调研窗口:2026-08-14 10:19 ~ 2026-08-15 22:30 北京时间(补跑:10:18 定时任务因模型服务超时失败,本报告为补跑产出) 信源:GitHub(org: flagos-ai)、Google News 聚合(中英文)、HN、智源社区等(详见附录)


一、开源项目进展(GitHub 动态)

窗口总览:org 内 52 个仓库中 15 个在窗口内有推送,commit search 命中 76 条窗口内提交(committer-date 口径),无正式 GitHub Release,但 build-infra 配置已将版本号推进至 2.1.2——这是距 FlagOS 2.1(2026-06-24 六组件同步发布)约 7 周后的首个版本周期启动信号。本窗口三大主线:FlagOS 2.1.2 发布周期启动(build-infra megatron wheel 工厂全线打通)Torch-FL 分布式通信三线突破(燧原 GCU / 摩尔线程 MUSA / 昇腾 FSDP2)FlagFFT / FlagBLAS / FlagDNN 三个基础库同时扩芯片后端(摩尔线程 / 海光 / 昇腾)

1.1 build-infra:FlagOS 2.1.2 发布周期启动,megatron wheel 工厂全线打通(本窗口头条)

来源build-infra configs.yamlbuild-infra commits

  • 版本号推进:configs.yaml 中 version: "2.1.2"flaggems: "5.3.4"(此前 2.1.1 / 5.3.x 周期);同日 #390/#398/#400 三条 “refresh image descriptions for 2.1.2” 由 flagos-ci 自动刷新 base/runtime 镜像描述文档(8/15 17:57 ~ 8/16 00:52)。2.1.2 发布周期正式启动,各组件 wheel 与镜像标签统一锚定新版本号。
  • megatron wheel 构建重构(#375):放弃此前”构建器工具链镜像 + repack”方案,改为直接在厂商 runtime 镜像内构建 megatron wheel(build env == delivery env),单步安装即构建时验证;repack/ 目录移除。
  • megatron 验证闭环(#379/#383):新增 verify-megatron-backend.sh——安装 wheel 前后对 torch/triton/flag_gems/numpy 矩阵逐项比对(必须字节级不变)、megatron.core 导入 + helpers_cpp pybind 绑定检查;#383 将验证步骤接入 app-image workflow,验证失败 gate 掉镜像推送。hygon25 节点实测通过(torch 2.9.0+das.opt1.dtk2604 / flag_gems 5.3.4 / megatron-core 0.17.1)。
  • 版本溯源(#393):wheel 版本改为 commit 级溯源 0.17.1+fl.<日期>.g<sha>(如 0.17.1+fl.20260814.gba22f6b673f3),PEP 440 语义下 ==0.17.1 钉住不受影响,且可按日期排序比较新旧。
  • 海光镜像增强(#399):hygon runtime 镜像加入 flash-attn(注意此前 hygon 的 megatron 验证矩阵里 triton 为 MISSING,flash-attn 补齐是海光侧推理栈完善信号)。
  • 工程修复:unzip 缺失批量修复(#382,11 个基础镜像)、MetaX runner label 修正(#384)、github.com 克隆超时 + HTTP_PROXY 只作用于 clone 步骤(#378)、aliyun/flagos/baai 端点 NO_PROXY 规避隧道失败(#395)、gendoc TSV 传输回退 upload-artifact(#388)。

1.2 Torch-FL:分布式通信三线突破(燧原 GCU / 摩尔线程 MUSA / 昇腾 FSDP2)

来源Torch-FL PR #103PR #105PR #106

  • #103 燧原 Enflame GCU 分布式走 FlagCX(8/14 23:34):此前 ProcessGroupFlagOS 无 Enflame 行,fall through 到 nvidia 默认配置(flagcx_dev=”cuda” / no NCCL),GCU 上 init_process_group 根本无法工作。本次新增 enflame profile,钉住上游 FlagCX enflame adaptor(devName=”gcu”),并加 _gcu_device_guard(GCU stream/指针是设备作用域的,collective 操作数在其他设备会静默 no-op);19 项路由测试通过,覆盖 collectives/DDP/FSDP2。注意:无 GCU 硬件环境,live 脚本未实跑,需双卡验证(提交自注)。
  • #105 摩尔线程 MUSA 分布式集合通信(8/15 00:30):新增 _flagos_identity_view C++ 绑定(原样返回 tensor),让 FlagCX 的 MUSA adaptor 直接消费 privateuseone tensor(FlagCX musa_adaptor.cc 取 data_ptr() 不校验 device type,无需 storage 转换,绕开 torch 弃用的 UnsafeStorageView);MCCL(torch_musa ProcessGroupMCCL)作为原生兜底。配套 5 个测试文件约 650 行:6 个基础 collective、DDP(3 层 MLP)、FSDP2、Qwen3-0.6B 端到端 DDP(对齐生产规模梯度同步)。单测 17/17 通过。
  • #106 昇腾 FSDP2 原生 ACL stream/event 语义(8/15 00:30,本窗口工程量最大):此前昇腾 stream/event 层只是名字兼容(query 恒 False、wait/record 降级为 host 同步、GuardImpl 全 stream 返回 ID 0),FSDP2 的 fully_shard 要求独立 compute/comm stream + 显式事件序。本次实现:共享 ACL stream 注册表(C++ 线程本地 + 缓存 GetDevice 避免热路径 syscall)、Python AclStream/AclEvent 包装(ctypes + dlopen 缓存)、补 split_with_sizes_copy.out / _chunk_cat.out / _foreach_copy_ 三个 FSDP2 必需算子(CANN 无 aclnnForeachCopy,分解为逐张量 copy_ 走 aclnnInplaceCopy 消除 CPU 往返)。910 双卡 CANN 9.0 实测:stream smoke、FlagCX collectives、DDP(loss 0.061/0.119)、FSDP2(4 grads/rank,loss 0.044/0.064)全部通过。

1.3 FlagFFT:摩尔线程 MUSA/muFFT 后端合入(#14)

来源FlagFFT PR #14

  • MUSA 后端(8/14 20:29 开发、23:06 合入):FlagFFT 经 MUSA driver API 适配摩尔线程 GPU,muFFT 作为参考 FFT oracle;BACKEND CMake 选项支持 CUDA/MUSA,libtriton_jit 同值配置;src/adaptor/backend/musa/ 完整实现 Memory/Stream/EventTimer/CudaGraph/device 查询,device_architecture 返回 MUSA capability(如 31),triton_target 构建 musa:{arch}:32
  • TLE codegen 特化:MTGPU LLVM 后端(FlagTree mthreads 3.6)对 vectorized 3D transpose v2、thread-local mixed four-step、TLE fused twiddle 三种模式寄存器分配失败,回退标准 kernel。
  • MTT S5000(arch 31)实测:全部 1D/2D/3D 精度测试对 muFFT 通过。这是 FlagFFT 在 NVIDIA 之外的首个芯片后端,Fourier 库补上”摩尔线程”拼图。

1.4 FlagBLAS:Level-2 BLAS 算子批量合入,Ascend/Hygon 多后端(#29)

来源FlagBLAS PR #29commits

  • PR #29(8/14 23:09 合入):新增 Level-2 BLAS 算子及其单元/精度测试,带 Ascend / Hygon 多后端支持;配套 #34(测试文件 8/15 00:44)、#40(benchmark logger 修复 + Level-2 benchmark shapes,8/15 22:02)、#41(清理 L1 benchmark、重构 swap benchmark,8/15 23:20)——Level-2 算子 + 基准设施同步落地,FlagBLAS 从 L1 向 L2 扩展。

1.5 FlagDNN:海光 hygon 后端合入

来源FlagDNN commit

  • add hygon backend(8/14 19:04):深度学习算子库 FlagDNN 新增海光 DCU 后端。至此本窗口 FlagFFT(摩尔线程)、FlagBLAS(海光+昇腾)、FlagDNN(海光)三个基础库同步扩后端,与昨日 FlagAttention 8 后端铺开构成”基础库全面多芯片化”的连续动作。

1.6 FlagCX:昇腾 NPU 设备支持 + MetaX 单测流水线

来源FlagCX commits

  • #536 UIL 层昇腾 NPU 设备支持(8/15 20:41):FlagCX Ascend communicator 增加 NPU device 支持(UIL 层),与 #525 sunrise-sw-1.2.0 支持(8/14 19:09)同为设备适配线推进;
  • #532 MetaX 可配置单测流水线(8/14 22:07):CI 新增沐曦 MetaX 单元测试 workflow(可配置平台注册表、RDMA 环境、P2P/RMA 测试),FlagCX 在沐曦侧从”构建通过”走向”单测覆盖”。

1.7 FlagGems / FlagGems-vllm / FlagTree:算子与编译后端持续扩张

来源FlagGems commitsFlagTree commits

  • FlagGems:#4950 sparse_sampled_addmm 六后端一次铺开(NVIDIA/Ascend/Hygon/Thead/MetaX/iluvatar,8/15 00:20,KMCompiler 生成的 Triton kernel);AMD RDNA4 autotune(#5100 layer_norm/rms_norm + #5327 split softmax,8/14 22:16/22:56);#5478 sunrise 后端更新至 20260812(tang->ptpu、sunrise sort、attention 优化);昇腾 linalg_lu_factor_ex(#5462)、NVIDIA linalg_vecdot(#5416)、昇腾 do_bench_npu 修复(#5451);KernelGen NVIDIA true_divide(#5205)、special_multigammaln(#5316)。
  • FlagGems-vllm:#105 per-token-quant fp8 多后端(metax / hygon / mthread,8/14 18:56,int64 防溢出修复)——vLLM 推理量化算子覆盖沐曦/海光/摩尔线程三系。
  • FlagTree:#884 CUDA IPC allreduce(TLE,8/15 04:45);#972 AMD local pointers lowering + buffer ops address space 修复(8/15 00:01);#918 ag-gemm 多节点执行调整(8/15 01:46);#978 sunrise 后端插件更新(8/14 21:59);#995/#988 CI 标签与 vendor 映射整理。

1.8 其他仓库

  • Torch-FL:另有 #100 boxing 修复(CPU indices/device 恢复,8/14 23:34)、#108 FlagGems layer norm backward boxing(8/15 04:45);
  • FlagPrism:8/14 14:00 pushed(新库工程化继续,窗口内无独立提交命中);
  • 平静仓库:FlagScale、Megatron-LM-FL、vllm-plugin-FL、TransformerEngine-FL、sglang-plugin-FL、FlagQuantum、FlagOS-Robo 等窗口内 pushed_at 无窗口内提交(分支/标签活动)。

二、新闻报道与生态

2.1 新闻侧总体评价

Google News 对 FlagGems/FlagScale/FlagTree/FlagPerf/FlagCX/KernelGen 等组件关键词窗口内零直接命中;HN 四个查询(FlagOS/FlagGems/FlagScale/BAAI)全部为 “flag” 词义误匹配噪音或旧闻,无有效条目。新闻侧当日无重大动态,主体内容依赖 GitHub commits(见第一章)。

2.2 窗口内唯一相关条目:2026 GOAI 世界人工智能开源大赛「AI for Research 前沿探索」赛道报名

日期:2026-08-14 20:00 来源智源社区(gnews)

智源社区发布 2026 GOAI 世界人工智能开源大赛「AI for Research 前沿探索」赛道报名信息。该赛事属智源开源生态运营活动,与 FlagOS 组件无直接耦合,作为生态面背景条目收录。其余”智源研究院 开源”中文查询命中仍以博彩/SEO 噪音为主,已整批剔除(8/14 16:30 浙大 3D 图像编辑开源方案条目与 FlagOS 无关,剔除)。


三、成员单位深挖

窗口内多厂商动态图谱(以 8/14-8/15 提交为准):

厂商 芯片/后端 窗口内动态 证据
摩尔线程 MUSA S5000 FlagFFT 新增 MUSA/muFFT 后端(MTT S5000 实测通过);Torch-FL MUSA 分布式集合通信(FlagCX identity view + MCCL 兜底,含 Qwen3-0.6B DDP 测试);FlagGems-vllm mthreads per-token-quant fp8 FlagFFT #14 / Torch-FL #105 / FlagGems-vllm #105
海光 Hygon DCU FlagDNN 新增 hygon 后端;FlagBLAS Level-2 含 Hygon 后端;build-infra hygon25 megatron-wheel 实测通过 + hygon runtime 镜像加 flash-attn;FlagGems sparse_sampled_addmm 含 hygon FlagDNN / FlagBLAS #29 / build-infra #383/#399 / FlagGems #4950
昇腾 Ascend NPU Torch-FL FSDP2 原生 ACL stream/event(910 双卡 CANN 9.0 实测);FlagCX UIL 层 NPU 设备支持 #536;FlagGems 昇腾 linalg_lu_factor_ex + do_bench_npu 修复 Torch-FL #106 / FlagCX #536 / FlagGems #5462/#5451
燧原 Enflame GCU Torch-FL Enflame GCU 分布式改走 FlagCX(此前根本无法建组);FlagGems sunrise 后端更新(tang->ptpu、sort、attention 优化) Torch-FL #103 / FlagGems #5478
天数智芯 Iluvatar FlagGems sparse_sampled_addmm 含 iluvatar 后端 FlagGems #4950
沐曦 MetaX GPU FlagCX MetaX 可配置单测流水线 #532;FlagGems-vllm metax per-token-quant fp8;build-infra metax maca3.7.2.1 钉住 flagtree 0.6.1+metax3.6 弃 3.1.0(#374) FlagCX #532 / FlagGems-vllm #105 / build-infra #374
地平线 D-Robotics BPU 窗口内无新实质提交/报道
清微 tsingmicro 窗口内无新
寒武纪 Cambricon 窗口内无新(build-infra unzip 批量修复 #382 覆盖其 base 镜像) build-infra #382

趋势判断:本窗口最大信号是 FlagOS 2.1.2 发布周期启动——build-infra 单仓库 22 条提交把版本号推进到 2.1.2 并完成 megatron wheel 从”构建”到”双镜像验证”再到”版本溯源”的工厂化闭环,发布基础设施就绪度明显高于 2.1 周期前夜。第二大信号是 Torch-FL 分布式通信补齐三芯片:燧原 GCU(此前完全不可用)、摩尔线程 MUSA(identity view 打通 FlagCX 直通)、昇腾 FSDP2(原生 stream/event 语义 + 3 个缺失算子,910 实测)——”flagos device”统一抽象从”算子路由”走向”分布式通信全覆盖”。第三大信号是 三个基础库(FlagFFT/FlagBLAS/FlagDNN)同步扩芯片后端,与昨日 FlagAttention 8 后端铺开连续呼应,基础库多芯片化进入批量落地期。


四、总结

  1. FlagOS 2.1.2 发布周期启动:configs.yaml version 推进至 2.1.2、flaggems 5.3.4;build-infra 完成 megatron wheel 工厂化(runtime 镜像内构建 + 双镜像验证 + commit 级版本溯源),hygon25 实测通过,发布基础设施就绪。
  2. Torch-FL 分布式通信三线突破:#103 燧原 GCU 分布式走 FlagCX(修复此前无法建组)、#105 MUSA 集合通信(identity view + MCCL 兜底 + Qwen3-0.6B DDP 测试)、#106 昇腾 FSDP2 原生 ACL stream/event(910 双卡实测)。
  3. 基础库扩后端成批量:FlagFFT 摩尔线程 MUSA(MTT S5000 实测)、FlagBLAS Level-2 + Ascend/Hygon、FlagDNN 海光后端——与昨日 FlagAttention 8 后端连续构成”基础库多芯片化”主旋律。
  4. 算子侧扩张:FlagGems sparse_sampled_addmm 六后端一次铺开、AMD RDNA4 autotune 起步、FlagGems-vllm per-token-quant fp8 覆盖沐曦/海光/摩尔线程。
  5. 新闻侧平静:组件关键词零命中,仅智源 GOAI 开源大赛报名一条生态背景;HN 全噪音。主体动态全部来自 GitHub。
  6. 发布侧:无正式 GitHub Release;2.1.2 处于”配置推进 + 镜像文档刷新”阶段,距正式组件发布仍有距离(距 FlagOS 2.1 已 7 周余)。

局限性说明:Torch-FL #103(GCU)与 #105(MUSA)提交自注”无硬件实测,需双卡验证”,仅 #106 昇腾有物理 910 实测记录;gnews 跳转链接无法抓取正文,新闻细节依赖标题与多源交叉印证。


附录:完整信源清单

编号 事件 来源链接
1 build-infra configs.yaml version=2.1.2 https://github.com/flagos-ai/build-infra/blob/main/configs.yaml
2 build-infra megatron wheel 重构 #375 https://github.com/flagos-ai/build-infra/commit/3a8e89f7374c0be90f0a7f66e3802232d3c03e49
3 build-infra megatron 验证 #379/#383 https://github.com/flagos-ai/build-infra/commits
4 build-infra 版本溯源 #393、hygon flash-attn #399 https://github.com/flagos-ai/build-infra/commits
5 build-infra 2.1.2 镜像描述刷新 #390/#398/#400 https://github.com/flagos-ai/build-infra/commits
6 Torch-FL GCU 分布式 #103 https://github.com/flagos-ai/Torch-FL/pull/103
7 Torch-FL MUSA 分布式 #105 https://github.com/flagos-ai/Torch-FL/pull/105
8 Torch-FL 昇腾 FSDP2 #106 https://github.com/flagos-ai/Torch-FL/pull/106
9 FlagFFT MUSA 后端 #14 https://github.com/flagos-ai/FlagFFT/pull/14
10 FlagBLAS Level-2 #29 https://github.com/flagos-ai/FlagBLAS/pull/29
11 FlagDNN hygon 后端 https://github.com/flagos-ai/FlagDNN/commit/ed7dc4c5d860e4808df69bb2ca21850ba60260ad
12 FlagCX 昇腾 NPU #536 https://github.com/flagos-ai/FlagCX/commit/3a24d03ae109d3c82541ffc9651d4384f6c44b0f
13 FlagCX MetaX 单测 #532 https://github.com/flagos-ai/FlagCX/commit/7adf3ad7978f4ac068dffeb7b440ce6b7044f940
14 FlagGems sparse_sampled_addmm 六后端 #4950 https://github.com/flagos-ai/FlagGems/commit/8f12a4ca6d7cf433f9a602c4116645d0cd091234
15 FlagGems AMD RDNA4 #5100/#5327 https://github.com/flagos-ai/FlagGems/commits
16 FlagGems-vllm per-token-quant fp8 #105 https://github.com/flagos-ai/FlagGems-vllm/commit/1819d20708693105d1a9f4667690be51e0020f99
17 FlagTree CUDA IPC allreduce #884 https://github.com/flagos-ai/FlagTree/commit/04215a54f87f3c1a8006947497134347e0713a49
18 GOAI 开源大赛报名(智源社区) https://news.google.com/rss/articles/CBMiSEFVX3lxTFByelUzbEp3cF9vRWZkakphSkJjcFNmYmNJTzZWNks1eWExb0ozZFlHMGRteWszYzZUdkdYVG9NRFAtcTBYdG8wVw?oc=5
19 org repos 总览 https://api.github.com/orgs/flagos-ai/repos?per_page=100&sort=updated
20 commit search(窗口内 76 条) https://api.github.com/search/commits?q=org:flagos-ai+committer-date:%3E2026-08-14T02:19:00Z