FlagOS 每日动态报告(2026-08-22)
调研窗口:2026-08-21 10:18 ~ 2026-08-22 10:18 北京时间 信源:GitHub(org: flagos-ai)、Google News 聚合(中英文,本日代理链路超时改用 Tavily 验证)、HN、智源社区、厂商官网等(详见附录)
索引
- 一、开源项目进展(GitHub 动态)
- 1.1 FlagGems 11 条提交:KernelGen Nvidia 再添 6 算子、KMCompiler exponential 四芯片扩展、燧原同步(08-21~08-22)
- 1.2 Torch-FL 六线并进:沐曦 profiler 与 AMP 验证、GCU TOPSPTI 集成、PPU 编译序列化(08-21)
- 1.3 build-infra 记录昇腾 CANN 8.5.0 双编译器 E2E,昆仑芯 Triton bump(08-21)
- 1.4 vllm-plugin-FL:thead attention 后端合入 v0.3.0-dev,OOT 厂商后端支持 vLLM 0.24.0+(08-21)
- 1.5 FlagTree 启动 AMD amd3.6 CI/CD;FlagCX 燧原 topsPlatform 4.0 支持(08-21~08-22)
- 1.6 其他仓库动态:FlagAttention MSA/GLA 算子、FlagPrism 昇腾 CI、FlagScale-Agent 修复(08-21)
- 二、新闻报道与生态
- 2.1 新闻侧总体评价
- 2.2 生态参考条目:摩尔线程半年报深读(08-21)
- 2.3 近 3 天趋势
- 三、成员单位深挖
- 四、总结
- 附录:完整信源清单
一、开源项目进展(GitHub 动态)
窗口总览:org 内 52 个仓库中 11 个在窗口内有推送;commit search 命中 30 条窗口内提交(FlagGems 11 条、Torch-FL 6 条、build-infra 4 条居前),无正式 GitHub Release(最新仍为 6/24 FlagOS 2.1 批次)。本窗口双头条:FlagGems KernelGen 产线延续 Nvidia 批量算子入栈 与 Torch-FL 后端插件多芯片 profiler/AMP 集中落地;另有 build-infra 昇腾 CANN 8.5.0 双编译器 E2E 记录、vllm-plugin-FL thead 推理后端入 v0.3.0-dev 分支。
1.1 FlagGems:11 条提交,KernelGen Nvidia 再添 6 算子、KMCompiler exponential 四芯片扩展(窗口头条之一)
- KernelGen Nvidia 算子批量入栈(8/21 13:42-22:09,6 个新算子):cummaxmin_backward(#5566)、chalf(#5494)、_conj_copy(#5513)、logit_backward(#5661)、_batch_norm_with_update_functional(#5673)、choose_qparams_optimized(#5537)。延续 8/20 单日 12 算子节奏,量化(choose_qparams_optimized)与反向传播(cummaxmin_backward/logit_backward)类算子继续收敛。
- KMCompiler exponential 算子四芯片扩展(16:04,#5579):exponential 算子一次支持 NVIDIA/Hygon(海光)/Thead(平头哥真武 PPU)/iluvatar(天数智芯)四后端,KMCompiler 多芯片矩阵继续外扩。
- 燧原 enflame 同步(14:08,#5582):enflame_to_flagos_20260818 后端同步合入,延续 8/20 enflame 1.10.6 更新节奏。
- 其他:昇腾 Ascend 910b docker 镜像更新(#5681,16:08);flagtune 平台模型包缺失时回退修复(#5678,15:44);M-Threads 上传日志镜像与后端名修复(#5650,15:57)。
解读:与 8/18”KernelGen 全厂商批量出货”、8/20”单日 12 算子”一脉相承,KernelGen 产线在 Nvidia 侧保持日均 5-10 算子的入栈速度;KMCompiler 的 exponential 一次覆盖四家芯片体现”单算子多后端”的矩阵式扩展路径;燧原连续两日同步后端(1.10.6 工具链 + 20260818 镜像)显示 GCU 生态接入进入例行维护阶段。
1.2 Torch-FL:六线并进,沐曦 profiler 与 AMP 验证、GCU TOPSPTI 集成、PPU 编译序列化(窗口头条之二)
- 沐曦 MetaX 完整 profiler tracing(13:15,#134):补全 MetaX 平台 profiler 追踪能力;AMP 支持验证(15:47,#146)。
- 燧原 GCU TOPSPTI profiler 集成(15:47,#142):接入燧原 TOPSPTI 性能剖析接口。
- 摩尔线程 MUSA AMP 支持验证(19:13,#145)。
- 平头哥 PPU FlagTree 编译序列化修复(20:53,#148):PPU 后端 FlagTree 编译串行化,规避并发编译问题。
- 跨后端 RNG 集成测试统一(13:14,#141):统一多芯片 RNG 一致性测试覆盖。
解读:Torch-FL(PyTorch-Plugin-FL 统一后端插件)本窗口在沐曦/燧原/摩尔线程/平头哥四家后端同时落地 profiler 与 AMP 能力,配合 8/19”三芯片 AMP/profiler 补全”,统一插件的”Language Dispatch + Op Dispatch”两层机制进入密集功能验证期——成员单位接入从”能跑”走向”可观测、可调优”。
1.3 build-infra:昇腾 CANN 8.5.0 双编译器 E2E 记录,昆仑芯 Triton bump
- #470(8/21 22:47 合入):记录昇腾 CANN 8.5.0 Megatron E2E 验证(hw26 节点、8x 910B4-1、driver 25.5.0)。环境:flagos-runtime-ascend-cann8.5.0:2.1.2、Python 3.11、torch 2.9.0+cpu + torch-npu 2.9.0;F 路径 flagtree 0.6.0+ascend3.2(triton 3.2.0)与 T 路径 vendor triton 3.2.0 + triton_ascend 3.2.0 双编译器;训练(mock data 5 iter)、post_training(DummyModel+simple_generate)、推理(legacy StaticInferenceEngine 3x8)三场景双编译器全部 PASS(exit 0),RL 场景 paused。
- #469(8/21 21:43):昆仑芯 Kunlunxin Triton 版本 bump——昆仑芯后端接入继续推进(8/19 入 vllm 插件线之后的新动作)。
- #467/#468(17:17/21:40):megatron 厂商验证文档拆分重构与验证矩阵修订,为多厂商 E2E 记录铺路。
解读:继昨日海光 hygon 0.24.0 双编译器 E2E 后,昇腾 CANN 8.5.0 成为 build-infra 记录的第二个深度验证后端。megatron 训练场景三合一(训练/后训练/推理)双编译器全 PASS,说明 FlagOS 训练链路的”F/T 双路径”验证范式已标准化,接下来 megatron app image 的昇腾产线化值得关注。
1.4 vllm-plugin-FL:thead attention 后端合入 v0.3.0-dev,OOT 厂商后端支持 vLLM 0.24.0+
- #360(8/21 11:02 合入 v0.3.0-dev):将 PR #297 的 thead(平头哥真武 PPU)vendor attention 后端 cherry-pick 至 v0.3.0-dev 分支。测试环境:Host 810e、vLLM 0.24.0,Qwen3.6-35B-A3B(MoE、TP=1、BF16),CUDA Graph 与 Eager 双模式均通过。
- BreakableCUDAGraphWrapper 支持(11:18):为 OOT 厂商后端(vLLM 0.24.0+)增加 BreakableCUDAGraphWrapper 编译支持——vLLM 0.24.0 CUDA graph 重构后的插件适配。
解读:thead 推理后端进入 v0.3.0-dev 主开发分支并以 35B MoE 模型验证,说明平头哥 PPU 的 vLLM 推理路径(配合昨日 FlagGems PPU 算子修复)趋于可用;BreakableCUDAGraphWrapper 适配则确保厂商后端跟上 vLLM 0.24.0 图编译演进。
1.5 FlagTree 启动 AMD amd3.6 CI/CD;FlagCX 燧原 topsPlatform 4.0 支持
- FlagTree:[AMD][CI/CD] 新增 amd3.6 后端 CI/CD 工作流(#1027,16:41 合入,5 commits 含 core test),并修复 amd3.6 交付后端(#1032,18:18)——AMD GPU 后端(ROCm triton 3.6)进入 CI 矩阵与交付管线。
- FlagCX:[PAL] 支持最新 enflame topsPlatform 4.0 与 Host API 性能测试(#552,16:42);[CRL] 清理失败通信器创建(#553,8/22 10:17,窗口尾段)——燧原通信适配跟进工具链升级,CRL 健壮性修复。
1.6 其他仓库动态
- FlagAttention(1 条):合入 PR #42(11:08)——新增 MSA(MiniMax M3 Paged Sparse Attention)与 GLA 算子,附 NVIDIA H100 上 MSA 预填充/解码基准(BF16)。
- FlagPrism(1 条):新增 昇腾 debugger CI 覆盖(#6,17:20)——调试器多芯片 CI 矩阵扩展(继昨日天数智芯 Tianshu/CoreX 支持后)。
- FlagScale-Agent(1 条):修复 TrainingMonitorGuard 死循环(#40,19:56)。
- 分支推送(非默认分支):docs(modelscope 自动同步 20260821)、whisper-triton(dependabot)、vllm-plugin-FL(v0.3.0-dev 等开发分支)——pushed_at 在窗口内但主分支无新提交。
- 平静仓库:FlagScale、KernelGen、FlagPerf、FlagSparse、FlagBLAS、FlagQuantum、FlagOS-Robo、Megatron-LM-FL(主分支)、sglang-plugin-FL、FlagTensor、FlagGems-vllm 等窗口内无新提交。
二、新闻报道与生态
2.1 新闻侧总体评价
Google News RSS 本窗口代理链路超时,改经 Tavily 检索验证:FlagOS/FlagGems/FlagScale/FlagTree/FlagPerf/FlagCX/KernelGen 组件关键词窗口内零直接命中(与 8/20、8/21 连续一致);HN 零命中;”智源研究院 开源”查询以泛 AI 历史文章为主(FlagOS 1.6/2.0 发布回顾、TritonNext 2026 大会回顾等,均在窗口外)。组件级新闻继续平静,GitHub 侧为唯一活跃面(详见第一章与 2.3)。
2.2 生态参考条目(窗口内)
| 日期 | 事件 | 来源 |
|---|---|---|
| 8/21 | 摩尔线程半年报深读(ZAKER):质疑高增长背后结构短板——软件生态(信通院《AI 芯片软件生态白皮书(2026)》指国产软件生态成熟度差距仍在 5 年以上)、收入依赖信创采购、海外拓展受限;平台开发者 80 万、MUSA 深度兼容 CUDA 但缺少迁移规模/算子完备度等量化披露 | ZAKER |
| 8/21 | 思朗科技递交科创板招股书(寒武纪同行、科学智能底层算力方向),列为”寒武纪、海光、沐曦、摩尔线程”同行对比(非 FlagOS 成员单位,泛行业参考) | 新浪财经 |
排除项:证券之星/东方财富 ETF 份额播报与主力资金流(寒武纪/沐曦/摩尔线程重仓股例行播报);寒武纪融资融券余额;2025 年历史旧闻(寒武纪涨停潮、阿里采购寒武纪辟谣等);宇树科技/教育类泛行业噪音。
2.3 近 3 天趋势(GitHub org pushed 佐证)
| 日期 | 活跃仓库 | 主要内容 |
|---|---|---|
| 8/20 | FlagGems(27)、FlagBLAS(12)、FlagSparse(5)、build-infra(3) 等 12 仓 | KernelGen Nvidia 单日 12 算子 + KMCompiler 多芯片修复扩展;hygon 0.24.0 双编译器 E2E 记录;FlagSparse CUDA/DCU 合并;FlagBLAS 三角求解器族 |
| 8/21 | FlagGems(11)、Torch-FL(6)、build-infra(4)、FlagTree(2) 等 11 仓 | KernelGen Nvidia 6 算子续入 + exponential 四芯片扩展;Torch-FL 沐曦/燧原/摩尔线程/平头哥 profiler 与 AMP 集中落地;昇腾 CANN 8.5.0 双编译器 E2E 记录;thead attention 后端入 vllm v0.3.0-dev;FlagTree AMD amd3.6 CI/CD |
| 8/22(本窗口尾段) | FlagCX(1) | [CRL] 失败通信器创建清理(10:17)——夜间合入收尾 |
趋势判断:连续三日”算子库密度扩增”主线延续(KernelGen Nvidia 侧 8/20 12 算子 + 8/21 6 算子,KMCompiler 多芯片交叉扩展);新增两条支线:Torch-FL 统一后端插件进入 profiler/AMP 密集验证期(沐曦/燧原/摩尔线程/平头哥四家同日落地),以及 build-infra 推理/训练 E2E 验证矩阵外扩(海光 hygon → 昇腾 CANN 8.5.0,昆仑芯 Triton bump 跟进)。距 FlagOS 2.1(6/24)已 8 周余,仍无正式版本发布信号;megatron 昇腾产线化与 hygon flagtree wheel 重建(待 FlagTree #1020)是近期发布观察点。
三、成员单位深挖
窗口内多厂商动态图谱:
| 厂商 | 芯片/后端 | 窗口内动态 | 证据 |
|---|---|---|---|
| 智源 | — | build-infra 主导昇腾 CANN 8.5.0 E2E 记录(#470)与 megatron 验证文档重构(#467/#468);FlagScale-Agent 守卫修复(#40) | build-infra / FlagScale-Agent commits |
| 昇腾(生态外) | Ascend | CANN 8.5.0 Megatron 双编译器(F/T)三场景全 PASS(8x 910B4-1);FlagGems Ascend 910b docker 更新(#5681);FlagPrism 昇腾 debugger CI(#6) | build-infra #470 / FlagGems #5681 / FlagPrism #6 |
| 沐曦 | MetaX | Torch-FL MetaX 完整 profiler tracing(#134)+ AMP 验证(#146) | Torch-FL #134/#146 |
| 摩尔线程 | MUSA | Torch-FL MUSA AMP 验证(#145);FlagGems M-Threads 日志修复(#5650);商业面:半年报深读质疑结构短板 | Torch-FL #145 / FlagGems #5650 / ZAKER |
| 燧原 | Enflame GCU | FlagGems enflame 同步(#5582);FlagCX enflame topsPlatform 4.0 + Host API perf(#552);Torch-FL GCU TOPSPTI profiler(#142)——窗口内三线推进 | FlagGems / FlagCX #552 / Torch-FL #142 |
| 平头哥 | 真武 PPU | vllm-plugin-FL thead attention 后端入 v0.3.0-dev(#360,810e+Qwen3.6-35B-A3B 双模式通过);FlagGems exponential 算子 thead 支持(#5579);Torch-FL PPU 编译序列化修复(#148) | vllm-plugin-FL #360 / FlagGems / Torch-FL |
| 天数智芯 | Iluvatar | FlagGems exponential 算子 iluvatar 支持(#5579) | FlagGems #5579 |
| 海光 | Hygon DCU | FlagGems exponential 算子 hygon 支持(#5579);昨日 hygon 0.24.0 E2E 的 FlagTree #1020 修复仍在待合入状态 | FlagGems #5579 |
| 昆仑芯 | KunlunXin | build-infra Triton 版本 bump(#469)——8/19 入 vllm 插件线后接入继续推进 | build-infra #469 |
| AMD(生态外) | AMD GPU | FlagTree amd3.6 CI/CD 工作流与交付修复(#1027/#1032)——ROCm triton 3.6 后端进 CI 矩阵 | FlagTree #1027/#1032 |
| 寒武纪 / 清微 / 地平线 / 曦望芯科 | MLU / TXDA / BPU / SUNRISE | 开源侧无新动态;商业面:思朗科技 IPO 列为寒武纪同行(8/21) | 新浪财经 |
趋势判断:本窗口芯片版图关键词是”统一后端插件的多芯片可观测性建设“。Torch-FL 单日四家(沐曦/燧原/摩尔线程/平头哥)profiler/AMP 落地,配合 FlagPrism 调试器昇腾 CI 与 FlagCX 燧原 topsPlatform 4.0 适配,”性能可观测 + 精度可验证”成为成员单位接入的统一门槛;推理侧 thead attention 后端入 vllm v0.3.0-dev 并以 35B MoE 实测,平头哥 PPU 推理路径趋向实用化;训练侧昇腾 CANN 8.5.0 完成 F/T 双编译器三场景验证,接棒海光成为第二个被深度验证的 megatron 后端。商业面仅摩尔线程半年报深读一篇跟进评论,整体平静。
四、总结
- FlagGems KernelGen 产线延续(窗口头条之一):Nvidia 侧 6 个新算子入栈(量化 choose_qparams_optimized、反传 cummaxmin_backward/logit_backward 等),KMCompiler exponential 一次覆盖 NVIDIA/Hygon/Thead/iluvatar 四芯片,燧原 enflame 后端连续两日同步。
- Torch-FL 统一后端插件密集落地(窗口头条之二):沐曦完整 profiler tracing 与 AMP 验证、燧原 GCU TOPSPTI 集成、摩尔线程 MUSA AMP 验证、平头哥 PPU 编译序列化——四家后端同日推进,跨后端 RNG 测试统一。
- 昇腾 CANN 8.5.0 双编译器 E2E 记录:build-infra #470 完成 8x 910B4-1 上训练/后训练/推理三场景 F/T 双路径全 PASS(RL paused),接棒海光 hygon 成为第二个深度验证的 megatron 后端;昆仑芯 Triton bump 同步推进。
- 推理侧平头哥 PPU 实用化:thead attention 后端合入 vllm-plugin-FL v0.3.0-dev,810e + Qwen3.6-35B-A3B(MoE 35B)CUDA Graph/Eager 双模式通过;BreakableCUDAGraphWrapper 适配 vLLM 0.24.0 图编译演进。
- 工程与生态扩展:FlagTree 启动 AMD amd3.6 CI/CD;FlagAttention 新增 MiniMax M3 MSA/GLA 算子(H100 基准);FlagCX 燧原 topsPlatform 4.0 支持;FlagPrism 昇腾调试器 CI。
- 新闻侧连续第三日平静:组件关键词零命中、无正式 GitHub Release;摩尔线程半年报深读为唯一窗口内生态评论。megatron 昇腾产线化与 hygon wheel 重建(FlagTree #1020)是近期发布信号观察点。
局限性说明:提交数量与合入时间来自 commit search(搜索索引可能略滞后于实际合入,个别提交时间以 repos API pushed_at 为准);FlagGems 提交时间戳均为北京时间显示(GitHub API 原返回 UTC,经换算);本窗口 Google News RSS 代理链路超时,新闻侧判断依赖 Tavily 检索与标题语义交叉印证,可能存在低权重中文来源漏检;摩尔线程半年报数据与评论以媒体原文为准。
附录:完整信源清单
| 编号 | 事件 | 来源链接 |
|---|---|---|
| 1 | FlagGems KernelGen Nvidia 6 算子(#5566/#5494/#5513/#5661/#5673/#5537) | https://github.com/flagos-ai/FlagGems/commits/main |
| 2 | FlagGems KMCompiler exponential 四芯片(#5579)、enflame 同步(#5582)、910b docker(#5681)、flagtune 回退(#5678)、M-Threads 日志(#5650) | https://github.com/flagos-ai/FlagGems/commits/main |
| 3 | Torch-FL MetaX profiler(#134)/AMP(#146)、GCU TOPSPTI(#142)、MUSA AMP(#145)、PPU 序列化(#148)、RNG 统一(#141) | https://github.com/flagos-ai/Torch-FL/commits/main |
| 4 | build-infra 昇腾 CANN 8.5.0 E2E 记录(#470) | https://github.com/flagos-ai/build-infra/pull/470 |
| 5 | build-infra 昆仑芯 Triton bump(#469)、megatron 文档重构(#467/#468) | https://github.com/flagos-ai/build-infra/commits/main |
| 6 | vllm-plugin-FL thead attention 后端 cherry-pick(#360) | https://github.com/flagos-ai/vllm-plugin-FL/pull/360 |
| 7 | vllm-plugin-FL BreakableCUDAGraphWrapper(vLLM 0.24.0+) | https://github.com/flagos-ai/vllm-plugin-FL/commits/main |
| 8 | FlagTree AMD amd3.6 CI/CD(#1027/#1032) | https://github.com/flagos-ai/FlagTree/pull/1027 |
| 9 | FlagCX enflame topsPlatform 4.0(#552)、CRL 清理(#553) | https://github.com/flagos-ai/FlagCX/commits/main |
| 10 | FlagAttention MSA/GLA 算子(#42);FlagPrism 昇腾 CI(#6);FlagScale-Agent 守卫修复(#40) | https://github.com/flagos-ai/FlagAttention/pull/42 |
| 11 | org repos 总览(52 仓) | https://api.github.com/orgs/flagos-ai/repos?per_page=100&sort=updated |
| 12 | commit search(窗口内 30 条) | https://api.github.com/search/commits?q=org:flagos-ai+committer-date:%3E2026-08-21T02:18:00Z |
| 13 | 摩尔线程半年报深读(8/21,ZAKER) | https://app.myzaker.com/news/article.php?pk=6a87b4c6b15ec0493d08677b |
| 14 | 思朗科技科创板 IPO(8/21,新浪财经) | https://finance.sina.com.cn/stock/bxjj/2026-08-21/doc-iniparar1604431.shtml |
| 15 | Tavily 组件关键词检索(窗口内零直接命中) | https://www.tavily.com |
| 16 | HN Algolia | https://hn.algolia.com/api/v1/search_by_date?query=FlagOS |