FlagOS 每日动态报告(2026-09-17)
调研窗口:过去 24 小时(2026-09-16 10:18 ~ 2026-09-17 11:40,北京时间) 信源:GitHub(org: flagos-ai,54 个仓库 pushed_at 全量核查 + 单次 commit search 150 条按 committer-date 核验 + 重点仓库默认分支提交复核 + tags/releases 元数据 + community 发布清单与发布时间表 raw 直取 + 关键提交补丁与文件清单详情)、Google News RSS(中英文 33 组查询词,走代理)、HN Algolia、投资界、智源社区、新浪财经、雷峰网、集微网等(详见附录信源清单)
本期索引
- 今日重点:build-infra 把版本字段从 2.1.2 抬到 2.2.0——2.2 GA 前的最后一个全局开关被拨动(09-17)
- 一、开源项目进展(GitHub 动态)
- 1.1 build-infra:base 版本 2.1.2 到 2.2.0,FlagGems 锁定 5.4.0-rc2.post2(09-17)
- 1.2 FlagTrain 新仓库落位:训练侧出现一个空的占位仓(09-16)
- 1.3 FlagFFT:36 个 FFT 算子一次性验收,配 NumPy 独立校验与运行时计划(09-16)
- 1.4 FlagGems 算子扩容:KernelGen 十八个 Nvidia 算子入库(09-16/09-17)
- 1.5 FlagGems 量化算子线:摩尔线程原生 FP8 W8A8 MM、沐曦 W8A16 RMSNorm(09-16/09-17)
- 1.6 FlagGems-vllm:融合 Marlin MoE 与 FP8 变长 FlashAttention-2(09-16/09-17)
- 1.7 Torch-FL:从「路由切换」转入「切换后果修复」(09-16/09-17)
- 1.8 FlagTree:FlagTune 托管 Manifest 与 iluvatar3.6 基线工作流(09-16/09-17)
- 1.9 FlagQuantum:接入 JAX 测试,覆盖率下限抬到 60%(09-17)
- 1.10 FlagCX 与 vllm-plugin-FL:PTD 日志流式化、T-Head PPU CI 接入(09-16/09-17)
- 1.11 其余动态:community、FlagGems-Experimental、flir、FlagScale-Agent、镜像 tag 记录(09-16/09-17)
- 二、新闻报道与生态
- 2.1 组件级检索第十三个连续平静窗口:24 小时内零命中(09-16~09-17)
- 2.2 FlagOS 2.2 时间表与 RC2 清单复核:GA 定档 09-28(09-17 核查)
- 2.3 地平线体系:地瓜机器人完成 4 亿美元 C 轮融资(09-17)
- 2.4 成员单位资本面:沐曦中报扭亏、燧原上市首日市值破千亿、国产 GPU 半年报(09-16~09-17)
- 三、成员单位深挖
- 3.1 海光:linalg 与 dtype 语义两端同时补齐(09-16)
- 3.2 昇腾:MoE 与线性注意力所需算子最密的一条线(09-16/09-17)
- 3.3 达摩院玄铁:推理插件接入 PPU CI,MM/MV 支持 NN/NT 布局(09-16/09-17)
- 3.4 摩尔线程:原生 FP8 W8A8 MM 与 MUSA 旋转位置编码回设备侧(09-16/09-17)
- 3.5 沐曦:W8A16 RMSNorm 与三处路由绕行(09-16/09-17)
- 3.6 昆仑芯:xCCL 装进基础镜像,算子修复批次落地(09-17)
- 3.7 天数智芯:/dev/itrctl 与 iluvatar3.6 基线工作流(09-17)
- 3.8 燧原:GCU300 记录进 0.24.0 报告与两条镜像 tag(09-16)
- 3.9 智源(牵头方):治理自动化与版本号抬升(09-16/09-17)
- 四、总结与趋势观察
- 附录:信源核查表
- 附录:完整信源清单
今日重点:build-infra 把版本字段从 2.1.2 抬到 2.2.0——2.2 GA 前的最后一个全局开关
日期:2026-09-17 来源:build-infra #916 版本抬升、build-infra configs.yaml、FlagOS 2.2 发布时间表
09-17 08:49,build-infra 收到一条只有两行改动的提交 Bump base version to 2.2.0 (#916):configs.yaml 里的 version 由 2.1.2 改为 2.2.0,同一处的 flaggems 由 5.3.5 改为 5.4.0-rc2.post2。
这两行的分量来自该文件自身的定位。文件头部写明它是「所以厂商/后端依赖与构建设置的唯一事实来源(single source of truth)」,被 scripts/build_base.py 与 scripts/build_runtime.py 读取;version 字段负责给全部基础镜像与应用镜像打标签(flagos-base-{厂商}-{后端}:{版本} 与 flagos-runtime-{厂商}-{后端}:{版本}),注释里把发布动作写成三步:更新这两个字段、打 v<版本> 标签、结束。也就是说,前一日各模块的 rc 打标只是把候选版本推到验证位,而这一次抬升把整条镜像线指向 2.2.0,是 2.2 GA 之前 org 内唯一的全局开关。
与其他证据对照,节奏吻合:community 的 2.2 发布时间表把特性冻结定在 08-31、测试与稳定期定在 09-01 至 09-24、GA 定在 2026-09-28,milestone「FlagOS 2.2」当前 7 个 issue 均未关闭、到期日同样是 09-28;RC2 清单中 24 个模块条目里只有 FlagGems 打到 v5.4.0-rc2.post2,其余仍是 rc2.post1。build-infra 仓库自身的最新标签仍是 v2.2.0 之前的 v2.1.1,说明镜像标签尚未落下——距 GA 还有 11 天,留给多芯片验收的时间窗正在收窄。
值得注意的是同步性:同一天 build-infra 还提交了昆仑芯基础镜像安装 xCCL(#917)与 containerfile 修正(#918),两条都是在 2.2 镜像线冻结前补齐厂商依赖,属典型的「发布前一公里」动作。
一、开源项目进展(GitHub 动态)
窗口总览:org 内 54 个仓库中 19 个在窗口内有推送;单次 commit search 命中 150 条窗口内提交(两页,committer-date 降序,已取全量),分布于 15 个仓库:FlagGems 71、build-infra 18、Torch-FL 17、FlagGems-sglang 10、FlagTree 8、FlagFFT 7、FlagGems-Experimental 5、FlagGems-vllm 4、FlagQuantum 2、vllm-plugin-FL 2、community 2,以及 FlagCX、FlagTrain、FlagScale-Agent、flir 各 1。另有 docs、release-info、sglang-plugin-FL、TransformerEngine-FL 四仓在窗口内有推送,但默认分支上无窗口内新提交(属侧分支或标签推送,其中 docs 与 release-info 承担发布件与文档站点同步)。
本窗口形态 = 「发布件冻结」+「切换后果修复」两条线:治理侧由 build-infra 抬版本号、community 同步发布优先级收口 2.2;工程侧的注意力从「往算子库里加算子」转向两类收尾工作——一是把新入库的算子登记进规范(导出检查、测试标记、基准对齐),二是接住上周路由切换在各芯片平台暴露出来的具体问题(MetaX 的切片算子、MUSA 的复数旋转位置编码与随机数桥、CUDA 缺少 FlagTune)。FlagTrain 是本期唯一的新增仓库,但目前只是占位。
1.1 build-infra:base 版本 2.1.2 到 2.2.0,FlagGems 锁定 5.4.0-rc2.post2(09-17)
日期:2026-09-17 来源:build-infra #916、build-infra configs.yaml
详见「今日重点」。补充一处对照价值:flaggems 字段从 5.3.5 直接跨到 5.4.0-rc2.post2,跨越了一个小版本与两轮 rc,说明 2.1.2 镜像线此前绑定的算子库与 2.2 候选之间已经隔了较长的验证距离;而 build-infra 仓库的最新标签仍停在 v2.1.1,v2.2.0 标签尚未出现,可作后续日报的观察点。
1.2 FlagTrain 新仓库落位:训练侧出现一个空的占位仓(09-16)
日期:2026-09-16 来源:FlagTrain 仓库
09-16 15:02,org 内新增仓库 FlagTrain,建仓与唯一一条提交(Initial commit)相隔不到一秒,仓库规模 5 KB、无描述、无语言统计、README 仅一行标题——是典型的占位建仓。命名上它落在 FlagOS 的训练侧:该方向现有 FlagScale(训练框架入口)、Megatron-LM-FL 与 TransformerEngine-FL(训练内核与并行算子)、FlagScale-Agent(自动化调优),新仓库的定位要等 README 与目录填充后才能判断,但「训练侧又切出一块」的动作本身值得记录。按 org 惯例(FlagSparse、Open3D-PIMC 均是先建仓、后批量落地),代码落位通常在建仓后数日到数周内发生。
1.3 FlagFFT:36 个 FFT 算子一次性验收,配 NumPy 独立校验与运行时计划(09-16)
日期:2026-09-16 来源:FlagFFT 算子验收提交、FlagFFT 仓库
09-16 15:38,FlagFFT 收到一条 +2151/-2298 的提交 feat: accept 36 FFT operators with NumPy validation and runtime plans,一次把 36 个 FFT 算子转入验收态,改动落在 8 个文件:算子清单与测试矩阵两份配置、构建声明、验收测试运行器,以及一对专门用于独立校验的参考实现工具(C++ 侧负责捕获基准输出,Python 侧做逐算子比对)。随后两小时内又补了两条配套提交:test: enforce complete acceptance coverage and update CI reporting(15:44)把验收覆盖写成强制项并改 CI 报告口径,fix: preserve report compatibility and test interruption handling(15:58)修报告兼容性与中断处理。
把三条并读,FlagFFT 这一轮的实质变化不是「多了 36 个算子」,而是验收标准升级:用独立捕获的 NumPy 输出作为参考实现,配合运行时计划(runtime plans)逐条比对,而不是自证式单测。在 RC2 清单中 FlagFFT 的候选版本是 v0.2.0-rc2.post1,这条验收线正是它从 rc 走向 GA 的依据。
1.4 FlagGems 算子扩容:KernelGen 十八个 Nvidia 算子入库(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:FlagGems 仓库提交、FlagGems #6135 histogramdd、FlagGems #5961 slice_copy
窗口内 KernelGen 线以每天十余条的速度继续向主仓灌入 Nvidia 算子,带 Triton 内核的新入库算子共 18 个,覆盖四类:形状与索引类(降维、切片复制、通道洗牌、同形状判定、按维取值)、线性代数与特殊函数类(张量求逆、行列式对数、Sobol 序列、指数函数)、训练与反向类(迹反向、掩码软最大反向、稀疏嵌入反向、随机丢弃)、以及池化与采样类(分数阶三维池化、最近邻三维上采样反向)。类型分布与前一窗口一致——线性代数、特殊函数、训练用反向算子各占一段。
真正体现工程量的是随之而来的登记与测试规范三条:一条给算子导出加排序与一致性检查,一条把「使用 FlagGems 替代 ATen」的检查限缩到本次新增行、避免历史代码干扰,还有一条按命名约定自动推导下划线算子的测试标记。另有一条 [Test] Align MM tests and parallel FP8 benchmark with scaled-MM API(#6329)在测试侧对齐缩放矩阵乘的接口。批量入库的副作用是「登记成本」上升,这几条正是在把成本固化到 CI 里。
1.5 FlagGems 量化算子线:摩尔线程原生 FP8 W8A8 MM、沐曦 W8A16 RMSNorm(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:FlagGems #6211 摩尔线程 FP8 W8A8、FlagGems #6326 沐曦 W8A16 RMSNorm、FlagGems #4412 FP8 topk
摩尔线程线新增原生 FP8 W8A8 矩阵乘后端(#6211,5 个文件、+1100/-80):在摩尔线程后端的量化矩阵乘目录下实现厂商原生路径,与 Nvidia Hopper 版并列存在,并配齐基准脚本与测试,说明该路径以「贴近硬件的原生实现」而非「通用内核加回退」的方式交付。沐曦线新增 W8A16 RMSNorm(#6326),把量化范围从矩阵乘扩到归一化层;同期还优化了 FP8 topk 的选路(#4412)。加上测试侧对缩放矩阵乘 API 的对齐与 fix ops bugs(#6259)的批量修复,本窗口与量化直接相关的提交共 7 条。合看,W8A8/W8A16 的覆盖正在从「矩阵乘一层」向归一化、采样等相邻算子扩散,符合 2.2 把量化算子作为扩容主线的定位。
1.6 FlagGems-vllm:融合 Marlin MoE 与 FP8 变长 FlashAttention-2(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:FlagGems-vllm #750 融合 Marlin MoE、FlagGems-vllm #749 FP8 变长注意力
两条大改动用同一个思路落到推理算子层。其一 [QC] Add INT8 and FP8 W8A16 fused Marlin MoE(#750,7 个文件、+3118/-46)新增 INT8 与 FP8 两种 W8A16 权重的融合 Marlin MoE 算子,附带两份基准脚本、一份测试与 Nvidia 后端的调优配置 tune_configs.yaml,并更新了算子选择工具。其二 [QC] Add FP8 W8A8 variable-length FlashAttention-2(#749,5 个文件、+4710)补上变长序列的 FP8 FlashAttention-2,覆盖预填充阶段最常见的形状,同时登记进 conf/operators.yaml。
两个算子都指向同一类缺口:推理侧的量化算子此前集中在固定形状与稠密路径,而实际服务里变长批与 MoE 稀疏激活才是主流形态。这类算子的验收门槛也更高——两份基准与调优配置同时入库,意味着它们是以「可调优、可复现」而非「能跑」的标准交付的。
1.7 Torch-FL:从「路由切换」转入「切换后果修复」(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:Torch-FL #306 MetaX 绕行、Torch-FL #316 MUSA 旋转位置编码、Torch-FL #310 钉回 FlagGems master
前一窗口的主体动作是把六个平台的算子分派转向「FlagGems 优先」,本窗口的 17 条提交几乎都是这次切换的回响,按处理方式可分三类。
第一类是具名绕行:MetaX 上把 slice.Tensor 从 FlagGems 路由移出、并借此打通 Qwen-Image-2512 的手动测试流(#306);MUSA 上让复数形式的旋转位置编码算子留在设备侧执行(#316,8 个文件、+99/-7,含 csrc/aten/backends/musa/ 下的生成代码与 codegen_mudnn.py 的生成规则),同时重绑厂商算子模块上的随机数桥(#298)。第二类是显式开关:因上游 FlagGems master 出现回归,临时把 CI 钉回上一个可用提交(#310);CUDA 线上在 FlagTree 带出 FlagTune 之前先设 USE_FLAGTUNE=0(#311);把构建期的加速器配置写进 wheel(#314,含单元测试),避免安装后才知道构建目标。第三类是门禁建设:算子测试门禁里显式探测 PPU(#309)、PPU 测试清单改从 ppu.yml 读取而非内嵌 JSON(#305)、平台流水线统一挂在平台无关检查之后(#304),以及 CI 全平台跟踪 FlagGems master(#301)。
三类合看是一套可复用的应对模式:能修的走路由绕行并留下测试,不能修的用显式开关挡住,最后把判断依据收进门禁。对「一套算子库跨芯片复用」这个命题来说,绕行名单的长度本身就是可用性的度量表。
1.8 FlagTree:FlagTune 托管 Manifest 与 iluvatar3.6 基线工作流(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:FlagTree #1103 FlagTune 托管 Manifest、FlagTree #1197 天数基线工作流、FlagTree #1190 PPU 基准结果
主改动是 FlagTune(自动调优子系统)的一次大修(#1103,17 个文件、+687/-153):新增托管 Manifest 默认值与运行时兼容处理,改动面覆盖合约层(算子模式与表达式定义)、搜索层(遗传算法搜索与接口约定)、运行层(自动调优器、基准协议、设备抽象与错误定义),并配了四组测试(基准协议、模型档案、模型来源、运行时错误)。所谓托管默认值,意味着调优配置的缺省不再依赖本地生成,而是由一处统一提供,这对多芯片、多 Triton 版本的组合尤其重要。
配套的工程线同日推进:为天数智芯加 iluvatar3.6 的 FlagGems 基线与测试工作流(#1197),更新 PPU 基准结果(#1190),把 FlagGems 测试模板的后端初始化抽成统一接口(#1192),给 hcu 线的基准脚本改用清理熔断进程的脚本(#1188),以及对偶发失败的昇腾 TLE 用例加忽略(#1185)。
1.9 FlagQuantum:接入 JAX 测试,覆盖率下限抬到 60%(09-17)
日期:2026-09-17 来源:FlagQuantum #48 JAX 测试与覆盖率下限
09-17 11:05,FlagQuantum 收到 +429/-5 的提交,把 JAX 测试正式接入持续集成:新增一个混合前端测试与五个单元测试(批量拉回、MPS 内核、状态向量内核、张量网络收缩、张量网络内核),持续集成工作流与测试配置同步更新,并把覆盖率下限 60% 写进合约目录下的覆盖率策略文件——即质量阈值以合约文件而非工作流参数的形式固定下来。该仓库定位为「PyTorch 优先的量子 AI 框架」,接入 JAX 说明它在把第二个前端纳入同等验收标准,这与 FlagOS 各模块普遍「先定合约、再补实现」的做法一致。
1.10 FlagCX 与 vllm-plugin-FL:PTD 日志流式化、T-Head PPU CI 接入(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:FlagCX #601 PTD 日志流式化、vllm-plugin-FL #518 达摩院玄铁 PPU CI、vllm-plugin-FL #528 昆仑芯修复
FlagCX 的改动小而关键:跨芯片通信库的性能工具 PTD 在把日志转成 OpenMetrics 时一次性把整份日志读进内存,prepare 阶段在大规模运行下会因内存耗尽退出;#601 把转换改成流式处理(tools/PTD/src/prom2openmetrics.py,+68/-29),代价是多一层状态机,收益是工具本身不再成为压测规模的瓶颈。
推理插件线两笔:达摩院玄铁 PPU 的 CI 正式接入(#518,9 个文件),新增平台配置 configs/thead.yml、环境准备与检查脚本、镜像 docker/thead/Dockerfile 与平台测试清单 tests/platforms/thead.yaml,并顺带修正 MetaX 平台清单与清理工具;昆仑芯侧修掉 FlashAttention 模块导入失败后残留的状态污染(#528)。把 PPU CI 的接入与本报告 1.7 中 Torch-FL 对 PPU 的显式探测并读,达摩院玄铁线在本窗口的自建测试覆盖明显加强。
1.11 其余动态:community、FlagGems-Experimental、flir、FlagScale-Agent、镜像 tag 记录(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:community 2.2 项目同步、FlagGems-Experimental MetaX index_select、flir #74、build-infra 昆仑芯 xCCL
- community:把发布优先级同步进项目视图(工作流
.github/workflows/flagos-2.2-project-sync.yml,+60/-1),并保证 2.2 条目在发布期持续可见;治理动作与版本抬升同日发生,属 2.2 收口的配套。 - FlagGems-Experimental:修 MetaX 的
index_select实现(#419)、为conv_depthwise2d加 MetaX 支持(#391)、补dense_dim算子(#639)——该仓继续扮演「后端适配先落地、验证后入主仓」的试验田。 - flir:去掉
tile.to_tensor的 Pure 标记以对齐上游的 bufferization 语义(#74),改动与昇腾 TLE 线相关。 - FlagScale-Agent:修正文档中的克隆地址指向自身仓库(#42)。
- build-infra 镜像线:昆仑芯基础镜像安装 xCCL(#917)、修正其 containerfile(#918);同时记录六条 vLLM 应用镜像 tag(摩尔线程 musa5.2.0 与 musa4.3.6、燧原 tops1.9.10 与 tops1.10.6 各两条),并清理昆仑芯 0.24.0 的过期待发布变更日志(#911)。
二、新闻报道与生态
2.1 组件级检索第十三个连续平静窗口:24 小时内零命中(09-16~09-17)
日期:2026-09-16 至 2026-09-17 来源:Google News RSS(中英文 33 组查询词,窗口内零命中)
本期以 FlagOS、FlagGems、FlagScale、FlagTree、FlagPerf、FlagCX、KernelGen、FlagAttention 以及「智源研究院 开源」「BAAI open source」「众智 FlagOS」等关键词做了中英文各半的 33 组检索,24 小时窗口内零命中,与组件名相关的最近一条报道仍是 09-15 10:16 关于 Open3D-PIMC 开源的英文稿与 09-14 的中文硬件稿。这已是连续第十三个平静窗口。
按既有观察,FlagOS 的对外可见度呈现「月节奏」:版本发布、行业大会、芯片适配 Day0 三类事件才会带来报道高峰,而版本发布前的测试期恰好是静默期。本周期的可见度高峰预计落在 09-28 GA 前后。HN Algolia 同期查询(FlagOS / FlagGems / FlagScale / FlagTree)同样为空。
2.2 FlagOS 2.2 时间表与 RC2 清单复核:GA 定档 09-28(09-17 核查)
日期:2026-09-17(核查日) 来源:2.2 发布时间表、2.2 RC2 源码清单、milestone FlagOS 2.2
对发布件做了一次完整核对。时间表:特性冻结 08-31,测试与稳定期 09-01 至 09-24,GA 09-28;冻结规则写明了例外通道(安全补丁、严重缺陷与 CI 阻塞可走加急通道,需 TSC 批准),以及毕业标准——只有可执行的测试计划在测试期内通过,FEP 状态才从「可实现」转为「已实现」。
清单:RC2 的 24 个模块条目覆盖 L0 基础设施层(FlagTree 按 Triton 3.6 / 3.5 / 3.3 拆三条、FlagCX)、算子层(FlagGems、FlagFFT、FlagSparse、FlagDNN、FlagBLAS、FlagTensor、FlagAudio、FlagAttention)、推理插件层(FlagGems-vllm、FlagGems-sglang、Torch-FL、vllm-plugin-FL、sglang-plugin-FL)、训练层(TransformerEngine-FL、Megatron-LM-FL、FlagScale)、发布与工具层(KernelGen、KernelGenBench、FlagRelease、压缩器)。版本上仅 FlagGems 打到 rc2.post2,其余为 rc2.post1;FlagTree 沿用 0.7.0rc2.post1+triton3.x 的自有命名格式。
里程碑侧:2.2 的 7 个 issue 当前全部未关闭,到期日 09-28,与时间表一致。综合看,2.2 处于「代码冻结、验收收尾」阶段,未出现延期信号。
2.3 地平线体系:地瓜机器人完成 4 亿美元 C 轮融资(09-17)
日期:2026-09-17 来源:投资界报道
09-17,地瓜机器人(英文名 D-Robotics,由地平线孵化、2024 年独立的机器人软硬件底座公司)宣布完成 4 亿美元 C 轮融资。本轮由未来资产领投,美团战投、合肥国投、南山战新投、璟泉资本等产业与政府投资平台,以及凯辉基金、华美国际、广发信德、超越摩尔、启航投资旗下芯创二期基金等机构联合跟投;老股东高瓴创投、五源资本、线性资本、黄浦江资本、淡马锡旗下 Vertex Growth、Prosperity7、和暄资本、云锋基金、美团龙珠、九合创投等持续加码。
资金用途写得具体:强化旭日芯片的全算力段产品布局,并建设贯通「数据采集—模型训练—仿真验证—推理部署」的全链路软件平台。随附的运营数据同样有信息量:2026 年上半年营收较去年同期数倍增长,旭日系列芯片累计出货超 800 万片,具身智能业务进入量产级出货,旗舰 S600 半年内获 20 余家头部客户采用、具身智能客户覆盖率超 50%。
对本报告主题的意义在于软件栈侧的位置:地平线(含其机器人体系)是 FlagOS 的成员单位之一,其芯片与端侧平台是 FlagOS 端侧与具身智能方向的落点;「全链路软件平台」的建设口径与 FlagOS-Robo 在机器人侧要解决的问题高度重叠,后续可关注其软件平台是否引入 FlagOS 组件。
2.4 成员单位资本面:沐曦中报扭亏、燧原上市首日市值破千亿、国产 GPU 半年报(09-16~09-17)
日期:2026-09-16 至 2026-09-17 来源:虎嗅 沐曦中报、新浪财经 燧原上市首日、雷峰网 国产 GPU 半年报解读
成员单位的对外叙事本期集中在资本侧,三点:沐曦 2026 年中报扭亏为盈、主业仍处投入期(09-16);燧原科技上市首日市值突破千亿元,09-17 的解读转到其「市场化 GP 加地方国企 LP」的股权结构;雷峰网 09-17 汇总四家国产 GPU 的半年报,落点是二级市场的估值耐受度。同日行情侧,摩尔线程、沐曦、寒武纪均有大幅波动,属市场信息而非生态动态,本报告不作条目收录。
需要点明的是口径边界:上述三条都无法作为 FlagOS 项目进展的证据,它们只是成员单位经营与融资状态的旁证。本期与 FlagOS 相关的技术动作仍只出现在 GitHub 上,这也是连续多个窗口的共同特征。
三、成员单位深挖
3.1 海光:linalg 与 dtype 语义两端同时补齐(09-16)
日期:2026-09-16 来源:FlagGems #5390 linalg_lstsq、FlagGems #5959 linalg_matrix_power、FlagGems #6351 nansum dtype
海光本期没有单点大动作,而是三条并行的补齐:其一 linalg_lstsq 一次性支持三个后端(海光、沐曦、天数),说明最小二乘这类线性代数算子的多芯片实现开始成组推进;其二 linalg_matrix_power 支持海光与天数,属矩阵函数系列;其三 nansum 的整型 dtype 提升修复同时覆盖 Nvidia、昇腾、沐曦与海光,并补 int8/uint8 用例——这是语义一致性性质的工作,修的不是性能而是「同一算子在不同后端给出不同类型」的问题。前一窗口海光的重点在工具链与打包环境适配(gflags 头文件、TLE 白名单、镜像),本窗口转到算子与语义,方向上的切换说明其基础环境问题已基本收口。
3.2 昇腾:MoE 与线性注意力所需算子最密的一条线(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:FlagGems #6324 swiglu、FlagGems #6325 grouped_matmul、FlagGems-vllm #789 compressor、FlagGems-vllm #788 chunk_gated_delta_rule_fwd
昇腾线本期提交最密,且集中在当前大模型结构的两个热点。MoE 方向:swiglu 激活(#6324)与 grouped_matmul 分组矩阵乘(#6325)——前者是 MoE 前馈网络的激活函数,后者是专家并行的核心算子,两条凑齐意味着一层完整 MoE 计算可以在算子库内闭环。线性注意力方向:compressor(#789)与 chunk_gated_delta_rule_fwd(#788)两个融合算子进推理插件仓,对应 GDN 类线性注意力的分块前向;配合 flir 中对 tile.to_tensor 的语义对齐(#74,涉昇腾 TLE 线),以及 linalg_norm(#6355)、linalg_matrix_norm(#5670)两条范数实现,昇腾在算子侧是本期覆盖面最全的一家。
3.3 达摩院玄铁:推理插件接入 PPU CI,MM/MV 支持 NN/NT 布局(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:vllm-plugin-FL #518 PPU CI、FlagGems #6302 MM/MV 布局优化、FlagTree #1190 PPU 基准
达摩院玄铁(PPU)线本期是「测试基建 + 性能」双线。测试侧:vllm-plugin-FL 把 PPU 接进持续集成(#518,新增平台配置、环境准备脚本、镜像与平台测试清单),Torch-FL 在算子测试门禁里显式探测 PPU 而非依赖默认分支(#309),PPU 的测试清单改从 ppu.yml 读取(#305)。性能侧:FlagGems 对矩阵乘与矩阵向量乘做了 NN 与 NT 两种布局的支持与优化(#6302),FlagTree 更新 PPU 基准结果(#1190)并修 tl.load/tl.dot 在 PPU 与沐曦上的行为(#1191)。把一个平台从「能跑算子」推到「能在 CI 里被持续验证」,是可用性从个案走向常态的分界。
3.4 摩尔线程:原生 FP8 W8A8 MM 与 MUSA 旋转位置编码回设备侧(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:FlagGems #6211 原生 FP8 W8A8、Torch-FL #316 MUSA 旋转位置编码、Torch-FL #298 RNG 桥
三笔动作指向同一目标——让 MUSA 后端在量化推理与长上下文模型上少走回退。算子侧新增原生 FP8 W8A8 矩阵乘后端(#6211);适配侧把复数形式的旋转位置编码算子留在设备侧执行(#316),避免了原先可能的逐元素回退到主机;稳定性侧重绑厂商算子模块上的随机数桥(#298),修的是种子与流的一致性。镜像侧,build-infra 记录了 MUSA 5.2.0 与 4.3.6 两条应用镜像 tag,并为 0.24.0 rc2 重建补了待发布变更日志(#913/#914/#915)。旋转位置编码与随机数桥这两项属「不显眼但必过」的门槛项,也是跨芯片推理精度能否对齐的常见分界。
3.5 沐曦:W8A16 RMSNorm 与三处路由绕行(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:FlagGems #6326 W8A16 RMSNorm、FlagGems-Experimental #419 index_select、Torch-FL #306 slice.Tensor 绕行
沐曦线本期以「补一个算子、绕三处路径」为主。算子侧新增 W8A16 RMSNorm(#6326),把量化精度扩到归一化层;试验仓里修掉 index_select 的实现问题(#419)并补上逐深度卷积支持(#391)。路由侧三处绕行:Torch-FL 把 slice.Tensor 移出 FlagGems 路由以打通 Qwen-Image-2512 的手动测试流(#306)、把矩阵乘在部分场景下绕开 FlagGems 路由(与 1.7 中的门禁配套)、以及在 FlagTree 侧修 linalg_solve_triangular 的测试参考实现(#6341)。绕行条目本身不是成就,但它们被逐条具名记录,才能让后续版本的收敛有据可依。
3.6 昆仑芯:xCCL 装进基础镜像,算子修复批次落地(09-17)
日期:2026-09-17 来源:build-infra #917 xCCL、FlagGems #6328 算子修复、FlagGems #4540 topk_softmax 桩
昆仑芯线本期由三类动作组成。镜像侧:基础镜像装入 xCCL(#917)并修正其 containerfile(#918)——把厂商通信库预置进基础镜像,意味着跨芯片通信在其平台上不再依赖运行时外挂,与本报告 1.10 中 FlagCX 工具链的改进方向一致。算子侧:一批修复同时落地,覆盖 masked_fill、sinh、mish、hardswish、index_fill 五个算子(#6328);topk_softmax 补了给 C++ 启动器用的内核桩(#4540);去掉一条已被解决的 softmax_backward 维度跳过逻辑(#4539)。工程侧:测试改为在容器内运行(#6343),并修掉推理插件中 FlashAttention 模块导入失败后的残留状态(#528)。合看是「把测试环境与依赖一次性对齐」的整备动作。
3.7 天数智芯:/dev/itrctl 与 iluvatar3.6 基线工作流(09-17)
日期:2026-09-17 来源:FlagGems #6376 /dev/itrctl、FlagTree #1197 iluvatar3.6 基线、FlagGems #5390 linalg_lstsq
天数智芯线本期两条基础设施改动加一条算子补齐:FlagGems 的 CI/CD 配置挂入 /dev/itrctl 设备节点并更新打包配置(#6376),说明其测试环境需要访问设备控制接口;FlagTree 为 iluvatar3.6 增加 FlagGems 基线与测试工作流(#1197),即给该后端建立可比的性能与正确性基线;算子侧与海光、沐曦共用 linalg_lstsq 的多后端实现(#5390)。此外 build-infra 修掉了一条会破坏 corex clang 的过期环境变量(#901)。三条并读,天数智芯当前阶段是「把 CI 基线立起来」。
3.8 燧原:GCU300 记录进 0.24.0 报告与两条镜像 tag(09-16)
日期:2026-09-16 来源:build-infra #910 GCU300 记录、build-infra #900 门禁用例、FlagTree #1185 TLE 测试
燧原线本期全部落在构建与验证侧:把 GCU300 的运行记录写入 vLLM 0.24.0 报告(#910),记录门禁用例的运行结果与图模式下的阻塞项(#900),并为 tops1.9.10 与 tops1.10.6 两条工具链各记一条应用镜像 tag(#906/#907)。另在 FlagTree 侧,对昇腾 TLE 线中偶发失败的融合 softmax 用例加了忽略(#1185)——这类「偶发失败」在跨芯片 CI 里通常意味环境差异而非逻辑缺陷,标记而非修补是当前阶段的合理选择。燧原的资本面动作(09-15 上市、09-16 首日破千亿)不改变其工程重心,技术线仍以把 GCU 平台纳入多芯片验证矩阵为主。
3.9 智源(牵头方):治理自动化与版本号抬升(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:community 2.2 项目同步、build-infra #916
作为牵头方,智源本期的工作集中在治理而非代码产出:community 把发布优先级同步进项目视图并保证 2.2 条目在发布期持续可见;build-infra 抬升版本号,把整条镜像线指向 2.2.0。配合 2.2 时间表中「Release Manager 在追踪 issue 中维护测试矩阵、按发布流程组织 Go/No-Go」的角色定义,可以看到发布机制已从人工对表转为「项目视图 + 追踪 issue + 清单文件」三件套驱动。距 GA 11 天,智源侧下一步的可观察信号是 Go/No-Go 结论与各 FEP 的验收状态流转。
四、总结与趋势观察
- 2.2 进入发布件冻结阶段:build-infra 把版本字段抬到 2.2.0,是 org 内唯一的全局发布开关;此后各模块的 rc 打标只影响候选快照,不再改变版本号。GA 定档 09-28,测试期还剩约一周。
- 工程质量线的比重上升:150 条提交里 CI、测试与修复类合计约四分之一(单看以
ci、test、fix开头的提交即 23 条),KernelGen 的批量入库正在倒逼导出检查、测试标记、基准对齐等规范落地——扩容的瓶颈从「写内核」转向「登记与验收」。 - 跨芯片可用性靠「路由加绕行名单」推进:Torch-FL 与 vllm-plugin-FL 本期的主要产出是绕行条目与门禁,而非新功能;厂商内核承接的算子已有具名清单(MetaX 的切片算子、MUSA 的复数旋转位置编码、CUDA 的 FlagTune 缺位),这份清单的长度就是跨芯片复用率的反向指标。
- 两条算子扩容主线清晰:一是量化(W8A8、W8A16、FP8),从矩阵乘扩到归一化与采样,代表性提交为摩尔线程原生 FP8 W8A8 MM 与融合 Marlin MoE;二是 MoE 与线性注意力(分组矩阵乘、swiglu、compressor、分块门控 Delta 规则前向),集中在昇腾线。
- 测试基建向平台化收敛:达摩院玄铁 PPU 接入推理插件 CI、天数智芯建立 iluvatar3.6 基线、FlagTree 抽统一的后端初始化接口——三家不同形态的动作指向同一目标:让每个后端都能在 CI 里被持续验证,而不是靠人工跑通。
- 新闻侧持续静默、技术侧全部在代码上:这是连续第十三个平静窗口,成员单位的对外可见度主要来自资本面(地瓜机器人 4 亿美元 C 轮、沐曦中报、燧原上市)。预计下一个报道高峰在 09-28 发布窗口。
附录:信源核查表
| 信源 | 核查结果 |
|---|---|
| GitHub org 仓库 pushed_at(54 仓) | 19 仓窗口内有推送,已全部核验 |
| GitHub commit search(committer-date) | 150 条窗口内提交,两页取全量,分布于 15 仓 |
| GitHub 重点仓库默认分支提交 | FlagGems / build-infra / Torch-FL / FlagTree 等逐条复核 |
| GitHub tags 与 releases | 各模块最新标签均为 rc2.post1(FlagGems 为 rc2.post2),无新发布 |
| community 发布清单与时间表 | RC2 清单 24 条目、2.2 时间表与里程碑状态已复核 |
| build-infra configs.yaml | 版本字段抬升至 2.2.0,已取补丁与文件全文 |
| Google News RSS(33 组中英文查询) | 窗口内零命中,最近命中为 09-15 |
| HN Algolia | 窗口内零命中 |
| 智源社区(hub.baai.ac.cn) | 窗口内无 FlagOS 相关新稿 |
| 投资界 / 智源社区 / 新浪财经 / 雷峰网 / 集微网 | 取到地瓜机器人 C 轮等成员单位条目 |
完整信源清单
- [1] build-infra #916(base 版本抬升到 2.2.0) — https://github.com/flagos-ai/build-infra/commit/dc947656038dab790fe9e107f06533a1bf05abdd
- [2] build-infra configs.yaml(版本与依赖唯一事实来源) — https://github.com/flagos-ai/build-infra/blob/main/configs.yaml
- [3] community FlagOS 2.2 发布时间表 — https://github.com/flagos-ai/community/blob/main/release/2.2/schedule_CN.md
- [4] community 2.2 RC2 源码清单 — https://github.com/flagos-ai/community/blob/main/release/2.2/release-2.2-rc2.yaml
- [5] community 里程碑 FlagOS 2.2 — https://github.com/flagos-ai/community/milestone/2
- [6] community 发布优先级同步提交 — https://github.com/flagos-ai/community/commit/8b0208f3047348eeadda23d5a8997e43de8778de
- [7] FlagTrain 仓库(09-16 建仓) — https://github.com/flagos-ai/FlagTrain
- [8] FlagFFT 36 个算子验收提交 — https://github.com/flagos-ai/FlagFFT/commit/b01be40b38cceeddbc57c3c3a879745cf8c02b76
- [9] FlagGems 仓库提交列表(窗口全量) — https://github.com/flagos-ai/FlagGems/commits/master
- [10] FlagGems #6211 摩尔线程原生 FP8 W8A8 MM — https://github.com/flagos-ai/FlagGems/pull/6211
- [11] FlagGems #6326 沐曦 W8A16 RMSNorm — https://github.com/flagos-ai/FlagGems/pull/6326
- [12] FlagGems #4412 FP8 topk 优化 — https://github.com/flagos-ai/FlagGems/pull/4412
- [13] FlagGems #6302 达摩院玄铁 PPU 矩阵乘布局优化 — https://github.com/flagos-ai/FlagGems/pull/6302
- [14] FlagGems #5390 linalg_lstsq 多后端 — https://github.com/flagos-ai/FlagGems/pull/5390
- [15] FlagGems #5959 linalg_matrix_power 多后端 — https://github.com/flagos-ai/FlagGems/pull/5959
- [16] FlagGems #6351 nansum 整型 dtype 修复 — https://github.com/flagos-ai/FlagGems/pull/6351
- [17] FlagGems #6324 昇腾 swiglu — https://github.com/flagos-ai/FlagGems/pull/6324
- [18] FlagGems #6325 昇腾 grouped_matmul — https://github.com/flagos-ai/FlagGems/pull/6325
- [19] FlagGems #6355 linalg_norm 多后端 — https://github.com/flagos-ai/FlagGems/pull/6355
- [20] FlagGems #6328 昆仑芯算子修复批次 — https://github.com/flagos-ai/FlagGems/pull/6328
- [21] FlagGems #6376 天数智芯 /dev/itrctl — https://github.com/flagos-ai/FlagGems/pull/6376
- [22] FlagGems-vllm #750 融合 Marlin MoE — https://github.com/flagos-ai/FlagGems-vllm/pull/750
- [23] FlagGems-vllm #749 FP8 变长 FlashAttention-2 — https://github.com/flagos-ai/FlagGems-vllm/pull/749
- [24] FlagGems-vllm #789 昇腾 compressor — https://github.com/flagos-ai/FlagGems-vllm/pull/789
- [25] FlagGems-vllm #788 昇腾分块门控 Delta 规则前向 — https://github.com/flagos-ai/FlagGems-vllm/pull/788
- [26] Torch-FL #316 MUSA 复数旋转位置编码 — https://github.com/flagos-ai/Torch-FL/pull/316
- [27] Torch-FL #314 wheel 内嵌构建加速配置 — https://github.com/flagos-ai/Torch-FL/pull/314
- [28] Torch-FL #306 沐曦 slice.Tensor 绕行 — https://github.com/flagos-ai/Torch-FL/pull/306
- [29] Torch-FL #310 临时钉回 FlagGems master — https://github.com/flagos-ai/Torch-FL/pull/310
- [30] Torch-FL #309 PPU 门禁探测 — https://github.com/flagos-ai/Torch-FL/pull/309
- [31] FlagTree #1103 FlagTune 托管 Manifest — https://github.com/flagos-ai/FlagTree/pull/1103
- [32] FlagTree #1197 天数智芯 iluvatar3.6 基线 — https://github.com/flagos-ai/FlagTree/pull/1197
- [33] FlagTree #1190 PPU 基准结果 — https://github.com/flagos-ai/FlagTree/pull/1190
- [34] FlagQuantum #48 JAX 测试与覆盖率下限 — https://github.com/flagos-ai/FlagQuantum/pull/48
- [35] FlagCX #601 PTD 日志流式化 — https://github.com/flagos-ai/FlagCX/pull/601
- [36] vllm-plugin-FL #518 达摩院玄铁 PPU CI — https://github.com/flagos-ai/vllm-plugin-FL/pull/518
- [37] FlagGems-Experimental #419 沐曦 index_select — https://github.com/flagos-ai/FlagGems-Experimental/pull/419
- [38] flir #74 tile.to_tensor 语义对齐 — https://github.com/flagos-ai/flir/pull/74
- [39] build-infra #917 昆仑芯 xCCL — https://github.com/flagos-ai/build-infra/pull/917
- [40] build-infra #910 燧原 GCU300 记录 — https://github.com/flagos-ai/build-infra/pull/910
- [41] 投资界 地瓜机器人完成 4 亿美元 C 轮融资 — https://news.pedaily.cn/202609/569161.shtml
- [42] 虎嗅 沐曦股份 2026 年中报扭亏为盈 — https://news.google.com/rss/articles/CBMiX0FVX3lxTE9fMnJtYXZ3VnU5eTRXRnE3WmNxTWFzT0ZyRHlJODR2Wk1DN1JqSGszeW05X3hENVhIdWJaSVNQcjZvWXNTS0psMjdGWEZDT2ZKa
- [43] 新浪财经 燧原科技上市首日市值破千亿 — https://news.google.com/rss/articles/CBMieEFVX3lxTE1qSks5eWdMNmtGT1ZMTWNDMGFON2F1Z0hETlRLWUprRGNOZmRyejUwVW1EOTg1SlpSRHJndFQ0cFd2VUEydXFoOG13NWFtajdNc
- [44] 雷峰网 国产 GPU 四份半年报解读 — https://news.google.com/rss/articles/CBMibkFVX3lxTE5UbVdtRXlOaHJHdGdBSkZ5SUVWbmJuUG84QWtOaWx3U0xjcmpXSW9hUFVLQ3BkdnljbGJBbUV2aVhPUEpnb1lDZmxyU3VVXzUxd