调研窗口:过去 24 小时(2026-09-15 10:18 ~ 2026-09-16 10:18,北京时间) 信源:GitHub(org: flagos-ai,53 个仓库 pushed_at 全量核查 + 单次 commit search 119 条按 committer-date 核验 + 重点仓库默认分支提交复核 + 各仓库 releases/tags 元数据 + community 发布清单与发布时间表 raw 直取 + 关键提交补丁详情)、Google News RSS(中英文 24 组查询词,走代理)、HN Algolia、沐曦官网、观点网、新浪财经、21 财经、财联社、量子位、新华网、智源社区、CSDN FlagOS 社区等(详见附录信源清单)


本期索引

  • 今日重点:Torch-FL 六平台转向 FlagGems-first——PPU 路由条目从 11 条扩到 435 条(09-15/09-16)
  • 一、开源项目进展(GitHub 动态)
    • 1.1 2.2 RC2 第二轮:FlagGems 升到 v5.4.0-rc2.post2,清单条目换版(09-15)
    • 1.2 Open3D-PIMC 首次代码落地:单次提交 662 个文件,编译层与运行时到齐(09-16)
    • 1.3 Torch-FL:六个平台一起转向 FlagGems-first(09-15/09-16)
    • 1.4 FlagAttention:SageAttention 与 GDN2 同日入库,昇腾版单独实现(09-15)
    • 1.5 FlagGems 量化算子线:海光 W8A8 INT8 GEMM、摩尔线程 W8A16 FP8 RMSNorm(09-15)
    • 1.6 FlagGems KernelGen 批量入库:二十个 Nvidia 算子与昆仑芯 tle.gpu 迁移(09-15/09-16)
    • 1.7 推理插件线:昇腾 SparseAttnSharedKV、persistent_topk 与 vLLM 0.24 适配(09-15/09-16)
    • 1.8 build-infra:FlagCX wheel 打包线开通,六条 vLLM 应用镜像 tag 记录(09-15)
    • 1.9 community:2.2 发布治理自动化,状态改由关联 PR 推导(09-15/09-16)
    • 1.10 FlagSparse:外部分支合入主仓,昇腾精度收尾(09-15)
    • 1.11 FlagQuantum:Twin 证据按电路拓扑定级(09-15)
    • 1.12 其余动态:FlagTree、flir、FlagDNN、FlagCX(09-15/09-16)
  • 二、新闻报道与生态
    • 2.1 组件级检索第十二个连续平静窗口:命中集中在成员单位而非组件(09-15~09-16)
    • 2.2 沐曦完成上海人工智能实验室 ATRIA Dawn Preview 的 Day0 适配(09-15)
    • 2.3 燧原科技科创板上市:资本侧口径与生态位的两条读法(09-15)
    • 2.4 Open3D-PIMC 从发布到代码:媒体侧与代码侧的 48 小时时差(09-14~09-16)
  • 三、成员单位深挖
    • 3.1 清微智能:Open3D-PIMC 代码落地与 3D 可重构路线的合流(09-16)
    • 3.2 海光:量化算子、CI 镜像与 FlagCX wheel 三线并行(09-15)
    • 3.3 摩尔线程:W8A16 FP8 RMSNorm 与 MUSA 路由双向调整(09-15)
    • 3.4 沐曦:metax rc2 重建镜像记录与 Day0 适配叙事(09-15)
    • 3.5 燧原科技:S60 进 vLLM 0.24 线与 GCU CI 管线(09-15)
    • 3.6 天数智芯:iluvatar3.6 后端与 FlagTree 0.6.1 绑定(09-15)
    • 3.7 昆仑芯:sum 迁往 tle.gpu 与 paged-KV 约定修复(09-15)
    • 3.8 智源(牵头方):RC2 治理自动化与 2.2 进度对账(09-15/09-16)
  • 四、总结与趋势观察
  • 附录:完整信源清单

今日重点:Torch-FL 六平台转向 FlagGems-first——PPU 路由条目从 11 条扩到 435 条

日期:2026-09-15 至 2026-09-16 来源Torch-FL #290 PPU 路由Torch-FL #276 CUDA FlagGems-firstTorch-FL 算子支持文档

本窗口最集中的工程动作发生在 Torch-FL:这个负责把 PyTorch 算子调用分派到各芯片后端的适配层,在 24 小时内收到 12 次提交,把六个平台一起推向「FlagGems 优先」。其中 PPU(达摩院玄铁)一家的路由表变化最剧烈——FlagGems 路由条目从 11 条扩到 478 条,467 个重载从 cuda 移入 flaggems,没有一条反向移动;随后经过一次可执行性普查、两轮 CI 暴露的路由相关失败、以及一次源码级审计,落定为 435 条 FlagGems / 1601 条 cuda,即 482 个被 FlagGems 覆盖的算子中有 47 个被留在厂商内核上(33 个普查测出的路由相关失败、mm/bmm 家族、五个 addmm 重载、_conj、四个反射填充路由)。

这次改动还顺手堵掉一个结构性问题:PPU 的算子全集原先是从 backends_cuda.conf 里读回来的,而 codegen_ops.py 会重写这个文件,等于让 PPU 的算子宇宙成为另一个平台路由表的函数;现在改为读 csrc/aten/generated/register.inc——CUDA 线与 PPU 线共同编译的那份注册表,改完重生成九个 conf 全部字节一致,证明是纯溯源替换。仓库同时把 47 个留下的算子逐个写进 BOXING_TRITON_GAPS 并附失败描述,配置文件的 SHA-256 也被记录以保证可复现。

其余五个平台是同一方向的不同切面:CUDA 线(#276,18 个文件、+1660/-533)改为在作业内安装 FlagTree 0.6.2a2 与 FlagGems master 并承担 FlagGems C++ 算子的编译,工作流超时相应从 60 分钟提到 120 分钟;DCU(#277)默认启用 FlagTree 与 FlagGems;GCU(#285)走 FlagGems 加厂商回退;昇腾(#288)把流水线切到 FlagTree 并保留 dtype 回退;MUSA(#286)把四个原先判定为填隙的条目重新升回 FlagGems 路由。

把这条线放回 FlagOS 的命题看,它比任何单点算子入库都更接近核心目标:FlagOS 的立论是「一套算子库跨芯片复用」,而决定这一立论成立与否的正是分派层——有多少算子真的走了 FlagGems 而不是悄悄落回厂商内核。本窗口给出的答案是:厂商内核仍在承接大头(PPU 上 1601 对 435),但趋势明确、且每一处例外都有具名理由。


一、开源项目进展(GitHub 动态)

窗口总览:org 内 53 个仓库中 20 个在窗口内有推送;单次 commit search 命中 119 条窗口内提交(4 页,committer-date 降序),分布于 17 个仓库:FlagGems 43、build-infra 14、community 13、Torch-FL 12、FlagSparse 11、FlagGems-vllm 5、FlagGems-sglang 4、FlagQuantum 3、FlagAttention 3、sglang-plugin-FL 2、vllm-plugin-FL 2、FlagTree 2,以及 flir、FlagGems-Experimental、FlagCX、Open3D-PIMC、FlagDNN 各 1。另有 docs、release-info、FlagBLAS 三仓在窗口内有推送,但默认分支上无窗口内新提交(属标签或侧分支推送,其中 docs 与 release-info 承担发布件站点同步)。

本窗口形态 = 「分派层重构」+「量化与注意力算子加码」两条线并行:治理侧由 FlagGems 的第二次 RC2 打标与 community 的发布项目自动化推进 2.2 收口;工程侧的重点从「往里补算子」转向「让算子真的被走」——Torch-FL 的六平台 FlagGems-first 是主干,FlagGems 的量化算子(W8A8 / W8A16)与 FlagAttention 的 SageAttention、GDN2 是新增产能。此外 Open3D-PIMC 在窗口末尾完成首次代码落地,是本期唯一的新增代码库动作。

1.1 2.2 RC2 第二轮:FlagGems 升到 v5.4.0-rc2.post2,清单条目换版(09-15)

日期:2026-09-15 来源community 提交 #110FlagGems v5.4.0-rc2.post2

09-15 11:21,Release Manager 提交 release(2.2-rc2): bump flaggems to v5.4.0-rc2.post2 (#110),清单中仅一行变化:FlagGems 由 v5.4.0-rc2.post1 换为 v5.4.0-rc2.post2。提交说明写明了推动换版的两处修复——flash_attention_backward 兼容(#6253)与在 flagtree/3.5 线上给 tl.map_elementwise 加门控(#6236),新标签指向分支头 88acc0f7d。核对标签时间线:rc2.post1 与 rc2.post2 均为该分支上的验证快照,清单内其余 24 个条目仍指 rc2.post1。这是 2.2 RC2 的第二次打标,距 09-28 GA 还有 13 天。

1.2 Open3D-PIMC 首次代码落地:单次提交 662 个文件,编译层与运行时到齐(09-16)

日期:2026-09-16 来源Open3D-PIMC 首次提交项目 README

09-16 09:30,org 内 08-15 建立后一直为空的 Open3D-PIMC 仓库收到唯一一条根提交,一次性带进 662 个条目。目录结构显示这不是提案文档而是可用工程:source/raisa-inductor/ 是编译层(compiler.pygraph_manager.pygraph_executor.py,以及 passes/ 下的通信算子、融合、子图三类 pass 与 utils/_graph_hash.py 的编译缓存键),runtime/rcs2/ 是 C++ 运行时(engine.cppl1_workspace.cpp、CMake 与 kernel.cmake),另带 demo/test_compiler.pyenvsetup.sh 与两张架构图。README 把项目的四个待补缺口写得很清楚:内存层级的表达力、分片与拓扑的脱节、动态推理与整图编译的冲突、编译产物的复用;对应解法是把分层分片、3D-DRAM 数据驻留、对象生命周期与 Graph/Eager 边界提升为可验证、可变换、可优化的 IR 语义。这承接 09-14 中国算力大会的开源发布,完成了从「宣布开源」到「代码上线」的落地。

1.3 Torch-FL:六个平台一起转向 FlagGems-first(09-15/09-16)

日期:2026-09-15 至 2026-09-16 来源Torch-FL #290Torch-FL #276Torch-FL #285

详见「今日重点」。补充两点细节:其一是 PPU 作业的环境可复现性被彻底改写——原先它靠运行器 pod 上的 /workspace/FlagGems 宿主挂载导入 FlagGems,pod 一旦不带该挂载,set_env_ppu.sh 就在环境准备阶段以「FlagGems source is not available」退出、作业根本走不到算子步骤;现在改为从 FlagOS 索引装 FlagTree(0.6.2a2+ppu3.6)与从 git 装 FlagGems master,环境只依赖镜像加两个索引。其二是 mm/bmm 仍被钉在厂商内核上,原因是 FlagGems 的 _hygon 内核会给 Triton 的 mm_kernelnum_ldmatrixes 关键字而 PPU 版 Triton 不认,已作为 FlagGems #6225 上报。

1.4 FlagAttention:SageAttention 与 GDN2 同日入库,昇腾版单独实现(09-15)

日期:2026-09-15 来源FlagAttention #43 SageAttentionFlagAttention #44 GDN2FlagAttention #62 昇腾版

一天之内合入两个新版算子。#43 引入 SageAttention 的 Triton 实现(10 个文件、+862/-7):QK 走 INT8 逐块量化、PV 走 FP16 前向,QK 量化与注意力前向两个内核都使用 triton.experimental.tle.language,附带覆盖 1K 至 32K 序列长度的基准脚本与对标逐头参考实现的精度测试。#44 是优化后的 GDN2 算子——线性注意力方向的当前热点。#62 则为昇腾单独实现 GDN2 与 SageAttention:入口按 torch.npu.is_available() 自动路由到 _ascend 后端,通用路径再转指该实现,避免两处代码漂移;昇腾基准脚本对照 AscendC 算子测同一组形状。这三条放在一起,说明 FlagAttention 已从「补齐注意力变体」转向「跟随最新推理模型的结构热点」。

1.5 FlagGems 量化算子线:海光 W8A8 INT8 GEMM、摩尔线程 W8A16 FP8 RMSNorm(09-15)

日期:2026-09-15 来源FlagGems #6185 海光 W8A8FlagGems #6210 摩尔线程 W8A16

海光线新增 mm_w8a8_int8mm_w8a8_int8_out 两个非 ATen 量化矩阵乘算子(5 个文件、+871):输入为已量化的 INT8 矩阵,配标量或按行/列缩放的 FP32 scale 与可选 bias,量化本身在算子外完成,内核实现重点是 INT8 点积下的长 K 规约溢出保护;同时按 conf/operators.yaml 的规范补了算子登记,stage 标为 5.4,与当前 RC 分支对齐。摩尔线程线则优化了 W8A16 FP8 RMSNorm 路径(#6210)。此外 fix: enable TLE for Hygon(#6247)把海光加入 TLE 启用名单,说明其后端开始使用 Triton 的语言扩展。三条合看,量化(W8A8 / W8A16)正在成为本轮算子扩容的主线。

1.6 FlagGems KernelGen 批量入库:二十个 Nvidia 算子与昆仑芯 tle.gpu 迁移(09-15/09-16)

日期:2026-09-15 至 2026-09-16 来源FlagGems #5722FlagGems #6311 昆仑芯FlagGems #6188 backends.yaml

KernelGen 产出的 Nvidia 算子在本窗口成批进主仓,粗略计约二十个,覆盖三类:线性代数类(cond、solve、eigvals、vander、multi_dot、powsum 等 linalg 系列)、特殊函数类(entr、切比雪夫多项式等)、以及注意力与训练相关类(原生多头注意力、量化 GRU、grid_sampler 二维采样、三维上采样反向、多处伪量化与嵌入袋稀疏反向、批归一化反向规约等)。KMCompiler 线另补了 unsafe_index_put(Nvidia 与昇腾)、rnn_tanh 性能优化与 _dim_arange。昆仑芯侧把 sumsum_dim 迁移到 tle.gpu(#6311),并新增一个勒让德多项式算子。质量面上修掉了 linalg_svd 的 16×16 挂死(#6301)、addmv 标量 bias 的 dtype 不匹配(#6149)与 CI 容器的 shm/ipc 选项并更新了海光镜像(#6304);backends.yaml 也把 iluvatar 后端更新到 flagtree==0.6.1+iluvatar3.6(#6188)。

1.7 推理插件线:昇腾 SparseAttnSharedKV、persistent_topk 与 vLLM 0.24 适配(09-15/09-16)

日期:2026-09-15 至 2026-09-16 来源FlagGems-vllm #792 SparseAttnSharedKVvllm-plugin-FL #464sglang-plugin-FL #75 Hygon DCU CI

本窗口单笔最大的代码量来自昇腾的 SparseAttnSharedKV(#792,5 个文件、+9637):这是 DeepSeek-V4 稀疏注意力共享 KV 结构在昇腾上的 Triton 实现,固定验证六个形状——三个 decode 案例 KV 长度 8193、三个 prefill 案例 Q=KV=8192,常量集中在 64 个 Q 头、1 个 KV 头、头维 512、页大小 128,精度阈值 2e-2,测速以同设备 AscendC 算子为基准(5 次预热、20 次采样)并只作记录不作断言——即以精度作为验收口径。同线还补了昇腾 persistent_topk(segment-sort 加 merge 两路)并把厂商 fused_moe / persistent_topk 收纳到 ops/ 下,同时把 pre-commit 配置切到 gitcode 镜像以适配国内网络。插件侧两条升级:vllm-plugin-FL 把燧原 S60 适配到 vLLM 0.24 线(#464)并把昆仑芯升到 vLLM 0.24.0(#516);sglang-plugin-FL 则为海光 DCU(BW1000)与燧原 GCU(S60)各建了 CI 管线(#75/#88),其中海光线用 AMD adaptor 构建 FlagCX v0.13.0(DCU 属 HIP 谱系,DTK 自带 librccl),e2e 用例矩阵与昇腾、MUSA 对齐。FlagGems-sglang 侧把上游 FlagGems 的测试工具与 conftest 内置进仓(#76)。

1.8 build-infra:FlagCX wheel 打包线开通,六条 vLLM 应用镜像 tag 记录(09-15)

日期:2026-09-15 来源build-infra #886build-infra #895build-infra #888

窗口内 build-infra 以 14 条提交成为第二活跃仓库,主体是两件事。第一件是新开 FlagCX wheel 打包线(#886 新增构建、校验、发布三步,#896 pin scm 节点宽度并给 MACA 配 cu-bridge 的 CUDA_PATH,#897 回退过度注释,#899 让 vllm-plugin wheel 构建保留 wheel 作为 run artifact);其中 #895 记录了一处环境坑:torch 的已安装头文件强制要求 gflags——torch/headeronly/macros/cmake_macros.h 直接定义了 C10_USE_GFLAGS,于是 c10/util/Flags.h 对每个消费者都 include <gflags/gflags.h>,而任何运行时镜像都不带该头文件(在海光运行时镜像上实测无 /usr/include/gflags),海光构建因此在编译 backend_flagcx.cpp 时挂掉,故在构建镜像内加装 libgflags-devlibgoogle-glog-dev。第二件是把六条 vLLM 应用镜像 tag 入账,统一为 2.1.2-0.2.2rc2.post1_gdb28502.d20260915,分别对应 metax-maca3.8.1.3、metax-maca3.7.2.1、ascend-cann9.0.0、ascend-cann8.5.0 及两条 910c 变体(#888 至 #893),另补了 metax/ascend 0.20.2 rc2 重建的 changelog(#887)与昆仑芯 paged-KV 约定修复的记录(#898)。

1.9 community:2.2 发布治理自动化,状态改由关联 PR 推导(09-15/09-16)

日期:2026-09-15 至 2026-09-16 来源community 2.2 项目同步工作流community 提交 29a04c6e

在清单与打标之外,community 仓库本窗口的 13 条提交几乎全部用于把 2.2 的发布状态从人工看板搬进自动化。新增的 flagos-2.2-project-sync.yml 每 15 分钟运行一次,把带 flagos2.2-rc0/rc1/rc2 标签的 issue(不分开关状态)同步到组织的 GitHub Project #9,因默认的 Actions 令牌与旧的组织的令牌都缺 Projects 权限,工作流显式要求一个带 project scope 的专用令牌。随后一天的提交沿同一条链修:同步 issue、用关联 PR 推导发布状态、把状态与关联 PR 对齐、加固对账、保留被人工延期的 issue、把已指派的 triage issue 提升、规范调度周期、验证 Actions 调度心跳、并补一条说明写明 RC 的验证规则。把这条链与 RC2 两次打标并读,能看出 2.2 的 Go/No-Go 正在从「人看清单」变成「由 issue 与 PR 状态推导」,这也解释了为什么本窗口清单的每一次换版都能在半小时内落到标签上。

1.10 FlagSparse:外部分支合入主仓,昇腾精度收尾(09-15)

日期:2026-09-15 来源FlagSparse 提交列表

FlagSparse 本窗口的 11 条提交全部来自一条外部协作线:主仓以合并提交方式引入 NCIC-AlphaSparse/main 分支(#60),内容为昇腾精度调整(ascend accuracy refineascend refines)、CI 细化(两轮 ci refine)、wrapper 与文档更新,以及多次跨仓同步合并。这说明稀疏算子库的推进由外部团队主导、主仓承接,与 FlagAttention 由 org 内主线推进形成分工对照。

1.11 FlagQuantum:Twin 证据按电路拓扑定级(09-15)

日期:2026-09-15 来源FlagQuantum #45FlagQuantum #46

承接上一窗口的 Twin API 冻结,FlagQuantum 本窗口提交三次:跨电路比较 Twin 候选(#44)、按电路拓扑对 Twin 证据定级(#45)、组合相邻的连通 Twin 区域(#46)。三步合起来是把量子处理器数字孪生的等价性判定从「单电路比对」推进到「按拓扑组织证据集」,属历史序列管理之后的方法学补齐。

1.12 其余动态:FlagTree、flir、FlagDNN、FlagCX(09-15/09-16)

日期:2026-09-15 至 2026-09-16 来源FlagTree #1178FlagTree #1169flir #75FlagCX #599

FlagTree 两笔:fix(hcu): allow extract_tile in the TLE whitelist(#1169)把海光线上的 extract_tile 放入 TLE 白名单,与 FlagGems 侧「为海光启用 TLE」同向;[Triton] Use triton version instead of llvm22 version(#1178)统一了版本标识口径。同一改动也落在 flir(FlagTree IR,源自 microsoft/triton-shared)上(#75)。FlagDNN 修复了 Nvidia 后端的算子实现。FlagCX 的 #599 修正了性能报告口径:KV 等价吞吐不再用固定文本框数值,改为由实测的每请求 KV 字节数计算。


二、新闻报道与生态

2.1 组件级检索第十二个连续平静窗口:命中集中在成员单位而非组件(09-15~09-16)

日期:2026-09-15 至 2026-09-16 来源Google News RSS

以 FlagOS、FlagGems、FlagScale、FlagTree、FlagPerf、FlagCX、KernelGen、Open3D-PIMC 及 BAAI 侧词的中英文组合共 24 组查询(中文 17 组、英文 7 组,when:7dwhen:14d 两档)检索,组件名查询在窗口内全部零命中;放宽到成员单位与产业词后共得 13 条窗口内结果,其中仅沐曦的 Day0 适配与燧原的上市行情与生态相关,其余为股市行情、金融稿或无关内容。HN Algolia 对 FlagOS、FlagGems、FlagScale、BAAI 的查询亦无有效技术讨论。这是组件级新闻检索连续第十二个平静窗口,本期技术信息面仍基本全部来自代码仓库,并首次由 Torch-FL 的分派层改动提供了一条可独立成篇的技术叙事。

2.2 沐曦完成上海人工智能实验室 ATRIA Dawn Preview 的 Day0 适配(09-15)

日期:2026-09-15 来源沐曦官网观点网

09-14 上海人工智能实验室开源 ATRIA Dawn Preview 模型,沐曦同日宣布凭借自研通用 GPU 与 MXMACA 软件栈率先完成该模型的 Day0 适配。公司口径给出两条累积数据:自 2025 年 12 月以来已完成 37 个主流旗舰模型的 Day0 适配,覆盖智谱、阿里千问、MiniMax、DeepSeek、阶跃星辰、腾讯混元等;MXMACA 软件栈兼容 40 余种 AI 框架、1000 多款模型,适配超 6000 个开源项目测试,全量支持 PyTorch 2.8 的 2410 个 GPU 算子。需要区分的是:这条适配走的是厂商自有软件栈,与 FlagOS 里 metax 后端(Torch-FL 的 metax 路由、FlagGems 的 metax 后端)是两条并行路径;把两者并读,才能看出成员单位在「自有栈争 Day0」与「共建统一栈」上的双线投入。

2.3 燧原科技科创板上市:资本侧口径与生态位的两条读法(09-15)

日期:2026-09-15 来源21 财经同花顺财联社

燧原科技 09-11 登陆科创板后,相关解读在窗口内持续发酵:发行价 142.18 元,上市首日开盘 410 元、开盘涨幅 188.37%,盘中最高 475 元,收盘 397 元、涨幅 179.22%,对应市值 1708.5 亿元,募资 61.4 亿元;2023 至 2025 年营收 3.01 亿、7.22 亿、9.90 亿元,2026 上半年 11.20 亿元、同比增长 279.08%,三年归母净亏损合计逾 43 亿元,未弥补亏损 44.41 亿元,公司自估 2026 或 2027 年有望盈利。作为 FlagOS 成员单位,燧原在生态侧的对应动作是代码而非行情:本窗口其 enflame 后端同时出现在 FlagGems 算子线、vLLM 0.24 适配线与 sglang 的 GCU CI 上。资本叙事回答的是「能不能持续投入」,代码提交回答的是「投入落到哪里」,两者本期都指向云端推理。

2.4 Open3D-PIMC 从发布到代码:媒体侧与代码侧的 48 小时时差(09-14~09-16)

日期:2026-09-14 至 2026-09-16 来源新华网仓库首次提交

09-14 中国算力大会宣布 Open3D-PIMC 开源发布时,仓库内并无代码;到 09-16 09:30 才出现唯一一条根提交,一次性带进 662 个条目(编译层、C++ 运行时、示例与架构图)。媒体侧的表述是「代码已上线开源社区」「今年四季度将在全球科技顶会发布面向 3D 芯片算力的最新优化成果」,代码侧的时间戳则显示上线发生在发布后约 44 小时。这不构成矛盾,但提示了一种读法:面向新一代芯片形态的项目,其「发布」是路线宣告,真正的可用性要看仓库后续的提交节奏——本报告此后会把它纳入常规巡检。


三、成员单位深挖

3.1 清微智能:Open3D-PIMC 代码落地与 3D 可重构路线的合流(09-16)

日期:2026-09-16 来源Open3D-PIMC README清华大学官网

清微智能本期在 org 内的动作是 Open3D-PIMC 首次代码提交。从落地内容看,其技术主张与公司的可重构路线是同一条线:README 把 3D-DRAM 堆叠后的核心问题定位为「数据住在哪一层内存、张量如何在 Chiplet/Die/Tile 间分布、计算与通信能否在正确的时间点协同调度」,而不再是单算子吞吐;提出的解法是把分层分片、N3D 数据驻留、对象生命周期与 Graph/Eager 边界写进 IR,并允许厂商以插件形式提供成本模型、调度器与代码生成,保持前端、IR 与运行时 ABI 兼容。raisa-inductor 这一命名与 runtime/rcs2 的 C++ 引擎,说明落地的是自研编译与运行时栈的对外开源版本。结合公开信息给出的路线图(第二代 3D 可重构芯片即将量产流片、累计算力卡订单超 3 万张、十余省区千卡级智算中心落地),清微在 FlagOS 生态中的定位仍是一致的:不做补齐型算子贡献者,而在下一代芯片形态上争取软件定义权。

3.2 海光:量化算子、CI 镜像与 FlagCX wheel 三线并行(09-15)

日期:2026-09-15 来源FlagGems #6185FlagGems #6247build-infra #895

海光是本窗口工程量最分散但也最完整的一家:算子侧加入 W8A8 INT8 量化矩阵乘(含 _out 变体)并把海光纳入 TLE 启用名单;FlagTree 侧为海光线放行 extract_tile 的白名单;CI 侧恢复容器的 shm/ipc 选项并更新镜像;打包侧则因海光构建在编译 backend_flagcx.cpp 时缺 gflags 头文件而把 libgflags-dev 加进 FlagCX 的 wheel 构建镜像;此外 Torch-FL 的 DCU 线也把 FlagTree 与 FlagGems 设为默认启用。把五处并读,海光当前的瓶颈不在「缺算子」,而在工具链与打包环境的适配——这类问题数量多、单点价值低,但正是跨芯片可用性的实际门槛。

3.3 摩尔线程:W8A16 FP8 RMSNorm 与 MUSA 路由双向调整(09-15)

日期:2026-09-15 来源FlagGems #6210Torch-FL #286

摩尔线程本期两处动作方向相反但逻辑一致:一是 FlagGems 侧优化 W8A16 FP8 的 RMSNorm 路径,属于把已有算子做深;二是 Torch-FL 侧把四个此前被判定为「MUSA 填隙」的条目重新升回 FlagGems 路由,即把原先让给厂商内核的算子收回来。前者是产能,后者是覆盖面,两者合起来说明 MUSA 后端已越过「能跑」阶段,开始处理分派层的例外清单。

3.4 沐曦:metax rc2 重建镜像记录与 Day0 适配叙事(09-15)

日期:2026-09-15 来源build-infra #888build-infra #887沐曦官网

沐曦本期在 org 内的动作集中在发布件:build-infra 为 metax-maca3.8.1.3 与 metax-maca3.7.2.1 两个运行时组合各记录了一条应用镜像 tag,并补了 metax/ascend 0.20.2 rc2 重建的 changelog 条目——两条 MACA 版本线并列入账,说明其驱动栈的支持宽度被明确保留。四天前其 vllm-plugin-FL 的 metax CI 与 vLLM 0.24.0 升级也属同一条推理栈努力。对外一侧则是 2.2 条所述的 Day0 适配,走的是自有 MXMACA 栈。对 FlagOS 而言更关键的是前一条:镜像 tag 的入账使 metax 侧的多芯片验收具备可复现的基准。

3.5 燧原科技:S60 进 vLLM 0.24 线与 GCU CI 管线(09-15)

日期:2026-09-15 来源vllm-plugin-FL #464sglang-plugin-FL #88

燧原本期两笔均为适配动作:vllm-plugin-FL 把 Enflame S60 适配到 vLLM 0.24 线,sglang-plugin-FL 则为 GCU(S60)建立 CI 管线。两条一起看,S60 在 FlagOS 内的推理路径覆盖从 vLLM 扩到 sglang,且两者都带了 CI——这与本窗口的整体节奏一致:成员单位的新芯片接入不再止于算子入库,而要同时提供可运行的端到端流水线。结合 2.3 的资本侧信息,其研发投入的落点可以从这类提交里直接读到。

3.6 天数智芯:iluvatar3.6 后端与 FlagTree 0.6.1 绑定(09-15)

日期:2026-09-15 来源FlagGems #6188

天数智芯本期的动作是一条 CI 配置提交:FlagGems 的 backends.yaml 将其后端更新为 flagtree==0.6.1+iluvatar3.6,把 iluvatar 后端与 FlagTree 的指定构建版本绑定。单笔提交的信息量不大,但它是理解 2.2 验收矩阵的一条线索——各厂商后端的可用性实际上取决于「FlagGems 版本 + FlagTree 构建变体 + 厂商驱动」三者组合,而这类组合正被逐个写进配置以保证可复现。

3.7 昆仑芯:sum 迁往 tle.gpu 与 paged-KV 约定修复(09-15)

日期:2026-09-15 来源FlagGems #6311build-infra #898vllm-plugin-FL #516

昆仑芯本期三条动作方向一致:FlagGems 侧把 sumsum_dim 迁移到 tle.gpu 路径,新增 special_legendre_polynomial_p 算子;推理侧把 vllm-plugin-FL 升级到 vLLM 0.24.0;build-infra 则记录了其 paged-KV 约定的修复。sum 这类基础规约算子从通用实现迁到 TLE 路径,意味着昆仑芯后端已进入「用语言扩展压性能」的阶段,而非仅追求可用。

3.8 智源(牵头方):RC2 治理自动化与 2.2 进度对账(09-15/09-16)

日期:2026-09-15 至 2026-09-16 来源community 提交列表2.2 发布时间表

牵头方本窗口的动作全部落在治理面:先是 FlagGems 的 RC2 第二轮换版(清单一行、标签一次,半小时内完成),随后是 13 条 community 提交把 2.2 的发布状态同步搬进 GitHub Project 并由关联 PR 推导。对照时间表,当前仍处测试与稳定期(09-01 至 09-24),GA 定在 09-28,毕业标准是各 FEP 的可执行 Test Plan 在多芯片矩阵上验收通过。值得记下的是本次治理改造的一个细节:工作流显式声明需要带 project scope 的专用令牌,因为默认令牌与旧组织令牌都不具备 Projects 权限——这类「把流程写进代码」的改动不会出现在任何发布说明里,但决定了 RC 期间 25 个条目能否被逐项追踪。


四、总结与趋势观察

  • 分派层成为本期主战场:Torch-FL 一天内把六个平台推向 FlagGems-first,PPU 从 11 条路由扩到 435 条并逐条记录留在厂商内核上的 47 个算子及原因。FlagOS 的核心承诺是「一套算子库跨芯片复用」,而分派层正是这句承诺的兑现处;本期首次出现了对这一层的完整、可审计的量化口径。
  • 量化算子与注意力变体是新增产能的两端:FlagGems 侧海光的 W8A8 INT8 GEMM 与摩尔线程的 W8A16 FP8 RMSNorm,FlagAttention 侧 SageAttention(QK INT8 逐块量化)与 GDN2,昇腾侧的 SparseAttnSharedKV(DeepSeek-V4 稀疏注意力、头维 512)。这些算子的共同点是直接对应当前推理模型的真实结构,而非测试套件的覆盖率。
  • 发布治理从清单走向自动化:RC2 的第二次打标只改了一行清单,随即由 new 工作流把 issue 状态与关联 PR 对齐;Go/No-Go 的依据正在从「人看清单」转为「状态可推导」。距 09-28 GA 还有 13 天,值得观察这条链在最后一周是否稳定。
  • 生态侧从「适配芯片」走向「定义硬件形态」的第二步:Open3D-PIMC 在发布 44 小时后完成代码落地,带进面向 3D-DRAM 近存计算的分层 IR、编译层与 C++ 运行时。它不进 2.2 的验收范围,但决定了 FlagOS 在下一代芯片形态上的位置。
  • 新闻面连续第十二个平静窗口:组件级检索零命中,成员单位侧的可见新闻集中在资本市场与自有栈的 Day0 适配。技术进展的观察窗口已完全落在代码仓库,这也意味着日报的价值正在从「汇总报道」转为「解读提交」。

附录:信源核查表

信源 核查结果
GitHub org flagos-ai 53 个仓库全量核查 pushed_at,20 个在窗口内有推送;commit search 命中 119 条窗口内提交,分布 17 个仓库
GitHub releases / tags 核对 FlagGems、FlagTree、FlagCX、FlagAttention、vllm-plugin-FL、FlagSparse、FlagScale、KernelGen、Torch-FL、FlagQuantum、build-infra、community 十二个仓库;窗口内新增标签为 FlagGems v5.4.0-rc2.post2;无新 GitHub Release
community 发布清单 2.2 RC2 清单 25 条目(L0~L3 四层),FlagGems 换版为 rc2.post2,其余仍指 rc2.post1;时间表 GA 为 09-28
Google News RSS(中文 17 组) 组件名查询零命中;成员单位与产业词得 13 条窗口内结果,剔除行情与无关稿后保留 2 条
Google News RSS(英文 7 组) FlagOS、FlagGems、BAAI FlagOS、flagos-ai 等查询窗口内零命中
HN Algolia FlagOS、FlagGems、FlagScale、BAAI 查询无窗口内有效技术讨论
智源社区(hub.baai.ac.cn) 直连可用,检索与首页均无 FlagOS 相关窗口内条目
CSDN FlagOS 社区 直连可用,最新文章日期止于 09-10,窗口内无更新
沐曦官网 / 观点网 / 新浪财经 确认 ATRIA Dawn Preview 的 Day0 适配(事件 09-14,报道 09-15 11:17 在窗口内)
21 财经 / 同花顺 / 财联社 / 杭州网 确认燧原科技科创板上市首日数据(事件 09-11,解读稿在窗口内持续)
新华网 确认 Open3D-PIMC 于中国算力大会开源发布(09-14),与 09-16 代码落地形成对照

完整信源清单