调研窗口:过去 24 小时(2026-09-14 10:18 ~ 2026-09-15 10:18,北京时间) 信源:GitHub(org: flagos-ai,53 个仓库 pushed_at 全量核查 + 单次 commit search 97 条按 committer-date 核验 + per-repo commits 复核补入 1 条 + 各仓库 releases/tags 元数据 + community 仓库 2.2 发布清单与发布时间表 raw 直取 + 提交补丁详情)、Google News RSS(中英文 21 组查询词,走代理)、HN Algolia、新华网、观点网、新浪财经、财联社、科创板日报、环球网等产业报道,以及 Tavily 检索补充(详见附录信源清单)


本期索引

  • 今日重点:FlagOS 2.2 RC2 全栈同步打标——25 条目清单换版,25 个 rc2.post1 tag 在 10 分钟内落地(09-14)
  • 一、开源项目进展(GitHub 动态)
    • 1.1 2.2 RC2 清单提交:25 条目覆盖 L0~L3 四层,版本一律对齐 rc0/rc1(09-14)
    • 1.2 23 个组件在 10 分钟内打出 rc2.post1:本次发布周期的第二次全栈快照(09-14)
    • 1.3 首发 rc2.post1 Release:FlagGems v5.4.0 与 FlagSparse v0.3.0(09-14)
    • 1.4 FlagTree:AMD 解耦编译、XPU 修复,新增 xpu3.6 专用标签(09-14/09-15)
    • 1.5 FlagCX:libflagcx.so 进 wheel,T-Head PPU 后端与 CI 双向打通(09-14/09-15)
    • 1.6 FlagAttention v0.4.0:燧原、海光、沐曦、摩尔线程四后端一次性落地(09-14)
    • 1.7 FlagGems-Experimental:海光 17 算子批量入库,摩尔线程 4 个、昆仑芯 1 个(09-14)
    • 1.8 FlagGems 主线:燧原 enflame 同步、Triton 3.5 兼容与 GitCode 镜像(09-14/09-15)
    • 1.9 FlagGems-vllm 与推理插件线:moe_sum 双后端、MTT S5000 topk、vLLM 0.24.0(09-14/09-15)
    • 1.10 FlagQuantum:Twin API 冻结,QPU 数字孪生进入历史序列管理(09-14)
    • 1.11 框架与工具面:FlagScale 统一 CI、Torch-FL 后端路由对齐、TE-FL 海光接口(09-14/09-15)
    • 1.12 FlagGems-sglang:竞赛产出批量合入,10 个 PR 同日进主仓(09-14)
    • 1.13 build-infra:海光 vLLM rc2.post1 双镜像 tag 记录并复验(09-14)
    • 1.14 docs 与 release-info:文档线并入 CICD 改造,发布件站点同步(09-15)
  • 二、新闻报道与生态
    • 2.1 Open3D-PIMC 在中国算力大会开源发布:清微智能与智源联合开发,补齐 3D 算力芯片编译栈(09-14)
    • 2.2 组件级检索第十一个连续平静窗口:核心命中集中在智源侧报道(09-14~09-15)
    • 2.3 产业侧三场会议线:服贸会、外滩大会、中国算力大会的国产算力叙事(09-09~09-14)
  • 三、成员单位深挖
    • 3.1 清微智能:Open3D-PIMC 与可重构算力 5000P 的双线叙事(09-14)
    • 3.2 海光信息:从 17 个算子到 rc2.post1 镜像复验,本窗口工程量第一(09-14)
    • 3.3 摩尔线程:注意力后端、profiler 集成与服贸会份额口径(09-14)
    • 3.4 沐曦:metax CI 与 vLLM 0.24.0,曦云 C700 进入流片前夜(09-14)
    • 3.5 燧原科技:enflame 后端继续入库,IPO 后市值与客户结构叙事(09-14)
    • 3.6 天数智芯:iluvatar 后端命名统一,资本市场进入解禁前窗口(09-14)
    • 3.7 昆仑芯与达摩院玄铁(外部生态方):XPU 标签与 PPU 双线接入(09-14/09-15)
    • 3.8 智源(牵头方):RC2 治理纪律与 Open3D-PIMC 的规则定义权表述(09-14)
  • 四、总结与趋势观察
  • 附录:完整信源清单

今日重点:FlagOS 2.2 RC2 全栈同步打标——25 条目清单换版,25 个 rc2.post1 tag 在 10 分钟内落地

日期:2026-09-14 来源community 提交 #109(2.2 RC2 清单)2.2 发布时间表FlagGems v5.4.0-rc2.post1

本窗口最具分量的事件是一次协调动作:09-14 10:35,community 仓库合入 release/2.2/release-2.2-rc2.yaml(新增 251 行,Release Manager 提交),宣布 2.2 周期的第二轮候选版本 RC2 清单成型;随后从 10:45 到 10:54 的十分钟内,org 内 23 个组件仓库相继打出 v{X}-rc2.post1 标签或 Release,12:18 至 12:19 FlagTree 的三个 Triton 变体标签补齐,19:59 FlagTree 再补一个 xpu3.6 标签。加上 vllm-plugin-FL 的双版本线,窗口内共记录 26 次打标动作、覆盖 22 个仓库。

RC2 清单按四层组织:L0 基础设施层(FlagTree 的 triton3.6/3.5/3.3 三条目、FlagCX);L1 计算库层(FlagGems、FlagFFT、FlagSparse、FlagDNN、FlagBLAS、FlagTensor、FlagAudio、FlagAttention、FlagGems-vllm、FlagGems-sglang);L2 框架层(Torch-FL、vllm-plugin-FL 与 vllm-plugin-fl-0.2、sglang-plugin-FL、TransformerEngine-FL、Megatron-LM-FL、FlagOS-Compressor);L3 应用层(FlagScale、KernelGen、KernelGenBench、FlagRelease)。共 25 个条目,全部指向 rc2.post1 已验证快照。

与 RC1 相比,本次变化的性质是「结构不变、快照换代」:模块版本号与 rc0/rc1 保持一致,只在 .postN 迭代位上推进——FlagGems 由 v5.4.0-rc1.post2 到 v5.4.0-rc2.post1,FlagCX 由 v0.14.0-rc1.post2 到 v0.14.0-rc2.post1,FlagAttention 固定在 v0.4.0 线,FlagTree 由 0.7.0rc1.post1 到 0.7.0rc2.post1。清单头部把工作流写成可执行规则:从各模块基线分支拉出 rc2 集成分支,验证通过后打递增 tag(rc2.post1 → rc2.post2),并把上一轮 tag 记录在条目的 rc1 注释里;分支:基线分支: 两个字段由 manage-release.py 直接读取,因此同一仓库拆多条目、各跟不同上游线时(FlagTree、vllm-plugin-FL)以及需从发布分支而非默认分支拉出时(flagos-compressor)必须显式写明。

放回时间表看,这次打标发生在「测试与稳定期(09-01 ~ 09-24)」中段,距离 09-28 的 2.2 GA 还有 14 天。RC2 的意义不在于新增功能——特性冻结早在 08-31 已关闭——而在于把测试期内累积的修复固化成一组可复现、可批量拉取的锁定版本,让多芯片验收矩阵有一个统一的比对基线。


一、开源项目进展(GitHub 动态)

窗口总览:org 内 53 个仓库中 29 个在窗口内有推送;单次 commit search 命中 97 条窗口内提交(4 页,committer-date 降序),per-repo commits 复核另补入 1 条(TransformerEngine-FL),合计 98 条,分布于 17 个仓库:FlagQuantum 17、FlagGems-Experimental 20、FlagGems 12、FlagGems-sglang 10、FlagTree 6、FlagCX 5、FlagGems-vllm 5、build-infra 5、FlagAttention 4、docs 4、Torch-FL 2、sglang-plugin-FL 2、vllm-plugin-FL 2、FlagScale 1、FlagPrism 1、community 1、TransformerEngine-FL 1。另有 Megatron-LM-FL、KernelGen、FlagBLAS、FlagSparse、FlagDNN、FlagOS-Compressor、FlagFFT、FlagTensor、KernelGenBench、FlagRelease、FlagAudio、release-info 等仓在窗口内有推送,但窗口内新提交落在标签或非默认分支上(其中大部分是下文 1.2 的 rc2.post1 打标)。无新仓库。

本窗口形态 = 「全栈快照换代」+「外部后端加码」两条线同时推进:治理侧用一次清单提交与一次十分钟的集体打标,把 2.2 推进到第二轮候选;工程侧则由海光、摩尔线程、沐曦、燧原、昆仑芯、达摩院玄铁在算子、注意力后端、通信库与编译器四个面上同时加码,其中海光的 17 个算子批量入库和 FlagAttention 的四家后端同日落地是本窗口最集中的两块工程量。

1.1 2.2 RC2 清单提交:25 条目覆盖 L0~L3 四层,版本一律对齐 rc0/rc1(09-14)

日期:2026-09-14 来源community #109

Release Manager 于 09-14 10:35 新增 release/2.2/release-2.2-rc2.yaml(+251 行),提交说明写明「从各模块基线分支切出 rc2 分支,按清单头部工作流打 v{X}-rc2.post1;版本与 rc0/rc1 保持一致,各条目的 rc1 注释记录上一轮已验证 tag」。清单按 L0 基础设施、L1 计算库、L2 框架、L3 应用四层组织,共 25 条目,并注明 FlagGems、FlagGems-sglang、FlagDNN、FlagBLAS 的默认分支是 master 而非 main。这是继 rc1 之后的第二次清单快照,也是 2.2 GA(09-28)前唯一的中间候选。

1.2 23 个组件在 10 分钟内打出 rc2.post1:本次发布周期的第二次全栈快照(09-14)

日期:2026-09-14 来源FlagCX v0.14.0-rc2.post1

打标节奏高度集中:10:45 FlagCX、FlagGems、FlagFFT 三家先行;10:47 FlagDNN、FlagBLAS;10:48 FlagTensor、FlagSparse、FlagAudio、FlagAttention、FlagGems-vllm、FlagGems-sglang、Torch-FL 七家连发;10:49 vllm-plugin-FL(0.3.0 与 0.2.2 两条线)、sglang-plugin-FL、TransformerEngine-FL;10:51 Megatron-LM-FL、FlagOS-Compressor;10:53 FlagScale、KernelGen、KernelGenBench;10:54 FlagRelease。FlagTree 的 triton3.5/3.6/3.3 三条目在 12:18 至 12:19 补齐。十分钟内完成 23 个组件的打标,说明这套「清单先行、脚本执行」的发布工序已经稳定可复用。

1.3 首发 rc2.post1 Release:FlagGems v5.4.0 与 FlagSparse v0.3.0(09-14)

日期:2026-09-14 来源FlagSparse v0.3.0-rc2.post1

在 26 次打标中,多数以 tag 形式落地,仅 FlagGems(v5.4.0-rc2.post1)与 FlagSparse(v0.3.0-rc2.post1)生成了带发行说明的 GitHub Release,两者均于 09-14 10:45 至 10:48 之间发布。对照 FlagGems 的历史节奏:v5.4.0-rc0.post1(09-01)、v5.4.0-rc1.post1(09-07)、v5.4.0-rc1.post2(09-11)、v5.4.0-rc2.post1(09-14),稳定版 v5.3.6 停在 09-11,可见 5.4.0 的候选迭代已进入每周两轮以上的密度。

1.4 FlagTree:AMD 解耦编译、XPU 修复,新增 xpu3.6 专用标签(09-14/09-15)

日期:2026-09-14 ~ 09-15 来源FlagTree #1163(AMD 独立编译)

FlagTree 在窗口内 6 条提交并新增 4 个标签。工程侧四条线:其一,[Build][AMD] Decouple amd for independent compilation v2(#1163)把 AMD 后端从统一构建里解耦,允许独立编译;其二,XPU 线修 XPUDriver 取设备的路径,解决 cuda-graph capture 报 err -900(#1168);其三,CI 侧为 nvidia3.6 的 FlagGems 基线与测试任务接入远端可复用工作流(#1172,09-15 10:04),并把 USE_FLAGCX 变量从工作流中移除(#1167);其四,把 FlagPrism 的 profiler 与 debugger 集成进编译器链(#1106,摩尔线程方向)。标签侧除三条 rc2.post1 外,19:59 新增 0.7.0rc2+xpu3.6——这是该仓库标签体系里首次出现非 Triton 的加速器后缀(此前仅有 +triton3.x 形态),与昆仑芯 XPU 线在交付工作流之外单独成标签相对应。

1.5 FlagCX:libflagcx.so 进 wheel,T-Head PPU 后端与 CI 双向打通(09-14/09-15)

日期:2026-09-14 ~ 09-15 来源FlagCX #596(PPU torch 插件与 CI)

通信库本窗口 5 条提交,可分两组。交付面:[UIL] Place libflagcx.so into the flagcx wheel package(#570)把共享库打进 wheel,延续上一窗口「从源码自编走向可安装」的方向;[UIL] Rename the iluvatar_corex build key to iluvatar(#583)把天数智芯的构建键统一成厂商名,减少后端命名上的特例;另有一条 dependabot 升级(#572)。新后端面:[CICD] Add T-Head PPU CI workflow(#592)先建 CI,随后 [UIL] Add PPU torch plugin support and extend PPU CI workflow(#596,09-15 00:49)补上 torch 插件支持并扩展工作流,两步走的接法与此前各厂商后端一致。值得注意的是 PPU 的接入对象是达摩院玄铁(T-Head),不在既有成员单位名单内,属外部生态方新增。

1.6 FlagAttention v0.4.0:燧原、海光、沐曦、摩尔线程四后端一次性落地(09-14)

日期:2026-09-14 来源FlagAttention #61(mthread 后端)

FlagAttention 在 14:29 至 14:30 的两分钟内合入四条同构提交,为注意力算子依次加上燧原(enflame,#58)、海光(hygon,#59)、沐曦(metax,#60)与摩尔线程(mthread,#61)四个后端。四家厂商在同一批次、同一分钟内进入同一模块,说明注意力算子的后端接入已被抽象成可批量复制的模板——这与该仓库版本线在本窗口跳到 v0.4.0-rc2.post1 相互印证,注意力算子从「单一平台实现」进入「多厂商并行维护」阶段。

1.7 FlagGems-Experimental:海光 17 算子批量入库,摩尔线程 4 个、昆仑芯 1 个(09-14)

日期:2026-09-14 来源FlagGems-Experimental #557(Hygon ormqr)

本窗口单仓提交量第一(20 条)。海光线在 17:51 至 18:54 的一小时内连续合入 17 个算子,覆盖特殊函数(special_legendre_polynomial_p、special_hermite_polynomial_h、special_round_out)、线性代数(linalg_ldl_factor、ormqr)、数值与索引(norm_scalaropt_dim、masked_scale、scalar_tensor、gcd_、addmm_、as_strided_scatter、scatter_add、feature_dropout、conv_depthwise2d、beam_search_score、thnn_fused_lstm_cell),并附一条 Hygon 的 _scaled 相关修复;摩尔线程线补 cholesky_inverse、linalg_ldl_solve、ormqr 与线性算子特化;昆仑芯线补 mvlgamma 特化(#605)。密集补齐的形态说明这些算子此前在对应平台上缺位,属验收矩阵暴露出的缺口在填。

1.8 FlagGems 主线:燧原 enflame 同步、Triton 3.5 兼容与 GitCode 镜像(09-14/09-15)

日期:2026-09-14 ~ 09-15 来源FlagGems #6200(enflame 同步)

主线 12 条提交里三条最值得记录:一是 enflame to flagos 20260911(#6200),燧原把自家分支的改动成批同步回主线,是成员单位分支与上游主线周期性归并的实例;二是 fix: add Triton 3.5 compatibility for flash_attention_backward(#6252,对应 issue #6235),把注意力反向算子在新版 Triton 下的兼容性补上,与 FlagTree 的多 Triton 版本并行策略呼应;三是 [User Experience] pre commit config use gitcode mirror(#6231),把 pre-commit 的依赖源切到 GitCode 镜像,属面向国内开发者的基础设施适配。其余为缺陷修复(fft res_out、boolean slice views、batch_norm 基准命名)与 KernelGen 侧的算子入库(Nvidia __iand__、摩尔线程 linear、昇腾 master_scatter_backward)、KernelGen 测试发现与 alias_copy.out 注册修复(09-15 09:19/09:20)。

1.9 FlagGems-vllm 与推理插件线:moe_sum 双后端、MTT S5000 topk、vLLM 0.24.0(09-14/09-15)

日期:2026-09-14 ~ 09-15 来源FlagGems-vllm #758(MTT S5000 persistent_topk)

推理侧本窗口的动作集中在「让某后端可用」这一层。FlagGems-vllm:海光补 moe_sum(#745),达摩院玄铁同日补 moe_sum 变体(#772),两者构成同一算子在不同平台上的对照实现;KMCompiler 线把 top_k_per_row 的 prefill/decode 切到 FlagGems 套件并修掉两个厂商阻塞缺陷、补一个 MTT prefill,随后为摩尔线程 MTT S5000 加 persistent_topk 后端(#758,09-15 09:56)。插件侧:vllm-plugin-FL 开启 metax CI 并把 vLLM 抬到 0.24.0(#488),另加一批适配准入用例(#492);sglang-plugin-FL 把 dispatch 单元测试与平台配置解耦(#94),并给插件预加载加了基准(#96)。

1.10 FlagQuantum:Twin API 冻结,QPU 数字孪生进入历史序列管理(09-14)

日期:2026-09-14 来源FlagQuantum #31(Twin v1 API 冻结)

第二高提交量仓库(17 条),全部集中在一天内从 10:29 推进到 22:34,且是一条目的明确的单向链路:先生成身份绑定的 Twin 证据(#27),再做重复验证聚合(#28),接着落验证序列(#29),到 #30 准备 API 冻结、#31 正式冻结 Twin v1 API,随后完成收敛(#32)、恢复提交(#33),把 QPU 数字孪生持久化(#34),并依次比较校准漂移(#35)、建校准历史(#36/#37)、建验证历史(#38/#39)、延展与对齐历史(#40/#41)、比较候选(#42)、恢复候选提交(#43)。一天之内完成「冻结接口 + 建历史序列」的组合,是量子方向在 2.2 周期内第一次把孪生数据管理做成可复现流程。

1.11 框架与工具面:FlagScale 统一 CI、Torch-FL 后端路由对齐、TE-FL 海光接口(09-14/09-15)

日期:2026-09-14 ~ 09-15 来源FlagScale #1285(跨加速器 CI 统一)

FlagScale 的 [CICD] Unify dependency-coupled CI across accelerator platforms(#1285,09-15 09:28)把各加速器平台上互相耦合的 CI 依赖统一收口,是训练框架侧针对「一个改动要跑遍多平台」这一成本问题的应对。Torch-FL 两条:ci: align backend routing with platform FlagGems availability(#272)让后端路由与平台上 FlagGems 的实际可用性对齐;fix: restore MUSA FlagGems routing and fall back the ops it cannot run(#275)恢复沐曦 MUSA 的 FlagGems 路由,并为跑不了的算子加回退路径——这条补丁恰好说明「路由存在但算子覆盖不全」是当前多芯片栈的现实约束。TransformerEngine-FL 一条:支持海光两种 multi-tensor scale 接口(#122)。FlagPrism 一条:为摩尔线程加 profiler 与 debugger 支持并更新文档(#11)。

1.12 FlagGems-sglang:竞赛产出批量合入,10 个 PR 同日进主仓(09-14)

日期:2026-09-14 来源FlagGems-sglang #59(fused rmsnorm warp2)

11:58 至 13:31 的一个半小时内,10 个 PR 依次合入主仓,提交者与分支名清楚指向跨芯片算子优化竞赛的参赛任务:competition/bmm-chunk、competition/decode-attention、competition/decode-grouped-attention、competition/embedding-lora-a、competition/mamba-layernorm-gated、competition/sgemm-lora-b、competition/fused-rmsnorm-warp2,以及 flagos-task19、flagos-task21-moe-sum-reduce 等任务分支。竞赛产出以这种批量形式进入主仓,意味着该仓库已承担起「竞赛成果落地通道」的角色,而上一窗口同一仓库还只有零星合入。

1.13 build-infra:海光 vLLM rc2.post1 双镜像 tag 记录并复验(09-14)

日期:2026-09-14 来源build-infra #883(海光复验记录)

构建侧 5 条提交全部围绕海光 vLLM 线:先为 hygon 插件的 rc2 重建补上待发 changelog(#879),再连续记录两个应用镜像 tag——2.1.2-0.3.0rc2.post1_gc9bbcf0.d202609142.1.2-0.2.2rc2.post1_g52949b6.d20260914(均对应 hygon-dtk26.04,分别对应 vllm-plugin-FL 的两条版本线),随后把 upstream_prs 字段重新定义为待合入 PR 跟踪列表(#882),最后记录在上述 rc2.post1 标签上完成的海光复验(#883)。镜像 tag 与版本标签成对出现,是各后端能否进入 2.2 交付范围的直接凭据。

1.14 docs 与 release-info:文档线并入 CICD 改造,发布件站点同步(09-15)

日期:2026-09-15 来源docs #502 合并

docs 仓库在 09-15 09:12 至 09:28 有 4 条提交,全部是 new/flagcicd 分支与 main 的合并(#501、#502 及两次 merge),文档线被并入本轮 CICD 改造。release-info 仓库在窗口内有推送(09-14 12:42),但默认分支与分支 API 均未见窗口内新提交,按既有判定归为发布件站点/标签同步,无正文可核;其仓库说明为「仅用于发布 FlagOS 栈发布件信息的占位站点」。


二、新闻报道与生态

2.1 Open3D-PIMC 在中国算力大会开源发布:清微智能与智源联合开发,补齐 3D 算力芯片编译栈(09-14)

日期:2026-09-14 来源新华网《硬件为骨,开源为脉:Open3D-PIMC 补齐国产算力软件生态关键拼图》

在河北廊坊举行的 2026 中国算力大会上,全球首个面向 3D 算力芯片的编程模型与开源软件框架 Open3D-PIMC 正式开源发布,由北京清微智能科技与北京智源人工智能研究院联合开发,代码已上线开源社区,定位为国产 AI 软件栈众智 FlagOS 面向下一代 3D 算力芯片的主要解决方案之一。智源 AI 系统研究负责人门春雷给出的判断是:3D 芯片的关键技术正在突破、量产芯片即将陆续出现,若缺少配套编译器会造成「先进硬件、低效软件」的困境,而该项目的目标是通过产业力量汇聚形成 3D 芯片编译器的全球标准。报道同时引用 FlagOS 的整体口径:已适配 20 家芯片厂商的 30 多款 AI 芯片,覆盖 GPU、NPU、GPGPU、DSA、RISC-V AI、ARM 等架构;2026 年 8 月阿里巴巴发布 Qwen3.8-2.4T-A95B 当天,FlagOS 社区即在华为昇腾、沐曦、清微智能等 9 家芯片上完成适配验证。项目组称今年四季度将在全球科技顶会发布面向 3D 芯片算力的最新优化成果。

2.2 组件级检索第十一个连续平静窗口:核心命中集中在智源侧报道(09-14~09-15)

日期:2026-09-14 ~ 09-15 来源Google News 检索(FlagOS 及组件名)

以 FlagOS 及 FlagGems、FlagScale、FlagTree、FlagPerf、FlagAttention、FlagCX、KernelGen、FlagQuantum、FlagPrism、FlagBLAS、FlagOS-Robo 等组件名为关键词的中英文检索(含 when:7d 与 when:14d 窗口),在 24 小时内仅命中 1 条强相关中文报道(即 2.1 的 Open3D-PIMC),英文侧无命中;HN Algolia 对 FlagOS、FlagGems 等词的查询在窗口内亦无有效技术讨论。这是组件级新闻检索连续第十一个平静窗口,本窗口的技术信息面基本全部来自代码仓库。需要注意的是,主打词仍被金融行情稿淹没:以成员单位名检索出的数百条中文结果中,绝大多数为股价、解禁、打新浮盈与基金持仓类内容,已按标题语义整批剔除。

2.3 产业侧三场会议线:服贸会、外滩大会、中国算力大会的国产算力叙事(09-09~09-14)

日期:2026-09-09 ~ 09-14 来源观点网《摩尔线程 CFO 薛岩松:英伟达在华 AI 芯片份额跌至不足 8%》

窗口内国产算力的产业表达来自三场会议:北京服贸会(摩尔线程 CFO 薛岩松给出英伟达在中国 AI 芯片份额从 95% 跌至不足 8%、国产加速卡份额突破 60% 的口径,并披露配合国家级实验室用超 12000 卡集群完成 2360 亿参数科学大模型预训练、正攻关万亿参数,以及北大团队基于 S5000 集群的世界模型登顶斯坦福赛道榜单超 47 天);上海外滩大会(09-09 至 09-12,清微智能展示与蚂蚁集团调优后的大模型推理性能十倍跃升、与腾讯云的战略合作与 Token 工厂布局);廊坊中国算力大会(Open3D-PIMC 首发,以及成员单位在异构推理方向的多项发布)。三条会议线的共同叙事是「从可以用到好用」,与 FlagOS 侧 2.2 测试期的工作重心一致。


三、成员单位深挖

3.1 清微智能:Open3D-PIMC 与可重构算力 5000P 的双线叙事(09-14)

日期:2026-09-14 来源新浪财经(环球网)《当 AI 从对话走向生产 清微智能以可重构算力解码互联网算力新需求》

清微本窗口在 GitHub 侧暂无专属提交,动静集中在新闻侧,两条并进。其一即 2.1 的 Open3D-PIMC:该项目由清微与智源联合开发,清微软件副总裁李彬在中国算力大会主旨演讲中把公司八年路径概括为「以架构补工艺、以集成超制程、以系统聚算力、以开源创生态」,并给出在全国已部署及在建的可重构算力规模超 5000P 的口径。其二为外滩大会参展:2025 年下半年起与蚂蚁集团深度调优,大模型推理性能实现十倍跃升,2026 年与腾讯云等互联网客户达成战略合作并推进 Token 工厂布局。把两条并读,清微当前在 FlagOS 生态里的角色不是补算子,而是往「下一代芯片形态的软件定义者」方向占位——3D 芯片编译栈与可重构算力系统是同一叙事的上下游。

3.2 海光信息:从 17 个算子到 rc2.post1 镜像复验,本窗口工程量第一(09-14)

日期:2026-09-14 来源FlagGems-Experimental #568(Hygon conv_depthwise2d)

海光是本窗口工程量最大的成员单位,四条工作面同时推进:算子面(FlagGems-Experimental 17 个 Hygon 算子在 17:51 至 18:54 批量入库);推理面(FlagGems-vllm 加 moe_sum);框架面(TransformerEngine-FL 支持两种 multi-tensor scale 接口);构建与交付面(build-infra 记录两个 hygon-dtk26.04 的 rc2.post1 应用镜像 tag 并完成复验,见 1.13)。新闻侧,海光信息在 09-09 中国联通合作伙伴大会首发的「面向词元经营的双芯加速解决方案」(以 CPU 为智能调度中枢、DCU 为加速计算引擎,打通词元生产到复购扩容的业务闭环,并在算力、互连、安全、软件栈四个维度开放)在窗口内仍被产业媒体持续转述,是把算力售卖折算为词元经营的产品化表达。算子批量补齐 + 镜像复验 + 版本标签三者对齐,说明海光线已进入可交付状态。

3.3 摩尔线程:注意力后端、profiler 集成与服贸会份额口径(09-14)

日期:2026-09-14 来源FlagPrism #11(mthreads profiler/debugger)

摩尔线程在窗口内的技术动作分布在四个模块:FlagAttention 加 mthread 注意力后端(#61);FlagGems 与 FlagGems-Experimental 分别补摩尔线程特化算子(linear、cholesky_inverse、linalg_ldl_solve、ormqr);FlagGems-vllm 加 MTT S5000 的 persistent_topk 后端(#758);FlagPrism 加 profiler 与 debugger 支持(#11),并同步被集成进 FlagTree(#1106)。四者串起来看,摩尔线程这一轮补的是「可观测性」与「推理热度算子的平台特化」,而非单纯铺算子数量。产业侧即 2.3 中服贸会的份额口径与 12000 卡集群、S5000 世界模型等数据,是成员单位中对外表述最激进的一家。

3.4 沐曦:metax CI 与 vLLM 0.24.0,曦云 C700 进入流片前夜(09-14)

日期:2026-09-14 来源vllm-plugin-FL #488(metax CI 与 vLLM 0.24.0)

软件侧两条:FlagAttention 加 metax 注意力后端(#60);vllm-plugin-FL 开启 metax CI 并把 vLLM 抬到 0.24.0(#488),与 build-infra 记录的版本线同步;另有 Torch-FL 恢复 MUSA 的 FlagGems 路由并为无法执行的算子加回退(#275),这条补丁的价值在于承认了「路由对齐之后仍有算子缺口」的现实。硬件侧,多家媒体于 09-14 集中报道沐曦在半年度业绩说明会(09-07)上的表述:下一代旗舰 GPU 曦云 C700 核心设计与功能验证接近完成,下一步推进流片、软件适配、客户测试与量产导入,新增 FP4 等低精度支持,整体性能对标英伟达 H100,供应链在晶圆代工、封装与大容量显存环节均有国产化方案;前代 C600 已于 2026 年 5 月量产,配 144GB HBM3e、FP8 算力约 1000TFLOPS。机构预测 C700 于 2027 年下半年量产。

3.5 燧原科技:enflame 后端继续入库,IPO 后市值与客户结构叙事(09-14)

日期:2026-09-14 来源FlagGems #6200(enflame 同步)

技术侧两条:FlagAttention 加 enflame 注意力后端(#58);FlagGems 主线合入燧原分支的成批同步(#6200,enflame to flagos 20260911),把厂商分支改动归并回上游。产业侧则是 IPO 后的连续报道:09-14 有报道称其市值超 1800 亿元、上市首日股价大涨 179%、募资 9.12 亿美元、中一签盈利约 13 万元,公募打新浮盈约 35.59 亿元;同时亦有质疑性报道指出其营收增长 2.8 倍但亏损扩大、对单一客户腾讯的依赖度达 83%。对 FlagOS 而言值得记录的是:燧原在本窗口既是「新后端持续入库」的一方,也是成员单位中资本叙事与经营质疑同时最密集的一家。

3.6 天数智芯:iluvatar 后端命名统一,资本市场进入解禁前窗口(09-14)

日期:2026-09-14 来源FlagCX #583(iluvatar 构建键统一)

FlagOS 内的动作是把 FlagCX 的构建键从 iluvatar_corex 改名为 iluvatar(#583),属后端命名收敛,减少同一厂商在工具链里出现两种标识的情况。产业侧本窗口无重大技术发布,主要出现在港股与 A 股半导体板块的行情稿中(如 09-15 早盘半导体股上扬、相关标的涨超 3%),按惯例不作为技术动态收录,仅作记录。

3.7 昆仑芯与达摩院玄铁(外部生态方):XPU 标签与 PPU 双线接入(09-14/09-15)

日期:2026-09-14 ~ 09-15 来源FlagCX #592(T-Head PPU CI)

两家不在成员单位名单内的厂商在本窗口同时加深参与,且都从「交付工作流」往「通信与算子层」再进一步。昆仑芯线:FlagTree 修 XPU 设备查询与 cuda-graph capture 错误(#1168),并新增 0.7.0rc2+xpu3.6 标签(首个非 Triton 后缀的加速器 tag);算子面补 mvlgamma 后端特化(FlagGems-Experimental #605)。达摩院玄铁(T-Head)线:FlagCX 先加 PPU CI 工作流(#592)再补 PPU torch 插件支持并扩展工作流(#596,09-15 00:49),这是通信库层面首次接入 PPU;FlagGems-vllm 同日补 moe_sum 的 T-Head 变体(#772)。两家都沿用「先接 CI、再补算子、最后进清单」的路径,说明 FlagOS 的新芯片接入已经流程化。

3.8 智源(牵头方):RC2 治理纪律与 Open3D-PIMC 的规则定义权表述(09-14)

日期:2026-09-14 来源community 2.2 发布时间表

牵头方本窗口只有一次仓库动作,但它调度了整条发布链:09:35 的 RC2 清单提交之后,十分钟内 23 个组件集体打标。把清单、时间表与提交说明并读,能看出这套治理的几个明确约束——特性冻结(08-31)与发布(09-28)之间的测试期只收 bug 修复与验收测试,GA 以「FEP 的 Test Plan 在多芯片矩阵上验收通过」为毕业标准,版本迭代通过 .postN 递增而不改模块版本号。对外表述上,新华网报道把 Open3D-PIMC 的意义落在「规则的主动定义」上:谁先建立面向下一代硬件的编程模型与开源生态,谁就掌握定义技术路线的主动权。这与 FlagOS 一贯的「一次开发、多芯运行」定位是一致的。


四、总结与趋势观察

本窗口是 2.2 发布周期里信息密度最高的一天,可以从三个层面收束:

  • 发布侧:2.2 进入 RC2,全栈快照换代完成。 清单先行、脚本执行、十分钟内 23 个组件集体打标,把测试期内累积的修复固化为一组可批量拉取的锁定版本;距离 09-28 GA 还有 14 天,后续应重点关注 rc2.postN 的递增节奏与 Go/No-Go 结论。
  • 工程侧:验收缺口正在被逐条填掉,且带明显的厂商分工。 海光补齐 17 个算子并完成镜像复验,摩尔线程补 profiler 与推理热度算子,沐曦接通 vLLM 0.24.0 与 metax CI,燧原把厂商分支归并回主线,昆仑芯与达摩院玄铁沿「CI → 算子 → 清单」路径接入。判断 2.2 交付范围的直接凭据仍是 build-infra 中成对出现的镜像 tag 与版本标签。
  • 生态侧:从「适配芯片」走向「定义硬件形态」。 Open3D-PIMC 由清微与智源联合开源,把 FlagOS 的边界从多芯片软件栈推进到面向 3D 算力芯片的编程模型与编译栈,并明确要在四季度于全球科技顶会发布优化成果。这类动作的收益不在当期算子数量,而在下一代芯片的设计参考权。
  • 待观察项: 其一,FlagTree 首次出现 +xpu3.6 形态的加速器专属标签,是否会推广为各后端的标准交付形态;其二,Torch-FL 为无法执行的算子加回退路径,说明「路由已对齐但算子覆盖不全」仍是多芯片栈的常态约束,2.2 的验收矩阵能否覆盖这类缺口值得跟踪;其三,PPU(达摩院玄铁)与 XPU(昆仑芯)两家外部生态方的接入速度明显快于常规厂商,是否会转化为正式成员。

局限性说明:本报告的技术事实全部来自公开代码仓库与官方发布物料,其中发布节奏、清单结构与版本号以 community 仓库文件为准;产业侧信息来自媒体报道,含厂商在会议场合的单方口径(如芯片市场份额、算力部署规模、模型榜单成绩),未经独立核实,引用时已标注来源。组件级新闻检索已连续十一个窗口无有效命中,故技术面结论依赖代码证据而非媒体报道;成员单位相关的数百条检索结果中绝大多数为资本市场内容,已按语义剔除,可能遗漏少量被行情稿淹没的技术新闻。


完整信源清单