FlagOS 每日动态报告(2026-09-10)
调研窗口:2026-09-09 10:18 ~ 2026-09-10 10:18 北京时间 信源:GitHub(org: flagos-ai 52 仓 pushed_at + commit search 135 条按 committer-date 全量核验 + 默认分支 per-repo 复核 + 分支 API + commit 详情)、Google News RSS(中英 20 组查询词,走代理)、HN Algolia、Tavily/web 检索、FlagOS CSDN 官方号(详见附录)
索引
- 一、开源项目进展(GitHub 动态)
- 1.1 build-infra:昇腾 910C base/runtime 后端双线新增,60 个 app 镜像 changelog 基线落地(09-09/09-10)
- 1.2 FlagGems 主仓:KernelGen 算子流维持高流速,KMCompiler 多后端再扩(09-09/09-10)
- 1.3 FlagGems-Experimental:海光专用 flash attention 算子入库,Iluvatar/MThreads 双线批量(09-09/09-10)
- 1.4 推理插件层:达摩院玄铁 PPU fused persistent_topk、Arm CPU Qwen W4A8/GDN、sglang 算子配置(09-09)
- 1.5 领域库与工具链:FlagBLAS Ascend L3 三连合入、FlagTree TLE 多卡通信、FlagCX CICD 全覆盖(09-09)
- 1.6 其他组件:libtriton_jit 类型化设备指针、FlagScale 文档、FlagOS-Robo 支持矩阵新增 KERV(09-09)
- 二、新闻报道与生态
- 2.1 北京市”十五五”数字经济规划点名众智(FlagOS)与灵玑(LinkeeOS),强化 RISC-V 智算指令集(09-09)
- 2.2 组件级新闻第八个连续平静窗口;智源社区常规内容更新(09-09)
- 三、成员单位深挖
- 3.1 摩尔线程:京东云宣布以其 GPU 为底座建设十万卡集群(09-09)
- 3.2 燧原:9 月 11 日科创板上市,发行价 142.18 元/股(09-09)
- 3.3 海光:Token 经营”双芯”加速方案,CPU+DCU 贯通词元闭环(09-09)
- 3.4 沐曦与摩尔线程:限售解禁与二级市场波动(09-09)
- 四、总结
- 附录:完整信源清单
一、开源项目进展(GitHub 动态)
窗口总览:org 内 52 个仓库中 18 个在窗口内有推送;commit search 命中 135 条窗口内提交(5 页),分布于 14 仓(FlagGems-Experimental 60、FlagGems 39、build-infra 9、FlagBLAS 8、FlagTree 4、FlagCX 2、FlagGems-sglang 2、vllm-plugin-FL 2、FlagSparse 2、FlagOS-Robo 2、FlagAttention 2、libtriton_jit 1、FlagScale 1、FlagGems-vllm 1);另有 4 仓(sglang-plugin-FL、docs、FlagTree-AscendNPU-IR、release-info)窗口内推送经默认分支与分支 API 复核为 PR 分支动作。无新仓库、无新组件 release。
本窗口形态 = RC1 测试稳定期的”工程基建 + 算子矩阵”双线:交付侧最大动作落在 build-infra(昇腾 910C 新后端 + 60 个 app 镜像 changelog 基线与门控),代码侧延续算子自动生成流水线的高流速(主仓 39 条 + 实验仓 60 条),领域库与工具链则出现 FlagBLAS Ascend L3 三连、FlagTree TLE 多卡通信等实质能力扩展。
1.1 build-infra:昇腾 910C base/runtime 后端双线新增,60 个 app 镜像 changelog 基线落地(09-09/09-10)
来源:build-infra #803(09-09 20:27)、#801(09-09 13:42)、#802(09-09 20:22)、#807(09-10 09:38)、#799/#800(09-09 10:42/10:43)、#804、#805、#806
- 昇腾 910C 后端新增(#803):新增
ascend-cann8.5.0-910c/ascend-cann9.0.0-910c双后端,使同一 CANN 线可构建到昇腾 910C 芯片。910C 的芯片专用 ops 包使用 A3 token(Ascend-cann-A3-ops),两个 base Containerfile 与 910B 兄弟版字节级一致,仅 PRODUCT ARG 默认值(910b→A3)与文件头不同。本窗口首次把昇腾芯片矩阵从 910B 扩到 910C。 - 范围刻意收口:新增 configs.yaml 块有意省略
deps_app与env.app.*,使 910C 后端暂不进入 app 构建矩阵(deps_app 存在与否即 app 纳入的门控),待 app 制品产出并验证后再放开——沿用”先立 base/runtime、后进 app”的稳妥接入顺序。 - 顺带修复厂商解析:三个 verify 脚本的厂商切分由末位连字符(
${VAR%-*})改为首位连字符(${VAR%%-*}),与 generate_matrix.py / verify_base.py 对齐;旧逻辑在ascend-cann9.0.0-910c这类双连字符键下会解析出不在 run.vendors 里的厂商名,导致 run flags 为空。配套 #804(910B runner overrides 强制 910b label)、#806(910C base 构建走 runner proxy build-args)。 - 60 个 app 镜像 changelog 基线(#801):在
app/<app>/changelogs/下为 flagos-app 已发布的全部 60 个 app 镜像建立 YAML 基线,逐镜像记录当前 registry 驻留 tag 及其构建历史(新→旧),每条含重建原因、push_time 日期与所纳入的上游 PR;registry 已不再承载的旧 tag 折入后继条目的 history(成为其唯一痕迹)。配套 #802(用 registry push_time 回填日期)、#807(push 时强制 changelog 门控)。交付可追溯性从”镜像 tag 记录”升级为”逐镜像变更史”。 - 摩尔线程 Megatron 应用镜像双线登记(#799/#800):为 mthreads-musa4.3.6 与 mthreads-musa5.2.0 两条线记录 app image tag
2.1.2-0.3.0_rc0.post1_3.g6e8d7ffc7。另 #805 把外部 GitHub Actions 固定到完整 commit SHA(供应链加固)。
解读:昇腾 910C 的接入方式值得注意——它没有新开一条技术路线,而是把 910C 当成”910B 线的芯片同构变体”处理:Containerfile 字节级复用、只换 ops 包 token,且用 deps_app 缺位把新芯片拦在 app 矩阵之外。这是 RC 测试期”可进新适配、不进新特性”纪律在多芯片工程上的具体投影:新硬件只立骨架,不扰动既有交付面。60 个 app 镜像 changelog 基线 + push 门控的组合,则把 build-infra 从”记录发生了什么”推进到”强制解释为什么”,是 2.2 GA 前审计面收紧的信号。
1.2 FlagGems 主仓:KernelGen 算子流维持高流速,KMCompiler 多后端再扩(09-09/09-10)
来源:FlagGems #5957(QC/PPU W8A16 RMSNorm,09-09 10:29)、#5871(GLU TLE 自动调优,09-09 10:43)、#6094(KMCompiler Iluvatar gru,09-09 12:15)、#5960(KMCompiler Ascend/Metax linalg_matrix_power,09-09 12:16)、#6119(CI/CD rule-check-required,09-09 15:41)、#6090(移除 metax-maca3720)
- 主仓单窗口 39 条窗口内提交,为近期最密集的一窗。数量主体是 [KernelGen][Nvidia] 系列算子入库(约 25 条),覆盖 hardtanh(移入 ops)、cummax_helper、_nested_from_padded_tensor、_nested_tensor_from_mask_left_aligned、_nested_view_from_jagged、conv_tbc_backward、conv_transpose3d、matrix_exp_backward、max_pool1d、sum_to_size、embedding_renorm、cosine_embedding_loss、cov、corrcoef、cumulative_trapezoid、fft_irfftn、special_xlogy、_sparse_semi_structured_addmm、fake_quantize 系列与 nuclear_norm;09-10 09:03~09:52 仍在连续落库(corrcoef/cov/cumulative_trapezoid 三条同分钟合入)。
- KMCompiler 生成路径继续扩厂商:Iluvatar
gru(Triton kernel,#6094)、Ascend + Metax 同批linalg_matrix_power(#5960)。上一窗口才记录linalg_matrix_exp一次产出七后端,本窗口 linalg 矩阵函数族继续按”一次开发、多后端落地”的方式补齐。 - 量化算子再向达摩院玄铁 PPU 延伸:QC PPU
W8A16 RMSNorm(#5957);性能侧 GLU kernel 改用 TLE 自动调优(#5871)。 - 工程面 5 条:CI 改用 three-dot diff 推导 PR 变更文件(#6097);新增 rule-check-required job 与 CICD 文档(#6119);unittest workflow 加并发控制并在 09-10 修两次表达式语法(#6137 等);移除 metax-maca3720 的 CI 条目(#6090,厂商 CI 线调整);
[Fix]让 MM 测试与 benchmark 尊重 FlagTune 环境设置(#6129)、修复 all/any 除零、nextafter NaN 传播与两条 benchmark 结构化 JSON 输出。
解读:KernelGen 的产出流速从上窗口的 12 条/半天回升到本窗口约 25 条/半天,说明”AI 自动生成算子”已是常态化管道而非批次事件——这与 1.3 实验仓 60 条的合入量相互印证。本窗口的操作面分布也说明了当前的工程重心:在 2.2 冻结期里,新增能力全部走”生成器补算子 + 厂商后端专用化”,手写架构级改动为零;CI 侧反而加大了约束(three-dot diff、rule-check-required、并发控制),是 GA 前把交付纪律收紧的典型动作。
1.3 FlagGems-Experimental:海光专用 flash attention 算子入库,Iluvatar/MThreads 双线批量(09-09/09-10)
来源:FlagGems-Experimental #597(Hygon _flash_attention_forward,09-10 08:44)、#598(Hygon adaptive_avg_pool2d_backward,09-09 17:28)、#604(MThreads var,09-10 09:11)
- 实验仓单窗口 60 条窗口内提交,按后端计:Iluvatar 约 36 条(special 函数族、池化反向、linalg_svdvals、histc、median、mvlgamma、matmuladd 等)、MThreads 约 16 条、Ascend 3 条(special_erfinv、unsafe_masked_index、zero)、Hygon 2 条。
- 海光专用 flash attention 入库(#597):为 Hygon DCU 后端新增
_flash_attention_forward专用实现,文件落入src/flag_gems/runtime/backend/_hygon/ops/,由 BAAI 侧开发者提交。此前该后端在实验仓只有_amp_foreach_non_finite_check_and_unscale_等轻量算子,专用注意力算子是首次。 - 另一条 Hygon 算子为
adaptive_avg_pool2d_backward(#598)。两条均在同日/次日进入默认分支。 - 工程面:实验仓同步加 unittest workflow 并发设置(09-09 13:39、19:54 两次修订)。
解读:海光两条的落点比算子数量更有信息量——_flash_attention_forward 是注意力路径上的核心算子,09-08 主仓刚修过 Hygon 后端 flash attention 的 BLOCK_M 取块缺陷,本窗口专用实现即入库,构成”先修通用路径、再上专用实现”的接力。Iluvatar(天数智芯)单窗口 36 条继续是实验仓最大产能来源,与主仓 KMCompiler 的 Iluvatar gru 形成”实验仓批量验证 → 主仓 KMCompiler 生成/发布”的分工闭环。
1.4 推理插件层:达摩院玄铁 PPU fused persistent_topk、Arm CPU Qwen W4A8/GDN、sglang 算子配置(09-09)
来源:FlagGems-vllm #754(09-09 19:58)、vllm-plugin-FL #433(09-09 15:35)、#474(09-09 17:40)、FlagGems-sglang #60(09-09 18:56)
- 达摩院玄铁 PPU fused persistent_topk(FlagGems-vllm #754):在
runtime/backend/_thead/fused/下新增并注册persistent_topk.py(2394 行),面向 T-Head PPU-ZW810E;由 KMCompiler 生成。上一窗口(09-08)该算子的测试/benchmark 刚改为脱离 vLLM native op 可自测(#747),本窗口即为正式实现与注册落地。 - Arm CPU 侧 Qwen 量化推理(vllm-plugin-FL #433):在 CPU 上集成 Qwen 的 packed W4A8 与 GDN(Gated Delta Net)路径,是插件层向 Arm CPU 推理场景的扩展。
- KV 缓存一致性修复(#474):恢复来自 #382 的 FlagGems KV cache 更新(attention 路径回归修复)。
- sglang 插件算子配置(FlagGems-sglang #60):新增 operators 配置文件,使 sglang 插件侧算子启用集合可配置化。
解读:四条指向同一件事——插件层正在为”多框架 × 多芯片 × 多部署形态”补齐配置面与专用算子。玄铁 PPU 的 persistent_topk 完成了从”可自测”到”已注册”的两步走;Arm CPU 的 W4A8/GDN 则把插件层的作用域从加速卡延伸到 CPU 推理栈;sglang 算子配置化降低了按芯片裁剪算子集合的成本。三条合起来说明推理插件层已进入”逐 kernel 厂商化 + 配置面治理”的成熟期工程。
1.5 领域库与工具链:FlagBLAS Ascend L3 三连合入、FlagTree TLE 多卡通信、FlagCX CICD 全覆盖(09-09)
来源:FlagBLAS #102/#104/#105(09-09 11:22/14:35/15:03)、FlagTree #1048(09-09 16:56)、#1123、#1099(09-09 22:25)、FlagCX #573/#575(09-10 01:28/09:35)
- FlagBLAS Ascend L3 三连:同日依次合入 TBMV(#102)→ TBSV(#104)→ TPSV(#105) 三个特征值/三角矩阵运算的昇腾支持,并清理冗余算子导出清单(#103)。承接 09-07 的 Ascend L2 例程批量合入,本窗口把 BLAS 例程矩阵继续向 L3 推。
- FlagTree 四条:TLE 分布式原语
distributed_barrier新增多 GPU 通信支持(#1048);CI 新增 hcu qwen benchmark(#1123);XPU 侧把xpu-sdnn-objects升到 v0.3.6.6.1 修 int8 dot 失败(#1099);[FlagTune]在 CUDA graph 基准中保持 caller-stream 调用序(#1129)。 - FlagCX CICD 两条:把 CICD 覆盖面扩到全部 cooperative modes 与全部 team/operation 组合(#573/#575),即对通信库的合作模式组合做穷举式测试覆盖。
解读:三条线性质不同但方向一致——测试期把”覆盖度”当作主要抓手。FlagBLAS 用 L3 例程补齐昇腾的 BLAS 能力面,FlagCX 用组合穷举把 CICD 覆盖面推到边界(多卡通信正确性在 2.2 多芯片矩阵测试窗口是关键风险项),FlagTree 则是把 TLE 的多卡原语从”可用”推到”多卡通信可用”。hcu qwen benchmark 进入 CI 说明昇腾(hcu)侧的端到端模型基准已纳入例行验证。
1.6 其他组件:libtriton_jit 类型化设备指针、FlagScale 文档、FlagOS-Robo 支持矩阵新增 KERV(09-09)
来源:libtriton_jit #65(09-09 10:56)、FlagScale #1290(09-09 10:49)、FlagOS-Robo #12(09-09 14:21)、FlagSparse #55(09-09 17:35)、FlagAttention #41/#52(09-09 10:44/10:48)
- libtriton_jit #65:合并类型化设备指针(typed device ptr)特性分支,为 Triton JIT 层的指针类型处理补强。
- FlagScale #1290:仅一条文档提交(标注 qwen3.5 训练指南对应的主提交),训练栈本窗口无代码合入。
- FlagOS-Robo #12:README 支持矩阵新增 KERV(VLA,OpenVLA-7B) 条目,支持训练与推理(serve/evaluate 暂无),并随 PR 一并回应 KERV 支持矩阵 review 意见。09-07 FlagScale 已合入 KERV 具身投机解码集成,本窗口是把该能力正式写进 FlagOS-Robo 的支持矩阵。
- FlagSparse #55:
merge_with_spsv(稀疏矩阵向量乘融合)合入。FlagAttention 两条 PR(#41/#52)合入。FlagGems-sglang 见 1.4。
解读:FlagOS-Robo 的 KERV 条目是”能力落地 → 矩阵登记”的最后一步,说明具身智能工具链的模型覆盖面在按季度扩张(PI0/PI0.5/RoboBrain-2.0/2.5/RoboBrain-X0/Qwen-GR00T/GR00T-N1.5/KERV 已构成 8 类模型矩阵)。FlagScale 与 FlagAttention 本窗口仅文档/合并动作,属于 RC 测试期的低代码活动,与 1.2 主仓的高算子流速形成互补:训练栈收口、算子库扩张。
二、新闻报道与生态
2.1 北京市”十五五”数字经济规划点名众智(FlagOS)与灵玑(LinkeeOS),强化 RISC-V 智算指令集(09-09)
来源:证券时报:盘后,利好来了!北京,重磅发文(09-09 18:51)、东方财富:北京印发重磅发展规划(09-09)、财联社:北京市”十五五”时期高精尖产业发展规划(09-09)、新浪科技看点转载(09-09 16:05)
- 9 月 9 日盘后,北京市人民政府同日印发《北京市”十五五”时期高精尖产业发展规划》与《北京市”十五五”时期数字经济发展规划》。数字经济规划在”提升自主可控发展水平”条目中明确:“推进智算基础设施全栈自主创新,强化 RISC-V 智算指令集创新,深化众智(FlagOS)开源生态建设,布局灵玑(LinkeeOS)智能体操作系统。”
- 同一段落还提出”加快国产先进算力迭代验证平台建设,提升十万卡算力集群建设能力,依托全国一体化算力网络京津冀国家枢纽节点加速国产技术验证”,并要求”推动信创软硬件与人工智能深度融合”。
- 高精尖产业规划侧对应的表述是”提升人工智能系统软件栈能力,加快布局国产算力新架构”“培育具有国际影响力的开源项目和开源社区,建设全球开发者协同创新枢纽”——即系统软件栈与开源社区被写入市级产业规划的目标体系。
- 灵玑(LinkeeOS)此前由北京市经济和信息化局指导、北京通明湖信息技术应用创新中心联合产业伙伴发起(2026-05 发布先期核心成果),本次是其在市级五年规划文件中与 FlagOS 并列出现。
解读:这是 FlagOS 首次进入北京市五年规划级别的政策文本,且被与 RISC-V 智算指令集创新、十万卡集群建设能力、智能体操作系统并列在同一政策句内——意味着 FlagOS 的角色从”智源牵头的开源项目”上升为北京市自主可控算力基础设施的指定系统软件栈载体。对社区的直接含义有三:其一,2.2 GA(09-24 测试窗口截止)之后的路线图大概率要与”国产先进算力迭代验证平台”的建设节奏对齐;其二,”强化 RISC-V 智算指令集创新”与达摩院玄铁 PPU、进迭时空等 RISC-V 方向的算子后端(本期 1.4 玄铁 fused persistent_topk)方向一致,RISC-V 后端在 FlagOS 内的权重可能上升;其三,灵玑(LinkeeOS)与 FlagOS 并列,提示”系统软件栈 + 智能体操作系统”的分层定位已被政策确认。
2.2 组件级新闻第八个连续平静窗口;智源社区常规内容更新(09-09)
来源:Google News RSS(走代理)、HN Algolia、FlagOS CSDN 官方号(flagos.csdn.net)、智源社区(hub.baai.ac.cn)
- gnews 组件词(FlagOS/FlagGems/FlagScale/FlagTree/FlagPerf/FlagAttention/FlagCX/KernelGen/FlagOS-Robo/FlagQuantum,when:1d~14d 中英)在窗口内零命中——组件级新闻自 09-03 以来第八个连续平静窗口。唯一命中 FlagOS 字面的检索结果为上述北京市规划的转载稿(见 2.1),已单列。
- HN Algolia:FlagOS/FlagGems/FlagScale/FlagTree 四条查询在窗口内命中均为 “flags/flagship” 子串误匹配的无关 Show HN 条目(Mario 64 模拟、Agent Router、Locksmith 等),整批剔除。
- 智源研究院词查询窗口内 23 条命中,均为智源社区常规内容(AI+制药 CPHI 论坛议程、CV 论文导读、AI 纠纷裁判标尺、AI Native 研发组织、OpenAI 下一代模型传闻等),与 FlagOS 技术栈无直接关联,不作技术条目收录。
- FlagOS CSDN 官方号无新文章:最新内容仍为 08-28 的 GLM-5.3-Flash Day0 适配 9 款芯片;09-07 上海 KubeCon”开放 AI 计算”论坛与 09-03”算子岛”SGLang 算子赛事回放持续挂载,KernelGen 算子调优主题介绍页无发布时点更新,无新增活动公告。
近 3 天趋势(工程侧,供对照):09-07 FlagOS 2.2 RC1 manifest 切线 + 12 仓首轮 rc1.post1 tag 波;09-07 FlagScale KERV 具身投机解码集成与 Megatron-LM v0.18.2 双仓对齐;09-08/09-09 build-infra 连续交付记录(海光 dtk26.04 双框架闭环、清微主线镜像、provenance 标签自动化);09-09/09-10 本窗口 build-infra 昇腾 910C 后端与 60 镜像 changelog 基线。
三、成员单位深挖
3.1 摩尔线程:京东云宣布以其 GPU 为底座建设十万卡集群(09-09)
来源:新浪财经转新京报:京东云与摩尔线程达成合作,拟建十万卡国产智算集群(09-09 14:03)、新华财经/中国证券报(09-09 14:28)、网易转南都(09-09)
- 9 月 9 日在 2026 京东全球科技探索者大会上,京东云宣布拟建设十万卡全功能 GPU 集群,以摩尔线程全功能 GPU 为算力底座,聚焦大模型训练、推理及具身智能等关键领域,向全行业开放算力。
- 双方定位为”芯片 — 云平台 — 模型训练”全栈协同,推动京东 JoyAI 全系大模型迭代,构建”数据→训练→仿真→部署”闭环。京东集团技术委员会主席、京东云总裁曹鹏与摩尔线程创始人张建中分别表态;摩尔线程方面称这标志着国产 GPU 首次进入头部 AI 云厂商十万卡级核心智算集群。
- 背景参照:摩尔线程今年 3 月曾披露一笔标的为”夸娥”智算集群的 6.6 亿元重大合同;同期智谱披露已落地 1GW 级国产算力数据中心,MiniMax 透露在推进 M3/H3 的国产芯片适配。
解读:这条是成员单位在”国产算力规模化商用”上的里程碑级事件,且与 FlagOS 的软件栈定位直接相关——十万卡级集群要落地,跨芯片训练/推理的系统软件栈是必需项,而 FlagOS 的成员单位矩阵(摩尔线程为早期成员)与京东云”向全行业开放算力”的定位存在明确的结合面。另需注意集群明确把具身智能列入关键领域,与 FlagOS-Robo 的定位(本期 1.6 支持矩阵新增 KERV)同向。
3.2 燧原:9 月 11 日科创板上市,发行价 142.18 元/股(09-09)
来源:观点网/新浪财经:燧原科技股票 9 月 11 日登陆科创板(09-09 19:34)、金融界:发行价格 142.18 元/股(09-09)、猎云网转搜狐(09-09)
- 9 月 9 日晚间燧原科技公告:股票将于 2026 年 9 月 11 日在上海证券交易所科创板上市,股票代码 688801,发行价 142.18 元/股,发行数量 4303.5173 万股(占发行后总股本 10%)。
- 公司预计 2026 年 1-9 月营业收入 23 亿至 30 亿元,同比增长 325.78% 至 455.36%;发行价对应 2025 年摊薄后静态市销率 61.80 倍。截至公告日尚未盈利,上市后纳入科创成长层。
- 本次 IPO 拟融资 60 亿元,用于第五代与第六代 AI 芯片系列产品的研发及产业化。上市后”国产 GPU 四小龙”(摩尔线程、沐曦、壁仞、燧原)齐聚资本市场。
- 与 FlagOS 的关联侧记录:燧原在 09-09 报告窗口首次进入 FlagScale 训练 CICD(ZIXIAOC200 芯片镜像契约),此前其记录集中在 build-infra 的 sglang 0.5.18 交付线。
解读:燧原上市本身属资本市场事件,但对 FlagOS 生态有实际含义——成员单位在拿到 60 亿级募资后,软件栈侧的投入(FlagTree 后端、vllm/sglang 插件、build-infra 交付线)通常随之加码。结合其训练侧 CICD 刚于上一窗口补上的事实,燧原在 2.2 及后续版本的芯片矩阵参与度值得跟踪。
3.3 海光:Token 经营”双芯”加速方案,CPU+DCU 贯通词元闭环(09-09)
来源:新浪财经:海光重磅发布 Token 经营”双芯”加速解决方案(09-09)、网易:海光首发 AI 算力创新架构(08-27 发布,词元经济主题)
- 海光信息发布面向 Token 经营的”双芯”加速解决方案:以海光 CPU 为智能调度中枢、DCU 为加速算力引擎,双芯协同打通 Token”生产 — 调度 — 计量 — 成本核算 — 应用变现 — 复购扩容”业务闭环,主要适配运营场景。
- 该方案是其 8 月底在数博会首发的”Agent to Token 开放计算架构“的落地形态:CPU 承担 Agent 业务流枢纽(数据预处理、多智能体沙箱隔离、任务编排、记忆体分级存储、向量库检索五大模块),DCU 承担词元生成侧并行加速(批量解码、KV 缓存优化、长序列支撑);架构在算力、互连(自研 HSL)、安全、软件栈四个维度开放,软件栈侧称已适配百余种主流 AI 框架。
- 与 FlagOS 的关联侧记录:海光 dtk26.04 是上一窗口 build-infra 记录量最大的厂商线(sglang 0.5.18 + vllm 0.20.2 双框架闭环);本窗口 build-infra 的 changelog 基线与 FlagGems-Experimental 的 Hygon 专用 flash attention 算子(1.3)同属其生态推进。
解读:海光的方案把”Token 经济”作为算力产品的叙事框架,与北京市”十五五”规划中”构建词元结算体系、打造词元工厂”的政策表述(本期 2.1)高度呼应——即成员单位的产品叙事与地方政策方向已在同一话术层面对齐。对 FlagOS 而言,海光 DCU 后端在本期同时出现了”专用 flash attention 算子入库”与”Token 闭环方案发布”两条,软件栈侧的算子补齐与其商业叙事是配套推进的。
3.4 沐曦与摩尔线程:限售解禁与二级市场波动(09-09)
来源:东方财富:沐曦股份 1396.60 万股限售股 9 月 17 日解禁(09-09)、新浪财经:摩尔线程股价再创历史新低(09-09)
- 沐曦股份公告:约 1396.60 万股限售股(占总股本 3.4906%)将于 9 月 17 日起上市流通,为前期解禁窗口的延续。
- 摩尔线程 9 月 9 日股价触及上市以来新低,单日市值蒸发约 488 亿元,多家媒体报道与其解禁窗口相关;同期沐曦股价创五个半月新低。
- 板块层面:9 月 9 日科创综指、科创人工智能、科创芯片等 ETF 重仓股普遍走低,寒武纪、海光信息、沐曦股份等均出现在下跌成分中。
解读:本条与 FlagOS 软件生态无直接技术关联,按既有口径仅作背景记录,不纳入技术条目。值得留意的只是节奏:摩尔线程在宣布十万卡大单的同一日股价创上市新低,说明资本市场对国产 GPU 的定价逻辑与产业订单落地之间存在明显时滞;对社区而言,这类波动不影响 build-infra 交付线与 FlagGems 厂商后端的推进节奏(本期摩尔线程侧仍维持 MThreads 后端 16 条算子与两条 Megatron 应用镜像登记)。
四、总结
本窗口(09-09 10:18 ~ 09-10 10:18)GitHub 侧 135 条窗口内提交、18 仓推送,工程侧维持高位活跃;新闻侧组件级检索第八个连续平静窗口,但政策侧出现一条重量级条目。四条主线:
- 政策层面 FlagOS 进入北京市五年规划文本(本期最重要变化):北京市”十五五”数字经济规划明确”强化 RISC-V 智算指令集创新,深化众智(FlagOS)开源生态建设,布局灵玑(LinkeeOS)智能体操作系统”,把 FlagOS 与十万卡集群建设能力、信创软硬件融合写在同一政策句内。这是 FlagOS 首次出现在北京市五年规划级文件中,其角色从”智源牵头的开源项目”上升为市级自主可控算力基础设施的系统软件栈载体。
- build-infra 完成昇腾 910C 后端接入,并落地 60 个 app 镜像的 changelog 基线:910C 以”910B 线芯片同构变体”方式接入(Containerfile 字节级复用、仅换 A3 ops token),且用
deps_app缺位刻意拦在 app 构建矩阵之外;60 镜像 changelog + push 门控把交付记录升级为”逐镜像变更史 + 强制原因说明”。交付侧的审计面与芯片矩阵同窗口扩张。 - 算子矩阵维持高流速,厂商专用化继续右移:主仓 39 条(KernelGen Nvidia 约 25 条、KMCompiler Iluvatar/Ascend/Metax、QC 玄铁 PPU 量化算子、GLU TLE 自动调优),实验仓 60 条(Iluvatar 约 36、MThreads 约 16、Ascend 3、Hygon 2);海光专用
_flash_attention_forward入库、达摩院玄铁 PPU fused persistent_topk(2394 行)正式注册,是两个代表性节点。CI 侧同步收紧(three-dot diff、rule-check-required、并发控制)。 - 成员单位商业化与生态两条线同时推进:京东云宣布以摩尔线程 GPU 为底座建设十万卡全功能 GPU 集群(国产 GPU 首入头部云厂核心集群,且明确涵盖具身智能);燧原 9 月 11 日科创板上市(拟融资 60 亿元投向五代/六代芯片);海光发布 Token 经营”双芯”加速方案,与北京”词元工厂”政策表述同频。软件侧与商业侧的推进节奏在本窗口明显合拍。
预判:后续观察面三点——其一,昇腾 910C 何时补 deps_app 进入 app 构建矩阵(该动作将标志 910C 交付可用);其二,2.2 GA(09-24 测试窗口截止)前后的 release-info/community 清单动作,以及 FlagGems v5.4.0 rc 系列是否推进到正式版(当前最新 tag 仍为 v5.4.0-rc1.post1);其三,北京市规划落地后的社区侧配套动作(”国产先进算力迭代验证平台”与 FlagOS 验证矩阵的衔接方式、RISC-V 后端权重是否上升)。
附录:完整信源清单
| 信源 | 核查结果 |
|---|---|
| GitHub org repos API(flagos-ai,52 仓) | 18 仓窗口内推送:FlagGems、build-infra、FlagCX、FlagGems-Experimental、FlagTree、FlagGems-vllm、FlagGems-sglang、FlagSparse、vllm-plugin-FL、FlagBLAS、FlagOS-Robo、libtriton_jit、FlagScale、FlagAttention、sglang-plugin-FL、docs、FlagTree-AscendNPU-IR、release-info;无新仓库 |
| GitHub commit search(org 全量 135 条,5 页,sort=committer-date) | 14 仓默认分支实质合入,逐条核验 committer 时间与仓库归属:FlagGems-Experimental 60 / FlagGems 39 / build-infra 9 / FlagBLAS 8 / FlagTree 4 / FlagCX 2 / FlagGems-sglang 2 / vllm-plugin-FL 2 / FlagSparse 2 / FlagOS-Robo 2 / FlagAttention 2 / libtriton_jit 1 / FlagScale 1 / FlagGems-vllm 1 |
| GitHub 分支 API + per-repo commits 复核 | sglang-plugin-FL(pushed 09-10 10:16 北京时间)、docs、FlagTree-AscendNPU-IR、release-info 四仓窗口内推送,默认分支无窗口内提交、分支列表亦无窗口内提交,判定为 PR 分支引用动作 |
| GitHub commit 详情 | build-infra #803(910C 双后端,7 文件)、#801(60 个 changelog,60 文件)、#799/#800(mthreads Megatron app image tag);FlagGems-vllm #754(thead fused persistent_topk,2394 行);FlagGems-Experimental #597/#598(Hygon 算子) |
| GitHub tags/releases API | 本窗口无新组件 release。最新 tag:FlagGems v5.4.0-rc1.post1、build-infra v2.1.1、FlagCX v0.14.0-rc1.post1、FlagTree v0.4.0、FlagGems-vllm v0.2.0-rc1.post1、vllm-plugin-FL v0.3.0-rc1.post1、FlagBLAS v0.3.0-rc1.post1、FlagOS-Robo v0.1.0 |
| Google News RSS(中英 20 组查询词,走代理) | 组件词窗口内零命中(第八个连续平静窗口);”FlagOS when:1d”命中北京市规划转载稿 1 条(已作政策条目收录);成员单位词命中为上市/解禁/股价/资金流等资本市场新闻,按既有口径不纳入技术条目 |
| HN Algolia(FlagOS/FlagGems/FlagScale/FlagTree/BAAI) | 四条组件词命中均为 “flags/flagship” 子串误匹配的无关 Show HN 条目,整批剔除 |
| Tavily/web 检索 | 北京市”十五五”数字经济规划原文表述核验(证券时报/东方财富/财联社/新浪三源互证);京东云十万卡集群(新京报/新华财经/南都三源);燧原上市公告(观点网/金融界/猎云网三源);海光 Token 经营方案(新浪财经) |
| FlagOS CSDN 官方号(flagos.csdn.net) | 无新文章,最新仍为 08-28 GLM-5.3-Flash Day0 适配 9 款芯片;09-07 KubeCon 论坛与 09-03 算子赛事回放持续挂载,KernelGen 算子调优主题页无发布时点更新 |
| 智源社区(hub.baai.ac.cn) | 窗口内 23 条命中均为常规内容(AI+制药、CV 论文导读、AI 纠纷裁判、AI Native 研发组织等),与 FlagOS 技术栈无直接关联 |