调研窗口:2026-08-28 10:18 ~ 2026-08-29 10:18 北京时间 信源:GitHub(org: flagos-ai 52 仓 + commit search + PR/Issue API)、Google News RSS(中英文多组查询,代理链路正常)、HN Algolia、Tavily/web 交叉验证(详见附录)


索引

  • 一、开源项目进展(GitHub 动态)
    • 1.1 头条:verl-FL 海光 DCU E2E 打通,六补丁拆分上游 PR 链(08-28/08-29)
    • 1.2 build-infra:新增天数智芯 CoreX 4.5.0 后端、2.1.2 镜像栈描述自动刷新(08-28)
    • 1.3 FlagGems:单日合入 18 个 PR,KernelGen 算子批量扩充(08-28)
    • 1.4 FlagTree:燧原 Enflame 后端更新,新增 TARGET_PROFILE 构建开关(08-28)
    • 1.5 vllm-plugin-FL:batch MTP xGrammar masks 合入、昇腾 ModelSlim W8A8 分支关闭(08-28)
    • 1.6 flagtree-cpu:AArch64 SVE2/NEON I8MM 量化内核 PR 提出(08-28)
    • 1.7 docs:模型列表同步 PR 排队(08-28/08-29)
  • 二、新闻报道与生态
    • 2.1 平静日说明:组件级查询连续第二日零命中
    • 2.2 生态侧观察与排除项
  • 三、成员单位深挖
    • 3.1 海光:verl-FL hygon25 E2E 验证链落地(08-28/08-29)
    • 3.2 天数智芯:CoreX 4.5.0 后端接入(08-28)
    • 3.3 燧原:FlagTree gcu300/gcu400 后端更新(08-28)
    • 3.4 沐曦:MetaX AddMM 布局优化(08-28)
    • 3.5 摩尔线程:verl-FL MUSA 平台兼容 PR 推进(08-24 更新/窗口内观察)
    • 3.6 昇腾:ModelSlim W8A8 特性分支调整(08-28)
  • 四、总结
  • 附录:完整信源清单

一、开源项目进展(GitHub 动态)

窗口总览:org 内 52 个仓库中 8 个在窗口内有推送(build-infra、FlagGems、FlagTree、vllm-plugin-FL、docs、flagtree-cpu、release-info、verl-FL;其中 release-info 为分支推送无新提交,docs/verl-FL 主推送为 PR 分支);commit search 命中 34 条窗口内提交。本窗口主线:一、verl-FL 在国产 DCU 上跑通 E2E——build-infra 完成海光 hygon25 平台 verl-FL 全链路验证,将验证所需的六个代码补丁与一个环境变量拆分为上游 fork PR(verl-FL #20、vllm-plugin-FL #420、FlagGems #5841),训练框架多芯片适配从”计划”进入”实证”阶段;二、新后端接入——build-infra 新增天数智芯 CoreX 4.5.0 后端,镜像栈 2.1.2 描述自动刷新;三、算子库批量扩充——FlagGems 单日合入 18 个 PR,其中 KernelGen 生成器产出 13 个新 NVIDIA 算子,CI 增加 rule-check 结果飞书上报;四、编译栈纵深——FlagTree 燧原 gcu300/gcu400 后端更新、flagtree-cpu 提出 AArch64 SVE2/NEON I8MM 量化内核方案。新闻侧连续第二日组件级零命中。

1.1 头条:verl-FL 海光 DCU E2E 打通,六补丁拆分上游 PR 链(08-28/08-29)

来源build-infra #606verl-FL #20verl-FL #19vllm-plugin-FL #420FlagGems #5841

  • 8/28 23:06 UTC(8/29 07:06 北京时间)build-infra #606 合入:海光 hygon25 平台上 verl-FL E2E 验证所需的六个代码补丁 + 一个环境变量已全部拆分为上游 fork PR 归档——verl-FL #20(vLLM 0.20 线 run_method/max_model_len 修复,按 _VLLM_GE_0_20 版本门控)、vllm-plugin-FL #420(vLLM 0.20 的 kv_cache_config list 解包与 config context)、FlagGems #5841(HIP libdevice 缺失 finitef/isfinited 符号的 pure-triton 回退)。
  • 配套 issue verl-FL #19(8/28 14:34 UTC 创建):记录 vLLM 0.20.2 两个 rollout 断裂点——execute_method 被移除(须改走 vllm.v1.serial_utils.run_method)、max_model_len 被无条件覆盖;由 build-infra hygon E2E 验证在 GRPO(flagtree 与 triton 两条路径)上发现。
  • 剩余两项待办:torch/_inductor 补丁等待 flagtree wheel 重建(上游 #1020 已合入但未进 wheel);ray teardown 环境变量等待 verl app 镜像线。PR 说明注明”部分由生成式 AI 辅助撰写”。

解读:这是昨日 build-infra #595(verl 接入 Path B 计划)的直接落地——从”计划细化”推进到”海光 DCU 实证 + 补丁回灌上游”,且补丁链横跨 verl-FL、vllm-plugin-FL、FlagGems 三个仓库,说明 verl-FL 多芯片验证已形成”验证发现→补丁拆分→上游 PR→等待镜像重建”的成熟闭环。海光由此成为继昇腾之后又一个跑通 verl-FL E2E 的国产芯片平台(hygon25 对应海光新一代 DCU)。

1.2 build-infra:新增天数智芯 CoreX 4.5.0 后端、2.1.2 镜像栈描述自动刷新(08-28)

来源build-infra #602#604#605configs.yaml

  • 8/28 11:45 UTC build-infra #602 合入:新增 corex-4.5.0 后端(天数智芯 Iluvatar),configs.yaml 同步登记。
  • 8/28 13:10 与 15:05 UTC,#604/#605 由 GitHub Actions 机器人自动合入:刷新 2.1.2 镜像栈(base 与 runtime)的镜像描述文档——base 3 后端描述验证通过,runtime 侧 1 后端描述验证未通过(自动化标记,待人工核查)。
  • configs.yaml 当前版本:version: "2.1.2"flaggems: "5.3.5"(flaggems 5.3.5 为 8/25 bump,昨日报告已预告”5.3.5 全后端重验收尾”)。

解读:CoreX 4.5.0 是 build-infra 继 CANN 8.5.0(昇腾)、TOPS 1.10.6(燧原)之后又一个工具链版本跟进,天数智芯后端的软件栈随芯片 SDK 迭代同步升级;镜像栈 2.1.2 的”baked-in system-package 版本”自动化刷新说明镜像发布流程已高度自动化(机器人提交 + 自动验证)。

1.3 FlagGems:单日合入 18 个 PR,KernelGen 算子批量扩充(08-28)

来源FlagGems merged PRs(详见附录 9-11)

  • 8/28(02:33~10:23 UTC)FlagGems 单日合入 18 个 PR,其中 KernelGen(算子生成器)产出 13 个新 NVIDIA Triton 算子_thnn_differentiable_gru_cell_backwardlinalg_matrix_sqrth_upsample_lanczos2d_aacolumn_stack_nested_sum_backwardunsafe_split_with_sizesflipud_coalesced_fill_diagonal_binomialspecial_ndtrihsplitfake_quantize_per_tensor_affine
  • 厂商侧:[MetaX] AddMM 布局与 bias epilogue 优化(#5386,沐曦)——为沐曦后端优化矩阵乘布局与偏置尾处理。
  • 工程化:CI rule-check 结果上报飞书 Bitable(#5827),算子合规检查结果自动沉淀到飞书多维表格;另有修复类合入(exponential_ 计数器冲突、_weight_norm 测试拆分、randperm tl.where 参数、linalg vecdot fp64 测试逻辑)。

解读:KernelGen 单日 13 算子延续了”生成器批量产出 + 人工评审合入”的节奏(8/27 亦有 5 个 Qwen4 内核批次),算子覆盖向反向传播算子(_nested_sum_backward_thnn_differentiable_gru_cell_backward)与数值函数(special_ndtribinomial)扩展;CI 规则检查结果接入飞书是 FlagOS 团队工程流程透明化的又一信号。flaggems 5.3.5 已在 build-infra 固定,本轮合入属于 5.3.5 之后的算子扩充增量。

1.4 FlagTree:燧原 Enflame 后端更新,新增 TARGET_PROFILE 构建开关(08-28)

来源FlagTree #1059

  • 8/28 05:21 UTC FlagTree #1059 合入:更新 Enflame 后端(gcu300/gcu400)与 TLE-Raw python 层;新增 TARGET_PROFILE 构建开关、flaggems/ResolveGCUBuild cmake 集成;新增 tensor-dsl 测试并更新单元测试。

解读:燧原 GCU 后端在 FlagTree 统一编译栈内持续对齐(8/27 FlagCX 燧原 collective flow 闭环、8/28 FlagTree 燧原后端更新,燧原适配进入高频期);TARGET_PROFILE 开关让同一套代码按目标芯片配置裁剪编译,是”一套编译器多芯片”架构的工程支撑。

1.5 vllm-plugin-FL:batch MTP xGrammar masks 合入、昇腾 ModelSlim W8A8 分支关闭(08-28)

来源vllm-plugin-FL #414#416

  • 8/28 03:19 UTC #414 合入:perf(vllm-0.24): batch MTP xGrammar masks——在 vLLM 0.24 上批量处理 MTP(多 token 预测)的 xGrammar 掩码,属性能优化。
  • 8/28 06:28 UTC #416 关闭(未合入):Feature/ascend modelslim w8a8 v0.2——原计划为 FL 平台增加通用 ModelSlim W8A8 量化能力(解析 quant_model_description.json 量化描述、接入 W8A8 Static/Dynamic Linear 与 MoE 权重加载、昇腾 NPU 执行路径),分支关闭原因未注明,相关能力或改道合入。

解读:vllm-plugin-FL 双线并行——main 线持续做 vLLM 0.24 性能优化(延续昨日”W8A8 适配 vLLM 0.24、CI 迁移 main”的主线),昇腾 ModelSlim W8A8 特性分支被关闭(v0.2 阶段),昇腾量化推理能力的合入路径待观察。

1.6 flagtree-cpu:AArch64 SVE2/NEON I8MM 量化内核 PR 提出(08-28)

来源flagtree-cpu #5

  • 8/28 03:34 UTC 提出(open):[CPU][AArch64] 为 KleidiAI 兼容的 W4A8/W8A8 内核添加 SVE2/NEON I8MM lowering(Triton v3.7.x)——解决通用 Triton-CPU lowering 丢失打包 W4A8/W8A8 内核物理微 tile 结构、大点积退化为标量/洗牌/溢出代码、无法达到 Arm 原生 dot-product 性能的问题。

解读:CPU 侧(AArch64)量化推理内核是 flagtree-cpu 的新方向,瞄准 KleidiAI 兼容布局的 Arm 原生性能——与 FlagOS 推理栈”多硬件覆盖”叙事一致(GPU 五后端 + CPU AArch64)。

1.7 docs:模型列表同步 PR 排队(08-28/08-29)

来源docs #480#481#482

  • 8/28~8/29 三个自动同步 PR 排队:ModelScope 文档更新(#481/#480)、aihuanxin(爱换芯/模型源)模型列表更新(#482)——模型列表从 ModelScope、HuggingFace 之外新增 aihuanxin 信源。

解读:docs 仓库的模型列表同步自动化持续运转,新增 aihuanxin 模型源说明 FlagOS 文档对国内模型托管平台的覆盖在扩大。


二、新闻报道与生态

2.1 平静日说明:组件级查询连续第二日零命中

  • gnews 中文组查询(窗口 14d):FlagGems、FlagScale、FlagPerf、FlagAttention、FlagCX、KernelGen 全部零命中;FlagOS 命中 1 条(8/27 摩尔线程联合 FlagOS 完成 Qwen3.8-Flash-Next 适配,昨日报告已收录,非新增);FlagTree 仅命中 8/20 智源社区 AI Compiler 活动回顾(超窗口)。
  • gnews 英文组查询:"FlagOS" OR "FlagGems" when:7d(en-US)零命中。
  • 成员单位查询(when:7d):摩尔线程、燧原、天数智芯、海光 DCU、智源全部零命中。
  • HN Algolia(FlagOS OR FlagGems,3d):零命中。
  • 裸查询 RISC-V when:1d 命中 9 条(openKylin 3.0 发布、M-Robots OS 3.0 Beta、AI 芯片创业等),代理链路与抓取流程正常,但均与 FlagOS 无直接关联。

结论:新闻侧连续第二日组件级零命中,属 FlagOS 常见平静期;当日价值信息集中在 GitHub 仓库动态(见第一章)。

2.2 生态侧观察与排除项

  • 剔除:BAAI open source(en)命中 3 条——”英伟达 129 亿美元收购 Hugging Face”(智源社区 8/28 转载)与”HF 或被出售”(8/25)为收购传闻报道、HyperAI 开源项目征集(8/22),均不涉及 FlagOS 组件,按”仅泛泛提 BAAI/开源”标准剔除。
  • 观察项:OpenCourse 与智源社区 8/20 AI Compiler 活动回顾(”从编译优化到场景应用”)说明编译栈生态活动仍在推进,与 FlagTree/flagtree-cpu 近期动态呼应,可作为背景线索。

三、成员单位深挖

3.1 海光:verl-FL hygon25 E2E 验证链落地(08-28/08-29)

来源build-infra #606verl-FL #19FlagGems #5841

  • 海光 hygon25 平台跑通 verl-FL E2E(GRPO,flagtree 与 triton 双路径),暴露并归档 6+1 个补丁:verl-FL #20(vLLM 0.20 兼容门控)、vllm-plugin-FL #420(kv_cache_config 解包)、FlagGems #5841(HIP libdevice 符号回退)、torch/_inductor(待 wheel 重建)、ray teardown 环境变量(待镜像线)等。
  • FlagGems #5841 细节:verl optimizer_step 的 torch.isfinite 派发到 flag_gems isfinite 算子,其 lower 依赖 finitef/isfinited libdevice 符号,而 vendored hip triton 3.5.1 libdevice 两者皆缺,_patch_missing_symbols 借用 CUDA __nv_finitef extern 又失败——故提供 pure-triton 回退实现。

解读:海光 DCU 是继昇腾(CANN 8.5.0、0.20.2 双编译器 E2E)之后第二个跑通 verl-FL 的国产平台,”验证→拆补丁→上游 PR→等镜像重建”闭环成型;HIP 生态与 CUDA libdevice 的符号差异是国产芯片适配的典型摩擦点,pure-triton 回退是通用解法。

3.2 天数智芯:CoreX 4.5.0 后端接入(08-28)

来源build-infra #602

  • build-infra 新增 corex-4.5.0 后端(Iluvatar),configs.yaml 登记。天数智芯 SDK 工具链版本随 CoreX 4.5.0 跟进。

解读:天数智芯在 FlagOS 镜像栈中的后端从既有 corex 版本升级到 4.5.0,属于 SDK 常规迭代;与昇腾 CANN 8.5.0、燧原 TOPS 1.10.6 同属”成员单位工具链版本同步”节奏。

3.3 燧原:FlagTree gcu300/gcu400 后端更新(08-28)

来源FlagTree #1059

  • Enflame 后端更新覆盖 gcu300/gcu400 两代芯片,TLE-Raw python 层同步,新增 TARGET_PROFILE 构建开关与 tensor-dsl 测试。与 8/27 FlagCX 燧原 collective flow 闭环衔接。

解读:燧原连续两日在 FlagOS 仓库有实质合入(FlagCX 通信流、FlagTree 后端),是近期成员单位中最活跃的一家;gcu300/gcu400 双代覆盖说明燧原在统一编译器栈上的适配深度在增加。

3.4 沐曦:MetaX AddMM 布局优化(08-28)

来源FlagGems #5386

  • FlagGems 合入 MetaX AddMM 布局与 bias epilogue 优化(沐曦后端矩阵乘性能优化)。

解读:沐曦后端算子优化持续推进(8/27 同日有五后端 Qwen4 内核批次含沐曦版本),MetaX 专用优化是”统一算子库 + 厂商优化层”模式的常规动作。

3.5 摩尔线程:verl-FL MUSA 平台兼容 PR 推进(08-24 更新/窗口内观察)

来源verl-FL #18

  • verl-FL #18(open,8/24 更新,窗口外提出但持续跟踪):为摩尔线程 MUSA 平台增加支持,目标 Megatron(训练)+ SGLang 0.5.11(推理)+ FSDP 的 GRPO E2E——含 SGLang 0.5.11 _launch_subprocesses API 兼容 shim、_device_to_uuid/_device_from_maybe_uuid MUSA 适配、uvicorn 启动器替换等。

解读:摩尔线程 MUSA 的 verl-FL 支持与海光 hygon25 验证同属”verl-FL 多芯片化”进程,MUSA PR 仍在评审中;配合 8/26-27 摩尔线程 Qwen3.8-Flash-Next Day-0 头条,摩尔线程在 FlagOS 训练与推理双栈的适配均在进行。

3.6 昇腾:ModelSlim W8A8 特性分支调整(08-28)

来源vllm-plugin-FL #416

  • 昇腾 ModelSlim W8A8 通用量化能力特性分支(#416,解析 quant_model_description.json、接入 W8A8 Static/Dynamic Linear 与 MoE 权重加载、NPU 执行路径)于 8/28 关闭未合入,v0.2 阶段;昇腾侧 W8A8 推理能力的合入路径待观察。

四、总结

窗口主线:一、verl-FL 海光 DCU E2E 实证落地——build-infra 完成 hygon25 平台验证,六个补丁 + 一个环境变量拆分为上游 fork PR(verl-FL #20、vllm-plugin-FL #420、FlagGems #5841),补丁链横跨训练/推理/算子三栈,”验证→拆补丁→回灌上游”闭环成型,海光成为继昇腾后第二个跑通 verl-FL 的国产平台。二、新后端与新镜像栈——build-infra 新增天数智芯 CoreX 4.5.0 后端,镜像栈 2.1.2 描述自动刷新(机器人提交 + 自动验证)。三、算子库批量扩充——FlagGems 单日 18 个 PR(KernelGen 13 个 NVIDIA 算子 + MetaX AddMM 优化 + CI 飞书上报),5.3.5 之后的增量扩张。四、编译栈纵深——FlagTree 燧原 gcu300/gcu400 后端更新(TARGET_PROFILE 开关)、flagtree-cpu 提出 AArch64 SVE2/NEON I8MM 量化内核方案。五、新闻侧连续第二日组件级零命中,属平静期。

下一观察点:verl-FL #20 / vllm-plugin-FL #420 / FlagGems #5841 三个上游 PR 的合入进度;torch/_inductor 补丁随 flagtree wheel 重建落地;verl-FL #18(摩尔线程 MUSA GRPO E2E)评审进展;vllm-plugin-FL 昇腾 ModelSlim W8A8 是否改道合入;FlagGems KernelGen 算子扩充是否延续(每日批次节奏);build-infra runtime 侧 1 后端镜像描述验证失败的人工核查结果;docs 模型列表新增 aihuanxin 信源的同步落地。

局限性说明:新闻侧零命中基于 gnews 中英文多组查询与 HN 检索,Google News 收录延迟可能导致个别窗口内报道未入列;vllm-plugin-FL #416 分支关闭原因未在 PR 中注明;build-infra #605 runtime 侧 1 后端描述验证失败的具体后端未在 PR 描述中列出;release-info 仓库窗口内推送为分支推送(main 无新提交),未计入。


附录:完整信源清单

编号 事件 来源链接
1 build-infra #606:verl hygon25 E2E 补丁链拆分归档 https://github.com/flagos-ai/build-infra/pull/606
2 verl-FL #20:vLLM 0.20 run_method/max_model_len 门控修复 https://github.com/flagos-ai/verl-FL/pull/20
3 verl-FL #19:vLLM 0.20.2 rollout breakages issue https://github.com/flagos-ai/verl-FL/issues/19
4 vllm-plugin-FL #420:kv_cache_config list 解包 + config context https://github.com/flagos-ai/vllm-plugin-FL/pull/420
5 FlagGems #5841:HIP libdevice finitef/isfinited pure-triton 回退 https://github.com/flagos-ai/FlagGems/pull/5841
6 build-infra #602:CoreX 4.5.0 后端(天数智芯 Iluvatar) https://github.com/flagos-ai/build-infra/pull/602
7 build-infra #604:base 镜像 2.1.2 描述自动刷新 https://github.com/flagos-ai/build-infra/pull/604
8 build-infra #605:runtime 镜像 2.1.2 描述自动刷新 https://github.com/flagos-ai/build-infra/pull/605
9 FlagGems merged PRs(窗口内 18 个,含 KernelGen 13 算子) https://github.com/flagos-ai/FlagGems/pulls?q=is%3Apr+is%3Aclosed
10 FlagGems #5386:MetaX AddMM 布局优化 https://github.com/flagos-ai/FlagGems/pull/5386
11 FlagGems #5827:CI rule-check 飞书 Bitable 上报 https://github.com/flagos-ai/FlagGems/pull/5827
12 FlagTree #1059:Enflame 后端 gcu300/gcu400 更新 https://github.com/flagos-ai/FlagTree/pull/1059
13 vllm-plugin-FL #414:batch MTP xGrammar masks https://github.com/flagos-ai/vllm-plugin-FL/pull/414
14 vllm-plugin-FL #416:昇腾 ModelSlim W8A8 v0.2 分支关闭 https://github.com/flagos-ai/vllm-plugin-FL/pull/416
15 flagtree-cpu #5:AArch64 SVE2/NEON I8MM lowering https://github.com/flagos-ai/flagtree-cpu/pull/5
16 docs #480/#481/#482:模型列表同步 PR https://github.com/flagos-ai/docs/pulls
17 verl-FL #18:MUSA 平台兼容(摩尔线程) https://github.com/flagos-ai/verl-FL/pull/18
18 build-infra configs.yaml(version 2.1.2 / flaggems 5.3.5) https://github.com/flagos-ai/build-infra/blob/main/configs.yaml
19 org repos 总览(52 仓,8 仓窗口内活跃) https://api.github.com/orgs/flagos-ai/repos?per_page=100&sort=updated
20 commit search(窗口内 34 条提交) https://api.github.com/search/commits?q=org:flagos-ai+committer-date:%3E2026-08-28T02:18:00Z
21 gnews 中英文组查询(FlagOS/组件/成员单位,零命中) https://news.google.com/rss/search?q=FlagOS+when%3A14d&hl=zh-CN&gl=CN&ceid=CN%3Azh-Hans
22 HN Algolia(FlagOS OR FlagGems,3d,零命中) https://hn.algolia.com/api/v1/search_by_date?query=FlagOS%20OR%20FlagGems
23 BAAI open source 命中(HF 收购传闻,剔除) https://news.google.com/rss/search?q=BAAI+open+source+when%3A7d&hl=en-US&gl=US&ceid=US%3Aen