FlagOS 每日動態報告(2026-08-29)
調研視窗:2026-08-28 10:18 ~ 2026-08-29 10:18 北京時間 信源:GitHub(org: flagos-ai 52 倉 + commit search + PR/Issue API)、Google News RSS(中英文多組查詢,代理鏈路正常)、HN Algolia、Tavily/web 交叉驗證(詳見附錄)
索引
- 一、開源專案進展(GitHub 動態)
- 1.1 頭條:verl-FL 海光 DCU E2E 打通,六補丁拆分上游 PR 鏈(08-28/08-29)
- 1.2 build-infra:新增天數智芯 CoreX 4.5.0 後端、2.1.2 映象棧描述自動重新整理(08-28)
- 1.3 FlagGems:單日合入 18 個 PR,KernelGen 運算元批次擴充(08-28)
- 1.4 FlagTree:燧原 Enflame 後端更新,新增 TARGET_PROFILE 構建開關(08-28)
- 1.5 vllm-plugin-FL:batch MTP xGrammar masks 合入、昇騰 ModelSlim W8A8 分支關閉(08-28)
- 1.6 flagtree-cpu:AArch64 SVE2/NEON I8MM 量化核心 PR 提出(08-28)
- 1.7 docs:模型列表同步 PR 排隊(08-28/08-29)
- 二、新聞報道與生態
- 2.1 平靜日說明:元件級查詢連續第二日零命中
- 2.2 生態側觀察與排除項
- 三、成員單位深挖
- 3.1 海光:verl-FL hygon25 E2E 驗證鏈落地(08-28/08-29)
- 3.2 天數智芯:CoreX 4.5.0 後端接入(08-28)
- 3.3 燧原:FlagTree gcu300/gcu400 後端更新(08-28)
- 3.4 沐曦:MetaX AddMM 佈局最佳化(08-28)
- 3.5 摩爾執行緒:verl-FL MUSA 平臺相容 PR 推進(08-24 更新/視窗內觀察)
- 3.6 昇騰:ModelSlim W8A8 特性分支調整(08-28)
- 四、總結
- 附錄:完整信源清單
一、開源專案進展(GitHub 動態)
視窗總覽:org 內 52 個倉庫中 8 個在視窗內有推送(build-infra、FlagGems、FlagTree、vllm-plugin-FL、docs、flagtree-cpu、release-info、verl-FL;其中 release-info 為分支推送無新提交,docs/verl-FL 主推送為 PR 分支);commit search 命中 34 條視窗內提交。本視窗主線:一、verl-FL 在國產 DCU 上跑通 E2E——build-infra 完成海光 hygon25 平臺 verl-FL 全鏈路驗證,將驗證所需的六個程式碼補丁與一個環境變數拆分為上游 fork PR(verl-FL #20、vllm-plugin-FL #420、FlagGems #5841),訓練框架多晶片適配從”計劃”進入”實證”階段;二、新後端接入——build-infra 新增天數智芯 CoreX 4.5.0 後端,映象棧 2.1.2 描述自動重新整理;三、運算元庫批次擴充——FlagGems 單日合入 18 個 PR,其中 KernelGen 生成器產出 13 個新 NVIDIA 運算元,CI 增加 rule-check 結果飛書上報;四、編譯棧縱深——FlagTree 燧原 gcu300/gcu400 後端更新、flagtree-cpu 提出 AArch64 SVE2/NEON I8MM 量化核心方案。新聞側連續第二日元件級零命中。
1.1 頭條:verl-FL 海光 DCU E2E 打通,六補丁拆分上游 PR 鏈(08-28/08-29)
來源:build-infra #606、verl-FL #20、verl-FL #19、vllm-plugin-FL #420、FlagGems #5841
- 8/28 23:06 UTC(8/29 07:06 北京時間)build-infra #606 合入:海光 hygon25 平臺上 verl-FL E2E 驗證所需的六個程式碼補丁 + 一個環境變數已全部拆分為上游 fork PR 歸檔——verl-FL #20(vLLM 0.20 線 run_method/max_model_len 修復,按
_VLLM_GE_0_20版本門控)、vllm-plugin-FL #420(vLLM 0.20 的 kv_cache_config list 解包與 config context)、FlagGems #5841(HIP libdevice 缺失 finitef/isfinited 符號的 pure-triton 回退)。 - 配套 issue verl-FL #19(8/28 14:34 UTC 建立):記錄 vLLM 0.20.2 兩個 rollout 斷裂點——
execute_method被移除(須改走vllm.v1.serial_utils.run_method)、max_model_len被無條件覆蓋;由 build-infra hygon E2E 驗證在 GRPO(flagtree 與 triton 兩條路徑)上發現。 - 剩餘兩項待辦:torch/_inductor 補丁等待 flagtree wheel 重建(上游 #1020 已合入但未進 wheel);ray teardown 環境變數等待 verl app 映象線。PR 說明註明”部分由生成式 AI 輔助撰寫”。
解讀:這是昨日 build-infra #595(verl 接入 Path B 計劃)的直接落地——從”計劃細化”推進到”海光 DCU 實證 + 補丁回灌上游”,且補丁鏈橫跨 verl-FL、vllm-plugin-FL、FlagGems 三個倉庫,說明 verl-FL 多晶片驗證已形成”驗證發現→補丁拆分→上游 PR→等待映象重建”的成熟閉環。海光由此成為繼昇騰之後又一個跑通 verl-FL E2E 的國產晶片平臺(hygon25 對應海光新一代 DCU)。
1.2 build-infra:新增天數智芯 CoreX 4.5.0 後端、2.1.2 映象棧描述自動重新整理(08-28)
來源:build-infra #602、#604、#605、configs.yaml
- 8/28 11:45 UTC build-infra #602 合入:新增 corex-4.5.0 後端(天數智芯 Iluvatar),configs.yaml 同步登記。
- 8/28 13:10 與 15:05 UTC,#604/#605 由 GitHub Actions 機器人自動合入:重新整理 2.1.2 映象棧(base 與 runtime)的映象描述文件——base 3 後端描述驗證透過,runtime 側 1 後端描述驗證未透過(自動化標記,待人工核查)。
- configs.yaml 當前版本:
version: "2.1.2"、flaggems: "5.3.5"(flaggems 5.3.5 為 8/25 bump,昨日報告已預告”5.3.5 全後端重驗收尾”)。
解讀:CoreX 4.5.0 是 build-infra 繼 CANN 8.5.0(昇騰)、TOPS 1.10.6(燧原)之後又一個工具鏈版本跟進,天數智芯後端的軟體棧隨晶片 SDK 迭代同步升級;映象棧 2.1.2 的”baked-in system-package 版本”自動化重新整理說明映象釋出流程已高度自動化(機器人提交 + 自動驗證)。
1.3 FlagGems:單日合入 18 個 PR,KernelGen 運算元批次擴充(08-28)
來源:FlagGems merged PRs(詳見附錄 9-11)
- 8/28(02:33~10:23 UTC)FlagGems 單日合入 18 個 PR,其中 KernelGen(運算元生成器)產出 13 個新 NVIDIA Triton 運算元:
_thnn_differentiable_gru_cell_backward、linalg_matrix_sqrth、_upsample_lanczos2d_aa、column_stack、_nested_sum_backward、unsafe_split_with_sizes、flipud、_coalesced_、fill_diagonal_、binomial、special_ndtri、hsplit、fake_quantize_per_tensor_affine。 - 廠商側:[MetaX] AddMM 佈局與 bias epilogue 最佳化(#5386,沐曦)——為沐曦後端最佳化矩陣乘佈局與偏置尾處理。
- 工程化:CI rule-check 結果上報飛書 Bitable(#5827),運算元合規檢查結果自動沉澱到飛書多維表格;另有修復類合入(exponential_ 計數器衝突、_weight_norm 測試拆分、randperm tl.where 引數、linalg vecdot fp64 測試邏輯)。
解讀:KernelGen 單日 13 運算元延續了”生成器批次產出 + 人工評審合入”的節奏(8/27 亦有 5 個 Qwen4 核心批次),運算元覆蓋向反向傳播運算元(_nested_sum_backward、_thnn_differentiable_gru_cell_backward)與數值函式(special_ndtri、binomial)擴充套件;CI 規則檢查結果接入飛書是 FlagOS 團隊工程流程透明化的又一訊號。flaggems 5.3.5 已在 build-infra 固定,本輪合入屬於 5.3.5 之後的運算元擴充增量。
1.4 FlagTree:燧原 Enflame 後端更新,新增 TARGET_PROFILE 構建開關(08-28)
- 8/28 05:21 UTC FlagTree #1059 合入:更新 Enflame 後端(gcu300/gcu400)與 TLE-Raw python 層;新增 TARGET_PROFILE 構建開關、flaggems/ResolveGCUBuild cmake 整合;新增 tensor-dsl 測試並更新單元測試。
解讀:燧原 GCU 後端在 FlagTree 統一編譯棧內持續對齊(8/27 FlagCX 燧原 collective flow 閉環、8/28 FlagTree 燧原後端更新,燧原適配進入高頻期);TARGET_PROFILE 開關讓同一套程式碼按目標晶片配置裁剪編譯,是”一套編譯器多晶片”架構的工程支撐。
1.5 vllm-plugin-FL:batch MTP xGrammar masks 合入、昇騰 ModelSlim W8A8 分支關閉(08-28)
- 8/28 03:19 UTC #414 合入:
perf(vllm-0.24): batch MTP xGrammar masks——在 vLLM 0.24 上批次處理 MTP(多 token 預測)的 xGrammar 掩碼,屬效能最佳化。 - 8/28 06:28 UTC #416 關閉(未合入):
Feature/ascend modelslim w8a8 v0.2——原計劃為 FL 平臺增加通用 ModelSlim W8A8 量化能力(解析quant_model_description.json量化描述、接入 W8A8 Static/Dynamic Linear 與 MoE 權重載入、昇騰 NPU 執行路徑),分支關閉原因未註明,相關能力或改道合入。
解讀:vllm-plugin-FL 雙線並行——main 線持續做 vLLM 0.24 效能最佳化(延續昨日”W8A8 適配 vLLM 0.24、CI 遷移 main”的主線),昇騰 ModelSlim W8A8 特性分支被關閉(v0.2 階段),昇騰量化推理能力的合入路徑待觀察。
1.6 flagtree-cpu:AArch64 SVE2/NEON I8MM 量化核心 PR 提出(08-28)
- 8/28 03:34 UTC 提出(open):[CPU][AArch64] 為 KleidiAI 相容的 W4A8/W8A8 核心新增 SVE2/NEON I8MM lowering(Triton v3.7.x)——解決通用 Triton-CPU lowering 丟失打包 W4A8/W8A8 核心物理微 tile 結構、大點積退化為標量/洗牌/溢位程式碼、無法達到 Arm 原生 dot-product 效能的問題。
解讀:CPU 側(AArch64)量化推理核心是 flagtree-cpu 的新方向,瞄準 KleidiAI 相容佈局的 Arm 原生效能——與 FlagOS 推理棧”多硬體覆蓋”敘事一致(GPU 五後端 + CPU AArch64)。
1.7 docs:模型列表同步 PR 排隊(08-28/08-29)
- 8/28~8/29 三個自動同步 PR 排隊:ModelScope 文件更新(#481/#480)、aihuanxin(愛換芯/模型源)模型列表更新(#482)——模型列表從 ModelScope、HuggingFace 之外新增 aihuanxin 信源。
解讀:docs 倉庫的模型列表同步自動化持續運轉,新增 aihuanxin 模型源說明 FlagOS 文件對國內模型託管平臺的覆蓋在擴大。
二、新聞報道與生態
2.1 平靜日說明:元件級查詢連續第二日零命中
- gnews 中文組查詢(視窗 14d):FlagGems、FlagScale、FlagPerf、FlagAttention、FlagCX、KernelGen 全部零命中;FlagOS 命中 1 條(8/27 摩爾執行緒聯合 FlagOS 完成 Qwen3.8-Flash-Next 適配,昨日報告已收錄,非新增);FlagTree 僅命中 8/20 智源社群 AI Compiler 活動回顧(超視窗)。
- gnews 英文組查詢:
"FlagOS" OR "FlagGems" when:7d(en-US)零命中。 - 成員單位查詢(when:7d):摩爾執行緒、燧原、天數智芯、海光 DCU、智源全部零命中。
- HN Algolia(FlagOS OR FlagGems,3d):零命中。
- 裸查詢
RISC-V when:1d命中 9 條(openKylin 3.0 釋出、M-Robots OS 3.0 Beta、AI 晶片創業等),代理鏈路與抓取流程正常,但均與 FlagOS 無直接關聯。
結論:新聞側連續第二日元件級零命中,屬 FlagOS 常見平靜期;當日價值資訊集中在 GitHub 倉庫動態(見第一章)。
2.2 生態側觀察與排除項
- 剔除:BAAI open source(en)命中 3 條——”英偉達 129 億美元收購 Hugging Face”(智源社群 8/28 轉載)與”HF 或被出售”(8/25)為收購傳聞報道、HyperAI 開源專案徵集(8/22),均不涉及 FlagOS 元件,按”僅泛泛提 BAAI/開源”標準剔除。
- 觀察項:OpenCourse 與智源社群 8/20 AI Compiler 活動回顧(”從編譯最佳化到場景應用”)說明編譯棧生態活動仍在推進,與 FlagTree/flagtree-cpu 近期動態呼應,可作為背景線索。
三、成員單位深挖
3.1 海光:verl-FL hygon25 E2E 驗證鏈落地(08-28/08-29)
來源:build-infra #606、verl-FL #19、FlagGems #5841
- 海光 hygon25 平臺跑通 verl-FL E2E(GRPO,flagtree 與 triton 雙路徑),暴露並歸檔 6+1 個補丁:verl-FL #20(vLLM 0.20 相容門控)、vllm-plugin-FL #420(kv_cache_config 解包)、FlagGems #5841(HIP libdevice 符號回退)、torch/_inductor(待 wheel 重建)、ray teardown 環境變數(待映象線)等。
- FlagGems #5841 細節:verl optimizer_step 的
torch.isfinite派發到 flag_gems isfinite 運算元,其 lower 依賴 finitef/isfinited libdevice 符號,而 vendored hip triton 3.5.1 libdevice 兩者皆缺,_patch_missing_symbols借用 CUDA__nv_finitefextern 又失敗——故提供 pure-triton 回退實現。
解讀:海光 DCU 是繼昇騰(CANN 8.5.0、0.20.2 雙編譯器 E2E)之後第二個跑通 verl-FL 的國產平臺,”驗證→拆補丁→上游 PR→等映象重建”閉環成型;HIP 生態與 CUDA libdevice 的符號差異是國產晶片適配的典型摩擦點,pure-triton 回退是通用解法。
3.2 天數智芯:CoreX 4.5.0 後端接入(08-28)
- build-infra 新增 corex-4.5.0 後端(Iluvatar),configs.yaml 登記。天數智芯 SDK 工具鏈版本隨 CoreX 4.5.0 跟進。
解讀:天數智芯在 FlagOS 映象棧中的後端從既有 corex 版本升級到 4.5.0,屬於 SDK 常規迭代;與昇騰 CANN 8.5.0、燧原 TOPS 1.10.6 同屬”成員單位工具鏈版本同步”節奏。
3.3 燧原:FlagTree gcu300/gcu400 後端更新(08-28)
- Enflame 後端更新覆蓋 gcu300/gcu400 兩代晶片,TLE-Raw python 層同步,新增 TARGET_PROFILE 構建開關與 tensor-dsl 測試。與 8/27 FlagCX 燧原 collective flow 閉環銜接。
解讀:燧原連續兩日在 FlagOS 倉庫有實質合入(FlagCX 通訊流、FlagTree 後端),是近期成員單位中最活躍的一家;gcu300/gcu400 雙代覆蓋說明燧原在統一編譯器棧上的適配深度在增加。
3.4 沐曦:MetaX AddMM 佈局最佳化(08-28)
- FlagGems 合入 MetaX AddMM 佈局與 bias epilogue 最佳化(沐曦後端矩陣乘效能最佳化)。
解讀:沐曦後端運算元最佳化持續推進(8/27 同日有五後端 Qwen4 核心批次含沐曦版本),MetaX 專用最佳化是”統一運算元庫 + 廠商最佳化層”模式的常規動作。
3.5 摩爾執行緒:verl-FL MUSA 平臺相容 PR 推進(08-24 更新/視窗內觀察)
來源:verl-FL #18
- verl-FL #18(open,8/24 更新,視窗外提出但持續跟蹤):為摩爾執行緒 MUSA 平臺增加支援,目標 Megatron(訓練)+ SGLang 0.5.11(推理)+ FSDP 的 GRPO E2E——含 SGLang 0.5.11
_launch_subprocessesAPI 相容 shim、_device_to_uuid/_device_from_maybe_uuidMUSA 適配、uvicorn 啟動器替換等。
解讀:摩爾執行緒 MUSA 的 verl-FL 支援與海光 hygon25 驗證同屬”verl-FL 多晶片化”程序,MUSA PR 仍在評審中;配合 8/26-27 摩爾執行緒 Qwen3.8-Flash-Next Day-0 頭條,摩爾執行緒在 FlagOS 訓練與推理雙棧的適配均在進行。
3.6 昇騰:ModelSlim W8A8 特性分支調整(08-28)
- 昇騰 ModelSlim W8A8 通用量化能力特性分支(#416,解析 quant_model_description.json、接入 W8A8 Static/Dynamic Linear 與 MoE 權重載入、NPU 執行路徑)於 8/28 關閉未合入,v0.2 階段;昇騰側 W8A8 推理能力的合入路徑待觀察。
四、總結
視窗主線:一、verl-FL 海光 DCU E2E 實證落地——build-infra 完成 hygon25 平臺驗證,六個補丁 + 一個環境變數拆分為上游 fork PR(verl-FL #20、vllm-plugin-FL #420、FlagGems #5841),補丁鏈橫跨訓練/推理/運算元三棧,”驗證→拆補丁→回灌上游”閉環成型,海光成為繼昇騰後第二個跑通 verl-FL 的國產平臺。二、新後端與新映象棧——build-infra 新增天數智芯 CoreX 4.5.0 後端,映象棧 2.1.2 描述自動重新整理(機器人提交 + 自動驗證)。三、運算元庫批次擴充——FlagGems 單日 18 個 PR(KernelGen 13 個 NVIDIA 運算元 + MetaX AddMM 最佳化 + CI 飛書上報),5.3.5 之後的增量擴張。四、編譯棧縱深——FlagTree 燧原 gcu300/gcu400 後端更新(TARGET_PROFILE 開關)、flagtree-cpu 提出 AArch64 SVE2/NEON I8MM 量化核心方案。五、新聞側連續第二日元件級零命中,屬平靜期。
下一觀察點:verl-FL #20 / vllm-plugin-FL #420 / FlagGems #5841 三個上游 PR 的合入進度;torch/_inductor 補丁隨 flagtree wheel 重建落地;verl-FL #18(摩爾執行緒 MUSA GRPO E2E)評審進展;vllm-plugin-FL 昇騰 ModelSlim W8A8 是否改道合入;FlagGems KernelGen 運算元擴充是否延續(每日批次節奏);build-infra runtime 側 1 後端映象描述驗證失敗的人工核查結果;docs 模型列表新增 aihuanxin 信源的同步落地。
侷限性說明:新聞側零命中基於 gnews 中英文多組查詢與 HN 檢索,Google News 收錄延遲可能導致個別視窗內報道未入列;vllm-plugin-FL #416 分支關閉原因未在 PR 中註明;build-infra #605 runtime 側 1 後端描述驗證失敗的具體後端未在 PR 描述中列出;release-info 倉庫視窗內推送為分支推送(main 無新提交),未計入。
附錄:完整信源清單
| 編號 | 事件 | 來源連結 |
|---|---|---|
| 1 | build-infra #606:verl hygon25 E2E 補丁鏈拆分歸檔 | https://github.com/flagos-ai/build-infra/pull/606 |
| 2 | verl-FL #20:vLLM 0.20 run_method/max_model_len 門控修復 | https://github.com/flagos-ai/verl-FL/pull/20 |
| 3 | verl-FL #19:vLLM 0.20.2 rollout breakages issue | https://github.com/flagos-ai/verl-FL/issues/19 |
| 4 | vllm-plugin-FL #420:kv_cache_config list 解包 + config context | https://github.com/flagos-ai/vllm-plugin-FL/pull/420 |
| 5 | FlagGems #5841:HIP libdevice finitef/isfinited pure-triton 回退 | https://github.com/flagos-ai/FlagGems/pull/5841 |
| 6 | build-infra #602:CoreX 4.5.0 後端(天數智芯 Iluvatar) | https://github.com/flagos-ai/build-infra/pull/602 |
| 7 | build-infra #604:base 映象 2.1.2 描述自動重新整理 | https://github.com/flagos-ai/build-infra/pull/604 |
| 8 | build-infra #605:runtime 映象 2.1.2 描述自動重新整理 | https://github.com/flagos-ai/build-infra/pull/605 |
| 9 | FlagGems merged PRs(視窗內 18 個,含 KernelGen 13 運算元) | https://github.com/flagos-ai/FlagGems/pulls?q=is%3Apr+is%3Aclosed |
| 10 | FlagGems #5386:MetaX AddMM 佈局最佳化 | https://github.com/flagos-ai/FlagGems/pull/5386 |
| 11 | FlagGems #5827:CI rule-check 飛書 Bitable 上報 | https://github.com/flagos-ai/FlagGems/pull/5827 |
| 12 | FlagTree #1059:Enflame 後端 gcu300/gcu400 更新 | https://github.com/flagos-ai/FlagTree/pull/1059 |
| 13 | vllm-plugin-FL #414:batch MTP xGrammar masks | https://github.com/flagos-ai/vllm-plugin-FL/pull/414 |
| 14 | vllm-plugin-FL #416:昇騰 ModelSlim W8A8 v0.2 分支關閉 | https://github.com/flagos-ai/vllm-plugin-FL/pull/416 |
| 15 | flagtree-cpu #5:AArch64 SVE2/NEON I8MM lowering | https://github.com/flagos-ai/flagtree-cpu/pull/5 |
| 16 | docs #480/#481/#482:模型列表同步 PR | https://github.com/flagos-ai/docs/pulls |
| 17 | verl-FL #18:MUSA 平臺相容(摩爾執行緒) | https://github.com/flagos-ai/verl-FL/pull/18 |
| 18 | build-infra configs.yaml(version 2.1.2 / flaggems 5.3.5) | https://github.com/flagos-ai/build-infra/blob/main/configs.yaml |
| 19 | org repos 總覽(52 倉,8 倉視窗內活躍) | https://api.github.com/orgs/flagos-ai/repos?per_page=100&sort=updated |
| 20 | commit search(視窗內 34 條提交) | https://api.github.com/search/commits?q=org:flagos-ai+committer-date:%3E2026-08-28T02:18:00Z |
| 21 | gnews 中英文組查詢 |
| (FlagOS/元件/成員單位,零命中) | https://news.google.com/rss/search?q=FlagOS+when%3A14d&hl=zh-CN&gl=CN&ceid=CN%3Azh-Hans | ||
| 22 | HN Algolia(FlagOS OR FlagGems,3d,零命中) | https://hn.algolia.com/api/v1/search_by_date?query=FlagOS%20OR%20FlagGems | |
| 23 | BAAI open source 命中(HF 收購傳聞,剔除) | https://news.google.com/rss/search?q=BAAI+open+source+when%3A7d&hl=en-US&gl=US&ceid=US%3Aen |