調研視窗:2026-09-21 10:18 ~ 2026-09-22 10:00(約 24 小時;承接 09-21 日報視窗,無空檔) 信源:GitHub(org: flagos-ai,54 倉庫 pushed_at 全量核查,視窗內 19 個倉庫有推送;提交搜尋命中 224 條,跨 15 個倉庫)、Google News RSS(中英文 24 組查詢詞,走代理)、沐曦官網、介面新聞、觀點網、智源社群等(詳見附錄信源清單)


本期索引

  • 今日重點:FlagFFT 補齊海光後端——BW1000(HCU)介面卡進入 dev,單視窗 102 筆提交橫跨 MACA/Ascend/HCU 三線(09-21/09-22)
  • 一、開源專案進展(GitHub 動態)
    • 1.1 FlagFFT:HCU 介面卡落地,MACA/Ascend 效能與證據收口,打包三件套合入(09-21/09-22)
    • 1.2 build-infra:FlagCX wheel 通道六連合入、崑崙芯下發在審;純 Python 元件統一發布通道(09-21/09-22)
    • 1.3 FlagCX:v0.14.0-rc2.post2 釋出——清微 TSM torch 外掛連結修復(09-21)
    • 1.4 FlagGems-vllm:壁仞 SUPA 後端合入;昇騰 XCS 運算元批與六平臺 topk 調優(09-21/09-22)
    • 1.5 FlagGems:KernelGen 再入庫 Nvidia 運算元;崑崙芯修復批;海光 W8A8 TLE 管線替換(09-21/09-22)
    • 1.6 FlagTree:天數 Iluvatar TLE 分散式與 TLE_RAW;NVIDIA TLE SMEM 子切片(09-21/09-22)
    • 1.7 其餘動態:FlagTensor 0.3.0-rc2 打包線、FlagQuantum 互操作、FlagSparse、FlagAudio、FlagOS-Compressor 等(09-21)
  • 二、新聞報道與生態
    • 2.1 元件級檢索連續第十七個平靜視窗(09-21/09-22)
    • 2.2 沐曦 MXMACA 合入 LMCache 主線:成員單位軟體棧「上游優先」融入全球推理生態(09-18/09-21)
    • 2.3 介面新聞盤點沐曦 39 個 Day 0 適配:國產 GPU「軟硬一體」生態敘事(09-21)
  • 三、成員單位深挖
    • 3.1 沐曦:MACA 線三倉收口(FFT / 編譯器 / 訓練工具)(09-21/09-22)
    • 3.2 海光:FlagFFT HCU 介面卡與 FlagGems W8A8 TLE 替換(09-21/09-22)
    • 3.3 昇騰:XCS 運算元批與 NPU FFT 最佳化,910C vLLM 0.28 升級在審(09-21/09-22)
    • 3.4 天數智芯:Iluvatar TLE 分散式合入(09-22)
    • 3.5 摩爾執行緒:index_add/polar 最佳化合入,多條運算元 PR 在審(09-21/09-22)
    • 3.6 燧原:FlagGems-sglang 註冊 GCU vendor(09-21)
    • 3.7 清微智慧:FlagCX rc2.post2 修復 TSM torch 外掛(09-21)
    • 3.8 達摩院玄鐵:PPU 融合運算元合入與 PPU CI 校驗(09-21)
  • 四、總結與趨勢觀察
  • 附錄:信源核查表
  • 完整信源清單

今日重點:FlagFFT 補齊海光後端——BW1000(HCU)介面卡進入 dev,單視窗 102 筆提交橫跨三線

日期:2026-09-21 ~ 2026-09-22 來源:FlagFFT 提交記錄(dev)

09-21 深夜至 09-22 上午,FlagFFT(經 Triton/TLE 與 libtriton_jit 在執行時生成後端目標核心的 JIT 編譯 FFT 庫)把海光 BW1000(HCU)後端介面卡合入 dev 分支:「Add HCU backend adaptor for BW1000」(09-21 22:39)起步,隨後是 hipFFT 控制代碼轉換修復(22:55)、獨立 capture 連結 Torch HIP(23:01)、記憶體安全原策(09-22 00:11),並以「Hygon BW1000 HCU 環境搭建」「統一 HCU 測試構建」兩篇文件(09-22 08:44 / 08:47)與上游打包合併(08:57)收尾。README 的 CMake 後端清單隨之更新為 CUDA / MUSA / PPU / IX / MACA / NPU / HCU 七項——海光第一次進入 FFT 庫的後端矩陣。

同視窗 FlagFFT 單庫提交數達 102 筆,另兩條線各自成批:MACA(沐曦)的效能收口——FP64 暫存器交換實驗當日試落又撤回(Revert)、pack8 按葉佈局門控、四步與直連混合基的共享記憶體預算,以及一批帶證據留檔的驗收工具;NPU(昇騰)合併單 CT 最佳化並落地 Stockham 批次(16 蝴蝶單元、打包實數 FFT、限定向量下行等約十筆同批)。打包方向三件套同步合入:Debian + RPM 打包(#12)、Nexus 釋出通道(#19 / #20)、0.2.0-rc2 移植(#18),另放寬 nlohmann_json 下限(#22)——FFT 庫本視窗同時完成了「新後端 + 效能收口 + 分發打包」三件事。


一、開源專案進展(GitHub 動態)

視窗總覽:org 內 54 個倉庫中 19 個在視窗有推送;提交搜尋命中 224 條(跨 15 個倉庫);另有 FlagCX(釋出分支)、docs、vllm-plugin-FL 等倉庫的 PR 與分支側推送未計入搜尋。分佈為:FlagFFT 102、FlagGems 29、FlagTensor 23、FlagQuantum 19、FlagGems-vllm 14、FlagSparse 11、build-infra 7、FlagTree 5、FlagAudio 5、FlagOS-Compressor 3、FlagGems-sglang 2,FlagPrism / FlagDNN / FlagBLAS / FlagScale 各 1。

本視窗形態 = 「FFT 庫多後端衝刺」+「釋出工程收口」+「後端陣列擴員」:FlagFFT 佔據近半提交量(見「今日重點」);build-infra 把 FlagCX wheel 與純 Python 元件發行通道推到位;外掛側同日新增壁仞 SUPA 與燧原 GCU 兩個後端點名。

1.1 FlagFFT:HCU 介面卡落地,MACA/Ascend 效能與證據收口,打包三件套合入(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:FlagFFT #12、#18、#22

主線詳見「今日重點」。補充三點:其一,MACA 線的驗收工具批把裝箱(pack8)門控、資源與證據記錄、三程序雙向小例固化成流程(15:39–16:17 集中十筆);其二,「docs: complete MACA IX and Ascend setup」(22:51)補齊三條後端的環境文件,與新後端的「環境文件 + 統一測試構建」做法相互呼應;其三,打包三件套(#12 / #18 / #19 / #20)於 09-21 午後集中合入,Nexus 上傳複用 org 級共享工作流。

1.2 build-infra:FlagCX wheel 通道六連合入、崑崙芯下發在審;純 Python 元件統一發布通道(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:build-infra #993、#995、#998、#1000

FlagCX 的 wheel 分發線在本視窗連推七筆(六合入 + 一在審):#994 釋出 wheel 線所需的構建工具鏈映象(12:45)、#995 把各行的裝置 bitcode 裝進 wheel(13:59)、#996 讓 FlagCX 自打包裝置 bitcode(15:30)、#997 wheel 通道再開四行(19:07)、#999 重構 join 命名(21:12)、#998 在「該行裝置所在處」構建 wheel(23:18);本晨在審的 #1000 把下發線延伸到崑崙芯(deliver the kunlunxin wheel)。這條線把跨晶片通訊庫的分發從「原始碼編譯 + 映象」推進到逐後端預編譯 wheel。

另一條是 noarch-deb 集中釋出通道(#993):為純 Python 元件建立單一工作流——一套邏輯覆蓋 FlagAudio、FlagSparse、FlagAttention 三個元件(差異收斂到一個 case 塊),構建前先按釋出線打版本(元件打包後設資料版本號與釋出線此前存在漂移),配套 noarch-rpm.yml。「容器映象之外」的原生包通道繼續加固。

1.3 FlagCX:v0.14.0-rc2.post2 釋出——清微 TSM torch 外掛連結修復(09-21)

日期:2026-09-21 來源:FlagCX #617、釋出頁

22:11 釋出 v0.14.0-rc2.post2,內容為 #617:torch_txda(清微 TSM 的 Torch 外掛)庫目錄解析修復——get_device_config() 的 txda 分支此前把庫目錄解析為 <package>/lib(該路徑在包中不存在),連結期報 cannot find -ltorch_txda;修復後在 TSM 執行時映象上實測透過。這是 rc2 線的第二個補丁版(繼 post1),延續 2.2 釋出件「逐後端逐個修補」的節奏(詳見 3.7)。

1.4 FlagGems-vllm:壁仞 SUPA 後端合入;昇騰 XCS 運算元批與六平臺 topk 調優(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:FlagGems-vllm #794、#816、#830、#828

壁仞 SUPA 後端:#794 合入(17:09),四個檔案——runtime/backend/_biren/ 初始化、啟發式配置、tune_configs 與 common.py;提交由壁仞工程師共同完成。又一家晶片廠商以「後端目錄 + 調參配置」的標準形態接入統一外掛。

昇騰 XCS 線:視窗內五枚運算元合入(#811 kda_state_scatter、#812 kda_conv_gather、#813 kda_conv_scatter、#814 paged_scatter、#815 indexer_epilogue、#816 slot_mapping),本晨 #828 跟進 pack_seq/unpack_seq 效能項。其中 #816 給出實測:把分頁 KV 的槽位對映從「每請求單 program」改為按(請求,token 塊)並行、int32 索引算術使除法降為移位——4 請求生產形態裝置時間 69 → 13 μs(5.5 倍)、整輪服務每卡 1050.9 → 81.2 ms(12.9 倍),且與上游 kernel 逐位一致。另有 #818 group_list_cumsum、#819 indexer_gemm_score 在審。

調優與 CI:#830 為全域性 topk 索引與長度運算元(compute_global_topk)在六個平臺(MetaX / Hygon / MThreads / Ascend 等)一併調參並補測試與基準;#780 讓 top_k_per_row_prefill/decode 在 mctle 構建上走 TLE 路徑;#829 新增手動運算元測試工作流。在審池保持高位:MThreads #822 / #823、MetaX #826 / #785、Hygon #827 / #820 / #803、Ascend #744、TLE mhc #734 等。

1.5 FlagGems:KernelGen 再入庫 Nvidia 運算元;崑崙芯修復批;海光 W8A8 TLE 管線替換(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:FlagGems #6005、#6264、#6518、#6346

KernelGen(Nvidia)13 枚:quantized_max_pool2d(#6005)、msort(#5844)、_standard_gamma(#6103)、masked_select_backward(#5824)、_thnn_differentiable_lstm_cell_backward(#5815)、row_stack(#6011)、batch_norm_gather_stats(#5747)、inner(#6320)、smm(#5964)、quantized_max_pool1d(#5938)、row_indices(#6012)、replication_pad1d_backward(#5922)、_lu_with_info(#5877)——自動生成管線持續為通用運算元庫補充長尾運算元。

崑崙芯修復批:五筆合入——add/cat/div 點式與佈局(#6264,add 快路徑把單次呼叫宿主時間從約 36 μs 降到約 5.5 μs,P800 上為原生實現的 0.84–1.56 倍)、sort(#6263)、moe_align 宿主後設資料與 padded fused-MoE 派發重構(#6398)、GEMM 執行維保持未特化以穩定內部引數佈局(#6415)、special_bessel_y1 / softplus / weight_norm 批(#6426)。

海光 W8A8(#6518):因 HCU 的 TLE 白名單支援載入類原語但拒絕流水類原語,把 mm_w8a8_int8 的三處流水改寫為分段 tl.range 迴圈(保留 TLE 載入),恢復被誤刪的 rms_norm_w8a16_fp8 公開匯入,並把海光加入基準的 FP8 能力檢查。

其他:#6346 為 copy 運算元補低精度與 FP8 測試(NVIDIA / Ascend / Hygon / 玄鐵 / MetaX / Iluvatar 六後端);upsample 三個反向 overloads(#6504 / #6505 / #6506);本晨合入 MTHREADS 的 index_add 與 index_add_(#6368)與 polar(#6026)最佳化;工程面有 RPM 打包回退(#6537)、CI 共享記憶體尺寸(#6541)、setup.sh 的 torch_npu 與 triton 匯入修復(#6545)、基準零延遲守衛(#6540)、fused_moe INT8 W8A8 分類(#6081)。在審:#6513 rrelu_with_noise。

1.6 FlagTree:天數 Iluvatar TLE 分散式與 TLE_RAW;NVIDIA TLE SMEM 子切片(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:FlagTree #1184、#1079、#1252、#1258

  • #1184(09-22 02:14,30 檔案):Iluvatar 後端同步至 Triton v3.6.x 線並擴充套件 TLE——新增 TLE 分散式(n_pes / get_device_id / remote_pointers / distributed_barrier,由 FlagCX 支撐)與 TLE_RAW(CoreX clang JIT + 延遲 dsl_region 物化);Gluon 改為常開註冊;把 nv_mma_shared_layout 重對映到 TCU swizzled shared,使 TLE GEMM 可走 SME G2S 流水。
  • #1079:NVIDIA TLE 新增 SMEM 子切片與多寫者 TMA 管道。
  • AMD:#1252 AtomicCAS 張量運算元執行緒謂詞(移植 triton #9605);#1240 CanonicalizePointers 的 scf.if fat-ptr 合併與非整數位轉換修復。
  • 沐曦 / AABS:#1258 修復 metax dot m 的 block_size 限制;#1253 在審(MACA MMA 佈局無法切分的 dot 保留在 blocked layout)。
  • CI / 打包:#1263 / #1264 把 GEMS 複用工作流納入 CORE 變更檢測;#1260 在審(rpm 安裝 clang 並打包 flagtree);#1259 PPU CI 增加 pid.txt 校驗在審。

1.7 其餘動態:FlagTensor 0.3.0-rc2 打包線、FlagQuantum 互操作、FlagSparse、FlagAudio、FlagOS-Compressor 等(09-21)

日期:2026-09-21 來源:FlagTensor #23、FlagQuantum、FlagOS-Compressor #9

  • FlagTensor(23):0.3.0-rc2 分支合入(#23,27 檔案:deb/rpm 打包、CMake 查詢 Torch、libflagtensor-nvidia-dev 拆分等)+ Nexus 上傳工作流(#20)+ 打包腳手架(#4),版本對齊 0.3.0 釋出線。FlagTensor 是 FlagOS 的 Triton 張量原語庫(一元 28 運算元、二元 4、收縮 6,對標 cuTensor 基線)——本視窗的實質動作是「進入打包與分發體系」。
  • FlagQuantum(19):互操作與一致性測試密集推進——Qiskit 差分一致性(#118)、PennyLane 差分一致性(#122)、Cirq 介面卡契約(#125)、Qiskit 多量子位酉矩陣轉換(#114)與算術參數列達式匯入(#111)、區域孿生電路校驗(#116 / #120),以及一批輸入校驗修復(#107 至 #127)。
  • FlagSparse(11):NCIC-AlphaSparse 協作分支連合三個 PR(#76 / #77 / #78)——MACA SpMV CSR 基線、XPU MACA 與 Ascend 測試等。
  • FlagAudio(5):pyproject.toml 缺逗號修復(#12)+ RPM 缺少 pyproject-rpm-macros 時的普通 pip 回退(#10)。
  • FlagOS-Compressor(3):面向 DeepSeek V4.1 與 MiMo V2.5 的線性 INT8 匯出(#9——頭掃描、矩形 FP8 塊、保留索引器與 Engram 表等)16:08 合入、16:59 被 Revert 撤回(提交資訊未說明原因),該能力暫回到合入前狀態。
  • FlagGems-sglang(2):燧原 GCU vendor 註冊(#99)。
  • 單筆:FlagBLAS mthreads L2 支援合入(#122)、FlagDNN 修復 ppu 測試、FlagPrism Nvidia dev 202609(#15)、FlagScale metax 引數修復(#1296)。

二、新聞報道與生態

2.1 元件級檢索連續第十七個平靜視窗(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:Google News RSS(中英文 24 組查詢詞,走代理)

以 FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen 等元件名做中英文檢索(when:7d 與 when:14d),24 小時視窗繼續零命中,構成元件級檢索連續第十七個平靜視窗(上一視窗為第十六個)。剔除說明:「智源研究院」關鍵詞命中以智譜 ZCode 資料風波系列與博彩 SEO 為主(與 FlagOS 無關,未收錄);HN 對 FlagOS / FlagGems 的檢索無相關命中。本視窗對外資訊面由成員單位側承接(2.2、2.3)。

2.2 沐曦 MXMACA 合入 LMCache 主線:成員單位軟體棧「上游優先」融入全球推理生態(09-18/09-21)

日期:2026-09-18(官宣)/ 2026-09-21(媒體波) 來源:沐曦官網、觀點網、LMCache PR #4606

沐曦與國際開源 KV Cache 專案 LMCache 達成合作,自研軟體棧 MXMACA 以「Upstream First」原則加入 LMCache 官方原生支援體系,程式碼合入主幹並建立隨版本迭代的 CI 驗證機制(路線圖見 LMCache #4833)。LMCache 由芝加哥大學團隊發起,現有 220+ 貢獻者、30+ 行業合作伙伴,是大模型推理 KV Cache 管理的主流開源專案。09-21 觀點網、鳳凰網等轉發官宣稿。「上游優先」在本棧同樣是一貫做法(向 PyTorch 與各上游社群貢獻),這一案例是國產算力融入全球推理生態的可對照路徑。

2.3 介面新聞盤點沐曦 39 個 Day 0 適配:國產 GPU「軟硬一體」生態敘事(09-21)

日期:2026-09-21 來源:介面新聞

13:52 釋出的盤點文章:截至 09-20,沐曦自 2025 年 12 月以來完成 39 個主流旗艦模型的 Day 0 適配(覆蓋智譜、阿里千問、MiniMax、DeepSeek、階躍星辰、騰訊混元等);MXMACA 軟體棧覆蓋驅動、使用者態介面、編譯器、運算元適配與訓練/推理框架,支援 40+ AI 框架、1000+ 模型與 6000+ 開源專案測試,全量支援 PyTorch 2.8 的 2410 個 GPU 運算元;並披露下一代曦雲 C700 核心設計與功能驗證大部分完成。「統一編譯器 + 運算元 + 框架多層覆蓋」的敘事與本棧的多晶片統一路徑互為映象,是成員單位對外傳播的主力素材。

三、成員單位深挖

3.1 沐曦:MACA 線三倉收口(FFT / 編譯器 / 訓練工具)(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:FlagFFT 提交、FlagTree #1258、FlagScale #1296

程式碼側三條:FlagFFT 的 MACA 線約 17 筆(FP64 暫存器交換實驗當日試落又撤回、pack8 按葉佈局門控、四步與直連混合基的共享記憶體預算、驗收工具與證據留檔,含三程序雙向小例結果);FlagTree 的 AABS 修復 metax dot m 塊大小限制(#1258 合入;#1253 在審);FlagScale 修 metax 引數(#1296 合入)。新聞側見 2.2 與 2.3——沐曦是本視窗對外與程式碼兩側同時最活躍的成員單位。

3.2 海光:FlagFFT HCU 介面卡與 FlagGems W8A8 TLE 替換(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:FlagFFT 提交、FlagGems #6518、FlagGems-vllm #803

  • FlagFFT:HCU(BW1000)後端介面卡與配套修復、文件(詳見「今日重點」與 1.1)——FFT 庫第一次把海光平臺納入後端矩陣。
  • FlagGems:#6518 用分段 tl.range 替換 HCU TLE 白名單不支援的流水原語,並恢復 rms_norm_w8a16_fp8 匯入、把海光加入基準 FP8 能力檢查。
  • 在審:FlagGems-vllm 三條海光線——#820 INT8 varlen flash attention、#803 INT8 塊狀 BMM 與 int8_einsum、#827 top_k_per_row_decode。

3.3 昇騰:XCS 運算元批與 NPU FFT 最佳化,910C vLLM 0.28 升級在審(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:FlagGems-vllm #816、#828、vllm-plugin-FL #487

  • FlagGems-vllm:XCS 運算元批(#811 至 #816,見 1.4 的效能數)、#828 pack_seq 與 unpack_seq 跟進、#821 TLE 最佳化 topk_softplus_sqrt、#744 fused_marlin_moe_w4a16_int4 在審。
  • FlagFFT:NPU 線合併單 CT 最佳化與 Stockham 批(約十筆)。
  • vllm-plugin-FL:#487「支援 vLLM 0.28(NVIDIA 與昇騰 910C)」在審;#484 NVIDIA 線 vLLM 0.28.0 已合入——vLLM 0.24 至 0.28 的升級線啟動。
  • FlagGems:#6545 修復 setup.sh 的 torch_npu 與 triton 匯入錯誤。

3.4 天數智芯:Iluvatar TLE 分散式合入(09-22)

日期:2026-09-22 來源:FlagTree #1184

凌晨合入的 30 檔案大 PR:Iluvatar 後端同步至 Triton v3.6.x,並擴充套件 TLE 分散式與 TLE_RAW、Gluon 常開、nv_mma_shared_layout 重對映到 TCU swizzled shared(詳見 1.6)。分散式原語由 FlagCX 支撐,是天數線在 FlagOS 內「編譯器 + 通訊」協同的一處體現;TLE_RAW 的 CoreX clang JIT 路徑亦為按該工具鏈特性做的工程適配。

3.5 摩爾執行緒:index_add / polar 最佳化合入,多條運算元 PR 在審(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 來源:FlagGems #6368、FlagGems-vllm #822、FlagBLAS #122

  • FlagGems:本晨 10:01 合入 index_add 與 index_add_ 效能最佳化(#6368)與 polar(#6026)。
  • FlagGems-vllm 在審:#822 fused_inv_rope_fp8_quant 移植與最佳化、#823 flash_attn_varlen_func 的 W8A8 FP8 支援、#831 top_k 窄值帶修復、#807 fp8_fp4_mqa_logits。
  • FlagTree:#1261 fmul_rn_fp32 libdevice 支援在審。
  • FlagBLAS:#122 mthreads L2 支援合入。

3.6 燧原:FlagGems-sglang 註冊 GCU vendor(09-21)

日期:2026-09-21 來源:FlagGems-sglang #99、vllm-plugin-FL #556

#99 把 enflame(gcu)後端接入 vendor 管道:註冊 vendors.ENFLAME、對映 torch 的 gcu 裝置屬性、標記缺少 fp64 / int64 支援、完成 VendorDescriptor(PrivateUse1 派發、TLE 啟用)、裝置查詢命令定為 efsmi -L、補 CodeGenConfig 與 num_warps 啟發式。vllm-plugin-FL 側 #556「按 MUSA 矩陣對齊 e2e 覆蓋」本晨更新——燧原線的外掛化接入與測試對齊同步推進。

3.7 清微智慧:FlagCX rc2.post2 修復 TSM torch 外掛(09-21)

日期:2026-09-21 來源:FlagCX #617

v0.14.0-rc2.post2 的唯一內容:修復 TSM(清微,構建選項 USE_TSM)Torch 外掛對 torch_txda 庫目錄的解析,解決 TSM 執行時映象上鍊接失敗(cannot find -ltorch_txda)。清微在本棧 2.2 線多點位出現(KernelGen 2.2.0 新增硬體、build-infra 映象行 tsingmicro-tsm260610、FlagCX 後端文件),本次修復令其 torch 外掛構建通路打通。

3.8 達摩院玄鐵:PPU 融合運算元合入與 PPU CI 校驗(09-21)

日期:2026-09-21 來源:FlagGems-vllm #796、FlagTree #1259

  • FlagGems-vllm #796:PPU(thead)版「逆 RoPE 與 FP8 量化融合」與「按 token 分組 FP8 量化」兩個運算元——因 FlagTree PPU 暫不能降級原生 tl.float8e4nv 指標與轉換,改用整數運算編碼 E4M3FN 並透過 uint8 無複製檢視寫出,無 torch 計算回退。
  • FlagDNN:修復 ppu 測試。
  • FlagTree:#1259 PPU CI 增加 pid.txt 校驗在審。

四、總結與趨勢觀察

  • 後端矩陣「逐庫補齊」:FFT 庫迎來海光 HCU;外掛側同日新增壁仞 SUPA 與燧原 GCU 兩個後端點名。「廠商自建後端目錄 + 調參配置」已是標準接入形態,多晶片覆蓋從釋出件矩陣延伸到每個基礎庫。
  • FFT 庫一日吞吐 = 工具鏈成熟度訊號:102 筆提交橫跨 MACA / NPU / HCU 三線,效能改動普遍附帶分配預算、門控與證據留檔(含當日試落又撤回的實驗)——開發流程從「能跑」轉入「可復現地調優」。
  • 分發形態三軌化:FlagCX wheel 攜帶裝置 bitcode(#995 至 #998,與在審的崑崙芯 #1000)、純 Python 元件統一 noarch deb/rpm 通道(#993)、FlagFFT 與 FlagTensor 打包三件套——釋出物從「映象 + 文件」擴到「wheel / deb / rpm + 映象」。
  • 2.2 收口與新版本線並行:六平臺 topk 調參(#830)、六後端 FP8 測試(#6346)、昇騰 XCS 效能項(#816)屬加固側;vLLM 0.28 升級(#484 已合入、#487 在審)與 FlagTree packaging(#1260 在審)屬下一版本側。
  • 此前較靜模組集體動作:FlagTensor(0.3.0-rc2 打包)、FlagAudio(打包修復)、FlagSparse(協作分支合併)與此前「待觀察」清單正好呼應——rc2 線內這些模組進入了驗收與分發動作。
  • 對外傳播仍低位:元件級檢索第十七個平靜視窗 vs 224 筆提交;成員單位側(沐曦 LMCache、39 個 Day 0)承擔對外資訊主力。待觀察:FlagOS-Compressor 撤回後的後續動作、vLLM 0.28 線在各後端的落地速度。

附錄:信源核查表

類別 信源 核查方式 結果
GitHub org: flagos-ai repos API 54 倉庫 pushed_at 全量核查 19 倉視窗內活躍
GitHub 提交搜尋 + 逐倉核對 視窗內逐條核驗 224 條(15 倉庫)+ 分支推送
GitHub releases.atom(24 倉掃描) 逐倉掃描 新增 FlagCX v0.14.0-rc2.post2
新聞 Google News RSS(中英文 24 組查詢詞,走代理) 24 小時視窗過濾 + 逐條剔除 元件詞零命中(第 17 個平靜視窗);成員詞保留 2 條
媒體 沐曦官網 / 介面新聞 / 觀點網 / 鳳凰網 原文抓取複核 LMCache 合入、39 個 Day 0 盤點
社群 智源社群 / HN Algolia 檢索複核 視窗內無 FlagOS 相關新稿
專案文件 FlagTensor / FlagFFT / FlagCX README 與 docs 原文抓取 後端清單與庫定位核對

完整信源清單

ms-vllm #820 — https://github.com/flagos-ai/FlagGems-vllm/pull/820 · #803 — https://github.com/flagos-ai/FlagGems-vllm/pull/803 · #827 — https://github.com/flagos-ai/FlagGems-vllm/pull/827