調査期間:2026-09-21 10:18 ~ 2026-09-22 10:00(約 24 時間;09-21 デイリーレポートの期間を引き継ぎ、空白なし) 情報源:GitHub(org: flagos-ai、54 リポジトリの pushed_at を全量核查、期間内に 19 リポジトリでプッシュあり;コミット検索は 224 件ヒット、15 リポジトリに跨る)、Google News RSS(中国語・英語 24 組のクエリ語、プロキシ経由)、沐曦公式サイト、界面新聞、観点網、智源コミュニティ等(詳細は付録の情報源リスト参照)


本期インデックス

  • 今日の重点:FlagFFT が海光バックエンドを補完——BW1000(HCU)アダプタが dev に進出、単一期間で 102 件のコミットが MACA/Ascend/HCU の三ラインに跨る(09-21/09-22)
    1. オープンソースプロジェクトの進展(GitHub 動向)
      • 1.1 FlagFFT:HCU アダプタが着地、MACA/Ascend の性能と証拠を収口、パッケージ三種セットをマージ(09-21/09-22)
      • 1.2 build-infra:FlagCX wheel チャネルの六連続マージ、崑崙芯の下発は審査中;純 Python コンポーネントの統一リリースチャネル(09-21/09-22)
      • 1.3 FlagCX:v0.14.0-rc2.post2 リリース——清微 TSM torch プラグインのリンク修正(09-21)
      • 1.4 FlagGems-vllm:壁仞 SUPA バックエンドをマージ;昇騰 XCS オペレータバッチと六プラットフォーム topk 調優(09-21/09-22)
      • 1.5 FlagGems:KernelGen が Nvidia オペレータを再登録;崑崙芯修正バッチ;海光 W8A8 TLE パイプライン置換(09-21/09-22)
      • 1.6 FlagTree:天数 Iluvatar TLE 分散と TLE_RAW;NVIDIA TLE SMEM サブスライス(09-21/09-22)
      • 1.7 その他の動向:FlagTensor 0.3.0-rc2 パッケージライン、FlagQuantum 相互運用、FlagSparse、FlagAudio、FlagOS-Compressor 等(09-21)
    1. ニュース報道とエコシステム
      • 2.1 コンポーネントレベル検索は連続十七回目の平静な期間(09-21/09-22)
      • 2.2 沐曦 MXMACA が LMCache メインラインにマージ:メンバー単位のソフトウェアスタックが「上流優先」でグローバル推論エコシステムに融合(09-18/09-21)
      • 2.3 界面新聞が沐曦の 39 件の Day 0 適配を総括:国産 GPU の「ソフト・ハード一体」エコシステム叙事(09-21)
    1. メンバー単位の深掘り
      • 3.1 沐曦:MACA ライン三リポジトリの収口(FFT / コンパイラ / 訓練ツール)(09-21/09-22)
      • 3.2 海光:FlagFFT HCU アダプタと FlagGems W8A8 TLE 置換(09-21/09-22)
      • 3.3 昇騰:XCS オペレータバッチと NPU FFT 最適化、910C vLLM 0.28 アップグレードは審査中(09-21/09-22)
      • 3.4 天数智芯:Iluvatar TLE 分散をマージ(09-22)
      • 3.5 摩尔線程:index_add/polar 最適化をマージ、複数のオペレータ PR が審査中(09-21/09-22)
      • 3.6 燧原:FlagGems-sglang が GCU vendor を登録(09-21)
      • 3.7 清微智能:FlagCX rc2.post2 が TSM torch プラグインを修正(09-21)
      • 3.8 達摩院玄鉄:PPU 融合オペレータをマージと PPU CI 検証(09-21)
    1. 総括と趨勢観察
  • 付録:情報源核查表
  • 完全な情報源リスト

今日の重点:FlagFFT が海光バックエンドを補完——BW1000(HCU)アダプタが dev に進出、単一期間で 102 件のコミットが三ラインに跨る

日付:2026-09-21 ~ 2026-09-22 出所:FlagFFT コミット記録(dev)

09-21 深夜から 09-22 午前にかけて、FlagFFT(Triton/TLE と libtriton_jit を通じて実行時にバックエンドターゲットカーネルを生成する JIT コンパイル FFT ライブラリ)は、海光 BW1000(HCU)バックエンドアダプタを dev ブランチにマージした:「Add HCU backend adaptor for BW1000」(09-21 22:39)を皮切りに、続いて hipFFT ハンドル変換の修正(22:55)、独立 capture と Torch HIP のリンク(23:01)、メモリ安全原策(09-22 00:11)が行われ、「Hygon BW1000 HCU 環境構築」「統一 HCU テストビルド」の二篇のドキュメント(09-22 08:44 / 08:47)と上流パッケージングのマージ(08:57)で締めくくられた。README の CMake バックエンドリストもこれに伴い CUDA / MUSA / PPU / IX / MACA / NPU / HCU の七項目に更新された——海光が初めて FFT ライブラリのバックエンドマトリクスに参入した。

同一ウィンドウ内で FlagFFT 単一リポジトリのコミット数は 102 筆に達し、他に二つのラインがそれぞれまとまった形で進んだ:MACA(沐曦)の性能収束——FP64 レジスタ交換実験は当日試行後に撤回(Revert)、pack8 はリーフレイアウトでゲート制御、四段階と直接接続の混合基数による共有メモリ予算、および一連のエビデンス記録付き受け入れツール;NPU(昇騰)は単一 CT 最適化をマージし Stockham バッチを着地(16 バタフライユニット、パック実数 FFT、限定ベクトルダウンストリームなど約十筆を同バッチで)。パッケージング方向の三件セットも同時にマージ:Debian + RPM パッケージング(#12)、Nexus リリースチャネル(#19 / #20)、0.2.0-rc2 移植(#18)、さらに nlohmann_json の下限を緩和(#22)——FFT ライブラリは本ウィンドウ内で「新規バックエンド + 性能収束 + 配布パッケージング」の三つを同時に完了した。


1. オープンソースプロジェクトの進展(GitHub 動態)

ウィンドウ総覧:org 内の 54 リポジトリのうち 19 個がウィンドウ内でプッシュあり;コミット検索は 224 条ヒット(15 リポジトリに跨る);他に FlagCX(リリースブランチ)、docs、vllm-plugin-FL などのリポジトリの PR とブランチ側プッシュは検索に計上していない。分布は:FlagFFT 102、FlagGems 29、FlagTensor 23、FlagQuantum 19、FlagGems-vllm 14、FlagSparse 11、build-infra 7、FlagTree 5、FlagAudio 5、FlagOS-Compressor 3、FlagGems-sglang 2、FlagPrism / FlagDNN / FlagBLAS / FlagScale 各 1。

本ウィンドウの形態 = 「FFT ライブラリのマルチバックエンドスプリント」+「リリースエンジニアリング収束」+「バックエンド配列の拡員」:FlagFFT がコミット量のほぼ半分を占める(「今日の重点」参照);build-infra は FlagCX wheel と純 Python コンポーネントのリリースチャネルを整備;プラグイン側では同日、壁仞 SUPA と燧原 GCU の二つのバックエンドが新たに指名された。

1.1 FlagFFT:HCU アダプタ着地、MACA/Ascend の性能とエビデンス収束、パッケージング三件セットをマージ(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 出所:FlagFFT #12、#18、#22

本線の詳細は「今日の重点」を参照。補足三点:第一に、MACA ラインの受け入れツールバッチがボクシング(pack8)ゲート制御、リソースとエビデンス記録、三プロセス双方向小例をフローとして固化した(15:39–16:17 に十筆集中);第二に、「docs: complete MACA IX and Ascend setup」(22:51)が三つのバックエンドの環境ドキュメントを補完し、新規バックエンドの「環境ドキュメント + 統一テストビルド」のやり方と呼応している;第三に、パッケージング三件セット(#12 / #18 / #19 / #20)が 09-21 午後に集中マージされ、Nexus アップロードは org レベルの共有ワークフローを再利用している。

1.2 build-infra:FlagCX wheel チャネルを六連マージ、崑崙芯への下発は審査中;純 Python コンポーネントの統一リリースチャネル(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 出所:build-infra #993、#995、#998、#1000

FlagCX の wheel 配布ラインは本ウィンドウ内で七筆連続プッシュ(六マージ + 一審査中):#994 は wheel ラインに必要なビルドツールチェーンイメージをリリース(12:45)、#995 は各行のデバイス bitcode を wheel に収容(13:59)、#996 は FlagCX 自身でデバイス bitcode をパッケージング(15:30)、#997 は wheel チャネルでさらに四行を開設(19:07)、#999 は join 命名をリファクタリング(21:12)、#998 は「当該行のデバイスがある場所」で wheel をビルド(23:18);本朝審査中の #1000 は下発ラインを崑崙芯に延伸(deliver the kunlunxin wheel)。このラインはクロスチップ通信ライブラリの配布を「ソースビルド + イメージ」からバックエンド別のプリコンパイル済み wheel へと前進させた。

もう一つの経路は noarch-deb 集中リリースチャネル(#993):純 Python コンポーネント向けに単一ワークフローを確立——一つのロジックで FlagAudio、FlagSparse、FlagAttention の 3 コンポーネントをカバー(差分は 1 つの case ブロックに収束)、ビルド前にまずリリースラインに沿ってバージョン付け(コンポーネントのパッケージメタデータバージョン番号とリリースラインの間には以前からドリフトが存在)、併せて noarch-rpm.yml を整備。「コンテナイメージの外側」のネイティブパッケージチャネルは引き続き強化される。

1.3 FlagCX:v0.14.0-rc2.post2 リリース——清微 TSM torch プラグインのリンク修正(09-21)

日付:2026-09-21 情報源:FlagCX #617、リリースページ

22:11 に v0.14.0-rc2.post2 をリリース、内容は #617:torch_txda(清微 TSM の Torch プラグイン)のライブラリディレクトリ解決の修正——get_device_config() の txda 分岐は従来、ライブラリディレクトリを <package>/lib と解決していた(このパスはパッケージ内に存在しない)ため、リンク時に cannot find -ltorch_txda を報告していた。修正後は TSM ランタイムイメージ上で実測パスを確認。これは rc2 ラインの 2 番目のパッチ版(post1 に続く)であり、2.2 リリース物の「バックエンドごとに個別に修正していく」ペースを継続している(詳細は 3.7 参照)。

1.4 FlagGems-vllm:壁仞 SUPA バックエンドがマージ;昇騰 XCS オペレータバッチと 6 プラットフォーム topk チューニング(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 情報源:FlagGems-vllm #794、#816、#830、#828

壁仞 SUPA バックエンド:#794 がマージ(17:09)、4 ファイル——runtime/backend/_biren/ の初期化、ヒューリスティック設定、tune_configs と common.py;コミットは壁仞のエンジニアが共同で完成。さらに一社のチップベンダーが「バックエンドディレクトリ + パラメータチューニング設定」という標準の形態で統一プラグインに接続した。

昇騰 XCS ライン:調査期間内に 5 オペレータがマージ(#811 kda_state_scatter、#812 kda_conv_gather、#813 kda_conv_scatter、#814 paged_scatter、#815 indexer_epilogue、#816 slot_mapping)、今朝は #828 が pack_seq/unpack_seq の性能項目をフォローアップ。このうち #816 は実測値を提示:ページド KV のスロットマッピングを「リクエストごとに単一 program」から(リクエスト、token ブロック)単位の並列へ変更し、int32 インデックス演算により除算をシフトに低減——4 リクエストの本番形態でデバイス時間は 69 → 13 μs(5.5 倍)、サービス全体で 1 カードあたり 1050.9 → 81.2 ms(12.9 倍)、かつ上流 kernel とビット単位で一致。ほかに #818 group_list_cumsum、#819 indexer_gemm_score が審査中。

チューニングと CI:#830 はグローバル topk インデックスと長さオペレータ(compute_global_topk)を 6 プラットフォーム(MetaX / Hygon / MThreads / Ascend など)で一括チューニングし、テストとベンチマークを補完;#780 は top_k_per_row_prefill/decode を mctle ビルド上で TLE パス経由に;#829 は手動オペレータテストワークフローを新設。審査中プールは高水準を維持:MThreads #822 / #823、MetaX #826 / #785、Hygon #827 / #820 / #803、Ascend #744、TLE mhc #734 など。

1.5 FlagGems:KernelGen がさらに Nvidia オペレータを格納;崑崙芯修正バッチ;海光 W8A8 TLE パイプライン置換(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 情報源:FlagGems #6005、#6264、#6518、#6346

KernelGen(Nvidia)13 枚:quantized_max_pool2d(#6005)、msort(#5844)、_standard_gamma(#6103)、masked_select_backward(#5824)、_thnn_differentiable_lstm_cell_backward(#5815)、row_stack(#6011)、batch_norm_gather_stats(#5747)、inner(#6320)、smm(#5964)、quantized_max_pool1d(#5938)、row_indices(#6012)、replication_pad1d_backward(#5922)、_lu_with_info(#5877)——自動生成パイプラインは引き続き汎用オペレータライブラリにロングテールオペレータを補充している。

昆仑芯修正バッチ:5 件をマージ——add/cat/div のポイント式とレイアウト(#6264、add 高速パスにより単一呼び出しのホスト時間が約 36 μs から約 5.5 μs に短縮、P800 上ではネイティブ実装の 0.84~1.56 倍)、sort(#6263)、moe_align ホストメタデータと padded fused-MoE ディスパッチの再構築(#6398)、GEMM 実行次元を未特殊化のまま保持して内部パラメータレイアウトを安定化(#6415)、special_bessel_y1 / softplus / weight_norm バッチ(#6426)。

海光 W8A8(#6518):HCU の TLE ホワイトリストがロード系プリミティブのサポートを許可する一方でパイプライン系プリミティブを拒否するため、mm_w8a8_int8 の 3 箇所のパイプライン記述をセグメント化された tl.range ループに書き換え(TLE ロードは保持)、誤って削除された rms_norm_w8a16_fp8 の公開インポートを復元し、海光をベンチマークの FP8 能力チェックに追加した。

その他:#6346 は copy オペレータに低精度と FP8 テストを追加(NVIDIA / Ascend / Hygon / 玄鉄 / MetaX / Iluvatar の 6 バックエンド);upsample の 3 つの逆方向 overloads(#6504 / #6505 / #6506);今朝マージされた MTHREADS の index_add と index_add_(#6368)および polar(#6026)の最適化;エンジニアリング面では RPM パッケージングのロールバック(#6537)、CI 共有メモリサイズ(#6541)、setup.sh の torch_npu と triton インポート修正(#6545)、ベンチマークのゼロ遅延ガード(#6540)、fused_moe INT8 W8A8 分類(#6081)。レビュー中:#6513 rrelu_with_noise。

1.6 FlagTree:天数 Iluvatar TLE 分散と TLE_RAW;NVIDIA TLE SMEM サブスライス(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 情報源:FlagTree #1184、#1079、#1252、#1258

  • #1184(09-22 02:14、30 ファイル):Iluvatar バックエンドを Triton v3.6.x ラインに同期し TLE を拡張——TLE 分散(n_pes / get_device_id / remote_pointers / distributed_barrier、FlagCX が支える)と TLE_RAW(CoreX clang JIT + 遅延 dsl_region 実体化)を新規追加;Gluon を常時有効な登録に変更;nv_mma_shared_layout を TCU swizzled shared に再マッピングし、TLE GEMM が SME G2S パイプラインを通れるようにした。
  • #1079:NVIDIA TLE に SMEM サブスライスとマルチライター TMA パイプラインを新規追加。
  • AMD:#1252 AtomicCAS テンソルオペランドのスレッド述語(triton #9605 を移植);#1240 CanonicalizePointers の scf.if fat-ptr マージと非整数ビット変換の修正。
  • 沐曦 / AABS:#1258 metax dot m の block_size 制限を修正;#1253 レビュー中(MACA MMA レイアウトで分割できない dot を blocked layout に保持)。
  • CI / パッケージング:#1263 / #1264 で GEMS 再利用ワークフローを CORE 変更検出に組み込み;#1260 レビュー中(rpm で clang をインストールし flagtree をパッケージング);#1259 PPU CI に pid.txt 検証を追加、レビュー中。

1.7 その他の動向:FlagTensor 0.3.0-rc2 パッケージングライン、FlagQuantum 相互運用、FlagSparse、FlagAudio、FlagOS-Compressor など(09-21)

日付:2026-09-21 情報源:FlagTensor #23、FlagQuantum、FlagOS-Compressor #9

  • FlagTensor(23):0.3.0-rc2 ブランチをマージ(#23、27 ファイル:deb/rpm パッケージング、CMake による Torch 検索、libflagtensor-nvidia-dev 分割など)+ Nexus アップロードワークフロー(#20)+ パッケージングスキャフォールド(#4)、バージョンを 0.3.0 リリースラインに整合。FlagTensor は FlagOS の Triton テンソルプリミティブライブラリ(単項 28 オペレータ、二項 4、縮約 6、cuTensor ベースラインに対標)——本調査期間の実質的な動きは「パッケージングと配布体系への参入」である。
  • FlagQuantum(19):相互運用と一貫性テストを集中的に推進——Qiskit 差分一貫性(#118)、PennyLane 差分一貫性(#122)、Cirq アダプタ契約(#125)、Qiskit マルチ量子ビットユニタリ行列変換(#114)と算術パラメータ式インポート(#111)、領域双子回路検証(#116 / #120)、および一連の入力検証修正(#107 から #127)。
  • FlagSparse(11):NCIC-AlphaSparse 協作ブランチで三つの PR を連続マージ(#76 / #77 / #78)——MACA SpMV CSR ベースライン、XPU MACA と Ascend テストなど。
  • FlagAudio(5):pyproject.toml のカンマ欠落修正(#12)+ RPM で pyproject-rpm-macros が欠如している場合の通常 pip フォールバック(#10)。
  • FlagOS-Compressor(3):DeepSeek V4.1 と MiMo V2.5 向けの線形 INT8 エクスポート(#9——ヘッドスキャン、矩形 FP8 ブロック、インデクサと Engram テーブルの保持など)16:08 にマージ、16:59 に Revert で撤回(コミットメッセージに理由の記載なし)、当該機能は一時的にマージ前の状態に戻った。
  • FlagGems-sglang(2):燧原 GCU vendor 登録(#99)。
  • 単発:FlagBLAS mthreads L2 サポートのマージ(#122)、FlagDNN の ppu テスト修正、FlagPrism Nvidia dev 202609(#15)、FlagScale metax パラメータ修正(#1296)。

2. ニュース報道とエコシステム

2.1 コンポーネント単位検索は連続十七回目の平穏な調査期間(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 情報源:Google News RSS(中国語・英語 24 組のクエリ語、プロキシ経由)

FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen などのコンポーネント名で中日英検索(when:7d と when:14d)を実施、24 時間ウィンドウは引き続きゼロヒットで、コンポーネント級検索が連続十七番目の平穏ウィンドウとなる(前ウィンドウは十六番目)。除外説明:「智源研究院」キーワードのヒットは智譜 ZCode データ騒動シリーズとギャンブル SEO が中心(FlagOS とは無関係、未収録);HN の FlagOS / FlagGems 検索に関連ヒットなし。本ウィンドウの対外情報面はメンバー単位側が担当(2.2、2.3)。

2.2 沐曦 MXMACA が LMCache メインラインに合流:メンバー単位ソフトウェアスタックの「上流優先」によるグローバル推論エコシステムへの融合(09-18/09-21)

日付:2026-09-18(公式発表)/ 2026-09-21(メディア波) 出典:沐曦公式サイト、観点網、LMCache PR #4606

沐曦は国際オープンソース KV Cache プロジェクト LMCache と提携し、自社開発ソフトウェアスタック MXMACA を「Upstream First」原則のもと LMCache 公式ネイティブサポート体系に加え、コードをメイントランクにマージし、バージョンイテレーションに追随する CI 検証メカニズムを構築した(ロードマップは LMCache #4833 参照)。LMCache はシカゴ大学チームが立ち上げ、現在 220+ のコントリビューター、30+ の業界パートナーを擁し、大規模モデル推論 KV Cache 管理の主流オープンソースプロジェクトである。09-21 に観点網、鳳凰網などが公式発表稿を転載した。「上流優先」は本スタックにおいても一貫した方針であり(PyTorch および各上流コミュニティへの貢献)、この事例は国産算力がグローバル推論エコシステムに融合する比較可能な経路である。

2.3 界面新聞が沐曦の 39 件の Day 0 適配を総括:国産 GPU「ソフト・ハード一体」エコシステムの語り(09-21)

日付:2026-09-21 出典:界面新聞

13:52 公開の総括記事:09-20 時点で、沐曦は 2025 年 12 月以来 39 の主流フラッグシップモデルの Day 0 適配を完了(智譜、阿里千問、MiniMax、DeepSeek、階躍星辰、騰訊混元などをカバー);MXMACA ソフトウェアスタックはドライバ、ユーザー態インターフェース、コンパイラ、オペレータ適配と訓練/推論フレームワークをカバーし、40+ の AI フレームワーク、1000+ のモデルと 6000+ のオープンソースプロジェクトのテストをサポートし、PyTorch 2.8 の 2410 個の GPU オペレータを全量サポート;さらに次世代曦雲 C700 のコア設計と機能検証が大部分完了したことを開示。「統一コンパイラ + オペレータ + フレームワークの多層カバレッジ」という語りは本スタックのマルチチップ統一経路と相互に鏡像をなす、メンバー単位の対外発信における主力素材である。

3. メンバー単位の深掘り

3.1 沐曦:MACA ライン三リポジトリの収束(FFT / コンパイラ / 訓練ツール)(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 出典:FlagFFT コミット、FlagTree #1258、FlagScale #1296

コード側の三本:FlagFFT の MACA ライン約 17 筆(FP64 レジスタ交換実験は当日試行マージ後に撤回、pack8 はリーフレイアウトによるゲーティング、四段階と直結混合基数の共有メモリ予算、検収ツールと証跡の留档、三プロセス双方向の小例結果を含む);FlagTree の AABS 修復で metax dot m ブロックサイズ制限(#1258 マージ済み;#1253審査中);FlagScale の metax パラメータ修正(#1296 マージ済み)。ニュース側は 2.2 と 2.3 を参照——沐曦は本ウィンドウにおいて対外・コード両側で同時に最も活発なメンバー単位である。

3.2 海光:FlagFFT HCU アダプタと FlagGems W8A8 TLE 置換(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 出典:FlagFFT コミット、FlagGems #6518、FlagGems-vllm #803

  • FlagFFT:HCU(BW1000)バックエンドアダプタと付随する修正、ドキュメント(詳細は「今日の重点」と1.1)——FFTライブラリが初めて海光プラットフォームをバックエンドマトリックスに組み込んだ。
  • FlagGems:#6518 でセグメント化された tl.range を用いて HCU TLE ホワイトリストがサポートしないパイプライン原語を置き換え、rms_norm_w8a16_fp8 のインポートを復元し、海光をベンチマーク FP8 能力チェックに追加。
  • 審査中:FlagGems-vllm の海光線3件——#820 INT8 varlen flash attention、#803 INT8 ブロック状 BMM と int8_einsum、#827 top_k_per_row_decode。

3.3 昇騰:XCS オペレータバッチと NPU FFT 最適化、910C vLLM 0.28 アップグレードが審査中(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 情報源:FlagGems-vllm #816、#828、vllm-plugin-FL #487

  • FlagGems-vllm:XCS オペレータバッチ(#811 から #816、性能数値は 1.4 参照)、#828 pack_seq と unpack_seq のフォローアップ、#821 TLE 最適化 topk_softplus_sqrt、#744 fused_marlin_moe_w4a16_int4 が審査中。
  • FlagFFT:NPU 線で単一 CT 最適化と Stockham バッチ(約10件)をマージ。
  • vllm-plugin-FL:#487「vLLM 0.28(NVIDIA と昇騰 910C)をサポート」が審査中;#484 NVIDIA 線 vLLM 0.28.0 はすでにマージ済み——vLLM 0.24 から 0.28 へのアップグレード線が始動。
  • FlagGems:#6545 setup.sh の torch_npu と triton のインポートエラーを修正。

3.4 天数智芯:Iluvatar TLE 分散のマージ(09-22)

日付:2026-09-22 情報源:FlagTree #1184

未明にマージされた30ファイルの大型 PR:Iluvatar バックエンドを Triton v3.6.x に同期し、TLE 分散と TLE_RAW の拡張、Gluon 常時有効化、nv_mma_shared_layout の TCU swizzled shared へのリマッピングを実施(詳細は 1.6)。分散原語は FlagCX が支える。これは天数線が FlagOS 内で「コンパイラ + 通信」を協調させた一つの体现であり、TLE_RAW の CoreX clang JIT パスも当該ツールチェーンの特性に合わせた工程適配である。

3.5 摩尔線程:index_add / polar 最適化のマージ、複数のオペレータ PR が審査中(09-21/09-22)

日付:2026-09-21 ~ 2026-09-22 情報源:FlagGems #6368、FlagGems-vllm #822、FlagBLAS #122

  • FlagGems:今朝 10:01 に index_add と index_add_ の性能最適化(#6368)と polar(#6026)をマージ。
  • FlagGems-vllm 審査中:#822 fused_inv_rope_fp8_quant の移植と最適化、#823 flash_attn_varlen_func の W8A8 FP8 サポート、#831 top_k 狭値帯の修正、#807 fp8_fp4_mqa_logits。
  • FlagTree:#1261 fmul_rn_fp32 libdevice サポートが審査中。
  • FlagBLAS:#122 mthreads L2 サポートがマージ済み。

3.6 燧原:FlagGems-sglang が GCU ベンダーを登録(09-21)

日付:2026-09-21 情報源:FlagGems-sglang #99、vllm-plugin-FL #556

#99 enflame(gcu)バックエンドを vendor パイプラインに接続:vendors.ENFLAME の登録、torch の gcu デバイス属性のマッピング、fp64 / int64 サポート欠如のマーク、VendorDescriptor(PrivateUse1 ディスパッチ、TLE 有効化)の完成、デバイスクエリコマンドを efsmi -L に確定、CodeGenConfig と num_warps ヒューリスティックの補完。vllm-plugin-FL 側 #556「MUSA マトリクスに合わせて e2e カバレッジを整列」は今朝更新——燧原ラインのプラグイン化接続とテスト整列を同時に推進。

3.7 清微智能:FlagCX rc2.post2 が TSM torch プラグインを修正(09-21)

日付:2026-09-21 情報源:FlagCX #617

v0.14.0-rc2.post2 の唯一の内容:TSM(清微、ビルドオプション USE_TSM)Torch プラグインの torch_txda ライブラリディレクトリの解決を修正し、TSM ランタイムイメージ上でのリンク失敗(cannot find -ltorch_txda)を解決。清微は本スタック 2.2 ラインの複数ポイントに出現しており(KernelGen 2.2.0 の新規ハードウェア、build-infra イメージ行 tsingmicro-tsm260610、FlagCX バックエンドドキュメント)、今回の修正によりその torch プラグインビルド経路が開通した。

3.8 達摩院玄鉄:PPU 融合オペレータのマージと PPU CI 検証(09-21)

日付:2026-09-21 情報源:FlagGems-vllm #796、FlagTree #1259

  • FlagGems-vllm #796:PPU(thead)版「逆 RoPE と FP8 量子化の融合」および「トークン単位のグループ化 FP8 量子化」の 2 オペレータ——FlagTree PPU が現時点でネイティブ tl.float8e4nv ポインタと変換を降格できないため、整数演算で E4M3FN をエンコードし uint8 のノーコピービューを通じて書き出す方式に変更、torch 計算へのフォールバックなし。
  • FlagDNN:ppu テストを修正。
  • FlagTree:#1259 PPU CI に pid.txt 検証を追加、審査中。

4. 総括とトレンド観察

  • バックエンドマトリクス「ライブラリごとの逐次補完」:FFT ライブラリに海光 HCU が加わる。プラグイン側では同日、壁仞 SUPA と燧原 GCU の 2 つのバックエンドポイントが新たに指名された。「ベンダー自建バックエンドディレクトリ + パラメータ調整設定」はすでに標準的な接続形態であり、マルチチップカバレッジはリリース物マトリクスから各基礎ライブラリへと延伸している。
  • FFT ライブラリの 1 日スループット = ツールチェーン成熟度のシグナル:102 件のコミットが MACA / NPU / HCU の 3 ラインにまたがり、性能変更には一般に割り当て予算、ゲーティング、証跡の記録(当日試行して撤回した実験を含む)が付随——開発プロセスが「動く」から「再現可能にチューニングする」へ移行。
  • 配布形態の三軌化:FlagCX wheel はデバイス bitcode を同梱(#995 から #998、審査中の崑崙芯 #1000 とともに)、純 Python コンポーネントは noarch deb/rpm チャネルに統一(#993)、FlagFFT と FlagTensor はパッケージング三点セット——リリース物は「イメージ + ドキュメント」から「wheel / deb / rpm + イメージ」へ拡大。
  • 2.2 の収束と新バージョンラインの並行:6 プラットフォーム topk パラメータ調整(#830)、6 バックエンド FP8 テスト(#6346)、昇騰 XCS 性能項目(#816)は堅牢化側;vLLM 0.28 アップグレード(#484 マージ済み、#487 審査中)と FlagTree packaging(#1260 審査中)は次バージョン側。
  • これまで比較的静かだったモジュールの集団的動作:FlagTensor(0.3.0-rc2 パッケージング)、FlagAudio(パッケージング修正)、FlagSparse(協作ブランチのマージ)は、以前の「要観察」リストと呼応——rc2 ライン内でこれらのモジュールが検収と配布の動作に入った。
  • 対外発信は依然低調:コンポーネントレベルの検索は 17 番目の平静な調査期間 vs 224 件のコミット;メンバー単位側(沐曦 LMCache、39 の Day 0)が対外情報の主力を担う。要観察:FlagOS-Compressor 撤回後の後続アクション、vLLM 0.28 ラインの各バックエンドでの展開速度。

付録:情報源検証表

カテゴリ 情報源 検証方式 結果
GitHub org: flagos-ai repos API 54 リポジトリの pushed_at 全量検証 19 リポジトリが調査期間内に活動
GitHub コミット検索 + リポジトリ別照合 調査期間内を1件ずつ検証 224 件(15 リポジトリ)+ ブランチプッシュ
GitHub releases.atom(24 リポジトリ走査) リポジトリ別走査 新規 FlagCX v0.14.0-rc2.post2
ニュース Google News RSS(中国語・英語 24 組の検索語、プロキシ経由) 24 時間枠でフィルタ + 1件ずつ除外 コンポーネント語はゼロヒット(第 17 の平穏な調査期間);メンバー語は 2 件を保持
メディア 沐曦公式サイト / 界面新聞 / 観点網 / 鳳凰網 原文取得による再確認 LMCache マージ、39 件の Day 0 総括
コミュニティ 智源コミュニティ / HN Algolia 検索再確認 調査期間内に FlagOS 関連の新規記事なし
プロジェクトドキュメント FlagTensor / FlagFFT / FlagCX README と docs 原文取得 バックエンド一覧とライブラリの位置づけを照合

完全な情報源リスト

ms-vllm #820 — https://github.com/flagos-ai/FlagGems-vllm/pull/820 · #803 — https://github.com/flagos-ai/FlagGems-vllm/pull/803 · #827 — https://github.com/flagos-ai/FlagGems-vllm/pull/827