調査期間:2026-09-29 10:00 ~ 2026-09-30 10:00(24時間;水曜日枠;09-29 デイリーレポート枠を引き継ぎ、空白なし) 情報源:GitHub(org: flagos-ai、54リポジトリの pushed_at を全量核查、期間内に16リポジトリが活発、12リポジトリに期間内コミット;コミット検索168件を全量逐条検証;他に Torch-FL / FlagScale / FlagGems-vllm / FlagGems-sglang / FlagTree のタグと Release アトム、community #124 ~ #125、build-infra 約30件のマージ記録、docs 文書バッチ、release-info ポータル7回のデプロイ、FlagFFT ブランチ級活動を確認)、Google News RSS(中英文24組のクエリ語、プロキシ経由)、鳳凰網 / 新浪財経などの報道(詳細は付録の情報源リストを参照)


本期インデックス

  • 今日の重点:Torch-FL v2.10.0 リリースがリポジトリに反映——FlagOS 2.2 リストの最後の項目が補完(09-29)
    1. オープンソースプロジェクトの進展(GitHub 動向)
      • 1.1 Torch-FL:v2.10.0 正式リリース——2.2 最後の項目を補完(09-29)
      • 1.2 Torch-FL(二):リリースパイプラインの反復——候補タグからベンダー wheel へ(09-29 ~ 09-30)
      • 1.3 community:収尾修正の2件と八庫截点政策(09-29)
      • 1.4 リリース物の刷新:FlagScale タグ再構築と FlagGems 系2リポジトリの Release(09-29)
      • 1.5 build-infra:三線ミラー記録の収尾——mthreads / ascend / enflame(09-29 ~ 09-30)
      • 1.6 FlagGems:KernelGen オペレータバッチと Ascend 性能バッチ(09-29 ~ 09-30)
      • 1.7 FlagGems-vllm / FlagGems-Experimental:KMCompiler カーネルと 5.5 alpha 線(09-29 ~ 09-30)
      • 1.8 FlagTree:metax 後置パッチタグと全バックエンドスケジューリングワークフロー(09-29)
      • 1.9 FlagQuantum:カーネルディレクトリルーティングと性能融合バッチ(09-29 ~ 09-30)
      • 1.10 その他の動向:FlagCX / FlagFFT / FlagAttention / docs / vllm-plugin-FL(09-29 ~ 09-30)
    1. 報道とエコシステム
      • 2.1 コンポーネント級検索は連続23回目の平穏な期間(09-29 ~ 09-30)
      • 2.2 摩尔線程:無錫(恵山)国産智算センター稼働3ヶ月——六大智能体が着地(09-29)
    1. メンバー機関の深掘り
      • 3.1 摩尔線程:musa ミラーバッチ、MUSA 3D 最適化ブランチと無錫産業(09-29)
      • 3.2 昇騰:megatron 0.18.2 四変体と FlagGems 性能バッチ(09-29)
      • 3.3 海光 / 沐曦:性能オペレータバッチと metax 後置パッチ(09-29)
      • 3.4 燧原 / 天数:ミラーバッチと iluvatar 融合カーネル(09-29 ~ 09-30)
      • 3.5 崑崙芯 / 寒武紀 / 達磨院玄鉄 / 地平線:その他の要点(09-29 ~ 09-30)
    1. 総括とトレンド観察
  • 付録:情報源核查表
  • 完全情報源リスト

今日の重点:Torch-FL v2.10.0 リリースがリポジトリに反映——FlagOS 2.2 リストの最後の項目が補完(09-29)

日付:2026-09-29 出典:Torch-FL v2.10.0 Release、community #124、community #125

09-28 デイリーレポートにおける 2.2 リスト(24項目)の「唯一の空白」Torch-FL が本期間にリポジトリへ反映——12:34 / 17:01 の2つの候補タグ(v2.10.0rc1 / rc2)が先行してリリースパイプラインを演練し、18:17 に Release を建立、18:20 に正式リリース:

  • リリース内容:torch-fl は FlagOS の PyTorch デバイスプラグイン——オペレータごとのルーティング(ネイティブベンダーカーネル / FlagGems 可搬カーネル / CUDA 互換 boxing / CPU フォールバック)を単一の flagos デバイスの下に統合し、同一の PyTorch プログラムをコード変更なしで九種類の加速プラットフォームで実行可能:NVIDIA(A100 / H800)、昇騰(910C)、海光(BW1000)、沐曦(C550)、達磨院玄鉄(ZW810E)、摩尔線程(S5000)、燧原(S60)、崑崙芯(P800)と地平線系 BPU(s600)。
  • バージョンとパッケージング:本バージョンよりバージョン番号はバインドされた PyTorch マイナーバージョンラインに追随(今回は >=2.10,<2.11);wheel の命名は torch_fl-2.10.0+<sdk>(例 +cuda13.3 / +dtk2604 / +cann9.0.0)、「一つのタグ、プラットフォームごとに一つの成果物」;wheel は自己記述的(compatibility.json にプラットフォーム、カーネルセット、ビルド ABI と FlagTree / FlagGems / FlagCX のピン留めバージョンを記録)で、torch-fl-preflight 検証 CLI を同梱(torch_fl をインポートせずに環境をチェック可能)。
  • 検証基準:DDP と FSDP2 は主要カードで全て通過;torch.compile は flagos を一級の inductor GPU デバイスとして登録(FlagTree バックエンドは六社をカバー、燧原はベンダー Triton、BPU はオンボードコンパイラ);profiler は CUPTI に整合(各社専用 tracer を含む);クロスプラットフォームベンチマーク(Qwen-Image-2.1、シングルカード 1024²、40 ステップ)では H100 ネイティブ 6.52 秒/画像に対して FlagOS H100 10.67、摩尔線程 S5000 14.87、海光 BW1000 23.59、昇騰 910C 24.94、沐曦 C550 31.61、達磨院玄鉄 ZW810E 37.44、燧原 S60 58.04(画質は H100 と整合、CLIP-Score 偏差は ±1.6% 以内);純 CPU Arm パス(Mac M5 Pro)は PyTorch CPU 対比 1.74 倍の加速を達成。
  • 三つの新機能:新チップバックエンド接続 skill(本期間に T-Head ZW810E と崑崙芯 P800 がこのパスで導入)、boxing パスの FP8 / FP4 ソフトウェアエミュレーション(FP8 ハードウェアが利用不可の場合)、オペレータレベルの自動経路選択チューニング。
  • 境界説明(リリース物に同梱):torch.compile の各バックエンドは依然として実験的機能;崑崙芯 P800 の profiler / RNG と compile はまだロードマップ上;flex_attention は本バージョン未対応;BPU s600 は torch.compile のグラフデバイスとしてのみ機能(eager は CPU にフォールバック)。
  • 規模:v0.1.0 以降累計 269 コミット(62 機能 / 101 修正 / 11 性能 / 25 CI / 18 ドキュメント / 16 テスト / 10 リファクタリング / 4 ビルド)、HuggingFace 100+ モデルをマトリクスの各ボードで検証。

判断:これで 2.2 公式リストの全 24 項目に対応するリリース物がリポジトリに揃った(リスト中の Torch-FL 項目のレビュースナップショットは依然 pending、これは想定内で、次の修正バッチで更新予定);「タグ → Release → wheel → イメージ」の四種類の成果物チェーンが本期間で閉じた。


1. オープンソースプロジェクトの進展(GitHub 動向)

1.1 Torch-FL:v2.10.0 正式リリース——2.2 の最後の項目を補完(09-29)

日付:2026-09-29 情報源:Torch-FL v2.10.0、Torch-FL タグリスト、compare v0.1.0…main

  • タイムライン:rc1 タグ 12:34(「候補タグをリリース可能にする」コミット上に位置)→ rc2 タグ 17:01 → Release オブジェクト 18:17 作成、18:20 リリース;正式タグ v2.10.0 は rc2 と同一コミットを指す(#481 ベンダー runner リリースライン)。
  • プラットフォーム明細(リリース物マトリクス):昇騰 910C 354 個のルーティングオペレータ、FlagGems ルーティング 221 → 225、Qwen3-0.6B 訓練実測で torch_npu の 0.82 倍;海光 BW1000 は CUDA boxing 経由で 2033 個のオペレータをルーティング、FlagGems ルーティング 388 → 470;沐曦 C550 cu-bridge 2033 オペレータ、ルーティング 377 → 443;達摩院玄鉄 ZW810E ルーティング 390 → 435;摩尔線程 S5000 ネイティブ mudnn 105 カーネル、ルーティング 391 → 468;燧原 S60 ネイティブ libtopsaten 224 カーネル、Qwen-Image-2512 を 7.1 秒/ステップに最適化;崑崙芯 P800 2022 オペレータ、380 条の FlagGems-Python ルーティング;NVIDIA 側は FlagGems-C++ ディスパッチ経路が投入(18 条)。
  • 分散:collectives はプラットフォームごとに FlagCX+MCCL(MUSA)、FlagCX(GCU)、DTK 上の RCCL、HCCL フォールバックと NCCL 形ルーティングを経由;gloo リクエストは flagos バックエンドで応答。
  • 意味:rc 候補ラインが先行し、正式タグが翌日となる「越夜リリースウィンドウ」の進め方は、2.2 メジャーバージョンリリースの組織方法と一致する——まず成果物パイプラインを検証し、その後正式オブジェクトを確定する。

1.2 Torch-FL(二):リリースパイプラインの反復——候補タグからベンダー wheel まで(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 ソース:#473、#474、#475、#476、#480、#483

  • パッケージング規範:#473 wheel は構築された SDK に従って命名、プラットフォームごとにインタプリタを固定(CUDA / GCU / MetaX / PPU は 3.12、DCU / MUSA は 3.10、昇騰は 3.11)。
  • タグ駆動:#474 タグから wheel を構築してリリース;#475 リリース候補タグをリリース可能にする(rc1 / rc2 はこのメカニズムで通過)。
  • アップロード信頼性:#476 並行アップロード + タイムアウトとリトライ;#480 / #481 各プラットフォームの wheel は当該ベンダー固有の runner で構築され、ベンダー PyPI レーンにリリースされる。
  • 順序修正:#483 / #484(09-30 00:55)「先に publish、その後 artifact をアップロード」に修正——ウィンドウ最後のパイプライン補修。
  • 意味:リリースエンジニアリングは「タグが利用可能」から「プラットフォームごとの成果物が再現可能・検証可能」へと前進——九日前はまだ未着手項目だったが、今やリリースパイプライン自体が 0 から 1 を完了した。

1.3 community:最終修正の二筆と八リポジトリ締切ポリシー(09-29)

日付:2026-09-29 ソース:community #124、#125、#114、#115

  • #124(11:54)截点アラインメント:FlagGems-vllm と FlagGems-sglang は「メインブランチ 2026-09-28 09:00 以前の最後のコミット」に切り替え——両リポジトリの以前の公式タグは削除され、検証済みの截点コミット上で再構築された(バージョン名は不変);截点ポリシーはこれにより全 8 つのオペレータライブラリ(従来の 6 ライブラリ + 2 ライブラリ)に拡大。
  • #125(12:28)FlagScale 修正の取り込み:FlagScale の RC2 初期化修正(#1304 を含む、非異種初期化問題)を 2.2 に取り込み——マニフェストの FlagScale エントリを release-source: rc2-head、ターゲットコミット 4371924 に変更。
  • ステータス備考:#114(L1 オペレータライブラリをマニフェストに追加)はクローズされ未マージ、その範囲は #116 / #117 / #123 のロードマップで再構築;#115(2.2 でデリバリ済みの FEP 範囲と 2.3 への順延項目)は依然オープン、調査期間内にアクションなし。

1.4 リリース物のリフレッシュ:FlagScale タグ再構築と FlagGems 系 2 ライブラリの Release(09-29)

日付:2026-09-29 情報源:FlagScale v2.1.0、FlagGems-vllm v0.2.0、FlagGems-sglang v0.1.0

  • FlagScale v2.1.0(12:27):タグを「2.1.0-rc2 上の 4371924f」で再構築(#1304 修正を含む)、Release オブジェクトも同期してリフレッシュ——規模が 33 PR プラス 2 件の追加コミットに更新(従来の 32 PR の集計もこれに伴い修正)。
  • FlagGems-vllm v0.2.0(11:52):タグを截点コミット b5c2c224 上で再構築、Release は 11:52 ~ 11:55 に登録(本文に Part of FlagOS 2.2 と記載)。
  • FlagGems-sglang v0.1.0(11:53):タグを截点コミット 575d5bc3 上で再構築、Release も同期して登録(初版 80 PR および 14 件の追加コミット)。
  • 調査期間の連結:3 ライブラリのアクションは 11:52 ~ 12:28 に集中、#124 / #125 と分単位で連結——「記録修正 → タグ再構築 → Release リフレッシュ」が一つの昼の調査期間内でクローズドループ化。

1.5 build-infra:3 系統ミラー記録の締め——mthreads / ascend / enflame(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 情報源:build-infra ミラー記録バッチ、#1292、#1296 ~ #1303、#1312、#1314

  • 昇騰四変体(#1296 ~ #1303、16:28 ~ 17:04):megatron 0.18.2 訓練マトリクスに cann8.5.0 / cann9.0.0 / cann8.5.0-910c / cann9.0.0-910c の四レコードを追加し、0.18.2 変更ログを補完;verify コンテナはプロキシ貫通の修正を同期(#1297)。
  • 摩尔線程バッチ(#1294 ~ #1313、16:19 ~ 00:19):musa4.3.6 / musa5.2.0 の二ラインにおける vllm(0.3.0 / 0.2.2)、megatron(0.2.3)および sglang(0.1.dev1)のアプリケーションタグを一括記録;さらに mthreads アプリを新しい flagtree wheel 上で再ビルドすることを承認(#1292);sglang イメージタグを 2.2.0 スタックプレフィックスに復元;朝に mthreads sglang ドキュメントを補修(#1314、08:50)。
  • 燧原バッチ(#1284 ~ #1291、10:39 ~ 10:41):tops1.9.10 / 1.10.6 の二ラインにおける vllm(0.2.2)、megatron(0.2.3)および sglang の記録を一括登録。
  • ビルド基盤:EXTRA_PYPI のフォールバックを騰訊 PyPI ミラーに切り替え(#1312);Nexus 大容量ファイルアップロードヘルスプローブワークフロー(#1293)を審査待ちとして公開。
  • 規模:調査期間内に build-infra 51 コミット、約 30 マージ PR;release-info ポータルは記録バッチに伴い 7 回自動デプロイ。

1.6 FlagGems:KernelGen オペレータバッチと Ascend 性能バッチ(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 情報源:FlagGems #6610、#6770、#6699、#6553、#6633、#6795、#6741、#6799

  • KernelGen オペレータバッチ(16 件):NVIDIA 側に dim、kl_div、linalg_pinv、weight_int4pack_mm、_spsolve、triplet_margin_loss、max_pool1d_with_indices、conv_tbc、quantized_batch_norm、quantize_per_channel、put、special_hermite_polynomial_he、histogram、融合 SDPA 逆伝播、batch_norm_stats、bartlett_window を新規追加——KernelGen 生成オペレータが引き続き本流リポジトリに密集投入。
  • Ascend 性能バッチ(#6697 ~ #6703、#6770):baddbmm のバイアスブロードキャストと tile 選択、bmm tile とマスク、大規模 BF16 負荷 addmm、mv GEMV ディスパッチ、mul ブロードキャストディスパッチを連続チューニング;さらに TRITON_ALL_BLOCKS_PARALLEL 環境変数のグローバルリーク問題を修正。
  • ベンダー最適化:海光性能短板オペレータの一括最適化(#6553);KMCompiler linear が NVIDIA / Hygon / MetaX / Thead の四バックエンドをカバー(#6633);SiliconFlow ラインの geometric 族と argsort のバックエンド別実装(#6575 / #6692)。
  • CI と修正:寒武紀 ops-test イメージ更新(#6795)、摩尔線程テストを flagcicd に移行、変更オペレータはマークテストで実行(#6741)、runner ボリュームクリーンアップ;tle インポート保護(#6777)、SQL コールドスタート WAL 競合(#6730)、FlashAttention 非連続テンソルマテリアライズ(#6727);ベンチマークベースラインをネイティブ aten オペレータに変更(#6195)。
  • 新規投稿:五組の sparse / metadata テストスイート(#6799)を 09-30 朝に提出し審査待ち。

1.7 FlagGems-vllm / FlagGems-Experimental:KMCompiler カーネルと 5.5 alpha ライン(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 情報源:FlagGems-vllm #873、#875、#876、#877、FlagGems-Experimental #721

  • FlagGems-vllm:#873 バックエンド特化の dequantize_and_gather_k_cache(昇騰 / 摩尔線程)を追加;#875 / #876 天数 iluvatar 融合 q_kv_rmsnorm と fused add rms norm の最適化;#877 テストイメージを flagtree v0.7.0 に更新。
  • FlagGems-Experimental:同一バッチの KernelGen オペレータ(slow_conv_transpose3d、combinations、sparse_resize_、sparse_coo_tensor、_unpack_dual、can_cast、_fw_primal、flatten_dense_tensors、ccol_indices など)が実験ライブラリへ引き続き登録;alpha バージョン番号が 5.4 から 5.5 へ繰り上がり(#721)——次のオペレータライブラリバージョンラインの開発トラックが始動した。

1.8 FlagTree:metax ポストパッチタグと全バックエンドスケジューリングワークフロー(09-29)

日付:2026-09-29 情報源:FlagTree タグ、#1310、#1307、#1212、#1303

  • ポストパッチタグ:0.7.0.post2+metax3.6 が flagtree-bot により 18:27 にプッシュ(”pypi 0.7.0.post2+metax3.6”)——対象コミットは「Metax bf16 sum reduction を fp32 へ引き上げ」(#1310)であり、metax は post2 修正バリアントを獲得した最初のバックエンドとなった。
  • コミット:#1307 は全バックエンドに定時スケジューリングワークフローを追加;#1212 はデコード段階の TLE 融合 AllReduce + RMSNorm を新規追加;#1303 は CI がプロセスを kill する前に pid ファイルパスを検証するように。
  • 含意:2.2 凍結線の外側で、「リリース後にバリアント単位で増分パッチを当てる」チャネルが開いた——バリアント粒度(+metax3.6 など)が独立したパッチリズムを可能にする。

1.9 FlagQuantum:カーネルディレクトリルーティングとパフォーマンス融合バッチ(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 情報源:FlagQuantum #240、#236、#241、#259

  • カーネルカタログ(kernel catalog)シリーズ(#240 ~ #259、25 コミット):意味的カタログ(#240)、証拠リスト(#243)、能力マッチャー(#244)に続き、ローカル 1q / CNOT / CNOT シーケンス / 融合転置 / 制御サブ空間転送 / adjoint VJP / 可逆 VJP / シャード adjoint VJP などのパスが順次カタログルーティングに接続——スケジューリング層はハードコードからレジストリ駆動へ。
  • 性能融合:adjoint 境界融合(Euler 三つ組、QAOA 前向 / 逆方向境界、観測量回転境界)、CX gathers 融合、回転 tile 拡幅、終状態復元スキップ、前向不変量キャッシュ——CPU ネイティブパスが連続して収束。
  • 新機能:連続時間 Lindblad 演化(#236)、プロバイダ状態 VQE 基底状態求解(#241)、Triton コンパイラ溯源解析(#233)。
  • 意味:量智融合方向(10-17 大会専用セッション)のエンジニアリング基盤——コンポーネントが大会前三週で高頻度イテレーションに入る。

1.10 その他の動態:FlagCX / FlagFFT / FlagAttention / docs / vllm-plugin-FL(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 情報源:FlagCX #632、FlagFFT 活動、FlagAttention #71、docs #521、docs #530、vllm-plugin-FL #563

  • FlagCX:#632 で共有転送順序(CRL)と再試行可能な teardown を統合——クロスバックエンド転送一貫性の基盤層を引き続き強化。
  • FlagFFT:新たに codex/musa-3d-opt(摩尔線程)と codex/maca-3d-opt(沐曦)の二本の最適化ブランチを追加、09-29 午後から夕方にかけて複数回プッシュ——三次元 FFT のマルチプラットフォーム最適化ラインが同時に始動。
  • FlagAttention:moba attention(#71)、Hy3 attention(#56)、parallax(#57)の三件が 09-30 午前に連続マージ。
  • docs ドキュメントバッチ(23 コミット):#521「2.2 ドキュメント草稿」が一括マージ(09-30 08:44)——FlagAttention 中英語ドキュメント一式を新規作成、FlagAudio / FlagBLAS / FlagDNN / FlagFFT / FlagGems-vllm リリースノート更新、FlagQuantum ドキュメント刷新(アーキテクチャ / 能力 / アルゴリズム / ユーザーガイド)、デプロイワークフロー拡張;#530 で FlagGems-sglang の中英語ドキュメントページを新設(インストール / 要件 / オペレータ一覧 / リリースノート);#514 チップ適応ガイド;モデル一覧バッチが継続(ModelScope シリーズ、aihuanxin、HuggingFace オープン PR)。
  • vllm-plugin-FL:レビュー後に #563 をマージ;オープン PR ラインが活発——MiniCPM-V 4.7 適応(#567)、Sunrise PTPU 静的グラフ(#568)、天数 CoreX BI-V150 の vLLM 0.28.0 適応(#566)、昆仑芯 P800 を vLLM 0.24.0 へ引き上げ(#561)、昇腾汎用全デコードグラフ(#409)、および Qwen3.8-Flash / GLM5.3-Flash / HY4 の H100 サポート三件(#455 / #454 / #453)——09-30 朝も密集レビューが継続中。

2. ニュース報道とエコシステム

2.1 コンポーネント級検索が連続二十三個目の平穏な調査期間(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 情報源:Google News RSS(24 組の中英語クエリ語、プロキシ経由)、HN Algolia

  • コンポーネントとリリースラインの検索(FlagOS / FlagGems / FlagScale / FlagTree / FlagCX / KernelGen / FlagPerf / 大会アジェンダ)は24時間ウィンドウ内で新たな対外公告なし——連続23回目の静穏ウィンドウ;Torch-FLのリリースアクションはすべてコードと成果物側で発生(第1、3章参照)。
  • エコシステム側ウィンドウ内で11件ヒット:直接関連は摩尔線程産業側の1件(2.2参照);その他は株式市場の相場記事(燧原科技の収益予想、GPU四小龍の解禁)、智源関連の社会ニュース(AI安全投資インタビュー)と無関係な転載であり、題材別に除外。
  • HN AlgoliaはFlagOS / FlagGems / FlagScale / BAAIに対する関連ヒットなし(曖昧マッチング結果はすべて無関係な話題)。

2.2 摩尔線程:無錫(恵山)国産智算センター稼働3ヶ月——6大インテリジェントエージェントが実装(09-29)

日付:2026-09-29 情報源:鳳凰網(新浪財経などが同題転載)

  • マイルストーン:無錫(恵山)国産智算センター第一期が稼働満3ヶ月——稼働後わずか2ヶ月でほぼ満載となり、国産算力の商業化実装のベンチマークに;第一期2000枚の摩尔線程 MTT S5000 智算カードがすべて稼働済み(「東数西算」長江三角枢軸恵山ノードに属する)。
  • 6大インテリジェントエージェント:政務(恵山招商インテリジェントエージェント、データ-算力-アプリケーション一体化)、医療(恵山区人民医院 × 南郵エッジインテリジェント研究院のスマート病院システム、約30のモデルを実装;智診科技 WiseAgent 健康インテリジェントエージェント)、教育(華東師大啓創 InnoAgent プラットフォーム、300+の教育インテリジェントエージェント、1000+の教育スキルを統合しすでにオープンソース化)、チップ設計(芯華章 X-IVS / X-IDS、Formal Agent 事例のエンドツーエンド23.8時間)などの高価値トラック。
  • 本スタックとの関係:MTT S5000はFlagOSメンバープラットフォーム——本ウィンドウ内の摩尔線程側のmusaアプリケーションイメージバッチ、Torch-FLリリース物中のS5000データ(105個のネイティブカーネル、FlagGemsルーティング391 → 468)と「国芯訓国模」の産業ナラティブが相互に映照;「恵山モデル」は次のステップでより多くの地域へ複製される。

3. メンバー単位の深掘り

3.1 摩尔線程:musaイメージバッチ、MUSA 3D最適化ブランチと無錫産業(09-29)

日付:2026-09-29 ~ 2026-09-30 情報源:build-infra #1294 ~ #1313、FlagGems-vllm #873、FlagFFT 活動

  • アプリケーションイメージ:musa4.3.6 / musa5.2.0 の2ライン vllm(0.3.0 / 0.2.2)、megatron(0.2.3)、sglangタグを一括登録;アプリケーションは新flagtree wheel上で再ビルド承認を取得(#1292)。
  • オペレータ層:FlagGems-vllm dequantize_and_gather_k_cache の mthreads特化(#873);FlagTree bf16 sum reduction の fp32 への post2 パッチは当該バックエンドシナリオに基づく(#1310、1.8参照)。
  • 最適化ブランチ:FlagFFT codex/musa-3d-opt ブランチ 09-29 午後に複数回プッシュ(13:53 ~ 14:30)。
  • 産業側:無錫(恵山)智算センター稼働3ヶ月、6大インテリジェントエージェント実装(2.2参照)。

3.2 昇騰:megatron 0.18.2 の4変体とFlagGemsパフォーマンスバッチ(09-29)

日付:2026-09-29 情報源:build-infra #1296 ~ #1303、FlagGems #6699、#6770、FlagGems-vllm #873

  • 訓練フレームワーク:megatron 0.18.2 の4バックエンドライン(cann8.5.0 / cann9.0.0 / 910c デュアルバリアント)の記録と変更ログを反映——昇騰訓練側はリリース週後の最初の営業日に対応し、0.18.2 マトリクスを補完した。
  • オペレータ性能:FlagGems の Ascend 向け6件のチューニング(baddbmm / bmm / addmm / mv / mul / 環境変数リーク修復)。
  • 推論カーネル:FlagGems-vllm KMCompiler dequantize_and_gather_k_cache の昇騰特化(#873)。
  • オープン PR:vllm-plugin-FL 昇騰汎用全デコードグラフ(#409)を持続的にレビュー中。

3.3 海光 / 沐曦:性能オペレータバッチと metax 事後パッチ(09-29)

日付:2026-09-29 ソース:FlagGems #6553、#6633、FlagTree #1310、FlagFFT アクティビティ

  • 海光:FlagGems 性能短板オペレータの一括最適化(#6553);KMCompiler linear の海光バックエンドを4バックエンド統一リファクタリングに統合(#6633);Torch-FL リリース物において BW1000 は CUDA boxing を経由し(2033 オペレータ、466 件の FlagGems ルーティング)、上流 PyTorch ベースで動作し DTK ブランチではない。
  • 沐曦:FlagTree 0.7.0.post2+metax3.6 事後パッチタグ(bf16 sum → fp32);FlagFFT codex/maca-3d-opt ブランチを 09-29 午後から夕方にかけて連続プッシュ(15:31 ~ 18:45);Torch-FL リリース物において C550 は cu-bridge を経由し 2033 オペレータをルーティング、FSDP2 と Qwen3 訓練をアライメント。

3.4 燧原 / 天数:イメージバッチと iluvatar 融合カーネル(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 ソース:build-infra #1284 ~ #1291、FlagGems-vllm #875、#876

  • 燧原(enflame):tops1.9.10 / tops1.10.6 の2ラインの vllm(0.2.2)、megatron、sglang アプリケーション記録を一括登録(#1284 ~ #1291);Torch-FL リリース物において S60 はネイティブ libtopsaten バックエンド(224 カーネル)で Qwen-Image-2512 を 7.1 秒/ステップに最適化。
  • 天数(iluvatar):FlagGems-vllm の2件の融合カーネル——fused q_kv_rmsnorm と fused add rms norm の最適化(#875 / #876)。

3.5 昆仑芯 / 寒武紀 / 達摩院玄鉄 / 地平線:その他の要点(09-29 ~ 09-30)

日付:2026-09-29 ~ 2026-09-30 ソース:vllm-plugin-FL #561、FlagGems #6795、#6633、Torch-FL v2.10.0

  • 昆仑芯:vllm-plugin-FL で P800 を vLLM 0.24.0 にアップグレードする PR(#561)が審査待ち。Torch-FL リリース物では P800 の profiler / RNG と compile がロードマップ項目として記載。
  • 寒武紀:FlagGems ops-test イメージ更新(#6795)。
  • 達磨院玄鉄:KMCompiler linear の Thead バックエンドを四バックエンド再構築に統合(#6633)。Torch-FL リリース物では ZW810E ルーティング 390 → 435、AMP 統合。
  • 地平線:BPU s600 がエッジ側ターゲットとして Torch-FL プラットフォームマトリクスに参入(torch.compile グラフパス、オンボードコンパイラ)。
  • 清微:調査期間内に新規動向なし(前調査期間で FlagScale txda バックエンドは既に収録済み)。

4. 総括とトレンド观察

  1. 2.2 のクローズ完了:リスト 24 項目すべてがリポジトリに反映——Torch-FL v2.10.0 が調査期間内にリリースされ、最後の 1 項目が补齐。「修正 → 再構築 → 再リリース」の規律三連(#123 六リポジトリソース修正 → #124 二リポジトリ截点整合 → #125 FlagScale 修正 incorporation)が 12 時間以内にクローズドループを完了。
  2. リリースエンジニアリングが顕在化した能力に——Torch-FL は 1 日で rc1 → rc2 → 正式リリースを走破し、付随するリリースラインでも多数のイテレーション(タグ駆動ビルド、ベンダー自有 runner、並列アップロードリトライ、リリース順序修正)。wheel の自己記述 + preflight 検証——リリース物は「インストール可能」から「検証可能・追跡可能」へ。
  3. 開発ラインは全面的に次周期へ移行——FlagGems-Experimental alpha が 5.5 に上昇、FlagGems-vllm 0.3.0-dev1(前調査期間)、vllm-plugin-FL は新モデル(Qwen3.8-Flash / GLM5.3-Flash / MiniCPM-V 4.7)と新ハードウェア(CoreX BI-V150、P800 アップグレード)向けのオープン PR を集中的に審査中——リリースフリーズ終了後、適応ラインが再加速。
  4. 三条主線が調査期間内で同頻——KernelGen オペレータカバレッジ(16 件がメインリポジトリに収録)、ベンダープラットフォーム化最適化(昇騰 / 海光 / 沐曦 / 燧原がそれぞれ専用バッチ、FlagFFT 二重最適化ブランチ)、量子システムスタック(FlagQuantum 25 件)——10-17 大会の AI システム / 量智融合専場テーマと同方向。
  5. ニュース側第 23 の平穏な調査期間と産業側の着手が併存——コード側駆動、会議ノード叙述の格局が継続。摩尔線程無錫ケース(六智能体 + 満載標杆)は「国産算力商業化」叙述の新サンプルであり、Torch-FL リリース物の S5000 データと相互に裏付け。
  6. 次の観察ポイント:community リストの Torch-FL 項目に対するスナップショット更新、2.3 開発ライン合流(FlagGems 5.5、FlagGems-vllm 0.3.0、vLLM 0.28 適配)と 10-17 大会の対外リリース物。

付録:情報源検証表

カテゴリ 情報源 検証方式 結果
GitHub org: flagos-ai repos API 54 リポジトリの pushed_at 全量検証 16 リポジトリが調査期間内に活動(うち 12 リポジトリに期間内コミット)
GitHub コミット検索 + リポジトリ別照合 コミット検索 168 件(total_count 全量)を1件ずつ検証 12 リポジトリ 168 件(build-infra 51 / FlagGems 38 / FlagQuantum 25);組織内に新規リポジトリなし
リリース物 Torch-FL releases / tags API タグ、Release、リリース時刻を1件ずつ検証 v2.10.0(18:17 作成 / 18:20 リリース);rc1 / rc2 候補タグが先行
リリース物 FlagScale / FlagGems-vllm / FlagGems-sglang / FlagTree アトミック タグオブジェクト(tagger 時刻と対象コミット)を1件ずつ照合 三庫のタグ再構築(11:52 ~ 12:27);metax post2 タグ(18:27)
リリースエンジニアリング community #124 ~ #125 原文 タイトル、本文とファイル差分を照合 両件ともマージ済み;カットオフポリシーを八庫に拡大
リリースエンジニアリング release-2.2.yaml マニフェスト 原文取得照合 八庫カットオフ + FlagScale rc2-head;Torch-FL スナップショットは更新待ち
リリースエンジニアリング build-infra PR バッチと release-info ポータル 1件ずつ照合 約 30 件マージ;ポータル 7 回デプロイ
ドキュメント docs PR #521 / #530 ファイルリスト ファイル別照合 2.2 ドキュメント一括(FlagAttention 全套含む)と sglang ドキュメントページ
ニュース Google News RSS(24 組の中英語クエリ、プロキシ経由) 24 時間枠フィルタ + 1件ずつ除外 コンポーネント線は新規ゼロ(第 23 の平穏な調査期間);エコシステム側は 1 件を保持
メディア 鳳凰網(新浪財経など同一題の転載あり) 原文取得再確認(公開時刻 09-29 18:44) 無錫(恵山)智算センター三ヶ月マイルストーン
コミュニティ HN Algolia 検索再確認 関連ヒットなし
歴史対照 前両日の FlagOS デイリーレポート 重複排除検証 Torch-FL pending → リリースが調査期間の核心的増分;無錫事例は初収録;AICC2026 は 09-23 / 09-24 に収録済み

完全情報源リスト

ull/877> · https://github.com/flagos-ai/FlagGems-Experimental/pull/721