報告周期:2026年9月21日(月曜日)から9月25日(金曜日)まで、計5営業日 素材来源:本刊の毎日FlagOS動態レポート(09-21、09-22、09-23、09-24、09-25の5期、調査期間は日ごとに接続され、空白なし);すべての項目は当期に検証済みの情報源に基づき、編纂時に別途GitHubで再確認・補足 編纂説明:今週はFlagOS 2.2 GA(09-28)前の最後の完全な営業週であり、主線はリリースの収束——「タグ、マニフェスト、スコープ」の3層検証が相次いで完了;同時にコンポーネントとコードの共同構築、新チップパートナーの接続、メンバー単位とエコシステムの4つの次元をカバー。5期のデイリーレポートの調査期間コミットヒット合計は916件(163 / 224 / 143 / 211 / 175)、各期のアクティブリポジトリは22 / 19 / 24 / 23 / 24個、合計でorg内の約30リポジトリをカバー


1. 今週のトピック

  • 2.2 リリース物凍結:10コンポーネントの正式版タグを一括で登録(09-24):09-24 未明 01:49~01:50、10 個の L1 モジュールの正式版タグ(裸のバージョン番号、rc / post サフィックスなし)が一度に打たれた——flaggems v5.4.0、flagfft v0.2.0、flagsparse v0.3.0、flagdnn v0.3.0、flagblas v0.3.0、flagtensor v0.3.0、flagaudio v0.3.0、flagattention v0.4.0、flaggems-vllm v0.2.0、flaggems-sglang v0.1.0。各タグは対応モジュールの rc2 ブランチ HEAD に打たれ、1 件ずつ読み戻して照合。併せて PR(community #114)が「公式タグ ← rc2 ベースライン」のマッピングを公式リストに追加、編纂時点でまだレビュー中。
  • rc2 チャネル収束 + 範囲監査開始(09-24):community #113 が rc2 リストの 13 モジュールを最新の検証済み post タグ(flaggems rc2.post4 など)に一括 bump、rc2 安定期間はスケジュール通り 09-24 で締め切り、以降は hotfix のみ受け付け;同日 community #115 が「2.2 FEP 範囲監査」を起票——18 件の Implemented FEP は保持、FEP 0019 / 0069 / 0081 / 0084 / 0093 / 0100 の 6 件は 2.3 に延期、保持項目は「実装済みインターフェース + 検証済み構成」に限定。リリース検証は「コード凍結」「リリース物凍結」から「範囲と宣言の凍結」へと進む。
  • リリース情報ポータル再構築、プラットフォームマトリクスが急速に稠密化(09-22 ~ 09-25):Release Info ポータルを 09-23 に再構築(20 プラットフォーム行 base / runtime + vLLM 2 セットのマトリクス + Megatron + sglang アプリケーションイメージ);Megatron アプリケーションイメージ 2.2.0-0.2.3 は 14 プラットフォーム行をカバー、megatron_rl マトリクスはブロック解除され全 18 バックエンドを開放;sglang アプリケーションページは一夜で 7 連発(昆仑芯 / 昇騰 / 燧原 / 海光 / 摩尔線程 / 天数 / generic の 7 プラットフォーム)、達磨院玄鉄 thead-ppu2.1.0 アプリケーションページが同日ポータルに投入。
  • 新チップパートナーの集中的な参入(09-24 ~ 09-25):壁仞(Biren)SUPA バックエンドが「FlagGems オペレータライブラリ + vllm-plugin-FL 推論プラグイン」の二層で同日オンライン(#6367 / #530);曦望(Sunrise)が PTPU の 0.2.1 パッチセットを vLLM 0.24 メインラインに移植(#555);清微 FlagTree プラットフォームタグが完備——「オペレータライブラリ + 推論プラグイン + コンパイラ」の三層同構参入が外部チップの FlagOS 参入の標準経路となる。
  • FlagFFT が海光バックエンドを補完、単一期間で 102 件が三線にまたがる(09-21 ~ 09-22):海光 BW1000(HCU)アダプタが dev に参入、README バックエンドリストは CUDA / MUSA / PPU / IX / MACA / NPU / HCU の 7 項目に拡大;同期間に MACA(沐曦)の性能収束と NPU(昇騰)Stockham バッチ並列化、パッケージ三種(#12 / #18 / #22)が同時にマージ——新バックエンド + 性能収束 + 配布パッケージの 3 件を同期間で完了。
  • 達磨院玄鉄の二線推進:真武 V900 リリース + PPU が FlagOS マトリクスに参入(09-22 ~ 09-25):雲栖大会(09-22)で新一代の訓練推論一体型 AI チップ真武 V900 をリリース(216GB メモリ、ダイ間相互接続 1200GB/s、ネイティブ FP8 / FP4、単芯性能は前世代 M890 の 3 倍、2027 年 Q1 量産);ソフトウェア側では PPU が実正体でビルド・アプリケーションマトリクスに参入——FlagTree 0.7.0+ppu3.6 タグ、sglang thead-ppu アプリケーションページ、TE-FL PPU CI;SAIL ソフトウェアスタックはオープンソースの拡大を発表、GitHub 開発ブランチが研究開発メインラインとなる。
  • 910C 強化学習チェーンのエンドツーエンド準備完了(09-24 ~ 09-25):昇騰 910C の 2 構成(CANN 9.0.0 + torch 2.10 / CANN 8.5.0 + torch 2.9)が単一ステップインストールで megatron-core[rl] GRPO のエンドツーエンド検証を完了(終了コード 0)、wheel には packed_seq ゲーティングなど 3 件の RL 修正を内蔵;Ascend-Docker-Runtime による NPU 不可視問題も併せて解決——2.2 の RL シーンにおける昇騰宣言に再現可能な証拠チェーンを提供。
  • 産業・エコシステムイベントが集中(09-21 ~ 09-25):AICC2026 が北京で開催(FlagOS 2 件の報告、「信頼できる AI」評価体系に 20 社超の機関が始動);沐曦 MXMACA が「アップストリーム優先」で LMCache メインラインにマージ、39 の主要モデルの Day 0 適応を公式発表;摩尔線程 RLinf 公式 CI が MTT S5000 に接続、Protenix-v2 全チェーン推論が約 26% 高速化;龍芯が加速計算プラットフォームの初版をリリース;Open3D-PIMC 報道マトリクスが新浪財経に拡大。

2. バージョンとリリース動向

RC ペースと GA マイルストーン

  • タイムライン:rc2 安定期は 09-24 締切(以降は hotfix のみ受付)、GA Go/No-Go は 2026-09-28 に設定;リリース追跡 issue(community #47)と milestone の期日はいずれも 09-28。
  • rc2 チャネル最終全量アライン(09-24 00:42、community #113):13 モジュールを rc2 ブランチ HEAD 最新検証済みタグへ bump——flaggems rc2.post4;flagfft / flagdnn / flagblas / flagtensor / flagaudio rc2.post2(内容は Debian / RPM パッケージングと Nexus リリースチェーン、FlagAudio ゲイン恒等修正);flagtree 三ライン 0.7.0rc2.post2;vllm-plugin-fl 二ライン post3;transformerengine-fl post2;flagscale post2。
  • 公式リストの段階的コミット:09-22 community #111 で最初のエントリ sglang-plugin-fl v0.2.0 を収録(rc2 ベースライン HEAD 1c84db7、ファイルヘッダで「公式タグは一律裸バージョン番号、FlagTree は例外」というバージョン規範を明記);09-24 #114 で L1 十コンポーネントマッピングを補入(flaggems v5.4.0 ← post4、flagattention v0.4.0 ← post1 等)、本稿作成時点で当該 PR はまだレビュー中。
  • 範囲収縮と監査:FEP-0085 で GEMM+ReduceScatter を 2.2 範囲から除外(community #112、09-24、「テスト証拠 + ドキュメント改訂」チェーンでコミット);範囲監査 PR #115 で「18 保持 / 6 を 2.3 へ延期」のデリバリ境界を確立し、「未サポートの完了 / 性能宣言」の削除を要求。
  • 開発メインラインの昇格:正式タグコミットの翌日、FlagSparse main を 0.4.0 に昇格、FlagAudio バージョンラインを 0.4.0 に校正、FlagAttention も同期してバージョン更新を実施——2.2 リリース物(rc2 ベースライン + 正式タグ)と開発メインライン(0.4.0 シリーズ)が正式に分岐し、2.3 開発サイクルは事実上開始済み。

コンポーネント tag と Release リスト(期間内)

  • 正式タグ(L1 十枚):flaggems v5.4.0、flagfft v0.2.0、flagsparse v0.3.0、flagdnn v0.3.0、flagblas v0.3.0、flagtensor v0.3.0、flagaudio v0.3.0、flagattention v0.4.0、flaggems-vllm v0.2.0、flaggems-sglang v0.1.0(09-24)。
  • FlagTree:0.7.0 シリーズをバッチ产出し継続拡充——メインライン三ライン 0.7.0+triton3.6 / +triton3.5 / +triton3.3;プラットフォーム変体 +mthreads3.6、+ppu3.6、+xpu3.6、+tsingmicro3.6 / +tsingmicro3.3、+ascend3.5、+iluvatar3.6、+metax3.6、+tileir3.6、+hcu3.6 等十余枚(09-23 から 09-25)——プラットフォーム化タグが「メインライン」から「ベンダー特化」へ拡大し、正式にバージョン体系へ組み込み。
  • FlagCX:v0.14.0-rc2.post2 リリース(09-21 22:11)——清微 TSM の torch_txda ライブラリディレクトリ解析修正、TSM ランタイムイメージのリンク失敗を解決。
  • その他タグライン:FlagScale v2.1.0-rc2(09-23 に main から摘出)と v2.1.0-rc2.post2;vllm-plugin-FL 0.3.0-rc2 ブランチ(tsingmicro txda の 0.24.0 適配を含む);sglang-plugin-FL v0.2.0(公式リスト最初のエントリ)。

イメージと成果物の状態

  • アプリケーションイメージマトリクス:Megatron アプリケーションイメージ 2.2.0-0.2.3 が 14 のプラットフォーム行に集中登録(nvidia-cuda12.8 / 13.3、ascend-cann8.5.0 / 9.0.0、cambricon-neuware4.4.3 / 4.7.2、enflame-tops1.9.10 / 1.10.6、hygon-dtk26.04、iluvatar-corex4.4.0 / 4.5.0、metax-maca3.8.1.3、mthreads-musa4.3.6 / 5.2.0);megatron_rl アプリケーション行のブロックを解除し、全 18 バックエンドに向けて開放(09-23、build-infra #1057)。
  • vLLM ライン:0.20.2 ラインが 20/20 バックエンドの実機検証スナップショットを完了、3 つのバックエンドが FlagTree 0.7.0rc2 に載せられない原因を公開(沐曦 tl.dot ICE、燧原の旧ツールチェーンが enable_i64 を拒否、cuda13.3 が libcudart.so.12 に依存、それぞれ 0.6.x との対照とピン留め記録付き);0.24.0 ライン 2.2.0-0.3.0rc2.post2 の記録書き戻し。
  • sglang ライン:7 プラットフォームのアプリケーションページを一晩で連続発信(kunlunxin-xre5.37.1、ascend-cann8.5.0、enflame-tops1.10.6、hygon-dtk26.04 の 2 ページ、mthreads-musa4.3.5、iluvatar-corex4.5.0、generic-c13.0)、thead-ppu2.1.0 を公式コンポーネントタグに更新(09-25);アプリケーション層のリリース物もベンダー中立の命名に同期変更。
  • リリースポータルとビルド連動:Release Info ポータルを再構築(09-23、20 のプラットフォーム行の base / runtime と vLLM / Megatron / sglang アプリケーションマトリクスをカバー);build-infra がビルドマトリクスの FlagGems バージョンを 5.4.0 に引き上げ(09-24、正式タグと連動、約 7 時間後にマージ、これは「タグ → ビルド」順序の標準サンプル)。
  • 配布チャネルの多軌道化:FlagCX wheel チャネルを試験運用から全行へ拡大し昆仑芯に着地(プリコンパイル済み wheel がデバイス bitcode を保持);noarch deb / rpm の統一リリースチャネルが各パッケージングコンポーネントをカバー(FEP-0019 Wave 1);サードパーティチャネル flagos-packaging が v2026.09.20 をリリース(apt / dnf の 2 形式、6 ディストリビューションの repo、GPG 署名)。

3. コンポーネントとコードの共同構築

今週の org 内 5 期の調査期間におけるコミット数は 163 / 224 / 143 / 211 / 175 件、合計約 916 件であり、以下ではモジュール別に集約する。

オペレータとドメインライブラリ(FlagGems および各ドメインライブラリ)

  • FlagGems(メインライン、今週の第一のライン):5期の調査期間におけるコミット数は34 / 29 / 28 / 59 / 46件。3つの生産ラインが並行して進行:KernelGen 一括登録(1週間で Nvidia のロングテールオペレータ約60個を注入、inverse、_gather_sparse_backward、msort、linalg_inv_ex、_ctc_loss 系、_cudnn 系、histogramdd、_scaled_grouped_mm_v2 などをカバー);昆仑芯整備バッチ(31オペレータ最適化バッチを一括登録、27/31が0.8x性能ラインに到達、さらに約20件の XPU 修正バッチが FlashAttention 高速パス、scaled_mm ホスト高速パス、畳み込み系と特殊関数をカバー、テストマシンは klx-p800 に移行);TLE マルチバックエンド展開(昇騰 glu は tle.dsa.extract_slice を使用、天数 Iluvatar は vendor descriptor で TLE を有効化、海光 W8A8 パイプラインはホワイトリスト制限により分段 tl.range に書き換え、48時間以内に TLE が4つのバックエンドに進出)。
  • 量子化とチューニング:海光 fused_inv_rope_fp8_quant(DeepSeek-V4 アテンションパス「逆 RoPE + FP8 グループ量子化」融合)、海光 INT8 RMSNorm 登録;沐曦 topk_w8a16_fp8;摩尔線程 index_add / polar 最適化;6バックエンド FP8 テスト補完(NVIDIA / Ascend / Hygon / 玄鉄 / MetaX / Iluvatar);FlagTune コストモデルを Hopper、沐曦 MM と達摩院玄鉄 ZW810E に拡張(v1.1.0 審査中)、FP8 MM ローカルチューニング有効化。
  • プラットフォーム修正バッチ:昇騰(apply_rotary_pos_emb cos/sin 重複、batched linalg_solve_triangular 誤結果、log_ グリッド padding);天数(linalg_solve_triangular の TLE パス無効化、index_reduce_);海光(complex スカラー乗算);沐曦(masked_fill 範囲外);昆仑芯(special_bessel_y1 / softplus / weight_norm バッチ)。
  • 工程品質:オペレータ登録パス失効の修正、ベンチマーク reference-only ベースライン検証、候補事前プリチェックとプロセス内 profiling フック、週次バックエンドコンテナイメージ更新;SiliconFlow の継続的貢献(_scaled_grouped_mm クロスバックエンド修正とチューニング、adaptive_avg_pool2d 最適化、index_reduce_ 3プラットフォーム修正)。
  • FlagFFT:海光 HCU アダプタ(詳細は要聞参照);MACA ライン「1d single」測定戦略をデフォルトに変更、FP64 レジスタ交換実験は当日試行後に撤回;パッケージ三種セット(Debian + RPM、Nexus リリース、0.2.0-rc2 移植);JIT 成果物のクロスプロセス隔離とマルチプロセス回帰テスト。
  • FlagSparse:NCIC-AlphaSparse との協力が高頻度期に突入(1週間で6バッチマージ:MACA SpMV CSR ベースライン、DCU SpMM COO 最適化、ASCEND 数値デバッグ、biv アルゴリズム追加、MUSA デリバリ修正);v0.3.0 正式タグ後に main を 0.4.0 に昇格;rpm パッケージングと pip 互換性修正。
  • FlagBLAS:昇騰 L2 性能最適化2バッチ(SPR / SPR2 / HPR / HPR2、banded packed と triangular、SYMV 起動パス簡素化);摩尔線程 L2 サポートマージ;外部コントリビュータのパッケージングラインが実現。
  • FlagDNN / FlagTensor / FlagAudio / FlagAttention:FlagDNN は天数と海光プラットフォーム実装アーキテクチャを再編、摩尔線程はコンパイル済み成果物を再利用、パッケージングマージ;FlagTensor 0.3.0-rc2 パッケージングライン(deb / rpm、CMake による Torch 検索、Nexus アップロード);FlagAudio は最初の3つの PR マージ後に実稼働へ(スペクトログラム Triton オペレータ、ゲイン恒等修正、openEuler インストールフォールバック);FlagAttention v0.4.0 タグ、テストとベンチマーク更新。
  • FlagTrain(新方向):09-16 のリポジトリ作成後、最初の実装が着地——KMCompiler が提出した Triton lamb 訓練オペレータとテスト方法がマージされ、「Triton による主流訓練フレームワーク再利用型訓練オペレータの実現」を定位。

コンパイラと通信ライブラリ(FlagTree / FlagCX / libtriton_jit)

  • FlagTree:沐曦バックエンド専有化リファクタリングを夜通しで推進し十件(TritonIR / TritonToTritonGPU / TritonGPUToLLVM の三層ソース専有化、統一 CMake エントリ、Gluon レイアウトインターフェース);天数 Iluvatar を Triton v3.6.x に同期し TLE 分散および TLE_RAW を拡張(30 ファイルの大型 PR、分散プリミティブは FlagCX が支える);NVIDIA TLE に SMEM サブスライスとマルチライター TMA パイプラインを新規追加;AMD でコンパイラ修正二件(W7900 精度テストで露見);CI カバレッジ拡大(910B ワークフロー、mthreads3.6、hcu3.6、MetaX vLLM ベンチマーク、PPU pid 検証);パッケージング修正(triton ライブラリ名を _C/libtriton.so に統一、rpm パッケージング clang、deb PEP 440 準拠番号)。
  • FlagCX:rc2.post2 で清微 TSM プラグインを修正;異種転送を強化しアクセラレータ CI と整合、p2p engine rpc serve 拡張、barex 転送アップグレード;rpm Requires からバージョンなし CANN sonames を除外;CRL 異種 gather 集約スケジューリングを転送の後に配置;PAL が SHCA verbs ABI と 17 ビット LID をサポート;wheel 配布ライン(全行 + 崑崙芯)。
  • libtriton_jit:マルチアーキテクチャスクリプトディレクトリ修正、マルチバックエンドパッケージング、nlohmann-json 互換修正、パッケージングトリガー条件の絞り込み——Triton JIT ランタイムがマルチバックエンド配布形態へ収斂。

推論と学習フレームワーク(FlagGems-vllm / FlagGems-sglang / Torch-FL / プラグインライン / FlagScale / TE-FL / Megatron-LM-FL)

  • FlagGems-vllm(四プラットフォーム同一期間):昇騰 XCS オペレータバッチ推進(slot_mapping 最適化で実測サービス全体が 1050.9 → 81.2 ms、kpool 状態圧縮、lightning indexer、kv_rmsnorm_rope_cache など);摩尔線程が INT4 / FP8 融合 Marlin MoE と W8A8 可変長アテンションを共有;海光が INT8 ブロック状 BMM と einsum 縮約;沐曦が融合逆 RoPE FP8 量子化と persistent_topk MC550 バックエンド;達磨院玄鉄 TLE 版 topk;Gemma RMSNorm を一度に三プラットフォームへ補完;「同一オペレータのマルチプラットフォーム対照実装」が標準作業モデルに。
  • FlagGems-sglang:融合 MoE router の三路統合(崑崙芯と MUSA 統合、昇騰二版の tensorcore 変体、燧原 tensorcore dot-acc);燧原 GCU vendor 登録(デバイスクエリ、TLE 有効化、ヒューリスティック設定)。
  • Torch-FL(工程收口):DCU 境界外インデックスを直接拒否、昇騰カーネルをオペランド所在デバイスで実行するよう変更、PPU が CPU torch wheel の CUDA メタデータを復元;ビルドマトリクスを単一テーブルへ収斂、GEMS_VENDOR 未識別時は直接エラー、グローバル Tensor.__getitem__ パッチと MetaX 退役コードを除去;プラットフォーム検出を統一しケイパビリティマトリクス文書を補完、バージョン pin を単一ファイルに集中、インポート期の副作用を順序付き段階パイプラインへ収斂。
  • vllm-plugin-FL:vLLM 0.28 アップグレードライン起動(NVIDIA 側はマージ済み、昇騰 910C 適配 #487 は審査中);壁仞 SUPA バックエンドをマージ、曦望 PTPU を 0.24 メインラインへ移植、オペレータ級 profile ツールをマージ;海光 vLLM 0.24 ワークフローと MUSA CI を整合。
  • FlagScale / TransformerEngine-FL / Megatron-LM-FL:FlagScale は metax パラメータを修正し v2.1.0-rc2.post2 を推進、キューには MemRift 学習圧縮、NPU profiler、達磨院玄鉄 810E 学習 CI、海光 DCU ヘルスサンプリングを含む;TE-FL は NPU バックエンド LayerNorm とマルチテンソル Adam を新規追加、沐曦 vanilla TE パッケージレイアウトをサポート(併せて rc2.post2 に取り込み)、PPU ユニットテストと統合テストは審査中;Megatron-LM-FL はベンダーバックエンド互換性と CI を安定化、沐曦ビルドは jit_fuser を no-op に維持しメモリリークを防止、曦望 PT-PU プラットフォームをサポート。

リリースエンジニアリングとガバナンス(build-infra / community / docs)

  • build-infra:バージョンとイメージのラインを除き、今週はさらに FlagCX wheel チャネル(昆仑芯含む)、noarch deb / rpm 統合チャネル、パッケージングパイプラインの分割(release path ビルド、native-rpm スイート単位ダウンロード、リリースバージョンスタンプ)、リリース CI の五点強化(バージョン固定ビルド、verify 検証、シンボルチェック、パッケージ単位の列挙、ターゲットリポジトリ検証)、910C RL E2E と NPU 可視性の修正、sglang アプリページとポータル保守を完了した。
  • community:2.2 リリースガバナンスのラベル / チェックリスト / スコープの三ラインのアクションがすべてリポジトリに反映された(#111 ~ #115)。FEP ドキュメントは「リリース境界とエビデンス」の方針に沿って継続的に改訂中。
  • docs と wiki:モデルリストを四条更新(ModelScope / HuggingFace など)。FlagTree wiki のマルチプラットフォームユーザーマニュアルはリリース前に複数回更新された。

量子、スパースおよび新興方向

  • FlagQuantum(今週最も拡張が速い方向):連続する二つの調査期間で 30+ 件(38 / 35、他期間 19 / 13、合計 100+ 件)。五つのラインが並行して進行:クラウド QPU(Azure Quantum スキャフォールド、Quafu タスク API)、クロスフレームワーク実行ブリッジマトリクスがほぼ完成(Cirq、Qiskit Aer、PennyLane Lightning、Braket、CUDA-Q)、シミュレーション融合加速(状態ベクトルゲート、二ライ融合、浅層 Clifford ルーティング)、検証ゲート(ホールドアウトセット検証、ドリフト整合、エビデンス制約付きシミュレータ選定アドバイザー)、CI 再利用と並列化。
  • Open3D-PIMC:コード実装後、報道マトリクスが継続的に拡大(新華網 09-14 → 央広網 09-18 → 光明網 09-23 → 新浪財経 09-24)、核心事実は一致しており、新たな技術情報はなし。FlagOS の 3D 演算チップ方向と直接関連。
  • FlagOS-Compressor:DeepSeek V4.1 と MiMo V2.5 向けの線形 INT8 エクスポート PR がマージ後同日に撤回(コミットメッセージに理由の記載なし)、後続の動きは本誌の観察項目とする。

4. メンバー単位とベンダー適配

  • 智源(主導側):2.2 リリースガバナンス(チェックリスト / タグ / スコープ監査)を主導し、RC2 の収束と FEP リリース境界の定義を担当;AICC2026 の FlagOS 報告 2 件(林咏華「アーキテクチャ革新から利用可能な計算力へ」、趙帥の专题)と「信頼できる AI」評価体系の共同構築;Open3D-PIMC の共同開発。
  • 海光:FlagFFT 初の HCU(BW1000)バックエンドアダプタ;FlagGems の W8A8 TLE パイプライン置換、fused_inv_rope_fp8_quant、INT8 RMSNorm、mv 最適化、complex スカラー修正;FlagSparse DCU チェックリストと spv 精度;FlagScale DCU ハードウェアヘルスサンプリング(審査中);FlagTree に hcu3.6 FlagGems ベースラインとテストワークフローを追加;sglang hygon-dtk26.04 アプリケーションページを登録。
  • 沐曦:MXMACA を「アップストリーム優先」で LMCache メインラインにマージし CI 検証メカニズムを確立;2025 年 12 月以来 39 個のフラッグシップモデルの Day 0 適配(Qwen-Image-2.1 含む)を正式発表;コード側では FlagTree 専有化リファクタリング 10 件、Iluvatar 以外の複数の修正が rc2.post2 の内容に到達(TE-FL レイアウト、jit_fuser、persistent_topk)、topk_w8a16_fp8、MetaX vLLM ベンチマークを CI に登録、0.7.0+metax3.6 タグ。
  • 摩尔線程:RLinf 公式 CI が 0.3 版以降 MTT S5000 に接続(訓練曲線相関係数 0.976、1 ステップ所要時間 26% 削減、アイドル率 18.5% → 3.1%);Protenix-v2 全チェーン推論が国際主流 GPU 比で平均約 26% 高速化、三大 AI4S シーンのクローズドループを完了;W8A8 可変長アテンションと共有 INT4 / FP8 融合 Marlin MoE;AICC2026 登壇および「信頼できる AI」共同構築に参加。
  • 昇騰:XCS オペレータバッチ(slot_mapping / kpool / indexer 系)と 910B FlagGems ベースラインワークフロー;910C デュアル構成 RL エンドツーエンド通過、NPU 可視性修正;grouped_matmul をオペレータリストに登録、rrelu_with_noise、cat/concat ディスパッチ改善;vLLM 0.28 適配を審査中;TE-FL NPU バックエンドを補完;複数行のイメージ登録と sglang アプリケーションページ。
  • 燧原:FlagGems-sglang が GCU vendor と tensorcore dot-acc 融合 router を登録;megatron アプリケーションイメージ行を登録;プラグイン 0.24 ラインをフォロー。
  • 天数智芯:Iluvatar バックエンドが Triton v3.6.x に同期し TLE 分散を有効化;wheel を Ubuntu 22.04 で再ビルドしビルダーを公開;solve_triangular の TLE パスを無効化;corex4.4.0 / 4.5.0 の 2 行イメージ登録。
  • 崑崙芯:31 オペレータ最適化バッチ(27/31 達成)と約 20 件の XPU 修正バッチ;テストマシンを klx-p800 へ移行;sglang kunlunxin-xre5.37.1 アプリケーションページ;FlagCX wheel の崑崙芯対応を実現。
  • 清微智能:KernelGen 2.2.0 に新規ハードウェアとして収録;FlagCX rc2.post2 で TSM torch プラグインを修正;FlagTree +tsingmicro3.6 / +tsingmicro3.3 タグ;AICC2026「Open3D-PIMC」報告とポータル行の更新。
  • 達摩院玄鉄(T-Head):真武 V900 リリース(PPU 新世代);PPU が FlagOS ビルドおよびアプリケーションマトリクスに参入(0.7.0+ppu3.6、sglang thead-ppu アプリケーションページ、TE-FL PPU CI、FlagTree PPU pid 検証);ZW810E FlagTune コストモデル v1.1.0 を審査中;SAIL ソフトウェアスタックのオープンソースを拡大、GitHub 開発ブランチが研究開発メインラインに。
  • 壁仞と曦望(新規参入パートナー):壁仞 SUPA バックエンドの二層が同日にライン入り(オペレータライブラリ + 推論プラグイン);曦望 PTPU パッチセットを vLLM 0.24 メインラインへ移植(Qwen3.6 27B / 35B-A3B が正常動作)。
  • 寒武紀:megatron アプリケーションイメージ 2.2.0-0.2.3 が neuware4.4.3 / 4.7.2 の 2 行に登場。

5. エコシステムとコミュニティ

会議と産業イベント

  • AICC2026(09-21、北京):第7回人工知能計算大会——智源副院長兼チーフエンジニアの林咏華氏が「アーキテクチャ革新から利用可能な算力へ:FlagOS が駆動する AI 計算のソフト・ハード協調新パラダイム」と題した報告を実施;智源研究員の趙帥氏が「衆智 FlagOS:オープンソフトウェアスタックで多元 AI 算力の価値を解放」と題した報告を実施;会議内で「信頼できる AI」評価ワーキンググループを起動し、評価体系を発表(工信部電子五所が智源、浪潮、摩尔線程、沐曦など 20 余の機関と連合);IDC は 2026 年の中国スマート算力規模が 2576.5 EFLOPS(前年比 +87.9%)に達すると予測。
  • 雲栖大会(09-22、杭州):達摩院玄鉄が真武 V900 を発表(詳細は要聞参照);真武 J900(2028 年 3 月)と倚天 720 / 730 サーバー CPU(2027 年)を予告。
  • 国産算力ソフトウェアスタック動向:龍芯中科が「龍芯加速計算プラットフォーム」の初のソフトウェアバージョンをリリース(LG200 シリーズ GPU ベース、ドライバ、コンパイラ、ランタイム、オペレータライブラリ、推論エンジンをカバー、OpenCL 3.0 と CUDA 移行をサポート);第5回全球数字貿易博覧会が 09-23 に杭州で開幕(初の集積回路応用エコシステムセクションを設置、沐曦などが出展)。
  • SAIL オープンソース進展(09-23):達摩院玄鉄ソフトウェアエコシステムシニアディレクターの陸生華氏が開示——39 の低精度量子化モデルをオープンソース化(ダウンロード数 34.8 万回超)、SAIL が 260 余のフレームワークに適配、主流推論フレームワークの平均適配時間が 7 日未満、真武シリーズが既に 650 社以上の企業顧客にサービス提供。

オープンソースリリースと報道マトリクス

  • Open3D-PIMC:清微智能と智源が共同開発したオープンソース報道マトリクスが持続的に拡大(第3節参照)、「30 余の国産チップに向け、3D チップコンパイラのグローバル標準を探る」と描写。
  • flagos-packaging v2026.09.20:第三者が保守する FlagOS ネイティブパッケージチャネルの週次リリース(APT / YUM 両形式、6 ディストリビューション repo、GPG 署名)、build-infra の deb / rpm パイプラインと並行して推進。

コンテストとコミュニティ

  • FlagOS × MiniCPM モデル推論スループット性能最適化チャレンジ:開発・提出フェーズが 09-21 から開放(11-20 まで、12 月審査)、課題は 4k / 16k の 2 種類の評価シナリオをカバー。
  • SGLang クロスチップオペレータ最適化コンテスト:コンテスト成果が持続的に PR 形式でメインリポジトリに進入(今週融合した MoE router の三路マージはその延長線)。
  • 2026 人工知能オープン計算大会暨衆智 FlagOS 技術大会:10 月 17 日から 18 日に北京で開催、申し込み受付中;ワークショップ題目(KernelGen、端側、TLE Attention、FlagScale-Agent)は今週のエンジニアリング観察と一対一で対応。

ニュース面と外部チャネル

  • コンポーネント級ニュース検索が連続第16から第20の平穏ウィンドウ:週全体の 5 期ウィンドウ内で FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen などのコンポーネント名に対する中英文検索がすべて有効ヒットゼロ;対外情報の増分はメンバー機関と会議ノード(AICC2026、雲栖、数貿会)に集中。
  • 収録境界の説明:株式市場行情稿、ギャンブル SEO、シンクタンクの汎用コンテンツは計上せず;純資本面の動向は背景記録のみ。

6. トレンド観察

  • リリース規律が「三層凍結」への進化を完了:一週間のうちに、コード凍結後のリリース物凍結(タグの一括登録、rc2 マニフェストの確定)、範囲と宣言の凍結(FEP 範囲監査、保留項目は検証済み構成のみに限定)を順に完了;「人がマニフェストを見る」から「状態が導出可能、証跡が紐付け可能」へ移行。GA 前 3 日間は新機能を追わず、リスクは「インストールできる、正しく動作する、正確に説明できる」に集中。
  • マルチチップマトリクスが GA 前に拡列を継続、接続経路はすでに標準化:壁仞、曦望が今週初めてコード側に出現し、清微、達摩院玄鉄、天数などと同構の経路を形成——「オペレータライブラリ + 推論プラグイン + コンパイラプラットフォームタグ」の三層が同日に進線;FlagTree 0.7.0 のプラットフォームバリアントは十余枚に拡大し、プラットフォーム化タグが正式にバージョン体系に組み込まれた。「ベンダー特化」はもはや本線の外に遊離せず、リリース物の一部となっている。
  • 配布形態が多軌道化を完了:コンテナイメージのほか、プリコンパイル済み wheel(デバイス bitcode を携帯)、noarch deb / rpm、apt / dnf ネイティブパッケージの三軌が並行(FEP-0019 Wave 1 展開中);リリース物の「照合可能性」(ポータル、スナップショット、行ごとの記録、ピン留め版の説明、ベンダー中立命名)が機能と同等に重要なデリバリー面となっている。
  • オペレータライブラリが「拡容」から「検収とチューニング」へ移行:KernelGen ロングテール一括(約 60 枚)と昆仑芯 31 オペレータ最適化バッチ(27/31 達成)が並行;「同一オペレータのマルチプラットフォーム対照実装」「同一プラットフォームの一括修正バッチ」が常態的な作業モデルに;テスト基盤も同期してプラットフォーム化(klx-p800 移行、mthreads3.6 / hcu3.6 ワークフロー、六バックエンド FP8 対照テスト)。機能凍結後の性能アクションが GA 前に集中放出。
  • 非本線コンポーネントは独自のリズム、2.3 サイクルが前倒し始動:FlagQuantum は二週間の調査期間で 30+ 件からスタート、FlagSparse は外部協力者と高頻度に合流、FlagFFT は新バックエンド + パッケージングを完了、FlagTrain は初回オペレータを着地;正式タグ登録の翌日には開発本線が 0.4.0 に昇格——2.2 デリバリーと 2.3 開発の事実上の分岐がすでに発生(量子、3D 算力などの新方向と 2.2 の境界が正式に切り分けられた)。
  • 産業ナラティブとコードのリズムが同頻:会議シーズンの「統一ソフトウェアスタック / 多元算力」ナラティブが高密度に放出(AICC2026、雲栖、SAIL、龍芯、Open3D-PIMC)、コード側の確定アクションと相互に裏付け;メンバー単位は訓練(RLinf × S5000)と推論(Protenix-v2、Day 0 適配)の両側で同時に着地。次の報道ピークは 09-28 GA リリースウィンドウと予想される。

付録:素材と検証

— https://github.com/flagos-ai/FlagSparse/pull/90 · FlagFFT — https://github.com/flagos-ai/FlagFFT/commits/dev