調査期間:過去24時間(2026-09-29 07:00 ~ 2026-09-30 07:00、北京時間;前回のレポートは09-29で、期間はシームレスに接続し重複なし)。 情報源:GitHub(tile-ai 組織29リポジトリのプッシュ核查、期間内に7リポジトリでプッシュあり:tilelang、TileOPs、TileOPs-nightly、tilelang-ascend、tilelang-hygon、TileFoundry、TileOPs.github.io;メインリポジトリで2件のマージと7件の新規オープン、TileOPs で17件のマージ、昇騰リポジトリで2件の修正、海光とTileFoundryで各1件のマージ、ナイトスナップショット1件はゼロ失敗)、Google News RSS の中国語・英語複数クエリ(プロキシ経由、ヒットゼロ)、Hacker News、arXiv、コミュニティリポジトリ核查


本期インデックス

  • 今日の重点:Ascend 950 バックエンドの公開リリース——134コミットのネイティブバックエンド PR がオープン、0.1.15 バージョン番号を同時に引き上げ(09-30)
    1. コアプロジェクトの進展
      • 1.1 メインリポジトリ:Simplify 未使用バインディングエリミネータのマージ——read-after-write、副作用、メタデータ参照にいずれもリグレッションのセーフティネットあり(09-29)
      • 1.2 メインリポジトリ:Windows wheel ビルドで ccache ヒットを回復——clang-cl 引数を分割記述に変更(09-29)
      • 1.3 メインリポジトリのキュー:7件の新規オープンとアトミック操作修正ライン、オープン PR は計116件(09-29/09-30)
      • 1.4 TileOPs:INT8 量子化と逆量子化の4カーネルをマージ——ビット単位で torch リファレンスに一致(09-29/09-30)
      • 1.5 TileOPs:INT4 グループ単位量子化カーネルをマージ、ブロック量子化2件がキュー待ち(09-30)
      • 1.6 TileOPs:サンプリングオペレータ層をマージ——前期キュー待ちだった6件が正式に着帳(09-29)
      • 1.7 TileOPs:アテンション4件——FP8 式の沈み込み、varlen の出站を共有メモリに転換、SM89 ヘッド次元512の修正(09-29/09-30)
      • 1.8 TileOPs:カーネルインターフェースと共有メモリガバナンスの2件(09-29)
      • 1.9 TileOPs:CI とエンジニアリング規範の3件——8並発スモーク、絶対インポート、マニフェスト検証の単一化(09-29/09-30)
      • 1.10 TileOPs:要素レベル高速化の2件——除算フォールバックをスレッドごとに1回、f32 は16バイトを2回ロード(09-29/09-30)
      • 1.11 ナイトスナップショット:正確性1030項目、ベンチマーク1355項目、ゼロ失敗ゼロエラー(09-30 未明)
    1. マルチバックエンド適配(昇騰 / 沐曦 / 海光 / 摩尔線程)
      • 2.1 昇騰:950 リリースブランチを期間内に再修正——ブロードキャストのベクトル化とスカラーリダクションを回復(09-30)
      • 2.2 昇騰:ascend リポジトリの2件の修正——TVM の1行パッチがフォールバックの真因を解明(09-29)
      • 2.3 海光:非同期コピーとキャッシュ swizzle lowering の改善をマージ(09-29)
      • 2.4 沐曦 / 摩尔線程 / MLIR 昇騰:公式リポジトリは沈黙(09-30 核查)
    1. エコシステムと採用側
      • 3.1 TileFoundry:AtomSched 第4段階をマージ——HIR の TIR への降級とスケジューリング CLI(09-29)
      • 3.2 ドキュメントサイト:量子化、サンプリング、共有エキスパート MLP オペレータが API リファレンスに登録(09-30)
      • 3.3 採用側の核查:TileKernels と FlashQLA は期間内にプッシュなし(09-30)
      • 3.4 バージョンのリズム:0.1.15 引き上げ PR がオープン;TileRT と TileFoundry のリリースページは停滞(09-30)
    1. コミュニティ、チュートリアル、イベント
      • 4.1 コミュニティリポジトリの核查:期間内に新規コミットなし(09-30)
      • 4.2 メディアと学術側:Google News はヒットゼロ、arXiv に新規プレプリントなし(09-30)
    1. トレンド観察
      • 5.1 契約からカーネルへ:量子化ファミリーが48時間で履行を完了
      • 5.2 Ascend 950:マルチバックエンドの物語が「適配リポジトリ」から「メインリポジトリのネイティブ」へ
      • 5.3 エンジニアリングの収容力:テスト量 +21% 下での CI 再構築
      • 5.4 空白とリスクポイント
  • 付:素材と核查の説明

今日の重点:Ascend 950 バックエンドの公開リリース——134コミットのネイティブバックエンド PR がオープン、0.1.15 バージョン番号を同時に引き上げ(09-30)

日付:2026-09-30 出典:Ascend 950 バックエンド PR(#3308)/ バージョン引き上げ PR(#3309)/ リリースブランチ ascend-950-0930

09-30 未明、TileLang のメインリポジトリで象徴的な PR が2件連続で開設された。「Public Release 9/30」と标注された昇騰 950 ネイティブバックエンドとバージョン番号を 0.1.15 に引き上げである。前者は 134 コミット、379 ファイル、+79956/-733 の規模で、昇騰ラインを独立適応リポジトリからメインリポジトリの一級バックエンドへと押し上げた:

  • エンドツーエンド経路:Ascend 言語方言を新規追加し、カーネル起動、メモリ割り当て、データ移動と計算操作をカバー。ハードウェア特化 lower、自動スケジューリングと同期、デバイスコード生成、畢昇(Bisheng)コンパイルと NPU ランタイムロードを含む。ユーザーは target="ascend" で Ascend 950 カーネルを直接開発できる。
  • プログラミングモデル:単一カーネル内で Cube(AIC)T.gemm と Vector(AIV)計算を組み合わせ;T.SimdVF / T.SimtVF 領域で SIMD と SIMT プログラミングを混合;UB / L1 / L0 の明示的割り当て;T.copy / T.dual_copy によるブロック転送とクロスコア転送;MXFP8 / MXFP4 ブロックスケーリング GEMM 低精度パスを含む。
  • コンパイラとスケジューリング:昇騰フラクタルレイアウトの自動推論とストレージ正規化;AutoSchedule が依存関係とレイテンシを考慮した Cube/Vector スケジューリング、パイプラインとマルチバッファリングを実行;スケジューリング認識のコア内・クロスコア同期挿入、冗長同期除去、フラグビットの自動割り当てと再利用を付随。
  • ビルド統合:USE_ASCEND ビルドスイッチ、畢昇コンパイルチェーン、ランタイムロードとカーネル起動がいずれもメインリポジトリに入る;既存バックエンドインターフェースに従いマルチバックエンドアーキテクチャへ接続し、共有コンパイラ基盤を再利用。
  • 評価口径(PR 内):Torch NPU と対照し、BF16 GEMM、FP8 変換、GQA 逆伝播を各 4 形状で評価;GEMM と GQA は TFLOP/s、FP8 変換は有効 GB/s を報告。
  • 規模と署名:ブランチと main が同期、134 コミット先行、調査期間内も修正を追加中(最新コミットはブロードキャストベクトル化とスカラーリダクションを復元、09-30 未明);Co-author は 10 名、うち 2 名は deepseek.com 署名の開発者。
  • 連動:同日に開設された 0.1.15 バージョン引き上げ PR は VERSION の1行のみ変更(0.1.14 から 0.1.15)、950 バックエンドと隣接して計上され、同一バッチリリースかは観察待ち。

判読:もしマージされれば、昇騰 950 は初めてメインリポジトリのネイティブバックエンド形態で実装される(これまで昇騰サポートは主に独立適応リポジトリが担っていた)。「マルチバックエンド」はミラーリポジトリ適応から主干能力へとアップグレードされる。利用者にとっては、昇騰 950 のオペレータ開発と DeepGEMM スタイルのカーネルを TileLang で直接記述できる。リスク面は規模(379 ファイル、約 8 万行の新規追加)がもたらすレビューとマージ後の安定性コストにあり、かつ NPU 側の性能は現在 PR 内の図表による公開口径のみである。


1. コアプロジェクト進展

1.1 メインリポジトリ:Simplify 未使用バインディング削除器がマージ——読み後書き、副作用、メタデータ参照にいずれも回帰の裏付けあり(09-29)

日付:2026-09-29 情報源:Simplify 未使用バインディング(#3293)

  • 前号で新規開設された項目が本調査期間でマージ:tl.Simplify に UnusedBindRemover を追加し、その値が関連する副作用と volatile バッファ読み取りを破棄せずに捨てられる場合、未使用の BindNode を繰り返し削除する。
  • 境界ルール:反射フィールドとコンテナを走査してメタデータに参照されるバインディングを保持;バッファ定義とロード述語で使われるバインディングは一律保持;回帰テストは未使用マクロバインディング、読み後書き、副作用、volatile 読み取り、メタデータ参照、共有式ノードをカバー。
  • 意義:tl.Simplify のクリーンアップ能力の拡張は先週の剰余数界修正(#3294)と同じ方向性——変換層の「何を削ってよく、何を必ず残すか」が徐々にテスト可能な明確なリストとして書き出されている。

1.2 メインリポジトリ:Windows wheel ビルドで ccache ヒットが回復——clang-cl 引数を分離記述に変更(09-29)

日付:2026-09-29 情報源:Windows ビルド修正(#3305)

  • 問題:Windows wheel ビルドで ccache を復元しても TVM が繰り返し再コンパイル——1回約 32 分、554 回の未ヒット、ヒット率わずか 20.63%、3晩連続の夜間ビルドで同型。根本原因は CMake が clang-cl に出力する連結式 -imsvc<path> 引数で、ccache 4.9.1 がこれを前処理ハッシュに含め、PEP 517 依存ディレクトリが変わるとキャッシュキーも変わる;既存ラッパーは前処理テキストを正規化できるがコマンドライン差異は除去できない。
  • 修正:-imsvc <path> を分離記述形式に変更し、キャッシュキーが安定に回復;同日に作成・マージ、レビューコメントが自動サマリーで再確認。

1.3 メインリポジトリキュー:7件の新規開設とアトミック操作修正ライン、オープン PR は 116 件(09-29/09-30)

日付:2026-09-29、2026-09-30 情報源:主リポジトリ PR リスト/ アトミック操作修正(#3307)/ DeepSelect 示例(#3304)/ パックベクトル比較(#3303)

  • 調査期間内に新規 7 件:#3303 は FP16/BF16 パックベクトル比較(欠陥票 #3302 を修正、マスク内蔵で 0/1 に正規化、NaN の正しい不等価、CUDA 12 未満と低演算能力ではスカラーへのフォールバックを保持);#3304 は DeepSeek DeepSelect Top-K の TileLang 示例をコミット(インライン PTX なし、審査中の #3303 と #3296 に依存、RTX 5090 上で torch.topk と対照した 129 組の実測を提示);#3306、#3307 はアトミック操作修正ライン(int64 アトミック max/min と AtomicStore の int64/bf16/fp16 クラッシュ、#1716 の型正規化に遡及可能;#3306 はマージされずクローズ、#3307 は引き継いで審査中);#3308、#3309 は本日の重点を参照。
  • 既存更新:SM120 レジスタ A GEMM(#3286)、z3 スレッド推論(#3291)、C ソースインポートの改行(#3289)、popcount 拡張(#3300)などが調査期間内にいずれも更新あり。
  • キューの温度:オープン PR は計 116 件(前回 112 件);本調査期間のマージは 2 件(#3293、#3305)、「開多くマージ少なし」の構図が継続。

1.4 TileOPs:INT8 量子化と逆量子化の四カーネルをマージ——ビット単位で torch リファレンスに整合(09-29/09-30)

日付:2026-09-29、2026-09-30 情報源:per-tensor 逆量子化(#2304)/ per-channel 逆量子化(#2306)/ per-tensor 量子化(#2307)/ per-channel 量子化(#2308)

  • 前回の「まず契約を定め、次に実装を落とす」はカーネル兌現期に入った:INT8 ファミリーの量子化と逆量子化の計四つのオペレータ層がカーネル側で実装され、リストのステータスは implemented に移行、出力はビット単位で torch リファレンス実装に整合(scale がアンダーフローしてゼロになる境界ケースを含む)。
  • per-tensor 逆量子化(#2304):q はフラットな系列として読み取り、各スレッドは各ステップで 16 バイトの出力ベクトルを 1 つ変換、64 スレッドブロックごとに 4 ステップでまず全ロードを発行;コード点は指数バイアスの整数加算と FADD 変換を経由(I2F を回避);ブロック内出力はまず共有メモリに入れてからバッチ書き出し(SM90 では cp.async.bulk を使用);L1 evict-last ロードヘルパー(streaming_load.h)を新規追加。
  • per-channel 逆量子化(#2306):ベクトルが行をまたぐ際に二行のスケール間で選択し、任意の K で単一プログラム実行;per-channel 量子化(#2308):1 つの CTA が一行を独占し、行内はレジスタに常駐、スケールは逆数に 2 回の FMA を加えて正しく丸め、行頭と行末は隣接行とベクトルを共有しマスクを行う。
  • per-tensor 量子化(#2307):単一の協調起動で完了——第一段階で amax のシャードを読み込み交換(グリッドレベルバリア)、第二段階で量子化して出力;呼び出しごとにカーネルを構築し、コンパイル境界を明示的に宣言。
  • 進捗:量子化ファミリーの 9 件の spec-only 項目のうち既に 7 件がカーネル実装に到達(INT8 六件 + INT4 一件)、FP8 per-block と SmoothQuant はまだカーネル PR が見られない。

1.5 TileOPs:INT4 per-group 量子化カーネルをマージ、ブロック量子化は 2 件が待機中(09-30)

日付:2026-09-30 情報源:INT4 per-group 量子化(#2317)/ per-block 量子化(#2316、審査中)/ per-block 逆量子化(#2318、審査中)

  • INT4 グループ単位量子化が 2 つのカーネルに着地:packed_weight、weight_scale、weight_zero は torch 参照とビット単位で一致し、GemmW4A16FwdOp.repack のパッキング形式を採用——W4A16 重みチェーンの形式整合は今回最も実用的な互換ポイントである。
  • カーネルの要点:各 lane が 32 要素ブロックを 1 つ保持し、128 要素の K ステップ内で lane 間のデータ移動が不要;四乗四字転置で 16 バイト連続ストレージを出力;グループサイズは 32 から 1024 までの 2 の冪をサポート;別途行カーネル版を用意。
  • 審査中 2 件:INT8 ブロック単位量子化(#2316)とブロック単位逆量子化(#2318)——いずれも #2304 のスケジューリングテンプレートを踏襲し、「テンソル/チャネル/ブロック」の三档の最後のピースを補完する。

1.6 TileOPs:サンプリングオペレータ層のマージ——前回キューに並んでいた 6 枚が正式に着地(09-29)

日付:2026-09-29 情報源:サンプリングオペレータ層(#2299)

  • 前回レポートで「キュー待ち審査中」と記録された 6 枚のサンプリングオペレータ層(TopKMask、MinPMask、TopPMask、TopKTopPMask、SamplingFromProbs、ChainSpeculativeSampling)が 09-29 午後にマージ:オペレータ層、ワークロード、テストが一度に揃い、参照数値は FlashInfer 0.6.16(bf16/fp16/fp32 の三档)に整合、乱数は Philox4x32-10 整数テンソル演算で実装し、Random123 の既知の答案ベクトルと一致。オペレータ層は依然として宣言式(kernel_types = {})であり、カーネル実装は後続の PR を待つ。

1.7 TileOPs:アテンション 4 件——FP8 式の下沉、varlen 出站の共有メモリ化、SM89 ヘッド次元 512 の修正(09-29/09-30)

日付:2026-09-29、2026-09-30 情報源:FP8 GQA リーフオペレータ(#2294)/ varlen プリフィル出站(#2313)/ SM89 ヘッド次元 512(#2312)/ スライディングウィンドウ用例の階層化(#2311)

  • FP8 GQA の下沉(#2294):出力アキュムレータのクリアを T.clear に変更、KV 末尾マスクをレイアウト認識の T.Parallel ループとして表現、既に不要となった CUDA 辅助を 2 箇所削除;#2113 の増分に属する。評価された softcap の T.tanh 置換はロールバックのため意図的に除外——近似 tanh パスを保持。
  • varlen 出站は SMEM 経由(#2313):varlen GQA プリフィルの出力は acc_o フラグメントから散列書き出しされず、失効したクエリブロック共有バッファを経て行全体を 16 バイトで書き出し、共有メモリの追加オーバーヘッドはゼロ;部分ブロックはガード付き直接書き込みを保持。
  • SM89 ヘッド次元 512 の修正(#2312):単一 warpgroup の 32 行ブロックはスコアブロックをレジスタに残さなくなった(従来はレイアウト推論の衝突により block_m=32 候補が一度もコンパイル成功しなかった);デフォルト設定に 32×16 候補を追加(68 KiB 必要、SM89 の上限以下)。
  • テストの階層化(#2311):スライディングウィンドウ varlen の 8 用例を SM90 専用とマーク——従来 SM89 上ではスキップではなく失敗として現れていた。

1.8 TileOPs:カーネルインターフェースと共有メモリガバナンスの 2 件(09-29)

日付:2026-09-29 情報源:カーネルインターフェースとディスパッチ(#2300)/ 共有メモリ上限表(#2303)

  • カーネルのインターフェース化(#2300):オペレータにカーネルインターフェースを宣言し、単一の検索でディスパッチ——「カーネルインターフェース、実装、呼び出し仕様、可用性」など 7 つの概念を ops-design 設計ドキュメントに記述;実装の置換はキー名だけでなくインターフェース契約で検証され、バックエンドは内蔵実装の傍らに独自の実装を追加できる。
  • 共有メモリガバナンス(#2303):共有メモリの上限を統一テーブルに収束;FP8 GEMM は supported_archs = [90] を宣言(SM89 の呼び出しは誤って TMA/WGMMA カーネルを選択されるのではなく明示的に拒否される);スパース MLA は显存に収まらない呼び出しを下界評価の上で拒否(例えば SM86/SM89 上でブロックあたり 64 ヘッド、d=512 が 100 KB を下回らず 99 KB の上限を超えるシナリオで、従来は起動失敗していた)。

1.9 TileOPs:CI と工程規範の 3 件——8 並発スモーク、絶対インポート、マニフェスト検証の単一化(09-29/09-30)

日付:2026-09-29、2026-09-30 情報源:GPU スモーク八並列(#2314)/ 絶対インポート規範(#2310)/ マニフェスト検証の単一化(#2319)

  • スモーク高速化(#2314):PR スモークをシングルプロセス・シングルカードから八ワーカープロセスに変更。署名チェックは遅延生成に。ついでに bs1 デコードのバリア競合も修正。背景は記録に値する:メインブランチへのプッシュ時のテスト数は 4281 から 5174 へ増加(+21%)、pytest 所要時間は 324 秒から 605 秒へ増加(+87%)。増分は主にマニフェスト体系の CPU 作業によるもので、カーネルテストではない。
  • 規範(#2310):src/tileops/ の全インポートを絶対インポートに変更し、ruff TID252 で強制(ban-relative-imports = "all"、234 ファイルを書き換え)。設計ドキュメントも同期。
  • マニフェスト検証(#2319):validate_manifest.py を PR ごとに三回実行から一回に変更(GPU スモークではこのテストがクリティカルパスの 22 秒から 32 秒を占める)。併せて FMA 飽和度量がサンプリングされた GPU に追従するように。

1.10 TileOPs:要素レベル高速化二件——除算フォールバックをスレッド単位で一回に、f32 は 16 バイト二回ロード(09-29/09-30)

日付:2026-09-29、2026-09-30 情報源:除算フォールバック(#2305)/ f32 ロードと bool ストア(#2309)

  • 除算ファミリー(#2305):FloorDivide、Remainder と floor モードの Div は #2291 でビット単位の正確化を行った後、1.01 倍から 1.28 倍に後退。今回は fast_func をスレッドごとに統一して高速判定する方式に変更し、失敗したスレッドのみオペランドを読み戻して正確なフォールバックを実行。カーネルは 32 レジスタ上限を維持。16 ビットの高速パスは a * (1/b) で上方修正。
  • f32 ロード(#2309):同一形状の二項カーネルをスレッドごとに 16 バイト二回ロードに変更(inductor の XBLOCK 1024・四 warp 形態に整合)。比較と論理系の bool 結果はスレッドごとの連続セグメントで一括ストアに変更——これまで torch-compile に対して 1.002 倍から 1.006 倍だった行がこれで収束。

1.11 夜間スナップショット:正確性 1030 項目、ベンチマーク 1355 項目、失敗ゼロエラーゼロ(09-30 未明)

日付:2026-09-30 情報源:スナップショットコミット b8f4329a35/ スナップショット環境メタデータ

  • 調査期間内に 1 件のスナップショット(09-30 02:53、run 36608962204。対応する TileOPs メインブランチは 2ce972f98f、すなわち #2313 のマージ点):正確性 1030 項目(スキップ 2)失敗ゼロエラーゼロ、ベンチマーク 1355 項目(39 スイート)失敗ゼロエラーゼロ。環境:H200、CUDA 13.2、torch 2.13、tilelang 0.1.11+cu132。
  • 前回(b7f5a1b4bd、正確性 1027、ベンチマーク 1335)と比較:正確性 +3、ベンチマーク +20。基準は引き続き「失敗ゼロ」を尺とする。注:本スナップショットのマージ点は量子化カーネルバッチ(#2304 から #2317)より早い。当該バッチの回帰状態は次回のスナップショットに反映される。

2. マルチバックエンド適配(昇騰 / 沐曦 / 海光 / 摩尔線程)

2.1 昇騰:950 リリースブランチが調査期間内に再修正——ブロードキャストベクトル化とスカラーリダクションを復旧(09-30)

日付:2026-09-30 情報源:リリースブランチ ascend-950-0930

  • リリースブランチは本調査期間中に最新の修正コミットを受信(09-30 未明、コミット 39691ebaac):ブロードキャストベクトル化とスカラーリダクションを復旧——「Public Release 9/30」PR における調査期間内の最新修正の一つ。ブランチは main と同期し、134 コミット先行、メイン PR は依然オープン。技術構成の詳細は本日の重点を参照。

2.2 昇騰:ascend リポジトリの修正二件——TVM 一行パッチが後退の真因を解明(09-29)

日付:2026-09-29 出典:TVM 回帰越界パッチ(#1846)/ CI サブモジュールクリーンアップ(#1847)

  • ロールバックの真因が判明(#1846):固定の TVM サブモジュールに 1 行のパッチを追加し、TVM が誤ったコールスタックを生成する際の越界読み取り(std::string tmp(symname, symsize) を単一引数コンストラクタに変更)を修正。背景は前号レポートに記録された「#1829 がマージ後 4 日で丸ごとロールバックされた」件:tvm.error.InternalError の送出を期待する 9 件のコンパイラ負例が x86 runner では安定して SIGSEGV、ARM runner では安定して通過;同一マシンでの単変量 A/B 実験により、クラッシュはこの TVM 欠陥に由来し #1829 のロジックとは無関係であることが判明。パッチは既存の apply_tvm_patches.sh メカニズムを踏襲(3 つのビルドエントリで自動適用、適用済みならスキップ、将来適用不可となった場合はビルドを静かに通さず直接エラーにする)。
  • CI クリーンアップ(#1847):セルフホスト runner 上では actions/checkout がサブモジュールをクリアせず、git submodule update も commit が変わったときのみポインタを切り替えるため、前の PR で TVM に打ち込まれたパッチが後続のすべてのビルドに漏れていた(#1846 のビルドはまさに残留によりパッチ適用不可のエラーとなった);修正はビルド前にサブモジュールをリセットするもの。
  • 判読:#1829 がロールバックされたのはそれ自体の欠陥ではない——ロールバックされた機能がクリーンなベースラインで再提出されるかが、今後の観察ポイント。

2.3 海光:非同期コピーとキャッシュ swizzle lowering の改善をマージ(09-29)

日付:2026-09-29 出典:海光非同期コピー(#13)/ マージコミット 145fc5a8e7

  • 前号で記録したオープン PR が本調査期間でマージ(9 ファイル +497/-41):非同期コピーとキャッシュ swizzle の lowering を改善。変更は codegen_hcu(+121/-29)、op/copy.cc(+269/-8)、tl_templates/hcu/copy.h(+47)、amd_buffer_addressing.hpp(+20)に集中し、ほかに GEMM の LDS 戦略を微調整;Co-authored に Teng Huang。海光は今期の国産バックエンドのうち、昇騰を除いて唯一コードが進展した一家。

2.4 沐曦 / 摩尔線程 / MLIR 昇騰:公式リポジトリは静穏(09-30 確認)

日付:2026-09-30 出典:沐曦リポジトリ/ 摩尔線程リポジトリ/ MLIR 昇騰リポジトリ

  • 沐曦(最終プッシュ 09-24)、摩尔線程(09-17)、MLIR 昇騰(09-24)の公式リポジトリはいずれも調査期間内にプッシュなし;コミュニティ側にも新規コミットなし。国産バックエンドの今週の熱量は昇騰(950 バックエンド + 2 件の修正)と海光(#13 マージ)に集中。

3. エコシステムと採用側

3.1 TileFoundry:AtomSched 第 4 段階をマージ——HIR の TIR への降格とスケジューリング CLI(09-29)

日付:2026-09-29 出典:AtomSched 第 4 段階(#192)/ TileFoundry リポジトリ

  • 99 ファイル +4885/-2885 の段階的マージ:ConvertHIRToTIR というモジュールレベルの pass を新設し、記述済みのスケジューリング HIR を検証済み TIR へ降格;tilefoundry schedule finalize / facts / candidates の 3 組の CLI レポートを新設し、却下された matched ワークフローを削除。
  • 設計の指向:IR 宣言とアクセス関係を唯一の事実源とし、重複する問題計画、プリスキャン、推論分布、手書きアクセサを削除;レポート一覧、ソート、モードレンダリング、HIR/TIR 候補のペアリングは共有リフレクションと中立レジストリに変更。「宣言駆動スケジューリング」路線の収束段階にある。

3.2 ドキュメントサイト:量子化、サンプリング、共有エキスパート MLP オペレータが API リファレンスに追加(09-30)

日付:2026-09-30 出典:ドキュメントサイト更新(#57)

  • TileOPs ドキュメントサイトは、量子化・サンプリング・共有エキスパート MLP オペレータのマージ後、API リファレンスを同期更新——#2299、#2304 から #2317 までのオペレータ公開ペースと同日にフォローアップ。

3.3 採用者チェック:TileKernels と FlashQLA は調査期間内にプッシュなし(09-30)

日付:2026-09-30 情報源:TileKernels リポジトリ/ FlashQLA リポジトリ

  • DeepSeek TileKernels は依然として 2026-04 で停止;Qwen FlashQLA の最終プッシュは 09-28(前回調査期間、SM100 tcgen05 を既報)、今調査期間に新規コミットなし。両採用者の公開動向はいずれも間歇期にある。

3.4 バージョンリズム:0.1.15 の PR 提出で向上;TileRT と TileFoundry のリリースページは停滞(09-30)

日付:2026-09-30 情報源:メインリポジトリ リリースページ/ TileRT リリースページ/ TileFoundry リリースページ

  • メインリポジトリ v0.1.14(09-02 リリース)は既に 28 日経過、0.1.15 バージョンアップ PR が今調査期間に提出(本日の重点参照)、正式 release はまだ見られず;TileOPs に独立リリースなし。
  • TileRT リリースページは依然 v0.1.5.post2 で停滞(前号記載の v0.1.6 リリース PR マージ後、正式出版は見られず);TileFoundry の最新は依然 v0.0.2(09-10)。

4. コミュニティ、チュートリアルとイベント

4.1 コミュニティリポジトリチェック:調査期間内に新規コミットなし(09-30)

日付:2026-09-30 情報源:コミュニティチュートリアルリポジトリ/ 算能 BM1690 パイプラインリポジトリ/ S5000 パフォーマンス分析ツール/ tvm_tilelang_cookbook

  • 四つのコミュニティリポジトリ(tilelang-tutorials、bm1690-pipelines、Tilelang_musa、tvm_tilelang_cookbook)は調査期間内にいずれも新規コミットなし;cookbook は chart ブランチのスター履歴自動プッシュのみ(実質的動向ではなく、カウントせず)。前号報告のチュートリアルサイト CPU サンプルと BM1690 パイプライン進展は今号以前の内容であり、重複展開しない。

4.2 メディアと学術側:Google News ゼロヒット、arXiv に新規プレプリントなし(09-30)

日付:2026-09-30 情報源:Google News/ Hacker News/ arXiv

  • Google News RSS の中国語・英語複数グループクエリ(プロキシ経由)は 24 時間ウィンドウ内でゼロヒット;「昇騰 950」「Ascend 950」の中国語・英語ヒットはいずれもウィンドウ前の株式市場とマクロ記事であり、TileLang バックエンドリリースに直接関連なし(公開は 9/30 と注記、メディアは尚未フォローアップ)。Hacker News のウィンドウ項目は本テーマと無関係;arXiv で「tilelang」を検索すると最新は依然 07-24 の TileSight。

5. トレンド観察

5.1 契約からカーネルへ:量子化ファミリーが 48 時間で実現を完了

前号報告の観察点は「本批オペレータ層にはまだカーネルがなく、今後のカーネル実装リズムに注目」であった。48 時間も経たずに、量子化ファミリー 9 枚のうち 7 枚が既にカーネル実装に入った:INT8 四枚がマージされビット単位で torch リファレンスに整列、INT4 逐グループ一枚がマージされ W4A16 パッケージ形式に整列、INT8 逐ブロック二枚が審査中。単一批 PR の説明パラダイムも既に形成——各筆に参考実装とのビット単位一致性、コンパイル境界、マニフェスト状態と拒否セマンティクスを明記し、「まず正確性を証明し、次に性能を語る」。このペースであれば、残る FP8 逐ブロックと SmoothQuant 二枚の実装が次の観察ウィンドウの注目点となる。

5.2 Ascend 950:マルチバックエンドのナラティブが「適配リポジトリ」から「メインリポジトリ原生」へ

昇騰 950 バックエンドは 379 ファイル、約 8 万行の新規追加という PR でメインリポジトリに直接投入され、しかも 0.1.15 バージョンアップと同日に開設された——TileLang の「マルチバックエンド」はミラーリポジトリ適応からメインライン能力へと格上げされつつあり、対標ベースラインも華為自家の Torch NPU を直接選択している。署名には deepseek.com のメールと複数のコミュニティ核心開発者、計 10 名の Co-author が見て取れ、昇騰ラインが多方面協調による整建制での投入であり、単点適応ではないことを示している。冷静に見る必要があるのは、PR がまだマージされていないこと、規模が巨大であること、性能データは現時点で PR 内の図表口径のみであることだ。マージ後のメインライン安定性とフォローアップ保守コストは、より長い周期での観察点となる。

5.3 工程承载力:テスト量 +21% 下での CI 再構築

メインブランチのテスト数は 4281 から 5174 へ増加(+21%)、pytest 所要時間は +87%、増分は主にマニフェスト体系の CPU 側作業に由来する——まさに「200 オペレータ、契約先行」戦略の直接コストである。当日の回应は三つの工程化:GPU スモーク八並列、署名チェックの遅延化、マニフェスト検証の単回化(各 PR 二回の重複検証を除去)。能力拡張期に CI を「十分」から「規模に耐える」へと鋳直すことは、今週過小評価されている基盤叙事である。

5.4 空白とリスク点

其一、マルチバックエンド分化が継続:沐曦(09-24 以降)、摩尔線程(09-17 以降)、MLIR 昇騰(09-24 以降)は静黙、熱度は昇騰と海光に集中;其二、メインリポジトリの「開多合少」は未反転——本調査期間のマージ 2 筆、新規開設 7 筆、開放 PR は 116 筆に達し、レビューバンド幅は依然としてボトルネックであり、昇騰 950 の大型 PR のマージペースがこれを直接検証する;其三、#1829 の回退された特性の再提出、0.1.15 正式出版と TileRT v0.1.6 リリースページの補票はいずれも未決着;其四、量子化とサンプリング式カーネルの検証は現在ビット単位アライメントと単機ベンチマークに限られ、エンドツーエンドモデル精度への影響は公開検証がまだない。


付:素材と検証説明

情報源 検証結果
tile-ai 組織(29 リポジトリ) 調査期間内に 7 リポジトリでプッシュあり:tilelang(2 マージ、7 新規開設)、TileOPs(17 マージ)、TileOPs-nightly(1 スナップショット)、tilelang-ascend(2 マージ)、tilelang-hygon(1 マージ)、TileFoundry(1 マージ)、TileOPs.github.io(1 筆)
メインリポジトリ tilelang #3293、#3305 をマージ;#3303 から #3309 の新規開設計 7 筆(#3306 はクローズ未マージ);開放 PR 計 116 筆;リリースブランチとバージョンアップブランチは調査期間内に活発
TileOPs 17 筆マージ(#2299 から #2319 区間);同調査期間に 17 筆新規開設;審査中 4 筆(#2172、#2315、#2316、#2318);量子化ファミリーが主役
tvm(同組織サブモジュールリポジトリ) 調査期間内にコミットなし
TileOPs-nightly 1 スナップショット b8f4329a35:正確性 1030 項(スキップ 2)ゼロ失敗ゼロエラー;ベンチマーク 1355 項(39 スイート)ゼロ失敗ゼロエラー
TileOPs.github.io 1 筆(#57 量子化、サンプリングと MLP オペレータを API リファレンスに追加)
国産バックエンド五リポジトリ 昇騰:950 リリース PR #3308 と ascend リポジトリの二筆修正;海光:#13 マージ;沐曦(09-24 以降)、摩尔線程(09-17 以降)、MLIR 昇騰(09-24 以降)は活動なし
採用側とコミュニティ TileKernels、FlashQLA は調査期間内にプッシュなし;四社のコミュニティリポジトリに新規コミットなし(cookbook は自动化ブランチプッシュのみ)
Google News / Hacker News / arXiv 中英語クエリゼロヒット(昇騰 950 のヒットはいずれも調査期間前の株式市場とマクロ記事);HN は本テーマと無関係;arXiv 最新は依然 07-24 TileSight

完全情報源リスト

leOPs/pull/2313>

tilelang_cookbook — https://github.com/RuneFang/tvm_tilelang_cookbook