調査期間:過去 24 時間(2026-09-28 07:00 ~ 2026-09-29 07:00、北京時間;前回のレポートは 09-28、期間はシームレスに接続、重複なし)。 情報源:GitHub(tile-ai 組織 29 リポジトリのプッシュ核查、期間内に 7 リポジトリでプッシュあり:tilelang、TileOPs、TileOPs-nightly、tvm、tilelang-hygon、TileOPs.github.io、tilelang-ascend;TileOPs 14 件マージ、メインリポジトリ 2 件マージと TVM サブモジュールのフォローアップ、夜間スナップショット 1 件はゼロ失敗;採用側 FlashQLA とコミュニティリポジトリに更新あり)、Google News RSS 中国語・英語複数クエリ(プロキシ経由、ゼロヒット)、Hacker News、arXiv、コミュニティリポジトリ核查


本期インデックス

  • 今日の重点:TileOPs 量子化ファミリが先に実装層へ——九つのオペレータ層が一夜でマージ、サンプリングファミリ六つが同日に待機(09-28/09-29)
    1. コアプロジェクトの進展
      • 1.1 メインリポジトリ:TVM 末尾ガードレール修正——モジュロ剰余の境界反転が越界読みを引き起こす可能性、実ターゲットで再現後にマージ(09-28)
      • 1.2 メインリポジトリ:デフォルト単一構成ビルドに -O2 を追加——lowering 幾何平均が 1.19 倍高速化、ライブラリサイズが半減(09-28)
      • 1.3 メインリポジトリキュー:新規 5 件と更新 3 件、オープン PR は計 112 件(09-28)
      • 1.4 TileOPs:サイレントエラーカーネルの集中修正、十数箇所の「結果を返すがエラーを報告しない」を一括処理(09-29 未明)
      • 1.5 TileOPs:アテンション整編続章——MHA と GQA のページドデコードを統一、逆方向 WS カーネルをマージ(09-28)
      • 1.6 TileOPs:reduction と norm のバッチ高速化六件(09-28)
      • 1.7 TileOPs:エンジニアリング二件——ソースを csrc に移行、ガード免除の整理(09-28)
      • 1.8 夜間スナップショット:正確性 1027 項、ベンチマーク 1335 項、ゼロ失敗ゼロエラー(09-29 未明)
    1. マルチバックエンド適配(昇騰 / MLIR 昇騰 / 沐曦 / 海光 / 摩尔線程)
      • 2.1 海光:非同期コピーとキャッシュ swizzle lowering の改良がレビュー入り(09-28)
      • 2.2 昇騰:先週マージされた機能が一括でリバート、メインリポジトリに ascend-0930 ブランチを新規追加(09-28/09-29)
      • 2.3 沐曦 / 摩尔線程:公式リポジトリは静か、コミュニティ側で S5000 性能ツールが更新(09-28)
      • 2.4 コミュニティ側:算能 BM1690 TPU パイプライン適配の新規リポジトリが開設(09-28)
    1. エコシステムと採用側
      • 3.1 採用側:FlashQLA が SM100 tcgen05 に移行、prepare_h 実測 1.43 倍(09-28)
      • 3.2 採用側核查:TileKernels にプッシュなし、TileFoundry に期間内コミットなし(09-29 核查)
      • 3.3 バージョンリズム:v0.1.14 が満 27 日、TileRT リリースページが 5 日遅延(09-29)
    1. コミュニティ、チュートリアルとイベント
      • 4.1 コミュニティチュートリアル:tilelang-tutorials が CPU サンプルを更新(09-29)
      • 4.2 ドキュメントサイト:TileOPs ドキュメントサイト二件と削除・統合の同期(09-28)
      • 4.3 メディアと学術側:Google News ゼロヒット、arXiv に新規プレプリントなし(09-29 核查)
    1. トレンド観察
      • 5.1 契約先行の実行期:24 時間以内に spec-only からオペレータ層へ
      • 5.2 サイレントエラーと「カーネル領域」:一度のガバナンス集中負債
      • 5.3 コンパイラ健全性が上流連動を開始
      • 5.4 空白とリスク点
  • 付:素材と核查説明

今日の重点:TileOPs 量子化ファミリが先に実装層へ——九つのオペレータ層が一夜でマージ、サンプリングファミリ六つが同日に待機(09-28/09-29)

日付:2026-09-28、2026-09-29 来源:量子化オペレータ層六つ(#2298)/ INT8 逆量子化オペレータ層(#2297)/ サンプリングオペレータ層(#2299)/ 200 オペレータ追跡イシュー(#2271)

09-27 深夜に 24 条の spec-only エントリと 200 オペレータ計画を開いてから 24 時間も経たないうちに、TileOPs は「契約」を一つずつ「オペレータ層」へと実現し始めた。リズムは以下の通り:

  • 量子化ファミリー6枚を先にマージ(#2298、09-29 06:54 マージ、+798/-78、16ファイル):INT8のテンソル単位・チャネル単位・ブロック単位量子化、FP8のブロック単位量子化、INT4のグループ単位量子化とSmoothQuant、計6枚のオペレータ層(命名は INT8QuantPerTensorFwdOp から SmoothQuantFwdOp まで)が tileops.quantization に配置された。各枚とも kernel_types = {}——呼び出しはまず生成的チェックを実行し、その後 OpNotAvailableError をスローする(宣言済み、実装待ち)。新たに QuantizeCall(rows, cols, dtype, group_size) を追加;参考実装はテストファイルから workloads/quantization.py へ移され、テストは同一の数学を呼び出すように変更された。マニフェストには同時に工程上の制約も明記:INT4グループとGEMM W4A16は K % 128 == 0 を要求(パック順序は128要素ステップで定義)、INT4グループのセマンティクスを項目ごとに提示(ゼロ点区間 [0, 15]、スケールは最小正規数の下限を取り、torch.ao と AWQ 方式で量子化);vLLM scaled_int8_quant、per_token_group_quant_int8、DeepGEMM per_block_cast_to_fp8 との差異はすべて明示的に記録されている。
  • INT8逆量子化3枚が追随(#2297、09-29 06:20 マージ、+431/-29、11ファイル):INT8のテンソル単位・チャネル単位・ブロック単位の3種の逆量子化オペレータ層(INT8DequantPerTensorFwdOp など3枚の FwdOp)が同日に着地、エントリは spec-only のまま;参考実装 (q.float() * scale).to(out_dtype) は torch の3種の dequantize とビット単位で一致;per-block の最終ブロックは ceil_div(K, 128) のスケール形状で処理し、SGLang実装との差異も記録。
  • サンプリングファミリー6枚が同日に行列入り(#2299、オープン、+1065/-151、28ファイル):TopKMask、MinPMask、TopPMask、TopKTopPMask、SamplingFromProbs、ChainSpeculativeSampling のオペレータ層、ワークロード、テストが一度に揃った;参考実装は FlashInfer 0.6.16 に整合(bf16/fp16/fp32 の3段階)、乱数は Philox4x32-10 で整数テンソルの決定論的実装(Random123 の既知答案ベクトルに整合);さらに旧 top-p 参考の境界並列処理を修正(8行内で76個の bf16 token の結果が異なる)。
  • コンテキスト:#2279 で起票された24条の spec-only エントリ(量子化9、サンプリング6、MLA/KV 7、norm と線形注意力が各1)のうち、量子化9枚はすべてオペレータ層に入り、サンプリング6枚は PR 審査待ち——「先に契約を定め、後に実装を着地」は安定した実行リズムに入っている。

判読:オペレータ層を先行させる利点は「インターフェース、ワークロード、参考数値、拒否挙動」を先に凍結することで、カーネル実装は個別に追随でき、対外契約を変更する必要がなくなる;利用側にとっては OpNotAvailableError が明確な能力境界を示す。なお本バッチのオペレータ層はいずれもカーネル実装を含まず、最初のカーネルがマージされるまで使用可能な性能は生まれない;今後の注目点はカーネル着地のリズムと K % 128 などの形状制約がモデル接続に与える影響である。


1. コアプロジェクトの進展

1.1 メインリポジトリ:TVM末尾ガードレール修正——剰余数の境界反転が範囲外読みを引き起こす可能性、実ターゲットで再現後にマージ(09-28)

日付:2026-09-28 情報源:#3294/ TVM側修正(#77)

  • 問題:動的リダクション B * 192 要素、128スレッド時、(192 * B + 127) % 128 が境界分析で反転区間 [127, 63](正しくは [63, 127] であるべき)を与え、tl.Simplify がこれに基づき i * 128 + threadIdx.x < B * 192 を恒真と誤証明し末尾ガードレールを削除する可能性;B = 1 のとき最後の64スレッドは本来2回目をスキップすべきだが、ガードレールが削除されると次の層、さらには最終層の外側まで読み込んでしまう——実際に aux-loss 表示カーネルで観測された。
  • 修正:#3294 は 3rdparty/tvm サブモジュールを 907a88c879 から 4211874e9e へ前進させ(当該境界修正とその TVM 回帰のみを含む)、ポータブルな回帰テストケースを1件追加(直接 TIR を構築、B > 0 を仮定しない)。検証:transform 関連テスト48件通過、reducer v2 76件通過、TVM側110件通過(8 xfail);B300 上で aux-loss を再現した48種のパラメータ組み合わせがすべて通過。
  • 意義:「コンパイラ健全性欠陥 → 実ターゲットで再現 → 上流修正 → サブモジュール前進+回帰による下支え」の完全なクローズドループのサンプル;同一サブモジュールリポジトリ(tile-ai/tvm)の修正コミット #77 は「剰余数の境界が順序付けられ信頼できる」ことを TVM コアに書き込んだ。

1.2 メインリポジトリ:デフォルト単一構成ビルドに -O2 を追加——lowering 幾何平均 1.19 倍高速化、ライブラリサイズ半減(09-28)

日付:2026-09-28 情報源:#3191

  • 変更:明示的なビルドタイプがない場合、単一構成の CMake ビルドで TileLang オブジェクトのコンパイルに -O2 を追加;明示的な Debug/Release とマルチ構成ジェネレータは従来通り(1 ファイル +10/-0)。
  • 実測(178 サンプル):lowering 総所要時間 1548.8 → 1376.0 秒、幾何平均 1.186 倍、中央値 1.161 倍;168/178 サンプルで lowering が 5% 超高速化、5% 超の退行はゼロ;完全なカーネルコンパイルの幾何平均 1.053 倍。付随効果:libtilelang.so が 43.5 MB から 18.9 MB に縮小。
  • 背景:このコミットにより #3180 のコンパイラ性能回帰ケースも約 5 倍(幾何平均)高速化され、コンパイルチェーンの「デフォルトパラメータが手動パラメータに劣る」問題が収束。

1.3 メインリポジトリキュー:新規 5 件と 3 件更新、オープン PR は 112 件(09-28)

日付:2026-09-28 情報源:メインリポジトリ PR リスト/ #3296/ #3297/ #3299/ #3300/ #3293

  • 調査期間内に新規 5 件(いずれも小規模な修正):#3293 は tl.Simplify に未使用バインディング除去器を追加(read-after-write、副作用、volatile、メタデータ参照などの回帰を含む);#3296 は bulk TMA コピーのアラインメントとキャッシュヒントを修正(対応する欠陥票 #3295);#3297 は uint8 スパース GEMM オペランドをサポート;#3299 は ROCm 上の T.round の ties-to-even 丸めを修正;#3300 は CUDA int32 popcount サポートを追加。
  • 欠陥・要望側:調査期間内に 3 件更新——#3295(bulk TMA キャッシュヒントのコンパイル失敗、共有メモリの過剰アラインメントによる占有率低下)、#3292(METAL 上の T.copy デフォルト coalesced_width のストライド問題)、#3298(apache-tvm-ffi 0.1.13 サポート要望)。
  • キューの温度:オープン PR は 112 件;前期から継続のキュー(RNG 4 件 #3241~#3244、非同期ステージング #3279、TileIR バックエンド #3247、魔法定数除算 #3267、SIMT im2col #3275)はいずれも調査期間内に更新なし;他に旧 PR 1 件(#3187、vec 整数 bitwise_not クラッシュ修正)が調査期間内にクローズされマージされず。

1.4 TileOPs:サイレントエラーカーネルを集中修正、十余箇所の「結果を返すがエラーを報告しない」を一括処理(09-29 未明)

日付:2026-09-28、2026-09-29 情報源:#2291

  • 規模:単一コミット +2456/-1161、116 ファイル、十余箇所の誤った結果を計算しながらエラーを報告しないカーネルを一度に修正:MLA デコードの末尾ヘッドと空キャッシュ、CountNonzero の 2^24 超え、FloorDivide/Remainder/Div(floor と trunc のセマンティクス)、MoePermuteAlign の 1024 エキスパート超え、TopkSelector のオーバーフロー、SSD d_state のシャーディング、Conv「same」の奇数パディング、FP8 稠密プリフィルの因果、GLA シャーディング、整数平均アキュムレータ;MLA デコードは空キャッシュ時に torch の挙動に合わせてゼロを返すよう変更。
  • ガバナンスの三点セット:① SM90 専用ケースを @pytest.mark.sm90 に変更(26 関数、5 ファイル)、手動のケイパビリティチェックを廃止——SKIP が SM90 上の失敗を覆い隠せなくなる;② カーネル、ベンチマークタイマー、ウォームアッププラグインが環境変数から設定を取得しないように(新規 lint ルールでソース/ワークロード/ベンチマーク内での環境読み取りを禁止)、明示的な引数に変更しビルド識別子に含める;③ カーネル上限を各所に散在していたものから「カーネル領域」での一度の宣言に収束、範囲外の呼び出しは「該当呼び出しを処理する実装なし」として拒否——設定、拒否、キャッシュの挙動がここに至り一貫して再現可能に。
  • 付随:bench_kernel にイベントフォールバックスイッチを追加;空出力呼び出しは空を返す;CUDA が必要なケースにマークを補完。

1.5 TileOPs:アテンション整編の続章——MHA と GQA のページドデコードを統合、逆方向 WS カーネルをマージ(09-28)

日付:2026-09-28 情報源:#2296/ #2295/ #2281/ 議題 #2293

  • デコード統合(#2296、+588/-1156):GQADecodePagedKernel が MHA と GQA の両方のページングデコードオペレータに対応し、MHADecodePagedKernel は全面的に削除。MHA 側のインターフェース、マニフェスト項目、オペレータ数は変わらず。併せて GQA がキャッシュ外の非有限値を読み込んだ際の NaN と、sm_scale=0 のときにマスクキーが依然として重みを取得するという 2 つの問題を修正。テストノード 5047 → 5048;対外ベンチマーク(H200、device_busy):serving の 4 行は flashinfer の 1.34~1.76 倍。
  • WS カーネル修正と適用拡大(#2295、+454/-425):#2273 で導入された行ごとのガードが 4 つのシングルトークン行を最大 20% 遅くしていた問題を、ブロック全体の粒度で境界ブロックをガードする方式のみに変更して回復;warp 特化カーネルがマルチクエリ行に対応開始(B*H*S_q*N_kv*D <= 2^27 のワークロード制約下)、投機的デコードシナリオは 25.46 マイクロ秒から 6.27 マイクロ秒に短縮(FA3 の 14.88 マイクロ秒と比較して 2.37 倍)、4 つの serving 行は対照の 1.40~1.90 倍。
  • 逆方向カーネル(#2281、+806/-486):MHA 逆方向が SM90 上で新たな永続化 warp 特化カーネルに入り、ヘッド次元 128、128 行キーブロックで分割する呼び出しが 2.08~4.21 倍高速化;呼び出しごとの起動数 8 → 3;パイプラインにおける WGMMA の直列化と Q/dO 一時バッファの早すぎる解放の 2 箇所の問題を修正;MultiHeadAttentionBwdOp を削除(GQA 逆方向による MHA 直接対応に統合);ベンチマークスクリプトは逆方向のみを計測するように変更(従来は順方向・逆方向を混在計測)。

1.6 TileOPs:reduction と norm のバッチ高速化 6 件(09-28)

日付:2026-09-28 情報源:#2290/ #2292/ #2289/ #2287/ #2284/ #2286

  • リダクションエンジン再構築(#2290、+1436/-1294):先頭軸 prod をインプレースリダクションに変更し、入力の転置を廃止——[4, 128, 4096](dim=0)が 469 マイクロ秒から 3.3 マイクロ秒に短縮(対照 torch-compile は 3.2 マイクロ秒);16 バイトストリーミングロードヘッドを新規追加(L1/L2 evict-first キャッシュ戦略);単一レジスタ折り畳み行カーネルが sum/mean/amax/amin/prod と L1/L2/Inf ノルムを同時に対応、mlp-intermediate の各行が 28.6~30.1 マイクロ秒から 24.8~25.1 マイクロ秒に短縮(対照 torch-compile は 24.4~25.4)。
  • 残り 5 件:#2292 logsumexp がレーン間で折り畳み統計を分割し torch の inf セマンティクスを維持;#2289 論理リダクションが入力自身のバイト幅に応じて一度でレジスタ折り畳み;#2287 InstanceNorm の訓練時が 20 回の起動から 1 回に収束(image-track-stats 27.28 → 2.62 マイクロ秒)、丸めが torch と一致(従来は 1 ulp の差);#2284 BatchNorm 逆方向が呼び出し元のレイアウトを直接インデックス(resnet-stage3 15.5 → 4.9 マイクロ秒、1.86 倍)、併せて split 統計のブロックを越えた累加による NaN(形状は (3, 5, 300, 301) など)を修正;#2286 RMSNorm が短行でブロックを共有し、レジスタ内のみでゼロ埋め。

1.7 TileOPs:エンジニアリング 2 件——ソースを csrc へ移行、ガード免除の整理(09-28)

日付:2026-09-28 情報源:#2285/ #2288

  • #2285 C++/CUDA ソースコードを全体として src/tileops/csrc に移行(ビルドレイアウトの正規化);#2288 ガード免除リストを削除し、ついでにそれが覆い隠していた問題を修正——失敗面がもはやホワイトリストで希釈されなくなった。

1.8 夜間スナップショット:正確性 1027 項目、ベンチマーク 1335 項目、ゼロ失敗ゼロエラー(09-29 未明)

日付:2026-09-29 情報源:スナップショットコミット b7f5a1b4bd47/ スナップショット環境メタデータ

  • 調査期間内 1 件のスナップショット(09-29 04:11、run 36462093045;対応する TileOPs fa8acf71b9、すなわち #2291 のマージ点):正確性 1027 項目(スキップ 2)ゼロ失敗ゼロエラー;ベンチマーク 1335 項目(38 スイート)ゼロ失敗ゼロエラー。環境:H200、CUDA 13.2、torch 2.13、tilelang 0.1.11+cu132。
  • 前回分(09-28 未明、1093/1318)と比較:正確性カウント -66、ベンチマーク +17——カウントの変化は今週の複数のテストリファクタリングと免除クリーンアップに伴うもので、両者ともゼロ失敗;追跡基準は「ゼロ失敗」をものさしとし、カウントは直接にカバレッジの増減を表すものではない。

2. マルチバックエンド適配(昇騰 / MLIR 昇騰 / 沐曦 / 海光 / 摩尔線程)

2.1 海光:非同期コピーとキャッシュ swizzle lowering の改善がレビュー入り(09-28)

日付:2026-09-28 情報源:hygon PR #13/ ブランチコミット 4bf3ac58c4

  • 海光ラインは 09-24 に #12 をマージした後、ブランチ開発に移行:feat/hcu-async-copy-cache-swizzle ブランチに新規コミット(作者 Teng Huang、16:29)を追加し、非同期コピーとキャッシュ swizzle の lowering を改善;対応する PR #13 は同日更新、依然オープン。海光は本期の国産バックエンドの中で唯一コードの進展があったもの。

2.2 昇騰:先週マージされた機能が丸ごと巻き戻し、メインリポジトリに ascend-0930 ブランチ新設(09-28/09-29)

日付:2026-09-28、2026-09-29 情報源:巻き戻し PR #1841/ 巻き戻された機能 #1829/ tilelang メインリポジトリ

  • 09:44 に巻き戻しを丸ごとマージ(+3621/-10333、84 ファイル)、#1829(09-24 にマージされた「コンパイラ管理の AscendC Vector mask と FP32 行帰約最適化」、元 +10333/-3621)を撤回——当該機能はマージから 4 日後に全体撤回され、公開記録に巻き戻しの説明は付されていない。
  • 另:メインリポジトリは 09-29 未明に ascend-0930 ブランチを新設(作者 LeiWang1999)——昇騰関連の開発動向、観察項目として登録。

2.3 沐曦 / 摩尔線程:公式リポジトリは静穏、コミュニティ側で S5000 性能ツール更新(09-28)

日付:2026-09-28 情報源:tilelang-metax/ tilelang-musa/ Tilelang_musa コミュニティリポジトリ

  • 沐曦(最終プッシュ 09-24)、摩尔線程(09-17)の公式リポジトリは期間内にプッシュなし。コミュニティ側の摩尔線程方向では動きあり:Rankf/Tilelang_musa が TileSight と TileLang-MUSA のソースコードを整理し生成物を削除(09-28 15:33);その自述は「DeepStack エンジンに基づく MTT S5000 オペレータ級性能分析フレームワーク」であり、手動オペレータ最適化と Agent オペレータ評価の二類のシナリオにサービスを提供し、P0~P7 キャリブレーションドキュメント 30 篇、スクリプト 64 個、ベンチマーク 24 個を含む。

2.4 コミュニティ側:算能 BM1690 TPU パイプライン適配が新リポジトリを開設(09-28)

日付:2026-09-28 出典:tilelang-tpu-bm1690-pipelines/ 移行と検証の説明

  • 新規リポジトリ(09-28 作成、調査期間内 8 コミット):既存の tilelang-tpu 開発を基礎に、SOPHGO BM1690 / SG2260E 向けに六種類のオペレータ(Elementwise、RMSNorm、RoPE、SwiGLU、Matmul、FlashAttention)のパイプライン版を構築;BM1690 八コア TPU-Kernel と SG2260E の RV Tensor という二つのプログラミングモデルをサポートし、コンパイル、CModel、PCIe 実行は統一 PPL 1.7 ツールチェーンで進行。
  • 方法論は注目に値する:CModel は数値挙動のみを検証し、「CModel のウォールクロック時間は BM1690 の性能ではない」と明示的に記載;各ステップは制御されたランナー(プロセス数、120 秒タイムアウト、4096 MiB メモリ上限制約)で証拠を産出;調査期間内のコミットは FP16 matmul 1024³ CModel 検証と各オペレータのパイプライン化(SSA 安全ネストループ、ダブルバッファ記述子)などをカバーし、ボード実測はリモートハードウェア環境が整い次第実施予定。

3. エコシステムと採用側

3.1 採用側:FlashQLA が SM100 tcgen05 へ移行、prepare_h 実測 1.43 倍(09-28)

日付:2026-09-28 出典:PR #42/ FlashQLA リポジトリ

  • Qwen の FlashQLA(TileLang ベースの GDN 線形注意力カーネルライブラリ)が Blackwell データセンター向けの最適化をマージ:prepare_h の CP 状態遷移再帰(M、Z)をコンシューマグループ T.gemm から MMA warp の tcgen05 パイプラインへ移行、M は TMEM に常駐;レジスタ上限を 168/160/160/24 から 152/104/104/152 へ再構成;store_h=False 時は同期と左状態半部を一拍早く発行。
  • 実測(B200、24 の CP アクティブ行):prepare_h レイテンシ 153.8 → 107.5 マイクロ秒(1.43 倍、-30.1%);正確性ゲートは 48/48 特化ビット単位一致、フォワード統合は 15/15 と 42/42 行ビット単位一致。採用側は SM90/103/120 適配から SM100 tcgen05 の深度利用へと推進済み。

3.2 採用側核查:TileKernels プッシュなし、TileFoundry 調査期間内コミットなし(09-29 核查)

日付:2026-09-29 出典:TileKernels/ TileFoundry

  • DeepSeek TileKernels は依然 2026-04 で停止;TileFoundry の最近のプッシュは 09-28 未明(前回調査期間、AtomSched シリーズを既報)、本調査期間に新規コミットなし。

3.3 リリースペース:v0.1.14 が満 27 日、TileRT リリースページが 5 日遅延(09-29)

日付:2026-09-29 出典:tilelang リリースページ/ TileRT リリースページ/ TileFoundry リリースページ

  • メインリポジトリ v0.1.14(09-02)は満 27 日で新版なし;TileOPs に独立リリースなし;TileRT の v0.1.6 リリース PR は 09-24 にマージされたが、リリースページとタグは依然 v0.1.5.post2 で停止(5 日遅延);TileFoundry の最新は依然 v0.0.2(09-10)。

4. コミュニティ、チュートリアルとイベント

4.1 コミュニティチュートリアル:tilelang-tutorials が CPU 示例を更新(09-29)

日付:2026-09-29 出典:tilelang-tutorials

  • コミュニティチュートリアルリポジトリ easy-tilelang/tilelang-tutorials が CPU サンプルを更新(09-29 00:17)。当該リポジトリには 00_basic / 01_tvm / 02_tilelang / 03_tilelang_cpu / 04_tilelang_ascend / 05_tilelang_work の 6 グループのノートブックが含まれ、うち CPU JIT と昇騰の lowering/compile/JIT サンプルはプラットフォームの導入に参考価値がある。

4.2 ドキュメントサイト:TileOPs ドキュメントサイトの 2 件と削除・統合の同期(09-28)

日付:2026-09-28 情報源:ドキュメントサイト PR #55/ PR #56

  • 2 件:注釈後の __all__ に従ってドキュメントを生成し、削除済みの GQA オペレータを除去(#55)。アテンション API ページから削除済みの MultiHeadAttentionBwdOp を撤去(#56)——#2296/#2281 の削除・統合作業と同期。

4.3 メディア・学術側:Google News はゼロヒット、arXiv に新規プレプリントなし(09-29 核查)

日付:2026-09-29 情報源:Google News/ Hacker News/ arXiv

  • Google News RSS の中国語・英語の複数クエリ(プロキシ経由)で 24 時間ウィンドウ内に価値ある項目はゼロヒット(取得した 9 件の候補はすべて GitHub リポジトリ本体または無関係な内容)。Hacker News のウィンドウ内項目は本テーマと無関係。arXiv で「tilelang」を検索した最新は依然として 07-24 の TileSight(タイル中心の GPU 性能モデル)で、新規プレプリントはなし。

5. トレンド観察

5.1 契約先行の実行期:24 時間以内に spec-only からオペレータ層へ

昨日 24 件の spec-only 項目と 200 オペレータ計画が打ち出され、今日は定量 9 枚(マージ済み)とサンプリング 6 枚(キュー待ち)で「オペレータ層 + ワークロード + 参考数値 + 拒否動作」の完全な封装を走り切った。しかも境界セマンティクスは逐条 vLLM / FlashInfer / DeepGEMM と対照されている。これは Manifest 体系が契約検査点をパイプライン生産可能なまでにエンジニアリング化したことを示す。次の観察点はカーネル実装が同じペースで実現できるかどうかである(本批次のオペレータ層にはまだカーネルがない)。

5.2 サイレントエラーと「カーネル領域」:一度のガバナンス集中的負債

#2291 の 1 件で十余箇所の silent-wrong(MLA テールヘッドから整数平均アキュムレータまで)を修正——この種の問題は最も隠蔽されやすい。結果は誤りだが例外は投げず、テストは通過し、ベンチマークは正常である。これと「カーネル上限を行領域宣言に収束」「環境変数のカーネルパスからの退出」「ガード豁免の退場」を合わせて見ると、TileOPs は「カーネルがどのような条件下で正しいか」を散在するコードから機械検証可能な宣言へと変えつつある。これこそが 200 オペレータ計画が対外的にカバレッジ承诺を与えられる技術的基盤である。

5.3 コンパイラ健全性が上流連動を開始

#3294 の修正チェーン(実靶再現 → サブモジュールリポジトリ修正 #77 → サブモジュール前進 + ポータブル回帰)は、メインリポジトリの「コンパイラがサイレントにセマンティクスを変更する」類の欠陥に対する応答パスがすでに形成されたことを示す。TileLang に依存する下流(各社バックエンド fork を含む)にとって、サブモジュールレベルの修正のフォローアップペースが、得られる健全性レベルを直接決定する。

5.4 空白とリスク点

其一、マルチバックエンドの系統分化:海光はブランチ上で継続的に進化、昇騰は全体を撤回しかつ説明なし、沐曦と摩尔線程の公式側は引き続き沈黙(摩尔線程はすでに 12 日)。国産バックエンドの進捗差は拡大している。其二、アテンション逆方向線とデコード線は同日に「削除・統合」を完了したが、投機的デコードなどのシナリオは FA3 と比較して依然として単行 0.75 倍の差がある(#2296 ベンチマーク表)。其三、メインリポジトリのオープン PR は計 112 件、RNG 4 件、非同期暫存と TileIR などの大型案件は多日動いていない。消化能力とレビューバンド幅は依然としてボトルネックである。其四、メインリポジトリの本ウィンドウはマージ 2 件、新規 5 件で、「開多合少」の格局は逆転していない。


付:素材と核查説明

情報源 検証結果
tile-ai 組織(29 リポジトリ) 調査期間内に 7 つのリポジトリでプッシュあり:tilelang、TileOPs、TileOPs-nightly、tvm、tilelang-hygon、TileOPs.github.io、tilelang-ascend
メインリポジトリ tilelang 2 件マージ(#3294、#3191);新規 5 件(#3293、#3296、#3297、#3299、#3300);オープン PR は計 112 件;欠陥票 #3292、#3295 と要件票 #3298 が調査期間内に更新
TileOPs 14 件マージ(#2281 から #2298 の範囲);ほかに #2279、#2283 の 2 件が本調査期間開始後 7~29 分以内に計上完了(内容は前回レポートで既出のため重複展開せず);オープン PR は計 5 件(#2172、#2294、#2299、#2300、#2301);イシュー #2293 は #2296 に伴いクローズ
tvm(同組織サブモジュールリポジトリ) 1 件マージ(#77 剰余境界修正、メインリポジトリ #3294 と連動)
TileOPs-nightly スナップショット 1 件 b7f5a1b4bd47:正確性 1027 項目(スキップ 2)失敗ゼロエラーゼロ;ベンチマーク 1335 項目失敗ゼロエラーゼロ
TileOPs.github.io 2 件(#55、#56 ドキュメントと削除統合同期)
国産バックエンド 5 リポジトリ 昇騰:ロールバック #1841(#1829 を撤回);海光:ブランチコミット + PR #13 更新;沐曦(09-24 以降)、摩尔線程(09-17 以降)、MLIR 昇騰(09-24 以降)は活動なし
採用者とコミュニティ FlashQLA 合入 #42(SM100 tcgen05);TileKernels プッシュなし;コミュニティリポジトリ tilelang-tutorials、Tilelang_musa、bm1690-pipelines に更新あり
Google News / Hacker News / arXiv 中日英クエリともゼロヒット;HN は本テーマと無関係;arXiv に新規プレプリントなし(最新は依然 07-24 TileSight)

完全な情報源リスト

OPs/issues/2293>