报告周期:2026 年 9 月 13 日(周日)至 9 月 20 日(周日),共 7 个自然日,对应 ISO 第 38 周 素材来源:本刊每日 TileLang 动态日报 4 期(09-17、09-18、09-19、09-20);09-14 至 09-16 尚无日报(本刊自 09-17 起试刊),该段由 GitHub 组织级窗口核查(tile-ai 组织 28 个仓库,168 小时)与仓库提交元数据补齐,详见附录


一、本周要闻

  1. 主仓开出 CUDA Tile IR 执行后端,一笔提交 134 个文件、新增约 3.6 万行(09-18):新后端把 TileLang 程序下沉到 NVIDIA 的 CUDA Tile IR,经 cuTile 运行时装载,与现行「生成 CUDA 源码交 nvcc」的路径并行;改动同时覆盖 JIT、缓存、自动调优、两篇文档与一条专用 CI 作业,属路线级变化而非实验分支;窗口末该 PR 转入草稿状态,尚未合入(tilelang #3247)。
  2. 分块量化 GEMM 升为语言层算子,「静默降级」路径被移除(09-17):主仓新增 T.gemm_blockscaled 与专用后端选择器,缩放因子成为算子的一等输入;不具备该能力的后端由「按稠密 GEMM 静默执行、缩放因子被丢弃」改为编译失败。文档站随后补上完整签名、行为约定与三条指令级显式变体(#3237文档提交)。
  3. ROCm 侧 GLM-5.3 稀疏注意力 k 池在 24 小时内成链(09-19 ~ 09-20):同一作者连开四笔堆叠 PR,覆盖 k 池压缩与缓存写入之后的解码尾部维护、分页 logits、Top-K 变换与融合选择,合计约 9.8 千行、40 个文件,直接绑定已发布模型的配置契约(2048 token 预算、512 池);连同 KDA 解码示例与 DeepSeek V3.2 的 FP8 稀疏 MLA 示例,AMD 通路正按「新模型原生算子到位」组织推进(#3251#3253#3254#3255)。
  4. TileOPs 性能三连:批矩阵乘换共享模板、FP8 转置内核补短板、MoE 小路由对标 vLLM 领先(09-17 ~ 09-19):H200 上批矩阵乘改用共享 GEMM 模板后最高提速 1.44 倍、对官方库不落后;FP8 批矩阵乘的转置短板以合并访存内核补齐,五个用例提速 2.30 至 4.66 倍;MoE 索引小路由路径在 GLM-4.5 4096 token 档领先 vLLM 25.85%、DeepSeek-V3 档 16.03%(#2148#2153#2141)。
  5. 主仓完成一轮「静默错误前移」治理(09-16 ~ 09-20):原子向量宽度改由目的地址规划后,嵌入反向等内核提速 1.4 至 2.5 倍;原子加在非连续目的地址上退回标量,修掉一类静默写错与未对齐崩溃;随机数三处静默缺陷拆分为独立 PR;不支持的 GEMM 类型组合在代码生成前被拦截(#3238#3219#3242#3245)。
  6. 昇腾保持全周高频并以「每日回归全绿」收官(09-15 ~ 09-20):NSA 前向与其变长版本同日入库(910B3 上 19.62 与 20.34 微秒),动态量化、RMSNorm 融合与 RoPE 补齐算子面;每日回归用例数 1919 → 1925 → 1936 → 1936 连续四日失败为零,并开出多设备测试分片;窗口末又补入 mhc_pre 示例与一批算子文档细化(#1699#1700回归报告 #1814)。
  7. 后端格局出现「发行版」形态:Sunrise S2/TANG 进入 0.1.14 候选(09-18):tile-ai 组织下面向国产 GPGPU Sunrise S2 的后端发行版仓库被发现,独立建仓、独立版本号(0.1.14+sunrise.1.1.0)与独立 CI,与昇腾适配仓、海光特性分支、摩尔线程回移植分支共同构成四类适配组织形态(tilelang-sunrise)。
  8. 采用方结束静默:FlashQLA 同日三笔合入(09-18):通义千问侧基于 TileLang 的门控线性注意力实现一次收口三笔——SM120/SM121 反向融合内核、SM100 KKT 解算占用率、变长尾块异步流水;工程重心从新架构适配转向占用率与边界正确性(#34)。

二、核心项目进展

版本与发布

  • 主仓最新标签仍为 v0.1.14(09-02 发布),窗口内无新标签,至周期末已 18 天未发版;合入节奏收敛而评审队列持续累积,为本周期最明显的节奏特征。
  • 适配仓标签窗口内均未更新:昇腾 TileLang-ascend v0.1.2.000-release(09-09)、摩尔线程 v0.1.14+musa.1(09-11)、Sunrise 候选分支 0.1.14+sunrise.1.1.0;TileOPs 至今无发布记录,其对外状态由文档站与夜间快照承担。

语言层:算子语义与 API

  • 分块量化 GEMM(#3237,09-17 合入):新增 GemmBlockScaledNode 与语言侧 T.gemm_blockscaled,分派走 cuda.tcgen05.blockscaled(SM100 线)与 cuda.mma.blockscaled(SM120 线)两条实现;修正 SM100 单 CTA 可能命中 SM120 指令路径、以及不支持后端静默按稠密 GEMM 执行两处会静默出错的问题(PR)。
  • 拷贝宽度钳制(#3246,09-18 新开)T.copyT.async_copy 的合并宽度上限改为钳制到实际可达的向量宽度,取代此前的致命日志——「能力约束」降级继续、「用户语义错误」仍然失败,失败与降级的判据被写清。
  • 256 位全局访存限定 SM100 及更新架构(#3248,09-19 合入):仅在 SM100 及更新架构且 CUDA 12.9 以上发出 256 位 load/store,旧架构退回 128 位通路,并补 pre-SM100 负向测试。
  • 原子加在非连续目的地址上保持标量(#3219,09-16 合入):新增 CanVectorizeAtomicTarget 前置判定,覆盖 address_oftl.access_ptrtvm_access_ptr 三种目的地址形态;修复「所有车道写同一格」被编译成宽原子加的静默写坏与奇数基址未对齐崩溃。
  • 随机数三缺陷拆分修复(#3242 / #3243 / #3244,09-17 新开,未合入):默认随机序列只按 x 维推导导致二维线程块取数重复、绑定 void 结果、缺初始化不报错——三处均属「类型上能编译、语义上出错」的静默问题。

模型算子与示例

  • GLM-5.3 稀疏注意力 k 池链路(#3250 ~ #3255,09-19 ~ 09-20,未合入):四笔堆叠 PR 合计约 9.8 千行、40 个文件,覆盖 k 池压缩与缓存写入、解码尾部维护、分页 logits、Top-K 变换、融合选择五个环节;验证以 exact-head CI 为准(ROCm 7.2 / gfx942,#3251 报 2423 项通过、#3255 报 2435 项通过)。
  • KDA 解码示例(#3249,09-19 新开):带安全门控的门控线性注意力解码态示例,含输出与状态一致性、多步、空状态索引、乱序槽位等正确性覆盖。
  • DeepSeek V3.2 FP8 稀疏 MLA 前向示例(#3224,09-16 合入):面向 Hopper 的模型覆盖类贡献,属窗口前半段(日报创办前)的合入。

编译器与后端通路

  • 符号化循环布局单射性证明恢复(#3233,09-18 合入):修复 v0.1.12 至主线之间的回归——T.Parallel 迭代空间为静态与动态混合(如 (16, n))时,带填充尾部的布局单射但非双射,主线此前直接报「找不到可用布局」;修复从待检迭代映射构造逆映射并在定义域上证明往返相等(关联缺陷单 #2906)。
  • CUDA Tile IR 执行后端(#3247,09-18 新开、后转草稿):目标工具链为 CUDA Tile IR 13.4 绑定、tileiras 13.4、cuTile 1.5;带类型 IR、下沉与 pass 核心位于 tilelang/tileir,并接入 JIT、缓存与自动调优;配套新增 pass 配置项,用于启动物化前(含从缓存恢复的路径)仍执行源语言语义检查。
  • ROCm CI 接入可移植示例校验(#3165,09-19 合入):白名单覆盖 Seer 注意力、通用 Top-K、稀疏 MLA 前向、张量分组矩阵乘四类,示例本身成为回归资产——AMD 通路进入收敛期的旁证。
  • Metal 线补强:32 位整数原子加支持(#3211,09-19 合入,含竞争直方图验证)、GEMM 缓冲区域偏移修复(#3209,09-14 合入);「运行时可变的 GEMM 行数」(#3215)评审九天后关闭未合入(09-20)。
  • 其他修复:布尔位取反代码生成修复(#3228,09-16)、约束集合并时恢复先绑定后使用顺序(#3221,09-14)、CPU 测试引入 CPU dialect(#3236,09-16)。

运行时、工具链与测试

  • JIT 补 uint64 参数类型映射(#3229,09-17 合入),Cython 与 NVRTC 两条宿主包装器对齐。
  • 运行时库加载修复(#3227,09-15 合入):符号链接安装形态下的库加载问题。
  • 分析器拆分计时助手并加入挂钟基准(#3234,09-16 合入)。
  • 测试资产提质(#3252,09-20 合入,+20/-509):删除 CPU 与 LLVM 两侧重复的代码生成冒烟测试与独立快数学测试模块;修复「拿快数学输出与自身比较」的假断言,为 exp10log2log10cossintan 补上真参考实现。

性能

  • 原子向量宽度按目的地址规划(#3238,09-16 合入):动态形状此前引入 int64 车道偏移时整个循环被标量化;修复后嵌入反向 N=8192/H=4096/V=129280 从 97.90 微秒降至 56.01 微秒、N=196608/H=256/V=3000000 从 146.87 降至 82.70 微秒、序列辅助计数与求和从 18.40 降至 12.17 微秒,回归基准 example_gqa_bwd_tma_reduce_varlen 约 27% 相对提升。受影响的嵌入反向与变长注意力反向是大词表推理的常驻内核。
  • 算子库侧性能(BMM / FP8 / MoE)见第四节。

评审队列观察

  • ROCm 模型算子以堆叠链推进(#3249 ~ #3255),自述「包含前序提交直至各自合入」,需连环评审,任何一笔卡住即拖住整条链。
  • 随机数三缺陷(#3242 / #3243 / #3244)与 GEMM 类型组合拦截(#3245)窗口内持续更新、尚未合入;Tile IR 后端(#3247)转草稿静止。
  • 合入与队列的落差:主仓默认分支窗口内 16 笔提交,后段以补齐与收口为主,实质增量集中在评审队列。

三、多后端适配

昇腾(Ascend)

  • 算子面:NSA 前向(#1699)与变长版本(#1700)同日入库——黄金配置 19.62 微秒、27 例分层测试全过,变长版本在 910B3 上 20.34 微秒、21 例全过;动态量化(#1688,精度全过、平均加速比 0.78 倍,性能仍落后厂商基线)、RMSNorm 动态量化融合(#1673)、RoPE(#1580)、CrossEntropy 广播优化与 FP32 专用路径(09-15)、causal_conv1d_decode 解码拆分 AIV 对(09-15)。
  • 质量与回归:每日回归用例数 1919 → 1925 → 1936 → 1936 连续全通过;对比算子文档补 dtype 覆盖(#1602)、基准脚本缓冲令牌生命周期修复(#1779);多设备测试分片 CI(#1812)新开。
  • 窗口末(09-20 下午):新增 mhc_pre 示例(#1621);一批 T.tile 算子文档细化(sort / topk / transpose / max / min / add / sub / mul / div / select);行切片 GM 到 UB 拷贝 stride 修复;block_sparse_mqa_attn 异步读写超时修复。
  • 判读:昇腾是唯一保持「每日可见」工程节奏的后端,且进入「能力铺开后转向质量与可维护性」的阶段。

沐曦(MetaX)

  • MACA 异步拷贝 GEMM(#156)与测试修复(#157)于 09-17 合入后转入版本与测试维护,窗口后半段无新提交,四家中幅度最小。

海光(Hygon)

  • 多级存储(MLS)地址重基与异步流水接管正式合入主分支(#10,19 个文件、+540/-31),并回移植到 v0.1.12 版本分支(另带入三维切片作用域布局修复);开发分支另有流水管理收尾提交。后端代码改动幅度四家中最重。

摩尔线程(MUSA)

  • 窗口内推送落在 v0.1.12+musa.1 回移植分支(MUSA 5.3.0 文档),主分支自 09-11 起静止,尚未跟进更晚的版本线。

其他(Sunrise / tilelang-mlir-ascend)

  • Sunrise(S2 / TANG):后端发行版仓库窗口内推送,候选分支版本 0.1.14+sunrise.1.1.0;S2 为面向大模型推理的国产 GPGPU,示例面与主仓同构(矩阵乘、FlashAttention、稀疏注意力等)。
  • tilelang-mlir-ascend:窗口内 7 笔提交——CI 切昇腾 A3 设备 runner(#176)、自适应 LayerNorm 内核(#183)、基准修复(#184)、TileOPs 多头注意力算子接入(#185)、算子报告与优化 Mamba 算子、逐 agent 模型选择(#187 / #188,09-20)。

四、生态与采用方

TileOPs(算子库)

  • 规模:窗口内 23 笔合入;夜间流水线三个快照连续在线,基准 1040 项与正确性 1118 项自 09-18 起连续零失败。
  • 性能:BMM 共享模板最高 1.44 倍(对 torch-cublas 全部不落后);FP8 BMM 转置内核 2.30 至 4.66 倍(MoE 预填充 0.8741 到 0.1874 毫秒);MoE 索引小路由领先 vLLM(GLM-4.5 25.85%、DeepSeek-V3 16.03%、Kimi K2 8.65%);另见窗口前段的 FP8 密集解码(#2132)、GQA 解码并行度(#2136)、W4A16 去量化跨通道共享(#2139)与 GemmTemplate 扩展至稠密 coop1/coop2(#2126)等合入。
  • 契约与结构:清单支持复合算子、资源与可空输出(#2147);分派与调优解耦(#2152);GEMM 内核按服务区域重命名、GEMV 两带合并(#2156,kernel_map 旧键由静默兜底改为构造期报错);分页 KV 助手移出分组查询注意力模块(#2150);SM90 形状补齐(#2151);稀疏 MLA 聚集越界收口(#2149);统一 Gated DeltaNet 算子(#2135)与稠密 GDN 预填充迁移(#2144)。
  • 度量治理:路由专家计价公式修复——夜间报出的 8 行带宽异常(读数最高 132.4 TB/s,约为 H200 物理上限的 27 倍)源自「按全部专家计费」(#2155);字节审计改为只看读侧(#1996);性能历史窗口迁至快照分支(#2154)。三笔同日落地,先让判定可信、再谈快慢。
  • 新开:分组 GEMM 尾块分块并允许调用方声明填充行布局(#2157),正面追赶 CUTLASS 分组内核(此前差 6.4%)。

采用方与相关仓库

  • FlashQLA(通义千问):三笔合入(SM120/SM121 反向融合内核、SM100 KKT 解算占用率、变长尾块异步流水),随后窗口内无推送;此前数日静默,属脉冲式评审节奏。
  • TileKernels(深度求索):窗口内无推送(最近 04-23);媒体侧关于 DeepSeek 工程师评估 AI 写内核的报道(09-16/17)以 TileKernels 为背景(纯用 TileLang 写成的内核库,覆盖门控、混合专家路由、量化、转置与两类连接算子)。
  • TileRT:连续七周静止(最近 08-13),为当前清单中安静时间最长者。
  • TileFoundry / DeepStack:分别有两笔(解析器与代码整理,09-14/15)与一笔(修复与示例,09-15)提交。

五、社区、教程与活动

  • 文档站:主仓文档站机器人再生成(387 个文件,09-17),分块量化 GEMM 的完整签名、行为约定与三条指令级显式变体进入公开 API 页面;TileOPs 文档站两次站点部署(内容未变),并已跟随统一分派与编译边界更新(中英两套文档)。
  • 社区工具:第三方 TileSight 性能分析文档仓公开(09-17/18),把 TileLang 性能分析接到 TileSight 的缓存与流水分析接口,性能问题分六类并要求区分「模型预测 / 运行时观测 / 证据不足」三种结论强度;对应 arXiv 性能模型论文(07-24,窗口外背景)。
  • 媒体:NeoTeo 报道 DeepSeek 工程师公开判断——6 至 12 个月内 AI 写出的内核可达到或超过其个人水平(09-16/17);华为全联接大会 2026(09-17)公布昇腾 960 提前发布与 Atlas 960 超节点路线图,构成昇腾适配节奏的产业背景。
  • 学术与社区:窗口内 arXiv 与 Hacker News 均无主题新增命中;最近一篇主题预印本为 07-24 的性能建模论文。
  • 版本节奏:主仓 v0.1.14 满 18 天未更新,各适配仓标签未动(详见第二节)。

六、趋势观察

  1. NVIDIA 侧出现第二条执行通路:Tile IR 后端与现行 CUDA 代码生成路径并行,TileLang 的抽象层级开始与 NVIDIA 自家瓷砖级抽象正面接壤。一旦成熟,其价值主张会部分从「更好的代码生成」转向「更完整的程序表达与跨后端一致性」,而调度与布局决策的归属将成为长期议题。
  2. 「静默错误前移为编译期失败」成为项目级纪律,且判据已写清:主仓(原子向量化、随机数、GEMM 类型、布局证明)与 TileOPs(传错键报错、分派与调优解耦)同构;主仓同时把「能力约束」与「用户语义错误」两类失败区分开——前者降级继续(拷贝宽度钳制),后者编译失败。
  3. 后端适配与「新模型原生算子」深度绑定:ROCm 的 GLM-5.3 k 池链与 KDA、昇腾的 NSA 与 DeepSeek 系结构、主仓 Hopper 上的 DeepSeek V3.2 FP8 稀疏 MLA——模型发布后其特有算子在某个后端上的到位速度,正成为衡量该后端成熟度的直接指标。
  4. TileOPs 向「带契约、可复现对照的算子层」演进:性能、契约、度量治理三线并行;夜间快照把提交号、镜像摘要、时钟与功耗上限等可复现要素固定得完整,验收口径正向生产可用靠拢。
  5. 国产后端节奏分化、形态多样化:昇腾保持日更回归(唯一每日可见),海光合入加收口,沐曦与摩尔线程转维护,Sunrise 以「后端发行版」形态进入候选;能跟到上游最新能力位置的程度,各家已拉开差距。
  6. 风险与空白:主仓发版停滞 18 天与评审队列积压(Tile IR 转草稿、GLM-5.3 堆叠链未合、运行九天的 Metal 提案关闭)并存;性能数据均为作者或厂商自述、本刊无对应硬件未做独立复现;采用方整体仍偏静(除 FlashQLA 脉冲)。

附录:素材与核查说明

  • 素材:本刊每日 TileLang 动态日报 4 期(09-17、09-18、09-19、09-20)。09-14 至 09-16 无日报(本刊 09-17 创办),该段以 GitHub 组织级窗口核查与提交元数据补齐;09-17 首期为试运行(当日傍晚执行),与 09-18 期存在约半日重叠,重叠部分 09-18 期只做状态说明。
  • 补充核查(168 小时窗口,09-13 16:00 至 09-20 16:00):tile-ai 组织 28 个仓库推送全量核查——窗口内 14 个仓库有推送;默认分支提交数:主仓 tilelang 16 笔、TileOPs 23 笔、昇腾适配仓 19 笔(ascendc_pto 分支)、tilelang-mlir-ascend 7 笔;发布状态经仓库发布接口复核,主仓与各适配仓窗口内均无新版本。

信源核查表

信源 核查结果
tile-ai 组织(28 仓库) 窗口内 14 个仓库有推送
主仓 tilelang 默认分支 16 笔提交;新开 PR 覆盖 Tile IR、ROCm 模型算子链、随机数与类型拦截等组别,多数未合入
TileOPs 23 笔合入;夜间快照基准 1040 项、正确性 1118 项连续零失败
tilelang-ascend ascendc_pto 分支 19 笔提交;每日回归连续四日全通过;无新标签
tilelang-mlir-ascend 窗口内 7 笔提交
沐曦 / 海光 / 摩尔线程 / Sunrise 各家最近推送为 09-17 至 09-18;窗口后半段均无新提交
采用方(FlashQLA / TileKernels) FlashQLA 09-18 合入三笔;TileKernels 无推送
TileRT / 组织其他仓 TileRT 连续七周静止;TileFoundry 与 DeepStack 各有一至两笔
新闻与学术渠道 新闻检索、技术社区与预印本渠道窗口内均无主题新增;唯一媒体条目为 DeepSeek 工程师报道
版本与发布 主仓 v0.1.14(09-02)后 18 天未发版;各适配仓标签未动
  • 核查边界:昇腾与沐曦的实测数据来自提交说明与 PR 正文自述,本刊无对应硬件、未做独立复现;产业侧动态来自公开报道;夜间基准读数均为单次流水线记录,非横向评测。
  • 下一期周期建议:2026-09-20 ~ 2026-09-27。