调研窗口:过去 24 小时(2026-09-18 07:00 ~ 2026-09-19 07:00,北京时间)。本期为常规日更窗口,与上一期无重叠。 信源:GitHub(tile-ai 组织 28 个仓库推送时间全量核查,窗口内 6 个仓库有推送;主仓 2 笔合入与 5 个新开 PR 逐条复核,含 PR 正文、改动文件数与增删行数;TileOPs 5 笔合入与 1 个新开 PR;昇腾仓每日回归报告、CI 改动与 2 笔提交;TileOPs-nightly 夜间快照的基准与正确性 XML 全量解析;Sunrise 后端发行版仓库与分支核查)、Google News RSS 中英文多组查询(走代理)、Hacker News、arXiv、采用方仓库(TileKernels / FlashQLA)


本期索引

  • 今日重点:主仓新开 CUDA Tile IR 执行后端,134 个文件、约 3.6 万行新增(09-18)
  • 一、核心项目进展
    • 1.1 符号化循环布局的单射性证明恢复,混合静态与动态 T.Parallel 回归修复(09-18)
    • 1.2 ROCm CI 接入可移植示例校验,反向印证 ROCm 通路进入收敛期(09-18)
    • 1.3 窗口内主仓新开五个 PR:Tile IR 后端、拷贝宽度钳制、SM100 起 256 位访存、GLM-5.3 与 KDA 示例(09-18/09-19)
    • 1.4 TileOPs 一日合入五笔:分派与调的解耦、SM90 形状补齐、分页 KV 助手外移、稀疏 MLA 越界收口、清单复合算子(09-18)
    • 1.5 TileOPs 新开 FP8 批矩阵乘转置内核,正面追赶对照实现(09-18)
  • 二、多后端适配(昇腾 / Sunrise / 沐曦 / 海光 / 摩尔线程)
    • 2.1 昇腾:每日回归 1936 项全通过,并引入多设备测试分片(09-18/09-19)
    • 2.2 昇腾:对比算子文档补齐 dtype 覆盖,基准脚本缓冲区生命周期修复(09-18)
    • 2.3 Sunrise 后端发行版:面向 S2 加速器的 TANG 后端进入 0.1.14 候选(09-16/09-18)
    • 2.4 沐曦、海光、摩尔线程:窗口内无新提交,维持版本分支维护(09-17)
  • 三、生态与采用方
    • 3.1 FlashQLA 结束静默:同日合入三笔,含 SM120 反向融合内核(09-18)
    • 3.2 TileOPs 夜间基准 1040 项零失败,正确性 1118 项全通过(09-18)
    • 3.3 TileKernels 与 TileRT 窗口内无推送(04-23、08-13)
    • 3.4 社区工具:TileSight 性能分析文档仓上线,对应 arXiv 性能模型论文(09-18)
  • 四、社区、教程与活动
    • 4.1 组织文档站窗口内有一次站点部署,默认分支无内容变更(09-18)
    • 4.2 媒体与学术侧窗口内零新增(09-19)
    • 4.3 版本节奏:主仓仍为 v0.1.14,各适配仓标签未动(09-11)
  • 五、趋势观察
    • 5.1 第二条 NVIDIA 侧执行通路成形:从 CUDA 源码生成到 CUDA Tile IR
    • 5.2 主仓继续把静默语义错误前移为编译期失败
    • 5.3 TileOPs 性能与契约双线并行,夜间基准转绿
    • 5.4 采用方一侧回暖,FlashQLA 单日三笔合入
    • 5.5 后端矩阵扩张:从昇腾一极到多家后端发行版并存
  • 附:素材与核查说明

今日重点:主仓新开 CUDA Tile IR 执行后端,一次提交 134 个文件

日期:2026-09-18 来源tilelang #3247 新增 CUDA Tile IR 执行后端

本窗口最重的一笔内容出现在主仓的评审队列里:一条名为 tileir 的执行后端被提上 PR,改动规模为 134 个文件、新增约 35829 行、删除 111 行,由 0xtaruhi 提交,创建于北京时间 09-18 20:40,窗口内持续更新。

它做的事情是把 TileLang 程序下沉到 NVIDIA 的 CUDA Tile IR,再经由 cuTile 运行时装载汇编产物启动,目标版本组合为 CUDA Tile IR 13.4 绑定、tileiras 13.4、cuTile 1.5。与现有 CUDA 后端(直接生成 C/CUDA 源码交给 nvcc)相比,这是一条语义层更靠上的新通路:TileLang 的行为直接落到 Tile IR 上,编译与优化交给 NVIDIA 自己的瓷砖级中间表示。

配套改动同样成体系,说明这不是原型而是按产品化标准在写:

  • 后端接入 JIT 编译、内核缓存与自动调优三处,tilelang/jit/adapter/tileirtilelang/cachetilelang/autotuner 均有改动;带类型的 IR、下沉与 pass 核心放在 tilelang/tileir
  • 增加一个 pass 配置项,用于在 Tile IR 启动物化之前(含从缓存恢复的路径上)仍执行既有的源语言语义检查,并保留可配置的关闭开关;
  • 恢复新工具链下的完整示例覆盖,其中一项具体工作是把手写宿主侧 pybind 绑定与 nvcc 隔离,使扩展头文件在 CUDA 13.4 下能干净编译;
  • 补上两篇文档(编译器内部与编程指南各一)与一条专门构建固定版本 TileIR 绑定的 CI 作业。

作者给出的测试计划覆盖单测与下沉用例、JIT 与缓存与调优链路、以及全部示例的回归。需要说明的是,该 PR 截至窗口结束仍处未合入状态,改动规模大、目标工具链版本新,最终能否落入主线取决于评审;本期把它列为重点,依据是它在窗口内贡献了最大一笔实质工程内容,且指向 TileLang 的后端路线选择。


一、核心项目进展

窗口总览:主仓默认分支窗口内只有 2 笔合入(09-18 14:56 与 09-19 01:56 各一笔),但评审队列活跃——窗口内新开 5 个 PR,全部处于未合入状态。也就是说,主仓本窗口的重心在「提交新通路 + 提交防御性修复」,合入节奏偏慢。TileOPs 一侧相反,单日合入 5 笔。

1.1 符号化循环布局的单射性证明恢复,混合静态与动态 T.Parallel 回归修复(09-18)

日期:2026-09-18 来源tilelang #3233 恢复符号化循环布局的单射性证明/关联缺陷单 #2906

主仓本窗口唯一一笔语义修复,修的是一个从 v0.1.12 到主线之间的回归,由 sepcnt 提交,4 个文件、+198/-13,09-18 14:56(北京时间)合入。

触发场景很具体:当 T.Parallel 迭代空间是静态与动态的混合形态(例如 (16, n)nT.dynamic)时,布局带有填充出来的尾部,其循环布局是单射但非双射,定义域无法枚举。此前这条路上的判定会退回到「不检查」,而中间某次改动换成了真正去证明,却又无法处理符号化步长,于是这类核在主线直接报「找不到可用布局」——在 v0.1.12 上是能跑的。

修复恢复了对符号化填充循环布局的单射性证明:尝试从待检迭代映射构造逆映射,再在定义域上证明往返相等。作者在 PR 里把两种判定手段的盲区差异写明在调用点,两者都保留——这意味着这不是简单回退旧行为,而是补上了正确性论证。

第二个独立部分是拒绝在符号化共享内存瓷砖上附加布局,与前一部分同批提交,属同一作者在评审中被重新划定范围后的结果。

1.2 ROCm CI 接入可移植示例校验,反向印证 ROCm 通路进入收敛期(09-18)

日期:2026-09-19 来源tilelang #3165 在 CI 中运行可移植示例校验

09-19 01:56(北京时间)合入,内容是在 ROCm CI 作业里加入一份小型白名单,直接跑示例自身的正确性路径,而不是在测试目录下维护一套重复用例。白名单覆盖四类:Seer 注意力、通用 Top-K、稀疏多头潜在注意力前向、基于张量的分组矩阵乘。

这条改动的意义在于覆盖面来源的变化:此前 AMD 侧的验证由专门维护的测试副本承担,现在是「示例即测试」。当一个后端开始用示例本身当回归资产,通常说明该后端的示例已经稳定到可以当作基准,维护者不必再为它单独铺一套测试。

1.3 窗口内主仓新开五个 PR:Tile IR 后端、拷贝宽度钳制、SM100 起 256 位访存、GLM-5.3 与 KDA 示例(09-18/09-19)

日期:2026-09-18 至 2026-09-19 来源#3246 拷贝宽度钳制#3247 Tile IR 后端#3248 256 位访存#3249 KDA 解码示例#3250 GLM-5.3 压缩

除今日重点介绍的 Tile IR 后端外,窗口内另有四条新开条目,按创建时间排列:

其一,#3246(09-18 15:39)把 T.copyT.async_copy 的合并宽度上限钳制到实际可达的向量宽度,取代原来的致命日志。此前传入不支持的宽度会直接以 LOG(FATAL) 终止进程,改动后钳制为可用值继续编译。这与前一期的「把静默错误前移成显式失败」方向相反但互补——这里是把「直接崩掉」改成「降级并继续」,判定标准是宽度上限属于能力约束而非用户语义错误。

其二,#3248(09-19 01:35)修正 256 位全局访存的适用目标:仅在 SM100 及更新架构且 CUDA 12.9 以上才发出该宽度,旧架构退回 128 位通路,并补充了旧架构上的负向测试。这一条与前一期的原子向量宽度规划属同一类工作,都是在新的宽向量能力上补齐从属条件。

其三与其四均在 ROCm 方向:#3249(09-19 02:23)新增带安全门控的 KDA 解码示例,用 TileLang 写打包解码核,就地更新按槽位索引的循环状态池,并补上输出与状态一致性、多步、空状态索引、乱序槽位、可配置边界等正确性覆盖;#3250(09-19 06:42)新增 GLM-5.3 的 k 池压缩与缓存写入,含逐维 softmax 池化、归一化 Hadamard-128 变换与逐向量 FP8 量化,并把 FP8 的 K 值与 FP32 缩放写入调用方持有的分页缓存。

值得注意的是,这几条 ROCm 方向的新内容都是面向具体模型的具体算子(GLM-5.3 的压缩注意力、KDA 门控线性注意力的解码态),而不是笼统的后端能力补齐。这说明 AMD 侧的推进已经从「后端能用」转到「新模型的原生算子在这里也要有」。

1.4 TileOPs 一日合入五笔:分派与调的解耦、SM90 形状补齐、分页 KV 助手外移、稀疏 MLA 越界收口、清单复合算子(09-18)

日期:2026-09-18 来源#2147 清单复合算子#2149 稀疏 MLA 越界#2150 分页 KV 助手外移#2151 SM90 形状补齐#2152 分派与调优解耦

TileOPs 在本窗口合入 5 笔,性质分成三类:

契约类——#2147(08:36 合入)让算子清单能够描述复合算子,这是上一期以未合入状态报道过的条目,本窗口落地。它同时收掉了此前散落在多处的重复推导逻辑、支持可空输出。上一期已详细展开其问题清单,此处不重复。

分派正确性——#2152(19:27 合入)把「调优请求」与「实现选择」解耦。此前 tune 这个参数只应影响内核如何构建,却被两个特化实现当作分派条件使用,导致同一个形状仅仅因为调用方要求调优就选到不同实现,其中批矩阵乘模板直接拒绝调优请求。修复后选择器内核与调优无关。

盲区补齐——#2151(15:42 合入)补上 SM90 上无人负责的形状区间:基础 GEMM 内核把整个 SM90 排除在外,而通用 GEMM 内核只服务 TMA 能寻址的调用,两者相减留下一个空档,具体是操作数为半精度且 K 不是 8 的倍数、同时 M 大于 2 的情形。修复让基础内核接下这部分。

正确性收口——#2149(13:02 合入)修两处:稀疏多头潜在注意力解码的聚集操作此前只检查因果上界,当 top-k 槽位被填充为序列长度或 -1 时会读到缓存并未持有的行,修复把上界钳制到序列长度减一并对每个索引做非负检查;另一处是让分页注意力在碎片化布局下的计时可信。

结构性重构——#2150(13:22 合入)把五个分页 KV 缓存辅助函数从分组查询注意力模块中移出。这五个函数(交错块表构造、碎片块表构造、分页缓存取行、按逻辑序列填充分页缓存、单位缓存缩放构造)都不专属于分组查询注意力,此前多头注意力模块不得不反向依赖它,现独立成层。

五笔合入的共同点是:TileOPs 当前的主要工程量不在「新增算子」,而在算子增多之后暴露出来的分派一致性、模块边界与内存安全。

1.5 TileOPs 新开 FP8 批矩阵乘转置内核,正面追赶对照实现(09-18)

日期:2026-09-18 来源TileOPs #2153 用合并访存内核转置 FP8 的 B 操作数

窗口内 TileOPs 唯一的新开 PR(09-18 16:18 更新,未合入)。背景写得很直白:FP8 批矩阵乘前向算子在 trans_b=False 的 5 个用例里有 4 个输给对照实现,最差一档落后到 0.34 倍。作者先复核了对照实现与 fp32 参考的一致性,确认对照没有作弊,然后选择把 B 操作数的转置改成一个合并访存的内核来做,而不是继续在共享模板上打补丁。

这条与上一期的批矩阵乘提速(改用共享 GEMM 模板、H200 上最高 1.44 倍)是同一战线的延续:批矩阵乘在标准形状上已经追平甚至反超对照,剩下的短板集中在数据类型变体(FP8)与布局变体(需要转置 B)这些边角。是否影响共享模板的通用性,需等合入后看夜间基准的回归结果。


二、多后端适配(昇腾 / Sunrise / 沐曦 / 海光 / 摩尔线程)

窗口总览:本窗口的国产与第三方后端格局出现一个结构性变化——除既有的昇腾、海光、沐曦、摩尔线程四家之外,tile-ai 组织下已存在一个面向新加速器的后端发行版仓库(Sunrise),并已推进到候选发布分支。四家既有后端中,窗口内只有昇腾有提交。

2.1 昇腾:每日回归 1936 项全通过,并引入多设备测试分片(09-18/09-19)

日期:2026-09-19 来源tilelang-ascend 每日测试报告 #1813CI 多设备测试分片 #1812

昇腾侧的每日定时测试在北京时间 09-19 05:52 出报告:1936 项全部通过,失败 0 项,通过率 100%。对照前一日(09-18 05:46 的 1925 项)与再前一日(09-17 的 1919 项),用例总数在两日内净增 17 项且保持全绿——这是「上游持续并入新能力、昇腾侧回归仍不破」的直接证据。

同一窗口内,该仓另开一条 CI 改动(#1812,标题为新增通用的多设备测试分片),创建于 09-18 16:31、当日 19:22 仍在更新,未合入。用例数持续增长而单机回归时间会随之拉长,分片是顺势而为。

2.2 昇腾:对比算子文档补齐 dtype 覆盖,基准脚本缓冲区生命周期修复(09-18)

日期:2026-09-18 来源tilelang-ascend #1602 更新对比算子文档并补 dtype 覆盖#1779 修复基准脚本的缓冲区返回令牌生命周期

窗口内昇腾仓的两笔提交都落在 09-18 15:10 与 15:31(北京时间):一笔更新比较算子的文档字串、补上数据类型覆盖测试与 API 文档;另一笔修 bench_sfa 中累加器与输出临时缓冲的返回令牌生命周期,避免缓冲区在使用完成前被回收。两笔都不是算子能力扩张,而是把已有算子的文档、测试覆盖与基准脚本的稳健性补齐——与 2.1 的回归规模增长放在一起看,昇腾侧当前处于「能力已铺开、重点转向质量与可维护性」的阶段。

2.3 Sunrise 后端发行版:面向 S2 加速器的 TANG 后端进入 0.1.14 候选(09-16/09-18)

日期:2026-09-18 来源tile-ai/tilelang-sunrise 仓库

tile-ai 组织下有一个此前未被本日报点到的仓库进入窗口内的推送列表:tilelang-sunrise,建仓于 2026-08-26。其自述定位是 TileLang 的 Sunrise S2/TANG 后端发行版——Sunrise S2 是面向大模型推理的国产 GPGPU,TANG 为其编译与运行时栈(仓库要求 TANG Runtime 与配套的 torch 后端包、匹配的 Triton 包)。提供的算子示例覆盖矩阵乘、反量化矩阵乘、FlashAttention、Flash 线性注意力、Flash 多头潜在注意力解码与原生稀疏注意力,即与主仓保持同一套示例面。

进展状态:仓库在窗口内有推送(09-18 11:03),但默认分支最后提交停在 09-04;承载发布准备的候选分支上,最新一笔提交是 09-16 的版本更新,把版本号推到 0.1.14+sunrise.1.1.0,即已经跟到主仓 v0.1.14 一线。仓库另有一批待处理的依赖升级 PR 与一条 CI 分支。

判读要点:这是「后端发行版」而非「补丁分支」的形态——独立建仓、独立发版号(在主仓版本号后加后缀)、独立 CI。它与海光的 feat/hcu-... 分支、摩尔线程的加后缀回移植分支构成三种不同的适配组织方式。由于该仓库自述与示例与主仓同构,可视为 TileLang 在 NVIDIA/AMD/昇腾之外的又一条推理加速器通路正在进入可发布状态。

2.4 沐曦、海光、摩尔线程:窗口内无新提交,维持版本分支维护(09-17)

日期:2026-09-17 来源tilelang-metaxtilelang-hygontilelang-musa

三家适配仓在 24 小时窗口内均无提交,最近一次推送分别落在 09-17 17:38、09-17 20:25、09-17 03:47(北京时间),均在窗口之前,属上一期已报内容:沐曦的异步拷贝矩阵乘与其测试修复、海光的多级存储地址重基与异步流水合入、摩尔线程的 MUSA 5.3.0 文档。三家的版本标签窗口内均未更新,最新标签仍分别是沐曦无发布、海光无发布、摩尔线程 v0.1.14+musa.1(09-11)。


三、生态与采用方

3.1 FlashQLA 结束静默:同日合入三笔,含 SM120 反向融合内核(09-18)

日期:2026-09-18 来源FlashQLA #34 SM120/121 反向融合内核#41 SM100 KKT 解算占用率#44 变长尾块的异步流水

上一期报告里,「采用方一侧窗口内安静」中明确记到 FlashQLA 无推送;本窗口它同日合入三笔,且时间高度集中在北京时间 09-18 15:51 至 15:53,是一次批量收口。

三笔的内容分别是:

  • 新增硬件支持(#34):为分块门控 delta 规则补上 SM120/SM121 的反向融合内核。实现大体沿用早前在 Hopper 上的流水,主要差异是共享内存归约策略——SM120 的共享内存上限较低,归约要按这个约束重新设计。
  • 占用率调优(#41):给固定长度与变长两种 KKT 解算核加最小每流多处理器驻留块数标注,目标是在每个流多处理器上驻留八个 128 线程的线程块,KT 数学、布局、启动网格与公开接口均不变。
  • 正确性修复(#44):变长打包场景下,最后一组不足 64 行的瓦片此前会越读进下一条序列。修复保留完整瓦片的直接内存访问快路径,对不完整尾块改用带谓词的零填充异步拷贝,并把尾块暂存拆分到多条通道。

这两类改动指向同一件事:FlashQLA(通义千问侧基于 TileLang 的门控线性注意力实现)的工程重心正在从「新架构适配」转向「同一架构上的占用率与边界正确性」。三笔集中合入也说明其维护节奏是批量评审而非逐笔合并。

3.2 TileOPs 夜间基准 1040 项零失败,正确性 1118 项全通过(09-18)

日期:2026-09-18 来源TileOPs-nightly 快照提交快照环境元数据

夜间流水线在本窗口为 TileOPs 的 4c5b441f(即 1.4 中「分派与调优解耦」那笔合入)生成了快照,含基准结果、正确性结果与环境元数据三件。解析两份结果文件得到的读数:

  • 正确性:1118 项,失败 0,跳过 2;
  • 基准:1040 个用例,失败 0,跳过 3。

与前一日快照(正确性 1117 项全通过、基准 1039 项中 1 项失败)相比,用例数各增 1,且昨日唯一那项基准失败已消失——昨天失败的是分组查询注意力预填充分页内核在 softcap 50 配置下的用例,报错来自对照基线实现的函数签名不匹配(缺少参数)、并非 TileOPs 自身内核出错。本日转绿说明该对照侧问题已被处理。

环境元数据把可复现要素固定得比较完整:H200、CUDA 13.2、驱动 595.71.05、功耗上限 700 瓦、单流多处理器时钟 1500 兆赫兹(上限 1980)、内存时钟 3201 兆赫兹、镜像按其内容标识记录、以及全量依赖版本(其中 TileLang 为该次提交构建的 0.1.11 加代号版本、PyTorch 2.13.0)。基准用例面覆盖解码类算子(稀疏注意力解码、多头潜在注意力解码、分组查询注意力变体)与 27 项批矩阵乘用例,后者正是 1.5 中对照实现被超越的战场。

3.3 TileKernels 与 TileRT 窗口内无推送(04-23、08-13)

窗口内,深度求索的 TileKernels 与 tile-ai 组织下的 TileRT 都没有提交,最近推送时间仍分别为 2026-04-23 与 2026-08-13。TileRT 已连续六周静止。采用方一侧本窗口的动态全部来自 FlashQLA。

3.4 社区工具:TileSight 性能分析文档仓上线,对应 arXiv 性能模型论文(09-18)

日期:2026-09-18 来源tilelang4tilesight-doc 仓库arXiv 2607.22432 TileSight

窗口内出现一个由社区成员新建的文档仓,主题是把 TileLang 的性能分析接到 TileSight 工具链上:从 Python 与高层 TIR 中提取语义、工作量与依赖信息,接入 TileSight 的缓存与流水分析接口,再用运行时观测生成独立报告与联合预测。仓库给出四篇中文文档的阅读顺序(模型与运行时两条路径的整体方案、TileSight 的阶段与前端接口与流水分析、缓存模块、性能分析功能与协议对照索引),并把性能问题分成六类:流水瓶颈、跨层级搬运异常、缓存利用异常、计算与访存重叠失败、负载不均等;文档明确要求报告区分「模型预测」「运行时观测」「证据不足」三种结论强度。

与之对应的学术侧背景是 arXiv 上一篇 2026-07-24 的性能建模论文(从核心到集群的瓷砖级分析式 GPU 性能模型),是 TileLang 主题下最近一篇预印本。两条材料合起来说明:围绕 TileLang 的性能可解释性正在形成独立于语言本体与算子库的第三条社区线索。该仓库为个人项目、尚无星标,收录依据是它是本窗口内社区侧唯一实质新增。


四、社区、教程与活动

4.1 组织文档站窗口内有一次站点部署,默认分支无内容变更(09-18)

日期:2026-09-18 来源TileOPs.github.io 仓库

TileOPs 文档站在窗口内有推送记录(09-18 08:00),但其默认分支在窗口内没有新提交,判断为站点部署类动作而非内容更新。主仓文档站在本窗口没有推送,与前一日的机器人再生成(387 个文件)形成对照——文档站跟随上游代码的节奏本来就是脉冲式的。

4.2 媒体与学术侧窗口内零新增(09-19)

主题的 Google News RSS 中英文多组查询在本窗口零新增命中:英文侧近 7 天仅一条与主题强相关的报道,即前一期已收录的关于 DeepSeek 工程师评估 AI 编写内核能力的那篇,其发布时间在前一窗口内,本期不重复;中文侧针对组件名、国产加速器与算子内核的组合查询全部无窗口内结果。Hacker News 侧近五日内无主题讨论命中(检索到的 TileOPstile 类关键词命中项均为无关话题)。arXiv 侧窗口内无新预印本。

4.3 版本节奏:主仓仍为 v0.1.14,各适配仓标签未动(09-11)

主仓最新标签仍为 v0.1.14(09-02 发布),窗口内无新标签;TileOPs 至今无发布记录;昇腾仓最新标签为 TileLang-ascend v0.1.2.000-release(09-09);摩尔线程仓最近标签为 v0.1.14+musa.1(09-11)。后两者的发布节奏都与主仓的小版本对齐,当前都停留在 v0.1.14 一线,尚未跟随主线推进到新版本。


五、趋势观察

5.1 第二条 NVIDIA 侧执行通路成形:从 CUDA 源码生成到 CUDA Tile IR

本期最值得追踪的是 #3247 的开出。TileLang 此前的 NVIDIA 通路是「下沉到带瓷砖语义的中间表示、再生成 CUDA 源码、最后交给 nvcc」,新通路改为「下沉到 CUDA Tile IR、由 NVIDIA 的瓷砖级工具链编译优化、经 cuTile 运行时装载」。两条通路并存意味着:其一,TileLang 的抽象层级与 NVIDIA 自家的瓷砖级抽象开始正面接壤,谁承担调度与布局决策会变成长期议题;其二,一旦 Tile IR 通路成熟,TileLang 在 NVIDIA 平台上的价值主张会从「更好的代码生成」部分转向「更完整的程序表达与跨后端一致性」。这条 PR 的规模(一个后端从编译到缓存到调优再到文档与 CI 齐全)也说明它不是实验性分支。

5.2 主仓继续把静默语义错误前移为编译期失败

延续上一期的观察,本窗口主仓的两笔合入里有明确的一笔(1.1 的布局证明恢复)属于「把悄悄出错变成明确报错」,加上前三期累计的随机数诊断、不支持类型组合拦截、稀疏元数据形状拒绝,已经把「编译期失败优先」变成主仓稳定的工程取向。本期新增的信息是这条原则的边界:1.3 中把拷贝宽度的致命日志改成钳制降级,说明维护者在区分「用户语义错误」(应当失败)与「能力约束」(应当降级)——这不是原则松动,而是把判据写清楚了。

5.3 TileOPs 性能与契约双线并行,夜间基准转绿

TileOPs 本窗口 5 笔合入里,3 笔是分派、模块边界与内存安全,1 笔是清单契约,只有 1 笔(新开的 FP8 批矩阵乘)是纯性能。与夜间基准从「1 项失败」转为「零失败」放在一起看,它的当前状态是:性能基线稳定且已能压过对照实现的主要形状,因此工程资源转向多算子共存之后的一致性与契约。这是算子库成熟期的典型信号——算子越多,分派与清单的正确性对上层越重要。

5.4 采用方一侧回暖,FlashQLA 单日三笔合入

上一期「采用方安静」的判断在本期被推翻:FlashQLA 同日合入三笔,覆盖新架构(SM120/SM121 反向融合内核)、占用率调优与变长尾块正确性。这提示采用方仓库的更新是脉冲式的——评审积压到一定量后批量合入,单日或数日的静默不构成趋势。日报层面需要避免把单期静默解读为采用停滞。

5.5 后端矩阵扩张:从昇腾一极到多家后端发行版并存

本窗口发现的 Sunrise 后端发行版给出了一个新的格局读数:TileLang 的后端生态已不止于「主仓内置的后端」与「厂商在组织内开的适配仓」两种形态,还出现了带独立版本号与 CI 的后端发行版。目前已识别的适配形态共有三类——昇腾的独立适配仓(多分支,含每日回归)、海光的特性分支与加后缀回移植分支、摩尔线程的版本对齐回移植分支,加上 Sunrise 的独立发行版。形态差异本身反映了各厂商对 TileLang 的投入深度与产品化程度,是判断国产加速器对 TileLang 生态依赖度的一个可用指标。

5.6 本窗口的空白与风险点

三点需要标注:其一,主仓窗口内只合入 2 笔,且其中一笔是回退型修复(恢复 v0.1.12 的行为),主线净增能力有限;其二,#3247 这类超大改动一旦合入,对既有 CUDA 通路与缓存格式的回归面需要额外观察,本期尚无证据;其三,本窗口未见任何新标签或发布,主仓自 09-02 的 v0.1.14 后已连续两个多星期未发版,而评审队列在持续累积。


附:素材与核查说明

信源核查表

信源 核查结果
tile-ai 组织(28 仓库) 窗口内 6 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、tilelang-ascend、tilelang-sunrise、TileOPs.github.io
主仓 tilelang 默认分支 2 笔合入(#3233、#3165),新开 5 个 PR(#3246 至 #3250),无新标签
主仓夜间/组织仓库 TileOPs-nightly 为 TileOPs 提交生成快照;TileRT、TileFoundry、tilescale、DeepStack、tilelang-puzzles 窗口内无推送
国产后端四家 仅昇腾窗口内有提交与回归报告;沐曦、海光、摩尔线程最近推送在窗口之前
第三方/新增后端 Sunrise 后端发行版仓库窗口内有推送,候选分支版本推到 0.1.14+sunrise.1.1.0
采用方 FlashQLA 合入 3 笔;TileKernels 无推送
Google News RSS(中英多组查询,走代理) 窗口内零新增;组件名与技术词组合查询同样无窗口内结果
Hacker News 窗口内无主题命中,关键词噪音已剔除
arXiv 窗口内无新预印本,最近一篇为 2026-07-24 的性能建模论文
文档站 TileOPs 文档站有站点部署动作,默认分支无内容变更

完整信源清单