报告周期:2026 年 9 月 21 日(周一)至 9 月 25 日(周五),共 5 个工作日、5 期日报素材(对应 ISO 第 39 周) 素材来源:本刊每日 TileLang 动态日报 5 期(09-21、09-22、09-23、09-24、09-25);另经 tile-ai 组织 29 个仓库的 168 小时窗口补充核查与各仓库发布元数据复核(详见附录)


一、本周要闻

  • TileRT 一天内两笔发布 PR 合入,v0.1.6 把 GLM-5.2/5.3 带到 AMD Instinct MI350X/MI355X(09-24):北京时间 09-24 晚间 20:22 与 23:33,TileRT 连续合入 v0.1.5.post3(#63)与 v0.1.6(#68)两笔发布 PR。v0.1.6 发布说明为在 AMD Instinct MI350X/MI355X 上新增 GLM-5.2/5.3 支持(ROCm 路径)并包含预填充与解码分离(PD)相关更新;同日 PD 侧 KV 注入拷贝跨设备对重叠性能单 #66 关闭、内容并入本次发布叙事。边界:截至本周期末核查,TileRT 的 GitHub Releases 页面与标签仍停在 v0.1.5.post2(2026-08-06),发布页滞后于发布 PR,公开可获取版本尚未更新。

  • FP4 到 FP8 的精确转换融合进主仓,DeepSeek V4.1 专家 GEMM 提速最高 5.38 倍(09-22):主仓 tilelang #3204 于 09-22 19:36 合入(09-11 开出、11 天打磨、161 行新增)。改动把「E2M1(FP4)权重经 FP32 中转转成 E4M3(FP8)」的默认投射链融合为每四个元素两条 __byte_perm 指令,覆盖标量与 2、4、8、16、32 五种向量宽度,全程在寄存器内完成、不新增显存分配。H100 上十二个配置的提速区间为 2.97 倍至 5.38 倍(如 1×2304×5120 从 547.94 微秒降至 108.65 微秒、2048×5120×2304 从 1760.22 微秒降至 591.92 微秒),寄存器占用从 128 升至 156、无溢出。验证覆盖源生成测试、每个打包字的逐字编码比对与 CUDA/ROCm/Metal/CuTeDSL 当前头 CI;边界:Blackwell 执行与整模型服务两项尚未验证。

  • TileSight 正式开源:瓦片中心的分析式性能模型从论文落地为官方仓库(09-23):09-23 22:54,tile-ai 组织新增的 TileSight 仓库完成首次提交(177 个文件、约 5.67 万行、MIT 许可),组织仓库总数由 28 增至 29;7 月 24 日 arXiv 论文(2607.22432)结尾「发表后开源」的承诺至此落地。仓库覆盖 20 余份硬件档案(NVIDIA、AMD Instinct 与 Intel Arc 独显)、多级缓存复用距离模型、流水线重叠分析与 CUDA/HIP 微基准探针;论文口径:A100 至 B6000 四代平台单卡内核延迟合并平均绝对百分比误差 12.35%,扩到 32 卡集群后融合分布式内核与 vLLM 端到端服务的加权误差分别为 16.18% 与 13.52%。

  • TileOPs 一周 21 笔合入:治理合龙与性能季高峰并行(09-21 ~ 09-24):本周期 TileOPs 合计约 21 笔合入。治理线,roofline 公式大笔 #2158 让清单公式成为唯一执行来源并修正 15 类公式错误(覆盖 175 个已实现算子),随后 #2167 拆除最后旁路、#2175 让合成失败转为点名报告——「度量的信任工程」合龙;性能线,09-23 单日七笔合入(GEMM、Engram、注意力、MoE、Mamba、mHC、线性注意力七个子系统),其中 DeltaNet 推理算子(#2163)在 H200 上对照 FLA 最高提速 3.7 倍;通道治理与接口收缩同步推进(详见第四节)。

  • GLM-5.3 k 池链内容合入主线:整套示例与 4 个 AMD 测试资产入列(09-20 晚间):09-20 17:06,tilelang #3254 以压缩方式合入(11 个文件、+2520/-4),把上一周期的 k 池系列带进主线:examples/kpool/ 四个可运行示例(池内 softmax 池化、BF16 往返与 Hadamard 归一化、FP8 量化、分页缓存回读与 32 头 MQA 加权分数)加四笔 ROCm 测试;语言层 tilelang/language/fp8.py 的 FP8 dtype 选择改为可按设备指定。验证:exact-head CI 全绿,ROCm 7.2 在 MI300X 上报 2433 项通过。边界:栈上 #3250、#3251、#3253、#3255 四笔开单未收尾(内容已在主线),至本周期末未见收尾动作。

  • 主仓修复纵深:单日 6 笔合入、Fuzzer 清账、AllReduce 静默错误拦截与 NaN 语义双线闭环(09-21 ~ 09-24):主仓全周 14 笔合入,构成三层纵深——编译器前端与边界(两笔 Fuzzer ICE 修复 3206/3207,由同一位报告者 08-17 同日开出的原单被定点清账)、运行时包装层(NVRTC 修复 #3260)、代码生成与调度(AllReduce 步长校验 #3266 拦下「能跑但悄悄算错」的静默错误)。09-24,NaN 传播语义双线闭环(#3273 编译期报错 + #3205 clamp 降低修复,两个缺陷单关闭),同日 SIMT im2col 与异步暂存重构链成形(#3274 → #3275 → #3279)。

  • 昇腾的「合入—回退—恢复」一周闭环;A5 真机缺陷被公开(09-20 ~ 09-24):09-20 单日 11 笔合入(最大一笔 #1753 为 72 文件、+10117/-3618 的 FP32 行归约与同步修复)之后,09-22 迎来三笔整批回退(#1818 精确撤回 #1753),09-24 以每日测试 2448/2448 全通过收口——「合入、验证失败、回退、恢复全绿」全链在两天内走完。同时 09-23 开出三笔缺陷单,其中 #1830 指出真实 Ascend 950(dav-3510)上设备路径以 910B 代标号编译、启动即报设备异常、改标号后静默算错,暴露验证矩阵「真机覆盖 910B 代、仿真覆盖 950 代」的绕行盲区。

  • 多后端与生态:海光示例支持合入、沐曦日更、Sunrise 发版、摩尔线程静默(09-21 ~ 09-24):海光 #11 示例支持 09-23 合入(37 文件、+1104/-130,GEMM 改用 HCU 矩阵核内建指令),#12 于 09-24 合入(FP32 MMAC K 共享与 ds_read 片段打包);沐曦完成上游 main 同步(#158)并开出子 warp 守卫修复(#159);Sunrise 09-21 发布 0.1.14+sunrise.1.1.0(CI 体系扩充与 sparse mask 修复);摩尔线程仓库全周静默(最近推送 09-17),其外部后端接入的机制性缺口由 TileOPs 队列成组治理承接收口。


二、核心项目进展(主仓 tilelang)

版本与发布

  • 主仓最新标签仍为 v0.1.14(09-02 发布),至本周期末已 23 天未发新版本,逼近此前约 30 天的发布间隔;全组织本周期仅 Sunrise 有新发布(09-21),TileRT 两笔发布 PR 已合入但发布页未跟进(见第四节)。
  • 下游硬约束出现:TileOPs 自 #2172 起对 tilelang 提出 >= 0.1.14 的版本下限(pyproject.toml 加下限并在安装脚本强制),发版节奏与下游采纳窗口的节拍开始互相牵制。
  • 适配线标签全周未动:昇腾 v0.1.2.000(09-09)、MLIR 昇腾 v0.1.2.020.sglang.poc(09-09)、摩尔线程 v0.1.14+musa.1(09-11)、沐曦 v0.1.14(09-17)。

语言层与前端

  • Pythonic 前端(#3230,09-21 合入):编译期循环接受 Python 可迭代对象与推导式,5 文件 +1084/-24(含 766 行新测试),对 PrimExpr、Buffer 等误用给出明确拒绝;同步关闭两笔长期需求单(ForFrame 不可迭代、T.unroll 表达式列表索引)。
  • 循环目标绑定修复(#3232,09-23 合入,+196/-14):为循环目标(含元组目标)建立显式绑定,避免把归纳变量写进既有绑定;缺陷单 #3231 随合入关闭。
  • 拷贝宽度钳制(#3246,09-23 合入):T.copy 与 T.async_copy 的 coalesced_width 从「不可整除即致命日志」改为按可达向量宽度钳制——降级时告警、非正值拒绝;缺陷单 #3007 关闭。
  • NaN 传播语义双线(09-24 合入):#3273 为不支持的归约 NaN 传播 dtype 增加编译期报错(诊断给出操作名、支持的输出类型与实参 dtype,校验挂进原生 ReduceOp 构造器);#3205 把 T.clamp 的 NaN 传播正确降低到设备模板。前者源自报告单 #3270、后者源自模糊测试缺陷单 #3024,两者随合入关闭。
  • 清理类:#3262 移除不可变变量重绑定的警告(09-21 合入,净删 14 行)。

编译器、代码生成与运行时

  • Fuzzer 清账两笔(09-22 合入):#3206 把内核体里的普通 assert 降为设备侧合法检查(此前主机侧错误上报调用被写进 __global__ 内核、nvcc 直接拒编,原单 #3019);#3207 修复「动态形状输出排在供形输入之前」的调用期崩溃(原单 #3017)。
  • AllReduce 静默错误拦截(#3266,09-21 合入):XOR 蝶形规约的步长校验并入 CheckAllReduceWidth、模板加静态断言、规划器对不支持形态回退宽方案——拦下一类「看似能跑、恰好 96/192 线程时共享内存交换越界」的错误。
  • NVRTC 线:#3260 修复 warp 规约编译问题(09-22 合入,开出到修复约 14.5 小时);随后 #3265(启动不变量整数运算下沉主机侧)、#3263(包装层漏传主机标量)在审。
  • 动态形状除法:需求单 #3261 与实现 #3267(tl.LowerMagicDiv 魔法除法,按除数运行期值预计算)持续更新、待合入。
  • SIMT im2col 与异步暂存三级递进(09-24):性能缺陷单 #3274(降低时机过晚、错过调度与向量化机会)→ 三分钟后补丁 #3275(把加载提前到调度之前暴露)→ 09-25 凌晨重构草案 #3279(「统一异步数据暂存与传输感知降低」,实验性:逻辑访问与物理降低分离、共享传输分析、流水线等待规划与向量化扩宽)。同日 #3278(分区布局下异步拷贝降低修复)合入;#3276(保持 FP8 向量拷贝打包)在审。
  • 工程配套:#3268(CMake 保留后端环境变量给出的 SDK 路径)新开待审。
  • CUDA Tile IR 执行后端(#3247):一周内从 8 个提交追加至 31 个提交、+36506/-112、139 个文件,覆盖 JIT、缓存、自动调优与 DeepSeek V4 稀疏注意力调优内核,仍处评审——「加料未盖章」状态延续。

性能

  • FP4→FP8 转换融合(#3204,见要闻):H100 十二配置提速 2.97 至 5.38 倍;验证分四层(源生成、逐字比对、输出逐位一致、跨平台 CI)。
  • SM120 块缩放线(09-21):需求单 #3256 到补丁 #3257 仅隔 21 分钟(fragment A、奇数 warp 网格与紧凑缩放),路线由 SageAttention3 的实际需求牵引;#3257 待评审。
  • 节奏观察:全周小修复多为「当日开单、当周清账」(Fuzzer 两笔、NaN 一笔当天出补丁),实质增量的重心仍在评审队列。

评审队列观察

  • 大件积压:TileIR 后端(#3247,31 提交)、魔法除法(#3267)、启动不变量(#3265)、CuTeDSL 与 RNG 修复四笔(#3241 至 #3244 成批刷新)、GEMM dtype 组合拦截(#3245)、SM120 补丁(#3257)——「小修复盖章、大变更攒料」的格局贯穿全周。
  • k 池栈遗留四笔(#3250、#3251、#3253、#3255):内容已随 #3254 进入主线,开单未收尾、连续多日无动作,需以 rebase 或关闭收口。
  • 队列与发版联动:TileOPs 提出 >= 0.1.14 下限后,主仓发版窗口(已满 23 天)与下游采纳的节拍关系成为跨仓库变量。

三、多后端适配(昇腾 / 沐曦 / 海光 / 摩尔线程等)

昇腾(Ascend):合入日、回退日与恢复日的一周三幕

  • 09-20(密集合入日):单日 11 笔合入(09:36 至 16:29)——最大一笔 #1753(72 文件、+10117/-3618:编译期形状已知的 FP32 逐行 max/min/sum 实现与两类自动同步缺陷修复);正确性修复组 #1804(行切片 stride,修 910B2 上 uint16 截断数据损坏)、#1809(block_sparse_mqa_attn 异步读写);算子与文档组 #1621(mhc_pre 示例)与文档系列 6 笔。
  • 09-21(尾巴显现):跨两周评审的 #1633(mhc_bwd,Sinkhorn 隐式共轭梯度示例)17:16 合入,2048/4096 序列提速 3.1%、参考 CG 校验并入 PASSED 判据;#1821、#1822 两笔新修复开出;每日测试失败单 #1817 与两条跟进 PR(#1815、#1816)相继出现。
  • 09-22(回退日):三笔回退先后合入——#1818 精确撤回 #1753(72 文件、+3618/-10117,精确对称),#1819、#1820 撤回两笔文档增强;每日测试 #1823 以 2448/2448 全通过恢复(对照合入潮前基线 1936,增量 512 项未回落)。
  • 09-23(缺陷三重奏):两笔 mHC 示例回退(#1832、#1833,进仓均不足三天);三笔新缺陷单——#1830(A5 设备路径以固定标号 dav-2201 编译真实 Ascend 950(dav-3510),内核启动即报设备异常 507015、改标号后静默算错;README 验证矩阵恰好双向绕开该标号)、#1824 / #1825(自动同步的两处边界:条件分支同步状态错误合并、混用配置应在编译期拒绝);#1834 标量 GM 存储竞态修复方案开出(复现脚本失配数 12,967,510 降至 3,496,136,opt-in 重写路径开启后归零、113 项既有套件通过)。
  • 09-24(恢复推进):#1741 稀疏 FlashAttention 示例合入(09-04 创建、跨两周评审)、#1829 向量 mask 与 FP32 行归约优化、#1826 恢复 Select/Transpose 测试与就地校验;每日测试 #1835 以 2448/2448 全通过;API 文档核验队列约 10 笔成批刷新(主体自 8 月中旬挂起);#1828(算子迁移)、#1834 待审。
  • 判读:大合入的验证成本被正面偿付——合入、验证失败、回退、恢复到全绿全链不到两天;A5 真机检验则提示跨代硬件适配正从「能编译」进入「敢用真机校准」的阶段。

MLIR 昇腾(tilelang-mlir-ascend):Mamba 大笔合入与 A5 分支清理

  • 09-20:#187(TileOPs 基准与报告设施,约 +5.4 千行)与 #188(优化后的 Mamba 算子与 per-agent 模型选择)两笔落地。
  • 09-22:#191 Mamba-2 SSD 分块扫描 NPU 专家内核优化合入(42 文件、+4204/-1568,开出到合入约 3.5 小时),调优结论沉淀进模式库与案例记录。
  • 09-23:#178 NPU launcher 内存泄漏与流同步修复合入(rtMalloc 改为流感知分配、统一发射路径)。
  • 09-24:集中删除四条 A5 开发分支(对应同步类 PR 关闭);#130(A5 测试同步)仍开;#189、#190 待审。

海光(Hygon):示例支持合入,矩阵核数据布局修复落地

  • 示例支持 #11 09-23 合入(37 文件、+1104/-130:适配 autotune 与 LDS 配置、解决内核布局冲突、GEMM 改用 HCU 矩阵核内建指令、补回归覆盖)——海光侧「把 TileLang 示例套件在 HCU 上跑通」的阶段完成合入。
  • 特性分支两次推进:FP32 MMAC K 共享与 ds_read 打包(09-21)→ 扩展为五文件版并清理 tvm_ffi 的 FP8 导出变通代码(09-22)。
  • #12 于 09-24 合入:共享 FP32 MMAC 的 K 维度与打包 ds_read_format 片段。

沐曦(MetaX):上游同步与子 warp 守卫

  • 09-21:main 快进到上游最新 eab74a4a(同步近三周上游增量)。
  • 09-24:#158(上游 main 同步进 dev、含冲突解决)合入;#159(T.gemm_sp 子 warp 块尺寸守卫)开出待审。

摩尔线程(MUSA):全周静默,治理转入算子库队列

  • tilelang-musa 仓库最近推送为 09-17,本周期无新动作;MUSA 外部后端接入的机制性缺口(三笔 issue #2164 至 #2166:CUDA-only 输入校验、零输入拒绝、派发前 CUDA 设备查询)由 TileOPs 成组治理承接收口(见第四节),三笔单在窗口内持续更新。

其他:Sunrise 发布 0.1.14+sunrise.1.1.0

  • 09-21 发布新版本标签(候选分支 11:06 推送 → 发布 PR #6 15:33 合入 → 打标签):内容以工程化为主——修复 sparse mask 执行、设备恢复失败后停止 CI;CI 体系大幅扩充(run/install/junit 转 JSONL 脚本);新增编译速度基准与 compile-only、lower-trace 工具文档;z3 prover 开关与整数分析更新。

四、生态与采用方

TileOPs:21 笔合入的一周——治理合龙、性能季高峰与通道治理

  • 治理合龙:#2158(09-21 合入)让 roofline 清单公式成为唯一执行来源(一个来源、一个求值面),修正 15 类公式错误并让结构预言机逐 PR 重计 175 个算子;#2167(09-22 合入)拆除「对定义了求值方法的条目静默让位」的最后旁路并给两类误用补明确报错;#2175(09-24 合入)把公式合成失败转为点名报告(无需 torch 环境即可全量判定);#2161(issue)记录清单 shape_rules 的 helper 从不被求值、234 条规则静默跳过,修法待决策。
  • 性能季高峰:09-23 单日七笔合入——W4A16 预打包权重序(#2168)、Engram 解码拆分(#2173,批 4 档 8.2 倍)、varlen GQA 统一算子迁移(#2160)、MoE 超额路由按 16 行分组(#2169,相对 vLLM 升至 0.99 档)、Mamba DaCumsum(#2176)、mHC 预填充投影沿 K 拆分(#2177)、DeltaNet 推理算子(#2163);09-24 再落 GLA 推理算子(#2174)与 SM90 DeltaNet 解码(#2194),线性注意力家族补齐「训练侧 → 推理侧 → 平台解码 → 性能模型口径」多点;W4A16 长 K 流式(#2185)落地;队列中 GEMM 乒乓主循环与 176 瓦片(#2172)、varlen GQA 预规划三连(#2178 / #2180 / #2184)、FFT 内核重写(#2187)持续推进。
  • 通道治理(外接后端):#2179(09-24 合入,+797/-256)拆除算子层约 38 处设备种类检查、改由内核在张量层面声明设备,并新增 lint 钩子阻止回流;#2181、#2183(测试默认目标切换、算子行为测试全后端运行)、#2186(DeltaNet 预填充挂起与 GEMM roofline 异常修复)、#2193(输入内存滞留修复)同窗口合入;#2182(issue)记录 BuildKernel 协议缺口,待扩展。
  • 接口收缩:遗留路径清理草案四连——#2196(移除无归属 GDN 内核)、#2197(移除遗留 varlen GQA)、#2200(移除遗留 GLA 推理路径)、#2201(GLA 算子改名),另有 #2198 / #2199 / #2202 / #2203;#2195、#2205、#2180 关闭未合入(内容拆分推进)。
  • 判读:治理留下的账本正在变成性能工作的信用资产——每笔性能单都自带对照基准(torch.compile、cuBLASLt、vLLM、FLA)与逐位一致声明,且能被清单与基准独立复核。

TileOPs 夜间流水线:基准 1040 到 1081,正确性稳在 1140 上方

  • 本周期可见六份快照(对应 #1996 至 #2206 合入点):基准用例从 1040 起步,经 1046、1050 增至 1081;正确性用例在 1118 至 1141 之间,除一份快照遗漏结果文件(后恢复发布,属发布疏漏)外均零失败。
  • 09-24 快照出现一次文件级超时——DeltaNet 长预填充配置 900 秒内无测试启动(新算子「功能合入到基准可承载」之间的成本待标定),对应修复 #2186 当日合入后,09-25 快照恢复零失败、零错误。
  • 环境全周一致:H200、CUDA 13.2、驱动 595.71.05、SM 锁频、torch 2.13——快照的可复现要素保持完整。

TileRT:一天内两笔发布 PR 合入(详见要闻)

  • 补丁线与小版本线并行:v0.1.5.post3(09-07 创建)为 v0.1.5 线的第三个补丁;v0.1.6(当日创建当日合入,由项目成员合入)把 GLM-5.2/5.3 的 ROCm(AMD Instinct MI350X/MI355X)支持与 PD 分离更新并入;相对 8 月仅一笔发布的节奏,发布管线明显加密。
  • 发布页与标签滞后于发布 PR,公开渠道存在信息差,下一期继续核对。

TileFoundry:编译期分析的密集一周

  • 09-21 两笔合入:#170(循环感知的缓冲寿命求解,结构化 SSA 区间与复用约束,取代逻辑寿命求和)、#174(CuTe 风格 Swizzle 函子与 layout 代数特化,CUDA 代码生成原样输出)。
  • 09-22 两笔合入:#175(分析支持依赖单位的循环起点)、#176(内存元数据与流量归一化,分析规范单文件改动 263 行)。
  • 09-24 大笔合入:#179(内存足迹与复用窗口,+3207/-539、44 文件)——从访问关系推导时间与空间复用轴,给出「b holds=176.00MB fits=no(对照 47.68MB L2)」式可复算容量结论;同日 #184(isl 递归遍历修复)合入。
  • #185(分片排列重构草案)跟进;#168、#171、#172、#173、#178 关闭。

TileSight:瓦片中心性能模型正式开源(详见要闻)

  • 定位分工:TileSight 在建模期预测跨层成本,与 TileFoundry 的编译期 IR 分析互补;硬件档案覆盖 AMD 与 Intel 独显,天然服务多后端叙事。三段式落地(07-24 论文 → 09-18 社区文档仓 → 09-23 官方代码仓)把性能可解释性从个人线索升格为组织项目。

采用方:TileKernels 与 FlashQLA 全周无推送

  • TileKernels 最近推送仍为 04-23;FlashQLA 为 09-18(三笔 SM100/SM120 合入属上一周期)。采用方代码未动,但其推理负载持续驱动上游优化——本周合入的 FP4→FP8 融合正是以 DeepSeek V4.1 专家 GEMM 为对象。

五、社区、教程与活动

文档站与例行更新

  • 主仓文档站多次「Update docs」自动提交(09-20、09-21、09-23、09-24);TileOPs 文档站例行部署(09-20 至 09-22、09-24);均为自动化再生成,站点内容未见实质变化。

社区项目:TPU 后端、训练营、教学仓与 SoftHier

  • 社区 TPU 扩展仓(算能 BM1690):09-22 三笔提交——多核分块扫描 S3/P6 验证、P10 性能矩阵、主机侧源码校验修复;该仓保留 TileLang 的 Python 前端并增加 TPU 降低、代码生成与 JIT 运行时,是 TileLang 社区第一条公开的 TPU 后端路径。
  • 沐曦 C500 训练营材料仓:09-22 两笔——第二讲「向量加法」的 TileLang 与九齿对照练习、远程实例工作流补充操作代理配置;教学序列按「环境 → 加法对照 → Softmax 与 GEMM → AI 智能体辅助 → Llama 算子」推进。
  • 教学与本地化仓:tilelang-tutorials 新增 init_core 组示例(PTO 前端纯 Cube、纯 Vector、混合三形态,09-21,作者来自华为);tilelang-docs-l10n 完成一轮全语言 README 翻译同步。
  • SoftHier(ETH 苏黎世):把 TileLang 扩展到瓦片式多 PE 的 RISC-V 众核加速器(GVSoC 建模、Luca Benini 实验室指导的学期项目)——内核作者只声明「计算什么、数据在哪」,编译器推导簇放置、集合通信路由与同步;4×4 簇、BM=BN=BK=128 的 SUMMA GEMM(N=7168、K=2048,对应 DeepSeek-V3 路由专家降维投影尺寸),M=512 时编译器生成代码 1.01 ms 对 手写 C 0.96 ms(差距 5.14%)。

媒体与学术侧:全周零命中

  • Google News 中英文多组查询连续五个窗口零命中;Hacker News 无主题相关条目;arXiv 无新预印本(最近一篇仍为 07-24 的 TileSight 性能模型论文——其代码已于本周期开源)。媒体侧连续多周平静,主体内容以 GitHub 组织动态为准。

六、趋势观察

  • TileRT 发布节奏加密,AMD 平台权重被抬高:补丁线与小版本线同日推进,并把 ROCm(AMD Instinct MI350X/MI355X)与 GLM-5.2/5.3 的组合放到发布说明最显眼位置——对「超低延迟推理运行时」的定位而言,模型覆盖开始与 NVIDIA 线并行加码;发布页与标签滞后是短期盲区,需下一期核对收口。
  • 优化重心进入「每一层指令的账本」:161 行转换融合换来最高 5.38 倍端到端提速,前提是它出现在被反复读取的权重路径上;TileOPs 的性能第二波(调度规划、寄存器拆分、网格利用率、stream-K)同样在追问「同一块数据被读几次、在哪一级缓存流转」——收益持续向数据搬运与格式转换迁移。
  • 「静默错误前移」扩至调度与暂存层:NaN 传播双线、AllReduce 静态断言、Fuzzer 清账延续了语义校验的原则;SIMT im2col 提前暴露、逻辑访问与物理降低分离、异步暂存统一则把「先声明、后推导、隐式转显式」推入性能关键路径,直接服务卷积、GEMM 与 mHC 场景。
  • 线性注意力家族进入整编期:两天内完成 DeltaNet 推理 → GLA 推理与 SM90 解码的多点落子,随即开出四笔「删旧、改名、收敛接口」草案;此类整理通常先于接口冻结或版本动作出现——关注 TileOPs 随后是否出现发布节奏。
  • 多后端工程债显性化,治理成组推进:外接后端从「能注册」到「能调度」的最后一段开始铺路(三笔阻塞到 38 处检查拆除并加 lint 防回潮,双边协同推进);昇腾「合入—回退—恢复」闭环在两天内走完,A5 真机检验把跨代适配推入深水区;海光、沐曦保持日更节律,摩尔线程持续静默,四家热度分化。
  • 性能可解释性升格为组织资产:TileSight 从论文到官方仓库、TileFoundry 把编译期分析做到可复算容量结论——在算子库与运行时之外,分析工具的完善程度正在成为 TileLang 的差异化资产,也为多后端叙事提供建模底座。
  • 下一期关注点:主仓发版窗口(已满 23 天)与 TileIR 大件是否落地;被回退的昇腾 #1753 返工形态与 A5 输出正确性问题排期;TileRT 发布页与标签跟进;TileOPs 清理草案合入后是否触发版本动作;k 池栈四笔收尾。

附录:素材与核查说明

  • 素材:本刊每日 TileLang 动态日报 5 期(09-21 至 09-25),采集窗口为 09-20 07:00 至 09-25 07:00(北京时间);09-21 期覆盖 09-20 早间起 24 小时,含 09-20 晚间的 k 池链合入等条目。本周期之后的周末(09-26 至 09-27)动态将并入下周一日报。
  • 补充核查(168 小时窗口,截至本报告编制):tile-ai 组织 29 个仓库中窗口内 13 个有推送(tilelang、TileRT、TileOPs、TileOPs-nightly、TileFoundry、TileSight、tilelang-ascend、tilelang-metax、tilelang-hygon、tilelang-mlir-ascend、tilelang-sunrise、tilelang.github.io、TileOPs.github.io);发布与标签元数据逐仓复核;采用方与相关仓最近推送时间核对(TileKernels 04-23、FlashQLA 09-18、tilelang-musa 09-17)。

信源核查表

信源 核查结果
tile-ai 组织(29 仓库) 窗口内 13 个仓库有推送;新库 TileSight 完成首次提交(177 文件、约 5.67 万行)
主仓 tilelang 全周 14 笔合入(09-20 晚至 09-24);评审大件(TileIR 后端 31 提交、魔法除法、RNG 队列等)持续积压
TileRT v0.1.5.post3 与 v0.1.6 发布 PR 合入;发布页与标签仍停 v0.1.5.post2
TileOPs 全周 21 笔合入、多笔新开与关闭;夜间快照正确性 1118 至 1141、基准 1040 至 1081(一次文件级超时已修复)
TileFoundry 6 笔合入(#170、#174、#175、#176、#179、#184);#185 草案跟进
昇腾 三幕闭环:合入 11 笔(09-20)→ 回退 5 笔(09-22、09-23)→ 恢复 2448/2448(09-24);A5 缺陷与同步边界缺陷单开出
MLIR 昇腾 #187 至 #191 多笔落地与 A5 分支清理;#130 仍开、#189/#190 待审
海光 / 沐曦 海光 #11、#12 合入;沐曦 #158 合入、#159 开出
摩尔线程 / Sunrise 摩尔线程无推送(最近 09-17);Sunrise 发布 0.1.14+sunrise.1.1.0
采用方(TileKernels、FlashQLA) 全周无推送(最近 04-23 / 09-18)
社区仓库 TPU 扩展、训练营材料、教学仓、SoftHier 各有更新
媒体与学术渠道 Google News / Hacker News / arXiv 全周零命中
  • 口径与边界:性能数据均为合入说明或 PR 正文自述(H100、H200 实测),本刊无对应硬件、未做独立复现;夜间基准为单次流水线记录,非横向评测;发布状态以各仓库发布元数据复核为准(截至本报告编制),TileRT 发布页滞后于发布 PR 属仓库侧发布流程节奏,不代表发布内容无效。
  • 下一期周期建议:2026-09-28 ~ 2026-10-02。

主要引用

数据来源:每日 TileLang 动态日报(2026-09-21 至 2026-09-25 共五期)及本周期实测核查;报告周期为 2026 年 9 月 21 日至 9 月 25 日。