调研窗口:过去 24 小时(2026-09-29 07:00 ~ 2026-09-30 07:00,北京时间;上次出报为 09-29,窗口无缝衔接、无重叠)。 信源:GitHub(tile-ai 组织 29 仓库推送核查,窗口内 7 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、tilelang-ascend、tilelang-hygon、TileFoundry、TileOPs.github.io;主仓 2 笔合入与 7 笔新开、TileOPs 17 笔合入、昇腾仓 2 笔修复、海光与 TileFoundry 各 1 笔合入、夜间快照 1 份零失败)、Google News RSS 中英文多组查询(走代理,零命中)、Hacker News、arXiv、社区仓库核查


本期索引

  • 今日重点:Ascend 950 后端公开释出——134 提交原生后端 PR 开出,0.1.15 版本号同步提升(09-30)
  • 一、核心项目进展
    • 1.1 主仓:Simplify 未用绑定消除器合入——读后写、副作用与元数据引用均有回归兜底(09-29)
    • 1.2 主仓:Windows wheel 构建恢复 ccache 命中——clang-cl 参数改分写(09-29)
    • 1.3 主仓队列:七笔新开与原子操作修复线,开放 PR 计 116 笔(09-29/09-30)
    • 1.4 TileOPs:INT8 量化与反量化四枚内核合入——逐位对齐 torch 参考(09-29/09-30)
    • 1.5 TileOPs:INT4 逐组量化内核合入,块量化两笔排队(09-30)
    • 1.6 TileOPs:采样算子层合入——上期排队六枚正式落账(09-29)
    • 1.7 TileOPs:注意力四笔——FP8 表达式下沉、varlen 出站转共享内存、SM89 头维 512 修复(09-29/09-30)
    • 1.8 TileOPs:内核接口与共享内存治理两笔(09-29)
    • 1.9 TileOPs:CI 与工程规范三笔——八并发冒烟、绝对导入、清单校验单次化(09-29/09-30)
    • 1.10 TileOPs:元素级提速两笔——除法回退按线程一次、f32 双 16 字节装载(09-29/09-30)
    • 1.11 夜间快照:正确性 1030 项、基准 1355 项,零失败零错误(09-30 凌晨)
  • 二、多后端适配(昇腾 / 沐曦 / 海光 / 摩尔线程)
    • 2.1 昇腾:950 发布分支窗口内再修——广播向量化与标量归约恢复(09-30)
    • 2.2 昇腾:ascend 仓两笔修复——TVM 一行补丁揭开回退真因(09-29)
    • 2.3 海光:异步拷贝与缓存 swizzle lowering 改进合入(09-29)
    • 2.4 沐曦 / 摩尔线程 / MLIR 昇腾:官方仓静默(09-30 核查)
  • 三、生态与采用方
    • 3.1 TileFoundry:AtomSched 第四阶段合入——HIR 降级 TIR 与调度 CLI(09-29)
    • 3.2 文档站:量化、采样与共享专家 MLP 算子进入 API 参考(09-30)
    • 3.3 采用方核查:TileKernels 与 FlashQLA 无窗口内推送(09-30)
    • 3.4 版本节奏:0.1.15 提升 PR 开出;TileRT 与 TileFoundry 发布页停滞(09-30)
  • 四、社区、教程与活动
    • 4.1 社区仓库核查:窗口内无新提交(09-30)
    • 4.2 媒体与学术侧:Google News 零命中,arXiv 无新预印本(09-30)
  • 五、趋势观察
    • 5.1 从契约到内核:量化族 48 小时完成兑现
    • 5.2 Ascend 950:多后端叙事从「适配仓」走向「主仓原生」
    • 5.3 工程承载力:测试量 +21% 下的 CI 重构
    • 5.4 空白与风险点
  • 附:素材与核查说明

今日重点:Ascend 950 后端公开释出——134 提交原生后端 PR 开出,0.1.15 版本号同步提升(09-30)

日期:2026-09-30 来源:Ascend 950 后端 PR(#3308)/ 版本提升 PR(#3309)/ 发布分支 ascend-950-0930

09-30 凌晨,TileLang 主仓连开两笔标志性 PR:标注「Public Release 9/30」的昇腾 950 原生后端与版本号提升至 0.1.15。前者以 134 提交、379 文件、+79956/-733 的体量,把昇腾线从独立适配仓推进为主仓的一等后端:

  • 端到端路径:新增 Ascend 语言方言,覆盖内核启动、内存分配、数据搬运与计算操作,含硬件特化 lower、自动调度与同步、设备代码生成、毕昇(Bisheng)编译与 NPU 运行时装载;用户以 target="ascend" 可直接开发 Ascend 950 内核。
  • 编程模型:单内核内组合 Cube(AIC)T.gemm 与 Vector(AIV)计算;T.SimdVF / T.SimtVF 区域混合 SIMD 与 SIMT 编程;UB / L1 / L0 显式分配;T.copy / T.dual_copy 分块搬运与跨核传输;含 MXFP8 / MXFP4 块缩放 GEMM 低精度路径。
  • 编译器与调度:昇腾分形布局的自动推断与存储归一化;AutoSchedule 做依赖与时延感知的 Cube/Vector 调度、流水与多缓冲;调度感知的核内与跨核同步插入,附带冗余同步消除、标志位自动分配与复用。
  • 构建集成:USE_ASCEND 构建开关、毕昇编译链、运行时加载与内核启动均入主仓;按既有后端接口接入多后端架构,复用共享编译器设施。
  • 评估口径(PR 内):对照 Torch NPU,以 BF16 GEMM、FP8 转换与 GQA 反向各 4 个形状评测;GEMM 与 GQA 报 TFLOP/s、FP8 转换报有效 GB/s。
  • 规模与署名:分支与 main 同步、领先 134 提交,窗口内仍在追加修复(最新提交恢复广播向量化与标量归约,09-30 凌晨);Co-author 计 10 位,含 2 位 deepseek.com 署名开发者。
  • 联动:同日开出的 0.1.15 版本提升 PR 仅改 VERSION 一行(0.1.14 至 0.1.15),与 950 后端相邻落账,是否同批发布待观察。

判读:若合并,昇腾 950 将首次以主仓原生后端形态落地(此前昇腾支持主要由独立适配仓承载),「多后端」从镜像仓适配升级为主干能力;对使用方,昇腾 950 的算子开发与 DeepGEMM 风格内核可直接用 TileLang 编写。风险面在于体量(379 文件、约 8 万行新增)带来的审查与合并后稳定性成本,且 NPU 侧性能目前仅有 PR 内图表的公开口径。


一、核心项目进展

1.1 主仓:Simplify 未用绑定消除器合入——读后写、副作用与元数据引用均有回归兜底(09-29)

日期:2026-09-29 来源:Simplify 未用绑定(#3293)

  • 上期新开条目本窗口合入:为 tl.Simplify 增加 UnusedBindRemover,当其值可在不丢弃相关副作用与 volatile 缓冲读取的前提下被舍弃时,反复移除未使用的 BindNode。
  • 边界规则:遍历反射字段与容器以保留被元数据引用的绑定;缓冲区定义与加载谓词中用到的绑定一律保留;回归用例覆盖未用宏绑定、读后写、副作用、volatile 读取、元数据引用与共享表达式节点。
  • 意义:tl.Simplify 的清理能力扩展与上周的模余数界修复(#3294)同向——变换层「敢删什么、必留什么」逐步写成可测试的明确清单。

1.2 主仓:Windows wheel 构建恢复 ccache 命中——clang-cl 参数改分写(09-29)

日期:2026-09-29 来源:Windows 构建修复(#3305)

  • 问题:Windows wheel 构建恢复 ccache 后仍反复重编 TVM——单次约 32 分钟、554 次未命中、命中率仅 20.63%,连续三晚夜构建同型。根因是 CMake 对 clang-cl 输出粘连式 -imsvc<path> 参数,ccache 4.9.1 将其计入预处理哈希,PEP 517 依赖目录一变缓存键就变;既有包装器可归一化预处理文本但去不掉命令行差异。
  • 修复:将 -imsvc <path> 改为分写形式,缓存键恢复稳定;同日创建并合入,评审批注自动摘要复核。

1.3 主仓队列:七笔新开与原子操作修复线,开放 PR 计 116 笔(09-29/09-30)

日期:2026-09-29、2026-09-30 来源:主仓 PR 列表/ 原子操作修复(#3307)/ DeepSelect 示例(#3304)/ 打包向量比较(#3303)

  • 窗口内新开 7 笔:#3303 为 FP16/BF16 打包向量比较(修缺陷单 #3302,掩码内建归一 0/1、NaN 正确的不等于,CUDA 12 以下与低算力保留标量回退);#3304 提交 DeepSeek DeepSelect Top-K 的 TileLang 示例(无内联 PTX,依赖在审的 #3303 与 #3296,在 RTX 5090 上对照 torch.topk 给出 129 组实测);#3306、#3307 为原子操作修复线(int64 原子 max/min 与 AtomicStore 的 int64/bf16/fp16 崩溃,可溯源至 #1716 的类型归一化;#3306 关闭未合入、#3307 接续在审);#3308、#3309 见今日重点。
  • 存量更新:SM120 寄存器 A GEMM(#3286)、z3 线程推断(#3291)、C 源导入换行(#3289)、popcount 扩展(#3300)等窗口内均有更新。
  • 队列温度:开放 PR 计 116 笔(上期 112 笔);本窗口合入 2 笔(#3293、#3305),「开多合少」格局延续。

1.4 TileOPs:INT8 量化与反量化四枚内核合入——逐位对齐 torch 参考(09-29/09-30)

日期:2026-09-29、2026-09-30 来源:逐张量反量化(#2304)/ 逐通道反量化(#2306)/ 逐张量量化(#2307)/ 逐通道量化(#2308)

  • 上期「先定契约、再落实现」进入内核兑现期:INT8 家族的量化与反量化共四枚算子层在内核侧落地,清单状态转 implemented,输出逐位对齐 torch 参考实现(含 scale 下溢为零的边界用例)。
  • 逐张量反量化(#2304):q 按扁平序列读取,每线程每步转一个 16 字节输出向量、每 64 线程块四步且先发全部加载;码点经指数偏置整数加法加 FADD 转换(绕开 I2F);块内输出先入共享内存再做批量写出(SM90 上走 cp.async.bulk);新增 L1 evict-last 加载辅助(streaming_load.h)。
  • 逐通道反量化(#2306):向量跨行时在两行尺度间选择,任意 K 单程序运行;逐通道量化(#2308):一个 CTA 独占一行、行内常驻寄存器,尺度用倒数加两次 FMA 正确舍入,行首行尾与邻行共享向量并做掩码。
  • 逐张量量化(#2307):单次协同启动完成——第一阶段读入并交换 amax 分片(网格级屏障),第二阶段量化出片;每次调用构建内核,显式声明编译边界。
  • 进度:量化族 9 枚 spec-only 条目中已有 7 枚进入内核实现(INT8 六枚 + INT4 一枚),FP8 逐块与 SmoothQuant 尚未见内核 PR。

1.5 TileOPs:INT4 逐组量化内核合入,块量化两笔排队(09-30)

日期:2026-09-30 来源:INT4 逐组量化(#2317)/ 逐块量化(#2316,在审)/ 逐块反量化(#2318,在审)

  • INT4 逐组量化落位两枚内核:packed_weight、weight_scale、weight_zero 与 torch 参考逐位相等,且采用 GemmW4A16FwdOp.repack 的打包格式——W4A16 权重链路的格式对齐是本次最实用的兼容点。
  • 内核要点:每 lane 持一个 32 元素块,128 元素 K 步内无需跨 lane 搬数;四乘四字转置出 16 字节连续存储;组尺寸支持 32 至 1024 的 2 的幂;另备行内核版本。
  • 在审两笔:INT8 逐块量化(#2316)与逐块反量化(#2318)——均沿用 #2304 的调度模板,补齐“张量/通道/块”三档的最后一块。

1.6 TileOPs:采样算子层合入——上期排队六枚正式落账(09-29)

日期:2026-09-29 来源:采样算子层(#2299)

  • 上期报告记为「排队待审」的六枚采样算子层(TopKMask、MinPMask、TopPMask、TopKTopPMask、SamplingFromProbs、ChainSpeculativeSampling)于 09-29 下午合入:算子层、工作负载与测试一次备齐,参考数值对齐 FlashInfer 0.6.16(bf16/fp16/fp32 三档),随机数用 Philox4x32-10 整数张量算术实现、与 Random123 已知答案向量一致。算子层仍为声明式(kernel_types = {}),内核实现待后续 PR。

1.7 TileOPs:注意力四笔——FP8 表达式下沉、varlen 出站转共享内存、SM89 头维 512 修复(09-29/09-30)

日期:2026-09-29、2026-09-30 来源:FP8 GQA 叶子算子(#2294)/ varlen 预填出站(#2313)/ SM89 头维 512(#2312)/ 滑窗用例分层(#2311)

  • FP8 GQA 下沉(#2294):输出累加器清零改用 T.clear、KV 尾部掩码表达为布局感知的 T.Parallel 循环,删除两处已无用的 CUDA 辅助;属 #2113 增量。评估过的 softcap 的 T.tanh 替换因回退被有意排除——保留近似 tanh 路径。
  • varlen 出站走 SMEM(#2313):varlen GQA 预填的输出不再从 acc_o 片段散列写出,而是经已失效的查询块共享缓冲整行 16 字节写出,零额外共享内存开销;部分块保留守卫式直写。
  • SM89 头维 512 修复(#2312):单 warpgroup 的 32 行块不再把分数块留在寄存器(此前布局推断冲突导致 block_m=32 候选从未编译成功);默认配置新增 32×16 候选(需 68 KiB,低于 SM89 上限)。
  • 测试分层(#2311):滑窗 varlen 的 8 个用例标记 SM90 专用——此前在 SM89 上是以失败出现而非跳过。

1.8 TileOPs:内核接口与共享内存治理两笔(09-29)

日期:2026-09-29 来源:内核接口与分派(#2300)/ 共享内存上限表(#2303)

  • 内核接口化(#2300):为算子声明内核接口,经单一查找分派——把「内核接口、实现、调用规格、可用性」等七个概念写进 ops-design 设计文档;替换实现按接口契约校验而非仅按键名,后端可在内建实现旁增补自己的实现。
  • 共享内存治理(#2303):共享内存上限收敛到统一表格;FP8 GEMM 声明 supported_archs = [90](SM89 调用被明确拒绝而非误选 TMA/WGMMA 内核);稀疏 MLA 对显存放不下的调用做下界评估后拒绝(如 SM86/SM89 上每块 64 头、d=512 需不低于 100 KB 超出 99 KB 上限的场景,此前会启动失败)。

1.9 TileOPs:CI 与工程规范三笔——八并发冒烟、绝对导入、清单校验单次化(09-29/09-30)

日期:2026-09-29、2026-09-30 来源:GPU 冒烟八并发(#2314)/ 绝对导入规范(#2310)/ 清单校验单次化(#2319)

  • 冒烟提速(#2314):PR 冒烟从单进程单卡改为八工作进程;签名检查惰性生成;并顺手修复 bs1 解码的屏障冲突。背景值得记录:主分支推送的测试数 4281 增至 5174(+21%)、pytest 耗时 324 秒增至 605 秒(+87%),增量主要来自清单体系的 CPU 工作而非内核测试。
  • 规范(#2310):src/tileops/ 全部导入改为绝对导入并用 ruff TID252 强制(ban-relative-imports = "all",234 文件重写);设计文档同步。
  • 清单校验(#2319):validate_manifest.py 每 PR 由三次跑改一次(GPU 冒烟中该测试占关键路径 22 至 32 秒),并让 FMA 饱和度量跟随被采样 GPU。

1.10 TileOPs:元素级提速两笔——除法回退按线程一次、f32 双 16 字节装载(09-29/09-30)

日期:2026-09-29、2026-09-30 来源:除法回退(#2305)/ f32 装载与 bool 存储(#2309)

  • 除法族(#2305):FloorDivide、Remainder 与 floor 模式 Div 在 #2291 改为逐位精确后回退 1.01 至 1.28 倍;现改为 fast_func 逐线程统一快判,仅在失败线程回读操作数执行精确回退,内核维持 32 寄存器上限;16 位快路径用 a * (1/b) 上推修正。
  • f32 装载(#2309):同形状二元核每线程改两次 16 字节装载(对齐 inductor 的 XBLOCK 1024 四 warp 形态);比较与逻辑类 bool 结果改按线程连续段一次存储——此前 1.002 至 1.006 倍于 torch-compile 的行由此收敛。

1.11 夜间快照:正确性 1030 项、基准 1355 项,零失败零错误(09-30 凌晨)

日期:2026-09-30 来源:快照提交 b8f4329a35/ 快照环境元数据

  • 窗口内 1 份快照(09-30 02:53,run 36608962204;对应 TileOPs 主分支 2ce972f98f,即 #2313 合入点):正确性 1030 项(跳过 2)零失败零错误;基准 1355 项(39 套件)零失败零错误。环境:H200、CUDA 13.2、torch 2.13、tilelang 0.1.11+cu132。
  • 与上一份(b7f5a1b4bd,正确性 1027、基准 1335)相比:正确性 +3、基准 +20;口径仍以「零失败」为准绳。注:本快照合入点早于量化内核批次(#2304 至 #2317),该批次的回归状态将体现在下一份快照。

二、多后端适配(昇腾 / 沐曦 / 海光 / 摩尔线程)

2.1 昇腾:950 发布分支窗口内再修——广播向量化与标量归约恢复(09-30)

日期:2026-09-30 来源:发布分支 ascend-950-0930

  • 发布分支在本窗口收到最新修复提交(09-30 凌晨,提交 39691ebaac):恢复广播向量化与标量归约——「Public Release 9/30」PR 在窗口内的最新修复之一;分支与 main 同步、领先 134 提交,主 PR 仍开放。技术构成详见今日重点。

2.2 昇腾:ascend 仓两笔修复——TVM 一行补丁揭开回退真因(09-29)

日期:2026-09-29 来源:TVM 回溯越界补丁(#1846)/ CI 子模块清理(#1847)

  • 回退真因水落石出(#1846):给固定的 TVM 子模块加一行补丁,修复 TVM 生成错误调用栈时的越界读(std::string tmp(symname, symsize) 改为单参数构造)。背景是上期报告记录的「#1829 合入 4 天后被整笔回退」:9 个期望抛 tvm.error.InternalError 的编译器负例在 x86 runner 上稳定 SIGSEGV、在 ARM runner 上稳定通过;同机单变量 A/B 实验表明崩溃来自这一 TVM 缺陷,与 #1829 的逻辑无关。补丁沿用既有 apply_tvm_patches.sh 机制(三个构建入口自动应用、已应用者跳过、未来不适用时构建直接报错而非静默)。
  • CI 清理(#1847):自托管 runner 上 actions/checkout 不清子模块、git submodule update 又只在 commit 变化时切指针,导致上一 PR 打进 TVM 的补丁泄漏进后续所有构建(#1846 的构建即因残留报补丁无法应用);修复为构建前重置子模块。
  • 判读:#1829 被回退并非其自身缺陷——被回退特性是否按干净基线重提,是接下来的观察点。

2.3 海光:异步拷贝与缓存 swizzle lowering 改进合入(09-29)

日期:2026-09-29 来源:海光异步拷贝(#13)/ 合入提交 145fc5a8e7

  • 上期记录的开放 PR 本窗口合入(9 文件 +497/-41):改进异步拷贝与缓存 swizzle 的 lowering。改动集中在 codegen_hcu(+121/-29)、op/copy.cc(+269/-8)、tl_templates/hcu/copy.h(+47)与 amd_buffer_addressing.hpp(+20),另有 GEMM 的 LDS 策略微调;Co-authored 署名 Teng Huang。海光是本期国产后端中除昇腾外唯一有代码推进的一家。

2.4 沐曦 / 摩尔线程 / MLIR 昇腾:官方仓静默(09-30 核查)

日期:2026-09-30 来源:沐曦仓库/ 摩尔线程仓库/ MLIR 昇腾仓库

  • 沐曦(上次推送 09-24)、摩尔线程(09-17)、MLIR 昇腾(09-24)官方仓窗口内均无推送;社区侧亦无新提交。国产后端本周热度集中在昇腾(950 后端 + 两笔修复)与海光(#13 合入)。

三、生态与采用方

3.1 TileFoundry:AtomSched 第四阶段合入——HIR 降级 TIR 与调度 CLI(09-29)

日期:2026-09-29 来源:AtomSched 第四阶段(#192)/ TileFoundry 仓库

  • 体量 99 文件 +4885/-2885 的阶段性合入:新增 ConvertHIRToTIR 模块级 pass,把编写好的调度 HIR 降级为经校验的 TIR;新增 tilefoundry schedule finalize / facts / candidates 三组 CLI 报表,并移除被否决的 matched 工作流。
  • 设计取向:IR 声明与访问关系成为唯一事实源,删除重复的问题计划、预扫描、推断分布与手写访问器;报表清单、排序、模式渲染与 HIR/TIR 候选配对改为共享反射与中性注册表。处于「声明驱动调度」路线的收口阶段。

3.2 文档站:量化、采样与共享专家 MLP 算子进入 API 参考(09-30)

日期:2026-09-30 来源:文档站更新(#57)

  • TileOPs 文档站在量化、采样与共享专家 MLP 算子合入后同步更新 API 参考——与 #2299、#2304 至 #2317 的算子上线节奏保持同日跟进。

3.3 采用方核查:TileKernels 与 FlashQLA 无窗口内推送(09-30)

日期:2026-09-30 来源:TileKernels 仓库/ FlashQLA 仓库

  • DeepSeek TileKernels 仍停于 2026-04;Qwen FlashQLA 上次推送为 09-28(上窗口,已报 SM100 tcgen05),本窗口无新提交。两家采用方的公开动态均处间歇期。

3.4 版本节奏:0.1.15 提升 PR 开出;TileRT 与 TileFoundry 发布页停滞(09-30)

日期:2026-09-30 来源:主仓发布页/ TileRT 发布页/ TileFoundry 发布页

  • 主仓 v0.1.14(09-02 发布)已满 28 天,0.1.15 版本提升 PR 于本窗口开出(见今日重点),正式 release 尚未见;TileOPs 无独立发布。
  • TileRT 发布页仍停 v0.1.5.post2(上期所述 v0.1.6 发布 PR 合入后未见正式出版);TileFoundry 最新仍为 v0.0.2(09-10)。

四、社区、教程与活动

4.1 社区仓库核查:窗口内无新提交(09-30)

日期:2026-09-30 来源:社区教程仓库/ 算能 BM1690 流水线仓库/ S5000 性能分析工具/ tvm_tilelang_cookbook

  • 四家社区仓库(tilelang-tutorials、bm1690-pipelines、Tilelang_musa、tvm_tilelang_cookbook)窗口内均无新提交;cookbook 仅有 chart 分支的星标历史自动推送(非实质动态,不计)。上期报告的教程站 CPU 示例与 BM1690 流水线进展为本期之前内容,不重复展开。

4.2 媒体与学术侧:Google News 零命中,arXiv 无新预印本(09-30)

日期:2026-09-30 来源:Google News/ Hacker News/ arXiv

  • Google News RSS 中英文多组查询(走代理)24 小时窗口内零命中;「昇腾 950」「Ascend 950」的中英文命中均为窗口前的股市与宏观稿件,与 TileLang 后端发布无直接关联(发布标注 9/30,媒体尚未跟进)。Hacker News 窗口条目与本主题无关;arXiv 检索「tilelang」最新仍为 07-24 的 TileSight。

五、趋势观察

5.1 从契约到内核:量化族 48 小时完成兑现

上期报告的观察点是「本批算子层尚无内核,后续看内核落地节奏」。不到 48 小时,量化族 9 枚中 7 枚已进入内核实现:INT8 四枚合入且逐位对齐 torch 参考,INT4 逐组一枚合入并对齐 W4A16 打包格式,INT8 逐块两枚在审。单批 PR 的说明范式也已成型——逐笔注明与参考实现的逐位一致性、编译边界、清单状态与拒绝语义,「先证明正确、再谈性能」。按此节奏,剩余 FP8 逐块与 SmoothQuant 两枚的落地是下一观察窗口的看点。

5.2 Ascend 950:多后端叙事从「适配仓」走向「主仓原生」

昇腾 950 后端以 379 文件、约 8 万行新增的 PR 直投主仓,且与 0.1.15 版本提升同日开出——TileLang 的「多后端」正在从镜像仓适配升级为主干能力,对标基线也直接选择华为自家的 Torch NPU。署名中可见 deepseek.com 邮件与多位社区核心开发者共 10 人 Co-author,说明昇腾线是多方协同的整建制投入,而非单点适配。需要冷静看待的是:PR 尚未合入、体量巨大、性能数据目前仅有 PR 内图表口径;合入后的主线稳定性与跟进维护成本将是更长周期的观察点。

5.3 工程承载力:测试量 +21% 下的 CI 重构

主分支测试数 4281 增至 5174(+21%)、pytest 耗时 +87%,增量主要来自清单体系的 CPU 侧工作——这正是「200 算子、契约先行」策略的直接成本。当日回应是三项工程化:GPU 冒烟八并发、签名检查惰性化、清单校验单次化(去掉每 PR 两轮重复校验)。能力扩张期把 CI 从「够用」重铸为「扛规模」,是这一周被低估的基建叙事。

5.4 空白与风险点

其一,多后端分化继续:沐曦(09-24 后)、摩尔线程(09-17 后)、MLIR 昇腾(09-24 后)静默,热度集中于昇腾与海光;其二,主仓「开多合少」未逆转——本窗口合入 2 笔、新开 7 笔,开放 PR 达 116 笔,审查带宽仍是瓶颈,昇腾 950 大 PR 的合入节奏将直接检验这一点;其三,#1829 被回退特性的重提、0.1.15 正式出版与 TileRT v0.1.6 发布页补票均悬而未决;其四,量化与采样式内核的验证目前以逐位对齐与单机基准为限,端到端模型精度影响尚无公开验证。


附:素材与核查说明

信源 核查结果
tile-ai 组织(29 仓库) 窗口内 7 个仓库有推送:tilelang(2 合入、7 新开)、TileOPs(17 合入)、TileOPs-nightly(1 份快照)、tilelang-ascend(2 合入)、tilelang-hygon(1 合入)、TileFoundry(1 合入)、TileOPs.github.io(1 笔)
主仓 tilelang 合入 #3293、#3305;新开 #3303 至 #3309 计 7 笔(#3306 关闭未合入);开放 PR 计 116 笔;发布分支与版本提升分支窗口内活跃
TileOPs 17 笔合入(#2299 至 #2319 区间);同窗口新开 17 笔;在审 4 笔(#2172、#2315、#2316、#2318);量化族为主角
tvm(同组织子模块仓) 窗口内无提交
TileOPs-nightly 1 份快照 b8f4329a35:正确性 1030 项(跳过 2)零失败零错误;基准 1355 项(39 套件)零失败零错误
TileOPs.github.io 1 笔(#57 量化、采样与 MLP 算子入 API 参考)
国产后端五仓 昇腾:950 发布 PR #3308 与 ascend 仓两笔修复;海光:#13 合入;沐曦(09-24 后)、摩尔线程(09-17 后)、MLIR 昇腾(09-24 后)无活动
采用方与社区 TileKernels、FlashQLA 无窗口内推送;四家社区仓库无新提交(cookbook 仅自动化分支推送)
Google News / Hacker News / arXiv 中英文查询零命中(昇腾 950 命中均为窗口前股市与宏观稿);HN 与本主题无关;arXiv 最新仍为 07-24 TileSight

完整信源清单