调研窗口:过去 24 小时(2026-09-28 07:00 ~ 2026-09-29 07:00,北京时间;上次出报为 09-28,窗口无缝衔接、无重叠)。 信源:GitHub(tile-ai 组织 29 仓库推送核查,窗口内 7 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、tvm、tilelang-hygon、TileOPs.github.io、tilelang-ascend;TileOPs 14 笔合入、主仓 2 笔合入与 TVM 子模块跟进、夜间快照 1 份零失败;采用方 FlashQLA 与社区仓库有更新)、Google News RSS 中英文多组查询(走代理,零命中)、Hacker News、arXiv、社区仓库核查


本期索引

  • 今日重点:TileOPs 量化族先落实现层——九枚算子层一夜合入,采样族六枚同日排队(09-28/09-29)
  • 一、核心项目进展
    • 1.1 主仓:TVM 尾护栏修复——模余数边界倒置可致越界读,实靶复现后合入(09-28)
    • 1.2 主仓:默认单配置构建加 -O2——lowering 几何均值提速 1.19 倍,库体积减半(09-28)
    • 1.3 主仓队列:新开五笔与三单更新,开放 PR 计 112 笔(09-28)
    • 1.4 TileOPs:静默错误内核集中修复,十余处「返回结果但不报错」一并处置(09-29 凌晨)
    • 1.5 TileOPs:注意力整编续章——MHA 与 GQA 分页解码合一、反向 WS 内核合入(09-28)
    • 1.6 TileOPs:reduction 与 norm 批量提速六笔(09-28)
    • 1.7 TileOPs:工程化两笔——源码迁入 csrc、守卫豁免清理(09-28)
    • 1.8 夜间快照:正确性 1027 项、基准 1335 项,零失败零错误(09-29 凌晨)
  • 二、多后端适配(昇腾 / MLIR 昇腾 / 沐曦 / 海光 / 摩尔线程)
    • 2.1 海光:异步拷贝与缓存 swizzle lowering 改进进入评审(09-28)
    • 2.2 昇腾:上周合入特性被整笔回退,主仓新增 ascend-0930 分支(09-28/09-29)
    • 2.3 沐曦 / 摩尔线程:官方仓静默,社区侧 S5000 性能工具更新(09-28)
    • 2.4 社区侧:算能 BM1690 TPU 流水线适配开出新仓库(09-28)
  • 三、生态与采用方
    • 3.1 采用方:FlashQLA 迁移 SM100 tcgen05,prepare_h 实测 1.43 倍(09-28)
    • 3.2 采用方核查:TileKernels 无推送、TileFoundry 无窗口内提交(09-29 核查)
    • 3.3 版本节奏:v0.1.14 满 27 天,TileRT 发布页滞后 5 天(09-29)
  • 四、社区、教程与活动
    • 4.1 社区教程:tilelang-tutorials 更新 CPU 示例(09-29)
    • 4.2 文档站:TileOPs 文档站两笔与删并同步(09-28)
    • 4.3 媒体与学术侧:Google News 零命中,arXiv 无新预印本(09-29 核查)
  • 五、趋势观察
    • 5.1 契约先行的执行期:24 小时内从 spec-only 到算子层
    • 5.2 静默错误与「内核区域」:一次治理集中欠账
    • 5.3 编译器健全性开始与上游联动
    • 5.4 空白与风险点
  • 附:素材与核查说明

今日重点:TileOPs 量化族先落实现层——九枚算子层一夜合入,采样族六枚同日排队(09-28/09-29)

日期:2026-09-28、2026-09-29 来源:量化算子层六枚(#2298)/ INT8 反量化算子层(#2297)/ 采样算子层(#2299)/ 200 算子跟踪议题(#2271)

09-27 深夜开出 24 条 spec-only 条目与 200 算子计划之后不到 24 小时,TileOPs 开始把「契约」逐一兑现为「算子层」,节奏如下:

  • 量化族六枚先合入(#2298,09-29 06:54 合入,+798/-78,16 文件):INT8 逐张量、逐通道、逐块量化、FP8 逐块量化、INT4 逐组量化与 SmoothQuant,共六枚算子层(命名自 INT8QuantPerTensorFwdOp 到 SmoothQuantFwdOp)落位 tileops.quantization;每枚 kernel_types = {}——调用先跑生成式检查,随后抛 OpNotAvailableError(已声明、待实现)。新增 QuantizeCall(rows, cols, dtype, group_size);参考实现自测试文件迁入 workloads/quantization.py,测试改为调用同一份数学。清单同时写明工程约束:INT4 分组与 GEMM W4A16 要求 K % 128 == 0(打包序按 128 元素步长定义)、INT4 组语义逐条给出(零点区间 [0, 15]、尺度取最小正规数下限、按 torch.ao 与 AWQ 方式量化);与 vLLM scaled_int8_quant、per_token_group_quant_int8、DeepGEMM per_block_cast_to_fp8 的每一处差异都显式记录。
  • INT8 反量化三枚跟进(#2297,09-29 06:20 合入,+431/-29,11 文件):INT8 逐张量、逐通道、逐块三种反量化算子层(INT8DequantPerTensorFwdOp 等三枚 FwdOp)同日落地,条目标注保持 spec-only;参考实现 (q.float() * scale).to(out_dtype) 与 torch 三种 dequantize 逐位一致;per-block 末块按 ceil_div(K, 128) 的尺度形状处理,并记录与 SGLang 实现的差异。
  • 采样族六枚同日排队(#2299,开放,+1065/-151,28 文件):TopKMask、MinPMask、TopPMask、TopKTopPMask、SamplingFromProbs、ChainSpeculativeSampling 的算子层、工作负载与测试一次备齐;参考实现对齐 FlashInfer 0.6.16(bf16/fp16/fp32 三档),随机数用 Philox4x32-10 做整数张量确定性实现(Random123 已知答案向量对齐);并修正了旧 top-p 参考的边界并列处理(8 行内 76 个 bf16 token 结果不同)。
  • 语境:#2279 开出的 24 条 spec-only 条目(量化 9、采样 6、MLA/KV 7、norm 与线性注意力各 1)中,量化 9 枚已全部进入算子层、采样 6 枚进入 PR 待审——「先定契约、再落实现」进入稳定执行节奏。

判读:算子层先行的收益是把「接口、工作负载、参考数值、拒绝行为」先行冻结,内核实现可逐个跟进而不再改动对外契约;对使用方,OpNotAvailableError 给出清晰的能力边界。注意本批算子层均未含内核实现,首个内核合入前不产生可用性能;后续关注点为内核落地节奏与 K % 128 等形状约束对模型接入的影响。


一、核心项目进展

1.1 主仓:TVM 尾护栏修复——模余数边界倒置可致越界读,实靶复现后合入(09-28)

日期:2026-09-28 来源:#3294/ TVM 侧修复(#77)

  • 问题:动态归约 B * 192 元素、128 线程时,(192 * B + 127) % 128 被界分析给出倒置区间 [127, 63](正确应为 [63, 127]),tl.Simplify 据此可能误证 i * 128 + threadIdx.x < B * 192 恒真并删掉尾部护栏;B = 1 时末 64 线程本应跳过第二轮,护栏被删会读到下一层甚至最后一层之外——实际在 aux-loss 显示内核上观测到。
  • 修复:#3294 将 3rdparty/tvm 子模块从 907a88c879 前移至 4211874e9e(仅含该界修复与其 TVM 回归),并加一笔便携回归用例(直接构造 TIR、不假设 B > 0)。验证:transform 相关测试 48 项通过、reducer v2 76 项通过、TVM 侧 110 项通过(8 xfail);B300 上 aux-loss 复现的 48 种参数组合全部通过。
  • 意义:「编译器健全性缺陷 → 实靶复现 → 上游修复 → 子模块前移 + 回归兜底」的完整闭环样本;同一子模块仓库(tile-ai/tvm)的修复提交 #77 把「模余数界有序且可靠」写进 TVM 核心。

1.2 主仓:默认单配置构建加 -O2——lowering 几何均值提速 1.19 倍,库体积减半(09-28)

日期:2026-09-28 来源:#3191

  • 变更:无显式构建类型时,单配置 CMake 构建为 TileLang 对象编译加 -O2;显式 Debug/Release 与多配置生成器维持原样(1 文件 +10/-0)。
  • 实测(178 个示例):lowering 总耗时 1548.8 → 1376.0 秒,几何均值 1.186 倍、中位 1.161 倍;168/178 个示例 lowering 提速超 5%、无一例回退超 5%;完整内核编译几何均值 1.053 倍。附带效果:libtilelang.so 由 43.5 MB 缩至 18.9 MB。
  • 背景:该笔同时使 #3180 的编译器性能回归用例提速约 5 倍(几何均值),编译链路的「默认参数不如手工参数」问题收敛。

1.3 主仓队列:新开五笔与三单更新,开放 PR 计 112 笔(09-28)

日期:2026-09-28 来源:主仓 PR 列表/ #3296/ #3297/ #3299/ #3300/ #3293

  • 窗口内新开 5 笔(均为小步修复):#3293 为 tl.Simplify 增加未用绑定消除器(含读后写、副作用、volatile、元数据引用等回归);#3296 修复 bulk TMA 拷贝的对齐与缓存提示(对应缺陷单 #3295);#3297 支持 uint8 稀疏 GEMM 操作数;#3299 修复 ROCm 上 T.round 的 ties-to-even 舍入;#3300 增加 CUDA int32 popcount 支持。
  • 缺陷与需求侧:窗口内 3 单更新——#3295(bulk TMA 缓存提示编译失败、共享内存过度对齐降低占用)、#3292(METAL 上 T.copy 默认 coalesced_width 跨步问题)、#3298(apache-tvm-ffi 0.1.13 支持请求)。
  • 队列温度:开放 PR 计 112 笔;上期延续队列(RNG 四笔 #3241~#3244、异步暂存 #3279、TileIR 后端 #3247、魔法除法 #3267、SIMT im2col #3275)窗口内均未更新;另有一笔旧 PR(#3187,vec 整数 bitwise_not 崩溃修复)窗口内关闭未合入。

1.4 TileOPs:静默错误内核集中修复,十余处「返回结果但不报错」一并处置(09-29 凌晨)

日期:2026-09-28、2026-09-29 来源:#2291

  • 规模:单笔 +2456/-1161、116 文件,一次修复十余处算出错误结果却不报错的内核:MLA 解码尾头与空缓存、CountNonzero 超 2^24、FloorDivide/Remainder/Div(floor 与 trunc 语义)、MoePermuteAlign 超 1024 专家、TopkSelector 溢出、SSD d_state 分片、Conv「same」奇数填充、FP8 稠密预填充因果、GLA 分片、整数均值累加器;MLA 解码在空缓存下改为按 torch 行为返回零。
  • 治理三件套:① SM90 专用用例改用 @pytest.mark.sm90(26 个函数、5 个文件),手工能力检查退场——SKIP 不再能掩盖 SM90 上的失败;② 内核、基准计时与预热插件不再从环境变量取配置(新增 lint 规则禁止在源码/工作负载/基准中读环境),改为显式入参并进入构建标识;③ 内核上限从散落各处收敛为「内核区域」一次声明,超界调用以「无实现服务该调用」拒绝——配置、拒绝与缓存行为至此一致可复现。
  • 配套:bench_kernel 增事件回退开关;空输出调用按空返回;需要 CUDA 的用例补齐标记。

1.5 TileOPs:注意力整编续章——MHA 与 GQA 分页解码合一、反向 WS 内核合入(09-28)

日期:2026-09-28 来源:#2296/ #2295/ #2281/ 议题 #2293

  • 解码合一(#2296,+588/-1156):GQADecodePagedKernel 同时服务 MHA 与 GQA 两条分页解码算子,MHADecodePagedKernel 整体删除;MHA 侧接口、清单条目与算子计数不变;顺带修复 GQA 读到缓存外非有限值时的 NaN 与 sm_scale=0 时掩码键仍获权重两个问题。测试节点 5047 → 5048;对外基准(H200,device_busy):serving 四行 1.34~1.76 倍于 flashinfer。
  • WS 内核修复与扩面(#2295,+454/-425):#2273 引入的逐行守卫曾拖慢四个单 token 行最多 20%,改为仅在整块粒度守边块后恢复;warp 特化内核开始服务多查询行(受 B*H*S_q*N_kv*D <= 2^27 工作量约束),推测解码场景由 25.46 微秒降至 6.27 微秒(对比 FA3 的 14.88 微秒为 2.37 倍),四条 serving 行 1.40~1.90 倍于对照。
  • 反向内核(#2281,+806/-486):MHA 反向在 SM90 上进入新持久化 warp 特化内核,头维 128、按 128 行键块切分的调用提速 2.08~4.21 倍;每次调用启动数 8 → 3;修复流水线中 WGMMA 串行化与 Q/dO 暂存过早释放两处问题;MultiHeadAttentionBwdOp 删除(并入 GQA 反向直服 MHA);基准脚本改为只计反向(此前混计前反向)。

1.6 TileOPs:reduction 与 norm 批量提速六笔(09-28)

日期:2026-09-28 来源:#2290/ #2292/ #2289/ #2287/ #2284/ #2286

  • 归约引擎重建(#2290,+1436/-1294):前导轴 prod 改为就地归约、不再转置输入——[4, 128, 4096](dim=0)由 469 微秒降至 3.3 微秒(对照 torch-compile 3.2 微秒);新增 16 字节流式加载头(L1/L2 evict-first 缓存策略);单寄存器折叠行内核同服 sum/mean/amax/amin/prod 与 L1/L2/Inf 范数,mlp-intermediate 各行由 28.6~30.1 微秒降至 24.8~25.1 微秒(对照 torch-compile 24.4~25.4)。
  • 其余五笔:#2292 logsumexp 跨 lane 折叠分裂统计并保持 torch 的 inf 语义;#2289 逻辑归约按输入自身字节宽一次寄存器折叠;#2287 InstanceNorm 训练态由 20 次启动收敛为 1 次(image-track-stats 27.28 → 2.62 微秒),舍入与 torch 对齐(此前差 1 ulp);#2284 BatchNorm 反向直接索引调用方布局(resnet-stage3 15.5 → 4.9 微秒、1.86 倍),并修复 split 统计越块累加导致的 NaN(形状如 (3, 5, 300, 301));#2286 RMSNorm 短行共享块、仅寄存器内补零。

1.7 TileOPs:工程化两笔——源码迁入 csrc、守卫豁免清理(09-28)

日期:2026-09-28 来源:#2285/ #2288

  • #2285 把 C++/CUDA 源码整体迁入 src/tileops/csrc(构建布局归一);#2288 移除守卫豁免清单并顺手修复其掩盖的问题——失败面不再被白名单稀释。

1.8 夜间快照:正确性 1027 项、基准 1335 项,零失败零错误(09-29 凌晨)

日期:2026-09-29 来源:快照提交 b7f5a1b4bd47/ 快照环境元数据

  • 窗口内 1 份快照(09-29 04:11,run 36462093045;对应 TileOPs fa8acf71b9,即 #2291 合入点):正确性 1027 项(跳过 2)零失败零错误;基准 1335 项(38 个套件)零失败零错误。环境:H200、CUDA 13.2、torch 2.13、tilelang 0.1.11+cu132。
  • 与上一份(09-28 凌晨,1093/1318)相比:正确性计数 -66、基准 +17——计数变化与本周多笔测试重构和豁免清理相伴,两份均零失败;跟踪口径以「零失败」为准绳,计数不直接代表覆盖增减。

二、多后端适配(昇腾 / MLIR 昇腾 / 沐曦 / 海光 / 摩尔线程)

2.1 海光:异步拷贝与缓存 swizzle lowering 改进进入评审(09-28)

日期:2026-09-28 来源:hygon PR #13/ 分支提交 4bf3ac58c4

  • 海光线在 09-24 合入 #12 后转入分支开发:feat/hcu-async-copy-cache-swizzle 分支新增提交(作者 Teng Huang,16:29),改进异步拷贝与缓存 swizzle 的 lowering;对应 PR #13 同日更新、仍开放。海光是本期国产后端中唯一有代码推进的一家。

2.2 昇腾:上周合入特性被整笔回退,主仓新增 ascend-0930 分支(09-28/09-29)

日期:2026-09-28、2026-09-29 来源:回退 PR #1841/ 被回退特性 #1829/ tilelang 主仓

  • 09:44 合入整笔回退(+3621/-10333,84 文件),撤回 #1829(09-24 合入的「编译器托管 AscendC Vector mask 与 FP32 行归约优化」,原 +10333/-3621)——该特性合入 4 天后整体撤回,公开记录未附回退说明。
  • 另:主仓 09-29 凌晨新建 ascend-0930 分支(作者 LeiWang1999)——昇腾相关开发动向,登记为观察项。

2.3 沐曦 / 摩尔线程:官方仓静默,社区侧 S5000 性能工具更新(09-28)

日期:2026-09-28 来源:tilelang-metax/ tilelang-musa/ Tilelang_musa 社区仓

  • 沐曦(最近推送 09-24)、摩尔线程(09-17)官方仓窗口内无推送。社区侧摩尔线程方向有动作:Rankf/Tilelang_musa 整理 TileSight 与 TileLang-MUSA 源码并移除生成物(09-28 15:33);其自述为「基于 DeepStack 引擎的 MTT S5000 算子级性能分析框架」,服务手工算子优化与 Agent 算子评估两类场景,含 P0~P7 校准文档 30 篇、脚本 64 个、基准 24 个。

2.4 社区侧:算能 BM1690 TPU 流水线适配开出新仓库(09-28)

日期:2026-09-28 来源:tilelang-tpu-bm1690-pipelines/ 迁移与验证说明

  • 新仓库(创建于 09-28,窗口内 8 笔提交):在既有 tilelang-tpu 开发基础上,为 SOPHGO BM1690 / SG2260E 打造六类算子(Elementwise、RMSNorm、RoPE、SwiGLU、Matmul、FlashAttention)的流水线版本;支持 BM1690 八核 TPU-Kernel 与 SG2260E 的 RV Tensor 两个编程模型,编译、CModel 与 PCIe 执行走统一 PPL 1.7 工具链。
  • 方法学值得注意:CModel 只验证数值行为,「CModel 墙钟时长不是 BM1690 性能」被显式写明;每步以受控运行器(进程数、120 秒超时、4096 MiB 内存上限约束)产出证据;窗口内提交覆盖 FP16 matmul 1024³ CModel 验证与各算子流水线化(SSA 安全嵌套循环、双缓冲描述符)等,板卡实测待远程硬件环境就绪后进行。

三、生态与采用方

3.1 采用方:FlashQLA 迁移 SM100 tcgen05,prepare_h 实测 1.43 倍(09-28)

日期:2026-09-28 来源:PR #42/ FlashQLA 仓库

  • Qwen 的 FlashQLA(基于 TileLang 的 GDN 线性注意力内核库)合入面向 Blackwell 数据中心档的优化:prepare_h 的 CP 状态转移递推(M、Z)从消费者组 T.gemm 迁到 MMA warp 的 tcgen05 管线、M 常驻 TMEM;寄存器上限由 168/160/160/24 重配为 152/104/104/152;store_h=False 时提前一拍发布同步与左状态半部。
  • 实测(B200,24 个 CP 活跃行):prepare_h 延迟 153.8 → 107.5 微秒(1.43 倍、-30.1%);正确性门 48/48 特化逐位一致,前向集成 15/15 与 42/42 行逐位一致。采用方已从 SM90/103/120 适配推进到 SM100 tcgen05 深度利用。

3.2 采用方核查:TileKernels 无推送、TileFoundry 无窗口内提交(09-29 核查)

日期:2026-09-29 来源:TileKernels/ TileFoundry

  • DeepSeek TileKernels 仍停于 2026-04;TileFoundry 最近推送为 09-28 凌晨(上期窗口,已报 AtomSched 系列),本窗口无新提交。

3.3 版本节奏:v0.1.14 满 27 天,TileRT 发布页滞后 5 天(09-29)

日期:2026-09-29 来源:tilelang 发布页/ TileRT 发布页/ TileFoundry 发布页

  • 主仓 v0.1.14(09-02)满 27 天无新版;TileOPs 无独立发布;TileRT 的 v0.1.6 发布 PR 于 09-24 合入但发布页与标签仍停 v0.1.5.post2(滞后 5 天);TileFoundry 最新仍为 v0.0.2(09-10)。

四、社区、教程与活动

4.1 社区教程:tilelang-tutorials 更新 CPU 示例(09-29)

日期:2026-09-29 来源:tilelang-tutorials

  • 社区教程仓库 easy-tilelang/tilelang-tutorials 更新 CPU 示例(09-29 00:17);该仓含 00_basic / 01_tvm / 02_tilelang / 03_tilelang_cpu / 04_tilelang_ascend / 05_tilelang_work 六组笔记本,其中 CPU JIT 与昇腾 lowering/compile/JIT 示例对平台上手有参考价值。

4.2 文档站:TileOPs 文档站两笔与删并同步(09-28)

日期:2026-09-28 来源:文档站 PR #55/ PR #56

  • 两笔:按注解后的 __all__ 生成文档并移除已删的 GQA 算子(#55);注意力 API 页撤下已删除的 MultiHeadAttentionBwdOp(#56)——与 #2296/#2281 的删并动作同步。

4.3 媒体与学术侧:Google News 零命中,arXiv 无新预印本(09-29 核查)

日期:2026-09-29 来源:Google News/ Hacker News/ arXiv

  • Google News RSS 中英文多组查询(走代理)24 小时窗口内有价值条目零命中(抓取到的 9 条候选均为 GitHub 仓库本体或无关内容);Hacker News 窗口条目与本主题无关;arXiv 检索「tilelang」最新仍为 07-24 的 TileSight(瓦片中心 GPU 性能模型),无新预印本。

五、趋势观察

5.1 契约先行的执行期:24 小时内从 spec-only 到算子层

昨天开出 24 条 spec-only 条目与 200 算子计划,今天量化 9 枚(合入)与采样 6 枚(排队)就走完「算子层 + 工作负载 + 参考数值 + 拒绝行为」的完整封装,且边界语义逐条对照 vLLM / FlashInfer / DeepGEMM。说明 Manifest 体系已把契约检验点工程化到可流水线产出;下一步观察点是内核实现能否以同样节奏兑现(本批算子层尚无内核)。

5.2 静默错误与「内核区域」:一次治理集中欠账

#2291 一笔修复十余处 silent-wrong(从 MLA 尾头到整数均值累加器)——这类问题最隐蔽:结果错误但不抛错、测试通过、基准正常。与「内核上限收敛为区域声明」「环境变量退出内核路径」「守卫豁免退场」合看,TileOPs 正把「内核在什么条件下正确」从散落代码改为可机器核查的声明;这也是 200 算子计划能对外给出覆盖承诺的技术底座。

5.3 编译器健全性开始与上游联动

#3294 的修复链条(实靶复现 → 子模块仓库修复 #77 → 子模块前移 + 便携回归)表明主仓对「编译器静默改语义」类缺陷的响应路径已成型;对依赖 TileLang 的下游(含各家后端 fork)而言,子模块级修复的跟进节奏将直接决定其获得的健全性水平。

5.4 空白与风险点

其一,多后端线条分化:海光在分支上持续演进、昇腾整笔回退且无说明、沐曦与摩尔线程官方侧继续静默(摩尔线程已 12 天),国产后端进度差异扩大;其二,注意力反向线与解码线同日完成「删并」,但推测解码等场景相对 FA3 仍有单行 0.75 倍的差距(#2296 基准表);其三,主仓开放 PR 计 112 笔,RNG 四笔、异步暂存与 TileIR 等大单多日未动,消化能力与审查带宽仍是瓶颈;其四,主仓本窗口合入 2 笔、新开 5 笔,「开多合少」格局未逆转。


附:素材与核查说明

信源 核查结果
tile-ai 组织(29 仓库) 窗口内 7 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、tvm、tilelang-hygon、TileOPs.github.io、tilelang-ascend
主仓 tilelang 2 笔合入(#3294、#3191);新开 5 笔(#3293、#3296、#3297、#3299、#3300);开放 PR 计 112 笔;缺陷单 #3292、#3295 与需求单 #3298 窗口内更新
TileOPs 14 笔合入(#2281 至 #2298 区间);另有 #2279、#2283 两笔在本窗口开始后 7~29 分钟内完成落账(内容已在上期报告,不重复展开);开放 PR 计 5 笔(#2172、#2294、#2299、#2300、#2301);议题 #2293 随 #2296 关闭
tvm(同组织子模块仓) 1 笔合入(#77 模余数界修复,与主仓 #3294 联动)
TileOPs-nightly 1 份快照 b7f5a1b4bd47:正确性 1027 项(跳过 2)零失败零错误;基准 1335 项零失败零错误
TileOPs.github.io 2 笔(#55、#56 文档与删并同步)
国产后端五仓 昇腾:回退 #1841(撤回 #1829);海光:分支提交 + PR #13 更新;沐曦(09-24 后)、摩尔线程(09-17 后)、MLIR 昇腾(09-24 后)无活动
采用方与社区 FlashQLA 合入 #42(SM100 tcgen05);TileKernels 无推送;社区仓 tilelang-tutorials、Tilelang_musa、bm1690-pipelines 有更新
Google News / Hacker News / arXiv 中英文查询零命中;HN 与本主题无关;arXiv 无新预印本(最新仍为 07-24 TileSight)

完整信源清单