TileLang 每日动态报告(2026-09-29)
调研窗口:过去 24 小时(2026-09-28 07:00 ~ 2026-09-29 07:00,北京时间;上次出报为 09-28,窗口无缝衔接、无重叠)。 信源:GitHub(tile-ai 组织 29 仓库推送核查,窗口内 7 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、tvm、tilelang-hygon、TileOPs.github.io、tilelang-ascend;TileOPs 14 笔合入、主仓 2 笔合入与 TVM 子模块跟进、夜间快照 1 份零失败;采用方 FlashQLA 与社区仓库有更新)、Google News RSS 中英文多组查询(走代理,零命中)、Hacker News、arXiv、社区仓库核查
本期索引
- 今日重点:TileOPs 量化族先落实现层——九枚算子层一夜合入,采样族六枚同日排队(09-28/09-29)
- 一、核心项目进展
- 1.1 主仓:TVM 尾护栏修复——模余数边界倒置可致越界读,实靶复现后合入(09-28)
- 1.2 主仓:默认单配置构建加 -O2——lowering 几何均值提速 1.19 倍,库体积减半(09-28)
- 1.3 主仓队列:新开五笔与三单更新,开放 PR 计 112 笔(09-28)
- 1.4 TileOPs:静默错误内核集中修复,十余处「返回结果但不报错」一并处置(09-29 凌晨)
- 1.5 TileOPs:注意力整编续章——MHA 与 GQA 分页解码合一、反向 WS 内核合入(09-28)
- 1.6 TileOPs:reduction 与 norm 批量提速六笔(09-28)
- 1.7 TileOPs:工程化两笔——源码迁入 csrc、守卫豁免清理(09-28)
- 1.8 夜间快照:正确性 1027 项、基准 1335 项,零失败零错误(09-29 凌晨)
- 二、多后端适配(昇腾 / MLIR 昇腾 / 沐曦 / 海光 / 摩尔线程)
- 2.1 海光:异步拷贝与缓存 swizzle lowering 改进进入评审(09-28)
- 2.2 昇腾:上周合入特性被整笔回退,主仓新增 ascend-0930 分支(09-28/09-29)
- 2.3 沐曦 / 摩尔线程:官方仓静默,社区侧 S5000 性能工具更新(09-28)
- 2.4 社区侧:算能 BM1690 TPU 流水线适配开出新仓库(09-28)
- 三、生态与采用方
- 3.1 采用方:FlashQLA 迁移 SM100 tcgen05,prepare_h 实测 1.43 倍(09-28)
- 3.2 采用方核查:TileKernels 无推送、TileFoundry 无窗口内提交(09-29 核查)
- 3.3 版本节奏:v0.1.14 满 27 天,TileRT 发布页滞后 5 天(09-29)
- 四、社区、教程与活动
- 4.1 社区教程:tilelang-tutorials 更新 CPU 示例(09-29)
- 4.2 文档站:TileOPs 文档站两笔与删并同步(09-28)
- 4.3 媒体与学术侧:Google News 零命中,arXiv 无新预印本(09-29 核查)
- 五、趋势观察
- 5.1 契约先行的执行期:24 小时内从 spec-only 到算子层
- 5.2 静默错误与「内核区域」:一次治理集中欠账
- 5.3 编译器健全性开始与上游联动
- 5.4 空白与风险点
- 附:素材与核查说明
今日重点:TileOPs 量化族先落实现层——九枚算子层一夜合入,采样族六枚同日排队(09-28/09-29)
日期:2026-09-28、2026-09-29 来源:量化算子层六枚(#2298)/ INT8 反量化算子层(#2297)/ 采样算子层(#2299)/ 200 算子跟踪议题(#2271)
09-27 深夜开出 24 条 spec-only 条目与 200 算子计划之后不到 24 小时,TileOPs 开始把「契约」逐一兑现为「算子层」,节奏如下:
- 量化族六枚先合入(#2298,09-29 06:54 合入,+798/-78,16 文件):INT8 逐张量、逐通道、逐块量化、FP8 逐块量化、INT4 逐组量化与 SmoothQuant,共六枚算子层(命名自
INT8QuantPerTensorFwdOp到SmoothQuantFwdOp)落位tileops.quantization;每枚kernel_types = {}——调用先跑生成式检查,随后抛OpNotAvailableError(已声明、待实现)。新增QuantizeCall(rows, cols, dtype, group_size);参考实现自测试文件迁入workloads/quantization.py,测试改为调用同一份数学。清单同时写明工程约束:INT4 分组与 GEMM W4A16 要求K % 128 == 0(打包序按 128 元素步长定义)、INT4 组语义逐条给出(零点区间 [0, 15]、尺度取最小正规数下限、按 torch.ao 与 AWQ 方式量化);与 vLLMscaled_int8_quant、per_token_group_quant_int8、DeepGEMMper_block_cast_to_fp8的每一处差异都显式记录。 - INT8 反量化三枚跟进(#2297,09-29 06:20 合入,+431/-29,11 文件):INT8 逐张量、逐通道、逐块三种反量化算子层(
INT8DequantPerTensorFwdOp等三枚FwdOp)同日落地,条目标注保持 spec-only;参考实现(q.float() * scale).to(out_dtype)与 torch 三种 dequantize 逐位一致;per-block 末块按ceil_div(K, 128)的尺度形状处理,并记录与 SGLang 实现的差异。 - 采样族六枚同日排队(#2299,开放,+1065/-151,28 文件):
TopKMask、MinPMask、TopPMask、TopKTopPMask、SamplingFromProbs、ChainSpeculativeSampling的算子层、工作负载与测试一次备齐;参考实现对齐 FlashInfer 0.6.16(bf16/fp16/fp32 三档),随机数用 Philox4x32-10 做整数张量确定性实现(Random123 已知答案向量对齐);并修正了旧 top-p 参考的边界并列处理(8 行内 76 个 bf16 token 结果不同)。 - 语境:#2279 开出的 24 条 spec-only 条目(量化 9、采样 6、MLA/KV 7、norm 与线性注意力各 1)中,量化 9 枚已全部进入算子层、采样 6 枚进入 PR 待审——「先定契约、再落实现」进入稳定执行节奏。
判读:算子层先行的收益是把「接口、工作负载、参考数值、拒绝行为」先行冻结,内核实现可逐个跟进而不再改动对外契约;对使用方,OpNotAvailableError 给出清晰的能力边界。注意本批算子层均未含内核实现,首个内核合入前不产生可用性能;后续关注点为内核落地节奏与 K % 128 等形状约束对模型接入的影响。
一、核心项目进展
1.1 主仓:TVM 尾护栏修复——模余数边界倒置可致越界读,实靶复现后合入(09-28)
日期:2026-09-28 来源:#3294/ TVM 侧修复(#77)
- 问题:动态归约
B * 192元素、128 线程时,(192 * B + 127) % 128被界分析给出倒置区间[127, 63](正确应为[63, 127]),tl.Simplify据此可能误证i * 128 + threadIdx.x < B * 192恒真并删掉尾部护栏;B = 1 时末 64 线程本应跳过第二轮,护栏被删会读到下一层甚至最后一层之外——实际在 aux-loss 显示内核上观测到。 - 修复:#3294 将
3rdparty/tvm子模块从907a88c879前移至4211874e9e(仅含该界修复与其 TVM 回归),并加一笔便携回归用例(直接构造 TIR、不假设 B > 0)。验证:transform 相关测试 48 项通过、reducer v2 76 项通过、TVM 侧 110 项通过(8 xfail);B300 上 aux-loss 复现的 48 种参数组合全部通过。 - 意义:「编译器健全性缺陷 → 实靶复现 → 上游修复 → 子模块前移 + 回归兜底」的完整闭环样本;同一子模块仓库(tile-ai/tvm)的修复提交 #77 把「模余数界有序且可靠」写进 TVM 核心。
1.2 主仓:默认单配置构建加 -O2——lowering 几何均值提速 1.19 倍,库体积减半(09-28)
日期:2026-09-28 来源:#3191
- 变更:无显式构建类型时,单配置 CMake 构建为 TileLang 对象编译加
-O2;显式 Debug/Release 与多配置生成器维持原样(1 文件 +10/-0)。 - 实测(178 个示例):lowering 总耗时 1548.8 → 1376.0 秒,几何均值 1.186 倍、中位 1.161 倍;168/178 个示例 lowering 提速超 5%、无一例回退超 5%;完整内核编译几何均值 1.053 倍。附带效果:
libtilelang.so由 43.5 MB 缩至 18.9 MB。 - 背景:该笔同时使 #3180 的编译器性能回归用例提速约 5 倍(几何均值),编译链路的「默认参数不如手工参数」问题收敛。
1.3 主仓队列:新开五笔与三单更新,开放 PR 计 112 笔(09-28)
日期:2026-09-28 来源:主仓 PR 列表/ #3296/ #3297/ #3299/ #3300/ #3293
- 窗口内新开 5 笔(均为小步修复):#3293 为
tl.Simplify增加未用绑定消除器(含读后写、副作用、volatile、元数据引用等回归);#3296 修复 bulk TMA 拷贝的对齐与缓存提示(对应缺陷单 #3295);#3297 支持 uint8 稀疏 GEMM 操作数;#3299 修复 ROCm 上T.round的 ties-to-even 舍入;#3300 增加 CUDA int32 popcount 支持。 - 缺陷与需求侧:窗口内 3 单更新——#3295(bulk TMA 缓存提示编译失败、共享内存过度对齐降低占用)、#3292(METAL 上
T.copy默认 coalesced_width 跨步问题)、#3298(apache-tvm-ffi 0.1.13 支持请求)。 - 队列温度:开放 PR 计 112 笔;上期延续队列(RNG 四笔 #3241~#3244、异步暂存 #3279、TileIR 后端 #3247、魔法除法 #3267、SIMT im2col #3275)窗口内均未更新;另有一笔旧 PR(#3187,vec 整数 bitwise_not 崩溃修复)窗口内关闭未合入。
1.4 TileOPs:静默错误内核集中修复,十余处「返回结果但不报错」一并处置(09-29 凌晨)
日期:2026-09-28、2026-09-29 来源:#2291
- 规模:单笔 +2456/-1161、116 文件,一次修复十余处算出错误结果却不报错的内核:MLA 解码尾头与空缓存、CountNonzero 超 2^24、FloorDivide/Remainder/Div(floor 与 trunc 语义)、MoePermuteAlign 超 1024 专家、TopkSelector 溢出、SSD d_state 分片、Conv「same」奇数填充、FP8 稠密预填充因果、GLA 分片、整数均值累加器;MLA 解码在空缓存下改为按 torch 行为返回零。
- 治理三件套:① SM90 专用用例改用
@pytest.mark.sm90(26 个函数、5 个文件),手工能力检查退场——SKIP 不再能掩盖 SM90 上的失败;② 内核、基准计时与预热插件不再从环境变量取配置(新增 lint 规则禁止在源码/工作负载/基准中读环境),改为显式入参并进入构建标识;③ 内核上限从散落各处收敛为「内核区域」一次声明,超界调用以「无实现服务该调用」拒绝——配置、拒绝与缓存行为至此一致可复现。 - 配套:
bench_kernel增事件回退开关;空输出调用按空返回;需要 CUDA 的用例补齐标记。
1.5 TileOPs:注意力整编续章——MHA 与 GQA 分页解码合一、反向 WS 内核合入(09-28)
日期:2026-09-28 来源:#2296/ #2295/ #2281/ 议题 #2293
- 解码合一(#2296,+588/-1156):
GQADecodePagedKernel同时服务 MHA 与 GQA 两条分页解码算子,MHADecodePagedKernel整体删除;MHA 侧接口、清单条目与算子计数不变;顺带修复 GQA 读到缓存外非有限值时的 NaN 与sm_scale=0时掩码键仍获权重两个问题。测试节点 5047 → 5048;对外基准(H200,device_busy):serving 四行 1.34~1.76 倍于 flashinfer。 - WS 内核修复与扩面(#2295,+454/-425):#2273 引入的逐行守卫曾拖慢四个单 token 行最多 20%,改为仅在整块粒度守边块后恢复;warp 特化内核开始服务多查询行(受
B*H*S_q*N_kv*D <= 2^27工作量约束),推测解码场景由 25.46 微秒降至 6.27 微秒(对比 FA3 的 14.88 微秒为 2.37 倍),四条 serving 行 1.40~1.90 倍于对照。 - 反向内核(#2281,+806/-486):MHA 反向在 SM90 上进入新持久化 warp 特化内核,头维 128、按 128 行键块切分的调用提速 2.08~4.21 倍;每次调用启动数 8 → 3;修复流水线中 WGMMA 串行化与 Q/dO 暂存过早释放两处问题;
MultiHeadAttentionBwdOp删除(并入 GQA 反向直服 MHA);基准脚本改为只计反向(此前混计前反向)。
1.6 TileOPs:reduction 与 norm 批量提速六笔(09-28)
日期:2026-09-28 来源:#2290/ #2292/ #2289/ #2287/ #2284/ #2286
- 归约引擎重建(#2290,+1436/-1294):前导轴 prod 改为就地归约、不再转置输入——
[4, 128, 4096](dim=0)由 469 微秒降至 3.3 微秒(对照 torch-compile 3.2 微秒);新增 16 字节流式加载头(L1/L2 evict-first 缓存策略);单寄存器折叠行内核同服 sum/mean/amax/amin/prod 与 L1/L2/Inf 范数,mlp-intermediate 各行由 28.6~30.1 微秒降至 24.8~25.1 微秒(对照 torch-compile 24.4~25.4)。 - 其余五笔:#2292 logsumexp 跨 lane 折叠分裂统计并保持 torch 的 inf 语义;#2289 逻辑归约按输入自身字节宽一次寄存器折叠;#2287 InstanceNorm 训练态由 20 次启动收敛为 1 次(image-track-stats 27.28 → 2.62 微秒),舍入与 torch 对齐(此前差 1 ulp);#2284 BatchNorm 反向直接索引调用方布局(resnet-stage3 15.5 → 4.9 微秒、1.86 倍),并修复 split 统计越块累加导致的 NaN(形状如 (3, 5, 300, 301));#2286 RMSNorm 短行共享块、仅寄存器内补零。
1.7 TileOPs:工程化两笔——源码迁入 csrc、守卫豁免清理(09-28)
- #2285 把 C++/CUDA 源码整体迁入
src/tileops/csrc(构建布局归一);#2288 移除守卫豁免清单并顺手修复其掩盖的问题——失败面不再被白名单稀释。
1.8 夜间快照:正确性 1027 项、基准 1335 项,零失败零错误(09-29 凌晨)
日期:2026-09-29 来源:快照提交 b7f5a1b4bd47/ 快照环境元数据
- 窗口内 1 份快照(09-29 04:11,run 36462093045;对应 TileOPs
fa8acf71b9,即 #2291 合入点):正确性 1027 项(跳过 2)零失败零错误;基准 1335 项(38 个套件)零失败零错误。环境:H200、CUDA 13.2、torch 2.13、tilelang 0.1.11+cu132。 - 与上一份(09-28 凌晨,1093/1318)相比:正确性计数 -66、基准 +17——计数变化与本周多笔测试重构和豁免清理相伴,两份均零失败;跟踪口径以「零失败」为准绳,计数不直接代表覆盖增减。
二、多后端适配(昇腾 / MLIR 昇腾 / 沐曦 / 海光 / 摩尔线程)
2.1 海光:异步拷贝与缓存 swizzle lowering 改进进入评审(09-28)
日期:2026-09-28 来源:hygon PR #13/ 分支提交 4bf3ac58c4
- 海光线在 09-24 合入 #12 后转入分支开发:
feat/hcu-async-copy-cache-swizzle分支新增提交(作者 Teng Huang,16:29),改进异步拷贝与缓存 swizzle 的 lowering;对应 PR #13 同日更新、仍开放。海光是本期国产后端中唯一有代码推进的一家。
2.2 昇腾:上周合入特性被整笔回退,主仓新增 ascend-0930 分支(09-28/09-29)
日期:2026-09-28、2026-09-29 来源:回退 PR #1841/ 被回退特性 #1829/ tilelang 主仓
- 09:44 合入整笔回退(+3621/-10333,84 文件),撤回 #1829(09-24 合入的「编译器托管 AscendC Vector mask 与 FP32 行归约优化」,原 +10333/-3621)——该特性合入 4 天后整体撤回,公开记录未附回退说明。
- 另:主仓 09-29 凌晨新建
ascend-0930分支(作者 LeiWang1999)——昇腾相关开发动向,登记为观察项。
2.3 沐曦 / 摩尔线程:官方仓静默,社区侧 S5000 性能工具更新(09-28)
日期:2026-09-28 来源:tilelang-metax/ tilelang-musa/ Tilelang_musa 社区仓
- 沐曦(最近推送 09-24)、摩尔线程(09-17)官方仓窗口内无推送。社区侧摩尔线程方向有动作:
Rankf/Tilelang_musa整理 TileSight 与 TileLang-MUSA 源码并移除生成物(09-28 15:33);其自述为「基于 DeepStack 引擎的 MTT S5000 算子级性能分析框架」,服务手工算子优化与 Agent 算子评估两类场景,含 P0~P7 校准文档 30 篇、脚本 64 个、基准 24 个。
2.4 社区侧:算能 BM1690 TPU 流水线适配开出新仓库(09-28)
日期:2026-09-28 来源:tilelang-tpu-bm1690-pipelines/ 迁移与验证说明
- 新仓库(创建于 09-28,窗口内 8 笔提交):在既有 tilelang-tpu 开发基础上,为 SOPHGO BM1690 / SG2260E 打造六类算子(Elementwise、RMSNorm、RoPE、SwiGLU、Matmul、FlashAttention)的流水线版本;支持 BM1690 八核 TPU-Kernel 与 SG2260E 的 RV Tensor 两个编程模型,编译、CModel 与 PCIe 执行走统一 PPL 1.7 工具链。
- 方法学值得注意:CModel 只验证数值行为,「CModel 墙钟时长不是 BM1690 性能」被显式写明;每步以受控运行器(进程数、120 秒超时、4096 MiB 内存上限约束)产出证据;窗口内提交覆盖 FP16 matmul 1024³ CModel 验证与各算子流水线化(SSA 安全嵌套循环、双缓冲描述符)等,板卡实测待远程硬件环境就绪后进行。
三、生态与采用方
3.1 采用方:FlashQLA 迁移 SM100 tcgen05,prepare_h 实测 1.43 倍(09-28)
日期:2026-09-28 来源:PR #42/ FlashQLA 仓库
- Qwen 的 FlashQLA(基于 TileLang 的 GDN 线性注意力内核库)合入面向 Blackwell 数据中心档的优化:
prepare_h的 CP 状态转移递推(M、Z)从消费者组T.gemm迁到 MMA warp 的 tcgen05 管线、M 常驻 TMEM;寄存器上限由 168/160/160/24 重配为 152/104/104/152;store_h=False时提前一拍发布同步与左状态半部。 - 实测(B200,24 个 CP 活跃行):
prepare_h延迟 153.8 → 107.5 微秒(1.43 倍、-30.1%);正确性门 48/48 特化逐位一致,前向集成 15/15 与 42/42 行逐位一致。采用方已从 SM90/103/120 适配推进到 SM100 tcgen05 深度利用。
3.2 采用方核查:TileKernels 无推送、TileFoundry 无窗口内提交(09-29 核查)
日期:2026-09-29 来源:TileKernels/ TileFoundry
- DeepSeek TileKernels 仍停于 2026-04;TileFoundry 最近推送为 09-28 凌晨(上期窗口,已报 AtomSched 系列),本窗口无新提交。
3.3 版本节奏:v0.1.14 满 27 天,TileRT 发布页滞后 5 天(09-29)
日期:2026-09-29 来源:tilelang 发布页/ TileRT 发布页/ TileFoundry 发布页
- 主仓 v0.1.14(09-02)满 27 天无新版;TileOPs 无独立发布;TileRT 的 v0.1.6 发布 PR 于 09-24 合入但发布页与标签仍停 v0.1.5.post2(滞后 5 天);TileFoundry 最新仍为 v0.0.2(09-10)。
四、社区、教程与活动
4.1 社区教程:tilelang-tutorials 更新 CPU 示例(09-29)
日期:2026-09-29 来源:tilelang-tutorials
- 社区教程仓库
easy-tilelang/tilelang-tutorials更新 CPU 示例(09-29 00:17);该仓含 00_basic / 01_tvm / 02_tilelang / 03_tilelang_cpu / 04_tilelang_ascend / 05_tilelang_work 六组笔记本,其中 CPU JIT 与昇腾 lowering/compile/JIT 示例对平台上手有参考价值。
4.2 文档站:TileOPs 文档站两笔与删并同步(09-28)
日期:2026-09-28 来源:文档站 PR #55/ PR #56
- 两笔:按注解后的
__all__生成文档并移除已删的 GQA 算子(#55);注意力 API 页撤下已删除的MultiHeadAttentionBwdOp(#56)——与 #2296/#2281 的删并动作同步。
4.3 媒体与学术侧:Google News 零命中,arXiv 无新预印本(09-29 核查)
日期:2026-09-29 来源:Google News/ Hacker News/ arXiv
- Google News RSS 中英文多组查询(走代理)24 小时窗口内有价值条目零命中(抓取到的 9 条候选均为 GitHub 仓库本体或无关内容);Hacker News 窗口条目与本主题无关;arXiv 检索「tilelang」最新仍为 07-24 的 TileSight(瓦片中心 GPU 性能模型),无新预印本。
五、趋势观察
5.1 契约先行的执行期:24 小时内从 spec-only 到算子层
昨天开出 24 条 spec-only 条目与 200 算子计划,今天量化 9 枚(合入)与采样 6 枚(排队)就走完「算子层 + 工作负载 + 参考数值 + 拒绝行为」的完整封装,且边界语义逐条对照 vLLM / FlashInfer / DeepGEMM。说明 Manifest 体系已把契约检验点工程化到可流水线产出;下一步观察点是内核实现能否以同样节奏兑现(本批算子层尚无内核)。
5.2 静默错误与「内核区域」:一次治理集中欠账
#2291 一笔修复十余处 silent-wrong(从 MLA 尾头到整数均值累加器)——这类问题最隐蔽:结果错误但不抛错、测试通过、基准正常。与「内核上限收敛为区域声明」「环境变量退出内核路径」「守卫豁免退场」合看,TileOPs 正把「内核在什么条件下正确」从散落代码改为可机器核查的声明;这也是 200 算子计划能对外给出覆盖承诺的技术底座。
5.3 编译器健全性开始与上游联动
#3294 的修复链条(实靶复现 → 子模块仓库修复 #77 → 子模块前移 + 便携回归)表明主仓对「编译器静默改语义」类缺陷的响应路径已成型;对依赖 TileLang 的下游(含各家后端 fork)而言,子模块级修复的跟进节奏将直接决定其获得的健全性水平。
5.4 空白与风险点
其一,多后端线条分化:海光在分支上持续演进、昇腾整笔回退且无说明、沐曦与摩尔线程官方侧继续静默(摩尔线程已 12 天),国产后端进度差异扩大;其二,注意力反向线与解码线同日完成「删并」,但推测解码等场景相对 FA3 仍有单行 0.75 倍的差距(#2296 基准表);其三,主仓开放 PR 计 112 笔,RNG 四笔、异步暂存与 TileIR 等大单多日未动,消化能力与审查带宽仍是瓶颈;其四,主仓本窗口合入 2 笔、新开 5 笔,「开多合少」格局未逆转。
附:素材与核查说明
| 信源 | 核查结果 |
|---|---|
| tile-ai 组织(29 仓库) | 窗口内 7 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、tvm、tilelang-hygon、TileOPs.github.io、tilelang-ascend |
| 主仓 tilelang | 2 笔合入(#3294、#3191);新开 5 笔(#3293、#3296、#3297、#3299、#3300);开放 PR 计 112 笔;缺陷单 #3292、#3295 与需求单 #3298 窗口内更新 |
| TileOPs | 14 笔合入(#2281 至 #2298 区间);另有 #2279、#2283 两笔在本窗口开始后 7~29 分钟内完成落账(内容已在上期报告,不重复展开);开放 PR 计 5 笔(#2172、#2294、#2299、#2300、#2301);议题 #2293 随 #2296 关闭 |
| tvm(同组织子模块仓) | 1 笔合入(#77 模余数界修复,与主仓 #3294 联动) |
| TileOPs-nightly | 1 份快照 b7f5a1b4bd47:正确性 1027 项(跳过 2)零失败零错误;基准 1335 项零失败零错误 |
| TileOPs.github.io | 2 笔(#55、#56 文档与删并同步) |
| 国产后端五仓 | 昇腾:回退 #1841(撤回 #1829);海光:分支提交 + PR #13 更新;沐曦(09-24 后)、摩尔线程(09-17 后)、MLIR 昇腾(09-24 后)无活动 |
| 采用方与社区 | FlashQLA 合入 #42(SM100 tcgen05);TileKernels 无推送;社区仓 tilelang-tutorials、Tilelang_musa、bm1690-pipelines 有更新 |
| Google News / Hacker News / arXiv | 中英文查询零命中;HN 与本主题无关;arXiv 无新预印本(最新仍为 07-24 TileSight) |
完整信源清单
- [1] 主仓 TVM 尾护栏修复(#3294) — https://github.com/tile-ai/tilelang/pull/3294
- [2] TVM 模余数界修复(#77) — https://github.com/tile-ai/tvm/pull/77
- [3] 主仓构建 -O2(#3191) — https://github.com/tile-ai/tilelang/pull/3191
- [4] 主仓 Simplify 未用绑定(#3293) — https://github.com/tile-ai/tilelang/pull/3293
- [5] 主仓 bulk TMA 对齐修复(#3296) — https://github.com/tile-ai/tilelang/pull/3296
- [6] 主仓 TMA 缺陷单(#3295) — https://github.com/tile-ai/tilelang/issues/3295
- [7] 主仓 uint8 稀疏 GEMM(#3297) — https://github.com/tile-ai/tilelang/pull/3297
- [8] 主仓 ROCm 舍入修复(#3299) — https://github.com/tile-ai/tilelang/pull/3299
- [9] 主仓 int32 popcount(#3300) — https://github.com/tile-ai/tilelang/pull/3300
- [10] 主仓 METAL 缺陷单(#3292) — https://github.com/tile-ai/tilelang/issues/3292
- [11] 主仓 tvm-ffi 需求单(#3298) — https://github.com/tile-ai/tilelang/issues/3298
- [12] 主仓 z3 线程推断(#3291) — https://github.com/tile-ai/tilelang/pull/3291
- [13] 主仓 bitwise_not 修复(#3187,关闭未合入) — https://github.com/tile-ai/tilelang/pull/3187
- [14] 主仓 PR 列表 — https://github.com/tile-ai/tilelang/pulls
- [15] 主仓发布页 — https://github.com/tile-ai/tilelang/releases
- [16] TileOPs 量化算子层六枚(#2298) — https://github.com/tile-ai/TileOPs/pull/2298
- [17] TileOPs INT8 反量化算子层(#2297) — https://github.com/tile-ai/TileOPs/pull/2297
- [18] TileOPs 采样算子层(#2299) — https://github.com/tile-ai/TileOPs/pull/2299
- [19] TileOPs 内核槽接口化(#2300) — https://github.com/tile-ai/TileOPs/pull/2300
- [20] TileOPs varlen GQA hd512(#2301) — https://github.com/tile-ai/TileOPs/pull/2301
- [21] TileOPs FP8 GQA 叶子算子(#2294) — https://github.com/tile-ai/TileOPs/pull/2294
- [22] TileOPs GEMM epilogue(#2172) — https://github.com/tile-ai/TileOPs/pull/2172
- [23] TileOPs 静默错误批量修复(#2291) — https://github.com/tile-ai/TileOPs/pull/2291
- [24] TileOPs 单内核分页解码(#2296) — https://github.com/tile-ai/TileOPs/pull/2296
- [25] TileOPs 分页解码修正(#2295) — https://github.com/tile-ai/TileOPs/pull/2295
- [26] TileOPs MHA 反向 WS 内核(#2281) — https://github.com/tile-ai/TileOPs/pull/2281
- [27] TileOPs 解码单内核议题(#2293) — https://github.com/tile-ai/TileOPs/issues/2293
- [28] TileOPs reduction 就地 prod(#2290) — https://github.com/tile-ai/TileOPs/pull/2290
- [29] TileOPs logsumexp 折叠(#2292) — https://github.com/tile-ai/TileOPs/pull/2292
- [30] TileOPs 逻辑归约折叠(#2289) — https://github.com/tile-ai/TileOPs/pull/2289
- [31] TileOPs InstanceNorm 单启动(#2287) — https://github.com/tile-ai/TileOPs/pull/2287
- [32] TileOPs BatchNorm 反向(#2284) — https://github.com/tile-ai/TileOPs/pull/2284
- [33] TileOPs RMSNorm 短行(#2286) — https://github.com/tile-ai/TileOPs/pull/2286
- [34] TileOPs csrc 迁移(#2285) — https://github.com/tile-ai/TileOPs/pull/2285
- [35] TileOPs 守卫豁免清理(#2288) — https://github.com/tile-ai/TileOPs/pull/2288
- [36] TileOPs 校准匹配(#2283,上期内容、本期落账) — https://github.com/tile-ai/TileOPs/pull/2283
- [37] TileOPs spec-only 条目(#2279,上期内容、本期落账) — https://github.com/tile-ai/TileOPs/pull/2279
- [38] TileOPs 200 算子跟踪议题(#2271) — https://github.com/tile-ai/TileOPs/issues/2271
- [39] TileOPs PR 列表 — https://github.com/tile-ai/TileOPs/pulls
- [40] 夜间快照提交(b7f5a1b4bd47) — https://github.com/tile-ai/TileOPs-nightly/commit/b7f5a1b4bd47
- [41] 快照环境元数据 — https://github.com/tile-ai/TileOPs-nightly/blob/snapshots/meta.json
- [42] 海光异步拷贝 PR(#13) — https://github.com/tile-ai/tilelang-hygon/pull/13
- [43] 海光分支提交(4bf3ac58c4) — https://github.com/tile-ai/tilelang-hygon/commit/4bf3ac58c4
- [44] 昇腾回退 PR(#1841) — https://github.com/tile-ai/tilelang-ascend/pull/1841
- [45] 昇腾被回退特性(#1829) — https://github.com/tile-ai/tilelang-ascend/pull/1829
- [46] 沐曦仓库 — https://github.com/tile-ai/tilelang-metax
- [47] 摩尔线程仓库 — https://github.com/tile-ai/tilelang-musa
- [48] MLIR 昇腾仓库 — https://github.com/tile-ai/tilelang-mlir-ascend
- [49] 社区 S5000 性能分析工具 — https://github.com/Rankf/Tilelang_musa
- [50] 算能 BM1690 流水线仓库 — https://github.com/arcflute/tilelang-tpu-bm1690-pipelines
- [51] BM1690 迁移与验证说明 — https://github.com/arcflute/tilelang-tpu-bm1690-pipelines/blob/main/docs/bm1690-pipelines.md
- [52] tilelang-tpu 上游仓库 — https://github.com/xwhzz/tilelang-tpu
- [53] 社区教程仓库 — https://github.com/easy-tilelang/tilelang-tutorials
- [54] FlashQLA SM100 优化(#42) — https://github.com/QwenLM/FlashQLA/pull/42
- [55] FlashQLA 仓库 — https://github.com/QwenLM/FlashQLA
- [56] TileKernels 仓库 — https://github.com/deepseek-ai/TileKernels
- [57] TileRT 发布页 — https://github.com/tile-ai/TileRT/releases
- [58] TileFoundry 发布页 — https://github.com/tile-ai/TileFoundry/releases
- [59] TileOPs 文档站笔一(#55) — https://github.com/tile-ai/TileOPs.github.io/pull/55
- [60] TileOPs 文档站笔二(#56) — https://github.com/tile-ai/TileOPs.github.io/pull/56
- [61] TileOPs 文档站 — https://github.com/tile-ai/TileOPs.github.io
- [62] Google News RSS(中英文查询,走代理) — https://news.google.com/
- [63] Hacker News 检索 — https://hn.algolia.com/
- [64] arXiv 检索 — https://arxiv.org/