TileLang 每日动态报告(2026-09-18)
调研窗口:过去 24 小时(2026-09-17 07:00 ~ 2026-09-18 07:00,北京时间)。上一期为试运行,窗口取在 09-16 19:23 ~ 09-17 19:23,与本窗口在 09-17 白天部分重叠;重叠部分本期只做状态说明与后续进展,重点放在窗口内新开、新合入的内容。 信源:GitHub(tile-ai 组织 28 个仓库推送时间全量核查,窗口内 9 个仓库有推送;主仓窗口内新开 PR 与缺陷单逐条复核,含 RNG 缺陷拆分、GEMM 类型白名单、CuTeDSL 侧 FP4 修复;TileOPs、TileOPs-nightly、tilelang-hygon、tilelang-ascend、tilelang-metax、tilelang-musa 的分支、提交与回移植分支逐条核对)、Google News RSS 中英文多组查询(走代理)、Hacker News、arXiv、媒体报道(NeoTeo 关于 DeepSeek 内核自动化与 TileKernels 的报道)
本期索引
- 今日重点:TileOPs 批矩阵乘改用共享 GEMM 模板,H200 上最高提速 1.44 倍(09-17)
- 一、核心项目进展
- 1.1 主仓 RNG 三处缺陷拆分修复:默认随机序列、void 结果绑定、缺初始化不报错(09-17)
- 1.2 不支持的 GEMM 类型组合提前拦截,不再落到 nvcc 的类型断言(09-17)
- 1.3 CuTeDSL 后端 FP4 转换与存储修复,DeepSeek V4 激活量化仍卡在 FP8 阶段(09-17)
- 1.4 分块量化 GEMM 的 API 文档与指令级变体上线(09-17)
- 1.5 前一期已报内容的状态说明(09-17)
- 二、多后端适配(昇腾 / 沐曦 / 海光 / 摩尔线程)
- 2.1 昇腾:每日回归 1925 项全通过,算子面推进延续(09-17/09-18)
- 2.2 海光:MLS 地址重基与异步流水正式合入,并回移植到版本分支(09-17)
- 2.3 沐曦:异步拷贝 GEMM 入库后转入分支维护(09-17)
- 2.4 摩尔线程:回移植分支承载 MUSA 5.3.0 文档,主分支自 09-11 起静止(09-17)
- 三、生态与采用方
- 3.1 TileOPs 清单化:复合算子、资源与可空输出进入 manifest(09-17)
- 3.2 TileOPs 文档站跟进统一分派与新的编译边界(09-17)
- 3.3 夜间基准与正确性快照:基准 1039 项中 1 项失败,正确性 1117 项全通过(09-17)
- 3.4 媒体:DeepSeek 工程师预测 AI 写内核 6 至 12 个月可看齐本人工作(09-16/09-17)
- 3.5 采用方仓库窗口内安静:TileKernels、FlashQLA、TileRT 均无推送
- 四、社区、教程与活动
- 4.1 文档站与 API 页面由机器人再生成(09-17)
- 4.2 学术与社区侧无新增:arXiv 与 Hacker News 窗口内零命中(09-17)
- 4.3 版本节奏:主仓最新标签仍为 v0.1.14,TileOPs 无发布(09-02)
- 五、趋势观察
- 5.1 主仓重心从「加能力」转向「把静默错误改成编译期失败」
- 5.2 CuTeDSL 首次出现与上游 CUTLASS DSL 版本演进的耦合伤
- 5.3 国产后端节奏分化:昇腾高频迭代、海光收口、沐曦与摩尔线程转维护
- 5.4 TileOPs 一面提速一面立契约,向带契约的算子层演进
- 5.5 本窗口的空白与风险点
今日重点:TileOPs 批矩阵乘改用共享 GEMM 模板,H200 上最高提速 1.44 倍
日期:2026-09-17 来源:TileOPs #2148 批矩阵乘(BMM)改用共享 GEMM 模板
本窗口最重的一笔改动落在算子库而不是语言本体:TileOPs 把批矩阵乘前向算子(BmmFwdOp,对照 torch.bmm)的内核由自带实现换成共享 GEMM 模板的批处理形态(GemmTemplate(BATCHED) 与由此派生的批处理内核),改动由 michaelwithu 提交、维护者 lcy-seso 合入,共 6 个提交。
作者在 PR 中给出的实测数据(环境为 NVIDIA H200、CUDA 13.2、PyTorch 2.13.0、TileLang 0.1.12)显示,收益集中在中大形状:
| 形状(B,M,N,K) | 类型 | 旧版(毫秒) | 新版(毫秒) | 相对旧版 | 相对 torch-cublas | 新版算力 |
|---|---|---|---|---|---|---|
| (8, 2048, 2048, 2048) | bfloat16 | 0.2905 | 0.2023 | 1.437 倍 | 1.007 倍 | 679.6 TFLOPS |
| (4, 4096, 4096, 4096) | bfloat16 | 1.0413 | 0.7451 | 1.398 倍 | 1.034 倍 | 737.9 TFLOPS |
| (128, 512, 512, 2048) | bfloat16 | 0.2942 | 0.2110 | 1.394 倍 | 1.021 倍 | 651.3 TFLOPS |
| (8, 1024, 1024, 1024) | float16 | 0.0410 | 0.0304 | 1.351 倍 | 1.021 倍 | 566.0 TFLOPS |
| (16, 512, 512, 512) | float16 | 0.0132 | 0.0118 | 1.110 倍 | 1.008 倍 | 362.3 TFLOPS |
| (64, 128, 2048, 128) | float16 | 0.0228 | 0.0199 | 1.146 倍 | 1.063 倍 | 216.1 TFLOPS |
| (32, 256, 256, 256) | bfloat16 | 0.0064 | 0.0065 | 0.985 倍 | 1.108 倍 | 166.1 TFLOPS |
读法有三点:其一,新版本在 15 个用例里对 torch-cublas 全部不落后(1.007 至 1.185 倍),小形状(8×128×128×128、32×256×256×256、64×128×128×2048)基本持平;其二,唯一回退项是 (32, 256, 256, 256) 的 bfloat16,0.985 倍,属小形状上模板开销未摊平的边界情形;其三,把批处理统一到共享模板之后,注意力与多头结构一类的公共底座只在一处维护,后续批处理算子的优化不必逐个复制。
与提速同一批合入的还有 5 个附带修复,写法上都是「让错误在构造期或测量期暴露」:MoE 工作区校验改为构造期安全、批矩阵乘模板按实际启动的 tile 计数、H200 设备判定与设备名大小写归一、注意力内核的 grid 按手上设备填充。这类伴随改动说明共享模板被多个算子复用时,设备判定与资源计数的健壮性成了新的公共课题。
一、核心项目进展
窗口总览:tile-ai 组织 28 个仓库中窗口内 9 个有推送,但主仓默认分支的最后一次提交仍是 09-17 09:57 的分支参数类型映射修复——也就是说,窗口后半段(北京时间 09-17 20:00 之后)主仓没有新合入,活动集中在「已开 PR 的评审与缺陷拆分」。窗口内主仓新开 6 个 PR 与 1 个缺陷单,全部处于未合入状态。
1.1 主仓 RNG 三处缺陷拆分修复:默认随机序列、void 结果绑定、缺初始化不报错(09-17)
日期:2026-09-17 来源:#3242 默认序列改由完整启动维度推导/#3243 拒绝绑定 void 结果/#3244 未初始化即取数改为明确诊断
CUDA 侧随机数接口的三处缺陷被拆成三个独立 PR(同一作者提交,前身 #3239 已关闭改为拆分),三处都属于「类型上能编译、语义上出错」的静默问题:
其一,随机状态初始化在不指定序列号时,只用线程块内的 x 维与网格的 x 维推导默认序列,于是二维及以上线程块里仅 y/z 坐标不同的线程共用同一条随机子序列,取出的随机数按字节完全相同。修复改为按行主序把全部已启动维度折算进默认序列,一维情形的历史取值保持不变(#3242,附带 4 个新测试,覆盖二维线程块、二维网格、一维兼容与显式序列号对照)。
其二,随机初始化本身是纯副作用内建,但前端按「有返回值」的方式记录,照文档写法绑定结果会生成 void state = ;,把语义错误变成 nvcc 的「不完整类型」编译错误。修复在前端拒绝绑定无值表达式,并在报告里同时给出变量名与出问题的表达式(#3243)。
其三,函数里从未初始化却直接取随机数,会生成空的 curand 调用,同样以 nvcc 语法错误的形式出现。修复在函数级预扫描中记录「是否初始化」与「是否消费随机流」,缺一即报 TileLang 自身的错误;作者明确说明检查是函数级而非控制流敏感——运行期分支内的初始化仍算已初始化,避免演变成确定赋值分析(#3244)。
三条并读,能看出主仓正在处理的一类系统性问题:前端诊断缺失,让语义错误在底层编译器里以晦涩形式出现。
1.2 不支持的 GEMM 类型组合提前拦截,不再落到 nvcc 的类型断言(09-17)
日期:2026-09-17 来源:tilelang #3245 在 CUDA 代码生成前拒绝不支持的 GEMM 类型组合
一些矩阵乘操作数类型组合(例如 bfloat16 乘 bfloat16 输出 float16)此前会被前端接受,直到 nvcc 阶段才以不透明的静态断言失败。该 PR 为 Ampere/Ada 一代的 mma.sync 通路建立显式的类型白名单,同时在前端入口与 C++ 指令选择两处校验,不支持的组合在代码生成前就被拒绝并给出明确信息;受支持的组合与非 Ampere 目标不受影响,附带 1 个负向与 3 个正向回归测试。这是本期主仓第二条「把静默错误前移成显式失败」的线。
1.3 CuTeDSL 后端 FP4 转换与存储修复,DeepSeek V4 激活量化仍卡在 FP8 阶段(09-17)
日期:2026-09-17 来源:缺陷单 #3240/修复 #3241
窗口内最值得留意的风险项出现在 CuTeDSL 后端(以 CUTLASS DSL 原语而非 CUDA 代码生成的后端)。缺陷单记录:DeepSeek V4 示例中的激活量化内核在该后端上无法工作。根因是版本耦合——转换辅助函数仍在用过时的向量取元素与插元素操作,而 nvidia-cutlass-dsl 4.7 已把这两个操作改名,导致所有 FP4 类型转换抛出 MLIR 属性错误;同一条链路上还有一处 FP8 目标类型不匹配。
修复 PR 把 FP4 转换改为新版 MLIR 接口后,FP4 激活量化路径在指定该后端时可编译并通过,FP8 目标类型不匹配也一并修掉;但组合用例仍失败——FP8 阶段会撞上一个独立的 libNVVM 编译失败,因此该用例暂时还不能从已知失败清单中移除。缺陷单里另有一条值得记录的发现:该后端的实际启用方式(通过环境变量指定目标)在仓库里只有示例测试的夹具与两处流水线片段读取,库本体并不读这个变量,说明这条通路的测试覆盖是绕开库层搭起来的。
同时也要指出,本节对应的是 09-17 的实际活动(集中在上午与傍晚),与上一期时窗有交叠;本期把它单列,是因为它从「缺陷被记录」推进到了「缺陷被修复一半、余下部分被明确界定」。
1.4 分块量化 GEMM 的 API 文档与指令级变体上线(09-17)
日期:2026-09-17 来源:tilelang.github.io 提交 Update docs
文档站由机器人再生成(387 个文件),把上一期并入主仓的分块量化 GEMM 推到了公开 API 页面:CUDA 方言下新增分块量化 GEMM 的完整签名说明(缩放因子作为一等输入、SM100 上要求完成屏障、双 CTA 模式要求集群维度配置、SM120 走片段累加的同步路径),并新列出三条指令级显式变体——Hopper 的 wgmma 显式异步版、Blackwell 的 tcgen05 显式异步版、以及两者对应的分块量化版本,以及一个缩放布局构造入口。文档同时把行为约定写死为「不支持的组合编译失败,而不是丢弃缩放因子」。这与 1.2 的取向一致:新增能力的同时把失败模式写进文档。
1.5 前一期已报内容的状态说明(09-17)
下列内容已在前一期报道,窗口内无语义变化,仅记录当前状态:主仓分块量化 GEMM 与其后端选择器(#3237)、原子向量宽度按目的地址规划的性能回补(#3238)、批处理参数类型映射补齐(#3229);TileOPs 的 MoE 索引小路由专家路径(#2141)与内核选择、构建分派重构(#2146);昇腾侧 NSA 前向与变长算子、动态量化与 RMSNorm 融合示例;沐曦异步拷贝 GEMM(#156)与其测试修复(#157)。以上十余项构成本窗口的存量内容,本期不再重复展开。
二、多后端适配(昇腾 / 沐曦 / 海光 / 摩尔线程)
窗口总览:四家国产与第三方后端在窗口内均有动作,但性质不同——昇腾以「高频算子补齐 + 每日回归」维持最高活跃度,海光完成了一次较大的后端改动合入与回移植,沐曦与摩尔线程的重心已转到版本分支与文档维护。
2.1 昇腾:每日回归 1925 项全通过,算子面推进延续(09-17/09-18)
日期:2026-09-18 来源:tilelang-ascend 每日测试报告 #1811
昇腾适配仓的每日定时测试在 09-18 05:46(北京时间)出报告:1925 项测试全部通过,失败 0 项,附件保留 30 天。这是本窗口内唯一的跨日数据点,可以作为「上游主仓连续并入新算子后,昇腾侧回归仍保持全绿」的证据。窗口内该仓有 4 笔提交(NSA 前向、NSA 前向变长、动态量化示例、RMSNorm 动态量化融合示例),均落在 09-17 上午,属前一期已报内容;窗口后半段该仓无新提交。
2.2 海光:MLS 地址重基与异步流水正式合入,并回移植到版本分支(09-17)
日期:2026-09-17 来源:tilelang-hygon #10 重基缓冲存储并接管异步拷贝流水
海光侧一笔改动在本窗口正式合入主分支(19 个文件,+540/-31),内容是两件事:一是稳定多级存储(MLS)的地址重基,新增缓冲操作重基标注与对应的属性映射,使后端代码生成可以按块索引对缓冲存储的地址做重基,并顺带加快这些路径上的布局推断;二是把带异步偏好的并行拷贝的提交与等待交给软件流水规划器管理。改动同时通过了格式检查。合入后该仓库在 09-17 20:25(北京时间)把同一改动回移植到 v0.1.12 版本分支,并额外带入一笔针对三维切片作用域下矩阵乘布局的修复,新建的开发分支 feat/hcu-mls-rebase-device-flags 上还有一笔流水管理与格式收尾的提交。海光仍是四家中后端代码改动最重的一家。
2.3 沐曦:异步拷贝 GEMM 入库后转入分支维护(09-17)
日期:2026-09-17 来源:tilelang-metax 分支列表
沐曦侧窗口内无新的主分支提交,落点仍是 09-17 上午合入的 MACA 异步拷贝矩阵乘支持与其测试修复(前一期已报)。当前活动集中在版本分支与测试维护,是四家中改动幅度最小的一家。
2.4 摩尔线程:回移植分支承载 MUSA 5.3.0 文档,主分支自 09-11 起静止(09-17)
日期:2026-09-17 来源:tilelang-musa 分支列表
摩尔线程适配仓的主分支最后一次提交在 09-11,窗口内的推送落在版本回移植分支上,内容是该分支 09-17 上午定格的 MUSA 5.3.0 文档提交(前一期已报)。分支列表显示其维护方式是「一个上游小版本对应一个加后缀的回移植分支」,当前停在 v0.1.12 一线,尚未跟进主仓 v0.1.14。
三、生态与采用方
3.1 TileOPs 清单化:复合算子、资源与可空输出进入 manifest(09-17)
日期:2026-09-17 来源:TileOPs #2147 用清单表达复合算子
TileOPs 侧在本窗口提交了一笔规模最大的改动(34 个文件,+2552/-370,尚未合入)。它让算子清单(manifest)能描述复合算子的内部结构、资源与可空输出,同时收掉此前散落的重复推导逻辑。作者列出的问题清单很能说明该项目的成熟度瓶颈:清单此前只能描述公开算子的外部契约,导致六个已实现的复合算子无处声明自己是复合算子;某个融合专家算子把两块临时缓冲声明成普通签名输入,等于让工作区取得了「结果依赖的取值」的语义;共享专家算子既没有清单条目,基准又自带一份算力与字节数计算,类名还违反了既定的命名约定;返回空值的固定输出位置原先无法表达。这些都不是性能问题,而是接口契约问题——与今日重点里批矩阵乘的模板复用放在一起看,TileOPs 正在同时补性能与契约两条线。
3.2 TileOPs 文档站跟进统一分派与新的编译边界(09-17)
日期:2026-09-17 来源:TileOPs.github.io #51 跟进统一内核分派
文档站同步了上一期合入的算子分派重构:内核获取入口的新签名(把键与构建方式作为显式参数)、PyTorch 自定义算子注册与假实现注册的边界、以及由算子规格元组生成的编译边界写法。中英两套文档同批修改,作者在验证章节记录了接口页检查脚本、文档站构建与全量测试的执行情况。算子上游改动后文档当日跟进,说明 TileOPs 的文档流程已自动化到可跟随重构。
3.3 夜间基准与正确性快照:基准 1039 项中 1 项失败,正确性 1117 项全通过(09-17)
日期:2026-09-17 来源:TileOPs-nightly 快照提交/快照记录文件
TileOPs 的夜间流水线在本窗口为「批矩阵乘模板化」那个提交(正是今日重点的合入结果)生成了快照,含基准结果、正确性结果与一份环境元数据。元数据把可复现所需的要素全部固定下来:具体提交号、容器镜像按其摘要记录、GPU 型号与功耗上限、SM 时钟设置、以及全量依赖版本(该次记录中 Cube 版本 13.2、PyTorch 2.13.0、TileLang 0.1.11 加该次提交的构建标识)。两份结果的读数:
- 正确性:1117 项测试全部通过,跳过 2 项,用时约 219 秒;
- 基准:1039 个用例中 1 项失败,失败项是 GQA 预填充分页内核在 softcap 50 配置下的用例,报错来自对照基线实现的函数签名不匹配(缺少一个参数),并非 TileOPs 自身内核出错——这类失败恰好说明「对照侧也要进回归」的必要性。
基准里最亮的是稀疏注意力解码一类算子:主流批量配置下 TileOPs 为 1.86 毫秒、313.98 TFLOPS,对照实现为 19.88 毫秒、30.79 TFLOPS,另两个对照(融合注意力实现 5.61 毫秒、编译版 PyTorch 16.64 毫秒)也在其后;长上下文低 top-k 变体为 0.50 毫秒、291.55 TFLOPS,对照 20.36 毫秒;多头潜在注意力解码在 4k 上下文(半精度)为 0.0385 毫秒,对照 0.3147 毫秒。
需要说明两点边界:这些数字只出现在夜间流水线单次运行的记录里,不是横向评测;其中稀疏注意力一项的对照实现属于朴素实现(30.79 TFLOPS),与生产级索引注意力不可直接对比。
3.4 媒体:DeepSeek 工程师预测 AI 写内核 6 至 12 个月可看齐本人工作(09-16/09-17)
日期:2026-09-17 来源:NeoTeo:DeepSeek engineer forecasts AI-written GPU kernels could match his work
这是窗口内被检索到的唯一一条主题媒体报道。文章记录 DeepSeek 工程师 Shengyu Liu 的公开判断:约一年间,AI 在内核工作中的角色从读文档、读代码、改缺陷推进到阅读底层图形汇编、分析指令停顿并优化算子;他预测 6 至 12 个月内 AI 写出的内核可达到或超过他本人的水平,人的角色转向定义目标、解读性能剖析结果与评判产出。文章同时把 TileLang 生态作为背景梳理:TileKernels 是纯用 TileLang 写成的内核库,覆盖门控、混合专家路由、量化、转置与两类连接算子,环境要求为两代 Hopper/Blackwell 级 GPU、Python 3.10 以上、PyTorch 2.10 以上、TileLang 0.1.9 以上、CUDA 13.1 以上;并引述了 NVIDIA 此前用推理模型生成注意力内核的验证器闭环实验(一级数值正确率 100%、二级 96%、单次闭环约 15 分钟)作为「有限条件下已跑通」的对照。
定位上需要说清楚:这属于预测性报道加生态综述,不含 TileLang 本体的任何改动,也不构成对上述能力的独立验证;收录的理由是它是本窗口内唯一把 TileLang 放到产业人才结构语境里讨论的公开材料,对采用方(TileKernels)的叙事有直接关联。
3.5 采用方仓库窗口内安静:TileKernels、FlashQLA、TileRT 均无推送
窗口内,深度求索的 TileKernels(最后一次推送 04-23)、通义千问的 FlashQLA(08-26)、以及同为 tile-ai 组织下的 TileRT(08-13)都没有提交。TileRT 已连续五周无更新。采用方一侧的静止状态本窗口不构成风险信号,但意味着今日的动态完全由上游语言与算子库侧提供。
四、社区、教程与活动
4.1 文档站与 API 页面由机器人再生成(09-17)
日期:2026-09-17 来源:tilelang.github.io 提交列表
主仓文档站当日由机器人按上游代码再生成(387 个文件),可见的内容变化集中在矩阵乘相关的 API 页面(详见 1.4)。这套「上游合并、文档站当日跟进」的链条在本窗口运转正常,未出现文档与代码脱节。
4.2 学术与社区侧无新增:arXiv 与 Hacker News 窗口内零命中(09-17)
本窗口内 arXiv 检索 TileLang 无新论文,最近一篇为 2026-07-24 的性能建模方向论文(TileSight),属背景材料;Hacker News 近五日无主题讨论命中。社区侧窗口内没有教程、教程型仓库或活动公告类内容,本期不设增量条目。
4.3 版本节奏:主仓最新标签仍为 v0.1.14,TileOPs 无发布(09-02)
主仓最新标签仍为 v0.1.14(09-02 发布),窗口内无新标签;TileOPs 至今没有发布记录与标签,其对外状态由文档站与夜间快照承担。
五、趋势观察
5.1 主仓重心从「加能力」转向「把静默错误改成编译期失败」
本窗口主仓新开的 6 个 PR 里,有 5 个属于同一族:随机数默认序列错误、绑定 void 结果、缺初始化不报错、类型组合不满足却在底层编译器里炸掉、以及子字节浮点转换的接口过时。共同点是此前都能编译通过、跑出结果,但结果错误或错误信息指向无关层。加上分派重构把「不具备能力的后端静默降级」改成编译失败,可以判断主仓当前的优先级是把错误边界做在语言层,而不是继续扩算子面。
5.2 CuTeDSL 首次出现与上游 CUTLASS DSL 版本演进的耦合伤
CuTeDSL 后端在本窗口首次暴露出被上游版本改名打穿的问题,且修复后仍有 FP8 阶段卡在 libNVVM 上。这提示一个结构性风险:以第三方 DSL 为底座的后端,其稳定性取决于上游接口的稳定性,而这类后端目前又缺少库层可读的启用方式与常规回归覆盖。对依赖这条通路的采用方(尤其是关注 DeepSeek 系量化算子的团队),本窗口的进展值得跟踪。
5.3 国产后端节奏分化:昇腾高频迭代、海光收口、沐曦与摩尔线程转维护
四家的差异在本窗口格外清楚:昇腾以每日 1925 项回归加算子补齐维持推进;海光完成一次涉及代码生成与流水的较大改动并立即回移植到版本分支,属「合入加收口」;沐曦在异步拷贝 GEMM 入库后转入测试与分支维护;摩尔线程的回移植分支停在 v0.1.12 一线,尚未跟进主仓 v0.1.14。由此看,国产适配的整体节奏仍健康,但能把上游最新语言能力跟到什么位置,各家已经拉开差距。
5.4 TileOPs 一面提速一面立契约,向带契约的算子层演进
今日重点的批矩阵乘提速(最高 1.44 倍、对官方库不落后)与清单化改动(复合算子、资源语义、可空输出)同日推进,加上夜间流水线为每个提交留可复现快照(提交号、镜像摘要、时钟设置),TileOPs 的定位正在从「一批算子实现」转向「一批带契约、可复现对照的算子」。这对下游推理引擎集成是好事:契约明确比算子数量更能降低接入成本。
5.5 本窗口的空白与风险点
空白方面:主仓默认分支在窗口后半段无新合入;采用方仓库(TileKernels、FlashQLA、TileRT)全部静止;学术与社区侧零命中;无新版本发布。风险方面有两条:其一,CuTeDSL 上 DeepSeek V4 激活量化的 FP8 阶段仍未打通,组合用例还在已知失败清单里;其二,本窗口新开的 6 个主仓 PR 全部未合入,随机数三缺陷与类型白名单都还在评审队列中,修复落地时间不确定——这三点是下一期应重点核对的对象。
附录:素材与核查说明
信源核查表
| 信源 | 核查结果 |
|---|---|
| GitHub 组织推送核查 | tile-ai 组织 28 个仓库推送时间全量核查,窗口内 9 个仓库有推送:主仓、算子库与其站点与夜间数据仓、昇腾、沐曦、海光、摩尔线程、文档站 |
| 主仓提交明细 | 默认分支窗口内 2 笔(均为前一期已报内容),最后提交时间为 09-17 09:57;窗口内新开 PR 6 个、缺陷单 1 个,均未合入 |
| TileOPs | 窗口内 3 笔合入(其中 2 笔为前一期已报),新开 PR 1 个;夜间数据仓为最新提交生成快照 |
| TileOPs-nightly | snapshots 分支窗口内 1 次推送;基准 1039 项中 1 项失败(对照实现签名问题)、正确性 1117 项全通过 |
| tilelang-ascend | 窗口内 4 笔提交(前一期已报)加 1 份每日测试报告(1925 项全通过) |
| tilelang-hygon | 主分支 1 笔合入,回移植分支 2 笔,开发分支 1 笔;改动含地址重基与异步流水接管 |
| tilelang-metax | 默认分支窗口内 2 笔(前一期已报),无新提交 |
| tilelang-musa | 默认分支无窗口内提交,推送落在 v0.1.12 回移植分支;主分支最后提交为 09-11 |
| tilelang-mlir-ascend / TileFoundry / DeepStack / tilescale | 窗口内均无推送,最近一次分别为 09-16 / 09-15 / 09-15 / 08-25 |
| TileRT | 窗口内无推送,最近一次 2026-08-13,连续五周无更新 |
| 采用方仓库 TileKernels / FlashQLA | 窗口内无推送,最近一次分别为 2026-04-23 / 2026-08-26 |
| Google News RSS(中英文多组查询) | 主题词、组件名与团队词组合查询后窗口内仅 1 条可用命中(NeoTeo 报道),其余为同名噪音与股票行情稿,已剔除 |
| Hacker News | 近五日主题词零命中,命中项均为同名词条 |
| arXiv | 窗口内无新论文,最近一篇为 2026-07-24 的性能建模论文 |
| 文档站与标签 | 文档站当日再生成(387 个文件);主仓最新标签仍为 v0.1.14(09-02),TileOPs 无标签与发布 |
完整信源清单
- [1] TileLang 主仓 — https://github.com/tile-ai/tilelang
- [2] tilelang #3242 默认随机序列改由完整启动维度推导 — https://github.com/tile-ai/tilelang/pull/3242
- [3] tilelang #3243 拒绝绑定 void 随机初始化结果 — https://github.com/tile-ai/tilelang/pull/3243
- [4] tilelang #3244 未初始化即取随机数的明确诊断 — https://github.com/tile-ai/tilelang/pull/3244
- [5] tilelang #3245 在代码生成前拒绝不支持的 GEMM 类型组合 — https://github.com/tile-ai/tilelang/pull/3245
- [6] tilelang #3241 CuTeDSL 子字节浮点转换与存储修复 — https://github.com/tile-ai/tilelang/pull/3241
- [7] tilelang #3240 缺陷单:DeepSeek V4 激活量化在 CuTeDSL 上失败 — https://github.com/tile-ai/tilelang/issues/3240
- [8] tilelang #3239 随机数初始化语义加固(前身 PR,已关闭改拆分) — https://github.com/tile-ai/tilelang/pull/3239
- [9] tilelang.github.io 文档再生成提交 — https://github.com/tile-ai/tilelang.github.io/commit/2eb0b5e3
- [10] TileOPs 仓 — https://github.com/tile-ai/TileOPs
- [11] TileOPs #2148 批矩阵乘改用共享 GEMM 模板 — https://github.com/tile-ai/TileOPs/pull/2148
- [12] TileOPs #2147 用清单表达复合算子、资源与可空输出 — https://github.com/tile-ai/TileOPs/pull/2147
- [13] TileOPs 文档站 #51 跟进统一分派与编译边界 — https://github.com/tile-ai/TileOPs.github.io/pull/51
- [14] TileOPs 夜间数据仓快照提交 — https://github.com/tile-ai/TileOPs-nightly/commit/66c5f4f61b28478d98765680c36e7f3ceb579747
- [15] TileOPs 夜间快照环境元数据 — https://github.com/tile-ai/TileOPs-nightly/blob/snapshots/meta.json
- [16] tilelang-ascend 每日测试报告 #1811 — https://github.com/tile-ai/tilelang-ascend/issues/1811
- [17] tilelang-hygon #10 重基缓冲存储并接管异步拷贝流水 — https://github.com/tile-ai/tilelang-hygon/pull/10
- [18] tilelang-hygon 分支列表 — https://github.com/tile-ai/tilelang-hygon/branches
- [19] tilelang-metax 分支列表 — https://github.com/tile-ai/tilelang-metax/branches
- [20] tilelang-musa 分支列表 — https://github.com/tile-ai/tilelang-musa/branches
- [21] tilelang-mlir-ascend 提交列表 — https://github.com/tile-ai/tilelang-mlir-ascend/commits/main
- [22] TileFoundry 提交列表 — https://github.com/tile-ai/TileFoundry/commits/main
- [23] TileRT 仓 — https://github.com/tile-ai/TileRT
- [24] deepseek-ai/TileKernels — https://github.com/deepseek-ai/TileKernels
- [25] QwenLM/FlashQLA — https://github.com/QwenLM/FlashQLA
- [26] NeoTeo:DeepSeek 工程师预测 AI 写内核可看齐其本人工作 — https://www.neoteo.com/en/deepseek-engineer-forecasts-ai-written-gpu-kernels-could-match-his-work
- [27] TileLang 论文(arXiv:2504.17577) — https://arxiv.org/abs/2504.17577
- [28] TileSight 性能建模论文(arXiv:2607.22432) — https://arxiv.org/abs/2607.22432
- [29] tilelang 文档站 — https://tilelang.com