TileLang 每日动态报告(2026-09-17)
调研窗口:过去 24 小时(2026-09-16 19:23 ~ 2026-09-17 19:23,北京时间;本任务为每日 07:00 定时的首次试运行,判定改在当日傍晚执行,窗口仍按 24 小时取) 信源:GitHub(tile-ai 组织 28 个仓库 pushed_at 全量核查,窗口内 9 个仓库有推送;tilelang、tilelang-ascend、tilelang-metax、tilelang-hygon、TileOPs 等仓库窗口内提交逐条复核,关键 PR 说明与基准数据核对;分支与标签元数据交叉验证)、第三方适配与采用方仓库(tilelang-mlir-ascend、tilelang-musa、TileFoundry、TileRT、deepseek-ai/TileKernels、QwenLM/FlashQLA)、Google News RSS 中英文多组查询(走代理)、Hacker News、arXiv、华为全联接大会 2026 现场报道(详见附录信源清单)
本期索引
- 今日重点:T.gemm_blockscaled 进入主仓——分块量化 GEMM 有了统一入口(09-17)
- 一、核心项目进展
- 1.1 主仓新增 T.gemm_blockscaled 与后端选择器,分块量化不再静默降级(09-17)
- 1.2 原子向量宽度改由目的地址规划,嵌入反向等内核提速 1.4 至 2.5 倍(09-17)
- 1.3 原子加在非连续目的地址上保持标量,修掉一类静默写错与地址未对齐崩溃(09-17)
- 1.4 JIT 补 uint64 参数类型映射,Cython 与 NVRTC 宿主包装器对齐(09-17)
- 1.5 TileOPs:MoE 索引小路由专家路径,H200 上对标 vLLM 全面领先(09-17)
- 1.6 TileOPs:内核选择与构建分派重构,四处算子参数迁入构造函数(09-16/09-17)
- 二、多后端适配(昇腾 / 沐曦 / 海光 / 摩尔线程)
- 2.1 昇腾:NSA 前向与其变长版本同日入库,910B3 上进入 20 微秒量级(09-17)
- 2.2 昇腾:动态量化、RMSNorm 融合与 RoPE 示例补齐算子面(09-16/09-17)
- 2.3 沐曦:MACA 异步拷贝 GEMM 支持入库(09-17)
- 2.4 海光:HCU 后端 rebase 多级存储与缓冲存储,流水改走 prefer_async(09-17)
- 2.5 摩尔线程:MUSA 5.3.0 文档补入回移植分支(09-17)
- 2.6 产业侧:华为全联接大会 2026 公布昇腾 960 与 Atlas 960 超节点进展(09-17)
- 三、生态与采用方
- 3.1 tilelang-mlir-ascend:TileOPs 多头注意力算子与自适应 LayerNorm 合入(09-16)
- 3.2 采用方仓库窗口内安静:TileKernels、FlashQLA、TileRT 均无推送
- 3.3 第三方:TileSight 性能分析技术路线文档公开(09-17)
- 四、社区、教程与活动
- 4.1 文档站随主仓持续同步(09-17)
- 4.2 学术与教程线:ICLR 2026 论文与 Hugging Face 内核教程(背景,窗口外)
- 五、趋势观察
- 5.1 国产四家后端同日并行演进,适配从单向跟随转为同步推进
- 5.2 主仓两条线并行:新硬件分块量化能力与既有内核性能回补
- 5.3 TileOPs 的定位正从算子库转向可与推理引擎对表的生产级算子层
- 5.4 本窗口的空白与风险点
今日重点:T.gemm_blockscaled 进入主仓——分块量化 GEMM 有了统一入口
日期:2026-09-17 来源:tilelang #3237 分块量化 GEMM 语义与后端分派
本窗口主仓最重的一笔改动是把「分块量化 GEMM」(block-scaled GEMM,即 MXFP8/MXFP4 一类按块共享缩放因子的低位宽矩阵乘)从散落在各后端的特例,提升为语言层的一个正式算子。改动引入 GemmBlockScaledNode(实现于 src/op/gemm_blockscaled.{h,cc})与语言侧的 T.gemm_blockscaled,语义写作 C (+)= (A * SFA) @ (B * SFB),即缩放因子作为算子的一等输入,而不是让调用方在外部手工折算。
它同时修掉两个此前会静默出错的路径:其一,SM100 上的单 CTA 分块量化 GEMM 有可能命中只该 SM120 走的指令选择分支;其二,不具备分块量化能力的后端会把它当作稠密 GEMM 降级执行,缩放因子被直接丢弃——结果能跑通、精度是错的。现在分派改走专用的后端选择器,落在 cuda.tcgen05.blockscaled(SM100 线)与 cuda.mma.blockscaled(SM120 线)两条实现上,并保留 mbar、use_2cta、sf_layout 等参数入口。作者在 SM100 级设备(sm_103)上本地验证,覆盖 1D1D 布局的 MXFP8 分块量化示例与 tcgen05 INT8 GEMM 断言,并明确标注 SM120 侧的执行路径未在本地验证。
与它同日合入的 #3238 是另一条线上的对偶动作:不新增能力,而是把此前一次改动引入的性能回退收回来——详见 1.2。两条并读,主仓当前的节奏是「加新硬件路径」与「补既有内核性能」同时推进。
一、核心项目进展
窗口总览:tile-ai 组织 28 个仓库中,窗口内有推送的为 9 个:核心仓 tilelang,国产后端 tilelang-ascend、tilelang-metax、tilelang-hygon、tilelang-musa,算子库 TileOPs 与其站点 TileOPs.github.io、TileOPs-nightly,以及文档站 tilelang.github.io。按窗口内提交条数计,tilelang-ascend 6 条最多,tilelang 4 条、TileOPs 3 条、tilelang-metax 2 条、tilelang-hygon 1 条;tilelang-musa 的推送落在回移植分支而非默认分支,故默认分支上无窗口内提交。
1.1 主仓新增 T.gemm_blockscaled 与后端选择器,分块量化不再静默降级(09-17)
日期:2026-09-17 来源:tilelang #3237
详见「今日重点」。补两点实现侧细节:一是分块量化 GEMM 已从 GemmImpl 拆出、按后端单独注册,稠密 GEMM 与分块量化 GEMM 各走各的实现槽位,避免再次出现「某后端把它当稠密算子处理」的路径混淆;二是 tl.gemm.infer_layout 与 tl.gemm.lower 两个共享入口被要求严格接收 13 个位置参数,使新增算子必须显式声明完整接口,而不是靠默认值蒙混过关。该 PR 标题带「Do not review」前缀、由核心维护者自合,合入时携带 19 个提交。
1.2 原子向量宽度改由目的地址规划,嵌入反向等内核提速 1.4 至 2.5 倍(09-17)
日期:2026-09-16 至 2026-09-17 来源:tilelang #3238
动态形状会在车道索引外引入 int64 转换,此前的向量化判定只认未化简的 Ramp 形式,遇到「广播基址加 int64 车道偏移」这类等价写法就把整个循环标量化——明明访问的是四个对齐连续元素,却退化成逐元素执行。修复把判定改为依据目的地址(elem_offset、IndicesCanVectorize、AtomicTargetIsContiguous 三处协同),并以 c6ece48 为基线给出同卡三次测量的中位对比:嵌入反向 N=8192/H=4096/V=129280 从 97.90 微秒降到 56.01 微秒,N=196608/H=256/V=3000000 从 146.87 微秒降到 82.70 微秒,另一档从 86.62 微秒降到 49.87 微秒,序列辅助计数与求和从 18.40 微秒降到 12.17 微秒;回归基准里 example_gqa_bwd_tma_reduce_varlen 拿到约 27% 的相对提升,其余用例波动在 0.5% 至 1.5% 之间。这是一次典型的「编译器改写规则影响真实推理性能」——受影响的嵌入反向与变长注意力反向都是大词表推理的常驻内核。
1.3 原子加在非连续目的地址上保持标量,修掉一类静默写错与地址未对齐崩溃(09-17)
日期:2026-09-16 来源:tilelang #3219
与 1.2 同源的另一处向量化缺陷:T.atomic_add 的目的地址若是向量边界内不变的表达式(如按 i 除以 2 索引、或常量下标),旧逻辑只看数据类型选宽度,把一个「所有车道写同一格」的语义编译成一条宽原子加,结果是相邻元素被静默写坏;基址为奇数时直接触发地址未对齐崩溃。修复新增 CanVectorizeAtomicTarget 前置判定,覆盖 address_of、tl.access_ptr、tvm_access_ptr 三种目的地址形态,非连续或未对齐一律退回标量。这个缺陷影响面不小——T.Parallel 配 T.atomic_add 是 GEMM split-K、注意力反向、层归一化的常用写法,且既有测试用 N 等于线程数的配置刚好绕过了它。
1.4 JIT 补 uint64 参数类型映射,Cython 与 NVRTC 宿主包装器对齐(09-17)
日期:2026-09-17 来源:tilelang #3229
宿主侧包装器此前缺 uint64 的类型映射,遇到该类型参数直接报「不支持的 dtype」。修补后 Cython 与 NVRTC 两条宿主路径都能处理 uint64 实参,与设备侧的 uint64_t 声明对齐。属于小口子、但不补会在大整数索引与位运算类内核上直接撞墙。
1.5 TileOPs:MoE 索引小路由专家路径,H200 上对标 vLLM 全面领先(09-17)
日期:2026-09-17 来源:TileOPs #2141
算子库侧本窗口最有分量的一条。改动为共享融合 MoE 增加了索引式小路由专家路径:当路由分组稀疏、单专家实际收到的 token 很少时,改用按索引聚合的执行方式,避开大分组下的低效路径。公开接口不变,不支持的设备与形状、大路由分组、以及未验证的激活与布局组合一律保持既有回退。作者在 H200 上用 BF16、top-8 sigmoid 路由加修正偏置、CUPTI 设备占用计时并做 L2 冲刷,与 vLLM 对比三套模型:GLM-4.5 在 4096 token 档领先 25.85%,DeepSeek-V3 同档领先 16.03%,Kimi K2 领先 8.65%,小 token 档也普遍占先。基准自身也被重建(此前基线不可信),并给出 FusedTopK 至少 49.3%、PermuteAlign 至少 59.6% 的整组提升;对照数据说明路由为固定种子的合成路由而非真实 checkpoint 轨迹,属如实披露。
1.6 TileOPs:内核选择与构建分派重构,四处算子参数迁入构造函数(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:TileOPs #2146、TileOPs #2145
结构与 1.5 的性能改动同日发生,属同一轮内部整理。一是分派模型改为「先选出内核、再问它怎么构建」(Op.kernel_for / Op.entry_for),GEMM 家族全部改走选中的类分派,不再由调用点判断;二是四处原本按调用传参的算子把参数移到构造阶段,其中 MHP 前向若有外部目标首次调用会直接抛属性错误、分页预填充算子持有一个构造时从未赋值的序列长度字段,均属真实缺陷;另把六个算子的输出类型参数统一改名为 out_dtype,FP8 GEMM 与其批量版本改收 torch 数据类型而非字符串。作者明确本次未改内核主体与生成代码,因此不作性能主张,价值在于消除「选择时读一个设备的架构、构建时读另一个设备」这类漂移。
二、多后端适配(昇腾 / 沐曦 / 海光 / 摩尔线程)
本窗口的形态是四家国产后端同日在场:昇腾 6 条提交、沐曦 2 条、海光 1 条、摩尔线程 1 条(回移植分支文档)。这是本日报自采集中少见的密度——四家在同一天都有实质动作,而非各自错峰。
2.1 昇腾:NSA 前向与其变长版本同日入库,910B3 上进入 20 微秒量级(09-17)
日期:2026-09-17 来源:tilelang-ascend #1699、tilelang-ascend #1700
两条都落在昇腾专仓的 ascendc_pto 分支上,四分钟内先后合入(北京时间 11:44 与 11:49)。#1699 是原生稀疏注意力(NSA)前向算子:以开发者模式的混合写法实现,编译器自动切分 Cube 与 Vector 作用域、自动插入跨核同步标志,无需手写全局屏障、作用域声明或手工标志位;黄金配置下任务耗时 19.62 微秒,精度分层测试 27 例全过,最高绝对误差 1.95e-03。#1700 加上变长序列支持,单内核前向、持久化网格、四段流水,910B3 上测试配置耗时 20.34 微秒,21 例分层测试全过,按容差双闸门标准口径给出匹配比例 1.0000。两条一并看,昇腾侧对 DeepSeek 系稀疏注意力结构的覆盖从「有实现」走到「带变长与测试分层」。
2.2 昇腾:动态量化、RMSNorm 融合与 RoPE 示例补齐算子面(09-16/09-17)
日期:2026-09-16 至 2026-09-17 来源:tilelang-ascend #1688、tilelang-ascend #1673、tilelang-ascend #1580
三条示例层改动同时说明昇腾在补「推理链路上的常规算子」:动态量化算子(#1688)经 CANN 基准与在线评测,20 例精度全过、平均加速比 0.78 倍——即精度可用而性能仍落后厂商基线,属如实记录而非胜绩;叠加 RMSNorm 的动态量化融合算子(#1673)与旋转位置编码算子(#1580,覆盖半旋转与交错两种布局,附基准脚本与对标 torch_npu 的精度测试)补上了大模型推理前处理与位置编码两个环节。此外 #1603 为 T.tile.merge_sort 补了接口文档与测试用例。
2.3 沐曦:MACA 异步拷贝 GEMM 支持入库(09-17)
日期:2026-09-17 来源:tilelang-metax #156
沐曦侧为 MACA 平台补上异步拷贝 GEMM 路径,涉及异步内存拷贝原语、屏障指令与异步拷贝完成计数三个入口,使矩阵乘的数据搬运可以走异步流水;同日另有一条测试用例缺陷修复(#157)。对沐曦而言这是「从能跑到跑得快」的一步,因为异步拷贝正是 GEMM 流水重叠的前提。
2.4 海光:HCU 后端 rebase 多级存储与缓冲存储,流水改走 prefer_async(09-17)
日期:2026-09-17 来源:tilelang-hygon 提交 36db42e1
海光侧一条提交触及 19 个文件,动作是 rebase 多级存储(MLS)与缓冲存储的写入路径,并把流水线的拷贝调度改走 prefer_async。新增的缓冲偏移依赖检查器按「按块索引相关」与「按线程索引相关」两类分别判定,再以语法导向的方式把块基址与残余偏移拆开——注释里写明了这里的边界:缓冲注解就是调用方的安全契约,编译器不去做范围证明。这条与沐曦那条方向一致:两家都在把同步搬运换成异步流水。
2.5 摩尔线程:MUSA 5.3.0 文档补入回移植分支(09-17)
日期:2026-09-17 来源:tilelang-musa 分支列表
摩尔线程仓的窗口内推送落在 v0.1.12+musa.1 这条回移植分支上,内容是把 MUSA 5.3.0 的文档补进旧版本线,默认分支无窗口内提交。这条信号偏弱:主线的上一次实质提交是 09-11 的准备公开发布与 09-10 的一批运行时能力(对称 IPC 分配、IPC 与可选虚拟内存管理运行时、DLPack 设备兼容、系统级栅栏),MUSA 侧本期属维护性动作而非新能力。
2.6 产业侧:华为全联接大会 2026 公布昇腾 960 与 Atlas 960 超节点进展(09-17)
日期:2026-09-17 来源:华为全联接大会 2026 现场报道(每经,星岛环球网转载)、昇腾 960 定档 2027 年一季度(网易转载)
昇腾是 TileLang 国产后端里最活跃的一支,其硬件路线图对算子与内核的适配节奏有直接影响,故列一条产业侧动态。9 月 17 日在上海举行的华为全联接大会 2026 上,华为副董事长、轮值董事长汪涛宣布昇腾 960DT 提前至 2027 年第一季度发布、昇腾 960PR 提前至 2027 年第三季度;Atlas 960 超节点单个可实现 4096 颗 NPU 高速互联,依托灵衢架构与 Hi-ONE 光引擎,往返时延最低 2 微秒,并首次应用近封装光学(NPO)光引擎,液冷版计划 2027 年第三季度推出。会上另称超节点累计部署超一千套、服务 370 家以上客户。
作为背景(不在本窗口内):9 月 8 日 PyTorch Conference China 2026 上,昇腾方面称其已成为 PyTorch 官方支持的第一个中国硬件,并计划与 PyTorch 共建面向超节点的原生软件栈。两条合看,昇腾的软件生态位在抬升,对算子 DSL 层(含 TileLang 昇腾后端)是顺风。
三、生态与采用方
3.1 tilelang-mlir-ascend:TileOPs 多头注意力算子与自适应 LayerNorm 合入(09-16)
日期:2026-09-16 来源:tilelang-mlir-ascend 提交列表
该仓在 09-16 傍晚(贴近本窗口前边界)合入一条「把 TileOPs 的多头注意力算子接进来」的改动,并修复其基准脚本的缺陷;此前一天已补自适应 LayerNorm 内核。该仓同时把 CI 切到昇腾 A3 设备的 runner 标签上——说明昇腾侧不光在写算子,也在把验证搬进真实设备流水线。
3.2 采用方仓库窗口内安静:TileKernels、FlashQLA、TileRT 均无推送
日期:2026-09-17(核查) 来源:deepseek-ai/TileKernels、QwenLM/FlashQLA、tile-ai/TileRT
按本日报的核查清单,采用方与推理侧三个仓库窗口内均无推送:TileKernels 最近一次推送为 2026-04-23,FlashQLA 为 2026-08-26,TileRT 为 2026-08-13。TileRT 已连续五周无更新,是当前清单里安静时间最长的一个。这不构成负面结论,但值得继续跟踪——TileRT 面向的是低延迟推理运行时,长期停更会让「TileLang 生态已进入生产部署」的叙事缺少工程侧的新证据。
3.3 第三方:TileSight 性能分析技术路线文档公开(09-17)
日期:2026-09-17 来源:tilelang4tilesight-doc 仓库
第三方开发者公开了一套把 TileLang 程序与 TileSight 性能分析工具对接的技术文档,内容包括从 Python 与高层中间表示中提取语义、工作量与依赖,接入缓存与流水分析,并以运行时观测生成独立报告与联合预测;文档把性能问题分为流水瓶颈、跨层级搬运异常、缓存利用异常、计算与访存重叠失败、负载不均、模型预测偏差六类,并明确区分模型预测、运行时观测与证据不足三种结论强度,主要讨论平台为 H200。价值在于 TileLang 侧的观测与调优工具链正在被外部补齐。
四、社区、教程与活动
4.1 文档站随主仓持续同步(09-17)
日期:2026-09-17 来源:tilelang.github.io 提交列表
文档站在窗口内有一条自动同步提交(09-17 18:37 北京时间),此前 09-16、09-15、09-12 也各有一次,节奏与主仓合入基本对齐。站点当前版本为 0.1.14,工具区已含编译工具、性能分析器、布局可视化、自动增量调试、中间表示下降追溯与算子剖析等条目。文档站同步属机器人提交,本报告只作节奏记录。
4.2 学术与教程线:ICLR 2026 论文与 Hugging Face 内核教程(背景,窗口外)
日期:2026-04-23 至 2026-05-31(窗口外背景) 来源:ICLR 2026 海报页、TileLang 论文(arXiv:2504.17577)、Hugging Face 教程《Writing High-Performance Kernels in TileLang》
本窗口内 arXiv、Hacker News 与中英文新闻检索均未出现 TileLang 相关新内容,故此处只列窗口外已存在的学术与教程资产,供读者对照:论文声称在 H100 上最高相对 Triton 提速 5 倍、融合注意力内核代码量最多缩减 90%;Hugging Face 上的教程给出了从 GEMM 到多头潜在注意力的完整写法,并记录了一处真实收益——某个此前没有快速路径的模型配置,换成 TileLang 写的即插即用内核后从「直接报错」变为「可上线」。
五、趋势观察
5.1 国产四家后端同日并行演进,适配从单向跟随转为同步推进
昇腾、沐曦、海光、摩尔线程在同一个 24 小时窗口里都有落地动作,且方向高度趋同:都在补异步搬运与流水(沐曦的异步拷贝 GEMM、海光的 prefer_async、昇腾多段流水),都在补推理链路常规算子(动态量化、RMSNorm 融合、位置编码)。这说明国产后端的适配已经不是「等上游出特性再跟进」,而是在同一轮里各自补齐同一组能力。
5.2 主仓两条线并行:新硬件分块量化能力与既有内核性能回补
主仓本窗口的两笔大改动性质相反却同日合入:一边给 Blackwell 世代的分块量化 GEMM 建统一入口与专用分派(避免降级与路径混淆),一边把此前一次改写造成的向量化回退修回来(嵌入反向提速近一倍)。分块量化对应的是 MXFP8/MXFP4 这类低位宽格式在推理侧的普及,性能回补对应的则是大词表推理的常驻内核——两者都不属于「新增算子」型扩张,而是编译器层的稳定性与效率工作,通常比分点算子更能说明项目进入工程成熟期。
5.3 TileOPs 的定位正从算子库转向可与推理引擎对表的生产级算子层
本窗口 TileOPs 同时做了两件事:一是给出对标 vLLM 的整表性能数据(GLM-4.5 4096 token 档领先 25.85%、DeepSeek-V3 同档 16.03%),二是把内核选择与构建分派重构干净、并把不一致的接口参数一次性收口。愿意公开与 vLLM 的逐档对比、并同时承认基准此前不可信,表明它的验收口径正在向生产可用靠拢;昇腾侧的 mlir 仓开始直接接入 TileOPs 算子,则是这套口径开始跨后端复用的信号。
5.4 本窗口的空白与风险点
需要如实指出四点空白:其一,新闻侧 24 小时内在中英文渠道均无 TileLang 本体命中,检索到的同名噪音(数据库产品更名为 Tile.ai、无关的 2048 强化学习仓库)不算动态;其二,采用方仓库(TileKernels、FlashQLA)与推理运行时 TileRT 全部安静,其中 TileRT 已停更五周;其三,学术侧窗口内无新论文;其四,昇腾分块量化之外的国产后端仍以「补齐常规能力」为主,尚无对标厂商基线并取胜的性能数据,昇腾动态量化算子 0.78 倍的加速比就是一例——精度通过而性能落后,需要后续窗口继续跟踪是否收敛。
附录:素材与核查说明
核对方式:所有条目均以仓库提交时间(committer 时间)为准,仓库推送时间与提交时间分别核对;本窗口内新增的提交逐条读过标题与 PR 说明,关键改动另读正文中的验证口径与基准数据;对分支推送仓库(摩尔线程)追认到具体分支,确认默认分支无窗口内提交;对无法取得正文的第三方链接(含部分媒体页)只作存在性引用并在正文中注明其性质。
局限性说明:其一,GitHub 接口在本机采集过程中触发过未认证限流(每小时 60 次),窗口末期对文档站、mlir 仓、TileFoundry、TileRT 的核查改由仓库提交流完成,覆盖仓库数略有取舍,已在正文标注每一步的核查方式;其二,昇腾与沐曦的实测数据来自提交说明与 PR 正文的自述,本机无对应硬件,未做独立复现;其三,产业侧动态来自公开报道,未取得厂商一手公告原文。
信源核查表
| 信源 | 核查结果 |
|---|---|
| tile-ai 组织(28 仓库) | 窗口内 9 个仓库有推送 |
| 提交明细复核 | tilelang 4 条、tilelang-ascend 6 条、TileOPs 3 条、tilelang-metax 2 条、tilelang-hygon 1 条 |
| tilelang-musa | 默认分支无窗口内提交,推送落在回移植分支 v0.1.12+musa.1 |
| tilelang-mlir-ascend | 窗口内无推送,最近一次为 09-16 傍晚(窗口前边界外一小时) |
| TileFoundry / DeepStack / tilescale | 窗口内无推送,最近一次分别为 09-15 / 09-15 / 08-25 |
| TileRT | 窗口内无推送,最近一次 2026-08-13,连续五周无更新 |
| 采用方仓库 TileKernels / FlashQLA | 窗口内无推送,最近一次分别为 2026-04-23 / 2026-08-26 |
| Google News RSS(中英文多组查询) | 主题词与组件名窗口内零命中;命中的 TileDB 更名与 2048 强化学习仓库属同名噪音,已剔除 |
| 产业新闻渠道 | 华为全联接大会 2026 现场报道两条可用,已收录 1 条 |
| Hacker News | 窗口内无 TileLang 相关讨论 |
| arXiv | 窗口内无新论文,主论文为既有版本 v2 |
完整信源清单
- [1] TileLang 主仓 — https://github.com/tile-ai/tilelang
- [2] tilelang #3237 分块量化 GEMM 语义与后端分派 — https://github.com/tile-ai/tilelang/pull/3237
- [3] tilelang #3238 原子向量宽度按目的地址规划 — https://github.com/tile-ai/tilelang/pull/3238
- [4] tilelang #3219 原子加在非连续目的地址保持标量 — https://github.com/tile-ai/tilelang/pull/3219
- [5] tilelang #3229 JIT 补 uint64 参数类型映射 — https://github.com/tile-ai/tilelang/pull/3229
- [6] tilelang 文档站 — https://tilelang.com
- [7] tilelang.github.io 提交列表 — https://github.com/tile-ai/tilelang.github.io/commits/main
- [8] TileOPs #2141 MoE 索引小路由专家路径 — https://github.com/tile-ai/TileOPs/pull/2141
- [9] TileOPs #2145 GEMM 分派改走选中的类 — https://github.com/tile-ai/TileOPs/pull/2145
- [10] TileOPs #2146 内核选择与构建分派重构 — https://github.com/tile-ai/TileOPs/pull/2146
- [11] tilelang-ascend #1699 NSA 前向算子 — https://github.com/tile-ai/tilelang-ascend/pull/1699
- [12] tilelang-ascend #1700 NSA 前向变长算子 — https://github.com/tile-ai/tilelang-ascend/pull/1700
- [13] tilelang-ascend #1688 动态量化算子 — https://github.com/tile-ai/tilelang-ascend/pull/1688
- [14] tilelang-ascend #1673 RMSNorm 动态量化融合算子 — https://github.com/tile-ai/tilelang-ascend/pull/1673
- [15] tilelang-ascend #1580 旋转位置编码算子 — https://github.com/tile-ai/tilelang-ascend/pull/1580
- [16] tilelang-ascend #1603 merge_sort 文档与测试 — https://github.com/tile-ai/tilelang-ascend/pull/1603
- [17] tilelang-metax #156 MACA 异步拷贝 GEMM — https://github.com/tile-ai/tilelang-metax/pull/156
- [18] tilelang-metax #157 测试缺陷修复 — https://github.com/tile-ai/tilelang-metax/pull/157
- [19] tilelang-hygon 提交 36db42e1 — https://github.com/tile-ai/tilelang-hygon/commit/36db42e1
- [20] tilelang-musa 分支列表 — https://github.com/tile-ai/tilelang-musa/branches
- [21] tilelang-mlir-ascend 提交列表 — https://github.com/tile-ai/tilelang-mlir-ascend/commits/main
- [22] TileFoundry 提交列表 — https://github.com/tile-ai/TileFoundry/commits/main
- [23] TileRT 仓库 — https://github.com/tile-ai/TileRT
- [24] deepseek-ai/TileKernels — https://github.com/deepseek-ai/TileKernels
- [25] QwenLM/FlashQLA — https://github.com/QwenLM/FlashQLA
- [26] TileSight 性能分析技术路线文档仓 — https://github.com/superAngGao/tilelang4tilesight-doc
- [27] 华为全联接大会 2026 现场报道:昇腾 960 提前发布与 Atlas 960 采用 NPO 光引擎 — http://www.stnn.cc/detail/6aab5f30158f681db4eff237.html
- [28] 昇腾 960 定档 2027 年一季度(网易转载) — https://www.163.com/dy/article/L71E8QBV0514EMD3.html
- [29] 华为全联接大会 2026 官网 — https://www.huawei.com/cn/events/huaweiconnect
- [30] TileLang 论文(arXiv:2504.17577) — https://arxiv.org/abs/2504.17577
- [31] ICLR 2026 海报页 — https://iclr.cc/virtual/2026/poster/10010186
- [32] Hugging Face 教程《Writing High-Performance Kernels in TileLang》 — https://huggingface.co/blog/AtlasCloud-AI/writing-high-performance-kernels-in-tilelang