Ежедневный отчёт TileLang (2026-09-17)
Окно мониторинга: последние 24 часа (2026-09-16 19:23 ~ 2026-09-17 19:23, пекинское время; данная задача является первым пробным запуском по расписанию в 07:00 ежедневно, решение перенесено на вечер того же дня, окно по-прежнему принимается за 24 часа) Источники: GitHub (полная проверка pushed_at по 28 репозиториям организации tile-ai, в окне зафиксирован push в 9 репозиториях; по репозиториям tilelang, tilelang-ascend, tilelang-metax, tilelang-hygon, TileOPs и др. проведена поштучная сверка коммитов за окно, выборочная проверка описаний ключевых PR и эталонных данных; перекрёстная валидация метаданных ветвей и тегов), репозитории сторонних адаптаций и потребителей (tilelang-mlir-ascend, tilelang-musa, TileFoundry, TileRT, deepseek-ai/TileKernels, QwenLM/FlashQLA), множественные запросы Google News RSS на китайском и английском языках (через прокси), Hacker News, arXiv, репортажи с места проведения Huawei Connect 2026 (подробнее см. перечень источников в приложении)
Индекс выпуска
- Главное за сегодня: T.gemm_blockscaled вошёл в основной репозиторий — блочно-квантованный GEMM получил единую точку входа (09-17)
-
- Прогресс ключевых проектов
- 1.1 В основной репозиторий добавлены T.gemm_blockscaled и селектор бэкенда, блочное квантование больше не деградирует молча (09-17)
- 1.2 Ширина атомарных векторов теперь планируется по адресу назначения, ядра обратного прохода embedding и др. ускорились в 1,4–2,5 раза (09-17)
- 1.3 Атомарное сложение на несмежных адресах назначения остаётся скалярным, устранён класс молчаливых ошибок записи и сбоев из-за невыровненных адресов (09-17)
- 1.4 В JIT добавлено отображение типов параметров uint64, выровнены обёртки хоста Cython и NVRTC (09-17)
- 1.5 TileOPs: путь малых экспертов маршрутизации индекса MoE, на H200 полное превосходство над vLLM (09-17)
- 1.6 TileOPs: рефакторинг выбора ядер и диспетчеризации сборки, параметры четырёх операторов перенесены в конструктор (09-16/09-17)
- Прогресс ключевых проектов
-
- Мультибэкендная адаптация (Ascend / MetaX / Hygon / Moore Threads)
- 2.1 Ascend: прямой проход NSA и его версия с переменной длиной вошли в репозиторий в один день, на 910B3 достигнут уровень порядка 20 микросекунд (09-17)
- 2.2 Ascend: динамическое квантование, фьюзинг RMSNorm и примеры RoPE дополнили поверхность операторов (09-16/09-17)
- 2.3 MetaX: в репозиторий добавлена поддержка GEMM с асинхронным копированием MACA (09-17)
- 2.4 Hygon: бэкенд HCU перебазирован на многоуровневую память и буферную память, конвейер переведён на prefer_async (09-17)
- 2.5 Moore Threads: в документацию MUSA 5.3.0 добавлена ветка обратного портирования (09-17)
- 2.6 Промышленность: на Huawei Connect 2026 объявлен прогресс супернод Ascend 960 и Atlas 960 (09-17)
- Мультибэкендная адаптация (Ascend / MetaX / Hygon / Moore Threads)
-
- Экосистема и потребители
- 3.1 tilelang-mlir-ascend: влиты оператор многоголового внимания TileOPs и адаптивный LayerNorm (09-16)
- 3.2 Репозитории потребителей в окне тихие: TileKernels, FlashQLA, TileRT без push
- 3.3 Сторонние: опубликован документ по технической дорожной карте профилирования производительности TileSight (09-17)
- Экосистема и потребители
-
- Сообщество, руководства и мероприятия
- 4.1 Сайт документации непрерывно синхронизируется с основным репозиторием (09-17)
- 4.2 Академическая линия и руководства: статья ICLR 2026 и руководство по ядрам Hugging Face (фон, вне окна)
- Сообщество, руководства и мероприятия
-
- Наблюдения за трендами
- 5.1 Четыре отечественных бэкенда развиваются параллельно в один день, адаптация перешла от одностороннего следования к синхронному продвижению
- 5.2 В основном репозитории параллельно идут две линии: возможности блочного квантования под новое железо и восполнение производительности существующих ядер
- 5.3 Позиционирование TileOPs смещается от библиотеки операторов к производственному уровню операторов, сверяемому с инференс-движками
- 5.4 Пробелы и точки риска данного окна
- Наблюдения за трендами
Главное за сегодня: T.gemm_blockscaled вошёл в основной репозиторий — блочно-квантованный GEMM получил единую точку входа
Дата: 2026-09-17 Источник: tilelang #3237 семантика и диспетчеризация бэкендов блочно-квантованного GEMM
Самое весомое изменение основного репозитория в данном окне — повышение «блочно-квантованного GEMM» (block-scaled GEMM, то есть низкоразрядного матричного умножения класса MXFP8/MXFP4 с общим на блок масштабирующим множителем) из разрозненных частных случаев по бэкендам до официального оператора языкового уровня. Изменение вводит GemmBlockScaledNode (реализован в src/op/gemm_blockscaled.{h,cc}) и языковой T.gemm_blockscaled, семантика записывается как C (+)= (A * SFA) @ (B * SFB), то есть масштабирующий множитель становится полноправным входом оператора, а не пересчитывается вызывающей стороной вручную извне.
Тем самым он исправляет два пути, которые ранее могли молча давать сбой: во-первых, одноблочный блочно-квантованный GEMM на SM100 мог попасть в ветку выбора инструкций, которая должна была использоваться только на SM120; во-вторых, бэкенды, не обладающие возможностью блочного квантования, выполняли его как пониженный до плотного GEMM, при этом масштабирующие множители просто отбрасывались — результат проходил, но точность была неверной. Теперь диспетчеризация идёт через специализированный селектор бэкендов, опираясь на две реализации: cuda.tcgen05.blockscaled (линия SM100) и cuda.mma.blockscaled (линия SM120), и сохраняет точки входа параметров mbar, use_2cta, sf_layout и других. Автор проверил локально на устройстве уровня SM100 (sm_103), охватив пример блочного квантования MXFP8 с раскладкой 1D1D и утверждения tcgen05 INT8 GEMM, и явно отметил, что путь выполнения на стороне SM120 локально не проверялся.
Влитый в тот же день #3238 — это парное действие на другой линии: он не добавляет новых возможностей, а возвращает производительность, потерянную из-за предыдущего изменения, — подробности в 1.2. Читая оба вместе, текущий ритм основного репозитория — это одновременное продвижение «добавления новых аппаратных путей» и «восстановления производительности существующих ядер».
1. Ключевые достижения проекта
Обзор окна: из 28 репозиториев организации tile-ai в окне мониторинга пуши были в 9: основной репозиторий tilelang, отечественные бэкенды tilelang-ascend, tilelang-metax, tilelang-hygon, tilelang-musa, библиотека операторов TileOPs и её сайты TileOPs.github.io, TileOPs-nightly, а также сайт документации tilelang.github.io. По числу коммитов в окне мониторинга tilelang-ascend лидирует с 6 коммитами, далее tilelang — 4, TileOPs — 3, tilelang-metax — 2, tilelang-hygon — 1; пуш tilelang-musa попал в ветку обратного портирования, а не в ветку по умолчанию, поэтому в ветке по умолчанию коммитов в окне мониторинга нет.
1.1 В основном репозитории добавлены T.gemm_blockscaled и селектор бэкендов, блочное квантование больше не понижается молча (09-17)
Дата: 2026-09-17 Источник: tilelang #3237
Подробности в разделе «Главное за сегодня». Добавим два уточнения со стороны реализации: во-первых, блочно-квантованный GEMM уже выделен из GemmImpl и регистрируется отдельно по бэкендам, плотный GEMM и блочно-квантованный GEMM идут каждый по своему слоту реализации, что позволяет избежать повторной путаницы путей, когда «некоторый бэкенд обрабатывает его как плотный оператор»; во-вторых, две общие точки входа tl.gemm.infer_layout и tl.gemm.lower теперь обязаны строго принимать 13 позиционных аргументов, чтобы новые операторы должны были явно объявлять полный интерфейс, а не проходить за счёт значений по умолчанию. Заголовок этого PR имеет префикс «Do not review», он был самостоятельно влит основным мейнтейнером, и при вливании содержал 19 коммитов.
1.2 Ширина атомарного вектора теперь планируется по целевому адресу, ядра вроде обратного прохода embedding ускоряются в 1,4–2,5 раза (09-17)
Дата: 2026-09-16 — 2026-09-17 Источник: tilelang #3238
Динамические формы вносят преобразования int64 вне индексов дорожек; ранее определение векторизации признавало только несокращённую форму Ramp, и при встрече с эквивалентной записью вида «широковещательный базовый адрес плюс int64-смещение дорожки» оно скаляризовало весь цикл — хотя доступ шёл к четырём выровненным последовательным элементам, выполнение вырождалось в поэлементное. Исправление меняет определение так, чтобы оно опиралось на целевой адрес (совместная работа трёх мест: elem_offset, IndicesCanVectorize, AtomicTargetIsContiguous), и на базе c6ece48 приводит медианное сравнение трёх измерений на одной и той же карте: обратный проход embedding при N=8192/H=4096/V=129280 снизился с 97,90 микросекунды до 56,01 микросекунды, при N=196608/H=256/V=3000000 — с 146,87 микросекунды до 82,70 микросекунды, ещё один вариант — с 86,62 микросекунды до 49,87 микросекунды, вспомогательный подсчёт и суммирование последовательности — с 18,40 микросекунды до 12,17 микросекунды; в регрессионном бенчмарке example_gqa_bwd_tma_reduce_varlen получил относительный прирост около 27%, остальные случаи колебались в пределах от 0,5% до 1,5%. Это типичный случай «изменение правил перезаписи компилятора влияет на реальную производительность инференса» — затронутые обратный проход embedding и обратный проход attention с переменной длиной являются постоянными ядрами инференса с большим словарём.
1.3 Атомарное сложение сохраняет скалярность на несмежных целевых адресах, исправлен класс молчаливых ошибок записи и сбоев из-за невыровненных адресов (09-17)
Дата: 2026-09-16 Источник: tilelang #3219
Ещё один дефект векторизации, родственный 1.2: если целевой адрес T.atomic_add является выражением, инвариантным внутри границ вектора (например, индекс по i, делённому на 2, или константный индекс), старая логика выбирала ширину только по типу данных и компилировала семантику «все дорожки пишут в одну и ту же ячейку» в одну широкую атомарную операцию сложения, из-за чего соседние элементы молча повреждались; при нечётном базовом адресе это напрямую приводило к сбою из-за невыровненного адреса. Исправление добавляет предварительную проверку CanVectorizeAtomicTarget, охватывающую три формы целевого адреса: address_of, tl.access_ptr, tvm_access_ptr, — и при неконтигуальности или невыровненности всегда откатывается к скалярному варианту. Этот дефект имеет немалую область влияния — сочетание T.Parallel с T.atomic_add является распространённым способом записи для GEMM split-K, обратного прохода внимания и слоевой нормализации, — к тому же существующие тесты с конфигурацией, где N равно числу потоков, как раз обходили его.
1.4 JIT дополняет отображение типов параметров uint64, Cython и хостовый обёрточный слой NVRTC приводятся в соответствие (09-17)
Дата: 2026-09-17 Источник: tilelang #3229
Хостовый обёрточный слой ранее не имел отображения типов для uint64 и при встрече с параметром этого типа сразу сообщал о «неподдерживаемом dtype». После исправления оба хостовых пути — Cython и NVRTC — способны обрабатывать аргументы uint64 в соответствии с объявлением uint64_t на стороне устройства. Это небольшая брешь, но без её закрытия можно напрямую упереться в стену на ядрах с большими целочисленными индексами и битовыми операциями.
1.5 TileOPs: индексный путь малых маршрутизируемых экспертов MoE, на H200 полное превосходство над vLLM (09-17)
Дата: 2026-09-17 Источник: TileOPs #2141
Самая весомая позиция на стороне библиотеки операторов в этом окне мониторинга. Изменение добавляет для общего слитого MoE индексный путь малых маршрутизируемых экспертов: когда группы маршрутизации разрежены и отдельный эксперт фактически получает очень мало токенов, используется способ выполнения с агрегацией по индексам, позволяющий обойти неэффективный путь при больших группах. Публичный интерфейс не меняется, для неподдерживаемых устройств и форм, больших групп маршрутизации, а также непроверенных комбинаций активаций и раскладок сохраняется существующий откат. Автор на H200 с BF16, маршрутизацией top-8 sigmoid с корректирующим смещением, измерением занятости устройства через CUPTI и сбросом L2 сравнил с vLLM три набора моделей: GLM-4.5 на режиме 4096 токенов опережает на 25.85%, DeepSeek-V3 на том же режиме — на 16.03%, Kimi K2 — на 8.65%, на режимах с малым числом токенов также повсеместно впереди. Сам бенчмарк тоже был перестроен (прежняя базовая линия недостоверна), приведён общий прирост группы FusedTopK не менее 49.3% и PermuteAlign не менее 59.6%; сравнительные данные указывают, что маршрутизация была синтетической с фиксированным зерном, а не траекторией реального checkpoint, что раскрыто добросовестно.
1.6 TileOPs: рефакторинг выбора ядер и диспетчеризации сборки, параметры четырёх операторов перенесены в конструктор (09-16/09-17)
Дата: 2026-09-16 — 2026-09-17 Источник: TileOPs #2146, TileOPs #2145
Структурное изменение произошло в тот же день, что и оптимизация производительности в 1.5, и относится к тому же циклу внутренней упорядочивающей работы. Во-первых, модель диспетчеризации изменена на «сначала выбрать ядро, затем спросить его, как собирать» (Op.kernel_for / Op.entry_for), всё семейство GEMM переведено на диспетчеризацию через выбранный класс, а не через решение в точке вызова; во-вторых, параметры четырёх операторов, ранее передававшиеся при вызове, перенесены на этап конструирования, причём в числе них: прямой проход MHP при первом вызове с внешней целью напрямую выбрасывает ошибку атрибута, а оператор постраничного предзаполнения хранит поле длины последовательности, никогда не присваиваемое при конструировании, — всё это реальные дефекты; кроме того, параметр типа вывода шести операторов единообразно переименован в out_dtype, а FP8 GEMM и его пакетная версия принимают тип данных torch, а не строку. Автор явно указывает, что тело ядер и генерируемый код в этот раз не менялись, поэтому заявлений о производительности не делается; ценность в устранении такого рода дрейфа, как «при выборе читается архитектура одного устройства, а при сборке — другого».
2. Мультибэкендная адаптация (Ascend / MetaX / Hygon / Moore Threads)
Форма этого окна мониторинга — одновременное присутствие четырёх отечественных бэкендов: 6 коммитов Ascend, 2 — MetaX, 1 — Hygon, 1 — Moore Threads (документация ветки обратного портирования). Это редкая для собственного сбора данного ежедневного отчёта плотность — все четыре в один день имели содержательные действия, а не разнесли их по разным дням.
2.1 Ascend: прямой проход NSA и его версия с переменной длиной вошли в репозиторий в один день, на 910B3 вышли на уровень порядка 20 микросекунд (09-17)
Дата: 2026-09-17 Источник: tilelang-ascend #1699, tilelang-ascend #1700
Оба коммита попали в ветку ascendc_pto специализированного репозитория Ascend и были влиты с интервалом в четыре минуты (пекинское время 11:44 и 11:49). #1699 — это оператор прямого прохода нативной разреженной внимания (NSA): реализован смешанным способом в режиме разработчика, компилятор автоматически разделяет области видимости Cube и Vector, автоматически вставляет межъядерные флаги синхронизации, без необходимости писать глобальные барьеры, объявления областей видимости или ручные биты флагов вручную; при эталонной конфигурации время выполнения задачи составляет 19,62 микросекунды, все 27 случаев тестирования по уровням точности пройдены, максимальная абсолютная погрешность 1,95e-03. #1700 добавляет поддержку последовательностей переменной длины, прямой проход с одним ядром, персистентную сетку, четырёхсегментный конвейер, на 910B3 время тестовой конфигурации 20,34 микросекунды, все 21 случай многоуровневого тестирования пройдены, по стандарту двойного шлюза допуска приведена доля совпадений 1.0000. Рассматривая оба коммита вместе, покрытие структур разреженного внимания семейства DeepSeek на стороне Ascend прошло путь от «есть реализация» до «с поддержкой переменной длины и многоуровневым тестированием».
2.2 Ascend: динамическое квантование, слияние RMSNorm и примеры RoPE дополняют набор операторов (09-16/09-17)
Дата: 2026-09-16 — 2026-09-17 Источники: tilelang-ascend #1688, tilelang-ascend #1673, tilelang-ascend #1580
Три изменения на уровне примеров одновременно показывают, что Ascend восполняет «стандартные операторы инференс-конвейера»: оператор динамического квантования (#1688) прошёл эталонное тестирование CANN и онлайн-оценку, все 20 случаев точности пройдены, среднее ускорение 0,78x — то есть точность приемлема, но производительность всё ещё отстаёт от вендорского базового уровня, что является честной фиксацией, а не победным результатом; оператор слияния динамического квантования с RMSNorm (#1673) и оператор вращательного позиционного кодирования (#1580, охватывающий как половинную, так и чередующуюся раскладки, с приложенными эталонными скриптами и тестами точности в сравнении с torch_npu) закрывают два звена — предобработку инференса больших моделей и позиционное кодирование. Кроме того, #1603 добавил документацию по интерфейсу и тестовые случаи для T.tile.merge_sort.
2.3 MetaX: в репозиторий принята поддержка GEMM с асинхронным копированием для MACA (09-17)
Дата: 2026-09-17 Источники: tilelang-metax #156
Сторона MetaX добавила для платформы MACA путь GEMM с асинхронным копированием, затрагивающий три точки входа: примитив асинхронного копирования памяти, инструкцию барьера и счётчик завершения асинхронного копирования, что позволяет перемещению данных при матричном умножении идти по асинхронному конвейеру; в тот же день была ещё одна правка дефекта тестового случая (#157). Для MetaX это шаг «от работоспособности к скорости», поскольку асинхронное копирование как раз является предпосылкой перекрытия конвейеров GEMM.
2.4 Hygon: бэкенд HCU перебазирует многоуровневую память и буферную память, конвейер переходит на prefer_async (09-17)
Дата: 2026-09-17 Источники: tilelang-hygon коммит 36db42e1
Один коммит на стороне Hygon затрагивает 19 файлов, действие — перебазирование путей записи многоуровневой памяти (MLS) и буферной памяти, а также перевод планирования копирования конвейера на prefer_async. Новый проверщик зависимостей буферных смещений различает два класса — «зависимость по блочному индексу» и «зависимость по индексному потоку» — и затем синтаксически ориентированным способом разделяет базовый адрес блока и остаточное смещение — в комментариях явно указана граница: буферная аннотация является контрактом безопасности вызывающей стороны, компилятор не выполняет доказательство диапазонов. Этот коммит совпадает по направлению с коммитом MetaX: обе компании заменяют синхронное перемещение на асинхронный конвейер.
2.5 Moore Threads: документация MUSA 5.3.0 добавлена в ветку обратного портирования (09-17)
Дата: 2026-09-17 Источники: список веток tilelang-musa
Пуш в репозитории Moore Threads в пределах окна пришёлся на ветку обратного портирования v0.1.12+musa.1, содержимое — добавление документации MUSA 5.3.0 в старую линейку версий, в ветке по умолчанию коммитов в пределах окна нет. Этот сигнал довольно слабый: последний существенный коммит основной линии — подготовка к публичному релизу от 09-11 и ряд возможностей времени выполнения от 09-10 (симметричное IPC-выделение, IPC и опциональное управление виртуальной памятью во время выполнения, совместимость устройств DLPack, системные барьеры), на стороне MUSA в этом периоде — поддерживающие действия, а не новые возможности.
2.6 Отраслевая сторона: Huawei Connect 2026 объявила о прогрессе суперузлов Ascend 960 и Atlas 960 (09-17)
Дата: 2026-09-17 Источники: репортаж с места Huawei Connect 2026 (Muijing, републикация Sing Tao Global Network), Ascend 960 назначен на первый квартал 2027 года (републикация NetEase)
Huawei Ascend — самая активная ветка среди отечественных бэкендов TileLang, и её аппаратная дорожная карта напрямую влияет на ритм адаптации операторов и ядер, поэтому здесь приводится одна отраслевая новость. 17 сентября на конференции Huawei Connect 2026 в Шанхае заместитель председателя правления и ротирующий председатель Huawei Ван Тао объявил, что Ascend 960DT будет выпущен досрочно — в первом квартале 2027 года, а Ascend 960PR — досрочно в третьем квартале 2027 года; один суперузел Atlas 960 сможет обеспечить высокоскоростное соединение 4096 чипов NPU, опираясь на архитектуру Lingqu и оптический движок Hi-ONE, минимальная задержка кругового обхода составит 2 микросекунды, при этом впервые применён оптический движок с почти упакованной оптикой (NPO), а жидкостная версия запланирована к выпуску в третьем квартале 2027 года. На конференции также сообщили, что суммарно развёрнуто более тысячи суперузлов, обслуживающих более 370 клиентов.
В качестве фона (вне текущего окна): 8 сентября на PyTorch Conference China 2026 представители Ascend заявили, что Ascend стал первым китайским аппаратным обеспечением, официально поддерживаемым PyTorch, и планируется совместно с PyTorch создать нативный программный стек для суперузлов. Если рассматривать оба факта вместе, позиция Ascend в программной экосистеме повышается, что является попутным ветром для слоя DSL операторов (включая бэкенд TileLang для Ascend).
3. Экосистема и стороны внедрения
3.1 tilelang-mlir-ascend: оператор многоголового внимания TileOPs и адаптивный LayerNorm слиты в main (16.09)
Дата: 16.09.2026 Источник: список коммитов tilelang-mlir-ascend
Вечером 16.09 (близко к передней границе текущего окна) в этот репозиторий был слит коммит «подключить оператор многоголового внимания из TileOPs», а также исправлены недостатки его бенчмарк-скрипта; днём ранее было добавлено ядро адаптивного LayerNorm. Этот же репозиторий переключил CI на метку runner устройств Ascend A3 — это говорит о том, что на стороне Ascend не только пишут операторы, но и переносят верификацию в конвейер реальных устройств.
3.2 Репозитории сторон внедрения в окне молчат: TileKernels, FlashQLA, TileRT — без пушей
Дата: 17.09.2026 (проверка) Источник: deepseek-ai/TileKernels, QwenLM/FlashQLA, tile-ai/TileRT
Согласно контрольному списку данного ежедневного отчёта, во всех трёх репозиториях — стороны внедрения и стороны инференса — в окне не было пушей: последний пуш TileKernels — 23.04.2026, FlashQLA — 26.08.2026, TileRT — 13.08.2026. TileRT не обновлялся уже пять недель подряд и является самым долго молчащим в текущем списке. Это не является негативным выводом, но заслуживает дальнейшего отслеживания — TileRT ориентирован на среду выполнения инференса с низкой задержкой, и длительное отсутствие обновлений лишает нарратив «экосистема TileLang вошла в производственное развёртывание» новых инженерных доказательств.
3.3 Третья сторона: опубликован документ о техническом пути профилирования производительности TileSight (17.09)
Дата: 17.09.2026 Источник: репозиторий tilelang4tilesight-doc
Сторонний разработчик опубликовал набор технической документации по стыковке программ TileLang с инструментом профилирования производительности TileSight; содержание включает извлечение семантики, объёма работы и зависимостей из Python и высокоуровневого промежуточного представления, подключение анализа кэша и конвейера, а также генерацию независимых отчётов и совместных прогнозов на основе наблюдений времени выполнения; в документе проблемы производительности разделены на шесть категорий: узкие места конвейера, аномалии меж-уровневых перемещений, аномалии использования кэша, неудача перекрытия вычислений и обращений к памяти, неравномерность нагрузки, отклонение прогноза модели, — и чётко различаются три степени силы выводов: прогноз модели, наблюдение времени выполнения и недостаток доказательств; основная рассматриваемая платформа — H200. Ценность в том, что инструментальная цепочка наблюдения и тюнинга на стороне TileLang пополняется извне.
4. Сообщество, руководства и мероприятия
4.1 Сайт документации непрерывно синхронизируется с основным репозиторием (17.09)
Дата: 17.09.2026 Источник: список коммитов tilelang.github.io
В окне у сайта документации есть один коммит автоматической синхронизации (17.09 18:37 по пекинскому времени), ранее также было по одному 16.09, 15.09 и 12.09 — ритм в основном совпадает со слияниями в основной репозиторий. Текущая версия сайта — 0.1.14, в разделе инструментов уже есть пункты: инструменты компиляции, профилировщик производительности, визуализация раскладки, автоматическая инкрементная отладка, трассировка понижения промежуточного представления и профилирование операторов. Синхронизация сайта документации относится к роботизированным коммитам, в данном отчёте фиксируется только ритм.
4.2 Линия академии и руководств: статья для ICLR 2026 и руководство по ядрам на Hugging Face (фон, вне окна)
Дата: 2026-04-23 — 2026-05-31 (фон вне окна) Источники: страница постеров ICLR 2026, статья TileLang (arXiv:2504.17577), учебник Hugging Face «Writing High-Performance Kernels in TileLang»
В данном окне ни в arXiv, ни в Hacker News, ни в результатах поиска по китайско- и англоязычным новостям не появилось нового контента, связанного с TileLang, поэтому здесь перечислены только уже существовавшие вне окна академические и учебные материалы для сопоставления читателем: статья утверждает ускорение до 5 раз относительно Triton на H100 и сокращение объёма кода fused attention ядра до 90%; учебник на Hugging Face даёт полное описание от GEMM до multi-head latent attention и фиксирует один реальный выигрыш — некоторая конфигурация модели, ранее не имевшая быстрого пути, после замены на готовое к использованию ядро, написанное на TileLang, перешла из состояния «сразу ошибка» в состояние «можно выводить в продакшн».
5. Наблюдения за тенденциями
5.1 Четыре отечественных бэкенда развиваются параллельно в один и тот же день, адаптация переходит от одностороннего следования к синхронному продвижению
Ascend, MetaX, Hygon и Moore Threads в одном и том же 24-часовом окне совершили приземлённые действия, причём направление highly сходится: все дополняют асинхронную передачу и конвейеризацию (асинхронный копирующий GEMM у MetaX, prefer_async у Hygon, многоступенчатый конвейер у Ascend), все дополняют обычные операторы инференс-цепочки (динамическая квантизация, fused RMSNorm, позиционное кодирование). Это показывает, что адаптация отечественных бэкендов уже не является «ждём, пока upstream выпустит фичу, потом догоняем», а представляет собой в одном и том же раунде самостоятельное достраивание одной и той же группы возможностей.
5.2 Две линии основного репозитория идут параллельно: блочная квантизация под новое железо и восстановление производительности существующих ядер
Два крупных изменения основного репозитория в данном окне противоположны по характеру, но влиты в один день: с одной стороны, для блочно-квантизованного GEMM поколения Blackwell создаётся единая точка входа и специализированная диспетчеризация (во избежание деградации и путаницы путей), с другой — восстанавливается векторизационный откат, вызванный предыдущей переписью (ускорение embedding backward почти вдвое). Блочная квантизация соответствует распространению низкоразрядных форматов типа MXFP8/MXFP4 на стороне инференса, восстановление производительности соответствует постоянно resident ядру инференса с большим словарём — оба относятся не к расширению типа «новый оператор», а к работе над стабильностью и эффективностью на уровне компилятора, что обычно говорит о вступлении проекта в фазу инженерной зрелости лучше, чем точечные операторы.
5.3 Позиционирование TileOPs смещается от библиотеки операторов к production-уровню слоя операторов, сопоставимому с инференс-движками
В данном окне TileOPs одновременно сделал две вещи: во-первых, представил полную таблицу производительности в сравнении с vLLM (опережение на 25,85% на уровне 4096 токенов для GLM-4.5, 16,03% на том же уровне для DeepSeek-V3), во-вторых, чисто отрефакторил выбор ядер и диспетчеризацию сборки и разом унифицировал несогласованные параметры интерфейса. Готовность публично сопоставлять с vLLM по уровням и одновременно признавать, что бенчмарки ранее были недостоверны, говорит о том, что критерии приёмки смещаются в сторону production-готовности; начавшееся прямое подключение операторов TileOPs в репозитории mlir на стороне Ascend — сигнал начала кросс-бэкендового переиспользования этих критериев.
5.4 Пробелы и риски данного окна
Необходимо честно указать на четыре пробела: во-первых, на новостной стороне в течение 24 часов ни в китайскоязычных, ни в англоязычных каналах нет попаданий по самому TileLang, обнаруженный одноимённый шум (переименование продукта базы данных в Tile.ai, не связанный репозиторий обучения с подкреплением 2048) не считается динамикой; во-вторых, репозитории-потребители (TileKernels, FlashQLA) и инференс-рантайм TileRT полностью молчат, причём TileRT не обновлялся уже пять недель; в-третьих, на академической стороне в окне нет новых статей; в-четвёртых, помимо блочной квантизации у Ascend отечественные бэкенды по-прежнему сосредоточены в основном на «достраивании обычных возможностей», данных о производительности с победой над базовыми линиями производителей пока нет, примером чему служит коэффициент ускорения 0,78 у оператора динамической квантизации Ascend — точность проходит, а производительность отстаёт, и в последующих окнах нужно продолжать отслеживать, сойдётся ли это.
Приложение: материалы и пояснения по проверке
Способ сверки: все записи приводятся по времени коммита в репозитории (времени committer), время push в репозиторий и время коммита сверяются отдельно; новые коммиты в данном окне прочитаны построчно по заголовкам и описаниям PR, для ключевых изменений дополнительно прочитаны критерии верификации и данные бенчмарков в основном тексте; для репозиториев с push в ветки (Moore Threads) подтверждение доведено до конкретной ветки, подтверждено отсутствие коммитов в окне в ветке по умолчанию; для сторонних ссылок, текст которых получить не удалось (включая часть страниц СМИ), приведена только ссылка на существование с указанием её характера в основном тексте.
Пояснения по ограничениям: во-первых, GitHub API в процессе локального сбора запускал неаутентифицированный rate limit (60 раз в час), в конце окна проверка сайта документации, репозитория mlir, TileFoundry и TileRT выполнялась через коммиты в репозитории, охват репозиториев был несколько сокращён, способ проверки каждого шага отмечен в основном тексте; во-вторых, фактические данные Ascend и MetaX взяты из описаний коммитов и текстов PR, локально соответствующего железа нет, независимое воспроизведение не проводилось; в-третьих, отраслевая динамика взята из публичных сообщений, первоисточники официальных анонсов производителей не получены.
Таблица проверки источников
| Источники | Результат проверки |
|---|---|
| Организация tile-ai (28 репозиториев) | В окне мониторинга были пуши в 9 репозиториях |
| Проверка детализации коммитов | tilelang — 4, tilelang-ascend — 6, TileOPs — 3, tilelang-metax — 2, tilelang-hygon — 1 |
| tilelang-musa | В ветке по умолчанию нет коммитов в окне мониторинга, пуши находятся в ветке обратного портирования v0.1.12+musa.1 |
| tilelang-mlir-ascend | В окне мониторинга пушей нет, последний — 09-16 вечером (за час до границы окна) |
| TileFoundry / DeepStack / tilescale | В окне мониторинга пушей нет, последние — 09-15 / 09-15 / 08-25 соответственно |
| TileRT | В окне мониторинга пушей нет, последний — 2026-08-13, пять недель подряд без обновлений |
| Репозитории потребителей TileKernels / FlashQLA | В окне мониторинга пушей нет, последние — 2026-04-23 / 2026-08-26 соответственно |
| Google News RSS (несколько запросов на китайском и английском) | Тематические слова и названия компонентов дали ноль совпадений в окне мониторинга; совпавшие переименование TileDB и репозиторий обучения с подкреплением 2048 являются одноимённым шумом и были исключены |
| Каналы отраслевых новостей | Доступны две репортажные заметки с места проведения Huawei Connect 2026, включена 1 |
| Hacker News | В окне мониторинга нет обсуждений, связанных с TileLang |
| arXiv | В окне мониторинга нет новых статей, основная статья — существующая версия v2 |
Полный список источников
- [1] Основной репозиторий TileLang — https://github.com/tile-ai/tilelang
- [2] tilelang #3237 Блочная семантика квантованного GEMM и диспетчеризация бэкендов — https://github.com/tile-ai/tilelang/pull/3237
- [3] tilelang #3238 Планирование ширины атомарных векторов по целевому адресу — https://github.com/tile-ai/tilelang/pull/3238
- [4] tilelang #3219 Атомарное сложение сохраняет скалярность при несмежных целевых адресах — https://github.com/tile-ai/tilelang/pull/3219
- [5] tilelang #3229 JIT: добавлено сопоставление типов параметров uint64 — https://github.com/tile-ai/tilelang/pull/3229
- [6] Сайт документации tilelang — https://tilelang.com
- [7] Список коммитов tilelang.github.io — https://github.com/tile-ai/tilelang.github.io/commits/main
- [8] TileOPs #2141 Индекс MoE для пути малых маршрутизирующих экспертов — https://github.com/tile-ai/TileOPs/pull/2141
- [9] TileOPs #2145 Диспетчеризация GEMM переведена на выбранный класс — https://github.com/tile-ai/TileOPs/pull/2145
- [10] TileOPs #2146 Рефакторинг выбора ядер и диспетчеризации сборки — https://github.com/tile-ai/TileOPs/pull/2146
- [11] tilelang-ascend #1699 Оператор прямого прохода NSA — https://github.com/tile-ai/tilelang-ascend/pull/1699
- [12] tilelang-ascend #1700 Оператор прямого прохода NSA с переменной длиной — https://github.com/tile-ai/tilelang-ascend/pull/1700
- [13] tilelang-ascend #1688 Оператор динамического квантования — https://github.com/tile-ai/tilelang-ascend/pull/1688
- [14] tilelang-ascend #1673 Фьюжн-оператор RMSNorm с динамическим квантованием — https://github.com/tile-ai/tilelang-ascend/pull/1673
- [15] tilelang-ascend #1580 Оператор вращательного позиционного кодирования — https://github.com/tile-ai/tilelang-ascend/pull/1580
- [16] tilelang-ascend #1603 Документация и тесты merge_sort — https://github.com/tile-ai/tilelang-ascend/pull/1603
- [17] tilelang-metax #156 GEMM с асинхронным копированием MACA — https://github.com/tile-ai/tilelang-metax/pull/156
- [18] tilelang-metax #157 Исправление дефектов тестирования — https://github.com/tile-ai/tilelang-metax/pull/157
- [19] tilelang-hygon коммит 36db42e1 — https://github.com/tile-ai/tilelang-hygon/commit/36db42e1
- [20] Список веток tilelang-musa — https://github.com/tile-ai/tilelang-musa/branches
- [21] Список коммитов tilelang-mlir-ascend — https://github.com/tile-ai/tilelang-mlir-ascend/commits/main
- [22] Список коммитов TileFoundry — https://github.com/tile-ai/TileFoundry/commits/main
- [23] Репозиторий TileRT — https://github.com/tile-ai/TileRT
- [24] deepseek-ai/TileKernels — https://github.com/deepseek-ai/TileKernels
- [25] QwenLM/FlashQLA — <https://github.com/Q
wenLM/FlashQLA>
- [26] Репозиторий документа с техническим планом профилирования производительности TileSight — https://github.com/superAngGao/tilelang4tilesight-doc
- [27] Репортаж с места проведения Huawei Connect 2026: досрочный выпуск Ascend 960 и использование NPO оптического движка в Atlas 960 — http://www.stnn.cc/detail/6aab5f30158f681db4eff237.html
- [28] Ascend 960 запланирован на первый квартал 2027 года (перепечатка NetEase) — https://www.163.com/dy/article/L71E8QBV0514EMD3.html
- [29] Официальный сайт Huawei Connect 2026 — https://www.huawei.com/cn/events/huaweiconnect
- [30] Статья о TileLang (arXiv:2504.17577) — https://arxiv.org/abs/2504.17577
- [31] Страница постера ICLR 2026 — https://iclr.cc/virtual/2026/poster/10010186
- [32] Руководство Hugging Face «Writing High-Performance Kernels in TileLang» — https://huggingface.co/blog/AtlasCloud-AI/writing-high-performance-kernels-in-tilelang