Отчётный период: с 21 сентября 2026 года (понедельник) по 25 сентября 2026 года (пятница), всего 5 рабочих дней, материалы 5 выпусков ежедневного отчёта (соответствует 39-й неделе ISO) Источники материалов: 5 выпусков ежедневного отчёта TileLang за каждый день (09-21, 09-22, 09-23, 09-24, 09-25); дополнительно проведена проверка с 168-часовым окном по 29 репозиториям организации tile-ai и перекрёстная сверка метаданных релизов по каждому репозиторию (подробности в приложении)


1. Главные события недели

  • Два релизных PR TileRT влиты за один день, v0.1.6 приносит GLM-5.2/5.3 на AMD Instinct MI350X/MI355X (09-24): по пекинскому времени 09-24 вечером в 20:22 и 23:33 TileRT последовательно влил два релизных PR — v0.1.5.post3 (#63) и v0.1.6 (#68). В описании релиза v0.1.6 указано добавление поддержки GLM-5.2/5.3 на AMD Instinct MI350X/MI355X (путь ROCm), а также включены обновления, связанные с разделением префилл- и декодинг-фаз (PD); в тот же день одиночный PR по перекрытию производительности копирования KV-инъекции между парами устройств на стороне PD #66 был закрыт, а его содержимое вошло в нарратив данного релиза. Границы: по состоянию на проверку в конце данного периода страница GitHub Releases и теги TileRT всё ещё остаются на v0.1.5.post2 (2026-08-06), страница релизов отстаёт от релизных PR, публично доступная версия ещё не обновлена.

  • Точное преобразование FP4 в FP8 влито в основной репозиторий, ускорение экспертного GEMM для DeepSeek V4.1 до 5,38 раза (09-22): PR основного репозитория tilelang #3204 был влит 09-22 в 19:36 (открыт 09-11, доработка 11 дней, добавлено 161 строка). Изменение объединяет стандартную цепочку преобразования «веса E2M1 (FP4) через промежуточное FP32 в E4M3 (FP8)» в две инструкции __byte_perm на каждые четыре элемента, охватывая скалярную и пять векторных ширин 2, 4, 8, 16, 32; всё выполняется внутри регистров без дополнительного выделения видеопамяти. На H100 диапазон ускорения по двенадцати конфигурациям составил от 2,97 до 5,38 раза (например, 1×2304×5120 с 547,94 микросекунды до 108,65 микросекунды, 2048×5120×2304 с 1760,22 микросекунды до 591,92 микросекунды), использование регистров выросло с 128 до 156, без переполнения. Верификация охватывает тесты генерации исходного кода, побайтовое сравнение кодирования каждого упакованного слова и текущий головной CI для CUDA/ROCm/Metal/CuTeDSL; границы: выполнение на Blackwell и обслуживание полной модели пока не проверены.

  • TileSight официально открыт: аналитическая модель производительности с центром на тайлах перешла из статьи в официальный репозиторий (09-23): 09-23 в 22:54 новый репозиторий TileSight организации tile-ai завершил первый коммит (177 файлов, около 56,7 тыс. строк, лицензия MIT), общее число репозиториев организации выросло с 28 до 29; обещание «открыть исходный код после публикации», данное в конце статьи на arXiv от 24 июля (2607.22432), тем самым выполнено. Репозиторий охватывает более 20 профилей оборудования (дискретные видеокарты NVIDIA, AMD Instinct и Intel Arc), модель расстояния повторного использования многоуровневого кэша, анализ перекрытия конвейера и микробенчмарк-зонды CUDA/HIP; по данным статьи: средняя абсолютная процентная ошибка объединённой задержки ядра на одной карте для четырёх поколений платформ от A100 до B6000 составляет 12,35%, при расширении до кластера из 32 карт взвешенная ошибка для объединённых распределённых ядер и end-to-end обслуживания vLLM составляет 16,18% и 13,52% соответственно.

  • TileOPs — 21 влитый коммит за неделю: объединение управленческой линии и пик сезона производительности идут параллельно (09-21 ~ 09-24): за данный период в TileOPs всего около 21 влитого коммита. Линия управления: крупный PR с формулами roofline roofline #2158 сделал формулы манифеста единственным источником исполнения и исправил ошибки в 15 классах формул (охватывает 175 реализованных операторов), затем #2167 демонтировал последний обходной путь, а #2175 превратил сбои синтеза в адресные отчёты — «инженерия доверия к измерениям» замкнулась; линия производительности: 09-23 за один день семь влитых коммитов (семь подсистем: GEMM, Engram, внимание, MoE, Mamba, mHC, линейное внимание), среди них оператор вывода DeltaNet (#2163) на H200 показал ускорение до 3,7 раза по сравнению с FLA; управление каналами и сжатие интерфейсов продвигаются синхронно (подробности в разделе 4).

  • Контент цепочки k-пула GLM-5.3 влит в основную ветку: полный набор примеров и 4 тестовых ресурса AMD вошли в состав (вечер 09-20): 09-20 17:06, tilelang #3254 влит в сжатом виде (11 файлов, +2520/-4), внося серию k-пула предыдущего цикла в основную ветку: examples/kpool/ четыре запускаемых примера (пулинг softmax внутри пула, BF16 туда-обратно с нормализацией Адамара, квантование FP8, обратное чтение страничного кеша и взвешенные баллы MQA с 32 головами) плюс четыре теста ROCm; на языковом уровне в tilelang/language/fp8.py выбор dtype FP8 изменён на возможность указания по устройству. Проверка: exact-head CI полностью зелёный, ROCm 7.2 на MI300X сообщает о 2433 пройденных пунктах. Границы: в стеке #3250, #3251, #3253, #3255 — четыре открытых PR не завершены (содержимое уже в основной ветке), к концу данного цикла завершающих действий не наблюдается.

  • Углубление исправлений в основном репозитории: 6 вливаний за день, расчистка Fuzzer, перехват тихих ошибок AllReduce и двустороннее замыкание семантики NaN (09-21 ~ 09-24): в основном репозитории за всю неделю 14 вливаний, образующих три уровня глубины — фронтенд компилятора и границы (два исправления ICE Fuzzer 3206/3207, исходные PR, открытые одним и тем же репортёром 08-17 в тот же день, точечно расчищены), слой обёртки времени выполнения (исправление NVRTC #3260), генерация кода и планирование (проверка шага AllReduce #3266 перехватывает тихие ошибки «работает, но молча считает неверно»). 09-24, двустороннее замыкание семантики распространения NaN (#3273 ошибка на этапе компиляции + #3205 исправление понижения clamp, два дефектных PR закрыты), в тот же день оформилась цепочка рефакторинга SIMT im2col и асинхронного промежуточного хранения (#3274 → #3275 → #3279).

  • Недельный цикл «вливание — откат — восстановление» у Ascend; дефект на реальном железе A5 предан огласке (09-20 ~ 09-24): после 11 вливаний за один день 09-20 (крупнейший — #1753, 72 файла, +10117/-3618, исправление строчной редукции FP32 и синхронизации), 09-22 наступили три пакетных отката (#1818 точно отзывает #1753), 09-24 завершилось ежедневным тестом 2448/2448 — вся цепочка «вливание, провал проверки, откат, восстановление до полной зелёнки» пройдена за два дня. Одновременно 09-23 открыты три дефектных PR, среди которых #1830 указывает, что на реальном Ascend 950 (dav-3510) путь устройства компилируется с меткой поколения 910B, при запуске сразу сообщает об исключении устройства, а после смены метки молча считает неверно, обнажая слепую зону обхода матрицы проверки: «реальное железо покрывает поколение 910B, симуляция покрывает поколение 950».

  • Мультибэкенд и экосистема: поддержка примеров Hygon влита, ежедневные обновления MetaX, релиз Sunrise, молчание Moore Threads (09-21 ~ 09-24): Hygon поддержка примеров #11 влита 09-23 (37 файлов, +1104/-130, GEMM переведён на встроенные инструкции матричного ядра HCU), #12 влит 09-24 (разделение K в FP32 MMAC и упаковка фрагментов ds_read); MetaX завершил синхронизацию с upstream main (#158) и открыл исправление защиты подwarp (#159); Sunrise 09-21 выпустил 0.1.14+sunrise.1.1.0 (расширение системы CI и исправление sparse mask); репозиторий Moore Threads молчал всю неделю (последний push 09-17), механический пробел его внешнего бэкенда компенсируется групповым управлением очередью TileOPs.


2. Прогресс основных проектов (основной репозиторий tilelang)

Версии и релизы

  • Последний тег основного репозитория по-прежнему v0.1.14 (выпущен 09-02), к концу данного цикла новый релиз не выпускался уже 23 дня, приближаясь к предыдущему интервалу выпуска около 30 дней; за весь цикл во всей организации новый релиз был только у Sunrise (09-21), два релизных PR TileRT уже влиты, но страница релизов не обновлена (см. раздел 4).
  • Появилось жёсткое ограничение снизу: TileOPs начиная с #2172 устанавливает для tilelang нижнюю границу версии >= 0.1.14 (в pyproject.toml добавлена нижняя граница и принудительно в скрипте установки), ритм выпуска версий и окно принятия у downstream-потребителей начинают взаимно сдерживать друг друга.
  • Теги линий адаптации за всю неделю не менялись: Ascend v0.1.2.000 (09-09), MLIR Ascend v0.1.2.020.sglang.poc (09-09), Moore Threads v0.1.14+musa.1 (09-11), MetaX v0.1.14 (09-17).

Языковой уровень и фронтенд

  • Pythonic-фронтенд (#3230, влито 09-21): циклы времени компиляции принимают итерируемые объекты и генераторы Python, 5 файлов +1084/-24 (включая 766 строк новых тестов), даёт явный отказ при неправильном использовании PrimExpr, Buffer и т. п.; одновременно закрыты два давних запроса на функции (ForFrame не итерируем, индексация списка выражений T.unroll).
  • Исправление привязки цели цикла (#3232, влито 09-23, +196/-14): для целей цикла (включая кортежные цели) устанавливается явная привязка, чтобы избежать записи индукционной переменной в существующую привязку; баг-репорт #3231 закрыт вместе с вливанием.
  • Ограничение ширины копирования (#3246, влито 09-23): coalesced_width для T.copy и T.async_copy изменён с «фатальный лог при неделимости» на ограничение по достижимой ширине вектора — предупреждение при понижении, отказ при неположительном значении; баг-репорт #3007 закрыт.
  • Две линии семантики распространения NaN (влито 09-24): #3273 добавляет ошибку времени компиляции для неподдерживаемых dtype распространения NaN при редукции (диагностика указывает имя операции, поддерживаемые типы вывода и dtype аргументов, проверка встроена в конструктор нативного ReduceOp); #3205 корректно понижает распространение NaN в T.clamp до шаблона устройства. Первый происходит из отчёта #3270, второй — из баг-репорта фаззинга #3024, оба закрыты вместе с вливанием.
  • Уборочные: #3262 удаляет предупреждение о перепривязке неизменяемых переменных (влито 09-21, чистое удаление 14 строк).

Компилятор, генерация кода и среда выполнения

  • Fuzzer закрывает два счёта (влито 09-22): #3206 понижает обычный assert в теле ядра до допустимой проверки на стороне устройства (ранее вызов сообщения об ошибке на стороне хоста попадал в ядро __global__, и nvcc прямо отказывался компилировать, исходный тикет #3019); #3207 исправляет падение во время вызова «динамические выходные формы располагаются перед входными формами-задатчиками» (исходный тикет #3017).
  • Перехват тихих ошибок AllReduce (#3266, влито 09-21): проверка шага XOR-бабочковой редукции объединена в CheckAllReduceWidth, в шаблон добавлены статические утверждения, планировщик для неподдерживаемых форм откатывается на широкую схему — перехвачен класс ошибок «выглядит работающим, но при ровно 96/192 потоках происходит выход за границы обмена через разделяемую память».
  • Линия NVRTC: #3260 исправляет проблему компиляции warp-редукции (влито 09-22, около 14,5 часов от открытия до исправления); затем #3265 (опускание целочисленных операций стартового инварианта на сторону хоста), #3263 (обёрточный слой пропускает скаляр хоста) на рассмотрении.
  • Деление при динамических формах: запрос на функцию #3261 и реализация #3267 (tl.LowerMagicDiv, магическое деление, предвычисление по значению делителя во время выполнения) продолжают обновляться, ожидают вливания.
  • Трёхуровневая прогрессия SIMT im2col и асинхронного промежуточного хранения (09-24): баг-репорт производительности #3274 (момент понижения слишком поздний, упущены возможности планирования и векторизации) → через три минуты патч #3275 (вынести загрузку до планирования для раскрытия) → ранним утром 09-25 черновик рефакторинга #3279 («унифицированное асинхронное промежуточное хранение и передача с учётом понижения», экспериментально: разделение логического доступа и физического понижения, анализ разделяемой передачи, планирование ожидания конвейера и расширение векторизации). В тот же день влито #3278 (исправление понижения асинхронного копирования при блочной раскладке); на рассмотрении #3276 (сохранение упаковки векторного копирования FP8).
  • Инженерное сопровождение: #3268 (CMake сохраняет пути SDK, задаваемые переменными окружения бэкенда) открыт, ожидает рассмотрения.
  • Бэкенд исполнения CUDA Tile IR (#3247): за неделю вырос с 8 коммитов до 31, +36506/-112, 139 файлов, охватывает JIT, кэш, автотюнинг и ядро тюнинга разреженного внимания DeepSeek V4, всё ещё на ревью — состояние «добавлено, но не утверждено» продолжается.

Производительность

  • Слияние преобразования FP4→FP8 (#3204, см. главные новости): на H100 ускорение в 2,97–5,38 раза для двенадцати конфигураций; валидация на четырёх уровнях (генерация исходников, посимвольное сравнение, побитовая идентичность вывода, кросс-платформенный CI).
  • Линия блочного масштабирования SM120 (09-21): от заявки #3256 до патча #3257 прошёл всего 21 минута (fragment A, сетка с нечётными warp и компактное масштабирование), маршрут задан реальными потребностями SageAttention3; #3257 ожидает ревью.
  • Наблюдение за ритмом: большинство мелких исправлений за неделю — «заявка в тот же день, закрытие в ту же неделю» (два патча Fuzzer, один патч NaN в тот же день), а центр реального прироста по-прежнему в очереди на ревью.

Наблюдение за очередью ревью

  • Накопление крупных задач: бэкенд TileIR (#3247, 31 коммит), магическое деление (#3267), инварианты запуска (#3265), четыре патча CuTeDSL и RNG (пакетное обновление #3241–#3244), перехват комбинаций dtype для GEMM (#3245), патч SM120 (#3257) — картина «мелкие исправления утверждаются, крупные изменения копят материал» сохранялась всю неделю.
  • Наследие стека пула k — четыре патча (#3250, #3251, #3253, #3255): содержимое уже вошло в основную ветку через #3254, заявки не закрыты, несколько дней без движения, требуется закрыть через rebase или закрытие.
  • Связь очереди и релизов: после того как TileOPs установил нижнюю границу >= 0.1.14, связь между окном релизов основного репозитория (уже заполнено 23 дня) и темпом принятия в downstream стала кросс-репозиторной переменной.

3. Мультибэкендная адаптация (Ascend / MetaX / Hygon / Moore Threads и др.)

Ascend: три акта одной недели — день слияния, день отката и день восстановления

  • 09-20 (день плотных слияний): 11 слияний за один день (09:36–16:29) — крупнейшее #1753 (72 файла, +10117/-3618: реализация построчных max/min/sum для FP32 с известными на этапе компиляции формами и исправление двух типов дефектов автосинхронизации); группа исправлений корректности #1804 (stride среза строк, исправление повреждения данных из-за усечения uint16 на 910B2), #1809 (асинхронное чтение-запись block_sparse_mqa_attn); группа операторов и документации #1621 (пример mhc_pre) и серия документации из 6 патчей.
  • 09-21 (проявление хвоста): #1633 (mhc_bwd, пример неявного сопряжённого градиента Sinkhorn), находившийся на ревью две недели, слит в 17:16, ускорение на последовательностях 2048/4096 составило 3,1%, проверка эталонным CG включена в критерий PASSED; открыты два новых исправления #1821, #1822; появились ежедневная заявка о сбоях тестов #1817 и два сопровождающих PR (#1815, #1816).
  • 09-22 (день отката): последовательно слиты три отката — #1818 точно отозвал #1753 (72 файла, +3618/-10117, точная симметрия), #1819 и #1820 отозвали два улучшения документации; ежедневные тесты #1823 восстановлены с полным прохождением 2448/2448 (для сравнения: базовая линия до волны слияний — 1936, прирост 512 пунктов не откатился).
  • 09-23 (трио дефектов): два отката примеров mHC (#1832, #1833, оба пробыли в репозитории менее трёх дней); три заявки о новых дефектах — #1830 (путь устройства A5 компилирует реальный Ascend 950 (dav-3510) с фиксированной меткой dav-2201, ядро при запуске сообщает об исключении устройства 507015, после смены метки тихо считает неверно; матрица проверки в README как раз двусторонне обходит эту метку), #1824 / #1825 (две границы автосинхронизации: ошибочное объединение состояний синхронизации условных ветвлений, смешанные конфигурации должны отклоняться на этапе компиляции); открыто решение #1834 для исправления гонки при скалярном сохранении в GM (число несовпадений в скрипте воспроизведения снижено с 12 967 510 до 3 496 136, при включении opt-in пути перезаписи — до нуля, 113 существующих наборов тестов проходят).
  • 09-24 (продвижение восстановления): слит #1741 — пример разреженного FlashAttention (создан 09-04, ревью две недели), #1829 — оптимизация векторной маски и построчной редукции FP32, #1826 — восстановление тестов Select/Transpose и проверки на месте; ежедневные тесты #1835 с полным прохождением 2448/2448; очередь проверки документации API — пакетное обновление около 10 патчей (основная часть висела с середины августа); #1828 (миграция операторов), #1834 ожидают ревью.
  • Трактовка: стоимость валидации крупных слияний была оплачена напрямую — от слияния, сбоя валидации, отката до восстановления и полной зелени весь цикл занял менее двух дней; проверка на реальном железе A5 показывает, что межпоколенческая адаптация оборудования переходит от этапа «компилируется» к этапу «готовы калибровать на реальной машине».

MLIR Ascend (tilelang-mlir-ascend): крупное слияние Mamba и очистка ветки A5

  • 09-20: #187 (инфраструктура бенчмарков и отчётности TileOPs, около +5,4 тыс. строк) и #188 (оптимизированные операторы Mamba и выбор модели для каждого агента) — оба вошли в основную ветку.
  • 09-22: #191 — оптимизация экспертного ядра NPU для блочного сканирования Mamba-2 SSD влита (42 файла, +4204/-1568, от открытия до влития около 3,5 часов); результаты тюнинга закреплены в библиотеке шаблонов и записях кейсов.
  • 09-23: #178 — исправление утечки памяти и синхронизации потоков в NPU launcher влито (rtMalloc переведён на потоково-осведомлённое выделение, унифицирован путь запуска).
  • 09-24: массовое удаление четырёх веток разработки A5 (соответствующие PR по синхронизации закрыты); #130 (синхронизация тестов A5) всё ещё открыт; #189, #190 ожидают проверки.

Hygon: поддержка примеров влита, исправление раскладки данных матричного ядра

  • Поддержка примеров #11 влита 09-23 (37 файлов, +1104/-130: адаптация autotune и конфигурации LDS, устранение конфликтов раскладки ядра, перевод GEMM на встроенные инструкции матричного ядра HCU, добавление регрессионного покрытия) — этап «запуск набора примеров TileLang на HCU» на стороне Hygon завершён влитием.
  • Ветка функций продвинулась дважды: FP32 MMAC с общим K и упаковка ds_read (09-21) → расширение до версии из пяти файлов и очистка обходного кода экспорта FP8 из tvm_ffi (09-22).
  • #12 влит 09-24: измерение K общего FP32 MMAC и упакованный фрагмент ds_read_format.

MetaX: синхронизация с upstream и защита подгрупп warp

  • 09-21: main перемотан вперёд до последнего upstream eab74a4a (синхронизация накоплений upstream почти за три недели).
  • 09-24: #158 (синхронизация upstream main в dev, включая разрешение конфликтов) влит; #159 (защита размера блока подгруппы warp в T.gemm_sp) открыт и ожидает проверки.

Moore Threads (MUSA): всю неделю тишина, управление переведено в очередь библиотеки операторов

  • Последний push в репозитории tilelang-musa был 09-17, в этом периоде новых действий нет; механистические пробелы подключения внешнего бэкенда MUSA (три issue #2164–#2166: проверка входных данных только для CUDA, отклонение нулевых входов, запрос устройства CUDA перед диспетчеризацией) приняты на себя групповым управлением TileOPs (см. раздел 4), три тикета продолжают обновляться в окне.

Прочее: Sunrise выпускает 0.1.14+sunrise.1.1.0

  • 09-21 выпущен тег новой версии (ветка-кандидат отправлена в 11:06 → PR релиза #6 влит в 15:33 → проставлен тег): содержание в основном инженерное — исправлено выполнение sparse mask, остановка CI после сбоя восстановления устройства; CI-система значительно расширена (скрипты run/install/junit переводятся в JSONL); добавлены бенчмарк скорости компиляции и документация инструментов compile-only и lower-trace; обновлены переключатель z3 prover и целочисленный анализ.

4. Экосистема и стороны внедрения

TileOPs: неделя из 21 влития — смыкание управления, пик сезона производительности и управление каналами

  • Консолидация управления: #2158 (влит 09-21) делает формулу реестра roofline единственным источником исполнения (один источник, одна поверхность вычисления), исправляет 15 типов ошибок формул и заставляет структурный оракул пересчитывать 175 операторов на каждый PR; #2167 (влит 09-22) демонтирует последний обходной путь «молчаливого уступания для записей с определённым методом вычисления» и добавляет явные сообщения об ошибках для двух типов неправильного использования; #2175 (влит 09-24) превращает сбой синтеза формул в адресный отчёт (полная проверка без необходимости окружения torch); #2161 (issue) фиксирует, что helper реестра shape_rules никогда не вычисляется, 234 правила молча пропускаются, решение об исправлении ожидается.
  • Пик сезона производительности: 09-23 за один день семь влитий — порядок предварительно упакованных весов W4A16 (#2168), разделение декодирования Engram (#2173, 8,2-кратное ускорение на 4 уровнях батча), миграция унифицированного оператора varlen GQA (#2160), группировка избыточной маршрутизации MoE по 16 строкам (#2169, рост до уровня 0,99 относительно vLLM), Mamba DaCumsum (#2176), разбиение проекции предзаполнения mHC вдоль K (#2177), оператор вывода DeltaNet (#2163); 09-24 дополнительно вошли оператор вывода GLA (#2174) и декодирование SM90 DeltaNet (#2194), семейство линейного внимания дополнено в нескольких точках «сторона обучения → сторона вывода → декодирование платформы → метрология модели производительности»; вошёл потоковый режим W4A16 с длинным K (#2185); в очереди продолжают продвигаться основной цикл пинг-понга GEMM и 176 тайлов (#2172), тройка предварительного планирования varlen GQA (#2178 / #2180 / #2184), переписывание ядра FFT (#2187).
  • Управление каналами (внешние бэкенды): #2179 (влит 09-24, +797/-256) демонтирует около 38 проверок типа устройства на уровне операторов, перенося объявление устройства ядром на уровне тензоров, и добавляет lint-хук для предотвращения возврата; #2181, #2183 (переключение цели тестирования по умолчанию, запуск поведенческих тестов операторов на всех бэкендах), #2186 (исправление зависания предзаполнения DeltaNet и аномалии roofline GEMM), #2193 (исправление задержки входной памяти) влиты в том же окне; #2182 (issue) фиксирует пробел в протоколе BuildKernel, ожидает расширения.
  • Сжатие интерфейсов: четыре связанных черновика очистки устаревших путей — #2196 (удаление бесхозного ядра GDN), #2197 (удаление устаревшего varlen GQA), #2200 (удаление устаревшего пути вывода GLA), #2201 (переименование оператора GLA), а также #2198 / #2199 / #2202 / #2203; #2195, #2205, #2180 закрыты без влития (продвижение через разбиение содержимого).
  • Толкование: бухгалтерская книга, оставленная управлением, превращается в кредитный актив работы над производительностью — каждый набор производительности несёт собственный эталон сравнения (torch.compile, cuBLASLt, vLLM, FLA) и заявление о побитовой идентичности, и может быть независимо проверен реестром и бенчмарками.

Ночной конвейер TileOPs: бенчмарки с 1040 до 1081, корректность стабильно выше 1140

  • В этом периоде видно шесть снимков (соответствующих точкам влития #1996 – #2206): набор бенчмарков стартует с 1040, проходит через 1046, 1050 и достигает 1081; набор корректности — между 1118 и 1141, за исключением одного снимка с пропущенным файлом результатов (позже публикация восстановлена, это упущение при публикации) — везде ноль сбоев.
  • В снимке 09-24 возник таймаут на уровне файла — конфигурация длинного предзаполнения DeltaNet не запустила тест за 900 секунд (стоимость между «функциональным вливанием нового оператора и его выдерживанием бенчмарком» ещё предстоит калибровать); после влития соответствующего исправления #2186 в тот же день снимок 09-25 восстановил ноль сбоев и ноль ошибок.
  • Окружение неизменно всю неделю: H200, CUDA 13.2, драйвер 595.71.05, SM с фиксацией частоты, torch 2.13 — воспроизводимые элементы снимка остаются полными.

TileRT: два релизных PR влиты за один день (подробности в главных новостях)

  • Линия патчей и линия минорных версий идут параллельно: v0.1.5.post3 (создан 09-07) — третий патч линии v0.1.5; v0.1.6 (создан и влит в тот же день, влит участником проекта) объединяет поддержку ROCm (AMD Instinct MI350X/MI355X) для GLM-5.2/5.3 и обновление разделения PD; по сравнению с ритмом августа, где был лишь один релиз, релизный конвейер заметно уплотнился.
  • Страница релизов и теги отстают от релизных PR, в публичных каналах существует информационный разрыв, проверка продолжится в следующем выпуске.

TileFoundry: насыщенная неделя анализа на этапе компиляции

  • 09-21 два влитых коммита: #170 (определение времени жизни буфера с учётом циклов, структурированные SSA-интервалы и ограничения повторного использования, замена суммирования логического времени жизни), #174 (функтор Swizzle в стиле CuTe и специализация алгебры layout, генерация кода CUDA без изменений).
  • 09-22 два влитых коммита: #175 (аналитическая поддержка начала цикла с зависимыми единицами), #176 (нормализация метаданных памяти и трафика, нормативный анализ изменений в одном файле — 263 строки).
  • 09-24 крупное вливание: #179 (объём памяти и окно повторного использования, +3207/-539, 44 файла) — из отношений доступа выводятся оси временного и пространственного повторного использования, выдаётся воспроизводимый вывод о ёмкости в форме «b holds=176.00MB fits=no (в сравнении с 47.68MB L2)»; в тот же день влит #184 (исправление рекурсивного обхода isl).
  • #185 (черновик рефакторинга размещения шардов) в работе; #168, #171, #172, #173, #178 закрыты.

TileSight: модель производительности с центром на тайлах официально открыта (подробности в главных новостях)

  • Разделение задач: TileSight прогнозирует межуровневые затраты на этапе моделирования и дополняет анализ IR на этапе компиляции в TileFoundry; профили оборудования охватывают дискретные GPU AMD и Intel, что естественно обслуживает нарратив мультибэкендности. Трёхэтапное развёртывание (статья 07-24 → репозиторий документации сообщества 09-18 → официальный репозиторий кода 09-23) переводит объяснимость производительности из личной инициативы в организационный проект.

Потребители: TileKernels и FlashQLA всю неделю без пушей

  • Последний пуш TileKernels по-прежнему 04-23; FlashQLA — 09-18 (три вливания SM100/SM120 относятся к предыдущему периоду). Код потребителей не менялся, но их инференс-нагрузки продолжают двигать оптимизации в upstream — влитое на этой неделе слияние FP4→FP8 как раз нацелено на экспертный GEMM DeepSeek V4.1.

5. Сообщество, руководства и мероприятия

Документационный сайт и рутинные обновления

  • Документационный сайт основного репозитория несколько раз получал автоматические коммиты «Update docs» (09-20, 09-21, 09-23, 09-24); документационный сайт TileOPs развёртывался по рутине (09-20 – 09-22, 09-24); всё это автоматическая регенерация, содержательных изменений на сайтах не замечено.

Проекты сообщества: бэкенд TPU, учебный лагерь, учебный репозиторий и SoftHier

  • Репозиторий расширения TPU сообщества (SOPHGO BM1690): 09-22 три коммита — верификация многоядерного блочного сканирования S3/P6, матрица производительности P10, исправление проверки исходников на стороне хоста; этот репозиторий сохраняет Python-фронтенд TileLang и добавляет понижение для TPU, генерацию кода и JIT-рантайм — это первый публичный путь бэкенда TPU в сообществе TileLang.
  • Репозиторий материалов учебного лагеря MetaX C500: 09-22 два коммита — практические упражнения второго занятия «векторное сложение» с сопоставлением TileLang и Jiuge, дополнение рабочего процесса удалённого экземпляра настройкой операционного прокси; учебная серия продвигается по маршруту «окружение → сопоставление сложения → Softmax и GEMM → помощь AI-агента → операторы Llama».
  • Учебный и локализационный репозиторий: tilelang-tutorials добавил примеры группы init_core (три формы фронтенда PTO: чистый Cube, чистый Vector, смешанная, 09-21, автор из Huawei); tilelang-docs-l10n завершил раунд синхронизации переводов README на все языки.
  • SoftHier (ETH Zurich): расширяет TileLang на тайловый многоядерный RISC-V-ускоритель с множеством PE (моделирование GVSoC, семестровый проект под руководством лаборатории Luca Benini) — автор ядра декларирует только «что вычислять и где данные», компилятор выводит размещение кластеров, маршрутизацию коллективных коммуникаций и синхронизацию; SUMMA GEMM с кластером 4×4 и BM=BN=BK=128 (N=7168, K=2048, что соответствует размеру проекции понижения размерности маршрутизируемых экспертов DeepSeek-V3), при M=512 сгенерированный компилятором код — 1.01 ms против 0.96 ms у написанного вручную C (разрыв 5.14%).

Медиа и академическая сторона: ноль попаданий за всю неделю

  • В Google News по нескольким группам запросов на китайском и английском пять окон подряд ноль попаданий; на Hacker News нет тематических записей; на arXiv нет новых препринтов (последняя работа по-прежнему статья о модели производительности TileSight от 07-24 — её код был открыт в этом периоде). Медийная сторона спокойна уже несколько недель подряд, основной контент определяется динамикой организаций на GitHub.

6. Наблюдения за трендами

  • Уплотнение ритма релизов TileRT, вес платформы AMD повышен: патч-линия и линия минорных версий продвигаются в один день, а комбинация ROCm (AMD Instinct MI350X/MI355X) и GLM-5.2/5.3 вынесена на самое видное место в примечаниях к релизу — для позиционирования «сверхнизколатентного инференс-рантайма» покрытие моделей начинает усиливаться параллельно с линией NVIDIA; отставание страницы релизов и тегов — краткосрочная слепая зона, требуется сверить и закрыть в следующем выпуске.
  • Центр тяжести оптимизации смещается в «бухгалтерию каждой инструкции каждого слоя»: 161 строка преобразований и слияний даёт до 5.38-кратного ускорения сквозного прохода, но при условии, что это происходит на многократно читаемом пути весов; вторая волна производительности TileOPs (планирование расписания, разбиение регистров, утилизация сетки, stream-K) также задаётся вопросом «сколько раз читается один и тот же блок данных и на каком уровне кэша он циркулирует» — выигрыш продолжает смещаться в сторону перемещения данных и преобразования форматов.
  • «Сдвиг тихих ошибок влево» расширяется на уровень планирования и временного хранения: двухлинейное распространение NaN, статические утверждения AllReduce, расчистка Fuzzer продолжают принцип семантической валидации; заблаговременное выявление SIMT im2col, разделение логического доступа и физического понижения, унификация асинхронного временного хранения вводят «сначала объявить, потом вывести, неявное в явное» в критический путь производительности, напрямую обслуживая сценарии свёрток, GEMM и mHC.
  • Семейство линейного внимания вступает в период консолидации: за два дня выполнены многоточечные шаги от инференса DeltaNet до инференса GLA и декодирования SM90, сразу после чего открыты четыре черновика «удалить старое, переименовать, свести интерфейсы»; такая уборка обычно предшествует заморозке интерфейсов или версионным действиям — следить, появится ли вслед за этим у TileOPs релизный ритм.
  • Технический долг мультибэкендности становится явным, управление продвигается группами: начинается выстраивание последнего отрезка внешних бэкендов от «умеет регистрироваться» до «умеет планироваться» (три коммита блокируют, 38 проверок демонтированы и добавлен lint против регресса, двусторонняя скоординированная работа); замкнутый цикл «слияние—откат—восстановление» для Ascend пройден за два дня, проверка на реальном железе A5 заводит кросс-поколенческую адаптацию на глубокую воду; Hygon и MetaX сохраняют ежедневный ритм обновлений, Moore Threads продолжает молчать — дифференциация активности среди четырёх игроков.
  • Объяснимость производительности повышается до организационного актива: TileSight проходит путь от статьи до официального репозитория, TileFoundry доводит анализ времени компиляции до воспроизводимых выводов о ёмкости — помимо библиотеки операторов и рантайма степень проработанности аналитических инструментов становится дифференцирующим активом TileLang и обеспечивает базу моделирования для мультибэкендного нарратива.
  • Точки внимания следующего выпуска: окно релиза основного репозитория (уже 23 дня) и вопрос о выходе крупных компонентов TileIR; форма переработки откаченного Ascend #1753 и график решения проблем корректности вывода на A5; сопровождение страницы релизов и тегов TileRT; вызовет ли слияние черновиков расчистки TileOPs версионные действия; завершение четырёх коммитов стека пула k.

Приложение: материалы и пояснения по проверке

  • Материалы: 5 выпусков ежедневного отчёта TileLang за 09-21 — 09-25, окно мониторинга с 09-20 07:00 по 09-25 07:00 (пекинское время); выпуск 09-21 охватывает 24 часа начиная с утра 09-20, включая такие пункты, как слияние цепочки пула k вечером 09-20. Динамика выходных после этого периода (09-26 — 09-27) будет включена в ежедневный отчёт следующего понедельника.
  • Дополнительная проверка (окно 168 часов, на момент составления отчёта): из 29 репозиториев организации tile-ai в окне было 13 с пушами (tilelang, TileRT, TileOPs, TileOPs-nightly, TileFoundry, TileSight, tilelang-ascend, tilelang-metax, tilelang-hygon, tilelang-mlir-ascend, tilelang-sunrise, tilelang.github.io, TileOPs.github.io); метаданные релизов и тегов перепроверены по каждому репозиторию; время последних пушей сверено с репозиториями потребителей и смежными (TileKernels 04-23, FlashQLA 09-18, tilelang-musa 09-17).

Таблица проверки источников

Источники Результаты проверки
Организация tile-ai (29 репозиториев) В окне мониторинга были пуши в 13 репозиториев; новый репозиторий TileSight выполнил первый коммит (177 файлов, около 56,7 тыс. строк)
Основной репозиторий tilelang За всю неделю 14 влитых изменений (с вечера 09-20 по 09-24); крупные рецензируемые элемены (бэкенд TileIR 31 коммит, магическое деление, очередь RNG и т. д.) продолжают накапливаться
TileRT PR для релизов v0.1.5.post3 и v0.1.6 влиты; страница релизов и теги всё ещё остаются на v0.1.5.post2
TileOPs За всю неделю 21 влитое изменение, несколько новых и закрытых; ночные снимки корректности с 1118 по 1141, бенчмарки с 1040 по 1081 (один таймаут на уровне файла был исправлен)
TileFoundry 6 влитых изменений (#170, #174, #175, #176, #179, #184); черновик #185 продолжает отслеживаться
Ascend Замкнутый цикл из трёх актов: влито 11 изменений (09-20) → откат 5 изменений (09-22, 09-23) → восстановление 2448/2448 (09-24); заведены тикеты по дефектам A5 и дефектам границ синхронизации
MLIR Ascend Несколько изменений с #187 по #191 влиты и очищена ветка A5; #130 всё ещё открыт, #189/#190 ожидают ревью
Hygon / MetaX Hygon #11, #12 влиты; MetaX #158 влит, #159 открыт
Moore Threads / Sunrise Moore Threads без пушей (последний 09-17); Sunrise выпустил 0.1.14+sunrise.1.1.0
Потребители (TileKernels, FlashQLA) За всю неделю без пушей (последние 04-23 / 09-18)
Репозитории сообщества TPU-расширение, материалы тренировочного лагеря, учебный репозиторий, SoftHier — у каждого есть обновления
Медийные и академические каналы Google News / Hacker News / arXiv за всю неделю ноль попаданий
  • Методика и границы: все данные о производительности взяты из описаний влитых изменений или из текста PR (измерения на H100, H200), у нашего издания нет соответствующего оборудования, независимое воспроизведение не проводилось; ночные бенчмарки — это запись одного прохода конвейера, а не сравнительное тестирование; статус релизов проверен по метаданным релизов в соответствующих репозиториях (на момент составления данного отчёта), отставание страницы релизов TileRT от релизного PR относится к темпу процесса релизов на стороне репозитория и не означает недействительность содержания релиза.
  • Рекомендуемый период следующего выпуска: 2026-09-28 ~ 2026-10-02.

Основные ссылки

sunrise.1.1.0>

Источники данных: ежедневные отчёты о динамике TileLang (пять выпусков с 2026-09-21 по 2026-09-25) и фактическая проверка в данном периоде; период отчёта — с 21 по 25 сентября 2026 года.