Ежедневный отчёт TileLang (2026-09-23)
Окно мониторинга: последние 24 часа (2026-09-22 07:00 ~ 2026-09-23 07:00, пекинское время). Этот выпуск — стандартное ежедневное окно, без пересечения с предыдущим выпуском. Источники: GitHub (проверка 28 репозиториев организации tile-ai, в окне зафиксированы пуши в 7 репозиториях; в основном репозитории 1 слияние и 1 новый PR, несколько обновлений очереди ревью; TileOPs — 1 слияние и 5 новых PR, 4 закрытых; TileFoundry — два слияния; MLIR Ascend — крупное слияние Mamba; Hygon — продвижение по двум ветвям с обновлением PR поддержки примеров; общественный репозиторий бэкенда TPU — многопроцессорная проверка BM1690; ежедневный тестовый рабочий процесс Ascend — сбой уровня workflow и отчёт о дефектах аппаратного пути A5; ночной снимок — 1046 бенчмарков с нулём сбоев, 1141 проверка корректности с восстановленным релизом), Google News RSS — несколько групп запросов на английском и китайском (через прокси, ноль совпадений), Hacker News, arXiv, репозитории сторонней экосистемы
Индекс этого выпуска
- Главное за сегодня: точное преобразование FP4 в FP8 влито в основной репозиторий — экспертный GEMM DeepSeek V4.1 ускоряется до 5,4 раза (09-22)
-
- Прогресс ключевых проектов
- 1.1 Очередь ревью основного репозитория: новый PR исправления параллельных циклов, 8 коммитов в бэкенд TileIR (09-22)
- 1.2 Управление TileOPs завершено: последний обходной путь для пунктов списка и вычислителя демонтирован (09-22)
- 1.3 Спринт производительности TileOPs, часть первая: декодирование Engram разделено на два ядра — проекция и редукция (09-22)
- 1.4 Спринт производительности TileOPs, часть вторая: основной цикл GEMM с пинг-понгом скрывает плотный эпилог, 176 тайлов в очереди (09-22)
- 1.5 Спринт производительности TileOPs, часть третья: операторы инференса GLA добавлены в очередь, группировка избыточной маршрутизации MoE (09-22)
- 1.6 TileOPs: сбой синтеза roofline переведён в отчётный статус, три обновления в очереди (09-22)
- 1.7 TileFoundry: два слияния — метаданные памяти и нормализация трафика (09-22)
- 1.8 Ночной снимок: 1046 бенчмарков с нулём сбоев, 1141 проверка корректности с восстановленным релизом (09-23)
- Прогресс ключевых проектов
-
- Мультибэкендная адаптация (Ascend / Hygon / MetaX / Moore Threads и другие)
- 2.1 Ascend: ежедневный тест вновь показал сбой уровня workflow, три новых дефекта указывают на аппаратный путь A5 и автоматическую синхронизацию (09-22 – 09-23)
- 2.2 MLIR Ascend: крупное слияние оператора Mamba SSD chunk scan, одновременно усовершенствованы процессы тюнинга и интеграции (09-22)
- 2.3 Hygon: переработка расширения коммита FP32 MMAC K; в PR поддержки примеров добавлено 32 файла (09-22)
- 2.4 MetaX и Moore Threads: в окне пушей нет (проверка 09-23)
- 2.5 Общественный бэкенд: TileLang-TPU продвигает многопроцессорную проверку Sophon BM1690 и матрицу производительности (09-22)
- Мультибэкендная адаптация (Ascend / Hygon / MetaX / Moore Threads и другие)
-
- Экосистема и потребители
- 3.1 Потребители: TileKernels и FlashQLA — в окне пушей нет (проверка 09-23)
- 3.2 Общественные проекты: продолжается提交 материалов практического лагеря по разработке многопарадигменных операторов для MetaX C500 (09-22)
- Экосистема и потребители
-
- Сообщество, руководства и мероприятия
- 4.1 Сайт документации: одно версионированное развёртывание сайта документации TileOPs (09-22)
- 4.2 Медиа и академическая сторона: Google News — ноль совпадений, arXiv — новых статей нет (проверка 09-23)
- 4.3 Ритм релизов: новых релизов нет, основной репозиторий v0.1.14 держится 21 день (09-23)
- Сообщество, руководства и мероприятия
-
- Наблюдения за тенденциями
- 5.1 Операторы преобразования становятся полноправными гражданами
- 5.2 TileOPs переходит от сезона управления к сезону производительности
- 5.3 Чередование красного и зелёного у Ascend и реальная аппаратная проверка A5
- 5.4 Пробелы и точки риска
- Наблюдения за тенденциями
- Приложение: материалы и пояснения по проверке
Главное за сегодня: точное преобразование FP4 в FP8 влито в основной репозиторий — экспертный GEMM DeepSeek V4.1 ускоряется до 5,4 раза
Дата: 2026-09-22 Источник: tilelang #3204
Слияние в 19:36 (открыт 09-11, 11 дней доработки). Отправной точкой этой записи стала, казалось бы, незаметная цепочка преобразований: экспертный GEMM DeepSeek V4.1 на каждом тайле K должен преобразовать веса E2M1 (FP4) через промежуточный FP32 в E4M3 (FP8). Автор заметил факт кодирования — все значения E2M1, включая знаковый ноль, имеют точное соответствие в кодировке E4M3, поэтому эта цепочка проекции по умолчанию «сначала развернуть в FP32, затем сжать» могла бы обойтись без FP32.
В реализации эта неразмеченная цепочка преобразований CUDA слита в две инструкции __byte_perm на каждые четыре элемента; охвачены скалярная и пять векторных ширин — 2, 4, 8, 16, 32; код с явной аннотацией преобразования сохраняет прежний путь понижения; всё преобразование выполняется в регистрах, без новых выделений глобальной или разделяемой памяти.
Проверка разделена на четыре уровня: тесты генерации исходников охватывают два варианта написания E4M3 и все ширины;runtime-примеры выполняют посимвольное сравнение каждого упакованного слова из четырёх полубайтов с независимой таблицей кодирования; извлечённый GEMM во всех конфигурациях побитово совпадает с базовым уровнем (плюс независимо семплированный эталон на CPU); текущие заголовочные CI для CUDA, ROCm, Metal и CuTeDSL проходят.
Производительность на H100 (та же карта, те же входные данные, медиана из 100 вызовов на график, выбрано четыре строки):
| M | N | K | Базовая линия (мкс) | Текущий коммит (мкс) |
|---|---|---|---|---|
| 1 | 2,304 | 5,120 | 547.94 | 108.65 |
| 512 | 2,304 | 5,120 | 717.30 | 224.21 |
| 1 | 5,120 | 2,304 | 245.17 | 45.85 |
| 2,048 | 5,120 | 2,304 | 1,760.22 | 591.92 |
Диапазон ускорения для двенадцати конфигураций составляет от 2.97 до 5.38 раза; занятость регистров выросла со 128 до 156, переполнения нет. Отмеченные автором границы: выполнение на Blackwell и обслуживание полной модели пока не проверены.
Суждение: «микро-преобразование» всего со 161 строкой добавлений даёт выигрыш в сквозной производительности до 5.4 раза, что показывает: в сценариях вроде экспертных GEMM, где веса многократно считываются по тайлам, стоимость цепочки преобразований не напрасно рассматривается под лупой; это также в очередной раз демонстрирует, что объект оптимизации основной линии TileLang смещается от «крупных структур» к «бухгалтерии каждой инструкции на каждом уровне».
1. Прогресс ключевых проектов
1.1 Очередь ревью основного репозитория: открыто исправление параллельных циклов, в бэкенд TileIR добавлено 8 коммитов (09-22)
Дата: 2026-09-22 — 2026-09-23 Источники: #3269/#3247 и ещё два запроса (полный список см. в приложении)
- #3269 (открыт 09-23 01:48): исправление понижения параллельных циклов при отключённом let-инлайне — скорректирован порядок подстановки переменных цикла в
PartitionLoop, перед подстановкой сначала упрощается индекс буфера, а для параллельных циклов добавлен регрессионный тест, дополнительно добавлено покрытие выполнения условных параллельных циклов для CUDA/HIP. Второе исправление этого автора в текущем окне (предыдущее — по линии NVRTC). - #3247 (добавлено 8 коммитов в 13:56): бэкенд выполнения CUDA Tile IR (цель
tileir, понижение до NVIDIA CUDA Tile IR, выпуск cubin через среду выполнения cuTile; включает JIT, кэширование, автотюнинг и ядро тюнинга разреженного внимания DeepSeek V4) после нескольких дней паузы возобновил продвижение, в текущем окне разом добавлено 8 коммитов, всё ещё на ревью. - #3267 (обновлён 09-23 01:05): продолжается ревью магического деления
tl.LowerMagicDiv(предвычисление на стороне хоста для делителей с динамическими формами), охватывает генерацию кода CUDA/ROCm/CPU C и хост-кода. - #3265 (обновлён 13:54): понижение целочисленных операций инвариантов запуска на сторону хоста, охватывает логику отклонения для обоих путей запуска — Cython и NVRTC.
- #3241 — #3244 (по одной активности в 18:16 — 18:20): исправления понижения преобразования и сохранения FP4 в CuTeDSL, а также триада по инициализации RNG (последовательность по умолчанию, отклонение void-привязки, диагностика отсутствующей инициализации) — эти четыре исправления остаются открытыми, действий по слиянию не наблюдается.
Наблюдение по очереди: в текущем окне в основной репозиторий слит только 1 запрос (#3204, см. сегодняшний фокус), сторона ревью перешла в состояние «добавляем коммиты, не ставим печать» — обе крупные линии, TileIR и магическое деление, накапливают материал.
1.2 Завершение управления TileOPs: последние обходные пути элементов списка и вычислителя демонтированы (09-22)
Дата: 2026-09-22 Источник: TileOPs #2167
Слито в 10:24 (открыто 09-21 22:34, выполнено примерно за полдня). Продолжая сведение формул списка из #2158, этот запрос демонтирует механизм «функция молча уступает для элементов, у которых определён метод вычисления» прямо в точке установки: удалены два переопределения GQA, блокировавших унифицированный путь, и использована та же запись «наложение нагрузки времени вызова поверх атрибутов»; одновременно для двух видов неправильного использования добавлены явные ошибки — нагрузка равна None (проблема упорядочивания вызовов у вызывающей стороны) и нагрузка не является отображением (ошибка подключения у автора). Фоновые данные взяты из разбора контрольного запроса #2175: на некотором коммите 09-19 из 175 реализованных элементов 19 не удалось скомпоновать формулу, #2158 и этот запрос исправили их до и после, но тогда ни один уровень не сообщал, «кто следующий на очереди на провал».
1.3 Первый спринт производительности TileOPs: декодирование Engram разделено на два сегмента ядер — проекция и редукция (09-22)
Дата: 2026-09-22 Источник: TileOPs #2173
16:50 Открыт новый PR (1 файл, +265/-108). Старая реализация использовала один блок потоков на строку батча, две проекции выполнялись в последовательном цикле с цепочечными скалярными загрузками, веса не разделялись между блоками — на H200 достигалось лишь от 6 до 34 ГБ/с при пропускной способности устройства 4,8 ТБ/с, и на всех рабочих нагрузках из манифеста она была медленнее базовой линии torch.compile. Новая структура разделена на два сегмента: проекция переработана с разбиением по измерению d, вес читается один раз через матричное умножение и обслуживает весь батч (при B не более 16 помещается в один тайл MMA) и попутно выполняется сдвиг кэша; остальные шаги (три RMSNorm, гейтирование, полая свёртка, SiLU), поскольку все они редуцируются вдоль d, вынесены во второй сегмент — по одному блоку на строку батча. Ещё одно наблюдение записано в описание: когда два матричных умножения находятся в одном конвейере, при некоторых формах тайлов происходит тихое чтение неверного уровня конвейера — после перебора 3 форм на 30 комбинаций тайлов/уровней было решено пустить два блока по оси сетки; одиночный блок с одиночной цепочкой точен во всех 30 комбинациях.
Измерения (время занятости устройства H200): батч 1 снизился с 28,1 микросекунды до 6,0 микросекунд (в 4,7 раза, против torch.compile с 0,40 раза до 1,90 раза); батч 4 — с 67,9 до 8,3 (в 8,2 раза, 2,57 раза); батч 8 — с 28,1 до 5,6 (в 5,0 раз, 3,16 раза).
1.4 TileOPs, спринт производительности 2: GEMM с пинг-понг основным циклом скрывает плотный эпилог, 176 тайлов в очереди (09-22)
Дата: 2026-09-22 Источник: TileOPs #2172
16:21 Открыт новый PR (5 файлов, +465/-42). Эпилог плотного GEMM скрывается под основным циклом противоположного потребителя: один производитель и два потребительских warpgroup работают на чередующихся тайлах постоянного цикла, основной цикл передаёт управление через упорядоченный mbarrier, так что эпилог одного потребителя выполняется под основным циклом другого. Расчёт таков — в структуре с двумя потребителями во время эпилога тензорные ядра простаивают, на каждый тайл фиксировано около 3,1 тысячи циклов (5,2 тысячи при ширине блока 176), что составляет от 9% до 18% от 32 раундов основного цикла — именно это и есть весь разрыв с ядром 176x128 из cuBLASLt на строках предзаполнения DeepSeek-V3. Сопутствующее: эпилог переведён на чередование двух буферных тайлов (ранее последний не скрытый эпилог сериализовал одиннадцать записей обратно, добавляя 2,9 тысячи циклов на каждый запуск), хвосты M/N обрабатываются через граничную обрезку TMA, ширина корзины 176 поставлена в очередь (2112 = 12 умножить на 176, последняя волна заполнена на 91%, лучше, чем 67% у 192). Для 176 требуется tilelang не ниже 0.1.14 (зависимость от select_wgmma_inst_n), в pyproject.toml добавлена нижняя граница версии и она принудительно проверяется в установочном скрипте. Тесты: на H200 прошли 86 пунктов, шесть форм побитово совпадают с torch.matmul, добавлено 9 новых тестов.
1.5 TileOPs, спринт производительности 3: оператор инференса GLA в очереди, группировка сверхмаршрутизации MoE (09-22)
Дата: 2026-09-22 Источник: #2174/#2169/#1931
- #2174 (17:07 открыт новый PR, 15 файлов, +1384/-2, помечен как черновик и не включён в список): оператор инференса GLA (
GLAInferenceFwdOp, Q/K/V/G в раскладке BTHD, опциональное начальное состояние FP32, возвращает выход и конечное состояние FP32). Последовательное вычисление оценок внутри блока заменено тензорно-ядерным тайлом на 16 токенов; для длинных последовательностей заимствована идея разделения на разделы/сканирование/воспроизведение из #1931, включается только при длине последовательности не менее 16384. Измерения на H200 (батч 2, длина 16384, голов 4, Dk=Dv=64): старый блочный путь 472,1 микросекунды, разделённый путь 348,5 микросекунды, эталонная реализация 443,5 микросекунды; независимые замеры по бенчмарку из манифеста дали TileOps 392,0 против эталона 531,5 микросекунды. Для коротких последовательностей сохранён исходный путь. - #2169 (12:58 открыт новый PR): оптимизация группировки в пути индексов MoE, когда отдельный эксперт получает более 16 маршрутов — выбор между индексированием и последовательным выполнением по плотности маршрутов, а не по числу токенов; измерения на H200 на уровне 64 токенов: DeepSeek-V3 с 0,80 до 0,990 (относительно vLLM, значение больше 1 означает быстрее), Kimi-K2 с 0,83 до 0,993, GLM-4.5 до 0,995; на уровне 32 токенов — до примерно 1,0. Дублирующий одиночный PR #2171 закрыт через три минуты после открытия.
- Закрыто три PR: два исследования производительности — ускорение W4A16 GEMV (#2159) и разбиение по K в сетке W4A16 (#2170) — закрыты; открытый 08-17 конвейер предзаполнения GLA (#1931) закрыт, его идея разделённого сканирования уже поглощена #2174.
Три PR по производительности (Engram, GEMM, GLA) плюс одна оптимизация MoE, присутствующие одновременно в течение одного дня, — это самый плотный день по коммитам производительности у TileOPs за последнее время.
1.6 TileOPs: сбой синтеза roofline переведён в отчётный, три обновления в очереди (09-22)
Дата: 2026-09-22 Источник: TileOPs #2175
19:47 Открыт новый (8 файлов +473/-160). Прямое решение проблемы «синтез формулы не удаётся, но об этом не сообщается»: ранее элемент, вычисление которого не поддавалось синтезу, отображал лишь заглушку, а сообщение, действительно указывающее на недопустимое имя или конструкцию, выбрасывалось слоем генерации кода и никем не принималось; сам слой генерации кода также не выносил решение по каждому элементу (для немаппированных сигнатур выбрасывалось голое исключение, для случая служебных свойств уровня модуля и вовсе любое исключение считалось допустимым); к тому же процесс синтеза ради привязки одного имени импортировал парсер выходного dtype, а вместе с ним всю библиотеку тензоров — проверка имени и формы формулы вовсе не должна требовать torch. Данный коммит превращает шлюз слоя генерации кода в полное решение (каждый деформированный элемент — явная ошибка с указанием имени оператора), решение читает только сам элемент (175 реализованных элементов полностью синтезируемы в среде без torch), а также добавляет поголовную проверку синтеза, сообщающую о причинах сбоя как об ошибках уровня schema. Одновременно исправлены шесть несоответствий коду в проектном документе.
Обновление очереди: #2168 (порядок предупакованных весов W4A16, обновлено в 23:55) остаётся открытым; #2163 (оператор инференса DeltaNet, обновлено в 23:36) и #2160 (миграция переменной длины GQA, обновлено в 23:19) продвигаются.
1.7 TileFoundry: влиты два коммита — метаданные памяти и нормализация трафика (09-22)
Дата: 2026-09-22 Источник: TileFoundry #175/#176/#168
- #175 (влито в 12:09): анализ поддерживает начало цикла зависимых единиц — когда верхняя граница и шаг несут семантику единиц, начало цикла больше не предполагается нулевым; методология анализа согласована с семантикой циклов аппаратного исполнения.
- #176 (влито в 15:22, два коммита): метаданные памяти и нормализация трафика — переписаны модули памяти и метаданных анализа, затронут учёт трафика, roofline и документ спецификации анализа (в едином файле спецификации анализа изменено 263 строки), синхронизированы учебное руководство и инспектор. Оба вошли в день открытия (09-21), завершены в течение суток.
- Связанные задачи: #171, #173 закрыты; #168 (повторное чтение инвариантных операндов должно учитываться в общем объёме трафика) остаётся в обсуждении.
1.8 Ночной снимок: база 1046 позиций, ноль сбоев; корректность 1141 позиция — публикация возобновлена (09-23)
Дата: 2026-09-23 Источник: коммит снимка 81946098/метаданные среды снимка
Сгенерирован в 02:38 для b07a259f (точка вливания #2167): база 1046 позиций, сбоев 0, пропущено 3 (по-прежнему три позиции GQA с постраничной организацией), число тест-кейсов на уровне предыдущего; файл результатов корректности на этот раз опубликован снова — 1141 позиция, сбоев 0, пропущено 2; тем самым снята неясность с отсутствием файла в двух предыдущих снимках (снимок от 09-21 прилагал только файл базы). Среда та же, что и в прошлый раз: H200, CUDA 13.2, драйвер 595.71.05, TileLang 0.1.11 с кодовым обозначением версии, torch 2.13.0, кодовое обозначение образа afcebed1, вторая версия.
2. Мультибэкендовая адаптация (Ascend / Hygon / MetaX / Moore Threads и др.)
2.1 Ascend: ежедневный тест вновь демонстрирует сбой на уровне рабочего процесса, три новые заявки на дефекты указывают на аппаратный путь A5 и автосинхронизацию (09-22 — 09-23)
Дата: 2026-09-22 — 2026-09-23 Источник: ежедневный тест #1831/#1830/#1824/#1825
- Ежедневный тест повторно воспроизвёл сбой (#1831, 09-23 06:29 автоматически создан): пакетное задание после примерно полутора часов работы завершилось сбоем (сбой на уровне рабочего процесса, не на уровне тест-кейса); по сравнению со снимком от 09-22 06:35 результат был 2448/2448 полностью зелёный. За последние три дня наблюдается чередование красного и зелёного (09-21 сбой рабочего процесса, 09-22 полностью зелёный, 09-23 сбой), проблема стабильности заслуживает постоянного наблюдения. В ветке кода в данном окне мониторинга коммитов не было.
- #1830 (09-23 00:47 создан): дефект архитектурной метки на пути устройства A5 — на реальном Ascend 950 (dav-3510) путь устройства компилируется с фиксированной меткой
dav-2201(относящейся к поколению 910B), ядро при запуске сразу сообщает об исключении устройства 507015; после изменения метки ядро запускается, но молча вычисляет неверные значения (ошибка в масштабирующем коэффициенте официального примера квантования). Автор указывает, что корневая причина — жёстко закодированная архитектурная метка в коде сборки, и отмечает, что матрица верификации в README как раз двусторонне обходит эту метку (реальные машины A2/A3 сами по себе относятся к поколению 910B, A5 идёт только через эмуляцию), поэтому дефект не был обнаружен. - #1824 / #1825 (09-22 09:58 созданы, один и тот же докладчик): две границы автоматической синхронизации — состояние синхронизации внутри условной ветки ошибочно объединяется, при невыполнении ветки последующее чтение может остаться без барьера (включая минимальное воспроизведение); автоматическая межъядерная синхронизация должна на этапе компиляции напрямую отклонять две конфигурации: «отключение комбинированного переключателя приводит к молчаливому отказу переключателя» и «смешанное использование двух наборов синхронизации — автоматической и рукописной». В последнем случае указывается, что сами примеры в репозитории уже содержат такую конфигурацию.
2.2 MLIR Ascend: крупное слияние оператора Mamba SSD chunk scan, одновременно усовершенствованы процессы настройки и интеграции (09-22)
Дата: 2026-09-22 Источник: tilelang-mlir-ascend #191
Слито в 18:57 (создано в 15:18, завершено примерно за 3,5 часа, 42 файла +4204/-1568). Китайский заголовок и есть описание изменений, три блока содержимого: во-первых, оптимизация экспертного ядра NPU для блочного сканирования дуальности пространства состояний Mamba-2 (SSD) и подключение к обёрточному слою — улучшена загрузка предыдущего состояния, вычисления с двойной буферизацией L0C, повторное использование данных векторной ветки, одновременно обновлены конфигурация по умолчанию, проектная документация и журнал настройки; во-вторых, усовершенствован процесс оператора — исправлено распределение нагрузки задач оптимизации и выбор базовых тест-кейсов, список нагрузки генерируется из базовых тестов, результаты производительности записываются по фактически протестированным файлам ядра, а в контроле качества проверяются итоговые файлы, покрытие тестами и данные отчёта; в-третьих, добавлена автоматическая генерация и проверка отчётов TileOPs, при интеграции автоматически устанавливаются переменные режима, а выводы повторного запуска SSD и второго раунда настройки фиксируются в библиотеке режимов, кейсах и записях задач. Данное слияние перекликается с линией Mamba в репозитории адаптации Ascend в том же окне, а также с работой по блочному сканированию в репозитории TPU сообщества (см. 2.5).
2.3 Hygon: переработка расширенного коммита FP32 MMAC K; PR поддержки примеров добавляет 32 файла (09-22)
Дата: 2026-09-22 Источник: коммит ветки e4dc1053/PR поддержки примеров #11
- Переработка ветки функции (отправлено в 15:27): исправление в ветке
feat/hcu-ds-read-fp32-mmac-kбыло расширенно переработано — исходная трёхфайловая версия (общий FP32 MMAC K и упаковка фрагментов) расширена до пятифайловой версии (+54/-86): добавлено удаление ограничения FP16/BF16 по типу данных в выводе стратегии LDS для GEMM (расширяет область применения стратегии, расчищая предпосылку для пути FP8), а также очищен обходной код экспорта FP8 в адаптере tvm_ffi (удалено 53 строки, добавлено 4 строки; изначально использовался для обхода ограничения невозможности экспорта torch FP8 через DLPack); дата коммита — вечер 09-21, отправка состоялась в данном окне. У этой ветки по-прежнему нет соответствующего PR. - Расширение PR поддержки примеров #11 (дополнительный коммит в 14:44, 32 файла +1086/-121): обеспечена поддержка Hygon для примеров восходящего потока TileLang — добавлены эксклюзивные примеры flash attention для HCU (прямой проход 258 строк, обратный 603 строки) и их тесты; массово адаптированы примеры восходящего потока: внимание (многоголовое прямое и обратное, декодирование GQA и переменная длина, блочная разреженность), блочное состояние MoE, GEMM (автонастройка, персистентность, встроенные примитивы), GEMV, групповое матричное умножение и другие; рабочий процесс CI и скрипты регрессии синхронно обновлены, а также подключены предварительно скомпилированные колёса flash-attn из отечественного зеркала.
2.4 MetaX и Moore Threads: в окне коммитов нет (проверка 09-23)
Дата: 2026-09-23 (проверка) Источник: tilelang-metax/tilelang-musa
Последний коммит MetaX по-прежнему от 09-21 (синхронизация с восходящим потоком), последний коммит Moore Threads от 09-17; в обоих репозиториях в данном окне новых действий нет. На стороне MetaX есть ещё одно проявление температуры экосистемы: тренировочный лагерь сообщества на базе C500 и TileLang продолжает подавать материалы (см. 3.2).
2.5 Бэкенд сообщества: TileLang-TPU продвигает многоядерную верификацию и матрицу производительности Sophon BM1690 (09-22)
Дата: 2026-09-22 Источник: репозиторий сообщества TileLang-TPU
Репозиторий расширения TileLang для ускорителей Sophon, поддерживаемый сообществом, в этом окне получил три коммита подряд: проверка S3 и P6 для многоядерного блочного сканирования (14:27), матрица производительности P10 (16:05), исправление проверки исходного кода на стороне хоста для P10 (16:13). Этот репозиторий позиционируется как «перенос программной модели TileLang на цель TPU Sophon» — сохраняется Python-фронтенд TileLang, добавляются понижение для TPU, генерация кода и интеграция со средой выполнения JIT, предоставляется цель target="tpu", два режима выполнения — через PCIe и эмуляцию, TPU-специфичные примитивы (копирование, матричное умножение, редукция, обратный квадратный корень, позиционное кодирование вращением и т. д.), а основной линией является BM1690; с 09-20 начата аппаратная верификация и поэтапная оптимизация (одноядерная, многоядерная, дорожная карта производительности с P8 по P10). Репозиторий находится в активной разработке и заявляет о приветствии вкладов. Это первый публичный путь бэкенда TPU, появившийся в сообществе TileLang; в сопоставлении с включением блочного сканирования Mamba для MLIR Ascend в том же окне, одно и то же семейство алгоритмов в один и тот же день появилось на двух наборах не-NVIDIA целей.
3. Экосистема и стороны внедрения
3.1 Стороны внедрения: TileKernels и FlashQLA без пушей в окне (проверка 09-23)
Дата: 2026-09-23 (проверка) Источник: TileKernels/FlashQLA
В окне у обеих сторон внедрения не было пушей: последний пуш TileKernels остановился на 04-23; последний пуш FlashQLA — 09-18. Примечательно, что слияние FP4 в FP8, включённое в основном репозитории в этом окне, как раз нацелено на экспертный GEMM DeepSeek V4.1 — сторона внедрения код не меняла, но шаблон преобразования в её коде инференса напрямую стимулировал вышестоящую оптимизацию.
3.2 Проекты сообщества: материалы практикума по разработке операторов с несколькими парадигмами на MetaX C500 продолжают поступать (09-22)
Дата: 2026-09-22 Источник: репозиторий материалов учебного лагеря сообщества
В этом окне два коммита: завершено практическое сравнение двух реализаций — на TileLang и на Jiuchi — для второй лекции «сложение векторов» (10:29), а также дополнена конфигурация навыков операционного агента для рабочего процесса удалённых экземпляров (10:32). Этот репозиторий материалов использует вычислительные ресурсы MetaX C500 в качестве основы (образ содержит TileLang 0.1.9 и определённую версию инструментальной цепочки); последовательность упражнений такова: устройство и вычислительная среда, сравнение сложения на TileLang и Jiuchi (блоки и хвостовые блоки), редукция и численная устойчивость Softmax и GEMM, разработка и верификация операторов с помощью AI-агента, после чего начинается этап операторов Llama (подключение, корректность, производительность, сквозной сценарий). В истории репозитория видны следы слияния с вышестоящей веткой в рамках инициативы вычислительных ресурсов сообщества, что представляет собой непрерывные усилия в направлении обучения сообщества.
4. Сообщество, руководства и мероприятия
4.1 Сайт документации: одна версионированная публикация сайта документации TileOPs (09-22)
Дата: 2026-09-22 Источник: сайт документации TileOPs
В 08:40 одна автоматическая публикация (версионированный коммит генератора статического сайта 1.6.1), существенных изменений в содержимом сайта не замечено; основной репозиторий сайта документации в этом окне не выполнял публикаций.
4.2 Медиа и академическая сторона: нулевые попадания в Google News, новых статей на arXiv нет (проверка 09-23)
Дата: 2026-09-23 (проверка) Источник: Google News RSS (несколько запросов на китайском и английском, через прокси)/Hacker News/arXiv
В Google News по нескольким группам запросов на китайском и английском в окне нулевые попадания; в Hacker News по соответствующим запросам только нерелевантные записи (совпадения слов вроде трассировки печатных плат, настольных штативов и т. п.); в тематическом поиске arXiv последняя статья по-прежнему относится к 07-24 — работе о модели производительности, новых препринтов в окне нет. На медийной стороне это второе подряд спокойное окно.
4.3 Ритм версий: новых релизов нет, основной репозиторий v0.1.14 достиг 21 дня (09-23)
Дата: 2026-09-23 Источник: tilelang v0.1.14
В окне мониторинга ни в одном репозитории не было новых релизов. Последний релиз основного репозитория по-прежнему v0.1.14 от 09-02 (прошло 21 день); версии всех адаптационных линий не изменились: Ascend v0.1.2.000 (09-09), MLIR Ascend v0.1.2.020 (09-09), Moore Threads v0.1.14+musa.1 (09-11), MetaX v0.1.14 (09-17), Sunrise 0.1.14+sunrise.1.1.0 (09-21). Отдельно отметим: начиная с #2172, TileOPs выдвигает жёсткое требование к нижней границе версии tilelang — 0.1.14; взаимосвязь между ритмом выпуска версий и окном принятия нижестоящими потребителями заслуживает внимания.
5. Наблюдения за трендами
5.1 Преобразующие операторы становятся полноправными гражданами
Одно изменение из 161 строки, занимающееся исключительно вопросом «как FP4 превращается в FP8», даёт ускорение сквозного прохода в 2,97–5,38 раза — но при условии, что оно появляется на пути весов, которые читаются многократно. Параллельно с этим три улучшения производительности в TileOPs (разделение Engram, скрытие перемещения данных для GEMM, блочность GLA) также оптимизируют «сколько раз читается один и тот же блок данных и на каком уровне кэша он циркулирует». Когда структура на уровне операторов постепенно стабилизируется, выгода продолжает смещаться в сторону перемещения данных и преобразования форматов — это же объясняет, почему основной репозиторий принимает точное изменение кодирования преобразования как полноценную запись, а не как локальную мелкую правку.
5.2 TileOPs переходит от сезона управления к сезону производительности
Ключевым словом прошлой недели было «исправить неверное на верное» (формулы, физика, прослеживаемость); в данном окне в течение одного дня одновременно присутствуют три заявки на производительность плюс одна оптимизация маршрутизации, причём новые заявки, как правило, несут с собой эталонные基准 для сравнения (torch.compile, cuBLASLt, эталонная реализация, vLLM) и заявление о побитовой идентичности. Бухгалтерская книга, оставленная управлением, превращается в кредитный актив работы над производительностью: каждая заявка на производительность может быть независимо перепроверена по списку и эталонным基准.
5.3 Чередование красного и зелёного у Ascend и реальная аппаратная проверка A5
Чередование красного и зелёного в ежедневных тестах за три дня показывает, что стабильность среды прогонов всё ещё не закрыта; а проблема, выявленная в #1830, более показательна — матрица верификации покрывает поколение 910B на реальных машинах и поколение 950 на симуляции, и как раз обе стороны обходят архитектурную маркировку путей устройств, из-за чего дефект проявляется на реальном 950 в двух формах: «падение при запуске, а после смены маркировки — молчаливый неверный расчёт». Глубина адаптации кросс-поколенческого оборудования переходит от «способности скомпилировать» к этапу «готовности калибровать на реальных машинах».
5.4 Пробелы и точки риска
Четыре пункта: во-первых, ритм слияний в основной репозиторий в данном окне составил лишь одну запись, обе крупные линии — TileIR и магическое деление — находятся в состоянии «ингредиенты добавлены, но печать не поставлена»; заслуживает наблюдения, не становится ли узким местом пропускная способность рецензирования; во-вторых, застой релизов достиг 21 дня, а нижестоящий потребитель (TileOPs) уже начал заявлять жёсткую зависимость от 0.1.14 и выше — такт между окном версий и принятием экосистемы нуждается в согласовании; в-третьих, проблема корректности вывода Ascend A5 (молчаливая ошибка после смены маркировки) пока не имеет заявки на исправление, и если она подтвердится, это повлияет на нарратив доверия к поколению 950; в-четвёртых, ветка особенностей Hygon по-прежнему без PR, а крупное слияние с откатом у Ascend не имеет запланированной даты переделки — состояние «внедрение в пути» двух отечественных линий сохраняется.
Приложение: материалы и пояснения по проверке
Таблица проверки источников
| Источник | Результат проверки |
|---|---|
| Организация tile-ai (28 репозиториев) | В окне推送 в 7 репозиториях: tilelang, TileOPs, TileOPs-nightly, TileFoundry, tilelang-mlir-ascend, tilelang-hygon, TileOPs.github.io |
| Основной репозиторий tilelang, ветка по умолчанию | 1 слияние (#3204); 1 новая заявка (#3269); #3247, #3267, #3265, #3241–#3244 — у каждой обновление в окне; новых и закрытых issue в окне — 0 |
| TileOPs | 1 слияние (#2167); новые #2169, #2172, #2173, #2174, #2175 (#2171, дубликат той же темы, закрыт на месте); закрыты #2159, #2170, #1931; обновлены #2168, #2163, #2160 |
| TileOPs-nightly | 1 снимок (81946098, соответствует b07a259f, т. е. точке слияния #2167): эталонный基准 1046 пунктов, ноль отказов; корректность 1141 пунктов восстановлена с выпуском снимка |
| TileFoundry | 2 слияния (#175, #176); #171, #173 закрыты; #168 остаётся в обсуждении |
| tilelang-mlir-ascend | 1 слияние (#191, оптимизация Mamba SSD chunk scan, 42 файла) |
| tilelang-hygon | В 2 ветках есть推送: коммиты ветки особенностей расширены и переделаны; примеры поддержки PR #11 — дополнительно 32 файла коммитов |
| tilelang-ascend | В кодовой ветке нет推送; отказ на уровне ежедневного рабочего процесса (#1831); 3 новые заявки на дефекты (#1830, #1824, #1825) |
| Остальные репозитории tile-ai (TileRT, tilescale, DeepStack, tilelang-puzzles, metax, musa и др.) | В окне нет推送 |
| Потребители (TileKernels, FlashQLA) | В окне нет推送 |
| Сторонние находки | Репозиторий расширения TPU сообщества (3 коммита многоядерной верификации BM1690); репозиторий материалов тренировочного лагеря сообщества (2 коммита) |
| Google News / Hacker News / arXiv | Ноль попаданий по нескольким группам запросов на китайском и английском; в HN нет связанных записей; в arXiv нет новых препринтов |
Полный список источников
- [1] Объединение FP4 в FP8 в основном репозитории (#3204) — https://github.com/tile-ai/tilelang/pull/3204
- [2] Открыто исправление параллельных циклов (#3269) — https://github.com/tile-ai/tilelang/pull/3269
- [3] Дополнительный коммит бэкенда CUDA Tile IR (#3247) — https://github.com/tile-ai/tilelang/pull/3247
- [4] Магическое деление (#3267) — https://github.com/tile-ai/tilelang/pull/3267
- [5] Понижение целочисленных инвариантов запуска (#3265) — https://github.com/tile-ai/tilelang/pull/3265
- [6] Серия исправлений CuTeDSL и RNG (#3241–#3244) — https://github.com/tile-ai/tilelang/pull/3241
- [7] Объединено удаление обхода вычислителя TileOPs (#2167) — https://github.com/tile-ai/TileOPs/pull/2167
- [8] Разделение декодирования Engram (#2173) — https://github.com/tile-ai/TileOPs/pull/2173
- [9] Пинг-понг основной цикл GEMM и тайлы 176 (#2172) — https://github.com/tile-ai/TileOPs/pull/2172
- [10] Оператор инференса GLA (#2174) — https://github.com/tile-ai/TileOPs/pull/2174
- [11] Группировка избыточной маршрутизации MoE (#2169) — https://github.com/tile-ai/TileOPs/pull/2169
- [12] Возможность сообщить о сбое синтеза roofline (#2175) — https://github.com/tile-ai/TileOPs/pull/2175
- [13] Порядок предупакованных весов W4A16 (#2168) — https://github.com/tile-ai/TileOPs/pull/2168
- [14] Оператор инференса DeltaNet (#2163) — https://github.com/tile-ai/TileOPs/pull/2163
- [15] Миграция GQA с переменной длиной (#2160) — https://github.com/tile-ai/TileOPs/pull/2160
- [16] Заявка на закрытие конвейера префилла GLA (#1931) — https://github.com/tile-ai/TileOPs/pull/1931
- [17] Коммит ночного снимка (81946098) — https://github.com/tile-ai/TileOPs-nightly/commit/81946098
- [18] Метаданные окружения снимка — https://github.com/tile-ai/TileOPs-nightly/blob/snapshots/meta.json
- [19] Анализ начальной точки цикла TileFoundry (#175) — https://github.com/tile-ai/TileFoundry/pull/175
- [20] Нормализация метаданных памяти TileFoundry (#176) — https://github.com/tile-ai/TileFoundry/pull/176
- [21] Заявка на обсуждение трафика TileFoundry (#168) — https://github.com/tile-ai/TileFoundry/issues/168
- [22] Объединено блочное сканирование Mamba для Ascend в MLIR (#191) — https://github.com/tile-ai/tilelang-mlir-ascend/pull/191
- [23] Сбой ежедневного теста Ascend (#1831) — https://github.com/tile-ai/tilelang-ascend/issues/1831
- [24] Дефект обозначения архитектуры Ascend A5 (#1830) — https://github.com/tile-ai/tilelang-ascend/issues/1830
- [25] Границы автосинхронизации Ascend (#1824) — https://github.com/tile-ai/tilelang-ascend/issues/1824
- [26] Отклонение конфигурации синхронизации Ascend (#1825) — https://github.com/tile-ai/tilelang-ascend/issues/1825
- [27]
Ветка функций Hygon, коммит (e4dc1053) — https://github.com/tile-ai/tilelang-hygon/commit/e4dc1053
- [28] PR поддержки примеров Hygon (#11) — https://github.com/tile-ai/tilelang-hygon/pull/11
- [29] Репозиторий сообщества TileLang-TPU (BM1690) — https://github.com/arcflute/ChunkScan-2-TileLang-4-TPU-bm1690
- [30] Репозиторий материалов учебного лагеря сообщества (MetaX C500) — https://github.com/wuExin/metax-operator-training
- [31] Развёртывание сайта документации TileOPs — https://github.com/tile-ai/TileOPs.github.io
- [32] Последний релиз основного репозитория (v0.1.14) — https://github.com/tile-ai/tilelang/releases/tag/v0.1.14
- [33] Google News RSS (запросы на китайском и английском, через прокси) — https://news.google.com/
- [34] Поиск по Hacker News — https://hn.algolia.com/
- [35] Поиск по arXiv — https://arxiv.org/