Окно мониторинга: последние 24 часа (2026-09-22 07:00 ~ 2026-09-23 07:00, пекинское время). Этот выпуск — стандартное ежедневное окно, без пересечения с предыдущим выпуском. Источники: GitHub (проверка 28 репозиториев организации tile-ai, в окне зафиксированы пуши в 7 репозиториях; в основном репозитории 1 слияние и 1 новый PR, несколько обновлений очереди ревью; TileOPs — 1 слияние и 5 новых PR, 4 закрытых; TileFoundry — два слияния; MLIR Ascend — крупное слияние Mamba; Hygon — продвижение по двум ветвям с обновлением PR поддержки примеров; общественный репозиторий бэкенда TPU — многопроцессорная проверка BM1690; ежедневный тестовый рабочий процесс Ascend — сбой уровня workflow и отчёт о дефектах аппаратного пути A5; ночной снимок — 1046 бенчмарков с нулём сбоев, 1141 проверка корректности с восстановленным релизом), Google News RSS — несколько групп запросов на английском и китайском (через прокси, ноль совпадений), Hacker News, arXiv, репозитории сторонней экосистемы


Индекс этого выпуска

  • Главное за сегодня: точное преобразование FP4 в FP8 влито в основной репозиторий — экспертный GEMM DeepSeek V4.1 ускоряется до 5,4 раза (09-22)
    1. Прогресс ключевых проектов
      • 1.1 Очередь ревью основного репозитория: новый PR исправления параллельных циклов, 8 коммитов в бэкенд TileIR (09-22)
      • 1.2 Управление TileOPs завершено: последний обходной путь для пунктов списка и вычислителя демонтирован (09-22)
      • 1.3 Спринт производительности TileOPs, часть первая: декодирование Engram разделено на два ядра — проекция и редукция (09-22)
      • 1.4 Спринт производительности TileOPs, часть вторая: основной цикл GEMM с пинг-понгом скрывает плотный эпилог, 176 тайлов в очереди (09-22)
      • 1.5 Спринт производительности TileOPs, часть третья: операторы инференса GLA добавлены в очередь, группировка избыточной маршрутизации MoE (09-22)
      • 1.6 TileOPs: сбой синтеза roofline переведён в отчётный статус, три обновления в очереди (09-22)
      • 1.7 TileFoundry: два слияния — метаданные памяти и нормализация трафика (09-22)
      • 1.8 Ночной снимок: 1046 бенчмарков с нулём сбоев, 1141 проверка корректности с восстановленным релизом (09-23)
    1. Мультибэкендная адаптация (Ascend / Hygon / MetaX / Moore Threads и другие)
      • 2.1 Ascend: ежедневный тест вновь показал сбой уровня workflow, три новых дефекта указывают на аппаратный путь A5 и автоматическую синхронизацию (09-22 – 09-23)
      • 2.2 MLIR Ascend: крупное слияние оператора Mamba SSD chunk scan, одновременно усовершенствованы процессы тюнинга и интеграции (09-22)
      • 2.3 Hygon: переработка расширения коммита FP32 MMAC K; в PR поддержки примеров добавлено 32 файла (09-22)
      • 2.4 MetaX и Moore Threads: в окне пушей нет (проверка 09-23)
      • 2.5 Общественный бэкенд: TileLang-TPU продвигает многопроцессорную проверку Sophon BM1690 и матрицу производительности (09-22)
    1. Экосистема и потребители
      • 3.1 Потребители: TileKernels и FlashQLA — в окне пушей нет (проверка 09-23)
      • 3.2 Общественные проекты: продолжается提交 материалов практического лагеря по разработке многопарадигменных операторов для MetaX C500 (09-22)
    1. Сообщество, руководства и мероприятия
      • 4.1 Сайт документации: одно версионированное развёртывание сайта документации TileOPs (09-22)
      • 4.2 Медиа и академическая сторона: Google News — ноль совпадений, arXiv — новых статей нет (проверка 09-23)
      • 4.3 Ритм релизов: новых релизов нет, основной репозиторий v0.1.14 держится 21 день (09-23)
    1. Наблюдения за тенденциями
      • 5.1 Операторы преобразования становятся полноправными гражданами
      • 5.2 TileOPs переходит от сезона управления к сезону производительности
      • 5.3 Чередование красного и зелёного у Ascend и реальная аппаратная проверка A5
      • 5.4 Пробелы и точки риска
  • Приложение: материалы и пояснения по проверке

Главное за сегодня: точное преобразование FP4 в FP8 влито в основной репозиторий — экспертный GEMM DeepSeek V4.1 ускоряется до 5,4 раза

Дата: 2026-09-22 Источник: tilelang #3204

Слияние в 19:36 (открыт 09-11, 11 дней доработки). Отправной точкой этой записи стала, казалось бы, незаметная цепочка преобразований: экспертный GEMM DeepSeek V4.1 на каждом тайле K должен преобразовать веса E2M1 (FP4) через промежуточный FP32 в E4M3 (FP8). Автор заметил факт кодирования — все значения E2M1, включая знаковый ноль, имеют точное соответствие в кодировке E4M3, поэтому эта цепочка проекции по умолчанию «сначала развернуть в FP32, затем сжать» могла бы обойтись без FP32.

В реализации эта неразмеченная цепочка преобразований CUDA слита в две инструкции __byte_perm на каждые четыре элемента; охвачены скалярная и пять векторных ширин — 2, 4, 8, 16, 32; код с явной аннотацией преобразования сохраняет прежний путь понижения; всё преобразование выполняется в регистрах, без новых выделений глобальной или разделяемой памяти.

Проверка разделена на четыре уровня: тесты генерации исходников охватывают два варианта написания E4M3 и все ширины;runtime-примеры выполняют посимвольное сравнение каждого упакованного слова из четырёх полубайтов с независимой таблицей кодирования; извлечённый GEMM во всех конфигурациях побитово совпадает с базовым уровнем (плюс независимо семплированный эталон на CPU); текущие заголовочные CI для CUDA, ROCm, Metal и CuTeDSL проходят.

Производительность на H100 (та же карта, те же входные данные, медиана из 100 вызовов на график, выбрано четыре строки):

M N K Базовая линия (мкс) Текущий коммит (мкс)
1 2,304 5,120 547.94 108.65
512 2,304 5,120 717.30 224.21
1 5,120 2,304 245.17 45.85
2,048 5,120 2,304 1,760.22 591.92

Диапазон ускорения для двенадцати конфигураций составляет от 2.97 до 5.38 раза; занятость регистров выросла со 128 до 156, переполнения нет. Отмеченные автором границы: выполнение на Blackwell и обслуживание полной модели пока не проверены.

Суждение: «микро-преобразование» всего со 161 строкой добавлений даёт выигрыш в сквозной производительности до 5.4 раза, что показывает: в сценариях вроде экспертных GEMM, где веса многократно считываются по тайлам, стоимость цепочки преобразований не напрасно рассматривается под лупой; это также в очередной раз демонстрирует, что объект оптимизации основной линии TileLang смещается от «крупных структур» к «бухгалтерии каждой инструкции на каждом уровне».


1. Прогресс ключевых проектов

1.1 Очередь ревью основного репозитория: открыто исправление параллельных циклов, в бэкенд TileIR добавлено 8 коммитов (09-22)

Дата: 2026-09-22 — 2026-09-23 Источники: #3269/#3247 и ещё два запроса (полный список см. в приложении)

  • #3269 (открыт 09-23 01:48): исправление понижения параллельных циклов при отключённом let-инлайне — скорректирован порядок подстановки переменных цикла в PartitionLoop, перед подстановкой сначала упрощается индекс буфера, а для параллельных циклов добавлен регрессионный тест, дополнительно добавлено покрытие выполнения условных параллельных циклов для CUDA/HIP. Второе исправление этого автора в текущем окне (предыдущее — по линии NVRTC).
  • #3247 (добавлено 8 коммитов в 13:56): бэкенд выполнения CUDA Tile IR (цель tileir, понижение до NVIDIA CUDA Tile IR, выпуск cubin через среду выполнения cuTile; включает JIT, кэширование, автотюнинг и ядро тюнинга разреженного внимания DeepSeek V4) после нескольких дней паузы возобновил продвижение, в текущем окне разом добавлено 8 коммитов, всё ещё на ревью.
  • #3267 (обновлён 09-23 01:05): продолжается ревью магического деления tl.LowerMagicDiv (предвычисление на стороне хоста для делителей с динамическими формами), охватывает генерацию кода CUDA/ROCm/CPU C и хост-кода.
  • #3265 (обновлён 13:54): понижение целочисленных операций инвариантов запуска на сторону хоста, охватывает логику отклонения для обоих путей запуска — Cython и NVRTC.
  • #3241 — #3244 (по одной активности в 18:16 — 18:20): исправления понижения преобразования и сохранения FP4 в CuTeDSL, а также триада по инициализации RNG (последовательность по умолчанию, отклонение void-привязки, диагностика отсутствующей инициализации) — эти четыре исправления остаются открытыми, действий по слиянию не наблюдается.

Наблюдение по очереди: в текущем окне в основной репозиторий слит только 1 запрос (#3204, см. сегодняшний фокус), сторона ревью перешла в состояние «добавляем коммиты, не ставим печать» — обе крупные линии, TileIR и магическое деление, накапливают материал.

1.2 Завершение управления TileOPs: последние обходные пути элементов списка и вычислителя демонтированы (09-22)

Дата: 2026-09-22 Источник: TileOPs #2167

Слито в 10:24 (открыто 09-21 22:34, выполнено примерно за полдня). Продолжая сведение формул списка из #2158, этот запрос демонтирует механизм «функция молча уступает для элементов, у которых определён метод вычисления» прямо в точке установки: удалены два переопределения GQA, блокировавших унифицированный путь, и использована та же запись «наложение нагрузки времени вызова поверх атрибутов»; одновременно для двух видов неправильного использования добавлены явные ошибки — нагрузка равна None (проблема упорядочивания вызовов у вызывающей стороны) и нагрузка не является отображением (ошибка подключения у автора). Фоновые данные взяты из разбора контрольного запроса #2175: на некотором коммите 09-19 из 175 реализованных элементов 19 не удалось скомпоновать формулу, #2158 и этот запрос исправили их до и после, но тогда ни один уровень не сообщал, «кто следующий на очереди на провал».

1.3 Первый спринт производительности TileOPs: декодирование Engram разделено на два сегмента ядер — проекция и редукция (09-22)

Дата: 2026-09-22 Источник: TileOPs #2173

16:50 Открыт новый PR (1 файл, +265/-108). Старая реализация использовала один блок потоков на строку батча, две проекции выполнялись в последовательном цикле с цепочечными скалярными загрузками, веса не разделялись между блоками — на H200 достигалось лишь от 6 до 34 ГБ/с при пропускной способности устройства 4,8 ТБ/с, и на всех рабочих нагрузках из манифеста она была медленнее базовой линии torch.compile. Новая структура разделена на два сегмента: проекция переработана с разбиением по измерению d, вес читается один раз через матричное умножение и обслуживает весь батч (при B не более 16 помещается в один тайл MMA) и попутно выполняется сдвиг кэша; остальные шаги (три RMSNorm, гейтирование, полая свёртка, SiLU), поскольку все они редуцируются вдоль d, вынесены во второй сегмент — по одному блоку на строку батча. Ещё одно наблюдение записано в описание: когда два матричных умножения находятся в одном конвейере, при некоторых формах тайлов происходит тихое чтение неверного уровня конвейера — после перебора 3 форм на 30 комбинаций тайлов/уровней было решено пустить два блока по оси сетки; одиночный блок с одиночной цепочкой точен во всех 30 комбинациях.

Измерения (время занятости устройства H200): батч 1 снизился с 28,1 микросекунды до 6,0 микросекунд (в 4,7 раза, против torch.compile с 0,40 раза до 1,90 раза); батч 4 — с 67,9 до 8,3 (в 8,2 раза, 2,57 раза); батч 8 — с 28,1 до 5,6 (в 5,0 раз, 3,16 раза).

1.4 TileOPs, спринт производительности 2: GEMM с пинг-понг основным циклом скрывает плотный эпилог, 176 тайлов в очереди (09-22)

Дата: 2026-09-22 Источник: TileOPs #2172

16:21 Открыт новый PR (5 файлов, +465/-42). Эпилог плотного GEMM скрывается под основным циклом противоположного потребителя: один производитель и два потребительских warpgroup работают на чередующихся тайлах постоянного цикла, основной цикл передаёт управление через упорядоченный mbarrier, так что эпилог одного потребителя выполняется под основным циклом другого. Расчёт таков — в структуре с двумя потребителями во время эпилога тензорные ядра простаивают, на каждый тайл фиксировано около 3,1 тысячи циклов (5,2 тысячи при ширине блока 176), что составляет от 9% до 18% от 32 раундов основного цикла — именно это и есть весь разрыв с ядром 176x128 из cuBLASLt на строках предзаполнения DeepSeek-V3. Сопутствующее: эпилог переведён на чередование двух буферных тайлов (ранее последний не скрытый эпилог сериализовал одиннадцать записей обратно, добавляя 2,9 тысячи циклов на каждый запуск), хвосты M/N обрабатываются через граничную обрезку TMA, ширина корзины 176 поставлена в очередь (2112 = 12 умножить на 176, последняя волна заполнена на 91%, лучше, чем 67% у 192). Для 176 требуется tilelang не ниже 0.1.14 (зависимость от select_wgmma_inst_n), в pyproject.toml добавлена нижняя граница версии и она принудительно проверяется в установочном скрипте. Тесты: на H200 прошли 86 пунктов, шесть форм побитово совпадают с torch.matmul, добавлено 9 новых тестов.

1.5 TileOPs, спринт производительности 3: оператор инференса GLA в очереди, группировка сверхмаршрутизации MoE (09-22)

Дата: 2026-09-22 Источник: #2174/#2169/#1931

  • #2174 (17:07 открыт новый PR, 15 файлов, +1384/-2, помечен как черновик и не включён в список): оператор инференса GLA (GLAInferenceFwdOp, Q/K/V/G в раскладке BTHD, опциональное начальное состояние FP32, возвращает выход и конечное состояние FP32). Последовательное вычисление оценок внутри блока заменено тензорно-ядерным тайлом на 16 токенов; для длинных последовательностей заимствована идея разделения на разделы/сканирование/воспроизведение из #1931, включается только при длине последовательности не менее 16384. Измерения на H200 (батч 2, длина 16384, голов 4, Dk=Dv=64): старый блочный путь 472,1 микросекунды, разделённый путь 348,5 микросекунды, эталонная реализация 443,5 микросекунды; независимые замеры по бенчмарку из манифеста дали TileOps 392,0 против эталона 531,5 микросекунды. Для коротких последовательностей сохранён исходный путь.
  • #2169 (12:58 открыт новый PR): оптимизация группировки в пути индексов MoE, когда отдельный эксперт получает более 16 маршрутов — выбор между индексированием и последовательным выполнением по плотности маршрутов, а не по числу токенов; измерения на H200 на уровне 64 токенов: DeepSeek-V3 с 0,80 до 0,990 (относительно vLLM, значение больше 1 означает быстрее), Kimi-K2 с 0,83 до 0,993, GLM-4.5 до 0,995; на уровне 32 токенов — до примерно 1,0. Дублирующий одиночный PR #2171 закрыт через три минуты после открытия.
  • Закрыто три PR: два исследования производительности — ускорение W4A16 GEMV (#2159) и разбиение по K в сетке W4A16 (#2170) — закрыты; открытый 08-17 конвейер предзаполнения GLA (#1931) закрыт, его идея разделённого сканирования уже поглощена #2174.

Три PR по производительности (Engram, GEMM, GLA) плюс одна оптимизация MoE, присутствующие одновременно в течение одного дня, — это самый плотный день по коммитам производительности у TileOPs за последнее время.

1.6 TileOPs: сбой синтеза roofline переведён в отчётный, три обновления в очереди (09-22)

Дата: 2026-09-22 Источник: TileOPs #2175

19:47 Открыт новый (8 файлов +473/-160). Прямое решение проблемы «синтез формулы не удаётся, но об этом не сообщается»: ранее элемент, вычисление которого не поддавалось синтезу, отображал лишь заглушку, а сообщение, действительно указывающее на недопустимое имя или конструкцию, выбрасывалось слоем генерации кода и никем не принималось; сам слой генерации кода также не выносил решение по каждому элементу (для немаппированных сигнатур выбрасывалось голое исключение, для случая служебных свойств уровня модуля и вовсе любое исключение считалось допустимым); к тому же процесс синтеза ради привязки одного имени импортировал парсер выходного dtype, а вместе с ним всю библиотеку тензоров — проверка имени и формы формулы вовсе не должна требовать torch. Данный коммит превращает шлюз слоя генерации кода в полное решение (каждый деформированный элемент — явная ошибка с указанием имени оператора), решение читает только сам элемент (175 реализованных элементов полностью синтезируемы в среде без torch), а также добавляет поголовную проверку синтеза, сообщающую о причинах сбоя как об ошибках уровня schema. Одновременно исправлены шесть несоответствий коду в проектном документе.

Обновление очереди: #2168 (порядок предупакованных весов W4A16, обновлено в 23:55) остаётся открытым; #2163 (оператор инференса DeltaNet, обновлено в 23:36) и #2160 (миграция переменной длины GQA, обновлено в 23:19) продвигаются.

1.7 TileFoundry: влиты два коммита — метаданные памяти и нормализация трафика (09-22)

Дата: 2026-09-22 Источник: TileFoundry #175/#176/#168

  • #175 (влито в 12:09): анализ поддерживает начало цикла зависимых единиц — когда верхняя граница и шаг несут семантику единиц, начало цикла больше не предполагается нулевым; методология анализа согласована с семантикой циклов аппаратного исполнения.
  • #176 (влито в 15:22, два коммита): метаданные памяти и нормализация трафика — переписаны модули памяти и метаданных анализа, затронут учёт трафика, roofline и документ спецификации анализа (в едином файле спецификации анализа изменено 263 строки), синхронизированы учебное руководство и инспектор. Оба вошли в день открытия (09-21), завершены в течение суток.
  • Связанные задачи: #171, #173 закрыты; #168 (повторное чтение инвариантных операндов должно учитываться в общем объёме трафика) остаётся в обсуждении.

1.8 Ночной снимок: база 1046 позиций, ноль сбоев; корректность 1141 позиция — публикация возобновлена (09-23)

Дата: 2026-09-23 Источник: коммит снимка 81946098/метаданные среды снимка

Сгенерирован в 02:38 для b07a259f (точка вливания #2167): база 1046 позиций, сбоев 0, пропущено 3 (по-прежнему три позиции GQA с постраничной организацией), число тест-кейсов на уровне предыдущего; файл результатов корректности на этот раз опубликован снова — 1141 позиция, сбоев 0, пропущено 2; тем самым снята неясность с отсутствием файла в двух предыдущих снимках (снимок от 09-21 прилагал только файл базы). Среда та же, что и в прошлый раз: H200, CUDA 13.2, драйвер 595.71.05, TileLang 0.1.11 с кодовым обозначением версии, torch 2.13.0, кодовое обозначение образа afcebed1, вторая версия.


2. Мультибэкендовая адаптация (Ascend / Hygon / MetaX / Moore Threads и др.)

2.1 Ascend: ежедневный тест вновь демонстрирует сбой на уровне рабочего процесса, три новые заявки на дефекты указывают на аппаратный путь A5 и автосинхронизацию (09-22 — 09-23)

Дата: 2026-09-22 — 2026-09-23 Источник: ежедневный тест #1831/#1830/#1824/#1825

  • Ежедневный тест повторно воспроизвёл сбой (#1831, 09-23 06:29 автоматически создан): пакетное задание после примерно полутора часов работы завершилось сбоем (сбой на уровне рабочего процесса, не на уровне тест-кейса); по сравнению со снимком от 09-22 06:35 результат был 2448/2448 полностью зелёный. За последние три дня наблюдается чередование красного и зелёного (09-21 сбой рабочего процесса, 09-22 полностью зелёный, 09-23 сбой), проблема стабильности заслуживает постоянного наблюдения. В ветке кода в данном окне мониторинга коммитов не было.
  • #1830 (09-23 00:47 создан): дефект архитектурной метки на пути устройства A5 — на реальном Ascend 950 (dav-3510) путь устройства компилируется с фиксированной меткой dav-2201 (относящейся к поколению 910B), ядро при запуске сразу сообщает об исключении устройства 507015; после изменения метки ядро запускается, но молча вычисляет неверные значения (ошибка в масштабирующем коэффициенте официального примера квантования). Автор указывает, что корневая причина — жёстко закодированная архитектурная метка в коде сборки, и отмечает, что матрица верификации в README как раз двусторонне обходит эту метку (реальные машины A2/A3 сами по себе относятся к поколению 910B, A5 идёт только через эмуляцию), поэтому дефект не был обнаружен.
  • #1824 / #1825 (09-22 09:58 созданы, один и тот же докладчик): две границы автоматической синхронизации — состояние синхронизации внутри условной ветки ошибочно объединяется, при невыполнении ветки последующее чтение может остаться без барьера (включая минимальное воспроизведение); автоматическая межъядерная синхронизация должна на этапе компиляции напрямую отклонять две конфигурации: «отключение комбинированного переключателя приводит к молчаливому отказу переключателя» и «смешанное использование двух наборов синхронизации — автоматической и рукописной». В последнем случае указывается, что сами примеры в репозитории уже содержат такую конфигурацию.

2.2 MLIR Ascend: крупное слияние оператора Mamba SSD chunk scan, одновременно усовершенствованы процессы настройки и интеграции (09-22)

Дата: 2026-09-22 Источник: tilelang-mlir-ascend #191

Слито в 18:57 (создано в 15:18, завершено примерно за 3,5 часа, 42 файла +4204/-1568). Китайский заголовок и есть описание изменений, три блока содержимого: во-первых, оптимизация экспертного ядра NPU для блочного сканирования дуальности пространства состояний Mamba-2 (SSD) и подключение к обёрточному слою — улучшена загрузка предыдущего состояния, вычисления с двойной буферизацией L0C, повторное использование данных векторной ветки, одновременно обновлены конфигурация по умолчанию, проектная документация и журнал настройки; во-вторых, усовершенствован процесс оператора — исправлено распределение нагрузки задач оптимизации и выбор базовых тест-кейсов, список нагрузки генерируется из базовых тестов, результаты производительности записываются по фактически протестированным файлам ядра, а в контроле качества проверяются итоговые файлы, покрытие тестами и данные отчёта; в-третьих, добавлена автоматическая генерация и проверка отчётов TileOPs, при интеграции автоматически устанавливаются переменные режима, а выводы повторного запуска SSD и второго раунда настройки фиксируются в библиотеке режимов, кейсах и записях задач. Данное слияние перекликается с линией Mamba в репозитории адаптации Ascend в том же окне, а также с работой по блочному сканированию в репозитории TPU сообщества (см. 2.5).

2.3 Hygon: переработка расширенного коммита FP32 MMAC K; PR поддержки примеров добавляет 32 файла (09-22)

Дата: 2026-09-22 Источник: коммит ветки e4dc1053/PR поддержки примеров #11

  • Переработка ветки функции (отправлено в 15:27): исправление в ветке feat/hcu-ds-read-fp32-mmac-k было расширенно переработано — исходная трёхфайловая версия (общий FP32 MMAC K и упаковка фрагментов) расширена до пятифайловой версии (+54/-86): добавлено удаление ограничения FP16/BF16 по типу данных в выводе стратегии LDS для GEMM (расширяет область применения стратегии, расчищая предпосылку для пути FP8), а также очищен обходной код экспорта FP8 в адаптере tvm_ffi (удалено 53 строки, добавлено 4 строки; изначально использовался для обхода ограничения невозможности экспорта torch FP8 через DLPack); дата коммита — вечер 09-21, отправка состоялась в данном окне. У этой ветки по-прежнему нет соответствующего PR.
  • Расширение PR поддержки примеров #11 (дополнительный коммит в 14:44, 32 файла +1086/-121): обеспечена поддержка Hygon для примеров восходящего потока TileLang — добавлены эксклюзивные примеры flash attention для HCU (прямой проход 258 строк, обратный 603 строки) и их тесты; массово адаптированы примеры восходящего потока: внимание (многоголовое прямое и обратное, декодирование GQA и переменная длина, блочная разреженность), блочное состояние MoE, GEMM (автонастройка, персистентность, встроенные примитивы), GEMV, групповое матричное умножение и другие; рабочий процесс CI и скрипты регрессии синхронно обновлены, а также подключены предварительно скомпилированные колёса flash-attn из отечественного зеркала.

2.4 MetaX и Moore Threads: в окне коммитов нет (проверка 09-23)

Дата: 2026-09-23 (проверка) Источник: tilelang-metax/tilelang-musa

Последний коммит MetaX по-прежнему от 09-21 (синхронизация с восходящим потоком), последний коммит Moore Threads от 09-17; в обоих репозиториях в данном окне новых действий нет. На стороне MetaX есть ещё одно проявление температуры экосистемы: тренировочный лагерь сообщества на базе C500 и TileLang продолжает подавать материалы (см. 3.2).

2.5 Бэкенд сообщества: TileLang-TPU продвигает многоядерную верификацию и матрицу производительности Sophon BM1690 (09-22)

Дата: 2026-09-22 Источник: репозиторий сообщества TileLang-TPU

Репозиторий расширения TileLang для ускорителей Sophon, поддерживаемый сообществом, в этом окне получил три коммита подряд: проверка S3 и P6 для многоядерного блочного сканирования (14:27), матрица производительности P10 (16:05), исправление проверки исходного кода на стороне хоста для P10 (16:13). Этот репозиторий позиционируется как «перенос программной модели TileLang на цель TPU Sophon» — сохраняется Python-фронтенд TileLang, добавляются понижение для TPU, генерация кода и интеграция со средой выполнения JIT, предоставляется цель target="tpu", два режима выполнения — через PCIe и эмуляцию, TPU-специфичные примитивы (копирование, матричное умножение, редукция, обратный квадратный корень, позиционное кодирование вращением и т. д.), а основной линией является BM1690; с 09-20 начата аппаратная верификация и поэтапная оптимизация (одноядерная, многоядерная, дорожная карта производительности с P8 по P10). Репозиторий находится в активной разработке и заявляет о приветствии вкладов. Это первый публичный путь бэкенда TPU, появившийся в сообществе TileLang; в сопоставлении с включением блочного сканирования Mamba для MLIR Ascend в том же окне, одно и то же семейство алгоритмов в один и тот же день появилось на двух наборах не-NVIDIA целей.


3. Экосистема и стороны внедрения

3.1 Стороны внедрения: TileKernels и FlashQLA без пушей в окне (проверка 09-23)

Дата: 2026-09-23 (проверка) Источник: TileKernels/FlashQLA

В окне у обеих сторон внедрения не было пушей: последний пуш TileKernels остановился на 04-23; последний пуш FlashQLA — 09-18. Примечательно, что слияние FP4 в FP8, включённое в основном репозитории в этом окне, как раз нацелено на экспертный GEMM DeepSeek V4.1 — сторона внедрения код не меняла, но шаблон преобразования в её коде инференса напрямую стимулировал вышестоящую оптимизацию.

3.2 Проекты сообщества: материалы практикума по разработке операторов с несколькими парадигмами на MetaX C500 продолжают поступать (09-22)

Дата: 2026-09-22 Источник: репозиторий материалов учебного лагеря сообщества

В этом окне два коммита: завершено практическое сравнение двух реализаций — на TileLang и на Jiuchi — для второй лекции «сложение векторов» (10:29), а также дополнена конфигурация навыков операционного агента для рабочего процесса удалённых экземпляров (10:32). Этот репозиторий материалов использует вычислительные ресурсы MetaX C500 в качестве основы (образ содержит TileLang 0.1.9 и определённую версию инструментальной цепочки); последовательность упражнений такова: устройство и вычислительная среда, сравнение сложения на TileLang и Jiuchi (блоки и хвостовые блоки), редукция и численная устойчивость Softmax и GEMM, разработка и верификация операторов с помощью AI-агента, после чего начинается этап операторов Llama (подключение, корректность, производительность, сквозной сценарий). В истории репозитория видны следы слияния с вышестоящей веткой в рамках инициативы вычислительных ресурсов сообщества, что представляет собой непрерывные усилия в направлении обучения сообщества.


4. Сообщество, руководства и мероприятия

4.1 Сайт документации: одна версионированная публикация сайта документации TileOPs (09-22)

Дата: 2026-09-22 Источник: сайт документации TileOPs

В 08:40 одна автоматическая публикация (версионированный коммит генератора статического сайта 1.6.1), существенных изменений в содержимом сайта не замечено; основной репозиторий сайта документации в этом окне не выполнял публикаций.

4.2 Медиа и академическая сторона: нулевые попадания в Google News, новых статей на arXiv нет (проверка 09-23)

Дата: 2026-09-23 (проверка) Источник: Google News RSS (несколько запросов на китайском и английском, через прокси)/Hacker News/arXiv

В Google News по нескольким группам запросов на китайском и английском в окне нулевые попадания; в Hacker News по соответствующим запросам только нерелевантные записи (совпадения слов вроде трассировки печатных плат, настольных штативов и т. п.); в тематическом поиске arXiv последняя статья по-прежнему относится к 07-24 — работе о модели производительности, новых препринтов в окне нет. На медийной стороне это второе подряд спокойное окно.

4.3 Ритм версий: новых релизов нет, основной репозиторий v0.1.14 достиг 21 дня (09-23)

Дата: 2026-09-23 Источник: tilelang v0.1.14

В окне мониторинга ни в одном репозитории не было новых релизов. Последний релиз основного репозитория по-прежнему v0.1.14 от 09-02 (прошло 21 день); версии всех адаптационных линий не изменились: Ascend v0.1.2.000 (09-09), MLIR Ascend v0.1.2.020 (09-09), Moore Threads v0.1.14+musa.1 (09-11), MetaX v0.1.14 (09-17), Sunrise 0.1.14+sunrise.1.1.0 (09-21). Отдельно отметим: начиная с #2172, TileOPs выдвигает жёсткое требование к нижней границе версии tilelang — 0.1.14; взаимосвязь между ритмом выпуска версий и окном принятия нижестоящими потребителями заслуживает внимания.


5. Наблюдения за трендами

5.1 Преобразующие операторы становятся полноправными гражданами

Одно изменение из 161 строки, занимающееся исключительно вопросом «как FP4 превращается в FP8», даёт ускорение сквозного прохода в 2,97–5,38 раза — но при условии, что оно появляется на пути весов, которые читаются многократно. Параллельно с этим три улучшения производительности в TileOPs (разделение Engram, скрытие перемещения данных для GEMM, блочность GLA) также оптимизируют «сколько раз читается один и тот же блок данных и на каком уровне кэша он циркулирует». Когда структура на уровне операторов постепенно стабилизируется, выгода продолжает смещаться в сторону перемещения данных и преобразования форматов — это же объясняет, почему основной репозиторий принимает точное изменение кодирования преобразования как полноценную запись, а не как локальную мелкую правку.

5.2 TileOPs переходит от сезона управления к сезону производительности

Ключевым словом прошлой недели было «исправить неверное на верное» (формулы, физика, прослеживаемость); в данном окне в течение одного дня одновременно присутствуют три заявки на производительность плюс одна оптимизация маршрутизации, причём новые заявки, как правило, несут с собой эталонные基准 для сравнения (torch.compile, cuBLASLt, эталонная реализация, vLLM) и заявление о побитовой идентичности. Бухгалтерская книга, оставленная управлением, превращается в кредитный актив работы над производительностью: каждая заявка на производительность может быть независимо перепроверена по списку и эталонным基准.

5.3 Чередование красного и зелёного у Ascend и реальная аппаратная проверка A5

Чередование красного и зелёного в ежедневных тестах за три дня показывает, что стабильность среды прогонов всё ещё не закрыта; а проблема, выявленная в #1830, более показательна — матрица верификации покрывает поколение 910B на реальных машинах и поколение 950 на симуляции, и как раз обе стороны обходят архитектурную маркировку путей устройств, из-за чего дефект проявляется на реальном 950 в двух формах: «падение при запуске, а после смены маркировки — молчаливый неверный расчёт». Глубина адаптации кросс-поколенческого оборудования переходит от «способности скомпилировать» к этапу «готовности калибровать на реальных машинах».

5.4 Пробелы и точки риска

Четыре пункта: во-первых, ритм слияний в основной репозиторий в данном окне составил лишь одну запись, обе крупные линии — TileIR и магическое деление — находятся в состоянии «ингредиенты добавлены, но печать не поставлена»; заслуживает наблюдения, не становится ли узким местом пропускная способность рецензирования; во-вторых, застой релизов достиг 21 дня, а нижестоящий потребитель (TileOPs) уже начал заявлять жёсткую зависимость от 0.1.14 и выше — такт между окном версий и принятием экосистемы нуждается в согласовании; в-третьих, проблема корректности вывода Ascend A5 (молчаливая ошибка после смены маркировки) пока не имеет заявки на исправление, и если она подтвердится, это повлияет на нарратив доверия к поколению 950; в-четвёртых, ветка особенностей Hygon по-прежнему без PR, а крупное слияние с откатом у Ascend не имеет запланированной даты переделки — состояние «внедрение в пути» двух отечественных линий сохраняется.


Приложение: материалы и пояснения по проверке

Таблица проверки источников

Источник Результат проверки
Организация tile-ai (28 репозиториев) В окне推送 в 7 репозиториях: tilelang, TileOPs, TileOPs-nightly, TileFoundry, tilelang-mlir-ascend, tilelang-hygon, TileOPs.github.io
Основной репозиторий tilelang, ветка по умолчанию 1 слияние (#3204); 1 новая заявка (#3269); #3247, #3267, #3265, #3241–#3244 — у каждой обновление в окне; новых и закрытых issue в окне — 0
TileOPs 1 слияние (#2167); новые #2169, #2172, #2173, #2174, #2175 (#2171, дубликат той же темы, закрыт на месте); закрыты #2159, #2170, #1931; обновлены #2168, #2163, #2160
TileOPs-nightly 1 снимок (81946098, соответствует b07a259f, т. е. точке слияния #2167): эталонный基准 1046 пунктов, ноль отказов; корректность 1141 пунктов восстановлена с выпуском снимка
TileFoundry 2 слияния (#175, #176); #171, #173 закрыты; #168 остаётся в обсуждении
tilelang-mlir-ascend 1 слияние (#191, оптимизация Mamba SSD chunk scan, 42 файла)
tilelang-hygon В 2 ветках есть推送: коммиты ветки особенностей расширены и переделаны; примеры поддержки PR #11 — дополнительно 32 файла коммитов
tilelang-ascend В кодовой ветке нет推送; отказ на уровне ежедневного рабочего процесса (#1831); 3 новые заявки на дефекты (#1830, #1824, #1825)
Остальные репозитории tile-ai (TileRT, tilescale, DeepStack, tilelang-puzzles, metax, musa и др.) В окне нет推送
Потребители (TileKernels, FlashQLA) В окне нет推送
Сторонние находки Репозиторий расширения TPU сообщества (3 коммита многоядерной верификации BM1690); репозиторий материалов тренировочного лагеря сообщества (2 коммита)
Google News / Hacker News / arXiv Ноль попаданий по нескольким группам запросов на китайском и английском; в HN нет связанных записей; в arXiv нет новых препринтов

Полный список источников

Ветка функций Hygon, коммит (e4dc1053) — https://github.com/tile-ai/tilelang-hygon/commit/e4dc1053