Окно мониторинга: последние 24 часа (2026-09-23 07:00 ~ 2026-09-24 07:00, пекинское время). Стандартное ежедневное окно, без пересечения с предыдущим выпуском. Источники: GitHub (проверка push-активности в 29 репозиториях организации tile-ai, в окне были push в 10 репозиториях; в основном репозитории смержены два исправления дефектов и открыт новый тикет проверки NaN; в TileOPs за один день смержены семь оптимизаций производительности и открыты девять новых; в TileFoundry смержен крупный блок по анализу памяти; в Ascend два отката примеров и исправление состояния гонки при работе с памятью; в MLIR Ascend и Hygon по одному смерженному исправлению; первый коммит в новый репозиторий TileSight; ночной снимок корректности — 1141 пункт, ноль сбоев), Google News RSS множественные запросы на китайском и английском (через прокси, ноль попаданий), Hacker News, arXiv, проверка репозиториев сообщества


Индекс выпуска

  • Главное за сегодня: TileSight официально открыт — аналитическая модель производительности с центром на тайлах из статьи превратилась в официальный репозиторий (09-23)
    1. Прогресс ключевых проектов
      • 1.1 Основной репозиторий: смержены два исправления дефектов, тикет исправления границ индексации закрыт в тот же день (09-23)
      • 1.2 Основной репозиторий: семантика распространения NaN выходит на поверхность, проверка на этапе компиляции подключена в тот же день (09-23)
      • 1.3 Очередь ревью основного репозитория: в бэкенде TileIR накоплен 31 коммит, всё ещё на рассмотрении (09-23)
      • 1.4 TileOPs: семь оптимизаций производительности смержены за один день, все семь подсистем продвигаются (09-23)
      • 1.5 Спецтема TileOPs: оператор инференса DeltaNet добавлен в список, на H200 ускорение до 3,7 раза по сравнению с FLA (09-23)
      • 1.6 Очередь новых задач TileOPs: тройной varlen GQA и потоковый W4A16 с длинным K (09-23)
      • 1.7 TileOPs: упорядочивание каналов внешних бэкендов — удалено 38 проверок устройств (09-23)
      • 1.8 TileFoundry: смержен анализ объёма памяти и окна повторного использования (09-23)
      • 1.9 Ночной снимок: корректность 1141 пункт, ноль сбоев, тайм-аут бенчмарка длинного префилл-заполнения DeltaNet (09-24)
    1. Мультибэкендная адаптация (Ascend / Hygon / MetaX / Moore Threads и др.)
      • 2.1 Ascend: два отката примеров mHC (09-23)
      • 2.2 Ascend: предложено исправление состояния гонки при скалярной записи в GM, число различий сведено к нулю (09-23)
      • 2.3 Ascend: ежедневное тестирование 2448 пунктов восстановлено до полного прохождения (09-24)
      • 2.4 MLIR Ascend: смержены исправления утечки памяти в NPU launcher и синхронизации потоков (09-23)
      • 2.5 Hygon: смержена поддержка примеров, 37 файлов задействуют матричные ядра HCU (09-23)
      • 2.6 MetaX и Moore Threads: в репозиториях нет push, управление MUSA переведено в очередь TileOPs (проверка 09-24)
    1. Экосистема и потребители
      • 3.1 Потребители: TileKernels и FlashQLA без push в окне (проверка 09-24)
      • 3.2 Проекты сообщества: репозиторий верификации TPU и репозиторий тренировочного лагеря MetaX без новых коммитов (проверка 09-24)
    1. Сообщество, руководства и мероприятия
      • 4.1 Сайт документации: плановая перегенерация сайта документации основного репозитория (09-23)
      • 4.2 Медиа и академическая сторона: ноль попаданий в Google News, на arXiv нет новых препринтов (проверка 09-24)
      • 4.3 Ритм релизов: новых релизов нет, основной репозиторий v0.1.14 находится на отметке 22 дня (09-24)
    1. Наблюдения за тенденциями
      • 5.1 Формирование аналитического слоя: от статей и документации сообщества к официальному репозиторию кода
      • 5.2 Завершение и новый старт сезона производительности TileOPs
      • 5.3 Технический долг мультибэкендности становится явным
      • 5.4 Пробелы и риски
  • Приложение: материалы и пояснения по проверке

Главное за сегодня: TileSight официально открыт — аналитическая модель производительности с центром на тайлах из статьи превратилась в официальный репозиторий

Дата: 2026-09-23 Источник: репозиторий tile-ai/TileSight / первый коммит init / arXiv 2607.22432

09-23 22:54 (пекинское время) новый репозиторий TileSight в организации tile-ai завершил первый коммит init: 177 файлов, около 56,7 тыс. добавленных строк, лицензия MIT, автор коммита — Zhiwen Mo из Имперского колледжа Лондона. Обещание из конца статьи на arXiv от 24 июля «будет открыт после публикации» наконец выполнено; общее число репозиториев организации выросло с 28 до 29.

TileSight позиционируется как аналитическая модель производительности GPU «с центром на тайлах»: единицей моделирования служит тайл, на стороне CPU оцениваются операционные затраты оператора, трафик кэша и время выполнения — внутри ядра моделируется перекрытие вычислительного конвейера и конвейера доступа к памяти, между ядрами моделируется иерархия кэша, между GPU моделируются межнодовые коммуникации; измеренная калибровка выполняется отдельно зондами CUDA и HIP на целевом GPU и развязана с моделированием. Заявленная в статье точность: на четырёх поколениях платформ A100, H200, B200, B6000 объединённая средняя абсолютная процентная ошибка задержки одного ядра составляет 12,35%, прогноз попаданий в L2 отличается от измеренного примерно на 1 процентный пункт; при расширении до кластера из 32 карт взвешенная ошибка для слитых распределённых ядер и сквозного сервиса vLLM составляет 16,18% и 13,52% соответственно.

Структура репозитория (объём первого коммита):

  • tilesight/arch/: более 20 аппаратных профилей, охватывающих NVIDIA A100/H100/H200/B200/B6000/V100/T4/P100 и RTX 3090/4090/5090 и др., AMD MI50/MI210/MI300X/MI325X, Intel Arc 770;
  • tilesight/modeling/: фронтенд программ (конструктор/анализ/контракты), модель расстояния повторного использования многоуровневого кэша (SDCM), анализ перекрытия конвейера (пролог/устойчивое состояние/эпилог, занятость, квантование волн), GEMM/FlashAttention (циклическое планирование FA3/FA4) и адаптеры декодирования FlashMLA и др.;
  • micro_benchmark/: зонды CUDA (B200 tcgen05/tmem, H200 wgmma, универсальное сканирование dram и P2P) и зонды HIP (rocBLAS GEMM, информация об устройствах AMD);
  • examples/ и полный набор тестов, а также инструменты прогнозной поддержки для сравнения с NCU и CuTeDSL/частных цепочек инструментов.

Интерпретация: это третий фрагмент线索 «объяснимости производительности» данной темы — статья от 24.07 (соавторство Imperial College и ключевых участников TileLang) → общественный репозиторий документации от 18.09 (подключение аналитики TileLang к TileSight) → официальный репозиторий кода от 23.09. Он закрепляет ранее разрозненные в статьях и личной документации методы в организационный проект, формируя разделение труда с TileFoundry (анализ IR во время компиляции): один прогнозирует межслойные затраты на этапе моделирования, другой выдаёт заключения о ёмкости кэша на этапе компиляции. То, что аппаратные профили охватывают дискретные видеокарты AMD и Intel, также естественно позволяет ему служить нарративу о множественных бэкендах.


1. Ключевые进展 проекта

1.1 Основной репозиторий: два исправления дефектов влиты, исправление границ индексации закрыто в тот же день (23.09)

Дата: 2026-09-23 Источник: #3232/#3246/#3272

  • #3232 (влито в 13:54, +196/−14, 3 файла): исправлена проблема «повторного использования изменяемой скалярной привязки целью цикла» (тикет дефекта #3231 синхронно закрыт) — для целей цикла (включая кортежные цели) создаётся явная привязка, чтобы избежать записи индукционной переменной в существующую alloc_var или привязку Ref, при этом сохраняются обычное изменяемое присваивание и проверки выхода за границы; добавлены регрессионные тесты для форм цикла, кортежных целей, устаревших привязок и др.
  • #3246 (влито в 11:52, +76/−6, 2 файла): параметр подсказки ширины объединения coalesced_width для T.copy и T.async_copy изменён с «фатальный лог при неделимости ширины» на «ограничение по достижимой ширине вектора» — запрос трактуется как верхняя граница, берётся наибольший делимый множитель геометрически выведенной ширины; при деградации выдаётся предупреждение, неположительные значения отклоняются; покрыты регрессии для нерегулярных и сверхбольших ширин (8, 257); соответствующий тикет дефекта #3007 синхронно закрыт.
  • #3272 (открыт ночью 24.09, закрыт в 01:49, не влит): предотвращение расширения индекса буфера, ровно равного верхнему пределу представимого знакового типа, до 64 бит; тикет закрыт в тот же день без пояснений; если проблема сохраняется, требуется продолжение решения.

1.2 Основной репозиторий: семантика распространения NaN выходит на поверхность, проверка на этапе компиляции подключена в тот же день (23.09)

Дата: 2026-09-23 Источник: #3270/#3273/#3205

  • 14:15 тикет дефекта #3270: nan_propagate=True для трёх операторов редукции reduce_max, reduce_min, reduce_absmax молча игнорируется на выходах float32/float64 (для float16/bfloat16 есть поддержка бэкенда). Автор отчёта привёл полное окружение (H800, CUDA 13.1) и указал, что это поведение определяется dtype на этапе понижения, а не аппаратным обеспечением — то есть семантика несогласована на одном и том же реальном оборудовании.
  • 03:08 ночи 24.09 открыт новый PR #3273: добавлена ошибка на этапе компиляции для неподдерживаемых выходных dtype — диагностика выдаёт имя операции, поддерживаемые выходные типы и фактический dtype аргумента; проверка размещена внутри конструктора нативного ReduceOp (контракт dtype аккумулятора единообразно поддерживается для локальной редукции, фрагментной редукции и накопления с записью); регрессионная матрица покрывает три оператора × два уровня clear × два значения флага × пять dtype; регрессия упакованной редукции SM100 синхронно обновлена на ожидание той же диагностики.
  • Ещё одна ветка #3205 (исправление понижения шаблона устройства для clamp распространения NaN) продолжала обновляться в окне мониторинга, всё ещё на ревью.

Интерпретация: это очередное воспроизведение принципа «переноса молчаливых семантических ошибок в отказ на этапе компиляции» на новую семантику типов данных — от генераторов случайных чисел, доказательств раскладки, комбинаций типов до распространения NaN, причём реакция от отчёта до исправляющего PR уложилась в полдня.

1.3 Очередь ревью основного репозитория: бэкенд TileIR накопил 31 коммит и всё ещё на рассмотрении (09-23)

Дата: 2026-09-23 Источник: #3247/#3267 и др.

  • #3247 (бэкенд исполнения CUDA Tile IR): в течение окна мониторинга продолжалась новая активность, объём накоплен до 31 коммита, +36506/−112 строк, 139 файлов, всё ещё не влит; полнота от JIT, кэша и автотюнинга до документации и CI — наибольшая среди всех предыдущих окон.
  • #3267 (tl.LowerMagicDiv магическое деление), #3265 (опускание целочисленных вычислений инвариантов запуска) — в окне мониторинга получили обновления, ожидают влития; запрос на функцию #3261, соответствующий магическому делению, обновлён синхронно.
  • #3243 (отклонение void-привязки RNG), #3205 и другие исправления остаются открытыми.

Наблюдение за очередью: в этом окне основной репозиторий продолжил ритм «мелкие исправления штампуются, крупные изменения накапливают материал» — два исправления дефектов вошли в основную ветку, полоса оценки по-прежнему сосредоточена на крупных элементах.

1.4 TileOPs: семь слияний производительности за один день, продвижение по всем семи подсистемам (09-23)

Дата: 2026-09-23 Источник: #2168/#2163 и ещё семь (полный список см. в приложении)

С 13:13 по 18:44 (пекинское время) семь PR последовательно влиты, охватывают семь подсистем: GEMM, Engram, внимание, MoE, Mamba, mHC, линейное внимание:

  • #2168 (13:13): W4A16 GEMM поддерживает чтение предварительно упакованного порядка весов (нативная поддержка пути квантованного развёртывания);
  • #2173 (13:14): шаг декодирования Engram разделён на два сегмента ядер — проекцию и редукцию;
  • #2160 (16:44): ядро varlen GQA перенесено в унифицированный оператор (завершение рефакторинга);
  • #2169 (16:45): избыточная маршрутизация MoE сгруппирована по 16 строк как ведущая;
  • #2176 (16:46): Mamba DaCumsum объединяет загрузку dt, двухуровневое сканирование на каждый блок;
  • #2177 (16:46): проекция предзаполнения mHC разбита вдоль размерности K;
  • #2163 (18:44): оператор инференса DeltaNet (см. 1.5).

Также #2162 (исследовательский тикет по конвейеру varlen GQA и полнотиловым маскам) закрыт в тот же день без влития; три последующих новых открытия того же автора (см. 1.6) продолжают это направление.

1.5 Спецтема TileOPs: оператор инференса DeltaNet добавлен, максимальное ускорение до 3,7 раза относительно FLA на H200 (09-23)

Дата: 2026-09-23 Источник: #2163

Влито в 18:44 (+743/−3, 13 файлов):

  • Добавлены DeltaNetInferenceFwdOp и ядро плотного предзаполнения для H200 (конвейер блочного решения/рекурсии на основе Gated DeltaNet); существующий API обучения и независимое ядро декодирования остаются без изменений; поддерживается ненулевое начальное состояние FP32, удерживаемое вызывающей стороной;
  • Текущая внутридревесная специализация охватывает сценарии равной длины BF16/FP16 предзаполнения, K=V=64 или 128, T≥64 и делящегося на 64; декодирование, упакованная переменная длина и L2-нормализация Q/K отнесены к последующим путям, публичный контракт инференса пока «спецификационного уровня»;
  • Верификация: на H200 прошли 51 тест инференса/GDN/roofline, 9 унаследованных тестов прямого прохода; при заблокированной частоте (SM 1500MHz) попарное A/B с FLA по каждому случаю (микросекунды, медиана; busy — сумма времени активности GPU, latency включает промежутки активности):
B / T / H / D TileOps busy FLA busy TileOps latency FLA latency
2 / 2048 / 4 / 64 44.8 67.1 293.1 497.0
2 / 8192 / 4 / 64 76.5 229.9 306.5 486.5
2 / 16384 / 4 / 64 120.5 448.2 320.6 602.1
1 / 4096 / 16 / 128 116.6 206.8 300.1 494.6

Чтение: максимальное ускорение по метрике busy — 3,7 раза (T=16384), сквозная задержка с промежутками снижена максимум примерно на 47%; каждый случай перед хронометражем проходит сверку выходов и конечного состояния. Также следует отметить: после вхождения этого оператора в ночной бенчмарк в конфигурации длинного предзаполнения произошёл один таймаут (см. 1.9).

1.6 Очередь новых открытий TileOPs: трио varlen GQA и потоковая обработка W4A16 с длинным K (09-23)

Дата: 2026-09-23 Источники: #2178/#2180/#2184/#2185

  • varlen GQA, три подряд (20:13 / 22:22 / 09-24 00:27, один и тот же автор): предварительное планирование расписания, персистентность расписания, улучшение локальности и редьюса. Направление — перевод планирования работы для varlen GQA с определения во время исполнения к «предварительному планированию + персистентности».
  • W4A16, длинный K, потоковый режим (09-24 01:02, +482/−234, 3 файла): постановка задачи приводит полную смету — строка декодирования с длинным K (1, 8192, 81920) занимает 0.1366ms, отстаёт от Marlin с 0.1261ms (коэффициент 0.92), это единственная нагрузка в семействе W4A16, которая медленнее Marlin; тайл на один токен выполняет дополнительное масштабирование на каждую пару весов, сетка длинного K из 128 N-тайлов соответствует 132 SM (4 SM простаивают всё время), разбиение регистров для 256-поточного тайла (24+240) превышает лимит регистрового файла и на практике зависает на setmaxnreg. Исправление: групповое масштабирование отложено до частичных сумм FP32, построение малых тайлов по реальному M, введение сетки stream-K с независимым редьюсом, разбиение регистров изменено на 32/224.

1.7 TileOPs: управление каналами внешних бэкендов — устранено 38 проверок устройства (09-23)

Дата: 2026-09-23 Источники: #2179/#2164/#2182

Контекст: разработчик из сообщества сообщил, что при интеграции внешнего бэкенда MUSA на MTT S5000 несколько официальных операторов «падают до вызова зарегистрированного внешнего конструктора» — три блокирующих фактора: валидация входных данных только для CUDA, отказ внешнего вызова при нулевом входе, запрос устройства CUDA перед делегированием (дефект #2164; #2165 и #2166 отдельно фиксируют проблемы тестовых путей и регистрации билдеров).

Реакция в окне мониторинга:

  • #2179 (+797/−256): удалено около 38 проверок типа устройства на уровне операторов (RoPE, Dropout, Mamba/SSD, DeltaNet, GLA, NSA, Engram, MoE, FFT, квантизация FP8, TopK и др.), вместо этого внутридревесные ядра объявляют устройство на уровне тензоров через Kernel._require_cuda; check_tensor_shape сохраняет проверку формы, но убирает проверку устройства; добавлен pre-commit-хук op-device-kind-lint, предотвращающий возврат проверок типа устройства; для отложенных вызовов построения введён параметр make_call. Два класса — нулевой вход и составные операторы — требуют проектных решений и отнесены к последующей работе.
  • #2182 (issue): указывается, что протокол BuildKernel обещает лишь вызываемый объект, тогда как уровень операторов предполагает больше — существуют случаи чтения атрибутов внутридревесных ядер, распаковки нескольких ядер из одной записи, 44 класса операторов не принимают параметр target= и т. д.; составные записи, которые протокол не может выразить, требуют расширения.
  • #2181, #2183: внутридревесные тесты привязаны к пути BUILTIN с явным указанием вывода iter_kernels, а тесты бинарной автонастройки ограничены внутридревесными ядрами, что согласуется с описанным управлением.

Оценка: внешние бэкенды начинают прокладывать последний отрезок пути от «можно зарегистрировать» к «можно планировать»; блокировки выявлены на практике внешней стороной, исправления продвигаются сопровождающей стороной целыми группами — редкий ритм двусторонней координации.

1.8 TileFoundry: объединены метрики потребления памяти и окно повторного использования (09-23)

Дата: 2026-09-23 Источники: #179/#184/#182

  • #179 (09-24 00:10, влито, +3207/−539, 44 файла): закрывает две проблемы — запись памяти вызова и функции имеет «зарезервированные слоты следа», но нет результата рабочего набора по уникальным адресам; снимок L2 за одну итерацию не может ответить, остаются ли переиспользуемые данные резидентными. Новый анализ объединяет в пределах одной целевой волны по конечным исходным адресам и выводит след вызова/функции; из отношений доступа выводятся оси временного и пространственного переиспользования, для каждого буфера сообщается окно резидентности, holds по всем буферам, число байтов переиспользования и вывод fits относительно ёмкости кэша сравнения. Практический пример: GEMM-бенчмарк 128×128×64, w12×11, K=16384 сообщает b holds=176.00MB fits=no (в сравнении с L2 47.68MB) — конкретный, воспроизводимо вычисляемый вывод по ёмкости, а не игрушечный результат.
  • #184 (новый, исправляет #182): отрисовка целочисленного Binary(MUL) могла повторно входить в аксессоры диапазона, что приводило к бесконечной рекурсии — перешли на аксессоры измерений снизу вверх, интервальная арифметика применяется только к неаффинному умножению.
  • #178 (кросс-проверка распределённого HIR, +1825/−34) закрыт, не влит; #172, #168 закрыты; #177 (измерение эффективности передачи) всё ещё открыт.

1.9 Ночной снимок: корректность 1141 пункт, нулевых отказов, таймаут бенчмарка длинного префилла DeltaNet (09-24)

Дата: 2026-09-24 03:01 Источник: коммит снимка/метаданные окружения

  • Снимок соответствует коммиту 252a1721 основной ветки TileOPs, то есть точке влития #2163, покрывает все семь влитий данного окна мониторинга;
  • Корректность: 1141 тест, нулевых отказов;
  • Бенчмарки: 1050 записей (на 4 больше, чем 1046 в предыдущем снимке), нулевых отказов, но возникла 1 ошибка уровня файла — конфигурация длинного префилла prefill-long-bfloat16 в bench_deltanet.py была завершена по таймауту в течение 900 секунд без запуска теста (дамп стека сохранён). Именно этот файл бенчмарка вошёл в конвейер вместе с оператором DeltaNet в данном окне;
  • Окружение совпадает с предыдущим снимком (H200, CUDA 13.2, фиксация частоты SM 1500MHz, образ и версии зависимостей в комплекте).

Толкование: на стороне корректности всё зелёное; на стороне бенчмарков этот таймаут сигнализирует, что между «функциональным влитием» и «выдерживанием бенчмарка» у нового оператора ещё есть затраты, которые надо откалибровать — застой произошёл до запуска теста, это сигнал фазы компиляции или инициализации; в последующих окнах нужно отслеживать, не повторится ли это.


2. Мультибэкендовая адаптация (Ascend / Hygon / MetaX / Moore Threads и др.)

2.1 Ascend: два отката примеров mHC (09-23)

Дата: 2026-09-23 Источник: #1833 (откат #1621)/#1832 (откат #1633)

В 11:26 и 11:30 были влиты два отката: ранее включённые примеры mhc_pre и mhc_bwd (неявный сопряжённый градиент Sinkhorn) для Ascend NPU выведены из основной ветки. Оба находились в репозитории менее трёх дней. В этом репозитории в последнее время уже неоднократно происходили откаты (09-21 также были откаты документации и функций); частота появления и исчезновения вкладов в виде примеров заслуживает отслеживания — ужесточились ли критерии приёмки или это трения процесса, публичных разъяснений пока нет.

2.2 Ascend: предложено исправление гонки скалярного GM-хранилища, число различий обнулилось (09-23)

Дата: 2026-09-23 Источник: #1834 (исправляет #1304)

17:04 новый (+557/−1, 10 файлов), двухуровневое исправление:

  • Анализ первопричины: один и тот же буфер GM смешанно записывается — пакетное копирование идёт напрямую через DMA MTE3, а скалярная запись хвостового столбца SetValue выполняет чтение-изменение-запись через кэш обратной записи с отложенной записью обратно; когда межстрочный шаг не кратен 64 байтам, соседние строки совместно используют строку кэша, и вытеснение грязной строки перезаписывает новые значения, уже записанные DMA; в многоблочных ядрах гонка возникает между ядрами, а инструкции очистки кэша и синхронизации имеют область действия только текущего ядра, поэтому одними лишь инструкциями синхронизации полностью не исправить (в скрипте воспроизведения остаётся 27%).
  • Первый уровень (внутри ядра): на этапе вставки синхронизации для «буферов GM, в которые производилась скалярная запись» выборочно вставляются очистка кэша и ожидание до и после записи MTE3; одновременно распределение номеров событий изменено на циклическое переиспользование (устранён скрытый дедлок, вызванный столкновением жёстко закодированного в шаблоне события 0 с распределением в pass). Число несовпадений в скрипте воспроизведения 12,967,510 → 3,496,136 (снижение на 73%).
  • Второй уровень (устранение перезаписи): добавлен opt-in pass (по умолчанию отключён) — «одиночная скалярная запись в GM внутри последовательного цикла» переписывается в промежуточное хранение в UB + одиночный DMA burst, что устраняет само возникновение грязных строк. После включения число несовпадений обнуляется; 2 новых регрессионных теста пройдены, 113 существующих наборов пройдены, gqa_fwd_varlen без накладных расходов, деградации в квантованном смешанном ядре нет.
  • Область действия: opt-in; формы условной записи, накопления, разбросанной записи и т. п., которые нельзя переписать в непрерывный burst, по-прежнему имеют межъядерные риски (ограничение уровня платформы, рекомендуется отслеживать отдельно); среда автора — Ascend910 A3 / CANN 9.0.0.

2.3 Ascend: ежедневное тестирование 2448 пунктов восстановлено и полностью пройдено (09-24)

Дата: 2026-09-24 06:11 Источники: #1835

Новый раунд ежедневного тестирования сообщает о полном прохождении всех 2448 пунктов (100%). Тикет о сбое на уровне workflow #1831 предыдущего дня всё ещё открыт, но автоматизированный тикет продолжен новым результатом; связаны ли прежние откаты и исправления из 2.1, 2.2 с этим тикетом о сбое, репозиторий пояснений не даёт.

2.4 MLIR Ascend: исправление утечки памяти NPU launcher и синхронизации потока смерджено (09-23)

Дата: 2026-09-23 Источники: #178

Смерджено в 10:50 (+215/−92), три места: во-первых, rtMalloc заменён на потокочувствительный путь выделения torch_npu, дескрипторы тензоров больше не утекают; во-вторых, унифицирован запуск очереди задач — все платформы идут через одну обработку запуска, удалён специализированный путь для 910 и его освобождение в конце, захват lambda изменён с захвата по ссылке на захват по значению (для обработки возможного отложенного выполнения); в-третьих, исправлено расхождение потока — поток запуска разрешается в момент вызова (в соответствии со стратегией triton-ascend), а не захватывается на этапе сборки. Кроме того, тикет улучшения отчётности #192 закрыт, не смерджен; тикет синхронизации тестов A5 #130 остаётся открытым.

2.5 Hygon: поддержка примеров смерджена, 37 файлов задействуют матричные ядра HCU (09-23)

Дата: 2026-09-23 Источники: #11

Смерджено в 15:57 (+1104/−130, 37 файлов): адаптация автоподбора и конфигурации LDS, устранение конфликтов компоновки ядер, переход GEMM на встроенные матричные ядра HCU, дополнение регрессионного покрытия. Продолжая действие предыдущего окна «PR поддержки примеров добавляет 32 файла», примерная реализация линии Hygon доведена до слияния.

2.6 MetaX и Moore Threads: в репозиториях нет пушей, управление MUSA переходит в очередь TileOPs (проверка 09-24)

Дата: 2026-09-24 Источники: tilelang-metax/tilelang-musa

В обоих репозиториях в течение окна пушей не было (последние соответственно 09-21 и 09-17); связанное с этим управление методологией и протоколами перешло в тикеты дефектов и новые PR TileOPs (см. 1.7).


3. Экосистема и стороны-потребители

3.1 Стороны-потребители: TileKernels и FlashQLA без пушей в окне (проверка 09-24)

Дата: 2026-09-24 Источники: репозиторий TileKernels/репозиторий FlashQLA

Последний пуш TileKernels от DeepSeek по-прежнему 04-23; Alibaba FlashQLA — 09-18. В обоих репозиториях в течение окна новых коммитов нет.

3.2 Проекты сообщества: репозиторий верификации TPU и репозиторий тренировочного лагеря MetaX без новых коммитов (проверка 09-24)

Дата: 2026-09-24 Источники: ChunkScan-2-TileLang-4-TPU/metax-operator-training

Последний коммит в репозитории многокомпонентной верификации BM1690 — 09-22, последний коммит в репозитории материалов тренировочного лагеря MetaX — 09-22, в окне мониторинга новых нет. Кроме того, в окне мониторинга в репозитории обучающих материалов сообщества появился один push, при проверке оказалось, что это действие автоматизированной ветки диаграмм за пределами основной ветки, а не обновление содержимого; новый репозиторий категории личных экспериментов (3 коммита) не достиг критериев включения.


4. Сообщество, обучающие материалы и мероприятия

4.1 Сайт документации: плановая регенерация сайта документации основного репозитория (09-23)

Дата: 2026-09-23 Источник: коммит tilelang.github.io

В 14:10 плановый коммит «Update docs», содержимое — регенерация страниц autoapi для tilelang/language/eager/ (ast, builder) (+29/−5, 7 файлов), относится к автоматической синхронизации репозитория кода. Сайт документации TileOPs в 08:11 имел одно действие развёртывания, в его ветке по умолчанию изменений содержимого нет.

4.2 Медиа и академическая сторона: нулевые попадания Google News, новых препринтов arXiv нет (проверка 09-24)

Дата: 2026-09-24 Источник: Google News/Hacker News/arXiv

Несколько групп запросов на китайском и английском в окне мониторинга дали нулевые попадания; в Hacker News нет тематически связанных записей; тематический поиск по arXiv — самая свежая статья по-прежнему TileSight от 07-24 (в этом окне соответствующий ей код уже открыт внутри организации, см. сегодняшний фокус), новых препринтов в окне мониторинга нет.

4.3 Ритм выпуска версий: новых релизов нет, основной репозиторий v0.1.14 уже 22 дня (09-24)

Дата: 2026-09-24 Источник: страница релизов tilelang

Последний тег основного репозитория по-прежнему v0.1.14 (выпущен 09-02), уже 22 дня, приближается к интервалу между двумя предыдущими релизами (около 30 дней); у TileOPs по-прежнему нет записей о релизах; теги репозиториев Ascend, MLIR Ascend, Moore Threads остановились на линии с 09-09 по 09-11; последний релиз TileFoundry — v0.0.2 (09-10). В окне мониторинга во всей организации не было ни одного нового релиза или нового тега.


5. Наблюдения за тенденциями

5.1 Формирование аналитического слоя: от статей и документации сообщества к официальному репозиторию кода

Трёхэтапное внедрение TileSight (статья 07-24 → репозиторий документации сообщества 09-18 → официальный репозиторий кода 09-23) показывает: интерпретируемость производительности вокруг TileLang поднимается со статуса «личной线索» до «проекта организации». Оно пересекается по направлению с TileFoundry (анализ внутри компиляции, в этом окне вывод о ёмкости кэша доведён до воспроизводимости). Значение для экосистемы: помимо библиотеки операторов и среды исполнения, степень проработанности аналитических инструментов становится дифференцирующим активом TileLang по сравнению с аналогичными цепочками инструментов; охват аппаратных профилей TileSight включает дискретные видеокарты AMD и Intel, что также предоставляет основу для моделирования в нарративе о множественных бэкендах.

5.2 Завершение и новый старт сезона производительности TileOPs

Семь слияний и три новых открытия за один день показывают, что сезон производительности TileOPs не завершён, а переходит от первой волны «включения операторов в список» ко второй волне «тонкой шлифовки планирования и конфигурации»: трио varlen GQA сосредоточено вокруг планирования расписания и персистентности, W4A16 — вокруг регистров и утилизации сетки. Наблюдаемый показатель: такой темп слияний должен продержаться ещё несколько торговых дней, чтобы считаться стабильным, иначе это всё ещё импульсное продвижение.

5.3 Проявление технического долга множественных бэкендов

Три блокировки и пробелы в протоколе внешнего бэкенда возвращают «подключаемость множественных бэкендов» из области видения к инженерным деталям: проверки типа устройства разбросаны по слою операторов, протокол строителя гарантирует только вызываемость, 44 классам операторов не хватает целевых параметров. Хорошая новость в том, что в окне мониторинга уже есть сгруппированные действия по разминированию (за один раз устранено 38 проверок и добавлен lint против регресса); по критериям внешней стороны, полнота этого канала определит, сможет ли сторонний бэкенд в текущем цикле прогнать официальную очередь операторов.

5.4 Пробелы и точки риска

Во-первых, накопление ревью в основном репозитории не решено: 31 коммит бэкенда TileIR, магическое деление и инварианты запуска продолжают ждать, накладывается большое окно изменений и стагнация релиза (22 дня); во-вторых, новый оператор при входе в бенчмарк сразу выявляет таймаут длинного префилла, нарративу производительности нужно на уровне бенчмарка дополнить несущую способность; в-третьих, ритм «слияние—откат» в репозитории Ascend продолжается, путь приёмки вкладов категории примеров публично не объяснён; в-четвёртых, фикс границы индекса закрыт в тот же день, и если проблема всё ещё существует, а никто не продолжит, граничное поведение узкого типа индекса останется в подвешенном состоянии.


Приложение: материалы и пояснения по проверке

Таблица проверки источников

Источники Результаты проверки
Организация tile-ai (29 репозиториев) В окне мониторинга были пуши в 10 репозиториев: tilelang, TileOPs, TileOPs-nightly, TileFoundry, TileSight, tilelang-hygon, tilelang-ascend, tilelang-mlir-ascend, tilelang.github.io, TileOPs.github.io
Основной репозиторий tilelang 2 влитых коммита (#3232, #3246); открыт #3273; #3272 закрыт в тот же день; открыто 2 issue (#3270, #3271); обновлены #3247, #3265, #3267, #3243, #3205 и др.
TileOPs 7 влитых, 9 открытых, 1 закрытый; открыто 1 issue (#2182); обновлены #2164–#2166, связанные с MUSA
TileOPs-nightly 1 снапшот (11bd1b9c, соответствует 252a1721, т. е. точке влития #2163): 1141 проверка корректности без сбоев; 1050 бенчмарков, 1 таймаут на уровне файла
TileFoundry 1 влитый коммит (#179); открыт #184; открыт баг-репорт #182; закрыты #178, #172, #168
TileSight Первый коммит (+56675 строк, 177 файлов, MIT)
tilelang-ascend 2 влитых отката (#1832, #1833); открыт #1834; обновлены #1829, #1828, #1815 и др.; ежедневные тесты #1835 полностью пройдены
tilelang-mlir-ascend 1 влитый коммит (#178); #192 закрыт; #130 обновлён
tilelang-hygon 1 влитый коммит (#11)
Репозитории MetaX / Moore Threads В окне мониторинга пушей нет (последние 09-21 / 09-17)
Внедряющие стороны (TileKernels, FlashQLA) В окне мониторинга пушей нет (последние 04-23 / 09-18)
Репозитории сообщества В основной ветке новых изменений нет; пуши в репозиторий с туториалами относятся к ветке автоматизации диаграмм
Google News / Hacker News / arXiv Запросы на китайском и английском без результатов; в HN ничего релевантного; в arXiv новых препринтов нет

Полный список источников