Окно мониторинга: 2026-09-21 10:18 ~ 2026-09-22 10:00 (около 24 часов; продолжение окна ежедневного отчёта от 09-21, без пропусков) Источники: GitHub (org: flagos-ai, полная проверка pushed_at по 54 репозиториям, в окне зафиксированы пуши в 19 репозиториях; поиск коммитов дал 224 совпадения по 15 репозиториям), Google News RSS (24 группы поисковых запросов на китайском и английском, через прокси), официальный сайт MetaX, Jiemian News, Guandian Web, сообщество Zhiyuan/BAAI и др. (подробнее см. перечень источников в приложении)


Индекс выпуска

  • Главное за день: FlagFFT дополнен бэкендом Hygon — адаптер BW1000 (HCU) вошёл в dev, 102 коммита в одном окне охватывают три линии MACA/Ascend/HCU (09-21/09-22)
      1. Прогресс открытых проектов (динамика GitHub)
        • 1.1 FlagFFT: адаптер HCU вошёл, производительность и доказательная база MACA/Ascend закрыты, пакетный набор из трёх частей влит (09-21/09-22)
        • 1.2 build-infra: шесть подряд влитий канала FlagCX wheel, выпуск для Kunlunxin на рассмотрении; единый канал публикации чисто Python-компонентов (09-21/09-22)
        • 1.3 FlagCX: выпуск v0.14.0-rc2.post2 — исправление линковки torch-плагина Tsingmicro TSM (09-21)
        • 1.4 FlagGems-vllm: влит бэкенд Biren SUPA; пакет операторов Ascend XCS и тюнинг topk для шести платформ (09-21/09-22)
        • 1.5 FlagGems: KernelGen повторно добавил операторы Nvidia; пакет исправлений Kunlunxin; замена конвейера Hygon W8A8 TLE (09-21/09-22)
        • 1.6 FlagTree: распределённый Iluvatar TLE и TLE_RAW; поднарезка NVIDIA TLE SMEM (09-21/09-22)
        • 1.7 Прочая динамика: сборочная линия FlagTensor 0.3.0-rc2, интероперабельность FlagQuantum, FlagSparse, FlagAudio, FlagOS-Compressor и др. (09-21)
    1. Новости и экосистема
      • 2.1 Семнадцатое подряд спокойное окно компонентного поиска (09-21/09-22)
      • 2.2 MXMACA от MetaX влит в основную ветку LMCache: программный стек членской организации «upstream-first» встраивается в глобальную экосистему инференса (09-18/09-21)
      • 2.3 Jiemian News обозревает 39 адаптаций Day 0 у MetaX: экосистемный нарратив «software-hardware integration» китайских GPU (09-21)
    1. Углублённый анализ членских организаций
      • 3.1 MetaX: закрытие трёх репозиториев линии MACA (FFT / компилятор / инструменты обучения) (09-21/09-22)
      • 3.2 Hygon: адаптер FlagFFT HCU и замена FlagGems W8A8 TLE (09-21/09-22)
      • 3.3 Ascend: пакет операторов XCS и оптимизация NPU FFT, обновление 910C vLLM 0.28 на рассмотрении (09-21/09-22)
      • 3.4 Iluvatar CoreX: влит распределённый Iluvatar TLE (09-22)
      • 3.5 Moore Threads: влиты оптимизации index_add/polar, несколько PR с операторами на рассмотрении (09-21/09-22)
      • 3.6 Enflame: FlagGems-sglang регистрирует vendor GCU (09-21)
      • 3.7 Tsingmicro: FlagCX rc2.post2 исправляет torch-плагин TSM (09-21)
      • 3.8 Damo Academy Xuantie: влит fused-оператор PPU и проверка PPU CI (09-21)
    1. Итоги и наблюдения за тенденциями
  • Приложение: таблица проверки источников
  • Полный перечень источников

Главное за день: FlagFFT дополнен бэкендом Hygon — адаптер BW1000 (HCU) вошёл в dev, 102 коммита в одном окне охватывают три линии

Дата: 2026-09-21 ~ 2026-09-22 Источник: История коммитов FlagFFT (dev)

С позднего вечера 09-21 до утра 09-22 FlagFFT (JIT-компилируемая FFT-библиотека, генерирующая целевые ядра бэкендов во время выполнения через Triton/TLE и libtriton_jit) влил в ветку dev адаптер бэкенда Hygon BW1000 (HCU): начиная с «Add HCU backend adaptor for BW1000» (09-21 22:39), затем исправление преобразования дескриптора hipFFT (22:55), подключение независимого capture к Torch HIP (23:01), первичные меры по безопасности памяти (09-22 00:11), и завершая двумя документами «Настройка окружения Hygon BW1000 HCU» и «Унифицированная сборка тестов HCU» (09-22 08:44 / 08:47) и слиянием пакетной сборки с upstream (08:57). Список бэкендов CMake в README соответственно обновлён до семи пунктов CUDA / MUSA / PPU / IX / MACA / NPU / HCU — Hygon впервые вошёл в матрицу бэкендов FFT-библиотеки.

В том же окне число коммитов в одном репозитории FlagFFT достигло 102, а ещё две линии идут каждая своим пакетом: MACA (MetaX) — закрытие производительности: эксперимент с обменом регистрами FP64 в тот же день был опробован и откачен (Revert), гейтинг pack8 по листовой раскладке, бюджет разделяемой памяти для смешанной базы из четырёх шагов и прямого подключения, а также пакет приёмочных инструментов с зафиксированными доказательствами; NPU (Ascend) — слияние одиночной оптимизации CT и внедрение партии Stockham (16 блоков-бабочек, упакованный вещественный FFT, ограниченный векторный нисходящий поток и т. п., около десяти в одной партии). Триединый набор упаковки синхронно влит: упаковка Debian + RPM (#12), канал релизов Nexus (#19 / #20), порт 0.2.0-rc2 (#18), плюс ослаблен нижний предел nlohmann_json (#22) — библиотека FFT в этом окне одновременно завершила три вещи: «новый бэкенд + закрытие производительности + упаковка для распространения».


1. Прогресс открытых проектов (динамика GitHub)

Обзор окна: из 54 репозиториев в org 19 имели push в окне; поиск по коммитам дал 224 попадания (по 15 репозиториям); кроме того, PR и push по веткам в репозиториях FlagCX (ветка релиза), docs, vllm-plugin-FL и др. не учтены в поиске. Распределение: FlagFFT 102, FlagGems 29, FlagTensor 23, FlagQuantum 19, FlagGems-vllm 14, FlagSparse 11, build-infra 7, FlagTree 5, FlagAudio 5, FlagOS-Compressor 3, FlagGems-sglang 2, FlagPrism / FlagDNN / FlagBLAS / FlagScale по 1.

Форма этого окна = «спринт многобэкендовой библиотеки FFT» + «закрытие релизной инженерии» + «расширение набора бэкендов»: FlagFFT занимает почти половину объёма коммитов (см. «Сегодняшний фокус»); build-infra доводит до готовности каналы выпуска FlagCX wheel и чисто Python-компонентов; на стороне плагинов в тот же день добавлены точки входа двух бэкендов — Biren SUPA и Enflame GCU.

1.1 FlagFFT: внедрение адаптера HCU, закрытие производительности и доказательств MACA/Ascend, слияние триединого набора упаковки (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источники: FlagFFT #12, #18, #22

Основная линия подробно в «Сегодняшнем фокусе». Три дополнения: во-первых, пакет приёмочных инструментов линии MACA зафиксировал в процесс гейтинг упаковки (pack8), запись ресурсов и доказательств, двунаправленный малый пример с тремя процессами (сосредоточенные десять коммитов с 15:39 до 16:17); во-вторых, «docs: complete MACA IX and Ascend setup» (22:51) дополняет документацию по окружению для трёх бэкендов, перекликаясь с подходом новых бэкендов «документация по окружению + единая сборка тестов»; в-третьих, триединый набор упаковки (#12 / #18 / #19 / #20) сосредоточенно влит после полудня 09-21, загрузка в Nexus переиспользует общий рабочий процесс уровня org.

1.2 build-infra: шесть подряд слияний канала FlagCX wheel, раздача Kunlunxin на рассмотрении; единый канал публикации чисто Python-компонентов (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источники: build-infra #993, #995, #998, #1000

Линия распространения wheel для FlagCX в этом окне продвинула семь коммитов подряд (шесть слито + один на рассмотрении): #994 выпускает образ инструментальной цепочки сборки, необходимый линии wheel (12:45), #995 упаковывает device bitcode каждой строки в wheel (13:59), #996 заставляет FlagCX самостоятельно упаковывать device bitcode (15:30), #997 открывает ещё четыре строки в канале wheel (19:07), #999 рефакторит именование join (21:12), #998 собирает wheel «там, где находится устройство данной строки» (23:18); #1000, находящийся на рассмотрении этим утром, расширяет линию раздачи на Kunlunxin (deliver the kunlunxin wheel). Эта линия продвигает распространение межчиповой коммуникационной библиотеки от «компиляции из исходников + образа» к предварительно скомпилированным wheel для каждого бэкенда.

Ещё один — централизованный канал публикации noarch-deb (#993): создание единого рабочего процесса для чисто Python-компонентов — одна логика охватывает три компонента FlagAudio, FlagSparse и FlagAttention (различия сведены к одному блоку case), перед сборкой версия проставляется по линии релиза (ранее наблюдался дрейф между версией метаданных упаковки компонента и линией релиза), в комплекте с noarch-rpm.yml. Канал нативных пакетов «за пределами контейнерных образов» продолжает укрепляться.

1.3 FlagCX: релиз v0.14.0-rc2.post2 — исправление линковки torch-плагина Tsingmicro TSM (09-21)

Дата: 2026-09-21 Источники: FlagCX #617, страница релиза

В 22:11 выпущен v0.14.0-rc2.post2, содержимое — #617: исправление разрешения каталога библиотек torch_txda (Torch-плагина Tsingmicro TSM) — ветка txda в get_device_config() ранее разрешала каталог библиотек как <package>/lib (этот путь в пакете отсутствует), при линковке возникала ошибка cannot find -ltorch_txda; после исправления проверено на runtime-образе TSM — проходит. Это второй патч-релиз линии rc2 (после post1), продолжающий ритм релиза 2.2 «постепенные исправления по каждому бэкенду» (подробнее в 3.7).

1.4 FlagGems-vllm: подключён бэкенд Biren SUPA; пакет операторов Ascend XCS и тюнинг topk на шести платформах (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источники: FlagGems-vllm #794, #816, #830, #828

Бэкенд Biren SUPA: #794 смержен (17:09), четыре файла — инициализация runtime/backend/_biren/, эвристические конфигурации, tune_configs и common.py; коммит выполнен совместно с инженерами Biren. Ещё один производитель чипов подключился к единому плагину в стандартной форме «каталог бэкенда + конфигурация тюнинга».

Линия Ascend XCS: в окне мониторинга смержены пять операторов (#811 kda_state_scatter, #812 kda_conv_gather, #813 kda_conv_scatter, #814 paged_scatter, #815 indexer_epilogue, #816 slot_mapping), этим утром #828 добавил производительность pack_seq/unpack_seq. В частности, #816 приводит измерения: отображение слотов страничного KV изменено с «одна программа на запрос» на параллелизм по (запрос, блок токенов), арифметика индексов int32 сводит деление к сдвигу — время устройства в производственной форме с 4 запросами 69 → 13 μs (в 5,5 раза), полный цикл обслуживания на карту 1050,9 → 81,2 ms (в 12,9 раза), при этом побитовая идентичность с upstream kernel. Кроме того, на рассмотрении #818 group_list_cumsum, #819 indexer_gemm_score.

Тюнинг и CI: #830 настраивает параметры глобального topk-индекса и оператора длины (compute_global_topk) сразу на шести платформах (MetaX / Hygon / MThreads / Ascend и др.) и добавляет тесты с бенчмарками; #780 направляет top_k_per_row_prefill/decode по пути TLE при сборке mctle; #829 добавляет рабочий процесс ручного тестирования операторов. Пул на рассмотрении держится на высоком уровне: MThreads #822 / #823, MetaX #826 / #785, Hygon #827 / #820 / #803, Ascend #744, TLE mhc #734 и др.

1.5 FlagGems: KernelGen вновь добавляет в репозиторий операторы Nvidia; пакет исправлений Kunlunxin; замена TLE-конвейера Hygon W8A8 (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источники: FlagGems #6005, #6264, #6518, #6346

KernelGen (Nvidia) 13 шт.: quantized_max_pool2d (#6005), msort (#5844), _standard_gamma (#6103), masked_select_backward (#5824), _thnn_differentiable_lstm_cell_backward (#5815), row_stack (#6011), batch_norm_gather_stats (#5747), inner (#6320), smm (#5964), quantized_max_pool1d (#5938), row_indices (#6012), replication_pad1d_backward (#5922), _lu_with_info (#5877) — автоматизированный конвейер генерации продолжает пополнять универсальную библиотеку операторов длиннохвостыми операторами.

Пакет исправлений Kunlunxin: пять коммитов объединены — точечные и компоновочные add/cat/div (#6264, быстрый путь add снижает время однократного вызова на хосте с примерно 36 μs до примерно 5.5 μs, на P800 составляет 0.84–1.56x от нативной реализации), sort (#6263), рефакторинг хостовых метаданных moe_align и диспетчеризации padded fused-MoE (#6398), сохранение неспециализированными рабочих размерностей GEMM для стабилизации внутренней компоновки параметров (#6415), пакет special_bessel_y1 / softplus / weight_norm (#6426).

Hygon W8A8 (#6518): поскольку белый список TLE для HCU поддерживает загрузочные примитивы, но отклоняет конвейерные примитивы, три места конвейеризации mm_w8a8_int8 переписаны в сегментированные циклы tl.range (с сохранением загрузки TLE), восстановлен ошибочно удалённый публичный импорт rms_norm_w8a16_fp8, а Hygon добавлен в проверку возможностей FP8 бенчмарка.

Прочее: #6346 добавляет для оператора copy тесты низкой точности и FP8 (шесть бэкендов: NVIDIA / Ascend / Hygon / XuanTie / MetaX / Iluvatar); три обратных overloads для upsample (#6504 / #6505 / #6506); в это утро объединены оптимизации index_add и index_add_ (#6368) и polar (#6026) для MTHREADS; в инженерной части — откат упаковки RPM (#6537), размер разделяемой памяти CI (#6541), исправление импорта torch_npu и triton в setup.sh (#6545), защита от нулевой задержки бенчмарка (#6540), классификация fused_moe INT8 W8A8 (#6081). На рассмотрении: #6513 rrelu_with_noise.

1.6 FlagTree: Iluvatar TLE распределённый и TLE_RAW; NVIDIA TLE SMEM под-срез (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источники: FlagTree #1184, #1079, #1252, #1258

  • #1184 (09-22 02:14, 30 файлов): Бэкенд Iluvatar синхронизирован с линией Triton v3.6.x и расширен TLE — добавлены TLE распределённый (n_pes / get_device_id / remote_pointers / distributed_barrier, поддерживается FlagCX) и TLE_RAW (CoreX clang JIT + отложенная материализация dsl_region); Gluon переведён на постоянно включённую регистрацию; nv_mma_shared_layout переназначен на TCU swizzled shared, что позволяет TLE GEMM использовать конвейер SME G2S.
  • #1079: В NVIDIA TLE добавлены подмножества SMEM и многописательский конвейер TMA.
  • AMD: #1252 Предикат потока для тензорного операнда AtomicCAS (портирован triton #9605); #1240 Объединение scf.if fat-ptr в CanonicalizePointers и исправление преобразования нецелочисленных битов.
  • MetaX / AABS: #1258 Исправлено ограничение block_size для metax dot m; #1253 на рассмотрении (dot, который не может быть разбит по разметке MACA MMA, сохраняется в blocked layout).
  • CI / упаковка: #1263 / #1264 Включение переиспользуемого рабочего процесса GEMS в обнаружение изменений CORE; #1260 на рассмотрении (установка clang через rpm и упаковка flagtree); #1259 В PPU CI добавлена проверка pid.txt, на рассмотрении.

1.7 Прочие события: линия упаковки FlagTensor 0.3.0-rc2, совместимость FlagQuantum, FlagSparse, FlagAudio, FlagOS-Compressor и др. (09-21)

Дата: 2026-09-21 Источники: FlagTensor #23, FlagQuantum, FlagOS-Compressor #9

  • FlagTensor (23): Влита ветка 0.3.0-rc2 (#23, 27 файлов: упаковка deb/rpm, поиск Torch в CMake, разделение libflagtensor-nvidia-dev и др.) + рабочий процесс загрузки в Nexus (#20) + каркас упаковки (#4), версия выровнена по линии релиза 0.3.0. FlagTensor — это библиотека тензорных примитивов Triton в FlagOS (28 унарных операторов, 4 бинарных, 6 свёрток, ориентир — базовая линия cuTensor) — фактическое действие в этом окне мониторинга — «вход в систему упаковки и распространения».
  • FlagQuantum (19): Интенсивное продвижение тестов совместимости и согласованности — дифференциальная согласованность Qiskit (#118), дифференциальная согласованность PennyLane (#122), контракт адаптера Cirq (#125), преобразование многокубитных унитарных матриц Qiskit (#114) и импорт арифметических параметрических выражений (#111), проверка схем зеркальных близнецов (#116 / #120), а также ряд исправлений проверки ввода (#107–#127).
  • FlagSparse (11): В совместной ветке NCIC-AlphaSparse объединены три PR (#76 / #77 / #78) — базовая линия MACA SpMV CSR, тесты XPU MACA и Ascend и др.
  • FlagAudio (5): Исправлена пропущенная запятая в pyproject.toml (#12) + обычный откат к pip при отсутствии pyproject-rpm-macros в RPM (#10).
  • FlagOS-Compressor (3): Линейный экспорт INT8 для DeepSeek V4.1 и MiMo V2.5 (#9 — построчное сканирование, прямоугольные блоки FP8, сохранение индексатора и таблицы Engram и др.) влит в 16:08, отменён через Revert в 16:59 (причина в сообщении коммита не указана), эта возможность временно возвращена в состояние до вливания.
  • FlagGems-sglang (2): Регистрация вендора GCU Enflame (#99).
  • Единичные: Влита поддержка FlagBLAS mthreads L2 (#122), исправление тестов ppu в FlagDNN, FlagPrism Nvidia dev 202609 (#15), исправление параметров FlagScale metax (#1296).

2. Новости и экосистема

2.1 Семнадцатое подряд спокойное окно поиска на уровне компонентов (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источники: Google News RSS (24 группы поисковых запросов на китайском и английском, через прокси)

При компонентном поиске по названиям компонентов FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen на китайском и английском языках (when:7d и when:14d) 24-часовое окно вновь дало ноль совпадений, что образует семнадцатое подряд спокойное окно компонентного поиска (предыдущее окно — шестнадцатое). Исключения: по ключевому слову «BAAI» совпадения приходятся в основном на серию материалов о скандале с данными Zhipu ZCode и на игровое SEO (не связано с FlagOS, не включено); поиск по FlagOS / FlagGems в HN релевантных совпадений не дал. Внешний информационный фон этого окна обеспечивается стороной организаций-участников (2.2, 2.3).

2.2 MetaX MXMACA влит в основную ветку LMCache: программный стек организации-участника «сначала в上游» интегрируется в глобальную экосистему инференса (09-18/09-21)

Дата: 2026-09-18 (официальное объявление) / 2026-09-21 (медийная волна) Источник: официальный сайт MetaX, Guandian, LMCache PR #4606

MetaX достигла сотрудничества с международным открытым проектом KV Cache LMCache: собственный программный стек MXMACA по принципу «Upstream First» присоединяется к официальной системе нативной поддержки LMCache, код влит в основную ветку и создан механизм CI-верификации, сопровождающий итерации версий (дорожная карта — LMCache #4833). LMCache инициирован командой Чикагского университета, насчитывает 220+ контрибьюторов и 30+ отраслевых партнёров и является mainstream-проектом открытого ПО для управления KV Cache при инференсе больших моделей. 09-21 Guandian, Phoenix и другие перепечатали официальное объявление. «Сначала в上游» в этом стеке также является неизменной практикой (вклад в PyTorch и различные вышестоящие сообщества); этот кейс — сопоставимый путь интеграции отечественных вычислительных мощностей в глобальную экосистему инференса.

2.3 Jiemian News подводит итог 39 адаптациям Day 0 от MetaX: экосистемный нарратив «софт-аппаратной интеграции» отечественных GPU (09-21)

Дата: 2026-09-21 Источник: Jiemian News

Опубликованная в 13:52 обзорная статья: по состоянию на 09-20 MetaX с декабря 2025 года выполнила 39 адаптаций Day 0主流 флагманских моделей (охватывая Zhipu, Alibaba Qwen, MiniMax, DeepSeek, StepFun, Tencent Hunyuan и другие); программный стек MXMACA охватывает драйверы, интерфейсы пользовательского режима, компилятор, адаптацию операторов и фреймворки обучения/инференса, поддерживает 40+ AI-фреймворков, 1000+ моделей и тестирование 6000+ открытых проектов, полностью поддерживает 2410 GPU-операторов PyTorch 2.8; также раскрыто, что основная разработка и функциональная верификация ядра下一代 Xiyun C700 в основном завершены. Нарратив «единый компилятор + операторы + многоуровневое покрытие фреймворков» зеркально отражает мультичиповый унифицированный путь этого стека и является основным материалом для внешней коммуникации организации-участника.

3. Углублённое рассмотрение организаций-участников

3.1 MetaX: сведение трёх репозиториев линии MACA (FFT / компилятор / инструменты обучения) (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источник: коммиты FlagFFT, FlagTree #1258, FlagScale #1296

Со стороны кода три направления: FlagFFT — линия MACA около 17 коммитов (эксперимент по обмену регистрами FP64 в тот же день был опробован и откачен, гейтинг pack8 по листовой раскладке, бюджет разделяемой памяти для четырёхшагового и прямого смешанного основания, инструменты приёмки и архивирование доказательств, включая результаты малого двунаправленного примера с тремя процессами); FlagTree — исправление AABS ограничения размера блока metax dot m (#1258 влит; #1253 на рассмотрении); FlagScale — исправление параметров metax (#1296 влит). Медийная сторона — см. 2.2 и 2.3: MetaX в этом окне наиболее активная организация-участник одновременно и на внешнем, и на кодовом направлении.

3.2 Hygon: адаптер FlagFFT HCU и замена FlagGems W8A8 TLE (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источник: коммиты FlagFFT, FlagGems #6518, FlagGems-vllm #803

  • FlagFFT: адаптер бэкенда HCU (BW1000) и сопутствующие исправления, документация (подробнее в разделе «Главное за сегодня» и 1.1) — библиотека FFT впервые включила платформу Hygon в матрицу бэкендов.
  • FlagGems: #6518 заменил конвейерные примитивы, не поддерживаемые белым списком HCU TLE, на сегментированный tl.range, а также восстановил импорт rms_norm_w8a16_fp8 и добавил Hygon в проверку возможностей эталонного FP8.
  • На рассмотрении: три линии Hygon в FlagGems-vllm — #820 INT8 varlen flash attention, #803 INT8 блочный BMM и int8_einsum, #827 top_k_per_row_decode.

3.3 Ascend: пакет операторов XCS и оптимизация NPU FFT, обновление 910C vLLM 0.28 на рассмотрении (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источники: FlagGems-vllm #816, #828, vllm-plugin-FL #487

  • FlagGems-vllm: пакет операторов XCS (#811–#816, показатели производительности см. в 1.4), продолжение #828 pack_seq и unpack_seq, #821 TLE-оптимизация topk_softplus_sqrt, #744 fused_marlin_moe_w4a16_int4 на рассмотрении.
  • FlagFFT: линия NPU объединила одиночную оптимизацию CT и пакет Stockham (около десяти коммитов).
  • vllm-plugin-FL: #487 «Поддержка vLLM 0.28 (NVIDIA и Ascend 910C)» на рассмотрении; #484 линия NVIDIA vLLM 0.28.0 уже влита — запущена линия обновления vLLM с 0.24 до 0.28.
  • FlagGems: #6545 исправляет ошибки импорта torch_npu и triton в setup.sh.

3.4 Iluvatar CoreX: влита распределённая поддержка Iluvatar TLE (09-22)

Дата: 2026-09-22 Источники: FlagTree #1184

Крупный PR на 30 файлов, влитый ночью: бэкенд Iluvatar синхронизирован с Triton v3.6.x, а также расширены распределённая поддержка TLE и TLE_RAW, постоянно включённый Gluon, переназначение nv_mma_shared_layout на TCU swizzled shared (подробнее в 1.6). Распределённые примитивы поддерживаются FlagCX — это одно из проявлений синергии «компилятор + коммуникация» в линии Iluvatar внутри FlagOS; путь CoreX clang JIT для TLE_RAW также является инженерной адаптацией под особенности этого инструментария.

3.5 Moore Threads: влиты оптимизации index_add / polar, несколько PR с операторами на рассмотрении (09-21/09-22)

Дата: 2026-09-21 ~ 2026-09-22 Источники: FlagGems #6368, FlagGems-vllm #822, FlagBLAS #122

  • FlagGems: сегодня утром в 10:01 влиты оптимизации производительности index_add и index_add_ (#6368) и polar (#6026).
  • FlagGems-vllm на рассмотрении: #822 перенос и оптимизация fused_inv_rope_fp8_quant, #823 поддержка W8A8 FP8 для flash_attn_varlen_func, #831 исправление узкой полосы значений top_k, #807 fp8_fp4_mqa_logits.
  • FlagTree: #1261 поддержка fmul_rn_fp32 libdevice на рассмотрении.
  • FlagBLAS: #122 поддержка mthreads L2 влита.

3.6 Enflame: FlagGems-sglang регистрирует GCU vendor (09-21)

Дата: 2026-09-21 Источники: FlagGems-sglang #99, vllm-plugin-FL #556

#99 Подключение бэкенда enflame (gcu) к vendor-конвейеру: регистрация vendors.ENFLAME, сопоставление атрибутов устройства gcu из torch, пометка отсутствия поддержки fp64 / int64, завершение VendorDescriptor (диспетчеризация PrivateUse1, включение TLE), команда запроса устройства efsmi -L, дополнение CodeGenConfig и эвристики num_warps. На стороне vllm-plugin-FL #556 «выравнивание e2e-покрытия по матрице MUSA» обновлён этим утром — плагинное подключение и выравнивание тестов линии Enflame продвигаются синхронно.

3.7 Tsingmicro: FlagCX rc2.post2 исправляет TSM torch-плагин (09-21)

Дата: 2026-09-21 Источники: FlagCX #617

Единственное содержимое v0.14.0-rc2.post2: исправление разбора каталога библиотеки torch_txda в TSM (Tsingmicro, опция сборки USE_TSM) Torch-плагине, устранение ошибки линковки на runtime-образе TSM (cannot find -ltorch_txda). Tsingmicro присутствует в данном стеке в нескольких точках линии 2.2 (новое оборудование в KernelGen 2.2.0, строка образа build-infra tsingmicro-tsm260610, документация бэкенда FlagCX); данное исправление открывает путь сборки его torch-плагина.

3.8 Damo Academy XuanTie: вливание fused-операторов PPU и проверка PPU CI (09-21)

Дата: 2026-09-21 Источники: FlagGems-vllm #796, FlagTree #1259

  • FlagGems-vllm #796: два оператора версии PPU (thead) — «слияние обратного RoPE с FP8-квантизацией» и «FP8-квантизация с группировкой по токенам» — поскольку FlagTree PPU пока не может понизить нативные указатели и преобразования tl.float8e4nv, переведены на целочисленные операции с кодированием E4M3FN и записью через uint8-представление без копирования, без отката к вычислениям torch.
  • FlagDNN: исправление тестов ppu.
  • FlagTree: #1259 добавление проверки pid.txt в PPU CI на рассмотрении.

4. Итоги и наблюдения за тенденциями

  • Матрица бэкендов «доукомплектовывается по библиотекам»: библиотека FFT получает Hygon HCU; на стороне плагинов в тот же день добавлены две точки подключения бэкендов — Biren SUPA и Enflame GCU. «Собственный каталог бэкенда вендора + конфигурация настройки параметров» уже стало стандартной формой подключения, покрытие множества чипов распространяется от матрицы релизных артефактов на каждую базовую библиотеку.
  • Суточная пропускная способность библиотеки FFT = сигнал зрелости инструментальной цепочки: 102 коммита охватывают три линии MACA / NPU / HCU, изменения производительности повсеместно сопровождаются бюджетами аллокации, гейтингом и фиксацией доказательств (включая эксперименты, посаженные и откатанные в тот же день) — процесс разработки переходит от «работает» к «воспроизводимо настраивается».
  • Трёхканальная форма дистрибуции: FlagCX wheel несёт device bitcode (#995–#998, вместе с рассматриваемым Kunlunxin #1000), унифицированный noarch-канал deb/rpm для чистых Python-компонентов (#993), тройной набор упаковки FlagFFT и FlagTensor — релизные артефакты расширяются от «образ + документация» до «wheel / deb / rpm + образ».
  • Закрытие 2.2 и линия новой версии идут параллельно: настройка topk для шести платформ (#830), тесты FP8 для шести бэкендов (#6346), элементы производительности Ascend XCS (#816) относятся к стороне укрепления; обновление до vLLM 0.28 (#484 влито, #487 на рассмотрении) и FlagTree packaging (#1260 на рассмотрении) относятся к стороне следующей версии.
  • Коллективные действия ранее тихих модулей: FlagTensor (упаковка 0.3.0-rc2), FlagAudio (исправление упаковки), FlagSparse (слияние ветки сотрудничества) точно перекликаются с предыдущим списком «под наблюдением» — внутри линии rc2 эти модули перешли к приёмочным и дистрибуционным действиям.
  • Внешняя коммуникация по-прежнему на низком уровне: семнадцатое спокойное окно поиска на уровне компонентов против 224 коммитов; на стороне организаций-участников (MetaX LMCache, 39 Day 0) лежит основная внешняя информационная нагрузка. Под наблюдением: последующие действия после отзыва FlagOS-Compressor, скорость внедрения линии vLLM 0.28 на различных бэкендах.

Приложение: таблица проверки источников

Категория Источники Способ проверки Результат
GitHub org: flagos-ai repos API полная проверка pushed_at по 54 репозиториям 19 репозиториев активны в окне
GitHub поиск коммитов + порепозиторная сверка поэлементная верификация в окне 224 записи (15 репозиториев) + push веток
GitHub releases.atom (сканирование 24 репозиториев) порепозиторное сканирование добавлен FlagCX v0.14.0-rc2.post2
Новости Google News RSS (24 группы поисковых запросов на китайском и английском, через прокси) фильтрация по 24-часовому окну + поэлементное исключение по компонентным словам ноль совпадений (17-е спокойное окно); по словам участников сохранено 2 записи
Медиа сайт MetaX / Jiemian News / Guandian / ifeng повторный сбор оригиналов включение LMCache, обзор 39 Day 0
Сообщество сообщество Zhiyuan / HN Algolia повторная проверка поиска новых материалов, связанных с FlagOS, в окне нет
Документация проекта FlagTensor / FlagFFT / FlagCX README и docs сбор оригиналов сверка списка бэкендов и позиционирования библиотек

Полный список источников

ms-vllm #820 — https://github.com/flagos-ai/FlagGems-vllm/pull/820 · #803 — https://github.com/flagos-ai/FlagGems-vllm/pull/803 · #827 — https://github.com/flagos-ai/FlagGems-vllm/pull/827