Окно мониторинга: 2026-09-25 10:00 ~ 2026-09-28 10:00 (около 72 часов; окно понедельника, охватывает выходные; продолжает окно ежедневного отчёта от 09-25, без пропусков) Источники: GitHub (org: flagos-ai, полная проверка 54 репозиториев pushed_at, в окне активно 15 репозиториев; поиск коммитов — 173 записи по 11 репозиториям, дополнительно построчная сверка тестовой партии FlagGems P1, dev-ветки FlagFFT, Megatron-LM-FL 0.3.0-rc2, двух функциональных веток FlagTree, FlagScale 2.1.0-rc2 и других 6 веток; построчное сопоставление оригиналов community #114/#115 и build-infra PR; построчная проверка записей развёртывания портала release-info), Google News RSS (26 групп поисковых запросов на китайском и английском, через прокси), материалы Changsha Evening News / Voc.com.cn / сообщества Zhiyuan / ifeng.com / QbitAI / Sina Tech и других (подробнее см. список источников в приложении)


Индекс выпуска

  • Главное за сегодня: день GA версии 2.2 (09-28) — финальная подготовка в окне: завершение цепочки обновления Megatron 0.18.2 и повторная проверка переразмещения wheel v0.3.0 (09-27)
    1. Прогресс проектов с открытым исходным кодом (динамика GitHub)
      • 1.1 Релиз-инжиниринг: наступление дня GA — список community ожидает слияния; 5 автоматических развёртываний портала release-info в окне (09-25 ~ 09-26)
      • 1.2 build-infra: цепочка обновления Megatron 0.18.2 — трёхплатформенная верификация RL E2E и переразмещение wheel v0.3.0 (09-26 ~ 09-27)
      • 1.3 build-infra (часть 2): внедрение фреймворка навыков — Claude Code skills обеспечивают интеграцию бэкендов и контроль изменений (09-27)
      • 1.4 FlagTree: продолжение ветки рефакторинга специализации iluvatar C++; открыта ветка исправления производительности vLLM (09-25 ~ 09-28)
      • 1.5 FlagGems: пять подряд выпусков тестовых партий P0/P1; очередь PR оптимизации под несколько платформ (09-25 ~ 09-28)
      • 1.6 FlagGems-vllm: одновременный выпуск chunk_kda для трёх платформ; moe_sum и fused_add_rms_norm (09-28)
      • 1.7 Torch-FL: партия кросс-платформенных исправлений из 24 записей — полная матрица DCU / Ascend / Enflame / MUSA (09-25 ~ 09-28)
      • 1.8 FlagFFT: 18 записей в dev-ветке — оптимизация FFT для трёх платформ Hygon / Iluvatar CoreX / MetaX (09-25 ~ 09-27)
      • 1.9 FlagSparse / FlagBLAS: многоплатформенные конвейеры для разреженных вычислений и BLAS (09-25 ~ 09-27)
      • 1.10 Прочая динамика: FlagCX / FlagQuantum / FlagScale / FlagDNN / docs (09-25 ~ 09-28)
    1. Новостные публикации и экосистема
      • 2.1 Второе подряд двадцать первое спокойное окно покомпонентного поиска (09-25 ~ 09-28)
      • 2.2 Конференция в Юэлу «AI+OpenCL»: подписание соглашения о совместном создании отечественной библиотеки операторов OpenCL (09-24/09-25)
      • 2.3 XuanTie от DAMO Academy: анонс второй партии открытых исходников SAIL — с конца текущего месяца до начала октября (09-26)
      • 2.4 Shishi Tech Meta-Infer: почти 7-кратный прирост производительности инференса DeepSeek на видеокартах PCIe (09-24, дополнительная запись за предыдущее окно)
    1. Углублённый анализ участников
      • 3.1 Ascend: партия исправлений Torch-FL и очередь оптимизации FlagGems; линия образов 0.18.2 ожидает миграции (09-25 ~ 09-28)
      • 3.2 Hygon: партия исправлений DCU + оптимизация HCU FFT + верификация hygon RL E2E (09-25 ~ 09-27)
      • 3.3 MetaX: партия оптимизации MACA FFT + Metax RL E2E + тег образа (09-26 ~ 09-27)
      • 3.4 Moore Threads: интеграция chunk_kda, поддержка FP64 L2 и очередь оптимизации семейства bmm (09-25 ~ 09-27)
      • 3.5 Iluvatar CoreX / Enflame / Kunlunxin: три параллельные линии Iluvatar CoreX; защита ядра Enflame; очередь оптимизации Kunlunxin (09-25 ~ 09-27)
      • 3.6 Tsingmicro: запуск вычислительной группировки «Струна космоса» — реконфигурируемые чипы вошли в космическую производственную цепочку (09-25/09-26)
    1. Итоги и наблюдения за трендами
  • Приложение: таблица проверки источников
  • Полный список источников

Главное за сегодня: день GA версии 2.2 (09-28) — финальная подготовка в окне: завершение цепочки обновления Megatron 0.18.2 и повторная проверка переразмещения wheel v0.3.0

Дата: 2026-09-27 Источники: community #115, build-infra #1181, #1145, #1144, портал release-info

Официальный график показывает, что дата GA для FlagOS 2.2 — 09-28 (день данного отчёта). По состоянию на момент закрытия окна мониторинга данного отчёта (10:00) два ожидающих слияния релизных артефакта на стороне community — официальный перечень операторов библиотеки L1 (#114) и аудит объёма FEP 2.2 (#115) — всё ещё находятся в состоянии ожидания слияния (оба открыты 09-24, в течение окна новых действий не было), объявление GA может быть выпущено в любой момент. Основное действие в окне на стороне сборки — завершение цепочки обновления Megatron 0.18.2:

  • Сквозная проверка RL на трёх платформах: #1144 фиксирует сквозное прохождение megatron rl 0.18.2 в двух конфигурациях nvidia (cuda12.8 / cuda13.3); #1145 фиксирует прохождение двух путей hygon-dtk26.04 и metax-maca3.8.1.3 — цепочка обучения RL версии 0.18.2 получила подтверждения на множестве платформ.
  • Переупаковка wheel v0.3.0: Megatron-LM-FL после слияния трёх исправлений в ветке 0.3.0-rc2 (#192 восстановление защиты NullTokenizer bos и packed_seq для RL, #193 восстановление диспетчеризации возможностей paged-attention версии v0.3.0, #194 дополнение сборки для CUDA постраничным резервным вариантом flag_gems) был переупакован; build-infra фиксирует запись о пересборке (#1167) и выполняет повторную сквозную проверку RL без shim на «переупакованном wheel v0.3.0» (#1181, завершено 09-27 в 23:02).
  • Обновление артефактов: тег образа приложения 2.2.0-0.3.0 массово зафиксирован на четырёх платформах nvidia-cuda12.8 / nvidia-cuda13.3 / hygon-dtk26.04 / metax-maca3.8.1.3 (более 20 коммитов с записями тегов в течение окна); на портале release-info в течение окна выполнено 5 автоматических развёртываний (09-25 10:17 ~ 09-26 15:15), в списке присутствуют пять записей серии 0.18.2 для megatron_rl / megatron_training.

Оценка: в последнем окне перед GA не было никаких новых заявлений о функциональности, все действия сосредоточены вокруг «завершения проверок + пересоздания артефактов + фиксации следов» — это согласуется с тональностью предыдущего аудита объёма (#115): во внешних заявлениях сохраняется только «уже реализовано + уже проверено», публичная поставка 2.2 будет основана на цепочке доказательств, воспроизводимой в артефактах.


1. Прогресс проектов с открытым исходным кодом (динамика GitHub)

1.1 Релизная инженерия: наступление дня GA — перечень community ожидает слияния; на портале release-info в течение окна 5 автоматических развёртываний (09-25 ~ 09-26)

Дата: 2026-09-25 ~ 2026-09-26 Источники: community #114, #115, портал release-info, записи развёртываний release-info

  • состояние сообщества: официальный список операторов L1 (#114) и аудит объёма 2.2 FEP (#115) в рамках окна мониторинга не показали новой активности и остаются в режиме ожидания слияния; ветка релиза release/2.2-official-l1 зарегистрирована (открыта 09-24) — слияние официального списка GA является следующей видимой контрольной точкой.
  • обновление портала: release-info (портал инфраструктуры сборки) в рамках окна мониторинга выполнил 5 автоматических развёртываний (09-25 10:17, 09-26 09:50 / 10:06 / 13:06 / 15:15), содержимое продолжает следовать за продвижением основной ветки build-infra; портал в настоящее время содержит записи серии 0.18.2 для megatron_rl / megatron_training (cambricon-neuware4.7.2, generic-12.8, generic-13.3, hygon-dtk26.04, metax-maca3.8.1.3) и страницы приложений двух серий vllm 0.20.2 / 0.24.0.
  • значение: релизная инженерия вошла в состояние «портал как инструкция к зеркалу» — документация, список зеркал и записи проверок синхронно обновляются, подготавливая почву для внешней поставки после GA.

1.2 build-infra: цепочка обновления Megatron 0.18.2 — E2E-проверка RL на трёх платформах и перепозиционирование wheel v0.3.0 (09-26 ~ 09-27)

Дата: 2026-09-26 ~ 2026-09-27 Источники: build-infra #1144, #1145, #1146, #1167, #1181, Megatron-LM-FL #194 (и др., всего 99 коммитов, см. приложение)

  • Цепочка E2E-проверки RL: #1144 (двойная конфигурация nvidia cuda12.8 / cuda13.3) и #1145 (двойной путь hygon-dtk26.04 / metax-maca3.8.1.3) последовательно зафиксировали сквозное прохождение megatron rl 0.18.2; днём ранее (09-26) матрица обучения была закрыта первой — #1131 отметил проверку обучения metax и зафиксировал первопричину cambricon, #1132 завершил рецепт компиляции flagcx bitcode для cuda13.3 (проверка обучения F/T).
  • Рабочая книга проверок: документ отслеживания 0.18.2 (с #1119) и рабочая книга проверок (серия #1126 / #1128 / #1130) фиксируют состояние матрицы каждой платформы способом «единого источника истины» — проверка релиза начала вестись в едином учётном журнале.
  • Перепозиционирование wheel v0.3.0: после слияния трёх исправлений ветки Megatron-LM-FL 0.3.0-rc2 (#192 ~ #194) wheel был пересобран; build-infra зафиксировал запись пересборки (#1167 «pending entries for the #194 wheel rebuild»), затем #1181 выполнил повторную проверку no-shim RL E2E на перепозиционированном артефакте — цикл «исправление — переупаковка — повторная проверка» был пройден в рамках одного окна мониторинга.
  • Цепочка сборки flagcx wheel: #1133 закрепил builder clang на встроенном в flagtree снимке LLVM; #1134 отказался от переходного решения FLAGCX_BITCODE_PATH для cuda13.3; #1135 изменил скрипт проверки на предварительное удаление предустановленного flagcx; #1136 добавил flagcx wheel в runtime-образ cuda12.8 — инженерные детали распространения коммуникационного компонента вместе с образом закрываются пункт за пунктом.
  • значение: миграция платформ с 0.17.1 на 0.18.2 (обучение + RL) завершила основную проверку перед GA и является главной инженерной осью завершающей стадии текущего релизного цикла.

1.3 build-infra (продолжение): внедрение фреймворка навыков — Claude Code skills обеспечивают подключение бэкендов и контроль изменений (09-27)

Дата: 2026-09-27 Источники: build-infra #1155, #1156, #1166, #1176

  • Основы фреймворка skills: #1155 «land the Claude Code skills framework foundation» влит — процесс релизной инженерии начинает отстаиваться в виде набора навыков, исполняемых ассистентом по программированию с AI.
  • Навыки для процесса интеграции: #1156 добавлены процессные навыки add-backend и verify-app-backend, затем переработаны в update-backend flow (и смоделированы области действия по «цепочке распространения слоёв») — «подключение нового бэкенда для чипа + проверка образа приложения» становится стандартным процессом, переиспользуемым агентом.
  • Уточнение шлюзов: #1166 ограничивает область действия changelog gate сценарием отправки образа приложения; #1176 развязывает --no-cache и логику push — автоматизированный процесс поэлементно калибруется в реальных итерациях.
  • Наблюдение: перекликается с нарративом Skills / SkillHub релиза FlagOS 2.0 — навыки агента не только ориентированы на внешних разработчиков, но и начинают обратно встраиваться в саму инфраструктуру разработки FlagOS.

1.4 FlagTree: продолжение ветки рефакторинга специализации iluvatar C++; открыта ветка исправления производительности vLLM (25.09 ~ 28.09)

Дата: 2026-09-25 ~ 2026-09-28 Источники: FlagTree refactor/iluvatar-cpp-specialization-v2, fix_perf_vllm

  • Рефакторинг специализации iluvatar C++ (v2): три коммита миграции и рефакторинга исходного кода специализации C++ для платформы Iluvatar — «перемещение исходного кода специализации C++», «восстановление подключения исходников ядра CMake», «переиспользование определения основного rewriter Triton» (25.09) — продолжение одноимённой ветки предыдущего раунда, упорядочивающее путь инженерной специализации для бэкенда iluvatar.
  • fix_perf_vllm: утром 28.09 открыта новая ветка — два коммита «[CI] Fix perf.sh» и «исправление pre-commit», нацеленные на исправление скрипта бенчмарка производительности vLLM (09:37 / 09:47).
  • Тишина в основной ветке: в окне мониторинга в основной ветке коммитов нет (последний — рабочий процесс MetaX vLLM benchmark от 24.09), новых тегов серии 0.7.0 нет — работа периода заморозки GA перешла в feature-ветки.
  • Наблюдение: заморозка основной ветки, рефакторинг и исправления продвигаются в ветках — ещё один пример «разделения окна релиза и окна разработки».

1.5 FlagGems: пять подряд партий тестов P0/P1; очередь PR по оптимизации для множества платформ (25.09 ~ 28.09)

Дата: 2026-09-25 ~ 2026-09-28 Источники: FlagGems #6687, #6689, #6691, #6694, #6709 (и ещё более 30 PR, см. приложение)

  • P0/P1 испытательная кампания: запущенная 09-24 партия тестов в окне мониторинга集中но вышла на上游 — пять P1-тестовых PR открыты одновременно (#6687 разреженное сокращение / softmax / cuDNN, #6688 разреженный log-softmax / sum / addmm, #6689 разреженное матричное умножение / fused convolution / Cholesky / QR / Bessel, #6691 FFT / psi / линейная алгебра, #6694 ISTFT / разреженное сокращение / cuDNN CTC / полуструктурированный apply), все с воспроизводимыми бенчмарками; ранее набор P0 был отозван из ревью (#6670), вместо него продвигаются пакетные PR.
  • Основная ветка: в окне мониторинга всего 1 слияние (#6709 исправление сбоя pre-commit в тесте shifted Chebyshev) — следы релизного замораживания отчётливы.
  • Очередь мультиплатформенных PR (активных в окне мониторинга): Ascend оптимизация addmm / bmm / baddbmm / mv / mul и исправление одноэлементной индексации index_put (диапазон #6697 ~ #6703); Moore Threads bmm / addmm / baddbmm (#6705 ~ #6707); MetaX диспетчеризация MM и тюнинг ядер (#6663); Hygon addmm FlagTune и conv2d (#6696 / #6700); Kunlunxin партия два (#6659 / #6662); SOPHGO оптимизация бэкенда (#4615 / #4632); очередь миграции операторов KernelGen Nvidia (#6608 ~ #6635 шесть штук: dim、crow/ccol_indices_copy、_dim_arange、_dimV、_values и др.).
  • Оценка: ритм «перед релизом — восполнение тестов, после релиза — производительность» ясно виден на уровне PR — очередь тестовых пакетов и очередь платформенных оптимизаций идут параллельно.

1.6 FlagGems-vllm: chunk_kda одновременно на трёх платформах; moe_sum и fused_add_rms_norm (09-28)

Дата: 2026-09-28 Источники: FlagGems-vllm #856、#859、#860、#855、#850、#846

  • chunk_kda одновременно на трёх платформах (09-28 утром): Moore Threads (#856), версия Hygon TLE (#859), Iluvatar CoreX (#860) последовательно влили оператор chunk_kda — операторы инференса семейства линейного внимания за одно утро дополнены до трёх платформ.
  • Другие операторы: Iluvatar CoreX moe_sum (#855); оптимизация производительности Ascend fused_add_rms_norm (#850); оптимизация Hygon TLE topk_softplus_sqrt (#846); mhc_post добавлен новый layout (#854).
  • Контекст: FlagGems-vllm — это плагин операторов FlagGems для vLLM (v0.2.0 входит в официальный L1-список из 2.2) — в период замораживания GA сохраняется ежедневный ритм пополнения операторов, непрерывно увеличивая плотность платформенного покрытия со стороны инференса.

1.7 Torch-FL: пакет кроссплатформенных исправлений из 24 штук — полная матрица DCU / Ascend / Enflame / MUSA (09-25 ~ 09-28)

Дата: 2026-09-25 ~ 2026-09-28 Источники: Torch-FL #450、#453、#447、#449、#437、#448 (и др. 24 штуки, см. приложение)

  • Согласование релизных артефактов: #447 опубликован и проверен список совместимости wheel; #420 CI унифицированно устанавливает опубликованный FlagOS wheel; #440 ограничения venv в CI — релизные артефакты и окружение CI приводятся в соответствие на опережение.
  • DCU (Hygon): #453 «прибивает» scatter_add_ / argmin / mean к CUDA boxing; #437 имена устройств FlagGems больше не ориентированы только на CUDA.
  • Ascend: #450 исправлен путь Qwen-Image и добавлен проверенный регрессионный profile; #436 SDPA realShift поддерживает ограниченное аддитивное смещение attention; #426 открыт контракт profiler со стороны устройства.
  • Enflame (GCU): #438 отклонение 64-битных ядер Triton до прерывания со стороны вендорского компилятора; #429 утечка int64 в вендорское ядро; #423 new_ones теперь предоставляется вендорским ядром — парадигма защитного проектирования «отклонить заранее / утечка».
  • Распределённые и общие: #435 запросы gloo обслуживаются бэкендом flagos, коллективные операции — через память хоста; #434 внешний стек ассоциаций MSPTI извлекается по реальным адресам; #421 бэкенд flagos поддерживает DataParallel; #449 flex_attention на устройстве flagos; #410 поддержка сжатых разреженных (CSR / CSC / BSR / BSC) тензоров; #416 автоматическая генерация таблицы cbid среды выполнения CUPTI.
  • Значение: 24 коммита охватывают три линии — «согласование релизных артефактов + исправления платформ + общие возможности» — Torch-FL как единый плагин со стороны torch постепенно подкрепляет заявленные в 2.2 возможности доказательствами платформенного уровня.

1.8 FlagFFT: 18 коммитов в ветке dev — оптимизация FFT на трёх платформах Hygon / Iluvatar / MetaX (09-25 ~ 09-27)

Дата: 2026-09-25 ~ 2026-09-27 Источник: коммиты ветки dev FlagFFT

  • Hygon (HCU): пакет из пяти коммитов оптимизации листьев CT — сравнение листьев radix-16, оптимизация коротких листьев CT и очистка накладных расходов launch, планирование листьев ограничено одномерными запросами, тюнинг не распространяется на подузлы декомпозиции (09-25).
  • Iluvatar (IX): более десяти коммитов многоволновой оптимизации — согласование факторов вещественного CT, упаковка N210, планирование двойного warp для 1024 точек, пакетное сканирование CT, аппаратные таблицы R2C twiddle, слитые листья R2C включены по умолчанию по результатам измерений (09-26 ~ 09-27).
  • MetaX (MACA): упакованный вещественный путь C2R для одиночного преобразования и зафиксированная документально измеренная выгода (09-27).
  • Значение: FFT — представительная область операторов в направлении научных вычислений (в README этой библиотеки уже перечислены семь бэкендов: CUDA / MUSA / PPU / IX / MACA / NPU / HCU) — три отечественные платформы продвигаются в одном окне, что перекликается с расширением области «от больших моделей к научным вычислениям» в 2.2.

1.9 FlagSparse / FlagBLAS: многоуровневые конвейеры для разреженных вычислений и BLAS на нескольких платформах (09-25 ~ 09-27)

Дата: 2026-09-25 ~ 2026-09-27 Источник: FlagSparse #101, #100, #98, FlagBLAS #135, #134, #133

  • FlagSparse (линия сотрудничества NCIC-AlphaSparse): несколько раундов слияний #98 ~ #101 — точность и пропускная способность spmv CSR на DCU (Hygon), SpMV / SpMM в версии COO, базовая линия sddmm для MACA (MetaX), gather fp16 для XPU (Kunlunxin), восстановление документации алгоритма BIV и тонкая доводка CI; цикл разработки 0.4.0 продолжает продвигаться.
  • FlagBLAS: #135 поддержка FP64 L2 для Moore Threads; #134 / #133 масштабирование эквивалентной производительности L2 для Damo Academy XuanTie и повышение базовых линий GEMV / L2; #132 оптимизация L2 для Ascend (удалены платформенно-специфичные пропуски) — уровень L2 (класс матрица-вектор) становится общим передним краем производительности для трёх платформ.

1.10 Прочая динамика: FlagCX / FlagQuantum / FlagScale / FlagDNN / docs (09-25 ~ 09-28)

Дата: 2026-09-25 ~ 2026-09-28 Источники: FlagCX #629, #628, FlagQuantum #221, FlagScale #1303, docs #523

  • FlagCX: #629 базовый уровень корректности CRL runner; #628 унифицированная диспетчеризация транспорта CRL и исправление согласования P2P-путей; #627 общая транспортная основа для сетевых адаптеров PAL; #626 повышение надёжности PAL IBUC и CI для CUDA adaptor — фундаментальное инженерное продвижение коммуникационной библиотеки по двум экспериментальным линиям CRL / PAL.
  • FlagQuantum: #220 пакетный слой Clifford для произведения состояний; #221 отложенная материализация SWAP произведения состояний — квантовый компонент продолжает пакет оптимизаций на стороне CPU.
  • FlagScale: #1303 исправление негетерогенной инициализации flagcx (main, 09-28 09:21) с cherry-pick в ветку 2.1.0-rc2 (#1304).
  • FlagDNN: корректировка совместимости с Hygon (09-25).
  • docs: синхронизация документации FlagPrism с обновлениями апстрима (#523, 09-27) — документация новых компонентов дополнена перед релизом 2.2.

2. Новости и экосистема

2.1 Двадцать первое подряд спокойное окно мониторинга на уровне компонентов (09-25 ~ 09-28)

Дата: 2026-09-25 ~ 2026-09-28 Источники: Google News RSS (26 групп поисковых запросов на китайском и английском, через прокси), HN Algolia

  • Запросы по именам компонентов (FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen / FlagOS 2.2) в 72-часовом окне дали ноль совпадений — двадцать первое подряд спокойное окно на новостной стороне.
  • На стороне экосистемы 18 совпадений в окне: продолжение репортажей о конференции Yuelu по OpenCL и о SAIL от Damo Academy XuanTie вошло по тематике (см. 2.2 / 2.3); остальное — биржевые сводки (связанные с IPO Enflame, полупроводниковый сектор), материалы аналитических центров и нерелевантные перепечатки, отсеяны по тематике.
  • HN Algolia не дал релевантных совпадений по FlagOS / FlagGems / FlagScale / BAAI.
  • Спокойное окно, охватившее три релизных цикла 2.0 / 2.1 / 2.2, стало нормой: прирост внешней информации сосредоточен в точках релизов и конференций, а повседневный ритм задаётся стороной кода и стороной сообщества.

2.2 Конференция Yuelu «AI+OpenCL»: подписание соглашения о совместном создании отечественной библиотеки операторов OpenCL (09-24/09-25)

Дата: 2026-09-24 ~ 2026-09-25 Источники: Changsha Evening News (Zhangshang Changsha), Huason Online (перепечатка Phoenix)

  • Тематический форум «AI+OpenCL гетерогенные вычисления» конференции Internet Yuelu 2026 (09-24, Чанша): Changsha Quanying Semiconductor, Hunan Innovation Strategic Alliance of IC Industry Technology, CSDN, Jingjiawei, Shouzhua Technology и другие организации подписали стратегическое сотрудничество по библиотеке операторов OpenCL — совместное создание единой отечественной библиотеки операторов OpenCL, прямое решение болевой точки отечественных чипов «сильное железо, слабое ПО», отказ от «изобретения велосипеда», снижение затрат разработчиков на кросс-платформенный перенос.
  • Состав форума: Khronos разъяснил глобальную систему стандартов OpenCL (сертификацию прошли более 450 устройств; отечественные чипы, включая Jingjiawei и GPGPU Chengying, уже адаптированы); учёные из Университета Цинхуа и Фуданьского университета рассказали об открытом стеке ПО для GPGPU и его внедрении на устройствах; Suan Neng Technology, Lishuan Technology и другие поделились практикой в области библиотек операторов для финансового количественного анализа и AI-ассистированного проектирования интегральных схем.
  • Связь с данным стеком: параллельная многовекторность «достройки программного стека» отечественных вычислительных мощностей — открытый стандартный путь OpenCL (кросс-вендорная, кросс-аппаратная совместимость) и путь «унифицированного плагинного стека» FlagOS служат друг другу экосистемным контрастом; это также продолжение недавнего нарратива о «программном фундаменте» (в предыдущих окнах уже были аналогичные шаги, такие как полностековая платформа Loongson и Weijing).

2.3 Damo Academy XuanTie: анонс второй партии открытого исходного кода SAIL — с конца этого месяца до начала октября (09-26)

Дата: 2026-09-26 Источники: Сообщество Zhiyuan, Phoenix (Dafeng Hao)

  • Продолжение: после того как 09-23 на конференции Yunqi были обнародованы достижения SAIL в области открытого исходного кода (основные факты уже включены в выпуск данного ежедневного отчёта от 09-24), в течение окна мониторинга такие площадки, как сообщество Zhiyuan, продолжали распространение информации и привели дополнительные сведения — вторая партия открытого исходного кода SAIL будет выпущена в период с конца текущего месяца до начала октября: охват включает адаптацию фреймворков TensorFlow / JAX, библиотеки ускорения FLA / acext, инструменты отладки и кластерного обслуживания ppu-gdb / ppu-dcgm, а также дополнительные коммуникационные библиотеки.
  • Список уже открытого исходного кода (обзор в СМИ): адаптация фреймворка PyTorch-for-sail, инструмент миграции исходного кода sailify, инструмент разработки операторов Triton-for-sail, DeepGEMM-for-sail, FlashAttention-for-sail; «ветка разработки на базе GitHub станет основной линией исследований и разработки».
  • Связь с данным стеком: SAIL ориентирован на Zhenwu PPU (то есть платформу поддержки PPU в FlagOS); два маршрута «стека открытого программного обеспечения» — собственный стек производителя и унифицированный стек сообщества — продвигаются одновременно — записи сборки PPU на стороне FlagOS (тег FlagTree ppu3.6, страница приложения sglang thead-ppu) можно непрерывно отслеживать и сопоставлять.

2.4 Shishi Technology Meta-Infer: почти 7-кратный прирост производительности инференса DeepSeek на PCIe-видеокартах (09-24, дополнительная запись за предыдущее окно)

Дата: 2026-09-24 Источники: QbitAI, Sina Tech

  • Shishi Technology (METASTONE) выпустила собственный движок инференса Meta-Infer: за счёт чисто программной оптимизации (дополнение ядер, оптимизация операторов и переработка коммуникаций, настройка параллелизма и ёмкости, повторное использование кэша) раскрывается потенциал видеокарт PCIe-Only — в конфигурации из 8 карт пропускная способность ввода DeepSeek-V4.1-Flash выросла с 1932 → 13274 tok/s (примерно в 6,87 раза), поддерживается контекст 1M; DeepSeek-V4-Flash показывает прирост в 1,55 раза; также утверждается, что данный набор методов был успешно проверен и на отечественных GPU (данные опубликованы производителем, независимая проверка третьей стороной не проводилась).
  • Ключевые моменты методологии: такие фреймворки, как vLLM / SGLang, молча деградируют на несертифицированном оборудовании (несовпадение определений метаданных, размеров страниц, порогов быстрого пути коммуникаций), и исправление адаптации высвобождает многократный прирост производительности — «сначала убедитесь, что высокопроизводительное ядро действительно выполняется, а затем говорите о масштабировании».
  • Связь с данным стеком: сторонняя практика, подтверждающая тот же тезис FlagOS о «раскрытии потенциала разнородного оборудования через унифицированный стек программного обеспечения»; её вывод о том, что «адаптация длинного хвоста оборудования — недооценённая экологическая ниша», взаимно соотносится с маршрутом разнородных чипов данного стека. Примечание к дополнительной записи: данный материал был впервые опубликован вечером 09-24, и окно предыдущего ежедневного отчёта не успело его включить.

3. Углублённое изучение организаций-участников

3.1 Ascend: пакет исправлений Torch-FL и очередь оптимизаций FlagGems; линия образов 0.18.2 ожидает миграции (09-25 ~ 09-28)

Дата: 2026-09-25 ~ 2026-09-28 Источники: Torch-FL #450, #436, #426, FlagGems #6697, FlagGems-vllm #850, портал release-info

  • Уровень операторов: в окне мониторинга активны шесть PR по оптимизации FlagGems для Ascend (оптимизация addmm / bmm / baddbmm / mv / mul + исправление индексации одного элемента index_put, диапазон #6697 ~ #6703); оптимизация производительности fused add rms norm в FlagGems-vllm (#850).
  • Уровень фреймворков: Torch-FL исправляет путь Ascend Qwen-Image и добавляет проверенный профиль регрессии (#450), поддержка ограниченного аддитивного смещения в SDPA realShift (#436), контракт профилировщика на стороне устройства (#426) — работа Ascend по дополнению на стороне torch продолжается.
  • Линия образов: в серии 0.18.2 megatron на портале пока нет записей для Ascend (по-прежнему серии 0.17.1-ascend-cann8.5.0 / 9.0.0) — миграция 0.18.2 на платформу Ascend является следующей точкой наблюдения.

3.2 Hygon: пакет исправлений DCU + оптимизация HCU FFT + сквозная проверка hygon RL (09-25 ~ 09-27)

Дата: 2026-09-25 ~ 2026-09-27 Источники: Torch-FL #453, FlagGems-vllm #859, FlagSparse #101, build-infra #1145, FlagGems #6696, коммиты FlagFFT dev

  • Операторы и фреймворки: FlagSparse DCU spmv CSR точность и пропускная способность, семейство COO (пакеты #101 и др.); FlagGems-vllm chunk_kda версия TLE и topk_softplus_sqrt (#859 / #846); Torch-FL DCU весовая «привязка» CUDA boxing (#453) и выравнивание имён устройств (#437); FlagGems addmm FlagTune и оптимизация conv2d поставлены в очередь PR (#6696 / #6700).
  • Научные вычисления: FlagFFT HCU CT пакет оптимизации листьев (см. 1.8).
  • Цепочка обучения: megatron rl 0.18.2 hygon RL E2E двухпутевая валидация (build-infra #1145) + hygon-dtk26.04 образ тег 2.2.0-0.3.0——Hygon является одной из первых платформ валидации 0.18.2.
  • Значение: Hygon DCU / HCU в данном окне охватывает четыре уровня — библиотеку операторов, FFT, фреймворк, цепочку обучения——это платформа с наибольшей глубиной в окне.

3.3 MetaX: пакет оптимизации MACA FFT + Metax RL E2E + тег образа (09-26 ~ 09-27)

Дата: 2026-09-26 ~ 2026-09-27 Источники: коммиты FlagFFT dev, build-infra #1145, Torch-FL #427, FlagGems #6663

  • FlagFFT MACA одно преобразование C2R упакованный вещественный путь и фиксация выигрыша (09-27); megatron rl 0.18.2 metax RL E2E двухпутевой (#1145) + metax-maca3.8.1.3 образ тег 2.2.0-0.3.0; Torch-FL исправление точности привязки fp32 матричного умножения в задаче интеграции MetaX (#427); FlagGems MetaX PR диспетчеризации MM и тюнинга ядер (#6663); FlagSparse maca sddmm базовый вариант в репозитории.
  • Наблюдение: MetaX синхронизируется по нескольким направлениям «цепочка обучения + FFT + операторы»——наряду с Hygon две наиболее активные платформы в окне.

3.4 Moore Threads: подключение chunk_kda, поддержка FP64 L2 и очередь оптимизации семейства bmm (09-25 ~ 09-27)

Дата: 2026-09-25 ~ 2026-09-27 Источники: FlagGems-vllm #856, FlagBLAS #135, FlagGems #6705, #6706, #6707

  • Злились изменения chunk_kda для Moore Threads в FlagGems-vllm (#856); в FlagBLAS добавлена поддержка FP64 L2 (#135); в очереди PR FlagGems три оптимизации bmm / addmm / baddbmm (#6705 ~ #6707, ветки автоматического потока серии Opus codex/mthreads-*).
  • Наблюдение: платформа MUSA продолжает двойное углубление по линиям «инференс-операторы + базовая библиотека BLAS», поддержка FP64 закрыла пробел в двойной точности на уровне L2.

3.5 Iluvatar CoreX / Enflame / Kunlunxin: Iluvatar CoreX — три параллельные линии; Enflame — стражи ядра; Kunlunxin — очередь оптимизаций (09-25 ~ 09-27)

Дата: 2026-09-25 ~ 2026-09-27 Источники: ветка FlagTree refactor, FlagGems-vllm #860, Torch-FL #438, коммиты FlagSparse, FlagGems #6662

  • Iluvatar CoreX (iluvatar, IX): ветка v2 рефакторинга специализации C++ в FlagTree (см. 1.4); chunk_kda и moe_sum в FlagGems-vllm (#860 / #855); пакет оптимизаций FlagFFT IX (см. 1.8) — три параллельные линии: компиляция, инференс-операторы, FFT.
  • Enflame (GCU): три защитных исправления в Torch-FL (досрочное отклонение 64-битных ядер Triton #438, escape int64 #429, вендорное ядро new_ones #423) — инженерная парадигма «перехватить до того, как вендорный компилятор прервёт работу».
  • Kunlunxin (XPU): пакет оптимизаций PR второй очереди FlagGems (#6662 / #6659) + FlagSparse XPU gather fp16 — после крупного пакета исправлений от 09-24 переход к итерациям оптимизации.

3.6 Tsingmicro: запуск вычислительной созвездия «Струны космоса» — реконфигурируемые чипы вошли в космическую промышленную цепочку (09-25/09-26)

Дата: 2026-09-25 ~ 2026-09-26 Источники: Zhejiang Daily (Zhejiang Online), перепечатка Phoenix

  • 5-я выставка цифровой торговли · Конференция восточной космической вычислительной индустрии (09-25, Ханчжоу): Diwei Er и Dongfang Xinglian совместно представили вычислительное созвездие «Струны космоса» — планируется группировка из более чем тысячи AI-спутников для исследования обработки данных в космосе, развёртывания моделей и координации вычислительных ресурсов; Tsingmicro глубоко участвует как партнёр промышленной цепочки (промышленная цепочка бортовых AI-чипов провинции Чжэцзян).
  • Контекст: Tsingmicro и Dongfang Xinglian с конца 2025 года установили стратегическое сотрудничество, «космический интеллектуальный агент на реконфигурируемом чипе» был представлен на WAIC 2026, планируется завершить первые испытания на орбите к концу 2026 года — путь «реконфигурируемый чип в космос» продолжает продвигаться.
  • Связь с данным стеком: Tsingmicro является членом данного стека (в FlagTree уже есть варианты платформы tsingmicro3.3 / 3.6, Open3D-PIMC также является совместным результатом с Zhiyuan/BAAI) — космические вычисления являются продолжением линии сценариев реконфигурируемых чипов, что перекликается с долгосрочным направлением данного стека «от облака до периферии во всех сценариях».

4. Итоги и наблюдения за тенденциями

  1. Закрытие GA-дня, дисциплина релиза сквозная: в окне нет ни одного нового функционального заявления, все действия сосредоточены вокруг закрытия верификации, пересборки артефактов и фиксации записей; два списка community (#114 / #115) вот-вот будут включены — публичная поставка 2.2 будет основана на «доказанной степени готовности».
  2. Цепочка обновления Megatron 0.18.2 сформирована: RL E2E подтверждён на nvidia×2 / hygon / metax + после перепозиционирования wheel v0.3.0 завершена повторная проверка no-shim + пакетная запись тегов образов четырёх платформ — продвижение версий в сценариях обучения и RL является инженерной осью завершающей стадии, а также прелюдией следующего релизного цикла (линия 0.3.0).
  3. «Скиллизация» релизной инженерии: фреймворк Claude Code skills внедрён в build-infra, подключение бэкендов (add-backend / update-backend) и шлюзы изменений закреплены как исполняемые навыки — возможности агентов начинают обратно проникать в собственную инфраструктуру разработки FlagOS, перекликаясь изнутри и снаружи с нарративом Skills в сообществе.
  4. Всеобщая битва за тестовую инфраструктуру: пять подряд пакетов тестов FlagGems P0/P1 (разреженность, свёртки, FFT, линейная алгебра, cuDNN CTC и др., все с воспроизводимыми бенчмарками) — качество выдвинуто вперёд в период заморозки, закладывая основу для многоплатформенной матрицы 2.3.
  5. Многоплатформенные линии разработки расцвели повсеместно: FlagSparse (DCU / MUSA / XPU), FlagBLAS (XuanTie от DAMO Academy / Ascend / Moore Threads), FlagGems-vllm (Iluvatar CoreX / Hygon / Moore Threads), FlagFFT (Hygon / Iluvatar CoreX / MetaX), Torch-FL (полная матрица) — состояние двух треков «релизная заморозка и разработка параллельно» проявляется одновременно в пяти компонентах.
  6. Сопоставление со стороны экосистемы: 21-е спокойное окно новостной повестки контрастирует с активностью на периферии — совместное строительство библиотеки операторов OpenCL, анонс «второй партии SAIL», кейс Meta-Infer «почти в 7 раз» — все указывают на один тезис: реализация ценности разнородного оборудования всё больше зависит от возможностей программного стека. Оконный дивиденд унифицированного программного стека и конкуренция синхронны.

Приложение: таблица проверки источников

Категория Источник Способ проверки Результат
GitHub org: flagos-ai repos API Полная проверка pushed_at по 54 репозиториям 15 репозиториев активны в окне
GitHub Поиск коммитов + порепозиторная сверка Построчная верификация в окне (включая линии веток) Поиск коммитов: 173 записи по 11 репозиториям; дополнительно проверено 6 линий веток (пакет FlagGems P1 / FlagFFT dev / Megatron-LM-FL 0.3.0-rc2 / FlagTree ×2 / FlagScale 2.1.0-rc2)
Релизная инженерия Оригиналы community #114 / #115 Построчное сравнение статуса и веток Оба пункта всё ещё ожидают включения; ветка release/2.2-official-l1 в деле
Релизная инженерия PR build-infra и развёртывание release-info Сверка по извлечённым оригиналам Цепочка Megatron 0.18.2 закрыта; портал автоматически развёрнут 5 раз в окне
Теги FlagTree / FlagGems / FlagScale / FlagBLAS и др. tags atom Построчная сверка Новых тегов в окне нет (работа перешла в ветки и очередь PR)
Новости Google News RSS (26 групп поисковых запросов на китайском и английском, через прокси) Фильтрация по 72-часовому окну + построчное исключение По компонентным словам — ноль попаданий (21-е спокойное окно); со стороны экосистемы оставлено 3 записи
Медиа Changsha Evening News / Voc.com.cn / Zhiyuan Community / Phoenix News / QbitAI / Sina Tech Повторная проверка по извлечённым оригиналам Библиотека операторов OpenCL / продолжение отчёта SAIL / Meta-Infer (дописано)
Сообщество HN Algolia Повторная проверка поиска Релевантных попаданий нет
Историческое сопоставление Ежедневные отчёты FlagOS за предыдущие три дня Проверка дедупликации SAIL — продолжение отчёта (прирост явный); Open3D-PIMC — без нового; материалы о фондовом рынке исключены

Полный список источников

os-ai/FlagCX/pull/627> · https://github.com/flagos-ai/FlagCX/pull/628 · https://github.com/flagos-ai/FlagCX/pull/629 · https://github.com/flagos-ai/FlagQuantum/pull/220 · https://github.com/flagos-ai/FlagQuantum/pull/221 · https://github.com/flagos-ai/FlagScale/pull/1303 · https://github.com/flagos-ai/FlagScale/pull/1304 · https://github.com/flagos-ai/docs/pull/523