Период отчёта: с 21 сентября 2026 года (понедельник) по 25 сентября 2026 года (пятница), всего 5 рабочих дней Источники материалов: ежедневные отчёты о динамике FlagOS данного издания (пять выпусков: 09-21, 09-22, 09-23, 09-24, 09-25, окна мониторинга стыкуются день за днём, без пробелов); все пункты взяты из проверенных источников соответствующего периода, при подготовке дополнительно сверены и дополнены через GitHub Пояснение к подготовке: эта неделя — последняя полная рабочая неделя перед FlagOS 2.2 GA (09-28), основная линия — завершение релиза: последовательно выполнены три уровня проверки «тег, манифест, охват»; одновременно охвачены четыре измерения: совместная разработка компонентов и кода, подключение новых партнёров по чипам, организации-участники и экосистема. В окнах ежедневных отчётов за пять выпусков суммарно зафиксировано 916 попаданий коммитов (163 / 224 / 143 / 211 / 175), число активных репозиториев в каждом выпуске — 22 / 19 / 24 / 23 / 24, суммарно охвачено около 30 репозиториев внутри org


1. Главные новости недели

  • 2.2 Замораживание релизов: официальные метки версий десяти компонентов массово зафиксированы в репозитории (09-24): 09-24 в 01:49 ~ 01:50 по пекинскому времени десять официальных меток версий модулей L1 (чистые номера версий, без суффиксов rc / post) были проставлены разом — flaggems v5.4.0, flagfft v0.2.0, flagsparse v0.3.0, flagdnn v0.3.0, flagblas v0.3.0, flagtensor v0.3.0, flagaudio v0.3.0, flagattention v0.4.0, flaggems-vllm v0.2.0, flaggems-sglang v0.1.0; каждая метка проставлена на HEAD соответствующей ветки rc2 модуля и построчно выверена обратным чтением, сопутствующий PR (community #114) добавляет в официальный перечень сопоставление «официальная метка ← база rc2», на момент составления всё ещё на рассмотрении.
  • Закрытие канала rc2 + запуск аудита области (09-24): community #113 переводит перечень rc2 из 13 модулей единообразно на последние проверенные метки post (flaggems rc2.post4 и др.), период стабилизации rc2 по графику завершается 09-24, после чего принимаются только hotfix; в тот же день community #115 открывает «аудит области 2.2 FEP» — 18 позиций Implemented FEP сохраняются, FEP 0019 / 0069 / 0081 / 0084 / 0093 / 0100 шесть позиций отложены до 2.3, сохранённые позиции ограничены «реализованными интерфейсами + проверенными конфигурациями». Валидация релиза продвинулась от «замораживания кода» и «замораживания релизов» к «замораживанию области и деклараций».
  • Перестройка портала информации о релизах, быстрое уплотнение матрицы платформ (09-22 ~ 09-25): портал Release Info перестроен 09-23 (20 строк платформ base / runtime + два набора матриц vLLM + Megatron + образы приложений sglang); образ приложения Megatron 2.2.0-0.2.3 покрывает 14 строк платформ, матрица megatron_rl разблокирована и открывает все 18 бэкендов; страница приложения sglang за одну ночь выдала семь релизов подряд (Kunlunxin / Ascend / Enflame / Hygon / Moore Threads / Iluvatar / generic — семь платформ), страница приложения Damo Academy XuanTie thead-ppu2.1.0 в тот же день вошла в портал.
  • Плотное подключение новых партнёров по чипам (09-24 ~ 09-25): Biren с бэкендом SUPA вошла в линию в тот же день на двух уровнях — «библиотека операторов FlagGems + плагин инференса vllm-plugin-FL» (#6367 / #530); Sunrise портирует набор патчей 0.2.1 для PTPU в основную ветку vLLM 0.24 (#555); у Tsingmicro метки платформы FlagTree полностью укомплектованы — подключение на трёх уровнях «библиотека операторов + плагин инференса + компилятор» по единой схеме становится стандартным путём входа внешних чипов в FlagOS.
  • FlagFFT дополнил бэкенд Hygon, 102 коммита за одно окно мониторинга по трём линиям (09-21 ~ 09-22): адаптер Hygon BW1000 (HCU) вошёл в dev, перечень бэкендов в README расширен до семи позиций CUDA / MUSA / PPU / IX / MACA / NPU / HCU; в том же окне мониторинга завершение производительности MACA (MetaX) и пакетная работа Stockham для NPU (Ascend) шли параллельно, упаковочный набор из трёх частей (#12 / #18 / #22) влит синхронно — новый бэкенд + завершение производительности + упаковка дистрибутива три задачи выполнены в одном окне.
  • Damo Academy XuanTie продвигается по двум линиям: выпуск Zhenwu V900 + выход PPU в матрицу FlagOS (09-22 ~ 09-25): на конференции Yunqi (09-22) выпущен AI-чип нового поколения для обучения и инференса Zhenwu V900 (216 ГБ видеопамяти, межкристальный интерконнект 1200 ГБ/с, нативные FP8 / FP4, производительность одного чипа втрое выше предыдущего поколения M890, массовое производство в Q1 2027 года); со стороны программного обеспечения PPU в реальном статусе вошёл в матрицу сборки и приложений — метка FlagTree 0.7.0+ppu3.6, страница приложения sglang thead-ppu, TE-FL PPU CI; стек программного обеспечения SAIL объявил о расширении открытого исходного кода, ветка разработки на GitHub станет основной линией исследований и разработки.
  • Сквозная готовность цепочки обучения с подкреплением на 910C (09-24 ~ 09-25): две конфигурации Ascend 910C (CANN 9.0.0 + torch 2.10 / CANN 8.5.0 + torch 2.9) прошли сквозную валидацию megatron-core[rl] GRPO с одношаговой установкой (код выхода 0), в wheel встроены три исправления RL, включая гейтинг packed_seq; попутно решена проблема невидимости NPU, вызванная Ascend-Docker-Runtime — это обеспечивает воспроизводимую цепочку доказательств для декларации Ascend в сценариях RL в версии 2.2.
  • Плотные события в отрасли и экосистеме (09-21 ~ 09-25): AICC2026 прошла в Пекине (два доклада FlagOS, запуск системы оценки «надёжного AI» с участием более 20 организаций); MetaX MXMACA вошла в основную ветку LMCache по принципу «сначала upstream», официально объявлена адаптация 39 основных моделей в Day 0; Moore Threads подключила MTT S5000 к официальному CI RLinf, сквозной инференс Protenix-v2 ускорен примерно на 26%; Loongson выпустил первую версию платформы ускоренных вычислений; новостная матрица Open3D-PIMC расширена до Sina Finance.

2. Динамика версий и релизов

Ритм RC и вехи GA

  • График: период стабилизации rc2 завершается 09-24 (после этого принимаются только hotfix), GA Go/No-Go назначен на 2026-09-28; сроки issue отслеживания релиза (community #47) и milestone — также 09-28.
  • Финальное полное выравнивание канала rc2 (09-24 00:42, community #113): 13 модулей обновлены до последних проверенных тегов HEAD ветки rc2 — flaggems rc2.post4; flagfft / flagdnn / flagblas / flagtensor / flagaudio rc2.post2 (содержание — цепочка упаковки Debian / RPM и публикации в Nexus, исправление идентичности усиления FlagAudio); flagtree три линии 0.7.0rc2.post2; vllm-plugin-fl две линии post3; transformerengine-fl post2; flagscale post2.
  • Официальный список пополняется партиями: 09-22 community #111 включил первую запись sglang-plugin-fl v0.2.0 (базовый HEAD rc2 1c84db7, в заголовке файла явно указана спецификация версий «официальные теги всегда используют голый номер версии, исключение — FlagTree»); 09-24 #114 добавил сопоставление десяти компонентов L1 (flaggems v5.4.0 ← post4, flagattention v0.4.0 ← post1 и т. д.), на момент составления этот PR всё ещё находится на рассмотрении.
  • Сужение объёма и аудит: FEP-0085 выводит GEMM+ReduceScatter из объёма 2.2 (community #112, 09-24, зафиксировано по цепочке «тестовые доказательства + правка документации»); PR аудита объёма #115 устанавливает границу поставки «18 сохранено / 6 отложено до 2.3» и требует удалить «неподтверждённые заявления о завершении / производительности».
  • Повышение статуса основной линии разработки: на следующий день после фиксации официальных тегов FlagSparse main повышен до 0.4.0, версионная линия FlagAudio скорректирована до 0.4.0, FlagAttention синхронно выполнил обновление версии — релизные артефакты 2.2 (базовая линия rc2 + официальные теги) и основная линия разработки (серия 0.4.0) официально разошлись, цикл разработки 2.3 фактически уже запущен.

Теги компонентов и список Release (в пределах окна)

  • Официальные теги (десять L1): flaggems v5.4.0, flagfft v0.2.0, flagsparse v0.3.0, flagdnn v0.3.0, flagblas v0.3.0, flagtensor v0.3.0, flagaudio v0.3.0, flagattention v0.4.0, flaggems-vllm v0.2.0, flaggems-sglang v0.1.0 (09-24).
  • FlagTree: серия 0.7.0 массово выпускается и продолжает расширяться — основная линия из трёх веток 0.7.0+triton3.6 / +triton3.5 / +triton3.3; платформенные варианты +mthreads3.6, +ppu3.6, +xpu3.6, +tsingmicro3.6 / +tsingmicro3.3, +ascend3.5, +iluvatar3.6, +metax3.6, +tileir3.6, +hcu3.6 и ещё более десяти штук (09-23 — 09-25) — платформенные теги расширились от «основной линии» до «вендор-специфичных», официально включены в систему версий.
  • FlagCX: выпущен v0.14.0-rc2.post2 (09-21 22:11) — исправление разбора каталога библиотеки torch_txda для Tsingmicro TSM, устранена ошибка связывания runtime-образа TSM.
  • Прочие линии тегов: FlagScale v2.1.0-rc2 (09-23, выбран из main) и v2.1.0-rc2.post2; ветка vllm-plugin-FL 0.3.0-rc2 (включая адаптацию tsingmicro txda для 0.24.0); sglang-plugin-FL v0.2.0 (первая запись официального списка).

Состояние образов и артефактов

  • Матрица прикладных образов: образ приложения Megatron 2.2.0-0.2.3 централизованно зарегистрирован в 14 строках платформ (nvidia-cuda12.8 / 13.3, ascend-cann8.5.0 / 9.0.0, cambricon-neuware4.4.3 / 4.7.2, enflame-tops1.9.10 / 1.10.6, hygon-dtk26.04, iluvatar-corex4.4.0 / 4.5.0, metax-maca3.8.1.3, mthreads-musa4.3.6 / 5.2.0); строка приложения megatron_rl разблокирована и открыта для всех 18 бэкендов (09-23, build-infra #1057).
  • Линия vLLM: линия 0.20.2 завершила снимок проверки на стенде 20/20 бэкендов, опубликованы причины, по которым три бэкенда не могут работать на FlagTree 0.7.0rc2 (MetaX tl.dot ICE, старый инструментарий Enflame отвергает enable_i64, cuda13.3 зависит от libcudart.so.12, каждый с сопоставлением 0.6.x и записью фиксации версии); линия 0.24.0 2.2.0-0.3.0rc2.post2 записала обратный откат.
  • Линия sglang: страница приложения семи платформ выпущена за одну ночь подряд (kunlunxin-xre5.37.1, ascend-cann8.5.0, enflame-tops1.10.6, hygon-dtk26.04 двойная страница, mthreads-musa4.3.5, iluvatar-corex4.5.0, generic-c13.0), thead-ppu2.1.0 обновлён до официального тега компонента (09-25); релизы прикладного уровня синхронно переименованы в вендор-нейтральные.
  • Портал релизов и интеграция со сборкой: портал Release Info пересобран (09-23, охватывает 20 строк платформ base / runtime и матрицу приложений vLLM / Megatron / sglang); build-infra поднял версию FlagGems в матрице сборки до 5.4.0 (09-24, синхронно с официальным тегом, слито примерно через 7 часов — эталонный пример порядка «тег → сборка»).
  • Мультитрековость каналов распространения: канал FlagCX wheel расширен с пилота до всех строк и реализован на Kunlunxin (предкомпилированный wheel несёт device bitcode); единый канал публикации noarch deb / rpm охватывает каждый упаковываемый компонент (FEP-0019 Wave 1); сторонний канал flagos-packaging выпустил v2026.09.20 (два формата apt / dnf, repo шести дистрибутивов, подпись GPG).

3. Совместная разработка компонентов и кода

На этой неделе число коммитов в пяти окнах внутри org составило 163 / 224 / 143 / 211 / 175, всего около 916, ниже агрегировано по модулям.

Операторы и доменные библиотеки (FlagGems и доменные библиотеки)

  • FlagGems (основная линия, первая линия на этой неделе): за пять окон было зафиксировано 34 / 29 / 28 / 59 / 46 коммитов. Три параллельные производственные линии: массовое поступление в репозиторий через KernelGen (за неделю добавлено около 60 длиннохвостовых операторов Nvidia, охватывающих inverse, _gather_sparse_backward, msort, linalg_inv_ex, семейство _ctc_loss, семейство _cudnn, histogramdd, _scaled_grouped_mm_v2 и др.); пакет подготовки Kunlun Core (пакет оптимизации 31 оператора загружен за один раз, 27/31 достигли порога производительности 0.8x, кроме того около 20 исправлений XPU охватывают быстрый путь FlashAttention, быстрый путь scaled_mm на хосте, семейство свёрток и специальные функции, тестовая машина перенесена на klx-p800); развёртывание TLE на нескольких бэкендах (Ascend glu использует tle.dsa.extract_slice, Iluvatar включает TLE в vendor descriptor, конвейер Hygon W8A8 из-за ограничений белого списка переписан на сегментированный tl.range, за 48 часов TLE вошёл в четыре бэкенда).
  • Квантизация и тюнинг: Hygon fused_inv_rope_fp8_quant (слияние «обратный RoPE + групповая квантизация FP8» на пути внимания DeepSeek-V4), регистрация Hygon INT8 RMSNorm; MetaX topk_w8a16_fp8; оптимизация index_add / polar для Moore Threads; дополнены тесты FP8 для шести бэкендов (NVIDIA / Ascend / Hygon / XuanTie / MetaX / Iluvatar); модель затрат FlagTune расширена на Hopper, MetaX MM и Damo Academy XuanTie ZW810E (v1.1.0 на рассмотрении), включён локальный тюнинг FP8 MM.
  • Пакет исправлений платформы: Ascend (дублирование cos/sin в apply_rotary_pos_emb, ошибочные результаты batched linalg_solve_triangular, padding сетки log_); Iluvatar (отключение пути TLE для linalg_solve_triangular, index_reduce_); Hygon (умножение complex на скаляр); MetaX (выход за границы masked_fill); Kunlun Core (пакет special_bessel_y1 / softplus / weight_norm).
  • Качество разработки: исправление отказа пути регистрации операторов, проверка базовой линии reference-only для бенчмарков, предварительная проверка кандидатов и внутрипроцессный хук профилирования, еженедельное обновление образов контейнеров бэкендов; продолжает вносить вклад SiliconFlow (исправление и тюнинг _scaled_grouped_mm для разных бэкендов, оптимизация adaptive_avg_pool2d, исправление index_reduce_ на трёх платформах).
  • FlagFFT: адаптер Hygon HCU (подробности в главных новостях); линия MACA — стратегия измерения «1d single» переведена в режим по умолчанию, эксперимент с обменом регистров FP64 в тот же день был опробован и откатан; набор упаковки из трёх частей (Debian + RPM, публикация в Nexus, портирование 0.2.0-rc2); изоляция продуктов JIT между процессами и многопроцессные регрессионные тесты.
  • FlagSparse: сотрудничество с NCIC-AlphaSparse вступило в фазу высокой интенсивности (за неделю объединено шесть пакетов: базовая линия MACA SpMV CSR, оптимизация DCU SpMM COO, отладка численных результатов ASCEND, добавление алгоритма biv, исправления поставки MUSA); после официального тега v0.3.0 main повышен до 0.4.0; исправления совместимости rpm-упаковки и pip.
  • FlagBLAS: две партии оптимизации производительности L2 для Ascend (SPR / SPR2 / HPR / HPR2, banded packed и triangular, упрощение пути запуска SYMV); принята поддержка L2 для Moore Threads; реализована линия упаковки внешних контрибьюторов.
  • FlagDNN / FlagTensor / FlagAudio / FlagAttention: FlagDNN реорганизовал архитектуру реализаций для платформ Iluvatar и Hygon, Moore Threads повторно использует уже скомпилированные артефакты, объединение упаковки; линия упаковки FlagTensor 0.3.0-rc2 (deb / rpm, поиск Torch через CMake, загрузка в Nexus); FlagAudio после объединения первых трёх PR перешёл к практике (оператор спектрограммы Triton, исправление идентичности усиления, откат установки в openEuler); тег FlagAttention v0.4.0, обновление тестов и бенчмарков.
  • FlagTrain (новое направление): после создания репозитория 09-16 реализованы первые наработки — приняты представленные KMCompiler операторы обучения Triton lamb и методы тестирования, позиционирование — «реализация на Triton многоразовых операторов обучения для основных фреймворков обучения».

Компиляторы и коммуникационные библиотеки (FlagTree / FlagCX / libtriton_jit)

  • FlagTree: проприетарная реструктуризация бэкенда MetaX продвигалась ночью десятью коммитами (проприетаризация трёхуровневого исходного кода TritonIR / TritonToTritonGPU / TritonGPUToLLVM, единая точка входа CMake, интерфейс компоновки Gluon); Iluvatar синхронизирован с Triton v3.6.x и расширен TLE-распределением и TLE_RAW (большой PR на 30 файлов, распределённые примитивы поддерживаются FlagCX); в NVIDIA TLE добавлены подсечения SMEM и многописательный конвейер TMA; два исправления компилятора для AMD (выявлены тестами точности на W7900); расширено покрытие CI (рабочий процесс 910B, mthreads3.6, hcu3.6, бенчмарк MetaX vLLM, проверка PPU pid); исправления упаковки (унификация имени библиотеки triton _C/libtriton.so, упаковка clang в rpm, номер, соответствующий PEP 440, для deb).
  • FlagCX: rc2.post2 исправляет плагин TSM Tsingmicro; гетерогенная передача укреплена и выровнена с CI ускорителей, расширен p2p engine rpc serve, обновлена передача barex; из Requires в rpm исключены sonames CANN без версии; агрегированное планирование гетерогенного gather CRL вынесено после передачи; PAL поддерживает ABI SHCA verbs и 17-битный LID; линия распространения wheel (полная линейка + Kunlunxin).
  • libtriton_jit: исправление каталогов скриптов для нескольких архитектур, упаковка под несколько бэкендов, исправление совместимости с nlohmann-json, сужение условий срабатывания упаковки — среда выполнения Triton JIT сходится к форме распространения под несколько бэкендов.

Фреймворки инференса и обучения (FlagGems-vllm / FlagGems-sglang / Torch-FL / линия плагинов / FlagScale / TE-FL / Megatron-LM-FL)

  • FlagGems-vllm (четыре платформы в одном окне): партия операторов XCS Ascend продвигается (оптимизация slot_mapping на практике: полный цикл обслуживания 1050.9 → 81.2 мс, сжатие состояния kpool, lightning indexer, kv_rmsnorm_rope_cache и др.); Moore Threads делит INT4 / FP8 слитые Marlin MoE и W8A8 attention переменной длины; Hygon — блочный BMM INT8 и сокращение einsum; MetaX — слитая обратная RoPE с FP8-квантованием и persistent_topk на бэкенде MC550; TLE-версия topk для XuanTie от DAMO Academy; Gemma RMSNorm одним разом закрыт для трёх платформ; «сопоставимая реализация одного оператора на нескольких платформах» стала стандартным режимом работы.
  • FlagGems-sglang: слияние трёх ветвей fused MoE router (интеграция Kunlunxin и MUSA, две tensorcore-вариации Ascend, tensorcore dot-acc Enflame); регистрация vendor GCU Enflame (запрос устройств, включение TLE, эвристическая конфигурация).
  • Torch-FL (закрытие инженерных задач): прямой отказ при индексах за границами на DCU, ядра Ascend переведены на выполнение на устройстве, где находятся операнды, PPU восстанавливает метаданные CUDA для CPU torch wheel; матрица сборки сведена в единую таблицу, при нераспознанном GEMS_VENDOR — прямая ошибка, удалены глобальный патч Tensor.__getitem__ и выведенный из эксплуатации код MetaX; унифицировано определение платформ и добавлена документация по матрице возможностей, версии pin сосредоточены в едином файле, побочные эффекты при импорте сведены к упорядоченному конвейеру этапов.
  • vllm-plugin-FL: запущена линия обновления vLLM 0.28 (на стороне NVIDIA уже влито, адаптация Ascend 910C #487 на рассмотрении); влит бэкенд SUPA Biren, PTPU Xiwang портирован на основную ветку 0.24, влит инструмент профилирования на уровне операторов; рабочий процесс Hygon vLLM 0.24 выровнен с CI MUSA.
  • FlagScale / TransformerEngine-FL / Megatron-LM-FL: FlagScale исправляет параметры metax и продвигает v2.1.0-rc2.post2, в очереди сжатие обучения MemRift, профайлер NPU, CI обучения XuanTie 810E от DAMO Academy, выборка состояния здоровья Hygon DCU; в TE-FL добавлены LayerNorm бэкенда NPU и многоточечный Adam, поддержана компоновка vanilla TE-пакета MetaX (также включена в rc2.post2), модульные и интеграционные тесты PPU на рассмотрении; Megatron-LM-FL стабилизирует совместимость вендорных бэкендов и CI, сборка MetaX сохраняет jit_fuser как no-op для предотвращения утечки видеопамяти, поддержка платформы PT-PU Xiwang.

Инженерия релизов и управление (build-infra / community / docs)

  • build-infra:помимо линии версий и образов, на этой неделе также завершены канал FlagCX wheel (включая Kunlunxin), унифицированный канал noarch deb / rpm, разделение сборочного конвейера (сборка release path, поочерёдная загрузка native-rpm по наборам, штамп версии релиза), пятикратное усиление релизного CI (сборка с закреплёнными версиями, проверка verify, проверка символов, поочерёдное перечисление пакетов, проверка целевого репозитория), исправления 910C RL E2E и видимости NPU, страница приложения sglang и поддержка портала.
  • community:все три линии действий по управлению релизом 2.2 — метки / манифест / охват — зафиксированы в репозитории (#111 ~ #115); документация FEP продолжает пересматриваться в соответствии с принципом «границы релиза и доказательства».
  • docs и wiki:четыре обновления списка моделей (ModelScope / HuggingFace и др.); много платформенное руководство пользователя FlagTree wiki неоднократно обновлялось перед релизом.

Квантовое, разреженное и новые направления

  • FlagQuantum (самое быстрорастущее направление недели):два окна подряд по 30+ коммитов (38 / 35, ещё окна 19 / 13, в сумме 100+ коммитов). Пять линий параллельно: облачные QPU (каркас Azure Quantum, API задач Quafu), матрица кросс-фреймворковых мостов исполнения почти полная (Cirq, Qiskit Aer, PennyLane Lightning, Braket, CUDA-Q), ускорение слияния симуляции (вентили вектора состояний, двухлинейное слияние, маршрутизация поверхностного Clifford), контрольные ворота валидации (валидация на отложенном наборе, выравнивание дрейфа, консультант по выбору симулятора с ограничениями доказательств), переиспользование CI и распараллеливание.
  • Open3D-PIMC:после выхода кода матрица публикаций продолжает расширяться (Xinhua 09-14 → CNR 09-18 → Guangming 09-23 → Sina Finance 09-24), ключевые факты совпадают, новой технической информации нет; напрямую связано с направлением 3D-вычислительных чипов FlagOS.
  • FlagOS-Compressor:PR экспорта линейного INT8 для DeepSeek V4.1 и MiMo V2.5 был отозван в день слияния (причина не указана в сообщении коммита); последующие действия перечислены как пункт наблюдения этого отчёта.

4. Члены организации и адаптация производителей

  • Zhiyuan (BAAI, головной участник): руководство релизом 2.2 (аудит списка / меток / области охвата), завершение RC2 и определение границ релиза FEP; два доклада FlagOS на AICC2026 (Линь Юнхуа «От архитектурных инноваций к доступным вычислительным мощностям», специальный доклад Чжао Шуая) и совместное создание системы оценки «надёжного AI»; совместная разработка Open3D-PIMC.
  • Hygon: первый адаптер бэкенда FlagFFT для HCU (BW1000); замена конвейера W8A8 TLE в FlagGems, fused_inv_rope_fp8_quant, INT8 RMSNorm, оптимизация mv, исправление complex-скаляров; контрольный список FlagSparse DCU и точность spv; сэмплирование состояния оборудования FlagScale DCU (на рассмотрении); новые базовые показатели FlagGems hcu3.6 и рабочий процесс тестирования в FlagTree; публикация страницы приложения sglang hygon-dtk26.04.
  • MetaX: MXMACA вошла в основную ветку LMCache по принципу «сначала в upstream» и создан механизм CI-проверки; официально объявлена адаптация Day 0 для 39 флагманских моделей с декабря 2025 года (включая Qwen-Image-2.1); в коде — десять коммитов рефакторинга специализации FlagTree, ряд исправлений помимо Iluvatar вошли в содержимое rc2.post2 (раскладка TE-FL, jit_fuser, persistent_topk), topk_w8a16_fp8, бенчмарки MetaX vLLM в CI, метка 0.7.0+metax3.6.
  • Moore Threads: официальный CI RLinf начиная с версии 0.3 подключён к MTT S5000 (коэффициент корреляции кривой обучения 0.976, время полного шага снижено на 26%, доля простоя 18.5% → 3.1%); полный цикл инференса Protenix-v2 быстрее в среднем примерно на 26% по сравнению с основными мировыми GPU, замкнут цикл по трём крупным сценариям AI4S; W8A8 для внимания с переменной длиной и совместное INT4 / FP8 слияние Marlin MoE; доклад на AICC2026 и участие в совместном создании «надёжного AI».
  • Ascend: пакет операторов XCS (slot_mapping / kpool / серия indexer) и базовый рабочий процесс FlagGems для 910B; сквозное прохождение RL на 910C в двух конфигурациях, исправление видимости NPU; grouped_matmul внесён в список операторов, rrelu_with_noise, улучшения диспетчеризации cat/concat; адаптация vLLM 0.28 на рассмотрении; дополнен бэкенд TE-FL NPU; регистрация многострочных образов и страница приложения sglang.
  • Enflame: регистрация GCU vendor в FlagGems-sglang и слияние router с tensorcore dot-acc; регистрация строки образа приложения megatron; сопровождение линии плагина 0.24.
  • Iluvatar CoreX: бэкенд Iluvatar синхронизирован с Triton v3.6.x и включён TLE с распределением; wheel пересобран на Ubuntu 22.04 и опубликован builder; solve_triangular отключает путь TLE; регистрация двух строк образов corex4.4.0 / 4.5.0.
  • Kunlunxin: пакет оптимизации 31 оператора (27/31 достигли целевых показателей) и пакет из почти 20 исправлений XPU; миграция тестовой машины на klx-p800; страница приложения sglang kunlunxin-xre5.37.1; внедрение FlagCX wheel для Kunlunxin.
  • Tsingmicro: KernelGen 2.2.0 включён как новое оборудование; FlagCX rc2.post2 исправляет плагин TSM torch; метки FlagTree +tsingmicro3.6 / +tsingmicro3.3; доклад «Open3D-PIMC» на AICC2026 и обновление строки портала.
  • T-Head (XuanTie, DAMO Academy): выпуск Zhenwu V900 (новое поколение PPU); PPU вошёл в матрицу сборки и приложений FlagOS (метка 0.7.0+ppu3.6, страница приложения sglang thead-ppu, TE-FL PPU CI, проверка pid в FlagTree PPU); модель стоимости ZW810E FlagTune v1.1.0 на рассмотрении; программный стек SAIL расширяет открытый исходный код, ветка разработки на GitHub станет основной линией разработки.
  • Biren и Xiwang (новые партнёры): бэкенд SUPA от Biren вошёл в линию в двух уровнях в один день (библиотека операторов + плагин инференса); набор патчей Xiwang PTPU портирован в основную ветку vLLM 0.24 (Qwen3.6 27B / 35B-A3B работают штатно).
  • Cambricon: образ приложения megatron 2.2.0-0.2.3 доступен в строках neuware4.4.3 / 4.7.2.

5. Экосистема и сообщество

Конференции и отраслевые события

  • AICC2026 (21.09, Пекин): 7-я конференция по вычислениям с ИИ — заместитель директора и главный инженер BAAI Линь Юнхуа представила доклад «От архитектурных инноваций к доступным вычислительным мощностям: новая парадигма программно-аппаратной синергии для вычислений с ИИ на базе FlagOS»; исследователь BAAI Чжао Шуай представил доклад «Zhongzhi FlagOS: раскрытие ценности многообразных вычислительных мощностей для ИИ через открытый программный стек»; на конференции была запущена рабочая группа по оценке «надёжного ИИ» и опубликована система оценки (Пятый электронный институт Министерства промышленности и информатизации совместно с BAAI, Inspur, Moore Threads, MetaX и более чем 20 другими организациями); IDC прогнозирует, что к 2026 году масштаб интеллектуальных вычислительных мощностей Китая достигнет 2576,5 EFLOPS (+87,9% год к году).
  • Конференция Yunqi (22.09, Ханчжоу): XuanTie подразделения DAMO представила Zhenwu V900 (подробности в главных новостях); анонсированы Zhenwu J900 (март 2028 года) и серверные CPU Yitian 720 / 730 (2027 год).
  • Динамика отечественных программных стеков для вычислений: Loongson Technology выпустила первую программную версию «платформы ускоренных вычислений Loongson» (на базе GPU серии LG200, охватывает драйверы, компиляторы, среду исполнения, библиотеки операторов и движки вывода, поддерживает OpenCL 3.0 и миграцию с CUDA); 23.09 в Ханчжоу открылась 5-я Глобальная выставка цифровой торговли (впервые учреждён раздел экосистемы применения интегральных схем, MetaX и другие приняли участие).
  • Прогресс открытого исходного кода SAIL (23.09): старший директор по программной экосистеме XuanTie подразделения DAMO Лу Шэнхуа сообщил — уже открыто 39 моделей низкоточной квантизации (более 348 тыс. загрузок), SAIL адаптирован к более чем 260 фреймворкам, среднее время адаптации к основным фреймворкам вывода менее 7 дней, серия Zhenwu уже обслуживает более 650 корпоративных клиентов.

Матрица открытых релизов и освещения

  • Open3D-PIMC: матрица открытых публикаций, совместно разработанная Tsingmicro и BAAI, продолжает расширяться (подробности в разделе 3), описывается как «ориентированная на более чем 30 отечественных чипов, прокладывающая путь к глобальному стандарту компиляторов для 3D-чипов».
  • flagos-packaging v2026.09.20: поддерживаемый третьей стороной нативный пакетный канал FlagOS выпускается еженедельно (двойной формат APT / YUM, репозитории шести дистрибутивов, подпись GPG), параллельно с конвейером deb / rpm в build-infra.

Соревнования и сообщество

  • Конкурс по оптимизации пропускной способности вывода моделей FlagOS × MiniCPM: этап разработки и подачи заявок открыт с 21.09 (до 20.11, оценка в декабре), задачи охватывают два класса сценариев оценки: 4k / 16k.
  • Конкурс оптимизации операторов SGLang для кросс-чиповых решений: результаты конкурса продолжают поступать в основной репозиторий в виде PR (тройное слияние MoE router на этой неделе — его продолжение).
  • Конференция по открытым вычислениям с ИИ 2026 и техническая конференция Zhongzhi FlagOS: 17–18 октября в Пекине, регистрация продолжается; темы воркшопов (KernelGen, edge-устройства, TLE Attention, FlagScale-Agent) соответствуют инженерным наблюдениям этой недели.

Новостной фон и внешние каналы

  • Шестнадцатое–двадцатое подряд спокойное окно новостного поиска по компонентам: в течение всех пяти окон недели поиск на китайском и английском по названиям компонентов FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen и др. дал нулевые значимые результаты; прирост внешней информации сосредоточен на членах организации и узловых мероприятиях (AICC2026, Yunqi, выставка цифровой торговли).
  • Пояснение о границах отбора: биржевые сводки, букмекерский SEO и общий контент аналитических центров не учитывались; чисто капитальные тенденции учтены только как фон.

6. Наблюдения за трендами

  • Дисциплина релиза завершила эволюцию «трёхуровневой заморозки»: в течение одной недели последовательно выполнены заморозка релизных артефактов после заморозки кода (пакетная регистрация тегов в репозитории, закрытие списка rc2), заморозка объёма и деклараций (аудит объёма FEP, сохранённые пункты ограничены только проверенными конфигурациями); переход от «человек смотрит список» к «статус выводим, доказательства прикрепляемы». За 3 дня до GA не гонятся за новыми функциями, риски сосредоточены на «устанавливается, работает правильно, описывается точно».
  • Мультичиповая матрица продолжает расширяться перед GA, путь подключения уже стандартизирован: Biren, Xiwang на этой неделе впервые появились на стороне кода, образовав изоморфный путь с Tsingmicro, Damo Academy XuanTie, Iluvatar CoreX и другими — «библиотека операторов + плагин инференса + метка компиляторной платформы» выходят в линию в один день; платформенные варианты FlagTree 0.7.0 расширились до более чем десяти, платформенные метки официально включены в систему версий. «Вендорская специализация» больше не существует вне основной линии, а является частью релизных артефактов.
  • Формы дистрибуции стали многоканальными: помимо контейнерных образов, предкомпилированные wheel (с device bitcode), noarch deb / rpm, нативные пакеты apt / dnf — три канала параллельно (FEP-0019 Wave 1 в процессе внедрения); «проверяемость» релизных артефактов (портал, снимки, построчная запись, примечания к пиновке версий, вендор-нейтральные имена) становится поверхностью поставки, столь же важной, как и функциональность.
  • Библиотека операторов переходит от «расширения» к «приёмке и тюнингу»: пакет длинного хвоста KernelGen (около 60 операторов) и пакет оптимизации 31 оператора Kunlunxin (27/31 соответствуют норме) идут параллельно; «сравнительная реализация одного оператора на нескольких платформах» и «пакетные исправления для одной платформы» становятся штатным режимом работы; тестовая инфраструктура одновременно платформизируется (миграция klx-p800, рабочие процессы mthreads3.6 / hcu3.6, сравнительное тестирование FP8 на шести бэкендах). Работы по производительности после заморозки функций концентрированно высвобождаются перед GA.
  • Неосновные компоненты живут своим ритмом, цикл 2.3 запущен досрочно: FlagQuantum в двухнедельном окне стартовал с 30+ коммитов, FlagSparse и внешние партнёры активно сливаются, FlagFFT завершил новый бэкенд + упаковку, FlagTrain получил первую партию операторов; на следующий день после регистрации официального тега основная линия разработки поднялась до 0.4.0 — фактическое расхождение между поставкой 2.2 и разработкой 2.3 уже произошло (новые направления — квантовые вычисления, 3D-вычисления и другие — официально отделены от границ 2.2).
  • Отраслевой нарратив синхронизирован с ритмом кода: в сезон конференций высокоплотно высвобождается нарратив «единый программный стек / разнородные вычисления» (AICC2026, Yunqi, SAIL, Loongson, Open3D-PIMC), что взаимно подтверждается завершающими действиями на стороне кода; членские организации одновременно делают ходы как в обучении (RLinf × S5000), так и в инференсе (Protenix-v2, адаптация Day 0). Следующий пик освещения ожидается в окне релиза GA 09-28.

Приложение: материалы и верификация

— https://github.com/flagos-ai/FlagSparse/pull/90 · FlagFFT — https://github.com/flagos-ai/FlagFFT/commits/dev