보고 기간: 2026년 9월 21일(월) ~ 9월 25일(금), 총 5 영업일 자료 출처: 본지의 일일 FlagOS 동향 리포트(09-21, 09-22, 09-23, 09-24, 09-25 다섯 기간, 모니터링 기간이 일별로 연결되며 공백 없음). 모든 항목은 해당 기간에 이미 검증된 출처에서 나왔으며, 편성 시 GitHub를 통해 추가 검증 및 보완함 편성 설명: 이번 주는 FlagOS 2.2 GA(09-28) 전 마지막 완전한 영업주로, 주요 흐름은 릴리스 마감——’태그, 목록, 범위’ 3계층 검증이 연이어 완료됨; 동시에 컴포넌트 및 코드 공동 구축, 신규 칩 파트너 참여, 회원 기관 및 생태계 네 가지 차원을 포괄함. 다섯 기간 일일 리포트 모니터링 기간 커밋 적중 합계 916건(163 / 224 / 143 / 211 / 175), 각 기간별 활성 저장소 22 / 19 / 24 / 23 / 24개, 합계 org 내 약 30개 저장소를 포괄함


1. 이번 주 주요 뉴스

  • 2.2 릴리스 동결: 10개 컴포넌트 정식 버전 태그 일괄 저장소 반영 (09-24): 09-24 새벽 01:49 ~ 01:50, 10개 L1 모듈의 정식 버전 태그(순수 버전 번호, rc / post 접미사 없음)가 일괄 생성됨——flaggems v5.4.0, flagfft v0.2.0, flagsparse v0.3.0, flagdnn v0.3.0, flagblas v0.3.0, flagtensor v0.3.0, flagaudio v0.3.0, flagattention v0.4.0, flaggems-vllm v0.2.0, flaggems-sglang v0.1.0; 각 태그는 해당 모듈 rc2 브랜치 HEAD에 생성되었고 건별로 재확인되었으며, 연동 PR(community #114)이 “공식 태그 ← rc2 기준선” 매핑을 공식 목록에 추가했고 작성 시점 기준 심사 중.
  • rc2 채널 마감 + 범위 감사 착수 (09-24): community #113이 rc2 목록 13개 모듈을 최신 검증된 post 태그(flaggems rc2.post4 등)로 일괄 bump했고, rc2 안정화 기간은 일정대로 09-24 마감, 이후 hotfix만 접수; 같은 날 community #115가 “2.2 FEP 범위 감사”를 개설——18개 Implemented FEP 유지, FEP 0019 / 0069 / 0081 / 0084 / 0093 / 0100 여섯 항목은 2.3으로 연기, 유지 항목은 “구현된 인터페이스 + 검증된 구성”으로 한정. 릴리스 검증이 “코드 동결” “릴리스 동결”에서 “범위와 선언 동결”로 진전.
  • 릴리스 정보 포털 재구축, 플랫폼 매트릭스 빠르게 밀도 상승 (09-22 ~ 09-25): Release Info 포털 09-23 재구축(20개 플랫폼 행 base / runtime + vLLM 두 세트 매트릭스 + Megatron + sglang 애플리케이션 이미지); Megatron 애플리케이션 이미지 2.2.0-0.2.3이 14개 플랫폼 행 커버, megatron_rl 매트릭스 차단 해제 및 전체 18개 백엔드 개방; sglang 애플리케이션 페이지 하룻밤 7연속 릴리스(Kunlunxin / Ascend / Enflame / Hygon / Moore Threads / Iluvatar CoreX / generic 7개 플랫폼), Damo Academy XuanTie thead-ppu2.1.0 애플리케이션 페이지 같은 날 포털 진입.
  • 신규 칩 파트너 집중 접속 (09-24 ~ 09-25): Biren SUPA 백엔드가 “FlagGems 연산자 라이브러리 + vllm-plugin-FL 추론 플러그인” 2계층으로 같은 날 진입(#6367 / #530); Sunrise가 PTPU 0.2.1 패치 세트를 vLLM 0.24 메인라인에 이식(#555); Tsingmicro FlagTree 플랫폼 태그 완비——”연산자 라이브러리 + 추론 플러그인 + 컴파일러” 3계층 동형 접속이 외부 칩의 FlagOS 진입 표준 경로로 자리잡음.
  • FlagFFT Hygon 백엔드 보완, 단일 기간 102건 3개 라인 횡단 (09-21 ~ 09-22): Hygon BW1000(HCU) 어댑터 dev 진입, README 백엔드 목록 CUDA / MUSA / PPU / IX / MACA / NPU / HCU 7개로 확대; 같은 기간 MACA(MetaX) 성능 마감과 NPU(Ascend) Stockham 배치 병행, 패키징 3종 세트(#12 / #18 / #22) 동시 병합——신규 백엔드 + 성능 마감 + 배포 패키징 세 가지가 같은 기간에 완료.
  • Damo Academy XuanTie 2개 라인 추진: Zhenwu V900 릴리스 + PPU FlagOS 매트릭스 진입 (09-22 ~ 09-25): Apsara Conference(09-22)에서 차세대 학습·추론 통합 AI 칩 Zhenwu V900 발표(216GB 메모리, 칩간 인터커넥트 1200GB/s, 네이티브 FP8 / FP4, 단일 칩 성능 전 세대 M890 대비 3배, 2027년 Q1 양산); 소프트웨어 측면에서 PPU가 실제 위상으로 빌드와 애플리케이션 매트릭스에 진입——FlagTree 0.7.0+ppu3.6 태그, sglang thead-ppu 애플리케이션 페이지, TE-FL PPU CI; SAIL 소프트웨어 스택 오픈소스 확대 발표, GitHub 개발 브랜치가 연구개발 메인라인으로 전환.
  • 910C 강화학습 파이프라인 엔드투엔드 준비 완료 (09-24 ~ 09-25): Ascend 910C 두 가지 구성(CANN 9.0.0 + torch 2.10 / CANN 8.5.0 + torch 2.9)이 단일 단계 설치로 megatron-core[rl] GRPO 엔드투엔드 검증 완료(종료 코드 0), wheel 내장 packed_seq 게이팅 등 3건 RL 수정 포함; 연동하여 Ascend-Docker-Runtime으로 인한 NPU 비가시 문제 해결——2.2의 RL 시나리오 Ascend 선언에 재현 가능한 증거 체인 제공.
  • 산업과 생태계 이벤트 집중 (09-21 ~ 09-25): AICC2026 베이징 개최(FlagOS 2건 발표, “신뢰할 수 있는 AI” 평가 체계 20여 개 기관 출범); MetaX MXMACA가 “업스트림 우선”으로 LMCache 메인라인 병합, 39개 주류 모델 Day 0 적응 공식 발표; Moore Threads RLinf 공식 CI에 MTT S5000 접속, Protenix-v2 전 파이프라인 추론 약 26% 가속; Loongson 가속 컴퓨팅 플랫폼 첫 버전 릴리스; Open3D-PIMC 보도 매트릭스 Sina Finance로 확대.

2. 버전 및 릴리스 동향

RC 주기와 GA 마일스톤

  • 일정: rc2 안정화 기간은 09-24 마감(이후에는 hotfix만 수용), GA Go/No-Go는 2026-09-28로 확정, 릴리스 추적 issue(community #47)와 milestone의 만료일은 모두 09-28.
  • rc2 채널 최종 전면 정렬(09-24 00:42, community #113): 13개 모듈이 rc2 브랜치 HEAD의 최신 검증 완료 태그로 bump — flaggems rc2.post4, flagfft / flagdnn / flagblas / flagtensor / flagaudio rc2.post2(내용은 Debian / RPM 패키징과 Nexus 릴리스 체인, FlagAudio 게인 항등 수정), flagtree 3개 라인 0.7.0rc2.post2, vllm-plugin-fl 2개 라인 post3, transformerengine-fl post2, flagscale post2.
  • 공식 목록의 단계적 반영: 09-22 community #111에서 첫 항목 sglang-plugin-fl v0.2.0을 수록(rc2 기준 HEAD 1c84db7, 파일 헤더에 「공식 태그는 일괄적으로 순수 버전 번호, FlagTree는 예외」라는 버전 규범을 명시), 09-24 #114에서 L1 10개 컴포넌트 매핑(flaggems v5.4.0 ← post4, flagattention v0.4.0 ← post1 등)을 추가 반영, 작성 시점 기준 해당 PR은 여전히 리뷰 중.
  • 범위 축소와 감사: FEP-0085는 GEMM+ReduceScatter를 2.2 범위에서 제외(community #112, 09-24, 「테스트 증거 + 문서 개정」 체인으로 반영), 범위 감사 PR #115는 「18개 유지 / 6개 2.3으로 연기」라는 납품 경계를 확립하고 「근거 없는 완료 / 성능 선언」 삭제를 요구.
  • 개발 메인라인 승격: 공식 태그 반영 다음 날 FlagSparse main이 0.4.0으로, FlagAudio 버전 라인이 0.4.0으로 교정, FlagAttention도 동시에 버전 업데이트를 수행 — 2.2 릴리스물(rc2 기준 + 공식 태그)과 개발 메인라인(0.4.0 계열)이 공식적으로 분기되어, 2.3 개발 주기가 사실상 시작됨.

컴포넌트 tag 및 Release 목록(모니터링 기간 내)

  • 공식 태그(L1 10개): flaggems v5.4.0, flagfft v0.2.0, flagsparse v0.3.0, flagdnn v0.3.0, flagblas v0.3.0, flagtensor v0.3.0, flagaudio v0.3.0, flagattention v0.4.0, flaggems-vllm v0.2.0, flaggems-sglang v0.1.0(09-24).
  • FlagTree: 0.7.0 계열 대량 생성 및 지속 확장 — 메인라인 3개 라인 0.7.0+triton3.6 / +triton3.5 / +triton3.3, 플랫폼 변형 +mthreads3.6, +ppu3.6, +xpu3.6, +tsingmicro3.6 / +tsingmicro3.3, +ascend3.5, +iluvatar3.6, +metax3.6, +tileir3.6, +hcu3.6 등 10여 개(09-23 ~ 09-25) — 플랫폼화 태그가 「메인라인」에서 「벤더 특화」로 확대되어 공식적으로 버전 체계에 편입됨.
  • FlagCX: v0.14.0-rc2.post2 릴리스(09-21 22:11) — Tsingmicro TSM의 torch_txda 라이브러리 디렉터리 해석 수정, TSM 런타임 이미지 링크 실패 문제 해결.
  • 기타 태그 라인: FlagScale v2.1.0-rc2(09-23 main에서 추출)와 v2.1.0-rc2.post2, vllm-plugin-FL 0.3.0-rc2 브랜치(tsingmicro txda의 0.24.0 적응 포함), sglang-plugin-FL v0.2.0(공식 목록 첫 항목).

이미지 및 아티팩트 상태

  • 애플리케이션 이미지 매트릭스: Megatron 애플리케이션 이미지 2.2.0-0.2.3가 14개 플랫폼 행에 집중 등록(nvidia-cuda12.8 / 13.3, ascend-cann8.5.0 / 9.0.0, cambricon-neuware4.4.3 / 4.7.2, enflame-tops1.9.10 / 1.10.6, hygon-dtk26.04, iluvatar-corex4.4.0 / 4.5.0, metax-maca3.8.1.3, mthreads-musa4.3.6 / 5.2.0); megatron_rl 애플리케이션 행은 블로킹 해제되어 전체 18개 백엔드에 개방(09-23, build-infra #1057).
  • vLLM 라인: 0.20.2 라인이 20/20 백엔드 온보딩 검증 스냅샷을 완료, 세 백엔드가 FlagTree 0.7.0rc2에 올라갈 수 없는 이유 공개(MetaX tl.dot ICE, Enflame 구 툴체인의 enable_i64 거부, cuda13.3이 libcudart.so.12에 의존, 각각 0.6.x 대조 및 핀 버전 기록 포함); 0.24.0 라인 2.2.0-0.3.0rc2.post2 기록 회신.
  • sglang 라인: 7개 플랫폼 애플리케이션 페이지 단일 야간 연속 게시(kunlunxin-xre5.37.1, ascend-cann8.5.0, enflame-tops1.10.6, hygon-dtk26.04 듀얼 페이지, mthreads-musa4.3.5, iluvatar-corex4.5.0, generic-c13.0), thead-ppu2.1.0은 공식 컴포넌트 태그로 업데이트(09-25); 애플리케이션 계층 릴리스물도 벤더 중립 명명으로 동시 변경.
  • 릴리스 포털과 빌드 연동: Release Info 포털 재구축(09-23, 20개 플랫폼 행 base / runtime 및 vLLM / Megatron / sglang 애플리케이션 매트릭스 포함); build-infra가 빌드 매트릭스 FlagGems 버전을 5.4.0으로 상향(09-24, 정식 태그와 연동, 약 7시간 후 병합, 「태그 → 빌드」 순서의 표준 사례).
  • 배포 채널 다중 트랙화: FlagCX wheel 채널이 파일럿에서 전체 행으로 확대되고 Kunlunxin에 적용(사전 컴파일 wheel에 디바이스 bitcode 포함); noarch deb / rpm 통합 릴리스 채널이 각 패키징 컴포넌트를 커버(FEP-0019 Wave 1); 서드파티 채널 flagos-packaging이 v2026.09.20 릴리스(apt / dnf 이중 포맷, 6개 배포판 repo, GPG 서명).

3. 컴포넌트와 코드 공동 구축

이번 주 org 내 5개 모니터링 기간 커밋 수는 163 / 224 / 143 / 211 / 175건으로, 합계 약 916건이며, 이하 모듈별로 집계한다.

연산자와 도메인 라이브러리(FlagGems 및 각 도메인 라이브러리)

  • FlagGems(메인라인, 이번 주 첫 번째 라인): 5개 기간 모니터링 창 커밋 수 34 / 29 / 28 / 59 / 46건. 세 가지 생산 라인이 병행: KernelGen 대량 저장소 등록(한 주에 Nvidia 롱테일 연산자 약 60개 주입, inverse, _gather_sparse_backward, msort, linalg_inv_ex, _ctc_loss 계열, _cudnn 계열, histogramdd, _scaled_grouped_mm_v2 등 포함); Kunlunxin 정비 배치(31개 연산자 최적화 배치 일괄 등록, 27/31이 0.8x 성능 라인 도달, 추가로 약 20건의 XPU 수정 배치가 FlashAttention 고속 경로, scaled_mm 호스트 고속 경로, 컨볼루션 계열 및 특수 함수를 커버, 테스트 머신은 klx-p800으로 이전); TLE 멀티 백엔드 확산(Ascend glu는 tle.dsa.extract_slice 사용, Iluvatar는 vendor descriptor에서 TLE 활성화, Hygon W8A8 파이프라인은 화이트리스트 제한으로 인해 분할 tl.range로 재작성, 48시간 내 TLE가 네 개 백엔드에 진입).
  • 양자화 및 튜닝: Hygon fused_inv_rope_fp8_quant(DeepSeek-V4 어텐션 경로 「역 RoPE + FP8 그룹 양자화」 융합), Hygon INT8 RMSNorm 등록; MetaX topk_w8a16_fp8; Moore Threads index_add / polar 최적화; 6개 백엔드 FP8 테스트 보완(NVIDIA / Ascend / Hygon / XuanTie / MetaX / Iluvatar); FlagTune 비용 모델이 Hopper, MetaX MM, Damo Academy XuanTie ZW810E(v1.1.0 심사 중)로 확장, FP8 MM 로컬 튜닝 활성화.
  • 플랫폼 수정 배치: Ascend(apply_rotary_pos_emb cos/sin 중복, batched linalg_solve_triangular 오류 결과, log_ 그리드 padding); Iluvatar(linalg_solve_triangular TLE 경로 비활성화, index_reduce_); Hygon(complex 스칼라 곱); MetaX(masked_fill 범위 초과); Kunlunxin(special_bessel_y1 / softplus / weight_norm 배치).
  • 엔지니어링 품질: 연산자 등록 경로 실패 수정, 벤치마크 reference-only 기준선 검증, 후보 사전 사전 검사 및 프로세스 내 profiling 훅, 주간 백엔드 컨테이너 이미지 업데이트; SiliconFlow 지속 기여(_scaled_grouped_mm 크로스 백엔드 수정 및 튜닝, adaptive_avg_pool2d 최적화, index_reduce_ 3개 플랫폼 수정).
  • FlagFFT: Hygon HCU 어댑터(상세는 주요 뉴스 참조); MACA 라인 「1d single」 측정 전략 기본값 전환, FP64 레지스터 교환 실험이 당일 시도 후 철회; 패키징 3종 세트(Debian + RPM, Nexus 릴리스, 0.2.0-rc2 포팅); JIT 산출물 크로스 프로세스 격리 및 다중 프로세스 회귀 테스트.
  • FlagSparse: NCIC-AlphaSparse 협업이 고빈도 단계에 진입(한 주 6건 배치 병합: MACA SpMV CSR 기준선, DCU SpMM COO 최적화, ASCEND 수치 디버깅, biv 알고리즘 추가, MUSA 전달 수정); v0.3.0 정식 태그 이후 main이 0.4.0으로 상승; rpm 패키징 및 pip 호환성 수정.
  • FlagBLAS: Ascend L2 성능 최적화 두 배치(SPR / SPR2 / HPR / HPR2, banded packed 및 triangular, SYMV 시작 경로 간소화); Moore Threads L2 지원 병합; 외부 기여자 패키징 라인 구축.
  • FlagDNN / FlagTensor / FlagAudio / FlagAttention: FlagDNN이 Iluvatar와 Hygon 플랫폼 구현 아키텍처를 재구성, Moore Threads가 이미 컴파일된 산출물 재사용, 패키징 병합; FlagTensor 0.3.0-rc2 패키징 라인(deb / rpm, CMake Torch 탐색, Nexus 업로드); FlagAudio 첫 3개 PR 병합 후 실체화(스펙트로그램 Triton 연산자, 이득 항등 수정, openEuler 설치 폴백); FlagAttention v0.4.0 태그, 테스트 및 벤치마크 업데이트.
  • FlagTrain(신규 방향): 09-16 저장소 생성 후 첫 구현 착수 — KMCompiler가 제출한 Triton lamb 학습 연산자와 테스트 방법 병합, 「Triton으로 주류 학습 프레임워크 재사용형 학습 연산자 구현」을 지향.

컴파일러 및 통신 라이브러리(FlagTree / FlagCX / libtriton_jit)

  • FlagTree: MetaX 백엔드 전용화 리팩터링이 밤새 열 건 진행됨(TritonIR / TritonToTritonGPU / TritonGPUToLLVM 3계층 소스 전용화, 통합 CMake 진입점, Gluon 레이아웃 인터페이스); Iluvatar는 Triton v3.6.x로 동기화하고 TLE 분산 및 TLE_RAW 확장(30개 파일 대형 PR, 분산 프리미티브는 FlagCX가 지원); NVIDIA TLE에 SMEM 서브 슬라이스와 다중 작성자 TMA 파이프라인 추가; AMD 컴파일러 수정 두 건(W7900 정밀도 테스트에서 노출); CI 커버리지 확대(910B 워크플로, mthreads3.6, hcu3.6, MetaX vLLM 벤치마크, PPU pid 검증); 패키징 수정(triton 라이브러리 이름 통일 _C/libtriton.so, rpm 패키징 clang, deb PEP 440 준수 번호).
  • FlagCX: rc2.post2에서 TSM 플러그인 수정; 이기종 전송 강화 및 가속기 CI 정렬, p2p engine rpc serve 확장, barex 전송 업그레이드; rpm Requires에서 버전 없는 CANN sonames 제외; CRL 이기종 gather 집계 스케줄링을 전송 이후로 이동; PAL이 SHCA verbs ABI와 17비트 LID 지원; wheel 배포 라인(전 라인 + Kunlunxin).
  • libtriton_jit: 다중 아키텍처 스크립트 디렉터리 수정, 다중 백엔드 패키징, nlohmann-json 호환성 수정, 패키징 트리거 조건 축소——Triton JIT 런타임이 다중 백엔드 배포 형태로 수렴.

추론 및 학습 프레임워크 (FlagGems-vllm / FlagGems-sglang / Torch-FL / 플러그인 라인 / FlagScale / TE-FL / Megatron-LM-FL)

  • FlagGems-vllm(4개 플랫폼 동시): Ascend XCS 연산자 배치 진행(slot_mapping 최적화 실측 전체 서비스 1050.9 → 81.2 ms, kpool 상태 압축, lightning indexer, kv_rmsnorm_rope_cache 등); Moore Threads가 INT4 / FP8 융합 Marlin MoE와 W8A8 가변 길이 어텐션 공유; Hygon INT8 블록형 BMM과 einsum 축약; MetaX 융합 역 RoPE FP8 양자화와 persistent_topk MC550 백엔드; Damo Academy XuanTie TLE 버전 topk; Gemma RMSNorm을 한 번에 세 플랫폼에 보강; “동일 연산자 다중 플랫폼 대조 구현”이 표준 작업 모드로 자리 잡음.
  • FlagGems-sglang: 융합 MoE router 3경로 병합(Kunlunxin과 MUSA 통합, Ascend 두 버전 tensorcore 변형, Enflame tensorcore dot-acc); Enflame GCU vendor 등록(장치 조회, TLE 활성화, 휴리스틱 구성).
  • Torch-FL(엔지니어링 마무리): DCU 범위 초과 인덱스 즉시 거부, Ascend 커널을 피연산자가 있는 장치에서 실행하도록 변경, PPU가 CPU torch wheel의 CUDA 메타데이터 복원; 빌드 매트릭스를 단일 표로 수렴, GEMS_VENDOR 미인식 시 즉시 오류, 전역 Tensor.__getitem__ 패치와 MetaX 퇴역 코드 제거; 플랫폼 감지 통일 및 기능 매트릭스 문서 보강, 버전 pin을 단일 파일로 집중, 임포트 시점 부작용을 순서 있는 단계 파이프라인으로 수렴.
  • vllm-plugin-FL: vLLM 0.28 업그레이드 라인 시작(NVIDIA 측은 이미 병합, Ascend 910C 적응 #487 심사 중); Biren SUPA 백엔드 병합, Xiwang PTPU를 0.24 메인라인으로 이식, 연산자 수준 profile 도구 병합; Hygon vLLM 0.24 워크플로와 MUSA CI 정렬.
  • FlagScale / TransformerEngine-FL / Megatron-LM-FL: FlagScale은 metax 파라미터를 수정하고 v2.1.0-rc2.post2를 진행, 큐에는 MemRift 학습 압축, NPU profiler, Damo Academy XuanTie 810E 학습 CI, Hygon DCU 상태 샘플링 포함; TE-FL은 NPU 백엔드 LayerNorm과 다중 텐서 Adam 추가, MetaX vanilla TE 패키지 레이아웃 지원(rc2.post2에 포함), PPU 단위 및 통합 테스트 심사 중; Megatron-LM-FL은 벤더 백엔드 호환성과 CI 안정화, MetaX 빌드 jit_fuser가 no-op 유지로 메모리 누수 방지, Xiwang PT-PU 플랫폼 지원.

릴리스 엔지니어링과 거버넌스 (build-infra / community / docs)

  • build-infra: 버전 및 이미지 라인 외에도 이번 주에는 FlagCX wheel 채널(쿤룬신 포함), noarch deb / rpm 통합 채널, 패키징 파이프라인 분할(release path 빌드, native-rpm 개별 패키지 다운로드, 릴리스 버전 스탬프), 릴리스 CI 5중 강화(고정 버전 빌드, verify 검증, 심볼 검사, 패키지별 열거, 대상 저장소 검증), 910C RL E2E 및 NPU 가시성 수정, sglang 애플리케이션 페이지와 포털 유지보수를 완료했습니다.
  • community: 2.2 릴리스 거버넌스의 라벨 / 체크리스트 / 범위 3개 라인 작업이 모두 저장소에 반영되었습니다(#111 ~ #115). FEP 문서는 “릴리스 경계와 증거” 기준에 따라 지속적으로 개정되고 있습니다.
  • docs 및 wiki: 모델 목록 4건 업데이트(ModelScope / HuggingFace 등). FlagTree wiki 다중 플랫폼 사용자 매뉴얼이 릴리스 전 여러 차례 업데이트되었습니다.

양자, 희소 및 신흥 방향

  • FlagQuantum(이번 주 가장 빠르게 확장된 방향): 연속 두 모니터링 기간 동안 30+건(38 / 35, 다른 기간 19 / 13, 합계 100+건). 다섯 개 라인이 병행됩니다: 클라우드 QPU(Azure Quantum 스캐폴드, Quafu 작업 API), 크로스 프레임워크 실행 브리지 매트릭스가 거의 완성(Cirq, Qiskit Aer, PennyLane Lightning, Braket, CUDA-Q), 시뮬레이션 융합 가속(상태 벡터 게이트, 이중 라인 융합, 얕은 Clifford 라우팅), 검증 게이트(홀드아웃 세트 검증, 드리프트 정렬, 증거 제약 기반 시뮬레이터 선정 어드바이저), CI 재사용 및 병렬화.
  • Open3D-PIMC: 코드가 반영된 후 보도 매트릭스가 지속적으로 확대되었습니다(신화망 09-14 → 중국의 소리 09-18 → 광밍망 09-23 → 시나 파이낸스 09-24). 핵심 사실은 일관되며 새로운 기술 정보는 없습니다. FlagOS의 3D 컴퓨팅 칩 방향과 직접 관련됩니다.
  • FlagOS-Compressor: DeepSeek V4.1 및 MiMo V2.5를 대상으로 한 선형 INT8 내보내기 PR이 병합된 당일 철회되었습니다(커밋 메시지에 사유 미기재). 후속 작업은 본지 관찰 항목으로 등록되었습니다.

4. 회원 기관 및 제조사 대응

  • Zhiyuan(BAAI)(주도 기관): 2.2 릴리스 거버넌스(체크리스트 / 태그 / 범위 감사) 주도, RC2 마무리 및 FEP 릴리스 경계 정의; AICC2026 두 건의 FlagOS 발표(린융화 「아키텍처 혁신에서 사용 가능한 컴퓨팅 파워로」, 자오솨이 특별 세션) 및 「신뢰할 수 있는 AI」 평가 체계 공동 구축; Open3D-PIMC 공동 개발.
  • Hygon: FlagFFT 최초의 HCU(BW1000) 백엔드 어댑터; FlagGems의 W8A8 TLE 파이프라인 교체, fused_inv_rope_fp8_quant, INT8 RMSNorm, mv 최적화, complex 스칼라 수정; FlagSparse DCU 체크리스트 및 spv 정밀도; FlagScale DCU 하드웨어 헬스 샘플링(심사 중); FlagTree에 hcu3.6 FlagGems 베이스라인 및 테스트 워크플로 추가; sglang hygon-dtk26.04 애플리케이션 페이지 등록.
  • MetaX: MXMACA가 「업스트림 우선」 방식으로 LMCache 메인라인에 병합되고 CI 검증 메커니즘 구축; 2025년 12월 이후 39개 플래그십 모델 Day 0 적응( Qwen-Image-2.1 포함) 공식 발표; 코드 측면에서 FlagTree 전용화 리팩터링 10건, Iluvatar 외 다수 수정이 rc2.post2 내용에 포함(TE-FL 레이아웃, jit_fuser, persistent_topk), topk_w8a16_fp8, MetaX vLLM 벤치마크 CI 편입, 0.7.0+metax3.6 태그.
  • Moore Threads: RLinf 공식 CI가 0.3 버전부터 MTT S5000 연동(학습 곡선 상관계수 0.976, 전체 스텝 소요 시간 26% 감소, 유휴율 18.5% → 3.1%); Protenix-v2 전链路 추론이 국제 주류 GPU 대비 평균 약 26% 속도 향상, 3대 AI4S 시나리오 클로즈드 루프 완성; W8A8 가변 길이 어텐션 및 공유 INT4 / FP8 융합 Marlin MoE; AICC2026 발표 및 「신뢰할 수 있는 AI」 공동 구축 참여.
  • Ascend: XCS 연산자 배치(slot_mapping / kpool / indexer 계열) 및 910B FlagGems 베이스라인 워크플로; 910C 이중 구성 RL 엔드투엔드 통과, NPU 가시성 수정; grouped_matmul 연산자 목록 편입, rrelu_with_noise, cat/concat 디스패치 개선; vLLM 0.28 적응 심사 중; TE-FL NPU 백엔드 보완; 다중 행 이미지 등록 및 sglang 애플리케이션 페이지.
  • Enflame: FlagGems-sglang에 GCU vendor 등록 및 tensorcore dot-acc 융합 router; megatron 애플리케이션 이미지 행 등록; 플러그인 0.24 라인 후속.
  • Iluvatar CoreX: Iluvatar 백엔드 Triton v3.6.x 동기화 및 TLE 분산 활성화; wheel을 Ubuntu 22.04에서 재빌드하고 빌더 릴리스; solve_triangular TLE 경로 비활성화; corex4.4.0 / 4.5.0 두 행 이미지 등록.
  • Kunlunxin: 31개 연산자 최적화 배치(27/31 목표 달성) 및 약 20건 XPU 수정 배치; 테스트 머신 klx-p800으로 이전; sglang kunlunxin-xre5.37.1 애플리케이션 페이지; FlagCX wheel Kunlunxin 적용.
  • Tsingmicro: KernelGen 2.2.0에 신규 하드웨어로 등재; FlagCX rc2.post2에서 TSM torch 플러그인 수정; FlagTree +tsingmicro3.6 / +tsingmicro3.3 태그; AICC2026 「Open3D-PIMC」 발표 및 포털 행 업데이트.
  • Damo Academy T-Head: Zhenwu V900 릴리스(PPU 차세대); PPU가 FlagOS 빌드 및 애플리케이션 매트릭스에 진입(0.7.0+ppu3.6, sglang thead-ppu 애플리케이션 페이지, TE-FL PPU CI, FlagTree PPU pid 검증); ZW810E FlagTune 비용 모델 v1.1.0 심사 중; SAIL 소프트웨어 스택 오픈소스 확대, GitHub 개발 브랜치가 연구개발 메인라인이 될 예정.
  • Biren 및 Xiwang(신규 파트너): Biren SUPA 백엔드 이중 레이어 당일 동시 진입(연산자 라이브러리 + 추론 플러그인); Xiwang PTPU 패치셋을 vLLM 0.24 메인라인에 이식(Qwen3.6 27B / 35B-A3B 정상 구동).
  • Cambricon: megatron 애플리케이션 이미지 2.2.0-0.2.3이 neuware4.4.3 / 4.7.2 두 행에 등록.

5. 생태계와 커뮤니티

회의 및 산업 이벤트

  • AICC2026(09-21, 베이징): 제7회 인공지능 컴퓨팅 콘퍼런스 — Zhiyuan 부원장 겸 수석 엔지니어 Lin Yonghua가 「아키텍처 혁신에서 가용 연산력까지: FlagOS가 이끄는 AI 컴퓨팅의 소프트웨어-하드웨어 협동 신패러다임」 보고를 발표; Zhiyuan 연구원 Zhao Shuai가 「중즈 FlagOS: 개방형 소프트웨어 스택으로 다원적 AI 연산력 가치 실현」 보고를 발표; 회의에서 「신뢰 가능한 AI」 평가 워킹그룹을 출범하고 평가 체계를 발표(공업정보화부 전자제5연구소가 Zhiyuan, Inspur, Moore Threads, MetaX 등 20여 개 기관과 공동); IDC는 2026년 중국 지능형 연산력 규모가 2576.5 EFLOPS(전년 대비 +87.9%)에 달할 것으로 전망.
  • 윈치 콘퍼런스(09-22, 항저우): Damo Academy XuanTie가 Zhenwu V900을 발표(상세 내용은 주요 뉴스 참조); Zhenwu J900(2028년 3월)과 Yitian 720 / 730 서버 CPU(2027년)를 예고.
  • 국산 연산력 소프트웨어 스택 동향: Loongson Technology가 「Loongson 가속 컴퓨팅 플랫폼」 첫 소프트웨어 버전을 발표(LG200 시리즈 GPU 기반, 드라이버, 컴파일러, 런타임, 연산자 라이브러리, 추론 엔진을 포괄하며 OpenCL 3.0과 CUDA 마이그레이션 지원); 제5회 글로벌 디지털 트레이드 엑스포가 09-23 항저우에서 개막(집적회로 응용 생태 섹션을 최초로 설치, MetaX 등 참가).
  • SAIL 오픈소스 진전(09-23): Damo Academy XuanTie 소프트웨어 생태 시니어 디렉터 Lu Shenghua가 공개 — 39개의 저정밀도 양자화 모델을 이미 오픈소스화(다운로드 34.8만 회 초과), SAIL이 260여 개 프레임워크에 적응, 주류 추론 프레임워크 평균 적응 시간 7일 미만, Zhenwu 시리즈가 이미 650개 이상 기업 고객에 서비스 제공.

오픈소스 릴리스 및 보도 매트릭스

  • Open3D-PIMC: Qingwei Intelligent와 Zhiyuan이 공동 개발한 오픈소스 보도 매트릭스가 지속 확대(상세 내용은 제3절 참조), 「30여 종 국산 칩을 대상으로 3D 칩 컴파일러 글로벌 표준을 개척」으로 묘사.
  • flagos-packaging v2026.09.20: 서드파티가 유지 관리하는 FlagOS 네이티브 패키지 채널 주간 릴리스 발표(APT / YUM 이중 형식, 6개 배포판 repo, GPG 서명), build-infra의 deb / rpm 파이프라인과 병행 추진.

대회 및 커뮤니티

  • FlagOS × MiniCPM 모델 추론 처리량 성능 최적화 챌린지: 개발 및 제출 단계가 09-21부터 개방(11-20까지, 12월 심사), 대회 과제는 4k / 16k 두 가지 평가 시나리오를 포괄.
  • SGLang 크로스칩 연산자 최적화 대회: 대회 성과가 지속적으로 PR 형태로 메인 저장소에 진입(이번 주 MoE router 삼중 병합이 그 연장선).
  • 2026 인공지능 개방 컴퓨팅 콘퍼런스 겸 중즈 FlagOS 기술 콘퍼런스: 10월 17일~18일 베이징에서 개최, 참가 신청 진행 중; 워크숍 주제(KernelGen, 온디바이스, TLE Attention, FlagScale-Agent)가 이번 주 엔지니어링 관찰과 일대일로 대응.

뉴스 면과 외부 채널

  • 컴포넌트급 뉴스 검색 연속 열여섯 번째~스무 번째 평온한 윈도: 다섯 기간 윈도 전체에서 FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen 등 컴포넌트명에 대한 중영문 검색 모두 유효 적중 0건; 대외 정보 증분은 회원 단위와 회의 노드(AICC2026, 윈치, 디지털 트레이드 엑스포)에 집중.
  • 수집 경계 설명: 주식 시세 기사, 도박 SEO 및 싱크탱크 범용 콘텐츠는 집계하지 않음; 순수 자본 면 동향은 배경 기록으로만 반영.

6. 트렌드 관찰

  • 릴리스 규율, ‘3계층 동결’ 진화 완성: 일주일 안에 코드 동결 후 릴리스물 동결(태그 일괄 저장, rc2 목록 마감), 범위와 선언 동결(FEP 범위 감사, 보류 항목은 검증된 구성으로만 제한)을 순차적으로 완료; ‘사람이 목록을 보는’ 방식에서 ‘상태를 도출할 수 있고 증거를 연결할 수 있는’ 방식으로 전환. GA 전 3일 동안 신규 기능을 쫓지 않으며, 리스크는 ‘설치되고, 올바르게 실행되고, 정확하게 설명되는가’에 집중된다.
  • 멀티칩 매트릭스, GA 전 계속 확장, 연동 경로 이미 표준화: Biren, Xiwang이 이번 주 처음으로 코드 측에 등장, Qingwei, Damo Academy XuanTie, Iluvatar CoreX 등과 동형 경로를 형성 — ‘연산자 라이브러리 + 추론 플러그인 + 컴파일러 플랫폼 태그’ 3계층이 같은 날 진입; FlagTree 0.7.0 플랫폼 변형이 십여 개로 확대, 플랫폼화 태그가 공식적으로 버전 체계에 편입. ‘벤더 특화’는 더 이상 메인라인 밖에 떠돌지 않고 릴리스물의 일부가 된다.
  • 배포 형태, 다중 트랙화 완성: 컨테이너 이미지 외에 사전 컴파일 wheel(디바이스 bitcode 포함), noarch deb / rpm, apt / dnf 네이티브 패키지 3트랙 병행(FEP-0019 Wave 1 진행 중); 릴리스물의 ‘검증 가능성’(포털, 스냅샷, 행별 기록, 고정 버전 설명, 벤더 중립 명명)이 기능과 동등하게 중요한 딜리버리 영역이 된다.
  • 연산자 라이브러리, ‘확장’에서 ‘검수와 튜닝’으로 전환: KernelGen 롱테일 배치(약 60개)와 Kunlunxin 31 연산자 최적화 배치(27/31 목표 달성) 병행; ‘동일 연산자 다중 플랫폼 대조 구현’, ‘동일 플랫폼 배치 수정 배치’가 일상적 작업 모드로 자리 잡음; 테스트 인프라도 동시에 플랫폼화(klx-p800 마이그레이션, mthreads3.6 / hcu3.6 워크플로, 6백엔드 FP8 대조 테스트). 기능 동결 후 성능 작업이 GA 전에 집중적으로 풀린다.
  • 비메인라인 컴포넌트, 자체 리듬으로 2.3 주기 조기 시작: FlagQuantum 2주 모니터링 기간 30+ 건 출발, FlagSparse 외부 협력사와 고빈도 합류, FlagFFT 신규 백엔드 + 패키징 완료, FlagTrain 첫 연산자 배치; 정식 태그 저장 다음 날 개발 메인라인이 곧바로 0.4.0으로 상승 — 2.2 딜리버리와 2.3 개발의 사실상 분기가 이미 발생(양자, 3D 컴퓨팅 파워 등 신규 방향이 2.2 경계와 공식적으로 분리).
  • 산업 서사와 코드 리듬 동기화: 컨퍼런스 시즌 ‘통합 소프트웨어 스택 / 다원 컴퓨팅 파워’ 서사가 고밀도로 방출(AICC2026, Yunqi, SAIL, Loongson, Open3D-PIMC), 코드 측의 마감 동작과 상호 입증; 회원사들이 학습(RLinf × S5000)과 추론(Protenix-v2, Day 0 적응) 양측에서 동시에 착수. 다음 보도 피크는 09-28 GA 릴리스 윈도우로 예상된다.

부록: 소재와 검증

— https://github.com/flagos-ai/FlagSparse/pull/90 · FlagFFT — https://github.com/flagos-ai/FlagFFT/commits/dev