모니터링 기간: 2026-09-21 10:18 ~ 2026-09-22 10:00 (약 24시간; 09-21 데일리 리포트 기간을 이어받음, 공백 없음) 출처: GitHub (org: flagos-ai, 54개 저장소 pushed_at 전수 점검, 기간 내 19개 저장소에 푸시 발생; 커밋 검색 224건 적중, 15개 저장소에 걸침), Google News RSS (중영문 24개 쿼리어, 프록시 경유), MetaX 공식 홈페이지, Jiemian News, Guandian Net, Zhiyuan Community 등 (상세 내용은 부록 출처 목록 참조)


이번 호 인덱스

  • 오늘의 중점: FlagFFT, Hygon 백엔드 보완——BW1000 (HCU) 어댑터 dev 진입, 단일 모니터링 기간 102건 커밋이 MACA/Ascend/HCU 3개 라인에 걸침 (09-21/09-22)
      1. 오픈소스 프로젝트 진행 (GitHub 동향)
        • 1.1 FlagFFT: HCU 어댑터 착륙, MACA/Ascend 성능 및 증거 마무리, 패키징 3종 세트 병합 (09-21/09-22)
        • 1.2 build-infra: FlagCX wheel 채널 6연속 병합, Kunlunxin 배포 심사 중; 순수 Python 컴포넌트 통합 릴리스 채널 (09-21/09-22)
        • 1.3 FlagCX: v0.14.0-rc2.post2 릴리스——Qingwei TSM torch 플러그인 링크 수정 (09-21)
        • 1.4 FlagGems-vllm: Biren SUPA 백엔드 병합; Ascend XCS 연산자 배치 및 6개 플랫폼 topk 튜닝 (09-21/09-22)
        • 1.5 FlagGems: KernelGen, Nvidia 연산자 재입고; Kunlunxin 수정 배치; Hygon W8A8 TLE 파이프라인 교체 (09-21/09-22)
        • 1.6 FlagTree: Iluvatar TLE 분산 및 TLE_RAW; NVIDIA TLE SMEM 서브 슬라이스 (09-21/09-22)
        • 1.7 기타 동향: FlagTensor 0.3.0-rc2 패키징 라인, FlagQuantum 상호운용, FlagSparse, FlagAudio, FlagOS-Compressor 등 (09-21)
    1. 뉴스 보도와 생태계
      • 2.1 컴포넌트 수준 검색, 연속 열일곱 번째 조용한 모니터링 기간 (09-21/09-22)
      • 2.2 MetaX MXMACA, LMCache 메인라인에 병합: 회원사 소프트웨어 스택의 ‘업스트림 우선’ 글로벌 추론 생태계 융합 (09-18/09-21)
      • 2.3 Jiemian News, MetaX 39개 Day 0 적응 집중 조명: 중국산 GPU ‘소프트웨어-하드웨어 일체형’ 생태계 서사 (09-21)
    1. 회원사 심층 분석
      • 3.1 MetaX: MACA 라인 3개 저장소 마무리 (FFT / 컴파일러 / 학습 도구) (09-21/09-22)
      • 3.2 Hygon: FlagFFT HCU 어댑터와 FlagGems W8A8 TLE 교체 (09-21/09-22)
      • 3.3 Ascend: XCS 연산자 배치와 NPU FFT 최적화, 910C vLLM 0.28 업그레이드 심사 중 (09-21/09-22)
      • 3.4 Iluvatar CoreX: Iluvatar TLE 분산 병합 (09-22)
      • 3.5 Moore Threads: index_add/polar 최적화 병합, 다수 연산자 PR 심사 중 (09-21/09-22)
      • 3.6 Enflame: FlagGems-sglang, GCU vendor 등록 (09-21)
      • 3.7 Qingwei Intelligent: FlagCX rc2.post2, TSM torch 플러그인 수정 (09-21)
      • 3.8 Damo Academy XuanTie: PPU 융합 연산자 병합과 PPU CI 검증 (09-21)
    1. 요약 및 트렌드 관찰
  • 부록: 출처 점검표
  • 전체 출처 목록

오늘의 중점: FlagFFT, Hygon 백엔드 보완——BW1000 (HCU) 어댑터 dev 진입, 단일 모니터링 기간 102건 커밋이 3개 라인에 걸침

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagFFT 커밋 기록 (dev)

09-21 심야부터 09-22 오전까지, FlagFFT (Triton/TLE와 libtriton_jit을 통해 런타임에 백엔드 대상 커널을 생성하는 JIT 컴파일 FFT 라이브러리)는 Hygon BW1000 (HCU) 백엔드 어댑터를 dev 브랜치에 병합했다. “Add HCU backend adaptor for BW1000” (09-21 22:39)로 시작하여, 이어서 hipFFT 핸들 변환 수정 (22:55), 독립 capture의 Torch HIP 링크 (23:01), 메모리 안전 원칙 (09-22 00:11)이 뒤따랐고, “Hygon BW1000 HCU 환경 구축”, “통합 HCU 테스트 빌드” 두 문서 (09-22 08:44 / 08:47)와 업스트림 패키징 병합 (08:57)으로 마무리되었다. README의 CMake 백엔드 목록은 이에 따라 CUDA / MUSA / PPU / IX / MACA / NPU / HCU 7개 항목으로 갱신되었다——Hygon이 처음으로 FFT 라이브러리의 백엔드 매트릭스에 진입했다.

같은 모니터링 기간 내 FlagFFT 단일 저장소의 커밋 수는 102건에 달했고, 다른 두 라인도 각각 무리를 이루었다. MACA(MetaX) 의 성능 마감 — FP64 레지스터 교환 실험이 당일 시도 후 철회(Revert)되었고, pack8은 리프 레이아웃으로 게이팅되었으며, 4단계와 직접 연결 혼합 기저의 공유 메모리 예산, 그리고 증거를 남긴 일련의 검수 도구가 있었다. NPU(Ascend) 는 단일 CT 최적화를 병합하고 Stockham 배치(16개 나비 단위, 패킹 실수 FFT, 제한 벡터 하향 등 약 10건 동일 배치)를 반영했다. 패킹 방향 3종 세트도 동시에 병합되었다. Debian + RPM 패키징(#12), Nexus 릴리스 채널(#19 / #20), 0.2.0-rc2 이식(#18), 그리고 nlohmann_json 하한 완화(#22) — FFT 라이브러리는 이번 모니터링 기간에 「신규 백엔드 + 성능 마감 + 배포 패키징」세 가지를 동시에 완료했다.


1. 오픈소스 프로젝트 진행 상황(GitHub 동향)

모니터링 기간 개요: org 내 54개 저장소 중 19개가 모니터링 기간에 푸시되었다. 커밋 검색 히트 224건(15개 저장소에 걸침). 그 외 FlagCX(릴리스 브랜치), docs, vllm-plugin-FL 등 저장소의 PR과 브랜치 측 푸시는 검색에 포함되지 않았다. 분포는 FlagFFT 102, FlagGems 29, FlagTensor 23, FlagQuantum 19, FlagGems-vllm 14, FlagSparse 11, build-infra 7, FlagTree 5, FlagAudio 5, FlagOS-Compressor 3, FlagGems-sglang 2, FlagPrism / FlagDNN / FlagBLAS / FlagScale 각 1.

이번 모니터링 기간의 형태 = 「FFT 라이브러리 다중 백엔드 스프린트」+「릴리스 엔지니어링 마감」+「백엔드 진영 확장」: FlagFFT가 커밋량의 절반 가까이를 차지했으며(「오늘의 중점」참조), build-infra는 FlagCX wheel과 순수 Python 컴포넌트 배포 채널을 자리 잡게 했고, 플러그인 측은 같은 날 Biren SUPA와 Enflame GCU 두 백엔드 포인트를 추가로 지정했다.

1.1 FlagFFT: HCU 어댑터 반영, MACA/Ascend 성능 및 증거 마감, 패키징 3종 세트 병합(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagFFT #12, #18, #22

주요 내용은 「오늘의 중점」참조. 보충 세 가지: 첫째, MACA 라인의 검수 도구 배치는 패킹(pack8) 게이팅, 리소스 및 증거 기록, 3프로세스 양방향 소형 예제를 프로세스로 고정했다(15:39–16:17 집중 10건). 둘째, 「docs: complete MACA IX and Ascend setup」(22:51)이 세 백엔드의 환경 문서를 보완했으며, 신규 백엔드의 「환경 문서 + 통합 테스트 빌드」방식과 서로 호응한다. 셋째, 패키징 3종 세트(#12 / #18 / #19 / #20)가 09-21 오후에 집중 병합되었고, Nexus 업로드는 org 수준 공유 워크플로를 재사용한다.

1.2 build-infra: FlagCX wheel 채널 6연속 병합, Kunlunxin 배포 심사 중, 순수 Python 컴포넌트 통합 릴리스 채널(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: build-infra #993, #995, #998, #1000

FlagCX의 wheel 배포 라인은 이번 모니터링 기간에 7건을 연속 추진했다(6건 병합 + 1건 심사 중). #994는 wheel 라인에 필요한 빌드 툴체인 이미지를 릴리스했고(12:45), #995는 각 행의 디바이스 bitcode를 wheel에 담았으며(13:59), #996은 FlagCX가 디바이스 bitcode를 자체 패키징하도록 했고(15:30), #997은 wheel 채널에 4개 행을 추가로 열었으며(19:07), #999는 join 명명을 리팩터링했고(21:12), #998은 「해당 행 디바이스가 있는 곳」에서 wheel을 빌드했다(23:18). 오늘 아침 심사 중인 #1000은 배포 라인을 Kunlunxin까지 확장한다(deliver the kunlunxin wheel). 이 라인은 크로스 칩 통신 라이브러리의 배포를 「소스 컴파일 + 이미지」에서 백엔드별 사전 컴파일 wheel로 진전시켰다.

다른 하나는 noarch-deb 집중 릴리스 채널(#993)이다. 순수 Python 컴포넌트를 위한 단일 워크플로를 구축했다——하나의 로직으로 FlagAudio, FlagSparse, FlagAttention 세 컴포넌트를 커버하며(차이는 하나의 case 블록으로 수렴), 빌드 전에 릴리스 라인에 따라 버전을 매긴다(컴포넌트 패키징 메타데이터 버전 번호와 릴리스 라인 간에 이전부터 드리프트가 존재했다). 여기에 noarch-rpm.yml을 함께 구성했다. 「컨테이너 이미지 이외」의 네이티브 패키지 채널은 계속 강화한다.

1.3 FlagCX: v0.14.0-rc2.post2 릴리스——칭웨이 TSM torch 플러그인 링크 수정(09-21)

날짜: 2026-09-21 출처: FlagCX #617, 릴리스 페이지

22:11에 v0.14.0-rc2.post2를 릴리스했으며, 내용은 #617이다: torch_txda(칭웨이 TSM의 Torch 플러그인) 라이브러리 디렉터리 파싱 수정——get_device_config()의 txda 분기가 이전에는 라이브러리 디렉터리를 <package>/lib(해당 경로는 패키지에 존재하지 않음)로 파싱하여 링크 시 cannot find -ltorch_txda가 발생했으나, 수정 후 TSM 런타임 이미지에서 실측 통과했다. 이는 rc2 라인의 두 번째 패치 버전(post1에 이어)으로, 2.2 릴리스물의 「백엔드별 개별 패치」 리듬을 이어간다(상세는 3.7 참조).

1.4 FlagGems-vllm: 비런 SUPA 백엔드 머지; 어센드 XCS 연산자 배치와 6개 플랫폼 topk 튜닝(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagGems-vllm #794, #816, #830, #828

비런 SUPA 백엔드: #794 머지(17:09), 네 개 파일——runtime/backend/_biren/ 초기화, 휴리스틱 설정, tune_configs와 common.py; 커밋은 비런 엔지니어가 공동으로 완료했다. 또 하나의 칩 제조사가 「백엔드 디렉터리 + 튜닝 설정」의 표준 형태로 통합 플러그인에 접속했다.

어센드 XCS 라인: 모니터링 기간 내 다섯 개 연산자 머지(#811 kda_state_scatter, #812 kda_conv_gather, #813 kda_conv_scatter, #814 paged_scatter, #815 indexer_epilogue, #816 slot_mapping), 오늘 아침 #828이 pack_seq/unpack_seq 성능 항목을 후속 처리했다. 그중 #816은 실측을 제시했다: 페이징 KV의 슬롯 매핑을 「요청당 단일 program」에서 (요청, token 블록) 기준 병렬로 변경하고, int32 인덱스 산술로 나눗셈을 시프트로 낮추었다——4개 요청 프로덕션 형태에서 디바이스 시간 69 → 13 μs(5.5배), 전체 라운드 서비스 카드당 1050.9 → 81.2 ms(12.9배), 그리고 업스트림 kernel과 비트 단위로 일치한다. 별도로 #818 group_list_cumsum, #819 indexer_gemm_score가 심사 중이다.

튜닝과 CI: #830은 전역 topk 인덱스와 길이 연산자(compute_global_topk)를 여섯 개 플랫폼(MetaX / Hygon / MThreads / Ascend 등)에서 함께 튜닝하고 테스트와 벤치마크를 보강했다; #780은 top_k_per_row_prefill/decode가 mctle 빌드에서 TLE 경로를 타도록 했다; #829는 수동 연산자 테스트 워크플로를 추가했다. 심사 풀은 높은 수준을 유지한다: MThreads #822 / #823, MetaX #826 / #785, Hygon #827 / #820 / #803, Ascend #744, TLE mhc #734 등.

1.5 FlagGems: KernelGen이 다시 Nvidia 연산자를 저장소에 등록; 쿤룬신 수정 배치; 하이광 W8A8 TLE 파이프라인 교체(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagGems #6005, #6264, #6518, #6346

KernelGen(Nvidia) 13개: quantized_max_pool2d(#6005), msort(#5844), _standard_gamma(#6103), masked_select_backward(#5824), _thnn_differentiable_lstm_cell_backward(#5815), row_stack(#6011), batch_norm_gather_stats(#5747), inner(#6320), smm(#5964), quantized_max_pool1d(#5938), row_indices(#6012), replication_pad1d_backward(#5922), _lu_with_info(#5877) — 자동 생성 파이프라인이 범용 연산자 라이브러리에 롱테일 연산자를 지속적으로 보강하고 있다.

Kunlunxin 수정 배치: 다섯 건 병합 — add/cat/div 포인트와이즈 및 레이아웃(#6264, add 고속 경로가 단일 호출 호스트 시간을 약 36 μs에서 약 5.5 μs로 단축, P800에서 네이티브 구현의 0.84–1.56배), sort(#6263), moe_align 호스트 메타데이터와 padded fused-MoE 디스패치 재구성(#6398), GEMM 실행 차원을 미특화로 유지하여 내부 파라미터 레이아웃 안정화(#6415), special_bessel_y1 / softplus / weight_norm 배치(#6426).

Hygon W8A8(#6518): HCU의 TLE 화이트리스트가 로드 계열 프리미티브는 지원하지만 파이프라인 계열 프리미티브는 거부하기 때문에, mm_w8a8_int8의 세 곳 파이프라인을 분할된 tl.range 루프로 재작성하고(TLE 로드는 유지), 실수로 삭제된 rms_norm_w8a16_fp8 공개 임포트를 복원하며, Hygon을 벤치마크의 FP8 능력 검사에 추가했다.

기타: #6346은 copy 연산자에 저정밀도와 FP8 테스트를 추가(NVIDIA / Ascend / Hygon / XuanTie / MetaX / Iluvatar 6개 백엔드); upsample 세 개의 역방향 overloads(#6504 / #6505 / #6506); 오늘 아침 병합된 MTHREADS의 index_add와 index_add_(#6368) 및 polar(#6026) 최적화; 엔지니어링 측면에는 RPM 패키징 롤백(#6537), CI 공유 메모리 크기(#6541), setup.sh의 torch_npu와 triton 임포트 수정(#6545), 벤치마크 제로 레이턴시 가드(#6540), fused_moe INT8 W8A8 분류(#6081)가 있다. 심사 중: #6513 rrelu_with_noise.

1.6 FlagTree: Iluvatar TLE 분산과 TLE_RAW; NVIDIA TLE SMEM 서브 슬라이스(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagTree #1184, #1079, #1252, #1258

  • #1184(09-22 02:14, 30개 파일): Iluvatar 백엔드를 Triton v3.6.x 라인에 동기화하고 TLE를 확장 — TLE 분산(n_pes / get_device_id / remote_pointers / distributed_barrier, FlagCX 기반)과 TLE_RAW(CoreX clang JIT + 지연된 dsl_region 구체화) 추가; Gluon은 상시 등록으로 변경; nv_mma_shared_layout을 TCU swizzled shared로 재매핑하여 TLE GEMM이 SME G2S 파이프라인을 탈 수 있게 함.
  • #1079: NVIDIA TLE에 SMEM 서브슬라이스와 다중 작성자 TMA 파이프라인 추가.
  • AMD: #1252 AtomicCAS 텐서 피연산자 스레드 프레디케이트(triton #9605 포팅); #1240 CanonicalizePointers의 scf.if fat-ptr 병합 및 비정수 비트 변환 수정.
  • MetaX / AABS: #1258 metax dot m의 block_size 제한 수정; #1253 검토 중(MACA MMA 레이아웃으로 분할할 수 없는 dot을 blocked layout에 유지).
  • CI / 패키징: #1263 / #1264 GEMS 재사용 워크플로를 CORE 변경 감지에 포함; #1260 검토 중(rpm에 clang 설치 및 flagtree 패키징); #1259 PPU CI에 pid.txt 검증 추가 검토 중.

1.7 기타 동향: FlagTensor 0.3.0-rc2 패키징 라인, FlagQuantum 상호운용, FlagSparse, FlagAudio, FlagOS-Compressor 등 (09-21)

날짜: 2026-09-21 출처: FlagTensor #23, FlagQuantum, FlagOS-Compressor #9

  • FlagTensor(23): 0.3.0-rc2 브랜치 병합(#23, 27개 파일: deb/rpm 패키징, CMake의 Torch 탐색, libflagtensor-nvidia-dev 분리 등) + Nexus 업로드 워크플로(#20) + 패키징 스캐폴딩(#4), 버전을 0.3.0 릴리스 라인에 정렬. FlagTensor는 FlagOS의 Triton 텐서 프리미티브 라이브러리(단항 28개 연산자, 이항 4개, 축약 6개, cuTensor 베이스라인 대비) — 이번 모니터링 기간의 실질적 움직임은 「패키징 및 배포 체계 진입」.
  • FlagQuantum(19): 상호운용 및 일관성 테스트 집중 추진 — Qiskit 차분 일관성(#118), PennyLane 차분 일관성(#122), Cirq 어댑터 계약(#125), Qiskit 다중 큐비트 유니터리 행렬 변환(#114)과 산술 파라미터 표현식 가져오기(#111), 영역 쌍둥이 회로 검증(#116 / #120), 그리고 일련의 입력 검증 수정(#107~#127).
  • FlagSparse(11): NCIC-AlphaSparse 협업 브랜치에서 세 개의 PR 연속 병합(#76 / #77 / #78) — MACA SpMV CSR 베이스라인, XPU MACA 및 Ascend 테스트 등.
  • FlagAudio(5): pyproject.toml 누락된 쉼표 수정(#12) + RPM에 pyproject-rpm-macros 부재 시 일반 pip 폴백(#10).
  • FlagOS-Compressor(3): DeepSeek V4.1 및 MiMo V2.5 대상 선형 INT8 내보내기(#9 — 헤드 스캔, 직사각형 FP8 블록, 인덱서와 Engram 테이블 유지 등)가 16:08에 병합되고 16:59에 Revert로 철회됨(커밋 메시지에 사유 미기재), 해당 기능은 병합 전 상태로 복귀.
  • FlagGems-sglang(2): Enflame GCU vendor 등록(#99).
  • 단건: FlagBLAS mthreads L2 지원 병합(#122), FlagDNN ppu 테스트 수정, FlagPrism Nvidia dev 202609(#15), FlagScale metax 파라미터 수정(#1296).

2. 뉴스 보도와 생태계

2.1 컴포넌트 수준 검색 연속 열일곱 번째 조용한 모니터링 기간 (09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: Google News RSS(중영문 24개 쿼리어, 프록시 경유)

FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen 등 컴포넌트명으로 중영문 검색(when:7d 및 when:14d)을 수행했으나, 24시간 윈도우에서 계속 0건이 검출되어 컴포넌트급 검색 연속 열일곱 번째 평온 윈도우를 구성했다(직전 윈도우는 열여섯 번째). 제외 설명: 「Zhiyuan BAAI」 키워드 검출은 Zhipu ZCode 데이터 파동 시리즈와 도박 SEO가 주를 이루었으며(FlagOS와 무관, 미수록), HN의 FlagOS / FlagGems 검색에는 관련 검출이 없었다. 본 윈도우 대외 정보면은 멤버 기관 측이 담당했다(2.2, 2.3).

2.2 MetaX MXMACA, LMCache 메인라인에 병합: 멤버 기관 소프트웨어 스택 「업스트림 우선」으로 글로벌 추론 생태계에 융합(09-18/09-21)

날짜: 2026-09-18(공식 발표) / 2026-09-21(미디어 파동) 출처: MetaX 공식 사이트, Guandian, LMCache PR #4606

MetaX가 국제 오픈소스 KV Cache 프로젝트 LMCache와 협력하여, 자체 개발 소프트웨어 스택 MXMACA가 「Upstream First」 원칙에 따라 LMCache 공식 네이티브 지원 체계에 합류했으며, 코드가 메인라인에 병합되고 버전 반복에 따른 CI 검증 메커니즘을 구축했다(로드맵은 LMCache #4833 참조). LMCache는 시카고 대학 팀이 발기했으며, 현재 220+ 기여자, 30+ 업계 파트너를 보유한 대규모 모델 추론 KV Cache 관리의 주류 오픈소스 프로젝트이다. 09-21 Guandian, Phoenix Net 등이 공식 발표 원고를 전재했다. 「업스트림 우선」은 본 스택에서도 일관된 방식이며(PyTorch 및 각 업스트림 커뮤니티에 기여), 이 사례는 국산 컴퓨팅 파워가 글로벌 추론 생태계에 융합되는 대조 가능한 경로이다.

2.3 Jiemian News, MetaX의 39개 Day 0 적응 점검: 국산 GPU 「소프트·하드 일체」 생태계 서사(09-21)

날짜: 2026-09-21 출처: Jiemian News

13:52에 발표된 점검 기사: 09-20 기준, MetaX는 2025년 12월 이후 39개 주류 플래그십 모델의 Day 0 적응을 완료했다(Zhipu, Alibaba Qwen, MiniMax, DeepSeek, StepFun, Tencent Hunyuan 등 커버). MXMACA 소프트웨어 스택은 드라이버, 사용자 공간 인터페이스, 컴파일러, 연산자 적응 및 학습/추론 프레임워크를 커버하며, 40+ AI 프레임워크, 1000+ 모델, 6000+ 오픈소스 프로젝트 테스트를 지원하고 PyTorch 2.8의 2410개 GPU 연산자를 전량 지원한다. 또한 차세대 Xiyun C700의 핵심 설계와 기능 검증이 대부분 완료되었음을 공개했다. 「통합 컴파일러 + 연산자 + 프레임워크 다층 커버」의 서사는 본 스택의 다중 칩 통합 경로와 상호 거울상이며, 멤버 기관의 대외 전파 주력 소재이다.

3. 멤버 기관 심층 분석

3.1 MetaX: MACA 라인 3개 저장소 마무리(FFT / 컴파일러 / 학습 도구)(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagFFT 커밋, FlagTree #1258, FlagScale #1296

코드 측 세 가지: FlagFFT의 MACA 라인 약 17건(FP64 레지스터 교환 실험 당일 시도 후 철회, pack8 리프 레이아웃 게이팅, 4단계와 직결 혼합 기저의 공유 메모리 예산, 검수 도구와 증거 기록, 3프로세스 양방향 소형 예제 결과 포함), FlagTree의 AABS가 metax dot m 블록 크기 제한 수정(#1258 병합, #1253 심사 중), FlagScale이 metax 파라미터 수정(#1296 병합). 뉴스 측은 2.2와 2.3 참조 — MetaX는 본 윈도우에서 대외와 코드 양측 모두 가장 활발한 멤버 기관이다.

3.2 Hygon: FlagFFT HCU 어댑터와 FlagGems W8A8 TLE 교체(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagFFT 커밋, FlagGems #6518, FlagGems-vllm #803

  • FlagFFT: HCU(BW1000) 백엔드 어댑터 및 관련 수정, 문서(자세한 내용은 「오늘의 중점」 및 1.1 참조) — FFT 라이브러리가 처음으로 Hygon 플랫폼을 백엔드 매트릭스에 포함.
  • FlagGems: #6518은 세그먼트 tl.range로 HCU TLE 화이트리스트가 지원하지 않는 파이프라인 프리미티브를 대체하고, rms_norm_w8a16_fp8 임포트를 복원하며, Hygon을 벤치마크 FP8 능력 검사에 추가.
  • 심사 중: FlagGems-vllm의 세 가지 Hygon 라인 — #820 INT8 varlen flash attention, #803 INT8 블록 BMM과 int8_einsum, #827 top_k_per_row_decode.

3.3 Ascend: XCS 연산자 배치와 NPU FFT 최적화, 910C vLLM 0.28 업그레이드 심사 중(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagGems-vllm #816, #828, vllm-plugin-FL #487

  • FlagGems-vllm: XCS 연산자 배치(#811 ~ #816, 1.4의 성능 수치 참조), #828 pack_seq와 unpack_seq 후속, #821 TLE 최적화 topk_softplus_sqrt, #744 fused_marlin_moe_w4a16_int4 심사 중.
  • FlagFFT: NPU 라인 단일 CT 최적화와 Stockham 배치(약 10건) 병합.
  • vllm-plugin-FL: #487 「vLLM 0.28 지원(NVIDIA와 Ascend 910C)」 심사 중; #484 NVIDIA 라인 vLLM 0.28.0 이미 병합 — vLLM 0.24 ~ 0.28 업그레이드 라인 개시.
  • FlagGems: #6545 setup.sh의 torch_npu와 triton 임포트 오류 수정.

3.4 Iluvatar CoreX: Iluvatar TLE 분산 병합(09-22)

날짜: 2026-09-22 출처: FlagTree #1184

새벽에 병합된 30개 파일 대형 PR: Iluvatar 백엔드를 Triton v3.6.x로 동기화하고, TLE 분산과 TLE_RAW, Gluon 상시 활성화, nv_mma_shared_layout를 TCU swizzled shared로 재매핑(자세한 내용은 1.6 참조). 분산 프리미티브는 FlagCX가 뒷받침하며, 이는 Iluvatar 라인이 FlagOS 내에서 「컴파일러 + 통신」이 협력하는 한 사례이다; TLE_RAW의 CoreX clang JIT 경로 역시 해당 툴체인 특성에 맞춘 엔지니어링 적응이다.

3.5 Moore Threads: index_add / polar 최적화 병합, 다수 연산자 PR 심사 중(09-21/09-22)

날짜: 2026-09-21 ~ 2026-09-22 출처: FlagGems #6368, FlagGems-vllm #822, FlagBLAS #122

  • FlagGems: 오늘 아침 10:01에 index_add와 index_add_ 성능 최적화(#6368)와 polar(#6026) 병합.
  • FlagGems-vllm 심사 중: #822 fused_inv_rope_fp8_quant 이식과 최적화, #823 flash_attn_varlen_func의 W8A8 FP8 지원, #831 top_k 좁은 값 범위 수정, #807 fp8_fp4_mqa_logits.
  • FlagTree: #1261 fmul_rn_fp32 libdevice 지원 심사 중.
  • FlagBLAS: #122 mthreads L2 지원 병합.

3.6 Enflame: FlagGems-sglang GCU vendor 등록(09-21)

날짜: 2026-09-21 출처: FlagGems-sglang #99, vllm-plugin-FL #556

#99 enflame(gcu) 백엔드를 vendor 파이프라인에 연결: vendors.ENFLAME 등록, torch의 gcu 디바이스 속성 매핑, fp64 / int64 지원 누락 표시, VendorDescriptor(PrivateUse1 디스패치, TLE 활성화) 완료, 디바이스 조회 명령을 efsmi -L로 확정, CodeGenConfig와 num_warps 휴리스틱 보강. vllm-plugin-FL 측 #556 「MUSA 매트릭스 기준 e2e 커버리지 정렬」이 오늘 아침 업데이트——Enflame 라인의 플러그인화 연결과 테스트 정렬이 동시에 추진 중.

3.7 Tsingmicro: FlagCX rc2.post2 TSM torch 플러그인 수정 (09-21)

날짜: 2026-09-21 출처: FlagCX #617

v0.14.0-rc2.post2의 유일한 내용: TSM(Tsingmicro, 빌드 옵션 USE_TSM) Torch 플러그인의 torch_txda 라이브러리 디렉터리 파싱 수정, TSM 런타임 이미지에서 링크 실패(cannot find -ltorch_txda) 해결. Tsingmicro는 이 스택 2.2 라인의 여러 지점에서 등장(KernelGen 2.2.0 신규 하드웨어, build-infra 이미지 행 tsingmicro-tsm260610, FlagCX 백엔드 문서)했으며, 이번 수정으로 torch 플러그인 빌드 경로가 열렸다.

3.8 Damo Academy XuanTie: PPU 융합 연산자 병합 및 PPU CI 검증 (09-21)

날짜: 2026-09-21 출처: FlagGems-vllm #796, FlagTree #1259

  • FlagGems-vllm #796: PPU(thead) 버전 「역 RoPE와 FP8 양자화 융합」 및 「token별 그룹 FP8 양자화」 두 연산자——FlagTree PPU가 아직 네이티브 tl.float8e4nv 포인터와 변환을 하향 지원하지 못하기 때문에, 정수 연산으로 E4M3FN을 인코딩하고 uint8 무복사 뷰로 출력하며, torch 계산 폴백 없음.
  • FlagDNN: ppu 테스트 수정.
  • FlagTree: #1259 PPU CI에 pid.txt 검증 추가 심사 중.

4. 요약 및 동향 관찰

  • 백엔드 매트릭스 「라이브러리별 순차 보강」: FFT 라이브러리에 Hygon HCU 합류; 플러그인 측은 같은 날 Biren SUPA와 Enflame GCU 두 백엔드 지점 추가. 「벤더 자체 백엔드 디렉터리 + 튜닝 설정」이 이미 표준 연결 형태이며, 다중 칩 커버리지가 릴리스 매트릭스에서 각 기반 라이브러리로 확장되고 있다.
  • FFT 라이브러리 하루 처리량 = 툴체인 성숙도 신호: 102건의 커밋이 MACA / NPU / HCU 세 라인에 걸쳐 있으며, 성능 변경에 일반적으로 할당 예산, 게이팅, 증거 기록(당일 시도 후 철회한 실험 포함)이 동반——개발 프로세스가 「돌아감」에서 「재현 가능한 튜닝」으로 전환.
  • 배포 형태 3트랙화: FlagCX wheel에 디바이스 bitcode 포함(#995~#998, 심사 중인 Kunlunxin #1000 포함), 순수 Python 컴포넌트를 noarch deb/rpm 채널로 통일(#993), FlagFFT와 FlagTensor 패키징 3종 세트——릴리스물이 「이미지 + 문서」에서 「wheel / deb / rpm + 이미지」로 확대.
  • 2.2 마감과 신규 버전 라인 병행: 6개 플랫폼 topk 튜닝(#830), 6개 백엔드 FP8 테스트(#6346), Ascend XCS 성능 항목(#816)은 강화 측; vLLM 0.28 업그레이드(#484 병합 완료, #487 심사 중)와 FlagTree packaging(#1260 심사 중)은 차기 버전 측.
  • 이전에 조용했던 모듈의 집단 움직임: FlagTensor(0.3.0-rc2 패키징), FlagAudio(패키징 수정), FlagSparse(협업 브랜치 병합)가 이전 「관찰 대기」 목록과 정확히 호응——rc2 라인 내 이 모듈들이 검수와 배포 단계에 진입.
  • 외부 전파는 여전히 저조: 컴포넌트급 검색 열일곱 번째 조용한 모니터링 기간 vs 224건 커밋; 멤버사 측(MetaX LMCache, 39개 Day 0)이 외부 정보 주력을 담당. 관찰 대기: FlagOS-Compressor 철회 후속 조치, vLLM 0.28 라인의 각 백엔드 정착 속도.

부록: 출처 검증표

카테고리 출처 검증 방식 결과
GitHub org: flagos-ai repos API 54개 저장소 pushed_at 전수 검증 19개 저장소가 모니터링 기간 내 활성
GitHub 커밋 검색 + 저장소별 대조 기간 내 건별 검증 224건(15개 저장소) + 브랜치 푸시
GitHub releases.atom(24개 저장소 스캔) 저장소별 스캔 신규 FlagCX v0.14.0-rc2.post2
뉴스 Google News RSS(중영문 24개 검색어 조합, 프록시 경유) 24시간 기간 필터링 + 건별 제외 컴포넌트 키워드 무적중(17번째 조용한 기간), 멤버 키워드 2건 유지
미디어 MetaX 공식 사이트 / Jiemian News / Guandian / ifeng 원문 수집 재검증 LMCache 병합, 39개 Day 0 정리
커뮤니티 Zhiyuan 커뮤니티 / HN Algolia 검색 재검증 모니터링 기간 내 FlagOS 관련 신규 기사 없음
프로젝트 문서 FlagTensor / FlagFFT / FlagCX README 및 docs 원문 수집 백엔드 목록 및 라이브러리 포지셔닝 대조

전체 출처 목록