FlagOS 데일리 리포트 (2026-09-10)
모니터링 기간: 2026-09-09 10:18 ~ 2026-09-10 10:18 베이징 시간 출처: GitHub(org: flagos-ai 52개 저장소 pushed_at + commit search 135건 committer-date 기준 전수 검증 + 기본 브랜치 per-repo 재검증 + 브랜치 API + commit 상세)、Google News RSS(중영 20개 쿼리어, 프록시 경유)、HN Algolia、Tavily/web 검색、FlagOS CSDN 공식 계정(상세는 부록 참조)
인덱스
-
- 오픈소스 프로젝트 진행 상황(GitHub 동향)
- 1.1 build-infra: Ascend 910C base/runtime 백엔드 이중 라인 신규 추가, 60개 app 이미지 changelog 베이스라인 반영(09-09/09-10)
- 1.2 FlagGems 메인 저장소: KernelGen 연산자 흐름 고속 유지, KMCompiler 다중 백엔드 추가 확장(09-09/09-10)
- 1.3 FlagGems-Experimental: Hygon 전용 flash attention 연산자 반영, Iluvatar/MThreads 이중 라인 대량 작업(09-09/09-10)
- 1.4 추론 플러그인 계층: Damo Academy XuanTie PPU fused persistent_topk, Arm CPU Qwen W4A8/GDN, sglang 연산자 설정(09-09)
- 1.5 도메인 라이브러리와 툴체인: FlagBLAS Ascend L3 3연속 병합, FlagTree TLE 다중 카드 통신, FlagCX CICD 전면 커버리지(09-09)
- 1.6 기타 컴포넌트: libtriton_jit 타입화 디바이스 포인터, FlagScale 문서, FlagOS-Robo 지원 매트릭스 KERV 신규 추가(09-09)
- 오픈소스 프로젝트 진행 상황(GitHub 동향)
-
- 뉴스 보도와 생태계
- 2.1 베이징시 “15차 5개년” 디지털 경제 계획에서 Zhongzhi(FlagOS)와 Lingji(LinkeeOS)지목, RISC-V 지능형 컴퓨팅 명령어 집합 강화(09-09)
- 2.2 컴포넌트급 뉴스 8번째 연속 평온 기간; Zhiyuan 커뮤니티 정규 콘텐츠 업데이트(09-09)
- 뉴스 보도와 생태계
-
- 회원사 심층 분석
- 3.1 Moore Threads: JD Cloud, 자사 GPU 기반 10만 카드 클러스터 구축 발표(09-09)
- 3.2 Enflame: 9월 11일 STAR Market 상장, 공모가 142.18 위안/주(09-09)
- 3.3 Hygon: Token 운영 “듀얼칩” 가속 솔루션, CPU+DCU 토큰 루프 완성(09-09)
- 3.4 MetaX와 Moore Threads: 보호예수 해제와 2차 시장 변동성(09-09)
- 회원사 심층 분석
-
- 요약
- 부록: 전체 출처 목록
1. 오픈소스 프로젝트 진행 상황(GitHub 동향)
기간 총괄: org 내 52개 저장소 중 18개가 기간 내 푸시 발생; commit search 히트 135건 기간 내 커밋(5페이지), 14개 저장소에 분포(FlagGems-Experimental 60, FlagGems 39, build-infra 9, FlagBLAS 8, FlagTree 4, FlagCX 2, FlagGems-sglang 2, vllm-plugin-FL 2, FlagSparse 2, FlagOS-Robo 2, FlagAttention 2, libtriton_jit 1, FlagScale 1, FlagGems-vllm 1); 별도로 4개 저장소(sglang-plugin-FL, docs, FlagTree-AscendNPU-IR, release-info)기간 내 푸시는 기본 브랜치와 브랜치 API 재검증 결과 PR 브랜치 작업으로 확인. 신규 저장소 없음, 신규 컴포넌트 release 없음.
이번 기간 형태 = RC1 테스트 안정기의 “엔지니어링 인프라 + 연산자 매트릭스” 이중 라인: 전달 측면 최대 작업은 build-infra(Ascend 910C 신규 백엔드 + 60개 app 이미지 changelog 베이스라인과 게이팅)에 집중, 코드 측면은 연산자 자동 생성 파이프라인의 고속 흐름 지속(메인 저장소 39건 + 실험 저장소 60건), 도메인 라이브러리와 툴체인에서는 FlagBLAS Ascend L3 3연속, FlagTree TLE 다중 카드 통신 등 실질적 역량 확장 발생.
1.1 build-infra: Ascend 910C base/runtime 백엔드 이중 라인 신규 추가, 60개 app 이미지 changelog 베이스라인 반영(09-09/09-10)
출처: build-infra #803 (09-09 20:27), #801 (09-09 13:42), #802 (09-09 20:22), #807 (09-10 09:38), #799/#800 (09-09 10:42/10:43), #804, #805, #806
- Ascend 910C 백엔드 신규 추가 (#803):
ascend-cann8.5.0-910c/ascend-cann9.0.0-910c듀얼 백엔드를 신규 추가하여 동일한 CANN 라인으로 Ascend 910C 칩에 빌드할 수 있게 되었다. 910C의 칩 전용 ops 패키지는 A3 token (Ascend-cann-A3-ops)을 사용하며, 두 base Containerfile은 910B 형제 버전과 바이트 단위로 동일하고 PRODUCT ARG 기본값(910b→A3)과 파일 헤더만 다르다. 이번 모니터링 기간에 처음으로 Ascend 칩 매트릭스를 910B에서 910C로 확장했다. - 범위 의도적 축소: 신규 configs.yaml 블록은
deps_app과env.app.*를 의도적으로 생략하여 910C 백엔드가 당분간 app 빌드 매트릭스에 진입하지 않도록 했다(deps_app 존재 여부가 app 편입의 게이팅). app 아티팩트가 산출되고 검증된 후에 개방할 예정이며, “base/runtime 먼저 정립, app 이후 진입”이라는 안정적 접속 순서를 따른다. - 부수적 벤더 파싱 수정: 세 개의 verify 스크립트에서 벤더 분할을 마지막 하이픈(
${VAR%-*})에서 첫 번째 하이픈(${VAR%%-*})으로 변경하여 generate_matrix.py / verify_base.py와 정렬했다. 기존 로직은ascend-cann9.0.0-910c와 같은 이중 하이픈 키에서 run.vendors에 없는 벤더명을 파싱하여 run flags가 비어버리는 문제가 있었다. 함께 #804(910B runner overrides에서 910b label 강제), #806(910C base 빌드가 runner proxy build-args를 사용하도록)이 반영되었다. - 60개 app 이미지 changelog 베이스라인 (#801):
app/<app>/changelogs/아래에 flagos-app이 이미 릴리스한 60개 app 이미지 전체에 대한 YAML 베이스라인을 구축하여, 이미지별로 현재 registry에 상주하는 tag와 그 빌드 이력(신→구)을 기록했다. 각 항목에는 재빌드 사유, push_time 날짜, 포함된 업스트림 PR이 담겨 있다. registry가 더 이상 보유하지 않는 구버전 tag는 후속 항목의 history에 편입되어 그 유일한 흔적으로 남는다. 함께 #802(registry push_time으로 날짜 백필), #807(push 시 changelog 게이팅 강제)이 반영되었다. 전달 추적성이 “이미지 tag 기록”에서 “이미지별 변경 이력”으로 격상되었다. - Moore Threads Megatron 애플리케이션 이미지 이중 라인 등록 (#799/#800): mthreads-musa4.3.6과 mthreads-musa5.2.0 두 라인에 대해 app image tag
2.1.2-0.3.0_rc0.post1_3.g6e8d7ffc7을 기록했다. 또한 #805는 외부 GitHub Actions를 전체 commit SHA로 고정했다(공급망 강화).
해석: Ascend 910C의 연동 방식은 주목할 만하다——새로운 기술 노선을 개설한 것이 아니라, 910C를 “910B 라인의 칩 동형 변종”으로 처리했다: Containerfile은 바이트 단위로 재사용하고 ops 패키지 token만 교체하며, deps_app 부재를 통해 새 칩을 app 매트릭스 밖으로 차단했다. 이는 RC 테스트 기간의 “새 적응은 가능, 새 기능은 불가” 규율이 멀티칩 엔지니어링에 구체적으로 투영된 것이다: 새 하드웨어는 골격만 세우고, 기존 딜리버리 표면을 교란하지 않는다. 60개 app 이미지 changelog 베이스라인 + push 게이팅의 조합은 build-infra를 “무슨 일이 일어났는지 기록”에서 “왜 그런지 강제로 설명”으로 끌어올린 것으로, 2.2 GA 전 감사 표면이tightening되는 신호다.
1.2 FlagGems 메인 저장소: KernelGen 연산자 흐름 높은 속도 유지, KMCompiler 다중 백엔드 재확장 (09-09/09-10)
출처: FlagGems #5957 (QC/PPU W8A16 RMSNorm, 09-09 10:29), #5871 (GLU TLE 자동 튜닝, 09-09 10:43), #6094 (KMCompiler Iluvatar gru, 09-09 12:15), #5960 (KMCompiler Ascend/Metax linalg_matrix_power, 09-09 12:16), #6119 (CI/CD rule-check-required, 09-09 15:41), #6090 (metax-maca3720 제거)
-
메인 저장소 단일 모니터링 기간 39건의 기간 내 커밋으로, 최근 가장 밀집된 한 기간입니다. 수량의 주체는 [KernelGen][Nvidia] 시리즈 연산자 등록(약 25건)이며, hardtanh(ops로 이동), cummax_helper, _nested_from_padded_tensor, _nested_tensor_from_mask_left_aligned, _nested_view_from_jagged, conv_tbc_backward, conv_transpose3d, matrix_exp_backward, max_pool1d, sum_to_size, embedding_renorm, cosine_embedding_loss, cov, corrcoef, cumulative_trapezoid, fft_irfftn, special_xlogy, _sparse_semi_structured_addmm, fake_quantize 시리즈와 nuclear_norm을 포함합니다. 09-10 09:03~09:52에도 여전히 연속 등록 중입니다(corrcoef/cov/cumulative_trapezoid 세 건이 같은 분에 병합).
-
KMCompiler 생성 경로가 계속 벤더를 확장: Iluvatar
gru(Triton kernel, #6094), Ascend + Metax 동일 배치linalg_matrix_power(#5960). 직전 기간에야linalg_matrix_exp가 일곱 백엔드를 한 번에 산출한 것을 기록했는데, 이번 기간에는 linalg 행렬 함수군이 계속 “한 번 개발, 다중 백엔드 구현” 방식으로 보완되고 있습니다. -
양자화 연산자가 다시 Damo Academy XuanTie PPU로 확장: QC PPU
W8A16 RMSNorm(#5957), 성능 측면에서는 GLU kernel이 TLE 자동 튜닝으로 전환(#5871). -
엔지니어링 측면 5건: CI가 three-dot diff로 PR 변경 파일을 도출하도록 변경(#6097), rule-check-required job과 CICD 문서 추가(#6119), unittest workflow에 동시성 제어를 추가하고 09-10에 표현식 문법을 두 번 수정(#6137 등), metax-maca3720의 CI 항목 제거(#6090, 벤더 CI 라인 조정),
[Fix]로 MM 테스트와 benchmark가 FlagTune 환경 설정을 준수하도록 하고(#6129), all/any 0으로 나누기, nextafter NaN 전파, 두 건의 benchmark 구조화 JSON 출력을 수정.
해석: KernelGen의 산출 속도가 직전 기간의 반나절당 12건에서 이번 기간 반나절당 약 25건으로 회복된 것은 “AI 자동 연산자 생성”이 이미 일회성 이벤트가 아닌 상시화된 파이프라인임을 보여줍니다. 이는 1.3 실험 저장소의 60건 병합량과 서로 뒷받침됩니다. 이번 기간의 작업면 분포 역시 현재의 엔지니어링 중심을 보여줍니다. 2.2 동결 기간에는 신규 역량이 전부 “생성기 연산자 보충 + 벤더 백엔드 전용화”로 이뤄지며, 수작업 아키텍처급 변경은 0건입니다. 반대로 CI 측은 제약을 더 강화했는데(three-dot diff, rule-check-required, 동시성 제어), 이는 GA 전에 딜리버리 규율을 조이는 전형적인 조치입니다.
1.3 FlagGems-Experimental: Hygon 전용 flash attention 연산자 등록, Iluvatar/MThreads 이중 라인 배치 (09-09/09-10)
출처: FlagGems-Experimental #597(Hygon _flash_attention_forward, 09-10 08:44), #598(Hygon adaptive_avg_pool2d_backward, 09-09 17:28), #604(MThreads var, 09-10 09:11)
- 실험 저장소 단일 기간 60건 커밋, 백엔드별 집계: Iluvatar 약 36건(special 함수군, 풀링 역방향, linalg_svdvals, histc, median, mvlgamma, matmuladd 등), MThreads 약 16건, Ascend 3건(special_erfinv, unsafe_masked_index, zero), Hygon 2건.
- Hygon 전용 flash attention 저장소 반영(#597): Hygon DCU 백엔드를 위해
_flash_attention_forward전용 구현을 추가, 파일은src/flag_gems/runtime/backend/_hygon/ops/에 위치, BAAI 측 개발자가 커밋. 이전까지 해당 백엔드는 실험 저장소에_amp_foreach_non_finite_check_and_unscale_등 경량 연산자만 있었고, 전용 어텐션 연산자는 이번이 처음. - 다른 Hygon 연산자는
adaptive_avg_pool2d_backward(#598). 두 건 모두 같은 날/다음 날 기본 브랜치에 반영. - 엔지니어링 측면: 실험 저장소에 unittest workflow 동시성 설정 동기화 추가(09-09 13:39, 19:54 두 차례 개정).
해석: Hygon 두 건의 착지점은 연산자 수보다 더 많은 정보를 담고 있다 — _flash_attention_forward는 어텐션 경로의 핵심 연산자이며, 09-08 메인 저장소에서 Hygon 백엔드 flash attention의 BLOCK_M 블록 채택 결함을 방금 수정했고, 이번 기간에 전용 구현이 바로 저장소에 반영되어 “먼저 범용 경로를 수정하고, 이어서 전용 구현을 올린다”는 릴레이를 구성한다. Iluvatar(Iluvatar CoreX)는 단일 기간 36건으로 실험 저장소 최대 생산 능력 출처를 계속 유지하며, 메인 저장소 KMCompiler의 Iluvatar gru와 함께 “실험 저장소 대량 검증 → 메인 저장소 KMCompiler 생성/릴리스”라는 분업 폐루프를 형성한다.
1.4 추론 플러그인 계층: Damo Academy XuanTie PPU fused persistent_topk, Arm CPU Qwen W4A8/GDN, sglang 연산자 설정(09-09)
출처: FlagGems-vllm #754(09-09 19:58), vllm-plugin-FL #433(09-09 15:35), #474(09-09 17:40), FlagGems-sglang #60(09-09 18:56)
- Damo Academy XuanTie PPU fused persistent_topk(FlagGems-vllm #754):
runtime/backend/_thead/fused/아래에persistent_topk.py(2394행)를 신규 추가 및 등록, T-Head PPU-ZW810E 대상, KMCompiler가 생성. 직전 기간(09-08)에 해당 연산자의 테스트/benchmark가 vLLM native op에서 벗어나 자체 테스트 가능하도록 변경되었고(#747), 이번 기간에 정식 구현과 등록이 착지. - Arm CPU 측 Qwen 양자화 추론(vllm-plugin-FL #433): CPU에서 Qwen의 packed W4A8 및 GDN(Gated Delta Net) 경로를 통합, 플러그인 계층이 Arm CPU 추론 시나리오로 확장된 것.
- KV 캐시 일관성 수정(#474): #382에서 온 FlagGems KV cache 업데이트 복원(attention 경로 회귀 수정).
- sglang 플러그인 연산자 설정(FlagGems-sglang #60): operators 설정 파일을 신규 추가, sglang 플러그인 측 연산자 활성화 집합을 설정 가능하게 함.
해석: 네 건은 같은 한 가지를 가리킨다 — 플러그인 계층이 “다중 프레임워크 × 다중 칩 × 다중 배포 형태”를 위해 설정면과 전용 연산자를 보강하고 있다. XuanTie PPU의 persistent_topk는 “자체 테스트 가능”에서 “등록 완료”로의 2단계 걸음을 마쳤고, Arm CPU의 W4A8/GDN은 플러그인 계층의 적용 범위를 가속 카드에서 CPU 추론 스택으로 확장했다. sglang 연산자 설정화는 칩별 연산자 집합 선별 비용을 낮춘다. 세 가지를 합치면 추론 플러그인 계층이 “커널별 벤더화 + 설정면 거버넌스”의 성숙기 엔지니어링에 진입했음을 보여준다.
1.5 도메인 라이브러리와 툴체인: FlagBLAS Ascend L3 삼연속 병합, FlagTree TLE 다중 카드 통신, FlagCX CICD 전면 커버 (09-09)
출처: FlagBLAS #102/#104/#105 (09-09 11:22/14:35/15:03), FlagTree #1048 (09-09 16:56), #1123, #1099 (09-09 22:25), FlagCX #573/#575 (09-10 01:28/09:35)
- FlagBLAS Ascend L3 삼연속: 같은 날 TBMV(#102) → TBSV(#104) → TPSV(#105) 세 가지 고유값/삼각 행렬 연산의 Ascend 지원을 순차적으로 병합하고, 중복 연산자 내보내기 목록을 정리했다(#103). 09-07의 Ascend L2 루틴 일괄 병합을 이어받아, 이번 모니터링 기간에는 BLAS 루틴 행렬을 계속 L3로 밀어 올린다.
- FlagTree 네 건: TLE 분산 프리미티브
distributed_barrier에 다중 GPU 통신 지원 추가(#1048); CI에 hcu qwen benchmark 추가(#1123); XPU 측에서xpu-sdnn-objects를 v0.3.6.6.1로 올려 int8 dot 실패 수정(#1099);[FlagTune]이 CUDA graph 벤치마크에서 caller-stream 호출 순서를 유지(#1129). - FlagCX CICD 두 건: CICD 커버리지를 모든 cooperative modes와 모든 team/operation 조합으로 확대(#573/#575), 즉 통신 라이브러리의 협력 모드 조합에 대해 전수 조사식 테스트 커버리지를 적용한다.
해석: 세 라인의 성격은 다르지만 방향은 일치한다——테스트 기간에는 “커버리지”를 주요 지렛대로 삼는다. FlagBLAS는 L3 루틴으로 Ascend의 BLAS 능력 면을 보강하고, FlagCX는 조합 전수 조사로 CICD 커버리지를 경계까지 밀어 올리며(다중 카드 통신 정확성은 2.2 다중 칩 매트릭스 테스트 모니터링 기간의 핵심 리스크 항목이다), FlagTree는 TLE의 다중 카드 프리미티브를 “사용 가능”에서 “다중 카드 통신 사용 가능”으로 끌어올린다. hcu qwen benchmark가 CI에 진입한 것은 Ascend(hcu) 측의 엔드투엔드 모델 벤치마크가 일상 검증에 포함되었음을 의미한다.
1.6 기타 컴포넌트: libtriton_jit 타입 지정 디바이스 포인터, FlagScale 문서, FlagOS-Robo 지원 매트릭스에 KERV 추가 (09-09)
출처: libtriton_jit #65 (09-09 10:56), FlagScale #1290 (09-09 10:49), FlagOS-Robo #12 (09-09 14:21), FlagSparse #55 (09-09 17:35), FlagAttention #41/#52 (09-09 10:44/10:48)
- libtriton_jit #65: 타입화된 디바이스 포인터(typed device ptr) 기능 브랜치를 병합하여 Triton JIT 계층의 포인터 타입 처리를 보강.
- FlagScale #1290: 문서 커밋 한 건만 존재(qwen3.5 훈련 가이드에 대응하는 메인 커밋 표기), 훈련 스택은 이번 모니터링 기간에 코드 병합 없음.
- FlagOS-Robo #12: README 지원 매트릭스에 KERV(VLA, OpenVLA-7B) 항목을 추가, 훈련과 추론 지원(serve/evaluate는 아직 없음), PR과 함께 KERV 지원 매트릭스 리뷰 의견에도 대응. 09-07 FlagScale은 이미 KERV 구현형 추측 디코딩 통합을 병합했으며, 이번 모니터링 기간에는 이 역량을 FlagOS-Robo의 지원 매트릭스에 공식적으로 기재한 것.
- FlagSparse #55:
merge_with_spsv(희소 행렬-벡터 곱 융합) 병합. FlagAttention 두 건의 PR(#41/#52) 병합. FlagGems-sglang은 1.4 참조.
해석: FlagOS-Robo의 KERV 항목은 “역량 구현 → 매트릭스 등록”의 마지막 단계로, 구현형 인공지능 툴체인의 모델 커버리지가 분기 단위로 확장되고 있음을 보여준다(PI0/PI0.5/RoboBrain-2.0/2.5/RoboBrain-X0/Qwen-GR00T/GR00T-N1.5/KERV가 이미 8종 모델 매트릭스를 구성). FlagScale과 FlagAttention은 이번 모니터링 기간에 문서/병합 작업만 있어 RC 테스트 기간의 저코드 활동에 해당하며, 1.2 메인 저장소의 높은 연산자 유입 속도와 상호 보완을 이룬다: 훈련 스택 마감, 연산자 라이브러리 확장.
2. 뉴스 보도와 생태계
2.1 베이징시 “15차 5개년” 디지털 경제 계획에서 Zhongzhi(FlagOS)와 Lingji(LinkeeOS)를 지목, RISC-V 지능형 컴퓨팅 명령어 집합 강화(09-09)
출처: 증권시보: 장 마감 후, 호재가 왔다! 베이징, 중대 발표(09-09 18:51), 동방재부: 베이징 중대 발전 계획 발표(09-09), 차이롄서: 베이징시 “15차 5개년” 시기 첨단산업 발전 계획(09-09), 시나과기간점 전재(09-09 16:05)
- 9월 9일 장 마감 후, 베이징시 인민정부는 같은 날 《베이징시 “15차 5개년” 시기 첨단산업 발전 계획》과 《베이징시 “15차 5개년” 시기 디지털 경제 발전 계획》을 발표했다. 디지털 경제 계획은 “자주통제발전 수준 제고” 항목에서 명확히 밝혔다: “지능형 컴퓨팅 인프라 전 스택 자주 혁신을 추진하고, RISC-V 지능형 컴퓨팅 명령어 집합 혁신을 강화하며, Zhongzhi(FlagOS) 오픈소스 생태계 조성을 심화하고, Lingji(LinkeeOS) 에이전트 운영체제를 배치한다.”
- 같은 단락에서는 또한 “국산 첨단 컴퓨팅 반복 검증 플랫폼 건설을 가속하고, 10만 카드 컴퓨팅 클러스터 건설 능력을 제고하며, 전국 일체화 컴퓨팅 네트워크 징진지 국가 허브 노드를 기반으로 국산 기술 검증을 가속”할 것을 제시하고, “신창 소프트웨어·하드웨어와 인공지능의 심층 융합을 추진”할 것을 요구했다.
- 첨단산업 발전 계획 측의 대응 표현은 “인공지능 시스템 소프트웨어 스택 능력을 제고하고 국산 컴퓨팅 신아키텍처 배치를 가속”“국제적 영향력을 지닌 오픈소스 프로젝트와 오픈소스 커뮤니티를 육성하고 글로벌 개발자 협업 혁신 허브를 건설”이다. 즉 시스템 소프트웨어 스택과 오픈소스 커뮤니티가 시급 산업 계획의 목표 체계에 포함되었다.
- Lingji(LinkeeOS)는 이전에 베이징시 경제정보화국 지도 아래 베이징 퉁밍후 정보기술 응용혁신센터가 산업 파트너와 공동 발기했으며(2026-05 선기 핵심 성과 발표), 이번에 시급 5개년 계획 문서에서 FlagOS와 나란히 등장한 것.
- 해석: 이는 FlagOS가 처음으로 베이징시 5개년 계획급 정책 텍스트에 진입한 것이며, RISC-V 지능형 컴퓨팅 명령어 집합 혁신, 10만 카드 클러스터 건설 능력, 에이전트 운영체제와 같은 정책 문장 안에 나란히 배치되었다 — 이는 FlagOS의 역할이 “Zhiyuan이 주도하는 오픈소스 프로젝트”에서 베이징시 자주통제 컴퓨팅 인프라의 지정 시스템 소프트웨어 스택 담체로 상승했음을 의미한다. 커뮤니티에 대한 직접적 함의는 세 가지다: 첫째, 2.2 GA(09-24 테스트 기간 마감) 이후의 로드맵은 대체로 “국산 첨단 컴퓨팅 반복 검증 플랫폼” 건설 리듬과 정렬될 가능성이 크다; 둘째, “RISC-V 지능형 컴퓨팅 명령어 집합 혁신 강화”는 Damo Academy XuanTie PPU, Jindie Shikong 등 RISC-V 방향의 연산자 백엔드(이번 호 1.4 XuanTie fused persistent_topk) 방향과 일치하며, FlagOS 내 RISC-V 백엔드의 비중이 상승할 수 있다; 셋째, Lingji(LinkeeOS)와 FlagOS의 병치는 “시스템 소프트웨어 스택 + 에이전트 운영체제”의 계층적 포지셔닝이 정책적으로 확인되었음을 시사한다.
2.2 컴포넌트급 뉴스 여덟 번째 연속평온 기간; Zhiyuan 커뮤니티 정례 콘텐츠 업데이트(09-09)
출처: Google News RSS(프록시 경유), HN Algolia, FlagOS CSDN 공식 계정(flagos.csdn.net), Zhiyuan 커뮤니티(hub.baai.ac.cn)
- gnews 컴포넌트 키워드(FlagOS/FlagGems/FlagScale/FlagTree/FlagPerf/FlagAttention/FlagCX/KernelGen/FlagOS-Robo/FlagQuantum, when:1d~14d 중영문)는 모니터링 기간 내 제로 히트——컴포넌트급 뉴스는 09-03 이후 여덟 번째 연속 조용한 기간이다. FlagOS 문자 그대로 유일하게 히트한 검색 결과는 상기 베이징시 계획 전재 기사(2.1 참조)로, 별도로 분리했다.
- HN Algolia: FlagOS/FlagGems/FlagScale/FlagTree 네 가지 쿼리는 모니터링 기간 내 히트가 모두 “flags/flagship” 부분 문자열 오매칭된 무관한 Show HN 항목(Mario 64 에뮬레이션, Agent Router, Locksmith 등)으로, 전량 제외했다.
- Zhiyuan/BAAI 연구원 키워드 쿼리 모니터링 기간 내 23건 히트는 모두 Zhiyuan 커뮤니티 정규 콘텐츠(AI+제약 CPHI 포럼 의제, CV 논문 리뷰, AI 분쟁 재판 기준, AI Native 연구개발 조직, OpenAI 차세대 모델 루머 등)로, FlagOS 기술 스택과 직접적 연관이 없어 기술 항목으로 수록하지 않는다.
- FlagOS CSDN 공식 계정 신규 글 없음: 최신 콘텐츠는 여전히 08-28의 GLM-5.3-Flash Day0 9개 칩 적응이며, 09-07 상하이 KubeCon “개방형 AI 컴퓨팅” 포럼과 09-03 “연산자 아일랜드” SGLang 연산자 대회 다시보기가 지속 게재 중이고, KernelGen 연산자 튜닝 주제 소개 페이지는 게시 시점 업데이트가 없으며 신규 활동 공지도 없다.
최근 3일 동향(엔지니어링 측, 대조용): 09-07 FlagOS 2.2 RC1 manifest 분기 + 12개 저장소 첫 라운드 rc1.post1 tag 웨이브, 09-07 FlagScale KERV 체화 추측 디코딩 통합 및 Megatron-LM v0.18.2 이중 저장소 정렬, 09-08/09-09 build-infra 연속 딜리버리 기록(Hygon dtk26.04 이중 프레임워크 클로즈드 루프, Tsingmicro 메인라인 이미지, provenance 태그 자동화), 09-09/09-10 본 모니터링 기간 build-infra Ascend 910C 백엔드 및 60개 이미지 changelog 베이스라인.
3. 멤버 단위 심층 분석
3.1 Moore Threads: JD Cloud, 자사 GPU를 기반으로 10만 카드 클러스터 구축 발표(09-09)
출처: Sina Finance, The Beijing News 인용: JD Cloud와 Moore Threads 협력 체결, 10만 카드급 중국산 지능형 컴퓨팅 클러스터 건설 계획(09-09 14:03), Xinhua Finance/China Securities Journal(09-09 14:28), NetEase, Southern Metropolis Daily 인용(09-09)
- 9월 9일 2026 JD 글로벌 테크 익스플로러 콘퍼런스에서 JD Cloud는 10만 카드 풀기능 GPU 클러스터 건설 계획을 발표했으며, Moore Threads의 풀기능 GPU를 컴퓨팅 기반으로 삼아 대규모 모델 훈련, 추론 및 체화 지능 등 핵심 분야에 집중하고 전 업계에 컴퓨팅 파워를 개방한다.
- 양측은 “칩 — 클라우드 플랫폼 — 모델 훈련” 풀스택 협력으로 포지셔닝하며, JD JoyAI 전 계열 대규모 모델 반복을 추진하고 “데이터→훈련→시뮬레이션→배포” 클로즈드 루프를 구축한다. JD 그룹 기술위원회 의장 겸 JD Cloud 사장 Cao Peng과 Moore Threads 창립자 Zhang Jianzhong이 각각 입장을 밝혔으며, Moore Threads 측은 이것이 중국산 GPU가 처음으로 주요 AI 클라우드 업체의 10만 카드급 핵심 지능형 컴퓨팅 클러스터에 진입했음을 의미한다고 밝혔다.
- 배경 참조: Moore Threads는 올해 3월 “Kuae” 지능형 컴퓨팅 클러스터를 대상으로 하는 6.6억 위안 규모의 중대 계약을 공시한 바 있으며, 같은 시기 Zhipu는 1GW급 중국산 컴퓨팅 데이터센터 구축 완료를 공시했고, MiniMax는 M3/H3의 중국산 칩 적응을 진행 중이라고 밝혔다.
해석: 이는 멤버 단위가 “중국산 컴퓨팅 파워의 규모화 상용화”에서 이룬 이정표급 사건이며, FlagOS의 소프트웨어 스택 포지셔닝과 직접적으로 관련된다——10만 카드급 클러스터가 실제 구축되려면 크로스칩 훈련/추론 시스템 소프트웨어 스택이 필수 항목이고, FlagOS의 멤버 단위 매트릭스(Moore Threads는 초기 멤버)와 JD Cloud의 “전 업계 컴퓨팅 파워 개방” 포지셔닝 사이에는 명확한 접점이 존재한다. 또한 클러스터가 체화 지능을 핵심 분야로 명시한 점에 주목할 필요가 있으며, 이는 FlagOS-Robo의 포지셔닝(본 호 1.6 지원 매트릭스에 KERV 신규 추가)과 같은 방향이다.
3.2 Enflame: 9월 11일 STAR Market 상장, 공모가 142.18 위안/주(09-09)
출처: Guandian/Sina Finance: Enflame 테크놀로지 주식 9월 11일 STAR Market 상장(09-09 19:34), JRJ: 공모가 142.18 위안/주(09-09), Lieyunwang, Sohu 인용(09-09)
- 9월 9일 저녁 Enflame 공고: 주식이 2026년 9월 11일 상하이증권거래소 커촹반에 상장될 예정이며, 종목 코드는 688801, 발행가는 주당 142.18 위안, 발행 수량은 4303만 5173주(발행 후 총 주식의 10%)이다.
- 회사는 2026년 1-9월 영업수익이 23억 위안에서 30억 위안에 이를 것으로 예상하며, 전년 대비 325.78%에서 455.36% 성장할 전망이다. 발행가는 2025년 희석 후 정적 시가매출비율(P/S) 61.80배에 해당한다. 공고일 기준 아직 흑자를 내지 못했으며, 상장 후 커촹 성장층에 편입된다.
- 이번 IPO는 60억 위안 조달을 계획하고 있으며, 5세대와 6세대 AI 칩 시리즈 제품의 연구개발 및 산업화에 사용될 예정이다. 상장 후 “국산 GPU 4강”(Moore Threads, MetaX, Biren, Enflame)이 자본시장에 모두 모이게 된다.
- FlagOS 관련 측면 기록: Enflame은 09-09 보고 기간에 처음으로 FlagScale 훈련 CICD(ZIXIAOC200 칩 이미지 계약)에 진입했으며, 이전 기록은 build-infra의 sglang 0.5.18 딜리버리 라인에 집중되어 있었다.
해석: Enflame의 상장 자체는 자본시장 이벤트이지만, FlagOS 생태계에 실질적 의미가 있다——구성원 기관이 60억 위안 규모의 조달 자금을 확보한 후 소프트웨어 스택 측 투자(FlagTree 백엔드, vllm/sglang 플러그인, build-infra 딜리버리 라인)는 통상 그에 따라 강화된다. 훈련 측 CICD가 바로 이전 모니터링 기간에 막 보완되었다는 사실과 결합하면, Enflame의 2.2 및 후속 버전 칩 매트릭스 참여도는 추적할 가치가 있다.
3.3 Hygon: Token 운영 “듀얼 칩” 가속 솔루션, CPU+DCU로 토큰 폐루프 관통 (09-09)
출처: Sina Finance: Hygon, Token 운영 “듀얼 칩” 가속 솔루션 중대 발표 (09-09), NetEase: Hygon, AI 컴퓨팅 혁신 아키텍처 최초 공개 (08-27 발표, 토큰 경제 주제)
- Hygon Information은 Token 운영을 겨냥한 “듀얼 칩” 가속 솔루션을 발표했다: Hygon CPU를 지능형 스케줄링 중추로, DCU를 가속 컴퓨팅 엔진으로 삼아 두 칩이 협력하여 Token “생산 — 스케줄링 — 계량 — 원가 산정 — 애플리케이션 수익화 — 재구매 확장” 비즈니스 폐루프를 관통하며, 주로 운영 시나리오에 적합하다.
- 이 솔루션은 8월 말 수치엑스포에서 최초 공개한 “Agent to Token 개방형 컴퓨팅 아키텍처“의 구현 형태이다: CPU는 Agent 비즈니스 흐름의 허브(데이터 전처리, 멀티 에이전트 샌드박스 격리, 태스크 오케스트레이션, 메모리 계층형 저장, 벡터 DB 검색의 5대 모듈)를 담당하고, DCU는 토큰 생성 측 병렬 가속(배치 디코딩, KV 캐시 최적화, 장시퀀스 지원)을 담당한다. 아키텍처는 컴퓨팅 파워, 인터커넥트(자체 개발 HSL), 보안, 소프트웨어 스택의 네 차원에서 개방되며, 소프트웨어 스택 측은 이미 100여 종의 주류 AI 프레임워크에 적응되었다고 밝혔다.
- FlagOS 관련 측면 기록: Hygon dtk26.04는 이전 모니터링 기간 build-infra에서 기록량이 가장 많은 벤더 라인이었으며(sglang 0.5.18 + vllm 0.20.2 듀얼 프레임워크 폐루프), 이번 모니터링 기간 build-infra의 changelog 베이스라인과 FlagGems-Experimental의 Hygon 전용 flash attention 연산자(1.3)는 모두 그 생태계 추진에 속한다.
해석: Hygon의 솔루션은 “Token 경제”를 컴퓨팅 제품의 서사 프레임으로 삼고 있으며, 베이징시 “15·5” 계획의 “토큰 결산 체계 구축, 토큰 팩토리 조성” 정책 표현(본 기간 2.1)과 높은 호응을 이룬다——즉 구성원 기관의 제품 서사와 지방 정책 방향이 이미 동일한 담론 층위에서 정렬된 것이다. FlagOS 입장에서 Hygon DCU 백엔드는 본 기간에 “전용 flash attention 연산자 입고”와 “Token 폐루프 솔루션 발표” 두 가지가 동시에 나타났으며, 소프트웨어 스택 측의 연산자 보완과 그 상업적 서사는 함께 추진되고 있다.
3.4 MetaX와 Moore Threads: 보호예수 해제와 2차 시장 변동성 (09-09)
출처: East Money: MetaX 1396만 6000주 보호예수 주식 9월 17일 해제 (09-09), Sina Finance: Moore Threads 주가 사상 최저치 재경신 (09-09)
- MetaX 공고: 약 1396만 6000 주의 제한 매도 주식(총 자본금의 3.4906%)이 9월 17일부터 상장 유통되며, 이는 이전 해제 창구의 연장입니다.
- Moore Threads는 9월 9일 주가가 상장 이래 최저치를 기록했고, 하루 시가총액이 약 488억 위안 증발했으며, 여러 매체가 해제 창구와 관련이 있다고 보도했습니다. 같은 기간 MetaX 주가도 5개월 반 만에 최저치를 기록했습니다.
- 섹터 차원: 9월 9일 과학혁신종합지수, 과학혁신 AI, 과학혁신 칩 등 ETF 중점 보유 종목이 전반적으로 하락했으며, Cambricon, Hygon, MetaX 등이 모두 하락 구성 종목에 포함되었습니다.
해석: 본 항목은 FlagOS 소프트웨어 생태계와 직접적인 기술 연관이 없으므로 기존 기준에 따라 배경 기록으로만 남기고 기술 항목에 포함하지 않습니다. 주목할 점은 리듬입니다. Moore Threads가 10만 카드 대형 수주를 발표한 같은 날 주가가 상장 이래 최저치를 기록했다는 것은 자본시장의 국산 GPU 가격 결정 논리와 산업 주문 실행 사이에 뚜렷한 시차가 존재함을 보여줍니다. 커뮤니티 입장에서 이런 변동은 build-infra 전달 라인과 FlagGems 벤더 백엔드의 진행 리듬에 영향을 주지 않습니다(이번 기간 Moore Threads 측은 여전히 MThreads 백엔드 16개 연산자와 2개 Megatron 애플리케이션 이미지 등록을 유지).
4. 요약
이번 모니터링 기간(09-09 10:18 ~ 09-10 10:18) GitHub 측은 기간 내 135개 커밋, 18개 저장소 푸시로 엔지니어링 측은 높은 활기를 유지했습니다. 뉴스 측 컴포넌트급 검색은 여덟 번째 연속 조용한 기간이었지만, 정책 측에서 중량급 항목 하나가 나타났습니다. 네 가지 주요 흐름:
- 정책 차원에서 FlagOS가 베이징시 5개년 계획 텍스트에 진입(이번 기간 가장 중요한 변화): 베이징시 “15차 5개년” 디지털 경제 계획이 “RISC-V 지능형 컴퓨팅 명령어 세트 혁신을 강화하고, Zhongzhi(FlagOS) 오픈소스 생태계 구축을 심화하며, Lingji(LinkeeOS) 에이전트 운영체제를 배치한다”고 명확히 밝혀, FlagOS를 10만 카드 클러스터 구축 역량, 신창 소프트웨어·하드웨어 융합과 같은 정책 문장 안에 함께 넣었습니다. FlagOS가 베이징시 5개년 계획급 문서에 처음 등장한 것으로, 그 역할이 “Zhiyuan/BAAI가 주도하는 오픈소스 프로젝트”에서 시급 자주통제 가능 컴퓨팅 인프라의 시스템 소프트웨어 스택 담체로 상승했습니다.
- build-infra가 Ascend 910C 백엔드 접속을 완료하고 60개 앱 이미지의 changelog 기준선을 구축: 910C는 “910B 라인 칩 동형 변형” 방식으로 접속되었으며(Containerfile 바이트급 재사용, A3 ops token만 교체),
deps_app부재를 이용해 의도적으로 앱 빌드 매트릭스 밖에 차단했습니다. 60개 이미지 changelog + push 게이팅은 전달 기록을 “이미지별 변경 이력 + 강제 사유 설명”으로 업그레이드했습니다. 전달 측의 감사 면과 칩 매트릭스가 같은 기간에 확장되었습니다. - 연산자 매트릭스는 높은 흐름 속도를 유지하고, 벤더 전용화는 계속 우측으로 이동: 메인 저장소 39개(KernelGen Nvidia 약 25개, KMCompiler Iluvatar/Ascend/Metax, QC XuanTie PPU 양자화 연산자, GLU TLE 자동 튜닝), 실험 저장소 60개(Iluvatar 약 36, MThreads 약 16, Ascend 3, Hygon 2). Hygon 전용
_flash_attention_forward입고, Damo Academy XuanTie PPU fused persistent_topk(2394줄) 정식 등록이 두 가지 대표적 노드입니다. CI 측도 동시에 강화되었습니다(three-dot diff, rule-check-required, 동시성 제어). - 회원 단위의 상업화와 생태계 두 라인이 동시에 추진: JD Cloud는 Moore Threads GPU를 기반으로 10만 카드 풀기능 GPU 클러스터를 구축한다고 발표했습니다(국산 GPU가 처음으로 대형 클라우드 업체의 핵심 클러스터에 진입했으며, 엠바디드 AI를 명확히 포함). Enflame은 9월 11일 과학혁신판 상장(60억 위안 조달 계획, 5세대/6세대 칩에 투자). Hygon은 Token 경영 “듀얼 칩” 가속 솔루션을 발표해 베이징의 “워드 토큰 팩토리” 정책 표현과 같은 주파수에 맞췄습니다. 소프트웨어 측과 상업 측의 추진 리듬이 이번 기간에 뚜렷하게 맞아떨어졌습니다.
예측: 이후 관찰 면은 세 가지입니다. 첫째, Ascend 910C가 언제 deps_app을 보충해 앱 빌드 매트릭스에 진입하는지(이 동작은 910C 전달 사용 가능을 표시함). 둘째, 2.2 GA(09-24 테스트 기간 마감) 전후의 release-info/community 목록 작업, 그리고 FlagGems v5.4.0 rc 시리즈가 정식 버전으로 진행되는지(현재 최신 tag는 여전히 v5.4.0-rc1.post1). 셋째, 베이징시 계획 실행 후의 커뮤니티 측 지원 동작(“국산 선진 컴퓨팅 반복 검증 플랫폼”과 FlagOS 검증 매트릭스의 연결 방식, RISC-V 백엔드 비중이 상승하는지).
부록: 전체 출처 목록
| 출처 | 검증 결과 |
|---|---|
| GitHub org repos API(flagos-ai, 52개 저장소) | 모니터링 기간 내 푸시된 저장소 18개: FlagGems, build-infra, FlagCX, FlagGems-Experimental, FlagTree, FlagGems-vllm, FlagGems-sglang, FlagSparse, vllm-plugin-FL, FlagBLAS, FlagOS-Robo, libtriton_jit, FlagScale, FlagAttention, sglang-plugin-FL, docs, FlagTree-AscendNPU-IR, release-info; 신규 저장소 없음 |
| GitHub commit search(org 전체 135건, 5페이지, sort=committer-date) | 14개 저장소의 기본 브랜치에 실질 병합, committer 시간과 저장소 귀속을 건별 검증: FlagGems-Experimental 60 / FlagGems 39 / build-infra 9 / FlagBLAS 8 / FlagTree 4 / FlagCX 2 / FlagGems-sglang 2 / vllm-plugin-FL 2 / FlagSparse 2 / FlagOS-Robo 2 / FlagAttention 2 / libtriton_jit 1 / FlagScale 1 / FlagGems-vllm 1 |
| GitHub 브랜치 API + per-repo commits 재검증 | sglang-plugin-FL(pushed 09-10 10:16 베이징 시간), docs, FlagTree-AscendNPU-IR, release-info 네 저장소가 모니터링 기간 내 푸시되었으나, 기본 브랜치에 모니터링 기간 내 커밋이 없고 브랜치 목록에도 모니터링 기간 내 커밋이 없어 PR 브랜치 참조 동작으로 판정 |
| GitHub commit 상세 | build-infra #803(910C 듀얼 백엔드, 7개 파일), #801(60개 changelog, 60개 파일), #799/#800(mthreads Megatron app image tag); FlagGems-vllm #754(thead fused persistent_topk, 2394줄); FlagGems-Experimental #597/#598(Hygon 연산자) |
| GitHub tags/releases API | 이번 모니터링 기간 내 신규 컴포넌트 릴리스 없음. 최신 tag: FlagGems v5.4.0-rc1.post1, build-infra v2.1.1, FlagCX v0.14.0-rc1.post1, FlagTree v0.4.0, FlagGems-vllm v0.2.0-rc1.post1, vllm-plugin-FL v0.3.0-rc1.post1, FlagBLAS v0.3.0-rc1.post1, FlagOS-Robo v0.1.0 |
| Google News RSS(중영문 20개 검색어, 프록시 경유) | 컴포넌트 키워드 모니터링 기간 내 히트 0건(여덟 번째 연속 조용한 모니터링 기간); “FlagOS when:1d”는 베이징시 계획 전재 기사 1건 히트(정책 항목으로 별도 수록); 멤버 기관 키워드는 상장/해제/주가/자금 흐름 등 자본시장 뉴스로 히트되어 기존 기준에 따라 기술 항목에서 제외 |
| HN Algolia(FlagOS/FlagGems/FlagScale/FlagTree/BAAI) | 네 개 컴포넌트 키워드 히트 모두 “flags/flagship” 부분 문자열 오매칭된 무관한 Show HN 항목으로, 전체 제외 |
| Tavily/web 검색 | 베이징시 “15차 5개년” 디지털 경제 계획 원문 표현 검증(증권시보/동팡차이푸/차이롄서/시나랑 3개 출처 교차 확인); 징둥윈 10만 카드 클러스터(신징바오/신화차이징/난두 3개 출처); Enflame 상장 공고(관뎬왕/진룽제/례윈왕 3개 출처); Hygon Token 운영 방안(시나차이징) |
| FlagOS CSDN 공식 계정(flagos.csdn.net) | 신규 글 없음, 최신은 여전히 08-28 GLM-5.3-Flash Day0 9개 칩 적응; 09-07 KubeCon 포럼과 09-03 연산자 대회 다시보기 지속 게재, KernelGen 연산자 튜닝 주제 페이지는 게시 시점 업데이트 없음 |
| Zhiyuan 커뮤니티(hub.baai.ac.cn) | 모니터링 기간 내 23건 히트 모두 일반 콘텐츠(AI+제약, CV 논문 리뷰, AI 분쟁 재판, AI Native R&D 조직 등)로 FlagOS 기술 스택과 직접적 관련 없음 |