FlagOS 데일리 리포트 (2026-09-09)
모니터링 기간: 2026-09-08 10:18 ~ 2026-09-09 10:18 베이징 시간 출처: GitHub(org: flagos-ai 52개 저장소 pushed_at + commit search 72건 전량 committer-date 기준 검증 + 기본 브랜치 per-repo 재확인 + PR 상세 + git ls-remote 브랜치 검증), Google News RSS(중영문 18개 쿼리어, 프록시 경유), HN Algolia, Tavily/web 검색, FlagOS CSDN 공식 계정(상세는 부록 참조)
인덱스
-
- 오픈소스 프로젝트 진척(GitHub 동향)
- 1.1 FlagGems 메인 저장소: KMCompiler 크로스칩 linalg 연산자, QC 양자화 연산자 및 MTHREADS 일괄 튜닝(09-08)
- 1.2 FlagGems-Experimental: KernelGen 연산자 흐름 12건 + CICD 4건 기본 브랜치 infra-ci에 머지(09-08)
- 1.3 FlagScale: Enflame ZIXIAOC200 및 Kunlunxin P800 학습 지원 CICD 진입(09-08)
- 1.4 FlagCX: PTD(prefill/transfer/decode) 프로파일링 도구 추가 및 PAL 포인터 분류 강화(09-08/09-09)
- 1.5 FlagGems-vllm: fp8/fp4 paged MQA logits(TLE), fused-add-RMSNorm 최적화 및 KMCompiler 등록 리팩터링(09-08)
- 1.6 기타 컴포넌트: FlagTree 두 건 수정, FlagBLAS Ascend L2 지속, FlagSparse 업스트림 동기화 및 spmm CSC 최적화, FlagAttention 및 FlagPrism(09-08/09-09)
- 오픈소스 프로젝트 진척(GitHub 동향)
-
- 뉴스 보도 및 생태계
- 2.1 컴포넌트급 뉴스 일곱 번째 연속 정온 기간; Zhiyuan 기관 동향 한 건(09-08)
- 2.2 최근 3일 추세(엔지니어링 측)
- 뉴스 보도 및 생태계
-
- 회원사 심층 분석
- 3.1 Hygon: dtk26.04 듀얼 프레임워크(sglang 0.5.18 + vllm 0.20.2) 납품 폐쇄 루프(09-08/09-09)
- 3.2 Qingwei: vllm-plugin-FL #460 메인라인 활성화 진행 중, 메인라인 이미지 납품 등록(09-08/09-09)
- 3.3 Moore Threads: FlagGems MTHREADS 다섯 건 연산자 최적화 + Megatron-LM-FL 신규 CI 브랜치(09-08/09-09)
- 3.4 Enflame 및 Kunlunxin: 학습 측 최초 FlagScale CICD 진입(09-08)
- 3.5 MetaX: llm-d(CNCF) Xiyun C 시리즈 적응, 국산 GPU 최초 해당 생태계 진입(09-08)
- 회원사 심층 분석
-
- 요약
- 부록: 전체 출처 목록
1. 오픈소스 프로젝트 진척(GitHub 동향)
기간 총람: org 내 52개 저장소 중 17개가 기간 내 푸시 발생; commit search 히트 기간 내 커밋 72건, 11개 저장소 기본 브랜치 실질 머지에 분포(build-infra 14, FlagGems 18, FlagGems-Experimental 16, FlagSparse 7, FlagBLAS 4, FlagCX 3, FlagGems-vllm 3, FlagTree 2, FlagScale 2, FlagAttention 2, FlagPrism 1); 별도로 6개 저장소(TransformerEngine-FL, Megatron-LM-FL, vllm-plugin-FL, sglang-plugin-FL, docs, release-info)의 기간 내 푸시는 기본 브랜치 재확인 및 ls-remote 검증 결과 PR 브랜치/릴리스 브랜치 작업으로 확인. 신규 저장소 없음, 컴포넌트 릴리스 없음. 본 기간 형태 = RC1 분기(09-07) 이후 첫 완전 납품 기록 기간: community 및 각 컴포넌트 기본 브랜치가 “수정만 수용”하는 테스트 안정화 기간에 진입, 가장 밀집된 작업은 build-infra(14건 납품 기록 및 엔지니어링 자동화)에 집중, 컴포넌트 코드 측은 연산자 매트릭스 우측 이동과 툴체인 신규 역량 지속. 직전 기간(09-08 리포트)이 RC1 manifest 및 첫 rc1.post1 tag 파도를 막 기록한 상황에서 본 기간 엔지니어링 측 작업 리듬은 이와 연결: 검증 매트릭스 가동, 각 벤더 라인별 이미지 tag 순차 기록.
1.1 FlagGems 메인 저장소: KMCompiler 크로스칩 linalg 연산자, QC 양자화 연산자 및 MTHREADS 일괄 튜닝(09-08)
출처: FlagGems commits (09-08 13:43~19:51, 18건), linalg_matrix_exp #6069, linalg_matrix_power #5951, MetaX GRU #6059, QC PPU FP8 TopK #5966, QC Ascend RMSNorm #5968, Hopper sm90 수정 #6075
- KMCompiler/KernelGen 생성 연산자 지속 저장소 반영 (4건):
linalg_matrix_exp는 한 번에 NVIDIA/Ascend/Hygon/Thead/MetaX/iluvatar 7개 백엔드를 커버(#6069, 19:51);linalg_matrix_power는 NVIDIA + Thead에 반영(#5951); MetaXgru연산자(#6059); NVIDIAcudnn_convolution_transpose(#4363, Triton kernel). - 신규 fused 연산자와 양자화 연산자:
post_layer_norm_residualfused 연산자 신규 추가(#4930); SiLU는 Ascend/MetaX 대상 최적화(#5565); QC 측 Ascend INT8 W8A16 RMSNorm(#5968)과 PPU W8A16 FP8 TopK(#5966) 두 양자화 연산자가 같은 날 병합. - Moore Threads(MTHREADS) 5연속: fp32 conv_transpose2d k3(#5879), cudnn_convolution no-bias 경로(#5834), one_hot 검증과 scatter 경로(#5833), isin Tensor_Scalar(#5977), bmm SQMMA 튜닝(#5909).
- 정확성 수정 (테스트 안정기 특징): broadcast_tensors 제로 크기 차원 형상 계산(#6024); Hopper sm90에서
_attn_bwd런타임 크래시 방지(#6075); flash_attention decode backward에서 AABS가 tl.dot을 깨뜨리는 문제 수정(#6077); mm w8a8 fp8 독립 benchmark 진입점(#6084); weekly CI에 workflow dispatch 제어 추가(#5919).
해석: 단일 연산자 linalg_matrix_exp를 KMCompiler가 한 번에 7개 백엔드 구현으로 산출한 것은 “연산자 자동 생성→멀티 칩 동시 반영” 파이프라인 역량의 직접적인 표본이다——이것이 바로 2.2 테스트 기간 연산자 매트릭스가 계속 우측으로 이동할 수 있는 이유다(생성기가 연산자를 보충하는 것이 수작업보다 한 자릿수 빠르다). QC 양자화 연산자가 Ascend와 XuanTie PPU로 확장되어, 어제 vllm 플러그인 계층의 XuanTie/Hygon fused-MoE 백엔드와 함께 “양자화 정밀도 + 추론 연산자”의 칩별 대응을 형성한다. MTHREADS 단일 모니터링 기간 5건 튜닝은 최근 Moore Threads가 연산자 라이브러리 측에서 가장 집중적으로 진행한 사례다(상세 3.3).
1.2 FlagGems-Experimental: KernelGen 연산자 스트림 12건 + CICD 4건 기본 브랜치 infra-ci에 병합 (09-08)
출처: FlagGems-Experimental commits(기본 브랜치 infra-ci, 09-08 10:46~11:31 CST 16건 병합), linalg.qr #5586, log_normal #5472, Ascend dist #6014, iluvatar OOM 수정 #6070
- 저장소 구조 안내: 해당 저장소의 현재 기본 브랜치는 infra-ci이며(commit search와 기본 브랜치 재확인 모두 이 인덱스를 따름), FlagGems master 이력 미러 + KernelGen 연산자 흐름 실험 커밋을 담고 있다.
- KernelGen NVIDIA 신규 연산자 7건(10:46~10:58): linalg_eig(#5588), special_softmax(#5578), igamma(#5488), special_modified_bessel_i0(#5110), fill_mem_eff_dropout_mask(#5552), fake_quantize_learnable_per_channel_affine_backward(#5543), 그리고 _index_put_impl 수정(#5889). special 함수군(igamma/베셀/softmax 변형)은 이전 모니터링 기간의 주력 범위를 이어간다.
- KMCompiler 다중 칩 5건(11:11~11:23): linalg.qr는 Nvidia/Ascend/Metax/Iluvatar 4개 백엔드를 커버(#5586), log_normal은 7개 백엔드를 커버(#5472), Ascend 측 dist(#6014)와 unsafe_index(#6007) 최적화, iluvatar OOM 수정(#6070).
- CICD 4건(11:31 동일 초 타임스탬프): add sync-to-kernelgen, ci doc, test infra-ci branch, remove owners — 09-07 리포트에서 기록했던 sync-to-kernelgen 워크플로와 동일 계통의 반복 작업으로, 이번에는 4개 커밋 집합 형태로 기본 브랜치 infra-ci 상단에 반영되었다(infra-ci 브랜치 자체 테스트와 owners 정리 포함). 이 크로스 저장소 동기화 파이프라인은 기본 브랜치와 함께 정식 가동된다.
해석: 이전 모니터링 기간(09-07)의 대량 60여 건 병합 이후, 이번 모니터링 기간은 KernelGen 연산자 흐름의 통상 속도 회복(12건/반나절)으로, “배치 동기화”가 일회성 작업이 아니라 지속적 파이프라인임을 입증한다. log_normal, linalg.qr 같은 “다중 백엔드 일괄 산출” 연산자는 1.1 메인 저장소의 linalg_matrix_exp와 동형이며, 실험 저장소와 메인 저장소 사이에 “실험 저장소 검증 → sync-to-kernelgen → 메인 저장소 릴리스”의 분업 폐쇄 루프가 형성되고 있다.
1.3 FlagScale: Enflame ZIXIAOC200과 Kunlunxin P800 학습 지원 CICD 진입(09-08)
출처: FlagScale PR #1275(Enflame, 09-08 10:32 병합), PR #1282(Kunlunxin P800, 10:32 병합)
- #1275(hooray03): Enflame Enflame ZIXIAOC200를 위한 최초 image-build 계약을 수립하고 FlagScale 범용 이미지 CI 프레임워크에 연동 — inference/train/all-in-one 3종 Dockerfile(검증된 Enflame 런타임 기반)과 플랫폼 환경 설정 포함.
- #1282(AlexMa616): Cambricon P800을 위한 학습 CI 및 런타임 지원 추가 — 학습 이미지, 환경 구축, Megatron-LM-FL 통합, 플랫폼 테스트 설정과 GitHub Actions 일체.
해석: 두 건이 같은 분에 병합되면서 FlagScale(학습 스택)의 칩 매트릭스가 “기존 칩 테스트 실행”에서 “신규 칩용 이미지 계약 수립” 단계로 넘어갔다. Enflame은 이전까지 build-infra의 sglang 0.5.18 딜리버리 라인(tops1.9.10)에만 등장했는데, 이번 모니터링 기간은 Enflame이 최초로 FlagScale 학습 CI에 진입한 사례다. Cambricon은 이전까지 KernelGen 연산자 측(digamma/arctan/bernoulli)에서 활동했으며, 학습 측 P800은 완전히 새로운 연동이다. 학습 스택 칩 확장은 2.2 테스트 안정화 기간에 발생했으며, 이는 “신규 기능은 넣지 않되 신규 적응은 넣을 수 있는” 마감 기간의 엔지니어링에 해당한다.
1.4 FlagCX: PTD(prefill/transfer/decode) 프로파일링 도구 추가 및 PAL 포인터 분류 강화 (09-08/09-09)
출처: FlagCX PR #567(09-08 18:07 병합), #569(20:11), #571(09-09 00:15)
- #567 PTD 분석 도구:
tools/PTD신규 추가 — vLLM과 SGLang 상의 P/D(Prefill/Decode) 분리 추론을 위한 오프라인 Prometheus + Grafana 프로파일링 스택으로, 런타임 중 수집된 /metrics 스냅샷을 재생하면 prefill/transfer/decode 세 구간 소요 시간을 프로파일링할 수 있으며 온라인 연동이 필요 없다. - #569 CICD: 하드웨어 단위 테스트 컨테이너 실행 방식을 통일.
- #571 PAL: 병렬 추상화 계층에 견고한 디바이스 포인터 분류(device pointer classification)를 추가.
해석: FlagCX는 2.2 주기 내 컴포넌트 동작이 많지 않았으며(직전 실질 병합은 rc0 전의 PAL/통신 기능), 이번 모니터링 기간의 세 건은 관측성과 툴체인에 집중되어 있다. PTD 프로파일링 도구는 vLLM 0.20.2 라인의 P/D 분리 딜리버리(vllm-plugin-FL의 어제 Prometheus KV-transfer 지표, FlagCX 커넥터)와 함께 “P/D 분리 배포 관측” 조합을 구성한다 — 멀티칩 매트릭스 테스트 기간에 P/D 토폴로지를 돌릴 때 이 도구는 통일된 소요 시간 귀인 수단을 제공한다.
1.5 FlagGems-vllm: fp8/fp4 paged MQA logits(TLE), fused-add-RMSNorm 최적화 및 KMCompiler 등록 리팩터링 (09-08)
출처: FlagGems-vllm #698(11:28), #722(11:30), #748(17:25)
- #698: fp8/fp4 paged MQA logits의 TLE kernel(add-fp8_fp4_paged_mqa_logits-tle) 신규 추가 — 양자화 paged 어텐션 logits 계산의 TLE 백엔드 구현.
- #722: fused add rms norm 최적화.
- #748: KMCompiler 측 리팩터링 — 각 백엔드의 moe_align_block_size를 fused
__init__을 통한 통합 등록으로 변경(어제 #747에서 KMCompiler 생성 경로를 vLLM native op 의존에서 벗어나게 한 자체 테스트 개편을 이어받음).
해석: vllm 플러그인 계층의 kernel 보강(fp8/fp4 logits, fused norm)과 KMCompiler 등록 메커니즘 정렬이 병행 추진되고 있다. paged MQA logits는 양자화 추론 경로상의 핫스팟 kernel이며, TLE 버전은 해당 kernel이 다중 칩(비 NVIDIA) 백엔드에서 컴파일·실행될 수 있음을 의미한다. 이는 어제의 XuanTie/Hygon fused-MoE 백엔드와 마찬가지로 “kernel별 벤더화” 엔지니어링에 속한다.
1.6 기타 컴포넌트: FlagTree 2건 수정, FlagBLAS Ascend L2 지속, FlagSparse 업스트림 동기화 및 spmm CSC 최적화, FlagAttention과 FlagPrism (09-08/09-09)
출처: FlagTree #1125 (12:59), #1129 (09-09 10:18), FlagBLAS Ascend SSYR2 (#100), FlagSparse PR #54 (NCIC-AlphaSparse), FlagAttention #54, FlagPrism #9 (21:02)
- FlagTree (2건): #1125는 nvidia3.6에서 tle_supported 목록을 수정 (12:59), #1129
[FlagTune]은 CUDA graph 벤치마크에서 caller-stream 호출 순서를 유지 (09-09 10:18 병합, 모니터링 기간 종점에 근접). 기본 브랜치는 지난 모니터링 기간 #1115 이후 첫 실질 병합. - FlagBLAS (4건): Ascend L2 루틴 후속 작업 — SSYR2 (#100, 11:45 병합)와 CHEMV tile 레이아웃 업데이트 (#101, 16:27 병합)로, 어제의 CHER/CHER2/SSYR/CSYR 루틴별 보완 라인을 이어감.
- FlagSparse (7건): PR #53 (zyq1105331849, “New update”, 12:30 병합, 3건의 merge_adapt 커밋 포함)과 PR #54 (NCIC-AlphaSparse 공식 계정, “metax and cuda opt”, 15:55 병합) — CAS AlphaSparse 팀이 업스트림한 metax/cuda 최적화가 지속적으로 메인 저장소로 동기화됨, 실질적 신규 개발은 15:42의 spmm CSC CUDA 최적화.
- FlagAttention (2건): #54 (huangyiqun, 13:34 병합)에서 conf/와 tools/ 디렉터리 추가.
- FlagPrism (1건): #9 (21:02)에서 중영 이중 언어 README 갱신.
해석: 각 컴포넌트의 기본 브랜치는 RC1 이후 “소규모 수정 + 디렉터리/문서 정리” 리듬을 보인다. FlagTree는 빌드 및 튜닝 도구 수정으로 복귀, FlagBLAS는 Ascend L2 지속, FlagSparse는 양방향 동기화(외부 업스트림 유입, 로컬 개발 유입), FlagPrism은 이중 언어 README로 어제 #8 (debugger/profiler) 병합과 연결 — 신규 컴포넌트의 GA 전 문서화 준비 신호다.
2. 뉴스 보도와 생태계
2.1 컴포넌트급 뉴스 7번째 연속 조용한 모니터링 기간, BAAI 기관 동향 1건 (09-08)
출처: Google News RSS (중영 18개 검색어, 프록시 경유), HN Algolia, FlagOS CSDN 공식 계정 (flagos.csdn.net), BAAI 커뮤니티 gnews 항목 (09-08)
- gnews 구성 요소 키워드(FlagOS/FlagGems/FlagScale/FlagTree/FlagCX/FlagAttention/FlagPerf/KernelGen/FlagOS-Robo/FlagQuantum, when:7d~14d 중영) 모니터링 기간 내 제로 히트 — 구성 요소 수준 뉴스는 09-03 이후 일곱 번째 연속 조용한 기간입니다. HN Algolia의 두 건 히트는 모두 “flags/flagship” 부분 문자열 오매칭인 Show HN 무관 항목( cmd 보안 경고 도구, 사이트 AI 냄새 감지)이므로 제외했습니다.
- CSDN 공식 계정 신규 글 없음: 최신 콘텐츠는 여전히 09-07 상하이 KubeCon 포럼 공지(어제 보고)이며, 해당 라이브 다시보기 페이지는 모니터링 기간 내에도 상호작용이 있습니다. “Suanzidao”SGLang 대회(09-03 시작)와 verl 기술 라이브(08-27) 다시보기는 계속 게시되어 있으며, 신규 활동 공지는 없습니다.
- Zhiyuan 기관 동향 한 건: Zhiyuan 연구원이 기관 회원 자격으로 유엔 글로벌 콤팩트 조직 “일대일로” 행동 플랫폼 전문가 그룹에 가입했습니다(Zhiyuan 커뮤니티 09-08 발표). 이 플랫폼은 2020년 UNGC가 발족했으며, 2026년 6대 전문가 워킹 그룹을 설립했습니다. Zhiyuan이 기관 자격으로 전문가 그룹에 참여한 것은 연구원의 국제 생태계 배치 움직임이며, 이전에 보고된 UNDP 중아프리카 AI 세미나(08-26, Zhiyuan 주최)와 동일한 서사선에 속합니다. FlagOS 구성 요소와 직접적 연관은 없으며, 기관 동향 기록으로만 남깁니다.
- 회원사 자본시장 뉴스 일괄 제외(어제 기준과 동일, 미수록): Moore Threads 20% 하한가/시가총액 신저가/홍콩 비밀 상장 신청 소문, Enflame 발행 결과(온라인 청약 6100배 초과)와 상장 절차, MetaX 보호예수 해제, Hygon Information 자금 흐름 등은 모두 FlagOS 소프트웨어 생태계와 직접적 연관이 없습니다.
2.2 최근 3일 추세(엔지니어링 측, GitHub org pushed 입증)
- 09-07: FlagOS 2.2 RC1 manifest 분기 + 12개 저장소 첫 rc1.post1 tag 웨이브; FlagScale KERV 구현체 추론 디코딩 학습/추론 통합 + Megatron-LM v0.18.2 두 저장소 정렬; FlagGems-Experimental 일괄 60+건 KernelGen 연산자 입고(모두 보고됨).
- 09-08: Iluvatar CoreX 0.20.2 결정성 확정(flag_gems GEMM 계열 전체 블랙리스트, 30/30 확정), sglang 0.5.18 다중제조사 라인 기록 폐쇄 루프(MetaX/Cambricon/Ascend), Tsingmicro txda vllm-plugin-FL main 라인 병합(모두 보고됨).
- 09-08 10:18 ~ 09-09 10:18(본 모니터링 기간): build-infra 단일 기간 14건 딜리버리 기록(Hygon dtk26.04 듀얼 프레임워크, Tsingmicro 메인라인 이미지, provenance 태그 자동화); FlagGems 계열 연산자 매트릭스 30건 병합; FlagScale 학습 CICD Enflame/KunlunXin 확장; FlagCX PTD 도구(본 절에서 상술).
3. 회원사 심층 분석
3.1 Hygon: dtk26.04 듀얼 프레임워크(sglang 0.5.18 + vllm 0.20.2) 딜리버리 폐쇄 루프(09-08/09-09)
출처: build-infra #785(flagtree 0.6.2a1), #792(sglang 0.5.18 F/T 검증 기록), #795(vllm 0.20.2 deps_app 개통), #798(vllm app tag 등록)
- 이 모니터링 기간 build-infra 14건의 기록 중 8건이 Hygon dtk26.04 라인에 속하며, 전 경로에 걸쳐 전개되고 있다:
- 의존성 고정: #785는 Hygon 측 flagtree를 0.6.2a1로 고정한다(manifest 메인라인 flagtree 0.7.0rc1 계열과 분리 관리됨에 유의); #787/#788은 sglang deps_app에 대해 torchvision 0.24.0과 compressed-tensors를 고정한다.
- sglang 0.5.18 라인: #792(09-09 01:16) docs는 dtk26.04의 sglang 0.5.18 F/T 이중 경로 검증 통과를 기록한다; #793은 on-node 검증의 제어된 serve args를 수정한다; #794는 sglang app 이미지 tag
2.1.2-0.1.dev1_g440208beb를 등록한다. - vllm 0.20.2 라인: #795(09-09 07:50)는 hygon의 vllm 0.20.2 deps_app을 개통한다; #796/#798은 두 개의 app 이미지 tag(
2.1.2-0.2.1_g13eb9be와g14cf11d, 모두 d20260908, 지문이 순차적으로 갱신됨)를 등록한다.
- 엔지니어링 자동화: #791(22:04)는 app 이미지에 대해 통일적으로 자체 provenance 라벨을 부착한다(워크플로우 수준); #797(08:21)은 검증 매트릭스를 YAML에서 자동 새로고침하여 status-matrix에 반영한다——기록 방식이 수동 docs에서 자동화로 나아간다.
해석: 어제 리포트는 “build-infra의 기록 빈도가 RC 진행의 최적 대리 지표”라고 예측했는데, 이 모니터링 기간에 즉시 실현되었다: 14건의 기록 중 8건이 Hygon이다. Hygon은 동일 모니터링 기간 내에 sglang 0.5.18과 vllm 0.20.2 두 프레임워크 검증 기록 + 두 버전 이미지 tag를 모두 폐루프한 첫 번째 벤더 라인이며, 이는 어제 0.20.2 확정 판정(GEMM 블랙리스트 노선) 이후에 발생했다——확정 판정 이후의 정상 납품 흐름이 이미 회복되었음을 의미하며, 이미지 지문 g13eb9be→g14cf11d의 갱신은 플러그인 소스 코드 반복에 대응한다. Hygon 측 flagtree는 메인라인 0.7.0rc1이 아닌 0.6.2a1을 사용하는데, 이는 벤더 환경과 2.2 manifest 메인라인의 컴파일러 버전 간 분리 관리가 존재함을 시사한다(확정성 과제의 엔지니어링 측 대응 중 하나).
3.2 Tsingmicro: vllm-plugin-FL #460 메인라인 활성화 진행 중, 메인라인 이미지 납품 등록(09-08/09-09)
출처: vllm-plugin-FL PR #460(open), build-infra #789(매트릭스가 #460을 가리킴), #790(tsingmicro 메인라인 이미지 tag)
- 플러그인 측: vllm-plugin-FL PR #460(tengqm 제출, base main, head tsingmicro-enable-main)이 진행 중이다——”feat(tsingmicro): enable vllm 0.24.0 on txda (complement #447)”, 즉 어제 이미 병합된 #447(txda 빈 플러그인 골격, vLLM 0.24.0)을 사용 가능한 txda 백엔드 구현으로 완성하는 것이다; 09-08에 갱신이 있었으며, 아직 병합되지 않았다.
- 납품 측: build-infra #789(09-08 20:46)는 tsingmicro runner 매트릭스를 PR #460 브랜치로 향하게 한다; #790(20:54)은 tsm260610의 app 이미지 tag
2.1.2-0.3.0rc0_g2f034ee.d20260908를 등록한다——main 라인 plugin v0.3.0rc0 기반과 #460 브랜치 소스 코드 지문 g2f034ee의 빌드에 기반한다. - 이중 라인 구도: release/0.2(vLLM 0.20.2) 라인의 패치 #450은 여전히 build-infra가 어제 기록한 대로 진행 중이다; main(vLLM 0.24.0) 라인의 #460은 진행 중이지만 이미지는 이미 산출 가능하다.
해석: Tsingmicro의 txda 적응은 명확한 “벤더 자체 추진, 이중 라인 병행” 리듬을 보인다: 컴파일러(FlagTree 백엔드)가 선행하고, 추론 플러그인(txda 빈 플러그인→완성 활성화)이 뒤따르며, 납품 이미지(build-infra 등록)가 병행한다. 주목할 점은 #460이 Tsingmicro 공식 계정이 아니라 tengqm(외부 개발자, Tencent Cloud 배경)에 의해 제출되었다는 점으로, 어제 #447이 tsingmicro-public-e에 의해 제출된 것과 다르다——Tsingmicro 메인라인 활성화에 커뮤니티 개발자 협력의 조짐이 나타나고 있다. #460의 병합 시점이 txda가 2.2 다중 칩 매트릭스 테스트 기간(09-01~09-24)에 맞출 수 있을지를 결정할 것이다.
3.3 Moore Threads: FlagGems MTHREADS 5개 연산자 최적화 + Megatron-LM-FL 신규 CI 브랜치 (09-08/09-09)
출처: FlagGems MTHREADS 커밋(#5879/#5834/#5833/#5977/#5909), Megatron-LM-FL 브랜치 검증(ls-remote)
- FlagGems 메인 저장소: 단일 모니터링 기간 내 5건의 [MTHREADS] 커밋(conv_transpose2d k3, cudnn_convolution no-bias, one_hot, isin, bmm SQMMA 튜닝)으로, 이번 기간 FlagGems 내 각 벤더 백엔드 중 가장 활발하며(18건 중 5건), 연산자 런타임 최적화와 튜닝 파라미터 탐색에 집중되었다.
- Megatron-LM-FL: 기간 내 푸시(09-09 08:45 CST)가 ls-remote 검증 결과 브랜치 작업으로 확인됨——
ci/megatron0171-mthreads-20260909CI 브랜치 신규 추가/갱신(Moore Threads 측 Megatron-LM 0.17.1 CI 라인; 메인 저장소는 어제 Megatron-LM v0.18.2로 업그레이드되었으니, 벤더 라인은 0.17.1 기준으로 분기 관리됨) 및ci/enflame,ci/merge-105-106-107-114등 브랜치.
해석: Moore Threads는 연산자 라이브러리(FlagGems)와 학습 프레임워크(Megatron-LM-FL) 양측에서 동시에 활발함을 유지하고 있다: 연산자 측은 ‘마지막 1마일’ 개별 연산자 튜닝이고, 학습 측 0.17.1 CI 브랜치와 메인 저장소 0.18.2의 버전 차이는 벤더 툴체인의 추종 리듬상 통상적인 현상이다. 시장 측(주가 하한가/홍콩 상장설)과 엔지니어링 측(오픈소스 기여 밀도)이 뚜렷한 대비를 이루며, 엔지니어링 측 기여는 자본 변동의 영향을 받지 않았다.
3.4 Enflame과 Kunlunxin: 학습 측 최초로 FlagScale CICD에 진입 (09-08)
출처: FlagScale #1275(Enflame ZIXIAOC200), #1282(Kunlunxin P800)
- Enflame(회원사): ZIXIAOC200 칩의 image-build 계약이 최초로 FlagScale 범용 이미지 CI(train/inference/all-in-one 세 가지 Dockerfile)에 연결되었다. 이전까지 Enflame은 build-infra의 sglang 0.5.18 딜리버리 라인(tops1.9.10)에만 기록이 있었고 학습 스택 측은 전무했으며, 이번 기간에 학습 측 진입점을 보완했다.
- Kunlunxin(외부 생태계): P800 학습 지원(학습 이미지 + Megatron-LM-FL 통합 + GH Actions). Kunlunxin은 이전에 KernelGen 연산자 측에서 활발했으며(09-07 digamma/arctan/bernoulli 일괄 병합), 학습 측은 완전히 새로운 진입이다.
해석: FlagScale의 ‘신규 칩 이미지 계약’ 방식 진입은 build-infra의 딜리버리 기록보다 더 앞선다——먼저 범용 CI 프레임워크에 계약을 세우고, 이후 라운드별로 검증한다. 2.2 일정(09-24 테스트 윈도 마감)과 결합하면, 이 두 건이 기간 내 첫 학습 검증을 완료할 경우 Enflame/Kunlunxin이 2.2 GA의 학습 지원 매트릭스에 진입할 가능성이 있다.
3.5 MetaX: llm-d(CNCF) Xiyun C 시리즈 적응, 국산 GPU 최초로 해당 생태계 진입 (09-08)
출처: Kuaikeji: 국산 GPU 최초로 CNCF 국제 오픈소스 생태계 진입(09-08)
- llm-d(Red Hat 주도, CNCF 호스팅 클라우드 네이티브 분산 추론 프로젝트로 vLLM/SGLang + Kubernetes 기반, GitHub 4400+ star, 프리픽스 캐시 인식 라우팅, 부하 인식 스케줄링, P/D 분리에 집중)의 공식 가속기 명단에 국산 GPU가 최초로 등장했다: MetaX가 Dynamia AI와 협력하여 Xiyun C 시리즈 적응을 완료했다.
- 세 가지 즉시 사용 경로 제공: Qwen3-14B 단일 카드(TP=1) 기준선, DeepSeek-R1-Distill-Llama-70B 8카드(TP=8) 기준선, Qwen3-14B Prefill/Decode 분리(vLLM NixlConnector + llm-d 라우팅 Sidecar로 KV 캐시 인스턴스 간 전송 연결).
- 성능 교정: 단일 카드 피크 Prefill 처리량 5773 tokens/s, 8카드 5468 tokens/s, 데이터는 llm-d 커뮤니티 공개 교정 매트릭스에 편입되었다.
해석: 이 항목은 FlagOS 컴포넌트와 직접적인 연관은 없지만, 멤버 기관의 오픈소스 생태계에서 중요한 움직임에 해당한다: MetaX는 FlagOS 채널(build-infra sglang 0.5.18 라인, KernelGen/MetaX 연산자) 외에도 국제 CNCF 생태계에 동시에 진출하고 있다. XiYun C 시리즈는 llm-d(본 항목)와 FlagOS 전달 매트릭스(어제 maca3.7.2.1 F/T E2E 기록)에 동시에 등장하며, 멤버 기관이 “FlagOS 통합 스택 + 국제 커뮤니티 직접 연결”의 이중 트랙 생태계 전략을 채택하고 있음을 보여준다.
4. 요약
이번 모니터링 기간(09-08 10:18 ~ 09-09 10:18) GitHub 측은 기간 내 72건 커밋, 17개 저장소 푸시로 엔지니어링 측면에서 높은 활약도를 유지했다; 뉴스 측 컴포넌트 단위 검색은 일곱 번째 연속 평온한 모니터링 기간이다. 네 가지 주요 흐름:
- build-infra 전달 기록 홍수가 RC1 이후 주요 관전 포인트로 부상: 단일 모니터링 기간 14건 기록, Hygon dtk26.04는 sglang 0.5.18 + vllm 0.20.2 듀얼 프레임워크 동일 기간 클로즈드 루프 달성(의존성 핀 고정, F/T 검증 기록, 듀얼 버전 이미지 태그 포함), Tsingmicro tsm260610 메인라인 이미지 태그 등록, 추가로 앱 이미지 provenance 태그 자동 스탬프(#791)와 검증 매트릭스 YAML 자동 새로고침(#797) 두 가지 엔지니어링 자동화를 구현——어제의 “build-infra 기록 빈도가 RC 진행의 최적 대리 지표”라는 예측을 입증했다.
- FlagGems 계열 연산자 매트릭스 지속 우측 이동: 메인 저장소 18건 + 실험 저장소 16건(12건 연산자). 대표적 신호: linalg_matrix_exp가 KMCompiler 단일 연산자에서 일곱 백엔드를 한 번에 산출, QC 양자화 연산자가 Ascend(INT8 W8A16 RMSNorm)와 XuanTie PPU(W8A16 FP8 TopK)로 확장, MTHREADS 5건 튜닝; 실험 저장소 기본 브랜치는 infra-ci로 확인되었고, sync-to-kernelgen 파이프라인이 4개 커밋 세트로 공식 확정되었다.
- 훈련 측 칩 확장: FlagScale CICD 이중 개시——Enflame ZIXIAOC200 이미지 계약(멤버 기관 훈련 측 최초), Kunlunxin P800 훈련 지원(외부 생태계 훈련 측 최초).
- 툴체인과 관측성 신규 기능: FlagCX에 PTD 프로파일링 도구 추가(vLLM/SGLang P/D 분리 추론 오프라인 프로파일링), FlagGems-vllm에 fp8/fp4 paged MQA logits 추가(TLE); Megatron-LM-FL에 Moore Threads 0.17.1 신규 CI 브랜치 등장.
예측: RC1 이후 관찰 면은 계속 검증 매트릭스 기록 밀도와 rc1.postN 증가 리듬에 집중될 것이다(build-infra의 #797 자동화로 매트릭스 새로고침이 빨라져 기록 빈도가 더욱 상승할 수 있음); Tsingmicro #460의 병합 시점이 txda 메인라인이 09-24 이전 다중 칩 매트릭스 테스트 윈도우에 맞출 수 있을지를 결정한다; FlagScale Enflame/Kunlunxin 두 신규 CICD가 모니터링 기간 내 첫 훈련 검증을 완료하면 2.2 GA 훈련 매트릭스에 진입할 수 있다; 컴파일러 결정성 과제(flagtree 엔진 내 컴파일 비결정성, FlagGems #6054-6057 업스트림 인계)는 이번 모니터링 기간 신규 커밋이 없어 계속 추적한다; FlagPrism 이중 언어 README와 docs 저장소 add-auto-sync-docs 브랜치는 GA 전 문서화가 진행 중임을 시사한다.
부록: 전체 출처 목록
| 출처 | 검증 결과 |
|---|---|
| GitHub org repos API (flagos-ai, 52개 저장소) | 17개 저장소가 모니터링 기간 내 푸시됨; 11개 저장소의 기본 브랜치에 실질적 병합(build-infra 14/FlagGems 18/FlagGems-Experimental 16/FlagSparse 7/FlagBLAS 4/FlagCX 3/FlagGems-vllm 3/FlagTree 2/FlagScale 2/FlagAttention 2/FlagPrism 1); 신규 저장소 없음(09-01 이후 created 없음) |
| GitHub commit search (org 전체 72건, 3페이지, sort=committer-date) | 커미터 시간과 소속 저장소를 건별 검증; FlagGems-Experimental 기본 브랜치는 infra-ci(search가 이에 따라 인덱싱) |
| GitHub PR/commit 상세 | vllm-plugin-FL #460 (open, tsingmicro-enable-main); FlagScale #1275/#1282 (Enflame/Kunlunxin CICD, 10:32 동일 분 병합); FlagCX #567 (PTD 도구); FlagSparse #53/#54 (zyq1105331849 / NCIC-AlphaSparse) |
| git ls-remote 브랜치 검증 (6개 저장소) | Megatron-LM-FL: ci/megatron0171-mthreads-20260909, ci/enflame 등 브랜치 활동(기본 브랜치에 모니터링 기간 내 커밋 없음); TransformerEngine-FL/vllm-plugin-FL/sglang-plugin-FL/docs: 릴리스 브랜치 및 PR 브랜치 활동; release-info: gh-pages 푸시(릴리스 사이트) |
| GitHub tags/releases API | 이번 모니터링 기간 내 신규 컴포넌트 릴리스 없음; vllm-plugin-FL 최신 tag는 여전히 v0.3.0-rc1.post1 (RC1 웨이브 산출물) |
| Google News RSS (중영 18개 쿼리어, 프록시 경유) | 컴포넌트 키워드는 모니터링 기간 내 제로 히트; Zhiyuan 관련 키워드는 UNGC “일대일로” 행동 플랫폼 전문가 그룹 기관 동향 1건 히트; Moore Threads/Enflame/MetaX/Hygon 쿼리 히트는 하한가/해제/청약/자금 흐름 등 자본시장 뉴스로 FlagOS 소프트웨어 생태계와 직접적 관련 없어 일괄 제외 |
| HN Algolia (FlagOS/FlagGems/FlagScale/FlagTree) | 2건 히트 모두 “flags” 부분 문자열 오매칭된 Show HN 항목으로 제외 |
| Tavily/web 검색 | MetaX Xiyun C 시리즈 llm-d 적응(Kuaikeji 09-08, 원문 링크); FlagOS 관련은 기존 글(Day0 적응/포럼)뿐 신규 내용 없음 |
| FlagOS CSDN 공식 계정 (flagos.csdn.net) | 신규 글 없음; 09-07 상하이 포럼 다시보기 페이지는 모니터링 기간 내 여전히 인터랙션 존재; 대회/라이브 다시보기 지속 게재 |
| flagos.io / hub.baai.ac.cn | 모니터링 기간 내 신규 공지 없음 |