모니터링 기간: 2026-09-25 10:00 ~ 2026-09-28 10:00 (약 72시간; 월요일 기간, 주말 포함; 09-25 데일리 리포트 기간을 이어받아 공백 없음) 출처: GitHub (org: flagos-ai, 54개 저장소 pushed_at 전수 확인, 기간 내 15개 저장소 활성; 커밋 검색 173건, 11개 저장소에 걸침, 추가로 FlagGems P1 테스트 배치, FlagFFT dev, Megatron-LM-FL 0.3.0-rc2, FlagTree 두 개 기능 브랜치, FlagScale 2.1.0-rc2 등 6개 브랜치 라인을 개별 확인; community #114/#115와 build-infra PR 원문을 항목별 대조; release-info 포털 배포 기록을 항목별 확인), Google News RSS (중영문 26개 검색어 그룹, 프록시 경유), 长沙晚报 / 华声在线 / 智源社区 / 凤凰网 / 量子位 / 新浪科技 등 보도 (자세한 내용은 부록 출처 목록 참조)


이번 호 인덱스

  • 오늘의 중점: 2.2 GA 일 (09-28) — 기간 내 최종 정비: Megatron 0.18.2 업그레이드 체인 마무리와 v0.3.0 wheel 재배치 재검증 (09-27)
    1. 오픈소스 프로젝트 진행 (GitHub 동향)
      • 1.1 릴리스 엔지니어링: GA 일 도래 — community 목록 병합 대기; release-info 포털 기간 내 5회 자동 배포 (09-25 ~ 09-26)
      • 1.2 build-infra: Megatron 0.18.2 업그레이드 체인 — RL E2E 3개 플랫폼 검증과 v0.3.0 wheel 재배치 (09-26 ~ 09-27)
      • 1.3 build-infra (2): 스킬 프레임워크 구축 — Claude Code skills가 백엔드 접속과 변경 게이트를 담당 (09-27)
      • 1.4 FlagTree: iluvatar C++ 특화 리팩터링 브랜치 계속 진행; vLLM 성능 수정 브랜치 개설 (09-25 ~ 09-28)
      • 1.5 FlagGems: P0/P1 테스트 배치 5연속 발행; 다중 플랫폼 최적화 PR 대기열 (09-25 ~ 09-28)
      • 1.6 FlagGems-vllm: chunk_kda 3개 플랫폼 동시 발행; moe_sum와 fused_add_rms_norm (09-28)
      • 1.7 Torch-FL: 크로스 플랫폼 수정 배치 24건 — DCU / Ascend / Enflame / MUSA 전 매트릭스 (09-25 ~ 09-28)
      • 1.8 FlagFFT: dev 브랜치 18건 — Hygon / Iluvatar / MetaX 3개 플랫폼 FFT 최적화 (09-25 ~ 09-27)
      • 1.9 FlagSparse / FlagBLAS: 희소 및 BLAS 다중 플랫폼 파이프라인 (09-25 ~ 09-27)
      • 1.10 기타 동향: FlagCX / FlagQuantum / FlagScale / FlagDNN / docs (09-25 ~ 09-28)
    1. 뉴스 보도와 생태계
      • 2.1 컴포넌트 수준 검색 연속 21번째 조용한 기간 (09-25 ~ 09-28)
      • 2.2 岳麓 대회 「AI+OpenCL」: 국산 OpenCL 연산자 라이브러리 공동 구축 계약 (09-24/09-25)
      • 2.3 Damo Academy 玄铁: SAIL 2차 오픈소스 예고 — 이번 달 말부터 10월 초 (09-26)
      • 2.4 是石科技 Meta-Infer: PCIe 그래픽카드 DeepSeek 추론 최대 7배 향상 (09-24, 이전 기간 추가 수록)
    1. 회원사 심층 분석
      • 3.1 Ascend: Torch-FL 수정 배치와 FlagGems 최적화 대기열; 0.18.2 이미지 라인 마이그레이션 대기 (09-25 ~ 09-28)
      • 3.2 Hygon: DCU 수정 배치 + HCU FFT 최적화 + hygon RL E2E 검증 (09-25 ~ 09-27)
      • 3.3 MetaX: MACA FFT 최적화 배치 + Metax RL E2E + 이미지 tag (09-26 ~ 09-27)
      • 3.4 Moore Threads: chunk_kda 접속, FP64 L2 지원 및 bmm 패밀리 최적화 대기열 (09-25 ~ 09-27)
      • 3.5 Iluvatar / Enflame / Kunlunxin: Iluvatar 3개 라인 병행; Enflame 커널 가드; Kunlunxin 최적화 대기열 (09-25 ~ 09-27)
      • 3.6 清微智能: 「太空之弦」 컴퓨팅 성좌启动 — 재구성 가능 칩, 우주 산업망 진입 (09-25/09-26)
    1. 요약과 트렌드 관찰
  • 부록: 출처 검증표
  • 전체 출처 목록

오늘의 중점: 2.2 GA 일 (09-28) — 기간 내 최종 정비: Megatron 0.18.2 업그레이드 체인 마무리와 v0.3.0 wheel 재배치 재검증

날짜: 2026-09-27 출처: community #115, build-infra #1181, #1145, #1144, release-info 포털

공식 일정에 따르면 FlagOS 2.2의 GA일은 09-28(본 보고서 발행일)이다. 본 보고서 모니터링 기간 마감(10:00) 기준, community 측의 두 가지 머지 대기 릴리스물인 L1 연산자 라이브러리 공식 목록(#114)과 2.2 FEP 범위 감사(#115)는 여전히 머지 대기 상태이다(두 항목 모두 09-24에 개설되었으며 모니터링 기간 내 새로운 움직임은 없음). GA 선언은 언제든 발표 가능한 조건을 갖추고 있다. 모니터링 기간 내 빌드 측의 주된 움직임은 Megatron 0.18.2 업그레이드 체인의 마무리였다:

  • RL E2E 3개 플랫폼 검증: #1144는 nvidia 이중 구성(cuda12.8 / cuda13.3) megatron rl 0.18.2 엔드투엔드 통과를 기록했고, #1145는 hygon-dtk26.04와 metax-maca3.8.1.3 이중 경로 통과를 기록했다——0.18.2의 RL 훈련 체인이 다중 플랫폼에서 검증 기록을 확보했다.
  • v0.3.0 wheel 재배치: Megatron-LM-FL은 0.3.0-rc2 브랜치에서 세 가지 수정(#192 RL의 NullTokenizer bos 및 packed_seq 가드 복원, #193 v0.3.0의 paged-attention 능력 디스패치 복원, #194 CUDA 대상 빌드에 flag_gems 페이징 폴백 보완)을 머지한 후 재패키징했다. build-infra는 재빌드 항목(#1167)을 기록했고, “재배치된 v0.3.0 wheel”에서 no-shim RL E2E 재검증을 완료했다(#1181, 09-27 23:02 마감).
  • 아티팩트 갱신: 애플리케이션 이미지 tag 2.2.0-0.3.0이 nvidia-cuda12.8 / nvidia-cuda13.3 / hygon-dtk26.04 / metax-maca3.8.1.3 4개 플랫폼에서 일괄 기록되었다(모니터링 기간 내 20여 건의 tag 기록 커밋). release-info 포털은 모니터링 기간 내 5회 자동 배포(09-25 10:17 ~ 09-26 15:15)되었으며, megatron_rl / megatron_training의 0.18.2 시리즈 다섯 항목이 목록에 포함되었다.

판단: GA 전 마지막 모니터링 기간에는 새로운 기능 선언이 전혀 없었고, 모든 움직임이 “검증 마감 + 아티팩트 재제작 + 기록 남기기”를 중심으로 이루어졌다——이는 이전 범위 감사(#115)의 기조와 일치한다: 대외 선언은 “구현 완료 + 검증 완료”만 유지하며, 2.2의 공개 딜리버리는 아티팩트에서 재현 가능한 증거 체인을 기초 자료로 삼을 것이다.


1. 오픈소스 프로젝트 진행 상황(GitHub 동향)

1.1 릴리스 엔지니어링: GA일 도래——community 목록 머지 대기; release-info 포털 모니터링 기간 내 5회 자동 배포(09-25 ~ 09-26)

날짜: 2026-09-25 ~ 2026-09-26 출처: community #114, #115, release-info 포털, release-info 배포 기록

  • community 상태: L1 연산자 라이브러리 공식 목록(#114)과 2.2 FEP 범위 감사(#115)는 모니터링 기간 내 새 동작 없이 머지 대기 유지; 릴리스 브랜치 release/2.2-official-l1이 등재됨(09-24 개설) — GA 공식 목록의 머지가 다음 가시적 노드.
  • 포털 갱신: release-info(빌드 인프라 포털)는 모니터링 기간 내 5회 자동 배포 완료(09-25 10:17, 09-26 09:50 / 10:06 / 13:06 / 15:15), 콘텐츠는 build-infra 메인라인 진척을 지속 추종; 포털에는 현재 megatron_rl / megatron_training의 0.18.2 시리즈 항목(cambricon-neuware4.7.2, generic-12.8, generic-13.3, hygon-dtk26.04, metax-maca3.8.1.3) 및 vllm 0.20.2 / 0.24.0 듀얼 시리즈 애플리케이션 페이지 포함.
  • 의미: 릴리스 엔지니어링이 「포털이 곧 이미지 설명서」 상태에 진입 — 문서, 이미지 목록, 검증 기록이 동기적으로 갱신되며 GA 이후 대외 납품을 준비.

1.2 build-infra: Megatron 0.18.2 업그레이드 체인 — RL E2E 3플랫폼 검증과 v0.3.0 wheel 재배치(09-26 ~ 09-27)

날짜: 2026-09-26 ~ 2026-09-27 출처: build-infra #1144, #1145, #1146, #1167, #1181, Megatron-LM-FL #194(등 99건 커밋, 부록 참조)

  • RL E2E 검증 체인: #1144(nvidia cuda12.8 / cuda13.3 듀얼 구성)와 #1145(hygon-dtk26.04 / metax-maca3.8.1.3 듀얼 경로)가 연이어 megatron rl 0.18.2 엔드투엔드 통과 기록; 전일(09-26) 훈련 매트릭스가 먼저 마감 — #1131은 metax 훈련 검증 표시 및 cambricon 근본 원인 기록, #1132는 cuda13.3 flagcx bitcode 컴파일 레시피 완료(F/T 훈련 검증).
  • 검증 워크북: 0.18.2 추적 문서(#1119부터)와 검증 워크북(#1126 / #1128 / #1130 시리즈)이 「단일 진실 공급원」 방식으로 각 플랫폼 매트릭스 상태 기록 — 릴리스 검증에 통합 장부가 생기기 시작.
  • v0.3.0 wheel 재배치: Megatron-LM-FL 0.3.0-rc2 브랜치 3건 수정(#192 ~ #194) 머지 후 wheel 재빌드; build-infra는 재빌드 항목 기록(#1167 「pending entries for the #194 wheel rebuild」), 이후 #1181이 재배치 산출물에서 no-shim RL E2E 재검증 완료 — 「수정 - 재패키징 - 재검증」 폐루프가 한 모니터링 기간 내 완주.
  • flagcx wheel 빌드 체인: #1133은 builder clang을 flagtree 내장 LLVM 스냅샷으로 고정; #1134는 cuda13.3에서 FLAGCX_BITCODE_PATH 과도기 방안 폐기; #1135는 검증 스크립트를 사전 설치된 flagcx 먼저 제거하도록 변경; #1136은 cuda12.8 런타임 이미지에 flagcx wheel 탑재 — 통신 컴포넌트의 이미지 동봉 배포 엔지니어링 세부 사항을 항목별로 마감.
  • 의미: 0.17.1에서 0.18.2로의 플랫폼 마이그레이션(훈련 + RL)이 GA 전 주요 검증을 완료한 것이 이번 릴리스 주기 마무리 단계의 엔지니어링 주축.

1.3 build-infra(2): 스킬 프레임워크 구축 — Claude Code skills가 백엔드 연동과 변경 게이트키핑 담당(09-27)

날짜: 2026-09-27 출처: build-infra #1155, #1156, #1166, #1176

  • skills 프레임워크 기반 마련: #1155 「land the Claude Code skills framework foundation」머지 — 릴리스 엔지니어링 프로세스가 AI 프로그래밍 어시스턴트가 실행 가능한 스킬 집합으로 축적되기 시작했다.
  • 온보딩 프로세스 스킬화: #1156에서 add-backend 및 verify-app-backend 프로세스 스킬을 추가하고, 이후 update-backend flow로 리팩터링(「계층 전파 체인」으로 스코프 모델링) — 「신규 칩 백엔드 온보딩 + 애플리케이션 이미지 검증」이 에이전트가 재사용 가능한 표준 프로세스가 되었다.
  • 게이트 세분화: #1166에서 changelog gate의 스코프를 애플리케이션 이미지 푸시 시나리오로 한정; #1176에서 --no-cache와 push 로직을 분리 — 자동화 프로세스가 실제 반복 과정에서 항목별로 교정되고 있다.
  • 관찰: FlagOS 2.0 릴리스의 Skills / SkillHub 내러티브와 내외로 호응 — 에이전트 스킬이 외부 개발자만을 위한 것이 아니라 FlagOS 자체의 개발 인프라로도 역류하기 시작했다.

1.4 FlagTree: iluvatar C++ 특화 리팩터 브랜치 지속 진행; vLLM 성능 수정 브랜치 개설 (09-25 ~ 09-28)

날짜: 2026-09-25 ~ 2026-09-28 출처: FlagTree refactor/iluvatar-cpp-specialization-v2, fix_perf_vllm

  • iluvatar C++ 특화 리팩터(v2): Iluvatar CoreX 플랫폼 C++ 특화 소스 이관 리팩터 3건 — 「특화 C++ 소스 이동」「핵심 CMake 소스 연결 복원」「메인 Triton rewriter 정의 재사용」(09-25) — 이전 라운드의 동명 브랜치 후속으로, iluvatar 백엔드의 특화 엔지니어링 경로를 정리한 것이다.
  • fix_perf_vllm: 09-28 오전 새 브랜치 개설 — 「[CI] Fix perf.sh」와 「pre-commit 수정」 두 건의 커밋으로, vLLM 성능 벤치마크 스크립트 수정을 겨냥한다(09:37 / 09:47).
  • 메인 브랜치 정적: 메인 브랜치는 모니터링 기간 내 커밋 없음(최신은 09-24의 MetaX vLLM benchmark 워크플로), 0.7.0 시리즈 태그 신규 없음 — GA 동결 기간의 작업이 피처 브랜치로 이동했다.
  • 관찰: 메인 브랜치 동결, 리팩터와 수정이 브랜치에서 진행되는 것은 「릴리스 윈도우와 개발 윈도우 분리」의 또 한 사례다.

1.5 FlagGems: P0/P1 테스트 배치 5연발; 멀티플랫폼 최적화 PR 큐 (09-25 ~ 09-28)

날짜: 2026-09-25 ~ 2026-09-28 출처: FlagGems #6687, #6689, #6691, #6694, #6709 (등 30여 건 PR, 부록 참조)

  • P0/P1 테스트 대회전: 09-24부터 시작된 테스트 배치 작업이 모니터링 기간 내에 집중적으로 업스트림됨——다섯 개의 P1 테스트 PR이 동시에 열림(#6687 희소 리덕션 / softmax / cuDNN, #6688 희소 log-softmax / sum / addmm, #6689 희소 행렬 곱 / 융합 컨볼루션 / Cholesky / QR / Bessel, #6691 FFT / psi / 선형대수, #6694 ISTFT / 희소 리덕션 / cuDNN CTC / 반구조적 apply), 모두 재현 가능한 벤치마크 포함; 이전에 P0 스위트는 리뷰가 철회된 바 있으며(#6670), 배치별 PR로 전환하여 진행.

  • 메인 브랜치: 모니터링 기간 내 단 1건 병합(#6709 shifted Chebyshev 테스트의 pre-commit 실패 수정)——릴리스 동결의 흔적이 뚜렷함.

  • 멀티플랫폼 PR 큐(모니터링 기간 내 활발): Ascend addmm / bmm / baddbmm / mv / mul 최적화 및 index_put 단일 요소 인덱스 수정(#6697 ~ #6703 구간); Moore Threads bmm / addmm / baddbmm(#6705 ~ #6707); MetaX MM 디스패치 및 튜닝 커널(#6663); Hygon addmm FlagTune 및 conv2d(#6696 / #6700); Kunlunxin 배치 2(#6659 / #6662); SOPHGO 백엔드 최적화(#4615 / #4632); KernelGen Nvidia 연산자 마이그레이션 큐(#6608 ~ #6635 여섯 건: dim, crow/ccol_indices_copy, _dim_arange, _dimV, _values 등).

  • 판단: “릴리스 전 테스트 보충, 릴리스 후 성능 대응”의 리듬이 PR 레벨에서 명확히 보임——테스트 배치와 플랫폼 최적화 두 큐가 병행.

1.6 FlagGems-vllm: chunk_kda 3개 플랫폼 동시 출시; moe_sum 및 fused_add_rms_norm (09-28)

날짜: 2026-09-28 출처: FlagGems-vllm #856, #859, #860, #855, #850, #846

  • chunk_kda 3개 플랫폼 동시 출시(09-28 오전): Moore Threads(#856), Hygon TLE 버전(#859), Iluvatar CoreX(#860)가 차례로 chunk_kda 연산자를 병합——선형 어텐션 계열 추론 연산자가 한 오전에 세 플랫폼을 모두 채움.

  • 기타 연산자: Iluvatar CoreX moe_sum(#855); Ascend fused_add_rms_norm 성능 최적화(#850); Hygon TLE 최적화 topk_softplus_sqrt(#846); mhc_post 신규 레이아웃(#854).

  • 배경: FlagGems-vllm은 vLLM의 FlagGems 연산자 플러그인(v0.2.0은 2.2 공식 L1 목록 구성 요소)——GA 동결 기간에도 일일 단위 연산자 보완 리듬을 유지하며 추론 측 플랫폼 커버리지를 지속적으로 강화.

1.7 Torch-FL: 크로스 플랫폼 수정 배치 24건——DCU / Ascend / Enflame / MUSA 전 매트릭스 (09-25 ~ 09-28)

날짜: 2026-09-25 ~ 2026-09-28 출처: Torch-FL #450, #453, #447, #449, #437, #448(등 24건, 부록 참조)

  • 릴리스물 정합: #447 릴리스 및 wheel 호환성 목록 검증; #420 CI에서 릴리스된 FlagOS wheel 통합 설치; #440 CI venv 제약 — 릴리스물과 CI 환경을 우선 정합.
  • DCU(Hygon): #453 scatter_add_ / argmin / mean 계열을 CUDA boxing에 “고정”; #437 FlagGems 디바이스 이름이 더 이상 CUDA에만 정합하지 않음.
  • Ascend: #450 Qwen-Image 경로 수정 및 검증된 회귀 profile 추가; #436 SDPA realShift가 제한적 가산 attention 편향 지원; #426 디바이스 측 profiler 계약 개방.
  • Enflame(GCU): #438 벤더 컴파일러 중단 전에 64-bit Triton 커널 거부; #429 int64가 벤더 커널로 이탈; #423 new_ones를 벤더 커널이 제공하도록 변경 — “사전 거부 / 이탈”의 가드식 엔지니어링 패러다임.
  • 분산 및 범용: #435 gloo 요청을 flagos 백엔드가 응답, 집합 연산은 호스트 메모리 경유; #434 MSPTI 외부 연관 스택을 실제 주소로 팝; #421 flagos 백엔드가 DataParallel 지원; #449 flex_attention을 flagos 디바이스에서; #410 압축 희소(CSR / CSC / BSR / BSC) 텐서 지원; #416 CUPTI 런타임 cbid 테이블 자동 생성.
  • 의미: 24건의 커밋이 “릴리스물 정합 + 플랫폼 수정 + 범용 역량” 삼선을 커버 — Torch-FL은 torch 측 통합 플러그인으로서, 2.2에서 선언한 역량을 플랫폼급 증거로 하나씩 보강하고 있음.

1.8 FlagFFT: dev 브랜치 18건 — Hygon / Iluvatar CoreX / MetaX 삼플랫폼 FFT 최적화 (09-25 ~ 09-27)

날짜: 2026-09-25 ~ 2026-09-27 출처: FlagFFT dev 브랜치 커밋

  • Hygon(HCU): CT 리프 최적화 배치 5건 — radix-16 리프 대조, 단축 CT 리프 최적화 및 launch 오버헤드 정리, 리프 스케줄링을 1차원 요청으로 한정, 튜닝이 분해 자식 노드로 넘치지 않도록 (09-25).
  • Iluvatar CoreX(IX): 다중 웨이브 최적화 10여 건 — 실수 CT 인자 매칭, N210 패킹, 1024 포인트 듀얼 warp 스케줄링, 배치 CT 스캔, 하드웨어 테이블 R2C twiddle, 융합 R2C 리프를 실측 기반으로 기본 활성화 (09-26 ~ 09-27).
  • MetaX(MACA): 단일 변환 C2R 패킹 실수 경로 및 실측 이득 기록 (09-27).
  • 의미: FFT는 과학 계산 방향의 대표 연산자 영역(해당 라이브러리 README에는 이미 CUDA / MUSA / PPU / IX / MACA / NPU / HCU 7종 백엔드가 나열됨) — 세 개 국산 플랫폼이 같은 기간에 병행 개진, 이는 2.2의 “대규모 모델에서 과학 계산으로” 영역 확장과 호응.

1.9 FlagSparse / FlagBLAS: 희소 및 BLAS 다중 플랫폼 파이프라인 (09-25 ~ 09-27)

날짜: 2026-09-25 ~ 2026-09-27 출처: FlagSparse #101, #100, #98, FlagBLAS #135, #134, #133

  • FlagSparse(NCIC-AlphaSparse 협업 라인): #98 ~ #101 다중 라운드 병합 — DCU(Hygon) spmv CSR 정밀도 및 대역폭, COO 버전 SpMV / SpMM, MACA(MetaX) sddmm 베이스라인, XPU(Kunlunxin) gather fp16, BIV 알고리즘 문서 복원 및 CI 정비; 0.4.0 개발 주기 지속 추진.
  • FlagBLAS: #135 Moore Threads FP64 L2 지원; #134 / #133 Damo Academy XuanTie L2 등가 성능 확장 및 GEMV / L2 베이스라인 향상; #132 Ascend L2 최적화(플랫폼 전용 스킵 항목 제거) — L2 계층(행렬-벡터류)이 세 플랫폼의 공동 성능 전선이 됨.

1.10 나머지 동향: FlagCX / FlagQuantum / FlagScale / FlagDNN / docs (09-25 ~ 09-28)

날짜: 2026-09-25 ~ 2026-09-28 출처: FlagCX #629, #628, FlagQuantum #221, FlagScale #1303, docs #523

  • FlagCX: #629 CRL runner 정확성 베이스라인; #628 CRL 통합 전송 디스패치 및 P2P 경로 협상 수정; #627 PAL 네트워크 어댑터 공유 전송 기반; #626 PAL IBUC 신뢰성 강화 및 CUDA adaptor CI——통신 라이브러리의 CRL / PAL 두 실험 라인에서의 기반 엔지니어링 추진.
  • FlagQuantum: #220 배치 축적 상태 Clifford 레이어; #221 지연 축적 상태 SWAP 구체화——양자 컴포넌트의 CPU 측 최적화 배치 연속.
  • FlagScale: #1303 flagcx 비이기종 초기화 수정 (main, 09-28 09:21), 및 2.1.0-rc2 브랜치로 cherry-pick (#1304).
  • FlagDNN: Hygon 호환성 조정 (09-25).
  • docs: FlagPrism 문서 업스트림 정렬 업데이트 (#523, 09-27)——신규 컴포넌트 문서를 2.2 릴리스 전에 보충.

2. 뉴스 보도와 생태계

2.1 컴포넌트급 검색 연속 21번째 평온한 모니터링 기간 (09-25 ~ 09-28)

날짜: 2026-09-25 ~ 2026-09-28 출처: Google News RSS (26개 중영문 검색어, 프록시 경유), HN Algolia

  • 컴포넌트명 검색 (FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen / FlagOS 2.2)이 72시간 모니터링 기간 내 제로 히트——연속 21번째 뉴스 측 평온한 모니터링 기간.
  • 생태계 측 18건 모니터링 기간 내 히트: Yuelu 대회 OpenCL 및 Damo Academy XuanTie SAIL 후속 보도가 토픽에 따라 수집됨 (2.2 / 2.3 참조); 나머지는 주식 시황 기사 (Enflame IPO 관련, 반도체 섹터), 싱크탱크 콘텐츠 및 무관 재전송으로 토픽에 따라 제외.
  • HN Algolia에서 FlagOS / FlagGems / FlagScale / BAAI 관련 히트 없음.
  • 평온한 모니터링 기간은 2.0 / 2.1 / 2.2 세 릴리스 주기를 넘어 상시화됨: 대외 정보 증분은 릴리스 시점과 회의 시점에 집중되고, 일상 리듬은 코드 측과 커뮤니티 측이 주도.

2.2 Yuelu 대회 「AI+OpenCL」: 국산 OpenCL 연산자 라이브러리 공동 구축 협약 (09-24/09-25)

날짜: 2026-09-24 ~ 2026-09-25 출처: 창사만보 (장상창사), 화성온라인 (펑황망 재전송)

  • 2026 인터넷 Yuelu 대회 「AI+OpenCL 이기종 컴퓨팅」 테마 포럼 (09-24, 창사): 창사 Quanying 반도체, 후난 집적회로 산업기술혁신전략연맹, CSDN, Jingjia Micro, Shouzhao Technology 등 기관이 OpenCL 연산자 라이브러리 전략 협력 체결——통일된 국산 OpenCL 연산자 라이브러리 공동 구축, 국산 칩의 「하드웨어 강세, 소프트웨어 약세」 문제점에 직접 대응, 「바퀴의 중복 발명」 회피, 개발자의 크로스 플랫폼 이식 비용 절감.
  • 포럼 구성: Khronos가 OpenCL 글로벌 표준 체계 해설 (450개 이상 디바이스 인증 획득, Jingjia Micro, Chengying GPGPU 등 국산 칩 모두 적응 완료); 칭화대학, 푸단대학 학자가 오픈소스 GPGPU 소프트웨어 스택과 온디바이스 구현 공유; SuanNeng Technology, Lisuan Technology 등이 금융 퀀트 연산자 라이브러리, AI 보조 집적회로 설계 등 실천 공유.
  • 본 스택과의 관계: 국산 컴퓨팅 파워 「소프트웨어 스택 보충」의 다중 노선 병행——OpenCL 개방 표준 노선 (크로스 벤더 크로스 하드웨어 호환)과 FlagOS 「통합 플러그인 스택」 노선이 생태계 대조를 이룸; 이는 최근 「소프트웨어 기반」 서사의 연장이기도 함 (이전 모니터링 기간에 Loongson 풀 스택 플랫폼, Weizhen 등 동종 움직임이 이미 있었음).

2.3 Damo Academy XuanTie: SAIL 2차 오픈소스 예고——이달 말부터 10월 초 (09-26)

날짜: 2026-09-26 출처: Zhiyuan 커뮤니티, 펑황망 (대풍호)

  • 후속 보도: 09-23 운치 대회에서 SAIL 오픈소스 진행 상황(본 데일리 리포트 09-24호에 핵심 사실이 이미 수록됨)이 공개된 이후, 모니터링 기간 내 Zhiyuan 커뮤니티 등 매체에서 계속 확산되었으며 증분 정보를 제시했다 — SAIL 2차 오픈소스 코드가 이번 달 말부터 10월 초에 릴리스될 예정이다: 범위에는 TensorFlow / JAX 프레임워크 적응, FLA / acext 가속 라이브러리, ppu-gdb / ppu-dcgm 디버깅 및 클러스터 운영 도구, 더 많은 통신 라이브러리가 포함된다.
  • 이미 오픈소스화된 목록(매체 복기): PyTorch-for-sail 프레임워크 적응, sailify 소스 마이그레이션 도구, Triton-for-sail 연산자 개발 도구, DeepGEMM-for-sail, FlashAttention-for-sail; 「GitHub 기반 개발 브랜치가 연구개발 메인라인으로 사용될 것」.
  • 본 스택과의 관계: SAIL은 Zhenwu PPU(즉 FlagOS의 PPU 지원 플랫폼)를 대상으로 한다; 제조사 자체 스택과 커뮤니티 통합 스택이라는 두 가지 「오픈소스 소프트웨어 스택」 노선이 동시기에 추진되고 있다 — PPU의 FlagOS 측 빌드 항목(FlagTree ppu3.6 태그, sglang thead-ppu 애플리케이션 페이지)을 지속적으로 추적 대조할 수 있다.

2.4 Shishi Technology Meta-Infer: PCIe 그래픽카드 DeepSeek 추론 약 7배 향상 (09-24, 이전 기간 추가 수록)

날짜: 2026-09-24 출처: QbitAI, Sina Tech

  • Shishi Technology(METASTONE)가 자체 개발한 Meta-Infer 추론 엔진을 발표: 순수 소프트웨어 최적화(커널 보완, 연산자 최적화 및 통신 재구성, 병렬 및 용량 튜닝, 캐시 재사용)로 PCIe-Only 그래픽카드의 잠재력을 끌어올렸다 — 8카드 환경에서 DeepSeek-V4.1-Flash 입력 처리량 1932 → 13274 tok/s(약 6.87배), 1M 컨텍스트 지원; DeepSeek-V4-Flash는 1.55배 향상; 또한 이 방법론이 국산 GPU에서도 동일하게 검증되었다고 밝혔다(제조사 발표 데이터, 제3자 독립 검증 미경유).
  • 방법론 요점: vLLM / SGLang 등 프레임워크가 비인증 하드웨어에 대해 조용히 성능을 저하시킨다(메타데이터 정의, 페이지 크기, 통신 고속 경로 임계값 불일치), 적응을 수정하면 곧바로 수배의 성능이 발휘된다 — 「먼저 고성능 커널이 실제로 실행되고 있는지 확인한 다음에 확장을 논하라」.
  • 본 스택과의 관계: FlagOS의 「통합 소프트웨어 스택으로 다양한 하드웨어의 잠재력을 발휘한다」는 것과 같은 명제의 제3자 실천; 그의 「롱테일 하드웨어 적응은 과소평가된 생태적 지위」라는 판단은 본 스택의 다양한 칩 노선과 상호 참조가 된다. 추가 수록 설명: 해당 보도는 09-24 저녁에 최초 게재되어 직전 데일리 리포트 모니터링 기간에는 수록하지 못했다.

3. 회원 단위 심층 분석

3.1 Ascend: Torch-FL 수정 배치와 FlagGems 최적화 큐; 0.18.2 이미지 라인 마이그레이션 대기 (09-25 ~ 09-28)

날짜: 2026-09-25 ~ 2026-09-28 출처: Torch-FL #450, #436, #426, FlagGems #6697, FlagGems-vllm #850, release-info 포털

  • 연산자 계층: FlagGems Ascend 최적화 PR 큐가 모니터링 기간 내 6건 활발(addmm / bmm / baddbmm / mv / mul 최적화 + index_put 단일 요소 인덱스 수정, #6697 ~ #6703 구간); FlagGems-vllm의 fused add rms norm 성능 최적화(#850).
  • 프레임워크 계층: Torch-FL이 Ascend Qwen-Image 경로를 수정하고 검증된 회귀 profile을 신규 추가(#450), SDPA realShift가 유한 가산 편향을 지원(#436), 디바이스 측 profiler 계약(#426) — Ascend의 torch 측 보완 작업이 계속되고 있다.
  • 이미지 라인: 포털에서 megatron의 0.18.2 시리즈는 아직 Ascend 항목을 포함하지 않는다(여전히 0.17.1-ascend-cann8.5.0 / 9.0.0 시리즈) — 0.18.2의 Ascend 플랫폼 마이그레이션은 다음 단계의 관찰 포인트다.

3.2 Hygon: DCU 수정 배치 + HCU FFT 최적화 + hygon RL E2E 검증 (09-25 ~ 09-27)

날짜: 2026-09-25 ~ 2026-09-27 출처: Torch-FL #453, FlagGems-vllm #859, FlagSparse #101, build-infra #1145, FlagGems #6696, FlagFFT dev 커밋

  • 연산자와 프레임워크: FlagSparse DCU spmv CSR 정밀도와 대역폭, COO 계열(#101 등 배치); FlagGems-vllm chunk_kda TLE 버전과 topk_softplus_sqrt(#859 / #846); Torch-FL DCU 가중치 “고정” CUDA boxing(#453)과 디바이스 이름 정렬(#437); FlagGems addmm FlagTune과 conv2d 최적화 PR 대기열 진입(#6696 / #6700).
  • 과학 계산: FlagFFT HCU CT 리프 최적화 배치(1.8 참조).
  • 훈련 체인: megatron rl 0.18.2 hygon RL E2E 이중 경로 검증(build-infra #1145) + hygon-dtk26.04 이미지 tag 2.2.0-0.3.0——Hygon은 0.18.2 최초 검증 플랫폼 중 하나이다.
  • 의미: Hygon DCU / HCU는 이번 모니터링 기간 동안 연산자 라이브러리, FFT, 프레임워크, 훈련 체인 4개 계층을 아울렀다——모니터링 기간 내 깊이가 가장 깊은 플랫폼이다.

3.3 MetaX: MACA FFT 최적화 배치 + Metax RL E2E + 이미지 tag (09-26 ~ 09-27)

날짜: 2026-09-26 ~ 2026-09-27 출처: FlagFFT dev 커밋, build-infra #1145, Torch-FL #427, FlagGems #6663

  • FlagFFT MACA 단일 변환 C2R 패킹 실수 경로와 이득 기록(09-27); megatron rl 0.18.2 metax RL E2E 이중 경로(#1145) + metax-maca3.8.1.3 이미지 tag 2.2.0-0.3.0; Torch-FL MetaX 통합 작업의 fp32 행렬 곱 정밀도 고정 수정(#427); FlagGems MetaX MM 디스패치와 튜닝 커널 PR(#6663); FlagSparse maca sddmm 베이스라인 저장소 등록.
  • 관찰: MetaX는 “훈련 체인 + FFT + 연산자” 다중 라인에서 동시 진행——Hygon과 함께 모니터링 기간 내 가장 활발한 두 플랫폼이다.

3.4 Moore Threads: chunk_kda 통합, FP64 L2 지원과 bmm 제품군 최적화 대기열 (09-25 ~ 09-27)

날짜: 2026-09-25 ~ 2026-09-27 출처: FlagGems-vllm #856, FlagBLAS #135, FlagGems #6705, #6706, #6707

  • FlagGems-vllm chunk_kda Moore Threads 버전 병합(#856), FlagBLAS FP64 L2 지원 추가(#135), FlagGems PR 큐 bmm / addmm / baddbmm 세 건 최적화(#6705 ~ #6707, Opus 계열 자동 흐름 codex/mthreads-* 브랜치).
  • 관찰: MUSA 플랫폼은 「추론 연산자 + BLAS 기반 라이브러리」 양대 축 하향 침투를 이어가며, FP64 지원으로 L2 계층의 배정밀도 공백을 메웠다.

3.5 Iluvatar CoreX / Enflame / Kunlunxin: Iluvatar CoreX 3개 라인 병행; Enflame 커널 가드; Kunlunxin 최적화 큐(09-25 ~ 09-27)

날짜: 2026-09-25 ~ 2026-09-27 출처: FlagTree refactor 브랜치, FlagGems-vllm #860, Torch-FL #438, FlagSparse 커밋, FlagGems #6662

  • Iluvatar CoreX(iluvatar, IX): FlagTree C++ 특화 리팩터 v2 브랜치(1.4 참조); FlagGems-vllm chunk_kda 및 moe_sum(#860 / #855); FlagFFT IX 최적화 배치(1.8 참조) — 컴파일, 추론 연산자, FFT 3개 라인 병행.
  • Enflame(GCU): Torch-FL 3건의 가드형 수정(64-bit Triton 커널 조기 거부 #438, int64 이스케이프 #429, new_ones 벤더 커널 #423) — 「벤더 컴파일러가 중단되기 전에 차단」하는 엔지니어링 패러다임.
  • Kunlunxin(XPU): FlagGems 배치 2 최적화 PR(#6662 / #6659) + FlagSparse XPU gather fp16 — 09-24 대규모 수정 배치 이후 최적화 반복 단계에 진입.

3.6 Tsingmicro: 「우주 하늘의 현」 컴퓨팅 성좌 출범 — 재구성 가능 칩, 우주 산업 체인에 합류(09-25/09-26)

날짜: 2026-09-25 ~ 2026-09-26 출처: Zhejiang Daily(Zhejiang Online), Phoenix Net 전재

  • 제5회 글로벌 디지털 트레이드 엑스포·동방 우주 컴퓨팅 산업 대회(09-25, 항저우): Geespace, Dongfang Xinglian 공동 발표 「우주 하늘의 현」 컴퓨팅 성좌 — 1000기 이상의 AI 위성 네트워킹 계획, 천기 데이터 처리, 모델 배포 및 컴퓨팅 자원 협력 탐색; Tsingmicro는 산업 체인 파트너로서 깊이 참여(Zhejiang 성재 AI 칩 산업 체인).
  • 배경: Tsingmicro와 Dongfang Xinglian은 2025년 말부터 전략적 협력을 구축, 「재구성 가능 칩 우주 지능체」는 WAIC 2026에서 발표되었으며, 2026년 말 최초 궤도 실측 완료 계획 — 「재구성 가능 칩의 우주 진출」 경로가 지속적으로 추진 중.
  • 본 스택과의 관계: Tsingmicro는 본 스택의 회원 단위(FlagTree에 이미 tsingmicro3.3 / 3.6 플랫폼 변형이 있으며, Open3D-PIMC 역시 Tsingmicro와 Zhiyuan/BAAI의 공동 성과) — 우주 컴퓨팅은 재구성 가능 칩 시나리오 라인의 연장으로, 본 스택의 「클라우드에서 엣지까지 전 시나리오」 장기 방향과 호응을 이룬다.

4. 요약 및 트렌드 관찰

  1. GA 마감, 릴리스 규율 관철: 모니터링 기간 내 신규 기능 선언은 전무하며, 모든 움직임은 검증 마감, 아티팩트 재생성, 기록 남기기에 집중되었다. community의 두 가지 체크리스트(#114 / #115)가 곧 머지될 예정이며, 2.2의 공개 딜리버리는 “증거 기반 완성도”를 초안으로 삼을 것이다.
  2. Megatron 0.18.2 업그레이드 체인 완성: RL E2E가 nvidia×2 / hygon / metax에서 검증을 획득한 데 이어 v0.3.0 wheel 재배치 후 no-shim 재검증을 완료하고, 4개 플랫폼 이미지 tag를 일괄 기록했다. 학습 및 RL 시나리오의 버전 추진은 마무리 단계의 엔지니어링 주축이자 다음 릴리스 주기(0.3.0 라인)의 전주곡이다.
  3. 릴리스 엔지니어링의 “스킬화”: Claude Code skills 프레임워크가 build-infra에 안착하고, 백엔드 연동(add-backend / update-backend)과 변경 게이트가 실행 가능한 스킬로 정착되었다. 에이전트 역량이 FlagOS 자체의 개발 인프라로 역진입하기 시작했으며, 커뮤니티 Skills 서사와 내외로 호응한다.
  4. 테스트 인프라 대회전: FlagGems P0/P1 테스트 배치가 5연속 투입되었다(희소, 컨볼루션, FFT, 선형대수, cuDNN CTC 등, 모두 재현 가능한 벤치마크 포함). 품질을 동결기 전면에 배치하여 2.3의 다중 플랫폼 매트릭스를 위한 토대를 미리 깔았다.
  5. 다중 플랫폼 개발 라인 전면 개화: FlagSparse(DCU / MUSA / XPU), FlagBLAS(DAMO XuanTie / Ascend / Moore Threads), FlagGems-vllm(Iluvatar CoreX / Hygon / Moore Threads), FlagFFT(Hygon / Iluvatar CoreX / MetaX), Torch-FL(전체 매트릭스) — “릴리스 동결과 개발 병행”의 이중 트랙 상태가 다섯 개 컴포넌트에서 동시에 나타났다.
  6. 생태계 측 대조: 뉴스 면의 21번째平静 모니터링 기간이 장외 열기와 대비를 이룬다 — OpenCL 연산자 라이브러리 공동 구축, “SAIL 제2차” 예고, Meta-Infer “거의 7배” 사례는 모두 동일한 명제를 가리킨다. 다양한 하드웨어의 가치 실현은 점점 소프트웨어 스택 역량에 달려 있다. 통합 소프트웨어 스택의 모니터링 기간 보너스와 경쟁은 같은 주파수에 있다.

부록: 출처 검증표

분류 출처 검증 방식 결과
GitHub org: flagos-ai repos API 54개 저장소 pushed_at 전수 검증 15개 저장소 모니터링 기간 내 활성
GitHub 커밋 검색 + 저장소별 대조 모니터링 기간 내 건별 검증(브랜치 라인 포함) 커밋 검색 173건, 11개 저장소에 걸침, 별도로 6개 브랜치 라인 검증(FlagGems P1 배치 / FlagFFT dev / Megatron-LM-FL 0.3.0-rc2 / FlagTree ×2 / FlagScale 2.1.0-rc2)
릴리스 엔지니어링 community #114 / #115 원문 상태와 브랜치 건별 대조 두 항목 여전히 머지 대기 중, release/2.2-official-l1 브랜치 등재
릴리스 엔지니어링 build-infra PR 및 release-info 배포 원문 수집 대조 Megatron 0.18.2 체인 마감, 포털 모니터링 기간 내 5회 자동 배포
태그 FlagTree / FlagGems / FlagScale / FlagBLAS 등 tags atom 건별 대조 모니터링 기간 내 신규 태그 없음(작업이 브랜치와 PR 큐로 전환)
뉴스 Google News RSS(중영문 26개 검색어, 프록시 경유) 72시간 모니터링 기간 필터 + 건별 제거 컴포넌트 키워드 제로 히트(21번째平静 모니터링 기간), 생태계 측 3건 유지
미디어 Changsha Evening News / Voice of Hunan / Zhiyuan Community / ifeng / QbitAI / Sina Technology 원문 수집 재검증 OpenCL 연산자 라이브러리 / SAIL 후속 보도 / Meta-Infer(추가 기록)
커뮤니티 HN Algolia 검색 재검증 관련 히트 없음
역사 대조 이전 3일 FlagOS 데일리 리포트 중복 제거 검증 SAIL은 후속 보도(증분 명확), Open3D-PIMC 신규 없음, 주식 시황 기사 제거

전체 출처 목록

6659> · https://github.com/flagos-ai/FlagGems/pull/6697 ~ https://github.com/flagos-ai/FlagGems/pull/6703 · https://github.com/flagos-ai/FlagGems/pull/6705 · https://github.com/flagos-ai/FlagGems/pull/6706 · https://github.com/flagos-ai/FlagGems/pull/6707 · https://github.com/flagos-ai/FlagGems/pull/4615 · https://github.com/flagos-ai/FlagGems/pull/4632

https://github.com/flagos-ai/FlagCX/pull/627 · https://github.com/flagos-ai/FlagCX/pull/628 · https://github.com/flagos-ai/FlagCX/pull/629 · https://github.com/flagos-ai/FlagQuantum/pull/220 · https://github.com/flagos-ai/FlagQuantum/pull/221 · https://github.com/flagos-ai/FlagScale/pull/1303 · https://github.com/flagos-ai/FlagScale/pull/1304 · https://github.com/flagos-ai/docs/pull/523