모니터링 기간: 2026-09-29 10:00 ~ 2026-09-30 10:00 (24시간; 수요일 기간; 09-29 데일리 리포트 기간을 승계, 공백 없음) 출처: GitHub (org: flagos-ai, 54개 저장소 pushed_at 전수核查, 기간 내 16개 저장소 활동, 12개 저장소에 기간 내 커밋; 커밋 검색 168건 전수 개별 검증; 별도로 Torch-FL / FlagScale / FlagGems-vllm / FlagGems-sglang / FlagTree의 태그와 Release 원자, community #124 ~ #125, build-infra 약 30건 병합 기록, docs 문서 배치, release-info 포털 7회 배포, FlagFFT 브랜치级 활동 확인), Google News RSS (중영문 24개 검색어 조합, 프록시 경유), Phoenix Net / Sina Finance 등 보도 (상세 내용은 부록 출처 목록 참조)


이번 호 인덱스

  • 오늘의 중점: Torch-FL v2.10.0 릴리스 저장소 반영——FlagOS 2.2 목록 마지막 항목 완성 (09-29)
    1. 오픈소스 프로젝트 진행 (GitHub 동향)
      • 1.1 Torch-FL: v2.10.0 정식 릴리스——2.2 마지막 항목 완성 (09-29)
      • 1.2 Torch-FL (2): 릴리스 파이프라인 반복——후보 태그에서 벤더 wheel까지 (09-29 ~ 09-30)
      • 1.3 community: 마무리 수정 2건과 8개 저장소 컷오프 정책 (09-29)
      • 1.4 릴리스물 갱신: FlagScale 태그 재구축과 FlagGems 계열 2개 저장소 Release (09-29)
      • 1.5 build-infra: 3개 라인 이미지 기록 마무리——mthreads / ascend / enflame (09-29 ~ 09-30)
      • 1.6 FlagGems: KernelGen 연산자 배치와 Ascend 성능 배치 (09-29 ~ 09-30)
      • 1.7 FlagGems-vllm / FlagGems-Experimental: KMCompiler 커널과 5.5 alpha 라인 (09-29 ~ 09-30)
      • 1.8 FlagTree: metax 후치 패치 태그와 전체 백엔드 스케줄링 워크플로 (09-29)
      • 1.9 FlagQuantum: 커널 디렉터리 라우팅과 성능 융합 배치 (09-29 ~ 09-30)
      • 1.10 기타 동향: FlagCX / FlagFFT / FlagAttention / docs / vllm-plugin-FL (09-29 ~ 09-30)
    1. 뉴스 보도와 생태계
      • 2.1 컴포넌트 수준 검색 연속 23번째 평온한 기간 (09-29 ~ 09-30)
      • 2.2 Moore Threads: 우시 (惠山) 국산 지능형 컴퓨팅 센터 운영 3개월——6대 에이전트 실제 도입 (09-29)
    1. 회원사 심층 분석
      • 3.1 Moore Threads: musa 이미지 배치, MUSA 3D 최적화 브랜치와 우시 산업 (09-29)
      • 3.2 Ascend: megatron 0.18.2 4개 변형과 FlagGems 성능 배치 (09-29)
      • 3.3 Hygon / MetaX: 성능 연산자 배치와 metax 후치 패치 (09-29)
      • 3.4 Enflame / Iluvatar CoreX: 이미지 배치와 iluvatar 융합 커널 (09-29 ~ 09-30)
      • 3.5 Kunlunxin / Cambricon / Damo Academy XuanTie / Horizon Robotics: 기타 요점 (09-29 ~ 09-30)
    1. 요약과 트렌드 관찰
  • 부록: 출처 검증표
  • 전체 출처 목록

오늘의 중점: Torch-FL v2.10.0 릴리스 저장소 반영——FlagOS 2.2 목록 마지막 항목 완성 (09-29)

날짜: 2026-09-29 출처: Torch-FL v2.10.0 Release, community #124, community #125

09-28 데일리 리포트에서 2.2 목록(24개 항목)의 「유일한 공백」이었던 Torch-FL이 이번 기간에 저장소에 반영되었다——12:34 / 17:01 두 후보 태그(v2.10.0rc1 / rc2)가 먼저 릴리스 파이프라인을 예행演练하고, 18:17 Release를 생성, 18:20 정식 릴리스:

  • 릴리스 내용: torch-fl은 FlagOS의 PyTorch 디바이스 플러그인으로, 연산자별 라우팅(네이티브 벤더 커널 / FlagGems 이식 가능 커널 / CUDA 호환 boxing / CPU 폴백)을 단일 flagos 디바이스 아래로 통합하여, 동일한 PyTorch 프로그램이 코드 수정 없이 아홉 가지 가속 플랫폼에서 실행되도록 한다: NVIDIA(A100 / H800), Ascend(910C), Hygon(BW1000), MetaX(C550), DAMO Academy XuanTie(ZW810E), Moore Threads(S5000), Enflame(S60), Kunlunxin(P800), 그리고 Horizon Robotics 계열 BPU(s600).
  • 버전 및 패키징: 이 버전부터 버전 번호는 바인딩된 PyTorch 마이너 버전 라인을 따른다(이번에는 >=2.10,<2.11). wheel 이름은 torch_fl-2.10.0+<sdk>(예: +cuda13.3 / +dtk2604 / +cann9.0.0)이며, “하나의 태그, 플랫폼당 하나의 아티팩트” 방식을 따른다. wheel은 자기 서술적이며(compatibility.json에 플랫폼, 커널 집합, 빌드 ABI, FlagTree / FlagGems / FlagCX 핀 버전 기록), torch-fl-preflight 검증 CLI가 함께 제공된다(torch_fl을 import하지 않고도 환경 점검 가능).
  • 검증 기준: DDP와 FSDP2는 주류 카드에서 전부 통과했다. torch.compile은 flagos를 일급 inductor GPU 디바이스로 등록한다(FlagTree 백엔드가 여섯 곳을 커버, Enflame은 벤더 Triton 사용, BPU는 온보드 컴파일러 사용). profiler는 CUPTI에 정렬된다(각 사 전용 tracer 포함). 크로스 플랫폼 벤치마크(Qwen-Image-2.1, 단일 카드 1024², 40 스텝)에서 H100 네이티브 6.52초/이미지 대비 FlagOS H100 10.67, Moore Threads S5000 14.87, Hygon BW1000 23.59, Ascend 910C 24.94, MetaX C550 31.61, DAMO Academy XuanTie ZW810E 37.44, Enflame S60 58.04를 기록했다(이미지 품질은 H100과 정렬되며, CLIP-Score 편차는 ±1.6% 이내). 순수 CPU Arm 경로(Mac M5 Pro)는 PyTorch CPU 대비 1.74배 가속을 달성했다.
  • 세 가지 신규 역량: 신규 칩 백엔드 연동 skill(이번 주기에 T-Head ZW810E와 Kunlunxin P800이 이 경로로 도입됨), boxing 경로의 FP8 / FP4 소프트웨어 시뮬레이션(FP8 하드웨어가 없을 때 사용 가능), 연산자 수준 자동 경로 선택 튜닝.
  • 경계 설명(릴리스 산출물에 포함): torch.compile의 각 백엔드는 여전히 실험적 기능이다. Kunlunxin P800의 profiler / RNG와 compile은 아직 로드맵 상에 있다. flex_attention은 이 버전에서 미지원이다. BPU s600은 torch.compile 그래프 디바이스로만 사용된다(eager는 CPU로 폴백).
  • 규모: v0.1.0 이후 누적 269건의 커밋(62 기능 / 101 수정 / 11 성능 / 25 CI / 18 문서 / 16 테스트 / 10 리팩터 / 4 빌드)이며, HuggingFace 100+ 모델이 매트릭스의 각 보드에서 검증되었다.

판단: 이로써 2.2 공식 목록의 전 24개 항목 모두 대응하는 릴리스 산출물이 저장소에 반영되었다(목록 중 Torch-FL 항목의 검토 스냅샷은 여전히 pending이며, 이는 예상된 것이고 다음 수정 배치에서 갱신될 예정이다). “태그 → Release → wheel → 이미지” 네 가지 아티팩트 체인이 이번 모니터링 기간에 닫혔다.


1. 오픈소스 프로젝트 진행 상황(GitHub 동향)

1.1 Torch-FL: v2.10.0 정식 릴리스——2.2 마지막 항목 보완(09-29)

날짜: 2026-09-29 출처: Torch-FL v2.10.0, Torch-FL 태그 목록, compare v0.1.0…main

  • 타임라인: rc1 태그 12:34(“후보 태그를 릴리스 가능하게” 커밋에 위치) → rc2 태그 17:01 → Release 객체 18:17 생성, 18:20 릴리스; 정식 태그 v2.10.0과 rc2는 동일 커밋(#481 벤더 runner 릴리스 라인)을 가리킴.
  • 플랫폼 명세(릴리스물 매트릭스): Ascend 910C 354개 라우팅 연산자, FlagGems 라우팅 221 → 225, Qwen3-0.6B 학습 실측 torch_npu의 0.82배; Hygon BW1000은 CUDA boxing 경유 2033개 연산자 라우팅, FlagGems 라우팅 388 → 470; MetaX C550 cu-bridge 2033 연산자, 라우팅 377 → 443; DAMO Academy XuanTie ZW810E 라우팅 390 → 435; Moore Threads S5000 네이티브 mudnn 105 커널, 라우팅 391 → 468; Enflame S60 네이티브 libtopsaten 224 커널, Qwen-Image-2512 7.1초/스텝으로 최적화; Kunlunxin P800 2022 연산자, 380개 FlagGems-Python 라우팅; NVIDIA 측 FlagGems-C++ 디스패치 경로 진입(18개).
  • 분산: collectives는 플랫폼별로 FlagCX+MCCL(MUSA), FlagCX(GCU), DTK 상의 RCCL, HCCL 폴백과 NCCL 형태 라우팅으로 각각 처리; gloo 요청은 flagos 백엔드에서 응답.
  • 의미: rc 후보 라인을 먼저 돌리고 정식 태그를 다음 날 지정하는 “야간 걸침 릴리스 윈도” 추진 방식은 2.2 메이저 버전 릴리스의 조직 방식과 일치 — 먼저 아티팩트 파이프라인을 검증하고, 그다음 정식 객체를 확정.

1.2 Torch-FL(2): 릴리스 파이프라인 반복——후보 태그에서 벤더 wheel까지(09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: #473, #474, #475, #476, #480, #483

  • 패키징 규범: #473 wheel은 빌드된 SDK에 따라 명명, 플랫폼별로 인터프리터 고정(CUDA / GCU / MetaX / PPU는 3.12, DCU / MUSA는 3.10, Ascend는 3.11).
  • 태그 주도: #474는 태그로부터 wheel을 빌드하고 릴리스; #475는 릴리스 후보 태그를 릴리스 가능하게 함(rc1 / rc2가 이 메커니즘으로 통과).
  • 업로드 신뢰성: #476 동시 업로드 + 타임아웃 및 재시도; #480 / #481 각 플랫폼 wheel은 해당 벤더 자체 runner로 빌드되어 벤더 PyPI 레인에 릴리스.
  • 순서 수정: #483 / #484(09-30 00:55)에서 “먼저 publish, 그다음 artifact 업로드”로 수정 — 윈도 마지막 파이프라인 보수.
  • 의미: 릴리스 엔지니어링이 “태그 사용 가능”에서 “플랫폼별 아티팩트 재현 가능, 검증 가능”으로 진전 — 9일 전만 해도 미착수 항목이었으나, 이제는 릴리스 파이프라인 자체가 0에서 1을 완성.

1.3 community: 마무리 수정 2건과 8개 저장소 컷오프 정책(09-29)

날짜: 2026-09-29 출처: community #124, #125, #114, #115

  • #124(11:54) 기준점 정렬: FlagGems-vllm과 FlagGems-sglang이 「메인 브랜치의 2026-09-28 09:00 이전 마지막 커밋」을 사용하도록 변경 — 두 저장소의 기존 공식 태그가 삭제되고 검증된 기준점 커밋 위에 재생성됨(버전명 불변); 기준점 정책은 이로써 전체 8개 연산자 저장소(기존 6개 저장소 + 2개 저장소)로 확대됨.
  • #125(12:28) FlagScale 수정 반영: FlagScale의 RC2 초기화 수정(#1304 포함, 비이기종 초기화 문제)을 2.2에 반영 — 명세의 FlagScale 항목을 release-source: rc2-head, 대상 커밋 4371924로 변경.
  • 상태 비고: #114(L1 연산자 저장소를 명세에 추가)는 종료되었으나 병합되지 않았고, 그 범위는 #116 / #117 / #123 노선으로 재구성됨; #115(2.2에 이미 전달된 FEP 범위와 2.3으로 순연된 항목)는 여전히 열려 있으며 모니터링 기간 내 동작 없음.

1.4 릴리스물 갱신: FlagScale 태그 재생성과 FlagGems 계열 두 저장소 Release(09-29)

날짜: 2026-09-29 출처: FlagScale v2.1.0, FlagGems-vllm v0.2.0, FlagGems-sglang v0.1.0

  • FlagScale v2.1.0(12:27): 태그가 「2.1.0-rc2 상의 4371924f」로 재생성됨(#1304 수정 포함), Release 객체도 동기 갱신됨 — 규모가 33개 PR 및 2건의 추가 커밋으로 갱신됨(기존 32 PR 기준도 이에 따라 수정됨).
  • FlagGems-vllm v0.2.0(11:52): 태그가 기준점 커밋 b5c2c224 위에 재생성됨, Release는 11:52 ~ 11:55에 저장소에 등록됨(본문에 Part of FlagOS 2.2 표기).
  • FlagGems-sglang v0.1.0(11:53): 태그가 기준점 커밋 575d5bc3 위에 재생성됨, Release 동기 등록됨(최초 버전 80개 PR 및 14건의 추가 커밋).
  • 모니터링 기간 연계: 세 저장소의 작업이 11:52 ~ 12:28 사이에 집중되었고 #124 / #125와 분 단위로 연계됨 — 「기록 수정 → 태그 재생성 → Release 갱신」이 한 번의 점심시간 모니터링 기간 내에 완결됨.

1.5 build-infra: 3개 계열 이미지 기록 마무리 — mthreads / ascend / enflame(09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: build-infra 이미지 기록 배치, #1292, #1296 ~ #1303, #1312, #1314

  • Ascend 4개 변형(#1296 ~ #1303, 16:28 ~ 17:04): megatron 0.18.2 학습 매트릭스에 cann8.5.0 / cann9.0.0 / cann8.5.0-910c / cann9.0.0-910c 4개 레코드를 추가하고 0.18.2 변경 로그를 보완했으며, verify 컨테이너의 프록시 관통 문제도 동시에 수정(#1297).
  • Moore Threads 배치(#1294 ~ #1313, 16:19 ~ 00:19): musa4.3.6 / musa5.2.0 두 라인의 vllm(0.3.0 / 0.2.2), megatron(0.2.3)과 sglang(0.1.dev1) 애플리케이션 태그를 일괄 기록했으며, mthreads 애플리케이션이 새 flagtree wheel 위에서 재빌드되도록 승인(#1292). sglang 이미지 태그는 2.2.0 스택 접두사를 복원했고, 아침에 mthreads sglang 문서를 보완 수정(#1314, 08:50).
  • Enflame 배치(#1284 ~ #1291, 10:39 ~ 10:41): tops1.9.10 / 1.10.6 두 라인의 vllm(0.2.2), megatron(0.2.3)과 sglang 레코드를 일괄 저장.
  • 빌드 인프라: EXTRA_PYPI 폴백을 Tencent PyPI 미러로 전환(#1312). Nexus 대용량 파일 업로드 상태 확인 워크플로(#1293)가 검토 대기로 공개.
  • 규모: 모니터링 기간 내 build-infra 51건 커밋, 약 30건 병합 PR. release-info 포털은 레코드 배치에 따라 자동 배포 7회.

1.6 FlagGems: KernelGen 연산자 배치와 Ascend 성능 배치(09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: FlagGems #6610, #6770, #6699, #6553, #6633, #6795, #6741, #6799

  • KernelGen 연산자 배치(16건): NVIDIA 측에 dim, kl_div, linalg_pinv, weight_int4pack_mm, _spsolve, triplet_margin_loss, max_pool1d_with_indices, conv_tbc, quantized_batch_norm, quantize_per_channel, put, special_hermite_polynomial_he, histogram, 융합 SDPA 역방향, batch_norm_stats, bartlett_window 신규 추가——KernelGen 생성 연산자가 계속해서 메인 저장소에 집중적으로 유입.
  • Ascend 성능 배치(#6697 ~ #6703, #6770): baddbmm 바이어스 브로드캐스트와 tile 선택, bmm tile과 마스크, 대형 BF16 부하 addmm, mv GEMV 디스패치, mul 브로드캐스트 디스패치 연속 튜닝. TRITON_ALL_BLOCKS_PARALLEL 환경 변수 전역 누수 문제도 수정.
  • 벤더 최적화: Hygon 성능 취약 연산자 일괄 최적화(#6553). KMCompiler linear가 NVIDIA / Hygon / MetaX / Thead 4개 백엔드를 커버(#6633). SiliconFlow 라인 geometric 계열과 argsort의 백엔드별 구현(#6575 / #6692).
  • CI 및 수정: Cambricon ops-test 이미지 업데이트(#6795), Moore Threads 테스트를 flagcicd로 이관, 변경 연산자는 마커 테스트로 전환(#6741), runner 볼륨 정리. tle 임포트 보호(#6777), SQL 콜드 스타트 WAL 경합(#6730), FlashAttention 비연속 텐서 구체화(#6727). 벤치마크 기준선을 네이티브 aten 연산자로 변경(#6195).
  • 신규 기여: 5개 sparse / metadata 테스트 스위트(#6799)가 09-30 아침 제출되어 검토 대기 중.

1.7 FlagGems-vllm / FlagGems-Experimental: KMCompiler 커널과 5.5 alpha 라인(09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: FlagGems-vllm #873, #875, #876, #877, FlagGems-Experimental #721

  • FlagGems-vllm: #873 백엔드 특화 dequantize_and_gather_k_cache 추가(Ascend / Moore Threads); #875 / #876 Iluvatar 융합 q_kv_rmsnorm 및 fused add rms norm 최적화; #877 테스트 이미지를 flagtree v0.7.0으로 상향.
  • FlagGems-Experimental: 동일 배치 KernelGen 연산자(slow_conv_transpose3d, combinations, sparse_resize_, sparse_coo_tensor, _unpack_dual, can_cast, _fw_primal, flatten_dense_tensors, ccol_indices 등)가 실험 저장소에 계속 편입; alpha 버전 번호가 5.4에서 5.5로 상향(#721) — 다음 연산자 라이브러리 버전 라인의 개발 트랙이 개시됨.

1.8 FlagTree: metax 후치 패치 태그와 전 백엔드 스케줄링 워크플로 (09-29)

날짜: 2026-09-29 출처: FlagTree 태그, #1310, #1307, #1212, #1303

  • 후치 패치 태그: 0.7.0.post2+metax3.6이 flagtree-bot에 의해 18:27에 푸시됨(“pypi 0.7.0.post2+metax3.6”) — 대상 커밋은 바로 “Metax bf16 sum reduction을 fp32로 승격”(#1310)이며, metax는 post2 수정 변형을 최초로 확보한 백엔드가 됨.
  • 커밋: #1307은 모든 백엔드에定时 스케줄링 워크플로를 추가; #1212는 디코드 단계 TLE 융합 AllReduce + RMSNorm 추가; #1303 CI는 프로세스 종료 전에 pid 파일 경로를 검증.
  • 의미: 2.2 동결 라인 밖에서 “릴리스 후 변형별 증분 패치” 채널이 열림 — 변형 입도(+metax3.6 등)는 독립적인 패치 주기를 지원.

1.9 FlagQuantum: 커널 디렉터리 라우팅과 성능 융합 배치 (09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: FlagQuantum #240, #236, #241, #259

  • 커널 카탈로그(kernel catalog) 시리즈(#240 ~ #259, 25건 커밋): 시맨틱 카탈로그(#240), 증거 목록(#243), 능력 매처(#244) 이후, 로컬 1q / CNOT / CNOT 시퀀스 / 융합 전치 / 제어 부분공간 전송 / adjoint VJP / 가역 VJP / 샤딩 adjoint VJP 등의 경로가 순차적으로 카탈로그 라우팅에 연결됨 — 스케줄링 계층이 하드코딩에서 레지스트리 기반으로 전환.
  • 성능 융합: adjoint 경계 융합(Euler 삼중항, QAOA 정방향 / 역방향 경계, 관측 가능량 회전 경계), CX gathers 융합, 회전 tile 확장, 종료 상태 복원 건너뛰기, 정방향 불변량 캐싱 — CPU 네이티브 경로가 연속적으로 마무리됨.
  • 신규 기능: 연속 시간 Lindblad 진화(#236), 제공자 상태 VQE 기저 상태 해법(#241), Triton 컴파일러 소스 추적 분석(#233).
  • 의미: 양자-지능 융합 방향(10-17 대회 특별 세션)의 엔지니어링 기반 — 컴포넌트가 대회 3주 전에 고빈도 반복 개발에 진입.

1.10 기타 동향: FlagCX / FlagFFT / FlagAttention / docs / vllm-plugin-FL (09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: FlagCX #632, FlagFFT 활동, FlagAttention #71, docs #521, docs #530, vllm-plugin-FL #563

  • FlagCX: #632는 공유 전송 정렬(CRL)과 재시도 가능한 teardown을 통합 — 백엔드 간 전송 일관성 기반 계층을 계속 강화.
  • FlagFFT: codex/musa-3d-opt(Moore Threads)와 codex/maca-3d-opt(MetaX) 두 최적화 브랜치를 신규 추가, 09-29 오후부터 저녁까지 여러 차례 푸시 — 3차원 FFT의 다중 플랫폼 최적화 라인이 동시에 가동.
  • FlagAttention: moba attention(#71), Hy3 attention(#56), parallax(#57) 세 건이 09-30 오전에 연속 머지됨.
  • docs 문서 배치(23건 커밋): #521 “2.2 문서 초안” 전체 배치 머지(09-30 08:44) — FlagAttention 중영문 문서 전체 신규 생성, FlagAudio / FlagBLAS / FlagDNN / FlagFFT / FlagGems-vllm 릴리스 노트 업데이트, FlagQuantum 문서 개편(아키텍처 / 기능 / 알고리즘 / 사용자 가이드), 배포 워크플로 확장; #530은 FlagGems-sglang 중영문 문서 페이지 개설(설치 / 요구사항 / 연산자 목록 / 릴리스 노트); #514 칩 적응 가이드; 모델 목록 배치 지속(ModelScope 시리즈, aihuanxin, HuggingFace 오픈 PR).
  • vllm-plugin-FL: 리뷰 후 #563 머지; 오픈 PR 라인 활발 — MiniCPM-V 4.7 적응(#567), Sunrise PTPU 정적 그래프(#568), Iluvatar CoreX BI-V150의 vLLM 0.28.0 적응(#566), Kunlunxin P800을 vLLM 0.24.0으로 업그레이드(#561), Ascend 범용 전체 디코딩 그래프(#409), 그리고 Qwen3.8-Flash / GLM5.3-Flash / HY4의 H100 지원 세 건(#455 / #454 / #453) — 09-30 아침까지도 집중 리뷰 중.

2. 뉴스 보도와 생태계

2.1 컴포넌트 수준 검색 연속 23번째 평온한 모니터링 기간 (09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: Google News RSS(중영문 검색어 24개 조합, 프록시 경유), HN Algolia

  • 컴포넌트 및 릴리스 라인 조회(FlagOS / FlagGems / FlagScale / FlagTree / FlagCX / KernelGen / FlagPerf / 대회 의제)는 24시간 모니터링 기간 내 신규 대외 공지가 없음——연속 23번째 조용한 모니터링 기간; Torch-FL의 릴리스 동작은 전부 코드와 아티팩트 측에서 발생(1장, 3장 참조).
  • 생태계 측 모니터링 기간 내 11건 적중: 직접 관련은 Moore Threads 산업 측 1건(2.2 참조); 나머지는 주식 시세 기사(Enflame 수익 전망, GPU 4대 신흥기업 보호예수 해제), Zhiyuan 관련 사회 뉴스(AI 안전 투자 인터뷰) 및 무관한 전재로, 주제별로 제외.
  • HN Algolia에서 FlagOS / FlagGems / FlagScale / BAAI 관련 적중 없음(퍼지 매칭 결과 모두 무관한 주제).

2.2 Moore Threads: 우시(후이산) 국산 지능형 컴퓨팅 센터 운영 3개월——6대 지능형 에이전트 안착(09-29)

날짜: 2026-09-29 출처: Phoenix Net(Sina Finance 등 동일 제목 전재)

  • 이정표: 우시(후이산) 국산 지능형 컴퓨팅 센터 1기 운영 3개월 충족——운영 후 불과 2개월 만에 거의 만부하에 도달, 국산 컴퓨팅 파워 상용화 안착의 벤치마크가 됨; 1기 2000장의 Moore Threads MTT S5000 지능형 컴퓨팅 카드가 전부 운영 중(“동수서산” 양쯔강 델타 허브 후이산 노드에 속함).
  • 6대 지능형 에이전트: 정무(후이산 투자유치 지능형 에이전트, 데이터-컴퓨팅-애플리케이션 일체화), 의료(후이산구 인민병원 × 난징우전대학교 에지 지능 연구원 스마트 병원 시스템, 약 30개 모델 안착; Zhizhen Technology WiseAgent 건강 지능형 에이전트), 교육(ECNU Qichuang InnoAgent 플랫폼, 300+ 교육 지능형 에이전트, 1000+ 교육 스킬 통합 및 이미 오픈소스화), 칩 설계(X-Epic X-IVS / X-IDS, Formal Agent 사례 엔드투엔드 23.8시간) 등 고부가가치 분야.
  • 본 스택과의 관계: MTT S5000은 FlagOS 멤버 플랫폼——본 모니터링 기간 내 Moore Threads 측 musa 애플리케이션 이미지 배치, Torch-FL 릴리스물 중 S5000 데이터(105개 네이티브 커널, FlagGems 라우팅 391 → 468)와 “국산 칩으로 국산 모델 훈련” 산업 서사가 상호 조응; “후이산 모델”은 다음 단계로 더 많은 지역에 복제될 예정.

3. 멤버사 심층 분석

3.1 Moore Threads: musa 이미지 배치, MUSA 3D 최적화 브랜치와 우시 산업(09-29)

날짜: 2026-09-29 ~ 2026-09-30 출처: build-infra #1294 ~ #1313, FlagGems-vllm #873, FlagFFT 활동

  • 애플리케이션 이미지: musa4.3.6 / musa5.2.0 두 라인 vllm(0.3.0 / 0.2.2), megatron(0.2.3), sglang 태그 일괄 저장소 반영; 애플리케이션이 신규 flagtree wheel에서 재빌드 승인 획득(#1292).
  • 연산자 계층: FlagGems-vllm dequantize_and_gather_k_cache의 mthreads 특화(#873); FlagTree bf16 sum reduction의 fp32 대비 향상 post2 패치가 해당 백엔드 시나리오 기반(#1310, 1.8 참조).
  • 최적화 브랜치: FlagFFT codex/musa-3d-opt 브랜치 09-29 오후 여러 차례 푸시(13:53 ~ 14:30).
  • 산업 측: 우시(후이산) 지능형 컴퓨팅 센터 운영 3개월, 6대 지능형 에이전트 안착(2.2 참조).

3.2 Ascend: megatron 0.18.2 4가지 변형과 FlagGems 성능 배치(09-29)

날짜: 2026-09-29 출처: build-infra #1296 ~ #1303, FlagGems #6699, #6770, FlagGems-vllm #873

  • 학습 프레임워크: megatron 0.18.2 네 가지 백엔드 라인(cann8.5.0 / cann9.0.0 / 910c 두 변형) 기록 및 변경 로그 반영 — Ascend 학습 측이 릴리스 주 이후 첫 영업일에 0.18.2 매트릭스를 보완.
  • 연산자 성능: FlagGems 여섯 건의 Ascend 튜닝(baddbmm / bmm / addmm / mv / mul / 환경 변수 누출 수정).
  • 추론 커널: FlagGems-vllm KMCompiler dequantize_and_gather_k_cache Ascend 특화(#873).
  • 오픈 PR: vllm-plugin-FL Ascend 범용 전체 디코딩 그래프(#409) 지속 리뷰.

3.3 Hygon / MetaX: 성능 연산자 배치와 metax 후속 패치 (09-29)

날짜: 2026-09-29 출처: FlagGems #6553, #6633, FlagTree #1310, FlagFFT 활동

  • Hygon: FlagGems 성능 취약 연산자 일괄 최적화(#6553); KMCompiler linear의 Hygon 백엔드를 네 백엔드 통합 리팩터링에 포함(#6633); Torch-FL 릴리스물에서 BW1000은 CUDA boxing(2033 연산자, 466개 FlagGems 라우팅)으로 동작하며 DTK 브랜치가 아닌 업스트림 PyTorch 기반으로 실행.
  • MetaX: FlagTree 0.7.0.post2+metax3.6 후속 패치 태그(bf16 sum → fp32); FlagFFT codex/maca-3d-opt 브랜치 09-29 오후부터 저녁까지 연속 푸시(15:31 ~ 18:45); Torch-FL 릴리스물에서 C550은 cu-bridge를 통해 2033 연산자 라우팅, FSDP2와 Qwen3 학습 정렬.

3.4 Enflame / Iluvatar: 이미지 배치와 iluvatar 융합 커널 (09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: build-infra #1284 ~ #1291, FlagGems-vllm #875, #876

  • Enflame: tops1.9.10 / tops1.10.6 두 라인 vllm(0.2.2), megatron, sglang 애플리케이션 기록 일괄 저장(#1284 ~ #1291); Torch-FL 릴리스물에서 S60은 네이티브 libtopsaten 백엔드(224 커널)로 Qwen-Image-2512를 7.1초/스텝으로 최적화.
  • Iluvatar: FlagGems-vllm 두 건의 융합 커널 — fused q_kv_rmsnorm과 fused add rms norm 최적화(#875 / #876).

3.5 Kunlunxin / Cambricon / Damo Academy XuanTie / Horizon Robotics: 기타 요점 (09-29 ~ 09-30)

날짜: 2026-09-29 ~ 2026-09-30 출처: vllm-plugin-FL #561, FlagGems #6795, #6633, Torch-FL v2.10.0

  • Kunlunxin: vllm-plugin-FL의 P800을 vLLM 0.24.0으로 업그레이드하는 PR(#561)이 심사 대기 중이며, Torch-FL 릴리스물에서 P800의 profiler / RNG와 compile은 로드맵 항목으로 분류되었습니다.
  • Cambricon: FlagGems ops-test 이미지 업데이트(#6795).
  • DAMO Academy XuanTie: KMCompiler linear의 Thead 백엔드가 4개 백엔드 리팩터링(#6633)으로 편입되었으며, Torch-FL 릴리스물에서 ZW810E 라우팅 390 → 435, AMP 통합.
  • Horizon Robotics: BPU s600이 엣지 디바이스 타깃으로 Torch-FL 플랫폼 매트릭스에 진입(torch.compile 그래프 경로, 온보드 컴파일러).
  • Qingwei: 모니터링 기간 내 신규 동향 없음(이전 기간에 FlagScale txda 백엔드가 이미 수록됨).

4. 요약 및 트렌드 관찰

  1. 2.2 마무리 완료: 체크리스트 24개 항목 전부 저장소 반영 — Torch-FL v2.10.0이 모니터링 기간 내 릴리스되어 마지막 항목이 채워졌으며, 「수정 → 재빌드 → 재릴리스」 규율 3연타(#123 6개 저장소 소스 수정 → #124 2개 저장소 기준점 정렬 → #125 FlagScale 수정 반영)가 12시간 이내에 폐루프를 완성했습니다.
  2. 릴리스 엔지니어링이 명시적 역량으로 부상 — Torch-FL이 하루 만에 rc1 → rc2 → 정식 릴리스를 완료했고, 릴리스 라인에 다수의 반복 개선(태그 기반 빌드, 벤더 자체 runner, 동시 업로드 재시도, 릴리스 순서 수정)이 동반되었습니다. wheel 자기 기술 + preflight 검증 — 릴리스물이 「설치 가능」에서 「검증 가능, 추적 가능」으로 나아가고 있습니다.
  3. 개발 라인 전면적 차기 주기 전환 — FlagGems-Experimental alpha가 5.5로 상승, FlagGems-vllm 0.3.0-dev1(이전 기간), vllm-plugin-FL의 신모델(Qwen3.8-Flash / GLM5.3-Flash / MiniCPM-V 4.7) 및 신하드웨어(CoreX BI-V150, P800 업그레이드) 대응 오픈 PR 집중 심사 — 릴리스 동결 종료 후 적응 라인이 다시 가속화되고 있습니다.
  4. 세 가지 주류가 모니터링 기간 내 동조 — KernelGen 연산자 커버리지(16건 메인 저장소 반영), 벤더 플랫폼화 최적화(Ascend / Hygon / MetaX / Enflame 각각 전용 배치, FlagFFT 이중 최적화 브랜치), 양자 시스템 스택(FlagQuantum 25건) — 10-17 대회의 AI 시스템 / 양지융합 특별 세션 주제와 같은 방향입니다.
  5. 뉴스 측 23번째 평온한 기간과 산업 측 행보 병존 — 코드 측 주도, 회의 노드 서사의 구도가 지속되며, Moore Threads 우시 사례(6개 에이전트 + 풀부하 벤치마크)는 「국산 컴퓨팅 파워 상용화」 서사의 새로운 샘플로, Torch-FL 릴리스물의 S5000 데이터와 상호 입증됩니다.
  6. 다음 관찰 포인트: community 체크리스트의 Torch-FL 항목 스냅샷 갱신, 2.3 개발 라인 합류(FlagGems 5.5, FlagGems-vllm 0.3.0, vLLM 0.28 적응) 및 10-17 대회의 대외 발표물.

부록: 출처 검증표

카테고리 출처 검증 방식 결과
GitHub org: flagos-ai repos API 54개 저장소 pushed_at 전수 검증 16개 저장소가 모니터링 기간 내 활성 (그중 12개 저장소에 기간 내 커밋 존재)
GitHub 커밋 검색 + 저장소별 대조 커밋 검색 168건(total_count 전수) 건별 검증 12개 저장소 168건(build-infra 51 / FlagGems 38 / FlagQuantum 25); 조직 내 신규 저장소 없음
릴리스물 Torch-FL releases / tags API 태그, Release, 릴리스 시각 건별 검증 v2.10.0(18:17 생성 / 18:20 릴리스); rc1 / rc2 후보 태그 선행
릴리스물 FlagScale / FlagGems-vllm / FlagGems-sglang / FlagTree 원자 태그 객체(tagger 시간 및 대상 커밋) 건별 대조 세 저장소 태그 재생성(11:52 ~ 12:27); metax post2 태그(18:27)
릴리스 엔지니어링 community #124 ~ #125 원문 제목, 본문 및 파일 차이 대조 두 건 모두 병합; 마감 정책 8개 저장소로 확대
릴리스 엔지니어링 release-2.2.yaml 매니페스트 원문 수집 대조 8개 저장소 마감 + FlagScale rc2-head; Torch-FL 스냅샷 갱신 대기
릴리스 엔지니어링 build-infra PR 배치 및 release-info 포털 건별 대조 약 30건 병합; 포털 7회 배포
문서 docs PR #521 / #530 파일 목록 파일별 대조 2.2 문서 전체 배치(FlagAttention 전체 세트 포함) 및 sglang 문서 페이지
뉴스 Google News RSS(중영문 검색어 24조, 프록시 경유) 24시간 기간 필터 + 건별 제외 컴포넌트 라인 신규 없음(23번째 조용한 기간); 생태계 측 1건 유지
미디어 Phoenix Net(신랑재경 등 동일 제목 전재) 원문 수집 재검증(게시 시각 09-29 18:44) 우시(후이산) 지능형 컴퓨팅 센터 3개월 마일스톤
커뮤니티 HN Algolia 검색 재검증 관련 항목 없음
과거 대조 전 이틀 FlagOS 데일리 리포트 중복 제거 검증 Torch-FL pending → 릴리스가 기간 핵심 증분; 우시 사례 최초 수록; AICC2026은 09-23 / 09-24에 이미 수록

전체 출처 목록