모니터링 기간: 지난 24시간(2026-09-22 07:00 ~ 2026-09-23 07:00, 베이징 시간). 이번 회차는 정규 데일리 업데이트 기간이며 이전 회차와 겹치지 않습니다. 출처: GitHub(tile-ai 조직 28개 저장소 푸시 점검, 기간 내 7개 저장소에 푸시 있음; 메인 저장소 1건 머지 및 1건 신규 오픈, 리뷰 큐 다수 업데이트; TileOPs 1건 머지와 5건 신규 오픈, 4건 종료; TileFoundry 2건 머지; MLIR Ascend Mamba 대형 머지; Hygon 듀얼 브랜치 진행에 샘플 지원 PR 업데이트 포함; 커뮤니티 TPU 백엔드 저장소 BM1690 멀티코어 검증; Ascend 일일 테스트 워크플로 수준 실패 및 A5 하드웨어 경로 결함 보고; 야간 스냅샷 벤치마크 1046건 무실패, 정확성 1141건 릴리스 복구), Google News RSS 중영문 다중 쿼리(프록시 경유, 제로 히트), Hacker News, arXiv, 서드파티 생태계 저장소


이번 회차 인덱스

  • 오늘의 핵심: FP4에서 FP8로의 정확한 변환이 메인 저장소에 융합됨——DeepSeek V4.1 전문가 GEMM 최대 5.4배 속도 향상(09-22)
    1. 핵심 프로젝트 진행
      • 1.1 메인 저장소 리뷰 큐: 병렬 루프 수정 신규 오픈, TileIR 백엔드 8개 커밋 추가(09-22)
      • 1.2 TileOPs 거버넌스 마무리: 매니페스트 항목과 평가기의 마지막 우회 경로 제거(09-22)
      • 1.3 TileOPs 성능 스프린트 1: Engram 디코딩을 프로젝션과 리덕션 두 단계 커널로 분할(09-22)
      • 1.4 TileOPs 성능 스프린트 2: GEMM 핑퐁 메인 루프로 덴스 에필로그 숨김, 176 타일 진입(09-22)
      • 1.5 TileOPs 성능 스프린트 3: GLA 추론 연산자 진입, MoE 초과 라우팅 그룹화(09-22)
      • 1.6 TileOPs: roofline 합성 실패가 보고 가능으로 전환, 큐 3건 업데이트(09-22)
      • 1.7 TileFoundry: 메모리 메타데이터와 트래픽 정규화 2건 머지(09-22)
      • 1.8 야간 스냅샷: 벤치마크 1046건 무실패, 정확성 1141건 릴리스 복구(09-23)
    1. 멀티 백엔드 적응(Ascend / Hygon / MetaX / Moore Threads 등)
      • 2.1 Ascend: 일일 테스트 워크플로 수준 실패 재발, 3건 신규 결함 티켓이 A5 하드웨어 경로와 자동 동기화 지목(09-22 ~ 09-23)
      • 2.2 MLIR Ascend: Mamba SSD chunk scan 연산자 대형 머지, 튜닝과 통합 프로세스 동시 정비(09-22)
      • 2.3 Hygon: FP32 MMAC K 커밋 확장 재작업; 샘플 지원 PR에 32개 파일 신규 추가(09-22)
      • 2.4 MetaX와 Moore Threads: 기간 내 푸시 없음(09-23 점검)
      • 2.5 커뮤니티 백엔드: TileLang-TPU, Sophon BM1690 멀티코어 검증과 성능 매트릭스 추진(09-22)
    1. 생태계와 도입자
      • 3.1 도입자: TileKernels와 FlashQLA 기간 내 푸시 없음(09-23 점검)
      • 3.2 커뮤니티 프로젝트: MetaX C500 멀티패러다임 연산자 개발 실전 캠프 자료 지속 커밋(09-22)
    1. 커뮤니티, 튜토리얼과 활동
      • 4.1 문서 사이트: TileOPs 문서 사이트 1회 버전화 배포(09-22)
      • 4.2 미디어와 학술 측: Google News 제로 히트, arXiv 신규 논문 없음(09-23 점검)
      • 4.3 버전 리듬: 신규 릴리스 없음, 메인 저장소 v0.1.14 21일 경과(09-23)
    1. 트렌드 관찰
      • 5.1 변환 연산자가 일등 시민이 되다
      • 5.2 TileOPs, 거버넌스 시즌에서 성능 시즌으로 전환
      • 5.3 Ascend의 적록 교차와 A5의 실제 하드웨어 검증
      • 5.4 공백과 리스크 지점
  • 부록: 소재와 점검 설명

오늘의 핵심: FP4에서 FP8로의 정확한 변환이 메인 저장소에 융합됨——DeepSeek V4.1 전문가 GEMM 최대 5.4배 속도 향상

날짜: 2026-09-22 출처: tilelang #3204

19:36 머지(09-11 오픈, 11일간 다듬음). 이 변경의 출발점은 겉보기엔 사소한 변환 체인입니다: DeepSeek V4.1의 전문가 GEMM은 각 K 타일에서 E2M1(FP4) 가중치를 FP32를 경유해 E4M3(FP8)로 변환해야 합니다. 작성자는 하나의 인코딩 사실을 발견했습니다——E2M1의 모든 값은 부호 있는 0을 포함해 E4M3에 정확히 대응하는 인코딩이 존재하므로, 이 “먼저 FP32로 전개한 뒤 다시 압축”하는 기본 프로젝션 체인은 FP32를 거치지 않아도 됩니다.

구현상, 이 미표기 CUDA 변환 체인을 4개 원소당 두 개의 __byte_perm 명령어로 융합했습니다; 스칼라와 2, 4, 8, 16, 32 다섯 가지 벡터 폭을 지원합니다; 변환 어노테이션이 명시적으로 작성된 코드는 기존 lowering 경로를 유지합니다; 전체 변환이 레지스터 내에서 완료되며 전역 또는 공유 메모리 할당이 추가되지 않습니다.

검증은 네 계층으로 나뉩니다: 소스 생성 테스트가 두 가지 E4M3 표기와 모든 폭을 커버; 런타임 케이스가 각 패킹된 4니블 워드와 독립 인코딩 테이블을 문자 단위로 비교; 추출된 GEMM이 모든 구성에서 베이스라인과 비트 단위로 일치(별도로 샘플링한 CPU 레퍼런스 포함); CUDA, ROCm, Metal, CuTeDSL의 현재 헤드 CI 모두 통과.

H100 성능(동일 카드, 동일 입력, 각 그래프 100회 호출 중앙값, 네 행 발췌):

M N K 베이스라인(마이크로초) 이번 커밋(마이크로초)
1 2,304 5,120 547.94 108.65
512 2,304 5,120 717.30 224.21
1 5,120 2,304 245.17 45.85
2,048 5,120 2,304 1,760.22 591.92

열두 개 구성의 속도 향상 구간은 2.97배에서 5.38배이며, 레지스터 사용량은 128에서 156으로 증가했지만 스필은 없다. 작성자가 명시한 경계: Blackwell 실행과 전체 모델 서빙 두 가지는 아직 검증되지 않았다.

판독: 161줄만 추가된 「마이크로 전환」 한 건이 최대 5.4배의 엔드투엔드 이득을 가져왔다는 것은, 전문가 GEMM처럼 가중치를 타일마다 반복적으로 읽는 시나리오에서 전환 체인의 비용이 확대경 아래 놓이는 것이 과장이 아님을 보여준다. 또한 TileLang 메인라인의 최적화 대상이 「큰 구조」에서 「각 계층 명령어의 장부」로 옮겨가고 있음을 다시 보여준다.


1. 핵심 프로젝트 진행 상황

1.1 메인 저장소 리뷰 큐: 병렬 루프 수정 새로 열림, TileIR 백엔드에 8개 커밋 추가 (09-22)

날짜: 2026-09-22 ~ 2026-09-23 출처: #3269/#3247 등 네 건(전체 목록은 부록 참조)

  • #3269 (09-23 01:48 새로 열림): let 인라인 비활성화 시 병렬 루프의 lowering 수정——PartitionLoop에서 루프 변수 치환 순서를 조정하고, 치환 전에 버퍼 인덱스를 먼저 간소화하며, 병렬 루프에 회귀 테스트를 추가하고, CUDA/HIP에서 조건부 병렬 루프 실행 커버리지도 보강. 같은 작성자가 이번 모니터링 기간에 올린 두 번째 수정(첫 번째는 NVRTC 라인).
  • #3247 (13:56에 8개 커밋 추가): CUDA Tile IR 실행 백엔드(tileir 타깃, NVIDIA CUDA Tile IR로 lowering, cuTile 런타임을 거쳐 cubin 방출, JIT, 캐시, 자동 튜닝, DeepSeek V4 희소 어텐션 튜닝 커널 포함)가 며칠간 중단되었다가 재개되어, 이번 모니터링 기간에 한 번에 8개 커밋을 추가했으며 여전히 리뷰 중.
  • #3267 (09-23 01:05 업데이트): tl.LowerMagicDiv 매직 디비전(동적 형상 제수를 위한 호스트 측 사전 계산) 리뷰 계속, CUDA/ROCm/CPU C와 호스트 코드 생성을 커버.
  • #3265 (13:54 업데이트): 시작 불변 정수 연산을 호스트 측으로 내리기, Cython과 NVRTC 두 시작 경로의 거부 로직을 커버.
  • #3241 ~ #3244 (18:16~18:20에 각각 한 번씩 활동): CuTeDSL의 FP4 변환과 저장 lowering 수정, RNG 초기화 삼연타(기본 시퀀스, void 바인딩 거부, 초기화 누락 진단) 네 건의 수정 PR이 열린 상태로 유지되고 있으며, 머지 동작은 보이지 않음.

큐 관찰: 이번 모니터링 기간에 메인 저장소는 단 1건만 머지되었으며(#3204, 오늘의 중점 참조), 리뷰 측은 「커밋 추가, 승인 없음」 상태에 들어갔다——TileIR과 매직 디비전 두 큰 라인 모두 재료를 모으고 있다.

1.2 TileOPs 거버넌스 마무리: 목록 항목과 평가기의 마지막 우회로가 제거됨 (09-22)

날짜: 2026-09-22 출처: TileOPs #2167

10:24 머지(09-21 22:34에 열림, 약 반나절 만에 완료). #2158의 목록 공식 합류를 이어받아, 이번 커밋은 「함수가 정의된 평가 메서드를 가진 항목에 조용히 양보하는」 메커니즘을 설치 지점에서 제거했다: 통합 경로를 막던 두 개의 GQA 오버라이드를 삭제하고, 「호출 시점 페이로드를 속성 위에 중첩하는」 동일한 방식으로 전환했으며, 동시에 두 가지 오용에 명확한 오류를 추가했다——페이로드가 None인 경우(호출자 타이밍 문제)와 페이로드가 매핑이 아닌 경우(작성자 배선 오류). 배경 데이터는 대조 PR #2175의 회고에서 나왔다: 09-19의 특정 커밋 지점에서 175개의 구현된 항목 중 19개의 공식 합성이 실패했고, #2158과 이번 커밋 전후로 수정되었지만 당시에는 어느 계층도 「다음 실패가 누구인지」 보고하지 않았다.

1.3 TileOPs 성능 스프린트 1: Engram 디코딩을 프로젝션과 리덕션 두 단계 커널로 분할 (09-22)

날짜: 2026-09-22 출처: TileOPs #2173

16:50 새로 열림 (파일 1개 +265/-108). 기존 구현은 배치 행마다 하나의 스레드 블록을 두고, 두 번의 프로젝션을 직렬 루프 안에서 연쇄 스칼라 로딩으로 수행했으며, 가중치는 어떤 블록과도 공유되지 않았다. H200에서 4.8 TB/s 장치 대역폭의 6~34 GB/s밖에 나오지 않았고, 모든 목록 워크로드에서 torch.compile 베이스라인보다 느렸다. 새 구조는 두 단계로 나뉜다. 프로젝션은 d 차원 기준으로 블록을 나누고, 행렬 곱으로 가중치를 한 번 읽어 전체 배치를 처리하며(B가 16 이하이면 단일 MMA 타일 안에 들어감) 겸사겸사 캐시 시프트를 완료한다. 나머지 단계(세 개의 RMSNorm, 게이팅, 팽창 합성곱, SiLU)는 모두 d를 따라 리덕션되므로 두 번째 단계로 이어져, 배치 행마다 하나의 블록을 둔다. 설명에 적어 넣은 발견이 하나 더 있다. 두 행렬 곱이 같은 파이프라인 본체 안에 있을 때, 일부 타일 형상은 파이프라인 스테이지를 조용히 잘못 읽는다. 3가지 형상 곱하기 30가지 타일/스테이지 조합을 훑은 뒤 두 블록이 그리드 축을 타도록 바꾸었고, 단일 블록 단일 체인은 30가지 조합 모두에서 정확하다.

실측(H200 장치 사용 시간): 배치 1은 28.1 마이크로초에서 6.0 마이크로초로 감소(4.7배, torch.compile 대비 0.40배에서 1.90배로 반전). 배치 4는 67.9에서 8.3으로(8.2배, 2.57배). 배치 8은 28.1에서 5.6으로(5.0배, 3.16배).

1.4 TileOPs 성능 스프린트 2: GEMM 핑퐁 메인 루프가 덴스 에필로그를 숨김, 176 타일 편입 (09-22)

날짜: 2026-09-22 출처: TileOPs #2172

16:21 새로 열림 (파일 5개 +465/-42). 덴스 GEMM의 에필로그를 반대편 소비자의 메인 루프 속에 숨긴다. 하나의 프로듀서와 두 개의 소비자 warpgroup이 교대하는 영속 루프 타일 위에서 작업하고, 메인 루프는 순서가 있는 mbarrier 핸드오프를 통해 한 소비자의 에필로그가 다른 소비자의 메인 루프 아래에서 실행되게 한다. 계산은 이렇다. 이중 소비자 구조에서 에필로그 기간 동안 텐서 코어가 유휴 상태가 되어 타일마다 고정 약 3.1천 사이클(블록 폭 176일 때 5.2천)이 들고, 이는 32회 메인 루프의 9%~18%로, DeepSeek-V3 프리필 행에서 cuBLASLt의 176x128 커널과의 전체 격차에 해당한다. 부속 작업: 에필로그를 두 개의 스테이징 타일 회전으로 변경(이전에는 마지막으로 숨겨지지 않은 에필로그가 11회의 라이트백을 직렬화하고 매번 추가로 2.9천 사이클을 소모했다), M/N 테일은 TMA 경계 클리핑으로 처리, 176 버킷 폭 편입(2112 = 12 곱하기 176, 마지막 웨이브가 91% 차서 192의 67%보다 우수). 176은 tilelang 0.1.14 이상이 필요하다(select_wgmma_inst_n에 의존). pyproject.toml에 버전 하한을 추가하고 설치 스크립트에서 강제한다. 테스트: H200에서 86개 통과, 여섯 가지 형상이 torch.matmul과 비트 단위로 일치, 신규 테스트 9개 추가.

1.5 TileOPs 성능 스프린트 3: GLA 추론 연산자 편입, MoE 초과 라우팅 그룹화 (09-22)

날짜: 2026-09-22 출처: #2174/#2169/#1931

  • #2174(17:07 새로 열림, 파일 15개 +1384/-2, 초안 표시로 미등재): GLA 추론 연산자(GLAInferenceFwdOp, BTHD 레이아웃의 Q/K/V/G, 선택적 FP32 초기 상태, 출력과 FP32 종료 상태 반환). 16 토큰의 텐서 코어 타일로 직렬 청크 내 스코어링을 대체한다. 장시퀀스 경로는 #1931의 파티션 요약/스캔/재생 아이디어를 흡수했으며, 시퀀스 길이가 16384 이상일 때만 활성화된다. H200 실측(배치 2, 길이 16384, 헤드 4, Dk=Dv=64): 기존 청크 경로 472.1 마이크로초, 파티션 경로 348.5 마이크로초, 참조 구현 443.5 마이크로초. 목록 벤치마크에서 독립 측정한 TileOps 392.0 대 참조 531.5 마이크로초. 단시퀀스는 기존 경로를 유지한다.
  • #2169(12:58 새로 열림): MoE 인덱스 경로에서 단일 전문가가 16개를 초과하는 라우팅을 받을 때의 그룹화 최적화. 토큰 수가 아니라 라우팅 밀도에 따라 인덱스와 연속 실행 사이에서 선택한다. H200 실측 64 토큰 구간: DeepSeek-V3가 0.80에서 0.990으로 상승(vLLM 대비, 값이 1보다 크면 더 빠름), Kimi-K2가 0.83에서 0.993으로, GLM-4.5가 0.995로. 32 토큰 구간은 1.0 근처로 상승. 같은 문제의 중복 단일 이슈 #2171은 열린 지 3분 만에 닫혔다.
  • 세 건 종료: W4A16 GEMV 가속(#2159), W4A16 그리드 K 분할(#2170) 두 건의 성능 탐색 종료. 08-17에 열린 GLA 프리필 파이프라인(#1931) 종료, 그 파티션 스캔 아이디어는 #2174에 흡수되었다.

하루 안에 세 건의 성능 이슈(Engram, GEMM, GLA)와 한 건의 MoE 최적화가 동시에 진행 중인 것은 TileOPs 최근 가장 밀도 높은 성능 커밋일이다.

1.6 TileOPs: roofline 합성 실패를 보고 가능으로 전환, 큐 세 건 업데이트 (09-22)

날짜: 2026-09-22 출처: TileOPs #2175

19:47 새로 열림 (8개 파일 +473/-160). “공식 합성 실패가 보고되지 않는” 문제를 정면으로 해결: 이전에는 평가가 합성될 수 없는 항목이 자리 표시자 안내만 표시했고, 불법 이름이나 구성을 실제로 지적하는 메시지는 코드 생성 계층이 던진 후 아무도 받지 않았으며, 코드 생성 계층 자체도 각 항목에 대한 판정을 내리지 않았다(비매핑 시그니처는 날 예외를 던지고, 모듈 수준 속성 서비스의 경우는 무엇을 던져도 판정으로 간주). 또한 합성 과정에서 하나의 이름을 바인딩하기 위해 출력 dtype 파서를 임포트하면서 전체 텐서 라이브러리까지 끌어왔다 — 공식 이름과 형식을 검사하는 데 torch가 필요해서는 안 된다. 이번 PR은 코드 생성 계층의 게이트를 전량 판정으로 만들고(모든 기형 항목이 연산자를 지목하는 명확한 오류가 됨), 판정이 항목 자체만 읽도록 하며(175개의 구현된 항목이 torch 없는 환경에서 전부 합성 가능), 항목별 합성 검사를 새로 추가하여 schema 수준 오류로 실패 원인을 보고한다. 동시에 설계 문서에서 코드와 불일치하는 여섯 곳의 서술을 수정한다.

큐 업데이트: #2168(W4A16 사전 패키징 가중치 순서, 23:55 업데이트)은 열린 상태 유지, #2163(DeltaNet 추론 연산자, 23:36 업데이트)과 #2160(가변 길이 GQA 마이그레이션, 23:19 업데이트)은 모두 진척이 있다.

1.7 TileFoundry: 메모리 메타데이터와 트래픽 정규화 두 건 머지 (09-22)

날짜: 2026-09-22 출처: TileFoundry #175/#176/#168

  • #175(12:09 머지): 단위를 가진 의존 루프 시작점 분석 지원 — 상한과 스텝에 단위 의미가 있을 때 시작점을 0으로 가정하지 않으며, 분석 기준이 하드웨어 실행의 루프 의미와 정렬된다.
  • #176(15:22 머지, 두 건의 커밋): 메모리 메타데이터와 트래픽 정규화 — 분석의 메모리와 메타데이터 모듈을 재작성하고, 트래픽 회계, roofline 및 분석 사양 문서(분석 사양 단일 파일에서 263줄 변경)를 건드리며, 튜토리얼과 검사기도 동기화. 09-21에 새로 열린 두 건이 하루 간격 안에 당일 머지된 것이다.
  • 관련 이슈: #171, #173 닫힘, #168(불변량 피연산자의 중복 읽기가 트래픽 총량에 포함되어야 함)은 논의 유지.

1.8 야간 스냅샷: 벤치마크 1046건 무실패, 정확성 1141건 발행 재개 (09-23)

날짜: 2026-09-23 출처: 스냅샷 커밋 81946098/스냅샷 환경 메타데이터

02:38에 b07a259f(#2167 머지 지점)를 위해 생성: 벤치마크 1046건, 실패 0, 스킵 3(GQA 페이징 세 건으로 동일), 케이스 수는 이전 것과 같은 수준. 정확성 결과 파일이 이번에 발행 재개 — 1141건, 실패 0, 스킵 2, 이전 두 스냅샷의 파일 누락 의혹(09-21 스냅샷은 벤치마크 파일만 동반)이 이로써 해소되었다. 환경은 지난 기간과 동일: H200, CUDA 13.2, 드라이버 595.71.05, TileLang 0.1.11에 코드명 버전, torch 2.13.0, 이미지 코드명 afcebed1 두 번째 버전.


2. 다중 백엔드 적응 (Ascend / Hygon / MetaX / Moore Threads 등)

2.1 Ascend: 일일 테스트에서 워크플로 수준 실패 재현, 세 건의 신규 결함 티켓이 A5 하드웨어 경로와 자동 동기화를 지목 (09-22 ~ 09-23)

날짜: 2026-09-22 ~ 2026-09-23 출처: 일일 테스트 #1831/#1830/#1824/#1825

  • 일일 테스트 재현 실패(#1831, 09-23 06:29 자동 생성): 배치 작업이 약 1시간 30분 소요 후 실패로 종료(워크플로 수준 실패, 케이스 수준 아님). 09-22 06:35 스냅샷 기준 2448/2448 전부 녹색과 대조됨. 최근 3일간 적록 교대(09-21 워크플로 실패, 09-22 전부 녹색, 09-23 실패)를 보이며, 안정성 문제는 지속 관찰이 필요함. 코드 브랜치는 이번 모니터링 기간 내 푸시 없음.
  • #1830(09-23 00:47 생성): A5 디바이스 경로의 아키텍처 레이블 결함 — 실제 Ascend 950(dav-3510)에서 디바이스 경로가 고정 레이블 dav-2201(910B 세대)로 컴파일되어 커널 시작 시 디바이스 예외 507015 발생. 레이블 변경 후 커널은 시작되지만 조용히 잘못된 수치를 계산함(공식 양자화 예제의 스케일 팩터 오류). 작성자는 근본 원인이 빌드 코드에 하드코딩된 아키텍처 레이블에 있다고 지목하며, README의 검증 매트릭스가 정확히 이 레이블을 양방향으로 우회했기 때문에(실기 A2/A3는 원래 910B 세대, A5는 시뮬레이션만 경유) 발견되지 않았다고 지적함.
  • #1824 / #1825(09-22 09:58 생성, 동일 보고자): 자동 동기화의 두 가지 경계 — 조건 분기 내 동기화 상태가 잘못 병합되어, 분기가 실행되지 않을 때 후속 읽기에 배리어가 누락될 수 있음(최소 재현 포함). 자동 크로스 코어 동기화는 “조합 스위치 비활성화로 인한 스위치 조용한 무효화”와 “자동/수동 두 동기화 세트 혼용” 두 가지 구성에 대해 컴파일 시점에 직접 거부해야 함. 후자는 저장소 내 예제 자체에 이러한 구성이 있다고 지목함.

2.2 MLIR Ascend: Mamba SSD chunk scan 연산자 대규모 병합, 튜닝과 통합 프로세스 동시 정비(09-22)

날짜: 2026-09-22 출처: tilelang-mlir-ascend #191

18:57 병합(15:18 생성, 약 3.5시간 소요, 42개 파일 +4204/-1568). 중국어 제목이 곧 변경 설명이며, 세 부분으로 구성됨. 첫째, Mamba-2의 상태 공간 쌍대(SSD) 청크 스캔 NPU 전문가 커널 최적화 및 래퍼 계층 연결 — 전상태 로드 개선, L0C 더블 버퍼링 계산, 벡터 분기 데이터 재사용, 기본 구성·설계 문서·튜닝 로그 동시 업데이트. 둘째, 연산자 프로세스 정비 — 최적화 작업의 부하 분배와 벤치마크 케이스 선택 수정, 벤치마크에서 부하 목록 생성, 실제 테스트된 커널 파일별 성능 결과 기록, 게이트에서 최종 파일·테스트 커버리지·보고 데이터 검증. 셋째, TileOPs 보고서 자동 생성 및 검증 추가, 통합 시 모드 변수 자동 설정, SSD 재실행·2차 튜닝 결론을 모드 라이브러리·사례·할 일 기록에 축적. 이번 커밋은 같은 기간 내 Ascend 적응 저장소의 Mamba 라인, 그리고 커뮤니티 TPU 저장소의 청크 스캔 작업과 호응함(2.5 참조).

2.3 Hygon: FP32 MMAC K 커밋 확장 재작업; 예제 지원 PR 32개 파일 추가(09-22)

날짜: 2026-09-22 출처: 브랜치 커밋 e4dc1053/예제 지원 PR #11

  • 피처 브랜치 재작업(15:27 푸시): feat/hcu-ds-read-fp32-mmac-k 브랜치의 수정이 확장 재작업됨 — 원래 3개 파일 버전(공유 FP32 MMAC K 및 프래그먼트 패킹)이 5개 파일 버전(+54/-86)으로 확장. GEMM 제거의 LDS 전략 도출에서 데이터 타입에 대한 FP16/BF16 제한 추가(전략 적용 범위 확대, FP8 경로를 위한 선행 조건 정리), tvm_ffi 어댑터의 FP8 내보내기 우회 코드 정리(torch FP8이 DLPack으로 내보내기 불가한 제한을 우회하던 것, 53줄 삭제·4줄 추가). 커밋 날짜 09-21 저녁, 푸시는 이번 모니터링 기간에 반영. 해당 브랜치는 여전히 대응 PR 없음.
  • 예제 지원 PR #11 확장(14:44 추가 커밋, 32개 파일 +1086/-121): TileLang 업스트림 예제의 Hygon 지원 개통 — HCU 전용 플래시 어텐션 예제(순방향 258줄, 역방향 603줄)와 테스트 추가. 업스트림의 어텐션(멀티헤드 순역방향, GQA 디코딩과 가변 길이, 블록 희소), MoE 청크 상태, GEMM(자동 튜닝, 영속화, 인라인 프리미티브), GEMV, 그룹 행렬 곱 등 예제 일괄 적응. CI 워크플로와 회귀 스크립트 동시 업데이트, 중국산 소스 미러의 flash-attn 사전 컴파일 휠 도입.

2.4 MetaX와 Moore Threads: 모니터링 기간 내 푸시 없음(09-23 확인)

날짜: 2026-09-23(확인) 출처: tilelang-metax/tilelang-musa

MetaX 최근 푸시는 여전히 09-21(업스트림 동기화), Moore Threads 최근 푸시는 09-17. 두 저장소 모두 이번 모니터링 기간 내 새로운 동작 없음. MetaX 측 생태계 온도는 다른 곳에서도 드러남: 커뮤니티 트레이닝 캠프가 C500과 TileLang을 교육 매체로 지속적으로 자료를 제출 중(3.2 참조).

2.5 커뮤니티 백엔드: TileLang-TPU, Sophon BM1690 멀티코어 검증과 성능 매트릭스 추진(09-22)

날짜: 2026-09-22 출처: 커뮤니티 저장소 TileLang-TPU

Sophon 가속기를 대상으로 하는 커뮤니티 TileLang 확장 저장소가 이번 모니터링 기간에 세 건의 푸시를 연달아 올렸다: 멀티코어 분할 스캔의 S3 및 P6 검증(14:27), P10 성능 매트릭스(16:05), P10 호스트 측 소스 검증 수정(16:13). 이 저장소는 「TileLang 프로그래밍 모델을 Sophon TPU 타깃으로 가져오기」를 지향한다 — TileLang의 Python 프런트엔드를 유지하면서 TPU 로워링, 코드 생성 및 JIT 런타임 통합을 추가하고, target="tpu" 타깃, PCIe와 시뮬레이션 두 가지 실행 모드, TPU 전용 프리미티브(복사, 행렬 곱, 리덕션, 역제곱근, 회전 위치 인코딩 등)를 제공하며, BM1690을 메인 라인으로 삼아 09-20부터 하드웨어 검증과 단계별 튜닝(단일 코어, 멀티코어, 성능 로드맵 P8~P10)에 들어갔다. 저장소는 활발히 개발 중이며 기여를 환영한다고 밝히고 있다. 이는 TileLang 커뮤니티에서 처음으로 등장한 공개 TPU 백엔드 경로다. 같은 모니터링 기간 MLIR Ascend의 Mamba 분할 스캔 병합과 대조적으로, 동일한 알고리즘 계열이 같은 날 두 개의 비엔비디아 타깃에서 나타났다.


3. 생태계와 도입자

3.1 도입자: TileKernels와 FlashQLA 모니터링 기간 내 푸시 없음 (09-23 확인)

날짜: 2026-09-23(확인) 출처: TileKernels/FlashQLA

모니터링 기간 내 두 도입자 모두 푸시가 없었다: TileKernels의 최근 푸시는 04-23에 멈춰 있고, FlashQLA의 마지막 푸시는 09-18이었다. 주목할 점은 이번 모니터링 기간 메인 저장소에 병합된 FP4에서 FP8로의 융합이 바로 DeepSeek V4.1의 전문가 GEMM을 대상으로 한다는 것이다 — 도입자는 코드를 건드리지 않았지만, 그 추론 코드의 변환 패턴이 업스트림 최적화를 직접 이끌었다.

3.2 커뮤니티 프로젝트: MetaX C500 다중 패러다임 연산자 개발 실전 캠프 자료 지속 커밋 (09-22)

날짜: 2026-09-22 출처: 커뮤니티 트레이닝 캠프 자료 저장소

이번 모니터링 기간 두 건의 커밋: 두 번째 강의 「벡터 덧셈」의 TileLang과 Jiuchi 이중 구현 대조 실습 완료(10:29), 원격 인스턴스 워크플로를 위한 운영 에이전트 스킬 설정 보충(10:32). 이 자료 저장소는 MetaX C500 컴퓨팅 파워를 기반으로 하며(이미지에 TileLang 0.1.9, 특정 버전 툴체인 포함), 실습 순서는 다음과 같다: 디바이스와 컴퓨팅 환경, TileLang과 Jiuchi의 덧셈 대조(블록과 테일 블록), Softmax와 GEMM의 리덕션과 수치 안정성, AI 에이전트 보조 연산자 개발과 검증, 이후 Llama 연산자 단계(연결, 정확성, 성능, 엔드투엔드)로 진입한다. 저장소 이력에는 커뮤니티 컴퓨팅 파워 계획의 업스트림 브랜치와의 병합 흔적이 보이며, 커뮤니티 교육 방향의 지속적인 투입에 해당한다.


4. 커뮤니티, 튜토리얼과 활동

4.1 문서 사이트: TileOPs 문서 사이트 1회 버전화 배포 (09-22)

날짜: 2026-09-22 출처: TileOPs 문서 사이트

08:40에 자동 배포 1회(정적 사이트 생성기 1.6.1 버전화 커밋), 사이트 내용에는 실질적 변화가 보이지 않았다. 메인 저장소 문서 사이트는 이번 모니터링 기간에 배포 동작이 없었다.

4.2 미디어와 학술 측: Google News 제로 히트, arXiv 신규 논문 없음 (09-23 확인)

날짜: 2026-09-23(확인) 출처: Google News RSS(다수의 중영문 쿼리, 프록시 경유)/Hacker News/arXiv

Google News 중영문 여러 쿼리에서 모니터링 기간 내 제로 히트; Hacker News 관련 쿼리는 무관 항목(회로 기판 배선, 데스크톱 짐벌 등의 단어 우연 일치)만 있었고; arXiv 주제 검색의 최신 논문은 여전히 07-24의 성능 모델 논문으로, 모니터링 기간 내 신규 프리프린트는 없었다. 미디어 측은 연속 두 번째로 조용한 모니터링 기간이다.

4.3 버전 리듬: 신규 릴리스 없음, 메인 저장소 v0.1.14 21일 경과 (09-23)

날짜: 2026-09-23 출처: tilelang v0.1.14

모니터링 기간 내 각 저장소 모두 새 버전 릴리스가 없습니다. 메인 저장소 최신 릴리스는 여전히 09-02의 v0.1.14(만 21일 경과)이며, 각 적응 라인 버전도 변동이 없습니다: Ascend v0.1.2.000(09-09), MLIR Ascend v0.1.2.020(09-09), Moore Threads v0.1.14+musa.1(09-11), MetaX v0.1.14(09-17), Sunrise 0.1.14+sunrise.1.1.0(09-21). 또한 참고: #2172부터 TileOPs가 tilelang 버전 하한으로 0.1.14를 엄격 요구하고 있어, 릴리스 주기와 다운스트림 채택 창구의 관계는 주목할 만합니다.


5. 트렌드 관찰

5.1 변환 연산자가 일등 시민이 되다

“FP4가 어떻게 FP8로 변하는가”만을 다루는 161줄짜리 변경이 2.97~5.38배의 엔드투엔드 속도 향상을 가져왔으며, 그 전제는 이 변경이 반복적으로 읽히는 가중치 경로에 등장한다는 점입니다. 이와 나란히, TileOPs의 성능 관련 3건(Engram 분할, GEMM 이동 은닉, GLA 청킹) 또한 “같은 데이터 블록이 몇 번 읽히는가, 어느 캐시 계층에서 순환하는가”를 최적화하고 있습니다. 연산자 수준 구조가 점차 안정화되면서 수익은 지속적으로 데이터 이동과 포맷 변환 쪽으로 이동하고 있습니다——이는 메인 저장소가 정밀 인코딩 변환 한 건을 국소 미세조정이 아닌 정식 항목으로 병합하는 이유를 설명해 줍니다.

5.2 TileOPs, 거버넌스 시즌에서 성능 시즌으로 전환

지난주 키워드는 “잘못된 것을 바로잡기”(수식, 물리, 출처 추적)였다면, 이번 모니터링 기간에는 하루 만에 성능 관련 3건과 라우팅 최적화 1건이 동시에 등장했고, 새로 열린 이슈들은 대개 대조 기준(torch.compile, cuBLASLt, 참조 구현, vLLM)과 비트 단위 일치 선언을 자체적으로 포함하고 있습니다. 거버넌스가 남긴 장부는 성능 작업의 신용 자산이 되어 가고 있습니다: 각 성능 이슈는 체크리스트와 기준으로 독립적으로 검증될 수 있습니다.

5.3 Ascend의 적록 교차와 A5의 실제 하드웨어 검증

데일리 테스트가 사흘 내내 적록을 교차하는 것은 배치 실행 환경의 안정성이 아직 정리되지 않았음을 보여줍니다. #1830이 노출한 문제는 더 대표적입니다——검증 매트릭스가 실기로는 910B 세대를, 시뮬레이션으로는 950 세대를 커버하는데, 마침 양쪽 모두 장치 경로의 아키텍처 표기를 우회하여 결함이 실제 950에서 “시작 즉시 붕괴, 표기 수정 후 조용한 오산” 두 가지 형태로 드러났습니다. 세대 간 하드웨어 적응의 깊이는 이제 “컴파일 가능”에서 “실기 보정을 감행”하는 단계로 진입하고 있습니다.

5.4 공백과 리스크 지점

네 가지입니다. 첫째, 메인 저장소 병합 주기는 이번 모니터링 기간에 단 1건이었고, TileIR과 매직 디비전 두 대형 라인 모두 “재료는 넣었으나 직인은 안 찍힌” 상태로, 리뷰 대역폭이 병목인지 관찰할 가치가 있습니다. 둘째, 릴리스 정체가 만 21일에 달했으며 다운스트림(TileOPs)이 이미 0.1.14 이상에 대한 엄격 의존을 선언하기 시작했으므로, 버전 창구와 생태계 채택 사이의 박자를 조율할 필요가 있습니다. 셋째, Ascend A5의 출력 정확성 문제(표기 수정 후 조용한 오류)는 아직 수정 이슈가 없으며, 사실이라면 950 세대의 신뢰도 서사에 영향을 줄 것입니다. 넷째, Hygon 특성 브랜치는 여전히 PR이 없고, Ascend에서 되돌려진 대형 병합은 재작업 일정이 보이지 않아, 두 개의 국산 라인의 “착지 진행 중” 상태가 이어지고 있습니다.


부록: 자료와 검증 설명

출처 검증표

출처 검증 결과
tile-ai 조직(28개 저장소) 모니터링 기간 내 7개 저장소에 푸시: tilelang, TileOPs, TileOPs-nightly, TileFoundry, tilelang-mlir-ascend, tilelang-hygon, TileOPs.github.io
메인 저장소 tilelang 기본 브랜치 병합 1건(#3204), 신규 오픈 1건(#3269), #3247, #3267, #3265, #3241~#3244는 모니터링 기간 내 각각 업데이트, 신규 오픈 및 종료 이슈 모두 0건
TileOPs 병합 1건(#2167), 신규 오픈 #2169, #2172, #2173, #2174, #2175(별도로 동일 제목 중복인 #2171은 즉시 종료), 종료 #2159, #2170, #1931, 업데이트 #2168, #2163, #2160
TileOPs-nightly 스냅샷 1건(81946098, b07a259f 즉 #2167 병합 지점에 대응): 기준 1046건 무실패, 정확성 1141건은 스냅샷 릴리스와 함께 복구
TileFoundry 병합 2건(#175, #176), 종료 #171, #173, #168은 논의 유지
tilelang-mlir-ascend 병합 1건(#191, Mamba SSD chunk scan 최적화, 42개 파일)
tilelang-hygon 푸시된 브랜치 2개: 특성 브랜치 커밋 확장 재작업, 예제 지원 PR #11에 32개 파일 커밋 추가
tilelang-ascend 코드 브랜치 푸시 없음, 데일리 테스트 워크플로 수준 실패(#1831), 신규 결함 이슈 3건(#1830, #1824, #1825)
나머지 tile-ai 저장소(TileRT, tilescale, DeepStack, tilelang-puzzles, metax, musa 등) 모니터링 기간 내 푸시 없음
채택자(TileKernels, FlashQLA) 모니터링 기간 내 푸시 없음
제3자 발견 커뮤니티 TPU 확장 저장소(BM1690 멀티코어 검증 3건 커밋), 커뮤니티 트레이닝 캠프 자료 저장소(2건 커밋)
Google News / Hacker News / arXiv 중영문 다중 쿼리 제로 히트, HN 무관 항목 없음, arXiv 신규 프리프린트 없음

전체 출처 목록

Hygon 특성 브랜치 커밋 (e4dc1053) — https://github.com/tile-ai/tilelang-hygon/commit/e4dc1053