TileLang 데일리 리포트 (2026-09-17)
모니터링 기간: 지난 24시간 (2026-09-16 19:23 ~ 2026-09-17 19:23, 베이징 시간; 본 임무는 매일 07:00 정기 실행의 최초 시범 운영으로, 판정은 당일 저녁에 수행하되 기간은 여전히 24시간 기준으로 산정) 출처: GitHub (tile-ai 조직 28개 저장소의 pushed_at 전수 점검, 기간 내 9개 저장소에 푸시 발생; tilelang, tilelang-ascend, tilelang-metax, tilelang-hygon, TileOPs 등 저장소의 기간 내 커밋을 건별 재검토, 주요 PR 설명과 벤치마크 데이터 대조; 브랜치 및 태그 메타데이터 교차 검증), 서드파티 적응 및 채택자 저장소 (tilelang-mlir-ascend, tilelang-musa, TileFoundry, TileRT, deepseek-ai/TileKernels, QwenLM/FlashQLA), Google News RSS 중영문 다중 쿼리 (프록시 경유), Hacker News, arXiv, Huawei Connect 2026 현장 보도 (상세는 부록 출처 목록 참조)
이번 호 인덱스
- 오늘의 중점: T.gemm_blockscaled 메인 저장소 진입——블록 단위 양자화 GEMM에 통합 진입점 마련 (09-17)
-
- 핵심 프로젝트 진행 상황
- 1.1 메인 저장소에 T.gemm_blockscaled와 백엔드 선택기 추가, 블록 단위 양자화 더 이상 조용히 강등되지 않음 (09-17)
- 1.2 원자 벡터 폭이 목적지 주소 기반으로 계획되도록 변경, 임베딩 역방향 등 커널 1.4배에서 2.5배 속도 향상 (09-17)
- 1.3 원자 추가가 비연속 목적지 주소에서 스칼라 유지, 조용한 오기록 및 주소 미정렬 크래시 유형 수정 (09-17)
- 1.4 JIT에 uint64 파라미터 타입 매핑 보완, Cython과 NVRTC 호스트 래퍼 정렬 (09-17)
- 1.5 TileOPs: MoE 인덱스 소형 라우팅 전문가 경로, H200에서 vLLM 대비 전면 우위 (09-17)
- 1.6 TileOPs: 커널 선택 및 빌드 디스패치 리팩터링, 네 곳의 연산자 파라미터 생성자로 이전 (09-16/09-17)
- 핵심 프로젝트 진행 상황
-
- 멀티 백엔드 적응 (Ascend / MetaX / Hygon / Moore Threads)
- 2.1 Ascend: NSA 정방향 및 가변 길이 버전 동일 날짜 병합, 910B3에서 20마이크로초 수준 진입 (09-17)
- 2.2 Ascend: 동적 양자화, RMSNorm 융합 및 RoPE 예제로 연산자 면 보완 (09-16/09-17)
- 2.3 MetaX: MACA 비동기 복사 GEMM 지원 병합 (09-17)
- 2.4 Hygon: HCU 백엔드 rebase 다단계 저장 및 버퍼 저장, 파이프라인 prefer_async로 변경 (09-17)
- 2.5 Moore Threads: MUSA 5.3.0 문서에 백포트 브랜치 추가 (09-17)
- 2.6 산업 측: Huawei Connect 2026에서 Ascend 960 및 Atlas 960 슈퍼노드 진행 상황 발표 (09-17)
- 멀티 백엔드 적응 (Ascend / MetaX / Hygon / Moore Threads)
-
- 생태계 및 채택자
- 3.1 tilelang-mlir-ascend: TileOPs 멀티 헤드 어텐션 연산자 및 적응형 LayerNorm 병합 (09-16)
- 3.2 채택자 저장소 기간 내 조용: TileKernels, FlashQLA, TileRT 모두 푸시 없음
- 3.3 서드파티: TileSight 성능 분석 기술 로드맵 문서 공개 (09-17)
- 생태계 및 채택자
-
- 커뮤니티, 튜토리얼 및 활동
- 4.1 문서 사이트 메인 저장소와 지속 동기화 (09-17)
- 4.2 학술 및 튜토리얼 라인: ICLR 2026 논문 및 Hugging Face 커널 튜토리얼 (배경, 기간 외)
- 커뮤니티, 튜토리얼 및 활동
-
- 트렌드 관찰
- 5.1 국산 4개 백엔드 동일 날짜 병렬 진화, 적응이 단방향 추종에서 동기 추진으로 전환
- 5.2 메인 저장소 두 라인 병렬: 신규 하드웨어 블록 단위 양자화 능력과 기존 커널 성능 보완
- 5.3 TileOPs의 위치가 연산자 라이브러리에서 추론 엔진과 대조 가능한 프로덕션급 연산자 계층으로 전환 중
- 5.4 본 기간의 공백과 리스크 포인트
- 트렌드 관찰
오늘의 중점: T.gemm_blockscaled 메인 저장소 진입——블록 단위 양자화 GEMM에 통합 진입점 마련
날짜: 2026-09-17 출처: tilelang #3237 블록 단위 양자화 GEMM 시맨틱 및 백엔드 디스패치
본 기간 메인 저장소에서 가장 큰 변경은 「블록 단위 양자화 GEMM」(block-scaled GEMM, 즉 MXFP8/MXFP4와 같이 블록별로 스케일 팩터를 공유하는 저비트 행렬 곱)을 각 백엔드에 흩어져 있던 특수 케이스에서 언어 계층의 정식 연산자로 승격한 것입니다. 이 변경은 GemmBlockScaledNode(src/op/gemm_blockscaled.{h,cc}에 구현)와 언어 측의 T.gemm_blockscaled를 도입했으며, 시맨틱은 C (+)= (A * SFA) @ (B * SFB)로 표기됩니다. 즉 스케일 팩터가 연산자의 일급 입력이 되며, 호출자가 외부에서 수동으로 환산하지 않도록 합니다.
두 개의 이전에 조용히 오류를 내던 경로를 동시에 수정한다. 첫째, SM100에서의 단일 CTA 블록 스케일드 양자화 GEMM이 SM120에서만 타야 할 명령 선택 분기를 탈 수 있었다. 둘째, 블록 스케일드 양자화 기능이 없는 백엔드는 이를 조밀 GEMM으로 강등 실행하여 스케일 팩터가 그대로 버려졌다—결과는 돌아가지만 정밀도는 틀렸다. 이제 디스패치는 전용 백엔드 선택기로 바뀌어 cuda.tcgen05.blockscaled(SM100 계열)와 cuda.mma.blockscaled(SM120 계열) 두 구현에 위치하며, mbar, use_2cta, sf_layout 등의 파라미터 진입점을 유지한다. 작성자는 SM100급 디바이스(sm_103)에서 로컬 검증을 수행하여 1D1D 레이아웃의 MXFP8 블록 스케일드 양자화 예제와 tcgen05 INT8 GEMM 어서션을 커버했으며, SM120 측 실행 경로는 로컬에서 검증되지 않았음을 명확히 표기했다.
같은 날 병합된 #3238은 다른 계열의 상반된 조치다. 새로운 능력을 추가하는 것이 아니라, 이전 변경으로 도입된 성능 회귀를 되돌리는 것이다—자세한 내용은 1.2 참조. 두 가지를 함께 읽으면, 메인 저장소의 현재 리듬은 “새 하드웨어 경로 추가”와 “기존 커널 성능 보완”을 동시에 추진하는 것이다.
1. 핵심 프로젝트 진행 상황
모니터링 기간 개요: tile-ai 조직의 28개 저장소 중 모니터링 기간 내 푸시가 있는 곳은 9개다. 핵심 저장소 tilelang, 국산 백엔드 tilelang-ascend, tilelang-metax, tilelang-hygon, tilelang-musa, 연산자 라이브러리 TileOPs와 그 사이트 TileOPs.github.io, TileOPs-nightly, 그리고 문서 사이트 tilelang.github.io이다. 모니터링 기간 내 커밋 수 기준으로 tilelang-ascend가 6건으로 가장 많고, tilelang 4건, TileOPs 3건, tilelang-metax 2건, tilelang-hygon 1건이다. tilelang-musa의 푸시는 기본 브랜치가 아닌 백포트 브랜치에 있었으므로 기본 브랜치에는 모니터링 기간 내 커밋이 없다.
1.1 메인 저장소에 T.gemm_blockscaled와 백엔드 선택기 추가, 블록 스케일드 양자화 더 이상 조용히 강등되지 않음 (09-17)
날짜: 2026-09-17 출처: tilelang #3237
자세한 내용은 「오늘의 중점」 참조. 구현 측 세부 사항 두 가지를 보충한다. 첫째, 블록 스케일드 양자화 GEMM이 GemmImpl에서 분리되어 백엔드별로 개별 등록되었고, 조밀 GEMM과 블록 스케일드 양자화 GEMM이 각자의 구현 슬롯을 타게 되어 “어떤 백엔드가 이를 조밀 연산자로 처리”하는 경로 혼동이 재발하지 않도록 했다. 둘째, tl.gemm.infer_layout과 tl.gemm.lower 두 공유 진입점은 13개의 위치 인자를 엄격히 받도록 요구되어, 신규 연산자가 기본값으로 얼버무리는 대신 완전한 인터페이스를 명시적으로 선언해야 한다. 해당 PR 제목에는 “Do not review” 접두사가 붙어 있고 핵심 메인테이너가 자체 병합했으며, 병합 시 19개의 커밋을 포함했다.
1.2 원자 벡터 폭이 목적지 주소 기준으로 계획되도록 변경, 임베딩 역방향 등 커널 1.4~2.5배 속도 향상 (09-17)
날짜: 2026-09-16 ~ 2026-09-17 출처: tilelang #3238
동적 형상은 레인 인덱스 외부에 int64 변환을 도입하는데, 이전의 벡터화 판정은 미단순화 Ramp 형태만 인식하여 “브로드캐스트 베이스 주소 + int64 레인 오프셋” 같은 동등한 표기를 만나면 전체 루프를 스칼라화했다—분명 네 개의 정렬된 연속 요소에 접근하는데도 요소별 실행으로 퇴화했다. 수정은 판정을 목적지 주소 기반으로 변경했으며(elem_offset, IndicesCanVectorize, AtomicTargetIsContiguous 세 곳이 협력), c6ece48을 기준선으로 동일 카드 3회 측정 중앙값 비교를 제시한다. 임베딩 역방향 N=8192/H=4096/V=129280이 97.90마이크로초에서 56.01마이크로초로, N=196608/H=256/V=3000000이 146.87마이크로초에서 82.70마이크로초로, 다른 한 단계가 86.62마이크로초에서 49.87마이크로초로, 시퀀스 보조 카운트와 합산이 18.40마이크로초에서 12.17마이크로초로 줄었다. 회귀 벤치마크에서 example_gqa_bwd_tma_reduce_varlen은 약 27%의 상대적 향상을 얻었고, 나머지 케이스는 0.5%에서 1.5% 사이의 변동을 보였다. 이는 전형적인 “컴파일러 재작성 규칙이 실제 추론 성능에 영향을 미치는” 사례다—영향을 받은 임베딩 역방향과 가변 길이 어텐션 역방향은 모두 대형 어휘 추론의 상시 커널이다.
1.3 원자적 더하기가 비연속 목적지 주소에서 스칼라 유지, 조용한 오기록과 주소 미정렬 크래시 한 종류 수정 (09-17)
날짜: 2026-09-16 출처: tilelang #3219
1.2와 같은 계열의 또 다른 벡터화 결함: T.atomic_add의 목적 주소가 벡터 경계 안에서 불변하는 표현식(예: i를 2로 나눈 값으로 인덱싱하거나 상수 첨자)일 경우, 기존 로직은 데이터 타입만 보고 폭을 선택하여 “모든 레인이 같은 셀에 쓰기”라는 의미를 하나의 넓은 원자적 덧셈으로 컴파일했고, 그 결과 인접 원소가 조용히 손상되었다. 기저 주소가 홀수이면 주소 정렬 불일치로 즉시 크래시가 발생했다. 수정은 CanVectorizeAtomicTarget 사전 판정을 새로 추가하여 address_of, tl.access_ptr, tvm_access_ptr 세 가지 목적 주소 형태를 포괄하며, 비연속이거나 정렬되지 않은 경우 일괄적으로 스칼라로 되돌린다. 이 결함의 영향 범위는 작지 않다 — T.Parallel과 T.atomic_add의 조합은 GEMM split-K, 어텐션 역방향, 레이어 정규화의 상용 표현이며, 기존 테스트는 N이 스레드 수와 같은 설정이라 마침 이 문제를 우회하고 있었다.
1.4 JIT에 uint64 파라미터 타입 매핑 추가, Cython과 NVRTC 호스트 래퍼 정렬 (09-17)
날짜: 2026-09-17 출처: tilelang #3229
호스트 측 래퍼에는 그동안 uint64 타입 매핑이 빠져 있어, 해당 타입 파라미터를 만나면 곧바로 “지원하지 않는 dtype” 오류를 냈다. 수정 후에는 Cython과 NVRTC 두 호스트 경로 모두 uint64 실인자를 처리할 수 있게 되어 디바이스 측 uint64_t 선언과 정렬된다. 작은 구멍이지만 보충하지 않으면 대정수 인덱스와 비트 연산 계열 커널에서 바로 벽에 부딪힌다.
1.5 TileOPs: MoE 인덱스 소규모 라우팅 전문가 경로, H200에서 vLLM 대비 전면 우위 (09-17)
날짜: 2026-09-17 출처: TileOPs #2141
연산자 라이브러리 측에서 이번 모니터링 기간 가장 비중 있는 항목이다. 이번 변경은 공유 융합 MoE에 인덱스 기반 소규모 라우팅 전문가 경로를 추가했다: 라우팅 그룹이 희소하고 단일 전문가가 실제로 받는 token이 적을 때, 인덱스별 집계 실행 방식으로 전환하여 대규모 그룹에서의 비효율 경로를 피한다. 공개 인터페이스는 변하지 않으며, 지원하지 않는 디바이스와 형상, 대규모 라우팅 그룹, 그리고 검증되지 않은 활성화 및 레이아웃 조합은 일괄적으로 기존 폴백을 유지한다. 작성자는 H200에서 BF16, top-8 sigmoid 라우팅에 보정 편향을 더하고, CUPTI 디바이스 점유 타이밍과 L2 플러시를 사용하여 vLLM과 세 가지 모델을 비교했다: GLM-4.5는 4096 token 구간에서 25.85% 우위, DeepSeek-V3는 같은 구간에서 16.03% 우위, Kimi K2는 8.65% 우위였으며, 소규모 token 구간에서도 전반적으로 앞섰다. 벤치마크 자체도 재구축되었으며(기존 베이스라인은 신뢰할 수 없었음), FusedTopK 최소 49.3%, PermuteAlign 최소 59.6%의 전체 그룹 향상을 제시했다. 대조 데이터는 라우팅이 고정 시드의 합성 라우팅이며 실제 checkpoint 궤적이 아님을 설명하는데, 이는 사실대로 공개한 것이다.
1.6 TileOPs: 커널 선택과 빌드 디스패치 리팩터링, 네 곳의 연산자 파라미터를 생성자로 이전 (09-16/09-17)
날짜: 2026-09-16 ~ 2026-09-17 출처: TileOPs #2146, TileOPs #2145
구조는 1.5의 성능 변경과 같은 날 발생했으며 같은 라운드의 내부 정리에 속한다. 첫째, 디스패치 모델을 “먼저 커널을 선택하고, 그 다음 그것이 어떻게 빌드되는지 묻는다”(Op.kernel_for / Op.entry_for)로 바꾸었고, GEMM 계열은 전부 선택된 클래스 디스패치로 전환하여 더 이상 호출 지점에서 판단하지 않는다. 둘째, 원래 호출 시 인자를 전달하던 네 곳의 연산자가 파라미터를 생성 단계로 옮겼는데, 그중 MHP 순방향은 외부 목표가 있으면 최초 호출 시 곧바로 속성 오류를 던지고, 페이지드 프리필 연산자는 생성 시 한 번도 할당된 적 없는 시퀀스 길이 필드를 보유하고 있었으며, 모두 실제 결함이다. 또한 여섯 연산자의 출력 타입 파라미터를 일괄적으로 out_dtype으로 개명하고, FP8 GEMM과 그 배치 버전은 문자열 대신 torch 데이터 타입을 받도록 바꾸었다. 작성자는 이번에 커널 본체와 생성 코드를 변경하지 않았으므로 성능 주장은 하지 않으며, 가치는 “선택 시에는 한 디바이스의 아키텍처를 읽고 빌드 시에는 다른 디바이스를 읽는” 유형의 드리프트를 제거하는 데 있다고 명확히 밝혔다.
2. 멀티 백엔드 적응 (Ascend / MetaX / Hygon / Moore Threads)
이번 모니터링 기간의 형태는 네 곳의 국산 백엔드가 같은 날 모두 현장에 있다는 것이다: Ascend 6건 커밋, MetaX 2건, Hygon 1건, Moore Threads 1건(백포트 브랜치 문서). 이는 이 데일리 리포트 자체 수집에서 드물게 보이는 밀도다 — 네 곳이 각자 시간대를 달리하는 것이 아니라 같은 날 모두 실질적인 움직임을 보였다.
2.1 Ascend: NSA 순방향과 그 가변 길이 버전이 같은 날 병합, 910B3에서 20마이크로초 수준 진입 (09-17)
날짜: 2026-09-17 출처: tilelang-ascend #1699, tilelang-ascend #1700
둘 다 Ascend 전용 저장소의 ascendc_pto 브랜치에 있으며, 4분 이내에 선후로 병합되었다(베이징 시간 11:44와 11:49). #1699는 네이티브 희소 어텐션(NSA) 포워드 연산자다: 개발자 모드의 하이브리드 작성 방식으로 구현되었고, 컴파일러가 Cube와 Vector 스코프를 자동 분할하며 크로스 코어 동기화 플래그를 자동 삽입하므로 전역 배리어, 스코프 선언 또는 수동 플래그 비트를 직접 작성할 필요가 없다; 골든 구성에서 작업 소요 시간은 19.62마이크로초, 정밀도 계층 테스트 27건 전부 통과, 최대 절대 오차 1.95e-03. #1700은 가변 길이 시퀀스 지원을 추가했으며, 단일 커널 포워드, 영속 그리드, 4단 파이프라인, 910B3에서 테스트 구성 소요 시간 20.34마이크로초, 21건 계층 테스트 전부 통과, 허용 오차 이중 게이트 표준 기준으로 매칭 비율 1.0000을 제시한다. 두 건을 함께 보면, Ascend 측의 DeepSeek 계열 희소 어텐션 구조에 대한 커버리지가 「구현 있음」에서 「가변 길이와 테스트 계층 포함」으로 나아갔다.
2.2 Ascend: 동적 양자화, RMSNorm 융합 및 RoPE 예제로 연산자 면 보강(09-16/09-17)
날짜: 2026-09-16 ~ 2026-09-17 출처: tilelang-ascend #1688, tilelang-ascend #1673, tilelang-ascend #1580
세 건의 예제 계층 변경은 Ascend가 「추론 경로상의 일반 연산자」를 보강하고 있음을 동시에 보여준다: 동적 양자화 연산자(#1688)는 CANN 벤치마크와 온라인 평가를 거쳐 20건 정밀도 전부 통과, 평균 가속비 0.78배 — 즉 정밀도는 사용 가능하나 성능은 여전히 벤더 베이스라인에 뒤처지며, 이는 승전보가 아닌 있는 그대로의 기록이다; RMSNorm을 중첩한 동적 양자화 융합 연산자(#1673)와 회전 위치 인코딩 연산자(#1580, 반회전과 인터리브 두 가지 레이아웃을 커버하며 벤치마크 스크립트와 torch_npu 대비 정밀도 테스트 첨부)는 대규모 모델 추론 전처리와 위치 인코딩 두 단계를 보강했다. 이외에 #1603은 T.tile.merge_sort에 인터페이스 문서와 테스트 케이스를 보강했다.
2.3 MetaX: MACA 비동기 복사 GEMM 지원 저장소 반영(09-17)
날짜: 2026-09-17 출처: tilelang-metax #156
MetaX 측은 MACA 플랫폼에 비동기 복사 GEMM 경로를 보강했으며, 비동기 메모리 복사 원시 연산, 배리어 명령 및 비동기 복사 완료 카운트 세 가지 진입점을 포함하여 행렬 곱의 데이터 이동이 비동기 파이프라인을 탈 수 있게 했다; 같은 날 별도의 테스트 케이스 결함 수정도 있었다(#157). MetaX에게 이는 「돌아가는 것에서 빠르게 돌아가는 것으로」 가는 한 걸음인데, 비동기 복사가 바로 GEMM 파이프라인 중첩의 전제이기 때문이다.
2.4 Hygon: HCU 백엔드 rebase 다중 레벨 저장소 및 버퍼 저장소, 파이프라인을 prefer_async로 변경(09-17)
날짜: 2026-09-17 출처: tilelang-hygon 커밋 36db42e1
Hygon 측 한 건의 커밋이 19개 파일을 건드렸으며, 동작은 다중 레벨 저장소(MLS)와 버퍼 저장소의 쓰기 경로를 rebase하고 파이프라인의 복사 스케줄링을 prefer_async로 변경한 것이다. 새로 추가된 버퍼 오프셋 의존성 검사기는 「블록 인덱스 관련」과 「스레드 인덱스 관련」 두 부류로 각각 판정한 뒤 구문 지향 방식으로 블록 베이스 주소와 잔여 오프셋을 분리한다 — 주석에 이 경계가 명시되어 있다: 버퍼 주석은 호출자의 안전 계약이며, 컴파일러는 범위 증명을 수행하지 않는다. 이 조항은 MetaX 조항과 방향이 일치한다: 두 곳 모두 동기 이동을 비동기 파이프라인으로 바꾸고 있다.
2.5 Moore Threads: MUSA 5.3.0 문서를 백포트 브랜치에 보강(09-17)
날짜: 2026-09-17 출처: tilelang-musa 브랜치 목록
Moore Threads 저장소의 모니터링 기간 내 푸시는 v0.1.12+musa.1 백포트 브랜치에 있었으며, 내용은 MUSA 5.3.0 문서를 구버전 라인에 보강하는 것이고 기본 브랜치에는 모니터링 기간 내 커밋이 없다. 이 신호는 다소 약하다: 메인 라인의 마지막 실질 커밋은 09-11의 공개 릴리스 준비와 09-10의 일련의 런타임 기능(대칭 IPC 할당, IPC 및 선택적 가상 메모리 관리 런타임, DLPack 디바이스 호환, 시스템 레벨 펜스)이며, MUSA 측 이번 기간은 신규 기능이 아닌 유지보수성 동작에 해당한다.
2.6 산업 측: Huawei Connect 2026에서 Ascend 960과 Atlas 960 슈퍼 노드 진행 상황 발표(09-17)
날짜: 2026-09-17 출처: Huawei Connect 2026 현장 보도(JiWei, Sing Tao Global Network 전재), Ascend 960 2027년 1분기 출시 확정(NetEase 전재)
어센드는 TileLang 국산 백엔드 중 가장 활발한 축으로, 그 하드웨어 로드맵은 연산자와 커널의 적응 리듬에 직접적인 영향을 미치므로 산업 측 동향 한 줄을 기록한다. 9월 17일 상하이에서 열린 Huawei Connect 2026에서 화웨이 부회장 겸 순환 회장 왕타오는 어센드 960DT를 2027년 1분기로, 어센드 960PR을 2027년 3분기로 앞당겨 출시한다고 발표했다. Atlas 960 슈퍼노드는 단일 구성으로 4096개 NPU를 고속 상호 연결할 수 있으며, 링취 아키텍처와 Hi-ONE 광 엔진을 기반으로 왕복 지연 시간이 최저 2마이크로초에 달하고, 최초로 근접 패키징 광학(NPO) 광 엔진을 적용했으며, 액침 냉각 버전은 2027년 3분기 출시 계획이다. 회의에서는 슈퍼노드 누적 배포가 천 세트를 넘고 370개 이상 고객을 서비스한다고도 밝혔다.
배경으로(본 모니터링 기간 밖): 9월 8일 PyTorch Conference China 2026에서 어센드 측은 자사가 PyTorch 공식 지원 첫 중국 하드웨어가 되었으며 PyTorch와 함께 슈퍼노드용 네이티브 소프트웨어 스택을 공동 구축할 계획이라고 밝혔다. 두 가지를 함께 보면 어센드의 소프트웨어 생태계 위치가 상승하고 있으며, 연산자 DSL 계층(TileLang 어센드 백엔드 포함)에는 순풍이다.
3. 생태계와 도입자
3.1 tilelang-mlir-ascend: TileOPs 멀티헤드 어텐션 연산자와 적응형 LayerNorm 병합 (09-16)
날짜: 2026-09-16 출처: tilelang-mlir-ascend 커밋 목록
이 저장소는 09-16 저녁(본 모니터링 기간 전방 경계에 근접)에 “TileOPs의 멀티헤드 어텐션 연산자를 연결한다”는 변경을 병합하고, 그 벤치마크 스크립트의 결함을 수정했다. 전날에는 적응형 LayerNorm 커널을 보강했다. 이 저장소는 동시에 CI를 어센드 A3 디바이스의 runner 레이블로 전환했다——이는 어센드 측이 연산자를 작성할 뿐만 아니라 검증도 실제 디바이스 파이프라인으로 옮기고 있음을 보여준다.
3.2 도입자 저장소는 모니터링 기간 내 조용함: TileKernels, FlashQLA, TileRT 모두 푸시 없음
날짜: 2026-09-17(확인) 출처: deepseek-ai/TileKernels, QwenLM/FlashQLA, tile-ai/TileRT
본 데일리 리포트의 확인 목록에 따르면 도입자와 추론 측 세 저장소 모두 모니터링 기간 내 푸시가 없다. TileKernels의 최근 푸시는 2026-04-23, FlashQLA는 2026-08-26, TileRT는 2026-08-13이다. TileRT는 5주 연속 업데이트가 없어 현재 목록에서 가장 오래 조용한 항목이다. 이는 부정적 결론을 구성하지 않지만 계속 추적할 가치가 있다——TileRT가 지향하는 것은 저지연 추론 런타임으로, 장기 업데이트 중단은 “TileLang 생태계가 이미 프로덕션 배포에 진입했다”는 서사에 엔지니어링 측의 새로운 증거를 결여시킨다.
3.3 서드파티: TileSight 성능 분석 기술 로드맵 문서 공개 (09-17)
날짜: 2026-09-17 출처: tilelang4tilesight-doc 저장소
서드파티 개발자가 TileLang 프로그램과 TileSight 성능 분석 도구를 연결하는 기술 문서 세트를 공개했다. 내용에는 Python과 고수준 중간 표현에서 의미, 작업량, 의존성을 추출하고, 캐시와 파이프라인 분석에 연결하며, 런타임 관측으로 독립 보고서와 공동 예측을 생성하는 것이 포함된다. 문서는 성능 문제를 파이프라인 병목, 계층 간 이동 이상, 캐시 활용 이상, 연산과 메모리 접근 중첩 실패, 부하 불균형, 모델 예측 편차 여섯 가지로 분류하고, 모델 예측, 런타임 관측, 증거 부족이라는 세 가지 결론 강도를 명확히 구분하며, 주요 논의 플랫폼은 H200이다. 가치는 TileLang 측의 관측 및 튜닝 도구 체인이 외부에서 보강되고 있다는 데 있다.
4. 커뮤니티, 튜토리얼과 활동
4.1 문서 사이트가 메인 저장소와 지속 동기화 (09-17)
날짜: 2026-09-17 출처: tilelang.github.io 커밋 목록
문서 사이트는 모니터링 기간 내 자동 동기화 커밋이 하나 있으며(09-17 18:37 베이징 시간), 이전 09-16, 09-15, 09-12에도 각각 한 번씩 있어 리듬이 메인 저장소 병합과 기본적으로 정렬된다. 사이트 현재 버전은 0.1.14이며, 도구 영역에는 컴파일 도구, 성능 분석기, 레이아웃 시각화, 자동 증분 디버깅, 중간 표현 하강 추적, 연산자 프로파일링 등의 항목이 포함되어 있다. 문서 사이트 동기화는 봇 커밋에 해당하므로 본 보고서는 리듬 기록만 한다.
4.2 학술과 튜토리얼 라인: ICLR 2026 논문과 Hugging Face 커널 튜토리얼 (배경, 모니터링 기간 밖)
날짜: 2026-04-23 ~ 2026-05-31 (모니터링 기간 외 배경) 출처: ICLR 2026 포스터 페이지, TileLang 논문 (arXiv:2504.17577), Hugging Face 튜토리얼 《Writing High-Performance Kernels in TileLang》
이 모니터링 기간 내 arXiv, Hacker News 및 중·영문 뉴스 검색에서 TileLang 관련 신규 콘텐츠가 나타나지 않았으므로, 여기서는 모니터링 기간 외에 이미 존재하는 학술 및 튜토리얼 자산만 열거하여 독자의 대조를 돕는다: 논문은 H100에서 Triton 대비 최대 5배 상대 속도 향상, 융합 어텐션 커널 코드량 최대 90% 감소를 주장한다; Hugging Face의 튜토리얼은 GEMM부터 다중 헤드 잠재 어텐션까지의 완전한 작성법을 제시하고, 한 가지 실제 수익 사례를 기록했다——이전에 고속 경로가 없던 특정 모델 구성이 TileLang으로 작성된 플러그 앤 플레이 커널로 교체된 후 “직접 오류”에서 “출시 가능”으로 바뀌었다.
5. 트렌드 관찰
5.1 중국산 4개 백엔드가 같은 날 병행 진화, 적응이 단방향 추종에서 동기 진행으로 전환
Ascend, MetaX, Hygon, Moore Threads가 동일한 24시간 모니터링 기간에 모두 실질적 조치를 취했으며 방향이 매우 유사하다: 모두 비동기 데이터 이동과 파이프라인을 보강하고 있고 (MetaX의 비동기 복사 GEMM, Hygon의 prefer_async, Ascend의 다단 파이프라인), 모두 추론 경로의 일반 연산자를 보강하고 있다 (동적 양자화, RMSNorm 융합, 위치 인코딩). 이는 중국산 백엔드의 적응이 더 이상 “업스트림이 기능을 출시할 때까지 기다렸다가 따라가는” 것이 아니라, 같은 라운드에서 각자 동일한 능력 집합을 채워 넣고 있음을 보여준다.
5.2 메인 저장소의 두 축 병행: 신규 하드웨어 블록 양자화 능력과 기존 커널 성능 회복
메인 저장소의 이 모니터링 기간 두 건의 대규모 변경은 성격이 상반되지만 같은 날 병합되었다: 한쪽은 Blackwell 세대의 블록 양자화 GEMM에 통합 진입점과 전용 디스패치를 구축하고 (폴백과 경로 혼선 방지), 다른 한쪽은 이전의 한 차례 재작성으로 인한 벡터화 회귀를 복구했다 (임베딩 역방향 약 2배 속도 향상). 블록 양자화는 MXFP8/MXFP4 같은 저비트 폭 형식의 추론 측 보급에 대응하고, 성능 회복은 대형 어휘 추론의 상주 커널에 대응한다——둘 다 “새 연산자 추가”형 확장이 아니라 컴파일러 계층의 안정성과 효율 작업이며, 일반적으로 개별 연산자보다 프로젝트가 엔지니어링 성숙기에 진입했음을 더 잘 보여준다.
5.3 TileOPs의 위치가 연산자 라이브러리에서 추론 엔진과 대조 가능한 프로덕션급 연산자 계층으로 전환 중
이 모니터링 기간 TileOPs는 동시에 두 가지를 했다: 첫째, vLLM 대조 전체 성능 데이터를 제시했고 (GLM-4.5 4096 token 구간 25.85% 우위, DeepSeek-V3 동일 구간 16.03%), 둘째, 커널 선택과 빌드 디스패치를 깔끔하게 리팩터링하고 일관성 없는 인터페이스 파라미터를 일괄 정리했다. 기꺼이 vLLM과의 구간별 비교를 공개하고 동시에 벤치마크가 이전에는 신뢰할 수 없었음을 인정한다는 것은, 그 검수 기준이 프로덕션 사용 가능성을 향해 접근하고 있음을 보여준다; Ascend 측의 mlir 저장소가 TileOPs 연산자를 직접 통합하기 시작한 것은 이 기준이 백엔드 간 재사용되기 시작한 신호이다.
5.4 이 모니터링 기간의 공백과 리스크 포인트
네 가지 공백을 솔직히 지적할 필요가 있다: 첫째, 뉴스 측 24시간 내 중·영문 채널 모두에서 TileLang 본체가 검색되지 않았고, 검색된 동명 노이즈 (데이터베이스 제품의 Tile.ai 개명, 무관한 2048 강화학습 저장소)는 동향으로 간주하지 않는다; 둘째, 채택 측 저장소 (TileKernels, FlashQLA)와 추론 런타임 TileRT가 모두 조용하며, 그중 TileRT는 5주째 업데이트가 중단되었다; 셋째, 학술 측 모니터링 기간 내 신규 논문이 없다; 넷째, Ascend의 블록 양자화 외 중국산 백엔드는 여전히 “일반 능력 보강”이 주를 이루며, 벤더 기준선과 대조하여 승리한 성능 데이터가 아직 없고, Ascend 동적 양자화 연산자의 0.78배 가속비가 그 예이다——정밀도는 통과했으나 성능은 뒤처져 있으며, 이후 모니터링 기간에 수렴 여부를 계속 추적할 필요가 있다.
부록: 자료 및 검증 설명
검증 방식: 모든 항목은 저장소 커밋 시간(committer 시간)을 기준으로 하며, 저장소 푸시 시간과 커밋 시간을 각각 검증한다; 이 모니터링 기간 내 신규 커밋은 제목과 PR 설명을 건별로 읽었고, 주요 변경은 본문의 검증 기준과 벤치마크 데이터를 추가로 읽었다; 브랜치 푸시 저장소(Moore Threads)는 구체적 브랜치까지 추적하여 기본 브랜치에 모니터링 기간 내 커밋이 없음을 확인했다; 본문을 확보할 수 없는 제3자 링크(일부 미디어 페이지 포함)는 존재성 인용만 하고 본문에 그 성격을 명시했다.
한계 설명: 첫째, GitHub API가 로컬 수집 과정에서 미인증 속도 제한(시간당 60회)을 초과한 적이 있어, 모니터링 기간 말미의 문서 사이트, mlir 저장소, TileFoundry, TileRT 검증은 저장소 커밋 완료로 전환했으며, 커버 저장소 수가 다소조정되었다 — 본문에 각 단계의 검증 방식을 표기했다. 둘째, Ascend와 MetaX의 실측 데이터는 커밋 설명과 PR 본문의 자기 기술에 기반하며, 로컬에 해당 하드웨어가 없어 독립적 재현을 하지 않았다; 셋째, 산업 측 동향은 공개 보도에 기반하며, 벤더의 1차 공고 원문을 확보하지 못했다.
출처 검증 표
| 출처 | 검증 결과 |
|---|---|
| tile-ai 조직(28개 저장소) | 모니터링 기간 내 9개 저장소에 푸시 발생 |
| 커밋 상세 재검토 | tilelang 4건, tilelang-ascend 6건, TileOPs 3건, tilelang-metax 2건, tilelang-hygon 1건 |
| tilelang-musa | 기본 브랜치에 모니터링 기간 내 커밋 없음, 푸시는 백포트 브랜치 v0.1.12+musa.1에 위치 |
| tilelang-mlir-ascend | 모니터링 기간 내 푸시 없음, 최근 1회는 09-16 저녁(모니터링 기간 시작 경계 1시간 전) |
| TileFoundry / DeepStack / tilescale | 모니터링 기간 내 푸시 없음, 최근 1회는 각각 09-15 / 09-15 / 08-25 |
| TileRT | 모니터링 기간 내 푸시 없음, 최근 1회 2026-08-13, 5주 연속 업데이트 없음 |
| 채택자 저장소 TileKernels / FlashQLA | 모니터링 기간 내 푸시 없음, 최근 1회는 각각 2026-04-23 / 2026-08-26 |
| Google News RSS(중영문 다중 쿼리) | 주제어와 컴포넌트명이 모니터링 기간 내 0건 적중, 적중한 TileDB 개명과 2048 강화학습 저장소는 동명 노이즈로 확인되어 제외 |
| 산업 뉴스 채널 | Huawei Connect 2026 현장 보도 2건 사용 가능, 1건 수록 완료 |
| Hacker News | 모니터링 기간 내 TileLang 관련 논의 없음 |
| arXiv | 모니터링 기간 내 신규 논문 없음, 주 논문은 기존 버전 v2 |
전체 출처 목록
- [1] TileLang 메인 저장소 — https://github.com/tile-ai/tilelang
- [2] tilelang #3237 블록 양자화 GEMM 시맨틱 및 백엔드 디스패치 — https://github.com/tile-ai/tilelang/pull/3237
- [3] tilelang #3238 원자 벡터 폭을 목적지 주소 기준으로 계획 — https://github.com/tile-ai/tilelang/pull/3238
- [4] tilelang #3219 원자 더하기가 비연속 목적지 주소에서 스칼라 유지 — https://github.com/tile-ai/tilelang/pull/3219
- [5] tilelang #3229 JIT에 uint64 파라미터 타입 매핑 보완 — https://github.com/tile-ai/tilelang/pull/3229
- [6] tilelang 문서 사이트 — https://tilelang.com
- [7] tilelang.github.io 커밋 목록 — https://github.com/tile-ai/tilelang.github.io/commits/main
- [8] TileOPs #2141 MoE 인덱스 소규모 라우팅 전문가 경로 — https://github.com/tile-ai/TileOPs/pull/2141
- [9] TileOPs #2145 GEMM 디스패치를 선택된 클래스로 변경 — https://github.com/tile-ai/TileOPs/pull/2145
- [10] TileOPs #2146 커널 선택 및 빌드 디스패치 리팩터링 — https://github.com/tile-ai/TileOPs/pull/2146
- [11] tilelang-ascend #1699 NSA 포워드 연산자 — https://github.com/tile-ai/tilelang-ascend/pull/1699
- [12] tilelang-ascend #1700 NSA 포워드 가변 길이 연산자 — https://github.com/tile-ai/tilelang-ascend/pull/1700
- [13] tilelang-ascend #1688 동적 양자화 연산자 — https://github.com/tile-ai/tilelang-ascend/pull/1688
- [14] tilelang-ascend #1673 RMSNorm 동적 양자화 융합 연산자 — https://github.com/tile-ai/tilelang-ascend/pull/1673
- [15] tilelang-ascend #1580 회전 위치 인코딩 연산자 — https://github.com/tile-ai/tilelang-ascend/pull/1580
- [16] tilelang-ascend #1603 merge_sort 문서 및 테스트 — https://github.com/tile-ai/tilelang-ascend/pull/1603
- [17] tilelang-metax #156 MACA 비동기 복사 GEMM — https://github.com/tile-ai/tilelang-metax/pull/156
- [18] tilelang-metax #157 테스트 결함 수정 — https://github.com/tile-ai/tilelang-metax/pull/157
- [19] tilelang-hygon 커밋 36db42e1 — https://github.com/tile-ai/tilelang-hygon/commit/36db42e1
- [20] tilelang-musa 브랜치 목록 — https://github.com/tile-ai/tilelang-musa/branches
- [21] tilelang-mlir-ascend 커밋 목록 — https://github.com/tile-ai/tilelang-mlir-ascend/commits/main
- [22] TileFoundry 커밋 목록 — https://github.com/tile-ai/TileFoundry/commits/main
- [23] TileRT 저장소 — https://github.com/tile-ai/TileRT
- [24] deepseek-ai/TileKernels — https://github.com/deepseek-ai/TileKernels
- [25] QwenLM/FlashQLA — <https://github.com/Q
wenLM/FlashQLA>
- [26] TileSight 성능 분석 기술 로드맵 문서 저장소 — https://github.com/superAngGao/tilelang4tilesight-doc
- [27] Huawei Connect 2026 현장 보도: Ascend 960 조기 발표 및 Atlas 960의 NPO 광엔진 채택 — http://www.stnn.cc/detail/6aab5f30158f681db4eff237.html
- [28] Ascend 960, 2027년 1분기 출시 확정 (NetEase 전재) — https://www.163.com/dy/article/L71E8QBV0514EMD3.html
- [29] Huawei Connect 2026 공식 웹사이트 — https://www.huawei.com/cn/events/huaweiconnect
- [30] TileLang 논문 (arXiv:2504.17577) — https://arxiv.org/abs/2504.17577
- [31] ICLR 2026 포스터 페이지 — https://iclr.cc/virtual/2026/poster/10010186
- [32] Hugging Face 튜토리얼 “Writing High-Performance Kernels in TileLang” — https://huggingface.co/blog/AtlasCloud-AI/writing-high-performance-kernels-in-tilelang