TileLang 데일리 리포트 (2026-10-10)
모니터링 기간: 지난 24시간(2026-10-09 07:00 ~ 2026-10-10 07:00, 베이징 시간). 이번 회차는 국경절 연휴 대체 근무일(토요일)로 정상 발행되며, 모니터링 기간은 이전 회차(10-09)와 끊김 없이 이어진다. 출처: GitHub(tile-ai 조직 29개 저장소 푸시 점검, 모니터링 기간 내 9개 저장소에 푸시 발생: tilelang, TileOPs, tilelang-ascend, tilelang-hygon, tilelang-mlir-ascend, TileFoundry, tilelang.github.io, TileOPs.github.io, TileOPs-nightly; 조직 모니터링 기간 내 병합 21건, 신규 오픈 29건; 메인 저장소 6건 병합 및 10건 신규 오픈, TileOPs 9건 병합, Ascend 두 저장소 3건 병합; 오픈 PR: 메인 저장소 177건), PTO-ISA 조직 점검, Google News RSS 중영문 다중 쿼리, Hacker News, arXiv, 문서 사이트 및 릴리스 페이지 점검
이번 호 인덱스
- 오늘의 중점: 금요일 병합 러시——조직 하루 21건 병합 마무리, TileOPs 리팩터링 배치, Ascend 예제 라인, TileFoundry FP8 블록 스케일링이 같은 날 확정(10-09)
-
- 핵심 프로젝트 진척
- 1.1 메인 저장소 수정 배치: T.view 스칼라 비트폭, Autotuner 입력 재사용, autodd 중단, LDGSTG 테스트 게이팅 네 건 병합(10-09)
- 1.2 메인 저장소: CodeRabbit 의도 라우팅 리뷰 병합——리뷰 거버넌스가 툴체인으로 진입(10-09)
- 1.3 메인 저장소 신규 오픈 배치: #3460부터 #3469까지 열 건——PTO 경로 수정, A5 듀얼 카피, FlashMLA 예제 포함(10-09)
- 핵심 프로젝트 진척
-
- 다중 백엔드 적응(Ascend / MetaX / Hygon / Moore Threads)
- 2.1 Ascend: Expert v2/v3 플래시 어텐션 예제 병합——두 세대 구현이 v1 대비 약 1.6~1.9배 속도 향상(10-09)
- 2.2 Ascend: xAttention 예제 정리 및 공유 프리픽스 디코딩 커널 병합(10-09)
- 2.3 Ascend: CANN 9.3 자체 빌드 이미지 CI 검증 병합; MLIR 경로 리포트와 argmax 병합(10-09)
- 2.4 Hygon: warp size 수정 병합——gfx92a/gfx946에서 512 VGPR 적용(10-09)
- 2.5 MetaX / Moore Threads: 공식 저장소 침묵(10-09 점검)
- 다중 백엔드 적응(Ascend / MetaX / Hygon / Moore Threads)
-
- 생태계와 채택자
- 3.1 TileOPs: 하루 아홉 건 병합——csrc 마이그레이션 마무리와 선형 어텐션 명명 통일(10-09)
- 3.2 TileOPs: NSA varlen TMA 활성 슬롯 링 병합; 읽기 전용 페이지드 GQA RoPE 병합(10-09)
- 3.3 TileOPs: 디코딩 SM90 탈피와 GroupNorm 와이드 그룹 수정; 네 건 성능/수정 심사 중(10-09)
- 3.4 야간 파이프라인: 신규 스냅샷 1030건 정확성, 1945건 벤치마크 무실패(10-10)
- 3.5 TileFoundry: 블록 스케일링 FP8 GEMM이 SM90 WGMMA를 거쳐 HIR에서 TIR까지 관통(10-09)
- 3.6 채택자와 문서: TileRT 벤치마크 문서 심사 중; 문서 사이트 1건(10-09 점검)
- 생태계와 채택자
-
- 커뮤니티, 튜토리얼과 활동
- 4.1 커뮤니티: tilelang-debugger 여덟 건 집중 진척——중첩 관측과 통합 캡처(10-09)
- 4.2 PTO-ISA: 교육 저장소 문구 수정; SuperNPUBench 지속 반복(10-09)
- 4.3 미디어와 학술: Google News 점상 매칭; HN 제로 건, arXiv 신규 프리프린트 없음(10-09/10-10)
- 커뮤니티, 튜토리얼과 활동
-
- 트렌드 관찰
- 5.1 ‘재고 정리’에서 ‘증분 동결’로: 엔지니어링 가드레일이 강제 단계로 진입
- 5.2 대기열 양 끝: 177건 오픈 PR과 1030/1945건 무실패
- 5.3 Ascend ‘삼면 동시 타격’ 지속과 PTO 유지보수 면 확대
- 트렌드 관찰
오늘의 중점: 금요일 병합 러시——조직 하루 21건 병합 마무리, TileOPs 리팩터링 배치, Ascend 예제 라인, TileFoundry FP8 블록 스케일링이 같은 날 확정(10-09)
날짜: 2026-10-09 출처: 메인 저장소 PR 목록/ TileOPs 마이그레이션 마무리(#2495)/ Ascend Expert v2/v3(#1863)/ TileFoundry 블록 스케일링 GEMM(#213)/ 야간 스냅샷(821084ca)
모니터링 기간 내 조직 병합 21건(직전 기간과 동일), 신규 오픈 29건; 9개 저장소에 푸시가 있었으며, 리듬은 10-09 오후부터 심야에 집중되었다. 21건 병합 분포: 메인 저장소 6, TileOPs 9, Ascend 어댑테이션 저장소 2, MLIR 경로 1, Hygon 1, TileFoundry 1, 부속 문서 1. 네 개 라인이 같은 영업일에 착지했다:
- TileOPs 하루 9건: csrc 이관 마무리(기존 잔량 제로화 및 신규 추가 거부 가드레일 장착), 선형 어텐션 명명 통일(GLA/DeltaNet, 구명 별칭 잔존 없음), NSA varlen TMA 라이브 슬롯 링, 읽기 전용 페이징 GQA RoPE — 리팩터링·성능·기능 세 라인이 당일 동시 마감(상세는 3장).
- Ascend 두 라인: Expert v2/v3 플래시 어텐션 예시와 xAttention 공유 프리픽스 디코딩 커널이 순차 병합(v2는 구버전 대비 약 1.61~1.62배 속도 향상, v3는 약 1.92배); 같은 날 자체 빌드 CANN 9.3 이미지의 CI 검증 커밋(#3458)이 병합 — 예시 라인과 인프라 라인 동시 타격.
- TileFoundry 블록 스케일링 FP8 GEMM 개통: #213이 DeepSeek-V3 스타일의 블록 스케일링 FP8 GEMM(e4m3 피연산자, f32 1×128 및 128×128 스케일링)을 SM90 WGMMA를 거쳐 HIR에서 TIR까지 실행 — MatMul 결과 dtype, Dim 연산 비용 모델, Wgmma 데이터 타입 면을 보강.
- 야간 파이프라인: 10-10 새벽 신규 스냅샷(병합 지점 #2495에 대응): 정확성 1030건, 벤치마크 1945건(52개 스위트), 실패 제로·오류 제로·스킵 제로 — 테스트 자산이 당일 병합과 동기화되어 갱신.
- 메인 저장소 6건은 수정과 엔지니어링 거버넌스 중심: T.view 스칼라 비트폭, Autotuner 입력 재사용, autodd 중단, LDGSTG 테스트 게이팅, CodeRabbit 리뷰 라우팅, CANN 9.3 CI.
1. 핵심 프로젝트 진행
1.1 메인 저장소 수정 배치: T.view 스칼라 비트폭, Autotuner 입력 재사용, autodd 중단, LDGSTG 테스트 게이팅 네 건 병합(10-09)
날짜: 2026-10-09 출처: T.view 스칼라 비트폭(#3382)/ Autotuner 입력 재사용(#3415)/ autodd 중단 수정(#3385)/ LDGSTG 테스트 게이팅(#3463)
- T.view 스칼라 비트폭(#3382, 17:38 병합):
bits_product가 빈 형상에 대해 바로 1을 반환하고 dtype 비트폭과 채널 수를 건너뛰어, 스칼라T.view가 비트폭이 불일치하는 뷰를 수용하고 비트폭이 동일한 스칼라/텐서 뷰를 잘못 거부했다(결함 티켓 #3378); 수정 후 CPU 측 회귀 추가(비트폭 불일치, 벡터 채널, 동일 폭 재해석, 스칼라/텐서 랭크). - Autotuner 입력 재사용(#3415, 15:33 병합):
cache_input_tensors=True일 때 TVM dtype과 PyTorch dtype을 직접 비교하면 반드시 불일치가 발생(결함 티켓 #3412), 호환 입력이 매번 재생성되고 누락된 랭크 검사를 가렸다; 기존torch_dtype()변환을 사용하도록 변경, 먼저 이종 랭크를 거부하고 그다음 차원을 비교. - autodd 중단(#3385, 15:34 병합):
python -m tilelang.autodd --jobs 0이 작업 스레드를 생성하지 않아 영원히 반환되지 않았다; 이제 비양수는 바로 거부. - LDGSTG 테스트 게이팅(#3463, 13:15 병합): #3390에서 추가된 중첩 프레디케이트 테스트가 ROCm CI에서 CUDA 전용으로 등록된
LowerLDGSTG패스를 호출하여 오류 발생;requires_cuda게이팅 추가 — 실패한 ROCm 작업이 노출하고 당일 수정.
1.2 메인 저장소: CodeRabbit 의도 라우팅 리뷰 병합 — 리뷰 거버넌스가 툴체인으로 진입(10-09)
날짜: 2026-10-09 출처: CodeRabbit 리뷰 라우팅(#3456)
- 리뷰어 분배 목록을
.coderabbit.yaml에 직접 유지(네이티브 “추천 리뷰어” 지시 사용, 별도 명단 파일이나 분배 워크플로를 두지 않음): 리뷰어당 규칙 하나, “주 담당 범위 / 추천 트리거 / 비추천 트리거 / 경로 힌트” 네 단락으로 구성, 파일명이나 키워드가 아닌 변경 의도로 매칭, PR 작성자 본인을 명시적으로 제외(8개 파일). - 대조 배경: 메인 저장소 오픈 PR은 177건(직전 기간 174건) — 리뷰 대역폭 거버넌스가 “인원 추가”에서 “규칙화 라우팅”으로 전환 시작.
1.3 메인 저장소 신규 오픈 배치: #3460부터 #3469 열 건 — PTO 경로 수정, A5 이중 복사, FlashMLA 예시 포함(10-09)
날짜: 2026-10-09 출처: PTODSL 전체 리덕션 헬퍼 회수 (#3469) / A5 이중 복사 경로 변환 (#3468) / FlashMLA 수동 스케줄링 예제 (#3464) / TMA store 펜스 승격 (#3462)
- PTODSL 헬퍼 회수 (#3469): 업스트림 PTOAS가
ptodsl/_allreduce.py를 삭제하고 다운스트림이 자체적으로 vendor하기를 기대했으나,tilelang/contrib/ptodsl/simt.py가 여전히 삭제된 모듈을 참조하여 최신 CANN Weekly(09-30) 기반으로 모든 PTO 대상 연산자를 컴파일하면ModuleNotFoundError가 발생했다. 이번 커밋은 구현을contrib/ptodsl/allreduce.py로 옮기고 PTO 리덕션 프리미티브 테스트를 추가했다 — 업스트림 의존성 변경이 메인 저장소 PTO 경로에 직접 영향을 미친 새로운 사례다. - A5 이중 복사 (#3467 종료 후 #3468로 재개): FixPipe는 A5에서 이중 목적지와
quant_pre를 동시에 활성화할 수 없으며,T.dual_copy의 L0C fp32에서 UB f16/bf16으로의 변환은 이전에 추가vcvt가 필요했다. 이번 커밋은 “경로상 변환”으로 변경하여 추가 Vector 변환을 생략했다. - 기타 신규: CANN 9.2.0 문서 요구사항 (#3460), bisheng 래퍼 임시 파일 정리 (#3461), TMA store 프록시 펜스 실행 순서 (#3462), Ascend FlashMLA 수동 스케줄링 예제 (#3464), CUDA 원자 영역 랭크 진단 (#3465), Ascend 스칼라 rsqrt 싱크 수정 (#3466) — Ascend 관련이 그중 네 건을 차지한다.
2. 멀티 백엔드 적응 (Ascend / MetaX / Hygon / Moore Threads)
2.1 Ascend: Expert v2/v3 플래시 어텐션 예제 병합 — 두 세대 구현이 v1 대비 약 1.6~1.9배 속도 향상 (10-09)
날짜: 2026-10-09 출처: Expert v2/v3 예제 (#1863)
expert_v2/kernel.py와expert_v3/kernel.py신규 추가: v2는 TileLang 구현 방식에서 출발하여 고성능 연산과 파이프라인을 구성하고, v3는 먼저 CCE로 연산과 스케줄링을 작성 및 검증한 후 이를 TileLang으로 어떻게 표현할지 고려하며 직접 서술할 수 없는 부분은 workaround를 사용한다 — 두 경로가 공존하며 각각의 장단점은 문서에 기록되어 있다.- 성능 (fa-public 전체 3개 테스트 포인트): v2는 기존 v1 대비 약 1.61~1.62배, v3는 약 1.92배 속도 향상을 보였으며 세 버전 모두 정확성 검사를 통과했다.
bench_test.sh가 각 버전의 진입점을 자동으로 발견한다. - 제목에 자동 마커(파이프라인 서명)가 포함되며, 중국어 최적화 이력은 kernel과 같은 디렉터리에 보관된다.
2.2 Ascend: xAttention 예제 정리 및 공유 프리픽스 디코딩 커널 병합 (10-09)
날짜: 2026-10-09 출처: xAttention 예제 (#1864)
- xAttention
expert_v2신규 추가: 공유 프리픽스 부분은 행렬 곱으로 처리하고, 각 beam의 프라이빗 token은 마지막 공유 블록의 출력 업데이트에서 벡터 연산으로 완료되어 온칩에서 직접 병합된다. v2는 연속 BF16 입력을 사용하며, 32개의 query 헤드, 8개의 K/V 헤드, 헤드 차원 128로 고정되고 청크 테이블을 지원하지 않는다. - 기존
xattention.py와xattention_paged.py를expert_v1/으로 이동(경로만 이동, 내용 불변)하고 CI 목록과 관련 링크를 동기화했다 — xAttention 예제 라인이 v1/v2 두 단계로 재편되었다.
2.3 Ascend: CANN 9.3 자체 빌드 이미지 CI 검증 병합; MLIR 경로 리포트와 argmax 병합 (10-09)
날짜: 2026-10-09 출처: CANN 9.3 이미지 검증 (#3458) / MLIR 리포트와 argmax (#193) / NPU 프로파일링 지원 (#198)
-
CANN 9.3 자체 빌드 이미지(#3458, 18:00 병합): Ascend CI 작업이 자체 빌드 이미지로 전환(CANN 9.3.0 weekly 툴체인에 950 연산자, Ubuntu 22.04, Python 3.12 포함, torch 2.10.0+cpu 및 torch_npu 2.10.0 고정). 이미지는 국내 미러 소스를 통해 반영되었고 a5(950) runner에서 실행 검증 완료——950의 “회귀 가능” 기반 시설이 착수부터 검증 완료까지 한 주기. 함께 제공되는 a5 runner 마이그레이션 커밋(#3454)은 여전히 리뷰 중.
-
MLIR 경로(#193, 11:40 병합): 종합 성능 테스트 보고서 업데이트 및 mamba 연산자 테스트 추가, benchmark에서 smoke 및 torch 성능 항목 제거, agent 자동 튜닝을 위한 각 stage 시간 통계 및 회고 도입(자기 진화 메커니즘에 통합), argmax 연산자 및 그 증류 경험 추가.
-
신규 오픈: 선택적 Ascend NPU profiling 지원(#198) 및 문서 전면 개편(#197), 950 이미지 릴리스 커밋(#196)은 여전히 WIP.
2.4 Hygon: warp size 수정 병합——gfx92a/gfx946에 512 VGPR 적용(10-09)
날짜: 2026-10-09 출처: warp size 수정(#17)/ 레지스터 파이프라인(#18)
-
#17(18:54 병합): 비상수 표현식 HIP warpSize 지원, gfx92a와 gfx946에 512 VGPR 적용——Hygon 측 저수준 적응이 계속 수렴 중(공동 저자 Hygon 소속, 서명 huangteng@hygon.cn).
-
#18: 레지스터 파이프라인과 warp-diverge는 여전히 리뷰 중(자체 설명 example_gemm rocblas 벤치마크).
2.5 MetaX / Moore Threads: 공식 저장소 정적(10-09 점검)
날짜: 2026-10-09 출처: MetaX 저장소/ Moore Threads 저장소
- MetaX 최근 푸시는 09-20, Moore Threads는 09-30(v0.1.15+musa.1 릴리스일), 모니터링 기간 내 신규 활동 없음.
3. 생태계 및 도입처
3.1 TileOPs: 하루 9건 병합——csrc 마이그레이션 마무리 및 선형 어텐션 명명 통일(10-09)
날짜: 2026-10-09 출처: 인라인 CUDA 마이그레이션 마무리(#2495)/ GEMM 웨이브 커널 마이그레이션(#2493)/ GLA 개명(#2489)/ DeltaNet 개명(#2492)/ 내부 명명 정렬(#2494)/ 문서 후속(TileOPs.github.io #68)
- csrc 마이그레이션 마무리(#2493, #2495): 1D2D FP8 웨이브 커널의
_WAVE_SRC를csrc/fp8_1d2d_helper.h로 이전, warp 특화 MHA 역방향의claim_tile/retire를csrc/tile_claim.h로, 근사 수학 함수를csrc/approx_math.h로 이전(tl::approx_reciprocal및tl::approx_exp2),elementwise/_prelude.py삭제——그리고 “신규 인라인 CUDA 소스 문자열 거부” 가드레일 추가: 기존 재고 일괄 제거, 신규 추가 동결. - 선형 어텐션 명명 통일(#2489, #2492, #2494):
GLAInferenceFwdOp를GLAFwdOp로,DeltaNetInferenceFwdOp를DeltaNetFwdOp로 개명, 파일도 함께 개명(gla/fwd.py,deltanet/fwd.py), 청크 학습 측에Chunk접두사 통일 추가(kernel-map 키 포함). 구 명칭 별칭 유지하지 않음——외부 임포트 동기화 업데이트 필요, 문서 사이트 후속 반영(#68). - 리팩터링 및 마이그레이션 총 5건, 문서 1건으로 당일 병합의 대부분을 구성.
3.2 TileOPs: NSA varlen TMA 활성 슬롯 링 병합; 읽기 전용 페이징 GQA RoPE 병합 (10-09)
날짜: 2026-10-09 출처: NSA TMA 활성 슬롯 링 (#2491)/ 읽기 전용 페이징 GQA RoPE (#2484)
- NSA varlen TMA (#2491): SM90 커널
NSAFwdVarlenTMAKernel추가——Q와 각 활성 K/V 블록이 TMA를 통해 128바이트 스니핑 정렬 타일링으로 진입; Q는 한 번에 레지스터로 로드; 활성 슬롯은 비트마스크로 순회하며, 현재 블록 계산과 다음 블록 로딩이 중첩되어 진행. - 읽기 전용 페이징 GQA RoPE (#2484): FP16/BF16 페이징 GQA RoPE 완성——논리 캐시 위치, NeoX 및 인터리브 레이아웃, 부분 회전 및 안전 테일 읽기; 부수적으로 음수
sm_scale의 NaN 수정 (마스킹 전에 logits 먼저 스케일링); 공개 시그니처 불변 (#2232 닫음; FP8 부분은 #2231로 유보); H200 측 48개 페이징 테스트 동봉.
3.3 TileOPs: 디코드 SM90 탈피 및 GroupNorm 와이드 그룹 수정; 성능/수정 4건 심사 중 (10-09)
날짜: 2026-10-09 출처: 디코드 SM90 탈피 (#2487)/ GroupNorm 와이드 그룹 (#2486)/ 페이징 GQA Hopper 가속 (#2499)/ KDA 프리필 SM90 탈피 (#2498)/ DSA 시소 디코드 (#2497)/ GQA 캐시 어펜드 은퇴 (#2490)
- 디코드 SM90 탈피 (#2487): DeltaNet, GDN, KDA의 단일 토큰 디코드 커널 목록을 [80, 89, 90]으로 확장——SM80/89에서 SM90 기능 없이 실행 가능; 해당 테스트에서
sm90마커 제거. - GroupNorm 와이드 그룹 (#2486): 단일 블록에 담기지 않는 초광폭 그룹을 처리하는 분할 커널 추가——레지스터 행이 65536 열을 초과, 공유 메모리를 거치는 FP16/BF16 행이 16384 열을 초과하는 등의 시나리오를 샤딩 리덕션 후 재병합.
- 심사 중 4건: Hopper 페이징 GQA 가속 (#2499: 자체 보고 H200에서 17/17 비교 벤치마크 케이스가 FlashInfer보다 빠름, 혼합 serving 2.61배, CUDA Graph 재생 전반에 걸친 활성 오프셋 읽기 지원), KDA 청크 프리필 SM90 탈피 (#2498), DSA 희소 MLA 디코드의 “시소” 듀얼 컨슈머 커널 (#2497), GQA 캐시 어펜드 포함 프리필 은퇴 (#2490, 읽기 전용 페이징 API 유지).
- TileOPs 현재 오픈 PR 6건 집계.
3.4 야간 파이프라인: 신규 스냅샷 정확성 1030건, 벤치마크 1945건 무실패 (10-10)
날짜: 2026-10-10 출처: 스냅샷 커밋 (821084ca)/ 스냅샷 환경 메타데이터
- 10-10 새벽 신규 스냅샷 (run 37970266975, 대응 병합 지점 7c351e304 즉 #2495): 정확성 1030건 무실패, 무오류, 무스킵; 벤치마크 1945건 (52개 스위트) 무실패——직전 대비 각각 3건과 6건 증가, 규모 계속 상승.
- 실행 환경: H200, CUDA 13.2, driver 595.71.05, torch 2.13.0+cu132.
3.5 TileFoundry: 블록 스케일 FP8 GEMM, SM90 WGMMA 경유 HIR에서 TIR까지 관통 (10-09)
날짜: 2026-10-09 출처: 블록 스케일 FP8 GEMM (#213)/ 심사 중 수정 (#220)
- #213(23:46 병합): DeepSeek-V3 스타일의 블록 스케일링 FP8 GEMM(e4m3 피연산자, f32 1×128 및 128×128 스케일링)을 ‘작성 불가, 분석 불가, 배열 불가, 평가 불가’에서 전체 파이프라인 실행 가능 단계로 끌어올림——네 가지 기반을 보강: MatMul 결과 dtype, Dim 연산 비용 모델, Wgmma를 BF16에서 블록 스케일링 FP8로 확장, HIR 온칩 행렬 곱셈 결과 배치를 목표 MMA 기준으로 기록(피연산자 고정 방식 대신); 이미 닫힌 #212를 대체.
- 같은 날 별도로 3건의 수정 PR(#216, #217, #219)이 열린 후 닫힘(병합되지 않음); 1건 심사 중(#220: mesh 스코프 호출 및 스칼라 윈도우 수정).
3.6 채택자와 문서: TileRT 벤치마크 문서 심사 중; 문서 사이트 1건(10-09 확인)
날짜: 2026-10-09, 2026-10-10 출처: TileRT 벤치마크 문서(#58)/ 메인 문서 사이트 커밋(0158a427)/ TileKernels/ FlashQLA
- TileRT: #58(GLM-5.1과 vllm의 PD 배포 벤치마크 문서: 지연 시간 및 처리량 지표) 심사 중, 마감 전까지 여전히 업데이트 있음; #67(EFA 사용자 공간 컴포넌트) 심사 중.
- 문서 사이트: tilelang.github.io 1건 빌드 업데이트(autotuner/tuner 모듈의 autoapi 참조 페이지와 검색 인덱스); TileOPs.github.io는 이름 변경에 따라 1건 반영(3.1 참조).
- 채택자: TileKernels, FlashQLA 모니터링 기간 내 푸시 없음(최근 모두 09-30); 버전 리듬: 메인 저장소 v0.1.15(09-30)가 여전히 최신 태그, 모니터링 기간 내 새 릴리스 없음.
4. 커뮤니티, 튜토리얼 및 활동
4.1 커뮤니티: tilelang-debugger 8건 집중 진행——중첩 관측과 통합 캡처(10-09)
날짜: 2026-10-09 출처: tilelang-debugger/ 통합 캡처 커밋(e838fc88)
- 모니터링 기간 내 8건(10-09 오전부터 저녁): 사용자 지정 커널 소스 경로 수용, Python print 매크로로 소스 선택 캡처 구현, 중첩 관측의 타입 지정 샘플 기록과 통합 중첩 제어 흐름, 소스 분석/계측/이미터/프로토콜 분리, 스레드 선택과 리더 분리, 마지막으로 ‘통합 소스 캡처’로 마무리; 마감 전(10-10 아침) 1건 추가(통합 소스 접근 캡처 및 TileLang 호환성 검증).
- H200 대상 TileLang 전용 디버깅 워크스페이스, 연속 두 번째 모니터링 기간에서 일평균 약 10건의 진행 강도 유지(10-08 최초 생성 당일 4건).
4.2 PTO-ISA: 교육 저장소 문구 수정; SuperNPUBench 지속 반복(10-09)
날짜: 2026-10-09 출처: tilelang-puzzles-ascend/ SuperNPUBench
- 교육 저장소(puzzles-ascend): 모니터링 기간 내 2건(torch 항목에서 각 텐서에 dtype과 형상 주석 추가; puzzle 파일 문구를 독자가 스스로 추론하도록 유도하고 답을 직접 제시하지 않도록 수정).
- SuperNPUBench: 모니터링 기간 내 2건, 마감 전 오늘 아침 추가 2건——FA 연산자 성능 워크북 추가, rms_norm 32k 테스트 기본 PE_NUM=4 수정, 단일 블록 경로 32k gamma 개선, tail_ocp_fp8에 inf/zero/special 세 가지 가드 보강.
4.3 미디어와 학술: Google News 점형 검색 결과; HN 0건, arXiv 새 프리프린트 없음(10-09/10-10)
날짜: 2026-10-09 출처: Google News/ Hacker News 검색/ arXiv
- Google News: 중국어·영어 여러 검색 조합에서 4건 확인(영어 기술 브리핑 1건, 중국어 재경 기사 3건) — 제목과 출처 기준으로 모두 본 프로젝트에 관한 독립 보도가 아니며, “DeepSeek 오픈소스 Ascend 컴포넌트” 보도 흐름의 배경적 연장 및 시황 해석에 해당; 조합어 정밀 검색(최근 2일, 최근 3일)에서 그 외 추가 없음.
- Hacker News: 모니터링 기간 내 0건(본 주제가 HN에서 희박하게 다뤄지는 추세가 지속).
- arXiv: 모니터링 기간 내 신규 프리프린트 없음(검색된 최신 관련 항목은 2026-07-05의 GPU kernel 평가 연구).
5. 추세 관찰
5.1 “재고 정리”에서 “증분 동결”로: 엔지니어링 가드레일이 강제 국면에 진입
- TileOPs는 “인라인 CUDA 소스 문자열”을 마이그레이션 프로젝트에서 동결 규칙으로 전환(재고 소진 후 신규 추가 거부); 선형 어텐션 명칭 변경은 별칭을 남기지 않음; 메인 저장소 측 CodeRabbit 의도 라우팅은 리뷰어 분배를 규칙화; Ascend CI는 자체 구축 CANN 9.3 이미지로 고정. 엔지니어링 품질 조치의 공통점: 모두 일회성 정리를 장기 제약으로 승격 — 리팩터링 기간 종료, 수성 기간 시작.
5.2 큐의 양 끝: 177건의 오픈 PR과 1030/1945건 무실패
- 오픈 PR: 메인 저장소 177건(직전 대비 +3), Ascend 어댑테이션 저장소 225건 — 리뷰 대역폭은 여전히 리듬 변수; 반대편에서는 야간 파이프라인 1030건 정확성 + 1945건 벤치마크(52개 스위트)가 연속 무실패로 대규모 대기 큐에 회귀 기반을 제공. 모니터링 기간 내 신규 29건 중 10건이 당일 머지 완료(TileOPs 주도) — “빠른 진입·빠른 배출”과 “롱테일 큐”가 공존.
5.3 Ascend “삼면 동시 타격” 지속과 PTO 유지보수 면 확대
- 기능(Expert 예제, A5 이중 복사, rsqrt), 인프라(CANN 9.3 이미지 검증), 컴파일 경로(MLIR 보고 및 argmax)가 같은 날 여러 지점에서 동시 전개; 반면 #3469는 새 변수를 시사: 업스트림 PTOAS의 인터페이스 변경이 메인 저장소 PTO 타깃의 컴파일을 직접 중단시킬 수 있음 — PTO 제2 경로가 “업스트림 의존성 관리” 과제기에 진입. 마감 전(10-10 아침) Ascend 관련 건은 여전히 업데이트 중(#3466, #3468, #3469 및 #3321, #1657 등).
부록: 자료 및 검증 설명
| 출처 | 검증 결과 |
|---|---|
| tile-ai 조직(29개 저장소) | 모니터링 기간 내 9개 저장소에 푸시 발생: tilelang(6건), TileOPs(9건), tilelang-ascend(2건), tilelang-hygon(1건), tilelang-mlir-ascend(1건), TileFoundry(1건), tilelang.github.io(1건), TileOPs.github.io(1건), TileOPs-nightly(1건 스냅샷); 조직 모니터링 기간 내 머지 21건, 신규 29건 |
| 메인 저장소 tilelang | 머지 6건(#3382, #3385, #3415, #3456, #3458, #3463); 신규 10건(#3460~#3469, 그중 #3467은 닫힌 후 #3468로 재개); 오픈 PR 177건; 릴리스 페이지 및 태그 모니터링 기간 내 신규 없음(최신 v0.1.15, 09-30) |
| Ascend 저장소(ascend / mlir-ascend) | ascend: 머지 2건(#1863, #1864), 신규 2건(#1866, #1867), 오픈 PR 225건; mlir-ascend: 머지 1건(#193), 신규 2건(#197, #198), #196은 여전히 WIP |
| Hygon / MetaX / Moore Threads | Hygon: #17 머지, #18 심사 중; MetaX(09-20 이후), Moore Threads(09-30 이후) 활동 없음 |
| TileOPs | 머지 9건(#2484, #2486, #2487, #2489, #2491, #2492, #2493, #2494, #2495); 신규 10건; 오픈 PR 6건 |
| TileOPs-nightly | 신규 스냅샷 821084ca(run 37970266975): 정확성 1030건, 벤치마크 1945건(52개 스위트), 무실패·무오류·무스킵; 대응 머지 지점 7c351e304(#2495) |
| TileFoundry | 머지 1건(#213); 신규 4건(#216, #217, #219는 닫힘·미머지, #220은 심사 중) |
| TileRT | #58, #67 심사 중; #58은 마감 전 업데이트; 릴리스 페이지 신규 없음(최신 v0.1.6, 09-24) |
| PTO-ISA 조직 | tilelang-puzzles-ascend 모니터링 기간 내 2건; SuperNPUBench 모니터링 기간 내 2건, 마감 전 오늘 아침 추가 2건 |
| 채택자 및 커뮤니티 | TileKernels, FlashQLA 모니터링 기간 내 푸시 없음; 커뮤니티 저장소 tilelang-debugger 모니터링 기간 내 8건(마감 전 추가 1건); BM1690 파이프라인 저장소 모니터링 기간 내 업데이트 없음 |
| Google News / Hacker News / arXiv | Google News 중국어·영어 검색에서 4건 확인(영어 브리핑 1, 중국어 재경 기사 3); HN 0건; arXiv 신규 프리프린트 없음 |
전체 출처 목록
- [1] 메인 저장소 PR 목록 — https://github.com/tile-ai/tilelang/pulls
- [2] T.view 스칼라 비트폭 (#3382) — https://github.com/tile-ai/tilelang/pull/3382
- [3] Autotuner 입력 재사용 (#3415) — https://github.com/tile-ai/tilelang/pull/3415
- [4] autodd 행업 수정 (#3385) — https://github.com/tile-ai/tilelang/pull/3385
- [5] LDGSTG 테스트 게이팅 (#3463) — https://github.com/tile-ai/tilelang/pull/3463
- [6] CodeRabbit 리뷰 라우팅 (#3456) — https://github.com/tile-ai/tilelang/pull/3456
- [7] PTODSL 전체 리덕션 헬퍼 회수 (#3469) — https://github.com/tile-ai/tilelang/pull/3469
- [8] PTOAS 업스트림 변경 커밋 (f5eff3ee2) — https://github.com/hw-native-sys/PTOAS/commit/f5eff3ee249697f6157088f649c6434fcc9d7c5b
- [9] A5 이중 복사 경로 변환 (#3468) — https://github.com/tile-ai/tilelang/pull/3468
- [10] FlashMLA 수동 스케줄링 예제 (#3464) — https://github.com/tile-ai/tilelang/pull/3464
- [11] TMA store 펜스 승격 (#3462) — https://github.com/tile-ai/tilelang/pull/3462
- [12] CANN 9.2.0 문서 요구사항 (#3460) — https://github.com/tile-ai/tilelang/pull/3460
- [13] 원자 구역 랭크 진단 (#3465) — https://github.com/tile-ai/tilelang/pull/3465
- [14] Ascend 스칼라 rsqrt 수정 (#3466) — https://github.com/tile-ai/tilelang/pull/3466
- [15] Expert v2/v3 예제 (#1863) — https://github.com/tile-ai/tilelang-ascend/pull/1863
- [16] xAttention 예제 (#1864) — https://github.com/tile-ai/tilelang-ascend/pull/1864
- [17] CANN 9.3 이미지 검증 (#3458) — https://github.com/tile-ai/tilelang/pull/3458
- [18] a5 runner 마이그레이션 (#3454) — https://github.com/tile-ai/tilelang/pull/3454
- [19] MLIR 리포트와 argmax (#193) — https://github.com/tile-ai/tilelang-mlir-ascend/pull/193
- [20] NPU 프로파일링 지원 (#198) — https://github.com/tile-ai/tilelang-mlir-ascend/pull/198
- [21] 문서 전면 개편 (#197) — https://github.com/tile-ai/tilelang-mlir-ascend/pull/197
- [22] 950 이미지 릴리스 (#196) — https://github.com/tile-ai/tilelang-mlir-ascend/pull/196
- [23] warp size 수정 (#17) — https://github.com/tile-ai/tilelang-hygon/pull/17
- [24] 레지스터 파이프라인 (#18) — https://github.com/tile-ai/tilelang-hygon/pull/18
- [25] MetaX 저장소 — https://github.com/tile-ai/tilelang-metax
- [26] Moore Threads 저장소 — https://github.com/tile-ai/tilelang-musa
-
[27] 인라인 CUDA 마이그레이션 마무리 (#2495) — <https://github.com/tile-a
- [28] GEMM 웨이브 커널 마이그레이션(#2493) — https://github.com/tile-ai/TileOPs/pull/2493
- [29] GLA 명칭 변경(#2489) — https://github.com/tile-ai/TileOPs/pull/2489
- [30] DeltaNet 명칭 변경(#2492) — https://github.com/tile-ai/TileOPs/pull/2492
- [31] 내부 명명 정렬(#2494) — https://github.com/tile-ai/TileOPs/pull/2494
- [32] 문서 후속 작업(TileOPs.github.io #68) — https://github.com/tile-ai/TileOPs.github.io/pull/68
- [33] NSA TMA 활성 슬롯 링(#2491) — https://github.com/tile-ai/TileOPs/pull/2491
- [34] 읽기 전용 페이지드 GQA RoPE(#2484) — https://github.com/tile-ai/TileOPs/pull/2484
- [35] 디코딩 SM90 탈피(#2487) — https://github.com/tile-ai/TileOPs/pull/2487
- [36] GroupNorm 와이드 그룹(#2486) — https://github.com/tile-ai/TileOPs/pull/2486
- [37] 페이지드 GQA Hopper 가속(#2499) — https://github.com/tile-ai/TileOPs/pull/2499
- [38] KDA 프리필 SM90 탈피(#2498) — https://github.com/tile-ai/TileOPs/pull/2498
- [39] DSA 시소 디코딩(#2497) — https://github.com/tile-ai/TileOPs/pull/2497
- [40] GQA 캐시 추가 퇴역(#2490) — https://github.com/tile-ai/TileOPs/pull/2490
- [41] 스냅샷 커밋(821084ca) — https://github.com/tile-ai/TileOPs-nightly/commit/821084caf4f944ff9899a3671498f39c3bfb9363
- [42] 스냅샷 환경 메타데이터 — https://github.com/tile-ai/TileOPs-nightly/blob/snapshots/meta.json
- [43] 블록 스케일링 FP8 GEMM(#213) — https://github.com/tile-ai/TileFoundry/pull/213
- [44] 심사 중 수정(#220) — https://github.com/tile-ai/TileFoundry/pull/220
- [45] TileRT 벤치마크 문서(#58) — https://github.com/tile-ai/TileRT/pull/58
- [46] EFA 사용자 공간 컴포넌트(#67) — https://github.com/tile-ai/TileRT/pull/67
- [47] 메인 문서 사이트 커밋(0158a427) — https://github.com/tile-ai/tilelang.github.io/commit/0158a42782d462781b6afd728f0bcd2530cf79a1
- [48] TileKernels 저장소 — https://github.com/deepseek-ai/TileKernels
- [49] FlashQLA 저장소 — https://github.com/QwenLM/FlashQLA
- [50] tilelang-debugger — https://github.com/superAngGao/tilelang-debugger
- [51] 디버거 통합 캡처 커밋(e838fc88) — https://github.com/superAngGao/tilelang-debugger/commit/e838fc88d96a562ee6230ee154d6593bac6632f8
- [52] tilelang-puzzles-ascend — https://github.com/PTO-ISA/tilelang-puzzles-ascend
-
[53] SuperNPUBench — <https://github.com/PTO-ISA/SuperNPUB
- [54] BM1690 파이프라인 저장소 — https://github.com/arcflute/tilelang-tpu-bm1690-pipelines
- [55] 메인 저장소 릴리스 페이지 — https://github.com/tile-ai/tilelang/releases
- [56] Google News RSS(중영문 검색) — https://news.google.com/
- [57] Hacker News 검색 — https://hn.algolia.com/
- [58] arXiv 검색 — https://arxiv.org/