TileLang 데일리 리포트 (2026-09-24)
모니터링 기간: 지난 24시간(2026-09-23 07:00 ~ 2026-09-24 07:00, 베이징 시간). 정기 데일리 업데이트 기간으로, 이전 호와 중복 없음. 출처: GitHub(tile-ai 조직 29개 저장소 푸시 점검, 기간 내 10개 저장소에 푸시 발생; 메인 저장소 결함 수정 2건 병합 및 신규 NaN 검증 이슈 오픈; TileOPs 하루 7건 성능 병합 및 9건 신규 오픈; TileFoundry 메모리 분석 대형 병합; Ascend 예제 2건 롤백 및 저장소 경합 수정 방안; MLIR Ascend와 Hygon 각각 수정 병합; TileSight 신규 저장소 최초 커밋; 야간 스냅샷 정확성 1141건 무실패), Google News RSS 중영문 다중 쿼리(프록시 경유, 0건 적중), Hacker News, arXiv, 커뮤니티 저장소 점검
이번 호 인덱스
- 오늘의 핵심: TileSight 정식 오픈소스——타일 중심의 분석적 성능 모델이 논문에서 공식 저장소로 착지(09-23)
-
- 핵심 프로젝트 진행
- 1.1 메인 저장소: 결함 수정 2건 병합, 인덱스 경계 수정 이슈 당일 종료(09-23)
- 1.2 메인 저장소: NaN 전파 시맨틱스 부상, 컴파일 시점 검증 동일자 후속(09-23)
- 1.3 메인 저장소 리뷰 큐: TileIR 백엔드 31개 커밋 누적 여전히 심사 중(09-23)
- 1.4 TileOPs: 하루 7건 성능 병합, 7대 서브시스템 전면 추진(09-23)
- 1.5 TileOPs 특집: DeltaNet 추론 연산자 합류, H200 대조 FLA 최대 3.7배 속도 향상(09-23)
- 1.6 TileOPs 신규 오픈 큐: varlen GQA 3연속 및 W4A16 롱 K 스트리밍(09-23)
- 1.7 TileOPs: 외부 백엔드 채널 거버넌스——38개소 디바이스 검사 철거(09-23)
- 1.8 TileFoundry: 메모리 풋프린트 및 재사용 윈도우 병합(09-23)
- 1.9 야간 스냅샷: 정확성 1141건 무실패, DeltaNet 롱 프리필 벤치마크 타임아웃(09-24)
- 핵심 프로젝트 진행
-
- 다중 백엔드 적응(Ascend / Hygon / MetaX / Moore Threads 등)
- 2.1 Ascend: mHC 예제 2건 롤백(09-23)
- 2.2 Ascend: 스칼라 GM 저장소 경합 수정 방안 제출, 차이 수 0으로(09-23)
- 2.3 Ascend: 일일 테스트 2448건 전면 통과 복귀(09-24)
- 2.4 MLIR Ascend: NPU launcher 메모리 누수 및 스트림 동기화 수정 병합(09-23)
- 2.5 Hygon: 예제 지원 병합, 37개 파일 HCU 행렬 코어 활성화(09-23)
- 2.6 MetaX와 Moore Threads: 저장소 푸시 없음, MUSA 거버넌스 TileOPs 큐로 전환(09-24 점검)
- 다중 백엔드 적응(Ascend / Hygon / MetaX / Moore Threads 등)
-
- 생태계와 채택 측
- 3.1 채택 측: TileKernels와 FlashQLA 기간 내 푸시 없음(09-24 점검)
- 3.2 커뮤니티 프로젝트: TPU 검증 저장소와 MetaX 트레이닝 캠프 저장소 신규 커밋 없음(09-24 점검)
- 생태계와 채택 측
-
- 커뮤니티, 튜토리얼과 활동
- 4.1 문서 사이트: 메인 저장소 문서 사이트 정기 재생성(09-23)
- 4.2 미디어와 학술 측: Google News 0건 적중, arXiv 신규 프리프린트 없음(09-24 점검)
- 4.3 버전 리듬: 신규 릴리스 없음, 메인 저장소 v0.1.14 22일째(09-24)
- 커뮤니티, 튜토리얼과 활동
-
- 트렌드 관찰
- 5.1 분석 계층 형성: 논문과 커뮤니티 문서에서 공식 코드 저장소로
- 5.2 TileOPs 성능 시즌의 마무리와 재출발
- 5.3 다중 백엔드 엔지니어링 부채의 표면화
- 5.4 공백과 리스크 포인트
- 트렌드 관찰
- 부록: 자료와 점검 설명
오늘의 핵심: TileSight 정식 오픈소스——타일 중심의 분석적 성능 모델이 논문에서 공식 저장소로 착지
날짜: 2026-09-23 출처: tile-ai/TileSight 저장소/최초 커밋 init/arXiv 2607.22432
09-23 22:54(베이징 시간), tile-ai 조직 아래 새로 추가된 TileSight 저장소가 최초 커밋 init을 완료했다: 177개 파일, 약 5.67만 행 추가, MIT 라이선스, 커밋 작성자는 Imperial College London의 Zhiwen Mo. 7월 24일 arXiv 논문 말미의 “발표 후 오픈소스화하겠다”는 약속이 이로써 정식으로 이행되었다; 조직 저장소 총수는 28개에서 29개로 증가.
TileSight는 “타일 중심” 분석적 GPU 성능 모델로 자리매김한다: 타일을 모델링 단위로 삼아 CPU 측에서 연산자의 연산 비용, 캐시 트래픽과 실행 시간을 추정한다——커널 내에서는 연산과 메모리 접근 파이프라인 중첩을 모델링하고, 커널 간에는 캐시 계층을 모델링하며, GPU 간에는 노드 간 통신을 모델링한다; 실측 교정은 CUDA와 HIP 프로브가 대상 GPU에서 별도로 수행하여 모델링과 분리된다. 논문 기준 정밀도: A100, H200, B200, B6000 4세대 플랫폼에서 단일 카드 커널 지연의 통합 평균 절대 백분율 오차는 12.35%, L2 적중률 예측은 실측과 약 1퍼센트포인트 차이; 32카드 클러스터로 확장하면 융합 분산 커널과 vLLM 엔드투엔드 서비스의 가중 오차는 각각 16.18%와 13.52%.
저장소 구조(최초 커밋 범위):
tilesight/arch/: 20여 개의 하드웨어 프로필로, NVIDIA A100/H100/H200/B200/B6000/V100/T4/P100과 RTX 3090/4090/5090 등, AMD MI50/MI210/MI300X/MI325X, Intel Arc 770을 포괄합니다;tilesight/modeling/: 프로그램 프런트엔드(빌더/분석/계약), 다단계 캐시 재사용 거리 모델(SDCM), 파이프라인 중첩 분석(프롤로그/정상 상태/에필로그, 점유율, 웨이브 양자화), GEMM/FlashAttention(FA3/FA4 주기 스케줄링)과 FlashMLA 디코딩 등의 어댑터;micro_benchmark/: CUDA 프로브(B200 tcgen05/tmem, H200 wgmma, 범용 dram 스캔과 P2P)와 HIP 프로브(rocBLAS GEMM, AMD 장치 정보);examples/와 전체 테스트 스위트, 추가로 NCU 비교와 CuTeDSL/사설 툴체인의 예측 보조 도구.
판독: 이는 본 주제 「성능 해석 가능성」 단서의 세 번째 구간입니다 — 07-24 논문(Imperial College와 TileLang 핵심 멤버 공저) → 09-18 커뮤니티 문서 저장소(TileLang 분석을 TileSight에 연결) → 09-23 공식 코드 저장소. 이는 그동안 논문과 개인 문서에 흩어져 있던 방법을 조직 프로젝트로 고정화했으며, TileFoundry(컴파일 시점 내 IR 분석)와 분업을 이룹니다: 하나는 모델링 단계에서 계층 간 비용을 예측하고, 다른 하나는 컴파일 시점에 캐시 용량 결론을 보고합니다. 하드웨어 프로필이 AMD와 Intel 외장 GPU를 포괄한다는 점 역시, 이를 자연스럽게 멀티 백엔드 서사에 봉사하게 만듭니다.
1. 핵심 프로젝트 진행 상황
1.1 메인 저장소: 결함 수정 2건 병합, 인덱스 경계 수정 단건 당일 종료(09-23)
날짜: 2026-09-23 출처: #3232/#3246/#3272
- #3232(13:54 병합, +196/−14, 파일 3개): 「루프 목표가 가변 스칼라 바인딩을 재사용」 문제 수정(결함 단건 #3231 동시 종료) — 루프 목표(튜플 목표 포함)에 명시적 바인딩을 설정하여, 귀납 변수를 기존 alloc_var 또는 Ref 바인딩에 기록하는 것을 방지하고, 동시에 일반 가변 할당과 범위 초과 검사를 유지; 루프 형태, 튜플 목표, 만료된 바인딩 등의 회귀 테스트를 갖춤.
- #3246(11:52 병합, +76/−6, 파일 2개):
T.copy와T.async_copy의 병합 폭 힌트 매개변수coalesced_width를 「폭이 나누어떨어지지 않으면 치명적 로그」에서 「도달 가능한 벡터 폭에 따라 클램프」로 변경 — 요청을 상한으로 취급하고, 기하학적으로 도출된 폭의 최대 나누어떨어지는 인수를 취함; 하향 조정 발생 시 경고, 비양수 값 거부; 불규칙 및 초대형 폭(8, 257) 회귀 포괄; 대응 결함 단건 #3007 동시 종료. - #3272(09-24 새벽 신규 개설, 01:49 종료, 미병합): 부호 있는 타입이 표현할 수 있는 상한과 정확히 같은 버퍼 인덱스를 64비트로 확장하는 것을 방지; 해당 단건은 당일 종료되었으나 설명이 없으며, 문제가 여전하다면 후속 방안이 필요함.
1.2 메인 저장소: NaN 전파 시맨틱 부상, 컴파일 시점 검증 같은 날 후속(09-23)
날짜: 2026-09-23 출처: #3270/#3273/#3205
- 14:15 결함 단건 #3270:
reduce_max,reduce_min,reduce_absmax세 가지 리덕션 연산자의nan_propagate=True가 float32/float64 출력에서 조용히 무시됨(float16/bfloat16은 백엔드 지원 있음). 보고자는 완전한 환경(H800, CUDA 13.1)을 제시하며, 이 동작이 하드웨어가 아니라 하향 단계에서 dtype에 따라 결정된다고 지적 — 즉 동일한 실제 하드웨어에서 시맨틱이 일관되지 않음. - 09-24 새벽 03:08 신규 개설 PR #3273: 지원되지 않는 출력 dtype에 대해 컴파일 시점 오류 추가 — 진단 정보는 연산 이름, 지원되는 출력 타입과 실인자 dtype을 제공; 검증은 네이티브 ReduceOp 생성자 내부에 위치(로컬 리덕션, 프래그먼트 리덕션, 쓰기 되돌림 누산을 가로질러 누산기 dtype 계약을 통일적으로 보유); 회귀 매트릭스는 세 연산자 × clear 두 단계 × 플래그 두 값 × 다섯 dtype을 포괄; SM100 패킹 리덕션 회귀도 동일 진단을 기대하도록 동시 업데이트.
- 또 다른 #3205(NaN 전파 clamp의 장치 템플릿 하향 수정)는 모니터링 기간 내 계속 업데이트되었으며, 여전히 리뷰 중.
판독: 이는 「조용한 시맨틱 오류를 컴파일 시점 실패로 앞당긴다」 원칙이 새로운 데이터 타입 시맨틱에 한 번 복제된 것입니다 — 난수, 레이아웃 증명, 타입 조합에서 NaN 전파로 확장되었으며, 보고에서 수정 PR까지의 응답이 반나절 내에 완료되었습니다.
1.3 메인 저장소 리뷰 큐: TileIR 백엔드에 누적 31개 커밋이 여전히 심사 중 (09-23)
날짜: 2026-09-23 출처: #3247/#3267 등
- #3247(CUDA Tile IR 실행 백엔드): 모니터링 기간 내 계속 새로운 활동이 있었으며, 규모가 31개 커밋, +36506/−112줄, 139개 파일까지 누적되었고 여전히 병합되지 않았다. JIT, 캐시, 자동 튜닝부터 문서와 CI까지의 완성도는 이전 각 모니터링 기간 중 최고 수준이다.
- #3267(
tl.LowerMagicDiv매직 디비전), #3265(기동 불변식 정수 연산 하강)는 모니터링 기간 내 각각 업데이트가 있었으며, 병합 대기 중이다. 매직 디비전에 대응하는 기능 요청 이슈 #3261도 함께 업데이트되었다. - #3243(RNG void 바인딩 거부), #3205 등 수정 이슈는 열린 상태를 유지했다.
큐 관찰: 이번 모니터링 기간 메인 저장소는 “소규모 수정은 도장 찍듯 병합, 대규모 변경은 재료를 모으는” 리듬을 이어갔다. 두 건의 결함 수정이 메인라인에 들어갔고, 평가 대역폭은 여전히 대형 항목에 집중되었다.
1.4 TileOPs: 하루에 일곱 건의 성능 병합, 일곱 개 하위 시스템 전면 추진 (09-23)
날짜: 2026-09-23 출처: #2168/#2163 등 일곱 건(전체 목록은 부록 참조)
13:13부터 18:44(베이징 시간) 사이에 일곱 건의 PR이 연이어 병합되었으며, GEMM, Engram, 어텐션, MoE, Mamba, mHC, 선형 어텐션 일곱 개 하위 시스템을 아우른다:
- #2168(13:13): W4A16 GEMM이 사전 패키징된 가중치 순서 읽기를 지원(양자화 배포 경로의 네이티브 지원);
- #2173(13:14): Engram 디코딩 단계를 프로젝션과 리덕션 두 단계 커널로 분할;
- #2160(16:44): varlen GQA 커널을 통합 연산자로 이전(리팩터링 마무리);
- #2169(16:45): MoE 초과 라우팅을 16행 단위로 그룹화하여 선도자로 지정;
- #2176(16:46): Mamba DaCumsum이 dt 로딩을 병합, 블록당 두 단계 스캔;
- #2177(16:46): mHC 프리필 프로젝션을 K 차원을 따라 분할;
- #2163(18:44): DeltaNet 추론 연산자(1.5 참조).
또한 #2162(varlen GQA 파이프라인과 전체 타일 마스크 탐구 이슈)는 같은 날 닫혔으며 병합되지 않았다. 같은 작성자의 이후 세 건의 신규 오픈(1.6 참조)이 해당 방향을 이어간다.
1.5 TileOPs 특집: DeltaNet 추론 연산자 합류, H200에서 FLA 대비 최대 3.7배 속도 향상 (09-23)
날짜: 2026-09-23 출처: #2163
18:44 병합(+743/−3, 13개 파일):
DeltaNetInferenceFwdOp와 H200을 겨냥한 밀집 프리필 커널(Gated DeltaNet 기반의 블록 단위 솔버/재귀 파이프라인)을 새로 추가; 기존 학습 API와 독립 디코딩 커널은 그대로 유지; 호출자가 보유한 0이 아닌 FP32 초기 상태를 지원;- 현재 트리 내 특수화는 동일 길이 BF16/FP16 프리필, K=V=64 또는 128, T≥64이면서 64로 나누어떨어지는 시나리오를 커버; 디코딩, 패킹 가변 길이, Q/K L2 정규화는 후속 경로로 분류되며, 공용 추론 계약은 잠정적으로 “스펙 수준”;
- 검증: H200에서 추론/GDN/roofline 테스트 51건 통과, 레거시 순전파 테스트 9건 통과; 클럭 고정(SM 1500MHz) 상태에서 FLA와 케이스별 A/B(마이크로초, 중앙값; busy는 GPU 활동 시간의 합, latency는 활동 간극 포함):
| B / T / H / D | TileOps busy | FLA busy | TileOps latency | FLA latency |
|---|---|---|---|---|
| 2 / 2048 / 4 / 64 | 44.8 | 67.1 | 293.1 | 497.0 |
| 2 / 8192 / 4 / 64 | 76.5 | 229.9 | 306.5 | 486.5 |
| 2 / 16384 / 4 / 64 | 120.5 | 448.2 | 320.6 | 602.1 |
| 1 / 4096 / 16 / 128 | 116.6 | 206.8 | 300.1 | 494.6 |
해석: busy 기준 최대 3.7배 속도 향상(T=16384), 간극을 포함한 종단 간 지연은 최대 약 47% 감소; 각 케이스는 타이밍 전에 출력과 최종 상태를 대조 검사한다. 또한 유의할 점: 이 연산자가 야간 벤치마크에 들어간 후, 긴 프리필 구성에서 한 차례 타임아웃이 발생했다(1.9 참조).
1.6 TileOPs 신규 오픈 큐: varlen GQA 삼연속과 W4A16 긴 K 스트리밍 (09-23)
날짜: 2026-09-23 출처: #2178/#2180/#2184/#2185
- varlen GQA 삼연타 (20:13 / 22:22 / 09-24 00:27, 동일 작성자): 사전 계획 스케줄링, 스케줄 지속성, 지역성과 리덕션 개선. 방향은 가변 길이 GQA의 작업 스케줄링을 런타임 결정에서 「사전 계획 + 지속성」으로 옮기는 것이다.
- W4A16 롱 K 스트리밍 (09-24 01:02, +482/−234, 3개 파일): 문제 진술이 완전한 장부를 제시했다——롱 K 디코딩 행 (1, 8192, 81920)은 0.1366ms가 걸려 Marlin의 0.1261ms에 뒤처지며(0.92배), W4A16 계열에서 유일하게 Marlin보다 느린 워크로드이다. 단일 토큰 타일은 각 가중치 쌍마다 스케일링을 한 번 더 수행하고, 롱 K 그리드의 128개 N 타일은 132개 SM에 대응하며(4개 SM은 내내 유휴), 256 스레드 타일의 레지스터 분할(24+240)은 레지스터 파일 상한을 초과하여 실측에서
setmaxnreg에서 멈춘다. 개선 방법: 그룹 스케일링을 FP32 부분합으로 지연, 실제 M에 따라 작은 타일 구성, stream-K 그리드와 독립 리덕션 도입, 레지스터 분할을 32/224로 변경.
1.7 TileOPs: 외부 백엔드 채널 거버넌스——38곳의 디바이스 검사 철거 (09-23)
날짜: 2026-09-23 출처: #2179/#2164/#2182
배경: 커뮤니티 개발자가 MTT S5000에서 외부 MUSA 백엔드를 통합할 때 여러 공식 연산자가 「등록된 외부 생성자가 호출되기 전에 실패한다」고 보고했다——세 가지 장애물: CUDA 전용 입력 검증, 제로 입력을 거부하는 외부 호출, 외부 위임 전의 CUDA 디바이스 조회(결함 티켓 #2164; #2165, #2166은 테스트 경로와 빌더 등록 문제를 별도 기록).
모니터링 기간 내 대응:
- #2179 (+797/−256): 연산자 계층의 약 38곳 디바이스 종류 검사(RoPE, Dropout, Mamba/SSD, DeltaNet, GLA, NSA, Engram, MoE, FFT, FP8 양자화, TopK 등)를 철거하고, 트리 내 커널이
Kernel._require_cuda로 텐서 수준에서 디바이스를 선언하도록 변경.check_tensor_shape는 형상 검사를 유지하고 디바이스 검사를 제거. pre-commit 훅op-device-kind-lint를 신설하여 디바이스 종류 검사의 재유입을 차단. 지연 빌드 호출 기록을 위해make_call형식 매개변수를 도입. 제로 입력과 복합 연산자 두 부류는 설계 결정이 필요하여 후속 작업으로 분류. - #2182 (issue):
BuildKernel프로토콜이 호출 가능 객체만 약속하는데 연산자 계층은 그 이상을 가정한다고 지적——트리 내 커널 속성 읽기, 단일 항목 다중 커널 언패킹, 44개 연산자 클래스가target=매개변수를 받지 않는 등의 상황이 존재. 프로토콜이 표현할 수 없는 복합 항목은 확장이 필요. - #2181, #2183: 트리 내 테스트를 BUILTIN 경로로 고정하고
iter_kernels산출을 명확히 하며, 이항 자동 튜닝 테스트를 트리 내 커널로 한정하여 상기 거버넌스에 호응.
판독: 외부 백엔드가 「등록 가능」에서 「스케줄링 가능」으로 가는 마지막 구간의 길을 닦기 시작했다. 장애물은 외부 측이 실측으로 제시하고, 수정은 유지보수 측이 그룹으로 추진하는, 드문 양방향 협업 리듬이다.
1.8 TileFoundry: 메모리 풋프린트와 재사용 윈도우 병합 (09-23)
날짜: 2026-09-23 출처: #179/#184/#182
- #179(09-24 00:10 병합, +3207/−539, 파일 44개): 두 가지 문제를 이어받는다——호출과 함수의 메모리 기록에 「보존 풋프린트 슬롯」은 있지만 고유 주소의 워킹 세트 결과가 없다; 단일 반복의 L2 스냅샷은 재사용된 데이터가 상주하는지 답할 수 없다. 새 분석은 최종 소스 주소를 기준으로 하나의 목표 웨이브 내에서 합집합을 구해 호출/함수 풋프린트를 도출한다; 접근 관계에서 시간적·공간적 재사용 축을 유도하고, 각 버퍼의 상주 윈도우, 전체 버퍼의
holds, 재사용 바이트 수와 대조 캐시 용량에 대한fits결론을 보고한다. 실측 예시: 128×128×64, w12×11, K=16384의 GEMM 벤치마크가b holds=176.00MB fits=no를 보고한다(47.68MB의 L2와 대조)——구체적이고 재계산 가능한 용량 결론이며, 장난감 같은 결과가 아니다. - #184(신규 오픈, #182 수정): 정수
Binary(MUL)렌더링이 범위 접근자를 재진입시켜 무한 재귀를 초래할 수 있다——상향식 차원 접근자로 전환하고, 구간 산술은 비아핀 곱셈에만 사용한다. - #178(분산 HIR 대조 검사, +1825/−34) 종료, 미병합; #172, #168 종료; #177(전송 효율 측정)은 여전히 열려 있음.
1.9 야간 스냅샷: 정확성 1141건 무실패, DeltaNet 장문 프리필 벤치마크 타임아웃 (09-24)
날짜: 2026-09-24 03:01 출처: 스냅샷 커밋/환경 메타데이터
- 스냅샷은 TileOPs 메인 브랜치 커밋
252a1721, 즉 #2163의 병합 지점에 대응하며, 이번 모니터링 기간의 일곱 건 병합을 모두 포함한다; - 정확성: 테스트 1141건, 무실패;
- 벤치마크: 1050건 기록(이전 스냅샷 1046건 대비 4건 증가), 무실패, 그러나 파일 수준 오류 1건 발생——
bench_deltanet.py의 장문 프리필 구성prefill-long-bfloat16이 900초 내 테스트 시작 없이 종료됨(스택 덤프 보존됨). 이 벤치마크 파일은 바로 이번 모니터링 기간에 DeltaNet 연산자가 파이프라인에 들어오면서 함께 편입된 것이다; - 환경은 이전 스냅샷과 동일(H200, CUDA 13.2, SM 1500MHz 고정 주파수, 이미지와 의존성 버전 완비).
판독: 정확성 측은 전부 녹색; 벤치마크 측의 이 타임아웃은 신규 연산자가 「기능 병합」에서 「벤치마크가 감당 가능」하기까지 아직 표준화해야 할 비용이 남아 있음을 시사한다——정체가 테스트 시작 이전에 발생했으므로 컴파일 또는 초기화 단계의 신호이며, 이후 모니터링 기간에 재발 여부를 추적해야 한다.
2. 다중 백엔드 적응(昇腾 / 海光 / 沐曦 / 摩尔线程 등)
2.1 昇腾: mHC 예제 2건 롤백 (09-23)
날짜: 2026-09-23 출처: #1833(#1621 롤백)/#1832(#1633 롤백)
11:26과 11:30에 롤백 2건이 병합됨: 그전에 병합되었던 mhc_pre와 mhc_bwd(Sinkhorn 암시적 켤레 기울기) 두 Ascend NPU 예제를 메인 브랜치에서 철회함. 둘 다 저장소에 들어온 지 3일이 채 되지 않았다. 이 저장소는 최근 연속으로 롤백 동작이 나타나고 있다(09-21에도 문서와 기능 롤백이 있었음), 예제 유형 기여의 진입·이탈 빈도는 추적할 만하다——수용 기준이 엄격해진 것인지 프로세스 마찰인지에 대한 공개 설명은 아직 없다.
2.2 昇腾: 스칼라 GM 저장 경합 수정 방안 제출, 차이 수 0으로 수렴 (09-23)
날짜: 2026-09-23 출처: #1834(#1304 수정)
17:04 신규 오픈(+557/−1, 파일 10개), 두 계층 수정:
- 근본 원인 분석: 동일 GM 버퍼에 혼합 기록이 발생한다 — 배치 복사는 MTE3 DMA 직접 쓰기로, 마지막 열 스칼라
SetValue는 라이트백 캐시를 거쳐 읽기-수정-쓰기 후 지연 라이트백된다. 행 간격이 64바이트의 배수가 아닐 때 인접 행이 캐시 라인을 공유하고, 더티 행 축출이 DMA가 이미 쓴 새 값을 덮어쓴다. 다중 블록 커널에서는 코어 간 경쟁이 발생하는데, 캐시 정리와 동기화 명령이 모두 해당 코어 범위이므로 동기화 명령만으로는 완전히 고칠 수 없다(재현 스크립트 잔여 27%). - 1단계(동일 코어): 동기 삽입 지점에서 “스칼라로 기록된 GM 버퍼”에 대해 MTE3 쓰기 전후에 선택적으로 캐시 정리와 대기를 삽입하고, 동시에 이벤트 번호 할당을 순환 재사용으로 변경한다(템플릿 하드코딩 0번 이벤트와 pass 할당 충돌로 인한 잠재적 데드락 제거). 재현 스크립트 불일치 수 12,967,510 → 3,496,136(73% 감소).
- 2단계(재작성 제거): opt-in pass 추가(기본 비활성화) — “연속 직렬 루프 내 단일 GM 스칼라 쓰기”를 UB 임시 저장 + 단일 DMA burst로 재작성하여 근본적으로 더티 행이 발생하지 않게 한다. 활성화 후 불일치 수 0; 신규 회귀 테스트 2개 통과, 기존 113개 스위트 통과,
gqa_fwd_varlen제로 오버헤드, 양자화 혼합 커널 성능 저하 없음. - 범위: opt-in; 조건부 쓰기, 누적, 산포 등 연속 burst로 재작성할 수 없는 형태는 여전히 코어 간 위험이 있다(플랫폼 수준 제한, 별도 추적 권장); 작성자 환경은 Ascend910 A3 / CANN 9.0.0.
2.3 Ascend: 일일 테스트 2448개 항목 전면 통과 복귀(09-24)
날짜: 2026-09-24 06:11 출처: #1835
새 일일 테스트에서 2448개 항목 전면 통과(100%)를 보고했다. 전날의 워크플로 수준 실패 이슈 #1831은 여전히 열려 있으나, 자동화 이슈는 새 결과로 이어졌으며, 이전 2.1, 2.2의 롤백과 수정 조치가 해당 실패 이슈와 관련이 있는지 저장소는 설명을 제공하지 않았다.
2.4 MLIR Ascend: NPU launcher 메모리 누수 및 스트림 동기화 수정 병합(09-23)
날짜: 2026-09-23 출처: #178
10:50 병합(+215/−92), 세 가지: 첫째, rtMalloc을 torch_npu 스트림 인식 할당 경로로 교체하여 텐서 핸들이 더 이상 누수되지 않는다. 둘째, 작업 큐 발사 통일 — 모든 플랫폼이 동일한 발사 처리를 거치고, 910 전용 경로와 그 마지막 부분 해제를 제거하며, lambda 캡처를 참조에서 값 캡처로 변경(지연 실행 가능성 처리). 셋째, 스트림 미스매치 수정 — 발사 스트림이 호출 시점에 해석되어(triton-ascend 전략 정렬) 더 이상 빌드 시점에 캡처되지 않는다. 별도로 보고 강화 이슈 #192는 닫힘, 미병합; A5 테스트 동기화 이슈 #130은 계속 열려 있다.
2.5 Hygon: 예제 지원 병합, 37개 파일 HCU 매트릭스 코어 활성화(09-23)
날짜: 2026-09-23 출처: #11
15:57 병합(+1104/−130, 37개 파일): 자동 튜닝 및 LDS 설정 적응, 커널 레이아웃 충돌 해결, GEMM을 HCU 매트릭스 코어 내장으로 변경, 회귀 커버리지 보강. 이전 모니터링 기간의 “예제 지원 PR 32개 파일 추가” 조치를 이어받아, Hygon 라인의 예제 수준 구현이 병합 완료되었다.
2.6 MetaX와 Moore Threads: 저장소 푸시 없음, MUSA 거버넌스 TileOPs 큐로 전환(09-24 확인)
날짜: 2026-09-24 출처: tilelang-metax/tilelang-musa
두 저장소 모두 모니터링 기간 내 푸시가 없었다(최근 각각 09-21과 09-17). 이와 관련된 방법론과 프로토콜 거버넌스는 TileOPs의 결함 이슈와 새 PR로 전환되었다(1.7 참조).
3. 생태계와 채택자
3.1 채택자: TileKernels와 FlashQLA 모니터링 기간 내 푸시 없음(09-24 확인)
날짜: 2026-09-24 출처: TileKernels 저장소/FlashQLA 저장소
DeepSeek TileKernels의 최근 푸시는 여전히 04-23; Alibaba FlashQLA는 09-18. 두 저장소 모두 모니터링 기간 내 새 커밋이 없다.
3.2 커뮤니티 프로젝트: TPU 검증 저장소와 MetaX 트레이닝 캠프 저장소 신규 커밋 없음(09-24 확인)
날짜: 2026-09-24 출처: ChunkScan-2-TileLang-4-TPU/metax-operator-training
BM1690 멀티코어 검증 저장소의 최근 커밋은 09-22, MetaX 트레이닝 캠프 자료 저장소의 최근 커밋은 09-22로, 모니터링 기간 내 신규 추가는 없었습니다. 이외에 커뮤니티 튜토리얼 저장소에서 모니터링 기간 내 한 차례 푸시가 발생했으나, 확인 결과 메인 브랜치 외의 차트 자동화 브랜치 작업으로 내용 업데이트는 아니었습니다. 개인 실험류 신규 저장소(커밋 3건)는 수록 기준에 미달했습니다.
4. 커뮤니티, 튜토리얼 및 활동
4.1 문서 사이트: 메인 저장소 문서 사이트 정례 재생성 (09-23)
날짜: 2026-09-23 출처: tilelang.github.io 커밋
14:10에 정례적인 「Update docs」 커밋이 있었으며, 내용은 tilelang/language/eager/(ast, builder)의 autoapi 페이지 재생성(+29/−5, 7개 파일)으로, 코드 저장소 자동 동기화에 해당합니다. TileOPs 문서 사이트는 08:11에 한 차례 배포 작업이 있었으나, 해당 기본 브랜치에는 내용 변경이 없었습니다.
4.2 미디어 및 학술 측: Google News 히트 없음, arXiv 신규 프리프린트 없음 (09-24 확인)
날짜: 2026-09-24 출처: Google News/Hacker News/arXiv
중영문 여러 검색 조합에서 모니터링 기간 내 히트가 없었습니다. Hacker News에는 주제 관련 항목이 없었고, arXiv 주제 검색의 최신 논문은 여전히 07-24의 TileSight 논문입니다(이번 모니터링 기간에 해당 코드가 조직 내에서 오픈소스화되었으며, 이는 오늘의 주요 사항을 참조). 모니터링 기간 내 신규 프리프린트는 없었습니다.
4.3 버전 리듬: 신규 릴리스 없음, 메인 저장소 v0.1.14 22일 경과 (09-24)
날짜: 2026-09-24 출처: tilelang 릴리스 페이지
메인 저장소의 최신 태그는 여전히 v0.1.14(09-02 릴리스)로, 22일이 경과하여 이전 두 차례 릴리스 간격(약 30일)에 근접하고 있습니다. TileOPs는 여전히 릴리스 기록이 없으며, Ascend, MLIR Ascend, Moore Threads 저장소의 태그는 09-09에서 09-11 선에 머물러 있고, TileFoundry의 최신 릴리스는 v0.0.2(09-10)입니다. 모니터링 기간 내 전체 조직에서 신규 릴리스나 신규 태그는 전혀 없었습니다.
5. 트렌드 관찰
5.1 분석 계층의 형성: 논문과 커뮤니티 문서에서 공식 코드 저장소로
TileSight의 3단계 안착(07-24 논문 → 09-18 커뮤니티 문서 저장소 → 09-23 공식 코드 저장소)은 TileLang을 둘러싼 성능 설명 가능성이 「개인적 단서」에서 「조직 프로젝트」로 격상되고 있음을 보여줍니다. 이는 TileFoundry(컴파일 내 분석, 이번 모니터링 기간에 캐시 용량 결론을 재계산 가능하게 만듦)와 방향이 교차합니다. 생태계에 대한 함의: 연산자 라이브러리와 런타임 외에도 분석 도구의 완성도가 TileLang이 동종 툴체인 대비 차별화되는 자산이 되고 있으며, TileSight의 하드웨어 프로파일이 AMD와 Intel 외장 GPU를 커버하는 것도 멀티 백엔드 서사에 모델링 기반을 제공합니다.
5.2 TileOPs 성능 시즌의 마무리와 재출발
하루에 7건 머지에 3건 신규 오픈은 TileOPs의 성능 시즌이 끝난 것이 아니라, 첫 번째 물결인 「연산자 등재」에서 두 번째 물결인 「스케줄링과 구성의 세밀한 다듬기」로 전환되었음을 의미합니다. varlen GQA 3연속은 스케줄링 계획과 지속성에 집중하고, W4A16은 레지스터와 그리드 활용률에 집중합니다. 관찰 지표: 이러한 머지 리듬이 안정화되려면 앞으로도 여러 거래일이 더 지속되어야 하며, 그렇지 않으면 여전히 펄스형 추진에 해당합니다.
5.3 멀티 백엔드 엔지니어링 부채의 표면화
외부 연동 백엔드의 세 가지 블로킹과 프로토콜 공백은 「멀티 백엔드 플러거블」을 비전에서 엔지니어링 세부사항으로 되돌립니다. 장치 종류 검사가 연산자 계층에 흩어져 있고, 빌더 프로토콜은 호출 가능성만 보장하며, 44개 연산자 클래스에 타깃 매개변수가 누락되어 있습니다. 좋은 소식은 모니터링 기간 내에 이미 묶음 단위의 폭탄 해체 작업(한 번에 38곳 검사 제거 및 재발 방지 lint 추가)이 있었다는 점입니다. 외부 연동 측 기준으로, 이 경로의 완성도가 서드파티 백엔드가 현재 주기에 공식 연산자 큐를 통과할 수 있는지를 결정할 것입니다.
5.4 공백과 리스크 포인트
첫째, 메인 저장소의 리뷰 적체가 해소되지 않았습니다. TileIR 백엔드 31개 커밋, 매직 디비전과 기동 불변량이 계속 대기 중이며, 대규모 변경 모니터링 기간과 릴리스 정체(22일)가 겹쳐 있습니다. 둘째, 신규 연산자가 벤치마크에 진입하자마자 긴 프리필 타임아웃이 노출되어, 성능 서사가 벤치마크 수준에서 수용 능력을 보완해야 합니다. 셋째, Ascend 저장소의 「머지—롤백」 리듬이 계속되고 있으며, 예제류 기여의 검수 경로에 대한 공개 설명은 보이지 않습니다. 넷째, 인덱스 경계 수정 건이 당일 종료되었는데, 문제가 여전히 존재하는데도 후속 작업자가 없다면 좁은 인덱스 유형의 경계 동작은 계속 공중에 떠 있는 상태로 남을 것입니다.
부록: 자료 및 확인 설명
출처 확인 표
| 출처 | 검증 결과 |
|---|---|
| tile-ai 조직 (29개 저장소) | 모니터링 기간 내 10개 저장소에 푸시 발생: tilelang, TileOPs, TileOPs-nightly, TileFoundry, TileSight, tilelang-hygon, tilelang-ascend, tilelang-mlir-ascend, tilelang.github.io, TileOPs.github.io |
| 메인 저장소 tilelang | 2건 머지 (#3232, #3246); #3273 신규 오픈; #3272 당일 클로즈; 이슈 2건 신규 오픈 (#3270, #3271); #3247, #3265, #3267, #3243, #3205 등 업데이트 |
| TileOPs | 7건 머지, 9건 신규 오픈, 1건 클로즈; 이슈 1건 신규 오픈 (#2182); MUSA 관련 #2164~#2166 업데이트 |
| TileOPs-nightly | 스냅샷 1건 (11bd1b9c, 252a1721 즉 #2163 머지 지점에 대응): 정확성 1141건 무실패; 벤치마크 1050건, 파일 단위 타임아웃 1건 |
| TileFoundry | 1건 머지 (#179); #184 신규 오픈; 결함 티켓 #182 신규 오픈; #178, #172, #168 클로즈 |
| TileSight | 최초 커밋 (+56675줄, 177개 파일, MIT) |
| tilelang-ascend | 2건 롤백 머지 (#1832, #1833); #1834 신규 오픈; #1829, #1828, #1815 등 업데이트; 데일리 테스트 #1835 전부 통과 |
| tilelang-mlir-ascend | 1건 머지 (#178); #192 클로즈; #130 업데이트 |
| tilelang-hygon | 1건 머지 (#11) |
| MetaX / Moore Threads 저장소 | 모니터링 기간 내 푸시 없음 (최근 09-21 / 09-17) |
| 도입처 (TileKernels, FlashQLA) | 모니터링 기간 내 푸시 없음 (최근 04-23 / 09-18) |
| 커뮤니티 저장소 | 메인 브랜치 신규 없음; 튜토리얼 저장소 푸시는 차트 자동화 브랜치에 해당 |
| Google News / Hacker News / arXiv | 중영문 쿼리 제로 히트; HN 관련 없음; arXiv 신규 프리프린트 없음 |
전체 출처 목록
- [1] TileSight 저장소 — https://github.com/tile-ai/TileSight
- [2] TileSight 최초 커밋 — https://github.com/tile-ai/TileSight/commit/75428c41b7
- [3] TileSight 논문(arXiv:2607.22432) — https://arxiv.org/abs/2607.22432
- [4] 커뮤니티 문서 저장소 tilelang4tilesight-doc — https://github.com/superAngGao/tilelang4tilesight-doc
- [5] 메인 저장소 루프 목표 바인딩 수정(#3232) — https://github.com/tile-ai/tilelang/pull/3232
- [6] 루프 목표 결함 이슈(#3231) — https://github.com/tile-ai/tilelang/issues/3231
- [7] 복사 너비 클램프 수정(#3246) — https://github.com/tile-ai/tilelang/pull/3246
- [8] 복사 너비 결함 이슈(#3007) — https://github.com/tile-ai/tilelang/issues/3007
- [9] 인덱스 경계 수정 PR 당일 종료(#3272) — https://github.com/tile-ai/tilelang/pull/3272
- [10] NaN 전파 결함 이슈(#3270) — https://github.com/tile-ai/tilelang/issues/3270
- [11] NaN dtype 검증(#3273) — https://github.com/tile-ai/tilelang/pull/3273
- [12] 범위 계약 기능 요청(#3271) — https://github.com/tile-ai/tilelang/issues/3271
- [13] NaN 전파 clamp 수정(#3205) — https://github.com/tile-ai/tilelang/pull/3205
- [14] CUDA Tile IR 실행 백엔드(#3247) — https://github.com/tile-ai/tilelang/pull/3247
- [15] 매직 디비전(#3267) — https://github.com/tile-ai/tilelang/pull/3267
- [16] 시작 불변식 정수 싱크(#3265) — https://github.com/tile-ai/tilelang/pull/3265
- [17] RNG 빈 바인딩 거부(#3243) — https://github.com/tile-ai/tilelang/pull/3243
- [18] TileOPs W4A16 사전 패키징 가중치 순서(#2168) — https://github.com/tile-ai/TileOPs/pull/2168
- [19] TileOPs Engram 디코딩 분할(#2173) — https://github.com/tile-ai/TileOPs/pull/2173
- [20] TileOPs varlen GQA 마이그레이션(#2160) — https://github.com/tile-ai/TileOPs/pull/2160
- [21] TileOPs MoE 초과 라우팅(#2169) — https://github.com/tile-ai/TileOPs/pull/2169
- [22] TileOPs Mamba DaCumsum(#2176) — https://github.com/tile-ai/TileOPs/pull/2176
- [23] TileOPs mHC 프로젝션 분할(#2177) — https://github.com/tile-ai/TileOPs/pull/2177
- [24] TileOPs DeltaNet 추론 연산자(#2163) — https://github.com/tile-ai/TileOPs/pull/2163
- [25] TileOPs varlen GQA 탐색 이슈 종료(#2162) — https://github.com/tile-ai/TileOPs/pull/2162
- [26] TileOPs varlen GQA 사전 계획(#2178) — https://github.com/tile-ai/TileOPs/pull/2178
-
[27] TileOPs varlen GQA 스케줄 지속성(#2180) — <https://gith
- [28] TileOPs varlen GQA 지역성 (#2184) — https://github.com/tile-ai/TileOPs/pull/2184
- [29] TileOPs W4A16 긴 K 스트리밍 (#2185) — https://github.com/tile-ai/TileOPs/pull/2185
- [30] TileOPs 외부 백엔드 디바이스 검사 정비 (#2179) — https://github.com/tile-ai/TileOPs/pull/2179
- [31] TileOPs MUSA 차단 목록 (#2164) — https://github.com/tile-ai/TileOPs/issues/2164
- [32] TileOPs MUSA 테스트 경로 (#2165) — https://github.com/tile-ai/TileOPs/issues/2165
- [33] TileOPs MUSA 빌더 등록 (#2166) — https://github.com/tile-ai/TileOPs/issues/2166
- [34] TileOPs 빌더 프로토콜 공백 (#2182) — https://github.com/tile-ai/TileOPs/issues/2182
- [35] TileOPs 자동 튜닝 테스트 범위 (#2181) — https://github.com/tile-ai/TileOPs/pull/2181
- [36] TileOPs 커널 테스트 고정 (#2183) — https://github.com/tile-ai/TileOPs/pull/2183
- [37] TileFoundry 메모리 사용량과 재사용 윈도 (#179) — https://github.com/tile-ai/TileFoundry/pull/179
- [38] TileFoundry 재귀 수정 (#184) — https://github.com/tile-ai/TileFoundry/pull/184
- [39] TileFoundry 재귀 결함 이슈 (#182) — https://github.com/tile-ai/TileFoundry/issues/182
- [40] TileFoundry 분산 HIR 검사 (#178) — https://github.com/tile-ai/TileFoundry/pull/178
- [41] 야간 스냅샷 커밋 (11bd1b9c) — https://github.com/tile-ai/TileOPs-nightly/commit/11bd1b9c1fa9
- [42] 스냅샷 환경 메타데이터 — https://github.com/tile-ai/TileOPs-nightly/blob/snapshots/meta.json
- [43] Ascend mHC 예제 롤백 (#1833) — https://github.com/tile-ai/tilelang-ascend/pull/1833
- [44] Ascend mHC 예제 롤백 (#1832) — https://github.com/tile-ai/tilelang-ascend/pull/1832
- [45] Ascend 스칼라 GM 저장 경쟁 조건 수정 (#1834) — https://github.com/tile-ai/tilelang-ascend/pull/1834
- [46] Ascend 경쟁 조건 결함 이슈 (#1304) — https://github.com/tile-ai/tilelang-ascend/issues/1304
- [47] Ascend 일일 테스트 전부 통과 (#1835) — https://github.com/tile-ai/tilelang-ascend/issues/1835
- [48] Ascend 일일 테스트 실패 이슈 (#1831) — https://github.com/tile-ai/tilelang-ascend/issues/1831
- [49] Ascend 벡터 mask와 행 리덕션 (#1829) — https://github.com/tile-ai/tilelang-ascend/pull/1829
- [50] MLIR Ascend JIT 수정 (#178) — https://github.com/tile-ai/tilelang-mlir-ascend/pull/178
- [51] MLIR Ascend 리포트 개선 종료 (#192) — https://github.com/tile-ai/tilelang-mlir-ascend/pull/192
-
[52] MLIR Ascend A5 테스트 동기화 (#130) — <https://git
- [53] Hygon 예제 지원(#11) — https://github.com/tile-ai/tilelang-hygon/pull/11
- [54] 메인 저장소 문서 사이트 커밋(60942afb22) — https://github.com/tile-ai/tilelang.github.io/commit/60942afb22
- [55] 메인 저장소 릴리스 페이지(v0.1.14) — https://github.com/tile-ai/tilelang/releases
- [56] Google News RSS(중영문 쿼리, 프록시 경유) — https://news.google.com/
- [57] Hacker News 검색 — https://hn.algolia.com/
- [58] arXiv 검색 — https://arxiv.org/