TileLang 데일리 리포트 (2026-09-18)
모니터링 기간: 지난 24시간(2026-09-17 07:00 ~ 2026-09-18 07:00, 베이징 시간). 이전 회차는 시범 운영으로 기간을 09-16 19:23 ~ 09-17 19:23으로 설정했으며, 본 기간과 09-17 낮 부분에서 겹친다. 겹치는 부분에 대해서는 이번 회차에서 상태 설명과 후속 진행만 다루고, 중점은 기간 내 새로 열리거나 새로 병합된 내용에 둔다. 출처: GitHub(tile-ai 조직 28개 저장소의 푸시 시각 전수 점검, 기간 내 9개 저장소에 푸시 발생, 메인 저장소의 기간 내 신규 PR과 결함 티켓을 항목별로 재검토, RNG 결함 분할, GEMM 타입 화이트리스트, CuTeDSL 측 FP4 수정 포함, TileOPs, TileOPs-nightly, tilelang-hygon, tilelang-ascend, tilelang-metax, tilelang-musa의 브랜치, 커밋 및 백포트 브랜치를 항목별로 대조), Google News RSS 중영문 다중 쿼리(프록시 경유), Hacker News, arXiv, 언론 보도(NeoTeo의 DeepSeek 커널 자동화 및 TileKernels 관련 보도)
이번 회차 인덱스
- 오늘의 중점: TileOPs 배치 행렬 곱이 공유 GEMM 템플릿으로 전환, H200에서 최대 1.44배 속도 향상(09-17)
-
- 핵심 프로젝트 진행
- 1.1 메인 저장소 RNG 세 곳 결함 분할 수정: 기본 난수 시퀀스, void 결과 바인딩, 초기화 누락 시 미보고(09-17)
- 1.2 지원하지 않는 GEMM 타입 조합 사전 차단, 더 이상 nvcc의 타입 단언으로 떨어지지 않음(09-17)
- 1.3 CuTeDSL 백엔드 FP4 변환 및 저장 수정, DeepSeek V4 활성화 양자화는 여전히 FP8 단계에서 정체(09-17)
- 1.4 블록 양자화 GEMM의 API 문서와 명령어 수준 변형 출시(09-17)
- 1.5 이전 회차에서 이미 보고된 내용의 상태 설명(09-17)
- 핵심 프로젝트 진행
-
- 멀티 백엔드 적응(어센드 / 메타X / 하이곤 / 무어 스레즈)
- 2.1 어센드: 일일 회귀 1925항목 전부 통과, 연산자 면 추진 지속(09-17/09-18)
- 2.2 하이곤: MLS 주소 재기반화와 비동기 파이프라인 정식 병합, 버전 브랜치로 백포트(09-17)
- 2.3 메타X: 비동기 복사 GEMM 저장소 반영 후 브랜치 유지보수로 전환(09-17)
- 2.4 무어 스레즈: 백포트 브랜치가 MUSA 5.3.0 문서를 담당, 메인 브랜치는 09-11부터 정지(09-17)
- 멀티 백엔드 적응(어센드 / 메타X / 하이곤 / 무어 스레즈)
-
- 생태계와 채택 측
- 3.1 TileOPs 목록화: 복합 연산자, 리소스 및 널 허용 출력이 manifest에 진입(09-17)
- 3.2 TileOPs 문서 사이트가 통합 디스패치와 새로운 컴파일 경계를 반영(09-17)
- 3.3 야간 벤치마크와 정확성 스냅샷: 벤치마크 1039항목 중 1항목 실패, 정확성 1117항목 전부 통과(09-17)
- 3.4 언론: DeepSeek 엔지니어가 AI 커널 작성이 6~12개월 내 본인 작업 수준에 도달할 것으로 예측(09-16/09-17)
- 3.5 채택 측 저장소는 기간 내 조용: TileKernels, FlashQLA, TileRT 모두 푸시 없음
- 생태계와 채택 측
-
- 커뮤니티, 튜토리얼 및 활동
- 4.1 문서 사이트와 API 페이지가 로봇에 의해 재생성(09-17)
- 4.2 학술 및 커뮤니티 측 신규 없음: arXiv와 Hacker News 기간 내 전무(09-17)
- 4.3 버전 리듬: 메인 저장소 최신 태그는 여전히 v0.1.14, TileOPs 릴리스 없음(09-02)
- 커뮤니티, 튜토리얼 및 활동
-
- 트렌드 관찰
- 5.1 메인 저장소의 중심이 「능력 추가」에서 「조용한 오류를 컴파일 시점 실패로 전환」으로 이동
- 5.2 CuTeDSL이 처음으로 업스트림 CUTLASS DSL 버전 진화와의 결합 부상 발생
- 5.3 국산 백엔드 리듬 분화: 어센드 고빈도 반복, 하이곤 마무리, 메타X와 무어 스레즈 유지보수 전환
- 5.4 TileOPs는 속도 향상과 동시에 계약을 세우며, 계약을 갖춘 연산자 계층으로 진화
- 5.5 본 기간의 공백과 리스크 지점
- 트렌드 관찰
오늘의 중점: TileOPs 배치 행렬 곱이 공유 GEMM 템플릿으로 전환, H200에서 최대 1.44배 속도 향상
날짜: 2026-09-17 출처: TileOPs #2148 배치 행렬 곱(BMM)이 공유 GEMM 템플릿으로 전환
본 기간 가장 큰 변경은 언어 본체가 아닌 연산자 라이브러리에 있다: TileOPs가 배치 행렬 곱 순전파 연산자(BmmFwdOp, torch.bmm 대응)의 커널을 자체 구현에서 공유 GEMM 템플릿의 배치 처리 형태(GemmTemplate(BATCHED) 및 그로부터 파생된 배치 처리 커널)로 교체했으며, 변경은 michaelwithu가 제출하고 유지보수자 lcy-seso가 병합했으며 총 6개의 커밋으로 이루어졌다.
작성자가 PR에서 제시한 실측 데이터(NVIDIA H200, CUDA 13.2, PyTorch 2.13.0, TileLang 0.1.12 환경)에 따르면, 이득은 중대형 형상에 집중된다:
| 형태 (B,M,N,K) | 유형 | 구버전 (밀리초) | 신버전 (밀리초) | 구버전 대비 | torch-cublas 대비 | 신버전 연산 성능 |
|---|---|---|---|---|---|---|
| (8, 2048, 2048, 2048) | bfloat16 | 0.2905 | 0.2023 | 1.437배 | 1.007배 | 679.6 TFLOPS |
| (4, 4096, 4096, 4096) | bfloat16 | 1.0413 | 0.7451 | 1.398배 | 1.034배 | 737.9 TFLOPS |
| (128, 512, 512, 2048) | bfloat16 | 0.2942 | 0.2110 | 1.394배 | 1.021배 | 651.3 TFLOPS |
| (8, 1024, 1024, 1024) | float16 | 0.0410 | 0.0304 | 1.351배 | 1.021배 | 566.0 TFLOPS |
| (16, 512, 512, 512) | float16 | 0.0132 | 0.0118 | 1.110배 | 1.008배 | 362.3 TFLOPS |
| (64, 128, 2048, 128) | float16 | 0.0228 | 0.0199 | 1.146배 | 1.063배 | 216.1 TFLOPS |
| (32, 256, 256, 256) | bfloat16 | 0.0064 | 0.0065 | 0.985배 | 1.108배 | 166.1 TFLOPS |
해석은 세 가지다. 첫째, 신버전은 15개 사례에서 torch-cublas 대비 모두 뒤지지 않으며(1.007~1.185배), 작은 형태(8×128×128×128, 32×256×256×256, 64×128×128×2048)는 거의 동등하다. 둘째, 유일한 퇴행 항목은 (32, 256, 256, 256)의 bfloat16으로 0.985배인데, 이는 작은 형태에서 템플릿 오버헤드가 상쇄되지 않은 경계 상황이다. 셋째, 배치 처리를 공유 템플릿으로 통일한 뒤에는 어텐션과 멀티헤드 구조 같은 공통 기반을 한 곳에서만 유지보수하면 되므로, 이후 배치 연산자 최적화를 개별적으로 복제할 필요가 없다.
속도 개선과 같은 배치로 병합된 5개의 부수 수정도 있는데, 작성 방식은 모두 “오류를 생성 시점이나 측정 시점에 드러내기”다. MoE 워크스페이스 검증을 생성 시점 안전으로 변경, 배치 행렬 곱 템플릿을 실제로 기동된 tile 기준으로 카운트, H200 디바이스 판정과 디바이스 이름 대소문자 정규화, 어텐션 커널의 grid를 보유 디바이스에 맞게 채우기 등이다. 이러한 동반 변경은 공유 템플릿이 여러 연산자에서 재사용될 때 디바이스 판정과 리소스 카운트의 견고성이 새로운 공통 과제가 되었음을 보여준다.
1. 핵심 프로젝트 진행 상황
모니터링 기간 개요: tile-ai 조직의 28개 저장소 중 모니터링 기간 내 9개에 푸시가 있었지만, 메인 저장소 기본 브랜치의 마지막 커밋은 여전히 09-17 09:57의 브랜치 파라미터 타입 매핑 수정이다. 즉 모니터링 기간 후반부(베이징 시간 09-17 20:00 이후)에는 메인 저장소에 새로운 병합이 없었고, 활동은 “이미 열린 PR의 리뷰와 결함 분리”에 집중되었다. 모니터링 기간 내 메인 저장소에 새로 열린 6개의 PR과 1개의 결함 이슈가 있으며, 모두 미병합 상태다.
1.1 메인 저장소 RNG 세 곳 결함 분리 수정: 기본 난수 시퀀스, void 결과 바인딩, 초기화 누락 미보고 (09-17)
날짜: 2026-09-17 출처: #3242 기본 시퀀스를 전체 기동 차원에서 도출하도록 변경/#3243 void 결과 바인딩 거부/#3244 미초기화 상태에서의 값 읽기를 명확한 진단으로 변경
CUDA 측 난수 인터페이스의 세 결함이 세 개의 독립 PR로 분리되었다(동일 작성자가 제출, 전신 #3239는 종료 후 분리로 변경). 세 곳 모두 “타입상으로는 컴파일되지만 의미상 오류”인 조용한 문제에 속한다.
첫째, 난수 상태 초기화 시 시퀀스 번호를 지정하지 않으면 스레드 블록 내 x 차원과 그리드의 x 차원만으로 기본 시퀀스를 도출하여, 2차원 이상 스레드 블록에서 y/z 좌표만 다른 스레드가 동일한 난수 부분 시퀀스를 공유해 추출된 난수가 바이트 단위로 완전히 동일해진다. 수정은 행 우선 순서로 모든 기동된 차원을 기본 시퀀스에 반영하도록 변경했으며, 1차원 상황의 기존 값은 그대로 유지된다(#3242, 4개의 신규 테스트 동반, 2차원 스레드 블록, 2차원 그리드, 1차원 호환성, 명시적 시퀀스 번호 대조를 커버).
둘째, 난수 초기화 자체는 순수 부수 효과 내장이지만, 프런트엔드가 “반환값이 있음” 방식으로 기록하여 문서대로 작성하면 결과 바인딩 시 void state = ;가 생성되어 의미 오류가 nvcc의 “불완전 타입” 컴파일 오류로 바뀐다. 수정은 프런트엔드에서 값 없는 표현식 바인딩을 거부하고, 보고 시 변수명과 문제가 된 표현식을 함께 제공한다(#3243).
셋째, 함수에서 한 번도 초기화하지 않고 바로 난수를 추출하면 빈 curand 호출이 생성되어 마찬가지로 nvcc 구문 오류 형태로 나타난다. 수정은 함수 수준 사전 스캔에서 “초기화 여부”와 “난수 스트림 소비 여부”를 기록하여 하나라도 빠지면 TileLang 자체 오류를 보고한다. 작성자는 검사가 함수 수준이며 제어 흐름에 민감하지 않다고 명확히 밝혔다. 실행 시점 분기 내 초기화도 여전히 초기화된 것으로 간주하여 확정 할당 분석으로 발전하는 것을 피한다(#3244).
세 가지를 함께 읽으면, 메인 저장소가 처리하고 있는 한 종류의 시스템적 문제를 알 수 있다: 프런트엔드 진단의 부재로 인해 의미 오류가 하위 컴파일러에서 난해한 형태로 나타나는 것이다.
1.2 지원되지 않는 GEMM 타입 조합을 사전에 차단하고, 더 이상 nvcc의 타입 단언으로 흘러가지 않음 (09-17)
날짜: 2026-09-17 출처: tilelang #3245 CUDA 코드 생성 전에 지원되지 않는 GEMM 타입 조합을 거부
일부 행렬 곱 연산자 타입 조합(예: bfloat16 곱하기 bfloat16, 출력 float16)은 이전에 프런트엔드에서 받아들여졌고 nvcc 단계에서야 불투명한 정적 단언으로 실패했다. 이 PR은 Ampere/Ada 세대의 mma.sync 경로에 대해 명시적 타입 화이트리스트를 구축하고, 프런트엔드 진입점과 C++ 명령 선택 두 곳에서 검증하며, 지원되지 않는 조합은 코드 생성 전에 거부되고 명확한 메시지를 제공한다; 지원되는 조합과 비 Ampere 대상은 영향을 받지 않으며, 1개의 부정 및 3개의 긍정 회귀 테스트가 첨부되어 있다. 이는 이번 기간 메인 저장소의 두 번째 「조용한 오류를 명시적 실패로 앞당기는」 라인이다.
1.3 CuTeDSL 백엔드 FP4 변환 및 저장 수정, DeepSeek V4 활성화 양자화는 여전히 FP8 단계에서 막힘 (09-17)
날짜: 2026-09-17 출처: 결함 티켓 #3240 / 수정 #3241
모니터링 기간 내 가장 주목할 만한 위험 항목은 CuTeDSL 백엔드(CUTLASS DSL 원시 연산을 사용하며 CUDA 코드를 생성하지 않는 백엔드)에서 나타났다. 결함 티켓은 다음과 같이 기록한다: DeepSeek V4 예제의 활성화 양자화 커널이 이 백엔드에서 작동하지 않는다. 근본 원인은 버전 결합이다—변환 보조 함수가 여전히 구식 벡터 요소 가져오기와 요소 삽입 연산을 사용하고 있는데, nvidia-cutlass-dsl 4.7은 이 두 연산의 이름을 바꾸었기 때문에 모든 FP4 타입 변환이 MLIR 속성 오류를 던진다; 같은 체인 상에 FP8 대상 타입 불일치도 한 곳 있다.
수정 PR은 FP4 변환을 새 버전 MLIR 인터페이스로 바꾼 후, FP4 활성화 양자화 경로는 해당 백엔드를 지정하면 컴파일되고 통과할 수 있으며, FP8 대상 타입 불일치도 함께 수정되었다; 그러나 조합 사용 사례는 여전히 실패한다—FP8 단계에서 독립적인 libNVVM 컴파일 실패에 부딪히기 때문에, 이 사용 사례는 아직 알려진 실패 목록에서 제거할 수 없다. 결함 티켓에는 또 하나 기록할 만한 발견이 있다: 해당 백엔드의 실제 활성화 방식(환경 변수를 통해 대상 지정)은 저장소에서 예제 테스트의 픽스처와 두 곳의 파이프라인 조각만 읽을 뿐, 라이브러리 본체는 이 변수를 읽지 않는다는 것이다. 이는 이 경로의 테스트 커버리지가 라이브러리 계층을 우회하여 구축되었음을 보여준다.
동시에 지적할 점은, 이 절이 대응하는 것은 09-17의 실제 활동(오전과 저녁에 집중)이며 이전 기간의 시간 창과 겹친다는 것이다; 이번 기간에 이를 별도로 다루는 이유는 그것이「결함이 기록됨」에서「결함이 절반 수정되고 나머지 부분이 명확히 규정됨」으로 진전되었기 때문이다.
1.4 블록 양자화 GEMM의 API 문서와 명령 수준 변형 출시 (09-17)
날짜: 2026-09-17 출처: tilelang.github.io 커밋 Update docs
문서 사이트가 로봇에 의해 재생성되었으며(387개 파일), 지난 기간에 메인 저장소로 병합된 블록 양자화 GEMM을 공개 API 페이지로 끌어올렸다: CUDA 방언 아래 블록 양자화 GEMM의 전체 시그니처 설명(스케일 팩터를 일급 입력으로, SM100에서 완료 배리어 요구, 듀얼 CTA 모드에서 클러스터 차원 구성 요구, SM120은 프래그먼트 누적의 동기 경로 사용)이 추가되었고, 세 가지 명령 수준 명시적 변형—Hopper의 wgmma 명시적 비동기 버전, Blackwell의 tcgen05 명시적 비동기 버전, 그리고 둘에 대응하는 블록 양자화 버전—과 하나의 스케일 레이아웃 구성 진입점이 새로 나열되었다. 문서는 동시에 동작 규약을 「지원되지 않는 조합은 컴파일 실패하며, 스케일 팩터를 버리지 않는다」로 못박았다. 이는 1.2의 지향과 일치한다: 새로운 능력을 추가하면서 동시에 실패 모드를 문서에 기록한다.
1.5 이전 기간에 이미 보고된 내용의 상태 설명 (09-17)
다음 내용은 이전 기간에 이미 보고되었으며, 모니터링 기간 내 의미 변화가 없고 현재 상태만 기록한다: 메인 저장소 블록 양자화 GEMM과 그 백엔드 선택기(#3237), 목적 주소에 따른 원자 벡터 너비 계획의 성능 보완(#3238), 배치 처리 매개변수 타입 매핑 보완(#3229); TileOPs의 MoE 인덱스 소형 라우팅 전문가 경로(#2141)와 커널 선택, 빌드 디스패치 리팩터링(#2146); Ascend 측 NSA 전방향과 가변 길이 연산자, 동적 양자화와 RMSNorm 융합 예제; MetaX 비동기 복사 GEMM(#156)과 그 테스트 수정(#157). 위 십여 항목이 이 모니터링 기간의 기존 내용을 구성하며, 이번 기간에는 더 이상 반복해서 다루지 않는다.
2. 멀티 백엔드 적응 (Ascend / MetaX / Hygon / Moore Threads)
모니터링 기간 개요: 네 곳의 국산 및 서드파티 백엔드 모두 모니터링 기간 내 동작이 있었지만 성격이 다르다—Ascend는 「고빈도 연산자 보완 + 매일 회귀」로 최고활동량를 유지하고, Hygon은 한 차례 큰 백엔드 변경 병합과 백포트를 완료했으며, MetaX와 Moore Threads의 중심은 이미 버전 브랜치와 문서 유지보수로 옮겨졌다.
2.1 Ascend: 매일 회귀 1925개 항목 전부 통과, 연산자 면 추진 지속 (09-17/09-18)
날짜: 2026-09-18 출처: tilelang-ascend 데일리 테스트 리포트 #1811
Ascend 어댑테이션 저장소의 데일리 정기 테스트가 09-18 05:46(베이징 시간)에 리포트를 냈다: 1925개 테스트 전부 통과, 실패 0건, 첨부 파일은 30일간 보관. 이는 이번 모니터링 기간 내 유일한 일자 경계 데이터 포인트로, “업스트림 메인 저장소가 연속으로 새 연산자를 병합한 후에도 Ascend 측 회귀가 여전히 올그린을 유지”한다는 증거로 삼을 수 있다. 모니터링 기간 내 해당 저장소에는 4건의 커밋(NSA 순전파, NSA 순전파 가변 길이, 동적 양자화 예시, RMSNorm 동적 양자화 융합 예시)이 있었으며, 모두 09-17 오전에 있었고 이전 기간에 이미 보고된 내용이다. 모니터링 기간 후반부에 해당 저장소에는 새 커밋이 없었다.
2.2 Hygon: MLS 주소 재기반화와 비동기 파이프라인 정식 병합, 그리고 버전 브랜치로 백포트(09-17)
날짜: 2026-09-17 출처: tilelang-hygon #10 버퍼 저장소 재기반화 및 비동기 복사 파이프라인 관리
Hygon 측 변경 한 건이 이번 모니터링 기간에 메인 브랜치에 정식 병합되었다(19개 파일, +540/-31). 내용은 두 가지다: 첫째, 다단계 저장소(MLS)의 주소 재기반화로, 버퍼 연산 재기반화 어노테이션과 이에 대응하는 속성 매핑을 새로 추가하여 백엔드 코드 생성이 블록 인덱스에 따라 버퍼 저장소의 주소를 재기반화할 수 있게 했고, 아울러 이 경로들의 레이아웃 추론을 빨라지게 했다; 둘째, 비동기 선호를 가진 병렬 복사의 제출과 대기를 소프트웨어 파이프라인 플래너가 관리하도록 넘겼다. 변경은 포맷 검사도 동시에 통과했다. 병합 후 해당 저장소는 09-17 20:25(베이징 시간)에 동일 변경을 v0.1.12 버전 브랜치로 백포트했고, 추가로 3차원 슬라이싱 스코프에서의 행렬 곱 레이아웃 수정 한 건을 함께 가져왔으며, 새로 만든 개발 브랜치 feat/hcu-mls-rebase-device-flags에는 파이프라인 관리와 포맷 마무리 커밋 한 건이 더 있다. Hygon은 여전히 네 곳 중 백엔드 코드 변경이 가장 큰 곳이다.
2.3 MetaX: 비동기 복사 GEMM 저장소 반영 후 브랜치 유지보수로 전환(09-17)
날짜: 2026-09-17 출처: tilelang-metax 브랜치 목록
MetaX 측 모니터링 기간 내 새로운 메인 브랜치 커밋은 없으며, 최종 반영점은 여전히 09-17 오전에 병합된 MACA 비동기 복사 행렬 곱 지원과 그 테스트 수정이다(이전 기간에 이미 보고됨). 현재 활동은 버전 브랜치와 테스트 유지보수에 집중되어 있으며, 네 곳 중 변경 폭이 가장 작은 곳이다.
2.4 Moore Threads: 백포트 브랜치가 MUSA 5.3.0 문서를 담당, 메인 브랜치는 09-11부터 정지(09-17)
날짜: 2026-09-17 출처: tilelang-musa 브랜치 목록
Moore Threads 어댑테이션 저장소의 메인 브랜치 마지막 커밋은 09-11이며, 모니터링 기간 내 푸시는 버전 백포트 브랜치에 있었고 내용은 해당 브랜치가 09-17 오전에 고정한 MUSA 5.3.0 문서 커밋이다(이전 기간에 이미 보고됨). 브랜치 목록을 보면 유지보수 방식은 “업스트림 마이너 버전 하나에 접미사가 붙은 백포트 브랜치 하나를 대응”시키는 것이며, 현재 v0.1.12 라인에 머물러 있고 아직 메인 저장소 v0.1.14를 따라가지 않았다.
3. 생태계와 채택 측
3.1 TileOPs 매니페스트화: 복합 연산자, 리소스 및 널 허용 출력이 manifest에 진입(09-17)
날짜: 2026-09-17 출처: TileOPs #2147 매니페스트로 복합 연산자 표현
TileOPs 측은 이번 모니터링 기간에 규모가 가장 큰 변경 한 건(34개 파일, +2552/-370, 아직 병합되지 않음)을 커밋했다. 이는 연산자 매니페스트가 복합 연산자의 내부 구조, 리소스 및 널 허용 출력을 기술할 수 있게 하는 동시에, 이전에 흩어져 있던 중복 유도 로직을 정리한다. 작성자가 나열한 문제 목록은 이 프로젝트의 성숙도 병목을 잘 보여준다: 매니페스트가 이전에는 공개 연산자의 외부 계약만 기술할 수 있었기에 여섯 개의 이미 구현된 복합 연산자가 자신이 복합 연산자임을 선언할 곳이 없었다; 어떤 융합 전문가 연산자는 두 임시 버퍼를 일반 시그니처 입력으로 선언하여, 작업 공간이 “결과 의존적 값”이라는 시맨틱을 얻게 만들었다; 공유 전문가 연산자는 매니페스트 항목도 없고, 벤치마크가 자체적으로 연산량과 바이트 수 계산을 하나 갖고 있으며, 클래스 이름은 정해진 명명 규칙을 위반한다; 빈 값을 반환하는 고정 출력 위치는 이전에 표현할 수 없었다. 이들은 성능 문제가 아니라 인터페이스 계약 문제다 — 오늘의 중점에 있는 배치 행렬 곱의 템플릿 재사용과 함께 보면, TileOPs는 성능과 계약이라는 두 라인을 동시에 보강하고 있다.
3.2 TileOPs 문서 사이트가 통합 분배와 새로운 컴파일 경계를 따라감(09-17)
날짜: 2026-09-17 출처: TileOPs.github.io #51 통합 커널 분배를 따라감
문서 사이트는 이전 기간에 병합된 연산자 분배 리팩터링을 동기화했다: 커널 획득 진입점의 새 시그니처(키와 빌드 방식을 명시적 매개변수로), PyTorch 사용자 정의 연산자 등록과 가짜 구현 등록의 경계, 그리고 연산자 스펙 튜플로부터 생성되는 컴파일 경계 작성법이다. 중영 양쪽 문서를 같은 배치로 수정했고, 작성자는 검증 섹션에 인터페이스 페이지 검사 스크립트, 문서 사이트 빌드 및 전체 테스트의 실행 상황을 기록했다. 연산자 업스트림 변경 후 문서가 당일 따라갔다는 점은 TileOPs의 문서 흐름이 리팩터링을 따라갈 수 있을 만큼 자동화되었음을 보여준다.
3.3 야간 기준 및 정확성 스냅샷: 기준 1039건 중 1건 실패, 정확성 1117건 전부 통과 (09-17)
날짜: 2026-09-17 출처: TileOPs-nightly 스냅샷 커밋/스냅샷 기록 파일
TileOPs의 야간 파이프라인은 이번 모니터링 기간에 「배치 행렬 곱 템플릿화」 커밋(바로 오늘 중점 사항의 병합 결과)에 대한 스냅샷을 생성했으며, 여기에는 기준 결과, 정확성 결과, 환경 메타데이터 한 부가 포함된다. 메타데이터는 재현에 필요한 요소를 전부 고정한다: 구체적 커밋 번호, 컨테이너 이미지를 다이제스트로 기록, GPU 모델과 전력 상한, SM 클럭 설정, 그리고 전체 의존성 버전(해당 기록에서 Cube 버전 13.2, PyTorch 2.13.0, TileLang 0.1.11에 해당 커밋의 빌드 식별자 추가). 두 결과의 판독값:
- 정확성: 1117개 테스트 전부 통과, 2건 건너뜀, 소요 시간 약 219초;
- 기준: 1039개 사례 중 1건 실패, 실패 항목은 GQA 프리필 페이징 커널의 softcap 50 구성 사례로, 오류는 대조 기준 구현의 함수 시그니처 불일치(파라미터 하나 누락)에서 비롯된 것이지 TileOPs 자체 커널의 오류가 아니다—— 이런 유형의 실패는 정확히 「대조 측도 회귀에 포함시켜야 한다」는 필요성을 보여준다.
기준에서 가장 눈에 띄는 것은 희소 어텐션 디코딩 계열 연산자다: 주류 배치 구성에서 TileOPs는 1.86밀리초, 313.98 TFLOPS이고, 대조 구현은 19.88밀리초, 30.79 TFLOPS이며, 다른 두 대조(융합 어텐션 구현 5.61밀리초, 컴파일 버전 PyTorch 16.64밀리초)도 그 뒤를 잇는다; 장문맥 낮은 top-k 변형은 0.50밀리초, 291.55 TFLOPS이고 대조는 20.36밀리초; 다중 헤드 잠재 어텐션 디코딩은 4k 문맥(반정밀도)에서 0.0385밀리초, 대조는 0.3147밀리초.
두 가지 경계를 밝혀둘 필요가 있다: 이 수치들은 야간 파이프라인 단일 실행 기록에만 나타나는 것이지 횡적 평가가 아니다; 그중 희소 어텐션 항목의 대조 구현은 단순 구현(30.79 TFLOPS)에 속하며 프로덕션급 인덱스 어텐션과 직접 비교할 수 없다.
3.4 미디어: DeepSeek 엔지니어, AI가 커널을 작성하는 데 6~12개월이면 본인 작업에 필적할 것으로 예측 (09-16/09-17)
날짜: 2026-09-17 출처: NeoTeo: DeepSeek engineer forecasts AI-written GPU kernels could match his work
이번 모니터링 기간에 검색된 유일한 주제 관련 미디어 보도다. 기사는 DeepSeek 엔지니어 Shengyu Liu의 공개적 판단을 기록한다: 약 1년 동안 AI의 커널 작업에서의 역할이 문서 읽기, 코드 읽기, 결함 수정에서 저수준 그래픽 어셈블리 읽기, 명령어 스톨 분석 및 연산자 최적화로 진전했다; 그는 6~12개월 내에 AI가 작성한 커널이 본인 수준에 도달하거나 초과할 수 있으며, 인간의 역할은 목표 정의, 성능 프로파일링 결과 해석, 산출물 평가로 전환된다고 예측한다. 기사는 동시에 TileLang 생태계를 배경으로 정리한다: TileKernels는 순수하게 TileLang으로 작성된 커널 라이브러리로, 게이팅, 전문가 혼합 라우팅, 양자화, 전치 및 두 가지 유형의 연결 연산자를 포괄하며, 환경 요구사항은 두 세대의 Hopper/Blackwell급 GPU, Python 3.10 이상, PyTorch 2.10 이상, TileLang 0.1.9 이상, CUDA 13.1 이상이다; 그리고 NVIDIA가 이전에 추론 모델로 어텐션 커널을 생성한 검증기 폐루프 실험(1급 수치 정확도 100%, 2급 96%, 단일 폐루프 약 15분)을 「제한된 조건에서 이미 성공적으로 가동됨」의 대조로 인용한다.
위치 설정에서 분명히 해야 할 점: 이는 예측성 보도에 생태계 개관을 더한 것으로, TileLang 본체의 어떤 변경도 포함하지 않으며 위 능력에 대한 독립적 검증도 구성하지 않는다; 수록 이유는 이것이 이번 모니터링 기간에 TileLang을 산업 인재 구조 맥락에서 논의한 유일한 공개 자료이며, 채택자(TileKernels)의 내러티브와 직접적 관련이 있기 때문이다.
3.5 채택자 저장소는 모니터링 기간 내 조용함: TileKernels, FlashQLA, TileRT 모두 푸시 없음
모니터링 기간 내, DeepSeek의 TileKernels(마지막 푸시 04-23), Tongyi Qianwen의 FlashQLA(08-26), 그리고 같은 tile-ai 조직 아래의 TileRT(08-13) 모두 커밋이 없었다. TileRT는 이미 5주 연속 업데이트가 없다. 채택자 측의 정지 상태는 이번 모니터링 기간에 위험 신호를 구성하지 않지만, 오늘의 동향이 전적으로 업스트림 언어 및 연산자 라이브러리 측에서 제공되었음을 의미한다.
4. 커뮤니티, 튜토리얼 및 활동
4.1 문서 사이트와 API 페이지가 봇에 의해 재생성됨 (09-17)
날짜: 2026-09-17 출처: tilelang.github.io 커밋 목록
메인 저장소 문서 사이트는 당일 로봇이 업스트림 코드에 따라 재생성되었으며(387개 파일), 확인 가능한 콘텐츠 변화는 행렬 곱셈 관련 API 페이지에 집중되었다(자세한 내용은 1.4 참조). 이른바 “업스트림 병합, 문서 사이트 당일 추적”의 사슬은 이번 모니터링 기간에 정상 작동했으며, 문서와 코드가 분리되는 현상은 나타나지 않았다.
4.2 학술 및 커뮤니티 측 신규 없음: arXiv 및 Hacker News 모니터링 기간 내 적중 0건 (09-17)
이번 모니터링 기간 내 arXiv에서 TileLang 검색 시 새 논문은 없었으며, 가장 최근 논문은 2026-07-24의 성능 모델링 방향 논문(TileSight)으로 배경 자료에 해당한다. Hacker News에서는 최근 5일간 주제 토론 적중이 없었다. 커뮤니티 측 모니터링 기간 내에는 튜토리얼, 튜토리얼형 저장소 또는 이벤트 공지 유형의 콘텐츠가 없어, 이번 호에서는 증분 항목을 두지 않는다.
4.3 버전 리듬: 메인 저장소 최신 태그는 여전히 v0.1.14, TileOPs 릴리스 없음 (09-02)
메인 저장소 최신 태그는 여전히 v0.1.14(09-02 릴리스)이며, 모니터링 기간 내 새 태그는 없었다. TileOPs는 현재까지 릴리스 기록과 태그가 없으며, 그 외부 상태는 문서 사이트와 야간 스냅샷이 담당한다.
5. 트렌드 관찰
5.1 메인 저장소의 중심이 “능력 추가”에서 “조용한 오류를 컴파일 시점 실패로 전환”으로 이동
이번 모니터링 기간 메인 저장소에서 새로 열린 6개의 PR 중 5개가 동일 계열에 속한다: 난수 기본 시퀀스 오류, void 결과 바인딩, 초기화 누락 시 오류 미보고, 타입 조합이 충족되지 않았는데도 하위 컴파일러에서 폭발, 그리고 서브바이트 부동소수점 변환의 인터페이스 구식화. 공통점은 이전에는 모두 컴파일이 통과되고 결과가 나왔지만, 결과가 틀렸거나 오류 메시지가 무관한 계층을 가리켰다는 것이다. 여기에 디스패치 리팩터링으로 “능력이 없는 백엔드의 조용한 다운그레이드”를 컴파일 실패로 바꾼 것을 더하면, 메인 저장소의 현재 우선순위가 연산자 면을 계속 확장하는 것이 아니라 오류 경계를 언어 계층에 두는 것임을 판단할 수 있다.
5.2 CuTeDSL 최초로 업스트림 CUTLASS DSL 버전 진화와의 결합 손상 발생
CuTeDSL 백엔드는 이번 모니터링 기간에 처음으로 업스트림 버전 이름 변경에 의해 관통되는 문제를 노출했으며, 수정 후에도 FP8 단계가 libNVVM에서 막혀 있다. 이는 구조적 위험을 시사한다: 서드파티 DSL을 기반으로 하는 백엔드의 안정성은 업스트림 인터페이스의 안정성에 달려 있는데, 이러한 백엔드는 현재 라이브러리 계층에서 읽을 수 있는 활성화 방식과 일반 회귀 커버리지가 부족하다. 이 경로에 의존하는 채택자(특히 DeepSeek 계열 양자화 연산자에 관심 있는 팀)에게 이번 모니터링 기간의 진전은 추적할 가치가 있다.
5.3 중국산 백엔드 리듬 분화: Ascend 고빈도 반복, Hygon 마무리, MetaX와 Moore Threads 유지보수 전환
네 곳의 차이는 이번 모니터링 기간에 특히 명확했다: Ascend는 매일 1925개 항목의 회귀에 연산자 보완을 더해 추진을 유지하고, Hygon은 코드 생성과 파이프라인에 걸친 비교적 큰 변경을 완료하고 즉시 릴리스 브랜치로 백포트하여 “병합 및 마무리”에 해당하며, MetaX는 비동기 복사 GEMM 반영 후 테스트와 브랜치 유지보수로 전환했고, Moore Threads의 백포트 브랜치는 v0.1.12 선에서 멈춰 있어 아직 메인 저장소 v0.1.14를 따라가지 못했다. 이로 보건대, 중국산 적응의 전반적 리듬은 여전히 건강하지만, 업스트림 최신 언어 기능을 어디까지 따라갈 수 있는지에서 각 사의 격차가 이미 벌어졌다.
5.4 TileOPs는 속도 향상과 함께 계약을 세우며, 계약을 갖춘 연산자 계층으로 진화
오늘 중점인 배치 행렬 곱셈 속도 향상(최대 1.44배, 공식 라이브러리에 뒤지지 않음)과 목록화된 변경(복합 연산자, 리소스 의미론, 널 허용 출력)이 같은 날 추진되었고, 여기에 야간 파이프라인이 각 커밋에 재현 가능한 스냅샷(커밋 해시, 이미지 다이제스트, 클록 설정)을 남기는 것을 더하면, TileOPs의 위치는 “연산자 구현 묶음”에서 “계약을 갖추고 재현 가능하게 대조되는 연산자 묶음”으로 이동하고 있다. 이는 다운스트림 추론 엔진 통합에 좋은 일이다: 계약이 명확한 것이 연산자 수보다 접속 비용을 더 낮출 수 있다.
5.5 이번 모니터링 기간의 공백과 위험 지점
공백 측면: 메인 저장소 기본 브랜치는 모니터링 기간 후반부에 새 병합이 없었고, 채택자 저장소(TileKernels, FlashQLA, TileRT)는 전부 정지 상태이며, 학술 및 커뮤니티 측은 적중 0건이고, 새 버전 릴리스도 없다. 위험 측면은 두 가지다: 첫째, CuTeDSL 상의 DeepSeek V4 활성화 양자화 FP8 단계가 여전히 뚫리지 않았고, 조합 사용 사례가 아직 알려진 실패 목록에 있다. 둘째, 이번 모니터링 기간 새로 열린 6개의 메인 저장소 PR이 전부 병합되지 않았으며, 난수 3대 결함과 타입 화이트리스트가 모두 리뷰 대기열에 있어 수정 착지 시점이 불확실하다. 이 세 가지가 다음 호에서 중점적으로 확인해야 할 대상이다.
부록: 자료 및 검증 설명
출처 검증 표
| 출처 | 검증 결과 |
|---|---|
| GitHub 조직 푸시 검증 | tile-ai 조직 28개 저장소의 푸시 시간 전수 검증, 모니터링 기간 내 9개 저장소에 푸시 발생: 메인 저장소, 연산자 라이브러리 및 그 사이트와 야간 데이터 저장소, Ascend, MetaX, Hygon, Moore Threads, 문서 사이트 |
| 메인 저장소 커밋 내역 | 기본 브랜치 모니터링 기간 내 2건(모두 이전 회차에 이미 보고된 내용), 마지막 커밋 시각 09-17 09:57; 모니터링 기간 내 신규 PR 6건, 결함 이슈 1건, 모두 병합되지 않음 |
| TileOPs | 모니터링 기간 내 3건 병합(그중 2건은 이전 회차에 이미 보고됨), 신규 PR 1건; 야간 데이터 저장소는 최신 커밋 기준 스냅샷 생성 |
| TileOPs-nightly | snapshots 브랜치 모니터링 기간 내 1회 푸시; 벤치마크 1039건 중 1건 실패(대조 구현 시그니처 문제), 정확성 1117건 전부 통과 |
| tilelang-ascend | 모니터링 기간 내 4건 커밋(이전 회차에 이미 보고됨) 및 일일 테스트 리포트 1건(1925건 전부 통과) |
| tilelang-hygon | 메인 브랜치 1건 병합, 백포트 브랜치 2건, 개발 브랜치 1건; 변경 사항에 주소 재기반화와 비동기 파이프라인 인수 포함 |
| tilelang-metax | 기본 브랜치 모니터링 기간 내 2건(이전 회차에 이미 보고됨), 신규 커밋 없음 |
| tilelang-musa | 기본 브랜치에 모니터링 기간 내 커밋 없음, 푸시는 v0.1.12 백포트 브랜치에 발생; 메인 브랜치 마지막 커밋은 09-11 |
| tilelang-mlir-ascend / TileFoundry / DeepStack / tilescale | 모니터링 기간 내 모두 푸시 없음, 최근 각각 09-16 / 09-15 / 09-15 / 08-25 |
| TileRT | 모니터링 기간 내 푸시 없음, 최근 2026-08-13, 5주 연속 업데이트 없음 |
| 채택측 저장소 TileKernels / FlashQLA | 모니터링 기간 내 푸시 없음, 최근 각각 2026-04-23 / 2026-08-26 |
| Google News RSS(중영문 다중 쿼리) | 주제어, 컴포넌트명, 팀명 조합 쿼리 후 모니터링 기간 내 유효 히트 1건만 존재(NeoTeo 보도), 나머지는 동명 노이즈와 주가 시황 기사로 제외됨 |
| Hacker News | 최근 5일 주제어 히트 제로, 히트 항목은 모두 동명 항목 |
| arXiv | 모니터링 기간 내 신규 논문 없음, 최근 1편은 2026-07-24의 성능 모델링 논문 |
| 문서 사이트와 태그 | 문서 사이트 당일 재생성(387개 파일); 메인 저장소 최신 태그는 여전히 v0.1.14(09-02), TileOPs는 태그와 릴리스 없음 |
전체 출처 목록
- [1] TileLang 메인 저장소 — https://github.com/tile-ai/tilelang
- [2] tilelang #3242 기본 랜덤 시퀀스를 전체 시작 차원에서 도출하도록 변경 — https://github.com/tile-ai/tilelang/pull/3242
- [3] tilelang #3243 void 랜덤 초기화 결과 바인딩 거부 — https://github.com/tile-ai/tilelang/pull/3243
- [4] tilelang #3244 초기화 없이 랜덤 값 가져오기에 대한 명확한 진단 — https://github.com/tile-ai/tilelang/pull/3244
- [5] tilelang #3245 코드 생성 전 지원되지 않는 GEMM 유형 조합 거부 — https://github.com/tile-ai/tilelang/pull/3245
- [6] tilelang #3241 CuTeDSL 서브바이트 부동소수점 변환 및 저장 수정 — https://github.com/tile-ai/tilelang/pull/3241
- [7] tilelang #3240 결함 티켓: DeepSeek V4 활성화 양자화가 CuTeDSL에서 실패 — https://github.com/tile-ai/tilelang/issues/3240
- [8] tilelang #3239 랜덤 값 초기화 시맨틱 강화 (이전 PR, 닫히고 분할로 변경) — https://github.com/tile-ai/tilelang/pull/3239
- [9] tilelang.github.io 문서 재생성 커밋 — https://github.com/tile-ai/tilelang.github.io/commit/2eb0b5e3
- [10] TileOPs 저장소 — https://github.com/tile-ai/TileOPs
- [11] TileOPs #2148 배치 행렬 곱셈을 공유 GEMM 템플릿으로 전환 — https://github.com/tile-ai/TileOPs/pull/2148
- [12] TileOPs #2147 매니페스트로 복합 연산자, 리소스 및 nullable 출력 표현 — https://github.com/tile-ai/TileOPs/pull/2147
- [13] TileOPs 문서 사이트 #51 통합 디스패치 및 컴파일 경계 후속 — https://github.com/tile-ai/TileOPs.github.io/pull/51
- [14] TileOPs 야간 데이터 저장소 스냅샷 커밋 — https://github.com/tile-ai/TileOPs-nightly/commit/66c5f4f61b28478d98765680c36e7f3ceb579747
- [15] TileOPs 야간 스냅샷 환경 메타데이터 — https://github.com/tile-ai/TileOPs-nightly/blob/snapshots/meta.json
- [16] tilelang-ascend 일일 테스트 리포트 #1811 — https://github.com/tile-ai/tilelang-ascend/issues/1811
- [17] tilelang-hygon #10 버퍼 저장소 리베이스 및 비동기 복사 파이프라인 인수 — https://github.com/tile-ai/tilelang-hygon/pull/10
- [18] tilelang-hygon 브랜치 목록 — https://github.com/tile-ai/tilelang-hygon/branches
- [19] tilelang-metax 브랜치 목록 — https://github.com/tile-ai/tilelang-metax/branches
- [20] tilelang-musa 브랜치 목록 — https://github.com/tile-ai/tilelang-musa/branches
- [21] tilelang-mlir-ascend 커밋 목록 — https://github.com/tile-ai/tilelang-mlir-ascend/commits/main
- [22] TileFoundry 커밋 목록 — https://github.com/tile-ai/TileFoundry/commits/main
- [23] TileRT 저장소 — https://github.com/tile-ai/TileRT
- [24] deepseek-ai/TileKernels — https://github.com/deepseek-ai/TileKernels
- [25]
QwenLM/FlashQLA — https://github.com/QwenLM/FlashQLA
- [26] NeoTeo: DeepSeek 엔지니어, AI가 작성한 커널이 자신의 작업 수준에 필적할 수 있다고 예측 — https://www.neoteo.com/en/deepseek-engineer-forecasts-ai-written-gpu-kernels-could-match-his-work
- [27] TileLang 논문 (arXiv:2504.17577) — https://arxiv.org/abs/2504.17577
- [28] TileSight 성능 모델링 논문 (arXiv:2607.22432) — https://arxiv.org/abs/2607.22432
- [29] tilelang 문서 사이트 — https://tilelang.com