모니터링 기간: 지난 24시간(2026-09-28 07:00 ~ 2026-09-29 07:00, 베이징 시간; 직전 보고는 09-28, 기간이 매끄럽게 이어지고 중복 없음). 출처: GitHub(tile-ai 조직 29개 저장소 푸시 점검, 기간 내 7개 저장소에 푸시 있음: tilelang, TileOPs, TileOPs-nightly, tvm, tilelang-hygon, TileOPs.github.io, tilelang-ascend; TileOPs 14건 병합, 메인 저장소 2건 병합 및 TVM 서브모듈 후속, 야간 스냅샷 1건 무실패; 도입처 FlashQLA 및 커뮤니티 저장소 업데이트 있음), Google News RSS 중영문 다중 쿼리(프록시 경유, 0건), Hacker News, arXiv, 커뮤니티 저장소 점검


이번 호 인덱스

  • 오늘의 중점: TileOPs 양자화 계열이 구현 계층에 먼저 착지——아홉 개 연산자 계층이 하룻밤 사이 병합, 샘플링 계열 여섯 개가 같은 날 대기열 진입(09-28/09-29)
    1. 핵심 프로젝트 진척
      • 1.1 메인 저장소: TVM 꼬리 가드레일 수정——모듈로 나머지 경계 반전이 범위 초과 읽기를 유발할 수 있어, 실제 표적 재현 후 병합(09-28)
      • 1.2 메인 저장소: 기본 단일 구성 빌드에 -O2 추가——lowering 기하평균 1.19배 속도 향상, 라이브러리 크기 절반 감소(09-28)
      • 1.3 메인 저장소 대기열: 신규 5건과 3건 업데이트, 오픈 PR 총 112건(09-28)
      • 1.4 TileOPs: 조용한 오류 커널 집중 수정, 십여 곳의 「결과를 반환하지만 오류를 보고하지 않는」 문제 일괄 처리(09-29 새벽)
      • 1.5 TileOPs: 어텐션 정비 속편——MHA와 GQA 페이지드 디코딩 통합, 역방향 WS 커널 병합(09-28)
      • 1.6 TileOPs: reduction과 norm 일괄 가속 6건(09-28)
      • 1.7 TileOPs: 엔지니어링 2건——소스 코드를 csrc로 이전, 가드 예외 정리(09-28)
      • 1.8 야간 스냅샷: 정확성 1027건, 벤치마크 1335건, 무실패 무오류(09-29 새벽)
    1. 다중 백엔드 어댑테이션(Ascend / MLIR Ascend / MetaX / Hygon / Moore Threads)
      • 2.1 Hygon: 비동기 복사와 캐시 swizzle lowering 개선 리뷰 진입(09-28)
      • 2.2 Ascend: 지난주 병합된 기능이 통째로 롤백, 메인 저장소에 ascend-0930 브랜치 신설(09-28/09-29)
      • 2.3 MetaX / Moore Threads: 공식 저장소 조용, 커뮤니티 측 S5000 성능 도구 업데이트(09-28)
      • 2.4 커뮤니티 측: Sophon BM1690 TPU 파이프라인 어댑테이션 신규 저장소 개설(09-28)
    1. 생태계와 도입처
      • 3.1 도입처: FlashQLA SM100 tcgen05로 이전, prepare_h 실측 1.43배(09-28)
      • 3.2 도입처 점검: TileKernels 푸시 없음, TileFoundry 기간 내 커밋 없음(09-29 점검)
      • 3.3 버전 리듬: v0.1.14 27일 경과, TileRT 릴리스 페이지 5일 지연(09-29)
    1. 커뮤니티, 튜토리얼 및 활동
      • 4.1 커뮤니티 튜토리얼: tilelang-tutorials CPU 예제 업데이트(09-29)
      • 4.2 문서 사이트: TileOPs 문서 사이트 2건과 삭제·병합 동기화(09-28)
      • 4.3 미디어와 학술 측: Google News 0건, arXiv 신규 프리프린트 없음(09-29 점검)
    1. 트렌드 관찰
      • 5.1 계약 우선의 실행기: 24시간 내 spec-only에서 연산자 계층으로
      • 5.2 조용한 오류와 「커널 영역」: 한 차례 거버넌스 집중 부채
      • 5.3 컴파일러 건전성, 업스트림과 연동 시작
      • 5.4 공백과 리스크 포인트
  • 부록: 자료와 점검 설명

오늘의 중점: TileOPs 양자화 계열이 구현 계층에 먼저 착지——아홉 개 연산자 계층이 하룻밤 사이 병합, 샘플링 계열 여섯 개가 같은 날 대기열 진입(09-28/09-29)

날짜: 2026-09-28, 2026-09-29 출처: 양자화 연산자 계층 6개(#2298)/ INT8 역양자화 연산자 계층(#2297)/ 샘플링 연산자 계층(#2299)/ 200 연산자 추적 이슈(#2271)

09-27 심야에 24건의 spec-only 항목과 200 연산자 계획을 개설한 지 24시간도 채 지나지 않아, TileOPs는 「계약」을 하나씩 「연산자 계층」으로 이행하기 시작했으며, 리듬은 다음과 같다:

  • 양자화 계열 6개 선병합(#2298, 09-29 06:54 병합, +798/-78, 16개 파일): INT8 텐서별, 채널별, 블록별 양자화, FP8 블록별 양자화, INT4 그룹별 양자화와 SmoothQuant, 총 6개 연산자 계층(INT8QuantPerTensorFwdOp부터 SmoothQuantFwdOp까지 명명)이 tileops.quantization에 자리 잡음. 각각 kernel_types = {}——호출 시 먼저 생성형 검사를 실행한 뒤 OpNotAvailableError를 던짐(선언됨, 구현 대기). QuantizeCall(rows, cols, dtype, group_size) 신규 추가, 참조 구현은 테스트 파일에서 workloads/quantization.py로 이전, 테스트는 동일한 수학을 호출하도록 변경. 명세에는 엔지니어링 제약도 함께 명시: INT4 그룹화와 GEMM W4A16은 K % 128 == 0을 요구(패킹 순서는 128개 원소 스텝 기준으로 정의), INT4 그룹 의미론을 항목별로 제시(제로 포인트 구간 [0, 15], 스케일은 최소 정규수 하한, torch.ao와 AWQ 방식으로 양자화); vLLM scaled_int8_quant, per_token_group_quant_int8, DeepGEMM per_block_cast_to_fp8와의 차이점을 하나하나 명시적으로 기록.

  • INT8 역양자화 3개 후속(#2297, 09-29 06:20 병합, +431/-29, 11개 파일): INT8 텐서별, 채널별, 블록별 세 가지 역양자화 연산자 계층(INT8DequantPerTensorFwdOp 등 세 개의 FwdOp)이 같은 날 착지, 항목에는 spec-only 유지로 표기. 참조 구현 (q.float() * scale).to(out_dtype)은 torch의 세 가지 dequantize와 비트 단위로 일치; per-block 마지막 블록은 ceil_div(K, 128)의 스케일 형상으로 처리, SGLang 구현과의 차이도 기록.

  • 샘플링 계열 6개 같은 날 대기(#2299, 오픈, +1065/-151, 28개 파일): TopKMask, MinPMask, TopPMask, TopKTopPMask, SamplingFromProbs, ChainSpeculativeSampling의 연산자 계층, 워크로드, 테스트를 한 번에 준비; 참조 구현은 FlashInfer 0.6.16에 정렬(bf16/fp16/fp32 세 단계), 난수는 Philox4x32-10으로 정수 텐서 결정론적 구현(Random123 알려진 답 벡터 정렬); 기존 top-p 참조의 경계 동률 처리도 수정(8행 내 76개 bf16 token 결과 상이).

  • 맥락: #2279에서 제기된 24개 spec-only 항목(양자화 9, 샘플링 6, MLA/KV 7, norm과 선형 어텐션 각 1) 중 양자화 9개는 전부 연산자 계층에 진입, 샘플링 6개는 PR 심사 대기——”계약을 먼저 정하고, 구현을 나중에”가 안정적인 실행 리듬에 진입.

판독: 연산자 계층 선행의 이점은 “인터페이스, 워크로드, 참조 수치, 거부 동작”을 먼저 동결하여 커널 구현이 하나씩 뒤따라와도 외부 계약을 더 이상 바꾸지 않아도 된다는 것; 사용자 입장에서는 OpNotAvailableError가 명확한 능력 경계를 제시. 이번 배치의 연산자 계층은 모두 커널 구현을 포함하지 않으므로 첫 커널 병합 전에는 사용 가능한 성능이 발생하지 않음에 유의; 후속 관전 포인트는 커널 착지 리듬과 K % 128 등 형상 제약이 모델 통합에 미치는 영향.


1. 핵심 프로젝트 진행

1.1 메인 저장소: TVM 테일 가드레일 수정——모듈러 나머지 경계 역전으로 범위 초과 읽기 발생, 실타깃 재현 후 병합(09-28)

날짜: 2026-09-28 출처: #3294/ TVM 측 수정(#77)

  • 문제: 동적 리덕션 B * 192 원소, 128 스레드에서 (192 * B + 127) % 128이 경계 분석에 의해 역전 구간 [127, 63]으로 산출(올바르게는 [63, 127]), tl.Simplify가 이를 근거로 i * 128 + threadIdx.x < B * 192를 항상 참으로 오증명하여 테일 가드레일을 삭제할 수 있음; B = 1일 때 마지막 64 스레드는 본래 두 번째 라운드를 건너뛰어야 하는데, 가드레일이 삭제되면 다음 계층 심지어 마지막 계층 밖까지 읽게 됨——실제로 aux-loss 표시 커널에서 관측됨.
  • 수정: #3294는 3rdparty/tvm 서브모듈을 907a88c879에서 4211874e9e로 전진(해당 경계 수정과 그 TVM 회귀만 포함), 이식 가능한 회귀 케이스 1건 추가(TIR을 직접 구성, B > 0을 가정하지 않음). 검증: transform 관련 테스트 48개 통과, reducer v2 76개 통과, TVM 측 110개 통과(8 xfail); B300에서 aux-loss 재현의 48가지 파라미터 조합 전부 통과.
  • 의의: “컴파일러 건전성 결함 → 실타깃 재현 → 업스트림 수정 → 서브모듈 전진 + 회귀 안전망”의 완전한 폐루프 표본; 동일 서브모듈 저장소(tile-ai/tvm)의 수정 커밋 #77은 “모듈러 나머지 경계가 질서 정연하고 신뢰할 수 있음”을 TVM 코어에 기록.

1.2 메인 저장소: 기본 단일 구성 빌드에 -O2 추가——lowering 기하평균 1.19배 향상, 라이브러리 크기 절반으로 (09-28)

날짜: 2026-09-28 출처: #3191

  • 변경: 명시적 빌드 유형이 없을 때, 단일 구성 CMake 빌드가 TileLang 객체 컴파일에 -O2를 추가; 명시적 Debug/Release와 다중 구성 생성기는 기존대로 유지 (1 파일 +10/-0).
  • 실측 (178개 예제): lowering 총 소요 시간 1548.8 → 1376.0초, 기하평균 1.186배, 중앙값 1.161배; 168/178개 예제 lowering 5% 초과 향상, 5% 초과 회귀 사례 없음; 전체 커널 컴파일 기하평균 1.053배. 부수 효과: libtilelang.so가 43.5 MB에서 18.9 MB로 축소.
  • 배경: 이 커밋은 동시에 #3180의 컴파일러 성능 회귀 케이스를 약 5배 (기하평균) 향상시켰으며, 컴파일 파이프라인의 “기본 매개변수가 수동 매개변수보다 못하다”는 문제가 수렴됨.

1.3 메인 저장소 큐: 신규 5건 및 3건 업데이트, 오픈 PR 112건 집계 (09-28)

날짜: 2026-09-28 출처: 메인 저장소 PR 목록/ #3296/ #3297/ #3299/ #3300/ #3293

  • 모니터링 기간 내 신규 5건 (모두 소규모 수정): #3293은 tl.Simplify에 미사용 바인딩 제거기 추가 (읽기 후 쓰기, 부작용, volatile, 메타데이터 참조 등 회귀 포함); #3296은 bulk TMA 복사의 정렬 및 캐시 힌트 수정 (대응 결함 이슈 #3295); #3297은 uint8 희소 GEMM 피연산자 지원; #3299는 ROCm에서 T.round의 ties-to-even 반올림 수정; #3300은 CUDA int32 popcount 지원 추가.
  • 결함 및 요구사항 측면: 모니터링 기간 내 3건 업데이트——#3295 (bulk TMA 캐시 힌트 컴파일 실패, 공유 메모리 과잉 정렬로 점유율 저하), #3292 (METAL에서 T.copy 기본 coalesced_width 스트라이드 문제), #3298 (apache-tvm-ffi 0.1.13 지원 요청).
  • 큐 온도: 오픈 PR 112건 집계; 이전 기간에서 이어진 큐 (RNG 4건 #3241~#3244, 비동기 스테이징 #3279, TileIR 백엔드 #3247, 매직 디비전 #3267, SIMT im2col #3275)는 모니터링 기간 내 업데이트 없음; 별도로 오래된 PR 1건 (#3187, vec 정수 bitwise_not 크래시 수정)이 모니터링 기간 내 머지 없이 닫힘.

1.4 TileOPs: 조용한 오류 커널 집중 수정, 십여 곳의 “결과를 반환하지만 오류를 보고하지 않음” 일괄 처리 (09-29 새벽)

날짜: 2026-09-28, 2026-09-29 출처: #2291

  • 규모: 단일 커밋 +2456/-1161, 116개 파일, 한 번에 십여 곳의 잘못된 결과를 계산하면서도 오류를 보고하지 않는 커널 수정: MLA 디코딩 테일 헤드 및 빈 캐시, CountNonzero 2^24 초과, FloorDivide/Remainder/Div (floor 및 trunc 시맨틱), MoePermuteAlign 1024 전문가 초과, TopkSelector 오버플로, SSD d_state 샤딩, Conv “same” 홀수 패딩, FP8 밀집 프리필 causal, GLA 샤딩, 정수 평균 누산기; MLA 디코딩은 빈 캐시에서 torch 동작에 따라 0을 반환하도록 변경.
  • 거버넌스 3종 세트: ① SM90 전용 케이스를 @pytest.mark.sm90으로 전환 (26개 함수, 5개 파일), 수동 능력 검사 퇴장——SKIP이 더 이상 SM90에서의 실패를 은폐할 수 없음; ② 커널, 벤치마크 타이밍 및 워밍업 플러그인이 더 이상 환경 변수에서 구성을 가져오지 않음 (소스/워크로드/벤치마크에서 환경 읽기를 금지하는 린트 규칙 추가), 명시적 인수로 전환하고 빌드 식별자에 포함; ③ 커널 상한이 곳곳에 흩어져 있던 것에서 “커널 영역”에서 한 번 선언하는 것으로 수렴, 범위 초과 호출은 “해당 호출을 서비스할 구현 없음”으로 거부——구성, 거부 및 캐시 동작이 이로써 일관되고 재현 가능.
  • 부속: bench_kernel에 이벤트 폴백 스위치 추가; 빈 출력 호출은 빈 반환으로 처리; CUDA가 필요한 케이스에 마커 보완.

1.5 TileOPs: 어텐션 정비 속편——MHA와 GQA 페이지드 디코딩 통합, 역방향 WS 커널 머지 (09-28)

날짜: 2026-09-28 출처: #2296/ #2295/ #2281/ 이슈 #2293

  • 디코드 통합(#2296, +588/-1156): GQADecodePagedKernel이 MHA와 GQA 두 페이지드 디코드 연산자를 동시에 서비스하며, MHADecodePagedKernel은 전체 삭제됨; MHA 측 인터페이스, 매니페스트 항목 및 연산자 카운트는 변경 없음; 부수적으로 GQA가 캐시 밖 비유한 값을 읽을 때의 NaN과 sm_scale=0일 때 마스크 키가 여전히 가중치를 받는 두 가지 문제를 수정. 테스트 노드 5047 → 5048; 외부 벤치마크(H200, device_busy): serving 네 행이 flashinfer 대비 1.34~1.76배.
  • WS 커널 수정 및 확장(#2295, +454/-425): #2273에서 도입된 행별 가드가 네 개의 단일 토큰 행을 최대 20%까지 느리게 했던 것을 전체 블록 단위로 경계 블록만 가드하도록 변경하여 복구; warp 특화 커널이 다중 쿼리 행 서비스를 시작(B*H*S_q*N_kv*D <= 2^27 작업량 제약), 추측 디코딩 시나리오가 25.46마이크로초에서 6.27마이크로초로 감소(FA3의 14.88마이크로초 대비 2.37배), 네 개의 serving 행이 대조군 대비 1.40~1.90배.
  • 역방향 커널(#2281, +806/-486): MHA 역방향이 SM90에서 새로운 영속 warp 특화 커널로 진입, 헤드 차원 128, 128행 키 블록 분할 호출 시 2.08~4.21배 속도 향상; 호출당 시작 수 8 → 3; 파이프라인 내 WGMMA 직렬화와 Q/dO 임시 저장 조기 해제 두 가지 문제 수정; MultiHeadAttentionBwdOp 삭제(GQA 역방향 직서비스 MHA로 병합); 벤치마크 스크립트를 역방향만 계산하도록 변경(이전에는 순방향·역방향 혼합 계산).

1.6 TileOPs: reduction 및 norm 배치 가속 6건(09-28)

날짜: 2026-09-28 출처: #2290/ #2292/ #2289/ #2287/ #2284/ #2286

  • 리덕션 엔진 재구축(#2290, +1436/-1294): 선행 축 prod를 제자리 리덕션으로 변경, 더 이상 입력을 전치하지 않음——[4, 128, 4096](dim=0)이 469마이크로초에서 3.3마이크로초로 감소(torch-compile 3.2마이크로초 대비); 16바이트 스트리밍 로드 헤드 추가(L1/L2 evict-first 캐시 정책); 단일 레지스터 폴딩 행 커널이 sum/mean/amax/amin/prod와 L1/L2/Inf 노름을 동시 서비스, mlp-intermediate 각 행이 28.6~30.1마이크로초에서 24.8~25.1마이크로초로 감소(torch-compile 24.4~25.4 대비).
  • 나머지 5건: #2292 logsumexp가 lane 간 폴딩 분할 통계를 사용하고 torch의 inf 시맨틱 유지; #2289 논리 리덕션이 입력 자체의 바이트 폭에 따라 한 번에 레지스터 폴딩; #2287 InstanceNorm 훈련 모드가 20회 시작에서 1회로 수렴(image-track-stats 27.28 → 2.62마이크로초), 반올림이 torch와 정렬(이전에는 1 ulp 차이); #2284 BatchNorm 역방향이 호출자 레이아웃을 직접 인덱싱(resnet-stage3 15.5 → 4.9마이크로초, 1.86배), split 통계의 블록 초과 누적으로 인한 NaN 수정(형상 예: (3, 5, 300, 301)); #2286 RMSNorm 짧은 행이 블록을 공유하고 레지스터 내에서만 제로 패딩.

1.7 TileOPs: 엔지니어링 2건——소스 코드 csrc로 이전, 가드 예외 정리(09-28)

날짜: 2026-09-28 출처: #2285/ #2288

  • #2285 C++/CUDA 소스 코드를 전부 src/tileops/csrc로 이전(빌드 레이아웃 정규화); #2288 가드 면제 목록을 제거하고 그 과정에서 그 목록이 가리던 문제를 함께 수정—실패 범위가 더 이상 화이트리스트로 희석되지 않음.

1.8 야간 스냅샷: 정확성 1027건, 벤치마크 1335건, 실패 0건 오류 0건 (09-29 새벽)

날짜: 2026-09-29 출처: 스냅샷 커밋 b7f5a1b4bd47/ 스냅샷 환경 메타데이터

  • 모니터링 기간 내 스냅샷 1건(09-29 04:11, run 36462093045; 대응 TileOPs fa8acf71b9, 즉 #2291 머지 지점): 정확성 1027건(스킵 2) 실패 0건 오류 0건; 벤치마크 1335건(38개 스위트) 실패 0건 오류 0건. 환경: H200, CUDA 13.2, torch 2.13, tilelang 0.1.11+cu132.
  • 이전 스냅샷(09-28 새벽, 1093/1318)과 비교: 정확성 카운트 -66, 벤치마크 +17—카운트 변화는 이번 주 여러 테스트 리팩터링 및 면제 정리와 동반되었으며, 두 스냅샷 모두 실패 0건; 추적 기준은 「실패 0건」을 준칙으로 하며, 카운트가 커버리지 증감을 직접 대표하지는 않음.

2. 멀티 백엔드 어댑테이션 (Ascend / MLIR Ascend / MetaX / Hygon / Moore Threads)

2.1 Hygon: 비동기 복사 및 캐시 swizzle lowering 개선 리뷰 진입 (09-28)

날짜: 2026-09-28 출처: hygon PR #13/ 브랜치 커밋 4bf3ac58c4

  • Hygon 라인은 09-24 #12 머지 후 브랜치 개발로 전환: feat/hcu-async-copy-cache-swizzle 브랜치에 신규 커밋(작성자 Teng Huang, 16:29), 비동기 복사 및 캐시 swizzle의 lowering 개선; 대응 PR #13은 같은 날 업데이트되었으며 여전히 열려 있음. Hygon은 이번 기간 국산 백엔드 중 유일하게 코드가 진전된 곳.

2.2 Ascend: 지난주 머지된 기능이 통째로 롤백, 메인 저장소에 ascend-0930 브랜치 신규 추가 (09-28/09-29)

날짜: 2026-09-28, 2026-09-29 출처: 롤백 PR #1841/ 롤백된 기능 #1829/ tilelang 메인 저장소

  • 09:44 통째로 롤백 머지(+3621/-10333, 84개 파일), #1829 철회(09-24 머지된 「컴파일러 관리 AscendC Vector mask 및 FP32 행 리덕션 최적화」, 원래 +10333/-3621)—해당 기능은 머지 4일 후 전체 철회, 공개 기록에 롤백 사유 미첨부.
  • 또한: 메인 저장소 09-29 새벽에 ascend-0930 브랜치 신규 생성(작성자 LeiWang1999)—Ascend 관련 개발 동향, 관찰 항목으로 등록.

2.3 MetaX / Moore Threads: 공식 저장소 조용, 커뮤니티 측 S5000 성능 도구 업데이트 (09-28)

날짜: 2026-09-28 출처: tilelang-metax/ tilelang-musa/ Tilelang_musa 커뮤니티 저장소

  • MetaX(최근 푸시 09-24), Moore Threads(09-17) 공식 저장소는 모니터링 기간 내 푸시 없음. 커뮤니티 측 Moore Threads 방향에 움직임 있음: Rankf/Tilelang_musa가 TileSight와 TileLang-MUSA 소스 코드를 정리하고 생성물 제거(09-28 15:33); 자체 설명은 「DeepStack 엔진 기반 MTT S5000 연산자급 성능 분석 프레임워크」로, 수동 연산자 최적화와 Agent 연산자 평가 두 가지 시나리오를 지원하며, P0~P7 캘리브레이션 문서 30편, 스크립트 64개, 벤치마크 24개 포함.

2.4 커뮤니티 측: Sophon BM1690 TPU 파이프라인 어댑테이션 신규 저장소 개설 (09-28)

날짜: 2026-09-28 출처: tilelang-tpu-bm1690-pipelines/ 마이그레이션 및 검증 설명

  • 신규 저장소(09-28 생성, 모니터링 기간 내 8건 커밋): 기존 tilelang-tpu 개발 기반 위에서 SOPHGO BM1690 / SG2260E를 위한 여섯 종류 연산자(Elementwise, RMSNorm, RoPE, SwiGLU, Matmul, FlashAttention)의 파이프라인 버전을 구축; BM1690 8코어 TPU-Kernel과 SG2260E의 RV Tensor 두 가지 프로그래밍 모델을 지원하며, 컴파일, CModel 및 PCIe 실행은 통합 PPL 1.7 툴체인을 사용한다.
  • 방법론이 주목할 만하다: CModel은 수치 동작만 검증하며, 「CModel의 월클록 시간은 BM1690 성능이 아니다」라고 명시적으로 기재되어 있다; 각 단계는 통제된 러너(프로세스 수, 120초 타임아웃, 4096 MiB 메모리 상한 제약)로 증거를 산출한다; 모니터링 기간 내 커밋은 FP16 matmul 1024³ CModel 검증과 각 연산자 파이프라인화(SSA 안전 중첩 루프, 이중 버퍼 디스크립터) 등을 포함하며, 보드 실측은 원격 하드웨어 환경이 준비된 후 진행될 예정이다.

3. 생태계 및 채택 측

3.1 채택 측: FlashQLA, SM100 tcgen05로 마이그레이션, prepare_h 실측 1.43배 (09-28)

날짜: 2026-09-28 출처: PR #42/ FlashQLA 저장소

  • Qwen의 FlashQLA(TileLang 기반 GDN 선형 어텐션 커널 라이브러리)가 Blackwell 데이터센터 등급을 겨냥한 최적화를 머지했다: prepare_h의 CP 상태 전이 재귀(M, Z)를 컨슈머 그룹 T.gemm에서 MMA warp의 tcgen05 파이프라인으로 이전하고, M을 TMEM에 상주시켰다; 레지스터 상한을 168/160/160/24에서 152/104/104/152로 재구성했다; store_h=False일 때 동기화와 좌측 상태 절반을 한 박자 앞당겨 발행한다.
  • 실측(B200, CP 활성 행 24개): prepare_h 지연 153.8 → 107.5 마이크로초(1.43배, -30.1%); 정확성 게이트 48/48 특화 비트 단위 일치, 전방 통합 15/15 및 42/42 행 비트 단위 일치. 채택 측은 이미 SM90/103/120 적응에서 SM100 tcgen05 심층 활용으로 진전했다.

3.2 채택 측 점검: TileKernels 푸시 없음, TileFoundry 모니터링 기간 내 커밋 없음 (09-29 점검)

날짜: 2026-09-29 출처: TileKernels/ TileFoundry

  • DeepSeek TileKernels는 여전히 2026-04에 정지해 있다; TileFoundry의 최근 푸시는 09-28 새벽(직전 모니터링 기간, AtomSched 시리즈로 이미 보고됨)이며, 이번 모니터링 기간에는 신규 커밋이 없다.

3.3 버전 리듬: v0.1.14 만 27일 경과, TileRT 릴리스 페이지 5일 지연 (09-29)

날짜: 2026-09-29 출처: tilelang 릴리스 페이지/ TileRT 릴리스 페이지/ TileFoundry 릴리스 페이지

  • 메인 저장소 v0.1.14(09-02)는 만 27일 동안 신규 버전이 없다; TileOPs는 독립 릴리스가 없다; TileRT의 v0.1.6 릴리스 PR은 09-24에 머지되었으나 릴리스 페이지와 태그는 여전히 v0.1.5.post2에 정지해 있다(5일 지연); TileFoundry 최신 버전은 여전히 v0.0.2(09-10)이다.

4. 커뮤니티, 튜토리얼 및 활동

4.1 커뮤니티 튜토리얼: tilelang-tutorials, CPU 예제 업데이트 (09-29)

날짜: 2026-09-29 출처: tilelang-tutorials

  • 커뮤니티 튜토리얼 저장소 easy-tilelang/tilelang-tutorials가 CPU 예제를 업데이트했습니다(09-29 00:17). 해당 저장소에는 00_basic / 01_tvm / 02_tilelang / 03_tilelang_cpu / 04_tilelang_ascend / 05_tilelang_work 여섯 그룹의 노트북이 있으며, 그중 CPU JIT와 Ascend lowering/compile/JIT 예제는 플랫폼 입문에 참고 가치가 있습니다.

4.2 문서 사이트: TileOPs 문서 사이트 2건 및 삭제·병합 동기화(09-28)

날짜: 2026-09-28 출처: 문서 사이트 PR #55/ PR #56

  • 2건: 주석 처리된 __all__에 따라 문서를 생성하고 삭제된 GQA 연산자를 제거(#55); 어텐션 API 페이지에서 삭제된 MultiHeadAttentionBwdOp를 내림(#56) — #2296/#2281의 삭제·병합 작업과 동기화.

4.3 미디어 및 학술 측: Google News 0건, arXiv 신규 프리프린트 없음(09-29 확인)

날짜: 2026-09-29 출처: Google News/ Hacker News/ arXiv

  • Google News RSS 중·영문 여러 쿼리(프록시 경유) 24시간 모니터링 기간 내 가치 있는 항목 0건(수집된 9건의 후보는 모두 GitHub 저장소 자체 또는 무관한 내용); Hacker News 모니터링 기간 항목은 본 주제와 무관; arXiv에서 “tilelang” 검색 시 최신은 여전히 07-24의 TileSight(타일 중심 GPU 성능 모델)이며, 신규 프리프린트는 없음.

5. 동향 관찰

5.1 계약 우선의 실행기: 24시간 내 spec-only에서 연산자 계층까지

어제 24건의 spec-only 항목과 200 연산자 계획을 발표했는데, 오늘 9개(병합)와 샘플링 6개(대기)로 “연산자 계층 + 워크로드 + 참조 수치 + 거부 동작”의 완전한 패키징을 마쳤으며, 경계 시맨틱은 항목별로 vLLM / FlashInfer / DeepGEMM과 대조했습니다. 이는 Manifest 체계가 계약 검증 지점을 파이프라인으로 산출 가능한 수준까지 엔지니어링했음을 보여줍니다. 다음 관찰 지점은 커널 구현이 같은 리듬으로 이행될 수 있는지입니다(이번 배치의 연산자 계층에는 아직 커널이 없음).

5.2 사일런트 오류와 “커널 영역”: 한 차례 거버넌스 집중 부채

#2291은 한 건으로 십여 곳의 silent-wrong을 수정했습니다(MLA tail head부터 정수 평균 누산기까지) — 이런 문제는 가장 은밀합니다: 결과는 틀리지만 오류를 던지지 않고, 테스트는 통과하고, 벤치마크는 정상입니다. “커널 상한이 영역 선언으로 수렴”, “환경 변수가 커널 경로에서 퇴장”, “가드 예외 퇴장”과 함께 보면, TileOPs는 “커널이 어떤 조건에서 올바른가”를 흩어진 코드에서 기계 검증 가능한 선언으로 바꾸고 있습니다. 이는 200 연산자 계획이 외부에 커버리지 약속을 제시할 수 있는 기술적 토대이기도 합니다.

5.3 컴파일러 건전성이 업스트림과 연동되기 시작

#3294의 수정 체인(실타겟 재현 → 서브모듈 저장소 수정 #77 → 서브모듈 전진 + 휴대용 회귀)은 메인 저장소가 “컴파일러가 조용히 시맨틱을 바꾸는” 유형의 결함에 대응하는 경로가 이미 정착되었음을 보여줍니다. TileLang에 의존하는 다운스트림(각 백엔드 fork 포함)에게는 서브모듈 수준 수정의 추적 리듬이 곧 확보하게 될 건전성 수준을 직접 좌우할 것입니다.

5.4 공백과 위험 지점

첫째, 다중 백엔드 라인의 분화: Hygon은 브랜치에서 지속적으로 진화하고, Ascend는 전면 롤백되었으나 설명이 없으며, MetaX와 Moore Threads의 공식 측은 계속 조용합니다(Moore Threads는 이미 12일). 국산 백엔드 진행 격차가 확대되고 있습니다. 둘째, 어텐션 역방향 라인과 디코딩 라인이 같은 날 “삭제·병합”을 완료했지만, 추측 디코딩 등 시나리오는 여전히 FA3 대비 단일 행 0.75배 격차가 있습니다(#2296 벤치마크 표). 셋째, 메인 저장소의 열린 PR은 112건이며, RNG 4건, 비동기 스테이징과 TileIR 등 대형 건은 여러 날 움직이지 않았습니다. 소화 능력과 리뷰 대역폭이 여전히 병목입니다. 넷째, 메인 저장소는 이번 모니터링 기간에 2건 병합, 5건 신규 오픈으로 “열림 많고 병합 적음” 구도가 반전되지 않았습니다.


부록: 자료 및 검증 설명

출처 검증 결과
tile-ai 조직(저장소 29개) 모니터링 기간 내 7개 저장소에 푸시 발생: tilelang, TileOPs, TileOPs-nightly, tvm, tilelang-hygon, TileOPs.github.io, tilelang-ascend
메인 저장소 tilelang 2건 병합(#3294, #3191); 신규 5건(#3293, #3296, #3297, #3299, #3300); 오픈 PR 총 112건; 결함 티켓 #3292, #3295와 요구사항 티켓 #3298이 모니터링 기간 내 업데이트
TileOPs 14건 병합(#2281~#2298 구간); 별도로 #2279, #2283 두 건이 이번 모니터링 기간 시작 후 7~29분 내에 반영 완료(내용은 지난 리포트에 포함되어 중복 설명 생략); 오픈 PR 총 5건(#2172, #2294, #2299, #2300, #2301); 이슈 #2293은 #2296과 함께 종료
tvm(동일 조직 서브모듈 저장소) 1건 병합(#77 모듈러스 나머지 경계 수정, 메인 저장소 #3294와 연동)
TileOPs-nightly 스냅샷 1건 b7f5a1b4bd47: 정확성 1027항목(2건 스킵) 실패 0건 오류 0건; 벤치마크 1335항목 실패 0건 오류 0건
TileOPs.github.io 2건(#55, #56 문서 및 삭제·병합 동기화)
국산 백엔드 5개 저장소 Ascend: 롤백 #1841(#1829 철회); Hygon: 브랜치 커밋 + PR #13 업데이트; MetaX(09-24 이후), Moore Threads(09-17 이후), MLIR Ascend(09-24 이후) 활동 없음
채택사 및 커뮤니티 FlashQLA 병합 #42(SM100 tcgen05); TileKernels 푸시 없음; 커뮤니티 저장소 tilelang-tutorials, Tilelang_musa, bm1690-pipelines 업데이트 있음
Google News / Hacker News / arXiv 중·영문 쿼리 히트 0건; HN은 본 주제와 무관; arXiv 신규 프리프린트 없음(최신은 여전히 07-24 TileSight)

전체 출처 목록