数据来源:本机每日日报(8/11 首次运行 14 天窗口 + 8/12)+ GitHub org:flagos-ai 补采(8/6-8/10)。8/11 日报为首跑(窗口 7/28-8/11),已覆盖 8/6-8/10 主体内容,本周报再与补采提交(FlagBLAS、FlagGems-Experimental 8/10 批次等)合并去重。 范围说明:FlagOS 组件含编译器栈(KernelGen、FlagTree、Triton-TLE)、算子库(FlagGems/FlagBLAS/FlagFFT/FlagDNN)、推理插件(PyTorch-Plugin-FL、vllm-plugin-FL)、训练(FlagScale)等;”AI Compiler”部分单列一节。


一、AI Compiler 编译器栈(本周重点)

1.1 智源发布 Triton-TLE 分层语言扩展:FlagTree 编译优化实现百倍级调优加速

日期:2026-08-08 来源:智源社区

智源研究院正式对外介绍 Triton-TLE 分层语言扩展:在 Triton 语言之上增加 TLE 语言扩展层,借助 FlagTree 统一编译器的编译优化实现百倍级自动调优加速。这与 FlagGems 提交中大量 [KMCompiler] 前缀(TLE 扩展实现的纯 Triton 算子)直接对应——TLE 已从论文/提案进入算子库量产阶段,是 FlagOS 编译器栈近两周最重要的公开技术进展。

1.2 FlagTree:AMD TLE 下沉 + Spacemit(RISC-V)后端合入 + wheel 分发体系搭建

日期:2026-08-08 ~ 08-11 来源:FlagTree #939 / #933 / build-infra

  • AMD 后端 TLE 下沉(8/8 前后):新增 tile 与 cumsum lowering(#939),将 AMD 后端适配推进到 TLE 语言层;CI 基准更新为 qwen3.6-27B(#959)——与 Triton-TLE 发布互为印证,TLE 正在成为跨厂商算子表达的统一入口;
  • Spacemit 后端正式合入(#933,8/11 17:59):进迭时空(RISC-V 芯片厂商)后端集成落地,与 FlagGems-Experimental 的 _spacemit 目录互相印证——RISC-V 芯片厂商首次成体系进入 FlagOS 编译栈;
  • wheel 分发体系(8/11,build-infra 连续 5 提交):沐曦 MACA 22.04 wheel 打包器(#362)、FlagTree wheel 构建 + 厂商私有 PyPI 上传 workflow(#363)、统一 FLAGTREE_VERSION(#364)、pybind11 v11 ABI 锁定(#366)。这是 FlagOS 首次为单组件建立”构建-打包-上传”的厂商分发通道,是组件化版本发布的先行指标(距 FlagOS 2.1 已 7 周余)。

1.3 KernelGen:FlagGems-Experimental 批量算子合入(8/10、8/11 两波)

日期:2026-08-10/11 来源:FlagGems-Experimental commits

  • 8 月 10 日(补采):Iluvatar/Metax/Hygon 三厂商十余算子——broadcast_tensors、diagonal_scatter、adaptive_max_pool3d_backward、softplus_backward、lgamma/lgamma_、special_chebyshev_polynomial_u/v、weight_norm、kthvalue、diff、index_select_backward、amp_foreach_non_finite_check_and_unscale 等;
  • 8 月 11 日:约 29 条 KernelGen 提交集中合入,覆盖 5 家后端——海光(Hygon DCU,tile/renorm/nll_loss_backward/max_unpool2d/avg_pool3d_backward 等 8 算子)、摩尔线程(MThreads,norm/im2col/bucketize/erfinv 等 8 算子)、天数智芯(Iluvatar,index_select_backward 等 10+ 算子)、沐曦(Metax,histc 等首批高性算子)、阿里云平头哥真武 PPU 首次批量出现(linalg_eigvals/conj/unbind_copy/cudnn_convolution,_thead 后端目录,目标真武 810E PPU,SDK v2.0.0+,CUDA 兼容 + AIU Tensor Core 扩展)。

FlagGems-Experimental 作为 KernelGen 算子试验场的角色更加明确:主仓走稳定合入,实验仓承担多厂商算子批量验证,成熟后上移。

1.4 FlagGems 主仓:[KMCompiler] 算子 + 版本节奏

日期:2026-08-06 ~ 08-12 来源:FlagGems commits

  • 版本:v5.3.3(8/6)、v5.3.4(8/10,fix special_chebyshev_polynomial_w)连续补丁,主仓处于 5.3.x 维护 + 5.4.0.dev0 开发双线;
  • 算子:igammac Triton kernel(#4860)、沐曦 MetaX cholesky solve(#5247,补齐厂商矩阵中沐曦的空缺)、special_erf/exp2(#5274/#5275);
  • 多后端:昇腾 cholesky solve/polygamma/nonzero/full_like(#5299/#4809/#4921/#5308)、天数智芯 cholesky solve(#5242)、replication_pad2d_backward(含海光适配);
  • 工程:run_tests.py 死锁修复(#5358)、沐曦 CI 在 Triton/FlagTree 后端间切换验证(#5396→#5405)。

1.5 FlagPrism:芯片厂商适配要求文档落地

日期:2026-08-11 来源:FlagPrism commits

FlagPrism(08-04 建仓的 FlagTree debugger/profiler 可选组件)新增 CHIP_VENDOR_ADAPTATION_REQUIREMENTS.md,并更新 vendor 文档——新组件从”under construction”进入”明确第三方接入规范”阶段,FlagOS 组件体系对外收口。

二、算子库与多厂商后端扩张

2.1 FlagBLAS:海光 Level-2 BLAS 密集合入(8/7 补采)

日期:2026-08-07 来源:FlagBLAS commits

feat(hygon) 新增 GBMV/HBMV/SPMV/HPMV,并合入 TPSV/TBSV/SYR/HER,同步建立 Level-2 shape 覆盖对齐文档与 weekly_full_test 测试流水线。FlagBLAS 的 Level-2 BLAS 海光后端覆盖在扩展。

2.2 多厂商后端图谱(8/6-8/12 累计)

| 厂商 | 后端/芯片 | 窗口内动态 | |—|—|—| | 昇腾(华为) | Ascend NPU | FlagGems cholesky/polygamma/nonzero/full_like 算子 | | 海光 | Hygon DCU | FlagGems-Experimental 10+ 算子、FlagBLAS Level-2、DCU Profiler(见 3.1) | | 摩尔线程 | Moore Threads | FlagGems-Experimental 8 算子、推理环境配置 | | 天数智芯 | Iluvatar | FlagGems-Experimental 10+ 算子、cholesky solve、testcase 修复 | | 沐曦 | Metax | 首批高性算子、cholesky solve、MACA 22.04 wheel、CI 后端切换 | | 阿里云平头哥 | 真武 PPU | 首次进入:5 算子 + _thead 后端目录 | | 进迭时空 | Spacemit(RISC-V) | 首次进入:FlagTree 后端合入 | | 昆仑芯 | KunlunXin | 首次进入:TE-FL 单元+集成测试 CI | | 燧原 | Enflame | vllm 插件 scaled_int8_quant 修复(#101) | | 地平线 | D-Robotics BPU | torch.compile 兼容修复(#84) | | AMD | ROCm | FlagTree TLE tile/cumsum lowering | | NVIDIA | CUDA | 多算子 + KernelGen special_erf/exp2 |

窗口内出现 3 家”新进入”芯片后端(真武 PPU、Spacemit、昆仑芯),FlagOS 芯片适配版图从首批 9 家成员单位向外扩圈。

三、推理插件与工具链

3.1 PyTorch-Plugin-FL:DCU Profiler 补齐 + 工程治理收紧

日期:2026-08-12 来源:PyTorch-Plugin-FL #88

  • feat(dcu): implement ROCtracer device activity tracing for profiler(#88,8/12 09:20 合入):解决 DCU CI Profiler parity 失败——csrc/profiler/ 原先仅有 CUPTI(NVIDIA)适配,本次为海光 DCU 新增 ROCm/ROCtracer 设备活动追踪;
  • 工程治理:docs/internal headers 重构(#89)、README 重设计(#93)、issue/PR 模板与 AI agent 规范(#96)。

3.2 其他推理/训练插件动态

  • FlagScale-Agent(8/11):skill(infer-env-setup) 新增海光 Hygon DCU、天数智芯 Iluvatar、摩尔线程三厂商推理环境配置,指向推理侧多卡验收流水线;agent 基础设施改进(verification discipline + TE upstream-sync);
  • TransformerEngine-FL(8/11):昆仑芯单元测试与 MCore 集成测试 CI 支持(#94),继 7/31 并入昆仑芯后端补丁后的配套;
  • FlagGems-vllm(8/11):燧原 scaled_int8_quant 修复(#101);
  • FlagCX(8/11):可配置 CUDA 单元测试流水线(#527)。

四、新闻报道与生态

  • TileRT 团队分享(8/11):智源 TileRT 马凌霄详解超低延迟大模型推理的”计算探索与协同设计”,属智源推理侧项目,与 FlagOS 推理体系同版图,生态参考;
  • 智源 AREX 自主研究智能体 BETA(8/11):独立产品线,与 FlagOS 不直接耦合,但同属智源”Agent + 开源软件栈”布局;
  • 世界动作模型 ω-0(8/11,北大/NTU/智源):具身智能方向输出,与 FlagOS-Robo 工具链生态呼应;
  • 新闻侧整体平静:英文源 0 条命中,中文有效命中极少,主体内容以 GitHub commits 为准。

五、总结与趋势观察

  1. 编译器栈主线清晰:Triton-TLE 官方发布(百倍调优加速)+ FlagTree 的 AMD TLE 下沉与 Spacemit 后端合入 + FlagGems 大量 [KMCompiler] 算子,”统一编译器 + 分层语言扩展”路线图进入量产兑现期。
  2. 组件分发体系起步:build-infra 为 FlagTree 搭建 wheel 构建 + 厂商私有 PyPI 上传(含沐曦 MACA),距 FlagOS 2.1(6/24)后首轮组件新版本或已不远。
  3. 芯片版图扩圈:真武 PPU、Spacemit(RISC-V)、昆仑芯三个新后端窗口内同现,叠加 FlagBLAS 海光 Level-2 推进,多后端适配从”跑通”转向”算子完备度”竞争。
  4. 推理侧功能对齐:DCU ROCtracer Profiler 补齐解决 parity 缺口,推理插件对国产芯片的功能对齐在推进。
  5. 局限性说明:8/6-8/10 无逐日日报,以 8/11 首跑 14 天窗口 + GitHub 补采为准;新闻侧命中极少,智源社区原站 JS 渲染不可直抓,引用 Google News 聚合链接。

附录:信源清单

编号 事件 来源
1 Triton-TLE + FlagTree 百倍加速(8/8) https://news.google.com/rss/articles/CBMiSEFVX3lxTFBDS1VCTlRoUFRkQkROYUtYTjBoLWo5aFJHcVlEZ05Hci1OU0J2T2t4ejgxV3NmLWhzVHJhcm9tb2tva0hzSHROSg?oc=5
2 FlagTree 动态(#939/#959) https://github.com/flagos-ai/FlagTree/commits
3 FlagTree Spacemit 后端 #933 https://github.com/flagos-ai/FlagTree/pull/933
4 build-infra wheel 分发(#362-#366) https://github.com/flagos-ai/build-infra/commits
5 FlagGems-Experimental 批量算子 https://github.com/flagos-ai/FlagGems-Experimental/commits
6 FlagGems 主仓动态(v5.3.3/v5.3.4) https://github.com/flagos-ai/FlagGems/commits
7 FlagPrism 适配规范文档 https://github.com/flagos-ai/FlagPrism/commits
8 FlagBLAS 海光 Level-2(8/7) https://github.com/flagos-ai/FlagBLAS/commits
9 PyTorch-Plugin-FL DCU ROCtracer #88 https://github.com/flagos-ai/PyTorch-Plugin-FL/pull/88
10 TransformerEngine-FL 昆仑芯 #94 https://github.com/flagos-ai/TransformerEngine-FL/commits
11 FlagScale-Agent 三厂商推理环境 https://github.com/flagos-ai/FlagScale-Agent/commits
12 TileRT 分享(智源社区) https://news.google.com/rss/articles/CBMiSEFVX3lxTE9fYTJ5OUJyTEJkRF9RcHkwVWV2eWZHZnJ3QjNvYXhtejN1c0E1ejRnbnlRM2hGVnlYQkpKN2dJSWRBSzcyX0doZw?oc=5
13 真武 PPU 后端 README https://github.com/flagos-ai/FlagGems-Experimental/tree/infra-ci/src/flag_gems/runtime/backend/_thead

生成时间:2026-08-16。8/6-8/10 基于 8/11 首跑 14 天窗口 + GitHub 补采,已与 8/12 日报去重。