跳到正文
arXiv · cs.AI· François Costa, Charly Castes, Thomas Bourgeat, Azalia Mirhoseini·· 10 天前精选

LLM智能体直接将Triton内核编译为PTX,在多代NVIDIA GPU上测试

AI as a Compiler: Compiling Triton kernels without the Triton compiler

arXiv:2609.36800v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:François Costa, Charly Castes, Thomas Bourgeat, Azalia Mirhoseini

首次提交:2026-09-29 14:13

研究任务与主要进展

研究团队让LLM智能体直接把Triton内核转换为NVIDIA PTX,以替代传统优化与降级流程;在Ada、Hopper和Blackwell GPU上的22个内核测试中,作者报告性能达到自动调优Triton的0.83至3.34倍。较大增益来自Tensor Core权重解码、softmax线程任务分配和卷积窗口复用等Triton未执行的转换;结果依赖包含候选PTX评估的验证环境。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

该论文提出由LLM智能体直接将Triton内核翻译为PTX,并在12个常见内核和10篇近期机器学习论文内核上报告相对于自动调优Triton的0.83至3.34倍性能。性能优势依赖候选PTX评估与验证机制;材料仅提供摘要,且扩展的Blackwell支持仍受文中所述形式化与实现限制影响。本站设想:在相同编译、验证和端到端预算下,测试该方法对更多GPU架构及验证失败情形的稳健性。

来源:arXiv · cs.AI · arxiv.org