跳到正文
热点事件观察中

KernelOPT用五个智能体优化GPU内核

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

KernelOPT研究团队提出一套面向GPU内核优化的多智能体系统;论文摘要显示,在NVIDIA H200上评测250个KernelBench问题时,相较torch.compile,全部内核的几何平均加速分别为Level 1的1.40倍、Level 2的1.15倍和Level 3的1.07倍,结果包含回退案例。 系统保留cuBLAS、cuDNN等厂商库调用,仅让五个性能分析引导的LLM智能体优化生成的Triton子内核;候选方案须依次通过静态验证、多随机种子正确性检查、模型级float64回退验证及性能门槛,再对重新拼接的完整模型验证。系统可接收PyTorch nn.Module、独立Triton内核和Helion内核,当前证据为arXiv论文摘要所述实验。

AI 根据报道生成 · 25 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    KernelOPT:面向 GPU 内核优化的调度感知 Agent 搜索

    KernelOPT 是一种多 Agent 系统,在保留 cuBLAS、cuDNN 等厂商库调用的同时,利用五个基于性能分析的 LLM Agent 优化生成的 Triton 子内核。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。