KernelOPT用五个智能体优化GPU内核
热点事件观察中
KernelOPT用五个智能体优化GPU内核
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
KernelOPT研究团队提出一套面向GPU内核优化的多智能体系统;论文摘要显示,在NVIDIA H200上评测250个KernelBench问题时,相较torch.compile,全部内核的几何平均加速分别为Level 1的1.40倍、Level 2的1.15倍和Level 3的1.07倍,结果包含回退案例。 系统保留cuBLAS、cuDNN等厂商库调用,仅让五个性能分析引导的LLM智能体优化生成的Triton子内核;候选方案须依次通过静态验证、多随机种子正确性检查、模型级float64回退验证及性能门槛,再对重新拼接的完整模型验证。系统可接收PyTorch nn.Module、独立Triton内核和Helion内核,当前证据为arXiv论文摘要所述实验。
AI 根据报道生成 · 25 分钟前更新
最新进展10月7日 12:00
KernelOPT:面向 GPU 内核优化的调度感知 Agent 搜索报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIKernelOPT:面向 GPU 内核优化的调度感知 Agent 搜索
KernelOPT 是一种多 Agent 系统,在保留 cuBLAS、cuDNN 等厂商库调用的同时,利用五个基于性能分析的 LLM Agent 优化生成的 Triton 子内核。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。