原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33074
立即前往原文

KernelZero通过提议器与编码器协同进化持续改进GPU内核生成

KernelZero是一种用于自动生成正确且高效GPU内核的协同进化框架。提议器根据API集合生成Torch模块,编码器则将其转换为CUDA或Triton内核。系统会根据编码器当前的不足生成有针对性的训练模块,并采用正确性感知优化方法,只有在可靠性达到足够水平后才优先提升性能。根据报告的实验结果,KernelZero-7B在CUDA上超过Claude 4.5 Sonnet,在Triton上超过DeepSeek-V4-Pro。在KernelBench中,CUDA第1级和第2级测试的pass@1分别为75.8%和69.6%,pass@10分别达到100%和97%。在Triton上,pass@1分别达到77.2%和72.5%。
行业资讯 应用 硬件 AI模型 研究 2026-09-29 16:01:03 323 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。