KernelZero通过提议器与编码器协同进化持续改进GPU内核生成
KernelZero是一种用于自动生成正确且高效GPU内核的协同进化框架。提议器根据API集合生成Torch模块,编码器则将其转换为CUDA或Triton内核。系统会根据编码器当前的不足生成有针对性的训练模块,并采用正确性感知优化方法,只有在可靠性达到足够水平后才优先提升性能。根据报告的实验结果,KernelZero-7B在CUDA上超过Claude 4.5 Sonnet,在Triton上超过DeepSeek-V4-Pro。在KernelBench中,CUDA第1级和第2级测试的pass@1分别为75.8%和69.6%,pass@10分别达到100%和97%。在Triton上,pass@1分别达到77.2%和72.5%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。