Φ-Bench:评估大语言模型能否开发支撑自身运行的基础设施
Φ-Bench 是一项用于评估大语言模型开发和优化 LLM 基础设施能力的基准测试。不同于主要关注孤立内核、预定义算子或既定优化目标的现有基准,Φ-Bench 覆盖整个基础设施栈中的开放式长期任务,从内核级函数补全到端到端系统的实现与优化。针对前沿 LLM 的实验揭示了它们在复杂基础设施工程方面的当前能力与局限,也反映出实现未来 AI 基础设施自主优化仍需解决的挑战。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。