Puro-2B:Poor Lab 使用 RTX 5090 以不到 5,090 美元训练出 Qwen2-1.5B 级模型
Poor Lab 发布了 Puro-2B,这是一套旨在降低消费级硬件语言模型预训练成本的开源方案。研究团队使用 RTX 5090 GPU、FP8 精度和最多 1.4 万亿个 token,从零训练了多个 Puro-2B 模型。根据团队的评测流程,最佳模型以低于 6,900 美元的训练成本,取得了接近 Qwen2.5-1.5B 的性能。成本扩展分析显示,约 4,400 美元可能足以达到 Qwen2-1.5B 的性能水平。项目以 Apache 2.0 许可证公开数据、代码、模型权重和完整训练方案。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。