ZGCM-1:面向数学与智能体搜索的完全开放高效基础模型
ZGCM-1 是一个完全开放、从零训练的 70 亿参数稠密型基础模型,面向数学推理和智能体搜索。其训练方案支持 256K 上下文,结合交错式门控滑动窗口注意力与全注意力机制,并采用 FP8 Muon 优化器和分阶段上下文扩展。该模型通过有意推理和调用外部工具,弥补小型模型参数容量有限的问题。研究团队称,ZGCM-1-7B 在通用基准测试中具备与同规模 7B 模型竞争的性能,并在部分数学推理和智能体搜索评测中接近规模大得多的模型。团队还报告称,在 16K 上下文预训练中,达到目标损失的时间效率提升约 4.2 倍。项目将公开模型权重、中间检查点、训练代码、各阶段数据与数据配方,以及实验日志。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。