DiagEvo:通过分层错误记忆实现诊断引导的自我进化
DiagEvo是一种语言模型自我进化方法,能够从求解器自身的失败历史中分析反复出现的错误原因。分层记忆按技能节点组织这些原因,并将其标记为“活跃”或“已掌握”。系统据此生成针对特定错误的题目,同时保留自由探索机制。双重置信度过滤器只有在最常见答案具有明显票数优势时,才保留中等难度题目。使用4B诊断模型时,DiagEvo在Qwen3-4B、Qwen3-8B和OctoThinker-8B上的九项基准测试中,平均准确率均超过所有基线方法。在Qwen3-8B上,它在五项数学推理基准测试中的平均准确率达到72.3%,比R-Zero高4.5个百分点;九项测试的平均准确率为57.4%,比DARC高1.1个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。