原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.00768
立即前往原文

DiagEvo:通过分层错误记忆实现诊断引导的自我进化

DiagEvo是一种语言模型自我进化方法,能够从求解器自身的失败历史中分析反复出现的错误原因。分层记忆按技能节点组织这些原因,并将其标记为“活跃”或“已掌握”。系统据此生成针对特定错误的题目,同时保留自由探索机制。双重置信度过滤器只有在最常见答案具有明显票数优势时,才保留中等难度题目。使用4B诊断模型时,DiagEvo在Qwen3-4B、Qwen3-8B和OctoThinker-8B上的九项基准测试中,平均准确率均超过所有基线方法。在Qwen3-8B上,它在五项数学推理基准测试中的平均准确率达到72.3%,比R-Zero高4.5个百分点;九项测试的平均准确率为57.4%,比DARC高1.1个百分点。
行业资讯 AI模型 研究 2026-09-02 11:30:59 965 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。