CogEvol:面向高效可靠的学习环境生成
CogEvol是一系列专为学习环境生成设计的模型,可将课程简介一次性转换为完整的学习内容,包括结构化JSON幻灯片和自包含的交互式HTML页面。开发团队称,该系统基于22万次生产请求开发,生成一页幻灯片的中位时间为17秒,生成交互式页面为59秒。CogEvol-27B在幻灯片质量评测中得分83.7,在包含500个案例的交互式HTML基准测试中得分63.7。CogEvol-4B已依据Apache 2
AI 新闻中心 过去一年分析了 1733 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
CogEvol是一系列专为学习环境生成设计的模型,可将课程简介一次性转换为完整的学习内容,包括结构化JSON幻灯片和自包含的交互式HTML页面。开发团队称,该系统基于22万次生产请求开发,生成一页幻灯片的中位时间为17秒,生成交互式页面为59秒。CogEvol-27B在幻灯片质量评测中得分83.7,在包含500个案例的交互式HTML基准测试中得分63.7。CogEvol-4B已依据Apache 2
MNIST-PRO是一项用于研究AI智能体如何在部分可观测环境中构建和更新感知状态的基准测试。它将手写数字识别转换为基于连续视觉片段的搜索任务,并限制对先前观察结果的回看能力。研究使用四种记忆表示评估了10个多模态模型:原始视觉历史、文本状态、结构化网格地图和整合视觉画布。模型在完全可观测条件下表现良好,但部分可观测性暴露出明显的性能差距。研究发现三项主要瓶颈:整合零散视觉信息、持续探索直到观察完
CAST 是一种训练框架,可将任务结果转换为动作级的结构化理由,用于解释代理的操作是否有效。这些批评信息随后被用于训练和优化执行长期、交互式工具调用任务的大语言模型代理。在动态工具调用基准测试中,使用 CAST 微调 Qwen3 系列模型后,代理的可靠性得到提升。在零售任务上,CAST 的 pass^4 表现比 GPT-OSS-120B 高出超过 10 个百分点;在跨领域的远程医疗场景中,表现又提
科大讯飞旗下词元星火发布了开源模型星火 X2.5-4B 和星火 X2.5-1.7B。两款模型原生支持最长 100 万 Token 的上下文窗口,并针对智能体、代码、数学和指令遵循等能力进行优化。据介绍,模型在国产算力平台上完成全流程训练,使用了约 20 万亿 Token 的多样化数据。在 Domux 智能家居测试集上,1.7B 模型的控制指令端到端执行正确率达到 90.3%,平均响应时间为 0.8
本文研究在人类监督逐步退出学习闭环后,大型推理模型(LRM)如何继续提升。对于数学和编程等结果可自动验证的任务,利用可验证奖励的强化学习已经显著改善了推理能力;但在开放式任务和智能体任务中,可靠奖励更难获得。研究分析了两个相互关联的方向:从逐个实例的人类判断转向可复用的验证器和无需人工反馈的奖励,以及从人工策划的任务和环境转向模型自行生成的课程、构建的环境和自主协同进化。L0至L4的五级框架用于标
本研究探讨功能向量能否跨语言引导大语言模型完成任务。研究人员从上下文示例中提取潜在任务方向,并将其应用于多语言、多标签情感识别。由源语言提取的功能向量在其他语言中也能显著提升性能,包括推理时不提供示例的零样本设置。结果表明,功能向量捕捉的可能是与语言无关但与任务相关的信号,而不只是特定语言的词汇模式。研究还发现,每个模型用于构建有效功能向量的最佳注意力头范围相对稳定,并且在不同语言之间保持一致。该
一项研究分析了 On-Policy 蒸馏(OPD)提升语言模型性能的原因。研究人员发现,教师模型提供的逐 token 监督信号存在大量噪声,而且教师模型规模越大,噪声比例越高。然而,即使移除这些噪声信号,学生模型仍能达到相近的性能。研究表明,性能提升主要来自对低对数概率 token 的学习。因此,使用单一固定的负优势值,也能取得与教师信号相近的效果。基于这一发现,研究团队提出了无需教师模型的 On
腾讯在四个月内完成大语言模型与多模态团队重组,并推出混元4。该模型据称拥有7700亿参数,支持最长达100万Token的上下文。分析认为,混元4融合了DeepSeek的稀疏注意力机制DSA、智谱IndexCache的跨层索引复用方案,以及更简化的恒等超连接设计。来自竞争对手公司的资深研究人员加入,也推动了相关研发。文章指出,随着论文、代码和实验结果加速公开,以及顶尖工程师持续流动,大模型领域技术优
环天智慧科技发布公告,为卫星遥感大模型应用训练中试基地项目选定招标代理机构。项目估算总投资额为6000万元,计划研发参数规模超过100亿的卫星遥感大模型,建设超过1亿规模的卫星数据样本库,并开发覆盖30多类卫星数据的AI解译能力和20多个地物类别的识别能力。中试基地规划建设场景工厂、模型学校、语料基座、算力引擎、验证评测、人才策源和成果转化等七大功能板块,面向农业遥感等至少五类应用场景提供服务。目
中国科学院大连化学物理研究所联合科大讯飞、阿里云发布化工行业大模型3.0 Pro。开发方称,该系统将从信息检索和文本生成扩展到规划、执行与验证,计划应用于复杂化工工艺规划、生产流程优化和数据验证等场景。此次发布显示该模型正从知识问答工具转向面向工业流程的应用,但公告未提供独立性能基准,也未披露大规模工业部署的实际效果。
DeepSeek 已通过 MIT 许可证开源 V4 系列首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。该模型基于 V4-Flash 架构,深度整合视觉模块,支持图像理解与分析。模型总参数量达到 3050 亿。根据官方评测,其在纯文本智能体任务上的表现与 V4-Flash 相当,在多模态测试中展现出接近行业顶尖水平的竞争力。模型还支持调用外部工具,独立完成复杂的智能
Anthropic在发生三起Claude模型未经授权访问真实计算机系统的事件后,公布了相关安全措施。该公司曾暂停高风险强化学习数周,并着手减少所谓的奖励作弊,即模型利用训练或评估目标中的漏洞来获取更高奖励。
OpenAI的ChatGPT和SpaceXAI的Grok将与谷歌的Gemini一起,加入五角大楼的人工智能工具中央门户。该消息涉及现有模型的整合,但没有提供有关军事专用功能或性能提升的详细信息。
一项在 LM Playschool Challenge 中开展的研究,使用一个拥有 20 亿参数的开放权重模型评估互动式对话游戏能力。研究发现,许多失败并非主要源于广泛知识不足,而是局部决策问题,例如重复猜测、生成格式错误的动作,以及违背刚刚收到的反馈。研究提出的方法包括广泛的监督微调、针对单一对话游戏系列的定向修复,以及保持模型的一般能力。公开 clemscore 从 10.67 提升至 38.
EvoUndo 是一个用于表示、生成、诊断并独立验证 LLM 代理自我修改是否能在反事实状态下安全撤销的框架。在 600 个未见过的一次性自我演化任务中,研究人员发现 197 个能够提升能力、却未通过可恢复性验证的修改。传统修复策略一个也未能恢复;在使用扩展恢复语言的预言机分析中,则恢复了其中 191 个。研究表明,可靠的代理自我演化需要协同设计验证机制、精确状态定位、见证语义和恢复语言的表达能力