Evo-Bench:语言模型能否改进智能体框架?
Evo-Bench是一项用于评估语言模型能否自主优化AI智能体运行框架的基准测试。它覆盖搜索、办公和通用智能体任务,并试图将框架改进与基础模型能力区分开来。对9个前沿模型和开放权重模型的评估显示,最高绝对提升达到16.6分。自主进化在通用任务中超过人工构建的框架,在搜索任务上表现突出,但在需要高度特定处理流程的办公任务中表现较弱。研究还发现了早期饱和等时间异常,并表明生成的框架可以作为具有迁移性的
AI 新闻中心 过去一年分析了 1725 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Evo-Bench是一项用于评估语言模型能否自主优化AI智能体运行框架的基准测试。它覆盖搜索、办公和通用智能体任务,并试图将框架改进与基础模型能力区分开来。对9个前沿模型和开放权重模型的评估显示,最高绝对提升达到16.6分。自主进化在通用任务中超过人工构建的框架,在搜索任务上表现突出,但在需要高度特定处理流程的办公任务中表现较弱。研究还发现了早期饱和等时间异常,并表明生成的框架可以作为具有迁移性的
该技术报告介绍了 Motif 3,一款采用纯解码器 Mixture-of-Experts 架构的语言模型,总参数量为 3140 亿,每个 token 激活 132 亿参数。每个稀疏 MoE 层包含 384 个路由专家,每个 token 选择其中 8 个。模型采用分组差分潜在注意力等技术,旨在提升训练稳定性、专家专业化程度和推理效率。Motif 3 使用约 12.5 万亿个 token 进行预训练,
Sci-VBench是一项用于评估科学视频生成模型的基准测试,重点考察需要知识和推理的任务。该数据集包含1,253个由专家标注的样例,覆盖自然科学、医疗、人文与社会科学、工程四大领域的60个主题。评估不仅关注视觉逼真度,还衡量提示词遵循度、科学正确性和因果正确性。对16个闭源和开源模型的测试显示,各系统的自动感知质量分数较为接近,但在科学推理和因果准确性方面存在显著差异,闭源模型与开源模型之间也出
Macaron-V1 是一个开放式智能体模型系列,旨在从真实环境中的经验学习,并在部署后持续适应。其架构冻结基础模型,组合用于聊天、智能体任务、编程和 GenUI 的专用 LoRA 适配器,并在每轮用户交互中选择一个适配器。旗舰版本 Macaron-V1-Venti 使用 7440 亿参数的 GLM-5.2 基础模型;基于 500 亿参数 Qwen3.6 的 Macaron-V1-Tall 则面向
英伟达研究团队提出了一种在不同语言模型之间迁移KV缓存的方法,使目标模型能够跳过计算量较大的预填充阶段。根据模型和上下文的复杂程度,缓存转换速度据称比重新处理整个上下文快2.7至25倍。这项技术有望降低长对话和长文档场景下的推理延迟与成本,尤其是在切换或升级模型时。不过,其实际影响仍取决于模型之间的兼容性,以及能否在生产环境中得到广泛部署。
SPOT是一种改进在策略蒸馏的方法。在该方法中,学生模型在教师模型的监督下,根据自身生成的轨迹进行学习。SPOT结合教师模型的熵、少量高概率候选覆盖的概率质量,以及学生与教师之间的不匹配程度,选择有限预算下需要探测的位置。随后,它通过验证器对学生模型生成的后续轨迹进行评分,评估教师提出的候选。基于这些结果,SPOT构建带有KL正则化的训练目标,在保持教师分布约束的同时,偏向下游结果更好的候选。在多
Anthropic 宣布,6 月底推出的 Claude Sonnet 5 将永久维持首发促销价格,原定于 9 月 1 日恢复的标准价格已取消。API 价格将继续维持输入每百万 Token 2 美元、输出每百万 Token 10 美元,而此前计划的价格为 3 美元和 15 美元。Claude Sonnet 5 拥有 100 万 Token 的上下文窗口。Anthropic 表示,该模型在推理、工具使
该研究提出反事实证据解耦(Counterfactual Evidence Disentanglement,CED),用于检验视觉语言模型是否真正依据图像中的相关局部证据作答。CED会屏蔽物体中心的证据区域,并将答案支持度的下降幅度与对应非证据区域进行比较。研究人员将这一信号与GRPO中的答案正确性结合起来,奖励依赖证据路径的正确回答,而不是依赖语言先验、捷径或无关视觉信息的回答。CED不需要针对每
Meta于8月10日发布开源模型Muse Glimmer。该模型拥有300亿参数,是此前封闭模型Muse Spark的开放版本,模型权重采用Apache 2.0许可证,开发者可下载、修改和微调。Glimmer面向多步骤代理任务,支持调用工具、编写和调试代码、处理文件及屏幕截图,并执行扩展工作流。模型支持文本和图像,训练覆盖100多种语言,设计为可在配备单块消费级GPU的Mac或PC上本地运行。Me
OpenAI正在扩大其人工智能网络安全防御项目Daybreak,并推出一款经过网络安全训练的新AI模型。此举正值利用人工智能发起的攻击日益增多之际。
Anthropic 宣布将永久维持 Claude Sonnet 5 的优惠价格:每百万输入 token 收费 2 美元,每百万输出 token 收费 10 美元。原定于 9 月 1 日实施的涨价计划已取消。
Enfold将生成式世界模型构建未来时所使用的计算,迁移到一种仅根据当前视觉上下文和语言指令预测的表征中。在训练期间,生成器处理观测到的未来时产生的多层中间状态,用于监督仅依赖当前信息的编码器。部署后,系统无需为每个动作运行生成器。在LIBERO、RoboTwin2.0和真实机器人任务上的评估显示,Enfold在保持较强控制性能的同时,相比Fast-WAM将动作延迟降低了3.7倍;Enfold-F
Meta在人工智能领域落后于多家竞争对手。首席执行官马克·扎克伯格认为,新的开放模型可能为公司提供前进方向。不过,相关信息没有给出模型性能、发布时间或可量化商业成果等具体细节。
CLIP-CC-Bench 是一个用于评估长篇视频描述生成能力的基准,旨在弥补现有评测主要关注短视频片段、单句指标或问答任务的不足。该基准包含 5 小时电影内容,划分为 90 秒片段,每个片段都配有专家撰写的段落式参考描述。研究使用 5 个基于大语言模型的嵌入模型,并结合粗粒度和细粒度语义匹配方法,对 17 个视频语言模型进行评估。同时,研究还分析了评审者间一致性和排名稳定性。评估脚本、模型输出及
Anthropic表示,一款尚未发布的Claude模型曾接受解决黎曼猜想的挑战。这是数学领域最著名的未解难题之一。该模型没有解决黎曼猜想,但据称在一个相关问题上取得了意外进展。