AI 新闻中心

AI 新闻中心 过去7天分析了 224 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Anthropic 自建生物实验室,推进 AI 辅助物理实验

Anthropic 已在旧金山湾区设立并运营一座湿实验室,用于开展生物学实验,并探索让 AI 模型参与从计算分析到实际实验操作的完整研究流程。公司尚未披露具体项目,但表示重点将放在基础生物学,而非直接进行药物研发。Anthropic 还收购了 AI 生物技术公司 Coefficient Bio,并推出生命科学验证计划,向通过审核的研究人员提供更强大的模型。由于 Anthropic 此前多次警告先进

自我进化的搜索索引

SELF-INDEX 是一个能根据不同信息检索环境自主改进搜索索引的框架。其优化器会自动诊断检索缺陷,选择性地修改相关索引键,并在更新前验证每项修改。查询模拟器还会主动探索现有优化查询之外的其他信息需求。在多种文档语料库和检索器上的测试表明,该方法的检索性能稳定优于现有索引优化方法。这些改进也延伸到下游应用,可提升搜索代理和记忆系统检索有用历史交互的效果与效率。

不要屏蔽环境:观测监督改变强化学习中智能体的探索方式

该研究提出 ActObs,一种不仅训练动作词元、也训练观测词元的监督式微调方法。虽然部署后的智能体不会生成观测,但学习预测观测有助于策略模型理解动作后果,而且不需要额外数据、参数、序列词元或前向计算。在使用 GRPO 优化后,基于 Qwen3-4B 的 ActObs 在 Terminal-Bench 2.0 的所有测试采样预算下,都取得了高于仅训练动作方法的 pass@k。基于 Qwen3-8B

让大语言模型助手的社会推理具备可验证性

研究人员推出 Fuse,这是一个用于评估大语言模型助手社会推理能力的多智能体模拟框架。在 Fuse 中,一个具有隐藏动机的智能体会与其他智能体互动,其中包括代表用户的智能体;用户智能体随后向被评估的助手咨询,以推断目标智能体的动机。这种设计能够构造出可验证的标准答案。研究团队通过包含 2.4 万条人工标注的研究验证了模拟的可信度。对 12 个大语言模型的评估显示,用户介入会增加社会推理难度,模型会

Anthropic的AI模型Claude正协助开发自己的下一代版本

Anthropic表示,Claude目前主导了公司26%的模型研究与开发工作,这一比例从2月的零增长到8月的约四分之一。公司约90%的研发工作都在Claude的协作下完成,但仍由人类进行密切监督。Claude尚未实现完全自主运行。Anthropic称,公开这些指标有助于评估AI距离“递归式自我改进”还有多远,即AI系统参与构建自身后继模型的能力。公司呼吁其他开发者采用公开方法,定期发布可比较的数据

千寻智能联合创始人:人形机器人最快明年可理解语音指令

千寻智能联合创始人兼首席科学家高阳预计,人形机器人最快从2027年开始就能理解语音指令并执行大多数通用任务,但真正进入家庭承担实用工作仍需更长时间。中国人形机器人企业正将竞争重点从硬件转向软件和具身智能。千寻智能目前通过约1000名合同人员收集真实世界数据,用于训练机器人。公司称,机器人在结构化客厅环境中执行简单任务的成功率已达到90%。未来一至两年可能成为工业应用的起点,商业服务场景随后有望出现

MiniMax Code CLI 正式开源,评测任务通过率达 76.7%

MiniMax 已面向全球开发者正式开源 MiniMax Code CLI v0.4.12,并采用 MIT 许可证。该 CLI 是 MiniMax Code 客户端的核心组件。根据官方信息,在基于 FrontierHarness Eval 的评测中,工具取得了 76.7% 的任务通过率,成功任务的耗时中位数为 4 分 33 秒,两项指标均高于报告列出的公开基线。MiniMax 表示,开源将帮助开发

MiniMax-H3能否推理物理世界?全模态生成模型评测

一项研究评估MiniMax-H3能否通过联合处理文本、图像、视频和音频,提升对物理世界的推理能力。研究团队构建了包含517个样本的评测框架,覆盖四种场景:结合多帧画面的隐式提示、音频-图像输入、前缀视频以及音频-视频输入。由于每种模态只能提供部分证据,模型需要整合互补线索,以推断事件状态和未来动态。MiniMax-H3的总体成功率为41.97%。其中,基于视频的决策推理表现最好,成功率为56.00