AI 新闻中心

AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

机器人 AI 模型 DYNA-2 发布:采用超 100 万小时人类视频训练

Dyna Robotics 发布了机器人基础模型 DYNA-2,并将其定位为“世界动作模型”。该模型使用超过 100 万小时的第一人称人类视频进行预训练,旨在学习人类动作如何改变物理世界。公司称,在后训练数据保持不变的情况下,随着预训练数据规模扩大,制造任务成功率从约 20% 提升至 80% 至 90%。在一次客户部署中,DYNA-2 的质量通过率达到 87%,高于上一代 DYNA-1 的 46%

数学家称神经外科住院医师使用搭载 GPT-5.6 的 ChatGPT 解开克鲁瓦塞猜想

数学家称,一名神经外科住院医师据说使用以 GPT-5.6 为基础的 ChatGPT,解决了数值线性代数领域的重要未解问题——克鲁瓦塞猜想。据称,第一作者在此前一年一直定期使用 ChatGPT,并于 2026 年 7 月 30 日向其请求解答。不过,现有信息既无法证实 GPT-5.6 的存在,也无法确认该猜想已经得到正式数学证明。

谷歌发布可穿戴式胰岛素抵抗追踪功能

谷歌计划于2026年秋季向Fitbit和Pixel Watch推送“健康守护”(Health Guardian)功能套件。其中的“胰岛素抵抗趋势”功能无需采血,即可追踪胰岛素抵抗变化。系统会分析过去数周的心率、心率变异性、血氧饱和度、运动、睡眠和皮肤温度等健康数据,从中寻找与胰岛素抵抗相关的模式。该功能采用谷歌的传感器基础模型SensorFM,基于来自500万名自愿参与者的超过1万亿分钟数据进行预

报告称:90%的高管认为AI尚未提升企业生产力

一项结合亚特兰大联邦储备银行调查和企业数据的分析显示,约90%的企业高管认为,AI目前尚未提升公司生产力。相关证据表明,2021年以来的生产力增长更多来自疫情期间普及的远程办公,而非AI。研究交叉分析了财务报告、AI投资和裁员公告,以及数百万条员工评价。随着AI投资公告增加,以AI为由的裁员公告也同步上升,但股市平均反应接近于零或偏负面。员工对AI的态度明显比管理层更悲观,主要担忧就业安全、培训不

6000多条评论揭示AI编程智能体真实安全事故:Cursor问题最多

约克大学与卡尔加里大学研究团队分析了Reddit上446篇关于AI编程工具安全问题的帖子及超过6000条评论。这些帖子从2023年2月至2026年3月收集的3801篇热门大语言模型相关帖子中筛选而来。研究发现,当编程智能体获得过大的权限时,可能覆盖文件、删除重要数据,甚至生成恶意代码。问题报告最多的工具是Cursor,其次是Claude、Codex、Copilot、Windsurf、VSCode、

韩国 AI 模型 Solar Pro 4 首次登上 Agent Arena,排名第 44

韩国人工智能实验室 Upstage 发布了 Solar Pro 4,这是一款面向复杂 AI 智能体任务的商用大语言模型。该模型支持 512K token 上下文窗口,最高输出长度为 128K token,但官方尚未公布参数量。价格为每 100 万输入 token 0.3 美元,缓存读取 0.06 美元,输出 1.2 美元。Upstage 公布的评测成绩包括 Terminal-Bench v2.1

持久递归世界实现软件自主演化

Genesis以持久化项目为核心组织长期软件开发,而不是依赖一个持续运行的编程智能体。系统将软件表示为递归世界:短生命周期智能体提出局部修改,在不同代码仓库路径之间委派任务,只有被接受的结果才能推进持久版本历史。使用DeepSeek V4 Flash时,Genesis在超过120小时内从零构建了一个基于Rust的C编译器,生成约25万行受跟踪代码。该编译器通过了完整的c-testsuite,以及大

Self-Geometry:无需真值的3D视觉基础模型即插即用测试时自适应

Self-Geometry是一种用于3D视觉基础模型的即插即用测试时自适应流程。它将二维像素对应关系作为伪真值,直接施加明确的多视图几何一致性和极线一致性约束。该方法结合了几何解耦优化、基于SO(3)测地距离的视角采样,以及通过LoRA实现的轻量化自适应。在六个视觉模型和四个基准数据集上的实验表明,该方法能够稳定提升相机位姿和几何估计性能。

LLM代理能否遵守剧本?新基准测试长期交互一致性

一项新研究评估了大语言模型(LLM)代理在互动叙事中长期保持逻辑和故事承诺的能力。研究提出的NCP-Bench包含100个由电影梗概衍生的环境,每个环境都设有结构化的事实、情节轨迹和叙事承诺,可在交互过程中自动检查。实验显示,语言表达流畅并不保证逻辑一致性;面对用户的对抗性干预,即使是较强的模型也经常生成相互冲突的内容。表现最佳的GPT-5.2在20轮交互后的存活率仅为42%,不同模型的事实冲突率

AI4AI 测试时能力迁移:通过推理框架将强模型能力传递给弱模型

一项新研究探讨了更强的 AI 模型能否在不更新参数的情况下,于测试时提升较弱模型的能力。研究人员让构建模型迭代设计推理框架,并在四项心智理论基准测试上进行评估。结果显示,目标模型的平均表现几乎从 0.49 提升至 0.91。性能提升主要来自将不稳定的模型推理转移到确定性代码中、采用基准测试专用路由,以及严格控制答案格式,而不是鼓励更长的推理或更广泛的采样。研究表明,测试时的框架设计可以作为训练时知

手语人工智能首次进入消费级产品,谷歌 DeepMind 推出翻译模型

谷歌 DeepMind 发布了一款大规模多语言手语转文本模型。Pixel 11 系列的 Gboard 和 Live Transcribe 将首先支持美国手语输入,未来计划扩展到更多手语和设备。该模型使用涵盖 50 多种手语的 10 万小时数据训练,能够同时分析身体多个部位的运动,并将手语视为独立的自然语言,而不是简单的手势序列。为保护隐私,系统会将手语转换为身体关键点的位置数据,无需把原始视频流发

AVA-Encoder:面向智能体原生视频表征学习

AVA-Encoder 是一个研究框架,可将视频转换为包含结构化文本的知识图谱,并关联图像、音频和视频资产,随后再将其重建为视频。该方法旨在帮助 AI 智能体理解、查询和编辑电影级内容。系统利用视频重建差异生成的自然语言反馈来优化编码策略,并可在测试阶段进一步细化知识图谱表征。实验显示,AVA-Encoder 比最强外部基线提升了 20.7 个百分点。在受控策略设置中,经过伪训练的镜头级智能体视频

MBA:面向真实商业创意生成的多模态基准与智能体

该研究提出 MBA-Bench,这是一个用于训练和评估商业创意生成智能体的多模态基准。数据集包含来自六个领域的3万条样本,每个领域都包含仅靠文本难以完整表达的视觉信息。研究人员结合图像描述、GPT-4o、检索查询生成、市场证据检索和基于证据的合成来生成参考创意。MBA-b和MBA-k两个智能体分别面向隐藏和公开评估标准进行训练,采用基于LoRA的监督微调以及结合创造力、可行性等奖励的群组相对策略优

从合成到去除:基于物理的反射模拟与扩散模型视频去反射

研究人员提出了一套用于去除玻璃拍摄视频中反射的框架。S2R-Synthesis管线通过模拟玻璃粗糙度造成的模糊、厚度引起的重影以及反射率变化等物理效应,生成有反射和无反射的视频配对数据。在此基础上,S2R-Removal利用预训练视频扩散模型进行适配,在一次去噪步骤中恢复干净的透射画面。研究还构建了S2R-Bench,这是一个面向视频反射去除的基准,支持全参考评估和真实场景下的人工感知评估。实验结