AI 新闻中心

AI 新闻中心 过去一年分析了 1725 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

马斯克确认SpaceX计划使用员工数据训练Grok

埃隆·马斯克在SpaceX全员会议上表示,公司计划使用包括员工提供的数据在内的内部信息训练Grok。他称员工是AI的“父母”,认为员工的价值观可能会影响未来模型。不过,目前尚不清楚具体会使用哪些数据、如何使用,以及如何保障隐私。SpaceX还推出了Grok Bot,定位是能够在计算机上自主执行任务的AI智能体。

机器人 AI 模型 DYNA-2 发布:采用超 100 万小时人类视频训练

Dyna Robotics 发布了机器人基础模型 DYNA-2,并将其定位为“世界动作模型”。该模型使用超过 100 万小时的第一人称人类视频进行预训练,旨在学习人类动作如何改变物理世界。公司称,在后训练数据保持不变的情况下,随着预训练数据规模扩大,制造任务成功率从约 20% 提升至 80% 至 90%。在一次客户部署中,DYNA-2 的质量通过率达到 87%,高于上一代 DYNA-1 的 46%

数学家称神经外科住院医师使用搭载 GPT-5.6 的 ChatGPT 解开克鲁瓦塞猜想

数学家称,一名神经外科住院医师据说使用以 GPT-5.6 为基础的 ChatGPT,解决了数值线性代数领域的重要未解问题——克鲁瓦塞猜想。据称,第一作者在此前一年一直定期使用 ChatGPT,并于 2026 年 7 月 30 日向其请求解答。不过,现有信息既无法证实 GPT-5.6 的存在,也无法确认该猜想已经得到正式数学证明。

谷歌发布可穿戴式胰岛素抵抗追踪功能

谷歌计划于2026年秋季向Fitbit和Pixel Watch推送“健康守护”(Health Guardian)功能套件。其中的“胰岛素抵抗趋势”功能无需采血,即可追踪胰岛素抵抗变化。系统会分析过去数周的心率、心率变异性、血氧饱和度、运动、睡眠和皮肤温度等健康数据,从中寻找与胰岛素抵抗相关的模式。该功能采用谷歌的传感器基础模型SensorFM,基于来自500万名自愿参与者的超过1万亿分钟数据进行预

韩国 AI 模型 Solar Pro 4 首次登上 Agent Arena,排名第 44

韩国人工智能实验室 Upstage 发布了 Solar Pro 4,这是一款面向复杂 AI 智能体任务的商用大语言模型。该模型支持 512K token 上下文窗口,最高输出长度为 128K token,但官方尚未公布参数量。价格为每 100 万输入 token 0.3 美元,缓存读取 0.06 美元,输出 1.2 美元。Upstage 公布的评测成绩包括 Terminal-Bench v2.1

Self-Geometry:无需真值的3D视觉基础模型即插即用测试时自适应

Self-Geometry是一种用于3D视觉基础模型的即插即用测试时自适应流程。它将二维像素对应关系作为伪真值,直接施加明确的多视图几何一致性和极线一致性约束。该方法结合了几何解耦优化、基于SO(3)测地距离的视角采样,以及通过LoRA实现的轻量化自适应。在六个视觉模型和四个基准数据集上的实验表明,该方法能够稳定提升相机位姿和几何估计性能。

LLM代理能否遵守剧本?新基准测试长期交互一致性

一项新研究评估了大语言模型(LLM)代理在互动叙事中长期保持逻辑和故事承诺的能力。研究提出的NCP-Bench包含100个由电影梗概衍生的环境,每个环境都设有结构化的事实、情节轨迹和叙事承诺,可在交互过程中自动检查。实验显示,语言表达流畅并不保证逻辑一致性;面对用户的对抗性干预,即使是较强的模型也经常生成相互冲突的内容。表现最佳的GPT-5.2在20轮交互后的存活率仅为42%,不同模型的事实冲突率

消息称美国AI网络安全审查未来可能扩展至开放权重模型

据《连线》援引知情人士报道,美国目前针对闭源先进AI模型的网络安全审查机制,未来数月可能扩展至开放权重模型。该机制目前仍属自愿性质。报道所称“前沿”模型,是指能力相当于Anthropic Claude Mythos或OpenAI GPT-5.6的模型,但未透露具体版本。部分美国官员担心,强制审查可能抑制AI发展。白宫还在考虑,闭源模型通过审查并投入使用后,是否会降低企业对未审查开放模型的兴趣,进而

AI4AI 测试时能力迁移:通过推理框架将强模型能力传递给弱模型

一项新研究探讨了更强的 AI 模型能否在不更新参数的情况下,于测试时提升较弱模型的能力。研究人员让构建模型迭代设计推理框架,并在四项心智理论基准测试上进行评估。结果显示,目标模型的平均表现几乎从 0.49 提升至 0.91。性能提升主要来自将不稳定的模型推理转移到确定性代码中、采用基准测试专用路由,以及严格控制答案格式,而不是鼓励更长的推理或更广泛的采样。研究表明,测试时的框架设计可以作为训练时知

手语人工智能首次进入消费级产品,谷歌 DeepMind 推出翻译模型

谷歌 DeepMind 发布了一款大规模多语言手语转文本模型。Pixel 11 系列的 Gboard 和 Live Transcribe 将首先支持美国手语输入,未来计划扩展到更多手语和设备。该模型使用涵盖 50 多种手语的 10 万小时数据训练,能够同时分析身体多个部位的运动,并将手语视为独立的自然语言,而不是简单的手势序列。为保护隐私,系统会将手语转换为身体关键点的位置数据,无需把原始视频流发

MBA:面向真实商业创意生成的多模态基准与智能体

该研究提出 MBA-Bench,这是一个用于训练和评估商业创意生成智能体的多模态基准。数据集包含来自六个领域的3万条样本,每个领域都包含仅靠文本难以完整表达的视觉信息。研究人员结合图像描述、GPT-4o、检索查询生成、市场证据检索和基于证据的合成来生成参考创意。MBA-b和MBA-k两个智能体分别面向隐藏和公开评估标准进行训练,采用基于LoRA的监督微调以及结合创造力、可行性等奖励的群组相对策略优

从合成到去除:基于物理的反射模拟与扩散模型视频去反射

研究人员提出了一套用于去除玻璃拍摄视频中反射的框架。S2R-Synthesis管线通过模拟玻璃粗糙度造成的模糊、厚度引起的重影以及反射率变化等物理效应,生成有反射和无反射的视频配对数据。在此基础上,S2R-Removal利用预训练视频扩散模型进行适配,在一次去噪步骤中恢复干净的透射画面。研究还构建了S2R-Bench,这是一个面向视频反射去除的基准,支持全参考评估和真实场景下的人工感知评估。实验结

小米决定不举办澎湃 OS 4 发布会,首批 Beta 版开启招募

小米宣布澎湃 OS 4 Beta 版上线,并决定不举办传统发布会,而是通过专门团队收集用户反馈并持续优化系统。此次更新包括升级自研 Xiaomi HyperCore,引入负载精算和内存预载技术,以改善响应速度和操作流畅度。小米还推出接入自研 MiMo 模型的“超级小爱 2.0”,提升跨应用、跨设备的任务编排与内容生成能力。首批 Beta 版适配机型已于 8 月 13 日上午 11 点在小米社区开启