AI 新闻中心

AI 新闻中心 过去一年分析了 8797 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Self-Geometry:无需真值的3D视觉基础模型即插即用测试时自适应

Self-Geometry是一种用于3D视觉基础模型的即插即用测试时自适应流程。它将二维像素对应关系作为伪真值,直接施加明确的多视图几何一致性和极线一致性约束。该方法结合了几何解耦优化、基于SO(3)测地距离的视角采样,以及通过LoRA实现的轻量化自适应。在六个视觉模型和四个基准数据集上的实验表明,该方法能够稳定提升相机位姿和几何估计性能。

矽品精密云林斗六厂动工,将导入先进 CoWoS 封装

日月光投控旗下半导体封装测试企业矽品精密(SPIL)已在云林县斗六市启动新厂建设。该项目投资近千亿新台币,预计用于AI半导体先进封装,并导入CoWoS 2.5D异构集成技术。厂区开发面积约6公顷,满载运营后可创造超过2200个就业岗位。首期预计于2028年启用。矽品目前也在台湾多地持续扩充生产能力,以应对先进芯片封装需求。

AI编程独角兽Cognition传正洽谈新一轮融资,估值或达400亿美元

据知情人士透露,AI编程助手Devin的开发商Cognition正与投资者洽谈新一轮融资,估值可能至少达到400亿美元。Cognition今年5月刚以约26亿美元估值完成10亿美元融资。公司称其年化收入运行率已达到10亿美元,过去半年企业客户对Devin的使用量保持每月50%的增长。其客户包括梅赛德斯-奔驰、美国国家航空航天局和高盛。Cognition表示,Devin并非用于取代程序员,而是帮助处

LLM代理能否遵守剧本?新基准测试长期交互一致性

一项新研究评估了大语言模型(LLM)代理在互动叙事中长期保持逻辑和故事承诺的能力。研究提出的NCP-Bench包含100个由电影梗概衍生的环境,每个环境都设有结构化的事实、情节轨迹和叙事承诺,可在交互过程中自动检查。实验显示,语言表达流畅并不保证逻辑一致性;面对用户的对抗性干预,即使是较强的模型也经常生成相互冲突的内容。表现最佳的GPT-5.2在20轮交互后的存活率仅为42%,不同模型的事实冲突率

消息称美国AI网络安全审查未来可能扩展至开放权重模型

据《连线》援引知情人士报道,美国目前针对闭源先进AI模型的网络安全审查机制,未来数月可能扩展至开放权重模型。该机制目前仍属自愿性质。报道所称“前沿”模型,是指能力相当于Anthropic Claude Mythos或OpenAI GPT-5.6的模型,但未透露具体版本。部分美国官员担心,强制审查可能抑制AI发展。白宫还在考虑,闭源模型通过审查并投入使用后,是否会降低企业对未审查开放模型的兴趣,进而

阿里巴巴在千问平台上线菜鸟智能体,协助规划寄件方案

阿里巴巴近日在千问开放平台上线菜鸟智能体。用户可以用自然语言输入物品类型、预算和上门取件时间等需求,智能体会推荐合适的快递服务和承运商,回答寄件政策相关问题,并识别重物、大件等特殊寄件需求。获得用户授权后,它还可以结合通讯录关键词和历史寄件记录,自动补全寄件和收件信息。这是物流领域的一项实用型 AI 应用,但不构成重大技术突破。

WordPress 母公司 Automattic 推出 Android 版 Mesh,加入 Nexus AI 助手

Automattic 旗下的个人 CRM 和关系管理平台 Mesh(原名 Clay)于 2026 年 8 月 12 日推出 Android 版本。该应用支持分屏、弹出视图和折叠屏设备,并可在不同设备之间实时同步。正在测试的 Nexus AI 可以让用户通过自然语言搜索复杂的人脉数据,例如查找特定公司的联系人、某个城市的人脉或某一领域的专家。Mesh 还在探索语音交互和 AI 名片识别功能。通过与

AI4AI 测试时能力迁移:通过推理框架将强模型能力传递给弱模型

一项新研究探讨了更强的 AI 模型能否在不更新参数的情况下,于测试时提升较弱模型的能力。研究人员让构建模型迭代设计推理框架,并在四项心智理论基准测试上进行评估。结果显示,目标模型的平均表现几乎从 0.49 提升至 0.91。性能提升主要来自将不稳定的模型推理转移到确定性代码中、采用基准测试专用路由,以及严格控制答案格式,而不是鼓励更长的推理或更广泛的采样。研究表明,测试时的框架设计可以作为训练时知

微软发布 VS Code 1.133:调整 Agent 窗口,支持会话中切换模型提供商

微软发布 Visual Studio Code 1.133,调整 Agent 窗口的访问方式,并支持用户在会话进行期间切换模型提供商。启用实验性设置后,用户即使不愿登录 GitHub,或设备无法连接 github.com,也可以打开 Agent 窗口。目前免登录功能仅支持 Claude,微软计划后续加入 Copilot 和 Codex。新版还允许用户在 Anthropic 与 Copilot 模型

手语人工智能首次进入消费级产品,谷歌 DeepMind 推出翻译模型

谷歌 DeepMind 发布了一款大规模多语言手语转文本模型。Pixel 11 系列的 Gboard 和 Live Transcribe 将首先支持美国手语输入,未来计划扩展到更多手语和设备。该模型使用涵盖 50 多种手语的 10 万小时数据训练,能够同时分析身体多个部位的运动,并将手语视为独立的自然语言,而不是简单的手势序列。为保护隐私,系统会将手语转换为身体关键点的位置数据,无需把原始视频流发

Cursor拟提前推出自动化代码审查平台Origin,整合Graphite团队技术

AI代码编辑工具开发商Cursor计划提前向全量用户推出自动化代码审查平台Origin。该平台由Cursor于2025年底收购的Graphite团队开发,将在Cursor网页界面中整合GitHub代码库管理和自动化拉取请求处理流程。AI代理可负责处理未解决PR的日常事务,仅在需要人类作出关键决策时通知开发者。这一产品反映出软件开发工具正从单纯的代码生成,逐步转向涵盖代码生成与审查的全流程自动化。

AVA-Encoder:面向智能体原生视频表征学习

AVA-Encoder 是一个研究框架,可将视频转换为包含结构化文本的知识图谱,并关联图像、音频和视频资产,随后再将其重建为视频。该方法旨在帮助 AI 智能体理解、查询和编辑电影级内容。系统利用视频重建差异生成的自然语言反馈来优化编码策略,并可在测试阶段进一步细化知识图谱表征。实验显示,AVA-Encoder 比最强外部基线提升了 20.7 个百分点。在受控策略设置中,经过伪训练的镜头级智能体视频

MBA:面向真实商业创意生成的多模态基准与智能体

该研究提出 MBA-Bench,这是一个用于训练和评估商业创意生成智能体的多模态基准。数据集包含来自六个领域的3万条样本,每个领域都包含仅靠文本难以完整表达的视觉信息。研究人员结合图像描述、GPT-4o、检索查询生成、市场证据检索和基于证据的合成来生成参考创意。MBA-b和MBA-k两个智能体分别面向隐藏和公开评估标准进行训练,采用基于LoRA的监督微调以及结合创造力、可行性等奖励的群组相对策略优

从合成到去除:基于物理的反射模拟与扩散模型视频去反射

研究人员提出了一套用于去除玻璃拍摄视频中反射的框架。S2R-Synthesis管线通过模拟玻璃粗糙度造成的模糊、厚度引起的重影以及反射率变化等物理效应,生成有反射和无反射的视频配对数据。在此基础上,S2R-Removal利用预训练视频扩散模型进行适配,在一次去噪步骤中恢复干净的透射画面。研究还构建了S2R-Bench,这是一个面向视频反射去除的基准,支持全参考评估和真实场景下的人工感知评估。实验结