AI 新闻中心

AI 新闻中心 过去一年分析了 1723 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

DCAS解耦CLI代理脚手架,将规划能力内化到模型中

一项研究分析了为何使用OpenHands轨迹数据微调的CLI软件工程代理,在其他脚手架上部署时性能会显著下降。研究人员认为,这种差距源于脚手架特有的规划行为,并区分了执行前生成的显式计划,以及贯穿代理循环的隐式结构惯例。DCAS是一种拦截层,可在不修改脚手架的情况下连接任意CLI脚手架与后端模型。实验表明,使用包含规划信息的轨迹进行微调,能够提升模型在非训练脚手架上的表现,说明规划能力可以从脚手架

多智能体法证推理提升可泛化的深度伪造视频检测能力

研究人员推出 FaceVid-Forensics-100K,这是一个包含 10 万个深度伪造视频的数据集,覆盖 33 种合成方法,并提供细粒度文本标注。其 ARGUS 框架由四个专门智能体分别分析纹理、光照、运动和物理特征,再由裁决智能体整合结果并生成带解释的判断。研究人员称,该系统完全由小型开源多模态语言模型构成,在域外测试中超过了包括 GPT 和 Gemini 闭源模型在内的所有对比方法,并在

Meta新款Glimmer AI模型展现扎克伯格对个人超级智能的构想

Meta推出的新型开放权重模型Muse Glimmer,被称为一窥马克·扎克伯格个人超级智能愿景的窗口。这一消息也凸显出日益扩大的差距:用户可以自行拥有一些AI模型,而另一些系统只能通过外部服务访问。不过,现有描述没有提供具体性能基准,也没有独立证据证明该模型实现了重大的技术突破。

扎克伯格呼吁美国放宽开源 AI 限制,以应对中国竞争

据路透社报道,Meta 首席执行官马克·扎克伯格呼吁美国政府减少对开源或开放权重 AI 模型的限制,以便与中国竞争。他表示,AI 应该广泛普及,而不应由少数机构掌控。报道还提到,Meta 据称推出了采用 4bit 量化技术的 AI 模型 Muse Glimmer,可在配备 24GB 或 32GB 显存的 Mac 和 PC 上本地运行。随着 AI 开发成本上升,以及 Anthropic 和 Open

相关但不完整:指涉悬空揭示硬提示压缩的根本性失效模式

一项研究发现,当系统独立评估并选择词元、句子或文本块时,硬提示压缩可能破坏关键的指涉关系。如果答案被保留,但用于理解答案的实体被删除,就会产生“指涉悬空”。在0.30的压缩率下,多个基准测试中最多有60%的案例出现这一问题。重新插入缺失的支持段落后,准确率提高了29至34个百分点。一个用于自动判断被删除句子是否必要的小型分类器,在压缩率几乎不变的情况下,使HotpotQA准确率提升4.7个百分点。

苹果曾短暂发布中国版指南,介绍如何将 Siri 连接至通义千问

苹果曾在中国支持网站短暂发布一份中文指南,说明 Mac 用户如何将阿里巴巴的通义千问连接到 Siri 和写作工具。根据指南,在 macOS 26.6 或更高版本上,Siri 可借助通义千问提供更详细的回答并分析照片和文档,写作工具则可生成文字和图像。用户需要登录自己的通义千问账户,且阿里巴巴不得使用提交的内容训练或改进模型。苹果在不到一天后删除了这份指南。此次撤下可能与技术调整或尚未完成的监管流程

用于研究人类认知与行为的小型基础模型

研究人员使用 Psych-101 训练了14个模型,参数规模从1.35亿到140亿不等。Psych-101包含来自160项实验的1,070万条试次级选择数据。在与训练数据相同的分布内,模型规模影响很小:6亿至10亿参数的模型在未参与训练的受试者上,达到了700亿参数基准模型的相近表现。但在泛化到新任务结构时,更大的模型明显更具优势。诊断测试显示,屏蔽刺激和反馈内容会破坏75.7%的已学习信息,并使