AI 新闻中心

AI 新闻中心 过去24小时分析了 168 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

会点头、抢话还会脸红:近半数受测者把 Tavus 的 AI 误认为真人

美国 AI 公司 Tavus 发布了 Griffin,这是一款结合全双工对话与视频生成的实时人类交互模型。在 Tavus 进行的一分钟测试中,54 名参与者有 26 人认为自己正在与真人交谈;上一代系统则是 41 人中只有 1 人。Griffin 可以同时处理语音、停顿、面部表情和周围场景,据称能更自然地回应、插话或保持沉默。Tavus 表示,模型平均响应延迟为 0.43 秒,并在 NVIDIA

Flow Matching 潜在推理的关键因素

潜在推理让大型语言模型在连续空间中思考,只将答案转化为语言。研究提出潜在思维应满足五项要求:有助于答对、具有多样性、可解释、能通过增加推理计算进一步改进,并且在准确率相近时比显式思维链更高效。研究聚焦于在学习得到的潜在空间中使用 Flow Matching,并提出 Flow-based Latent Reasoning(FLaRe)。针对五项要求的测试显示,FLaRe 优于此前的潜在推理方法。论文

意大利反垄断机构调查 AI 音乐平台 Suno,关注其服务条款

意大利反垄断机构已对 AI 音乐初创公司 Suno 展开调查。该机构认为,Suno 的服务条款可能损害消费者权益,因为条款允许公司单方面修改合同内容、服务功能和订阅费用。监管机构还对授权范围过宽、要求用户放弃著作人身权、强制在美国仲裁以及放弃集体诉讼权利等规定表示担忧。未来数周,行业协会、商会和消费者权益组织预计将参与相关意见征询。Suno 尚未立即置评。

梯度如何加剧分割式语言模型的文本泄漏:按词元和文档衡量

一项研究测量了分割学习过程中传输的激活值和梯度能够泄露多少文本。在 GPT-2 实验中,拥有公开权重的攻击者仅凭激活值就能恢复 94.20% 的词元;若同时获得梯度,比例升至 97.38%。32 个词元的文档被完整恢复的比例则从 13.71% 升至 37.77%。Secret mixup 防御几乎阻止了整份文档被准确恢复,但仍有 83% 至 91% 的词元可被还原。研究表明,激活值和梯度都可能泄露

UndoBench 将使用工具的 AI 智能体的任务能力与恢复能力分开评估

UndoBench 是一项基准测试,分别衡量 AI 智能体在正常情况下完成任务的能力,以及从故障中恢复的能力。测试涵盖 8 个企业领域中的 36 个工作流和 36 种故障场景。在 2,880 组配对试验中,常规任务能力为 83.54%,条件恢复成功率则为 46.72%。简单重试在 53.33% 的试验中造成外部效果重复。研究显示,恢复风险会随执行阶段而变化;如果只评估任务是否完成,这些风险可能被掩

DEPICT:通过答案一致性评估文本与图像的对齐程度

评估文本与图像的对齐程度有助于检验图像说明、检测幻觉、筛选数据以及评测文生图模型。研究人员提出了无需额外训练的评估指标 DEPICT。它比较基于图像得出的答案与仅根据说明得出的答案,并根据说明能否明确决定答案来为问题加权。与整体评分结合后,DEPICT 对否定表达的准确率从 19% 提升至 88%。在五项基准测试和三个模型系列的 11 个骨干模型上,DEPICT 优于所有受测的免训练指标;在衡量与

优化优化器:语言模型加速分子弛豫

在许多量子化学工作流程中,几何优化计算成本较高,因为每一步都需要进行力评估。在这项研究中,语言模型代理重写了优化器本身,以减少力评估次数。由此得到的 AutoSella 系列包含两种优化器;在搜索过程中未使用的分子基准测试和势能函数上,两者所需的力评估次数都稳定低于 Sella。在 r2SCAN-3c DFT 层级,最佳变体只需 Sella 的 40.2%至77.2%的力评估次数,就能达到相同的能