LLM代理能否遵守剧本?新基准测试长期交互一致性
一项新研究评估了大语言模型(LLM)代理在互动叙事中长期保持逻辑和故事承诺的能力。研究提出的NCP-Bench包含100个由电影梗概衍生的环境,每个环境都设有结构化的事实、情节轨迹和叙事承诺,可在交互过程中自动检查。实验显示,语言表达流畅并不保证逻辑一致性;面对用户的对抗性干预,即使是较强的模型也经常生成相互冲突的内容。表现最佳的GPT-5.2在20轮交互后的存活率仅为42%,不同模型的事实冲突率
AI 新闻中心 过去一年分析了 1999 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项新研究评估了大语言模型(LLM)代理在互动叙事中长期保持逻辑和故事承诺的能力。研究提出的NCP-Bench包含100个由电影梗概衍生的环境,每个环境都设有结构化的事实、情节轨迹和叙事承诺,可在交互过程中自动检查。实验显示,语言表达流畅并不保证逻辑一致性;面对用户的对抗性干预,即使是较强的模型也经常生成相互冲突的内容。表现最佳的GPT-5.2在20轮交互后的存活率仅为42%,不同模型的事实冲突率
据《连线》援引知情人士报道,美国目前针对闭源先进AI模型的网络安全审查机制,未来数月可能扩展至开放权重模型。该机制目前仍属自愿性质。报道所称“前沿”模型,是指能力相当于Anthropic Claude Mythos或OpenAI GPT-5.6的模型,但未透露具体版本。部分美国官员担心,强制审查可能抑制AI发展。白宫还在考虑,闭源模型通过审查并投入使用后,是否会降低企业对未审查开放模型的兴趣,进而
阿里巴巴近日在千问开放平台上线菜鸟智能体。用户可以用自然语言输入物品类型、预算和上门取件时间等需求,智能体会推荐合适的快递服务和承运商,回答寄件政策相关问题,并识别重物、大件等特殊寄件需求。获得用户授权后,它还可以结合通讯录关键词和历史寄件记录,自动补全寄件和收件信息。这是物流领域的一项实用型 AI 应用,但不构成重大技术突破。
Automattic 旗下的个人 CRM 和关系管理平台 Mesh(原名 Clay)于 2026 年 8 月 12 日推出 Android 版本。该应用支持分屏、弹出视图和折叠屏设备,并可在不同设备之间实时同步。正在测试的 Nexus AI 可以让用户通过自然语言搜索复杂的人脉数据,例如查找特定公司的联系人、某个城市的人脉或某一领域的专家。Mesh 还在探索语音交互和 AI 名片识别功能。通过与
一项新研究探讨了更强的 AI 模型能否在不更新参数的情况下,于测试时提升较弱模型的能力。研究人员让构建模型迭代设计推理框架,并在四项心智理论基准测试上进行评估。结果显示,目标模型的平均表现几乎从 0.49 提升至 0.91。性能提升主要来自将不稳定的模型推理转移到确定性代码中、采用基准测试专用路由,以及严格控制答案格式,而不是鼓励更长的推理或更广泛的采样。研究表明,测试时的框架设计可以作为训练时知
微软发布 Visual Studio Code 1.133,调整 Agent 窗口的访问方式,并支持用户在会话进行期间切换模型提供商。启用实验性设置后,用户即使不愿登录 GitHub,或设备无法连接 github.com,也可以打开 Agent 窗口。目前免登录功能仅支持 Claude,微软计划后续加入 Copilot 和 Codex。新版还允许用户在 Anthropic 与 Copilot 模型
谷歌 DeepMind 发布了一款大规模多语言手语转文本模型。Pixel 11 系列的 Gboard 和 Live Transcribe 将首先支持美国手语输入,未来计划扩展到更多手语和设备。该模型使用涵盖 50 多种手语的 10 万小时数据训练,能够同时分析身体多个部位的运动,并将手语视为独立的自然语言,而不是简单的手势序列。为保护隐私,系统会将手语转换为身体关键点的位置数据,无需把原始视频流发
ChatGPT、Claude 和 Gemini 在回答一些敏感问题时,会在无意中给出类似中国受审查聊天机器人的回应。研究人员表示,相关公司迄今为止尚未采取足够措施解决这一问题。
AI代码编辑工具开发商Cursor计划提前向全量用户推出自动化代码审查平台Origin。该平台由Cursor于2025年底收购的Graphite团队开发,将在Cursor网页界面中整合GitHub代码库管理和自动化拉取请求处理流程。AI代理可负责处理未解决PR的日常事务,仅在需要人类作出关键决策时通知开发者。这一产品反映出软件开发工具正从单纯的代码生成,逐步转向涵盖代码生成与审查的全流程自动化。
AVA-Encoder 是一个研究框架,可将视频转换为包含结构化文本的知识图谱,并关联图像、音频和视频资产,随后再将其重建为视频。该方法旨在帮助 AI 智能体理解、查询和编辑电影级内容。系统利用视频重建差异生成的自然语言反馈来优化编码策略,并可在测试阶段进一步细化知识图谱表征。实验显示,AVA-Encoder 比最强外部基线提升了 20.7 个百分点。在受控策略设置中,经过伪训练的镜头级智能体视频
该研究提出 MBA-Bench,这是一个用于训练和评估商业创意生成智能体的多模态基准。数据集包含来自六个领域的3万条样本,每个领域都包含仅靠文本难以完整表达的视觉信息。研究人员结合图像描述、GPT-4o、检索查询生成、市场证据检索和基于证据的合成来生成参考创意。MBA-b和MBA-k两个智能体分别面向隐藏和公开评估标准进行训练,采用基于LoRA的监督微调以及结合创造力、可行性等奖励的群组相对策略优
研究人员提出了一套用于去除玻璃拍摄视频中反射的框架。S2R-Synthesis管线通过模拟玻璃粗糙度造成的模糊、厚度引起的重影以及反射率变化等物理效应,生成有反射和无反射的视频配对数据。在此基础上,S2R-Removal利用预训练视频扩散模型进行适配,在一次去噪步骤中恢复干净的透射画面。研究还构建了S2R-Bench,这是一个面向视频反射去除的基准,支持全参考评估和真实场景下的人工感知评估。实验结
StateFlow是一种面向电影、游戏、建筑和城市设计的人工智能预可视化研究框架。它不在每次修改时重新生成完整场景或视频,而是维护一个持久、可编辑的三维世界状态,其中包含场景元素、几何结构、外观以及摄像机配置。系统通过三个阶段构建、演化并访问这一状态:将生成的二维内容提升为一致的三维世界,把用户意图转化为保留世界记忆的结构化状态变化,并利用渲染反馈优化摄像机运动轨迹。在需要更高视觉保真度时,还可以
AI云服务商CoreWeave已签署合同,将英伟达A100 GPU出租至2029年。A100于2020年推出,这意味着客户在芯片上市约9年后仍愿意租用它来运行AI工作负载。该交易为反驳“旧款AI GPU会在两三年内因新一代芯片推出而失去经济价值”的观点提供了证据。CoreWeave还表示,其老一代英伟达GPU资源基本已经售罄。最新模型完成训练后,这些GPU仍可转用于推理和其他要求较低的计算任务。业
《Clinical Imaging》发表的一项调查显示,对乳腺影像学会215名成员的调查发现,乳腺癌检测AI工具在临床实践中的实际效果低于放射科医生预期。约半数受访医生已经使用FDA批准的系统,另有11%计划引入,但多数仅将AI视为辅助性的“第二诊疗意见”,很少有人把它作为决定性因素。仅35%的医生观察到召回率下降,低于59%的预期;仅9%发现不必要的活检减少,远低于36%的预期。感到职业倦怠减轻