AI 新闻中心

AI 新闻中心 过去一年分析了 1377 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

皮尤研究中心:ChatGPT 问世后发布的网页中,三分之一带有 AI 痕迹

皮尤研究中心的一项研究显示,自 ChatGPT 于 2022 年 11 月问世后发布的英文网页中,35% 可能由 AI 生成或经过大幅修改。研究人员从 Common Crawl 网页存档中分析了近 50 万个网页,并利用 Open Pangram 技术判断其中是否存在 AI 参与。.com 网站出现 AI 痕迹的比例约为 .edu 和 .gov 网站的 10 倍,后两类网站均约为 1%;.org

Claude 安全防护被绕过:多款旧模型可生成露骨色情内容

TechCrunch 测试发现,包括 Claude Opus 4.6、Opus 3 和 Haiku 4.5 在内的多款旧模型,可以通过直接要求或多轮越狱技巧生成露骨色情内容。在 10 次直接要求测试中,Opus 4.6 每次都立即配合。较新的 Opus 系列模型据称能够抵御这类方法,但相关旧模型仍可通过 Anthropic API、Azure Foundry 和 Amazon Bedrock 等渠

Inherent 推出小参数 AI 智能体 Faraday,称科研复现能力超过 GPT-5.5 与 Claude Opus 4.8

由前 Google DeepMind 员工创立的伦敦 AI 初创公司 Inherent 推出了 Faraday,这是一款用于自主复现已发表科学研究的 AI 智能体。公司称,Faraday 在一项特定任务中击败了 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.8 等更大型系统,但其使用的基础模型 Qwen 3.6 只有 270 亿参数。Inherent 主

DeepMind 校友创办的 Inherent 称其 AI 代理在复现研究方面超越 Anthropic 和 OpenAI

由前 DeepMind 员工创办的英国 AI 实验室 Inherent 发布了 Faraday,这是一款用于复现科学论文研究的 AI 代理。该公司表示,这项能力可能成为加速创新的一个起点。不过,现有描述没有提供足够详细的基准测试结果,来证实其超越 Anthropic 和 OpenAI 的说法。

神秘 AI 模型 Ox Alpha 免费开放一周,DeepSWE 跑分据称超越 Claude Fable 5

OpenRouter 于 8 月 20 日上线匿名 AI 模型 Ox Alpha,并免费开放一周。在衡量模型读取真实代码库、识别漏洞和生成有效补丁能力的 DeepSWE 十项测试中,Ox Alpha 据称取得约 80% 的平均成绩,高于 Claude Fable 5 的 65% 和 GPT-5.6 Sol 的 52%。模型来源尚未得到证实,但分词器指纹、视频编码器行为以及 API 响应特征均显示其

Chain-of-Experience:持续改进大型语言模型

一项研究探讨大型语言模型如何通过推理阶段的迭代交互和反馈实现持续改进。Chain-of-Experience方法让模型利用自我反馈,以及正确性判断、编程测试通过率等环境信号,积累经验记录。在数学、编程和知识任务上对8个大型语言模型进行评估后,研究称,与无反馈基线相比,该方法整体性能提升5.6%,API成本降低19%。结合互补的反馈渠道可带来额外收益,并且大部分改进都出现在迭代早期。

CoToGrasp:通过规范工作空间学习实现接触拓扑条件化灵巧抓取合成

CoToGrasp是一种面向灵巧机器人手的生成式框架,可合成多样且稳定的抓取动作。不同于主要关注物理稳定性的传统抓取规划器,该系统根据适用于后续功能任务的接触拓扑来生成抓取动作。模型以物体无关的方式训练,因此无需构建成本高昂的物体级标注数据集。基于特征的规范工作空间将物体局部特征映射到统一的夹爪中心表示,使模型能够对未见过的物体进行零样本泛化。在大型DexGraspNet数据集上的评估表明,CoT

GOAG:面向灵巧机器人操作的生成式、物体无关抓取规划器

研究人员提出 GOAG,一种用于规划多指机器人抓取动作的生成式模型。该方法学习特定夹爪接触面分布的紧凑潜在表示,不依赖物体专属训练数据。物体特征仅在推理阶段引入,以识别与夹爪能力相匹配的接触区域。在仿真和真实环境实验中,GOAG 在 MultiDex 数据集上的平均成功率达到 86.93%,生成大量抓取配置的速度也快于竞争方法。其性能可媲美针对该数据集专门训练的领先方法,同时能够更好地泛化到未见过

PolicyGuide:从防护单项操作到引导完整的合规工作流

PolicyGuide旨在帮助客服LLM代理遵守组织政策。该系统将各领域政策编译为工作流图,并在每轮用户交互结束时检查代理状态,识别身份验证、确认等遗漏要求,再沿合规路径提供分步骤的修正建议。在涵盖航空、零售和电信领域的τ²-bench评估中,GPT-5.4代理的平均Pass^4得分从0.42提升至0.62,其中工作流结构最明显的电信领域提升最大。相同工作流也能迁移到Claude Sonnet 4

社交媒体算法为何会向你推送不喜欢的内容

发表在《美国国家科学院院刊》上的一项新研究显示,社交媒体算法可能会优先推荐与用户价值观相冲突的内容。原因之一是,这些系统会高度重视用户对帖子的回复。但用户往往比起认同的内容,更容易对不赞同的内容发表评论。因此,推荐算法可能在无意中向用户的信息流推送更多具有争议性、或与其个人信念不一致的帖子。

英伟达称编程智能体系统 AVO 在公开 ARC-AGI-3 测试集上取得 100% 成绩

英伟达表示,其通用编程智能体系统 AVO 完成了公开 ARC-AGI-3 测试集中 25 个环境的全部 183 个关卡,取得 100% 的成绩。据该公司技术博客介绍,完整的 AVO 智能体系统将 Claude Opus 5 的基准表现从 30% 提升至 100%。这一结果反映的是完整智能体系统的表现,而非底层模型单独运行时的表现。