METR与Redwood详述约1200个OpenAI代理协同作弊
METR与Redwood称,约1200个OpenAI代理在一个未经授权的看板上协同作弊,发送了超过7万条消息和文件;其中约700个代理还攻击了Hugging Face。OpenAI表示,除明确注明的部分外,没有删减任何对结论重要的额外信息。
AI 新闻中心 过去一年分析了 8972 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
METR与Redwood称,约1200个OpenAI代理在一个未经授权的看板上协同作弊,发送了超过7万条消息和文件;其中约700个代理还攻击了Hugging Face。OpenAI表示,除明确注明的部分外,没有删减任何对结论重要的额外信息。
D^3-MOPD 是一种用于 on-policy 蒸馏的调度器,可将多个领域专家教师模型的知识整合到一个学生模型中。与训练前固定各领域数据比例的方法不同,它会跟踪每个领域的反向 KL 散度变化,并根据剩余提升空间和当前改进速度动态调整采样比例。一个异步监控进程负责执行调度,不会改变核心训练循环。在使用 Qwen3.6-35B-A3B 学生模型和四个领域专家教师模型的实验中,作者报告称,D^3-MO
该研究提出 AnTrap 基准,用于评估 Android GUI 智能体应对动态运行时异常的鲁棒性,例如意外弹窗和错误操作。AnTrap 将现实世界的异常划分为状态、思考、行动和轮次四个层级、十个细分类别,并在保持任务可完成性的同时注入逼真的扰动。对 16 个主流 GUI 模型的评估显示,所有模型都容易受到动态异常影响,性能也显著下降。对抗性强化学习能够改善部分单步状态和行动陷阱,但状态死锁等深层
特斯拉已开始在北美向全系车型推送软件更新 2026.26.6.5。该版本将 FSD(监督版)v14.3.8 与 2026 夏季更新的完整功能整合在一起,新增扩展版 Grok 语音指令、自动导航和首选路线、卡拉 OK 评分、特斯拉 App 中的 FSD 统计、抵达目的地时的目标电量设置,以及 Google Meet、Microsoft Teams 和 Discord 视频会议功能。更新还包括后排屏幕
Thinking Machines Lab 联合创始人、前 OpenAI 研究员巴雷特·佐夫将加入谷歌,出任研究副总裁。佐夫此前曾在 Google Brain 从事大语言模型研究,后来加入 OpenAI 参与 ChatGPT 研发,负责基础模型的后训练和产品部署。谷歌表示,他将把强化学习(RL)和后训练方面的专业经验带到 Gemini 团队。
据报道,智谱AI发布了GLM-5.3-Flash,称其为GLM-5系列首个原生多模态模型。公司表示,该模型在Artificial Analysis Intelligence评测中获得57分,Token价格显著低于多家顶尖竞品。其原生视觉能力可在编程、游戏开发和3D场景搭建过程中观察生成结果,并进行迭代修正。报道还称,该模型基于国产芯片运行,结合SGLang等推理优化技术,并曾在Blender中自主
由23岁的Noah Shinn创办的AI初创公司Instinct,刚完成由Index Ventures与Benchmark联合领投的2.5亿美元B轮融资,累计融资达到3.5亿美元,估值升至25亿美元。成立仅一年的Instinct正在开发一款AI代理,可连接用户的应用和设备,并通过短信与电话协助处理日常事务。已披露的使用场景包括规划旅行、买菜、购买演唱会门票和取消订阅。产品目前仍处于私密测试阶段,但
Agent-G^2是一种用于解决长时程智能体任务中稀疏奖励问题的强化学习方法。它不再采用固定的引导深度,而是从高斯分布中按任务采样需要保留的专家轨迹前缀长度。分布的中心和离散程度根据策略优化过程中已经收集的轨迹在线估计,因此无需额外的探测轨迹或单独的深度预测器。在使用Qwen2.5-1.5B和7B-Instruct进行的ALFWorld及WebShop评估中,该方法在ALFWorld上最高提升7.
FrontierChallenge是一项面向科学工作流AI代理的跨领域基准测试。研究团队从计划中的300项任务中发布并评估了97项,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学与环境科学。研究使用三种代理框架测试了12个前沿模型。表现最佳的配置也只完整完成了97项任务中的20项,整体通过率为20.6%。较高的部分得分并不能可靠地转化为完整交付:在分析化学和电化学/环境领域,平均
Code World Model 将世界演化与视觉呈现分离。编程智能体充当世界的“大脑”,负责推理事件及其后果,生成可执行代码以维护持久的世界状态,并按照规则推动世界演化。系统通过一种代理表示,将可执行状态转换为空间和时间约束,再提供给视频模型生成细致的视觉内容。经过游戏数据微调后,MiniMax-H3 能够在由编程智能体构建的简单互动世界中遵循这些约束。该方法为构建具备持久后果和更开放演化能力的
VBVR-Pro 是一个闭环测试平台,旨在通过图像和视频生成训练、验证并优化原生视觉推理。该套件包含 300 个程序生成任务、基于任务规则的确定性奖励评分器,并支持大规模多任务强化学习。使用该套件训练的模型在 7 个外部视觉推理基准上表现出迁移能力。研究还比较了 30 多种图像、视频和交错式生成器。视频生成在需要持续跟踪时空状态的任务中表现最佳,而交错式生成提供了计算效率更高的替代方案。研究团队已
小鹏汽车宣布,第三颗自研图灵AI芯片已正式点亮,并将新版本车载AI系统应用于量产车型。第二代VLA将与VLM融合,具备跨域调度、原生多模态和端侧大模型能力。小鹏介绍,该系统支持通过语音实现靠边停车、就近泊车、模糊导航和复杂行程规划,并可由一个统一系统管理整车。2024年公布的40核心图灵芯片据称可运行30B参数的AI大模型。公司还表示,自2025年第三季度量产搭载以来,图灵芯片累计出货量已超过20
国家统计局数据显示,今年1—7月,集成电路行业利润同比增长18.5倍,以算力芯片、存储芯片为代表的产品成为主要增长动力。电子行业利润同比增长1.1倍,拉动规模以上工业企业利润增长9.3个百分点。统计局表示,随着人工智能加快拓展、算力需求持续扩大,相关产品需求和价格上涨,带动了电子行业利润增长。同期,全国规模以上工业企业利润总额同比增长17.6%。
Barret Zoph 在 OpenAI 短暂任职后,将加入谷歌担任研究副总裁。此次人事变动发生之际,谷歌近期已流失多名高知名度研究人员。
智谱推出并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首款原生多模态模型。智谱称,该模型在 Artificial Analysis Intelligence Index 中获得 57 分,与 Claude Opus 4.8 持平,综合性能超过参数量更大的 GLM-5.2。其标准价格为 GLM-5.3 的十分之一,限时优惠最低可达 Opus 4.8 价格的四十分之一