AI 新闻中心

AI 新闻中心 过去24小时分析了 177 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

中消协提醒:重要决策不要只依赖AI,曾有人按建议退改签损失600元

中国消费者协会提醒,消费者在涉及价格、退款、合同和法律诉讼等重要事项时,不应盲目相信生成式AI。AI生成的回答可能存在不准确、不完整或误导性内容。此前有媒体报道,一名用户因采纳AI提供的机票退改签建议,损失了600元。中消协表示,通用AI的回答本质上只是参考信息,不属于具有约束力的合同约定,也不能替代正式法律意见。企业部署的AI客服同样不能以“AI自动回复”为由逃避法定责任。消费者应通过官方渠道、

Task-CoEvolve:通过自适应验证任务选择实现高效的 Harness 优化

Task-CoEvolve 是一种优化大语言模型 Harness 的方法,无需更新底层模型权重。与每轮都评估完整验证集不同,该方法优先选择候选 Harness 结果存在分歧的任务,因为这些任务更有助于区分候选方案。它根据历史结果进行方差加权采样,并随着 Harness 的演进调整任务分布。随后,方法结合采样概率,从部分评估结果估算完整验证集的性能,从而在不同迭代之间进行一致比较。在在线文本分类和

Arm公布成立36年来首款自研芯片:AGI CPU拥有1000亿晶体管,支持6TB内存

据媒体报道,Arm在Hot Chips 2026大会上披露了一款面向智能体人工智能的AGI CPU细节。这被称为Arm成立36年来首款自研量产芯片。该处理器采用第三代Neoverse V3核心和Armv9.2架构,最多配备136个核心,最高频率为3.7GHz。芯片采用台积电3nm N3P工艺和双芯粒设计,据称拥有最多1000亿个晶体管,最大TDP为300W。处理器将内存与I/O集成在同一芯片上,目

GameXpert-Bench:编程智能体距离专家级游戏开发还有多远?

GameXpert-Bench用于评估AI编程智能体在完整游戏开发生命周期中的能力。测试包括三个部分:GameGen评估智能体能否根据一次请求创建完整游戏;GameFix评估缺陷诊断与修复能力;GameOpt则衡量多轮交互中的持续优化能力。评估采用实时游戏交互、确定性行为测试,以及带回归检查的最终产品标准。该基准包含11个游戏类型的97项生成任务、100项修复任务,以及17条优化链;每项修复任务都

亚马逊据报计划利用AI和机器人打造全自动化配送站

据Business Insider查阅的一份内部规划文件,亚马逊正在开发代号为“Project Tetromino”的高度自动化配送站。该设施将利用人工智能和机器人处理包裹分拣、暂存以及配送车辆装载前的排序,把自动化从履约中心延伸至配送前的最后环节。文件据称计划于2028年投入1.03亿美元启动试点,2029年建设5个站点,2030年再增加10个,到2029年的累计投资可能超过5.3亿美元。包裹处

LinkedIn“看起来像 AI 垃圾”按钮见效,相关内容浏览量下降四成

LinkedIn 表示,被认定为低质量 AI 内容的帖子,浏览量较几周前下降了 40%。自 7 月 30 日推出“看起来像 AI 垃圾”按钮以来,已有超过 100 万名用户针对可疑帖子和评论提供反馈。平台目前更依赖社区反馈,而不是可能产生误判的自动化 AI 检测器。当帖子获得足够多的社区反馈后,LinkedIn 会在“帖子分析”中突出显示相关提示,帮助作者了解其他用户如何看待其内容。公司还表示,已

超越模仿:根据推理进展筛选在线蒸馏信号

研究人员提出R2-OPD,以解决语言模型后训练中在线蒸馏(OPD)的一项局限。标准OPD将教师模型产生的奖励视为推理进展的可靠指标,但有些偏离教师输出的推理步骤实际上更有助于解决问题,却可能因此获得较低奖励。R2-OPD分别依据教师奖励和独立估计的推理进展,对同一轨迹中的推理片段进行排序。当两种排序不一致时,该方法会抑制相应的蒸馏信号,同时保留有效的教师指导。作者报告称,与标准OPD相比,该方法能

ReWorld:具备长时记忆的交互式世界模型

ReWorld是一种交互式世界模型,能够跟随用户操作、记住曾展示过的地点,并实时生成视频。其训练过程将短期控制与长期记忆分离:大多数注意力头关注近期历史,少数全局注意力头则访问完整历史。推理时,模型将有容量限制的KV缓存与按相机姿态索引的地标库结合,用于检索靠近当前位置的历史信息。训练数据涵盖Unreal渲染场景、游戏环境和真实世界视频,并统一到相同的物理动作尺度。通过蒸馏,采样步骤减少到4步,使

Prime Agent:可自我改进的 RLM Harness

Prime Agent 是一个开源 harness,用于评估长时程 AI 智能体并支持编程智能体工作流。它将基于递归语言模型概念的持久化 IPython REPL,与可在多次运行轨迹之间保留历史、记忆、技能、提示词和子智能体规范的持续型 harness 结合起来。递归子智能体可以直接通信,Agents View 则允许人工检查和管理由后台服务支持的会话。该系统统一执行、恢复、验证和资源核算,同时将

中消协发布消费提示:使用人工智能服务需谨防误导

中国消费者协会提醒消费者,不应仅依据生成式人工智能的回答,对价格费用、合同条款、售后服务或法律责任等重要事项作出决定。人工智能生成内容可能包含不准确的费率信息、难以兑现的赔偿承诺或错误的法律建议。重要信息应通过经营者官方渠道、合同文本、监管部门及其他权威来源进一步核实。部署人工智能客服的经营者仍须对相关答复承担责任,不能以“自动生成”或“算法回复”为由规避法定义务。中消协还要求相关企业加强内容审核

字节跳动发布“豆包工作”,深度打通飞书

字节跳动发布面向生产力场景的 AI Agent 产品“豆包工作”。该产品可根据用户目标拆解任务、调用工具,并持续推进复杂工作流程。通过与飞书深度整合,豆包工作可在用户授权范围内调用聊天记录、文档、会议纪要和日程等企业上下文,以完成内容生成、数据分析、资料整理等工作。它支持创建和编辑文档、表格、PPT、图片、视频、网页及应用,也能操作浏览器和电脑。需要长时间运行的任务可交由云电脑继续执行,即使用户设

英特尔推出 Crescent Island AI 推理加速卡,最高支持 480GB 内存

英特尔在 Hot Chips 2026 详细介绍了 Crescent Island GPU 加速卡,主要面向 AI 推理和智能体 AI 工作负载。该卡采用风冷设计,额定功耗为 350W,使用 PCIe Gen5 x16 接口,配备 32 个 Xe 核心和 32MB 统一 L2 缓存。英特尔自有版本搭载 160GB LPDDR5X 内存,合作伙伴版本最高可支持 480GB。基于 Xe3P 架构的 C

同一代理,不同答案:审计检索增强问答中由语料库变化引发的答案波动

一项研究发现,检索增强问答系统扩展索引后可能生成不同答案,即使模型标识符、提示词、检索策略和生成设置均保持不变。研究人员提出“快照兼容性审计”,用于区分同一快照重复运行时的正常差异,以及不同索引版本带来的变化。在一项针对400道 Natural Questions 题目的预注册研究中,额外的语义答案波动达到10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。TriviaQA也出现幅度较小