AI 新闻中心

AI 新闻中心 过去30天分析了 4644 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

代理框架与模型协同进化:在模仿失效时,在线策略纠错帮助较弱模型追赶

代理框架包括系统提示词、工具、执行钩子和上下文管理,对代理任务的成功率有重要影响。在七项企业代理任务中,自动进化的框架让较小模型以远低于前沿模型的成本取得了良好表现。但使用强模型专家的完整执行轨迹训练较弱模型后,性能反而下降了4至30个百分点。原因是较弱模型模仿了专家的规划策略,却缺乏执行该策略的能力,同时破坏了与原本依据其规划风格设计的框架之间的适配关系。研究人员提出一种在线策略纠错流程:由元级

蚂蚁国际携手 Visa、万事达卡共同开发 AI 支付新标准

蚂蚁国际、Visa 和万事达卡正合作制定 AI 智能体执行支付时使用的统一标准。三方提出的“Know-Your-Agent(KYA)”框架,旨在帮助卡组织、数字钱包、智能体平台和在线市场,在保留各自审批与风险管理流程的同时,跨支付生态识别并接入可信 AI 智能体。框架包括运营方可追溯性、统一的安全与行为评估,以及持续交易监控。三方将通过新加坡金融管理局召集的 BuildFin.ai 平台,探索让各

宇树科技股价跌破500元,较上市首日高点蒸发超2400亿元市值

中国机器人制造商宇树科技股价9月10日首次跌破上市后的500元关口,盘中最低跌至499元,随后报499.97元,跌幅超过2.7%。公司总市值降至约2022亿元,较上市首日高点减少超过2400亿元。宇树科技于8月19日以150.80元发行价登陆科创板,开盘价一度达到1100元。公司2026年上半年营收为11.52亿元,归母净利润为2.74亿元。不过,受研发、销售等期间费用增加影响,扣非后净利润同比下

Shield AI谈业务计划

美国国防初创公司Shield AI联合创始人兼总裁布兰登·曾谈到了公司的增长战略和扩张计划。随着公司加大在亚太市场的布局,Shield AI正扩大当地业务和产品服务。曾接受彭博社节目《亚洲交易》的海迪·斯特劳德·瓦茨独家采访。

高德回应“黑名单”传闻,推出 AI“避雷指南 1.0”

针对外界流传的“黑名单”传闻,高德推出了 AI“避雷指南 1.0”。该功能从营业时间、行程节奏、停车提示、拥挤预测等 15 个维度分析出行计划,提前提示白跑、堵车和行程延误等风险。用户可以在高德地图 App 中与 AI 对话,询问前往特定地点时需要注意的问题。据 IT之家测试,目前该功能并不是餐饮店、景点、酒店或停车场的公开负面榜单,而是一个对话式 AI 服务。

小米推出米家智能净烟机 3 Max:AI 自动控烟,补贴后售价 4599 元

小米在中国推出米家智能净烟机 3 Max,并同步发布配套的定时燃气灶。净烟机官方指导价为 5999 元,叠加政府补贴后售价为 4599 元。小米称,该产品通过 300 万像素摄像头和视觉 VLA 模型识别烹饪油烟变化,并自动调节吸力。设备还支持燃气、烟雾和 PM2.5 监测、溢锅提醒,以及与兼容米家燃气灶联动自动关火。官方公布的参数包括最高 17.5m/s 风速、1700Pa 最大静压和 59dB

小米推出米家 AI 智控灶 3 Max:5200W 火力并新增离灶检测雷达

小米在中国推出米家智能燃气灶 3 Max,京东售价 2704 元,叠加政府补贴后为 2299 元。产品主打 AI 防干烧和离灶看护功能。右侧灶具配备贴近锅底的温度传感探头,可识别干烧、空烧等情况,并自动关火断气。新增雷达可覆盖灶台前方 0.9 米范围,用户离开 30 分钟后发出蜂鸣提醒,60 分钟后自动熄火,也支持通过米家 App 远程提醒。左右灶均支持 1 至 180 分钟独立定时,右灶还可显示

仅凭分数无法证明发现:用于审计人工智能研究代理的发现认证协议

人工智能研究代理结合已有知识、公开信息和实验反馈来产生结果。发现认证协议(DCP)将关于这些结果的主张转化为可执行的恢复测试和反馈测试。在 SQLite 优化和虚拟催化剂控制的两项受控审计中,96 个实验周期均未观察到恢复,恢复率上限为 0.0468。配对研究中,真实反馈带来了 30 次恢复,而中性策略下为零;配套的零假设校准研究也通过。一个不使用大语言模型的确定性验证器能够根据冻结证据复现判定结

RESCUE-BENCH:面向关系感知型多方情绪支持对话系统的评测基准

该研究提出RESCUE,用于评估大语言模型在多方情绪支持对话中的表现。数据集来自真实的伴侣和家庭访谈,包含191个样本、7,079个标注对话轮次和1,064.8分钟视频。RESCUE设置了六项任务,评估模型理解人际关系动态以及提供关系敏感型支持的能力。对10个语言模型的实验显示,现有模型在处理局部情绪或干预线索时表现相对较好,但在关系模式预测、观点预测和支持策略预测等依赖关系理解的任务上仍存在明显

难度自适应树结构策略优化扩大RLVR的推理覆盖范围

基于可验证奖励的强化学习(RLVR)能够提升大型推理模型的单次回答准确率,但往往难以扩大以pass@k衡量的内在解题覆盖范围。研究提出DATPO,通过难度自适应树搜索、句子熵引导的分支,以及鼓励兄弟路径多样性的优势项,优化训练阶段的rollout。在数学推理基准测试中,DATPO尤其在pass@k上优于基线方法,并进一步提升了测试时扩展的性能。

Φ-Bench:评估大语言模型能否开发支撑自身运行的基础设施

Φ-Bench 是一项用于评估大语言模型开发和优化 LLM 基础设施能力的基准测试。不同于主要关注孤立内核、预定义算子或既定优化目标的现有基准,Φ-Bench 覆盖整个基础设施栈中的开放式长期任务,从内核级函数补全到端到端系统的实现与优化。针对前沿 LLM 的实验揭示了它们在复杂基础设施工程方面的当前能力与局限,也反映出实现未来 AI 基础设施自主优化仍需解决的挑战。

Show-Harness:仅凭 VLM 智能体即可操控机器人

Show-Harness 是一个通过紧凑语义接口,让视觉语言模型(VLM)控制机器人的框架。VLM 负责选择离散的语义动作,针对具体机器人设计的解释器则以确定性方式将其转换为实际动作。该方法支持利用前沿闭源 VLM 进行零样本机器人控制,也能通过数小时的 GPU 微调,使小型开源 VLM 用于低成本部署。其 GUMI 接口还允许人类和智能体通过图形界面收集演示数据,无需专用遥操作硬件。实验显示,该

OpenAI新董事警告:失去对AI的控制可能造成灾难性后果

曾负责OpenAI对齐研究的保罗·克里斯蒂亚诺加入OpenAI基金会董事会后警告,人类可能在短期内以灾难性且不可逆的方式失去对先进AI系统的控制。他表示,如果没有更强的对齐机制就开发超级智能,可能导致大多数人死亡。克里斯蒂亚诺呼吁加强国际协调,制定共同安全标准,透明分享风险及缓解措施,并在必要时放慢开发速度。他强调,加入董事会并不代表支持或批评OpenAI目前的安全做法。他还指出,强化学习可能促使