AI 新闻中心

AI 新闻中心 过去30天分析了 912 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

自变量发布三指九自由度灵巧操作手 TwinDEX

具身机器人企业自变量发布 TwinDEX,一对三指九自由度灵巧操作手,其中七个自由度为主动自由度。一只可穿戴,用于人工采集数据;另一只安装在机器人上,用于实际部署。公司称,该系统可完全使用无本体数据训练灵巧操作策略,无需采集真实机器人的遥操作数据。根据官方公布的测试结果,TwinDEX 每小时的数据采集效率达到真机遥操作的 5.3 倍。在多任务基准测试中,使用无本体数据训练的策略据称取得了接近真机

从生产流量到后训练:构建覆盖企业请求组合的自托管大语言模型

数据驻留要求迫使企业自行托管大语言模型,但持续引入新模型而不淘汰旧模型,会扩大服务模型集群并分散有限的 GPU 资源。该方案将 200 多个内部应用的流量整合到一个模型上,并根据生产环境错误分析,围绕指令遵循、函数调用和内部任务分布三个维度进行后训练。团队分别为每个维度训练 GRPO 专家,再通过两阶段 SLERP 合并。在内部 Arena 评测中,该方案超过了总参数量为其 7 倍的基线模型,同时

人工智能自我改进的递归临界性

该研究探讨,在开发未来人工智能系统的过程中使用人工智能,何时会形成自我增强的进步。模型将人工智能能力增长率与基础研究生产力、递归反馈,以及进一步取得进展的难度上升联系起来。研究人员提出递归再生产数 R_AI,用于比较反馈强度与进步变得更加困难的速度。当 R_AI 大于1时,改进会在多个开发周期中不断累积;当其低于1时,相关影响则会受到抑制。这是一项理论性研究,不能证明人工智能已经出现快速或失控的自

大规模智能体:面向持久化智能体的感知中心架构

该研究提出了Pera,一种面向持久化语言智能体的感知中心架构。与主要解决用户指定、边界明确任务的现有系统不同,Pera旨在让智能体在长期运行环境中持续提供帮助,并适应用户需求、上下文、服务流程及周围环境的变化。其感知和控制组件会持续从已执行任务、内部上下文和环境变化中获取相关信号,再据此构建生命周期任务,推动智能体持续运行与调整。作者利用该框架梳理近期研究,分析具体案例,并提出构建更强大、长期运行

Safin-1:通过记忆原生状态演化实现内在安全

Safin-1是一系列旨在将安全能力直接融入模型内部计算的基础模型,而不是完全依赖外部防护机制或训练后的对齐。其核心架构MARCH(Memory-Anchor Routing across Context History)维护结构化记忆状态,并从历史上下文中选择性检索相关信息。持久化的能力状态可以在测试时进行调整,无需反复修改模型主干,从而支持受控的专门化。使用专门Safety State的实验显

DiagEvo:通过分层错误记忆实现诊断引导的自我进化

DiagEvo是一种语言模型自我进化方法,能够从求解器自身的失败历史中分析反复出现的错误原因。分层记忆按技能节点组织这些原因,并将其标记为“活跃”或“已掌握”。系统据此生成针对特定错误的题目,同时保留自由探索机制。双重置信度过滤器只有在最常见答案具有明显票数优势时,才保留中等难度题目。使用4B诊断模型时,DiagEvo在Qwen3-4B、Qwen3-8B和OctoThinker-8B上的九项基准测

SMELT:计算量匹配的循环式 MoE Transformer 扩展定律

一项研究在混合专家(MoE)架构中评估循环式 Transformer。这类模型通过重复执行共享层块来增加有效深度,但研究在比较时匹配了每个 token 的计算量、非嵌入参数总数和 KV 缓存。研究人员提出 SMELT,让中间一半的层重复执行两次。在最大达到 540 亿个非嵌入参数的四种模型规模上,SMELT 随计算量增加呈现更快的损失下降,并在计算最优前沿节省 6.8% 至 18.0% 的训练 F

Harness-of-Harness:通过持续改进实现多日自主软件开发

该论文提出 Harness-of-Harness(HoH),一个面向大语言模型编程代理的框架。HoH 将现有代理运行环境组织为反复执行的规划、编码和测试循环,在修复问题与扩展能力之间取得平衡,并将开发拆分为可验证的小步骤,分离实现阶段测试与独立评估,同时保留带版本记录的项目历史。研究人员报告称,在 GameCraft-Bench、FrontierSWE 和 ProgramBench 上,经过三次迭

OPPO 联合多所高校推出端侧 AI 记忆评测基准 MobileMem

OPPO 联合 OpenKG,以及浙江大学、同济大学、东南大学等高校的研究团队,推出端侧 AI 记忆评测基准 MobileMem。该项目旨在建立统一标准,让不同技术方案能够进行测试、比较和改进。技术白皮书已经公开,数据集和相关工具预计将陆续开源。OPPO 认为,端侧记忆是 AI 助手持续理解用户、记住其习惯和偏好,并在合适时机提供帮助的重要基础。目前公告没有公布具体评测结果,也未提供经验证的性能提

Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索

Qwen-Drive-1.0是一款面向自动驾驶的视觉语言模型,将三维感知、视觉问答和运动规划统一到同一框架中。外部鸟瞰视角(BEV)感知头负责三维目标检测、语义占用预测和BEV地图分割,并为三维场景结构提供可检查的接口。规划模块基于共享的视觉语言模型表示生成车辆未来轨迹。分阶段训练方案结合驾驶监督数据与通用视觉语言数据,在培养驾驶能力的同时,尽量保留广泛的视觉理解和指令遵循能力。多种开放环、伪闭环

E-Commerce Bench 评估大语言模型智能体执行长期自主商业运营的能力

E-Commerce Bench 是一个开源基准,用于评估大语言模型智能体在动态年度商业模拟中的表现。智能体需要同时运营多家网店,开展市场调研,与供应商谈判,优化销售策略,处理订单和退货,并管理现金流。模拟环境包括促销活动、自然灾害和供应链冲击。研究团队从七个维度评估了18个前沿模型,结果显示没有任何模型在所有领域都占据优势。GPT-5.6 Sol 将10万初始资金增至1,431,425,期末资产

ZimaBlue通过可扩展视频预训练推进通用世界动作模型

ZimaBlue是一种利用大规模第一视角视频训练机器人世界动作模型的框架。其三阶段训练流程首先从人类和机器人视频中学习因果具身视觉动态,随后通过统一的动作表示将这些表征与异构机器人轨迹结合,最后针对目标机器人进行专门化。异步Slow-Fast架构将高容量Slow世界模型与轻量Fast分支结合,可在NVIDIA RTX 4090上以30 Hz进行动作预测。在真实机器人零样本评估中,相比仅使用目标机器