Zero-WAM:从人类视频进行上下文世界动作建模,实现开放式任务泛化
Zero-WAM是一种因果视频—动作模型,使机器人能够依据人类视频示范执行训练中未见过的操作任务。研究人员构建了HumanGen数据集,通过自动化流程生成涵盖8600项任务的74200组人类—机器人上下文学习配对。在RoboTwin 2.0模拟环境中,Zero-WAM在7项未见任务上取得47.0%的平均成功率,比最强的视频—动作基线高29.5个百分点。真实世界测试涵盖多物体场景、长时序操作以及精细
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Zero-WAM是一种因果视频—动作模型,使机器人能够依据人类视频示范执行训练中未见过的操作任务。研究人员构建了HumanGen数据集,通过自动化流程生成涵盖8600项任务的74200组人类—机器人上下文学习配对。在RoboTwin 2.0模拟环境中,Zero-WAM在7项未见任务上取得47.0%的平均成功率,比最强的视频—动作基线高29.5个百分点。真实世界测试涵盖多物体场景、长时序操作以及精细
该研究提出 UrbanGround,这是一个用于评估多模态大语言模型代理在复杂城市环境中表现的测试平台。研究团队利用覆盖香港全域的三维地理空间数据,构建了一个具有物理约束的香港城市复制环境,使代理能够以第一人称视角探索城市,并通过交互式地图进行导航。研究考察局部视觉感知能否支持空间问题回答、远距离导航,以及对路线和行人运动变化的适应。当前的多模态大语言模型代理在视觉识别和短距离空间推理方面表现出一
中国国光量超人工智能研究团队宣布,将量子技术引入大语言模型的核心决策与推理流程,并推出面向科研和学术领域的“玄幂”模型系列。团队称,该模型在科研科普、任务路由和智能体决策等特定任务中,相较主流开源模型具有更深入的专业理解、更清晰的任务判断和更短的决策路径。此次公告未提供独立技术验证或基准测试结果。
该研究分析了进化策略(ES)作为一种面向大语言模型推理能力的内存高效后训练方法。与群组相对策略优化(GRPO)相比,ES能够保持更高的候选解多样性,并在Pass@K指标上取得更好表现。GRPO容易出现熵坍缩,而ES在提升Pass@1的同时,可以覆盖更多推理路径。研究提出的序列式GRPO-ES训练策略,结合了GRPO获取最佳答案的优势与ES更广泛的覆盖能力。研究还发现,尽管模型整体参数可能发生较大漂
该研究提出了一个用于生成和评估 LLM 智能体交互数据的两层框架。研究将智能体数据表示为环境、任务、交互以及可选验证器的组合,并通过 ACE 视角——准确性、复杂性和多样性——分析如何生成有环境依据、内部一致、符合特定学习者能力且不重复的经验数据。文献显示,相关研究正逐步转向基于执行结果的准确性、相对于学习者的复杂性,以及超越表面变化的数据多样性。研究指出,核心挑战并非简单增加数据量,而是在智能体
据财联社援引知情人士报道,Meta内部曾预测,未来每年用于Anthropic人工智能模型的支出最高可能达到100亿美元。Anthropic旗下Claude系列模型在长文本处理、复杂推理和企业应用方面具有一定优势。若报道属实,这一潜在支出规模将凸显大型科技公司对头部外部模型开发商的依赖,也反映前沿人工智能领域的投资规模持续扩大。目前,Meta和Anthropic均未正式证实相关说法。
谷歌已为律师事务所和银行推出专用的 Gemini 版本。两项服务目前都处于预览阶段,价格尚未公布。
一项诉讼指控埃隆·马斯克旗下的人工智能公司 xAI,使用真实及人工智能生成的儿童性虐待内容训练 Grok 模型。相关指控目前正在司法程序中处理,并不代表法院已经作出最终认定。
VGI-Bench 是一个用于评估视频生成模型视觉推理能力的基准测试,包含 27 项任务和 810 个实例,并按任务领域和技能标签进行分类。评估结果显示,当前生成系统能够解决部分基于视觉的推理任务,但整体可靠性仍然不足。即使是表现最强的模型 Seedance 2.0,按照该研究的评估标准也只达到 51.0%。研究还分析了输出失败模式、对输入条件的敏感性、合成数据微调带来的性能迁移边界,以及去噪过程
Anthropic PBC 宣布了一项新的软件标准,旨在帮助 Claude 等人工智能助手更好地与科学研究和制造业使用的机器人及硬件互动。目前这似乎仍是早期测试或标准化工作,公告没有提供具体的性能数据,也未证明该技术已在工业领域广泛应用。
Anthropic 发布了 Model Hardware Standard,这是一套帮助 AI 代理操作显微镜、量子计算硬件和机械臂等物理系统的框架。该公司表示,这项技术有望推动科学研究和制造业自动化,但同时指出,让 AI 控制实体设备也会带来新的安全风险。
WIRED 审查的代码显示,OpenAI 正在开发一项功能,让 Codex 能够主动持续工作,直到被置于休眠状态。该功能目前尚未正式公布或发布。
Prefix Sliding 研究提出了一种降低语言模型长时间推理内存成本的方法。模型不再通过完整注意力机制保留全部推理轨迹,而是仅保留包含关键指令和工具信息的前缀,以及最近几千个词元组成的窗口。这样,无论推理持续多久,内存需求都能保持在固定上限内。研究人员称,在无需额外训练的情况下,该方法可让现有模型提速最多三倍,同时保持性能。结合强化学习后,模型还能处理超过十万个词元的推理轨迹,并取得更好表现
在英伟达的财报电话会上,首席执行官黄仁勋表示,公司已经实现了人工通用智能(AGI),这是科技行业多年来追逐的终极目标之一。但几乎就在随后,他又称这一里程碑“毫无意义”。由于业界尚未对AGI形成广泛认可的定义或客观测试标准,这一说法并不能证明英伟达确实在技术上实现了AGI。
谷歌推出了 Gemini Omni 1.1 Flash。该公司称,这款模型支持工作室级视频制作,包括延展现有场景、在首帧和末帧之间进行插帧,以及将视频放大至 4K。不过,公告没有提供能够独立验证这些性能说法的证据。