英伟达称编程智能体系统 AVO 在公开 ARC-AGI-3 测试集上取得 100% 成绩
英伟达表示,其通用编程智能体系统 AVO 完成了公开 ARC-AGI-3 测试集中 25 个环境的全部 183 个关卡,取得 100% 的成绩。据该公司技术博客介绍,完整的 AVO 智能体系统将 Claude Opus 5 的基准表现从 30% 提升至 100%。这一结果反映的是完整智能体系统的表现,而非底层模型单独运行时的表现。
AI 新闻中心 过去一年分析了 1729 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
英伟达表示,其通用编程智能体系统 AVO 完成了公开 ARC-AGI-3 测试集中 25 个环境的全部 183 个关卡,取得 100% 的成绩。据该公司技术博客介绍,完整的 AVO 智能体系统将 Claude Opus 5 的基准表现从 30% 提升至 100%。这一结果反映的是完整智能体系统的表现,而非底层模型单独运行时的表现。
英伟达的研究表明,即使底层AI模型并不擅长某项任务,通过微调和设计良好的智能体控制系统,AI智能体仍可能取得良好表现,并减少不当行为。研究结果凸显了模型之外的执行与控制架构的重要性,而不仅仅是模型本身的能力。
关键不在于选择最大的模型,而在于找到最适合自身企业的模型。许多公司从比较 Copilot、GPT、Gemini、Claude、Grok,以及 DeepSeek 和 Qwen 等中国模型开始部署 AI。但相比品牌知名度和市场潮流,与现有系统的整合能力、实际运营环境以及具体业务需求更值得重视。
Anthropic 表示,Mythos 5 现已面向 Claude Security 企业用户开启公开测试。该公司还在与服务提供商合作,将 Mythos 5 集成到防御性安全工具中。目前的公告未提供具体性能指标或独立评测结果。
一项研究对阿里巴巴、OpenAI和英伟达的三款混合专家模型进行微调,使其能够用希腊语推理;每个模型有36亿至40亿个活跃参数。准确率基准几乎没有变化,而且在这一规模下噪声很大:仅改变随机种子,得分就会波动7.7分。真正的变化体现在行为层面。基础模型在1000条推理轨迹中没有一条使用希腊语思考,即使问题本身是希腊语。经过监督微调(SFT)后,模型在约98%的题目中使用问题所用语言进行推理,语法性得到
工程师和投资者正越来越多地投入世界模型,也称为大型行动模型。这类系统旨在让机器人理解周围环境并规划行动,希望像 ChatGPT 改变写作和编程一样推动机器人技术发展。文章介绍了这一新兴的研究和投资趋势,但没有提供已经实现重大技术突破的证据。
一项研究提出了一种方法,用于衡量自动语音识别模型是否针对公开基准进行了优化,却没有相应提升通用转录能力。研究关注音频本身无法唯一确定参考文本,或音频与基准参考文本相矛盾的情况。通过参考文本不一致、遮蔽数字恢复和正字法切换三类行为探测,研究发现,表现最好的开源模型即使面对矛盾、被遮蔽或含糊的音频,也会逐字输出基准参考文本片段。机制分析表明,模型会依赖狭窄的声学线索,选择有利于基准成绩的策略,而不是忠
EXIMO是一种用于高效微调视觉—语言—动作模型(VLA)的方法,面向机器人操作任务。该方法分为三个阶段:视觉语言模型负责规划并拆解复杂的长期任务;系统利用这些规划结果收集组织化数据,并通过模仿学习微调VLA策略;最后使用残差离策略强化学习进一步优化。EXIMO旨在减少对昂贵远程操作数据的依赖,并缓解强化学习在长期任务中的样本效率问题。作者在实验中报告称,该方法在样本效率和最终性能方面均显著优于现
DeepSeek发布了一款能够理解视觉提示的实验性人工智能模型。这家中国公司表示,该模型的性能接近美国竞争对手Anthropic的先进模型Opus 4.8。不过,发布信息没有提供可独立验证这一说法的基准测试结果。
据报道,字节跳动大模型部门Seed已完成新一轮组织调整。此次重组整合了预训练数据、强化学习、推理和模型后训练团队,同时将企业级与消费级产品的模型研发分开。新设团队将统一负责多模态数据,以及新Omni模型和超大模型的预训练;另一团队则专注于强化学习,以提升模型的基础能力。此外,Seed将分别开发面向企业办公场景的Agent模型,以及为豆包、Dola等消费产品提供支持的对话模型。字节跳动目前尚未对此事
科大讯飞计划在今年全球1024开发者节上发布全新的主力通用大模型。公司总裁吴晓如表示,阶段性版本预计于8月底推出。据公司披露,该模型在代码能力和每Token成本效益方面将达到国内第一梯队水平,并在采用全国产算力训练的通用大模型中,在多项关键指标上保持领先。不过,目前尚未公布能够独立验证这些说法的基准测试结果。
OpenAI 宣布,图像生成模型 GPT-Image-2 现已支持生成透明背景的 PNG 图像。该功能可用于电商商品页、PPT 插图、贴纸素材和商品图片等场景。目前仅通过 API 提供,用户可设置 background=transparent 参数启用。OpenAI 建议不要在提示词中描述背景,并提醒用户仔细核对生成图像中的数字。
韩国 IT 巨头 Kakao 计划通过人事分割,拆分为新设公司 Kakao AI 和存续公司 Kakao X。Kakao AI 将以 KakaoTalk 和 Kanana 为核心,专注开发 AI 智能体,让用户通过聊天指令完成搜索、购买和支付等操作。Kakao 表示,拆分旨在建立适应 AI 时代的资本配置体系。Kakao X 将负责 Kakao Bank、Kakao Pay 和 SM Entert
OpenAI 已在 Apache 2.0 许可下开源 Codex Harness 的核心组件。该框架负责管理智能体循环、上下文、工具调用、事件流、故障处理和人工审批。此次发布包括命令行工具 codex exec、支持 TypeScript 和 Python 的 SDK,以及采用 JSON-RPC 接口的 Codex app-server。开发者可以将 Codex 智能体嵌入自有产品和业务流程,而不
Liquid AI与Hugging Face发布了LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B的DSpark草稿模型检查点。该方法基于投机解码,在贪心解码下不改变输出质量,据称可使GPU整体吞吐量最高提升3.18倍,端侧设备最高提升2.87倍。在端侧智能体场景中,LFM2.5-2.6B的函数调用延迟平均降低57%。使用M4 Max MacBook P