AI 新闻中心

AI 新闻中心 过去24小时分析了 194 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Rationale-Guided Policy Optimization:借助自适应推理支架学习推理

研究人员提出 Rationale-Guided Policy Optimization(RGPO),这是一种旨在解决语言模型推理训练中奖励信号稀疏问题的 on-policy 强化学习框架。该方法根据模型当前能力,将标准推理过程作为临时支架;随后,只把获得更高奖励的模型生成答案转入无引导训练。研究人员称,RGPO 在纯文本和视觉语言推理任务上的表现均优于 RLVR 基线。消融研究表明,自适应推理引导

微软描绘 Autopilot 新蓝图:Windows AI 将从“回答问题”走向“执行任务”

微软在 Surface 发布会上展示了 Autopilot 的未来方向。这款 AI 智能体将不再局限于回答问题,而是能够理解用户目标、规划步骤,并操作 Windows 及各种应用。用户可以用自然语言描述需求,AI 则负责查找信息、处理文件、配置系统或执行工作流程;用户在关键节点进行确认或干预,保留最终控制权。微软计划结合本地设备与云端能力,在响应速度、隐私保护和任务复杂度之间取得平衡。不过,高度自

Anthropic 为 Haiku 5.5 定价低于 Haiku 4.5

Anthropic 发布了 Claude Haiku 5.5,这是其最小、最实惠模型近一年来的首个新版本。对于不超过 10 万个 token 的请求,每百万输入 token 收费 0.10 美元,每百万输出 token 收费 0.50 美元。超过这一长度后,价格分别为 0.50 美元和 2.50 美元。Haiku 4.5 每百万输入 token 收费 1 美元,每百万输出 token 收费 5 美

黄仁勋:英伟达最初正是因 Windows 而诞生

英伟达 CEO 黄仁勋在旧金山一场活动中表示,Windows 95 和 DirectX 推动了早期 PC 图形技术的发展,并促成英伟达创立。在与微软 CEO 萨蒂亚·纳德拉及白宫前 AI 政策顾问斯里拉姆·克里希南的对谈中,黄仁勋称,英伟达希望将 AI 开发和应用从数据中心扩展到 Windows PC。他指出,本地处理、隐私保护和低延迟方面的需求正在增长。