RISE:通过自我外推策略蒸馏实现递归改进
RISE 是一种语言模型后训练方法,可直接从模型自身的 RLVR 训练轨迹中构建合成教师模型。该方法在参数空间或输出 logit 空间中外推当前检查点与较早锚点之间的变化,从而生成密集的逐 token 监督信号,无需外部模型或特权条件信息。基于结果的奖励将外推引向正确推理,而蒸馏则改进逐 token 的决策。随着学生模型不断进步,教师模型也会持续更新,使蒸馏从一次性压缩步骤转变为递归改进机制。在数
AI 新闻中心 过去30天分析了 913 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
RISE 是一种语言模型后训练方法,可直接从模型自身的 RLVR 训练轨迹中构建合成教师模型。该方法在参数空间或输出 logit 空间中外推当前检查点与较早锚点之间的变化,从而生成密集的逐 token 监督信号,无需外部模型或特权条件信息。基于结果的奖励将外推引向正确推理,而蒸馏则改进逐 token 的决策。随着学生模型不断进步,教师模型也会持续更新,使蒸馏从一次性压缩步骤转变为递归改进机制。在数
文章声称,Anthropic旗下模型Claude证明了ζ函数的67.25%零点位于临界线上,且为单零点。文章还称,数学家Youness Lamzouri利用希尔伯特空间不等式简化了相关方法,AxiomProver则在发布后不久通过Lean完成了形式化验证。此外,文中还宣称孪生素数猜想取得进展。上述叙述高度煽情,未提供可核实的来源或独立确认。黎曼猜想目前仍是未解决问题,所谓完整的机器验证也应接受严格
研究团队推出 Iris-mini 和 Iris-pro 两个搜索代理,分别以 35B-A3B 和 397B-A17B 规模训练。其训练任务根据网页语料中的多跳超链接结构生成,并专门设计为无法通过简单的字符串匹配解决。研究采用监督微调与强化学习相结合的方法,优化代理的实时搜索和上下文管理能力。启用上下文管理后,作者称两款模型在 BrowseComp、BrowseComp-ZH、DeepSearchQ
一项研究评估了层 Dropout(也称随机深度)在大语言模型训练和推理中的作用。通过优化层的分配、应用时间表和优化器超参数,该方法可以在相同计算量下获得更低损失,并在训练步数固定时节省最多 25% 的训练 FLOPs。它还支持提前退出、中间层跳过和自推测解码等训练后优化,在几乎不损失准确率的情况下,最高可将推理速度提升 1.5 倍。研究基于超过 2,400 次实验,覆盖参数量从 2.71 亿到 8
WorldSculpt提出了一种生成组合式3D场景表示的方法,可处理包含数百个物体的杂乱场景。该方法扩展了单物体3D生成模型Pixal3D,加入多视图条件模块,通过多个带姿态信息的观测来约束生成的物体网格。模型仅使用标准空间中的单个物体进行微调,却无需场景级训练即可推广到遮挡严重的大型场景。研究人员还推出了逼真的基准数据集UE-MeshyScene,其中包含逐物体标注和真实网格。在单物体、受控多物
英伟达首席执行官黄仁勋在 X 平台祝贺 OpenAI 发布新模型 Astra,并宣称通用人工智能(AGI)已经到来。OpenAI 将 Astra 描述为具备高度智能且符合人类价值观的模型,总裁格雷格·布罗克曼也表示 AGI 时代已经开始。人工智能研究员加里·马库斯则认为这一判断为时过早,指出黄仁勋没有提供科学定义或证据。按照马库斯提出的 10 项 AGI 标准,Astra 目前只能满足其中一到两项
OpenAI 表示,已实现打造“自动化研究实习生”的目标。据该公司称,其研究人员如今每个人类工作日使用相当于 3.1 个智能体工作日的工作量,使用量最高的用户每天在代币上的支出超过 7,000 美元。这些数据来自 OpenAI,尚未经过独立验证。该公司还表示,如果要让 AGI 惠及全人类,就必须对其实施民主治理。
在 OpenAI,编程智能体正逐渐改变人工智能研究的开展方式。文章介绍了有关智能体使用情况、实验速度、任务复杂度及其对研究效率潜在影响的初步数据。
随着食材和人工成本上涨,越来越多餐厅使用 AI 生成的食物图片制作菜单和营销材料,以降低开支。但许多消费者认为,这些图片不诱人、不自然,甚至可能误导顾客。在旧金山,AI 菜单图片已经引发嘲讽、投诉,甚至涂鸦。DoorDash 等平台提供 AI 图片编辑工具,同时会标注经过 AI 增强的图片,并禁止制作具有误导性的菜单图片。牛津大学研究发现,当消费者不知道图片由 AI 生成时,可能更喜欢这些图片;一
阿里巴巴开源了基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型 Qwen-Drive-1.0-4B。该模型在保留原有视觉语言模型架构的同时,统一整合了 3D 感知、视觉问答和运动规划。其分阶段训练方案结合驾驶监督数据与通用视觉语言数据,旨在兼顾驾驶专属能力、通用视觉理解和指令遵循能力。模型提供 SFT 和强化学习两种规划专家,评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪
我国在北京发布了可自动巡航进行杂交授粉的智能育种机器人“吉儿”具身智能版本。升级后的机器人能够识别和定位花蕊柱头,完成授粉及表型数据采集。在现场演示中,机器人使用花粉管和授粉笔配合作业,在不到 10 秒内完成一次番茄花授粉。据介绍,授粉笔一次蘸取的花粉量约可完成 50 次授粉。中国科学院遗传与发育生物学研究所团队将生物技术与 AI 结合,通过调整作物花型使柱头外露,从而便于机器人操作。机器人还需避
OpenAI 应用研究主管鲍里斯·鲍尔在 X 上表示,Astra 模型已经消除了人类过去在空间推理方面相对计算机的主要优势之一。一名独立研究员称,Astra 在其自行设计的评估中表现近乎完美。OpenAI 将 Astra 描述为高性能、高对齐模型,能够填写表格、调整文档格式、安排预约并操作软件。不过,报道没有提供独立基准测试或可验证的技术证据,相关结论主要来自 OpenAI 和个别研究者。“欢迎来
由西湖大学、西湖实验室和西湖制药联合研发的创新药艾普司韦(盐酸伊司特韦片)近日获国家药品监督管理局附条件批准上市,用于治疗成人轻型和中型新型冠状病毒感染。据研发方介绍,艾普司韦是西湖大学首款完全自主研发的中国1类创新药,也是全球首款基于DNA编码化合物库(DEL)技术获批的小分子创新药。此外,该药被称为中国首款经AI辅助研发并获批上市的原创药。从源头发现到完成临床试验,研发过程历时三年半。
据《财富》杂志记者Emily Forlini报道,OpenAI自9月3日宣布GPT-6 Astra以来,已修改多项评估基准。部分调整似乎让Astra的表现显得更有利,而其他指标在发布后仍持续修订。这些改动引发了外界对模型评估透明度和结果可比性的疑问。
研究人员开始利用人工智能了解动物之间的交流方式。生物伦理学家警告,这些技术也可能为人类操纵、剥削甚至伤害动物提供新的手段。人工智能或许能显著拓展人类对其他物种的认识,但也可能成为控制动物并助长虐待的强大工具。