并非所有提示词都相同:面向多模态强化学习后训练的探索引导式提示词支架
一项研究提出了一种方法,在多模态大语言模型的强化学习后训练过程中动态调整训练提示词的分布。探索潜力评分(EPS)利用在线策略回滚统计数据,估计提示词能够提供的学习价值。该方法不直接丢弃低价值提示词,而是让教师模型在保留原始任务意图的前提下进行改写,从而产生更有信息量的训练信号。与GRPO结合后,该方法在Geo3K和MMK12上均超过基线,域内相对提升最高达9.7%,在MathVision和MMMU
AI 新闻中心 过去一年分析了 1376 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究提出了一种方法,在多模态大语言模型的强化学习后训练过程中动态调整训练提示词的分布。探索潜力评分(EPS)利用在线策略回滚统计数据,估计提示词能够提供的学习价值。该方法不直接丢弃低价值提示词,而是让教师模型在保留原始任务意图的前提下进行改写,从而产生更有信息量的训练信号。与GRPO结合后,该方法在Geo3K和MMK12上均超过基线,域内相对提升最高达9.7%,在MathVision和MMMU
PhysBrain 1.5 是一个用于理解物理环境、生成动作和预测未来状态的统一模型。它将语言响应、末端执行器运动和视觉目标编码为离散序列,并通过自回归下一词预测进行联合训练。预训练完全采用人类交互视频,随后使用人类示范、机器人轨迹和模拟经验进行监督微调。作者称,这个拥有80亿参数的开源模型在28项具身理解基准测试中平均得分72.5,并在其中14项取得开源模型最佳成绩。这些性能数据属于作者报告,仍
四川省眉山市永丰村一处300亩水稻试点田首次采用水稻专用AI大模型进行田间管理。无人机负责采集农田数据,系统在插秧、水肥调控和病虫害预警等环节提供建议。专家按照规范测产,三个核心品种的亩产达到826.8至863.6公斤。试点田亩产较2023年提高152.6公斤。研究人员表示,良种、栽培技术与AI精准管理相结合,可能形成可向其他地区推广的增产技术路径。
LLaDA-UI 是一个拥有 167 亿参数的 GUI 智能体,将混合专家架构与分块扩散生成相结合。该系统先进行多模态预训练,随后使用移动端、桌面端、网页界面和视觉定位数据进行有监督微调。在多项定位与导航基准测试中,LLaDA-UI 的表现超过 Qwen2.5-VL-7B,并在报告的六项 GUI 基准中的四项超过 Qwen3-VL-8B。研究结果表明,分块扩散可以成为多模态 GUI 智能体的一种实
Attention-DP3是一种三维扩散策略,旨在帮助机器人在物体遮挡、混杂且干扰物较多的操作场景中识别与任务相关的几何信息。该方法首先对RGB图像进行开放词汇二维分割,再利用经过标定的相机几何将目标物体掩码提升到三维空间。其三场注意力条件机制分别强调目标物体、目标内部与任务相关的区域,并抑制背景和干扰物。 在Adroit、DexArt、MetaWorld以及真实SO101平台上的实验显示,该方法
BVB,即 Blender-VideoBench,用于评估多模态智能体能否通过编程,将现实世界视频重建为带动画的 Blender 场景。所有智能体都在相同的沙盒环境中完成重建,评测指标包括保留视频时空事实的能力,以及与原始视频的感知相似度。在来自 10 个模型系列的 51 种配置中,最佳模型的潜在相似度达到 88.6,但仅保留了原视频正确时空答案的 53.7%。增加推理过程可以提升视觉相似度,却无
该研究提出“发现基础模型”,这类 AI 系统不仅能够利用现有知识进行推理或解决人类定义的任务,还能参与提出新问题、构建新表示、形成假设并创造知识。其框架 Zetema 维护可修订的研究状态,验证证据、控制实验,并跨任务持续改进发现能力。GALILEO 将干实验室推理、机器人和实际湿实验室实验、外部生物学证据以及反复的假设修订结合起来,应用于治疗研究。研究还提出了超越最终答案准确率、训练和评估发现过
Dream-RSI 是一个用于可扩展、递归式改进自主 AI 智能体探索策略的框架。它将历史发现树构建为回放模拟器,使策略能够通过即时、低成本的离策略反馈进行评估和优化,而无需反复执行昂贵的在线评估。改进后的策略会重新部署,以推动后续发现,形成持续自我改进的循环。在算法工程、数学优化和 GPU 内核工程测试中,Dream-RSI 在多个场景下取得了具有竞争力或更高的发现质量,同时显著降低了发现成本。
Omni-Streaming Thinking(OST)是一种让模型持续处理视频和同步音频的方法。它将视觉与听觉证据分开保存,先把结论标记为待验证,并在未来证据出现时进行检查。检测到矛盾后,系统会降低相关结论及其依赖状态的影响,再依据新证据更新模型状态。研究人员使用轻量适配的 Qwen3-Omni-30B-A3B-Instruct 进行测试,报告称 OST 在五项流式和视听基准测试中平均超过开放基
蚂蚁集团 AI 安全实验室开源了大模型内生式安全护栏技术 SingProbe。该技术不依赖外挂式安全审核,而是复用模型推理过程中的隐藏状态,在不足 0.5% 额外计算开销下进行 token 级实时风险评估。SingProbe 支持意图分类、安全检测和幻觉识别,并可在内容输出前以毫秒级速度阻断风险结果,面向医疗等高风险场景。蚂蚁集团称,该技术已适配 29 个主流大模型,同时发布了开源代码和预训练模型
SemiAnalysis 的 Bryan Shan 表示,在使用 1.6 万亿参数 DeepSeek 模型进行推理测试时,Vera Rubin NVL72 的每兆瓦代币吞吐量最高达到 Blackwell 的 7 倍。这一结果高于英伟达首席执行官黄仁勋此前针对 1 万亿至 3 万亿参数大语言模型提出的 3 倍性能优势估计。相关数据来自分析报告,尚未被证明是经过独立验证的行业基准。
“HardFlow”算法有望帮助生成式人工智能模型生成高质量输出,同时遵守严格要求。该方法面向那些仅仅做到“基本正确”仍然不够的应用场景。
一份技术报告提出了 Pelican-Sim 1.0,这是一种根据视觉上下文和机器人动作预测未来观测结果的世界模型,用于支持后续学习和决策。其 28 维统一动作表示可适配多种机器人形态。系统结合渲染动作视频、稀疏混合专家层,以及经过蒸馏的四步生成流程,以提升可控性、视频质量和生成速度。模型使用约 100 万条真实和模拟轨迹进行训练,在多个机器人基准测试中超过了所评估的基线模型。在 RoboTwin
ReactHuman是一项用于评估多模态大语言模型能否控制人形机器人及时、安全应对突发物理危险的基准测试。它涵盖17类事件和1,000多个可复现场景,并通过240Hz刚体模拟生成精确的标准答案。每次反应根据合理性、安全性和物理依据三个维度,以五项指标进行评分。对7个具有代表性的MLLM进行评测发现,模型大约会错误处理三分之一的危险情境。它们经常依赖固定的行为倾向或物体外观,而不是观察到的运动;即使
该研究提出了 TRACE,这是一个用于理解火灾后环境中物体的基准数据集。TRACE 包含 2.14 万个基于真实图像的合成场景,以及从完好状态到受损状态的配对变化过程,覆盖 189 个类别中的 499 个物体身份。研究评估受损物体检测、原始状态恢复、原始材料识别、描述生成和功能推理等任务。随着损伤程度加重,现有模型的性能显著下降。研究提出的特征恢复模块在冻结主模型的情况下,将受损编码器特征映射到与