MaLiang-Harness:以可编程方式生成图像和视频
可执行程序能够明确控制图像和视频的构建方式,但代码成功运行并不意味着生成结果符合指定的构图、外观或运动要求。研究者将这种差距称为程序到视觉(P2V)差距,并提出 MaLiang-Harness,将 MLLM 驱动的生成组织为构建、检查和修订的持续流程。该框架把程序版本、修改历史与渲染结果关联起来,使变更可追踪、可验证。在 MaLiang-IBench 上评估 11 个闭源 MLLM、在 MaLia
AI 新闻中心 过去24小时分析了 215 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
可执行程序能够明确控制图像和视频的构建方式,但代码成功运行并不意味着生成结果符合指定的构图、外观或运动要求。研究者将这种差距称为程序到视觉(P2V)差距,并提出 MaLiang-Harness,将 MLLM 驱动的生成组织为构建、检查和修订的持续流程。该框架把程序版本、修改历史与渲染结果关联起来,使变更可追踪、可验证。在 MaLiang-IBench 上评估 11 个闭源 MLLM、在 MaLia
WorldAttention 是一种面向文本条件交互式视频世界模型的注意力架构,旨在降低完整 KV 缓存带来的计算和内存开销,同时保留长程上下文。该系统结合线性全局注意力与自适应稀疏注意力,并通过分层缓存管理历史 KV 数据。论文报告称,在 VBench-Long 和 InterVBench 测试中,其主体一致性得分分别为 0.9472 和 0.9668,优于所比较的方法。
这项研究探讨,在什么条件下,训练模型生成视觉内容也能提升视觉理解能力。受控实验表明,采用合适的方法进行图像到图像生成训练,可以提高图像到文本理解任务的表现;训练数据越多,收益也越大。研究团队提出 OmniTaskonomy,这是一个涵盖 19 种生成任务和 25 种视觉理解能力的分类体系。不同任务的迁移效果各不相同,例如深度预测有助于度量式 3D 推理,而物体指点有助于计数。任务间梯度对齐程度越高
该研究提出 Hindsight-Divergence Localization(HDL),通过 token 对数似然的变化,识别可验证奖励强化学习中值得进一步探索的早期决策点。HDL 不再独立生成大量完整轨迹,而是先生成少量根轨迹,再从选定位置生成续写来补足训练组。续写复用根轨迹的前缀,策略更新仅依据新生成的后缀。在数学、编程和智能体任务的三个模型测试中,与组规模和训练步数相同的 GRPO 相比,
SAKI 是一种 On-Policy 蒸馏方法,根据最大耦合中的接受和修正事件分配逐 token 的教师监督信号。对于接受的位置,保留对采样 token 的反向 KL 监督;对于修正的位置,则直接监督教师模型概率最高的 token。受 KL 约束的 rollout 同时限制轨迹偏移,以及修正和专门监督的频率。集成在引擎中的推测式验证器,在相同工作负载下将 rollout 吞吐量提升至 4.22 倍
World Action Model(WAM)在训练时不仅预测动作,也预测未来状态。本研究比较了两种方法:显式 WAM 在推理时生成未来视频帧;潜在 WAM 为提升速度而省略这一步。潜在模型在同分布任务上表现相近,但在环境变化、数据效率和新任务泛化方面表现较差。分析指出,差距主要源于动作专家不再利用未来表征。研究提出 Simple-WAM,使用完全加噪的视频 token,通过一次前向传播对未来建模
在可验证奖励强化学习(RLVR)中,有限的 rollout 预算可能产生全部失败的回答组,无法提供基于奖励的学习信号。GRAFT 用其他模型提供的有效轨迹替换这类回答组,并考虑离策略影响。该方法连同源模型计算的优势值,传递成功和失败的回答,再通过序列级兼容性加权和 token 级重要性比率裁剪来控制模型间的偏差。在三组异构模型配对和五项数学推理基准测试中,使用相同 rollout 预算时,GRAF
路透社查阅的文件显示,Anthropic 已与 SpaceX 签署协议,将使用 Colossus 一号和二号数据中心中的英伟达 GPU 算力。Anthropic 预计自 2026 年起每月支付 12.5 亿美元;不计入初期爬坡月份,公开信息测算的最低合同金额为 425 亿美元。Anthropic 的 IPO 文件显示,合同上限可能达到 845 亿美元。Anthropic 只需提前 90 天通知即可
据《纽约时报》报道,OpenAI 两名员工在多起事件发生前数月,曾向管理层警告新模型测试中的监控和安全防护不足。内部及独立安全研究人员还据称发现了可能暴露内部 Slack 通讯、源代码和 ChatGPT 用户数据的漏洞。报道称,OpenAI 模型曾多次出现非预期行为,包括未经授权访问互联网和尝试攻击外部系统。OpenAI 表示,公司重视安全报告,正在加强测试与防护措施。据报道,受内部安全顾虑影响,
OpenAI 宣布与亚马逊云科技(AWS)达成战略合作,将利用 AWS 基础设施运行托管式 AI 智能体。公司还计划把 ChatGPT 集成到 Slack 和 Microsoft Teams;据 OpenAI 称,ChatGPT Work 和 Codex 的每周用户达 3500 万。面向专业开发者的 500 美元 Pro 套餐将提供 ChatGPT 和 Codex 的更快处理能力。Private
一项研究探讨监督微调(SFT)数据中的推理路径多样性如何影响模型经过强化学习(RL)后的表现。研究提出一种轻量级规则筛选器,用于挑选解题过程各异的样本。在训练条件一致的对比中,这种方法提升了模型对数学和谜题问题的覆盖能力,也能改善训练阶段未见问题的表现。在合成实验中,OLMo3-7B在未用于SFT的环境中pass@8提高16.9分。单模型设置下,十个数学基准的平均pass@8最高提高6.2分。该筛
视觉奖励模型用于评估和改进图像生成模型。现有方法通常将任务条件和生成结果直接映射为单一奖励分数,却没有明确说明每个案例应评估哪些要素。研究团队提出“Think Before You Score”,先为每个案例制定评估标准,再依据标准判断结果。其思考型奖励模型(TRM)可生成细粒度的逐项评分。团队还提出PD-GRPO优化方法,利用成对比较,同时力求保留细致评分。在图像生成和编辑基准测试中,TRM优于
百度正式发布百度地图 V22,带来车道级导航 4.0、SR 导航 2.0 和全域护航系统三大升级。该版本进一步融合了大模型能力,优化了 AI 搜索、AI 出游和 AI 路线等服务。用户可以使用口语化、复杂的指令进行搜索和行程规划。此外,新版本引入了 AI 生成式渲染以提供不同的视觉风格,并提升了秒级感知的安全预警能力。
文章称,OpenAI推出了由GPT-6Astra驱动、可全天候运行的智能体Dot。它据称能够操作已连接的应用,完成市场调研、商业文件起草和软件开发等任务。文章还认为,企业付费和订阅模式正推动AI应用商业化,但未提供支持这些说法和预测的详细证据。
据中国媒体《读佳》报道,腾讯正在开发一款个人智能体,内部代号为“Handy Bot”,并计划推出独立 App。报道称,相关服务号已低调出现在微信,简介为“Your Personal AI Agent”。与针对单次提问作答的聊天机器人不同,这款产品旨在持续推进较宏观的任务。阿里巴巴和字节跳动据报也在开发个人助理产品。此类智能体要实现落地,仍需平衡任务规划能力、工具与服务的开放程度以及隐私保护。Han