StreamOPD:采用时空线索门控的流式视频理解后训练方法
StreamOPD研究在不增加推理时记忆、检索或压缩的情况下,仅通过后训练提升流式视频理解能力。该方法结合可验证的流式视频数据、思考模式下的在线策略蒸馏,以及指令模式部署。StreamingBench成绩从77.9%提升至83.9%,与9B教师模型的差距缩小到0.3个百分点以内。其扩展方法ST-CueGate利用教师模型针对时空线索的信号重新调整蒸馏权重,并在多个基准测试中取得改进。在线策略自蒸馏
AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
StreamOPD研究在不增加推理时记忆、检索或压缩的情况下,仅通过后训练提升流式视频理解能力。该方法结合可验证的流式视频数据、思考模式下的在线策略蒸馏,以及指令模式部署。StreamingBench成绩从77.9%提升至83.9%,与9B教师模型的差距缩小到0.3个百分点以内。其扩展方法ST-CueGate利用教师模型针对时空线索的信号重新调整蒸馏权重,并在多个基准测试中取得改进。在线策略自蒸馏
小米集团 CFO 林世伟在业绩电话会上表示,MiMo 将于近期推出首款个人桌面应用,帮助用户在一个平台上完成办公和生活任务。新一代 MiMo 模型也正在训练中,可能很快发布。MiMo Token Plan 已开始贡献收入,且增长较快,但小米 AI 业务仍处于大规模投入阶段,暂时不会把商业化作为主要目标。小米称,MiMo V2.5 在今年 7 月于 OpenRouter 的周度和月度调用量均排名第一
阿里巴巴表示,其新推出的开源多模态模型Qwen3.8-27B在发布数日内下载量已超过100万次。这款规模相对较小的模型可供客户在个人电脑上运行。阿里巴巴称,该模型已成为公司增长最快的模型之一。
Prior Labs开源了三个旨在推动关系学习研究的软件组件。RelArena-α在RelBench v1上统一了数据加载、评估协议、调参流程和基线模型比较。TabPFN-Rel是为TabPFN-3打造的关系学习工具,目前在RelArena-α的模型排名中位居第一。相关结果进一步表明,在现实任务中,将关系数据库展平为单一数据表,仍可能与专门的关系架构保持竞争力。模型无关的关系预测接口RPI则让研究
MOSS-VL 是一个面向实时交互的开源视觉语言模型系列。其解码器通过门控交叉注意力,在生成语音的同时处理输入视频帧。研究团队构建了合成交互语料,用于训练模型判断何时说话、保持沉默或修改回答。MOSS-VL-Realtime 在四项流式评测中的三项上,取得开源模型的最佳平均成绩;在 OmniMMI Proactive Alerting 上得分 66.0,明显高于最佳基线的 37.5。该模型拥有 1
该研究推出 AutoResearchEval,评估来自 7 个科学领域、覆盖从提出想法到同行评审完整科研流程的 100 项真实任务。研究团队使用 8 种模型与智能体框架组合,生成了 800 条科研智能体轨迹,并进行流程级标注。在此基础上,研究者提出 ARFT,归纳出 45 种有实证依据的失败模式。即使是测试中最强的模型,也经常无法核对输出是否与所找到的证据一致,无法修正缺乏支持的结论,也不会质疑所
研究人员提出了一种即插即用接口,使基于三维运动预训练的运动语言模型(MoLM)能够处理二维运动输入,无需修改或微调原始模型。该方法针对从单目视频中获取精确三维运动困难的问题。在公开数据集上的实验表明,该方法在多个MoLM上的表现可与三维输入相当,并优于仅使用二维运动从头训练的模型。研究团队还构建了真实单目视频运动评测数据集和视频适配器,并公开了相关代码。
据报道,中国AI公司演语科技已启动香港IPO筹备工作,最新一轮融资估值最高达30亿美元。公司从图像模型社区LiblibAI起步,逐步发展为整合多款基础模型的多模态创作平台,并推出设计类AI Agent和覆盖脚本、分镜、视觉生成与剪辑的AI视频工具。演语科技不直接研发基础模型,而是整合第三方模型能力,通过会员订阅、积分和API套餐实现商业化。这种“中间商”模式面临用户迁移成本低、大型科技公司加速入局
Vercel Labs 已在 GitHub 开源实验性编程语言 Zero,定位是供 AI Agent 使用,而不是主要供人类编写。Zero 将程序语义图作为核心源代码,Agent 通过查询图并提交带有哈希值和预期状态的 patch 来修改程序。编译器会先验证目标节点是否仍处于读取时的状态;如果不匹配,就拒绝写入。文本文件只是方便人类查看的投影,目标是让 Agent 的编辑比基于行号的修改更可靠。项
HiFi-BRep是一种用于生成计算机辅助设计(CAD)边界表示(B-Rep)的深度学习框架。它针对现有方法中的潜在空间填充噪声、特征污染、序列生成误差累积,以及训练与推理不匹配等问题进行改进。拓扑感知编码器通过可学习查询构建更高保真的潜在表示,单阶段解码器则并行预测几何与拓扑,并将可微分的流形约束纳入训练目标。作者报告的实验显示,该方法在结构有效性和几何保真度方面均优于现有先进方法。代码和模型已
由哈佛大学和麻省理工学院牵头、OpenAI 与 Google DeepMind 等机构参与的团队推出了 MatrAIx 系统,用于通过最多 83 亿个 AI 智能体模拟人类行为。该系统从 1,290 个维度对不同背景和生活方式的人群进行建模。智能体可以填写问卷、与客服聊天、浏览网页和操作应用。包含 400 次测试的对照研究显示,智能体在 91.5% 的情况下表现出正确特质,或在无关时正确抑制该特质
AnyTalk是一种为任意角色生成3D语音动画的方法,无需动画数据或繁琐的绑定与重新建模。该系统利用角色渲染图像,将预训练的视频扩散模型适配到目标角色,再通过估计blendshape参数,将生成的说话头像动作转换为3D动画。该方法可针对不同面部网格和blendshape配置生成唇形同步动画,并减少人工工作和数据需求。研究团队还将AnyTalk蒸馏为支持实时运行的AnyTalk_RT版本,代码已公开
一项针对开放权重语言模型的研究,探讨潜在信息如何转化为模型能够报告的形式。研究人员使用雅可比透镜,在共享相同上下文的基准任务上进行测试,未发现预测中的独立“闸门”机制。相反,注意力机制会在模型中等深度的区域聚集信息,使变量能够在查询位置被读取。这种效果取决于任务需求,并在两种不同架构中出现在相近的相对深度。研究定位了变量变得可读的位置,但没有揭示信息传输的完整路径。研究还指出,探针测得的可见性并不
HarnessEval-W 是一套面向世界模型的智能体评估流程。它不再只输出单一分数,而是将每个评估问题拆解为可测量的子问题,并为各个子问题配置具有专属上下文和诊断工具的专业子智能体。上级智能体会验证收集到的证据并生成最终结论,从而形成透明的证据树。该方法在 18 个代表性世界模型的 330 个评估案例上进行了测试,判断结果与人类偏好高度一致,同时能够细致诊断物理规律、因果关系和世界状态演变方面的
ConceptFormer 是一个用于视觉文档检索的研究框架,也是多模态检索增强生成的重要组成部分。该方法将与查询相关的证据表示为由查询条件化的连续潜在概念,在不依赖文本中间表示或直接视觉标注的情况下,连接局部视觉证据与语义相关性。训练过程中,强大的视觉语言模型会动态确定潜在概念标记的数量,并利用这些概念指导嵌入空间学习。在多个视觉文档检索基准测试中,ConceptFormer 的平均 NDCG@