BLARM:通过融合潜在刚性运动基元从视频生成3D物体动画
BLARM是一种由视频驱动静态3D网格动画的前馈方法。给定单目视频和物体网格,系统能够生成时间上连贯的动画网格,无需显式骨架、笼状模型、蒙皮权重或绑定标注。该方法使用一组随时间变化的学习型刚性运动组件,以及将顶点分配给组件的时间不变权重来表示运动。几何特征和视频特征通过分解式时空注意力进行融合。训练过程结合轨迹重建、熵正则化和运动感知对比学习,旨在通过低维变形空间生成准确、稳定且具有一定可解释性的
AI 新闻中心 过去30天分析了 4654 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
BLARM是一种由视频驱动静态3D网格动画的前馈方法。给定单目视频和物体网格,系统能够生成时间上连贯的动画网格,无需显式骨架、笼状模型、蒙皮权重或绑定标注。该方法使用一组随时间变化的学习型刚性运动组件,以及将顶点分配给组件的时间不变权重来表示运动。几何特征和视频特征通过分解式时空注意力进行融合。训练过程结合轨迹重建、熵正则化和运动感知对比学习,旨在通过低维变形空间生成准确、稳定且具有一定可解释性的
CAST 是一种训练框架,可将任务结果转换为动作级的结构化理由,用于解释代理的操作是否有效。这些批评信息随后被用于训练和优化执行长期、交互式工具调用任务的大语言模型代理。在动态工具调用基准测试中,使用 CAST 微调 Qwen3 系列模型后,代理的可靠性得到提升。在零售任务上,CAST 的 pass^4 表现比 GPT-OSS-120B 高出超过 10 个百分点;在跨领域的远程医疗场景中,表现又提
AutoSciRub 是一个面向自主科研智能体的框架,能够在研究开始前生成针对具体任务的可执行评估规则。它将定义不充分的研究指令拆解为原子化科学目标,并结合相关文献和可用数据,制定具体且可验证的标准。评估规则可指导实验与分析;逐项验证则能发现未满足的要求,并针对性地改进研究报告及其支撑成果。在 ResearchClawBench 和 AstaBench E2E Discovery 测试中,Auto
负责 Office 与 LinkedIn 业务的微软执行副总裁瑞安·罗斯兰斯基表示,低质量 AI 生成内容已进入日常办公场景。由 AI 生成、AI 阅读、AI 摘要构成的循环,可能让信息在反复改写中逐渐失去价值。生成式 AI 可以加快初稿、摘要和信息整理,但不能自动保证事实准确、逻辑完整或产生新的洞见。企业在关键决策、数据核验和观点形成环节仍应由员工负责。LinkedIn 已推出“看起来像 AI
科大讯飞旗下词元星火发布了开源模型星火 X2.5-4B 和星火 X2.5-1.7B。两款模型原生支持最长 100 万 Token 的上下文窗口,并针对智能体、代码、数学和指令遵循等能力进行优化。据介绍,模型在国产算力平台上完成全流程训练,使用了约 20 万亿 Token 的多样化数据。在 Domux 智能家居测试集上,1.7B 模型的控制指令端到端执行正确率达到 90.3%,平均响应时间为 0.8
阿里巴巴旗下AI助手通义千问在新学期升级学习功能,并将相关功能全部免费开放。此次更新新增与教材同步的作文辅导,以及初中语文、数学精讲;拍照解题和互动讲解能力则扩展至高中、大学的数学、物理、化学。作文辅导不会直接给出范文,而是通过连续提问,引导学生分析题目、整理素材并搭建文章结构。教材讲解会结合学生已学知识,帮助理解新概念。学生在理工科推导过程中遇到疑问时,也可以随时追问某一步的依据,系统会根据问题
AI初创公司Mirage于8月11日在X上播出了一档号称“直播”的24小时新闻节目。据称,这次实验消耗了约5万美元的代币。节目使用了外形逼真的AI虚拟人,但它们在自然对话方面表现不佳。报道分析了这次AI连续直播实验的效果、问题和成本。
本文研究在人类监督逐步退出学习闭环后,大型推理模型(LRM)如何继续提升。对于数学和编程等结果可自动验证的任务,利用可验证奖励的强化学习已经显著改善了推理能力;但在开放式任务和智能体任务中,可靠奖励更难获得。研究分析了两个相互关联的方向:从逐个实例的人类判断转向可复用的验证器和无需人工反馈的奖励,以及从人工策划的任务和环境转向模型自行生成的课程、构建的环境和自主协同进化。L0至L4的五级框架用于标
总部位于新加坡的AI代理实验室Manus宣布,在Meta收购交易告吹后恢复独立运营。该交易据称估值约20亿美元,但随后被中国有关部门依据外资安全审查机制叫停,双方开始进行业务、数据和运营分离。Manus表示,创始团队将继续负责公司发展,并专注于能够处理复杂任务的自主AI代理。公司下一阶段将加强产品与日常工作流程的融合,提升与现实世界的互动能力,并更主动地代表用户执行任务。分拆过渡期间,Manus完
本研究探讨功能向量能否跨语言引导大语言模型完成任务。研究人员从上下文示例中提取潜在任务方向,并将其应用于多语言、多标签情感识别。由源语言提取的功能向量在其他语言中也能显著提升性能,包括推理时不提供示例的零样本设置。结果表明,功能向量捕捉的可能是与语言无关但与任务相关的信号,而不只是特定语言的词汇模式。研究还发现,每个模型用于构建有效功能向量的最佳注意力头范围相对稳定,并且在不同语言之间保持一致。该
PaperGym 是一个将科学论文转化为完整训练环境的框架,用于训练生成研究计划的 AI。它根据论文的研究目标和背景生成问题,再从方法和实验中提取评估标准,从而减少模型仅靠改写内容获得奖励的情况。标准泄漏率降至 3.7%,而现有数据集为 11.90% 至 34.10%。在 Qwen3 模型上训练后,五项基准测试的平均成绩最高提升 5.6 分。研究团队还发布了包含 2 万个样本的 PaperGym-
一项研究分析了 On-Policy 蒸馏(OPD)提升语言模型性能的原因。研究人员发现,教师模型提供的逐 token 监督信号存在大量噪声,而且教师模型规模越大,噪声比例越高。然而,即使移除这些噪声信号,学生模型仍能达到相近的性能。研究表明,性能提升主要来自对低对数概率 token 的学习。因此,使用单一固定的负优势值,也能取得与教师信号相近的效果。基于这一发现,研究团队提出了无需教师模型的 On
腾讯在四个月内完成大语言模型与多模态团队重组,并推出混元4。该模型据称拥有7700亿参数,支持最长达100万Token的上下文。分析认为,混元4融合了DeepSeek的稀疏注意力机制DSA、智谱IndexCache的跨层索引复用方案,以及更简化的恒等超连接设计。来自竞争对手公司的资深研究人员加入,也推动了相关研发。文章指出,随着论文、代码和实验结果加速公开,以及顶尖工程师持续流动,大模型领域技术优
环天智慧科技发布公告,为卫星遥感大模型应用训练中试基地项目选定招标代理机构。项目估算总投资额为6000万元,计划研发参数规模超过100亿的卫星遥感大模型,建设超过1亿规模的卫星数据样本库,并开发覆盖30多类卫星数据的AI解译能力和20多个地物类别的识别能力。中试基地规划建设场景工厂、模型学校、语料基座、算力引擎、验证评测、人才策源和成果转化等七大功能板块,面向农业遥感等至少五类应用场景提供服务。目
分析师郭明錤称,英伟达已重启用于加速人工智能推理预填充阶段的Rubin CPX GPU项目,且设计已大幅调整,预计于2027年第一季度开始生产。据称,新芯片的算力接近标准Rubin GPU,最高功耗为2300瓦,并配备168GB HBM4内存。8颗芯片组成一个计算托盘,8个计算托盘组成一个机架模块。英伟达据称建议将Rubin CPX与标准Rubin系统按1:1配对。该平台旨在以更灵活、成本更低的方