FrameMorrow利用面向未来的Token选择长时段视频生成所需帧
FrameMorrow是一种用于长时段视频生成的历史帧选择方法。它不再只根据当前内容判断历史信息是否相关,而是预测一组代表未来信息需求的少量“前瞻Token”,并利用这些Token从生成历史中筛选有用帧,从而减少冗余上下文。由于该方法处理显式视频帧,而不是特定模型的内部状态,因此可以较低的额外推理成本集成到不同生成器中,包括闭源模型。在五个基准测试和11个生成模型上的评估显示,FrameMorro
AI 新闻中心 过去24小时分析了 161 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
FrameMorrow是一种用于长时段视频生成的历史帧选择方法。它不再只根据当前内容判断历史信息是否相关,而是预测一组代表未来信息需求的少量“前瞻Token”,并利用这些Token从生成历史中筛选有用帧,从而减少冗余上下文。由于该方法处理显式视频帧,而不是特定模型的内部状态,因此可以较低的额外推理成本集成到不同生成器中,包括闭源模型。在五个基准测试和11个生成模型上的评估显示,FrameMorro
这项研究分析了基于 token 的检测器难以发现的 AI 生成科学论文缺陷:各部分看似合理,但连接它们的科学推理可能存在断裂。研究团队提出六项衡量指标,并构建 SciSlopBench,收录 390 篇 AI 生成论文,每篇都配有研究问题和贡献类型相近的人类撰写论文。这些指标在 85.9% 的配对中识别出 AI 论文,高于 Binoculars 的 68.7%。科学缺陷越多,ICLR 评分往往越低
基于评分标准的强化学习按单项要求评估开放式回答,但评审有时会在回答缺少所需信息时仍然给分。研究团队将这一问题称为“空洞给分”,它甚至可能反转回答在 GRPO 中的优势。MetaRubric 只在回答提供充分证据时才给分,并利用当前策略生成的回答及反事实任务变体调整评分标准。在多个基础模型上,与使用静态评审的 GRPO 相比,MetaRubric 将 PubMedQA 准确率提高了 6.00 至 2
一项研究在三个领域测试了 12 种智能体模型,考察产品、酒店或论文的来源如何影响选择。模型始终偏好某些来源,并回避另一些来源。在约三分之二的比较中,如果更符合要求的选项来自不受偏好的来源,模型反而会选择来自偏好来源、少满足一项要求的选项。隐藏来源信息会削弱这种影响;将选项标记为来自偏好来源则会提高其入选率。研究认为,这种偏好可能源于训练过程中形成的捷径,以及信息缺失引发的先入之见。补充缺失信息,或
瑞典轴承制造商SKF发布了一则广告,以AI生成已于1990年去世的演员葛丽泰·嘉宝的形象。图像制作使用了字节跳动的Seedream 5 Pro和谷歌的Nano Banana Pro;动作生成则使用Seedance和快手的可灵AI等工具。声音根据获得授权的历史录音重现,并由演员协助调整语速和语调。SKF表示,生成形象时没有使用档案照片或历史影像。该项目与嘉宝遗产管理方及家属合作完成。广告评价褒贬不一
Axios 报道称,Reflection 等多家西方企业计划于本月发布开放权重 AI 模型。此类模型支持本地部署,对微调和推理数据安全要求严格的行业具有重要优势。据称,Reflection 的模型初期预计不及美国最先进的闭源模型,但有望与中国顶尖开放权重模型竞争。Reflection 拒绝置评,目前正寻求扩充服务所需的算力。
DRAM制造商南亚科技宣布,将投资在屏东科学园区设立3D晶圆封装测试厂。新厂将导入硅通孔(TSV)、晶圆堆叠等技术,建设晶圆级封装与测试的一体化制造能力,以满足AI应用带动的高性能、高带宽内存需求。报道推测,新厂可能瞄准类HBM内存解决方案,但尚未确认是否获得AI芯片订单。
据报道,Anthropic 前研究员雅各布·考克斯恩应纽约市议会议长朱莉·梅宁的邀请,将出席一场有关人工智能的听证会作证。市议员目前正在审议一揽子法案,拟为这项技术制定保障措施。考克斯恩上月离开 Anthropic,并警告称,人工智能可能在本十年末前导致人类灭绝。他还指责前雇主 Anthropic 和 OpenAI 将人们的生命置于危险之中。
Change.org表示,将投入1亿美元自有资金,以AI重建其核心请愿平台。该组织还推出了面向请愿发起人的AI助手测试版。Change.org最初由风险投资支持,并于2021年进行了重组。
零样本文本转语音(TTS)可根据一段简短录音复现未见过的说话者,但通常会将说话者身份与口音混为一体。DEFINE 使用不同的音频示例分别指定说话者身份和目标口音,并可在推理时通过单一权重调节口音强度,无需重新训练。该方法基于 F5-TTS,采用参数高效的 LoRA 适配;推理时无需口音标签,也无需合成后的波形转换。在已见口音上,增强引导使口音检测器准确率从 6.5% 提升至 19.6%。对于已见及
Diptych是一套用于比较音乐录音的AI辅助系统。用户可以选择比较整首曲目,或独立选定片段进行比较,并查看结构化音频特征以及针对特定比较范围的AI解读。在一项包含12名音乐家的研究中,该系统帮助参与者发现了更多差异;其中10项发现有9项获得专家至少部分支持。参与者认为系统易于使用,并表示对可能的后续步骤更加清晰。研究结果表明,用于创意比较的AI工具应允许用户定义比较范围,提供可检查的证据和可执行
OctLLM是一种多模态语言模型,将3D几何表示为显式的八叉树占用标记序列,而不是压缩为潜在码本索引或坐标文本。其稀疏八叉树表示在保留空间和深度信息的同时缩短序列。为增加3D能力,模型采用独立的可训练分支,并冻结预训练的语言和视觉路径,因此所需训练参数远少于完整微调。研究人员称,与ShapeLLM-Omni相比,OctLLM将图像到3D的FID降低17.4%,并将基于渲染结果的描述生成提升28.7
EditHero 是一个用于评估长程部件级 3D 编辑的基准。它通过自然语言指令以及几何和纹理目标图像,测试一系列连续修改。确定性装配引擎会在每次编辑后生成精确目标,所有编辑序列也经过人工审核。研究显示,非代理方法经常无法完成指定修改,还会改变本应保持不变的区域。基于 LLM 和 VLM 的智能体通常更能遵循指令,也更好地保留未编辑部分,但每次编辑需要数分钟。研究人员计划发布该引擎和编辑序列,以支
Skill2Real是一种在仿真环境中学习机器人技能,并在无需针对具体任务微调的情况下迁移至真实机器人的框架。Proposer-Verifier-Governor循环利用仿真中的特权信息诊断结果并验证更新。系统先学习基础操作技能,再学习将这些技能组合起来完成更高层级的任务。在LIBERO-90上训练的冻结技能,在四项真实世界操作任务中的平均完成率达到78.75%。在未用于训练的LIBERO-Pro
一项研究提出递归式自我改写(RSR)方法,将模型在专用任务环境中获得的成功解法转化为适用于通用环境的训练轨迹。规划器提取操作流程并生成手册,评审器检查验证器或解答信息泄漏并指导修订,执行器则在全新的沙箱中测试合格手册。在约3,000项经过筛选的终端任务中,三种环境合计解决759项,比记录中表现最好的单一环境多34.3%。RSR将2,001条成功的源轨迹扩展为11,094条改写轨迹。使用这些数据进行