缺失的时间连接:用于脚本驱动音视频生成的Temporal Context Routing
音视频联合生成模型在画面质量和音画同步方面取得了明显进展,但对镜头切换和对白出现时间的控制仍然有限。Temporal Context Routing(TCR)将结构化脚本中的时间信息映射到音频与视频共享的时间轴上,并把提示词引导传递到两种模态中的对应位置。在200个测试脚本上,TCR将镜头边界平均绝对误差降低了96%,从1.11秒降至0.042秒;0.5秒内对白准确率则从28.3%提升至84.1%
AI 新闻中心 过去30天分析了 915 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
音视频联合生成模型在画面质量和音画同步方面取得了明显进展,但对镜头切换和对白出现时间的控制仍然有限。Temporal Context Routing(TCR)将结构化脚本中的时间信息映射到音频与视频共享的时间轴上,并把提示词引导传递到两种模态中的对应位置。在200个测试脚本上,TCR将镜头边界平均绝对误差降低了96%,从1.11秒降至0.042秒;0.5秒内对白准确率则从28.3%提升至84.1%
该研究推出了 PACE 数据集,用于评估个性化助手能否判断一个看似合理的请求是否与用户的实际情况相冲突。不同于主要关注执行指令的既有研究,PACE 要求模型从知识库中检索与用户相关的隐含事实,并结合请求识别潜在限制。研究人员还提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤来获取具有决定性的上下文证据。实验结果显示,PaceMaker 在证据检索质量和冲突判断准确率方面
LatentStream是一种面向连续视频理解的框架,旨在让多模态大语言模型在严格的因果性和有限内存条件下进行推理。与将历史视觉信息存储在外部记忆中、需要时再检索的传统方法不同,该系统会将相关证据逐步内化到紧凑的潜在工作记忆中。其层级化设计在固定内存预算下管理短期、中期和长期视觉历史。潜在记忆标记逐步扩大感受范围,以检索并整合历史证据;同时,基于预测置信度的优化机制会共同改进潜在记忆和检索信息。实
Puffin-World是一种统一的多模态架构,将物理理解、空间模拟以及3D世界生成与重建整合到单一系统中。它共同建模重力场和纬度等物理状态、由深度表示的几何结构,以及图像形式的外观。统一的Omni-Camera表示支持多种任务和灵活的相机运动。系统在生成未来视角的同时重建其底层几何结构,旨在生成物理一致且视觉稳定的世界。为扩展复杂场景的训练,研究团队构建了Puffin-16M数据集,其中包含15
Random Attention 对根据缓存 Token 未来重要性进行评分和保留的 KV 缓存压缩方法提出质疑。该方法保留提示内容,并在每个注意力头内均匀随机淘汰 Token,完全省去评分计算。在四个模型和六项推理任务上的测试显示,其效果可与此前最强的淘汰方法相当,同时在 vLLM 部署中的吞吐量提升 32% 至 43%。受控实验表明,提示是缓存中最脆弱的部分;推理轨迹则依靠文本中的重复表述以及
Terminal-Universe 从编程智能体的工具执行历史中重建可执行工作区。这些恢复的环境可用于生成可验证任务、模拟多轮交互,并创建跨多个代码库的查询。应用于公开的智能体轨迹后,该框架生成了3.73万个可用于任务的环境。使用这一语料库对 Qwen3.5-27B 进行监督微调后,模型在 Terminal-Bench 2.1 的单轮性能提升了11.9分,在 EvoCode-Bench v2 MT
一项研究在数据极简条件下分析在线策略蒸馏(OPD),仅用一个查询训练模型。单查询 OPD 在数百个训练步骤中仍持续改进,并在多个任务领域和模型系列中恢复了完整数据训练的大部分收益。一个查询即可覆盖完整数据 OPD 所访问状态的 71.5%;加入 16 个语义多样的查询后,覆盖率达到 98.9%,性能与完整数据训练相当。研究人员认为,OPD 的主要瓶颈不是数据不足,而是学生模型吸收教师监督信号的速度
CORE将交叉注意力重排序器的细粒度组合判断蒸馏到基于MLLM的嵌入模型中。该方法构建覆盖五个组合匹配等级的候选列表,并使用Rank-KL目标函数训练嵌入模型复现重排序器的排序结果。在三个组合推理基准测试中,CORE-RERANKER-8B取得82.7%的平均分,比Jina-Reranker高10.7个百分点。CORE-EMBED-8B以0.666的总平均分,在所有评估的嵌入模型中表现最佳。这些改
中国AI 3D创业公司VAST(三启万物)宣布完成B轮和B+轮融资,合计约30亿元人民币。公司称,不到半年内累计融资已突破57亿元。投资方包括创投机构、游戏和汽车等产业公司,以及地方政府基金。VAST由曾任商汤科技员工、并以早期创始团队成员身份参与创办MiniMax的宋亚宸于2022年在北京成立。公司同步发布Tripo P2.0,主打原生四边形拓扑网格生成,并支持面数控制、局部编辑和部件拆分,目标
基准测试机构Vals AI的一项分析显示,使用开放权重模型执行构建网页应用等多阶段任务时,所需能源或用水量可能达到简单查询的1万倍。研究表明,人工智能的环境影响会随着任务复杂度和与模型交互次数的增加而显著上升。
据报道,OpenAI推出了GPT-6 Astra,具备105万token上下文窗口、多档推理强度,以及通过屏幕、键盘和鼠标直接操作图形用户界面的能力。文章宣称,Astra在数学、科学、软件工程和GUI操作基准测试中取得极高成绩;标准价格为每百万输入token 10美元、每百万输出token 50美元。产品据称将先向少数企业合作伙伴开放,随后逐步推送给ChatGPT会员和API用户。OpenAI表示
LatentPress将对话历史和长文档压缩为连续记忆标记,使冻结的语言模型能够通过输入嵌入接口直接读取,无需在推理阶段重建文本。一个与读取器匹配的小型写入器仅训练包含420万至2620万个参数的适配器,即可实现4至16倍压缩。在LongMemEval测试中,压缩7.7倍时准确率达到0.504,高于未压缩证据的0.490,也超过了基于文本摘要和OCR的压缩方法。每段对话的写入耗时约43毫秒,读取速
一项研究表明,混合式 Qwen3.8-27B 模型的全部 496 个线性层,包括 Gated DeltaNet 循环层,都可以采用 NVFP4 W4A4 量化,而不会造成明显的质量损失。在困惑度测试,以及 MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench 和最长 64K 上下文的 RULER 检索测试中,Minima 版本与 BF16 的差异处于随
LLaDA-Image 是一个统一的图像生成框架,由从零开始训练的 60 亿参数 Diffusion Transformer,以及基于扩散语言模型 LLaDA2.0-Mini 的冻结视觉语言理解模块组成。系统没有从一开始就高度依赖图文配对数据,而是先通过纯图像预训练和中期训练建立强大的视觉生成先验。训练过程使用了 2.2 亿个样本,其中包括 9800 万张真实图像。蒸馏版本 LLaDA-Image
AI科学家、谷歌研究员雷·库兹韦尔将担任硅谷初创公司Subsense的顾问。该公司正在开发一种非手术脑机接口技术,据称会使用吸入式纳米颗粒。这项技术仍处于开发阶段,其技术可行性和研发进展尚未得到独立验证。