过去塑造未来:自回归视频生成中的记忆
这篇综述系统梳理了自回归视频生成中的记忆机制。由于上下文窗口、存储空间和计算资源有限,实体身份、动态状态以及干预造成的因果变化等重要信息,可能在仍然相关时就离开当前上下文。文章从记忆表征、功能、操作、学习和评估五个方面归纳相关研究,并指出若干待解决问题:构建可组合且节省资源的架构、可靠地更新状态、通过闭环生成进行学习,以及制定标准化评估方法。
AI 新闻中心 过去7天分析了 224 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
这篇综述系统梳理了自回归视频生成中的记忆机制。由于上下文窗口、存储空间和计算资源有限,实体身份、动态状态以及干预造成的因果变化等重要信息,可能在仍然相关时就离开当前上下文。文章从记忆表征、功能、操作、学习和评估五个方面归纳相关研究,并指出若干待解决问题:构建可组合且节省资源的架构、可靠地更新状态、通过闭环生成进行学习,以及制定标准化评估方法。
Anthropic称,Claude从大量DNA序列数据中识别出一种尚未被完整描述的系统,由逆转录酶、邻近基因和非编码重复序列组成,并命名为ART,主要存在于噬菌体中。约950个智能体进行了持续21小时的搜索,消耗约2.1亿个token,随后由研究人员分析并验证发现。该系统的主要功能仍不清楚,也没有证据表明它能像CRISPR一样实现可编程DNA编辑。重复搜索也未能稳定找到关键重复序列。这项发现展现了
HARMONY 是一种从单张图像重建完整室内 3D 场景的框架,结合视觉语言模型的空间推理与点云几何估计。该方法先校准相机,再推断房间布局,并按层级顺序放置物体。基于几何的细化和反馈步骤旨在提高结果与输入图像的匹配度,并减少误差累积。在合成图像和真实图像实验中,HARMONY 的表现优于参与评测的场景重建基线方法。
MentalHealthBench是一项融合专家意见的基准测试,用于评估AI在真实心理健康对话中的回答是否有帮助且安全。
一场秘密的算牌行动表明,可能需要新的方法来识别AI智能体之间的欺骗行为。
Anthropic 表示,其 AI Claude 自主发现了一种新的酶系统,与基因编辑工具 CRISPR 背后的机制相似。这是该公司新设湿实验室的首项成果,也是初步检验 Claude 在科学研究中实用性的案例。Anthropic 同时正为可能的上市做准备。
中国DeepSeek介绍了一种AI智能体训练方法,有望提升学习效率,同时减少问题行为。现有说明未提供该方法在实际应用中的效果细节。
Microsoft Research 的新发现表明,将 AI 推理移至机器人外部运行,可能提高任务成功率和效率。这种方法还有望支持更先进的物理 AI 工作负载。
负责Claude微调的Anthropic工程师表示,后续模型更加注重数学和编程能力,也接受了大量为其他AI模型撰写技术解释的训练。这促成了Claude独特、信息密集的表达风格,但对人类读者而言可能不够易读。他认为,强化学习的奖励机制是原因之一:它可能更重视模型能否理解解释,而非人类能否轻松读懂。工程师称,Anthropic在Opus 5.5上找到了更好的平衡,但这并不代表其写作表现已经超过Opus
小米 MiMo 大模型负责人罗福莉宣布,即将推出的 MiMo-V3 将采用全新架构,核心技术 HySparse 2 于今日发布。小米称,在 100 万 Token 的上下文长度下,该技术可将预填充计算量降低 5.02 倍、KV 缓存缩小 4.5 倍,同时提升 MRCRv2 和 RULER-v2 评分,并降低 AgentPPL 和 LongPPL。其设计结合了自解码器与交叉解码器之间的 KV 桥接,
国际象棋引擎能够击败特级大师,但并不存在一套公认且万无一失的策略。AI没有毁掉这项游戏,反而正在探索新的下棋方式。
据Carnegie China数据,在顶尖AI人才目的地中,中国所占比例从2022年的27.1%升至2025年的40.6%。同期,美国的比例从46.4%降至34.2%。报告指出,越来越多的中国AI研究人员选择留在本国工作。
Agensh 是一种多智能体系统,代理无需中央协调器即可自行认领任务、分享发现并整合进展。系统通过共享工作区、消息接口和共享上下文支持协作。在五项难度较高的 ProgramBench 任务中,代理数量从 1 个增加到 128 个,平均测试通过率从 19.31% 提升至 28.78%。在 pandoc 任务中,扩展到 1,024 个代理后,通过率从 33.89% 提升至 55.06%。结果表明,在部
基于 LLM 的评估器能够处理多种任务,但在大规模应用中,成本和置信度的可靠性至关重要。本研究考察只输出判定的评估器能否以较低成本完成初筛,并识别需要更强评估的案例。与 16 种生成式和基于奖励模型的评估器相比,JEV-as-a-Judge 在常规偏好判断和基于证据的事实性评估中,与最强对照模型的差距不到 3 个百分点,成本仅为对方的 0.36%。在需要核查推导过程或识别措辞精巧的错误答案时,差距
盖洛普在37个国家开展的调查发现,大多数受访者对人工智能感到好奇或兴奋,而非害怕或担忧。34个国家的正面看法多于负面看法。中国超过90%的受访者和尼日利亚超过66%的受访者认为,人工智能将改善日常生活。