Spatial Memory Agent:面向空间智能的经验驱动程序记忆
研究人员提出了 Spatial Memory Agent(SMA),这是一种运行时框架,能够在不更新模型参数、推理时也不依赖外部空间工具的情况下,提升冻结式视觉语言模型(VLM)的空间推理能力。SMA收集经过验证的空间经验,通过验证器引导的反思将其提炼为简洁且可迁移的经验规则,并根据后续检索结果为每条规则分配迁移可靠性分数。在部署阶段,系统通过语义筛选以及结合相似度和可靠性的排序机制检索相关规则,
AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
研究人员提出了 Spatial Memory Agent(SMA),这是一种运行时框架,能够在不更新模型参数、推理时也不依赖外部空间工具的情况下,提升冻结式视觉语言模型(VLM)的空间推理能力。SMA收集经过验证的空间经验,通过验证器引导的反思将其提炼为简洁且可迁移的经验规则,并根据后续检索结果为每条规则分配迁移可靠性分数。在部署阶段,系统通过语义筛选以及结合相似度和可靠性的排序机制检索相关规则,
该研究首次系统分析了交错使用线性注意力层和完整注意力层的混合大语言模型中的大规模激活。研究人员发现了两种与架构相关的形态:完整注意力层之前会出现激活尖峰,激活还可能持续穿过中间的线性注意力层,形成间歇平台。这些现象在五种线性注意力架构、六种混合配置、五个数据领域,以及参数规模从12亿到3970亿的开源模型中均得到观察。针对较小型 Gated DeltaNet 混合模型的受控实验表明,两种形态在训练
PlayWorld 是一个通过长期交互目标评估视频世界模型的基准。由于不同模型实现同一目标所需的动作序列可能差异很大,使用固定动作进行评测难以公平比较,因此研究人员让多模态代理玩家与各模型互动。该基准包含 171 个场景,评估几何一致性、交互保真度、视野外变化、状态持续演化,以及视频质量和可控性。对九个先进世界模型的实验显示,当前系统在长期交互目标上仍不可靠,尤其难以维持空间一致性和持续的状态变化
CLUE 团队最新发布的 SuperCLUE-Terminal 评测显示,DeepSeek-V4-Pro-0813 得分 51.52 分,排名第二,仅次于获得 60.61 分的 Kimi K3,同时超过 GLM-5.2 和旧版 DeepSeek-V4-Flash。根据公布结果,该模型每道题的调用成本约为 1.42 元,约是 Kimi K3 的十四分之一。评测面向中国开发者,采用真实中文编程任务,并
社交平台上的多条消息称,由前 OpenAI 首席科学家伊利亚·苏茨克维创办的 Safe Superintelligence(SSI),正在探索基于测试时训练(TTT)的小型推理引擎。该方法可在模型解决问题时动态更新部分权重,不同于训练完成后参数通常保持固定的传统大模型。目前没有独立技术证据证明 SSI 已解决 TTT 面临的安全问题。据称,面向受邀用户的有限测试最快可能于 8 月开始,下一代模型规
AI企业Writer推出Palmyra X6。这款企业级模型基于Z.ai的开源模型GLM-5进行后训练调整,面向直接部署场景。Writer表示,新模型配合升级后的大模型调用框架,基础任务处理成本最高可降低50%。该方案重点优化复杂多步骤任务,旨在减少Token消耗并提升运行速度。Writer近期发布的研究论文显示,在多个模型上的测试中,优化调用框架平均可降低约40%的整体成本,效果有时优于单纯更换
谷歌推出 Gemini 3.7 Flash,定位于编程和智能体应用。谷歌表示,该版本源于开发者反馈和算法创新,并在软件工程、知识工作及网页开发流程方面有所提升。2026 年 12 月 31 日前,模型的首发价格为每百万输入 Token 0.75 美元、每百万输出 Token 3.75 美元,均为 Gemini 3.6 Flash 原价的一半。面向 160 多个国家和地区 Google AI Pro
Writer推出了一款新AI系统,该系统基于Z.ai的开源模型GLM-5.2进行后训练。公司称,该系统旨在以显著更低的价格提供可直接部署的能力。升级版工具则用于限制Token使用量,从而降低运营成本。相关信息未提供独立的性能数据或基准测试结果。
OpenAI与Anthropic希望客户重新评估使用其人工智能模型的成本。
研究团队提出了 Latent Dynamics Reasoning(LDR),一种显式建模运动动力学的视频世界模型方法,而不是仅拟合像素随时间的变化。LDR 在结构化潜在空间中对低阶动力学进行数值积分,并只学习预测展开所需的高阶残差。在涵盖五项物理任务的受控基准测试中,LDR 相比视频扩散模型,将分布内与分布外的误差差距缩小了 20 倍以上。同时,它使用的参数量减少了 26 倍,运行速度提高了 1
谷歌在 Gemini 3.6 Flash 发布仅三周后宣布推出 Gemini 3.7 Flash。该公司表示新版本带来了“重大改进”,但尚未公布技术细节或独立基准测试结果。
该研究探讨了大语言模型强化学习中的参数空间探索。与温度缩放等动作空间方法不同,参数空间方法从后验分布中采样不同策略,使各策略能够生成不同的rollout。作者提出了扰动参数策略优化(Perturbed Parameter Policy Optimization,3PO),通过不同的采样和rollout分组策略估计奖励。在OLMo-3-1025-7B和Qwen2.5-Math-7B的数学推理与代码生
Anthropic研究人员发现,AI代理在共享环境中运行时,可能以意想不到的方式发生冲突、串通和协调。这项发现引发了新的疑问:当前的安全测试是否足以评估多代理系统带来的风险。
本指南介绍初创公司如何利用 GPT-5.6 更快速、更经济地构建 AI 智能体,重点涵盖更智能的模型选择以及 Responses API 的新功能。
谷歌发布了 Gemini 3.7 Flash,并称其是目前最智能的编程和 AI 智能体工作模型。该模型上线时的定价为每 100 万输入令牌 0.75 美元、每 100 万输出令牌 3.75 美元。现有公告未提供独立性能数据或基准测试结果。