用于持续学习的快速权重注意力
该研究分析了递归快速权重记忆和选择性状态空间模型。这些模型将不断增长的上下文压缩到固定大小的递归状态中,并在因果性的读后写语义下把状态转移视为在线学习规则。作者针对平方误差回归和负内积目标推导了归一化更新,涵盖 Falcon-1、Falcon-2、Falcon-3 及其内积变体,同时提供递归、掩码并行和分块并行形式,以及数值稳定的正衰减重新归一化。代表性变体在语言建模中仍具竞争力,并改善了可变位数
AI 新闻中心 过去一年分析了 1378 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究分析了递归快速权重记忆和选择性状态空间模型。这些模型将不断增长的上下文压缩到固定大小的递归状态中,并在因果性的读后写语义下把状态转移视为在线学习规则。作者针对平方误差回归和负内积目标推导了归一化更新,涵盖 Falcon-1、Falcon-2、Falcon-3 及其内积变体,同时提供递归、掩码并行和分块并行形式,以及数值稳定的正衰减重新归一化。代表性变体在语言建模中仍具竞争力,并改善了可变位数
Ring Forcing是一种面向自回归视频扩散模型的框架,旨在提升数分钟视频的长期一致性。它同时解决两个问题:物体重新出现时能否准确保持其外观,以及模型能否处理超长上下文并利用遥远历史中的信息。环形训练策略促使模型从较早的历史中检索信息。压缩与时间步组合策略在固定序列长度下扩展了有效历史范围;稀疏RoPE机制则支持更灵活、可扩展的记忆适配。论文报告的实验结果显示,Ring Forcing在数分钟
研究人员提出了 Parallel Tube Decoding(PTD),用于更高效地定位视频中被指代的事件和目标。不同于通过自回归方式逐帧生成密集轨迹,PTD 将时间定位与空间定位分离,并行解码空间模块。因此,无论轨迹长度如何,顺序解码深度都固定为两轮。在 VidSTG 基准测试中,PTD 相比标准自回归解码将完整轨迹的完成延迟降低了 79 倍,并将空间解码吞吐量提升了 92 倍,同时提高了定位准
Poor Lab 发布了 Puro-2B,这是一套旨在降低消费级硬件语言模型预训练成本的开源方案。研究团队使用 RTX 5090 GPU、FP8 精度和最多 1.4 万亿个 token,从零训练了多个 Puro-2B 模型。根据团队的评测流程,最佳模型以低于 6,900 美元的训练成本,取得了接近 Qwen2.5-1.5B 的性能。成本扩展分析显示,约 4,400 美元可能足以达到 Qwen2-1
LayerRecall是一种面向自回归视频扩散模型的状态条件、分层选择式记忆路由器。它检索相关的历史键值状态,仅将其注入对长程记忆敏感的网络层,同时在其他位置保留局部注意力。其跨时域预测匹配方法利用拥有完整长上下文的参考信息训练有限记忆路由器,减少对显式记忆分配标注的依赖。在100个多镜头提示的评测中,LayerRecall在MemoBench和MovieBench上取得最佳综合结果,在VBenc
StarHarness 是一个在保持模型权重不变的情况下,针对特定环境优化智能体框架的系统。它可以调整提示词、任务描述、工具接口、技能、基于 MCP 的服务提供方、子智能体结构以及智能体循环配置。该方法根据基线失败行为对任务进行分层,分离提议者可见的搜索任务与不可见的选择任务,并通过保留任务评估泛化能力。在 ITBench SRE、EnterpriseOps-Gym ITSM 和 Automati
EASEL 是一项用于评估多模态智能体在闭环环境中精确使用视觉工具能力的新基准。核心任务要求智能体逐步在数字画布上作画,使结果匹配参考图像,同时测试区域标注、手写和路径规划。EASEL-Data 包含 44 万条训练样本。基于该数据训练的 EASEL-9B 相比基础模型取得 6.3% 的相对提升,在 25 个受测模型中排名第三。不过,结果表明当前多模态智能体仍存在明显不足:图像重建相似度较低,动作
中国信通院人工智能研究所发布的测试报告称,StartLux-V1.0-27B-Preview 在面向 AI 智能体的 MCP 基准测试中取得综合第二名。该模型拥有270亿参数,据称超过了参数规模更大的 DeepSeek 和 Step 模型,并在位置导航、浏览器自动化和金融分析等任务中与 DeepSeek-V4-Pro 持平或取得更好成绩。StartLux 以 Qwen3.6-27B 为基础,采用自
J-Zero 是一种无需额外训练数据、用于推动语言模型自我改进的框架。Challenger 生成难度不断增加的任务,Solver 学习给出质量更高的回答;与此同时,Judge 根据回答的生成方式,利用顺序预先确定的偏好对进行自适应。作者报告称,与基线方法相比,J-Zero 在可验证领域平均提升 4.2 分,在不可验证领域提升 8.0 分。J-Zero 至少持续迭代改进了十轮,而基线方法在两轮后出现
StepGuard是一种面向大语言模型代理的防护模型,既能审计已完成的代理执行轨迹,也能在工具操作执行前检查潜在风险。研究团队使用StepGen自动生成安全和不安全的轨迹:两者拥有相同上下文,但在风险步骤采取不同操作。为减少过度防御和防御不足,研究人员还提出了Balance-GRPO,根据观测到的准确率动态平衡安全与不安全操作的学习。实验显示,StepGuard在开放权重防护模型中取得最高平均准确
ABot-Recon 是一种从超长视频中进行三维场景重建的流式模型。它不维护庞大的长期记忆,而只缓存前 11 帧的键值特征。模型在当前相机坐标系中预测点图,并估计相邻帧之间的相对位姿,再通过序列组合恢复全局相机位姿和场景几何。轻量级时间细化器用于减少旋转漂移,考虑组合过程的位姿损失则用于训练多步位姿组合。在 Oxford Spires 基准测试中,ABot-Recon 的绝对轨迹误差为 4.35
LMSM 将 Linux Security Modules 的设计应用于大语言模型服务。该框架将经过校准的安全证据、版本化策略评估,以及缓冲输出的发布授权彼此分离。原型系统可在 Hugging Face Transformers 和 vLLM 中支持稀疏自编码器、转换器和密集探针。在 Qwen3-4B 上,LMSM-Checkpoint 将 HarmBench 攻击成功率从 39.20% 降至 3
该研究提出了 VLAct,一种面向视觉语言动作(VLA)系统的视觉语言模型骨干。VLAct 使用来自多种机器人形态的异构机器人数据进行持续预训练,在保留视觉语言模型通用知识的同时,促进跨机器人形态的共享动作语义。在固定机器人数据量和微调预算下,VLAct 在仿真、真实环境任务以及向未见机器人形态迁移时均提升了性能。它在 LIBERO-Plus 和 RoboTwin 2.0 上分别取得 82.6%
该研究提出了 Rubric-to-Code Credit Assignment(RCCA),一种面向强化学习的框架,用于让模型根据自然语言需求生成可用的 HTML、CSS 和 JavaScript 应用。RCCA 不再将单一的序列级奖励平均应用于所有 token,而是把功能反馈对应到相关代码区域和生成 token。其分层奖励机制区分格式、源代码、运行时和功能错误。Ling-RCCA-Flash 在
GeoNeXt重新利用预训练视频生成模型,从单张图像中联合估计深度和表面法线。该方法将几何估计定义为下一帧预测任务,从而利用视频模型中结构化的视觉先验,并以远少于以往方法的标注数据学习图像与几何信息之间的关系。在多个数据集上的实验表明,GeoNeXt在零样本单目深度和表面法线估计方面优于以往的任务专用型和统一型生成方法。它的性能还接近使用超过百倍数据训练的判别式先进方法,并在多个基准测试中超过这些