AI 新闻中心

AI 新闻中心 过去7天分析了 958 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Local Support Learning 旨在减少大语言模型的灾难性遗忘

一项研究分析了大型预训练模型在持续训练过程中出现的灾难性遗忘问题。研究提出 Local Support Learning(LSL),将标准权重适配器与门控函数结合起来。门控函数只在输入激活来自适配器自身训练分布时启用更新,从而减少对既有能力的干扰。该方法使用基于高斯混合模型的门控机制,在无法访问历史数据的情况下区分不同学习阶段的数据。作者称,在参数规模最高达70亿的语言模型上,LSL能够在多个训练

SimuVerity:面向工程级 Simulink 模型生成智能体的基准测试

SimuVerity 评估人工智能智能体能否生成满足工程要求的 Simulink 模型,而不仅是能够编译或与参考模型相似。该基准涵盖十个工程领域的 101 项文本到可执行模型任务,先检查成果交付、原生可执行性和工程合格性,再从准确性、输出质量、机制与因果完整性、运行域鲁棒性及动态响应等维度评分。在对六个智能体系统的评估中,最佳系统的总分仅为 42.86。结果表明,结构相似度并不能有效代表工程性能,

美国佛州女子疑将 Claude 当作“日记本”,AI 检测到枪击威胁后上报当局

美国佛罗里达州李县一名 30 岁女子因涉嫌在与 Anthropic 旗下 Claude 的对话中威胁袭击县警长办公室而被捕。警方称,该消息触发 Anthropic 的安全机制,经人工审核后转交当地执法部门。女子告诉调查人员,她把 AI 当作“日记本”使用。她目前面临书面暴力威胁指控,但尚未被定罪。此案引发对聊天机器人隐私边界的讨论。Anthropic 表示,在某些情况下,例如认为存在迫在眉睫的严重

MotorMind:利用通用视觉语言模型实现零样本机器人操作

MotorMind 将视觉语言模型提出的中间层动作与确定性机器人控制及执行反馈相连接。在不进行任务专属策略训练、不使用编程智能体或额外视觉定位工具的情况下,系统在 LIBERO-PRO 上的成功率为 66.7%,在扰动条件下为 53.8%。在真实 xArm6 机器人上,平均成功率达到 95%。结果表明,通用视觉语言模型配合适当的动作表示和执行框架,可以完成零样本机器人操作任务。

学习蛋白质折叠能否迁移到更广泛的推理任务?

一项研究探讨蛋白质折叠数据能否提升语言模型在生物学以外的推理能力。研究人员构建了蛋白质衍生问答数据集 FoldingCorpus,以及结合符号化结构预测与连续三维几何信息的后训练方法 Fold2Reason。在涵盖空间、图结构、科学和通用推理的 10 项基准测试中,平均准确率从 45.09% 提升至 48.33%。使用随机、合成或打乱结构的对照组,提升幅度明显较小,部分甚至出现负增长。研究结果表明

HyperBrowseComp:面向网页浏览智能体的多语言、多模态压力测试

HyperBrowseComp 是一项包含 423 道题目的基准测试,题目以 13 种语言手工编写并经过人工验证。高难度题目要求寻找隐蔽证据、追踪多步线索,并检查视频、扫描文档、图片或地图等不同来源。研究尽可能筛除了仅凭模型已有知识即可回答的题目。研究人员使用各模型提供方自带的搜索功能,以及统一的外部检索环境评估多个模型,并抽样开展人工评测以作对照。该基准用于衡量智能体能否跨越语言和媒介,在开放网

三元线性注意力:面向长上下文序列建模的三维循环状态

循环神经网络将历史上下文压缩到固定大小的记忆状态中,从而实现常数时间推理。三元线性注意力扩展了线性注意力:它将键、第二个键和值的三重外积写入三维张量状态,再通过两个查询读取。维度为 E 的第二个键可使状态大小扩大 E 倍,但只需增加两个投影。该方法兼容数据依赖遗忘、delta 规则和分块并行训练。应用于 Gated DeltaNet 和标量门控线性注意力时,它提升了长上下文语言建模和信息回忆能力,

LexReward:面向法律语言模型的分类体系驱动奖励框架

LexReward从三个维度评估法律回答:文风、事实和法规等法律要素,以及法律推理的结构与完整性。该框架为每个维度制定评估标准和质量等级,并将生成的偏好数据用于直接偏好优化(DPO)训练。实验表明,这种评分方式能够可靠地区分回答质量;按维度训练的奖励模型也能通过强化学习提升相应表现,且在评估时无需参考答案。

超越两次循环:可扩展的循环式混合专家模型方案

这项研究提出 LOOM,通过反复应用共享 Transformer 模块,在不增加参数量的情况下提升混合专家模型的有效深度。该方法针对以往方案的两个问题:循环状态不稳定,以及路由器反复选择相同的专家。对 1 亿至 17 亿参数模型的实验显示,LOOM 可稳定扩展至 9 至 12 次循环。在 FLOP 数近似匹配的比较中,7 亿参数模型循环 5 次,将困惑度从 18.36 降至 16.54。在未匹配

ProAR:利用自回归视频模型学习前瞻推理

ProAR 是一种旨在将自回归视频生成从短期预测扩展到目标导向推理的框架。它将目标帧预测融入中间状态生成,并促使内部表征预判后续的时间动态。实验显示,该方法在多种视觉推理基准测试中提升了性能;仅使用标准自回归基线模型 25% 的训练步数,便超过了完整训练的基线模型。作者还指出,该框架有望应用于具身推理任务。

On-policy 参数更新方向是 LLM 后训练泛化能力的关键

这项研究探讨了 on-policy 后训练为何通常具有较强的泛化能力,并将观察到的特性应用于监督微调(SFT)。SFT 倾向于沿着一致的方向更新参数,而 on-policy 训练会在训练过程中持续调整更新方向。研究人员提出 OPSFT,将 SFT 的更新限制在由 on-policy 训练确定的方向上。结果表明,该方法有望把部分 on-policy 方法的泛化优势迁移到 SFT,同时保留 SFT 的

科学乌托邦?利用闭环LLM模拟学术研究生态系统

SciUtopia是一套持久运行的LLM智能体模拟框架,用于研究学术研究生态系统的长期演变。它模拟研究方向选择、合作、投稿、同行评审、重新投稿、引用、经费资助和研究人员流失等过程。在61个模拟世界中,系统涵盖8000家机构的4万多名研究人员,并生成约40万项发表决策和120万份AI生成的评审意见。模拟结果显示,论文被拒后重新投稿可能显著增加审稿负担。研究还探讨了谨慎探索如何平衡引用影响、职业发展和

AI生成的跨游戏混搭模组兴起,资深制作者表达不满

资深模组制作者批评近期兴起的AI生成模组风潮,这类模组将彼此无关的游戏内容拼接在一起。代码生成能力提升、模型成本下降,降低了制作门槛,但成品往往存在问题。据报道,X上流传的许多模组使用了未经授权的反编译代码和游戏素材。Nexus Mods自2023年起便建议,除非取得所有素材的明确使用许可,否则不要使用AI工具。