研究资讯 实时更新
研究领域最新动态
今日 · 08月10日
21:00
相关但不完整:指涉悬空揭示硬提示压缩的根本性失效模式
一项研究发现,当系统独立评估并选择词元、句子或文本块时,硬提示压缩可能破坏关键的指涉关系。如果答案被保留,但用于理解答案的实体被删除,就会产生“指涉悬空”。在0.30的压缩率下,多个基准测试中最多有60%的案例出现这一问题。重新插入缺失的支持段落后,准确率提高了29至34个百分点。一个用于自动判断被删除句子是否必要的小型分类器,在压缩率几乎不变的情况下,使H
20:30
用于研究人类认知与行为的小型基础模型
研究人员使用 Psych-101 训练了14个模型,参数规模从1.35亿到140亿不等。Psych-101包含来自160项实验的1,070万条试次级选择数据。在与训练数据相同的分布内,模型规模影响很小:6亿至10亿参数的模型在未参与训练的受试者上,达到了700亿参数基准模型的相近表现。但在泛化到新任务结构时,更大的模型明显更具优势。诊断测试显示,屏蔽刺激和反
20:00
Discovered Materials 借助 AI 寻找更低温的芯片材料
Discovered Materials 已融资 900 万美元,将借助 AI 寻找能够制造出更高效、发热更低芯片的新型材料。
20:00
同行评审不堪重负——它能在人工智能时代延续吗?
随着研究成果和人工智能辅助论文数量激增,志愿审稿人越来越难以应付。文章探讨现有同行评审体系能否承受由此带来的额外压力。
20:00
为善而用的对抗性攻击:视觉内容全生命周期主动防护综述
该综述研究内容所有者、创作者、平台和审计人员可采用的技术措施,以限制视觉内容在人工智能流程中的未经授权使用,或支持事后追责。研究涵盖防止不必要识别的隐私过滤器、阻碍未经授权训练的不可学习样本、防范恶意编辑或模仿的生成式保护机制、控制自动化访问的对抗性 CAPTCHA,以及用于流通后归属追踪的来源机制。作者从可迁移性、适应性和部署成熟度等维度比较了这些方法。研
19:00
利用离线 Top-K Logits 和融合分块 KL 损失提高 LLM 知识蒸馏效率
一项实践研究提出了两种提高大语言模型知识蒸馏效率的系统技术。首先,预先缓存教师模型的 Top-K logits,可在不将教师模型保留于 GPU 内存中的情况下进行训练,同时保持与在线蒸馏几乎相同的训练损失。在单张 H200 GPU 上,每次迭代速度提升约 29%,吞吐量最高提升 41%。其次,融合式分块 KL 损失避免生成覆盖完整词表的 logits 张量,
18:01
OneEmo:统一情绪感知、理解与交互的多模态推理模型
研究人员推出 OneEmo,这是一种用于感知、理解和交互情绪的多模态模型。研究团队构建了 EmoWorld-130K 数据集,通过人工参与流程整理显式推理轨迹;同时提出 Emo-Chord 强化学习方法,以稳定多任务奖励分配。论文实验显示,与规模相近的基线模型相比,OneEmo 在大多数基准测试中达到领先水平。尽管参数量明显少于商业模型,该模型仍取得了具有竞
10:30
NASA“毅力号”凭借自主导航即将刷新火星行驶距离纪录
NASA火星车“毅力号”预计将在火星表面累计行驶超过45.16公里,打破由“机遇号”保持的纪录。其高效行驶的关键是车载自主导航系统:摄像头拍摄周围地形,车载计算机通过算法计算更安全的行驶路线。毅力号约90%的行驶距离由自主驾驶完成,而较早的“好奇号”只有约10%的行驶过程能够自主完成。更先进的视觉计算单元可以让探测车在行驶时同步处理图像,减少等待地球发送导航
10:30
消息称GPT-6将于8月发布,参数规模或达10万亿
AI 内幕人士 ChrisGPT 声称,OpenAI 将于 8 月发布 GPT-6,并称其就是此前暂停发布的 Astra 模型。该消息还预测,OpenAI 将在年底推出代号为 Doug、规模更大的模型。不过,关于 10 万亿参数、发布时间、英伟达下一代芯片,以及训练能力突破等说法,均未得到独立证实。文章还对 OpenAI、Anthropic 和 Google
10:30
Skaling:结合 Chinchilla 指数与 Kaplan 耦合模型
该研究提出 Skaling 定律,用于扩展现有的语言模型缩放定律。该方法不再假设模型规模和训练数据对损失的影响彼此独立,而是通过单一交互指数对二者进行联合建模。研究结果显示,在插值和外推场景中,平均绝对百分比误差可降低约 1.5 至 3 倍。结合仅覆盖低计算量区域的稀疏网格策略后,Skaling 还能以约为均匀扫描十分之一的计算量,准确外推完整网格的结果。
10:30
Modular TTT:重新思考可组合模块化的测试时训练
Modular TTT将测试时训练(TTT)视为一种在线学习问题,通过内部学习规则更新快速权重。该框架把内部学习器表示为有向无环图,并将快速权重网络、损失函数、学习率、权重衰减和归一化设为明确的设计维度。它可以自动将基本的训练视图和查询视图规则组合成完整的TTT计算,从而系统分析各个组件的作用。研究发现,较小的初始学习率、权重衰减和单层非线性有助于提升性能。
10:30
优化器就是智能体:以推理驱动搜索提示词、程序和机器学习工作流
ReASearch是一种统一框架,由具备工具使用能力的智能体自主优化提示词、程序和机器学习工作流。智能体自行决定评估哪些方案、如何诊断失败、进行哪些修改,以及何时验证结果或重新开始。借助持久记忆,它能够在长期运行中持续改进搜索策略。在14项不同任务中,该系统的表现与专用优化系统相当,并在大多数情况下超过后者,取得了2%至40%的提升。在部分任务中,它还发现了
10:30
面向视频世界模型的可寻址记忆
该研究探讨交互式视频世界模型如何在长时间范围内保存和检索视觉信息。当生成过程超出训练时长范围后,传统键值(KV)缓存中的内容将难以可靠寻址;直接压缩旋转位置编码后的缓存也可能破坏位置信息。研究提出无需重新训练的WorldTrace记忆框架,为每个压缩记忆槽分配一个位于训练分布内的独立虚拟位置。WorldTrace-Field压缩历史信息以保持时间连贯性,Wo
10:30
研究分析生产环境中 AI 生成 C++ 代码的质量特征
一项大规模企业研究分析了成熟 C++ 代码库中的 352 万次代码变更,并比较了 AI 生成代码与人工编写代码。研究发现,AI 生成代码更容易出现接口和耦合负担、额外的复制与内存分配,以及使用显式循环而非优化标准 API 的情况。这些问题增加了代码审查工作量,并使计算资源消耗上升 5% 至 8%。不过,向模型提供基于分类体系的针对性反馈后,相关静态分析警告减
11:01
StreamArena:迈向持续、交互式和长时程的智能体流式视频理解
StreamArena是一项用于评估多模态智能体长期处理连续视频流能力的基准测试。数据集包含243段完整视频,平均时长为88.8分钟,以及3646组经过严格标注的开放式问答。评估内容包括实时感知、历史事件回溯、主动交互和多模态工具使用。结果表明,仅保留最近帧的方法无法找回较早事件;将过去观测转换为文本会丢失视觉证据;反复压缩视觉记忆则难以长期保留细节。研究还
11:31
当特权指导与状态不匹配:面向多轮智能体的状态匹配路由与情境化自蒸馏
研究人员提出 SMRC-SD,通过更有选择性的特权蒸馏改进多轮智能体。该方法不再在每个回合无条件使用成功参考轨迹提供的指导,而是先检查智能体当前的执行状态是否得到参考轨迹支持。只有状态匹配时才进行蒸馏,并根据智能体实际到达的状态构建教师上下文。使用 Qwen3-1.7B 时,ALFWorld 的任务成功率从 0.746 提升至 0.865,WebShop 从
11:31
面向航拍图像目标导航的不确定性感知世界模型
研究人员提出了 UA-NWM,这是一种用于无人机根据目标图像前往指定位置的高效潜在世界模型。现有方法通常仅依赖一个或少数几个未来状态预测来评估候选轨迹,在具有较大未来状态不确定性的大规模户外环境中存在局限。UA-NWM 将可能的未来表示为不确定性子空间,并把预测与目标之间的差异分解为可由不确定性解释和无法解释的部分。系统仅使用无法解释的残差进行轨迹评分,因此
11:31
YOLO-PEFT:YOLO 系列的参数高效微调
YOLO-PEFT 是一个面向 YOLO 及其他实时检测器的结构感知型参数高效微调框架。它根据算子有效性、检测器语义、图接口和部署约束等明确条件规划适配器位置,并在训练前拒绝不合适的配置。在 VOC07+12 评测中,规划器选择的 RS-LoRA 在 YOLO11s 和 YOLO12s 上分别达到 0.7138 和 0.7307 的 mAP50-95,高于全
11:31
SimWAM:面向端到端自动驾驶的简易世界动作模型
SimWAM是一种面向自动驾驶的世界动作模型,仅在训练阶段使用视频生成。该方法联合训练预训练视频专家模型和轻量级动作专家模型,并通过注意力掩码使轨迹预测不依赖未来视频帧。训练完成后可以移除视频分支,从而得到低延迟的独立规划器。研究人员还使用强化学习优化驾驶奖励,使其超越单纯的轨迹模仿。据论文介绍,SimWAM在NAVSIM上达到91.5 PDMS,超过现有基
13:00
AudioRubrics 通过演进式奖励训练音频推理
AudioRubrics 是一个用于提升音频推理能力的强化学习框架。它从每个原始波形中生成基于音频证据的评估规则,并根据模型自身的输出持续重新生成和调整规则权重。与只监督最终答案或依赖固定人工标准的方法相比,这种设计能够针对模型当前的弱点提供自适应的训练信号。该方法旨在处理从感知到多步推理等不同类型的问题。研究人员在三个音频推理基准上进行评估,报告称其显著优