研究分析生产环境中 AI 生成 C++ 代码的质量特征
一项大规模企业研究分析了成熟 C++ 代码库中的 352 万次代码变更,并比较了 AI 生成代码与人工编写代码。研究发现,AI 生成代码更容易出现接口和耦合负担、额外的复制与内存分配,以及使用显式循环而非优化标准 API 的情况。这些问题增加了代码审查工作量,并使计算资源消耗上升 5% 至 8%。不过,向模型提供基于分类体系的针对性反馈后,相关静态分析警告减少了 11.1%,计算效率也得到改善。
AI 新闻中心 过去一年分析了 1372 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项大规模企业研究分析了成熟 C++ 代码库中的 352 万次代码变更,并比较了 AI 生成代码与人工编写代码。研究发现,AI 生成代码更容易出现接口和耦合负担、额外的复制与内存分配,以及使用显式循环而非优化标准 API 的情况。这些问题增加了代码审查工作量,并使计算资源消耗上升 5% 至 8%。不过,向模型提供基于分类体系的针对性反馈后,相关静态分析警告减少了 11.1%,计算效率也得到改善。
StreamArena是一项用于评估多模态智能体长期处理连续视频流能力的基准测试。数据集包含243段完整视频,平均时长为88.8分钟,以及3646组经过严格标注的开放式问答。评估内容包括实时感知、历史事件回溯、主动交互和多模态工具使用。结果表明,仅保留最近帧的方法无法找回较早事件;将过去观测转换为文本会丢失视觉证据;反复压缩视觉记忆则难以长期保留细节。研究还提出了StreamMind双层架构,将对
研究人员提出 SMRC-SD,通过更有选择性的特权蒸馏改进多轮智能体。该方法不再在每个回合无条件使用成功参考轨迹提供的指导,而是先检查智能体当前的执行状态是否得到参考轨迹支持。只有状态匹配时才进行蒸馏,并根据智能体实际到达的状态构建教师上下文。使用 Qwen3-1.7B 时,ALFWorld 的任务成功率从 0.746 提升至 0.865,WebShop 从 0.574 提升至 0.693。消融实
研究人员提出了 UA-NWM,这是一种用于无人机根据目标图像前往指定位置的高效潜在世界模型。现有方法通常仅依赖一个或少数几个未来状态预测来评估候选轨迹,在具有较大未来状态不确定性的大规模户外环境中存在局限。UA-NWM 将可能的未来表示为不确定性子空间,并把预测与目标之间的差异分解为可由不确定性解释和无法解释的部分。系统仅使用无法解释的残差进行轨迹评分,因此无需生成多个未来样本,也能实现更稳健的路
YOLO-PEFT 是一个面向 YOLO 及其他实时检测器的结构感知型参数高效微调框架。它根据算子有效性、检测器语义、图接口和部署约束等明确条件规划适配器位置,并在训练前拒绝不合适的配置。在 VOC07+12 评测中,规划器选择的 RS-LoRA 在 YOLO11s 和 YOLO12s 上分别达到 0.7138 和 0.7307 的 mAP50-95,高于全量微调的 0.6428 和 0.6662
SimWAM是一种面向自动驾驶的世界动作模型,仅在训练阶段使用视频生成。该方法联合训练预训练视频专家模型和轻量级动作专家模型,并通过注意力掩码使轨迹预测不依赖未来视频帧。训练完成后可以移除视频分支,从而得到低延迟的独立规划器。研究人员还使用强化学习优化驾驶奖励,使其超越单纯的轨迹模仿。据论文介绍,SimWAM在NAVSIM上达到91.5 PDMS,超过现有基于世界动作模型的规划器,并可零样本迁移至
AudioRubrics 是一个用于提升音频推理能力的强化学习框架。它从每个原始波形中生成基于音频证据的评估规则,并根据模型自身的输出持续重新生成和调整规则权重。与只监督最终答案或依赖固定人工标准的方法相比,这种设计能够针对模型当前的弱点提供自适应的训练信号。该方法旨在处理从感知到多步推理等不同类型的问题。研究人员在三个音频推理基准上进行评估,报告称其显著优于多种开源和基于训练的基线方法。分析还显
一项研究考察了人格条件化的大型语言模型智能体在经历11种重大生活事件后,性格特征如何变化。研究以“大五人格”作为心理测量基准,将智能体的变化轨迹与人类人格纵向研究证据进行比较,并通过新基准BFI-Adapt评估了14个模型。结果显示,智能体会产生可测量、稳定且受事件影响的特征变化,但变化幅度通常小于人类研究中的效应量。性别和文化区域提示的调节作用较小,而不同人格设定之间的差异比人类样本低三到四倍。
基于 LLM 的智能体越来越多地调用外部工具,自主完成多步骤任务,但它们经常获取超出任务所需范围的敏感信息。PrivacyPeek 是一个评估“获取阶段”隐私泄露的基准,关注数据首次进入智能体上下文、尚未出现在回复或外部操作中的阶段。该基准包含 1,182 个案例,覆盖 7 种获取行为和 16 个应用领域。它分析智能体的工具调用轨迹及接收的数据,并测试攻击者能否轻易诱导智能体泄露其已获取但未公开的
研究人员提出了 C4,这是一套受认知科学启发的评估框架,用于测试多模态大语言模型(MLLM)能否从不明显但有意义的概念关系中还原被编码的含义。该框架利用中文成语构建跨概念创造力任务,提供明确的连接路径、可调节的难度和精确答案。C4-Eval 包含 184 个合成题目和 37 个由人类创作的案例,在五种任务设置下形成 884 个主要答案恢复案例。对十个 MLLM 的评估显示,表现最好的闭源模型准确率
一项研究分析了监督微调(SFT)和强化学习(RL)在提升大语言模型多任务推理能力时为何表现不同。初步实验显示,SFT在多阶段训练中会造成严重的任务冲突,而RL能够让不同任务更稳定地共存。在参数层面,RL会针对不同任务产生稀疏且近似正交的更新。研究人员认为,这源于两种方法在梯度干扰上的差异:SFT中的干扰受梯度绝对大小限制,而RL中的干扰受优势归一化和在线策略优化引起的梯度方差限制。基于这一发现,研
一项研究发现,单纯增加多模态训练环境的数量,并不一定能提升智能体性能。研究人员分析了现有环境分布的局限,并提出两种方法:能力感知环境选择(AES),用于构建多样化环境集合;分层难度课程(HDC),通过逐步削弱辅助条件和扩大状态规模来组织训练难度。实验表明,这两种方法都能有效改善多模态智能体的训练效果。
公开基准数据不可避免地会进入预训练语料,模型一旦记住这些数据,评测分数就可能被高估。该研究指出,现有的 G-AP 指标存在缺陷:它依赖二元的对错结果,而且先求平均再计算差值,会让过度抑制与抑制不足相互抵消。研究提出 SA-PPG,通过采样估计每道题的解题概率,逐题与干净模型进行比较,并按干净模型的解题概率分组汇总。RailCap 则在生成过程中判断可能存在的污染;当采样结果回到贪心生成轨迹时,限制
研究人员提出了 DualIFM,一种专为视网膜眼底图像设计、从架构层面实现可解释性的基础模型。其 BagNet 主干网络采用小感受野,可生成忠实反映模型决策依据的证据图。预训练阶段加入的二维投影层能够直接可视化表示空间,从而发现具有临床意义的聚类以及潜在的虚假相关。DualIFM 使用超过 80 万张未标注眼底照片进行训练,在参数量仅为 RETFound 十六分之一的情况下,取得了相近的性能,并能
Capek 0.5是一款面向机器人的视觉语言模型,以完整的执行流程为核心组织具身智能体的能力,涵盖空间推理、时间理解、动作指导和状态验证。研究人员首先使用带有可验证奖励的强化学习,分别训练各项能力的专家模型,随后通过权重空间合并和策略空间蒸馏,将其整合为单一模型。Capek 0.5提供2B和35B-A3B两种规模,并通过包括新基准Capek-StateBench在内的综合测试、能力保留实验,以及模