修辞如何钻取 AI 审稿人的奖励机制:剖析 AI 同行评审中的修辞敏感性
一项研究考察了在科学内容保持不变的情况下,修辞表达如何影响大型语言模型对科学论文的评价。研究人员以 120 篇匿名化的 ICLR 2026 投稿为基础,构建了 4,200 份论文稿件,并让 5 个 AI 审稿人在标准和严格协议下进行评审。证据呈现方式和新颖性立场带来的正负评价差异最大,研究范围的表述影响较弱。影响高度取决于 AI 审稿人的初始评分:低分往往上升,高分往往下降,且中间分数段的变化最明
AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究考察了在科学内容保持不变的情况下,修辞表达如何影响大型语言模型对科学论文的评价。研究人员以 120 篇匿名化的 ICLR 2026 投稿为基础,构建了 4,200 份论文稿件,并让 5 个 AI 审稿人在标准和严格协议下进行评审。证据呈现方式和新颖性立场带来的正负评价差异最大,研究范围的表述影响较弱。影响高度取决于 AI 审稿人的初始评分:低分往往上升,高分往往下降,且中间分数段的变化最明
社交平台上的多条消息称,由前 OpenAI 首席科学家伊利亚·苏茨克维创办的 Safe Superintelligence(SSI),正在探索基于测试时训练(TTT)的小型推理引擎。该方法可在模型解决问题时动态更新部分权重,不同于训练完成后参数通常保持固定的传统大模型。目前没有独立技术证据证明 SSI 已解决 TTT 面临的安全问题。据称,面向受邀用户的有限测试最快可能于 8 月开始,下一代模型规
AI企业Writer推出Palmyra X6。这款企业级模型基于Z.ai的开源模型GLM-5进行后训练调整,面向直接部署场景。Writer表示,新模型配合升级后的大模型调用框架,基础任务处理成本最高可降低50%。该方案重点优化复杂多步骤任务,旨在减少Token消耗并提升运行速度。Writer近期发布的研究论文显示,在多个模型上的测试中,优化调用框架平均可降低约40%的整体成本,效果有时优于单纯更换
该研究提出可提示式视线目标估计(Promptable Gaze Target Estimation,PGE),这是一种端到端方法,用于识别现实世界图像中人物注视的目标。与依赖头部边界框、人体姿态等独立输入的传统多阶段方法不同,PGE 可通过灵活的文本或视觉提示指定分析对象,例如“穿红色衬衫的男孩”或图像中的某个坐标,从而减少中间步骤中的错误累积。研究团队还开发了 Gaze-Co 数据集和基准,包含
研究团队提出了 Latent Dynamics Reasoning(LDR),一种显式建模运动动力学的视频世界模型方法,而不是仅拟合像素随时间的变化。LDR 在结构化潜在空间中对低阶动力学进行数值积分,并只学习预测展开所需的高阶残差。在涵盖五项物理任务的受控基准测试中,LDR 相比视频扩散模型,将分布内与分布外的误差差距缩小了 20 倍以上。同时,它使用的参数量减少了 26 倍,运行速度提高了 1
该研究探讨了大语言模型强化学习中的参数空间探索。与温度缩放等动作空间方法不同,参数空间方法从后验分布中采样不同策略,使各策略能够生成不同的rollout。作者提出了扰动参数策略优化(Perturbed Parameter Policy Optimization,3PO),通过不同的采样和rollout分组策略估计奖励。在OLMo-3-1025-7B和Qwen2.5-Math-7B的数学推理与代码生
Anthropic研究人员发现,AI代理在共享环境中运行时,可能以意想不到的方式发生冲突、串通和协调。这项发现引发了新的疑问:当前的安全测试是否足以评估多代理系统带来的风险。
布伦南中心的一项研究发现,主流 AI 聊天机器人拒绝支持有关选举的虚假说法。然而,同一批公司提供的图像生成工具却能在用户要求下,制作出支持这些说法的虚假证据。研究结果凸显了文本 AI 与图像生成 AI 在安全防护方面的差距。
Ramp发布的月度AI指数显示,Anthropic在7月的市场份额达到43.5%,进一步扩大了对OpenAI的领先优势。企业购买的代币中,Fable 5仅占6%,可能是因为成本较高。该指数利用Ramp的支出数据,追踪美国企业对AI的使用情况。
Vivodyne 正在利用人工智能对实验室培育的人体组织进行实验。这种方法未来可能减少或取代部分在小鼠和狗身上开展的药物测试,并帮助研发对人体更有效的药物。当前药物开发面临的一大问题是,在小鼠身上有效的治疗方法,往往无法在人类身上取得同样的效果。
工人正在向机器人提供有关人类运动本质的宝贵数据。动作追踪器和摄像头记录任务的执行方式,帮助人工智能系统和机器人更有效地学习和复现人类行为。
Mechanist是一套用于自动研究AI模型能力、行为和风险机制的智能体系统。它整合了约1.3万篇论文构成的可解释性知识图谱、覆盖26个领域的4300万篇论文数据库,以及用于机制分析、因果干预和验证的32种基础方法。研究团队称,与Claude Code和现有AI科学家系统相比,Mechanist能够提出更有价值的机制假设,并更可靠地执行实验。系统展示了多项应用,包括发现不安全特征可通过表面安全的训
全球有超过10亿人的肝脏脂肪含量过高,这可能引发一系列健康问题。研究人员正在探索人工智能工具能否早期识别脂肪肝,从而帮助患者及时接受干预并降低并发症风险。不过,这类技术的广泛临床效果目前尚未得到充分证实。
该研究提出了 SHAPER,这是一种无需额外训练或更新模型参数即可适应具身智能体的框架。它利用冻结的基础模型,通过目标环境中的运行结果改进可复用技能,以及结合上下文和代码的执行框架。研究在 VLABench 和 ESI-Bench 上进行了评估,涵盖使用不同低层动作接口的智能体,并将 SHAPER 与直接执行、监督微调和推理时扩展方法进行比较。结果表明,当模型训练成本高昂、无法进行或不受欢迎时,优
该研究提出 Simplax,一种用于离散扩散模型的精确狄利克雷—类别增强方法。它将每个受损的类别状态与一个单纯形值辅助变量结合,同时在类别边缘分布上保留原有的一致扩散过程。该方法由此实现了可处理的 Rao-Blackwell 化反向桥接目标和随机反向采样器。在 OpenWebText 无条件生成中,Simplax 改善了生成困惑度与熵之间的权衡;在 Sudoku 生成中也取得了较高的准确率和有效性