AI 新闻中心

AI 新闻中心 过去30天分析了 913 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

基于能力门控的语言模型与先验信息融合用于事件预测

该研究分析语言模型何时能在市场、群体或统计预测之外提供额外信息,而不是只比较模型自身的准确率。研究提出能力门控机制,根据已揭晓的结果估计不同领域的信息源权重,将不确定的估计值收缩至全局权重,并重新校准融合后的预测。在2,357个已确定结果的二元问题和5个语言模型上,该方法将主要外部基线的布里尔评分从0.0771降至0.0732。即使控制数据泄漏,并与时间序列先验进行比较,改进仍具有显著性。但在Fo

迈向临床语言模型的确定性数学求解器

一项研究评估了一种方法:语言模型不直接进行临床计算,而是生成针对具体病例的 Python 代码,再由受限的本地执行器进行确定性求解。在 1,100 个病例和 55 个计算器上,该方法使用 Qwen2.5-7B 时并未稳定优于直接计算;使用 Qwen2.5-32B 时则达到 90.53%,高于直接计算的 83.47%。研究表明,执行器可以提升部分模型的表现,但不能替代经过验证的公式或可靠的变量提取。

独立测试能让人工智能更安全吗?

Vals AI联合创始人兼首席执行官拉扬·克里希南表示,随着人工智能模型能力快速提升,相关测试和评估的投资却没有跟上。该公司为OpenAI和Anthropic等企业的模型提供独立评估。Vals AI发现了一些人工智能可能朝递归式自我改进发展的早期迹象,但克里希南指出,目前的模型仍远远落后于顶尖人类研究人员。

无课程表学习:与任务无关的环境预处理

该研究探讨了大型语言模型代理能否在测试前探索陌生环境,在不知道后续任务分布的情况下,自主决定如何准备可复用资源。系统在预算限制下研究环境,并为一个固定求解器生成索引、脚本或流程指南等产物。研究人员在六个异质基准上,将元代理与固定的合成练习和语料处理方法进行比较。元代理在五个基准上取得最高的 Avg@3 奖励,但在最大语料库基准上,固定语料处理表现最佳。增加研究预算并不能稳定提升后续奖励。不过,预先

TRACE:面向高效 GUI 智能体的轨迹稳健证据排序

TRACE 是一种无需训练即可减少 GUI 智能体视觉 token 的框架。它结合交互潜力、指令相关性和特征新颖性对视觉证据进行排序,同时预留部分 token 以维持屏幕上的空间覆盖。嵌套式排序使保留的视觉证据能够随预算逐步缩减;单调 KV 压缩则将已淘汰的帧整合为紧凑的会话状态,避免重复进行视觉编码。在六个 GUI 基准和多种模型上的实验表明,该方法可在严格预算下提升效率。

ActionSplice:交互式世界模型中的生成中动作编辑

ActionSplice是一种面向分块自回归视频世界模型的推理框架,可在视频生成过程中处理新动作。该方法将问题表述为反事实状态传输(CST),利用轻量级校正器,将被中断的模型表示移动到修改后动作在同一求解器步骤所对应的状态。骨干模型和采样器保持不变,也无需重新执行已经完成的评估。CST-R会更新整个活动分块,CST-T则保留时间前缀,仅更新后缀。在minWM-Wan Action2V和HY-WM1

GPT-6 Astra据称在模拟自动售货机测试中近三倍领先Claude

Andon Labs让AI代理使用500美元启动资金,经营模拟自动售货机一年。据报道,GPT-6 Astra的平均最终账户余额达到1.5515万美元,大幅超过Claude Fable5.1。差距主要被归因于长期采购管理和稳定的规则执行,包括将商品价格压低至初始报价的约48%,并在整个运行周期内避免预付款损失。在更复杂的三方竞技测试中,GPT-6 Astra据称拒绝了违规协作,并赢得全部三轮比赛。该

StepAudio 3 Gen 技术报告

该技术报告介绍了 StepAudio 3 Gen,一种通用音频生成模型,支持零样本文本转语音、声音设计、歌声生成、音效、音乐,以及多种音频类型的混合生成。与近期常见的连续扩散模型不同,该模型直接在残差向量量化(RVQ)令牌上进行离散自回归建模。其共享表示同时编码语义和声学信息。模型沿时间轴预测第一个码本,再由轻量级因果 Transformer 生成其余15个码本。研究重点包括考虑干扰的渐进式预训练

Feyospace-v1:“网络安全七人组”如何训练前沿网络安全模型

Feyospace提出了一种以数据为中心的开放权重网络安全模型后训练方法。五个系统分别用于分析隐藏的推理特征、降低教师模型采样成本、绕过教师模型执行限制、恢复模型合并造成的能力损失,以及将专家干预转化为可训练的推理数据。其数据引擎构建了可重置的编程、漏洞、CTF、内核历史、完整漏洞利用、固件和设备环境。经过执行验证与证据审计后,研究团队使用164,269条轨迹进行长上下文监督微调。团队称,三个检查