基于能力门控的语言模型与先验信息融合用于事件预测
该研究分析语言模型何时能在市场、群体或统计预测之外提供额外信息,而不是只比较模型自身的准确率。研究提出能力门控机制,根据已揭晓的结果估计不同领域的信息源权重,将不确定的估计值收缩至全局权重,并重新校准融合后的预测。在2,357个已确定结果的二元问题和5个语言模型上,该方法将主要外部基线的布里尔评分从0.0771降至0.0732。即使控制数据泄漏,并与时间序列先验进行比较,改进仍具有显著性。但在Fo
AI 新闻中心 过去一年分析了 1376 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究分析语言模型何时能在市场、群体或统计预测之外提供额外信息,而不是只比较模型自身的准确率。研究提出能力门控机制,根据已揭晓的结果估计不同领域的信息源权重,将不确定的估计值收缩至全局权重,并重新校准融合后的预测。在2,357个已确定结果的二元问题和5个语言模型上,该方法将主要外部基线的布里尔评分从0.0771降至0.0732。即使控制数据泄漏,并与时间序列先验进行比较,改进仍具有显著性。但在Fo
一项研究评估了一种方法:语言模型不直接进行临床计算,而是生成针对具体病例的 Python 代码,再由受限的本地执行器进行确定性求解。在 1,100 个病例和 55 个计算器上,该方法使用 Qwen2.5-7B 时并未稳定优于直接计算;使用 Qwen2.5-32B 时则达到 90.53%,高于直接计算的 83.47%。研究表明,执行器可以提升部分模型的表现,但不能替代经过验证的公式或可靠的变量提取。
Vals AI联合创始人兼首席执行官拉扬·克里希南表示,随着人工智能模型能力快速提升,相关测试和评估的投资却没有跟上。该公司为OpenAI和Anthropic等企业的模型提供独立评估。Vals AI发现了一些人工智能可能朝递归式自我改进发展的早期迹象,但克里希南指出,目前的模型仍远远落后于顶尖人类研究人员。
一项新研究显示,人工智能的发展与受人工智能影响最大的大学专业毕业生初始收入和就业率显著下降同时出现。这一令人担忧的趋势可能在未来多年持续影响这些毕业生的职业发展。
本文介绍作者参加 ECCV 2026 Wearable-AI Challenge 中 EgoLongQA 赛道的系统“Ambient”。该方法将长视频感知能力蒸馏到一个参数量不足 20 亿的紧凑模型中。现有描述称该系统获得第一名,但来源文本并不完整。
该工作介绍了其参加 ECCV 2026 Wearable AI Challenge 之 EgoProactive 赛道的方案。该方案在大模型组获得第一名,并据描述在现有文本未明确说明的另一组别中获得第二名。所提供的简介未包含技术细节或基准测试结果。
一项研究提供了初步证据,表明人工智能可能正在减缓美国的工资增长。尽管分析人士尚未观察到人工智能大规模取代人类工作,但他们发现,劳动者获得加薪的速度可能正在放慢,并可能因此影响生活水平。
TechCrunch Disrupt 2026将探讨人工智能、遗传学和计算生物学的发展如何改变保护生物多样性的研究。一家估值达十亿美元的初创公司正在开发可能让灭绝物种复生的技术。活动还将讨论相关伦理问题:如果科技能够复活灭绝物种,人类是否应该这样做?
该研究探讨了大型语言模型代理能否在测试前探索陌生环境,在不知道后续任务分布的情况下,自主决定如何准备可复用资源。系统在预算限制下研究环境,并为一个固定求解器生成索引、脚本或流程指南等产物。研究人员在六个异质基准上,将元代理与固定的合成练习和语料处理方法进行比较。元代理在五个基准上取得最高的 Avg@3 奖励,但在最大语料库基准上,固定语料处理表现最佳。增加研究预算并不能稳定提升后续奖励。不过,预先
TRACE 是一种无需训练即可减少 GUI 智能体视觉 token 的框架。它结合交互潜力、指令相关性和特征新颖性对视觉证据进行排序,同时预留部分 token 以维持屏幕上的空间覆盖。嵌套式排序使保留的视觉证据能够随预算逐步缩减;单调 KV 压缩则将已淘汰的帧整合为紧凑的会话状态,避免重复进行视觉编码。在六个 GUI 基准和多种模型上的实验表明,该方法可在严格预算下提升效率。
ActionSplice是一种面向分块自回归视频世界模型的推理框架,可在视频生成过程中处理新动作。该方法将问题表述为反事实状态传输(CST),利用轻量级校正器,将被中断的模型表示移动到修改后动作在同一求解器步骤所对应的状态。骨干模型和采样器保持不变,也无需重新执行已经完成的评估。CST-R会更新整个活动分块,CST-T则保留时间前缀,仅更新后缀。在minWM-Wan Action2V和HY-WM1
经合组织的一项分析显示,学生使用人工智能聊天机器人完成学校作业,与学习进度落后一年半有关。与此同时,人工智能聊天机器人在亚洲经济体中得到广泛使用。
Andon Labs让AI代理使用500美元启动资金,经营模拟自动售货机一年。据报道,GPT-6 Astra的平均最终账户余额达到1.5515万美元,大幅超过Claude Fable5.1。差距主要被归因于长期采购管理和稳定的规则执行,包括将商品价格压低至初始报价的约48%,并在整个运行周期内避免预付款损失。在更复杂的三方竞技测试中,GPT-6 Astra据称拒绝了违规协作,并赢得全部三轮比赛。该
该技术报告介绍了 StepAudio 3 Gen,一种通用音频生成模型,支持零样本文本转语音、声音设计、歌声生成、音效、音乐,以及多种音频类型的混合生成。与近期常见的连续扩散模型不同,该模型直接在残差向量量化(RVQ)令牌上进行离散自回归建模。其共享表示同时编码语义和声学信息。模型沿时间轴预测第一个码本,再由轻量级因果 Transformer 生成其余15个码本。研究重点包括考虑干扰的渐进式预训练
Feyospace提出了一种以数据为中心的开放权重网络安全模型后训练方法。五个系统分别用于分析隐藏的推理特征、降低教师模型采样成本、绕过教师模型执行限制、恢复模型合并造成的能力损失,以及将专家干预转化为可训练的推理数据。其数据引擎构建了可重置的编程、漏洞、CTF、内核历史、完整漏洞利用、固件和设备环境。经过执行验证与证据审计后,研究团队使用164,269条轨迹进行长上下文监督微调。团队称,三个检查