AI 新闻中心

AI 新闻中心 过去30天分析了 915 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

研究显示:过度依赖 ChatGPT 可能削弱独立思考能力

法国 ISC 巴黎商学院的一项小型研究显示,过度依赖 ChatGPT 等 AI 产品,可能与独立思考能力下降、注意力持续时间缩短、记忆力减弱、自我怀疑增加以及部分情况下的社交孤立有关。研究人员访谈了 45 名年龄在 18 至 25 岁、每天使用 ChatGPT 的人士。部分受访者表示,ChatGPT 无法使用时会感到焦虑,也越来越倾向于先与聊天机器人交流,而不是向朋友、老师或同事求助。研究团队将这

WHALE:联合优化模型权重与执行框架的简单方法

AI代理的性能同时取决于模型参数,以及负责管理上下文和控制流程的可执行框架。WHALE(Weight-Harness Alternating Learning)交替执行两个阶段:先在当前框架下更新模型,再针对更新后的模型搜索更优框架。该方法结合了在线拒绝采样微调和Meta-Harness。在搜索问答、数学推理和国际象棋谜题三个领域使用Qwen3.5-2B和4B代理进行测试时,WHALE的最佳mea

GPT-6 Astra 在 ARC-AGI-3 标准测试中得分 62.7%,使用供应商适配器测试达 99.9%

Greg Kamradt 和 ARC Prize 表示,GPT-6 Astra 使用标准测试框架,在 ARC-AGI-3 Semi-Private 测试中以 2.6 万美元的成本取得 62.7% 的成绩。使用新的供应商适配器测试框架后,模型据称以 1.9 万美元取得 99.9% 的成绩。Claude Opus 5 得分 30.2%,GPT-5.6 Sol 得分 7.8%。两种测试方式产生了巨大差异

谷歌 DeepMind 发布 WeatherNext 3:AI 气象模型最高支持 5 公里分辨率

谷歌 DeepMind 和 Google Research 发布了 WeatherNext 3,并称其为目前最先进、最精准的全球气象模型。该模型利用最新卫星观测数据和气象站数据,每小时生成全球天气预报,部分关键地表变量的分辨率最高可达 5 公里。它旨在提供更本地化的预测,尤其面向过去因超级计算成本高昂而缺乏高分辨率区域模型的拉美、非洲和亚太地区。WeatherNext 3 还可预测约 100 米高

NeoMME:用于高效微调与推理的单塔式多模态原生多语言基础编码器

研究人员推出 NeoMME,这是一个包含 2.6 亿和 8 亿参数模型的双向多模态、多语言编码器系列。模型在单一 Transformer 编码器中处理多语言文本和原始图像块,并支持 16,384 个 Token 的上下文长度。在 ViDoRe v3 文档检索基准测试中,NeoMME Retriever 的 nDCG@10 分别达到 0.523 和 0.556。在 NVIDIA L40S 上使用 2

代理型人工智能究竟消耗多少能源?一位科学家追踪了他发送的每个提示

科技公司表示,普通人工智能提示消耗的能源很少。但气候科学家泽克·豪斯法瑟进行的一项为期八周的实验表明,代理型人工智能的能源消耗可能高得多。他在研究和数据分析中使用 Claude Code,记录了1,138条提示,并估算这些操作在数据中心消耗的电力。

研究探索语言代理与非语言代理的协作方式

一项研究考察,将非语言代理的连续状态表示压缩为简短文本摘要,是否会限制其与大型语言模型的协作。研究人员推出 LLAMIA-Bench,包含六项协作式国际象棋任务,涵盖行为模仿、状态评估和自然语言解释。作为语言化传递的替代方案,潜在状态内化方法将专用代理的表示直接投射到语言模型的 token 流中,以学习得到的状态 token 进行编码,并随环境状态变化动态重新编码。实验结果显示,基于语言描述的整合

ZipTok3D:利用紧凑Token前缀实现高保真三维标记化

研究人员提出了ZipTok3D,这是一种能够利用极短Token序列高质量重建三维几何结构的标记器。训练期间,嵌套丢弃会随机截断潜在序列,并要求每个保留下来的前缀都重建完整物体,从而使前置Token优先编码关键几何信息。随后,采用参数共享的Transformer解码器逐步恢复更精细的几何细节。在Token维度相同的情况下,ZipTok3D据称达到了使用32个Token的COD-VAE基线相当的重建质

一眼足矣:利用 SimLoss 实现单次推理的细粒度图像描述

SimLoss 是一种无需参考文本的训练目标,旨在通过单次推理生成更细致的图像描述。该方法使用 InfoNCE 对比损失,将视觉语言模型的隐藏状态表示与冻结的图像嵌入对齐,使模型在生成文字前就能学习属性、数量、纹理、材质和空间关系等信息。它不需要人工撰写的细粒度描述,也不依赖多阶段流程生成伪描述。在评测中,可微分的 SimLoss FFT 取得了最高精确率,F1 分数接近多阶段验证系统,同时运行速

OpenAI 首席科学家回应 AI 推理不透明争议

OpenAI 首席科学家雅各布·帕乔基在 X 上回应了外界对 AI 模型 Astra 可能因递归处理而难以监控的担忧。他表示,包括 Astra 在内的前沿模型,其计算图深度不到 GPT-4 的两倍,模型架构并未出现突然的复杂度跃升。OpenAI 计划为 Astra 部署额外的思维链监控。帕乔基承认,这类监控目前仍较为脆弱,但加强监控是公司的核心研究目标之一。争议源于“深度循环”技术:模型会反复调用

VibeVoice-ASR-Streaming:实时说话人归属语音识别技术报告

VibeVoice-ASR-Streaming 是一款用于实时流式自动语音识别和说话人归属的端到端模型。不同于将语音识别与说话人分离作为两个独立任务的传统系统,该模型结合固定大小的音频片段、少量前瞻音频和先前文本,在语音到达时直接输出“谁说了什么”。根据公布的评测结果,7B 模型在五个评测集上取得最低的平均 WER/CER,并在 13 项说话人归属设置中的 12 项达到最佳或并列最佳表现。研究团队

CRISP:面向长上下文大语言模型的输入自适应稀疏预填充

CRISP是一种加速长上下文大语言模型推理中注意力预填充阶段的方法。它利用代理注意力图的结构,直接识别适合的稀疏注意力模式,从而替代开销较高的路由计算。该方法还引入了考虑注意力汇聚标记的阈值,以减少在长上下文中选择相关位置时不断累积的背景噪声。根据作者的实验,在两个模型系列以及InfiniteBench、RULER和LongBench评测中,CRISP在512,000个词元下实现了最高5.30倍的

S3Gym:大语言模型能否将自我测试和自我评判转化为自我改进?

S3Gym是一项交互式基准测试,用于评估大语言模型能否测试自身行为、判断由此产生的经验,并改进未来的决策。该方法将开放式探索与严格的保留集评估分开,并在七个配备可执行环境验证器的文字游戏中测试智能体。研究比较了三种利用交互经验的路径:直接使用历史记录进行上下文学习、基于得分的摘要记忆,以及参数训练。结果表明,自我改进既不会自动发生,也不具有一致性。当经验能够被压缩为可复用的策略规则时,摘要更有帮助