时间序列基础模型出现预测崩溃
一项研究发现,时间序列基础模型在预测1,000只美国股票的小时收益率时会出现“预测崩溃”:预测结果近乎扁平,股票排名表现也很差。相比之下,在相同条件下预测交易量时,该现象大幅减弱。研究人员认为,原因包括目标变量的可预测性较低,以及按单个序列优化的目标函数无法识别序列之间的结构。最小化平方误差会导致扁平预测,而直接优化横截面相关性虽能改善排名,却可能使预测幅度放大一个数量级以上。研究提出CalibR
AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究发现,时间序列基础模型在预测1,000只美国股票的小时收益率时会出现“预测崩溃”:预测结果近乎扁平,股票排名表现也很差。相比之下,在相同条件下预测交易量时,该现象大幅减弱。研究人员认为,原因包括目标变量的可预测性较低,以及按单个序列优化的目标函数无法识别序列之间的结构。最小化平方误差会导致扁平预测,而直接优化横截面相关性虽能改善排名,却可能使预测幅度放大一个数量级以上。研究提出CalibR
阿里巴巴旗下 Qwen 研究团队发布了 Qwen 3.8 27B。这是一款采用 Apache 2.0 许可证、具备视觉能力的 270 亿参数语言模型。Simon Willison 表示,这款 17GB 的开放权重模型支持长上下文、有效的工具调用、较强的视觉能力以及合格的代码生成。
采用ReAct范式的LLM智能体会在推理、行动和观察之间交替进行,但在等待环境响应时,推理会暂停。Second Thought利用这段空闲时间,在每次Thought阶段结束后立即并行启动四个辅助推理分支,并在下一次环境观察到达时合并结果。在三个智能体基准和三个推理模型上,该方法在全部九个模型与基准组合中都降低了平均交互轮数。在其中六个组合中,主线程的顺序解码量最多减少43%,第七个组合基本不变。P
该研究提出潜在在线策略自蒸馏(LOPD),旨在帮助 AI 智能体将经验直接融入自身策略。LOPD 不依赖设计者预先制定的特权信息,而是端到端学习这类上下文:系统检索相关经验,并将其组合为连续潜在 token,用于调节自教师模型。学生模型根据任务和交互历史生成轨迹,并在每个访问过的前缀位置获得密集的 token 级监督。研究还引入特权边际目标,以提升训练稳定性。在智能体工具使用和代码生成实验中,LO
PRM-as-a-Judge 1.5是一套用于精细评估机器人操作流程的工具包。它将执行视频转换为密集的进度曲线,并提供衡量失败过程进展、性能下滑后恢复能力以及成功执行质量的多项指标。项目还推出RoboPulse++,用于测试流程奖励模型的可靠性。该套件包含基准测试、指标实现和可视化工具,支持对具身模型进行透明且可复现的评估。
法国研究团队称,他们将取自已故成年人的活性脑组织接入了由电极、麦克风和机械手组成的闭环系统。这些被称为 OPAB 的脑组织外植体接受训练,将三个音符与三根机械手指的动作建立关联。在 16 个样本中,平均模仿准确率从第一天的 31.2% 提升至训练三天后的 58.5%。其中 62.5% 的样本至少学会了两个音符,部分关联在 17 天后仍然保留。研究人员认为,这种能力源于脑组织内部神经连接的变化,而不
该研究提出GAS,一种面向多模态大语言模型的训练框架,将视觉生成重新定义为表征学习的辅助监督。GAS在解耦的Mixture-of-Transformers架构中采用下一嵌入预测,通过生成任务增强共享视觉路径,同时避免生成梯度直接干扰上层理解模块。训练完成后,生成分支会被移除,因此推理阶段无需额外计算。实验表明,GAS能够提升多模态理解能力,其中在视觉感知和空间理解方面的收益最为稳定。
CPI-Bench是一项用于评估AI图像编辑模型的新基准,重点测试模型在真实应用场景中的表现。它包含三个子集:覆盖多种编辑任务并首次纳入多图像编辑评估的CPI-General-Bench,聚焦高频用户场景的CPI-Practical-Bench,以及评估高难度推理式编辑能力的CPI-Intelligent-Bench。对主流图像编辑模型的评估表明,该基准能够更有效地区分模型在通用编辑、实际部署和高
文章声称,SpaceX 在4月启动合作后收购了 AI 编程助手 Cursor。报道称,交易将使 Cursor 获得大规模算力基础设施,用于开发性能更强、成本更低的 AI 模型。Grok 4.6 被描述为双方团队的首项联合成果。不过,文章关于收购事实、交易估值以及可用 GPU 基础设施规模的多项关键说法目前未经证实。
OpenAI 已向符合条件的 ChatGPT 账户开放 Codex 约 105 万 Token 的上下文窗口。此前,这项能力仅限通过 API 调用,Plus 和 Pro 订阅用户需要手动配置后才能使用。更大的上下文窗口可以让编程代理在自动压缩历史信息前,处理更多代码、工具输出和完整对话记录,有助于大型代码库重构、复杂调试和长时间开发会话。OpenAI 同时提醒,默认上下文长度是在性能与成本之间权衡
随着大语言模型规模扩大,为维持适当的 token 与参数比例(TPP),训练 token 预算也必须增加。然而,高质量领域数据比通用网络数据更难扩充。本研究考察了重复使用现有领域数据,能否在避免过拟合的同时,抵消其在训练数据混合中的占比下降。对于固定领域和 TPP,最佳重复次数会随着模型规模扩大而小幅增加。在不同领域之间,最终验证损失越低,通常越能从更多重复中受益;而独有领域数据的数量与最佳重复次
研究提出了主张级可靠性评估(Claim-Level Reliability Assessment,CLR),这是一种无需额外训练、旨在更高效利用推理时计算资源的方法。CLR不再生成更多完整解答,而是从推理轨迹中提取对决策至关重要的主张,并针对性地检查其中是否存在决定性错误。该方法利用了一个不对称性:构建正确解答需要一条完全无误的推理路径,而反驳错误主张只需找到一个决定性缺陷。在四个大语言模型和四个
OpenAI 已将 Codex 中 GPT-5.6 Sol 约 100 万 Token 上下文窗口的使用范围扩展至 ChatGPT 账号。该功能此前仅支持 API 密钥,现在 ChatGPT Plus、Pro 等订阅用户也可以手动启用。更大的上下文窗口可让 Codex 在压缩早期信息前保留更多代码、工具输出和对话记录,适用于大型代码库重构、复杂调试和长时间会话。OpenAI 表示,默认上下文长度是
新加坡希望,更容易获得先进人工智能模型,能够遏制金融人才流向香港。香港金融企业难以使用美国最新的人工智能模型;相比之下,新加坡与美国和中国都保持密切关系,因此在这个城市国家获取最新模型相对容易。
阿里巴巴旗下AI Agent产品“千问办公”于8月14日宣布接入智谱GLM-5.3和DeepSeek V4Pro,用户可在首页“前沿模型”栏目直接选择。加上此前已接入的Qwen3.8-Max,平台现已覆盖阿里巴巴、智谱和DeepSeek三家的旗舰模型。DeepSeek V4Pro据称支持100万Token上下文和最高38.4万Token输出,重点面向长程任务与Agent任务串联。GLM-5.3则据