继 Claude 被指取得突破后,OpenAI 宣称用1万个AI智能体解决千禧年难题
IT之家报道称,OpenAI 使用一款未公开模型和约1万个协作式AI智能体,在88小时内生成了纳维-斯托克斯存在性与光滑性问题的所谓证明。据称,GPT-6 Astra 进一步用 Lean 完成形式化验证。该说法尚未得到独立确认,并引发了对科学验证、数据使用和功劳归属的质疑。数学家陶哲轩还警告,如果AI无需人类深度参与就能解决重大难题,可能会对人类理解数学产生影响。此次计算成本据估计为1,500万至
AI 新闻中心 过去30天分析了 914 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
IT之家报道称,OpenAI 使用一款未公开模型和约1万个协作式AI智能体,在88小时内生成了纳维-斯托克斯存在性与光滑性问题的所谓证明。据称,GPT-6 Astra 进一步用 Lean 完成形式化验证。该说法尚未得到独立确认,并引发了对科学验证、数据使用和功劳归属的质疑。数学家陶哲轩还警告,如果AI无需人类深度参与就能解决重大难题,可能会对人类理解数学产生影响。此次计算成本据估计为1,500万至
一项针对双节点分割式 LLM 训练系统的系统安全研究发现了一个此前未测试的可观测信息泄漏通道。云端节点接收由真实数据行和诱饵数据行混合组成的数据帧,而本地节点只对真实数据行计算损失。因此,诱饵数据行的梯度精确为零,从而暴露哪些数据行是真实的。在九次运行中,每个数据帧的 4,096 个真实数据行都被准确识别。针对数据帧内容的攻击相比固定猜测基线每百个 token 约多恢复一个 token;随机打乱标
OpenAI 表示,已经找到纳维–斯托克斯问题的解法。这一重要数学问题与液体流动有关,已持续约 90 年未获解决。《纽约时报》和《连线》此前已报道这一说法。OpenAI 周二在博客文章中宣布了这项发现,但目前公开且可验证的技术细节似乎仍然有限。因此,这一所谓突破的实际意义尚未得到确认。
麻省理工学院一名研究人员使用GPT-5.6 Sol和Codex,自主开展量子计算实验、分析结果并校准量子比特。该案例展示了人工智能在具体科研任务中的应用,但没有提供性能限制或独立验证方面的信息。
谷歌人工智能气象模型的一项更新提高了天气预报的准确率。与传统气象模型一样,该模型也能从更丰富的输入数据中受益。
该消息分享了一份由人工智能生成的纳维–斯托克斯千禧年大奖问题解答,并附有文字说明和使用 Lean 形式化的证明。内容提出了可能取得数学突破的主张,但尚未证明该证明正确,也未显示其经过独立验证。
在各大人工智能实验室争夺数学能力优势之际,OpenAI称已投入数百万美元,解决了纳维–斯托克斯问题。但研究人员和竞争对手已经开始质疑这一说法。现有描述没有提供可验证的证据,证明这道长期未解的千禧年大奖难题确实已经被解决。
OpenAI表示,其一款内部模型利用1万个并行运行的智能体,在88小时内解决了数学界的纳维–斯托克斯千禧年难题。据称,该模型的能力显著强于“GPT-6 Astra”。不过,这一说法尚未得到公开验证,也没有经过独立评审的证明可供查验。
OpenAI现已接受总额500万美元的研究资助项目申请,支持独立研究生成式人工智能如何影响青少年的发展、福祉和安全。
人工智能研究机构 OpenAI 宣布了一项被称为里程碑式的成果,但一些学者指责其中可能存在不当行为,使这一消息受到争议影响。
数学家特里斯坦·巴克马斯特称,OpenAI 获悉他与 Anthropic 的勒文·阿尔珀格在纳维–斯托克斯方程方面的研究后,使用内部模型解决了这一问题。该说法目前尚未得到证实,也不能视为已确认的技术突破。巴克马斯特将这一疑似成果比作 1997 年 IBM 的深蓝击败加里·卡斯帕罗夫。
因果推断旨在根据数据估计治疗或干预的效果。传统方法通常需要针对每个新问题设计专门流程,包括提出因果机制、选择匹配的估计器并进行训练。因果基础模型将大规模预训练模型的范式引入因果推断。这类神经网络能够通过上下文学习,在完全新的数据集上估计平均处理效应等因果量,无需更新模型。该工作以实践为导向介绍这一新兴领域,概述因果推断和机器学习的必要基础,并提供示例代码和 Jupyter 笔记本。
这项研究提出了 Conformal Relevance 框架,通过结合上下文学习示例筛选与集成方法,为文档内容建立相关性评分。该框架面向摘要生成、抽取式问答等自然语言处理任务,旨在保留足够的关键信息,同时尽可能去除无关内容。现有先进评分方法通常依赖人工设计的提示词,让大语言模型评估内容的重要性。新方法减少了人工提示工程,在保持保形覆盖率的同时提高了内容的简洁性。研究在七项 NLP 任务上进行了验证
谷歌 DeepMind 推出 AlphaGenome Atlas,这是一个约 1 PB 的数据资源,预先计算了人类基因组中约 90 亿种可能单字母变化的分子影响。该图谱基于 AlphaGenome 和 AlphaMissense,涵盖数百种人类和小鼠细胞类型及组织中的基因调控、蛋白质影响等预测。新的 AlphaGenome Variant Impact 评分将两个模型的结果整合为单一数值,帮助研究
大型语言模型可以通过整合分散在公开网络上的线索,以令人意外的准确度将社交媒体上的化名账号与真实人物联系起来。这种能力引发了人们对网络匿名性、个人隐私和账号安全的重大担忧。