因“数学垃圾”批评,OpenAI停止赞助加州理工学院数学黑客松
OpenAI表示,不再赞助加州理工学院举办的数学黑客松。参与者在活动中使用人工智能解决研究问题。此前,数学家批评部分人工智能辅助产出流于表面、质量不高,并将其称为“数学垃圾”。
AI 新闻中心 过去30天分析了 914 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI表示,不再赞助加州理工学院举办的数学黑客松。参与者在活动中使用人工智能解决研究问题。此前,数学家批评部分人工智能辅助产出流于表面、质量不高,并将其称为“数学垃圾”。
快速的技术进步、递归式自我改进的可能性以及智能代理群体,据称正让大型人工智能实验室的研究人员感到不安。文章讨论了极端的未来风险,但现有描述没有证据表明这类系统已经存在,或构成迫在眉睫的威胁。
以参考图像为条件的迭代式图像编辑可能产生网格状和颗粒状纹理,通常被称为数字波纹。Mi-Ripple 是一种由诊断引导的图像修复流程,可将周期性晶格伪影与和图像内容相互纠缠的颗粒纹理分离。根据伪影类型,该方法分别采用选择性频谱陷波、结构感知平滑,或先清理参考图像再重新生成。在 14 次仅使用陷波处理的实验中,整幅图像在 CIELAB 亮度上的残差标准差为 0.08 至 0.44。在一个配对再生成示例
小米发布并开源了 Xiaomi-CocktailASR-1,这是一款采用端到端 LLM 架构的自动语音识别模型,旨在解决多人同时说话时的“鸡尾酒会问题”。模型以一段参考音频作为目标说话人的声纹提示,即使在多人交谈的复杂环境中,也能提取并仅转录指定说话人的语音。小米表示,该模型在多个主流多说话人测试集上达到领先水平,单人识别性能可媲美标准 ASR 模型。此外,模型能够拒识非目标说话人的干扰语音,并在
X-AuT通过逐步移除音频编码器层,降低语音大语言模型的推理成本。由于直接删除完整模块可能破坏解码器所使用的表示,该方法结合了行为探针、表示对齐、跨尺度蒸馏、分阶段的学生策略监督和LoRA微调。语言模型骨干保持冻结。在10个公开中英双语基准测试中,将Qwen3-ASR-0.6B的音频编码器从18层压缩到16层后,宏平均错误率从5.61%降至5.27%。14层版本将音频塔参数减少20.7%,错误率达
自然资源部发布两套用于地质制图和矿产勘查的人工智能系统。“智能填图”系统将地质专家长期积累的经验和方法转化为可计算的知识库,并利用深度学习识别地质体特征。官方称,该系统的地质体识别精度总体超过90%,数据处理、综合分析和地质编图效率较传统方法提升50%以上。“智能找矿”系统融合约百万条知识图谱,以及地质、重力、磁法、电法、地球化学和遥感等200多种数据处理分析算法,可用于圈定找矿有利区和勘查靶区,
麻省理工学院(MIT)推出了“大语言模型选举观察站”(LLM Election Observatory)仪表板,用于追踪近十几款人工智能模型在 2026 年美国中期选举期间如何解答政治咨询。随着选民越来越多地依靠 AI 获取选举信息,研究人员正着手分析这些模型输出内容的影响、准确性与一致性。
18至28岁的员工似乎很喜欢类似于编写AI提示词的具体表达方式。根据一项新研究,他们更希望管理者用清晰的步骤和参数来下达指示。
研究人员提出了 Recursive Code World Models(RCWM),一种仅根据单张参考图像,以可执行代码重建复杂三维世界的框架。RCWM将递归场景程序表示与递归调用自身的构建求解器结合起来,反复执行“全局—局部—全局”流程:先建立完整场景,再重建未解决的部分,最后重新审视整体以改进组合关系。视觉语言编程代理会比较参考图像与渲染场景,并据此引导修正。报告中的实验表明,RCWM优于此前
SenseNova-U1.5是一款8B-MoT多模态模型,采用无编码器、无VAE的架构,用于理解、推理和生成视觉内容。模型支持最高4K原生分辨率,并针对图像保真度、文字渲染、复杂构图、多参考图像编辑、交错生成和结构化视觉指令进行了优化。多个专用专家分别增强视觉美学、双语文字渲染、信息图生成和图像编辑能力,再通过多专家on-policy蒸馏进行整合。开发团队表示,模型在多项评测中取得改进,并计划开源
研究团队提出 SpatialBlock-15k,这是一个包含 15,000 个积木堆叠问题的合成数据集,用于训练大型视觉语言模型的基础空间能力。任务涵盖 3D 到 2D 投影、视角变换和结构组合,并利用受控的颜色线索帮助模型在复杂视觉环境中进行推理。实验显示,采用直接回答或基于推理的训练方法都能优于基线模型,并推广到现实世界的空间任务。代码和数据已公开。
NCP-ArchPreview在标准的下一词元预测(NTP)之外,引入了下一概念预测(NCP)。模型预测跨越多个词元的离散概念,并将其反馈到词元层面以指导后续生成。该模型拥有89亿个参数,使用Dolma-3的5.73万亿个词元进行训练。报告称,模型仅消耗总训练词元的51.3%,就达到了OLMo-3-7B最终预训练损失;完成训练后,其下游任务宏平均成绩高出2.45分,在GSM8K上提升5.99分。研
T1是一款总参数量达1220亿的混合专家模型,通过强化学习训练,用于处理长程终端任务。它能在云端沙箱中操作真实Shell,每项任务可执行超过300次工具调用。其训练方法结合了密集过程奖励、采样令牌标识同步,以及对MoE路由决策的重放,以减少训练与推理之间的偏差。为降低基准过拟合,研究团队使用了与Terminal-Bench 2.1完全分离的独立种子和合成任务。作者称,T1在Terminal-Ben
OpenAI已确认正在开发一款专门用于自动化研究任务的AI智能体。该系统似乎仍处于早期阶段,公司尚未公布详细技术规格或性能测试结果。
深入了解一个试图让互联网相信自己是人类的机器人的思维。