AI研究员约翰·舒尔曼、贝伦·米利奇与查理·奥尼尔谈反对递归自我改进的论据、中国实验室进展和长期强化学习
德瓦尔凯什·帕特尔采访了AI研究员约翰·舒尔曼、贝伦·米利奇和查理·奥尼尔,讨论反对AI递归式自我改进的论据、中国AI实验室的进展,以及面向长期任务的强化学习。嘉宾还分析了当前系统的局限,并认为AI发展距离能力上限仍然很远。
AI 新闻中心 过去24小时分析了 104 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
德瓦尔凯什·帕特尔采访了AI研究员约翰·舒尔曼、贝伦·米利奇和查理·奥尼尔,讨论反对AI递归式自我改进的论据、中国AI实验室的进展,以及面向长期任务的强化学习。嘉宾还分析了当前系统的局限,并认为AI发展距离能力上限仍然很远。
戴尔 14 Air 是一款 14 英寸 AI 轻薄本,将于 9 月 14 日在中国开售,售价 5999 元起。入门版搭载酷睿 5 320 处理器、16GB 内存、512GB 固态硬盘和 FHD+ 屏幕。高配版采用酷睿 7 350,拥有 6 核心、最高 4.8GHz 睿频,并内置可提供 17 TOPS AI 算力的 NPU。笔记本最厚 17.7mm,重量约 1.28kg,还可选配 2.5K 120H
阿里巴巴已将企业级 AI 办公智能体千问办公上架麒麟软件商店。官方称,该产品目前支持 Windows、macOS、HarmonyOS、银河麒麟和统信 UOS 等主流操作系统。阿里与麒麟软件围绕系统登录联动、设备互联和智能体技能调用等功能进行了适配优化。用户可以通过千问办公发送钉钉消息、总结群聊和会议内容、生成周报、预订会议、创建会议纪要,以及制作钉钉文档和 AI 表格。阿里巴巴表示,千问办公上线一
荣耀已在中国推出 DigaCite AI 相册管家。这款类似平板电脑的设备定价 1199 元,首发价为 999 元,配备 11 英寸 1920×1200 分辨率屏幕,支持最多 4TB 存储扩展和照片远程访问。其 AI 功能可按人物、场景和时间轴自动分类照片,并支持创建宝宝专属相册。自然语义语音搜索可处理“去年暑假在海边的全家福”等描述,以查找相符或相似照片。设备还提供废片拯救、老照片修复和自动生成
人工智能放射科医疗公司Epsilon Health宣布结束隐身运营,并完成由AlleyCorp领投的2000万美元A轮融资。该公司与使用其AI更快生成医学影像报告的放射科医生签订合作协议。
该研究探讨如何让大语言模型生成不仅能发现问题,还能指导作者进行具体修改的同行评审。ActReview将任务拆分为问题诊断和修改建议生成。研究人员利用OpenReview上的真实评审与反驳讨论,构建ActReview-40K数据集,将评审者提出的问题与作者回应及论文中的证据对应起来。Qwen3-8B-Base先经过监督微调,再使用GRPO和针对具体问题的评分类别奖励进行后训练。研究还推出了由人工整理
该研究分析图像标记器如何影响统一自回归多模态模型对图像和文本标记的联合建模。研究人员在多模态持续预训练过程中,跟踪文本、图像、文本到图像以及图像到文本预测的任务特定验证损失。结果表明,不同任务的损失呈现不同的扩展规律,并会对标记器产生不同的排序。基于共享文本词表计算的图像到文本损失,在跨标记器评估生成质量和视觉理解能力时,比文本到图像损失提供了更一致的信号。更好的图像重建能力并不一定带来更低的任务
IdeaAMBIG评估研究方法规范是否包含足够信息,使具备能力的实施者或编程代理无需无依据的假设,就能构建出预期方法。该基准包含660个有证据支持的实例:163个来自可复现性报告和GitHub问题的真实缺口,以及497个注入可实现参考资料中的受控合成缺口。研究评估三项能力:判断规范是否适合编码、定位缺陷,以及生成澄清行动。在测试的13个大语言模型中,最佳模型在真实实例上的宏观缺陷恢复率仅为9.6%
一项研究探讨了如何让推理模型持续使用用户提示所采用的语言进行推理,而不是主要依赖英语。研究团队构建了拥有33.5亿参数的 Tiny Aya L2-Thinker,在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的六项基准测试中,实现了覆盖60种语言、超过93%的语言内推理率。研究表明,更广泛的语言覆盖、多语言非推理数据,以及足够强的英语推理基础,有助于将能力泛化到未参与训练的语言。研究团队将公
一项研究分析了多模态实体链接系统在稀有实体上表现下降的原因。研究不只依赖页面浏览量等流行度指标,还采用知识图谱结构指标,识别文档记录不足或连接较弱的实体。根据稀有性的不同定义,当前最先进系统的准确率下降了15.4%至39.9%。研究人员提出了一种无需训练的框架,让具备推理能力的视觉语言模型反复搜索维基百科并动态收集证据。单独使用推理对稀有实体的提升并不明显;单独使用检索虽然能提高稀有实体准确率,却
MetroLLM-Bench 是一个包含955个案例的基准测试,用于评估语言模型作为交通服务终端的决策层,覆盖六个真实地铁系统。测试内容包括路线规划、票价计算、运营中断、无障碍服务和对抗性输入等。经过参数高效微调的40亿参数 Qwen 3.5 模型在确定性的 Tier 1 评估中获得91.3分,超过受测的 GPT-5.6 系统,并追平更大型的 GPT-5.4 配置;其 Q4_K_M 模型占用空间为
神经符号系统依赖数学求解器来验证推理,但求解器无法判断形式翻译是否与指定的参考形式化保持严格等价。该研究将一种失效模式定义为“保留判定的不忠实性”(VPU):错误编码仍能成功执行,并产生预期判定。理论分析表明,仅依赖结构和判定结果的验证方法,检测这类案例的能力最多接近随机水平。研究人员提出 Generative Verification(GenV),将离线的 Z3 等价性预言器蒸馏为连续且无需参考
一项研究分析了晚交互方法用于视觉文档搜索时的存储成本。现有压缩方法通常保留每页约1,000个向量中的一部分,或使用局部平均值,但在严格的存储限制下性能会明显下降;其他方案则需要重新训练编码器。研究人员对三种编码器进行分析后发现,这些向量位于单位球面上,并集中在内在维度仅为5到6的流形附近。将k-means质心归一化到球面表面,可以修正MaxSim分数被系统性低估的问题;与未处理的质心相比,nDCG
该研究提出 DRG-MAPPO,一种用于协同空战决策的多智能体强化学习框架。该方法通过图结构和图注意力机制,建模友军、敌军与威胁之间随时间变化的关系。分层策略动态分配“领导者”和“支援者”等战术角色,低层策略则根据角色信息和关系特征选择离散机动动作。此外,研究设计了目标优先级辅助任务,以促进集中火力等协同行为。在实验中,作者报告了 87% 的胜率。不过,这些结果仅限于所测试的仿真环境,尚不能证明该
UniH³是一种使用单一模型处理多种医学影像模态和退化类型的复原框架。该方法通过层次化同质性记忆模块和同质性引导注意力机制,利用不同模态之间共享的解剖结构。同时,层次化异质性平衡器可减少多任务优化过程中的任务冲突。在MedIR-2D-500K和MedIR-3D-3K基准测试中,研究人员报告称,该方法在全能复原和单任务复原方面均取得了当前最佳水平的结果。代码已公开。