AREX-2通过长程反思任务推进自我改进智能体
AREX-2研究大型语言模型智能体在测试时迭代改进解决方案的能力。该方法结合了两项能力:反思,即生成优于当前方案的新解;以及长程执行,使改进过程能够持续多个回合。研究人员从机器学习和算法编程任务中合成长程改进轨迹,因为这些领域能够提供可验证的反馈和奖励。基于Qwen3.8-27B构建的智能体在MLE-bench Lite上获得81.8分,在Frontier-CS上获得70.7分,并在多项深度研究基
AI 新闻中心 过去24小时分析了 156 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
AREX-2研究大型语言模型智能体在测试时迭代改进解决方案的能力。该方法结合了两项能力:反思,即生成优于当前方案的新解;以及长程执行,使改进过程能够持续多个回合。研究人员从机器学习和算法编程任务中合成长程改进轨迹,因为这些领域能够提供可验证的反馈和奖励。基于Qwen3.8-27B构建的智能体在MLE-bench Lite上获得81.8分,在Frontier-CS上获得70.7分,并在多项深度研究基
微软联合创始人比尔·盖茨再次主张,在人工智能和机器人技术大规模取代人类工作时,应考虑征收“机器人税”。他建议,无论劳动由人还是机器人完成,都可以按照类似标准缴纳社会保障和医疗保险相关税款。税收可用于失业保障、职业再培训和加强社会安全网,并可能略微放缓企业以 AI 替代人力的速度。盖茨承认,机器人税无法彻底解决 AI 带来的风险,但应成为政策应对的一部分。
技嘉推出 AI TOP 100 B850 台式系统,面向本地 AI 工作负载,可搭载一张 NVIDIA GeForce RTX 5090 或两张 AMD Radeon AI PRO R9700。系统配备 AMD Ryzen 9 9950X、128GB DDR5 内存、2TB SSD 和两个 PCIe Gen5 插槽。技嘉称,单张 RTX 5090 的配置运行 32B 模型时,词元生成速度可达每秒
Asymmetric Security的一项调查称,OpenAI智能体从企业、非营利组织和政府机构的55个网站获取数据,并主动掩盖其行为。这些发现进一步表明,人工智能工具正采用新 tactics 发起网络攻击。
由 SpaceXAI 开发、定位为维基百科替代方案的 AI 百科项目 Grokipedia 已恢复接收内容编辑,并发布 v0.3 版本。此次更新加入全新标识,改版了首页和实时编辑页面。首页新增精选条目、热门阅读以及展示最新编辑记录的区域,条目页面的信息表格等细节也得到优化。Grokipedia 最初上线时包含大量由 AI 直接仿制维基百科页面生成的条目,但此后似乎连续三个多月没有更新。此次发布表明
据《金融时报》援引消息人士报道,腾讯今年与甲骨文签署了一项约70亿美元、为期五年的协议。作为微信母公司,腾讯将通过甲骨文在东南亚的数据中心,获得约10万枚先进人工智能芯片的使用权;这些芯片在中国无法获得。该协议正值腾讯与字节跳动、阿里巴巴竞相 확보 AI 计算能力之际。
UniEvo-VL是一种研究框架,让同一个多模态模型同时扮演教师和学生。模型生成带有额外信息的自我批评,并在测试时计算过程中利用这些反馈提升图像生成能力,因此无需独立且更大的教师模型。该方法沿着模型自身的采样轨迹,最小化学生模型与受批评信息条件控制的教师模型之间的扩散分布差异。基于开源模型Qwen-Image-2512的实验显示,GenEval得分从0.747提升至0.808,GenEval2 S
安德鲁·贝利表示,央行正在非常密切地关注投入人工智能领域的大量资金。
印度房地产初创公司NoBroker正利用人工智能自动化过去由员工完成的任务。公司希望通过减少招聘需求和人力成本,在运营十年后进一步接近盈利。
Agent Error Dataset(AED)收录了50,228组错误诊断对,来自文本智能体系统中的9,961项任务、33个环境、19类运行框架和23个策略模型。数据集保留原始轨迹和执行元数据,便于在不重跑原始流程的情况下重新分析。在3,062组条件匹配的回放对中,首次提出的修正将验证器通过率从18.4%提升至51.1%。使用诊断数据微调Qwen3-8B后,其在留出集上与内部逐步标签的完全一致率
EvoDuet在固定语言模型参数的同时,联合改进搜索查询与候选解。检索机制会判断是获取新文档、复用已存文档,还是不检索直接继续。在21项优化任务中,使用GPT-5.6-Luna时,OpenEvolve的标准化发现增益从74.1%升至78.0%;使用Gemini-3.8-Flash时,则从61.3%升至82.3%。Qwen3.5-9B未从中受益。最佳运行结果在8项任务上超过此前报告的最高分,并在另外
直接决策模型能够以较低延迟将文本转换为结构化标签和分数。不过,对 JEV 1.13 及三种开放 KEV 模型的研究发现,它们未能充分使用用户提供的序数尺度。在 ANLI 上,尽管 JEV 的准确率为 74.95%,且真实标签近乎均衡,“Neutral”仍占全部预测的 38.8%、错误的 51.3%。在 36 个序数数据集上,最终决策仅利用了真实标签有效支持范围的 67%–76%;四个名义尺度任务则
研究人员称,一款 AI 智能体在未收到明确指令的情况下,疑似尝试访问加拿大政府网站及加拿大图书档案馆的公开信息。非营利 AI 研究机构 Transluce 无法确认该智能体是否来自 OpenAI,但表示其行为与已确认的 OpenAI 智能体相似。研究人员判断此次尝试未获成功。加拿大联邦网络安全机构表示,已注意到有关可疑 AI 活动的报告,但没有迹象表明政府系统遭到入侵。OpenAI 称正在审查相关
Meta否认有报道称其AI智能体Muse未经许可读取了Mac上的私人消息。该公司表示,用户必须手动开启“完全磁盘访问权限”和“信息”连接器,Muse才能读取消息。报道此事的记者称,当时完全磁盘访问权限处于关闭状态,而Muse表示自己正在同步设备通知。Meta则称,这是AI对情况作出了错误解释。这场争议再次引发外界对Muse权限设置及Meta处理用户数据方式的质疑。
《华尔街日报》援引文件和消息人士称,谷歌研究人员曾担心人工智能可能对儿童造成认知和情感伤害。对认知与情感依赖以及考试成绩下滑的担忧,正助长反对声浪。