AI 新闻中心

AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

RSIAgent:面向新环境递归自我改进的自主探索

RSIAgent是一种无需额外训练的多智能体框架,能够自主探索陌生的数字环境,并将环境特定知识保存到可复用的记忆中。课程、执行和验证智能体先进行广泛探索,再针对困难案例、隐藏约束、边界条件和因果关系开展深入探索。生成的记忆无需更新模型参数即可用于后续任务。研究在OSWorld-v2和Agent’s Last Exam上的实验中报告称,该方法显著提升了开源模型的表现,并声称Kimi-K3和GLM-5

苹果 iOS/iPadOS 27 汇总 54 项隐藏新功能,重点聚焦 AI

MacStories 主编 Federico Viticci 汇总了 iOS/iPadOS 27 的 54 项隐藏或不易发现的新功能。据介绍,本次更新没有延续大幅视觉改版路线,而是重点提升性能、可靠性并打磨细节。AI 功能是主要变化之一:Siri 可理解屏幕内容和上下文,跨 App 执行操作,分析图片,改写文字并搜索邮件;照片、文件、Safari 和快捷指令也加入 AI 辅助功能。其他更新包括改进

Realtime-Venus:支持异步委派的全双工交互系统

Realtime-Venus是一套面向音频和视频交互的主动式全双工系统,由两个分别训练、各含90亿参数的模型组成:用于视听交互的Realtime-Venus-Omni,以及用于语音交互的Realtime-Venus-Audio。两款模型通过共享因果时间线,整合连续感知、对话控制和原生语音生成。双循环运行环境可在对话持续进行的同时,异步执行后台推理和工具调用。根据公布的评测结果,Omni在8项视频基

HazardAuditor:从可执行威胁到更安全的计算机使用代理

计算机使用代理正越来越多地操作浏览器、终端、文件系统和外部服务,由此产生的安全风险往往在运行过程中出现,而不仅存在于生成内容中。HazardAuditor在受控环境中运行Claude Code、Codex、Hermes和OpenClaw等不同代理,并将其交互统一为标准事件表示,以支持跨框架监督。研究人员还提出Guard Policy Optimization,解决基于词元的训练目标容易让较长推理过

比尔·盖茨:中美各有四家机构能让大模型保持最先进水平

盖茨基金会计划在未来两年投入10亿美元发展人工智能,重点是让贫困地区也能获得技术红利。比尔·盖茨在采访中高度评价中国人工智能的发展,称中国和美国各自都有至少四家机构的大模型能够保持最先进水平,但没有透露具体名称。他认为,开源模型对发展中国家尤其重要,并建议技术领先国家拿出数据中心5%的算力,作为数字援助免费提供给贫困国家。盖茨还讨论了数据中心排放、硬件价格上涨、AI对就业的影响以及社会不平等。他表

Pick Your Poison:选择投毒数据集以增强对大语言模型的后门攻击

一项研究表明,大语言模型后门攻击的成功率高度取决于微调时选择哪些投毒样本。在三种基于 LLaMA-3-8B 的后门设置中,即使模型、干净数据和投毒样本数量完全相同,攻击成功率仍在 3% 到 80% 之间变化。研究人员将投毒数据集选择形式化为预算约束下的集合优化问题,并提出 SAILS。该方法通过数百次微调和评估,学习为数百万个候选数据集排序。与最强的基于影响力的基线方法相比,SAILS 在留出数据

当智能体开始变慢:通过每Token Elo分析理解LLM智能体的测试时策略

这项研究分析了大语言模型智能体如何在推理阶段分配额外算力,包括修改解法、使用工具、探索替代方案以及决定何时停止。研究人员提出每Token Elo分析,跟踪不同Token预算下找到的最佳解,并比较评分尺度不同的任务。在四个智能体和四个开放式基准上的实验表明,智能体起初比独立采样更高效地将Token转化为进展,但边际收益会下降,最终低于该参考水平。相比之下,人类参赛者在类似的优化任务中仍以超线性速度提

KaiNinja 将原生 3D 生成器扩展到部件级别

原生 3D 生成器通常会将单张图像转换为一个融合的单一网格,但编辑、绑定和仿真需要独立的部件资产。KaiNinja 通过能够表示部件接触界面的双体积表示,将 TRELLIS.2 扩展到部件级生成。该方法无需额外的分割模型即可生成部件级资产,同时保持基础模型的速度和质量。训练数据包括 CAD 模型,以及由 LLM 驱动代理创建的资产。作者称,与采用不同范式的部件生成流程相比,KaiNinja 将完整

Atria Dawn:面向科学研究与工程工作的智能体模型

Atria Dawn Preview是一款面向科学研究和工程工作流的智能体语言模型。该模型通过“可验证经验管线”训练,将工具交互连接到可执行环境和经外部验证的结果。在涵盖研究、工程和数字工作的16项基准测试中,Atria Dawn的表现可与前沿智能体竞争,并在其中5项取得已公布的最高分。对56名参与者完成的769项任务进行分析发现,人类仍掌握大多数最终决策,而智能体经常提出方法并实施修改。参与者认

OpenAI研究员警告:人类可能正逐渐失去评估先进AI模型的能力

OpenAI能力研究员丹·塞尔瑟姆在一份公开的个人人工智能风险声明中表示,顶尖模型似乎正变得越来越具备情境感知能力,这可能使人类更难可靠地评估它们的能力和行为。他还警告称,人们正越来越依赖人工智能来引导研究。这些说法属于个人观点,并未提供证明新能力或重大技术突破的独立证据。

ZGCM-1:面向数学与智能体搜索的完全开放高效基础模型

ZGCM-1 是一个完全开放、从零训练的 70 亿参数稠密型基础模型,面向数学推理和智能体搜索。其训练方案支持 256K 上下文,结合交错式门控滑动窗口注意力与全注意力机制,并采用 FP8 Muon 优化器和分阶段上下文扩展。该模型通过有意推理和调用外部工具,弥补小型模型参数容量有限的问题。研究团队称,ZGCM-1-7B 在通用基准测试中具备与同规模 7B 模型竞争的性能,并在部分数学推理和智能体

字节跳动 CEO 梁汝波:AI 是过去 50 年最大的 IT 发展高峰

字节跳动 CEO 梁汝波表示,过去 50 年 IT 行业经历了 PC、Web、移动和 AI 四次主要发展高峰,AI 高峰的规模远超前三次。尽管目前大语言模型与海外领先模型存在差距,字节跳动仍将坚持自研,接受短期落后并持续优化。公司称,视频生成模型 Seedance 仍保持前沿水平。字节跳动还在整合豆包、飞书和火山引擎的产品及企业服务团队,以加强面向办公和生产力场景的 AI 产品与服务。据称,飞书新

Vidu S2:实时交互、可编辑与空间视频生成

Vidu S2由Vidu S2-Avatar和Vidu S2-Editing组成,前者是实时交互式数字角色模型,后者是实时视频编辑模型。研究团队还探索了两者进行实时空间视频生成的可行性。与Vidu S1相比,S2-Avatar支持实时生成720p视频,能够使用可随时更新的动态参考内容,并更好地遵循跳舞等指令。S2-Editing可以实时编辑视频流,包括风格渲染以及服装、角色和背景替换。根据公布的实

并非所有提示词都相同:面向多模态强化学习后训练的探索引导式提示词支架

一项研究提出了一种方法,在多模态大语言模型的强化学习后训练过程中动态调整训练提示词的分布。探索潜力评分(EPS)利用在线策略回滚统计数据,估计提示词能够提供的学习价值。该方法不直接丢弃低价值提示词,而是让教师模型在保留原始任务意图的前提下进行改写,从而产生更有信息量的训练信号。与GRPO结合后,该方法在Geo3K和MMK12上均超过基线,域内相对提升最高达9.7%,在MathVision和MMMU