AI 新闻中心

AI 新闻中心 过去一年分析了 9093 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

智能体为何在长任务中失忆跑题:AWS、Claude Code 与 Manus 采用的四套框架机制

长时间运行的智能体频繁失败,问题往往不在模型本身,而在包裹模型的执行框架。AWS、Chroma 及多家智能体框架的分析总结出四种维持任务连续性的机制:上下文预算与外部卸载、压缩、任务状态管理,以及跨会话记忆。单纯扩大上下文窗口并不能可靠解决问题,因为输入越长,模型的可靠性可能越低。Claude Code 和 Deep Agents 会将大型工具输出写入外部存储,压缩对话并保留关键决策;Manus

OpenAI 发布仅 7 个月便将下线 GPT-5.3-Codex-Spark

据报道,OpenAI 将于下周退役 GPT-5.3-Codex-Spark,距离发布仅 7 个月。该模型专为实时编程设计,曾宣称依靠 Cerebras 晶圆级芯片实现每秒生成超过 1,200 个 Token,并脱离英伟达技术栈运行。但随着更强模型推出,其使用量持续下降,基准测试表现也明显落后于完整版本。Cerebras 后续推出的 Ultrafast 模式直接加速旗舰模型,表明高速推理可能从独立的

月费10美元的 OpenCode Go 宣布连续两周实现收支平衡

OpenCode 联合创始人 Dax Raad 于2026年9月12日表示,开源 AI 编码服务 OpenCode Go 已连续两周实现收支平衡。该订阅方案每月收费10美元,提供相对宽松的速率限制和多个 AI 模型的访问权限。OpenCode 还保留了包含其他模型的免费服务层。目前这一说法尚未得到独立验证;在 AI 编码企业纷纷收紧免费额度、转向追求财务可持续性的背景下,该消息具有一定的行业参考意

Benchmark Radar:面向 AI 基准测试与评估的持续更新数据库和搜索引擎

Benchmark Radar 是一个持续更新的数据库和搜索引擎,用于查找和评估大型语言模型及其他 AI 系统。平台覆盖语言模型评估、智能体与工具使用、编程、推理、安全以及特定领域评估。系统每天发现论文、代码仓库、数据集和发布内容,并将其与来源、引用、模型卡、技术报告及历史得分关联,方便用户核查评估证据。目录目前包含 1,283 条来源记录,以及覆盖 790 条记录的 12,916 个数值观测。项

英伟达推出搭载 84GB GDDR7 显存的专业级 RTX PRO 5500 Blackwell

英伟达近日在官网列出了专业级显卡 RTX PRO 5500 Blackwell 的工作站版本。该卡配备 21760 个 CUDA 核心、支持 ECC 的 84GB GDDR7 显存,显存带宽达到 1398GB/s,预计采用 448-bit 显存位宽和 25Gbps 等效速率。它搭载 3 个 NVENC 和 3 个 NVDEC 编解码器,最多提供 4 个 DisplayPort 2.1b 接口,最大

戴森 R3 AI 扫拖机器人在中国上架:30000Pa 吸力、70°C 热水深度洗地,售价 6999 元

戴森 R3 AI 扫拖机器人已在京东上架,售价 6999 元,9 月 16 日开始首销。产品配备 HD 摄像头、污渍感知系统和可识别近 200 种常见物体的算法。UV 显污和绿光显尘系统用于检测微尘及不易察觉的污渍,遇到重度污渍时可自动重复清洁。机器人拥有 30000Pa 吸力,遇到地毯会抬升滚筒,并可将 27 厘米宽的滚筒延伸最多 4 厘米以清洁边缘。气旋式基站支持无尘袋集尘、70°C 热水清洗

豆包手机助手消费者版发布,并推出 AI 应用自动化操作协议

字节跳动正式发布豆包手机助手消费者版,重点提升稳定性和日常可用性。用户可通过语音、专属 AI 键等方式唤醒助手,让其理解当前屏幕内容,搜索相册、短信、便签等本地数据,并在不同应用中执行任务。“操作手机”功能目前以 Beta 形式开放。豆包同时推出屏幕自动化操作声明协议(SAEP),允许第三方应用自行声明是否允许 AI 助手在应用内进行屏幕自动化操作。明确拒绝自动化操作的应用不会被助手操作。新版本还

Anthropic 与 Rum Group 签署 137 亿美元算力采购协议

据知情人士透露,Anthropic 已与 Rum Group 签署一份为期六年、价值 137 亿美元的算力采购协议。Rum Group 起家于社交媒体,长期与特朗普政府保持联系。此次交易让一家具有政治关联的供应商加入 Anthropic 不断扩大的基础设施网络。Anthropic 的合作方还包括谷歌等大型云服务商、SpaceX 等科技企业,以及新兴云厂商 Nscale。相关协议合计可能提供至少 1

马斯克:2.5万亿参数的Grok 4.8模型将于本周完成训练

xAI首席执行官埃隆·马斯克在X平台表示,Grok 4.8将是一款参数量达2.5万亿的AI模型,并使用全新的C++软件栈进行训练。他称模型将在本周完成训练,随后启动强化学习(RL)。此前宣布的Grok 4.7可能还要推迟几天发布。延迟原因可能是强化学习阶段对回复长度的惩罚过重,导致模型过早放弃困难任务,也无法严谨地检查自己的工作。

传闻:DeepSeek 将推出 3 万亿参数 Code 2.0,剑指 GPT-6 Astra

业内传闻称,DeepSeek 正在准备 Code 2.0。这款模型据称拥有超过 3 万亿参数,重点面向编程和电脑操作自动化,可能于 9 月发布,并延续 DeepSeek 的开源路线。相关消息出现在 V4.1Flash 发布及 V4.1Pro 系列公布之后。不过,关于 Code 2.0 将超过 GPT-6 Astra 等前沿模型的说法,目前没有官方技术资料或独立基准测试结果支持,仍属于未经证实的推测

月之暗面全面上线 Kimi K2.8 Preview,称性能接近旗舰 K3

月之暗面已将新模型 Kimi K2.8 Preview 全面接入 Kimi Code 和 Kimi Work 平台。公司表示,该模型综合性能已接近旗舰模型 Kimi K3,并重点提升了编程和智能体能力。模型支持最长 100 万 token 的上下文,所有会员档位均可使用。不过,报道没有提供独立基准测试来验证其接近 K3 的性能说法。此次发布是 Kimi 系列近期密集进行模型和产品迭代的一部分。