AI 新闻中心

AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

告别单机模型“虚胖”:百灵团队与 AReno 打通本地智能体强化学习闭环

百灵团队与开源社区共同维护的本地大语言模型后训练工具包 AReno,展示了一套轻量级智能体强化学习流程。团队在 DGX Spark 环境中,以井字棋作为验证任务,对总参数量 79 亿、激活参数量 13 亿的 Ling-3.0-tiny 进行后训练。通过规则化奖励和 GSPO 算法完成 400 个训练步骤后,模型的平均奖励提升,非法动作减少,工具调用和动作选择也更加稳定。这项工作提出了一套可复现的方

金山 WPS 灵犀全面接入 DeepSeek-V4-Pro

金山办公于2026年8月14日宣布,AI办公智能体“灵犀专业版”已全面接入DeepSeek最新正式版模型DeepSeek-V4-Pro(V4-Pro-0813)。据公司介绍,该模型支持最高100万token上下文,单次最大输出为38.4万token。用户无需额外配置,即可在产品内切换Flash和Pro版本。灵犀能够持续处理用户的历史文档、会议材料和个人偏好,并调用文档、表格、浏览器、代码及数据处理

腾讯将混元后训练负责人徐灿调往微信 WeLM 团队

腾讯研究员徐灿已从混元团队转岗至微信事业群,加入 WeLM 大模型团队,负责后训练和 AI Agent 开发。徐灿曾任微软亚洲研究院研究员,主导 WizardLM 项目,并在 Evol-Instruct、合成数据和自动评测方面积累了研究经验。此次调整发生在微信加快 AI 功能落地之际。微信 AI 助手“小微”目前正在小范围测试,支持通过语音或文字操作微信功能,并调用小程序。WeLM 团队还在研发高

智谱正式发布 GLM-5.3:编程能力最强开源模型,较 GLM-5.2 提升 50%

智谱正式发布 GLM-5.3。该模型沿用 GLM-5.2 的基础模型,但通过大幅增加后训练和强化学习提升能力。智谱称,GLM-5.3 在内部编程评测中的表现提升 50%,并在 Terminal-Bench 3.0、Agents' Last Exam 等公开基准测试中位居开源模型首位。其 Terminal-Bench 3.0 得分从 4.6 提升至 28.3,DeepSWE v1.1 得分从 46.

报道称苹果与阿里巴巴正打造中国专属大语言模型

据知情人士透露,苹果正重新调整在中国市场的人工智能战略,并在阿里巴巴的技术支持下,训练或开发一款专门面向中国市场的大语言模型。由于OpenAI、Anthropic等海外公司的模型无法直接在中国部署,苹果可能转而通过本土合作伙伴提供相关能力。报道称,Apple Intelligence计划在数月内通过iOS更新登陆中国。不过,双方是否已正式达成合作,以及该模型是否获得相关监管许可,目前均未得到官方确

LiveAnimate 实现稳定的长时实时人物动画生成

LiveAnimate 是一种姿态驱动的人物动画系统,可根据单张参考图像和实时姿态流生成目标人物视频。该系统基于拥有140亿参数的视频扩散变换器,采用区块因果自回归生成、三步采样蒸馏,以及用于在长时间串流中保持外观和身份一致性的有限注意力缓存。在两块 NVIDIA H100 GPU 上,系统达到每秒19.63帧。在三分钟测试中,研究人员报告其感知质量和身份一致性基本保持稳定,而此前系统会随时间明显

UniSwap:面向说话视频的流式音视频身份替换

UniSwap是一种用于流式替换说话视频中人物外貌和声音的框架。系统输入参考图像与参考语音,通过单一音视频扩散Transformer迁移视觉身份和声音音色,同时保留原始动作、场景、语言内容以及音画同步。针对跨身份配对训练数据稀缺的问题,研究人员提出了交换与重建训练流程。流式适配、KV缓存和高效扩散技术将每个区块的去噪步骤从30步减少到3步。实验结果显示,该方法具备较好的音画同步、具有竞争力的身份保

消息称苹果在阿里巴巴支持下为中国市场训练专用 AI 模型

据路透社援引三名知情人士报道,苹果已针对中国市场训练了一款大语言模型。据称,该模型由苹果与阿里巴巴合作开发,阿里巴巴的通义千问技术也可能用于支持中国版 Apple Intelligence。这意味着苹果可能改变此前在中国依赖第三方模型提供 AI 功能的策略。Apple Intelligence 预计将在 iOS 完成后续更新后,于未来几个月内在中国推出。苹果的多项手机端生成式 AI 服务已完成相关

DreamX-Phi 1.0:用于机器人操作的动作条件视频世界模型

DreamX-Phi 1.0是一种面向机器人操作的视频世界模型,可根据观测帧、语言指令以及由末端执行器位姿和夹爪状态组成的动作序列,预测未来观测结果。模型通过将SE(3)几何变换注入注意力机制,保留各机械臂的身份和指定运动轨迹。轻量级深度分支用于增强场景几何建模,SAM3掩码与冻结的V-JEPA教师模型则帮助维持抓取过程中小型操作物体的一致性。此外,研究人员将多步生成器蒸馏为少步模型,以提高部署效

消息称谷歌 DeepMind 将放弃前沿模型研发,或面临大规模裁员

据媒体报道,谷歌 DeepMind 可能缩减前沿 AI 模型研发,转而聚焦成本效益更高的 Flash 级模型。此次重组或导致三分之一甚至更多员工被裁撤。知情人士称,冗余岗位、Gemini 团队在开发重点和资源分配上的分歧、算力资源紧张,以及下一代旗舰 Gemini 模型延期,都是重组的背景因素。谷歌尚未全面证实相关说法。DeepMind 首席执行官 Demis Hassabis 据称将不再负责日常

Alaya-EVOKE:从线性扩展监督到无尽世界

Evoke 是一种交互式世界模型,旨在兼顾持久记忆、快速响应和长时生成。它将场景几何信息存储在外部的相机索引世界状态库中,只检索与当前视角相关的信息,从而使去噪器上下文不会随着会话长度增长。教师模型结合分块分组、远距离帧选择性检索和线性注意力全局状态,在内存和计算量线性增长的情况下提供长时监督。通过自强制 rollout 训练的 30 秒分布匹配目标,将这些能力迁移到三步学生模型中,在保留提示词和

AutoDesign:面向长程智能体设计的元级Harness优化

AutoDesign是一种框架,通过元级Harness优化器利用执行反馈,引导代码智能体反复改进自身的Harness。研究团队以学术论文生成海报为任务,使用新基准PosterBench进行评估。在主赛道中,AutoDesign取得78.32分,比Claude Design高7.45分。在七种代码智能体和模型配置中,整合学习得到的DesignHarness后,平均得分从54.99提升至67.39。完

Intern-S2-Preview:面向科学发现的智能体基础模型

Intern-S2-Preview是一系列面向科学研究的智能体基础模型,支持多模态理解、推理、生成和长周期任务。其训练流程结合科学多模态预训练、监督微调、可扩展的多任务强化学习、智能体强化学习和在线策略蒸馏。3970亿参数模型还将时间序列建模扩展到科学信号理解和数值预测。独立的Memory Decoder可以在不修改冻结的397B主干模型的情况下,快速进行科学领域专项适配。根据公布的评测结果,该系