AI 新闻中心

AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

马克·扎克伯格真的相信人工智能应该“属于所有人”吗?

Meta本周发布了Glimmer,这是一款开放权重人工智能模型,任何人都可以下载并在自己的硬件上运行。相比之下,该公司更强大的模型Muse Spark仍仅通过Meta的API提供。发布之际,马克·扎克伯格发表了一封信,主张人工智能应该“属于所有人”,而不应由少数几家实验室控制。

中国医生据称用 GPT-5.6 破解 22 年数学难题,Crouzeix 本人确认正确

据报道,中国神经外科医生、博士后金山木使用据称具备自主运行能力的 GPT-5.6-Sol 模型,在约 16 小时内完成了 Crouzeix 猜想的证明。数学家 Alex Townsend、Anne Greenbaum 和猜想提出者 Michel Crouzeix 据称审阅了论文手稿,并确认其证明正确。报道称,该系统采用大量并行智能体、对抗性审计以及后续的 Lean 4 形式化验证。论文、提示词、历

阿里开源 Qwen3.8-27B,称其在编程和办公任务中性能提升

阿里巴巴已正式发布 Qwen3.8-27B,开发者、科研机构和企业均可自由下载、部署和使用。该模型拥有 270 亿参数,是原生多模态稠密模型,支持 26.2 万 Token 的原生上下文,并可通过 YaRN 扩展至最多 100 万 Token。阿里巴巴表示,与 Qwen3.6-27B 相比,新模型在编程和办公任务中的性能显著提升,部分场景下超过 Qwen3.7-Plus。模型还新增 reasoni

70天推出超10款AI模型:美国限制措施反而加速中国AI创新

据报道,自6月以来,9家中国AI公司已推出超过10款模型,涉及MiniMax、智谱AI、美团、腾讯、月之暗面、字节跳动、DeepSeek和阿里巴巴等企业,重点覆盖编程、推理、AI智能体、超长上下文和多模态生成。Artificial Analysis Intelligence Index显示,DeepSeek V4 Pro 0813在AI智能体表现上落后于美国头部模型,但平均单次任务成本明显更低。C

X 开源自家排名算法,用户可查看是否被限流

X 扩大了开源代码库,将“为你推荐”时间线的推荐算法以及核心排名和过滤机制纳入其中。相关代码采用 Apache 2.0 许可证,用户可以了解推荐内容如何生成,以及内容标签如何影响帖文可见性。X 还在测试“Under the Hood”功能,让过去一个月发布超过 10 条帖文的用户查看账号和帖文标签,了解是否可能受到传播限制。该功能初期将随机提供给符合条件、注册时间满一年的测试账号。

告别单机模型“虚胖”:百灵团队与 AReno 打通本地智能体强化学习闭环

百灵团队与开源社区共同维护的本地大语言模型后训练工具包 AReno,展示了一套轻量级智能体强化学习流程。团队在 DGX Spark 环境中,以井字棋作为验证任务,对总参数量 79 亿、激活参数量 13 亿的 Ling-3.0-tiny 进行后训练。通过规则化奖励和 GSPO 算法完成 400 个训练步骤后,模型的平均奖励提升,非法动作减少,工具调用和动作选择也更加稳定。这项工作提出了一套可复现的方

智谱正式发布 GLM-5.3:编程能力最强开源模型,较 GLM-5.2 提升 50%

智谱正式发布 GLM-5.3。该模型沿用 GLM-5.2 的基础模型,但通过大幅增加后训练和强化学习提升能力。智谱称,GLM-5.3 在内部编程评测中的表现提升 50%,并在 Terminal-Bench 3.0、Agents' Last Exam 等公开基准测试中位居开源模型首位。其 Terminal-Bench 3.0 得分从 4.6 提升至 28.3,DeepSWE v1.1 得分从 46.

DreamX-Phi 1.0:用于机器人操作的动作条件视频世界模型

DreamX-Phi 1.0是一种面向机器人操作的视频世界模型,可根据观测帧、语言指令以及由末端执行器位姿和夹爪状态组成的动作序列,预测未来观测结果。模型通过将SE(3)几何变换注入注意力机制,保留各机械臂的身份和指定运动轨迹。轻量级深度分支用于增强场景几何建模,SAM3掩码与冻结的V-JEPA教师模型则帮助维持抓取过程中小型操作物体的一致性。此外,研究人员将多步生成器蒸馏为少步模型,以提高部署效

研究系统分析混合线性注意力大语言模型中的大规模激活

该研究首次系统分析了交错使用线性注意力层和完整注意力层的混合大语言模型中的大规模激活。研究人员发现了两种与架构相关的形态:完整注意力层之前会出现激活尖峰,激活还可能持续穿过中间的线性注意力层,形成间歇平台。这些现象在五种线性注意力架构、六种混合配置、五个数据领域,以及参数规模从12亿到3970亿的开源模型中均得到观察。针对较小型 Gated DeltaNet 混合模型的受控实验表明,两种形态在训练

PlayWorld:利用代理玩家和长期目标评测世界模型

PlayWorld 是一个通过长期交互目标评估视频世界模型的基准。由于不同模型实现同一目标所需的动作序列可能差异很大,使用固定动作进行评测难以公平比较,因此研究人员让多模态代理玩家与各模型互动。该基准包含 171 个场景,评估几何一致性、交互保真度、视野外变化、状态持续演化,以及视频质量和可控性。对九个先进世界模型的实验显示,当前系统在长期交互目标上仍不可靠,尤其难以维持空间一致性和持续的状态变化

DeepSeek 开源首款 Agent 框架 Harness:一切皆插件

DeepSeek 在 GitHub 以 MIT 协议开源了首款 Agent 产品 Harness v0.1 开发者预览版。该项目并非推出新模型,而是为复杂任务执行提供基础设施。其核心理念是“Model + Harness = Agent”:模型负责推理,Harness 负责协调工具、上下文管理、联网检索、外部技能、存储、沙箱、调度和界面等功能。Harness 基于 Cordis 插件框架构建,开发