AI 新闻中心

AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

微软 Azure CTO:AI 30 分钟内将 Windows 工具基本功能移植到 macOS

微软 Azure CTO 马克·鲁西诺维奇表示,他借助 AI 在一个周末内将拥有 20 多年历史的 Windows 工具 ZoomIt 移植到了 macOS。输入约 12 条提示词后,AI 不到 30 分钟就完成了基础功能移植,两天内则完成了约 90% 的功能,包括休息计时器、全景截图、视频录制与编辑,以及将画面投放到第二块显示器的 Demo Mirror。移植过程中仍需针对 macOS 的界面规

千问上线 Qwen3.8-Omni-Flash:支持百万级上下文,30项评测平均提升超26%

千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入,以及 100 万 token 上下文。千问称,该模型在 30 项评测中的平均得分较 Qwen3.5-Omni-Plus 提升超过 26%。据介绍,改进主要覆盖音视频 Agent、编程、GUI 操作和长程任务等场景。千问还表示,音频及音视频输入的 API 价格大幅下降。模型已在千问 AI 平台开放体验

PrismML发布Bonsai 2 27B,将Qwen压缩至5.9GB

PrismML发布了Bonsai 2 27B,这是阿里巴巴Qwen3.8 27B的压缩版本。该模型大小为5.9GB,理论上可在智能手机上运行。PrismML表示,它在基准测试中保留了Qwen原模型98.2%的成绩。此次发布的重点是模型压缩技术及其端侧运行潜力,而不是这家目前尚未获得大额融资、知名度有限的人工智能初创公司。

反思、修订、复用:无需训练的 GUI 智能体技能进化

EvoSkill-GUI 是一个无需额外训练的框架,使 GUI 智能体能够根据执行反馈在部署阶段修订可复用技能。每项技能都以结构化软件包形式管理,包含检索元数据、可执行计划、备用定位方法、失败恢复规则、无障碍工具和失败案例。在“反思—修订—复用”循环中,智能体会诊断失败的执行轨迹,并有针对性地更新技能文件。在 MobileWorld、AndroidWorld 和 OSWorld 三个基准测试中,该

面向多模态大语言模型细粒度感知的区域级策略优化

Vision-RL2 在避免大幅增加视觉 token 成本的同时,提升多模态大语言模型(MLLM)的细粒度视觉感知能力。该方法先从压缩视图中定位相关区域,再将更高分辨率集中到选定证据上。研究人员通过区域级强化学习优化轻量级候选区域网络,并使用冻结的 MLLM 读取器评估各区域对答案的贡献。在六个细粒度基准和四个 MLLM 骨干模型上,Vision-RL2 在所有视觉 token 预算下都提升了准确

DeepSeek-V4.1-Flash:突破 KV 缓存压缩极限

DeepSeek 发布了 DeepSeek-V4.1-Flash,这是一款拥有 5520 亿骨干参数、支持最长 100 万 token 上下文的多模态混合专家模型。其因果编码器—解码器架构在解码阶段每个 token 激活 160 亿参数,在预填充阶段仅激活 80 亿参数。通过跨层 KV 缓存复用、FP4 KV 缓存和 SWA Bounded Replay 部署优化,该模型将 HBM 中的 KV 缓

JEPA-Anything:跨不同世界学习预测模型

JEPA-Anything是一种基于正交预测因子分解的领域无关世界建模框架。它扩展了联合嵌入预测架构,将潜在目标分解为互补因子,通过专用路径进行学习,再在统一的预测设计中重新组合。研究人员在视觉、生物学、临床轨迹、控制、分子动力学、物理场和天气等七个领域进行了评估。论文称,与匹配的JEPA基线相比,该方法在10项动力学任务中均改善了指标,并将Interventional Pong中的单次干预预测误

美国政府网站一度使用阿里巴巴千问模型搜索《联邦公报》

据路透社报道,美国国家档案馆运营的《联邦公报》网站曾提供由阿里巴巴千问模型驱动的搜索工具,用于查找拟议中的联邦法规和公众意见。该工具与其他搜索选项并列提供,但根据截图和存档源代码,已于周三下线。目前尚不清楚它何时部署。专家表示,在这一用途上使用中国的开放权重模型不一定构成国家安全风险。千问的核心组件可公开获取,开发者可以下载并根据特定需求进行修改。美国国家档案馆和白宫截至报道发布时尚未回应置评请求

开发者成功令英伟达 DLSS 5 在浏览器里运行,苹果 macOS 也可体验

开发者 MAAN 展示了一项概念验证,通过 WebGPU 让英伟达 DLSS 5 直接在浏览器中处理 3D 图形,macOS 设备也能运行。目前已有在线演示,并计划将源代码发布至 GitHub。实际运行速度仍较慢,暂不适合实时游戏。英伟达并未官方支持浏览器版 DLSS,其 SDK 主要面向通过 NGX 或 Streamline 集成的 DirectX 或 Vulkan 原生应用。由于 MAAN 尚

内存墙的另一半:通过训练式路由预测从 SSD 运行 35B MoE

Edge0 是一款流式推理引擎,旨在让混合专家模型在消费级硬件上运行。经过训练的预路由器会提前一个 token 预测下一层将选择的专家,使所需权重能够从 SSD 预先读取,并与计算过程重叠。未合并的恢复 LoRA 用于弥补 int4 量化和替换原有路由造成的质量损失。在一台配备 24GB 内存的机器上,Edge0 可让 35B MoE 模型以每秒 20 个 token 的速度运行,峰值活动内存仅为

小米公开MiMo-V2.6强化学习训练过程,计划开源技术细节

小米MiMo团队负责人、前DeepSeek研究员罗福莉公布了MiMo-V2.6大模型强化学习训练的最新进展。小米同步上线实时页面,展示训练进度、Token消耗和成本。团队正在开展大规模多任务智能体强化学习实验,采用异步并行计算、支持多框架混合运行的环境,以及结合测试用例和评分标准的组内信用分配机制。根据公开数据,MiMo-V2.6-Pro训练约43小时,成本为89万美元;Flash版本训练约38小

PANORAMA:通过掩码候选选择实现全景接地描述

该研究针对全景接地描述任务,要求视觉语言模型同时描述前景物体和背景区域,并将每个短语关联到像素级掩码。作者推出了人工标注的 PanoCaps 基准,包含密集描述、近乎完整的像素覆盖以及实体级图文对齐,并提出 Generalized Panoptic Quality 评估指标。PANORAMA 使用预训练分割器生成由短语条件控制的掩码候选,再选择与每个短语对应的区域。在 PanoCaps 上,该模型

SpectralShift:通过谱重参数化有效扩展 Gated DeltaNet 的上下文窗口

该研究探讨如何扩展用于长上下文建模的线性注意力架构 Gated DeltaNet(GDN)的上下文窗口。研究发现,远距离信息检索需要两个条件:足够宽的慢衰减状态动态频谱,以及保留用于状态清除和上下文切换的快衰减模式。SpectralShift 通过调整 alpha 投影的初始化来重塑衰减频谱,并对相关投影采用学习率缩放,以支持长上下文持续预训练。实验表明,该方法在训练过程中能够持续提升长上下文能力

小米直播训练 MiMo-V2.6,研究强化学习的扩展极限

小米 MiMo 团队在今年 4 月开源 MiMo-v2.5 后,已投入近半年研发 MiMo-V2.6,重点研究强化学习究竟能扩展到多大规模。目前该模型仍处于训练中期。团队扩展了计算资源、多任务智能体的环境与工具,以及用于评分和信用分配的计算资源。训练总成本已超过 125 万美元。小米计划在未来几周逐步公开更多技术细节,但模型的正式发布时间尚未确定。