为什么 AI 模型发布似乎接连不断
OpenAI 和 Anthropic 正在更频繁地推出模型,但发布加速的部分原因,是将已有能力重新包装,以适应新的价格区间。公告增多并不一定意味着每次发布都带来了重大技术突破。
AI 新闻中心 过去7天分析了 263 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI 和 Anthropic 正在更频繁地推出模型,但发布加速的部分原因,是将已有能力重新包装,以适应新的价格区间。公告增多并不一定意味着每次发布都带来了重大技术突破。
蚂蚁百灵团队开源两款参数量均为 60 亿的模型。Ming-Image-0.1-Design 可根据文字需求生成 UI、信息图、海报等视觉设计;Layer 版本可将设计拆分为可独立编辑的透明图层。团队还开源了 Design Skill 和 PPT Skill。在 Artificial Analysis 的 UI/UX 设计专项评测中,该模型位列开源模型第一,Elo 得分为 1082。蚂蚁称,模型在复
科大讯飞发布新一代语音识别大模型 Spark-ASR-2.0。公司称,该模型提升了中英文混合、方言及复杂声学环境下的识别效果,采用非自回归与经大语言模型增强的自回归识别协同、动态上下文注入等技术。相比 Spark-ASR-1.0,推理成本增加 10%。模型将于明日起逐步上线讯飞输入法,并通过讯飞开放平台提供 API,后续还将应用于更多讯飞产品。
阿里巴巴推出 Qwen-Audio-3.1 系列,涵盖语音识别、语音合成、音频理解、音频创作和实时交互模型。新功能包括多语言及方言识别、带说话人区分的转写、结合上下文润色转写文本,以及将语音、音效和环境声整合生成。阿里巴巴称,模型在部分公开和内部评测中有所提升。公司还宣布下调 Qwen-Audio 全线产品价格:TTS 约降 70%,Realtime 约降 85%,ASR 约降 95%。
高通在年度骁龙峰会上发布了骁龙8 Elite Gen 6和骁龙8 Elite Extreme Gen 6两款旗舰手机处理器。两款芯片均重点提升端侧AI能力,并配备新的传感中枢,可在设备上运行小型模型。高通表示,Extreme版本能够本地运行规模最高达300亿参数的混合专家模型,并通过仅激活任务所需的专家来降低能耗。相关应用包括个性化语音助手、说话人识别、本地用户记忆和任务自动化。此外,两款芯片还升
在2026云栖大会上,阿里云发布了Qwen Book。这款电脑主打自主理解用户意图、持续学习和执行长期任务,配备Skill键盘阵列、全局AI按键以及支持语音和手写的输入笔。产品旨在提升跨应用、跨智能体的协作效率,并支持高负载任务持续运行。Qwen Book采用“OS as Harness”理念,将千问端云模型与操作系统、应用、云服务和硬件深度整合。阿里云表示将开放系统接口,并已与高通、英特尔、罗技
特斯拉 CEO 埃隆·马斯克在接受央视采访时表示,中国 AI 大模型按单位算力计算的性能接近全球顶尖水平。他估计,中国可能通过光刻技术和芯片制造的进步,在两到三年内补齐算力缺口。马斯克还预测,AI 将在数字工作和软件开发领域实现大幅进步,十年内全球可能拥有至少 10 亿台人形机器人。这些内容属于马斯克的个人预测,报道未提供独立的技术证据予以支持。
Cisco Talos分析了针对Windows 11的恶意软件ClosedQuorum。据该安全团队称,这款使用Go语言开发的植入程序会调用Google Gemini、DeepSeek、Qwen和Mistral,在入侵电脑后自主决定攻击方案,并无需人类操作员持续下达命令。它利用侦察信息和投票系统选择下一步行动,包括窃取浏览器登录凭证、提取加密货币信息、建立持久化机制以及横向传播。Talos称,Cl
StableVQ 针对自回归和掩码图像生成模型所使用的离散视觉 tokenizer 的训练不稳定问题提出改进方案。作者认为,问题源于编码器—解码器与 codebook 的训练相互纠缠,使系统在训练压力较大时容易失稳。该方法通过 Dynamic STE 改进编码器的学习目标,利用 Region VQ Loss 让 codebook 能够独立跟踪编码器输出分布,并采用解耦训练计划,为两个子系统设置不同
DeepSeek 发布新论文,公开了名为 DSec(DeepSeek Elastic Compute)的弹性计算平台,旨在解决 Agent 训练中的基础设施瓶颈。与普通大模型不同,Agent 训练需要频繁创建和销毁干净的沙盒环境。DSec 每秒可生成超 5000 个沙盒,单日达 300 万个。它提供函数调用、容器、轻量虚拟机和完整虚拟机四种后端,并通过统一的 Python SDK 调度。为了应对巨
研究人员提出了ScriptMoE,这是一种覆盖10种文字体系、229种语言的场景文字识别模型。该模型采用共享视觉编码器和稀疏混合专家解码器,将每张图像路由至与其文字体系匹配的专家,同时通过共享专家学习跨文字体系知识。研究团队还构建了合成数据集TextMuSS-10M,以弥补许多语言训练数据不足的问题。ScriptMoE在TextMuSS-Bench上达到82.06%的准确率,比最强基线高1.31个
Anthropic 发布 Claude Code v2.1.280,并将 Claude Opus 5.5 正式设为默认 Opus 模型。该模型支持 100 万 Token 上下文窗口,输入价格为每百万 Token 4 美元,输出为 20 美元,缓存读取为 0.20 美元。Pro 和 Team Standard 套餐的默认模型也从 Sonnet 切换为 Opus。此次更新还修复了安全检查重试、MCP
该研究提出一种紧凑的几何原生潜在空间,用于连接感知与生成。几何原生自编码器(GAE)的潜在表示可同时解码外观、深度、相机参数和点图。在保持生成器和训练流程不变的受控对比中,使用 GAE 潜在表示提升了视觉质量和独立测量的三维一致性。FVD 在 RealEstate10K 上下降 12.7%,在 DL3DV 上下降 23.1%;RealEstate10K 上的相机轨迹误差则降低了一半。
HyperQ在冻结的掩码扩散语言模型中加入令牌条件量子残差分支。轻量级电路超网络针对每个令牌,为共享的稀疏量子电路生成专属参数,训练时只更新新增分支。由于所需期望值可以通过精确的经典表达式计算,该方法能够在11亿参数的骨干模型上训练16至64量子比特的电路。在下游基准测试中,随着电路宽度增加,平均分数从47.65提升至54.30。在64量子比特配置下,HyperQ比骨干模型高4.71分,比低秩适配
本综述将大型语言模型(LLM)在心理健康领域的发展概括为三个阶段:最初作为信息工具和模式识别器,随后成为用于即时互动的共情型对话者,目前则迈向具备持续记忆的长期个性化陪伴者。文章系统分析了相关核心技术,以及涵盖用户画像、记忆、推理和规划的智能体架构,并梳理数据集与评测基准。研究旨在整合这一领域较为分散的文献,为构建负责任、有效且以人为本的心理健康人工智能系统提供发展方向。