AI 新闻中心

AI 新闻中心 过去7天分析了 592 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

高通:手机仍将是个人交互核心,应用正迈向 AI 智能体时代

在 2026 骁龙峰会上,高通表示,未来一段时间内,智能手机仍将是个人计算和设备连接的核心中枢。尽管 AI 智能体可能推动智能眼镜、智能戒指等新形态发展,用户仍需要一款具备电池、存储、Wi-Fi 和足够计算能力的中心设备。高通预计,应用与 AI 智能体将在较长时期内共存。以叫 Uber 为例,智能体仍需调用现有服务来完成任务。高通将这一趋势概括为从应用时代迈向智能体时代,但此次内容主要是企业战略判

The Tasteful Agent:衡量和提升长程任务中的决策能力

一项新研究考察了大型语言模型代理在工程和科研等长程任务中,能否在关键决策分岔点选择正确方向。研究人员推出了 Taste-Bench,从代理执行轨迹中的决策分岔自动构建测试题。表现最好的受测模型也仅答对了 59.7% 的问题。当决定性证据要到轨迹后期才出现时,相关分岔明显更难;增加推理预算也没有提升准确率。不过,研究表明这种能力可以训练:通过蒸馏一个了解最终结果的教师模型的判断,学生模型在未见任务上

基于脚本感知混合专家的全能多语言场景文字识别

研究人员提出了ScriptMoE,这是一种覆盖10种文字体系、229种语言的场景文字识别模型。该模型采用共享视觉编码器和稀疏混合专家解码器,将每张图像路由至与其文字体系匹配的专家,同时通过共享专家学习跨文字体系知识。研究团队还构建了合成数据集TextMuSS-10M,以弥补许多语言训练数据不足的问题。ScriptMoE在TextMuSS-Bench上达到82.06%的准确率,比最强基线高1.31个

Claude Code v2.1.280 将 Opus 5.5 设为默认模型,支持百万 Token 上下文

Anthropic 发布 Claude Code v2.1.280,并将 Claude Opus 5.5 正式设为默认 Opus 模型。该模型支持 100 万 Token 上下文窗口,输入价格为每百万 Token 4 美元,输出为 20 美元,缓存读取为 0.20 美元。Pro 和 Team Standard 套餐的默认模型也从 Sonnet 切换为 Opus。此次更新还修复了安全检查重试、MCP

用于理解三维场景交互的几何与语义耦合

研究人员提出 Segment-Snap,用于理解三维场景中的交互,并联合描述可移动部件、部件运动以及操作区域。该方法识别较大的部件表面和较小的把手,再利用几何先验与把手位置推断运动方式和铰链轴,无需训练运动回归器。在 Articulate3D 验证集上,在保持掩码和轴不变的情况下,把手引导使运动门控平均精度从 13.74% 提升至 40.98%。加入额外把手候选后,把手平均精度从 24.63% 提

从模式识别器到个性化陪伴者:大型语言模型在心理健康领域的综述

本综述将大型语言模型(LLM)在心理健康领域的发展概括为三个阶段:最初作为信息工具和模式识别器,随后成为用于即时互动的共情型对话者,目前则迈向具备持续记忆的长期个性化陪伴者。文章系统分析了相关核心技术,以及涵盖用户画像、记忆、推理和规划的智能体架构,并梳理数据集与评测基准。研究旨在整合这一领域较为分散的文献,为构建负责任、有效且以人为本的心理健康人工智能系统提供发展方向。

OpenRouter 发布 2026 嵌入模型选型指南

OpenRouter 核查了目录中的 37 个嵌入模型条目,并通过 28 项 API 检查测试了 19 个模型。指南建议英文 RAG 以低成本的 text-embedding-3-small 起步,长上下文场景选择 Voyage4-large,多语言开放权重方案则考虑 Qwen3-Embedding-8B。代码搜索可使用 voyage-code-4,文本与图像检索可选择 Gemini Embedd

火山引擎为Seedance 2.5上线Draft模式:480P低成本试错,1080P直接生成成片

火山引擎已为Seedance 2.5 API推出Draft模式。创作者可先以较低成本生成480P样片,检查场景、构图、主体动作、对白、音效和运镜节奏,再通过样片ID生成1080P成片。系统会延续提示词、参考素材以及seed、画面比例、时长等关键参数。官方以5秒1080P视频为例称,抽卡4次时成本可降低57%,抽卡20次时节省幅度可达77%。与先生成低分辨率视频再进行超分辨率处理不同,该模式直接生成

RULER:用于 SVG 生成的实例感知式评分规则奖励

RULER 是一种从自然语言指令生成 SVG 代码的优化方法。由于开放式矢量图形任务通常没有唯一的视觉标准答案,CLIP 和 Aesthetic 等标量指标难以准确评估此类内容,用作强化学习奖励时还可能引发奖励投机。RULER 针对每条指令生成包含六个项目的实例感知式评分规则,覆盖语义、视觉和风格维度。视觉语言模型逐项评估渲染后的 SVG,再通过 Group Relative Policy Opt

Flash-dLLM:面向高速、内存高效扩散式大语言模型的I/O感知KV缓存与并行解码

Flash-dLLM是一种无需训练的推理加速框架,旨在提升扩散式大语言模型(dLLM)的运行效率。研究发现,在启用KV缓存的dLLM推理中,GPU内存I/O是主要瓶颈,因此提出I/O感知的融合式KV缓存内核,以减少冗余的数据搬运。该方法还采用由KV缓存驱动的草稿生成与验证策略,由同一个dLLM同时充当草稿模型和验证器,无需额外辅助模型。在数学推理和代码生成基准测试中,Flash-dLLM在推理速度

韶音在2026云栖大会推出首款AI耳机OpenFit 2 AI

韶音在杭州举行的2026云栖大会上展示了首款AI耳机OpenFit 2 AI。该产品以阿里巴巴Qwen大模型为技术基础,支持录音转写、会议内容结构化总结和多语种实时翻译。新推出的“AI实验室”功能包括智能对话、日程与待办创建、语音随手记和消息摘要。耳机售价1398元,已于今年8月上市。产品具备IP55防护、蓝牙5.4和双设备同时连接功能,单耳最长续航11小时,搭配充电盒可达48小时。

华为智能门锁 2 Pro 悦享版开启预售,搭载 AI 3D 人脸识别 3.0,售价 2499 元

华为智能门锁 2 Pro 悦享版已在中国开启预售,售价 2499 元。该产品搭载 AI 3D 人脸识别 3.0 和 3D ToF 技术,可采集 307,200 个深度信息点,解锁耗时约 0.8 秒。活体检测与动态学习算法可用于拦截照片、视频及 3D 头模等伪造尝试。门锁还支持 AI 人形监测、异常抓拍、访客画面跨设备推送、可视对讲和远程解锁。内置 10,000mAh 电池可续航 4 至 6 个月,