AI 新闻中心

AI 新闻中心 过去30天分析了 4690 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

GAE:学习用于生成三维一致世界的几何原生潜在空间

该研究提出一种紧凑的几何原生潜在空间,用于连接感知与生成。几何原生自编码器(GAE)的潜在表示可同时解码外观、深度、相机参数和点图。在保持生成器和训练流程不变的受控对比中,使用 GAE 潜在表示提升了视觉质量和独立测量的三维一致性。FVD 在 RealEstate10K 上下降 12.7%,在 DL3DV 上下降 23.1%;RealEstate10K 上的相机轨迹误差则降低了一半。

HyperQ 将令牌条件量子电路引入扩散语言模型

HyperQ在冻结的掩码扩散语言模型中加入令牌条件量子残差分支。轻量级电路超网络针对每个令牌,为共享的稀疏量子电路生成专属参数,训练时只更新新增分支。由于所需期望值可以通过精确的经典表达式计算,该方法能够在11亿参数的骨干模型上训练16至64量子比特的电路。在下游基准测试中,随着电路宽度增加,平均分数从47.65提升至54.30。在64量子比特配置下,HyperQ比骨干模型高4.71分,比低秩适配

从模式识别器到个性化陪伴者:大型语言模型在心理健康领域的综述

本综述将大型语言模型(LLM)在心理健康领域的发展概括为三个阶段:最初作为信息工具和模式识别器,随后成为用于即时互动的共情型对话者,目前则迈向具备持续记忆的长期个性化陪伴者。文章系统分析了相关核心技术,以及涵盖用户画像、记忆、推理和规划的智能体架构,并梳理数据集与评测基准。研究旨在整合这一领域较为分散的文献,为构建负责任、有效且以人为本的心理健康人工智能系统提供发展方向。

OpenRouter 发布 2026 嵌入模型选型指南

OpenRouter 核查了目录中的 37 个嵌入模型条目,并通过 28 项 API 检查测试了 19 个模型。指南建议英文 RAG 以低成本的 text-embedding-3-small 起步,长上下文场景选择 Voyage4-large,多语言开放权重方案则考虑 Qwen3-Embedding-8B。代码搜索可使用 voyage-code-4,文本与图像检索可选择 Gemini Embedd

火山引擎为Seedance 2.5上线Draft模式:480P低成本试错,1080P直接生成成片

火山引擎已为Seedance 2.5 API推出Draft模式。创作者可先以较低成本生成480P样片,检查场景、构图、主体动作、对白、音效和运镜节奏,再通过样片ID生成1080P成片。系统会延续提示词、参考素材以及seed、画面比例、时长等关键参数。官方以5秒1080P视频为例称,抽卡4次时成本可降低57%,抽卡20次时节省幅度可达77%。与先生成低分辨率视频再进行超分辨率处理不同,该模式直接生成

Ovis-Embedding 推进通用全模态嵌入技术

该报告介绍了 Ovis-Embedding,这是一系列全模态嵌入模型,利用统一的多模态骨干网络,将文本、图像、视频和音频编码到共同的表示空间中。该方法以预训练的 Qwen-Omni 模型为基础,结合对比学习、覆盖多种模态的高质量数据集,以及聚焦损失和基于相似度的嵌入蒸馏等专用技术。低秩特征分解能够在性能损失有限的情况下生成维度灵活的紧凑嵌入。报告中的评测显示,Ovis-Embedding 在 MM

RULER:用于 SVG 生成的实例感知式评分规则奖励

RULER 是一种从自然语言指令生成 SVG 代码的优化方法。由于开放式矢量图形任务通常没有唯一的视觉标准答案,CLIP 和 Aesthetic 等标量指标难以准确评估此类内容,用作强化学习奖励时还可能引发奖励投机。RULER 针对每条指令生成包含六个项目的实例感知式评分规则,覆盖语义、视觉和风格维度。视觉语言模型逐项评估渲染后的 SVG,再通过 Group Relative Policy Opt

AI 研究智能体的递归式自我改进

AIDE^2 是一个能够修改 AI 研究智能体自身代码的系统。它在研发任务上评估修改后的版本,并保留表现最佳的改动。在一次持续 8 天的自主运行中,系统发现了 7 项连续改进,包括新的搜索策略,以及压缩和管理不断增长的上下文的机制。这些改进还迁移到了 4 个未参与筛选的基准测试,涵盖机器学习工程、启发式算法工程和基于物理的天气预报。最强版本的表现达到或超过了一款由人类设计、实力较强的生产级研究智能

Flash-dLLM:面向高速、内存高效扩散式大语言模型的I/O感知KV缓存与并行解码

Flash-dLLM是一种无需训练的推理加速框架,旨在提升扩散式大语言模型(dLLM)的运行效率。研究发现,在启用KV缓存的dLLM推理中,GPU内存I/O是主要瓶颈,因此提出I/O感知的融合式KV缓存内核,以减少冗余的数据搬运。该方法还采用由KV缓存驱动的草稿生成与验证策略,由同一个dLLM同时充当草稿模型和验证器,无需额外辅助模型。在数学推理和代码生成基准测试中,Flash-dLLM在推理速度

韶音在2026云栖大会推出首款AI耳机OpenFit 2 AI

韶音在杭州举行的2026云栖大会上展示了首款AI耳机OpenFit 2 AI。该产品以阿里巴巴Qwen大模型为技术基础,支持录音转写、会议内容结构化总结和多语种实时翻译。新推出的“AI实验室”功能包括智能对话、日程与待办创建、语音随手记和消息摘要。耳机售价1398元,已于今年8月上市。产品具备IP55防护、蓝牙5.4和双设备同时连接功能,单耳最长续航11小时,搭配充电盒可达48小时。

华为智能门锁 2 Pro 悦享版开启预售,搭载 AI 3D 人脸识别 3.0,售价 2499 元

华为智能门锁 2 Pro 悦享版已在中国开启预售,售价 2499 元。该产品搭载 AI 3D 人脸识别 3.0 和 3D ToF 技术,可采集 307,200 个深度信息点,解锁耗时约 0.8 秒。活体检测与动态学习算法可用于拦截照片、视频及 3D 头模等伪造尝试。门锁还支持 AI 人形监测、异常抓拍、访客画面跨设备推送、可视对讲和远程解锁。内置 10,000mAh 电池可续航 4 至 6 个月,

江西首个Token工厂在南昌落地,聚合超300款主流大模型

江西省首个Token工厂项目已在南昌高新区正式落地。该平台由南昌高新招商集团与中国移动江西有限公司南昌分公司共同建设,旨在为大模型训练和推理提供标准化、高可用、相对低成本的算力及模型服务。据介绍,项目首期已聚合300余款主流大模型,并支持制造、医疗、教育等行业模型接入。项目采用政策引导与市场化运营相结合的模式,目标是降低中小企业使用大模型和算力资源的门槛。后续,该平台计划与江西省算力调度体系互联,

消息称字节跳动重组豆包聊天团队与模型后训练资源

据媒体报道,字节跳动旗下豆包通用 Session 团队预计缩减约一半。该团队此前约有 50 人,主要负责豆包聊天产品的产品策略、评测等工作。调整后,部分员工将转岗至豆包商业化、飞书等团队,其余人员可能被裁撤。负责基于 Seed 基础模型开展豆包对话模型后训练的 Product Posttrain-Chat 团队,也因相关业务需求减少而缩编。此次调整同时涉及产品团队和模型后训练环节,显示字节跳动正将

虎鲸文娱发布“鲸锐AI”,进军AI影视制作与管理平台

虎鲸文娱在2026云栖大会上发布面向影视行业的AI制作与管理平台“鲸锐AI”。据介绍,该平台旨在减少AI视频生成中的无效试错,提升大型制作团队的协作效率,并支持对影视创作全流程进行精细控制。平台计划于10月开启内测,首批面向专业影视创作者和制作团队开放申请。公司认为,AI影视制作的竞争重点可能将从单个镜头的生成能力,逐步转向能否以持续、可解释且符合预算的方式完成完整作品。现阶段该平台尚未公布实际测