AI 新闻中心

AI 新闻中心 过去一年分析了 1377 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

科大讯飞2026年上半年归母净亏损2.04亿元,同比收窄14.68%

科大讯飞2026年上半年实现营业收入116.23亿元,同比增长6.52%;归母净亏损2.04亿元,同比收窄14.68%。不过,扣非净亏损扩大74.88%至6.37亿元,经营现金流净流出9.45亿元。公司上半年研发投入超过30亿元,重点用于大模型底座及相关AI产品。智能批阅机、影像云和AI眼镜等新品的战略性投入超过1亿元。公司还完成定向增发,净募集资金39.81亿元,将用于星火教育大模型、算力平台建

美团搜索3.0如何用大模型表征重构本地生活搜索底座

美团技术团队公布了搜索3.0在本地生活和零售场景中的三阶段演进。系统不再主要依赖词面匹配,而是为搜索词、商家和商品生成语义向量,并将余弦相似度信号注入排序模型,以匹配复杂用户意图与高度非标准化的本地供给。第二阶段引入对比学习、LoRA微调和Matryoshka Representation Learning,提升训练、推理效率及排序质量。第三阶段则将该表征体系从商家排序扩展到具体商品排序。美团称点

阿里巴巴发布 Qwen-UI-Agent,让模型操作数字世界中的各种界面

阿里巴巴发布了 Qwen-UI-Agent,这是一款面向手机、电脑、网页浏览器和 DeepSearch 环境的 GUI 智能体基座模型。据介绍,该模型在 MobileWorld、OSWorld、WebArena 和 ScreenSpot-Pro 等基准测试中达到领先水平。阿里巴巴表示,模型使用 100 多台真实手机和 150 多个应用构建训练与评测环境,并推出了真机基准。Qwen-UI-Agent

Unsloth Dynamic V3 压缩 Qwen3.8-27B,1-bit 版本仅需 8GB 内存

通义千问团队公开感谢 Unsloth 发布 Qwen3.8-27B 的 GGUF 量化版本,并称其更小、更聪明。Unsloth 表示,在文件大小相同的情况下,Dynamic V3 的准确率比其他量化方案高出超过 10%;不过,这些数据来自该项目自行进行的评测。1-bit 版本据称可保留约 77% 的原始准确率,并在 8GB 内存环境下运行。UD-IQ1_S 等高压缩版本约为 6.2GB,相比全精度

开源 AI 模型 Ornith-1.5 系列发布,宣称达到 Opus 4.8 级性能

DeepReinforce 发布了开源 AI 模型 Ornith-1.5 系列。公司称,该系列在训练过程中引入了自我改进循环,让模型持续生成难度更高的任务。旗舰模型 Ornith-1.5-397B 采用混合专家架构,总参数量为 3970 亿,并宣称在部分测试中超过 Claude Opus 4.8。该系列还包括 35B-A3B 模型、稠密型 9B 模型,以及量化版本 Ornith-1.5-9B-Mo

王兴兴:具身智能最快两三年迎来“ChatGPT时刻”

宇树科技创始人兼CEO、CTO王兴兴表示,具身智能最快可能在两三年内迎来重要产业转折,但在较慢情况下,突破可能需要五年至十年。他认为,产业规模化的标准应是机器人能够在80%的陌生环境中,通过语音或文字指令完成约80%的任务。当前主要技术瓶颈包括AI模型与物理世界的对齐、触觉反馈,以及操作最后几厘米时的精度和泛化能力。宇树展示了“物理AI机器人自进化”技术路线,计划结合研究成果检索、控制代码生成、仿

Co-RL:多智能体强化学习中的多样化模型群体涌现无监督推理

该研究提出 Co-RL,一种协作式强化学习框架,由多个相互独立的模型根据彼此的输出生成奖励信号。模型不共享参数,因此可以减少对成本高昂的真实标签的依赖。研究人员表示,增加模型系列、模型规模以及改写训练样本的多样性,有助于降低相关错误和自我强化反馈循环,从而缓解训练崩溃。在七项纯文本基准测试和四项多模态基准测试中,Co-RL 使语言模型平均提升 3.0% 至 8.6%,使视觉语言模型提升 2.3%

训练具备化学合理性感知能力的大语言模型,用于单步逆合成

一项研究提出将 Top-K 提示作为单步逆合成的训练和推理方法,使系统能够生成多条合理的反应路径,而不是只给出一个答案。研究人员构建了 CREED-CCV-2+USPTO-XL 数据集,其中包含约 4,560 万条经过验证的反应,并据此训练化学语言模型 C3LM。模型将微调与基于 ChemCensor 的奖励及面向新颖性的奖励相结合。研究作者称,该模型在分布外基准 URSA-expert-2026

潜在世界模型中的决策指标对齐:用于MPC规划的诊断与动作条件目标

该研究分析了在采用JEPA风格潜在世界模型的模型预测控制中,目标潜在表示的欧氏距离能否可靠反映实际任务进展。作者提出Plan-Real Spearman和CEM-Stage Spearman,用于衡量候选动作序列的潜在排序与真实排序在搜索前及交叉熵方法搜索逐渐集中时的一致性。研究指出,编码器失真、终端滚动预测误差和候选方案之间的差距是影响对齐效果的关键因素。DA-LeWM在LeWM基础上加入逆向动

Zetta ζ:面向自我进化物理智能的高效闭环系统

Zetta是一套面向具身AI代理的闭环控制与学习系统。在冻结基础策略模型的同时,它能够在线演化运行时批评器和恢复技能。三个具有不同时间尺度的循环分别负责在动作频率上进行执行控制、在每次 rollout 层面提出批评与恢复方案,并在通过验证后更新技能。结合将代理逻辑与异构执行资源解耦的Z-Infra,研究团队报告称,Zetta在LIBERO-Pro和RoboCasa上的成功率分别达到90.8%和93

SoftVTBench:面向可变形物体操作的形变感知视觉触觉数据集与基准

SoftVTBench 是一个用于评估可变形物体操作的数据集和基准,重点衡量物理交互质量。它包含 4,000 次专家示范和 50 多个物体,包括体积可变形物体及外观匹配的刚性对照物。每个回合同步记录多视角 RGB 图像、双指触觉图像和标记点运动、本体感知、语言及夹爪动作,并提供仅供评估使用的有限元状态作为独立的物理真实值。该基准提出“形变感知成功率”,只有在完成任务且最大形变保持在容差范围内时才算

SemComp-Bench:视频生成中的语义任务完成度基准

SemComp-Bench提出了一项面向结果的视频生成评测基准。只有同时实现预期结果,并保持与参考图像相关的任务语义对应,生成结果才算成功。其数据集SemComp-Data覆盖六个领域,包含参考图像、详细和简短指令,以及以结果为中心的视频片段。一个四阶段数据整理流程将原始视频转换为标准化样本。评测使用视觉语言模型回答结构化二元问题,并分别报告结果达成度和生成可靠性分数。对多种代表性视频生成模型的实

FM-Bench:评估竞争代理长期管理能力的基准测试

FM-Bench评估语言模型代理能否在行动后果不断累积的长期环境中持续做出有效决策。每个代理使用26种工具和约340至400个决策节点,管理一支足球俱乐部20个游戏内赛季。它需要组建阵容、交易球员、谈判合同、投资设施和青训、安排首发,并向有权解雇它的董事会负责。最终分数由确定性引擎计算,不使用LLM裁判或人工评分。在针对15个前沿模型的单人赛和共享世界Arena测试中,所有模型都完成了整个周期。C

SemaPLC:面向 PLC 代码生成的项目基础与验证门控代理框架

SemaPLC 是一个用于生成可编程逻辑控制器(PLC)代码的代理框架。它整合传统工具,只有在外部检查确认规格、编译结果以及实时运行环境中的行为后,才会判定任务完成。在涵盖 117 个独立程序组织单元任务、涉及 7 个模型的测试中,SemaPLC 的严格验证通过率平均达到 72.6%。在另一项包含 65 个项目上下文任务的测试中,生成的逻辑必须在现有项目内完成编译并运行;SemaPLC 在集成编译