AI 新闻中心

AI 新闻中心 过去一年分析了 8900 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

MemTrapBench评估大语言模型使用记忆时的认知陷阱

MemTrapBench是一项用于评估大语言模型如何受到已存储信息影响的新基准测试。现有记忆评测主要关注信息能否被正确提取、存储和检索,而MemTrapBench进一步考察相关记忆是否会在当前任务中扭曲模型的推理或信念。该基准涵盖两类认知陷阱:推理固着和信念扭曲。研究人员在两个模型系列和五种记忆框架上进行实验,发现所有受测记忆策略的表现都不如不使用记忆的设置,最强方法的性能也下降了超过10%。研究

EnvHarness:让静态环境适应智能体学习

大语言模型智能体通过与环境交互来学习,但现有环境通常由人工构建且保持静态。EnvHarness 提出一个可编程的插件组件层,在不修改底层逻辑或验证器的情况下,改变现有环境的行为。其配套系统 EnvRigger 将目标策略视为黑盒,分析执行轨迹以诊断弱点,生成针对性的组件,并通过新的运行过程进行验证。在覆盖四个领域的五项基准测试中,研究人员报告称,EnvHarness 的表现优于原始环境和面向特定领

WithEveryone:面向群体图像生成的统一规划与身份定位

WithEveryone 是一个用于生成包含最多 10 个指定人物身份的群体图像框架。该方法为每个身份注入带地址的标记,预测结构化的身份与布局规划,并将其作为视觉条件。其布局定位身份损失直接利用标注的人脸区域进行监督,避免依赖不稳定的基于嵌入的人脸匹配。在身份与训练数据不重叠的基准测试中,WithEveryone 的目标场景人脸相似度达到 0.499,高于 GPT-Image-2 的 0.462。

Waymo 首次公开搭载自研 5nm ASIC 的计算系统

Waymo 首次公开了驱动其 Robotaxi 的计算系统。公司称,该平台融合 CPU、GPU、加速器和机器学习技术,原始计算性能在 8 年间提升了 20 倍。低延迟软件栈旨在缩短从传感器获取初始数据到车辆执行动作之间的时间。系统还采用两个并行运行的计算引擎,以提供冗余能力,应对严苛的车载环境。除采购商用组件外,Waymo 还使用自研的 5nm ASIC,宣称其机器学习算力超过 1000 TOPS

超千亿参数藏语大模型“阳光清言”正式发布

在拉萨举行的2026全球数字经济大会论坛上,通用藏语大模型“阳光清言”正式发布。该模型基于大型基础模型打造,使用海量多源藏语数据进行训练,旨在理解和生成藏语内容及西藏相关知识。项目已完成近两个月的内部测试和两个多月的公开测试,并通过中国网信部门备案。项目发起人、中国工程院院士尼玛扎西表示,由于训练所需算力和高质量数据仍较为不足,模型当前整体表现尚未达到设计目标。新成立的拉萨市纳金数智研究院将开展人

阿里发布 Qwen-UI-Agent,称在多项 GUI 基准测试中领先

阿里巴巴于8月20日发布GUI智能体基础模型Qwen-UI-Agent,支持移动设备、电脑、网页浏览器和深度搜索环境。根据阿里公布的结果,该模型在MobileWorld、MobileWorld-Real、AndroidDaily和OSWorld-Verified上分别取得82.1%、92.2%、97.5%和79.5%的成绩,并在其他多项评测中刷新最高纪录。除常规GUI操作外,模型还支持执行命令行指

宇树科技推进具备自进化能力的物理AI机器人模型

宇树科技创始人王兴兴在2026世界机器人大会上表示,公司正在开发能够自我进化的物理AI机器人模型。相关计划将以大模型为核心,结合学术论文、研究成果、开源方案及自定义规则,自动生成机器人控制代码,并通过模型自评和人工审核进行验证。公司还计划把仿真数据、真实世界数据和人类行为数据纳入训练流程。宇树科技现场展示了人形、四足和轮式机器人在自研群控系统下的协同运行。王兴兴认为,机器人在陌生环境中的泛化能力不

腾讯新一代大模型Hy4即将发布,将成为WorkBuddy核心引擎

继腾讯此前在财报会议上预告后,其新一代大语言模型Hy4的内部测试界面近日据称曝光。界面显示,用户可在三种模型间选择:定位为专家级模型的Hy4、适用于大多数场景的升级版Hy3,以及专注于推理与理解的DeepSeek。Hy4旨在处理更复杂的业务和技术问题。业内推测,其性能提升可能来自将参数规模扩大至约1万亿,或在Hy3架构基础上加强强化学习后训练,但这些说法目前均未获证实。腾讯预计将Hy4用作AI智能

VA-Judger:基于人类偏好的视频音频联合生成奖励建模

VA-Judger是一种用于视频音频联合生成的奖励模型,旨在比单独评估音频质量、视觉保真度和同步性的传统指标更准确地反映人类偏好。研究团队构建了包含9,000个提示词和10,300组细粒度成对比较的VAPref-10K数据集,并提出VA-Judger-Bench评测基准。该模型逐步学习结构化的偏好解释,并通过按质量维度分解人类反馈的强化学习来提供更密集的奖励信号。实验表明,VA-Judger在域内

Adobe Firefly 扩充 AI 音频功能,可生成音乐、配音和音效

Adobe 为 Firefly 新增三项音频生成功能,目前已向所有用户开放。用户可以在同一创意工作区内,为社交媒体内容、直播、短片、产品教程和播客片段生成音乐、配音及音效。Generate Music 由 Firefly Music Model 驱动,可根据视频时长和所需氛围生成原创曲目。Adobe 表示,生成的音乐可用于商业用途,并提供通用授权。Generate Speech 使用 Firefl

Google开源Gemma模型下载量突破十亿,拓展至太空与医疗领域

Google DeepMind表示,Gemma系列模型的全球下载量已超过十亿次,开发者还发布了十万多个模型变体。据Google介绍,Gemma已部署在本地设备、边缘基础设施和轨道系统中,用于卫星图像分析、有限带宽优化及通信路由。在印度,Gemma已整合到医疗应用Aarogya Setu中。研究团队还利用Gemma开发医疗数据处理、癌症研究和临床分诊系统。其他项目包括面向医疗场景的MedGemma,

真实版大炮打蚊子:国产激光灭蚊炮登上央视

中国常州光之矩智能科技研发了一款自动化激光灭蚊设备。毫米级雷达可捕捉并追踪昆虫的飞行轨迹,算法则负责识别目标。确认目标为蚊虫后,高能脉冲激光会精准击中蚊翅。从扫描、识别、定位到发射,整个流程无需人工操作。目前,研发团队正提升作业区域边缘的信号强度,减少识别盲区,并提高覆盖范围和准确率。公司表示,未来还希望将这项技术用于驱除其他害虫。

苹果计划在2026年底前强制标注Apple Music上的AI生成音乐

据AppleInsider报道,苹果计划在2026年底前收紧Apple Music规则,要求内容供应商和唱片公司为大部分由AI生成的音乐添加标签。苹果于2026年3月推出AI Transparency Tags,当时是一项自愿机制,用于说明内容是否在人工智能帮助下实质性生成。新规生效后,唱片公司和分发商将无法自行决定是否披露AI的使用情况。苹果尚未公布具体执行方式或违规处罚措施。