AI 新闻中心

AI 新闻中心 过去一年分析了 1728 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

原生支持4K图像输出,商汤开源8B多模态模型SenseNova U1.5 Lite

商汤科技开源了轻量级多模态模型SenseNova U1.5 Lite,模型规模为80亿参数。该模型原生支持3K至4K上下文长度,可同时处理主体、数量、空间关系、文字、布局和风格等多重约束。商汤表示,模型提升了图像生成与编辑能力,包括构图、色彩、材质、光影、真实感、局部细节,以及对未编辑区域的保持效果。它还支持Bounding Box、Visual Marker以及单图和多图参考,以实现更精细的视觉

阿里云千问AI平台扩充模型矩阵,接入GLM-5.3与DeepSeek-V4-Pro

阿里云千问AI平台近日将智谱GLM-5.3和DeepSeek-V4-Pro正式版接入模型服务矩阵,并同步开放两款模型的API。GLM-5.3主要强化编程、长程任务执行和网络安全能力;DeepSeek-V4-Pro则重点提升智能体交互、软件开发及多步骤复杂任务处理能力。平台目前已聚合文本生成、代码开发、语音处理、图像生成和视频生成等领域的模型,涵盖通义千问、GLM、DeepSeek和Kimi等产品。

MemTrapBench评估大语言模型使用记忆时的认知陷阱

MemTrapBench是一项用于评估大语言模型如何受到已存储信息影响的新基准测试。现有记忆评测主要关注信息能否被正确提取、存储和检索,而MemTrapBench进一步考察相关记忆是否会在当前任务中扭曲模型的推理或信念。该基准涵盖两类认知陷阱:推理固着和信念扭曲。研究人员在两个模型系列和五种记忆框架上进行实验,发现所有受测记忆策略的表现都不如不使用记忆的设置,最强方法的性能也下降了超过10%。研究

WithEveryone:面向群体图像生成的统一规划与身份定位

WithEveryone 是一个用于生成包含最多 10 个指定人物身份的群体图像框架。该方法为每个身份注入带地址的标记,预测结构化的身份与布局规划,并将其作为视觉条件。其布局定位身份损失直接利用标注的人脸区域进行监督,避免依赖不稳定的基于嵌入的人脸匹配。在身份与训练数据不重叠的基准测试中,WithEveryone 的目标场景人脸相似度达到 0.499,高于 GPT-Image-2 的 0.462。

超千亿参数藏语大模型“阳光清言”正式发布

在拉萨举行的2026全球数字经济大会论坛上,通用藏语大模型“阳光清言”正式发布。该模型基于大型基础模型打造,使用海量多源藏语数据进行训练,旨在理解和生成藏语内容及西藏相关知识。项目已完成近两个月的内部测试和两个多月的公开测试,并通过中国网信部门备案。项目发起人、中国工程院院士尼玛扎西表示,由于训练所需算力和高质量数据仍较为不足,模型当前整体表现尚未达到设计目标。新成立的拉萨市纳金数智研究院将开展人

阿里发布 Qwen-UI-Agent,称在多项 GUI 基准测试中领先

阿里巴巴于8月20日发布GUI智能体基础模型Qwen-UI-Agent,支持移动设备、电脑、网页浏览器和深度搜索环境。根据阿里公布的结果,该模型在MobileWorld、MobileWorld-Real、AndroidDaily和OSWorld-Verified上分别取得82.1%、92.2%、97.5%和79.5%的成绩,并在其他多项评测中刷新最高纪录。除常规GUI操作外,模型还支持执行命令行指

宇树科技推进具备自进化能力的物理AI机器人模型

宇树科技创始人王兴兴在2026世界机器人大会上表示,公司正在开发能够自我进化的物理AI机器人模型。相关计划将以大模型为核心,结合学术论文、研究成果、开源方案及自定义规则,自动生成机器人控制代码,并通过模型自评和人工审核进行验证。公司还计划把仿真数据、真实世界数据和人类行为数据纳入训练流程。宇树科技现场展示了人形、四足和轮式机器人在自研群控系统下的协同运行。王兴兴认为,机器人在陌生环境中的泛化能力不

腾讯新一代大模型Hy4即将发布,将成为WorkBuddy核心引擎

继腾讯此前在财报会议上预告后,其新一代大语言模型Hy4的内部测试界面近日据称曝光。界面显示,用户可在三种模型间选择:定位为专家级模型的Hy4、适用于大多数场景的升级版Hy3,以及专注于推理与理解的DeepSeek。Hy4旨在处理更复杂的业务和技术问题。业内推测,其性能提升可能来自将参数规模扩大至约1万亿,或在Hy3架构基础上加强强化学习后训练,但这些说法目前均未获证实。腾讯预计将Hy4用作AI智能

VA-Judger:基于人类偏好的视频音频联合生成奖励建模

VA-Judger是一种用于视频音频联合生成的奖励模型,旨在比单独评估音频质量、视觉保真度和同步性的传统指标更准确地反映人类偏好。研究团队构建了包含9,000个提示词和10,300组细粒度成对比较的VAPref-10K数据集,并提出VA-Judger-Bench评测基准。该模型逐步学习结构化的偏好解释,并通过按质量维度分解人类反馈的强化学习来提供更密集的奖励信号。实验表明,VA-Judger在域内

Adobe Firefly 扩充 AI 音频功能,可生成音乐、配音和音效

Adobe 为 Firefly 新增三项音频生成功能,目前已向所有用户开放。用户可以在同一创意工作区内,为社交媒体内容、直播、短片、产品教程和播客片段生成音乐、配音及音效。Generate Music 由 Firefly Music Model 驱动,可根据视频时长和所需氛围生成原创曲目。Adobe 表示,生成的音乐可用于商业用途,并提供通用授权。Generate Speech 使用 Firefl

Google开源Gemma模型下载量突破十亿,拓展至太空与医疗领域

Google DeepMind表示,Gemma系列模型的全球下载量已超过十亿次,开发者还发布了十万多个模型变体。据Google介绍,Gemma已部署在本地设备、边缘基础设施和轨道系统中,用于卫星图像分析、有限带宽优化及通信路由。在印度,Gemma已整合到医疗应用Aarogya Setu中。研究团队还利用Gemma开发医疗数据处理、癌症研究和临床分诊系统。其他项目包括面向医疗场景的MedGemma,

Windows 365 上线五周年,微软计划深化 AI 智能体整合

微软宣布 Windows 365 上线五周年,并计划将 AI 智能体更深入地整合到受管理的云电脑中。Microsoft Scout 可通过 Teams 接收指令,在云电脑上查找文件、总结文档、保存结果,并起草待审核的电子邮件。Windows 365 for Agents 可为智能体配置拥有独立身份和权限的专用云电脑。开发者可使用预装 GitHub、VS Code 和 Node.js 的环境,并通过

蚂蚁百灵开源 Ling-3.0 Tiny 与 Flash 基础模型,公开训练过程关键 Checkpoint

蚂蚁集团 AI 团队百灵开源了 Ling-3.0-tiny 和 Ling-3.0-flash 基础模型。除最终 Base checkpoint 外,团队还公开了预训练和中期训练阶段的 checkpoint,两个模型合计 6 个。Ling-3.0-tiny-base 拥有 79 亿总参数和 13 亿激活参数;Ling-3.0-flash-base 拥有 1240 亿总参数和 51 亿激活参数。这些

SkillGate:训练长程智能体在策略内选择技能

SkillGate研究人工智能智能体如何在长程任务中决定读取哪项程序性技能。研究人员发现了“选择器信用饥饿”现象:在仅依据结果进行强化学习时,负责命名所选技能的少数词元几乎得不到有效训练信号;如果后续执行失败,正确的选择也可能受到惩罚。SkillGate将传递给执行词元的结果信用,与只传递给技能命名词元的局部优势信号分开。在五项智能体基准测试中,使用16个候选技能时,一个9B策略模型的试验成功率从