AI 新闻中心

AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

UI-Mate通过上下文示范推进开放权重基础GUI智能体

UI-Mate是一款用于自动化复杂数字任务的基础GUI智能体,将基于环境的训练体系与多模态示范的上下文学习相结合。该体系可在大规模并行环境中自动完成任务生成、环境构建、执行、筛选、监督微调和在线强化学习。研究团队还推出了OSWorkerBench,涵盖41个应用中的100项长流程办公任务,并区分了针对相同目标的自我示范和针对相关任务的人类变体示范。UI-Mate-27B在OSWorld-Verif

Ventor-QTest:威胁模型驱动的托管式 LLM API 验证

该研究提出 Ventor-QTest,一种用于审计第三方提供商托管开放权重语言模型所使用推理 API 的黑盒方法。它不需要目标 API 提供概率信息,而是通过重复请求和长序列测试,利用平均保真度损失(AFL)与极端保真度损失(EFL)衡量输出的不稳定性。在多种路由条件下,AFL与基于 logprob 的比较指标表现出较强的描述性一致性。EFL显著升高时,随着任务暴露增加,Terminal-Benc

字节跳动与清华AIR发布CUDA Agent:训练大模型编写超越编译器的GPU内核

字节跳动Seed团队与清华大学智能产业研究院(AIR)发布了CUDA Agent,这是一套通过强化学习训练大语言模型优化GPU内核的系统。该智能体运行在配备性能分析工具、正确性校验和安全沙盒的真实CUDA开发环境中。经过最多150步的PPO训练后,系统在KernelBench的250项任务中达到98.8%的通过率,生成内核中有96.8%的运行速度超过torch.compile。完整模型权重目前尚未

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

VibeWorlding是一套用于评估和训练多模态智能体的框架,旨在让智能体根据用户指令创建交互式3D世界。其VWE-BENCH包含2616个3D资产、323个由人工标注的初始世界,以及6828条多模态查询。VibeWorlding-Gym通过MCP工具整合资产检索、编辑和渲染,并利用基于评分标准的验证器检查物理可行性和用户意图的满足程度。实验表明,当前多模态大语言模型仍难以稳定完成这项任务;即使

Apple Silicon 上的 Nanbeige4.2-3B:修复部署漏洞并降低循环 Transformer 的内存开销

Nanbeige4.2-3B 是一个拥有 30 亿参数的智能体模型,通过在第二次前向传播中复用同一组层,在不增加参数的情况下提高有效深度。研究人员在 Apple Silicon 上发现了 5 个独立问题,导致发布的 checkpoint 无法直接通过 Hugging Face Transformers 运行,包括 RoPE 缓冲区被静默置零,以及调用已移除的缓存 API。分块预填充策略使 32 G

DFM Mimir v1:仅使用获准的后训练数据,10亿参数开源 HRM 模型实现前沿级性能

Danish Foundation Models 发布了 Mimir v1。这是一款基于分层推理模型架构、从零开始训练的10亿参数语言模型。该模型在后训练阶段仅使用获准数据,在英语任务上表现出较强竞争力,并在丹麦语上创下新的最佳成绩。在涵盖英语、数学、代码和丹麦语的20项基准测试中,Mimir v1 超越了 HRM-Text 1B,并可与 Qwen 3.5 4B、Gemma 4 E2B 等更大模型

联发科让汽车与手机天玑芯片首日支持阿里巴巴 Qwen3.8

联发科宣布,旗下天玑汽车座舱平台 C-X1 与旗舰移动芯片已在阿里巴巴 Qwen3.8 发布当天完成适配。这项整合可让搭载天玑芯片的智能手机与汽车更快使用新版 Qwen 模型。阿里巴巴此前已将 Qwen3.8-27B 开源,供开发者、科研机构和企业下载部署。这款原生多模态稠密模型支持 26.2 万 Token 的上下文长度,通过 YaRN 可扩展至最高 100 万 Token。阿里巴巴表示,新模型

谷歌允许关闭 AI 生成内容的显性水印

谷歌正在分阶段推出一项设置,允许用户关闭 AI 生成图片、视频和音乐中的显性水印。该功能预计首先登陆 Gemini 网页版、视频编辑工具 Flow,以及 Nano Banana、Omni 和 Lyria 等模型。SynthID 等隐形水印和 C2PA 元数据仍将保留,用户仍可据此验证内容是否由 AI 生成。谷歌还开源了 Credentio 本地验证开发库,方便开发者将验证功能集成到自己的应用中。

AI行业掀起“降本”潮,企业对大模型支出愈发敏感

AI服务商Writer推出企业旗舰模型Palmyra X6。该模型基于Z.ai开源模型GLM-5.2的后训练变体,并大幅升级了AI代理运行程序(harness)。Writer表示,Palmyra X6在基础任务中最多可为客户降低50%的成本。该公司近期发布的内部研究还称,优化运行程序的效率平均可降低40%的成本,比单纯更换大语言模型更可靠。Palmyra X6现已面向企业客户开放,可与现有工具集成

LittleLearner:在教育控制的知识暴露下研究语言模型

研究人员推出 LITTLECURRICULUM,这是一个包含 880 亿个 token、专门基于美国小学教材构建的预训练语料库。该语料库明确排除了五年级以上课程涉及的概念、事实和词汇。研究人员利用它从头训练出一个拥有 50 亿参数的语言模型 LITTLELEARNER。该模型具备足以进行开放式评估的语言能力,同时保留了清晰且可解释的知识与能力边界。模型和语料库以受控研究沙盒的形式发布,用于研究模型

PRM-as-a-Judge 1.5:机器人流程评估工具包

PRM-as-a-Judge 1.5是一套用于精细评估机器人操作流程的工具包。它将执行视频转换为密集的进度曲线,并提供衡量失败过程进展、性能下滑后恢复能力以及成功执行质量的多项指标。项目还推出RoboPulse++,用于测试流程奖励模型的可靠性。该套件包含基准测试、指标实现和可视化工具,支持对具身模型进行透明且可复现的评估。

Dion3:实现全栈正交更新优化

Dion3是Muon优化器的改进版本,旨在降低Newton-Schulz正交化步骤带来的计算和通信开销。其Gram Newton-Schulz算法减少了FLOP成本,优化后的CuteDSL内核利用对称性提升速度,批量合并策略则降低分布式训练中的通信开销。此外,新的更新规则每一步只对动量矩阵的一部分行进行正交化。作者称,Dion3在损失表现上可达到或优于Muon,同时将优化器单步耗时最多缩短6倍。该

小红书开源模型获突破:华为昇腾完成发布即全量适配与性能优化

小红书发布了新开源模型 dots3-note 的预览版。据介绍,该模型总参数量为2800亿,激活参数量为160亿,支持文本、视觉和语音等多模态能力。华为表示,Atlas 800A3 与 Atlas 900A3 SuperPoD 平台已在模型发布当日完成全量适配,并通过开源推理引擎 vLLM Ascend 支持部署和运行。优化内容包括多模态处理、通信与计算融合、MoE 推理吞吐量,以及利用 MTP