AI 新闻中心

AI 新闻中心 过去30天分析了 2441 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

让 Vibe 设计代理支持创意探索

一种新的推理架构旨在让设计代理不仅生成一个有效页面,还能探索多个协调一致的界面方案。该方法没有直接提高采样温度,而是将创意探索与实现过程分离:预处理阶段提出结构化设计规格,由外部选择器选出一个方案,再由下游生成器在固定设置下结合原始请求完成实现。在 168 个提示词的测试中,界面主题和截图的观测多样性有所提升。在超过 30 万个任务的在线实验中,代码导出量的增加尚未达到统计确定性。负面反馈减少,但

字节跳动整合豆包、飞书与火山引擎,加码企业AI

字节跳动CEO梁汝波在北京举行的飞书活动上表示,公司已将豆包、飞书和火山引擎整合为统一的生产力体系,旨在推动AI和Agent进入企业工作流程。豆包工作将提供写作、信息查询和任务拆解等智能功能;飞书负责聊天、文档、会议、权限和组织上下文等协作环境;火山引擎则提供模型、算力和开发工具,支持企业构建专属Agent。梁汝波认为,Agent只有与模型、人员和工作环境紧密结合,才能产生实际价值。字节跳动将继续

Atria Dawn:面向科学研究与工程工作的智能体模型

Atria Dawn Preview是一款面向科学研究和工程工作流的智能体语言模型。该模型通过“可验证经验管线”训练,将工具交互连接到可执行环境和经外部验证的结果。在涵盖研究、工程和数字工作的16项基准测试中,Atria Dawn的表现可与前沿智能体竞争,并在其中5项取得已公布的最高分。对56名参与者完成的769项任务进行分析发现,人类仍掌握大多数最终决策,而智能体经常提出方法并实施修改。参与者认

Waymo计划2027年在东京推出商业自动驾驶出租车服务

Alphabet旗下自动驾驶企业Waymo计划于2027年在日本东京全面推出商业Robotaxi服务,具体时间取决于日本中央和地方政府的监管批准。Waymo早在2024年12月就公布了进军日本的计划,并自2025年起与出租车企业日本交通及出行平台GO合作,开展有人监督的自动驾驶实地测试。该服务将从少量车辆起步,随后逐步扩展至约100辆,覆盖东京主要街区。

ZGCM-1:面向数学与智能体搜索的完全开放高效基础模型

ZGCM-1 是一个完全开放、从零训练的 70 亿参数稠密型基础模型,面向数学推理和智能体搜索。其训练方案支持 256K 上下文,结合交错式门控滑动窗口注意力与全注意力机制,并采用 FP8 Muon 优化器和分阶段上下文扩展。该模型通过有意推理和调用外部工具,弥补小型模型参数容量有限的问题。研究团队称,ZGCM-1-7B 在通用基准测试中具备与同规模 7B 模型竞争的性能,并在部分数学推理和智能体

字节跳动 CEO 梁汝波:AI 是过去 50 年最大的 IT 发展高峰

字节跳动 CEO 梁汝波表示,过去 50 年 IT 行业经历了 PC、Web、移动和 AI 四次主要发展高峰,AI 高峰的规模远超前三次。尽管目前大语言模型与海外领先模型存在差距,字节跳动仍将坚持自研,接受短期落后并持续优化。公司称,视频生成模型 Seedance 仍保持前沿水平。字节跳动还在整合豆包、飞书和火山引擎的产品及企业服务团队,以加强面向办公和生产力场景的 AI 产品与服务。据称,飞书新

Vidu S2:实时交互、可编辑与空间视频生成

Vidu S2由Vidu S2-Avatar和Vidu S2-Editing组成,前者是实时交互式数字角色模型,后者是实时视频编辑模型。研究团队还探索了两者进行实时空间视频生成的可行性。与Vidu S1相比,S2-Avatar支持实时生成720p视频,能够使用可随时更新的动态参考内容,并更好地遵循跳舞等指令。S2-Editing可以实时编辑视频流,包括风格渲染以及服装、角色和背景替换。根据公布的实

PhysBrain 1.5:从视觉语言模型迈向物理基础模型

PhysBrain 1.5 是一个用于理解物理环境、生成动作和预测未来状态的统一模型。它将语言响应、末端执行器运动和视觉目标编码为离散序列,并通过自回归下一词预测进行联合训练。预训练完全采用人类交互视频,随后使用人类示范、机器人轨迹和模拟经验进行监督微调。作者称,这个拥有80亿参数的开源模型在28项具身理解基准测试中平均得分72.5,并在其中14项取得开源模型最佳成绩。这些性能数据属于作者报告,仍

AI大模型助力水稻种植:四川300亩试点田最高亩产863.6公斤

四川省眉山市永丰村一处300亩水稻试点田首次采用水稻专用AI大模型进行田间管理。无人机负责采集农田数据,系统在插秧、水肥调控和病虫害预警等环节提供建议。专家按照规范测产,三个核心品种的亩产达到826.8至863.6公斤。试点田亩产较2023年提高152.6公斤。研究人员表示,良种、栽培技术与AI精准管理相结合,可能形成可向其他地区推广的增产技术路径。

LLaDA-UI 将分块扩散引入视觉语言 GUI 智能体

LLaDA-UI 是一个拥有 167 亿参数的 GUI 智能体,将混合专家架构与分块扩散生成相结合。该系统先进行多模态预训练,随后使用移动端、桌面端、网页界面和视觉定位数据进行有监督微调。在多项定位与导航基准测试中,LLaDA-UI 的表现超过 Qwen2.5-VL-7B,并在报告的六项 GUI 基准中的四项超过 Qwen3-VL-8B。研究结果表明,分块扩散可以成为多模态 GUI 智能体的一种实

Attention-DP3:通过几何对齐注意力实现物体感知的三维扩散策略

Attention-DP3是一种三维扩散策略,旨在帮助机器人在物体遮挡、混杂且干扰物较多的操作场景中识别与任务相关的几何信息。该方法首先对RGB图像进行开放词汇二维分割,再利用经过标定的相机几何将目标物体掩码提升到三维空间。其三场注意力条件机制分别强调目标物体、目标内部与任务相关的区域,并抑制背景和干扰物。 在Adroit、DexArt、MetaWorld以及真实SO101平台上的实验显示,该方法

Discovery Foundation Models:迈向开放式发现智能

该研究提出“发现基础模型”,这类 AI 系统不仅能够利用现有知识进行推理或解决人类定义的任务,还能参与提出新问题、构建新表示、形成假设并创造知识。其框架 Zetema 维护可修订的研究状态,验证证据、控制实验,并跨任务持续改进发现能力。GALILEO 将干实验室推理、机器人和实际湿实验室实验、外部生物学证据以及反复的假设修订结合起来,应用于治疗研究。研究还提出了超越最终答案准确率、训练和评估发现过

蚂蚁开源 SingProbe:以不足 0.5% 额外算力实时拦截大模型生成风险

蚂蚁集团 AI 安全实验室开源了大模型内生式安全护栏技术 SingProbe。该技术不依赖外挂式安全审核,而是复用模型推理过程中的隐藏状态,在不足 0.5% 额外计算开销下进行 token 级实时风险评估。SingProbe 支持意图分类、安全检测和幻觉识别,并可在内容输出前以毫秒级速度阻断风险结果,面向医疗等高风险场景。蚂蚁集团称,该技术已适配 29 个主流大模型,同时发布了开源代码和预训练模型

苹果全面升级AI体验:Siri AI覆盖iPhone、iPad与Vision Pro

苹果已向兼容设备推送iOS 27、watchOS 27、iPadOS 27和visionOS 27。延迟已久的Siri AI升级成为四大系统的核心AI功能,目前仅以英语测试版提供。苹果表示,法语、日语、韩语、葡萄牙语和西班牙语支持将于10月推出。visionOS 27为Apple Vision Pro带来完整的Siri AI升级。此外,各系统还更新了界面设计和小组件,新增独立音量控制,并改善运动功