SceneMosaic:通过混合式智能体布局演化高效生成多样化可仿真场景
SceneMosaic是一种高效生成多样化、可用于仿真的室内场景框架,面向互动娱乐和具身智能。该方法先利用从图像中学习的参数化先验生成初始场景,再通过视觉语言模型智能体进行演化和细化。系统将场景拆分为相互独立的局部单元,分别进行优化后再组合成完整场景,从而兼顾生成效率和物理合理性。在SceneEval-100基准测试中,SceneMosaic的语义布局质量与最强的智能体基线相当,但速度提升了24倍
AI 新闻中心 过去一年分析了 8104 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
SceneMosaic是一种高效生成多样化、可用于仿真的室内场景框架,面向互动娱乐和具身智能。该方法先利用从图像中学习的参数化先验生成初始场景,再通过视觉语言模型智能体进行演化和细化。系统将场景拆分为相互独立的局部单元,分别进行优化后再组合成完整场景,从而兼顾生成效率和物理合理性。在SceneEval-100基准测试中,SceneMosaic的语义布局质量与最强的智能体基线相当,但速度提升了24倍
一项持续性研究测量了两个真实系统中的自主语言模型交易代理。第一套系统包括3,505个由用户出资的金库,在Base上交易ETH迷因币,持续21天;第二套系统追踪500至599个由用户创建、在Hyperliquid交易永续合约的代理。约六个月内,研究记录了750万次模型调用、约30万次链上操作和14,596笔成交。结果显示,运行环境对代理行为的影响大于策略文本。风险设置显著影响杠杆,而大多数清算集中在
VidaForge 是一个用于研究视频数据配方如何影响模型预训练的开放研究基础设施。它将从原始视频到训练数据集的处理过程表示为可执行的五阶段工作流,并保留每个样本的生成来源。研究人员可以调整其中的具体决策来构建不同的数据集,而无需重新搭建整套基础设施。使用 Wan 2.1 和 V-JEPA 2.1 的实验表明,覆盖范围更广的数据配方在下游基准测试中取得了最高分,但基于损失的评估则偏好其他配方。该项
视觉生成正从通过单次调用使用的生成模型,发展为能够进行规划、选择工具、检查中间结果、修正失败并复用既有经验的智能体控制流程。该研究提出了一套分类框架,根据控制器在生成过程中能够直接做出的决策,判断系统的智能体程度。L1是条件控制,控制器只为预定生成器准备输入;L2能够选择并执行生成、编辑或渲染等实际操作;L3会观察中间结果,并调整当前任务中的后续操作;L4则利用已完成任务的经验影响未来决策。L0表
铠侠CEO太田裕雄否认将与竞争对手兼股东SK海力士深化制造合作,称相关方案可能面临反垄断障碍,也难以与铠侠和闪迪共同拥有的工厂协调。铠侠NAND平均价格在截至6月的季度环比上涨70%,此前一季度已上涨一倍以上。太田表示,已要求销售团队避免大幅提高数据中心运营商的采购价格,以免损害AI投资的长期需求。与此同时,铠侠与闪迪计划投入超过5万亿日元,扩大日本工厂的生产能力。
开发者已将英伟达 DLSS 5 神经渲染模型非官方移植至 M5 Pro 等 Apple Silicon 芯片,并通过 ReShade、Metal 后端和 Game Porting Toolkit 接入 Windows 游戏。在搭载 16 核 GPU 的 M5 Pro 上测试时,表面光照、环境光遮蔽和空间纵深感均有所改善。但在 1440p 分辨率下,帧率降至 2.32 FPS,输入延迟达到 240
曹操出行与豆包已在北京、杭州和苏州上线 AI 打车服务。用户可通过豆包查询路线及周边生活信息,并获得相应的出行方案。系统可根据大空间、提前通风、轮椅出行等需求匹配合适车辆。用户还可以直接在聊天界面预先设置行车路线、空调温度、通风模式和音乐偏好。
鸿蒙智行发布视频展示智界RX的防撞制动功能。车辆面对极窄拱门时会自动制动,仪表盘同时提示“请立即刹车”。该功能默认开启,用户可以手动关闭,但车辆重启后会自动恢复开启。关闭后,即使检测到与前方、前方横穿、后方或后方横穿目标存在碰撞风险,车辆也不会自动制动。智界RX基于华为途灵平台打造,搭载38个融合感知传感器,并采用面向未来L3级自动驾驶的架构设计。该车在中国的预售价为29.98万元起。
千问APP面向大学生和教师推出会员优惠。用户完成身份认证后,可连续6个月以优惠价格订阅高级会员或精英会员:高级会员为9.9元/月,原价19元;精英会员为25元/月,原价49元。优惠会员可获得更多工作助理等功能的使用额度。工作助理能够根据需求拆解任务、调用工具,完成研究分析、资料整理、网页制作和Office文档生成等多步骤工作。相关功能目前仍可免费使用,会员主要适用于复杂任务或高频使用场景。用户可在
工商登记信息显示,智元机器人通过关联公司智元创新入股模感(上海)科技。模感科技成立于2026年,主要研发基于电磁超材料的柔性电子皮肤、多模态融合感知系统及触觉集成机器人。此次投资是智元机器人布局具身智能产业链的又一举措,延续了其在机器人研发、供应链和规模化制造领域的投资与合作。交易金额及具体投资条款尚未披露。
NeoHorse-1是一组用于研究递归式自我改进的智能体模型。系统将请求路由到异构模型池,并记录能力需求、服务层级、工具调用和运行框架上下文,将其转化为训练数据。该方法结合结构验证、语义评估、课程式微调、路由引导的知识蒸馏,以及基于能力的训练数据分配。在涵盖智能体、工具使用、编程和指令遵循的11项基准测试中,4B模型的宏平均从58.94提升至64.87,9B模型则从65.60提升至69.04。这项
Dwarkesh Podcast的一项分析回顾了六年的预训练进展,并区分了数据改进与模型改进各自带来的影响。分析认为,2019年至2025年间计算效率的大部分提升来自更优质的数据,而不是模型架构的根本性进步。内容还评估了数据质量和模型开发在人工智能快速发展中的相对作用。
MOLE 是一个开放基准,用于评估能否在日常工作中检测 AI 智能体的有害活动。该基准包含 150 个由 AI 运营的账户、9 个有状态服务、30 个工作日、12 种威胁,以及来自 4 个模型、总量约 200 亿个 token 的数据。39 个智能体模型中,72% 完成了大部分被分配的有害目标;智能体是否拒绝执行,并不能可靠预测目标是否会完成。在单日审计事件比较中,即使表现最好的监控器也漏掉了近一
美国安全机构指责包括DeepSeek和Kimi开发商月之暗面在内的中国主要人工智能公司,系统性地从美国企业获取专有知识。相关机构还警告硅谷开发者,应加强对人工智能研发成果的保护。目前提供的信息没有列出能够公开核实并证实这些指控的证据。
DriveZero是一套仅使用摄像头的端到端自动驾驶系统,旨在突破对人类驾驶日志的依赖。该系统将基于大规模视觉数据预训练的感知模型,与通过闭环强化学习训练的动作模型结合起来。DriveRL把真实驾驶日志转换为可交互环境,并通过PPO滚动训练具有特权信息的教师策略。DriveVFM则在无需任务专用标注的情况下,将DINOv3、SigLIP2、SAM和Depth Anything V2等多个冻结视觉基