Chat-Edit-3D++:利用大语言模型进行交互式3D与4D场景编辑
这项研究提出了CE3D++,一个利用大语言模型对3D场景和单目4D场景进行对话式编辑的系统。其Hash-Atlas网络将2D图像编辑与3D重建流程解耦。LLM能够理解用户的自由格式文本指令,并自主调用合适的视觉模型。针对4D场景,研究加入了运动物体约束,并构建了与编辑任务相关的轨迹数据集。据研究人员介绍,较小的LLM可以准确调度最多30种视觉工具。实验显示,该系统支持多样化的编辑效果、场景理解和多
AI 新闻中心 过去30天分析了 2388 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
这项研究提出了CE3D++,一个利用大语言模型对3D场景和单目4D场景进行对话式编辑的系统。其Hash-Atlas网络将2D图像编辑与3D重建流程解耦。LLM能够理解用户的自由格式文本指令,并自主调用合适的视觉模型。针对4D场景,研究加入了运动物体约束,并构建了与编辑任务相关的轨迹数据集。据研究人员介绍,较小的LLM可以准确调度最多30种视觉工具。实验显示,该系统支持多样化的编辑效果、场景理解和多
FFmpeg 已通过 Vulkan API 集成英伟达 GPU 的帧插值功能。借助英伟达光流加速器,GeForce RTX 显卡可以预测并生成中间视频帧,在不经过传统图形渲染流程的情况下提高视频帧率。英伟达将这项技术称为 FRUC,即引擎辅助帧率转换。此次 Vulkan 实现让 FFmpeg 能够直接访问英伟达硬件,同时避免此前阻碍该功能合并的专有软件依赖。RTX 30、40 和 50 系列显卡用
Runway发布了Solaris,这是其“界面世界模型”系列的首个模型。公司称,Solaris能够逐帧实时生成图形用户界面,而不是完全依赖预先编写的代码和固定布局。语言模型负责理解用户意图,世界模型则负责渲染和更新视觉场景。在与根据屏幕截图重建的界面进行比较时,Runway表示,基于超过7500次成对比较,Solaris在指令遵循度和行为自然度方面的用户偏好率分别为61%和71%。该系统建立在Ge
美国国防部已将 OpenAI 的 ChatGPT Mil 和 xAI 的 Grok for Government 加入 GenAI.mil 内网门户,供数百万军人和文职人员处理文件阅读与写作、物流规划、供应链跟踪及研究等日常非机密任务。模型收集的数据将被限制在内网环境中,OpenAI 和 xAI 不得使用政府数据训练 AI 模型。两款助手均禁止用于战斗行动或目标锁定任务。
伯明翰大学、奥胡斯大学和林奈大学的研究人员研究了,长期与具有类人行为的客服 AI 互动,可能如何影响用户的语言、行为和自我认知。论文于 2026 年 8 月 19 日发表于《AI & Society》,提出“类机器人式人性”(robotoid humanness)概念。研究提出了一个三阶段镜像机制:形成合成社交现实、捕捉计算身份,以及进行适应性自我调整。具备自适应学习、个性化沟通和共情回应能力的系
谷歌发布了 TimesFM-3,这是其时间序列基础模型系列的第三代产品。该模型拥有 3.3 亿个参数,使用包含超过 1 万亿个时间点的真实世界和合成时间序列数据进行预训练。TimesFM-3 原生支持多变量预测、双注意力机制和连续补丁掩码,可在无需针对特定任务微调的情况下进行零样本预测。模型能够同时预测多个相互关联的时间序列并捕捉它们之间的依赖关系,还支持使用历史协变量,例如过去的人流量,以及已知
WebWorld解决了视觉语言模型(VLM)自动改进网页代码时的一个结构性问题:同一个模型既提出修复方案,又负责评判,而视觉上的合理性并不能说明网页确实可用。该系统将浏览器作为世界模型,以确定性、可执行的方式模拟HTML在用户操作下的行为。VLM生成批评意见,规划器将其编译为类型化交互契约。浏览器重新执行候选结果,只有在实现目标进展且保留所有此前验证过的功能时,才会颁发接受证书。监督微调只使用经过
LightNav-0 是一种用于具身机器人导航的紧凑型通用模型。它利用预训练视觉语言模型(VLM)的空间能力,并将其与机器人控制对齐,无需针对具体任务设计预测头。统一的标记接口用于表达空间意图,并将其转换为适配不同机器人形态的轨迹。该模型支持指令跟随、开放词汇目标导航和视觉跟踪。训练数据涵盖 2,000 多个场景和 4,000 多小时的具身导航数据。研究人员称,LightNav-0 在全部 10
由中国专家牵头制定的全球首个腿式机器人运动性能国际标准近日正式发布。该标准建立了在平地、楼梯、坡面和障碍环境中评估机器人运动能力的统一方法。评价内容不仅包括移动速度和稳定性,还纳入环境感知、交互、决策以及任务完成度,旨在更真实地反映机器人在巡检、搬运、搜救等实际场景中的综合能力。标准的实施将帮助企业改进产品研发,让检测机构依据统一方法开展测试,并为用户比较人形机器人、机器狗等腿式机器人的性能提供更
小米前手机部总裁王腾创办的“今日宜休”已正式启用深圳办公室。王腾表示,深圳团队将更贴近供应链和产业资源,提升硬件研发能力,并面向海外市场建设销售能力。公司目前正在招聘对AI硬件和睡眠健康感兴趣的人才,同时加快产品开发。不过,截至目前尚未公布具体产品。公开信息显示,王腾于2025年下半年离开小米后开始创业。
Meta 宣布 AI 编程工具 Muse Code 结束 Beta 测试并正式发布,同时新增会话间消息传递、可协调多个子智能体的工作流,以及将会话恢复到安全历史节点的 Rewind 功能。Meta 还发布了 SDK 开发者预览版。Muse Code 现可处理更复杂的多会话、多智能体工程任务,并支持兼容的 macOS 和 Linux 系统。Meta 同时推出三档订阅:每月 5 美元的 Everyda
中国无人驾驶公司九识(Zelos)的一辆无人配送车于8月31日在陕西西安逆行,并在放学高峰期挡住一辆公交车。九识客服表示,涉事车辆已停机调试,初步判断事故原因可能是路线设置错误,目前已安排人员调查处理。九识成立于2021年,主要开发无人配送车。今年7月,公司宣布其无图L4级自动驾驶方案已实现规模化量产。
据Teslarati援引众包平台Robotaxi Tracker的汇总数据,特斯拉在奥斯汀、达拉斯和休斯敦运营的无人监督Robotaxi车辆,已在三周内从20多辆增至接近200辆,增幅约为7倍。此次扩张发生在Cybercab预计发布前夕。特斯拉此前表示,Robotaxi项目已完成超过38万英里的无人监督行驶,且没有发生值得注意的事故,但相关车队数量尚未得到独立验证。同时,得州登记的Cybercab
中国 AI 硬件企业机智连接(Plaud)推出 Plaud One 真无线耳机,内置 4G LTE eSIM,支持 AI 辅助的对话录音与纪要。设备可在最远 5 米处录音,调用 AI 智能体,并通过兼容 MCP 的服务实现工作流自动化。产品售价为 249.99 美元,首批限量 2000 台。耳机配备 12mm 驱动单元、蓝牙 5.4、SBC 和 LDAC 编解码器,混合降噪深度最高达 40dB。音
比亚迪半导体宣布,新一代4D毫米波雷达芯片已开始量产。该芯片采用28纳米车规工艺,支持多款主流智能驾驶芯片平台,并已完成与比亚迪“璇玑A3”智能驾驶计算平台的联调适配。比亚迪表示,基于该芯片的方案可覆盖L2至L4级智能驾驶应用,包括高速和城市道路驾驶辅助、自动泊车及盲区监测。公开参数显示,该芯片可实现400米以上的稳定探测、0.8度水平角度分辨率,以及面向泊车场景的0.05米距离分辨率。芯片已通过