Astra通过电脑操作使用Blender,或预示AI需求的第四波浪潮
Key Context的Tae Kim介绍了Astra通过电脑操作使用Blender的演示。他认为这项能力几乎令人感觉像魔法,并指出继聊天机器人、推理和智能体编程之后,电脑操作可能成为AI需求的第四波浪潮。不过,这一判断目前主要基于早期观感,并不能证明出现了根本性的技术突破。
AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Key Context的Tae Kim介绍了Astra通过电脑操作使用Blender的演示。他认为这项能力几乎令人感觉像魔法,并指出继聊天机器人、推理和智能体编程之后,电脑操作可能成为AI需求的第四波浪潮。不过,这一判断目前主要基于早期观感,并不能证明出现了根本性的技术突破。
该研究分析了语言模型为何会因无害请求中出现表面上具有风险的词语而错误拒答。研究人员将安全调优数据集中的响应拆分为模板化拒答语句和拒答理由说明。实验表明,拒答语句会促使模型依赖表面线索,从而难以区分有害请求与无害请求。仅使用理由说明进行训练,可以在保持相近安全性能的同时减少误拒。该效果也出现在上下文学习设置中,并且与研究评估的推理时缓解方法兼容。研究结果强调了精确、细粒度安全监督数据集的重要性。
该研究提出 KoNA,一项用于评估视觉语言模型选择性不遵从能力的基准。不同于将整个问题简单判断为可回答或不可回答的传统评测,KoNA 检验模型能否回答有效部分,同时拒绝、纠正或暂不回答不适当的部分。该基准涵盖错误前提、视觉上无法获取的信息、普遍未知的信息、任务可行性和安全性五个类别。对多种模型的评估显示,模型经常无法正确处理这些情况,尤其是在同时包含可回答和不可回答内容的复合问题中。使用 KoNA
UniMate 是一种多模态基础模型,可根据带有绑定骨架的 3D 资产和文本提示,为任意骨架生成关节运动。与现有学习型动画生成器不同,它不需要特定类别模板、针对每个骨架进行微调,也不需要在推理阶段优化。其拓扑感知扩散 Transformer 用于建模关节关系和骨架的整体结构。研究团队还构建了 UniML3D 数据集,包含 13,006 段动作序列,覆盖双足、四足、鸟类、海洋生物、昆虫型、蛇型角色以
一名 AI 爱好者进行的实验显示,OpenAI 的新模型 GPT-6 Astra 据称自主通关了 Valve 的 3D 解谜游戏《传送门》。整个过程共调用工具 3336 次,按 API 价格计算成本约为 571.18 美元,但实际费用由每月 200 美元的 Codex Pro 订阅覆盖。模型通过 MCP 和修改版工具控制游戏,并根据游戏截图及角色位置等信息规划行动。完整记录约持续 24 小时。实验
英伟达首席执行官黄仁勋再次宣称,通用人工智能(AGI)已经到来。由于他过去曾做出类似但未能兑现的预测,这一说法受到质疑,也被认为可能是在制造炒作,以推广英伟达下一代GPU。
据彭博社报道,字节跳动正在准备推出一款实时空间视频生成AI模型,最快可能于下月发布,创始人张一鸣据称亲自督导开发。该模型基于Seedance视频生成模型,可用于直播、短剧和游戏中的交互式虚拟世界,并计划与旗下Pico XR头显协同。知情人士称,模型将支持响应用户的语音和动作,以每秒20帧、约50毫秒的延迟生成视频。字节跳动拟将空间内容生成这一计算密集型任务转移至云端,从而降低头显设备的算力需求和成
据彭博社报道,字节跳动正在开发一款用于实时生成空间视频的 AI 模型。公司创始人张一鸣据称正在监督该项目,该模型最早可能于下个月推出。若成功发布,字节跳动将与 Meta 和 Alphabet 展开直接竞争。不过,目前消息来自知情人士,尚未得到官方产品发布确认。
字节跳动正在准备一款面向实时空间视频生成的人工智能模型。该公司将与Meta和Alphabet在这一领域展开竞争,相关技术可能应用于机器人和自动驾驶系统。目前,字节跳动尚未公布具体性能数据或发布日期。
这番警告发布之际,OpenAI推出了GPT-6 Astra,公司称其为迄今最强大的产品。不过,现有信息没有提供具体的技术证据,也未详细说明人工智能可能带来的后果。
中国机器人公司宇树科技宣称,首次展示了由世界模型实时驱动的全自主人形机器人格斗。公司公布了现场视频,并表示 UnifoLM-X2-1.0 可在不依赖预设动作或人工遥控的情况下,完成未来状态预测、规划、决策和动态交互执行。宇树称,这项演示旨在验证世界模型驱动的人形机器人在高动态场景中部署的基础可行性。由于目前缺乏独立的技术验证,这一“全球首次”及相关性能说法仍应谨慎看待。
OpenAI 首席科学家雅库布·帕乔茨基呼吁放慢人工智能发展速度,并在系统能力快速提升之际建立强制性安全门槛。他警告,自主性不断增强的 AI 智能体可能绕过人类监督、入侵计算机系统、欺骗他人,甚至通过胁迫来实现自身目标。帕乔茨基表示,OpenAI 正在研究控制高能力智能体的技术方案,但第三方审计机构、政府或国际组织也需要采取更广泛的干预措施。他还担心,新模型可能操纵或隐藏内部推理过程,使研究人员更
一项研究考察了大语言模型如何在内部表示空间中组织问题构建、目标分解和演绎等推理操作。研究人员发现,这些操作可以在留作测试的隐藏表示中被区分,且在模型中间层的可分离性最高。该结构不能仅由词汇或位置因素解释。随着层数增加,推理操作的对应关系会分布到更长的词元片段中;同一个表面词也会因周围推理操作不同而产生不同的内部表示。注意力屏蔽干预进一步表明,推理片段开头与操作相关的表示依赖此前的推理上下文。研究团
李飞飞与 World Labs 核心团队发布了多模态世界模型 Atlas,其核心机制是新视角预测。不同于预测下一个 token 的语言模型和预测下一帧画面的视频模型,Atlas 可根据少量图像或文字描述,生成从场景不同位置观察到的画面。它能在同一系统中处理文本、图像、视频、3D 数据和相机位姿,并融合场景重建与内容生成。团队称,Atlas 可显著减少 3D 场景重建所需的数据量,并有望应用于创意设
该研究将多智能体 LLM 系统中协调器与工作智能体的交互建模为双层协调博弈,并分析任务分解、文本反思、记忆更新和外部验证对协作与系统漂移的影响。研究提出随机反思记忆攀升(SRMA)方法,只有在基于环境的评估显示风险降低时才接受记忆更新;在特定假设下,作者还给出了收敛和重新锚定保证。在 500 个 SWE-bench 实例上,基于 Kimi 的系统解决了 72.2% 的任务,公开的 mini-SWE