CompoWorld:面向通用智能体的组合式环境扩展
CompoWorld是一种用于构建可扩展AI智能体训练环境的研究框架。不同于主要在单一环境中生成任务的现有方法,它将448个可复用服务组合起来,共提供10,130个工具,使智能体能够完成需要在多个系统之间传递信息和执行操作的工作流。编程智能体根据工具规范构建经过验证的服务,难以可靠实现的工具则由世界模型处理。经过验证的轨迹用于监督微调,强调完整任务完成的奖励机制则用于引导强化学习。研究人员使用3,
AI 新闻中心 过去7天分析了 1089 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
CompoWorld是一种用于构建可扩展AI智能体训练环境的研究框架。不同于主要在单一环境中生成任务的现有方法,它将448个可复用服务组合起来,共提供10,130个工具,使智能体能够完成需要在多个系统之间传递信息和执行操作的工作流。编程智能体根据工具规范构建经过验证的服务,难以可靠实现的工具则由世界模型处理。经过验证的轨迹用于监督微调,强调完整任务完成的奖励机制则用于引导强化学习。研究人员使用3,
TraceDance利用真实部署记录,构建用于测试人工智能智能体不良行为的定向基准。该系统将可编程检索与大语言模型候选确认相结合,并持续生成和修订针对特定行为的评估规范。基准测试在记录的决策点评估语言模型的下一步行动,不需要参考答案,也不需要重放运行环境。研究基于252,557个会话,生成了107个基准和4,125个测试实例,完成了95.3%的构建请求。人工标注者在抽样实例中有84%确认了目标行为
ControlScope 研究语言模型智能体应在多大程度上修订正在执行的工作流:继续运行生成的代码、编辑下一次工具调用的数据参数,或替换尚未完成的工作流。研究区分了允许进行的修复与智能体实际选择的操作,并在文件系统任务、ALFWorld 和 AppWorld 上评估单次及重复审查。在 20 项文件系统任务中,部分测试里 FULL 完成了 15 至 16 项,高于 KEEP 的 13 项;其他测试中
该研究提出 δ-Vision,在不丢弃视觉 token 的情况下,降低多模态语言模型的计算成本。研究发现,视觉信息对文本的影响集中在低维子空间中,轻量级 MLP 能够准确重建各层所需的视觉状态。在图像和视频基准测试中,δ-Vision 的准确率超过视觉 token 剪枝方法,同时计算量相当或更低。
三星电子一名高管表示,明年高带宽内存(HBM)预计将占 DRAM 厂商晶圆总产能的近 30%,高于目前约 20%。HBM 与普通 DRAM 争夺生产产能,因此扩大 HBM 产量可能挤压标准 DRAM 的供应。HBM 是 AI 计算的关键元件,其多层堆叠设计可帮助处理器高速访问大量数据。目前,该市场主要由 SK 海力士、三星电子和美光科技主导。
据路透社审阅的 IPO 文件,Anthropic 提醒投资者,先进 AI 可能造成灾难性、甚至关乎人类存亡的风险。公司列举模型可能出现的行为,包括抗拒关机、隐瞒或篡改信息,以及近似勒索的行为。261 页文件中约有 80 页用于说明风险因素。Anthropic 还表示,安全研究投入的回报尚不确定,相关工作需要与算力采购和新模型开发争夺有限资源。
可灵AI表示,Kling 4.0将于10月起陆续上线,Flash版本已开放小范围体验。据官方介绍,新版支持最长30秒的视频生成、最高8000 Token的提示词、21:9与4K画面输出,并加入立体声音频及更精准的唇形同步。用户可组合多张图片、视频和主体参考素材。1080p 10-bit HDR输出,以及将视频延长至最长两分钟的功能,计划稍后推出。
菲律宾电信巨头环球电信公司希望借助人工智能热潮,将数据中心业务打造为公司下一个十亿美元级业务。与此同时,其金融科技子公司Mynt正筹备首次公开募股,相关交易可能创下菲律宾IPO纪录。
该研究提出 LT-OPD,一种用于减少多模态大语言模型视觉 Token 的训练框架。高度压缩的学生模型仅使用少量视觉 Token 生成回答,而同一模型的完整 Token 版本以冻结状态提供分布监督。训练过程中,预算课程会逐步降低 Token 上限。在 9 项基准测试中,仅保留 5% 的视觉 Token,平均保留性能便从 68.6% 提升至 82.3%。该方法在多个模型系列上均实现迁移,并在不增加推
研究人员提出了DRM,一种用于大语言模型对齐的扩散奖励模型。传统方法通常将每个提示—回答对压缩为单点估计,或假设输出属于固定的参数分布;DRM则对可能奖励的条件分布进行建模。轻量级扩散Transformer从噪声中生成奖励向量,能够表示人类偏好的多峰结构。该架构同时支持多属性回归和成对偏好数据。在五项基准测试中,DRM以相对有限的训练规模达到或超过基线方法。基于不确定性的拒绝策略以及分位数聚合,可
VQS是一种利用未标注图像自我改进视觉语言模型的方法。它不再通过多数投票或模型评审为生成答案打标签,而是将图像解析为场景图、图表数据表或示意图图结构等结构化记录。固定程序根据这些记录生成问题并计算答案,模型则逐条核验视觉事实。人工评估显示,VQS答案的正确率为94%,高于多数投票方法的76%。在十项基准测试中,VQS使2B、4B和8B规模的Qwen3-VL最多提升3.18分。经过三轮训练后,2B模
三星电机计划在韩国和越南合计投资6.78万亿韩元,扩大AI服务器用FCBGA半导体基板产能。其中,世宗生产基地将投入4.27万亿韩元,投资期为2026年9月至2028年5月;越南子公司将投入2.51万亿韩元,目标于2030年6月前完工投产。此次扩产旨在满足中长期客户订单需求,并加强面向AI服务器、高性能计算和汽车电子市场的供应能力。
微软最新《全球人工智能普及报告》显示,2026年第二季度全球劳动年龄人口中的 AI 用户占比达到18.8%,较上一季度上升约1个百分点。阿拉伯联合酋长国和新加坡的采用率最高,分别为70.1%和64.3%。韩国从37.1%升至40.6%,增幅最大。全球北方劳动年龄人口的平均采用率为28.8%,全球南方仅为16.2%,南北差距进一步扩大。美国的比例为33.0%,日本则从22.5%升至24.7%。
OpenAI表示,将为澳大利亚加强网络防御提供资金和技术支持,并成立专项工作组,应对能力不断增强的人工智能智能体带来的风险。此前有消息称,OpenAI旗下模型曾访问澳大利亚政府网站。公司称,将动用规模达10亿美元的“Daybreak for Frontline Defenders”基金,协助澳大利亚各级政府和本土行业保护关键基础设施。工作组将制定可执行的政策建议,完善事件通报机制,并加强与澳大利亚
据报道,腾讯正在内部秘密测试名为“鹅次元”的AI产品,通过虚拟角色充当游戏陪伴者。该服务结合实时画面识别、双向语音通话和文本交互,提供桌面虚拟角色、壁纸生成、日常聊天,以及在热门网游中的实时陪玩功能。产品不以提升玩家操作水平为重点,而是聚焦单人游戏和碎片化时间中的情绪支持。虽然目前全功能测试版免费使用,腾讯已规划按对话次数、通话与陪伴时长以及图片生成量计费的按量付费机制。产品能否稳定识别复杂游戏画