Counterpoint 的 Shah 谈英伟达与循环交易
Counterpoint 副总裁 Neil Shah 讨论英伟达的发展前景,以及支撑人工智能热潮的循环交易。他在彭博节目《The Asia Trade》中接受了 Shery Ahn 的采访。
AI 新闻中心 过去一年分析了 8776 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Counterpoint 副总裁 Neil Shah 讨论英伟达的发展前景,以及支撑人工智能热潮的循环交易。他在彭博节目《The Asia Trade》中接受了 Shery Ahn 的采访。
这篇综述研究智能体系统中的协同进化,即多个智能体与环境相互适应,并彼此施加进化压力。文章将现有研究分为三个阶段:智能体之间的协同进化、智能体与环境之间的协同进化(涉及不断变化的任务和反馈),以及元协同进化,即让进化机制本身也具备可适应性。研究还讨论了如何评估、扩展、保障安全并控制日益自主的进化系统。
DSAgentBench 是一个用于评估 AI 智能体在真实计算机环境中执行完整数据科学工作流的基准测试。它包含 275 项任务,覆盖数据整理、探索、建模、可视化和验证,并要求协调使用笔记本、IDE、终端、浏览器和数据库。确定性评估器不仅检查代码执行,还会验证分析正确性、可视化结果和模型性能。在对 15 个闭源和开源模型的实验中,表现最强的 Claude-4.6-Sonnet 任务成功率也只有 5
SkillZip是一种无需任务评估即可压缩自我进化AI智能体所积累技能的方法。它不将技能视为扁平文本,而是识别重复的规则和动作序列,将共享结构统一描述,并把差异保留为明确的例外。该方法采用带类型的最小描述长度目标,并对触发条件、工作流边、工具要求、义务和输出字段设置严格的覆盖约束,以保留罕见但重要的规则。SkillZip支持一次性压缩和持续更新,无需重新执行任务或解析完整历史。论文报告的实验显示,
Ex-Omni-2D 是一个多模态对话框架,可生成结合文本、个性化语音和参考条件视频的协调式响应。系统接收多模态查询、参考图像和音频后,先预测描述场景、情绪与动作的视觉思维计划,再生成响应文本和语音单元。共享的声学—时间接口能够将语音与视频帧对齐。研究人员将完整序列视频生成器蒸馏为更高效的流式模型,以支持增量生成。在四步推理和四张 GPU 的流水线中,系统在 400×720 或 720×400 分
东风汽车集团与华为联合打造的汽车品牌奕境,其总经理曾清林发文谈及双方合作。他表示,凭借896线激光雷达、ADS 5以及累计130亿公里的智驾数据,华为的智能驾驶技术仍处于行业顶级水平。曾清林还指出,先进软件需要强大硬件支撑。奕境X9将华为智驾系统与东风全铝底盘、奕境自有的“天穹智盾”安全架构结合,以提升整车性能。这款定位家庭旗舰级六座SUV的新车于8月10日首秀,支持华为乾崑智驾ADS 5,并配备
IBM 与 AI 原生云平台 Together AI 达成一项多年期、总值 2.4 亿美元的协议。IBM 将在 IBM Cloud 部署 NVIDIA HGX B300 集群,为 Together AI 的开源模型推理服务提供支持。该系统预计于 2027 年第一季度投入使用。IBM 表示,这是 IBM Cloud 首个采用 NVIDIA HGX B300 系统和 Spectrum-X 以太网技术建
米哈游宣布,旗下Steam抢先体验AI陪伴产品《BSide:Olivia Lin》(林离)将于8月31日停止线上运营。该产品于7月13日开启抢先体验,线上生命周期不足两个月。8月27日将上线离线版本,保留本地聆听林离演奏、使用动态壁纸等功能,但“写信”“上传MIDI”等依赖在线服务的功能将关闭。用户需在产品从Steam下架前下载离线版本,并提前备份相关数据。《林离》不同于传统游戏,主要探索与虚拟角
Mendel Gödel Machine(MGM)是一种让编码智能体反复重写自身源代码、持续自我改进的框架。不同于通常一次只依据单条失败轨迹进行自我修改的方法,MGM利用不断扩展的历史尝试档案中的比较信息。它引入了基于智能体在多个任务上的轨迹进行修改的变异方式,以及利用其他谱系智能体在同一任务上的轨迹进行混合改写的方法。理论分析和受控模拟表明,这些策略比单轨迹基线收敛更快、效果更好。在SWE-be
该研究提出 Latent-to-4D,用于根据文本或图像条件生成动态3D场景。与先重建RGB视频、再交由独立4D模型处理的方法不同,该方法将视频模型最终去噪后的潜在表示作为显式4D预测的可复用接口。研究人员使用约1,000段重建视频训练了一个检查点,并可将其原样迁移到多个使用同一VAE系列的视频扩散Transformer上。在Text4D-200和I4D-200数据集上,Latent-to-4D的
SPIEval是一项由人工整理的基准测试,用于评估大语言模型作为移动助手时,从多个应用中检索和整合分散个人信息的能力。该基准包含250项任务、来自10个应用的4,335条个人记录,以及支持多轮交互的21种工具,覆盖推理、消歧、信息整合、偏好推断和多意图分解等能力。在对9个具有代表性的LLM进行评估后,表现最佳的GPT-5.5(xhigh)准确率也仅为57.3%,最弱模型为16.4%。79%的失败源
VibeLifeBench是一项用于评估AI智能体的新基准,重点测试其作为个人助理长期处理日常事务的能力。该基准包含覆盖10个生活领域的200项多周任务,运行于由22个模拟服务构成的虚拟世界中。世界会自行变化,且许多变化不会主动通知智能体,因此智能体必须定期重新检查环境,保持计划连贯,并判断何时行动、提问或保持沉默。评估指标包括最终结果、行动时效性以及对隐含约束的遵守情况。研究人员测试了7个前沿模
从马拉松训练到追踪办公室里的焦虑情绪,健康爱好者正把自己的数据连接到聊天机器人,以打造高度个性化的教练。
上海市经济和信息化委员会发布软件和信息服务业“十五五”发展规划,提出到2030年将产业规模提升至4万亿元,并把上海建设为人工智能应用的重要基地。规划支持探索Transformer之外的下一代模型架构,包括状态空间模型和循环神经网络变体,同时布局物理智能、世界模型、量子智能和类脑智能等方向。上海还将推进超大规模智能算力集群组网,提升高性能计算芯片、高速光互连、高带宽内存和异构服务器等环节的供给能力,
由英伟达、思科和CrowdStrike等120多个组织组成的联盟,正在提议建立SAFE,用于报告涉及AI智能体的安全事件。成员将报告未经授权访问第三方系统、泄露机密信息以及部分险些发生的事故,并保存提示词、智能体追踪记录、工具调用、身份、权限和凭证等证据。草案要求成员尽快通知受影响的组织,在四个工作日内提交初步保密报告,适当情况下于30天内发布初步事实报告,并在90天内提供补救措施更新。该计划部分