AI 新闻中心

AI 新闻中心 过去一年分析了 7669 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

消息称英伟达因 HBM 短缺测试 192GB 和 256GB HBM4 版 Rubin Ultra

据 The Information 报道,英伟达正因先进 HBM 供应短缺,评估降低 Rubin Ultra 加速器显存容量的版本。英伟达此前展示的 Rubin Ultra 平台采用 4 个计算芯片,最高搭载 1TB HBM4E 显存。消息称,英伟达正在测试 192GB 和 256GB 版本,显存堆叠数量也少于此前公布的 16 组。此外,由于 HBM4E 所需的定制基础逻辑裸片制造难度较高,英伟达

消息称 Anthropic 最快将于9月上市,并淡化AI模型竞争等挑战

据《华尔街日报》报道,Anthropic正与潜在投资者接触,计划最早于9月或10月初进行首次公开募股。公司重点强调快速增长势头和编程工具Claude Code的成功,但投资者正关注中国低价AI系统的竞争、与特朗普政府的紧张关系,以及美国各地反对建设数据中心的声音。据知情人士透露,Anthropic高管淡化了中国AI企业的竞争影响,称多数用户仍希望使用能力最强的模型。公司还计划拓展AI在医疗和生物学

报告称:超七成美国人反对建设 AI 数据中心

据《The Information》报道,美国公众反对新建 AI 数据中心的情绪正在加剧。美国各地禁止新建数据中心的地方措施数量据称在 2026 年 7 月增至 500 多项,6 月为 300 多项。居民主要担忧噪声、水电成本上涨以及对环境的影响。自年初以来,抗议活动中至少有 37 人被捕。7 月公布的新禁令中,近四分之三位于佐治亚州、佛罗里达州等南部地区。纽约州已暂停审批耗电量达到或超过 50

千问推出AI硬件开放平台,支持开发者定制AI眼镜功能

阿里巴巴已上线千问AI硬件开放平台,覆盖App、PC和AI眼镜。平台为开发者提供Skill全流程开发框架,可调用拍照、语音交互等能力;企业则可使用涵盖眼镜端、App和云端的技术底座。已公布的应用包括为视障人士提供障碍物提示、基于视线触发的文旅讲解、烹饪指导,以及工业和零售场景的设备与货架巡检。平台后续计划开放空间3D显示和运动健康感知等功能。

Evo-Bench:语言模型能否改进智能体框架?

Evo-Bench是一项用于评估语言模型能否自主优化AI智能体运行框架的基准测试。它覆盖搜索、办公和通用智能体任务,并试图将框架改进与基础模型能力区分开来。对9个前沿模型和开放权重模型的评估显示,最高绝对提升达到16.6分。自主进化在通用任务中超过人工构建的框架,在搜索任务上表现突出,但在需要高度特定处理流程的办公任务中表现较弱。研究还发现了早期饱和等时间异常,并表明生成的框架可以作为具有迁移性的

意图胜过表面:超越响应模仿的可控用户模拟

用户模拟器为训练和评估交互式助手提供了可扩展的环境。新方法UserIDA将下一轮用户发言应实现的局部交互意图,与表达该意图的语言形式分离开来。该方法采用六类意图接口、监督式微调,以及基于群组强化学习的意图校准策略优化。在LMSYS-USP上,UserIDA的意图准确率达到86.6%,比最强的专用基线高出24.3个百分点,同时提升了语义和风格相似度。在上下文内干预测试中,它在91.7%的对话状态中实

消息称 Anthropic 与 Riot Platforms 达成 91 亿美元算力协议

据彭博社援引知情人士报道,人工智能公司 Anthropic 已与比特币挖矿企业 Riot Platforms 签署一项为期 20 年、价值 91 亿美元的算力协议。Riot 将从其位于美国得克萨斯州罗克代尔的数据中心园区提供 191 兆瓦算力。协议包含两次、每次 5 年的续约选择权,若全部执行,合同总销售额最高可达 161 亿美元。该交易显示,随着 AI 服务需求持续增长,Anthropic 正加

Motif 3:技术报告

该技术报告介绍了 Motif 3,一款采用纯解码器 Mixture-of-Experts 架构的语言模型,总参数量为 3140 亿,每个 token 激活 132 亿参数。每个稀疏 MoE 层包含 384 个路由专家,每个 token 选择其中 8 个。模型采用分组差分潜在注意力等技术,旨在提升训练稳定性、专家专业化程度和推理效率。Motif 3 使用约 12.5 万亿个 token 进行预训练,

Sci-VBench评估科学领域知识与推理密集型视频生成

Sci-VBench是一项用于评估科学视频生成模型的基准测试,重点考察需要知识和推理的任务。该数据集包含1,253个由专家标注的样例,覆盖自然科学、医疗、人文与社会科学、工程四大领域的60个主题。评估不仅关注视觉逼真度,还衡量提示词遵循度、科学正确性和因果正确性。对16个闭源和开源模型的测试显示,各系统的自动感知质量分数较为接近,但在科学推理和因果准确性方面存在显著差异,闭源模型与开源模型之间也出

SWE-Bench ProMax 评估 AI 代理的大规模多语言代码重构能力

SWE-Bench ProMax 是一个由专家策划的基准测试,包含从真实提交中选取的 170 个代码重构任务,覆盖 Python、Java、TypeScript、Go、C、C++ 和 Rust 七种语言。该项目针对现有基准中的测试缺陷,以及模型可能从训练数据中逐字复现标准补丁等问题进行了改进。每个任务平均修改 11.4 个文件和 261.6 行代码,规模明显超过现有评测。在两种代理框架的实验中,最

Macaron-V1:探索结合自我改进与 Mixture-of-LoRA 的开放式持续学习

Macaron-V1 是一个开放式智能体模型系列,旨在从真实环境中的经验学习,并在部署后持续适应。其架构冻结基础模型,组合用于聊天、智能体任务、编程和 GenUI 的专用 LoRA 适配器,并在每轮用户交互中选择一个适配器。旗舰版本 Macaron-V1-Venti 使用 7440 亿参数的 GLM-5.2 基础模型;基于 500 亿参数 Qwen3.6 的 Macaron-V1-Tall 则面向

TVB进军AI算力市场,计划2027年启用1万P级算力设施

无线集团有限公司(TVB)宣布与基汇资本关联公司Triton Square Limited签署协议纲领,计划在香港成立合资公司,提供先进AI算力服务。合资公司普通投票权股份预计由TVB持有51%、基汇资本持有49%。项目将在TVB将军澳工业邨园区内建设并运营GPU、CPU等算力设施,向外部客户及集团成员公司提供服务。资金来源包括基汇资本最高20亿港元的股本投资、银行融资和集团内部资源。首阶段目标算

Anthropic开始为Claude所有输出添加机器可读标记

Anthropic正在为Claude部署双层标记机制:在文本中嵌入人眼不可见的水印,并为生成的SVG、PNG、JPG等文件附加符合C2PA标准的数字签名元数据。该机制自8月2日起应用于新发布的Claude模型,并在全球所有Claude产品中生效,不局限于欧盟。通过AWS、Google Cloud和Microsoft Foundry调用Claude生成的文本同样会带有水印,但文件元数据是否存在取决于

英伟达实现AI模型间KV缓存迁移,推理速度最高提升25倍

英伟达研究团队提出了一种在不同语言模型之间迁移KV缓存的方法,使目标模型能够跳过计算量较大的预填充阶段。根据模型和上下文的复杂程度,缓存转换速度据称比重新处理整个上下文快2.7至25倍。这项技术有望降低长对话和长文档场景下的推理延迟与成本,尤其是在切换或升级模型时。不过,其实际影响仍取决于模型之间的兼容性,以及能否在生产环境中得到广泛部署。

SPOT:用于在策略蒸馏的稀疏探测与结果校准

SPOT是一种改进在策略蒸馏的方法。在该方法中,学生模型在教师模型的监督下,根据自身生成的轨迹进行学习。SPOT结合教师模型的熵、少量高概率候选覆盖的概率质量,以及学生与教师之间的不匹配程度,选择有限预算下需要探测的位置。随后,它通过验证器对学生模型生成的后续轨迹进行评分,评估教师提出的候选。基于这些结果,SPOT构建带有KL正则化的训练目标,在保持教师分布约束的同时,偏向下游结果更好的候选。在多