AI 新闻中心

AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

腾讯发布参数规模达 7700 亿的开源模型 Hy4 preview

腾讯发布了开源模型 Hy4 preview,总参数量 7700 亿,激活参数 490 亿,上下文长度达到 100 万 Token。腾讯称,该模型在软件工程、办公分析、游戏开发和科学研究等任务上有所提升。在由 163 名内部专家对 203 项工程任务进行的盲测中,Hy4 preview 平均得分为 2.99 分(满分 4 分),略高于腾讯公布的 GLM-5.3 和 Kimi K3 得分。腾讯还表示,

Anthropic推出MHS硬件标准,进军物理AI

Anthropic于8月27日以研究预览形式发布“模型硬件标准”(MHS)。该标准旨在提供统一的控制与通信层,让AI代理能够操作显微镜、液体处理设备、机械臂和量子计算系统等可编程设备。路透社、CNBC等媒体将其解读为Anthropic首次公开进入具身智能或物理AI领域。Anthropic表示,早期闭门测试在生物医药、量子计算和先进制造领域带来了效率提升。制药公司基因泰克称,一项自动化剂量反应实验的

Self-OPD:无需教师模型的流匹配模型策略内蒸馏

论文提出 Self-OPD,一种面向流匹配模型的无教师策略内蒸馏框架。现有 OPD 方法通常需要为每个新目标训练专门的预训练教师模型,计算成本较高;教师与学生分布之间的差异还可能导致生成轨迹中的误差累积。Self-OPD 将学生模型自身的探索转化为逐步监督信号。在每个时间步,方法从确定性的下一状态预测中生成多个随机候选,通过采样运行这些候选,并将其奖励与模型自身的确定性参考基线进行比较。优势较高的

TTPO:测试时策略优化

TTPO是一种无需真实标签、在推理阶段训练大语言模型的方法。它利用多数投票生成伪标签,对与投票结果一致的输出进行蒸馏,并惩罚不一致输出中的高置信度错误,以降低错误伪标签误导整个更新过程的风险。在五项竞赛级基准测试中,TTPO达到了使用标签监督的在策略自蒸馏方法的水平。在Qwen3-1.7B上,测试时训练性能从38.0%提升至45.2%;在不进行扩展思考的情况下,研究还报告了25.2%至36.4%的

Midjourney上线V8.2图像编辑模型,支持指令微调与画布扩展

Midjourney已开放V8.2图像编辑模型的公开测试。用户可以通过文本指令修改现有图像,同时融合最多4张参考图,并使用局部重绘和画布扩展功能。该模型还支持个性化设置、情绪板和风格参考。用户可通过Midjourney官网、alpha测试网站或Discord调用。官方表示,测试初期界面可能频繁调整,模型在复杂场景下仍可能出现非预期结果,并邀请用户提交反馈和任务ID。

PAWBench:距离概率对齐的世界模型还有多远?

PAWBench提出将概率对齐作为评估世界模型的标准。模型不仅要生成一条合理的轨迹,还应在相同的初始观测和行动条件下,正确复现各种可能结果的分布。该基准及PAWEval评测协议在50个场景和11个现有系统上分析了重复视频生成结果。没有任何受测模型能够持续匹配参考概率,同时覆盖全部有效的物理行为。研究还考察了语言提示、初始噪声和模型训练是否能够改变模型的预测分布。

蚂蚁百灵推出金融增强模型 Ling-3.0-flash-Fin,下周开源

蚂蚁集团旗下百灵推出金融增强模型 Ling-3.0-flash-Fin,总参数量为 1240 亿、激活参数为 51 亿。该模型延续 Ling-3.0-flash 的架构和长上下文能力,并通过金融语料持续预训练、领域后训练和工具使用优化,提升对年报、财务工作簿、研究材料及复杂金融任务的处理能力。蚂蚁集团称,模型已在多项金融与智能体基准上进行测试,相较多款通用模型展现出竞争力;其 AA Intelli

Zero-WAM:从人类视频进行上下文世界动作建模,实现开放式任务泛化

Zero-WAM是一种因果视频—动作模型,使机器人能够依据人类视频示范执行训练中未见过的操作任务。研究人员构建了HumanGen数据集,通过自动化流程生成涵盖8600项任务的74200组人类—机器人上下文学习配对。在RoboTwin 2.0模拟环境中,Zero-WAM在7项未见任务上取得47.0%的平均成功率,比最强的视频—动作基线高29.5个百分点。真实世界测试涵盖多物体场景、长时序操作以及精细

UrbanGround:从局部感知到真实规模城市中的空间行动能力

该研究提出 UrbanGround,这是一个用于评估多模态大语言模型代理在复杂城市环境中表现的测试平台。研究团队利用覆盖香港全域的三维地理空间数据,构建了一个具有物理约束的香港城市复制环境,使代理能够以第一人称视角探索城市,并通过交互式地图进行导航。研究考察局部视觉感知能否支持空间问题回答、远距离导航,以及对路线和行人运动变化的适应。当前的多模态大语言模型代理在视觉识别和短距离空间推理方面表现出一

量子技术与AI融合,中国首个量子增强大模型“玄幂”发布

中国国光量超人工智能研究团队宣布,将量子技术引入大语言模型的核心决策与推理流程,并推出面向科研和学术领域的“玄幂”模型系列。团队称,该模型在科研科普、任务路由和智能体决策等特定任务中,相较主流开源模型具有更深入的专业理解、更清晰的任务判断和更短的决策路径。此次公告未提供独立技术验证或基准测试结果。

进化策略在大语言模型推理覆盖度上优于GRPO

该研究分析了进化策略(ES)作为一种面向大语言模型推理能力的内存高效后训练方法。与群组相对策略优化(GRPO)相比,ES能够保持更高的候选解多样性,并在Pass@K指标上取得更好表现。GRPO容易出现熵坍缩,而ES在提升Pass@1的同时,可以覆盖更多推理路径。研究提出的序列式GRPO-ES训练策略,结合了GRPO获取最佳答案的优势与ES更广泛的覆盖能力。研究还发现,尽管模型整体参数可能发生较大漂

什么是高质量的智能体数据?从 ACE 视角看 LLM 智能体的数据生成

该研究提出了一个用于生成和评估 LLM 智能体交互数据的两层框架。研究将智能体数据表示为环境、任务、交互以及可选验证器的组合,并通过 ACE 视角——准确性、复杂性和多样性——分析如何生成有环境依据、内部一致、符合特定学习者能力且不重复的经验数据。文献显示,相关研究正逐步转向基于执行结果的准确性、相对于学习者的复杂性,以及超越表面变化的数据多样性。研究指出,核心挑战并非简单增加数据量,而是在智能体

Meta被曝或每年向Anthropic大模型投入最高100亿美元

据财联社援引知情人士报道,Meta内部曾预测,未来每年用于Anthropic人工智能模型的支出最高可能达到100亿美元。Anthropic旗下Claude系列模型在长文本处理、复杂推理和企业应用方面具有一定优势。若报道属实,这一潜在支出规模将凸显大型科技公司对头部外部模型开发商的依赖,也反映前沿人工智能领域的投资规模持续扩大。目前,Meta和Anthropic均未正式证实相关说法。