AI 新闻中心

AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

历时数月谈判,Anthropic向欧盟开放Mythos 5访问权限

Anthropic已正式向欧盟网络安全机构ENISA开放高性能AI模型Mythos 5的访问权限。欧盟委员会表示,ENISA目前正在测试该模型。Mythos专门用于挖掘网络安全漏洞,Anthropic通过“玻璃翼计划”仅向少数经过资质审核的机构提供访问权限。双方历经数月谈判,主要争议包括访问方式和权限范围。不过,欧盟最终只取得了部分成果:ENISA无法访问最新版本Mythos 5.1。此前美国曾限

宇树科技开源新一代人形机器人基础模型 UnifoLM-WLA-1.0

宇树科技宣布完全开源 UnifoLM-WLA-1.0,这是一款面向通用人形机器人的具身基础模型。公司称,该模型在多项评测中刷新开源模型的最佳成绩。实机测试显示,单一模型可统筹64项任务,覆盖桌面操作和全身移动,并支持跨任务、跨末端执行器泛化。该模型结合大规模多模态感知与理解数据,以及以交互为中心的世界模型,以提升空间感知和理解能力。上述评测和实机表现均来自宇树科技的官方介绍,尚待独立验证。

Kimi携手华胜天成、金山云等伙伴进军企业核心业务市场

月之暗面9月10日宣布启动Kimi企业合作伙伴计划,旨在通过技术与服务伙伴,将Kimi模型及Agent基础设施接入企业核心业务。该计划覆盖方案开发、前线部署工程师培养,以及从需求诊断、方案设计到生产部署的完整交付流程。首批合作伙伴包括华胜天成、金山云、亚康股份、亚信科技和中软国际。公告未披露具体的营收、性能或实际部署规模数据。

SyncWorld:视觉校准让世界模型成为零样本模拟器

SyncWorld是一种动作条件世界模型,旨在无需额外训练即可模拟机器人在未见环境中的动作。由于环境、摄像机视角、机器人位置或机体形态的变化,同一个数值动作可能产生不同的视觉结果,从而导致训练监督冲突以及部署时的泛化不稳定。SyncWorld通过包含图像与动作配对的视觉校准片段,描述特定设置下可控制的自由度,使模型能够依据视觉证据和交互历史理解动作。实验表明,该模型可以在未知环境中模拟动作结果,并

DeepSeek正式发布V4.1 Flash:原生多模态视觉理解,性能超越V4 Pro并下调API价格

据IT之家报道,DeepSeek正式发布V4.1 Flash,这是其全新模型架构系列中尺寸最小的模型。该模型为5520亿参数的混合专家模型,采用Causal-Encoder-Decoder结构,输入激活80亿参数,输出激活160亿参数。V4.1 Flash原生支持多模态视觉理解,官方称其在包括Agentic Benchmark在内的测试中超过DeepSeek V4 Pro等旗舰模型。新的KV Ca

财跃星辰与上海交通大学开源 Alpha-R1:8B 模型用于资产配置

财跃星辰与上海交通大学研究团队开源发布了金融推理模型 Alpha-R1,模型规模为 80 亿参数。该模型结合语义门控与包含 GRPO 强化学习的两阶段训练,将当前市场状态与候选资产配置策略背后的经济逻辑进行匹配。根据研究团队公布、使用 2025 年市场数据开展的样本外模拟,Alpha-R1 在多个股票池中超过了通用大模型以及多种统计和机器学习方法。消融实验显示,强化学习对结果有较大贡献。不过,相关

DF26:我们已经无法可靠地区分真假视频

DF26是一项用于检测AI生成视频的新基准,针对近期文本生成视频和图像生成视频模型制作的完全合成片段。数据集包含271段真实视频和2420段合成视频,涵盖面对镜头发言、官方声明和演播室采访等场景。人类观众和最先进的深度伪造检测器的表现都接近随机猜测。研究显示,现有评估方法难以衡量系统应对现代生成模型造成的数据分布变化时的稳健性。

消息称零跑四大车系或将全系搭载世界模型智驾

据媒体援引知情人士消息,零跑计划于9月16日的技术发布会上推出世界模型智驾系统,并宣称其有望达到行业第一梯队。报道称,零跑ABCD四大车系未来可能全系搭载该系统,覆盖6万至30万元人民币的车型。公司管理层还表示,新辅助驾驶产品相比现有系统将有大幅提升。不过,目前这些信息仍属于发布会前的未证实消息。

张宏江:Agent Economy时代,组织层面的“涌现”将成为核心竞争力

在2026 Inclusion·外滩大会上,张宏江表示,人工智能可能从根本上改变企业组织形态。他认为,企业需要将知识产权、Know-how、用户关系和产品能力转化为模型,并使模型产生涌现能力。张宏江提出,Agent将从对话工具发展为助手,再从个体走向群体或Agent Swarm。在Agent Economy阶段,Agent将更多地使用软件,并可能彼此形成经济关系。他还认为,“一个人加多个Agent

为什么AI还没有真正发现新的科学?普林斯顿研究者:答案可能不在模型里

普林斯顿大学教授王梦迪表示,大模型至今尚未在物理、化学和生物等基础科学领域带来同等规模的原创发现,原因之一是模型倾向于给出最可能的答案,却低估概率分布长尾中的少数可能性。数学和编程发展更快,是因为形式化证明系统、编译器和测试能够提供明确的验证反馈;现实科研则依赖复杂设备、人的判断、跨团队协作,以及不一定能稳定复现的实验。王梦迪团队正在自动化量子材料实验,通过API开放实验设备,并探索连接多模态AI

差异编辑与完整文件生成对比:Flutter/Dart 代码模型的实证研究

一项研究比较了两种 AI 代码编辑方式:一次性生成完整的修改文件,以及逐步生成局部搜索/替换差异。研究人员使用同一 Flutter/Dart 数据集,从头训练了一个 1 亿参数模型,并微调了一个 5 亿参数的 Qwen2.5-Coder;每个模型在约 1,790 个留出任务上进行评估。直接生成在编译和静态分析通过率、与参考代码的相似度,以及目标完成度、正确性和代码质量的盲评中,均持续优于差异生成。

代理框架与模型协同进化:在模仿失效时,在线策略纠错帮助较弱模型追赶

代理框架包括系统提示词、工具、执行钩子和上下文管理,对代理任务的成功率有重要影响。在七项企业代理任务中,自动进化的框架让较小模型以远低于前沿模型的成本取得了良好表现。但使用强模型专家的完整执行轨迹训练较弱模型后,性能反而下降了4至30个百分点。原因是较弱模型模仿了专家的规划策略,却缺乏执行该策略的能力,同时破坏了与原本依据其规划风格设计的框架之间的适配关系。研究人员提出一种在线策略纠错流程:由元级

RESCUE-BENCH:面向关系感知型多方情绪支持对话系统的评测基准

该研究提出RESCUE,用于评估大语言模型在多方情绪支持对话中的表现。数据集来自真实的伴侣和家庭访谈,包含191个样本、7,079个标注对话轮次和1,064.8分钟视频。RESCUE设置了六项任务,评估模型理解人际关系动态以及提供关系敏感型支持的能力。对10个语言模型的实验显示,现有模型在处理局部情绪或干预线索时表现相对较好,但在关系模式预测、观点预测和支持策略预测等依赖关系理解的任务上仍存在明显

难度自适应树结构策略优化扩大RLVR的推理覆盖范围

基于可验证奖励的强化学习(RLVR)能够提升大型推理模型的单次回答准确率,但往往难以扩大以pass@k衡量的内在解题覆盖范围。研究提出DATPO,通过难度自适应树搜索、句子熵引导的分支,以及鼓励兄弟路径多样性的优势项,优化训练阶段的rollout。在数学推理基准测试中,DATPO尤其在pass@k上优于基线方法,并进一步提升了测试时扩展的性能。