AI 新闻中心

AI 新闻中心 过去30天分析了 4649 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Kirin:从真实环境视频生成动物运动

Kirin 是一个从视频中重建和生成动物运动的框架。该系统利用大量真实环境中的动物视频,重建三维运动序列,并将其与文字描述配对,构建 AiM3D 数据集,为四足动物提供视频、文本和运动的对齐数据。在此基础上,研究人员开发了一个同时以文本和图像为条件的视觉引导运动生成模型,可为不同动物物种生成逼真的动作。结合现有的图像转三维模型,Kirin 还能自动为三维动物网格绑定骨骼并制作动画,为大规模、文本和

HarnessDev:大语言模型能否创建并进化自己的智能体框架?

HarnessDev 是一个用于评估语言模型能否构建和改进智能体执行基础设施的基准测试。在创建阶段,智能体从最小化的初始环境出发,建立完整的执行系统;在进化阶段,则根据执行反馈反复修改该系统。研究评估了 6 个大语言模型,覆盖 4 个领域和 5 个下游基准,共包含 2,207 个独立实例。生成的框架在编程、搜索和研究任务上明显落后于成熟的人工设计系统,但在写作和机器学习实验方面,表现达到或超过了部

Repo-To-Skill:将 GitHub 仓库提炼为 AI 技能

该研究推出 DisCo,一种将 GitHub 仓库和论文中的实践知识转化为紧凑、经过验证的技能的研究代理,用于自主机器学习研究。其 AREX-Skill Library 从 1,000 个广泛使用的 ML 仓库中提炼出超过 5,000 项技能。在模型、研究框架和执行预算保持不变的情况下,研究称配备这些技能的代理在 MLE-bench、PaperBench、FrontierCS 和 PassNet

地平线征程智驾芯片量产突破1500万套

中国芯片企业地平线宣布,征程系列智能驾驶芯片量产规模已突破1500万套。据公司介绍,相关芯片累计赋能800万名车主,并与超过40个汽车品牌达成合作,中国前十大车企均在其中。自2020年启动前装量产以来,地平线用了5年实现从0到1000万套,而从1000万套增至1500万套仅用12个月。公司称,目前已有500款量产车型确定采用其芯片,其中近130款属于中高阶智能驾驶领域,在手定点总量超过2000万套

百度引进北美前沿实验室专家,前 DeepSeek 研究员出任多模态负责人

百度基础模型研发部门正在重组研究团队。百度引进了来自一家未具名北美前沿实验室的资深研究员武钦,以增强文心系列模型的预训练能力。前 DeepSeek 研究员魏浩然也已转入百度,负责多模态算法开发。他的团队此前开源了 Unlimited OCR 模型,并在 OmniDocBench 基准测试中排名第一。百度希望通过引进人才强化文心的研究组织和技术开发,但这名新研究员的具体背景尚未公开。

EarlyEval通过提前预测结果降低AI智能体评估成本

评估大语言模型智能体的成本可能很高:前沿模型运行一次基准测试就可能花费数百至数千美元,反复测试会进一步增加开发成本。EarlyEval通过分析智能体的中间行为,提前预测其最终结果,并在成功或失败的置信度达到设定阈值时停止运行。该轻量级框架使用两个基于行为、文本和参考解决方案特征训练的LightGBM分类器。在SWE-bench Verified、TerminalBench和Toolathlon上,

语言模型可以控制自己的注意力

语言模型通常只需关注长上下文中的一小部分内容,但此前仍必须扫描整个 KV 缓存来寻找相关 token。Declarative Attention(DA)让模型在生成过程中自行声明需要关注完整上下文、特定区域,还是仅关注最近的输出。推理引擎会像处理工具调用一样解析这些声明,从而跳过大部分 KV 缓存读取。在涵盖 15 项长上下文任务的零样本评测中,DA 使 Gemma-4-31B 和 Qwen-3.

PS3 模拟器 RPCS3 因性能影响拒绝跟进英伟达 DLSS 5

RPCS3 团队表示,不会将英伟达 DLSS 5 集成到 PS3 模拟器的官方版本中。部分用户据称已在 RPCS3 渲染器中测试泄露的 DLSS 5 DLL 文件,团队称测试结果显示性能下降。据相关报道,英伟达表示,目前启用 DLSS 5 可能导致游戏性能下降 50% 至 60%。DLSS 5 被描述为面向 RTX 50 系列显卡的新一代超分辨率和神经渲染技术。上述信息基于泄露文件测试及文章引用的

Nscale据报获得Anthropic 450亿美元算力合同

据The Information报道,英国云服务商Nscale已与人工智能公司Anthropic达成一项价值450亿美元的算力协议。该协议使Nscale向潜在投资者披露的合同总额从约510亿美元增至约1030亿美元。相关合同的平均期限为5.7年,按此计算年均规模约为180亿美元,但公司没有披露预计实际确认的收入。知情人士称,Nscale最早可能在本月推进首次公开募股(IPO)。上述数据来自公司文件

像素文本表示学习的设计基础

该研究探讨模型如何直接在像素空间中读取、检索和压缩语言。通过系统性的控制变量实验,研究人员确定了四项关键因素:可变图像分辨率和字体大小、用于视觉对齐的自然图像文本对、防止像素级捷径学习的布局感知渲染,以及用于跨语言对齐的两阶段多语言训练课程。研究团队将这些原则整合到 Pixel Linguist II 中。这是一款采用原生分辨率、支持即时渲染,并使用2.8亿个训练样本训练的视觉编码器。该模型在英语

后训练让语言模型在编程竞赛中达到金牌水平

一项研究提出了一套端到端流程,用于将大型语言模型专门训练成竞赛编程系统。该方法结合了精选题目、合成推理轨迹、监督微调和强化学习。使用22,000道题目训练的Nemotron-3-Nano-CC,在加入测试时生成、评估和改进解答的策略后,于IOI 2025获得468分,超过金牌门槛。更大的Ultra-CC模型获得502分。随后,一个针对竞赛专门调整的系统在IOI 2026的前瞻性评估中取得600分中

ExecRetrieval 衡量代码嵌入检索中的功能正确性差距

ExecRetrieval 是一个用于测试代码嵌入系统能否区分功能正确代码与几乎相同但存在错误的代码变体的基准。数据集包含 939 个 Python 任务,每个任务配有一个经过执行验证的标准实现,以及最多四个通过单一目标修改生成、同样经过执行验证的错误干扰项。研究人员评估了 23 种密集嵌入配置和 BM25。表现最佳的托管系统 exec@10 达到 1.00,但 exec@1 仅为 0.331。在

PaperCompiler:通过仓库级规范编译实现忠实的论文到代码生成

PaperCompiler 是一个将研究论文转换为仓库级实现的框架。它把与实现相关的证据编译为明确的规范,保留来源信息,并区分论文支持、推断、外部委托和未解决的内容。规范还编码了防止性能退化的要求、任务归属、跨文件依赖关系和文件级约束。在 Paper2CodeBench 上,PaperCompiler 相比强基线将基于参考实现的保真度相对提升了 13.8%,得分从 3.64 提高到 4.15,同时