AI 新闻中心

AI 新闻中心 过去30天分析了 317 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

用于强化微调的动态重要样本挖掘

强化微调(RFT)越来越多地用于提升大型模型的推理能力,但其效果很大程度上取决于训练数据的选择。现有多数数据中心型RFT方法采用静态或启发式样本选择,忽略了样本价值会随着策略学习过程发生变化。Dynamic Important Example Mining(DIEM)提出了一种在RFT过程中自适应利用数据的框架。该方法通过梯度对齐估计每个样本对策略改进的边际贡献,并在保持梯度幅度的同时重新调整批次

DreamX-Creator 推动 2K 原生音视频生成普及

DreamX-Creator 1.0 是一套可联合生成视频和音频的紧凑型系统。其 70 亿参数生成器先分别处理视觉与音频流,再通过带门控的跨模态注意力机制进行耦合。系统采用经过筛选的时序一致多模态数据、渐进式联合训练,以及利用模态感知反馈的强化学习。针对 2K 输出,团队设计了一个精炼流程,将模型压缩为每个时间片段只需进行一次去噪评估。开发团队公开了 7B 生成器和 2K 精炼器,以支持统一音视频

CogEvol:面向高效可靠的学习环境生成

CogEvol是一系列专为学习环境生成设计的模型,可将课程简介一次性转换为完整的学习内容,包括结构化JSON幻灯片和自包含的交互式HTML页面。开发团队称,该系统基于22万次生产请求开发,生成一页幻灯片的中位时间为17秒,生成交互式页面为59秒。CogEvol-27B在幻灯片质量评测中得分83.7,在包含500个案例的交互式HTML基准测试中得分63.7。CogEvol-4B已依据Apache 2

科大讯飞开源端侧模型,支持百万 Token 上下文

科大讯飞旗下词元星火发布了开源模型星火 X2.5-4B 和星火 X2.5-1.7B。两款模型原生支持最长 100 万 Token 的上下文窗口,并针对智能体、代码、数学和指令遵循等能力进行优化。据介绍,模型在国产算力平台上完成全流程训练,使用了约 20 万亿 Token 的多样化数据。在 Domux 智能家居测试集上,1.7B 模型的控制指令端到端执行正确率达到 90.3%,平均响应时间为 0.8

让大型推理模型突破人类监督持续扩展

本文研究在人类监督逐步退出学习闭环后,大型推理模型(LRM)如何继续提升。对于数学和编程等结果可自动验证的任务,利用可验证奖励的强化学习已经显著改善了推理能力;但在开放式任务和智能体任务中,可靠奖励更难获得。研究分析了两个相互关联的方向:从逐个实例的人类判断转向可复用的验证器和无需人工反馈的奖励,以及从人工策划的任务和环境转向模型自行生成的课程、构建的环境和自主协同进化。L0至L4的五级框架用于标

用于大语言模型情感检测的跨语言功能向量

本研究探讨功能向量能否跨语言引导大语言模型完成任务。研究人员从上下文示例中提取潜在任务方向,并将其应用于多语言、多标签情感识别。由源语言提取的功能向量在其他语言中也能显著提升性能,包括推理时不提供示例的零样本设置。结果表明,功能向量捕捉的可能是与语言无关但与任务相关的信号,而不只是特定语言的词汇模式。研究还发现,每个模型用于构建有效功能向量的最佳注意力头范围相对稳定,并且在不同语言之间保持一致。该

PaperGym:利用科学评分标准训练研究计划生成模型

PaperGym 是一个将科学论文转化为完整训练环境的框架,用于训练生成研究计划的 AI。它根据论文的研究目标和背景生成问题,再从方法和实验中提取评估标准,从而减少模型仅靠改写内容获得奖励的情况。标准泄漏率降至 3.7%,而现有数据集为 11.90% 至 34.10%。在 Qwen3 模型上训练后,五项基准测试的平均成绩最高提升 5.6 分。研究团队还发布了包含 2 万个样本的 PaperGym-

大模型没有独门秘笈:腾讯混元4如何借助开源生态与顶尖人才实现逆袭

腾讯在四个月内完成大语言模型与多模态团队重组,并推出混元4。该模型据称拥有7700亿参数,支持最长达100万Token的上下文。分析认为,混元4融合了DeepSeek的稀疏注意力机制DSA、智谱IndexCache的跨层索引复用方案,以及更简化的恒等超连接设计。来自竞争对手公司的资深研究人员加入,也推动了相关研发。文章指出,随着论文、代码和实验结果加速公开,以及顶尖工程师持续流动,大模型领域技术优

DeepSeek 首个视觉实验模型正式开源,拥有 3050 亿参数

DeepSeek 已通过 MIT 许可证开源 V4 系列首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。该模型基于 V4-Flash 架构,深度整合视觉模块,支持图像理解与分析。模型总参数量达到 3050 亿。根据官方评测,其在纯文本智能体任务上的表现与 V4-Flash 相当,在多模态测试中展现出接近行业顶尖水平的竞争力。模型还支持调用外部工具,独立完成复杂的智能

获取、修复与保持:面向小型模型对话游戏智能体的诊断驱动后训练方法

一项在 LM Playschool Challenge 中开展的研究,使用一个拥有 20 亿参数的开放权重模型评估互动式对话游戏能力。研究发现,许多失败并非主要源于广泛知识不足,而是局部决策问题,例如重复猜测、生成格式错误的动作,以及违背刚刚收到的反馈。研究提出的方法包括广泛的监督微调、针对单一对话游戏系列的定向修复,以及保持模型的一般能力。公开 clemscore 从 10.67 提升至 38.

DeepSeek 开源多模态模型 DeepSeek-V4-Flash-Vision-Exp

DeepSeek 已在 Hugging Face 以 MIT 许可证开源 V4 系列首个多模态模型 DeepSeek-V4-Flash-Vision-Exp。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及覆盖视觉编码器、MoE 和注意力机制等核心模块的最小化 PyTorch 推理实现。该实验版本除文本外还支持输入 JPEG、PNG、GIF 和 WebP 图

LoopArena:评估模型作为循环工程运行时控制器的基准测试

LoopArena是一项用于评估模型的基准测试,研究模型如何在长期软件工程任务中指导独立的编码代理。每轮编码结束后,控制器会收到运行过程的结构化摘要,并决定工作代理下一步应执行或验证的内容,或者是否应该停止。该基准测试涵盖三种执行范围和成本设置。在完整任务中,观测到的最高严格成功率为24.69%,表明长期循环控制仍有较大改进空间。同时,受评估的控制器平均将估计推理成本降低了64.4%。研究人员已公

GGSS:用于生成式视觉语言模型推理时去偏的测地线门控球面引导

生成式视觉语言模型即使面对仅在感知种族或性别等受控属性上存在差异的图像,也可能生成带有人口统计偏见的内容。GGSS是一种推理时去偏方法,它在单位超球面上发现反事实偏见子空间,沿测地线弧线调整视觉标记,并自适应地重点修正携带更强人口统计信号的标记。在四个生成式视觉语言模型和十种对比方法上的评估中,GGSS在全部四个模型上取得了最低的平均偏见;其中三个模型骨干上的改进具有统计显著性。同时,MMStar