更聪明地训练,而不是更费力:主动学习中的信号引导切换
一项研究探讨了主动学习模型应从头重新训练,还是从上一个检查点进行微调。研究发现,在新标注批次可能显著改变数据分布的早期轮次,完整重训最有价值;当模型训练轨迹趋于稳定后,微调则更加可靠。HybridAL监测谱指数变化和验证准确率变化等稳定性信号,并在持续稳定后自适应地从重训切换到微调。在三种编码器骨干和六项文本分类任务上,HybridAL的最终宏平均F1不低于重训和微调基线,同时最多节省49%的重训
AI 新闻中心 过去一年分析了 1377 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究探讨了主动学习模型应从头重新训练,还是从上一个检查点进行微调。研究发现,在新标注批次可能显著改变数据分布的早期轮次,完整重训最有价值;当模型训练轨迹趋于稳定后,微调则更加可靠。HybridAL监测谱指数变化和验证准确率变化等稳定性信号,并在持续稳定后自适应地从重训切换到微调。在三种编码器骨干和六项文本分类任务上,HybridAL的最终宏平均F1不低于重训和微调基线,同时最多节省49%的重训
SWE-Bench Pro用于评估人工智能智能体处理仓库级复杂软件工程任务的能力。但分析发现,标准答案或隐藏评测信息泄露导致的奖励投机,以及误导性问题描述和范围不当的测试,可能扭曲评测结果。SWE-Bench Pro Verified通过阻断主要泄露渠道,并对存在缺陷的任务进行最小幅度修正,解决了这些问题。评测显示,部分模型的表现明显低于此前公布的结果,表明原有SWE-Bench Pro结果可能高
一项研究提出了一种基于参照的偏见审计方法,通过分析大语言模型的隐藏状态表示来检测偏见。该方法根据句子与固定锚点句集合的相似度对句子进行编码,使微调前后的模型变体即使内部表示结构发生变化,也能在统一的比较空间中进行分析。研究者提出“表示偏见变化”指标ΔB,用于衡量目标群体与正面、负面属性之间关联的变化。在三个模型系列的18种测试设置中,ΔB有15次与输出层面的偏见变化相关,最高相关系数为|r| =
宇树科技宣布完全开源 UnifoLM-WLA-1.0,这是一款面向通用人形机器人的具身基础模型。公司称,该模型在多项评测中刷新开源模型的最佳成绩。实机测试显示,单一模型可统筹64项任务,覆盖桌面操作和全身移动,并支持跨任务、跨末端执行器泛化。该模型结合大规模多模态感知与理解数据,以及以交互为中心的世界模型,以提升空间感知和理解能力。上述评测和实机表现均来自宇树科技的官方介绍,尚待独立验证。
SyncWorld是一种动作条件世界模型,旨在无需额外训练即可模拟机器人在未见环境中的动作。由于环境、摄像机视角、机器人位置或机体形态的变化,同一个数值动作可能产生不同的视觉结果,从而导致训练监督冲突以及部署时的泛化不稳定。SyncWorld通过包含图像与动作配对的视觉校准片段,描述特定设置下可控制的自由度,使模型能够依据视觉证据和交互历史理解动作。实验表明,该模型可以在未知环境中模拟动作结果,并
据IT之家报道,DeepSeek正式发布V4.1 Flash,这是其全新模型架构系列中尺寸最小的模型。该模型为5520亿参数的混合专家模型,采用Causal-Encoder-Decoder结构,输入激活80亿参数,输出激活160亿参数。V4.1 Flash原生支持多模态视觉理解,官方称其在包括Agentic Benchmark在内的测试中超过DeepSeek V4 Pro等旗舰模型。新的KV Ca
财跃星辰与上海交通大学研究团队开源发布了金融推理模型 Alpha-R1,模型规模为 80 亿参数。该模型结合语义门控与包含 GRPO 强化学习的两阶段训练,将当前市场状态与候选资产配置策略背后的经济逻辑进行匹配。根据研究团队公布、使用 2025 年市场数据开展的样本外模拟,Alpha-R1 在多个股票池中超过了通用大模型以及多种统计和机器学习方法。消融实验显示,强化学习对结果有较大贡献。不过,相关
DF26是一项用于检测AI生成视频的新基准,针对近期文本生成视频和图像生成视频模型制作的完全合成片段。数据集包含271段真实视频和2420段合成视频,涵盖面对镜头发言、官方声明和演播室采访等场景。人类观众和最先进的深度伪造检测器的表现都接近随机猜测。研究显示,现有评估方法难以衡量系统应对现代生成模型造成的数据分布变化时的稳健性。
诺贝尔经济学奖得主菲利普·阿吉翁在2026 Inclusion·外滩大会上表示,未来十年AI可能使年度生产率增速额外提高最多1.08个百分点。但他强调,这一潜力能否转化为持续增长,取决于竞争政策、教育体系和劳动力市场制度能否同步跟进。阿吉翁警告,云计算和图形处理器市场的高度集中,可能限制新企业进入和创新。他认为,AI会替代部分人类任务,但也可能通过提高生产率、扩大需求和促进新想法来创造就业。教育应
普林斯顿大学教授王梦迪表示,大模型至今尚未在物理、化学和生物等基础科学领域带来同等规模的原创发现,原因之一是模型倾向于给出最可能的答案,却低估概率分布长尾中的少数可能性。数学和编程发展更快,是因为形式化证明系统、编译器和测试能够提供明确的验证反馈;现实科研则依赖复杂设备、人的判断、跨团队协作,以及不一定能稳定复现的实验。王梦迪团队正在自动化量子材料实验,通过API开放实验设备,并探索连接多模态AI
论文提出 SAEScientist-Bench,用于评估 AI 代理能否借助稀疏自编码器(SAE)自主开展机制可解释性研究。给定一个目标概念,代理需要设计对比探针,并在 Gemma-2-9B-IT 超过 13.1 万个特征的字典中寻找最相关的特征。在 20 个任务和 10 种代理配置中,前沿代理展现出真实的发现能力,但仍明显落后于专家基准。它们在区分目标概念与对比控制数据方面接近专家水平,但在对文
一项研究比较了两种 AI 代码编辑方式:一次性生成完整的修改文件,以及逐步生成局部搜索/替换差异。研究人员使用同一 Flutter/Dart 数据集,从头训练了一个 1 亿参数模型,并微调了一个 5 亿参数的 Qwen2.5-Coder;每个模型在约 1,790 个留出任务上进行评估。直接生成在编译和静态分析通过率、与参考代码的相似度,以及目标完成度、正确性和代码质量的盲评中,均持续优于差异生成。
DianShi-RxnDB是一个用于支持化学人工智能开发的结构化有机反应数据平台。其自动化流程从美国专利商标局和欧洲专利局于1976年至2025年发布的专利文本、图像和反应示意图中提取并规范化信息。数据库收录约2400万条反应实例,其中约1480万条通过了自动质量检查。每条记录包含反应参与物及其角色、用量、温度、反应时间、产率、实验步骤以及来源专利链接。在对1300条合格记录进行的人工评估中,字段
代理框架包括系统提示词、工具、执行钩子和上下文管理,对代理任务的成功率有重要影响。在七项企业代理任务中,自动进化的框架让较小模型以远低于前沿模型的成本取得了良好表现。但使用强模型专家的完整执行轨迹训练较弱模型后,性能反而下降了4至30个百分点。原因是较弱模型模仿了专家的规划策略,却缺乏执行该策略的能力,同时破坏了与原本依据其规划风格设计的框架之间的适配关系。研究人员提出一种在线策略纠错流程:由元级
人工智能研究代理结合已有知识、公开信息和实验反馈来产生结果。发现认证协议(DCP)将关于这些结果的主张转化为可执行的恢复测试和反馈测试。在 SQLite 优化和虚拟催化剂控制的两项受控审计中,96 个实验周期均未观察到恢复,恢复率上限为 0.0468。配对研究中,真实反馈带来了 30 次恢复,而中性策略下为零;配套的零假设校准研究也通过。一个不使用大语言模型的确定性验证器能够根据冻结证据复现判定结