AI 新闻中心

AI 新闻中心 过去一年分析了 1378 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

AstroPT 对星系的认识,以及它能为大语言模型带来什么启示

一项可解释性研究将 AstroPT 用作受控测试平台。AstroPT 是一个使用数百万张星系图像训练的 Transformer,用于检验分析大语言模型的方法。天文学提供了已知的真实基准:研究人员事先知道不同概念的学习难度及其物理关系。几乎直接编码在像素中的属性,例如波段星等,会在训练早期和较浅的网络层中变得可解码。需要推断的属性,例如红移和比恒星形成率,则在更晚阶段、更加深层的网络中出现。这一顺序

Skild AI 发布机器人基础模型 S1,称其可学习预训练未涵盖的任务

Skild AI 发布了机器人基础模型 S1。该公司称,S1 可以通过一次视频演示学习预训练阶段未出现的任务,无需额外微调或训练后处理。公司还表示,该模型能够应对最长约 10 分钟的任务。不过,发布内容没有提供独立基准测试或详细技术验证,因此这些能力目前仍属于公司声明,能否稳定实现还有待外部评估确认。

ClawProBench:通过执行轨迹、运行时覆盖率和冻结式工作场景测试评估 AI 智能体

ClawProBench 是一个通过执行轨迹而非仅凭最终答案评估 AI 智能体的基准测试。该项目基于 OpenClaw 运行时,覆盖浏览、记忆、消息、调度、技能和子智能体等工作区工具及原生功能。测试包括 102 个场景的完整配置,以及采用封闭式 JSON 输出契约的 68 个场景冻结留出集。其安全门控评分结合正确性、流程质量和效率,并保留失败证据以供审计。原生运行时任务的表现低于实时工作区任务,完

上下文分配定律:生成式搜索中的因果测量与闭环编排

该研究针对检索增强生成(RAG)的两个瓶颈:证据利用率难以准确测量,以及上下文预算分配效率低下。作者提出一种因果留一法探针,用于分离每条证据对生成答案的实际贡献。实验表明,与单纯扩展单一上下文相比,将计算资源迭代分配到多次连续生成中,可使组合召回率提升16.7至20.5个百分点,并且在参数规模最高达320亿的模型上仍表现稳定。研究还构建了一个闭环调度器,结合因果反馈和归因引导的解码机制,推动模型整

Accelerated Understanding 发布面向企业的物理 AI 模型

Accelerated Understanding 发布了一款面向企业物理应用的人工智能模型。该模型采用神经算子,公司称其在测试中曾通过单个提示处理 5 万亿个数据元素。公司由两名研究人员创立,他们此前曾被认为可能领导由杰夫·贝索斯支持的 Prometheus 项目。目前,相关性能声明尚未获得独立验证,也没有证据表明该模型已实现大规模商业应用。

量化感知修复:恢复 4 位压缩大语言模型的实用方法

研究提出了一种名为量化感知修复(QAH)的方法,用于在部署前恢复经过结构化压缩并量化为 4 位的大语言模型性能。与传统的量化感知训练不同,QAH 直接从未压缩的原始模型向 4 位学生模型进行知识蒸馏。在 GPT-OSS 120B 缩减至 60B、再转换为 MXFP4 的流程中,开放权重模型 Hypernova-60B 在 9 项基准测试中的 7 项达到或超过了 bfloat16 源模型,同时将权重

AutoResearch:输入洞察,排除幻觉

AutoResearch 是一个由两阶段组成的自主研究系统,旨在提高研究流程的可靠性。在想法生成阶段,系统整合最新研究信号与积累的领域知识,通过多模型生成和交叉评审形成可验证的研究计划。在想法执行阶段,协作智能体将计划拆分为实验,反复实施和诊断,并在接受研究结论前进行独立的循证评审。系统在跨模态检索、系统优化和机器学习等场景中取得了可量化的进展,并能检测和纠正不可靠的实验结果。在 RSICD 基准

LongWoF-Bench 评估 EvoMap Gene 在可验证长工作流任务中的表现

LongWoF-Bench 研究能否通过 EvoMap 将经过验证的执行经验整理为可复用的结构化“Gene”,以帮助模型完成复杂工作流。该基准包含 778 项可由机器验证的任务,涵盖代码生成、智能体环境合成、数学推理和规则遵循。在拥有 Claude Opus 验证执行轨迹的 252 项任务中,演化后的 Gene 在全部 7 个评测模型上均超过 Skill,优势为 8.7 至 15.5 个百分点。相

番茄、土豆和洋葱:人脸呈现攻击检测真的需要人脸吗?

一项研究探讨了人脸呈现攻击检测系统能否在不使用人脸数据的情况下,学习可迁移的检测特征。研究人员构建了受控数据集 TPO,收录番茄、土豆和洋葱的真实、打印及重放记录。基于基础模型的检测器在 TPO 上训练后,在四项标准跨数据集人脸 PAD 基准测试中取得 92.70% 的平均 AUC,优于使用合成人脸训练的模型,并接近使用真实人脸数据训练的系统。结果表明,模型学习的主要是呈现、打印和重拍过程中的共同

EXPL-FR:通过视觉语言对齐解释人脸识别模型

EXPL-FR提出了一种无需访问内部架构即可解释深度人脸识别模型的方法。研究人员使用轻量级适配器,将视觉语言模型的图像编码器对齐到冻结的人脸识别模型嵌入空间。由于图像和文本编码器共享同一空间,22个类别中的978个属性提示词可以转换为人脸识别空间中的锚点。研究通过人脸验证协议和消融实验检验这种迁移是否有效。并非所有概念都能被识别,因为人脸识别模型会丢弃身份验证不需要的因素。一个无需标签的指标筛选出

WorldToken:面向机器人模仿学习的时间优先序列建模

WorldToken是一种机器人策略架构,在每个决策步骤中将多视角图像、本体感知和任务条件融合为一个世界令牌。因果时间Transformer处理由此形成的令牌序列,扩散动作头则生成动作片段。在RoboCasa的23项任务上,一个拥有8530万参数、除冻结的预训练CLIP文本编码器外均从头训练的模型,使用每项任务2900条生成示范,取得了59.45%的平均闭环成功率。针对数据集规模、模型规模和训练随