AI 新闻中心

AI 新闻中心 过去24小时分析了 161 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

AutoDataBench:加速自动化研究的数据中心测试平台

AutoDataBench 是一个受控测试平台,用于评估大语言模型智能体诊断、组织和改进训练数据的能力。平台固定框架、超参数和计算预算等其他因素,并通过三项任务测试数据优化。研究还考察模型能否预测数据干预的影响,而不只是依赖反复试验。将 AutoDataBench 的实验轨迹用于中期训练后,下游编程表现有所提升。代码和资源现已公开。

Architect-Ant:可编辑的建筑平面图自动家具布置

平面图自动布置家具需要满足几何和功能约束,但真实场景数据不足仍是主要难题。一项新研究推出 AntPlan 数据集,包含 505 张真实专业建筑平面图,并对 92 类物体和十种住宅房间类型进行了密集家具标注。其系统 Architect-Ant 先通过监督微调学习专业布置模式,再利用综合布局规则的评分进行优化。研究人员称,与多种基线方法相比,该系统的几何违规率较低,功能完整度较高。生成的布局支持逐个物

几乎不增加成本,提升循环式 Transformer 的解码效果

循环式 Transformer 会反复执行共享模型块,并生成可用于预测下一个 token 的中间表示。LoopCD 无需辅助模型或额外训练,而是利用较早一轮的结果作为较弱的对照预测。在四种 Transformer 系列的测试中,Ouro-2.6B-Thinking 的 AIME 2024 pass@1 从 61.88% 提升至 73.33%,Huginn 的 HumanEval pass@1 从

异构 LLM 系列间无需预填充的 KV 缓存传输

HeteroFold 可在不同系列的语言模型之间传输键值(KV)缓存,无需接收模型重新预填充共享上下文。该方法对齐模型结构,将发送方的缓存映射到接收方的表示空间并进行校准,同时保持两个模型不变。在六种传输方向上,它在全部四项长上下文基准测试和大多数短上下文设置中取得最佳结果。上下文长度为 32K 时,从 Llama-3.1-8B 到 Ministral-3-14B 的传输速度是原生预填充的 10.

衡量预测贡献:科学解释能为实验预测带来什么

本研究评估研究智能体的解释能否改善实验结果预测。研究在336个受控学习状态、12项Tox21指标和24项OpenML任务中,比较仅依据描述、加入匹配解释以及加入额外来源背景的预测。用于证明明确预测收益的预注册标准未能满足,匹配解释带来的准确率提升也未获确认。在DeepSeek V4 Pro测试中,解释卡片和背景卡片减少了Tox21的部分偏移;但Flash复测未显示点预测准确率提升。研究人员撰写的机