AutoDataBench:加速自动化研究的数据中心测试平台
AutoDataBench 是一个受控测试平台,用于评估大语言模型智能体诊断、组织和改进训练数据的能力。平台固定框架、超参数和计算预算等其他因素,并通过三项任务测试数据优化。研究还考察模型能否预测数据干预的影响,而不只是依赖反复试验。将 AutoDataBench 的实验轨迹用于中期训练后,下游编程表现有所提升。代码和资源现已公开。
AI 新闻中心 过去24小时分析了 161 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
AutoDataBench 是一个受控测试平台,用于评估大语言模型智能体诊断、组织和改进训练数据的能力。平台固定框架、超参数和计算预算等其他因素,并通过三项任务测试数据优化。研究还考察模型能否预测数据干预的影响,而不只是依赖反复试验。将 AutoDataBench 的实验轨迹用于中期训练后,下游编程表现有所提升。代码和资源现已公开。
据《The Information》援引消息人士报道,Anthropic为员工慈善捐赠提供的股票配捐,在截至3月的六个月内超过6.6亿美元。消息人士称,IPO后这一金额可能达到数十亿美元,从而稀释股东持股。Anthropic近期已向潜在投资者披露财务数据,并计划上市。
OpenAI首席执行官萨姆·奥特曼表示,该公司与竞争对手Anthropic在如何监管AI的问题上仍存在根本性分歧。他认为,AI带来的益处足以让人接受一定风险。
平面图自动布置家具需要满足几何和功能约束,但真实场景数据不足仍是主要难题。一项新研究推出 AntPlan 数据集,包含 505 张真实专业建筑平面图,并对 92 类物体和十种住宅房间类型进行了密集家具标注。其系统 Architect-Ant 先通过监督微调学习专业布置模式,再利用综合布局规则的评分进行优化。研究人员称,与多种基线方法相比,该系统的几何违规率较低,功能完整度较高。生成的布局支持逐个物
循环式 Transformer 会反复执行共享模型块,并生成可用于预测下一个 token 的中间表示。LoopCD 无需辅助模型或额外训练,而是利用较早一轮的结果作为较弱的对照预测。在四种 Transformer 系列的测试中,Ouro-2.6B-Thinking 的 AIME 2024 pass@1 从 61.88% 提升至 73.33%,Huginn 的 HumanEval pass@1 从
彭博情报(Bloomberg Intelligence)称,近几个月美国人工智能企业相较中国企业的性能优势大幅缩小,降至历史新低。DeepSeek等实验室取得的进展,正对美国的技术领先地位构成挑战。
节目 Equity 讨论了特朗普政府试图重塑人工智能形象的举措。
曾警告人工智能可能强大到超出人类控制能力的Anthropic前研究员Jacob Coxon,预计将于周一在纽约市议会听证会上作证。全球一些大型AI公司的代表也将出席。
HeteroFold 可在不同系列的语言模型之间传输键值(KV)缓存,无需接收模型重新预填充共享上下文。该方法对齐模型结构,将发送方的缓存映射到接收方的表示空间并进行校准,同时保持两个模型不变。在六种传输方向上,它在全部四项长上下文基准测试和大多数短上下文设置中取得最佳结果。上下文长度为 32K 时,从 Llama-3.1-8B 到 Ministral-3-14B 的传输速度是原生预填充的 10.
本研究评估研究智能体的解释能否改善实验结果预测。研究在336个受控学习状态、12项Tox21指标和24项OpenML任务中,比较仅依据描述、加入匹配解释以及加入额外来源背景的预测。用于证明明确预测收益的预注册标准未能满足,匹配解释带来的准确率提升也未获确认。在DeepSeek V4 Pro测试中,解释卡片和背景卡片减少了Tox21的部分偏移;但Flash复测未显示点预测准确率提升。研究人员撰写的机
提取的系统提示显示,Meta 的 AI 智能体 Muse 能为用户生活中的每个人创建一个页面,包含相关事实、经历和改善人际关系的建议。已有数百万人下载这款智能体,但使用它可能带来重大的隐私代价。