传OpenAI已完成万亿参数级“Bel”模型预训练
多名未具名科技消息人士称,OpenAI已完成代号“Bel”的基础模型预训练,参数规模据称达到约10万亿。该模型被描述为“Doug”的后继者,在编程、推理和长时程智能体任务方面超过“Astra”,并可自主运行数日、自我恢复以及协调数百个并行子智能体。消息还称,它可能在今年年底前或“Astra”发布后数月内亮相。但OpenAI尚未官方确认模型名称、参数规模或性能,相关说法也没有独立证据支持。
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
多名未具名科技消息人士称,OpenAI已完成代号“Bel”的基础模型预训练,参数规模据称达到约10万亿。该模型被描述为“Doug”的后继者,在编程、推理和长时程智能体任务方面超过“Astra”,并可自主运行数日、自我恢复以及协调数百个并行子智能体。消息还称,它可能在今年年底前或“Astra”发布后数月内亮相。但OpenAI尚未官方确认模型名称、参数规模或性能,相关说法也没有独立证据支持。
Poor Lab 发布了 Puro-2B,这是一套旨在降低消费级硬件语言模型预训练成本的开源方案。研究团队使用 RTX 5090 GPU、FP8 精度和最多 1.4 万亿个 token,从零训练了多个 Puro-2B 模型。根据团队的评测流程,最佳模型以低于 6,900 美元的训练成本,取得了接近 Qwen2.5-1.5B 的性能。成本扩展分析显示,约 4,400 美元可能足以达到 Qwen2-1
LayerRecall是一种面向自回归视频扩散模型的状态条件、分层选择式记忆路由器。它检索相关的历史键值状态,仅将其注入对长程记忆敏感的网络层,同时在其他位置保留局部注意力。其跨时域预测匹配方法利用拥有完整长上下文的参考信息训练有限记忆路由器,减少对显式记忆分配标注的依赖。在100个多镜头提示的评测中,LayerRecall在MemoBench和MovieBench上取得最佳综合结果,在VBenc
EASEL 是一项用于评估多模态智能体在闭环环境中精确使用视觉工具能力的新基准。核心任务要求智能体逐步在数字画布上作画,使结果匹配参考图像,同时测试区域标注、手写和路径规划。EASEL-Data 包含 44 万条训练样本。基于该数据训练的 EASEL-9B 相比基础模型取得 6.3% 的相对提升,在 25 个受测模型中排名第三。不过,结果表明当前多模态智能体仍存在明显不足:图像重建相似度较低,动作
科大讯飞计划于9月1日开源星火X2.5-4B和星火X2.5-1.7B两款端侧通用模型。两款模型均原生支持最长100万token的上下文窗口,并重点提升智能体交互、数学计算和基础通用理解能力,面向车载终端、智能硬件及其他联网设备。公司还计划于9月7日发布参数规模达2930亿的星火X2.5基座模型,进一步升级代码生成和智能体协同能力。此外,科大讯飞表示将在后续推出一款基于全国产算力的新主力通用大模型。
中国信通院人工智能研究所发布的测试报告称,StartLux-V1.0-27B-Preview 在面向 AI 智能体的 MCP 基准测试中取得综合第二名。该模型拥有270亿参数,据称超过了参数规模更大的 DeepSeek 和 Step 模型,并在位置导航、浏览器自动化和金融分析等任务中与 DeepSeek-V4-Pro 持平或取得更好成绩。StartLux 以 Qwen3.6-27B 为基础,采用自
J-Zero 是一种无需额外训练数据、用于推动语言模型自我改进的框架。Challenger 生成难度不断增加的任务,Solver 学习给出质量更高的回答;与此同时,Judge 根据回答的生成方式,利用顺序预先确定的偏好对进行自适应。作者报告称,与基线方法相比,J-Zero 在可验证领域平均提升 4.2 分,在不可验证领域提升 8.0 分。J-Zero 至少持续迭代改进了十轮,而基线方法在两轮后出现
腾讯表示,混元 Hy4preview 于8月28日接入 WorkBuddy 后,凭借升级的 Agent 能力引发较高需求。上线首日出现任务排队,公司随后紧急扩容 Hy4preview 推理集群,并将继续动态调配资源。腾讯同时提醒,在调用集中于高峰时段时,仍可能再次出现短时等待。作为过渡措施,Hy3 等既有模型的 WorkBuddy 限时免费权益延长至2026年9月30日。公告未披露具体使用量,也未
StepGuard是一种面向大语言模型代理的防护模型,既能审计已完成的代理执行轨迹,也能在工具操作执行前检查潜在风险。研究团队使用StepGen自动生成安全和不安全的轨迹:两者拥有相同上下文,但在风险步骤采取不同操作。为减少过度防御和防御不足,研究人员还提出了Balance-GRPO,根据观测到的准确率动态平衡安全与不安全操作的学习。实验显示,StepGuard在开放权重防护模型中取得最高平均准确
ABot-Recon 是一种从超长视频中进行三维场景重建的流式模型。它不维护庞大的长期记忆,而只缓存前 11 帧的键值特征。模型在当前相机坐标系中预测点图,并估计相邻帧之间的相对位姿,再通过序列组合恢复全局相机位姿和场景几何。轻量级时间细化器用于减少旋转漂移,考虑组合过程的位姿损失则用于训练多步位姿组合。在 Oxford Spires 基准测试中,ABot-Recon 的绝对轨迹误差为 4.35
该研究提出了 VLAct,一种面向视觉语言动作(VLA)系统的视觉语言模型骨干。VLAct 使用来自多种机器人形态的异构机器人数据进行持续预训练,在保留视觉语言模型通用知识的同时,促进跨机器人形态的共享动作语义。在固定机器人数据量和微调预算下,VLAct 在仿真、真实环境任务以及向未见机器人形态迁移时均提升了性能。它在 LIBERO-Plus 和 RoboTwin 2.0 上分别取得 82.6%
该研究提出了 Rubric-to-Code Credit Assignment(RCCA),一种面向强化学习的框架,用于让模型根据自然语言需求生成可用的 HTML、CSS 和 JavaScript 应用。RCCA 不再将单一的序列级奖励平均应用于所有 token,而是把功能反馈对应到相关代码区域和生成 token。其分层奖励机制区分格式、源代码、运行时和功能错误。Ling-RCCA-Flash 在
GeoNeXt重新利用预训练视频生成模型,从单张图像中联合估计深度和表面法线。该方法将几何估计定义为下一帧预测任务,从而利用视频模型中结构化的视觉先验,并以远少于以往方法的标注数据学习图像与几何信息之间的关系。在多个数据集上的实验表明,GeoNeXt在零样本单目深度和表面法线估计方面优于以往的任务专用型和统一型生成方法。它的性能还接近使用超过百倍数据训练的判别式先进方法,并在多个基准测试中超过这些
PonderPounce 将多模态大语言模型(MLLM)的原生因果上下文用作机器人控制的情景记忆。系统结合了 Ponder 和 Pounce:前者是较慢的 System 2 MLLM,负责积累观测、示范和此前的推理;后者是快速的视觉—语言—动作模型,直接根据当前观测生成动作。两者端到端联合训练,无需专用记忆模块或单独的桥接预训练。经过服务优化后,系统支持 20Hz 的动作执行。在 RoboMME
该研究提出“Code-as-World”,将物理世界表示为可执行代码。代码以紧凑、可控且具有定量依据的方式描述物体构成、动态变化和视觉外观。系统通过一个智能体循环,依据自然语言描述或现实世界视频等多模态观测,提出、执行、渲染、验证并反复改进世界假设。经过验证的可执行世界表征可作为可扩展的监督信号,用于训练视觉语言模型进行定量物理推理。研究人员表示,Code-as-World-VL在QuantiPh