VidaForge:面向视频预训练数据配方的开放研究基础设施
VidaForge 是一个用于研究视频数据配方如何影响模型预训练的开放研究基础设施。它将从原始视频到训练数据集的处理过程表示为可执行的五阶段工作流,并保留每个样本的生成来源。研究人员可以调整其中的具体决策来构建不同的数据集,而无需重新搭建整套基础设施。使用 Wan 2.1 和 V-JEPA 2.1 的实验表明,覆盖范围更广的数据配方在下游基准测试中取得了最高分,但基于损失的评估则偏好其他配方。该项
AI 新闻中心 过去一年分析了 1729 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
VidaForge 是一个用于研究视频数据配方如何影响模型预训练的开放研究基础设施。它将从原始视频到训练数据集的处理过程表示为可执行的五阶段工作流,并保留每个样本的生成来源。研究人员可以调整其中的具体决策来构建不同的数据集,而无需重新搭建整套基础设施。使用 Wan 2.1 和 V-JEPA 2.1 的实验表明,覆盖范围更广的数据配方在下游基准测试中取得了最高分,但基于损失的评估则偏好其他配方。该项
视觉生成正从通过单次调用使用的生成模型,发展为能够进行规划、选择工具、检查中间结果、修正失败并复用既有经验的智能体控制流程。该研究提出了一套分类框架,根据控制器在生成过程中能够直接做出的决策,判断系统的智能体程度。L1是条件控制,控制器只为预定生成器准备输入;L2能够选择并执行生成、编辑或渲染等实际操作;L3会观察中间结果,并调整当前任务中的后续操作;L4则利用已完成任务的经验影响未来决策。L0表
开发者已将英伟达 DLSS 5 神经渲染模型非官方移植至 M5 Pro 等 Apple Silicon 芯片,并通过 ReShade、Metal 后端和 Game Porting Toolkit 接入 Windows 游戏。在搭载 16 核 GPU 的 M5 Pro 上测试时,表面光照、环境光遮蔽和空间纵深感均有所改善。但在 1440p 分辨率下,帧率降至 2.32 FPS,输入延迟达到 240
NeoHorse-1是一组用于研究递归式自我改进的智能体模型。系统将请求路由到异构模型池,并记录能力需求、服务层级、工具调用和运行框架上下文,将其转化为训练数据。该方法结合结构验证、语义评估、课程式微调、路由引导的知识蒸馏,以及基于能力的训练数据分配。在涵盖智能体、工具使用、编程和指令遵循的11项基准测试中,4B模型的宏平均从58.94提升至64.87,9B模型则从65.60提升至69.04。这项
Dwarkesh Podcast的一项分析回顾了六年的预训练进展,并区分了数据改进与模型改进各自带来的影响。分析认为,2019年至2025年间计算效率的大部分提升来自更优质的数据,而不是模型架构的根本性进步。内容还评估了数据质量和模型开发在人工智能快速发展中的相对作用。
DriveZero是一套仅使用摄像头的端到端自动驾驶系统,旨在突破对人类驾驶日志的依赖。该系统将基于大规模视觉数据预训练的感知模型,与通过闭环强化学习训练的动作模型结合起来。DriveRL把真实驾驶日志转换为可交互环境,并通过PPO滚动训练具有特权信息的教师策略。DriveVFM则在无需任务专用标注的情况下,将DINOv3、SigLIP2、SAM和Depth Anything V2等多个冻结视觉基
三星电子已与法国人工智能初创企业 Mistral AI 签署战略合作协议。双方将结合三星的半导体技术和制造数据,以及 Mistral AI 的高效人工智能模型技术,共同开发用于半导体设计和制造的专有模型。三星计划在本地部署该模型,并逐步将其应用于半导体业务中的数据分析、缺陷预测和工艺优化。此举旨在缩短开发时间,提高制造效率和产品质量。三星电子也是 Mistral AI 30 亿欧元 D 轮融资的主
蚂蚁集团推出并开源百灵系列首个原生多模态模型 Ling-3.0-flash-VL。该模型基于混合专家(MoE)架构,总参数量为 1240 亿,但单次推理仅激活 55 亿参数;原生支持图像、文本和视频输入,上下文窗口达到 25.6 万 Token。模型引入视觉反馈闭环,可持续执行“观察、行动、验证、修正”流程,用于医疗报告解读、代码生成和 GUI 自动化等任务。蚂蚁集团称,模型在 Image-to-
OpenAI发布ChatGPT Images 2.5,称其为目前最先进的图像生成模型。官方表示,图像生成延迟最多降低50%,并新增Sketch草图参考、模板库和图片内评论标注等功能。DeepSeek宣布下调Flash系列模型价格,同时在内部测试采用新架构、原生支持多模态的V4.1 Flash中间版本。高德确认正在推进结合AI与大数据的消费场景负向预警榜单,以补充现有的正向推荐榜单。其他消息包括豆包
IT之家报道称,OpenAI 使用一款未公开模型和约1万个协作式AI智能体,在88小时内生成了纳维-斯托克斯存在性与光滑性问题的所谓证明。据称,GPT-6 Astra 进一步用 Lean 完成形式化验证。该说法尚未得到独立确认,并引发了对科学验证、数据使用和功劳归属的质疑。数学家陶哲轩还警告,如果AI无需人类深度参与就能解决重大难题,可能会对人类理解数学产生影响。此次计算成本据估计为1,500万至
多名 Claude 用户发现,即使没有使用服务,账号额度仍在快速消耗。Anthropic 表示,攻击者利用窃取的 Claude 登录会话访问用户账号,并生成未经授权的 Claude Code OAuth 令牌。公司称,部分事件可能与信息窃取恶意软件有关,这类软件会从受感染设备中盗取密码、会话数据和登录凭证。Anthropic表示,发现可疑活动后会强制用户退出登录、撤销授权,并在部分情况下退款。但其
DeepSeek 宣布,Flash 系列新价格将于 2026 年 9 月 10 日中午 12 时(北京时间)起生效。闲时价格为:输入缓存命中每百万 Token 0.02 元,输入缓存未命中 1 元,输出 4 元;高峰时段所有价格均为闲时的两倍。此次调整涉及 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp。输入缓存命中价格下调 60%,输入缓存未命中
Meta首席执行官马克·扎克伯格在《Sources》播客第二期中接受深度访谈,讨论Muse、外界对Meta数据中心的反对、公司近期与青少年安全相关的和解,以及围绕Meta智能眼镜的隐私担忧。
OpenAI 于周二宣布推出 ChatGPT Images 2.5,并加入名为 Sketch 的新功能。用户可以直接在 ChatGPT 中绘制简单草图,然后用文字说明希望系统如何将其生成图像。
麻省理工学院一名研究人员使用GPT-5.6 Sol和Codex,自主开展量子计算实验、分析结果并校准量子比特。该案例展示了人工智能在具体科研任务中的应用,但没有提供性能限制或独立验证方面的信息。