OpenAI 推出 Codex 专用插件,可用自然语言制作 Game Boy 风格游戏
OpenAI 在开发者活动中宣布推出 Game Studio,将其 AI 智能体工具 Codex 接入 ModRetro 的复古掌机 Chromatic。用户可以用自然语言描述游戏需求,由 Codex 协助生成程序代码。插件内置 Chromatic 模拟器,开发者可先在电脑上测试,再将游戏串流到实体设备。完成后的游戏可写入专用卡带或空白卡带,并在掌机上运行。
AI 新闻中心 过去24小时分析了 215 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI 在开发者活动中宣布推出 Game Studio,将其 AI 智能体工具 Codex 接入 ModRetro 的复古掌机 Chromatic。用户可以用自然语言描述游戏需求,由 Codex 协助生成程序代码。插件内置 Chromatic 模拟器,开发者可先在电脑上测试,再将游戏串流到实体设备。完成后的游戏可写入专用卡带或空白卡带,并在掌机上运行。
LEGO-Anything 是一个图像到代码框架,编程智能体会迭代编写、执行、检查和修改 Blender 代码,从单张图像生成可编辑的场景程序。新的 LEGO-Bench 评估生成场景的有效性、可见表面几何结构和渲染外观。在受测智能体中,GPT-6-astra 的综合表现最佳,但在准确恢复场景几何与外观方面仍存在明显差距。无需训练的 LEGO-Plugin 使全部六个模型的综合相对得分最高提升 6
LIFT 是一种可控的图像到视频生成框架,将相机控制与未来布局控制结合起来。用户可以指定未来视角中应出现的内容及其位置,尤其是最终帧的场景布局。现有方法通常只能控制相机运动轨迹,而文本提示对未来内容和空间布局只能提供粗略指导。LIFT 采用策略内自蒸馏,将使用逐帧密集布局训练的教师模型能力迁移到仅以最终帧布局为条件的学生模型中。研究人员还构建了 LIFT-Vista 数据集,其中包含大幅视角变化以
WorldLine是一种用于机器人学习的视觉模拟器,可在实际执行前预测动作结果。该系统利用超过1万小时的无动作机器人视频学习操作动力学,并通过来自十多种机器人形态的超过2000小时动作轨迹进行动作对齐。基于图像空间的动作表示为不同机器人提供了统一控制接口。在留出数据和分布外场景中,WorldLine使失败轨迹的机器人掩码IoU较最强基线提高0.1626,并以74%的平均准确率预测轨迹是否成功。在未
EVO-WAM无需收集额外的专家示范,也无需在外部环境中执行候选动作,即可将世界动作模型适配到新的机器人任务。该方法利用视觉语言模型筛选能够完成任务的视频片段,并通过逆向动力学模型验证视频与对应动作是否一致。在RoboTwin 2.0的七项未见任务中,Cosmos3的平均成功率从26.9%提高到68.0%,DreamZero则从28.5%提高到46.4%。在真实世界的三项未见长时程复合任务中,Co
LongLive-Plug 是一种蒸馏框架,可在基础模型上以 LoRA 适配器的形式训练可复用能力,包括少步采样、可控的无分类器引导,以及自回归长视频生成中的误差校正。研究人员称,该方法无需额外训练即可部署到 54 个下游模型,覆盖三类骨干模型系列和八种任务类别。
这项研究发现,Critic 的两种失效模式可能导致大语言模型的 PPO 训练不稳定:在 Actor 和 Critic 训练中都排除被截断的 rollout,以及不同提示词之间的回报噪声分布不均。EasyPPO 通过仅对 Actor 筛除过长 rollout、按噪声水平加权 Critic 回归损失,并缩小 Critic 的小批量规模来应对这些问题。在编程、数学推理和多轮搜索测试中,EasyPPO 在
据 404 Media 报道,数百名受雇于微软的合同工能够查看用户上传的照片、发送给 Copilot 的原始提示词,以及 AI 生成的编辑结果。这些人员据称负责评估 AI 生成内容的质量,而不是传统意义上的内容审核。一名合同工表示,照片中的人脸没有经过模糊处理,部分提示词涉及性内容,且存在疑似未经同意的素材。微软隐私常见问题称,图片用于 AI 训练前会对人脸等信息进行模糊处理,但这一说明是否完全适
总统还签署了一项行政命令,要求其政府将人工智能称为“超级智能”。
中国科技和硬件类股正面临季度最差表现。7月的大幅抛售源于市场担忧,认为人工智能企业可能难以证明其高估值合理,也难以支撑高额支出。
HiRAE是一种分层自编码器,融合视觉编码器各层级的表征,以提升图像重建质量,同时保持与生成模型的兼容性。该方法以最深层表征为锚点加入残差修正,并为较浅层级设置更严格的预算,限制修正幅度。HiRAE-24保留了潜在标记数量和通道维度。在ImageNet-256上,相比RAEv2,其重建FID从0.299降至0.209。在文生图任务中,HiRAE-24还在GenEval、DPG-Bench和GenA
一项研究表明,准确的预测和未发生坍塌的表征,并不能保证潜在世界模型具有与任务一致的规划几何结构。研究人员提出 AnisoWM 和 ΛReg,用具有固定迹和各向异性约束的可学习对角协方差,替代固定的各向同性高斯正则化。预测目标、预测器架构和欧氏规划器均保持不变。在四个视觉控制环境中,AnisoWM 的规划成功率均高于 LeWorldModel,其潜在规划成本也与实际任务结果更加一致。
研究人员提出了Grounded Entity Biographies(GEB),一种用于回答超长视频问题的框架。GEB将同一物理对象在不同视频片段中的视觉定位观测连接起来,构建可检索的对象“传记”,同时保留每个时刻的上下文。在问答过程中,系统会将该传记与事件证据一同检索,从而跟踪对象在长时间事件序列中的经历。在四个基准测试中,包括持续一天和一周的录制内容,GEB均优于此前的视频记忆框架。在EgoL
DeepSeek 开源了面向华为昇腾 AI 加速平台的基础设施组件,包括 TileLang 编译工具以及计算和通信库,与此前面向英伟达平台发布的组件相对应。套件涵盖矩阵运算、跨设备通信、向量处理和稀疏注意力等工具。DeepSeek 表示,其模型训练中使用的每个 TileLang 算子都有昇腾高性能实现;在多项关键测试中,这些组件的性能已接近硬件上限。
SentZero 是一种用于胸部 X 光零样本分析的视觉语言预训练框架。它利用大型语言模型对放射科报告进行句子级结构化,以增加训练配对的多样性,并减少对比学习中的假阴性。此外,该方法会根据每个句子的语义调整视觉特征。研究人员报告称,SentZero 在多项下游任务和数据集上提升了零样本泛化能力。