像素空间文本到图像扩散模型训练的实证研究
本文研究大规模像素空间文本到图像扩散模型的训练方法。作者发现,直接在像素空间进行预训练的收敛速度明显慢于潜在空间训练。因此,他们提出先在潜在空间高效学习生成先验,再在后训练阶段切换到像素空间的策略。研究系统分析了权重初始化、数据组成、预测目标、解码器架构和噪声调度等关键设计。结果表明,该方法生成的像素空间模型能够达到或超过潜在空间模型的性能,同时将端到端推理速度提升约3.18至4.75倍。
AI 新闻中心 过去7天分析了 917 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
本文研究大规模像素空间文本到图像扩散模型的训练方法。作者发现,直接在像素空间进行预训练的收敛速度明显慢于潜在空间训练。因此,他们提出先在潜在空间高效学习生成先验,再在后训练阶段切换到像素空间的策略。研究系统分析了权重初始化、数据组成、预测目标、解码器架构和噪声调度等关键设计。结果表明,该方法生成的像素空间模型能够达到或超过潜在空间模型的性能,同时将端到端推理速度提升约3.18至4.75倍。
第三方机构Signal65公布了搭载高通骁龙X2 Elite Extreme、英特尔酷睿Ultra X9 388H和AMD Ryzen AI 9 465的笔记本对比结果。在电池供电的平衡模式下,骁龙芯片在Geekbench 7.0多核测试中分别比英特尔和AMD快53%和83%。在Cinebench 2026多线程渲染测试中,其速度比两款竞品都快87%。Procyon AI计算机视觉测试显示,骁龙的
OpenAI为ChatGPT macOS桌面应用新增“计算机历史”功能。该功能采用主动选择加入机制,会将用户在电脑上的操作记录为事件,并整理成ChatGPT和Codex可以参考的时间线。它可用于查找最近编辑的文档、确认文件是否通过Slack共享、总结早上的电脑活动,以及为未完成的任务提供自动化建议。用户可以排除特定应用程序和网站,也可以删除已有记录。OpenAI表示,系统会自动忽略无痕浏览或私人浏
ClawGym II 提出了一套框架,用于通过复杂且不透明的智能体框架,对通用 AI 智能体进行稳定、可扩展的强化学习优化。该系统利用沙盒隔离任务环境并支持并行执行,通过服务代理捕获模型调用,再以前缀树重建多轮轨迹,同时适配 PPO 和 GRPO。使用 Qwen3-30A3B 时,ClawGym-Bench 的 Pass@1 在 OpenClaw 和 Claude Code 上分别提升 9.98
GenRouter 是一个统一多种智能体图像生成工作流的框架,可根据提示需求将任务路由至合适的处理流程。它使用基础组件和可执行模板对不同管线进行标准化,再通过需求分析、经验匹配和帕累托筛选选择配置。根据论文报告的实验结果,与计算量较大的静态管线相比,GenRouter 在提升视觉匹配度的同时,将执行成本降低了 95% 以上,延迟降低了 65%。系统还会持续积累经验,以增强零样本泛化能力,并进一步将
R^3-Bench评估六个语言模型如何在共享预算下,将有限的计算资源分配给由六道题组成的任务集。测试涵盖数学、竞赛编程和抽象推理,并包含无工具和代理式场景。研究根据各模型处理单题时的响应曲线构建了一个经验基准。在主要结果表的72个单元中,该基准在全部单元都达到或超过竞赛平均表现,并在71个单元中更高。结果表明,模型在单题上展现出的能力,与必须在多个任务之间分配资源时实际发挥这些能力的水平之间,存在
华硕表示,搭载英伟达 RTX Spark 平台的 ProArt P16 和 P14 首批产品已被渠道合作伙伴全部预订。公司称两款笔记本的预售需求远超预期,并将继续向合作伙伴追加订单。不过,华硕没有公布首批配额、预订量或追加订单的具体数量,因此无法据此判断实际销售规模。两款产品采用 Blackwell 架构 RTX GPU,最高配备 128GB 统一内存,宣称可提供最高 1 PFLOPS 的 AI
字节跳动Seed团队与清华大学智能产业研究院(AIR)发布了CUDA Agent,这是一套通过强化学习训练大语言模型优化GPU内核的系统。该智能体运行在配备性能分析工具、正确性校验和安全沙盒的真实CUDA开发环境中。经过最多150步的PPO训练后,系统在KernelBench的250项任务中达到98.8%的通过率,生成内核中有96.8%的运行速度超过torch.compile。完整模型权重目前尚未
Reddit正在测试一项AI功能,可将文字帖子和部分评论自动转换为音频、视频内容。AI语音会朗读原帖及评论,对应文字则会同步高亮,视频还会标注其为AI配音的真实对话。测试中,一篇发布于8年前、讨论公路旅行中适合成年人玩的游戏的帖子,被改编成约3分钟的视频。用户可以在传统阅读模式和播放模式之间切换。这项功能可能降低不熟悉论坛形式的用户获取内容的门槛,但也可能带来发音错误、评论引用不准确等问题。此次测
据《纽约时报》报道,低质量 AI 生成内容正在搜索引擎、电商平台和社交媒体上泛滥,包括虚假食谱、商品页面上的假传记、重复图片以及大量机器生成的音乐。Spotify 去年删除了 7500 万首疑似垃圾曲目;领英推出举报工具,YouTube 则在半年内移除了约 13 万个低质量频道。各平台正尝试识别异常快速上传、重复模板等协同滥用模式,而不是逐条审核内容。TikTok 已为数十亿条 AI 生成视频添加
韩国已将由 Motif Technologies Co. 牵头的团队淘汰出主权人工智能竞赛。经过此次筛选,这场竞赛目前只剩下三组参赛者。
一项分析研究探讨了由大型语言模型驱动的智能体人工智能系统,其不断扩展的认知能力可能如何影响人类的主体性、自主性和控制能力。研究提出了一个涵盖物理认知、社会认知和自我指涉认知的三层框架,并评估每个层级的潜在风险。同时,研究提出了相应的缓解策略,以提升智能体人工智能系统的可控性和长期安全性。
VibeWorlding是一套用于评估和训练多模态智能体的框架,旨在让智能体根据用户指令创建交互式3D世界。其VWE-BENCH包含2616个3D资产、323个由人工标注的初始世界,以及6828条多模态查询。VibeWorlding-Gym通过MCP工具整合资产检索、编辑和渲染,并利用基于评分标准的验证器检查物理可行性和用户意图的满足程度。实验表明,当前多模态大语言模型仍难以稳定完成这项任务;即使
Counterpoint预计,未来五年将有超过1.3亿颗采用先进芯片与内存封装技术的GPU和AI ASIC出货,并可能创造近2万亿美元的计算收入。报告指出,随着行业努力突破内存、性能和“铜墙”等物理限制,封装技术已成为新的竞争战场。台积电在大规模生产、技术成熟度以及基于JEDEC标准的生态系统方面仍占据优势,但其在HBM领域对高成本CoWoS硅中介层的依赖,也为替代方案带来机会。英特尔将EMIB、
美团启动2027届校园招聘,面向2026年11月至2027年10月毕业的海内外应届生,开放技术、产品、商业分析、运营、零售和销售等10大类、100余种岗位,覆盖中国及海外多个城市。今年新增AI全栈工程师、AI产品经理和智能商业分析师等AI相关岗位。超过80%的岗位描述明确提出AI能力要求。美团表示,希望招聘具备“AI Native”思维、能够借助AI解决问题并提升协作和服务效率的人才。公司将提供A