GenRouter:面向智能体图像生成的统一工作流路由
GenRouter 是一个统一多种智能体图像生成工作流的框架,可根据提示需求将任务路由至合适的处理流程。它使用基础组件和可执行模板对不同管线进行标准化,再通过需求分析、经验匹配和帕累托筛选选择配置。根据论文报告的实验结果,与计算量较大的静态管线相比,GenRouter 在提升视觉匹配度的同时,将执行成本降低了 95% 以上,延迟降低了 65%。系统还会持续积累经验,以增强零样本泛化能力,并进一步将
AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
GenRouter 是一个统一多种智能体图像生成工作流的框架,可根据提示需求将任务路由至合适的处理流程。它使用基础组件和可执行模板对不同管线进行标准化,再通过需求分析、经验匹配和帕累托筛选选择配置。根据论文报告的实验结果,与计算量较大的静态管线相比,GenRouter 在提升视觉匹配度的同时,将执行成本降低了 95% 以上,延迟降低了 65%。系统还会持续积累经验,以增强零样本泛化能力,并进一步将
R^3-Bench评估六个语言模型如何在共享预算下,将有限的计算资源分配给由六道题组成的任务集。测试涵盖数学、竞赛编程和抽象推理,并包含无工具和代理式场景。研究根据各模型处理单题时的响应曲线构建了一个经验基准。在主要结果表的72个单元中,该基准在全部单元都达到或超过竞赛平均表现,并在71个单元中更高。结果表明,模型在单题上展现出的能力,与必须在多个任务之间分配资源时实际发挥这些能力的水平之间,存在
字节跳动Seed团队与清华大学智能产业研究院(AIR)发布了CUDA Agent,这是一套通过强化学习训练大语言模型优化GPU内核的系统。该智能体运行在配备性能分析工具、正确性校验和安全沙盒的真实CUDA开发环境中。经过最多150步的PPO训练后,系统在KernelBench的250项任务中达到98.8%的通过率,生成内核中有96.8%的运行速度超过torch.compile。完整模型权重目前尚未
VibeWorlding是一套用于评估和训练多模态智能体的框架,旨在让智能体根据用户指令创建交互式3D世界。其VWE-BENCH包含2616个3D资产、323个由人工标注的初始世界,以及6828条多模态查询。VibeWorlding-Gym通过MCP工具整合资产检索、编辑和渲染,并利用基于评分标准的验证器检查物理可行性和用户意图的满足程度。实验表明,当前多模态大语言模型仍难以稳定完成这项任务;即使
MegaParts是一种用于生成复杂3D对象的自回归框架,可将对象表示为由语义部件组成的连贯结构。其向量量化形状分词器会根据几何复杂度自适应压缩部件几何,在保持重建质量的同时降低令牌数量和内存需求。语言模型在统一的结构化序列中生成对象及部件的边界框和部件形状令牌。借助最长达256,000个令牌的序列,该系统能够处理包含最多300个部件的对象。作者称,该方法的网格质量优于基准自回归模型和扩散模型,并
据彭博法律报道,谷歌以 1000 万美元收购了破产廉价航空公司精神航空的一批企业数据。数据包括自 2008 年起的 75 亿条乘客交易记录、72 亿条竞争航班定价信息、5 亿条 Microsoft Teams 聊天与协作记录、1 亿封电子邮件、3000 万行代码,以及最早可追溯至 1986 年的超过 17.5 万条员工记录。该数据集不包含个人数据和机密材料,交付谷歌前将由第三方进行匿名化处理。谷歌
谷歌在捷蓝航空破产拍卖中以1000万美元竞得一批去标识化的商业数据、软件代码和运营记录等资产。谷歌计划利用这些资料改进其人工智能模型。
Nanbeige4.2-3B 是一个拥有 30 亿参数的智能体模型,通过在第二次前向传播中复用同一组层,在不增加参数的情况下提高有效深度。研究人员在 Apple Silicon 上发现了 5 个独立问题,导致发布的 checkpoint 无法直接通过 Hugging Face Transformers 运行,包括 RoPE 缓冲区被静默置零,以及调用已移除的缓存 API。分块预填充策略使 32 G
Anthropic 解释了 Claude 新文本水印的工作原理、推出原因,以及它能够证明和无法证明的内容。
据路透社报道,字节跳动与美国电影协会(MPA)签署协议,将加强视频和图像生成 AI 模型的版权保护。协议涵盖字节跳动旗下的视频生成模型 Seedance 和图像生成模型 Seedream,这些模型目前通过 TikTok、CapCut 和 Dreamina 等应用提供服务。字节跳动表示,新版本模型已加入更强的知识产权保护机制。双方称,随着 AI 持续发展,将继续完善版权保护措施。
AI 公司的大宗采购意外提振了二手书店的销售。这些公司正在寻找合法取得的书籍,将其扫描后用于训练 AI 模型。二手书因此出现新的需求,但部分书籍可能在扫描完成后被销毁。
一项研究考察了人工智能模型推理轨迹中哪些行为与正确答案相关,以及面向推理的训练是否会放大这些行为。研究人员分析了15个模型在6个文本和视觉语言基准测试中的15,282条标注轨迹,发现了“放大—提升差距”:思考模型显著增强了自我纠错、假设检验和承认不确定性,但这些行为并不是正确性的最佳指标。置信度校准、知识一致性和自我意识与正确答案的关联更强,却几乎没有被放大。研究结果表明,训练目标应奖励经过校准且
据报道,亚马逊正在大量购买纸质书籍,扫描内容用于训练 AI,并在处理过程中销毁原书。404 Media 的调查人员将苹果 AirTag 藏入一批珍贵书籍的货件,追踪至亚马逊位于拉斯维加斯的仓库。员工称,为提高扫描效率,他们会先切掉书脊。Anthropic 此前也被披露实施过名为“巴拿马计划”的类似项目。在一起版权诉讼中,法官裁定这类扫描属于合理使用。但批评者担心,稀有书籍可能因此从公共收藏中消失,
获唐纳德·特朗普支持的World Liberty Financial正与总部位于香港的人工智能平台WorldClaw展开合作。据路透社报道,WorldClaw提供的90个AI模型中,有43个由曾被美国当局或安全官员列为潜在风险的中国实体开发。
ParliamentRAG 是一个面向意大利众议院会议记录的检索增强生成(RAG)系统,旨在解决三个问题:过度突出发言最频繁的人、无法根据议题评估发言者的专业性,以及在政治敏感文本中错误归属引文来源。系统根据用户查询,结合职业、教育背景和历史发言等可解释因素,估算发言者与当前议题相关的权威性。它会检索相关发言片段,从不同议会党团中识别相关专家,并生成附带引文的摘要。在涵盖15个政策议题、与 Goo