WebWorld:将浏览器作为自我改进网页代码的世界模型
WebWorld解决了视觉语言模型(VLM)自动改进网页代码时的一个结构性问题:同一个模型既提出修复方案,又负责评判,而视觉上的合理性并不能说明网页确实可用。该系统将浏览器作为世界模型,以确定性、可执行的方式模拟HTML在用户操作下的行为。VLM生成批评意见,规划器将其编译为类型化交互契约。浏览器重新执行候选结果,只有在实现目标进展且保留所有此前验证过的功能时,才会颁发接受证书。监督微调只使用经过
AI 新闻中心 过去一年分析了 1733 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
WebWorld解决了视觉语言模型(VLM)自动改进网页代码时的一个结构性问题:同一个模型既提出修复方案,又负责评判,而视觉上的合理性并不能说明网页确实可用。该系统将浏览器作为世界模型,以确定性、可执行的方式模拟HTML在用户操作下的行为。VLM生成批评意见,规划器将其编译为类型化交互契约。浏览器重新执行候选结果,只有在实现目标进展且保留所有此前验证过的功能时,才会颁发接受证书。监督微调只使用经过
LightNav-0 是一种用于具身机器人导航的紧凑型通用模型。它利用预训练视觉语言模型(VLM)的空间能力,并将其与机器人控制对齐,无需针对具体任务设计预测头。统一的标记接口用于表达空间意图,并将其转换为适配不同机器人形态的轨迹。该模型支持指令跟随、开放词汇目标导航和视觉跟踪。训练数据涵盖 2,000 多个场景和 4,000 多小时的具身导航数据。研究人员称,LightNav-0 在全部 10
该研究分析了大语言模型和视觉语言模型智能体在多智能体社交环境中的策略性欺骗行为。研究人员推出了 MineAmongUs,这是一个受《Among Us》启发的3D沙盒环境,要求内鬼智能体通过语言和身体行动欺骗船员。他们还提出了可配置的智能体测试框架 ARIA,用于分析不同认知组件,并建立了详细的欺骗行为标注体系。实验表明,VLM智能体会结合语言和非语言策略,以内鬼身份争取胜利。在不同框架配置和多种V
中国科学院大连化物所联合科大讯飞、阿里云等机构,于8月31日发布被称为中国首个化工行业大模型的最新版本“智能化工大模型3.0 Pro”。该系统旨在从专业知识问答扩展到化工任务的规划、执行和验证。其技术架构由大模型、智能体、专业技能与工具,以及应用场景四部分组成。在化工领域多维测评中,文本问答准确率为81.96%,多模态问答准确率为80.75%。发布方表示,与前代3.0版本相比,综合得分分别提升了2
MiniMax已将视频和音频生成模型H3Max的768P与480P版本接入开放平台和Design系统。公司及生态合作伙伴称,模型可在3秒内生成一段5秒的768P视频。开发者已将其用于持续生成和实时推流等场景,包括在Twitch上搭建实时生成视听内容的直播项目。MiniMax还公布了较快的商业增长:2026年上半年营收约1.17亿美元,企业和开发者业务约占经常性收入的80%。今年7月,公司通过配售股
一项新研究提出图像组合(Image Bundle Composition,IBC)范式,旨在从大规模、无结构的照片库中动态组成具有连贯关系的图像集合,而不是单独对每张图像进行排序。研究团队构建了IBCBench基准数据集,包含109,467张图像和667个经过验证的查询。其BundleWeaver框架利用大语言模型自适应地寻找缺失的关系角色,并通过视觉语言模型验证完整的图像集合。实验表明,现有嵌入
研究人员提出了 Verification-Aware Training(VAT),一种用于提升大语言模型推测解码性能的插件式训练方法。VAT在训练过程中模拟顺序验证流程,并将每个位置的接受与拒绝模式转化为监督信号。该方法结合轻量级验证头,以及在首次拒绝位置后重新开始权重衰减的自适应加权机制。VAT只修改训练目标,无需改变草稿模型架构、目标模型或推理流程。在EAGLE-3和DFlash搭配Qwen3
科大讯飞全资子公司词元星火宣布推出并开源两款面向端侧设备的通用人工智能模型:星火X2.5-4B和星火X2.5-1.7B。公司表示,两款模型原生支持最长达100万Token的上下文窗口。这一能力有望让更小型的设备在本地或离线环境中处理长文本、大量数据以及长期复杂任务。不过,公告未提供独立基准测试结果,也未公布具体硬件需求。
腾讯混元团队发布了Hy4 Preview轻量版。这款混合专家(MoE)语言模型总参数量达7700亿,通过Sherry稀疏三值量化算法和MIX-STQ1_0混合精度策略,将模型权重从接近1.5TB压缩至约214GB。在长文理解等主要任务上,轻量版整体保持稳定表现;MCP Atlas得分从83.7降至83.2,SWE-Bench Multi从82.9降至81.3。腾讯与prima.cpp的测试显示,使
研究人员提出了归一化低秩适配(NoRA),旨在提升 LoRA 训练的稳定性和效果。NoRA 可在训练过程中,或仅在初始化阶段,对下投影矩阵进行归一化。作者表示,该方法在预训练、监督微调和强化学习中能够加快收敛、提升性能与训练稳定性,并缓解灾难性遗忘。NoRA 不需要增加可训练参数,也不会带来额外的推理计算。
DreamX-Creator 1.0 是一套可联合生成视频和音频的紧凑型系统。其 70 亿参数生成器先分别处理视觉与音频流,再通过带门控的跨模态注意力机制进行耦合。系统采用经过筛选的时序一致多模态数据、渐进式联合训练,以及利用模态感知反馈的强化学习。针对 2K 输出,团队设计了一个精炼流程,将模型压缩为每个时间片段只需进行一次去噪评估。开发团队公开了 7B 生成器和 2K 精炼器,以支持统一音视频
潜在生成模型通常采用两阶段训练:先用变分自编码器学习重建,再在冻结的潜在空间中训练生成模型。研究人员指出,为重建优化的潜在表示不一定适合生成。分析表明,KL 散度目标中的熵项对于防止潜在空间坍塌至关重要,同时重建的学习速度更快、监督更强。GenFirst 因此先通过生成目标塑造潜在空间,再逐步加强重建,以恢复视觉细节。在 ImageNet-256 上,SiT 使用 CFG 时取得 0.97 的 g
Matrix-Game 3.5是一种用于实时生成持久虚拟环境的交互世界模型。新版本引入结合Patch Memory与tiled-PRoPE的几何感知记忆框架,将静态场景几何与动态主体分开建模,并通过两阶段渐进式蒸馏实现快速因果生成。这些改进旨在提升长时间场景记忆、精准摄像机控制、主体一致性和提示词驱动的世界生成能力。模型使用来自Unreal仿真环境、开放世界游戏和互联网视频的数据进行训练,研究团队
NavMCP将负责高层推理的视觉语言模型与负责闭环执行语义子目标的导航基础模型结合起来。意图、观测和记忆三个通道使系统能够决定需要寻找哪些证据,将导航过程转化为有依据的轨迹信息,并在多次调用之间保存发现、否定性证据和未解决目标。该方法无需重新训练任一模型,就能把孤立的导航回合转变为持续的具身交互。NavMCP在HM-EQA、MT-HM3D和EXPRESS-Bench上取得当前最佳结果,在HM-EQ
该研究介绍了 Qwen3.8-Flash-Next,这是一个拥有 1250 亿参数的稀疏混合专家模型,每个 token 仅激活 60 亿参数。在 14 项预训练基准测试中,该模型有 8 项超过前代 397B-A17B,其余测试最多落后 2.6 分;同时,激活参数和训练 token 数降至三分之一,训练 FLOPs 约为九分之一。其架构结合了 Gated DeltaNet、全局注意力、Qwen Sp