端到端智能体审计引擎
A^2E 是一款面向智能体运行框架的端到端评估引擎。其智能体任务协议支持将评估任务快速接入不同框架,并通过自动插桩的监控器采集标准化执行轨迹。系统不只评估正确性,还从执行效率、工具使用、任务规划和错误恢复等多个维度衡量框架能力。实验表明,模型与框架的组合在不同任务类型上的表现差异明显,没有任何组合能在所有任务中持续领先。相关代码已在 GitHub 开源。
AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
A^2E 是一款面向智能体运行框架的端到端评估引擎。其智能体任务协议支持将评估任务快速接入不同框架,并通过自动插桩的监控器采集标准化执行轨迹。系统不只评估正确性,还从执行效率、工具使用、任务规划和错误恢复等多个维度衡量框架能力。实验表明,模型与框架的组合在不同任务类型上的表现差异明显,没有任何组合能在所有任务中持续领先。相关代码已在 GitHub 开源。
RynnValue 是一个面向机器人操作的开源价值基础模型。它不依赖偏好或进度标注,而是使用时间距离,即从观测结果到语言指定目标的有向代价。这使模型能够利用超过 7,000 小时数据和约 300 万个指令条件视频片段进行训练。在 RBM-EVAL-OOD 基准测试中,RynnValue 的 Kendall tau_a 达到 0.675,超过完全使用偏好监督的方法(0.655)。将其转换为密集奖励后
Macaron-V1 是一个开放式智能体模型系列,旨在从真实环境中的经验学习,并在部署后持续适应。其架构冻结基础模型,组合用于聊天、智能体任务、编程和 GenUI 的专用 LoRA 适配器,并在每轮用户交互中选择一个适配器。旗舰版本 Macaron-V1-Venti 使用 7440 亿参数的 GLM-5.2 基础模型;基于 500 亿参数 Qwen3.6 的 Macaron-V1-Tall 则面向
腾讯开源了 BrowserSkill,一款专为 AI 智能体设计的浏览器自动化工具。它支持复用用户已有的浏览器登录状态,并在独立窗口中执行任务,从而减少重复验证,也不影响用户当前的浏览或沟通。BrowserSkill 提供 bsk 命令行接口,计划兼容 Claude Code、Codex 以及腾讯 Workbuddy 等智能体。演示场景包括搜索和总结网络内容、分析高互动评论等。该工具采用 CLI
Meta于8月10日发布开源模型Muse Glimmer。该模型拥有300亿参数,是此前封闭模型Muse Spark的开放版本,模型权重采用Apache 2.0许可证,开发者可下载、修改和微调。Glimmer面向多步骤代理任务,支持调用工具、编写和调试代码、处理文件及屏幕截图,并执行扩展工作流。模型支持文本和图像,训练覆盖100多种语言,设计为可在配备单块消费级GPU的Mac或PC上本地运行。Me
Meta在人工智能领域落后于多家竞争对手。首席执行官马克·扎克伯格认为,新的开放模型可能为公司提供前进方向。不过,相关信息没有给出模型性能、发布时间或可量化商业成果等具体细节。
CLIP-CC-Bench 是一个用于评估长篇视频描述生成能力的基准,旨在弥补现有评测主要关注短视频片段、单句指标或问答任务的不足。该基准包含 5 小时电影内容,划分为 90 秒片段,每个片段都配有专家撰写的段落式参考描述。研究使用 5 个基于大语言模型的嵌入模型,并结合粗粒度和细粒度语义匹配方法,对 17 个视频语言模型进行评估。同时,研究还分析了评审者间一致性和排名稳定性。评估脚本、模型输出及
成立仅一年的初创公司 Applied Compute 专注于帮助企业利用自有数据运行和定制开源模型。据 The Information 报道,该公司正在洽谈数亿美元融资,投资人 Elad Gil 可能领投,交易将使其估值达到约30亿美元。目前融资尚未最终敲定。
Meta 推出了可下载的新模型 Muse Glimmer,旨在仅使用一块 GPU 就能在个人电脑上运行,进一步加剧了围绕开放式与封闭式人工智能的争论。此次发布以及首席执行官马克·扎克伯格发表的新文章,凸显了 Meta 推动更易获取、更具可定制性的人工智能的战略。与此同时,中国的低成本开放模型正在加大对 OpenAI 和 Anthropic 等竞争对手的压力。
Meta推出的新型开放权重模型Muse Glimmer,被称为一窥马克·扎克伯格个人超级智能愿景的窗口。这一消息也凸显出日益扩大的差距:用户可以自行拥有一些AI模型,而另一些系统只能通过外部服务访问。不过,现有描述没有提供具体性能基准,也没有独立证据证明该模型实现了重大的技术突破。
据路透社报道,Meta 首席执行官马克·扎克伯格呼吁美国政府减少对开源或开放权重 AI 模型的限制,以便与中国竞争。他表示,AI 应该广泛普及,而不应由少数机构掌控。报道还提到,Meta 据称推出了采用 4bit 量化技术的 AI 模型 Muse Glimmer,可在配备 24GB 或 32GB 显存的 Mac 和 PC 上本地运行。随着 AI 开发成本上升,以及 Anthropic 和 Open
Meta 发布了 300 亿参数模型 Muse Glimmer,并采用 Apache 2.0 许可证开源。该模型针对全天候运行的本地智能体工作流优化,使用 4bit 量化,官方称其可在配备 24GB 或 32GB 内存的 Mac 和 PC 上本地运行。Meta 表示,量化对智能体任务性能的影响很小。在搭载 M4 Max、M5 Max 的 MacBook 以及 RTX 5090 上进行的测试据称显示
一项实践研究提出了两种提高大语言模型知识蒸馏效率的系统技术。首先,预先缓存教师模型的 Top-K logits,可在不将教师模型保留于 GPU 内存中的情况下进行训练,同时保持与在线蒸馏几乎相同的训练损失。在单张 H200 GPU 上,每次迭代速度提升约 29%,吞吐量最高提升 41%。其次,融合式分块 KL 损失避免生成覆盖完整词表的 logits 张量,从而降低峰值内存使用,并支持在单张 GP
Meta已发布新的开放权重人工智能模型Muse Glimmer,并计划在未来几周内推出其最先进模型Muse Spark 1.2的开放权重版本。首席执行官马克·扎克伯格希望通过更开放的模型和开发策略,提升外界对Meta人工智能布局的支持。
Meta 首席执行官马克·扎克伯格批评封闭式 AI 模型的开发商,尤其是 OpenAI 和 Anthropic。他表示,AI 实验室的讨论过度充斥着末日论调,并为蒸馏作为一项原则进行辩护,认为这有助于让强大的 AI 更广泛地普及。这些言论再次体现了 Meta 支持更开放 AI 发展的立场。