AI 智能体或将在性能和成本上超越印度外包
安德森・霍罗威茨合伙人 Fabrizio Serafini 称,计算机操作型 AI 智能体已从演示阶段进入可部署阶段,在部分企业流程中的成本可能低于印度离岸外包劳动力。这类智能体能够读取屏幕、点击界面、输入文字,并在缺少明确 API 的软件中处理错误。文章引用 OSWorld-Verified 数据称,领先模型的任务完成率已从 2025 年初的 42% 提升至 2026 年 6 月的 85%,但这
AI 新闻中心 过去一年分析了 4173 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
安德森・霍罗威茨合伙人 Fabrizio Serafini 称,计算机操作型 AI 智能体已从演示阶段进入可部署阶段,在部分企业流程中的成本可能低于印度离岸外包劳动力。这类智能体能够读取屏幕、点击界面、输入文字,并在缺少明确 API 的软件中处理错误。文章引用 OSWorld-Verified 数据称,领先模型的任务完成率已从 2025 年初的 42% 提升至 2026 年 6 月的 85%,但这
据SpaceX全员会议录像,CEO埃隆·马斯克表示,AI营收最快可能在9月超过公司其他业务的营收总和,并在第四季度大幅领先。他称SpaceX计划利用公司掌握的全部信息训练大语言模型Grok,但没有说明数据范围、训练方式或隐私保护措施。马斯克还表示,SpaceX必须在AI硬件和软件领域取得领先,并提到将数据中心部署到太空,以及采用英伟达未来Vera Rubin架构的算力基础设施。相关营收预测和企业计
据《华尔街日报》报道,一些高度重视数据的健康和健身爱好者,正将睡眠、锻炼和饮食数据接入聊天机器人。他们自行构建仪表板和工具,用于分析从马拉松训练到办公室压力等信息,以打造个性化的训练指导。
中国长安汽车集团与华为在深圳签署战略合作框架协议。双方将探索人工智能产品与应用场景、通用及汽车垂直大模型、数字化底座、算力以及软硬件等领域的合作,并在数字能源、国际化和数智化人才培养方面加强协作。目前协议主要明确合作方向,尚未公布具体产品、模型或落地时间表。
2026中国算力大会将于9月11日至13日在河北省廊坊市举行,主题涵盖算力基础设施、核心技术、行业应用和产业生态建设。大会将首次举办算力首创首发发布会,集中展示国产算力芯片、智能体、绿色算力等软硬件产品。围绕人工智能、具身智能、算电协同、太空算力和Token新经济等议题,大会还将举办10余场专题论坛。同期举行的“算力中国·AI与算力产业展览会”将免费向公众开放。大会由中国相关部门与地方政府共同主办
DistilVDR 是一个拥有 5.24 亿参数的视觉文档检索系统,由一个 80 亿参数的视觉语言模型蒸馏而来。其非对称编码器将更多视觉处理能力集中在文档端,同时保持较小的查询编码器,并且无需相关性标注或负样本采样。HiRes 版本在 ViDoRe v1 至 v3 上取得 61.74 的平均 NDCG@5,达到教师模型性能的 86.9%。两个版本生成的索引都明显更小,为一百万份文档建立索引的速度约
美团核心本地商业 CEO 王莆中表示,美团不会开设线下药店,而是希望成为医药商家的 AI 合作伙伴。美团计划向行业开放 AI 经营专家、CatPaw 能力以及工作流改造方法。目前,首批 AI 经营专家已在漱玉平民、科赴等企业应用;全场景 AI Agent 平台 CatPaw 也将面向医药商家启动试点。美团希望依托与约 25 万家药店及近 500 家药企的合作生态,打造面向医药零售业的 AI 基础设
Anthropic 的 AI 聊天机器人 Claude 不仅能回答基本问题。本文介绍了 15 项较少人了解的功能和使用方式,可能有助于提升工作效率和处理日常任务。这些功能的实际效果在很大程度上取决于用户能否清晰地编写提示。
研究人员称,疑似与中国有关的黑客利用开源人工智能代理开发了自主黑客工具,并于7月入侵台湾政府网站。据称,这些人工智能代理能够同时执行侦察和入侵行动,可能表明网络战正在进入新阶段。目前相关结论仍基于研究人员对事件的分析。
微软推出了 MAI-Code-1.1-Flash,这是面向 GitHub Copilot 工作负载优化的编程模型升级版。微软表示,通过 Copilot CLI 使用时,该模型在 Terminal-Bench 2.1 测试中的表现提升 22%,在 .NET 相关任务中的表现提升 15%。其 Token 生成速度提升 25%,完成相同任务所需的 Token 数量减少 25%。价格降至初代模型的四分之一
一项研究探讨了深度研究智能体如何在上下文不断增长时,移除价值较低的信息。研究在检索前、检索后和合成前三个阶段,对比了轻量级启发式方法与学习型价值模型。结果显示,剪枝发生的阶段比具体评分规则更重要:提前剪枝能带来最大的整体节省,而较晚剪枝主要用于优化最终合成上下文。轻量级启发式方法最多可减少 73% 的 Token 使用量,同时几乎不影响质量。但没有任何单一方法能在质量、效率和忠实度方面全面占优。
一项研究探讨了开放式大语言模型在46种语言机器翻译任务中的无参考后训练方法。研究人员以监督微调的MiLMMT-46-v0.1模型为基础,采用Group Relative Policy Optimization(GRPO),奖励信号取自两个无参考质量评估模型的平均值,并加入语言识别门控。随后,他们对监督微调和强化学习模型的检查点进行线性插值,得到MiLMMT-46-v1.0。根据论文报告的评测结果,
Combodied Agents 是一种旨在弥补智能体人工智能结构性缺陷的框架。数字智能体主要改变软件状态,具身智能体则改变物理状态,但两者都未必能够充分建模个人状态、意图和自主性的持续变化。该方法将人的状态轨迹置于核心,并把软件工具、传感器、可穿戴设备、机器人和人工服务作为干预渠道。框架结合多模态事件感知、可由用户纠正的长期记忆以及个人世界模型,并根据同意、不确定性、安全性、可逆性和用户控制选择
蚂蚁集团将好大夫医生版升级并更名为“蚂蚁阿福医生版”,新增两款AI助手,支持预问诊、患者沟通、诊后随访、病历整理和医学文献检索。平台还与面向患者的蚂蚁阿福App打通,蚂蚁称该App用户已超过1亿。公司强调,临床决策仍由医生负责,采用“医生把关”模式。平台据称整合了超过6000万篇医学文献、指南及其他专业资料,以及超过14万份药品说明书。目前已有超过30万名实名注册医生接入,医疗机构也可整体入驻。关
DSAgentBench 是一个用于评估 AI 智能体在真实计算机环境中执行完整数据科学工作流的基准测试。它包含 275 项任务,覆盖数据整理、探索、建模、可视化和验证,并要求协调使用笔记本、IDE、终端、浏览器和数据库。确定性评估器不仅检查代码执行,还会验证分析正确性、可视化结果和模型性能。在对 15 个闭源和开源模型的实验中,表现最强的 Claude-4.6-Sonnet 任务成功率也只有 5