大语言模型智能体时代的图工程:从个体智能到系统智能
大语言模型智能体正从语言生成器发展为能够执行复杂长期任务的自主系统。文章指出,当任务需要异质专业知识、并行子任务、独立验证和持久状态时,单个智能体的能力或上下文扩展会面临架构限制。作者提出“系统智能”概念,强调将多个专业智能体组织并协调到共同目标之下。“图工程”通过显式、动态且不断演化的图结构表示任务、智能体和系统状态,从而支持复杂目标的组织、异质智能体的协作以及系统演进。文章系统总结了这一范式的
AI 新闻中心 过去24小时分析了 150 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
大语言模型智能体正从语言生成器发展为能够执行复杂长期任务的自主系统。文章指出,当任务需要异质专业知识、并行子任务、独立验证和持久状态时,单个智能体的能力或上下文扩展会面临架构限制。作者提出“系统智能”概念,强调将多个专业智能体组织并协调到共同目标之下。“图工程”通过显式、动态且不断演化的图结构表示任务、智能体和系统状态,从而支持复杂目标的组织、异质智能体的协作以及系统演进。文章系统总结了这一范式的
微软正在简化 Windows 11“智能应用控制”的启用流程。该安全功能利用云端智能和代码签名信息,在不受信任或可能有害的应用运行前将其拦截。此前,用户通常必须全新安装 Windows 才能启用该功能。现在,受支持的设备可通过“设置 > Windows 安全中心 > 应用和浏览器控制 > 智能应用控制设置”开启或关闭。适用设备为运行 Windows 11 22H2 或更高版本的电脑。不过,实际操作
摩尔线程发布了一份基于MTT S5000 AI智算卡的“Prefill-as-a-Service”技术白皮书,面向AI Agent、代码生成和超长文档分析等长上下文推理场景。该方案将主要受计算能力限制的Prefill阶段,与更依赖显存带宽的Decode阶段分离,并分别部署在专用硬件资源池中。公司称,这种配置有望改善首字延迟、处理吞吐和基础设施成本效率。此次发布主要提出了一种推理系统架构,消息中未提
美国企业正逐渐放弃 Anthropic 最强大的模型 Fable 5,转而选择更便宜的替代产品。支付集团 Ramp 的支出数据显示,Fable 5 发布两个月后,企业对其支出仅占 Anthropic 工具总支出的约 11%,此后采用率趋于停滞。分析师认为,主要原因是定价过高,而旧款模型已经能够满足大多数需求。中国及其他地区的低价开放权重模型也为客户提供了更多选择。OpenAI 则凭借价格更低的新模
《纽约时报》报道了谷歌、微软和OpenAI试图影响美国学校及教育政策的做法,并关注教师对未经充分验证的人工智能工具日益增强的反对。2025年夏天,微软代表在曼哈顿市中心的一场会议上,向约200名教师介绍了公司的教育服务。
软银集团计划发行总额1万亿日元(约63亿美元)的零售债券,规模将创日本发行方同类债券之最。这也将是该集团今年第三次发行零售债券。部分募集资金将用于履行软银对OpenAI的财务承诺。
CLEAR是一种大语言模型安全对齐方法,通过隐藏状态中的轻量级门控机制,连续控制安全低秩适配器的激活强度。该方法旨在减少有害回答,同时避免对良性提示下的基础模型进行不必要的修改。在Llama-3-8B-Instruct测试中,CLEAR将HarmBench攻击成功率从32.3%降至0.5%,并保留了模型大部分实用性。在GSM8K准确率方面,其表现也比全局应用的SFT或LoRA高出最多7.1个百分点
SuperCLUE发布了最新的手机端侧大模型评测结果。vivo蓝心BlueLM 3.5 Nano 3B以89.86分排名第一,据该评测,其表现接近多个主流云端模型。Qwen3.5 9B和Qwen3.5 4B分别以87.82分和85.16分位列第二、第三。端侧模型能够在手机本地处理文本和图像,无需持续联网,因而有助于提升隐私保护和离线使用能力。不过,手机硬件限制了模型规模,也限制了其处理复杂任务的性
谷歌表示,其开源模型家族Gemma的累计下载量已超过10亿次,开发者还基于该系列创建了超过10万个定制变体。Gemma目前被用于太空图像分析、医疗报告结构化和生物医学研究。谷歌DeepMind、谷歌研究院与耶鲁大学合作开发的Cell2Sentence-Scale 27B,可将单细胞基因表达数据转换为语言模型能够分析的类文本序列。该模型对4000多种药物进行了虚拟筛选,提出将CK2激酶抑制剂silm
据《金融时报》报道,美国企业正在减少对Anthropic高价旗舰模型Fable5的使用,转而选择更便宜的替代方案。追踪7万家公司支出的Ramp数据显示,Fable5发布两个月后,仅占Anthropic工具总支出的约11%,近期采用率也趋于平稳。规模更小、价格更低的Opus5,其企业支出已超过Fable5。分析师认为,主要原因是Fable5价格高昂,而多数企业使用旧模型已能满足需求。据报道,Anth
泰康保险集团发布了自研的照护与医疗专用大模型1.0版。该模型首先应用于社区养老,可自动生成老年人健康画像、按需求进行分组,并制定个性化照护方案。公司表示,该系统旨在将传统的被动呼叫服务转变为主动风险预警。未来,泰康计划将其扩展至居家养老领域的全天候健康监测。目前尚未公布该模型性能、安全测试结果或实际部署规模的独立评估。
Llama-Mobile 是一个面向移动设备的视觉语言模型量化框架,旨在资源受限的硬件上实现高效推理。其量化流程利用模型自身生成训练数据,无需访问原始训练环境。新的每参数 2.7 位格式支持在 Arm CPU 上高效运行。研究人员在使用 8 位激活值的情况下,将 Llama 3.2 11B Vision Instruct 压缩至 3.7GB,并在多项标准视觉问答任务中保持了较强性能。
这项研究提出了面向开放式视频流的连续编辑方法:模型在接收新的编辑指令时,持续生成并编辑后续视频片段。InfinityEdit通过一个轻量级适配器扩展流式视频生成器,该适配器包含历史交叉注意力、因果时间自注意力和编辑交叉注意力。该设计旨在保持视频的时间连续性,而不是逐帧重写源视频,并在编辑指令不断累积时维持稳定质量。适配器只在编辑指令到达的片段中启用,之后的片段由原始模型继续生成。作者报告的实验结果
华为宣布鸿蒙智家迎来秋季升级,新增多款鸿蒙智选智能家居产品、6 类快捷指令,以及智慧生活 App 的灯具 24 小时未关提醒功能。该系统采用“1+3+N”架构,包括家庭计算与连接中枢、触控、语音和传感器交互方式,以及覆盖网络、影音娱乐、安防、照明、能耗和家电等领域的子系统。
联想集团与海尔集团在北京签署战略合作协议,双方将围绕数据中心与算力基础设施、供应链协同、智能制造、工业互联网和智慧家庭等领域展开合作。联想计划推动 AI PC 及其他智能终端与海尔智慧家庭生态融合,打造结合设备、算力和服务的整体体验。双方还将探索家用机器人的联合研发,并整合算力、平台与产业场景。协议暂未公布具体产品、落地时间表或投资金额。