纯Go语言Agent框架covonaut v1.1.4发布:引入滚动并行调度与多模态读取
面向生产环境的纯Go语言Agent框架covonaut发布v1.1.4版本。该版本引入滚动工具执行池调度,解决慢工具阻塞并行任务的问题;支持多模态内容通道,可自动分流并处理文本、图片、PDF、Notebook及视频;增强了安全隔离,将删除操作对接系统回收站以防误删,并拦截危险命令。升级过程无需改动接口代码。
AI 新闻中心 过去30天分析了 317 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
面向生产环境的纯Go语言Agent框架covonaut发布v1.1.4版本。该版本引入滚动工具执行池调度,解决慢工具阻塞并行任务的问题;支持多模态内容通道,可自动分流并处理文本、图片、PDF、Notebook及视频;增强了安全隔离,将删除操作对接系统回收站以防误删,并拦截危险命令。升级过程无需改动接口代码。
小米的 MiMo-V2.6-Pro 在 Artificial Analysis 的 Intelligence Index 中与 Grok 4.7(xHigh)得分相同,并超过 GLM-5.3(max)。根据这项基准测试,它成为得分最高的开放权重模型,领先于 xAI 的 Grok 4.6 和 Google 的 Gemini 3.8 Flash 等闭源模型。
9月22日科技早报聚焦多项AI动态。智谱表示,针对ZCode安全问题的社区反馈,官方已完成整改并向所有用户道歉,同时宣布ZCode开源。小米发布MiMo-V2.6,提供Pro和Flash两个版本并公开模型权重;据小米称,Pro版目前在AA综合智能指数的开源权重模型中排名最高。SpaceXAI推出Grok 4.7,针对编程和知识工作进行优化,支持最多100万词元输入。月之暗面上线Kimi Code
小米发布了包含 Pro 和 Flash 两个版本的开源权重模型系列 MiMo-V2.6。小米称,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3.2 中获得 46 分,超过 Kimi K3 和 GLM-5.3,但仍落后于顶级闭源模型。小米将性能提升归因于强化学习算力扩展。该系列支持文本、图像、视频和音频等多模态输入,可用于软件工
小米已发布开放权重多模态模型 MiMo-V2.6 Pro 和 Flash。该公司声称,Pro 版本在大多数智能体基准测试中的表现可与 Opus 5 和 GPT-5.6 Sol 相媲美。不过,此次公告没有提供独立验证这些性能说法的证据。
估值156亿美元的法律科技初创公司Harvey最初基于OpenAI GPT-4等模型,开发面向律师的专业人工智能服务。随着人工智能使用和开发成本不断上升,该公司开始重新评估对大型模型供应商的依赖,并扩大对开放模型的使用。
中国初创公司 Z.ai 已停用其 AI 编程助手 ZCode 的部分功能,并将该编程工具开源。部分用户此前表示,ZCode 未经同意将代码库上传至海外服务器。面对数据隐私和源代码安全方面的担忧,公司采取了上述措施。
Gricea 是一个开放科学平台,将对话式 AI 研究表示为可配置、可部署的研究成果。研究人员可以运行、检查、分享和复用这些成果。平台将研究流程、面向参与者的系统以及对话任务行为结合起来。在一项复现研究中,Gricea 复现了符合条件的 CUI 2026 论文中 93% 的配置,同时发现 96% 的论文缺少会妨碍忠实复现的信息。用户研究表明,来自不同背景的研究人员和从业者能够构建可运行的研究,以探
APort Vault是一项用于评测工具型AI代理支付授权能力的基准测试。研究重放了针对一个在线支付代理的4,371次人工编写攻击,覆盖8家实验室的14个模型、5种策略配置和225,964次评估。加入基于Open Agent Passport规范的确定性执行前检查后,69,297笔向未获授权收款人的转账中没有一笔被放行;未加入该检查时,76,842笔中有140笔被放行。该机制并非简单拒绝所有支付,
IntBMoE是一种混合专家模型架构,旨在将专家参与度、计算成本和内存需求相互解耦。轻量级超网络动态组合专家基底,而路由器只将每个令牌发送到少量区块。这样,每个组合专家都能利用完整专家池的信息,同时避免密集型MoE的执行成本。研究在图像分类、语言建模和序列推荐任务上进行了实验,结果显示其优于多种稀疏和密集基线模型。作者表示,IntBMoE已部署于高德地图的生成式推荐系统,在60毫秒延迟预算下服务数
亚马逊云科技已将月之暗面开发的 Kimi K3 模型接入 AI 平台 Amazon Bedrock。据现有信息,Kimi K3 是一款开放权重模型,原生支持视觉能力,拥有 100 万 Token 的上下文窗口,并宣称参数规模达到 2.8 万亿。该模型主要面向长时间编程任务和大规模文档分析。Bedrock 将为其提供与闭源模型相同的安全边界,包括统一的访问控制、加密和审计机制。Kimi K3 还是
9月18日,开发者发现,在“代码库索引”默认开启的情况下,智谱ZCode会将用户的完整工作区和Git历史上传至云端。智谱随后致歉,称数据用于生成Repo Wiki,并会在页面生成后立即删除。但这一解释并未消除对日志、缓存、备份、内部访问,以及数据是否被用于模型训练或产品优化的担忧。目前公开证据只能确认数据被上传,尚无证据证明这些代码已经用于模型训练。事件凸显了具备广泛文件权限的编程代理所带来的风险
电信诈骗话术变化迅速,而且常常伪装成普通客服通话。TeleAntiFraud 2.0提出按月冻结的评测集,在加入新诈骗模式的同时不覆盖既有测试集,并要求模型区分诈骗通话与合法、但处于相近领域的通话。每个评测集包含900段中文通话,其中600段为诈骗,300段为非诈骗。受控文本实验显示,分类器面对无关或普通负例时可达到完美的Macro-F1,但面对相近领域的负例时,得分降至0.65至0.68。完整音
CodeMidas 是一个自动化管线,旨在通过直接从现有源代码中生成任务,来扩展编码智能体(Agent)的强化学习(RL)环境。与依赖 Issue 或 Commit 等开发遗留产物的传统方法不同,CodeMidas 利用智能体分析代码库、制定行为规范,并验证基于执行的测试。该管线在 23 种编程语言中生成了 5,545 个训练任务。通过 GRPO 算法在此数据集上训练 MiMo-V2.5 模型后,
一项研究考察了使用模型生成的同行评审来递归训练后续评审模型,如何削弱科学判断的多样性。研究人员以 Llama 3.1 8B 为基础,先用 2018 至 2023 年的 ICLR 官方评审进行微调,再使用混合比例不同的官方评审和模型生成评审训练后续模型。加入合成评审后,评分分布趋于收窄,单篇论文和整个语料库的语义多样性均有所下降。作者将这一现象称为“科学判断崩溃”。研究团队还提出开源系统 Trust