消息称月之暗面 Kimi K3.1 将于下月登场
据报道,月之暗面正在筹备 Kimi K3.1,预计可能于 2026 年 10 月发布。相关模型标识据称出现在内部 JSON 和 API 响应中。配置资料显示,该模型可能提供三档推理强度、最高 100 万 Token 的上下文,以及智能体、多智能体协作、搜索和批处理模式。目前这些信息尚未获得官方确认。2026 年 7 月发布的 Kimi K3,是月之暗面目前公开推出的旗舰模型。
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
据报道,月之暗面正在筹备 Kimi K3.1,预计可能于 2026 年 10 月发布。相关模型标识据称出现在内部 JSON 和 API 响应中。配置资料显示,该模型可能提供三档推理强度、最高 100 万 Token 的上下文,以及智能体、多智能体协作、搜索和批处理模式。目前这些信息尚未获得官方确认。2026 年 7 月发布的 Kimi K3,是月之暗面目前公开推出的旗舰模型。
PackLab 是一个用于开发和评估多模态大语言模型的框架,面向机器人容器装箱中的闭环长期序列决策。该套件包括基于物理的仿真平台,可规模化生成多样化训练轨迹;PackLab-VLM,可根据物体和容器状态的变化同时选择物体并预测放置位置;以及 PackLab-Bench,提供多个难度等级的标准化评测场景。实验显示,在不同物体集合和容器配置下,PackLab-VLM 平均优于传统装箱启发式方法、传统强
HappyWorld-Bench是一套用于评估世界模型的综合基准。它不仅衡量生成世界的视觉质量,还测试模型在探索、交互和修改过程中的一致性与响应能力。该框架围绕六项能力,覆盖视频、空间和具身世界模型三个评测方向。研究评估了14个视频模型、9个空间系统和8个具身模型候选,并结合自动化行为指标、人工A/B比较和Elo评分。结果显示,三类模型都存在明显的可靠性缺口:视频模型在长时间生成和重新访问时一致性
这项研究提出JitMem,一种面向LLM智能体的记忆系统:先完整保留过去的交互轨迹,待新任务到来时再整理出所需信息,从而避免在未知未来查询出现前就决定该记住什么。在ALFWorld、WebShop和τ^2-bench测试中,JitMem优于无记忆智能体,以及在写入时整理记忆的启发式和学习式方法。与最强基线相比,成功率分别提高16.2、16.3和3.9个百分点。即使未经训练的记忆整理器也表现出竞争力
谷歌DeepMind高级副总裁Koray Kavukcuoglu表示,Gemini 4目前处于后训练的早期阶段。他希望这款模型能在年底之前很久就发布。
RewardVerse旨在缓解视频奖励模型的评分不稳定问题。当模型将主观的视频质量直接映射为单一分数时,评分尺度可能随提示而漂移。该框架先生成适应具体查询的动态评估准则,再据此进行评分。两阶段训练算法RGPO先用不断演进的种子准则预热评分器,随后联合优化准则生成器和评分器。研究团队称,在16维EvalVerse基准和外部数据集上的实验显示,该方法能够减轻评分尺度漂移,并在单项评估和成对评估中取得较
SpeakerMem-R1 是一款面向群体对话的长期记忆系统。它并行存储标注说话者的原文消息,以及按个人和群体组织的结构化信息,并在回答问题时整合实体、事件和时间线索。研究团队报告,该系统在 GroupMemBench、SocialMemBench 和 EverMemBench 上的二元准确率分别为 47.9%、69.2% 和 61.9%;在公开的 EverMemBench 榜单上达到 62.33
视觉-语言-动作模型为通用机器人控制提供了有力基础,但大多数策略不会保留先前观测中的信息。MemBodied提出固定容量的情景记忆,由记录交互的关联状态和代表初始场景的紧凑参照组成。在五项需要记忆的RMBench任务中,其平均成功率是无记忆策略的7.81倍、基础循环记忆的2.98倍。与最强的记忆增强基线相比,表现高出1.3倍,新增参数量则少了10倍。在LIBERO-Long上,MemBodied达
腾讯混元发布 Hy Image 3.5 Preview,视频平台 WorkRally 即日起向创作者免费开放两周。该模型支持文生图和图生图,最多可上传 5 张参考图,最高输出 2K 分辨率。腾讯称,数百名专业创作者参与的盲测显示,模型表现较 Hy Image 3.0 提升约 30%。WorkRally 将其接入概念设计、剧集分镜和影视物料等工作流程,并针对专业影视制作进行定制调优。腾讯云 API
这项研究通过完整性、前缀一致性和中立性三项条件,形式化定义了语言模型后训练中的 token 级信用分配。研究人员据此分析现有训练信号,并提出 Policy Aligned Critic Training(PACT)。PACT 先更新 actor,再通过重要性采样校正,使 critic 训练与更新后的策略保持一致。在四项智能体数学推理基准测试中,PACT 的平均准确率为 72.87%,比 GRPO
上海人工智能实验室推出 InternW0,这是一种将未来视觉动态预测与连续机器人控制相结合的物理世界模型。视频组件提供较长时间跨度的预测上下文,轻量级动作组件则能更频繁地响应新观测。模型使用约 7,200 小时的异构机器人和第一人称视角数据训练,其中包括 275 小时的 EgoLab 数据集。评估涵盖仿真和真实任务,包括 15 阶段的金属有机框架合成流程,以及考虑接触与受力的五阶段移液任务。介绍内
VHD-Play先求解数学模型,再将其决策过程呈现为有状态的工具,以构建智能体训练环境。因此,环境动态与轨迹评分基准来自同一模型。该流程以每个仅需几美分的成本生成了3,300个环境。使用这些环境训练Qwen3.6-35B-A3B后,其在涵盖五类环境的诊断测试中的平均智能体得分从0.204升至0.815。研究人员还报告称,模型在未见过的机制和外部基准测试上也有所提升。对比结果表明,可学习差距的大部分
报告介绍了采用混合专家架构的开源语言模型 Hunyuan-A13B。模型总参数量为 800 亿,但推理时仅激活 130 亿个参数。模型使用经过严格筛选、并加强 STEM 数据整理的 20 万亿 token 语料进行预训练,随后通过监督微调和大规模强化学习进一步提升能力。其双模式思维链框架会根据任务复杂度调整推理深度。报告称,该模型在数学、科学、编程等评测中表现具有竞争力。开发团队公开模型,以支持开
Anthropic称,Claude从大量DNA序列数据中识别出一种尚未被完整描述的系统,由逆转录酶、邻近基因和非编码重复序列组成,并命名为ART,主要存在于噬菌体中。约950个智能体进行了持续21小时的搜索,消耗约2.1亿个token,随后由研究人员分析并验证发现。该系统的主要功能仍不清楚,也没有证据表明它能像CRISPR一样实现可编程DNA编辑。重复搜索也未能稳定找到关键重复序列。这项发现展现了
Meta表示,Muse将从聊天机器人发展为用户可以通过视频交流的AI虚拟形象。公司还计划为智能体提供独立电子邮件地址,并为Muse增加Mac电脑操作功能和智能眼镜支持。