原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.08977
立即前往原文

全能交互智能体技术报告

该报告介绍了 Gander,这是一个将视频、语音和文本流式输入统一起来的端到端模型,旨在实现连续的多模态交互。其 Cerebellum-Brain 架构由 Cerebellum 负责实时对话与响应,Brain 负责复杂推理、工具调用和智能体任务。Streaming Thinker-Talker 设计支持低延迟、全双工交互,包括用户随时打断、模型主动提供中间反馈以及提出后续问题。内部人工评估显示,Gander 具备自然的语音对话能力,并在多模态交互方面达到有竞争力的水平,在背景噪声和多人互动场景中也表现出一定鲁棒性。团队已公开模型、代码和数据,供社区进一步研究。
行业资讯 AI模型 研究 开源 2026-09-09 13:01:03 879 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。