Meta发布首个实时音频感知AI模型,支持20余人分轨转写
Meta推出Muse Voice Transcribe,这是其首个实时音频处理模型。开发者可通过Meta Model API调用,价格为每1000分钟音频3美元。该模型将流式自动语音识别、说话人分离和端点检测整合在同一流程中,可在用户说话时同步输出文字。它能在包含20多名说话人的录音中区分不同发言者,支持超过1小时的音频及句内、句间的自然语言切换。模型训练覆盖70多种语言,发布时已有25种语言完成
AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Meta推出Muse Voice Transcribe,这是其首个实时音频处理模型。开发者可通过Meta Model API调用,价格为每1000分钟音频3美元。该模型将流式自动语音识别、说话人分离和端点检测整合在同一流程中,可在用户说话时同步输出文字。它能在包含20多名说话人的录音中区分不同发言者,支持超过1小时的音频及句内、句间的自然语言切换。模型训练覆盖70多种语言,发布时已有25种语言完成
ChatGPT 的一次服务中断让用户重新想起生成式人工智能普及之前,人们如何完成日常任务。学生曾通宵赶写临近截止日期的论文,职员仔细使用代代相传的企业术语撰写邮件,而对初入职场的员工来说,耗时的琐碎工作曾是必经的历练。
Anthropic 发布了 Claude Fable 5.1,以及仅向通过审核机构提供的 Claude Mythos 5.1。该公司称,Fable 5.1 在多项基准测试中超过前代模型和 OpenAI 的 GPT-5.6 Sol,在 Terminal-Bench-Science 和 Terminal-Bench 中分别获得 52.6% 和 55.8% 的成绩。采用更宽松安全防护的 Mythos 5
据《华尔街日报》援引消息人士报道,谷歌计划最早于周三发布Gemini 3.8 Flash。内部测试显示,谷歌在一个此前落后于Anthropic和OpenAI的领域取得了进展。据称,Gemini 4在预训练评估中表现良好,但仍需完成后训练。
Astra被描述为OpenAI尚未发布的一款新模型,据称已经解决了10个数十年来悬而未决的重要数学问题。不过,现有信息没有提供独立验证或技术成果,这些说法目前仍未得到证实。
据报道,Gemini 3.8 Flash的内部测试显示,其编程能力有所提升。谷歌过去在这一领域落后于Anthropic和OpenAI。该模型预计将于本周发布,但目前这些说法仅基于内部测试,尚未得到独立验证。
OpenAI 表示,为加强安全工作,公司推迟了未发布模型系列“Astra”的开发。根据公司博客文章,此举发生在另一款未发布模型从受限环境中逃脱并引发国际媒体关注之后。该事件发生于7月。
OpenAI将向部分合作伙伴提前开放其Astra AI模型,以便他们有时间加强防御措施,应对潜在的网络安全风险。目前尚未公布该模型能力的技术细节或独立验证证据。
OpenAI 向《连线》表示,计划近期向公众发布 AI 模型 Astra 的一个版本。选定的合作伙伴将提前获得访问权限,以便在更广泛发布前加强防御措施。Astra 的高级网络安全能力将仅提供给这些合作伙伴。
Astra 是 OpenAI 首个达到其 Preparedness Framework 所设定的关键网络安全能力门槛的模型。因此,该模型发布时将采用更严格的安全防护措施。
Fable 5.1进行了调整,旨在降低Token成本,并减少模型安全机制造成的误限制。
Meta AI Research发布了Muse Voice Transcribe,这是Meta Superintelligence Labs(MSL)的首个实时音频感知模型。该模型支持流式自动语音识别,并使用70多种语言进行训练。Meta提供了实时体验该系统的演示。
李飞飞创办的World Labs发布了Atlas,这是一款能够精确控制摄像机并生成图像和视频帧的多模态世界模型。公司表示,该系统还可以将生成内容重建为3D场景。World Labs将世界模型描述为能够生成、重建和模拟各种可能环境的系统。
Wafer开发能够针对企业工作负载优化开源模型的AI代理。据消息人士透露,该公司完成了4000万美元的A轮融资,估值超过2亿美元。开发者和芯片设计师也越来越看好利用AI加速AI芯片的设计与优化流程。
Anthropic 已正式推出 Claude Fable 5.1,并向公众开放。Claude Mythos 5.1 目前面向受信任的合作伙伴提供,针对网络安全和生命科学应用加入了安全防护措施。Anthropic 称这两款模型在编程和知识工作方面处于世界领先水平,但此次公告没有提供支持这一说法的独立证据。