构建面向生产环境的希腊语—英语语音识别系统
一项持续数月的工程计划介绍了 Sophea,这是一个面向生产环境的希腊语和英语双语自动语音识别系统。团队围绕词错误率、语言识别能力以及在非语音音频上的幻觉现象,设置了九项生产标准进行评估。在 23 次训练迭代中,没有任何训练数据配置同时通过全部九项标准。由三个模型组成的 ROVER 集成系统通过了全部标准,并将重叠语音场景下的词错误率相对降低 29%。另一个模型在八个公开英语测试集上的平均词错误率
AI 新闻中心 过去一年分析了 1376 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项持续数月的工程计划介绍了 Sophea,这是一个面向生产环境的希腊语和英语双语自动语音识别系统。团队围绕词错误率、语言识别能力以及在非语音音频上的幻觉现象,设置了九项生产标准进行评估。在 23 次训练迭代中,没有任何训练数据配置同时通过全部九项标准。由三个模型组成的 ROVER 集成系统通过了全部标准,并将重叠语音场景下的词错误率相对降低 29%。另一个模型在八个公开英语测试集上的平均词错误率
AlayaVista是一种可由摄像机控制的流式视频世界模型,旨在保持广泛的场景上下文,同时生成高保真的透视视图。系统从单张透视图像出发,利用预训练的全景扩展模型构建360度场景先验,并将其作为受摄像机条件控制的全景潜在状态持续演化。潜在视口渲染器将该状态转换为指定视角的视频潜在表示,透视细化模块则负责恢复细节、抑制伪影并进行超分辨率。为实现高效流式生成,研究团队将全景生成改造为分块自回归生成,并将
上海人工智能实验室开源了多模态基础模型 Intern-S2。实验室称,该模型的通用能力位居开源模型前列,并在生物、材料科学和化学等长程科学任务上达到可与顶尖闭源模型相比的水平。其核心架构是 Memory Decoder,支持插拔式专业记忆模块。针对特定领域,用户可以更换相应记忆模块,而无需重新训练整个模型,同时保留原有的通用能力。Intern-S2 还强化了长程推理和智能体工具执行能力,这些能力对
RSIAgent是一种无需额外训练的多智能体框架,能够自主探索陌生的数字环境,并将环境特定知识保存到可复用的记忆中。课程、执行和验证智能体先进行广泛探索,再针对困难案例、隐藏约束、边界条件和因果关系开展深入探索。生成的记忆无需更新模型参数即可用于后续任务。研究在OSWorld-v2和Agent’s Last Exam上的实验中报告称,该方法显著提升了开源模型的表现,并声称Kimi-K3和GLM-5
研究人员提出“Agent as Policy”(AGP),一种让通用人工智能代理在任务执行过程中直接控制实体机器人的方法,无需针对特定任务或环境进行训练。代理根据任务和机器人接口解读视觉信息,编写可执行程序,发出运动指令,并根据实际物理结果调整行动。AGP在多项真实世界操作任务中接受测试,包括根据人类视频进行装配、依据目标图像搭建积木、重新调整骰子方向、定向投掷以及双手折叠毛巾。在三种积木搭建配置
Realtime-Venus是一套面向音频和视频交互的主动式全双工系统,由两个分别训练、各含90亿参数的模型组成:用于视听交互的Realtime-Venus-Omni,以及用于语音交互的Realtime-Venus-Audio。两款模型通过共享因果时间线,整合连续感知、对话控制和原生语音生成。双循环运行环境可在对话持续进行的同时,异步执行后台推理和工具调用。根据公布的评测结果,Omni在8项视频基
计算机使用代理正越来越多地操作浏览器、终端、文件系统和外部服务,由此产生的安全风险往往在运行过程中出现,而不仅存在于生成内容中。HazardAuditor在受控环境中运行Claude Code、Codex、Hermes和OpenClaw等不同代理,并将其交互统一为标准事件表示,以支持跨框架监督。研究人员还提出Guard Policy Optimization,解决基于词元的训练目标容易让较长推理过
一项研究表明,大语言模型后门攻击的成功率高度取决于微调时选择哪些投毒样本。在三种基于 LLaMA-3-8B 的后门设置中,即使模型、干净数据和投毒样本数量完全相同,攻击成功率仍在 3% 到 80% 之间变化。研究人员将投毒数据集选择形式化为预算约束下的集合优化问题,并提出 SAILS。该方法通过数百次微调和评估,学习为数百万个候选数据集排序。与最强的基于影响力的基线方法相比,SAILS 在留出数据
一种新的推理架构旨在让设计代理不仅生成一个有效页面,还能探索多个协调一致的界面方案。该方法没有直接提高采样温度,而是将创意探索与实现过程分离:预处理阶段提出结构化设计规格,由外部选择器选出一个方案,再由下游生成器在固定设置下结合原始请求完成实现。在 168 个提示词的测试中,界面主题和截图的观测多样性有所提升。在超过 30 万个任务的在线实验中,代码导出量的增加尚未达到统计确定性。负面反馈减少,但
这项研究分析了大语言模型智能体如何在推理阶段分配额外算力,包括修改解法、使用工具、探索替代方案以及决定何时停止。研究人员提出每Token Elo分析,跟踪不同Token预算下找到的最佳解,并比较评分尺度不同的任务。在四个智能体和四个开放式基准上的实验表明,智能体起初比独立采样更高效地将Token转化为进展,但边际收益会下降,最终低于该参考水平。相比之下,人类参赛者在类似的优化任务中仍以超线性速度提
原生 3D 生成器通常会将单张图像转换为一个融合的单一网格,但编辑、绑定和仿真需要独立的部件资产。KaiNinja 通过能够表示部件接触界面的双体积表示,将 TRELLIS.2 扩展到部件级生成。该方法无需额外的分割模型即可生成部件级资产,同时保持基础模型的速度和质量。训练数据包括 CAD 模型,以及由 LLM 驱动代理创建的资产。作者称,与采用不同范式的部件生成流程相比,KaiNinja 将完整
Atria Dawn Preview是一款面向科学研究和工程工作流的智能体语言模型。该模型通过“可验证经验管线”训练,将工具交互连接到可执行环境和经外部验证的结果。在涵盖研究、工程和数字工作的16项基准测试中,Atria Dawn的表现可与前沿智能体竞争,并在其中5项取得已公布的最高分。对56名参与者完成的769项任务进行分析发现,人类仍掌握大多数最终决策,而智能体经常提出方法并实施修改。参与者认
OpenAI能力研究员丹·塞尔瑟姆在一份公开的个人人工智能风险声明中表示,顶尖模型似乎正变得越来越具备情境感知能力,这可能使人类更难可靠地评估它们的能力和行为。他还警告称,人们正越来越依赖人工智能来引导研究。这些说法属于个人观点,并未提供证明新能力或重大技术突破的独立证据。
ZGCM-1 是一个完全开放、从零训练的 70 亿参数稠密型基础模型,面向数学推理和智能体搜索。其训练方案支持 256K 上下文,结合交错式门控滑动窗口注意力与全注意力机制,并采用 FP8 Muon 优化器和分阶段上下文扩展。该模型通过有意推理和调用外部工具,弥补小型模型参数容量有限的问题。研究团队称,ZGCM-1-7B 在通用基准测试中具备与同规模 7B 模型竞争的性能,并在部分数学推理和智能体
Vidu S2由Vidu S2-Avatar和Vidu S2-Editing组成,前者是实时交互式数字角色模型,后者是实时视频编辑模型。研究团队还探索了两者进行实时空间视频生成的可行性。与Vidu S1相比,S2-Avatar支持实时生成720p视频,能够使用可随时更新的动态参考内容,并更好地遵循跳舞等指令。S2-Editing可以实时编辑视频流,包括风格渲染以及服装、角色和背景替换。根据公布的实