AI 新闻中心

AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

揭示原生统一多模态模型中理解与生成的协同效应

一项研究分析了原生统一多模态模型中视觉理解与视觉生成的相互作用。结果表明,两项目标能够彼此提供有用信号:生成能力可改善理解所需的视觉特征,而理解能力则能增强生成所需的视觉—语言对齐。但当两项目标被迫经过同一计算路径时,其中一方可能占据主导。研究提出按任务专门化视觉计算、同时保留语义交互的架构,以减少这种不对称退化。研究还发现,在依赖共享知识的理解与生成任务之间存在正向迁移。在同时要求图像理解和生成

控制流与数据流分离,提升多智能体大语言模型提示优化的稳定性

一项新的研究框架将多智能体大语言模型系统中的执行关键协议与任务相关语言分离。消息路由、输出格式和终止信号被表示为经过类型定义和验证的程序对象,而提示仍可用于优化任务性能。在合成推理、协作式评审生成和保险定价流程的测试中,该方法实现了100%的最终协议有效性,并持续提升了任务表现。

EM^2Mem:面向大语言模型的事件中心多模态记忆

EM^2Mem 是一种多模态记忆框架,在构建记忆时将长视频中的异构证据绑定到事件锚点。每个按事件索引的记忆单元整合多模态记录、时间上下文、图关联关系、语义事实和来源信息,使语言模型能够直接读取围绕具体事件组织的紧凑证据,而无需在推理阶段从彼此孤立的片段中重建跨模态和时间对应关系。在三个长视频问答基准测试中,EM^2Mem 相比最强的记忆基线,平均准确率分别提升了2.0、2.4和3.7个百分点。事件

GUI-CC:评估 GUI 世界模型作为智能体环境的上下文一致性

GUI 世界模型通常被评估为单步预测下一屏幕的模型,但其预期用途是作为 GUI 智能体的多步交互环境。GUI-CC 评估生成状态在反复用于后续交互时能否保持上下文一致性。该基准包含两条赛道:基于真实移动端 GUI 轨迹构建的 500 个离线任务,以及覆盖 30 个应用、经模拟器验证的 200 个在线智能体循环任务。评估指标包括转移保真度、转移合理性、上下文一致性和任务进度。实验表明,单步生成的屏幕

Anthropic发布Fable 5.1,AI模型价格战升温

据报道,Anthropic已发布新一代旗舰模型Fable 5.1,并向拥有相应访问权限的用户提供Mythos 5.1。该公司称,Fable 5.1在多项基准测试中超过上一代Fable 5及竞争产品,并重点提升了处理长时间、复杂智能体任务的能力,适用于编程、研究和知识工作。Anthropic表示,按Token计费的典型工作负载平均成本较上一代降低约25%,高强度智能体任务的成本降幅最高可达45%。不

Meta发布首个实时音频感知AI模型,支持20余人分轨转写

Meta推出Muse Voice Transcribe,这是其首个实时音频处理模型。开发者可通过Meta Model API调用,价格为每1000分钟音频3美元。该模型将流式自动语音识别、说话人分离和端点检测整合在同一流程中,可在用户说话时同步输出文字。它能在包含20多名说话人的录音中区分不同发言者,支持超过1小时的音频及句内、句间的自然语言切换。模型训练覆盖70多种语言,发布时已有25种语言完成