EM^2Mem:面向大语言模型的事件中心多模态记忆
EM^2Mem 是一种多模态记忆框架,在构建记忆时将长视频中的异构证据绑定到事件锚点。每个按事件索引的记忆单元整合多模态记录、时间上下文、图关联关系、语义事实和来源信息,使语言模型能够直接读取围绕具体事件组织的紧凑证据,而无需在推理阶段从彼此孤立的片段中重建跨模态和时间对应关系。在三个长视频问答基准测试中,EM^2Mem 相比最强的记忆基线,平均准确率分别提升了2.0、2.4和3.7个百分点。事件
AI 新闻中心 过去一年分析了 1380 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
EM^2Mem 是一种多模态记忆框架,在构建记忆时将长视频中的异构证据绑定到事件锚点。每个按事件索引的记忆单元整合多模态记录、时间上下文、图关联关系、语义事实和来源信息,使语言模型能够直接读取围绕具体事件组织的紧凑证据,而无需在推理阶段从彼此孤立的片段中重建跨模态和时间对应关系。在三个长视频问答基准测试中,EM^2Mem 相比最强的记忆基线,平均准确率分别提升了2.0、2.4和3.7个百分点。事件
GUI 世界模型通常被评估为单步预测下一屏幕的模型,但其预期用途是作为 GUI 智能体的多步交互环境。GUI-CC 评估生成状态在反复用于后续交互时能否保持上下文一致性。该基准包含两条赛道:基于真实移动端 GUI 轨迹构建的 500 个离线任务,以及覆盖 30 个应用、经模拟器验证的 200 个在线智能体循环任务。评估指标包括转移保真度、转移合理性、上下文一致性和任务进度。实验表明,单步生成的屏幕
一项研究考察了已部署 LLM 服务中的安全措施是否真正提升了整个系统的安全性。拒答率、攻击成功率和政策违规率等常见指标,只能说明控制措施在受测试请求上的表现,并不能反映攻击者在调整方法或寻找其他入口后,仍能获得多少有害任务帮助。研究使用统一的部署层面标准比较不同类型的安全措施。一次成功的攻击就足以证明有害帮助仍然存在;但较高的局部评测分数,并不能证明剩余的有害帮助很少。要得出这一结论,还需要了解安
非营利组织费米探索任务宣布,计划在2029年底前发射一艘宇宙飞船前往半人马座,这是距离太阳最近的恒星系统。据报道,该任务将采用PSI人工智能系统发现的飞行轨迹。目前这仍只是已公布的计划,尚未确认发射或任务运行成功。
Anthropic 发布了 Claude Fable 5.1,以及仅向通过审核机构提供的 Claude Mythos 5.1。该公司称,Fable 5.1 在多项基准测试中超过前代模型和 OpenAI 的 GPT-5.6 Sol,在 Terminal-Bench-Science 和 Terminal-Bench 中分别获得 52.6% 和 55.8% 的成绩。采用更宽松安全防护的 Mythos 5
Astra被描述为OpenAI尚未发布的一款新模型,据称已经解决了10个数十年来悬而未决的重要数学问题。不过,现有信息没有提供独立验证或技术成果,这些说法目前仍未得到证实。
Meta AI Research发布了Muse Voice Transcribe,这是Meta Superintelligence Labs(MSL)的首个实时音频感知模型。该模型支持流式自动语音识别,并使用70多种语言进行训练。Meta提供了实时体验该系统的演示。
CoVA-SFT 是一个结构化数据集,包含 51,900 个样本和超过 222,000 个多模态推理步骤,覆盖 5 类布局和 17 项复杂任务。该数据集旨在训练多模态语言模型结合文本、视觉中间表征与验证循环。配套基准 CoVA-Bench 包含 1,700 个留出测试样本。使用 CoVA-SFT 微调的模型平均性能比交错式思维链基线高出两倍以上,但仍落后于强大的纯文本思维链方法。
初创公司PSI正式结束隐身运营,并获得5800万美元种子轮融资,用于开发面向物理学研究的人工智能系统。公司表示,希望将新物理现象和原理的发现转化为可规模化的流程,研究方向甚至包括星际旅行。目前,这一计划主要体现为长期愿景,尚未公布具体科学成果或经过验证的技术突破。
该研究分析社交媒体上的多模态错误信息,即通过结合文字和图像来误导受众的内容。研究人员从 Twitter/X 收集了涵盖七种语言的大规模真实错误信息数据集,并基于定性分析和既有理论研究构建了综合分类体系。随后,他们利用视觉语言模型(VLM)开发多阶段自动标注流程,并通过人工进行验证。研究发现,人工智能生成内容在科技和科学相关的错误信息中尤其常见;而疫苗错误信息则不成比例地使用新闻媒体图片,以增强可信
SpanCalib-VLM是一种用于定位和评估大型视觉语言模型生成的幻觉文本片段的混合系统。该系统将由XLM-RoBERTa-Large和SigLIP视觉编码器组成的多模态序列标注器,与经过微调的生成模型Qwen3.5-4B-SHROOM-SFT结合。通过Union-Calibrated Fusion策略,系统利用序列标注器校准后的概率,对生成模型提出的候选片段重新评分。在SHROOM-Visio
清华大学开放报名2026年秋季学期全校课程《人工智能赋能学术研究:人机互动的知识生产》。课程由清华大学与豆包合作开展,介绍大模型在真实科研流程中的应用,覆盖问题发现、知识综述、数据分析和成果发表等环节。学生可以对AI工具提出反馈,并前往豆包与一线工程师交流。课程中的学术实践方法还将整理为可复用的技能,并上线豆包电脑端。课程面向清华大学全体在校本科生、硕士生和博士生开放。
该研究提出 ContextBias 和 ContextBench,用于评估当职业被置于不同语境中时,文本生成图像模型中的刻板印象视觉关联是否会持续。该基准涵盖 92 种职业和 1,656 个经过语义控制的提示词。研究人员评估了四个先进模型生成的 66,240 张图像,发现与职业无关的语境并未抑制职业相关属性,反而提高了这些属性在不同职业之间的集中程度。人口统计线索、特征性服装和职业专用工具在各种条
研究人员发现,大型语言模型会将写作推向趋同的风格规范,减少语言多样性,并模糊体现作者个性的表达线索。皮尤研究中心称,自ChatGPT于2022年11月发布以来,互联网上发布的网页中有超过三分之一由人工智能生成。同时,网络文字也正变得前所未有地简单。
EvoGenUI-Bench是一项评估大语言模型能否在用户需求持续变化时维护可执行网页界面的基准测试。该测试包含150个五轮任务,共750轮,覆盖信息展示、可执行交互和工具支撑的外部状态三类场景。生成的界面会在浏览器中运行,并通过截图、源代码与DOM证据、操作轨迹及运行日志进行评估。在测试的8个模型中,表现最好的模型单轮通过率为74.9%,但完整完成五轮任务的比例仅为37.3%。在工具支撑任务中,