CoVA-SFT:用于视觉抽象链的大规模数据集
CoVA-SFT 是一个结构化数据集,包含 51,900 个样本和超过 222,000 个多模态推理步骤,覆盖 5 类布局和 17 项复杂任务。该数据集旨在训练多模态语言模型结合文本、视觉中间表征与验证循环。配套基准 CoVA-Bench 包含 1,700 个留出测试样本。使用 CoVA-SFT 微调的模型平均性能比交错式思维链基线高出两倍以上,但仍落后于强大的纯文本思维链方法。
AI 新闻中心 过去30天分析了 912 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
CoVA-SFT 是一个结构化数据集,包含 51,900 个样本和超过 222,000 个多模态推理步骤,覆盖 5 类布局和 17 项复杂任务。该数据集旨在训练多模态语言模型结合文本、视觉中间表征与验证循环。配套基准 CoVA-Bench 包含 1,700 个留出测试样本。使用 CoVA-SFT 微调的模型平均性能比交错式思维链基线高出两倍以上,但仍落后于强大的纯文本思维链方法。
初创公司PSI正式结束隐身运营,并获得5800万美元种子轮融资,用于开发面向物理学研究的人工智能系统。公司表示,希望将新物理现象和原理的发现转化为可规模化的流程,研究方向甚至包括星际旅行。目前,这一计划主要体现为长期愿景,尚未公布具体科学成果或经过验证的技术突破。
该研究分析社交媒体上的多模态错误信息,即通过结合文字和图像来误导受众的内容。研究人员从 Twitter/X 收集了涵盖七种语言的大规模真实错误信息数据集,并基于定性分析和既有理论研究构建了综合分类体系。随后,他们利用视觉语言模型(VLM)开发多阶段自动标注流程,并通过人工进行验证。研究发现,人工智能生成内容在科技和科学相关的错误信息中尤其常见;而疫苗错误信息则不成比例地使用新闻媒体图片,以增强可信
SpanCalib-VLM是一种用于定位和评估大型视觉语言模型生成的幻觉文本片段的混合系统。该系统将由XLM-RoBERTa-Large和SigLIP视觉编码器组成的多模态序列标注器,与经过微调的生成模型Qwen3.5-4B-SHROOM-SFT结合。通过Union-Calibrated Fusion策略,系统利用序列标注器校准后的概率,对生成模型提出的候选片段重新评分。在SHROOM-Visio
清华大学开放报名2026年秋季学期全校课程《人工智能赋能学术研究:人机互动的知识生产》。课程由清华大学与豆包合作开展,介绍大模型在真实科研流程中的应用,覆盖问题发现、知识综述、数据分析和成果发表等环节。学生可以对AI工具提出反馈,并前往豆包与一线工程师交流。课程中的学术实践方法还将整理为可复用的技能,并上线豆包电脑端。课程面向清华大学全体在校本科生、硕士生和博士生开放。
该研究提出 ContextBias 和 ContextBench,用于评估当职业被置于不同语境中时,文本生成图像模型中的刻板印象视觉关联是否会持续。该基准涵盖 92 种职业和 1,656 个经过语义控制的提示词。研究人员评估了四个先进模型生成的 66,240 张图像,发现与职业无关的语境并未抑制职业相关属性,反而提高了这些属性在不同职业之间的集中程度。人口统计线索、特征性服装和职业专用工具在各种条
研究人员发现,大型语言模型会将写作推向趋同的风格规范,减少语言多样性,并模糊体现作者个性的表达线索。皮尤研究中心称,自ChatGPT于2022年11月发布以来,互联网上发布的网页中有超过三分之一由人工智能生成。同时,网络文字也正变得前所未有地简单。
EvoGenUI-Bench是一项评估大语言模型能否在用户需求持续变化时维护可执行网页界面的基准测试。该测试包含150个五轮任务,共750轮,覆盖信息展示、可执行交互和工具支撑的外部状态三类场景。生成的界面会在浏览器中运行,并通过截图、源代码与DOM证据、操作轨迹及运行日志进行评估。在测试的8个模型中,表现最好的模型单轮通过率为74.9%,但完整完成五轮任务的比例仅为37.3%。在工具支撑任务中,
一项研究推出了 FACE-Eval,使用5,100个样本评估思维链(CoT)记录是否忠实反映影响模型回答的信息。研究测试了来自8个模型系列的15个开放权重模型,参数规模从40亿到1.60万亿不等。所有模型在接收工具返回内容中的偏好线索时,明确表达受影响程度都低于接收用户消息中的线索,但未明确表达却采纳偏好的比例更高。从原始数据中推断出的隐性线索也呈现类似结果。要求模型标注信息来源的提示,在7个模型
研究人员将端到端天气预报模型Aardvark Weather扩展为概率模型,分别处理两类不确定性。观测编码器中的输入依赖噪声用于表示地球观测系统带来的不确定性,处理器中的蒙特卡洛 dropout则用于捕捉所学习大气动力学的不确定性。嵌套集成模型能够将预报离散度归因于这两种来源。概率微调使不同变量和预报时效的平均预报表现提升4.2%。模型在中期预报范围内保持良好校准,并在所有预报时效上以CRPS优于
该研究提出了 Super Library Agent 问题:基于大语言模型的编程代理需要生成多个相互关联、可独立部署的应用,同时维护一个包含可复用组件的共享库。所提出的方法结合了基于代码摘要的候选引导式提取、提取前的代码库整合,以及利用提取轨迹和调用图信息的上下文感知迁移。在 WebGen-Bench 和 PaperBench 上的评估表明,该方法在保持应用功能的同时,相比零样本方法和简单的库构建
这项研究提出了CE3D++,一个利用大语言模型对3D场景和单目4D场景进行对话式编辑的系统。其Hash-Atlas网络将2D图像编辑与3D重建流程解耦。LLM能够理解用户的自由格式文本指令,并自主调用合适的视觉模型。针对4D场景,研究加入了运动物体约束,并构建了与编辑任务相关的轨迹数据集。据研究人员介绍,较小的LLM可以准确调度最多30种视觉工具。实验显示,该系统支持多样化的编辑效果、场景理解和多
Runway发布了Solaris,这是其“界面世界模型”系列的首个模型。公司称,Solaris能够逐帧实时生成图形用户界面,而不是完全依赖预先编写的代码和固定布局。语言模型负责理解用户意图,世界模型则负责渲染和更新视觉场景。在与根据屏幕截图重建的界面进行比较时,Runway表示,基于超过7500次成对比较,Solaris在指令遵循度和行为自然度方面的用户偏好率分别为61%和71%。该系统建立在Ge
一项研究分析了基于对话历史、推断偏好和用户画像的个性化功能如何影响大语言模型的回答。研究指出,个性化可能使模型从提供平衡、信息丰富的回答,转向优先满足用户。研究团队发现三类风险:在不必要的场景引用个人信息、缩窄用户偏好并强化信息回音室,以及过度赞同用户观点的迎合偏差。研究人员提出了PRISK动态评估框架,结合自动数据生成和定制指标。对13个大语言模型的测试显示,用户画像和检索到的记忆会持续加剧这些
SafeAtlas-VL是一个包含150万条训练样本的数据集,用于以五级尺度评估多模态安全风险。它同时评估图像内容、用户请求和助手回复,覆盖15类危害及55个细分类别。配套的SafeAtlas-Bench包含5,000条留出测试样本。SafeAtlas Guard模型系列既能进行五级安全分类,也能输出连续风险分数。实验显示,80亿参数模型取得了整体最佳表现,在F1分数上约领先此前的最佳方法4%。研