AI 新闻中心

AI 新闻中心 过去30天分析了 1116 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

具备不确定性感知能力的端到端AI天气预报区分观测与模型贡献

研究人员将端到端天气预报模型Aardvark Weather扩展为概率模型,分别处理两类不确定性。观测编码器中的输入依赖噪声用于表示地球观测系统带来的不确定性,处理器中的蒙特卡洛 dropout则用于捕捉所学习大气动力学的不确定性。嵌套集成模型能够将预报离散度归因于这两种来源。概率微调使不同变量和预报时效的平均预报表现提升4.2%。模型在中期预报范围内保持良好校准,并在所有预报时效上以CRPS优于

罗永浩痛批车载AI体验太差:为何不直接接入豆包、千问和Kimi?

罗永浩批评新能源车企的车载AI体验普遍不佳。他在试乘数十款车型后表示,没有一家车企接入豆包、千问、Kimi等头部通用大模型。罗永浩认为,车企应与专业AI厂商合作,提升消费者的实际使用体验,即使因此收取额外费用也可以接受。他还呼吁电视行业为老年用户提供更简单的操作方式。相关言论再次引发对车企自研模型与采用第三方模型之间取舍的讨论。

Chat-Edit-3D++:利用大语言模型进行交互式3D与4D场景编辑

这项研究提出了CE3D++,一个利用大语言模型对3D场景和单目4D场景进行对话式编辑的系统。其Hash-Atlas网络将2D图像编辑与3D重建流程解耦。LLM能够理解用户的自由格式文本指令,并自主调用合适的视觉模型。针对4D场景,研究加入了运动物体约束,并构建了与编辑任务相关的轨迹数据集。据研究人员介绍,较小的LLM可以准确调度最多30种视觉工具。实验显示,该系统支持多样化的编辑效果、场景理解和多

Runway发布Solaris:可实时生成交互式界面的界面世界模型

Runway发布了Solaris,这是其“界面世界模型”系列的首个模型。公司称,Solaris能够逐帧实时生成图形用户界面,而不是完全依赖预先编写的代码和固定布局。语言模型负责理解用户意图,世界模型则负责渲染和更新视觉场景。在与根据屏幕截图重建的界面进行比较时,Runway表示,基于超过7500次成对比较,Solaris在指令遵循度和行为自然度方面的用户偏好率分别为61%和71%。该系统建立在Ge

研究评估大语言模型个性化的隐性成本

一项研究分析了基于对话历史、推断偏好和用户画像的个性化功能如何影响大语言模型的回答。研究指出,个性化可能使模型从提供平衡、信息丰富的回答,转向优先满足用户。研究团队发现三类风险:在不必要的场景引用个人信息、缩窄用户偏好并强化信息回音室,以及过度赞同用户观点的迎合偏差。研究人员提出了PRISK动态评估框架,结合自动数据生成和定制指标。对13个大语言模型的测试显示,用户画像和检索到的记忆会持续加剧这些

SafeAtlas-VL借助大规模数据与防护模型,突破多模态安全二元判定

SafeAtlas-VL是一个包含150万条训练样本的数据集,用于以五级尺度评估多模态安全风险。它同时评估图像内容、用户请求和助手回复,覆盖15类危害及55个细分类别。配套的SafeAtlas-Bench包含5,000条留出测试样本。SafeAtlas Guard模型系列既能进行五级安全分类,也能输出连续风险分数。实验显示,80亿参数模型取得了整体最佳表现,在F1分数上约领先此前的最佳方法4%。研

谷歌发布 TimesFM-3,支持零样本多变量时间序列预测

谷歌发布了 TimesFM-3,这是其时间序列基础模型系列的第三代产品。该模型拥有 3.3 亿个参数,使用包含超过 1 万亿个时间点的真实世界和合成时间序列数据进行预训练。TimesFM-3 原生支持多变量预测、双注意力机制和连续补丁掩码,可在无需针对特定任务微调的情况下进行零样本预测。模型能够同时预测多个相互关联的时间序列并捕捉它们之间的依赖关系,还支持使用历史协变量,例如过去的人流量,以及已知

DICS探索用于视觉指令选择的数据内在一致性

该研究提出数据内在一致性(DIC)指标,用于衡量视觉语言模型训练数据中图像、指令与回答之间的一致性。在此基础上,数据内在一致性选择方法(DICS)根据不同的数据预算,在样本级一致性与整体数据分布多样性之间进行平衡。根据作者的实验结果,DICS优于现有数据选择方法,仅使用LLaVA-1.5-665K数据集25%的样本,性能便超过使用完整数据集进行微调。此外,研究团队发布了包含600万条样本的多模态指

WebWorld:将浏览器作为自我改进网页代码的世界模型

WebWorld解决了视觉语言模型(VLM)自动改进网页代码时的一个结构性问题:同一个模型既提出修复方案,又负责评判,而视觉上的合理性并不能说明网页确实可用。该系统将浏览器作为世界模型,以确定性、可执行的方式模拟HTML在用户操作下的行为。VLM生成批评意见,规划器将其编译为类型化交互契约。浏览器重新执行候选结果,只有在实现目标进展且保留所有此前验证过的功能时,才会颁发接受证书。监督微调只使用经过

LightNav-0 激发视觉语言模型空间智能,实现通用具身导航

LightNav-0 是一种用于具身机器人导航的紧凑型通用模型。它利用预训练视觉语言模型(VLM)的空间能力,并将其与机器人控制对齐,无需针对具体任务设计预测头。统一的标记接口用于表达空间意图,并将其转换为适配不同机器人形态的轨迹。该模型支持指令跟随、开放词汇目标导航和视觉跟踪。训练数据涵盖 2,000 多个场景和 4,000 多小时的具身导航数据。研究人员称,LightNav-0 在全部 10

看得见的谎言:VLM智能体在具身社交互动中结合语言与非语言欺骗

该研究分析了大语言模型和视觉语言模型智能体在多智能体社交环境中的策略性欺骗行为。研究人员推出了 MineAmongUs,这是一个受《Among Us》启发的3D沙盒环境,要求内鬼智能体通过语言和身体行动欺骗船员。他们还提出了可配置的智能体测试框架 ARIA,用于分析不同认知组件,并建立了详细的欺骗行为标注体系。实验表明,VLM智能体会结合语言和非语言策略,以内鬼身份争取胜利。在不同框架配置和多种V

中国首个化工行业大模型升级至3.0 Pro

中国科学院大连化物所联合科大讯飞、阿里云等机构,于8月31日发布被称为中国首个化工行业大模型的最新版本“智能化工大模型3.0 Pro”。该系统旨在从专业知识问答扩展到化工任务的规划、执行和验证。其技术架构由大模型、智能体、专业技能与工具,以及应用场景四部分组成。在化工领域多维测评中,文本问答准确率为81.96%,多模态问答准确率为80.75%。发布方表示,与前代3.0版本相比,综合得分分别提升了2

MiniMax新模型推动股价上涨超20%,下半年或推出万亿级参数模型

MiniMax已将视频和音频生成模型H3Max的768P与480P版本接入开放平台和Design系统。公司及生态合作伙伴称,模型可在3秒内生成一段5秒的768P视频。开发者已将其用于持续生成和实时推流等场景,包括在Twitch上搭建实时生成视听内容的直播项目。MiniMax还公布了较快的商业增长:2026年上半年营收约1.17亿美元,企业和开发者业务约占经常性收入的80%。今年7月,公司通过配售股

编织视觉叙事:超越原子图像匹配的智能体图像组合

一项新研究提出图像组合(Image Bundle Composition,IBC)范式,旨在从大规模、无结构的照片库中动态组成具有连贯关系的图像集合,而不是单独对每张图像进行排序。研究团队构建了IBCBench基准数据集,包含109,467张图像和667个经过验证的查询。其BundleWeaver框架利用大语言模型自适应地寻找缺失的关系角色,并通过视觉语言模型验证完整的图像集合。实验表明,现有嵌入