AI 新闻中心

AI 新闻中心 过去24小时分析了 191 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

UltraText Bench:全面评估图像生成中视觉文本呈现的双语基准

UltraText Bench 用于评估图像生成模型在英文和中文场景中呈现密集文本的可靠性。该基准包含 432 个提示,涵盖 24 类真实场景和三个难度等级。每个提示为四至十二个文本区域提供精确字符串,以及内容、位置和视觉属性的结构化参考。视觉语言模型 Q-Judger 评估文本保真度、清晰度、空间质量和场景质量。对 24 种模型配置的测试显示各有优劣:Z-Image-Turbo 的清晰度比 Z-

AMD CEO苏姿丰访韩,会见三星电子联席CEO全永铉

AMD CEO苏姿丰在首尔与三星电子联席CEO全永铉会面,双方会谈超过三小时。苏姿丰称三星是优秀的合作伙伴,表示双方持续进行战略讨论,合作范围广泛,但未透露物理AI合作的具体细节。今年3月,两家公司签署谅解备忘录,将在HBM4内存和服务器DDR5领域合作。业内人士推测,AMD可能希望扩大HBM供应,三星则可能寻求增加晶圆代工订单。

谷歌以开源 EmbeddingGemma2 将多模态离线搜索带到手机

谷歌发布了 EmbeddingGemma2,这是一款拥有 7.4 亿参数的开源多模态嵌入模型。据谷歌介绍,完整模型的内存占用不到 600MB,能够将文字、代码、图片、视频和音频映射到同一语义空间,从而在手机、笔记本电脑和浏览器上进行不依赖云端上传的语义搜索。模型支持 8K 上下文窗口和 100 多种语言。谷歌声称,它在图片、视频和代码检索任务上的表现优于同等规模的开源模型,但目前的介绍没有提供独立

阿里巴巴蔡崇信:AI将转为隐性基础设施,知识工作者潜在市场规模达50万亿美元

阿里巴巴董事长蔡崇信在 Wave by Vento 2026 表示,未来五年,AI可能从显性的热门话题转变为融入企业运营的基础设施。他认为,提升知识工作者生产力是AI最明确的应用机会之一,并将其潜在市场规模估为50万亿美元。蔡崇信称,阿里巴巴将聚焦电商及覆盖算力、模型和应用的全栈AI战略。他还提到,中国的制造业数据和硬件供应链可能构成优势,并强调开源AI的重要性。

传三星因盈利困难将退出车载应用处理器业务

据韩国媒体报道,三星系统LSI事业部计划在完成与现代汽车和宝马的现有供货合同后,停止Exynos Auto车载应用处理器的研发和量产。高昂的研发成本、严格的汽车安全要求、较低的芯片售价以及高通的市场主导地位,使该业务难以盈利。三星据称将把资源转向图像传感器、移动处理器及其他芯片业务。

OpenAI 奥尔特曼:为换取 AI 的巨大红利,世界应接受部分负面影响

OpenAI 首席执行官萨姆·奥尔特曼在接受 Politico 播客《Decoded》采访时表示,社会应接受 AI 带来的一些负面后果,以换取技术收益和用户自主权。他主张采取较宽松的监管方式,并承认社会在探索系统韧性的过程中可能发生不好的事情。奥尔特曼认为,AI 的好处远远超过弊端。批评者则指出,AI 已带来失业、环境影响、版权侵权以及能源和水资源需求上升等问题。纽约大学荣誉教授加里·马库斯批评奥

WorkBuddy上线独立文件浏览器,可直接用AI处理本地文件

腾讯WorkBuddy上线独立文件浏览器。用户可通过“打开方式”选择WorkBuddy,查看或编辑Word、Excel、PPT、PDF、Markdown和HTML文件。侧边对话窗口保留每个文件各自的上下文,用户可让AI改写、润色或补充选中段落,支持格式的修改也可保存回本地文件。查看和编辑不消耗积分,调用AI能力则按任务计费。WorkBuddy只读取用户主动打开或添加的文件,不会扫描电脑磁盘。

微软确认 Copilot+ PC 品牌将继续,称全球每月本地 AI 推理超 2 万亿次

微软表示不会放弃 Copilot+ PC 品牌。Windows 与设备业务负责人帕万·达武卢里称,该系列每年出货数千万台,占商用笔记本电脑的 40% 以上。微软称,这些设备每月进行超过 2 万亿次本地 AI 推理,应用于搜索、图像处理和视频通话等场景。公司计划通过所谓的“混合智能”,加强本地上下文理解、代表用户执行设备操作以及调用本地模型等能力。

VepAgent结合工具增强强化学习预测视频事件

VepAgent是一种用于预测视频未来事件的智能体框架,将因果推理与工具增强强化学习结合起来,以推断已观察场景与后续事件之间的转变。该方法使用FutureBench-4K数据集进行监督微调,并在推理时调用状态跟踪、帧检索和图像区域放大等工具。据论文报告,在FutureBench和NEPBench评测中,VepAgent取得领先表现,优于规模更大的多模态语言模型。相关结论基于论文所述的基准测试。

AdSpark:面向产品中心广告视频生成的大规模数据集与基准测试

AdSpark 是用于 AI 广告视频生成的数据集与基准测试,旨在保留产品细节,并通过连贯的多镜头叙事呈现产品卖点。AdSpark-300K 包含约 30 万组图像、提示词和视频数据,涵盖真实数据与合成数据。结构化标注包括产品身份、卖点描述、创意方案及配套音频脚本。AdSpark-Bench 从六个维度评估生成广告,包括视觉质量、产品保真度、时间连贯性和音频对齐。对代表性模型的评测显示,产品保留和