AI 新闻中心

AI 新闻中心 过去一年分析了 1964 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Enfold将世界模型的想象融入预测表征,实现超高效具身控制

Enfold将生成式世界模型构建未来时所使用的计算,迁移到一种仅根据当前视觉上下文和语言指令预测的表征中。在训练期间,生成器处理观测到的未来时产生的多层中间状态,用于监督仅依赖当前信息的编码器。部署后,系统无需为每个动作运行生成器。在LIBERO、RoboTwin2.0和真实机器人任务上的评估显示,Enfold在保持较强控制性能的同时,相比Fast-WAM将动作延迟降低了3.7倍;Enfold-F

iOS 27 代码显示苹果正开发 Apple Reference Image,以验证 iPhone 照片真实性

据报道,iOS 27 开发者预览版 Beta 5 的代码显示,苹果正在开发 Apple Reference Image 功能,用于验证照片是否确实由 iPhone 拍摄。随着生成式 AI 图像和深度编辑内容越来越难与真实照片区分,该功能可帮助用户判断图像来源。照片将被发送至安全云端环境进行认证,并获得唯一 ID;苹果不会直接访问用户的原始照片。其他苹果设备可在本地检查照片是否仍保持认证状态。苹果还

ChatGPT 在美国和加拿大支持直接通过 Yelp 预订餐厅

Yelp 与 ChatGPT 在美国和加拿大进一步扩大内容合作。用户可以先通过 ChatGPT 获取餐厅推荐,在支持该功能的餐厅中,还能直接在聊天过程中通过 Yelp Reservations 订位或加入候补名单,无需跳转到其他应用或网站。ChatGPT 可协助填写用餐人数、日期、时间、联系方式和特殊需求,并最终确认预约。预订完成后,用户仍可通过 Yelp 修改预约信息。Yelp 还表示,其平台在

CLIP-CC-Bench 评估段落级视频描述能力

CLIP-CC-Bench 是一个用于评估长篇视频描述生成能力的基准,旨在弥补现有评测主要关注短视频片段、单句指标或问答任务的不足。该基准包含 5 小时电影内容,划分为 90 秒片段,每个片段都配有专家撰写的段落式参考描述。研究使用 5 个基于大语言模型的嵌入模型,并结合粗粒度和细粒度语义匹配方法,对 17 个视频语言模型进行评估。同时,研究还分析了评审者间一致性和排名稳定性。评估脚本、模型输出及