Editable Visual Design:支持图层编辑的 AI 视觉设计
Editable Visual Design 提出了一种由 AI 驱动的设计流程,将视觉语言模型的审美判断与 HTML/CSS 提供的精确布局控制结合起来。编程代理利用图像生成模型创建独立的视觉素材,将其组装成可编辑设计,并根据渲染反馈持续迭代优化。该系统生成的作品包含分离图层和真实文本,而不是扁平化位图,因此用户可以通过鼠标直接调整布局。在海报、信息图表等场景中的评估表明,这种方法能够兼顾较高的
AI 新闻中心 过去30天分析了 4661 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Editable Visual Design 提出了一种由 AI 驱动的设计流程,将视觉语言模型的审美判断与 HTML/CSS 提供的精确布局控制结合起来。编程代理利用图像生成模型创建独立的视觉素材,将其组装成可编辑设计,并根据渲染反馈持续迭代优化。该系统生成的作品包含分离图层和真实文本,而不是扁平化位图,因此用户可以通过鼠标直接调整布局。在海报、信息图表等场景中的评估表明,这种方法能够兼顾较高的
“Compile by Training”可将自然语言描述的任务规范转化为可复用的神经函数。在编译阶段,教师模型生成特定任务的示例,用于训练适配器,使其适配一个紧凑型解释器。生成的函数无需教师模型即可运行,并能像普通软件一样存储、版本管理和组合。在 FuzzyBench-Hard 上,对于 Program-as-Weights 快速编译器无法得到任何精确匹配的任务,该方法达到了83.6%的语义准确
谷歌于9月4日开始逐步停用移动设备上的Google Assistant。符合条件的安卓手机和平板电脑将在未来数周内分批自动切换至Gemini,完成迁移后将无法切换回Assistant。此次调整还涉及Wear OS智能手表、受支持的耳机,以及通过手机投屏使用Android Auto的车辆。Google TV和Google Home也将在之后逐步接入Gemini。设备需运行安卓9或更高版本,并至少配备
音视频联合生成模型在画面质量和音画同步方面取得了明显进展,但对镜头切换和对白出现时间的控制仍然有限。Temporal Context Routing(TCR)将结构化脚本中的时间信息映射到音频与视频共享的时间轴上,并把提示词引导传递到两种模态中的对应位置。在200个测试脚本上,TCR将镜头边界平均绝对误差降低了96%,从1.11秒降至0.042秒;0.5秒内对白准确率则从28.3%提升至84.1%
9月3日美东时间上午9时23分左右,ChatGPT、Claude、Grok、Google Gemini和Microsoft Copilot等多项主要AI服务据报出现大范围故障。此次中断据称持续约3小时40分钟,短暂影响了许多海外用户的日常办公和技术服务使用。报道称,中国AI服务在同一时段保持正常运行。中国AI公司智谱在社交平台发文称:“我们还在线。”不过,仅凭此次服务可用性,尚不足以证明中国厂商具
据知情人士透露,Anthropic PBC即将在公司提交首次公开募股文件前,将循环信贷额度扩大至150亿美元。Claude聊天机器人的开发商据称计划在IPO中筹集与SpaceX相当或更高的资金。摩根士丹利正在主导相关流程。
该研究推出了 PACE 数据集,用于评估个性化助手能否判断一个看似合理的请求是否与用户的实际情况相冲突。不同于主要关注执行指令的既有研究,PACE 要求模型从知识库中检索与用户相关的隐含事实,并结合请求识别潜在限制。研究人员还提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤来获取具有决定性的上下文证据。实验结果显示,PaceMaker 在证据检索质量和冲突判断准确率方面
LatentStream是一种面向连续视频理解的框架,旨在让多模态大语言模型在严格的因果性和有限内存条件下进行推理。与将历史视觉信息存储在外部记忆中、需要时再检索的传统方法不同,该系统会将相关证据逐步内化到紧凑的潜在工作记忆中。其层级化设计在固定内存预算下管理短期、中期和长期视觉历史。潜在记忆标记逐步扩大感受范围,以检索并整合历史证据;同时,基于预测置信度的优化机制会共同改进潜在记忆和检索信息。实
蔚来创始人兼CEO李斌在二季度业绩沟通会上表示,资本市场低估了蔚来的价值。他认为,蔚来不仅是一家汽车制造商,也是一家能源和人工智能公司。李斌称,AI产业的发展正通过推高对算力和原材料的需求、加剧技术人才竞争,以及分流投资者注意力和资本等方式影响汽车行业。他还指出,蔚来的全栈自研技术、能源业务,以及持续增长并实现盈利的服务和社区业务,尚未得到充分估值。不过,此次表态主要属于战略层面的企业叙述,并未公
英伟达发布 GeForce Game Ready 616.64 版驱动,重点针对《NBA 2K27》进行优化,并在游戏推出时支持 DLSS 5 3D-Guided Neural Rendering 技术。该驱动还支持《鬼武者:武士之路》等采用 DLSS 和 RTX 技术的最新游戏。英伟达未在更新说明中列出已修复的游戏专属问题或通用问题。驱动适用于运行 Windows 10 或 Windows 11
《华尔街日报》介绍了Hugging Face的发展历程。这家初创公司于2016年推出一款以表情符号命名的青少年聊天机器人应用,后来成为开源人工智能的重要倡导者。首席执行官克莱芒·德朗格表示,他在今年夏天曾接触英伟达,希望推进一项交易。
Puffin-World是一种统一的多模态架构,将物理理解、空间模拟以及3D世界生成与重建整合到单一系统中。它共同建模重力场和纬度等物理状态、由深度表示的几何结构,以及图像形式的外观。统一的Omni-Camera表示支持多种任务和灵活的相机运动。系统在生成未来视角的同时重建其底层几何结构,旨在生成物理一致且视觉稳定的世界。为扩展复杂场景的训练,研究团队构建了Puffin-16M数据集,其中包含15
Random Attention 对根据缓存 Token 未来重要性进行评分和保留的 KV 缓存压缩方法提出质疑。该方法保留提示内容,并在每个注意力头内均匀随机淘汰 Token,完全省去评分计算。在四个模型和六项推理任务上的测试显示,其效果可与此前最强的淘汰方法相当,同时在 vLLM 部署中的吞吐量提升 32% 至 43%。受控实验表明,提示是缓存中最脆弱的部分;推理轨迹则依靠文本中的重复表述以及
曾以字幕分享闻名的人人影视已推出“人人影视分享精彩”App。公司称,正在开发结合翻译和声音克隆的 AI 影视本地化技术,让国产影视作品能够以当地语言呈现。安卓端已经上线,iOS 版本正在准备中。平台计划覆盖 50 多个国家和地区,初期优先向东南亚输出国产影视内容。公司表示,相关技术依托超过 7 万集影视素材,并与华数传媒合作采购正版片源。目前 App 仍处于前期公测阶段,预计月底正式发布。
餐厅经营者可能会把生成式 AI 当作快速美化菜单的捷径。但顾客往往能直觉察觉,菜品或其呈现方式似乎有些不对劲。