ChatGPT 移动端新增语音智能体功能,可撰写文档、总结邮件
OpenAI 将为 ChatGPT 移动端新增语音智能体功能。Pro 和 Plus 订阅用户可用其创建文档、撰写电子邮件和总结 Slack 消息,还可执行创建网站、制作演示文稿和使用云端浏览器等进阶任务。Free 和 Go 用户则可使用插件及已连接的应用。OpenAI 表示,语音对话将提供更丰富的文本输出;Plus 用户还可以更方便地切换文本与语音,并将在手机上开始的工作转到电脑上继续。
AI 新闻中心 过去7天分析了 1091 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI 将为 ChatGPT 移动端新增语音智能体功能。Pro 和 Plus 订阅用户可用其创建文档、撰写电子邮件和总结 Slack 消息,还可执行创建网站、制作演示文稿和使用云端浏览器等进阶任务。Free 和 Go 用户则可使用插件及已连接的应用。OpenAI 表示,语音对话将提供更丰富的文本输出;Plus 用户还可以更方便地切换文本与语音,并将在手机上开始的工作转到电脑上继续。
特斯拉已开始向北美搭载 HW3 硬件的 Model S 和 Model X 推送 FSD v14.2 Lite。该更新是面向 HW4 的 FSD v14 技术栈的精简版,针对 HW3 较有限的算力和摄像头硬件进行了调整。目前推送仍处于小范围分批阶段,收到更新的车辆数量很少。HW3 车型将获得从停车位起步、抵达目的地后自动泊车和倒车等功能。HW4 版本中的自动碰撞规避等功能未包含在 Lite 版中。
小米在中国开启智能摄像机 5 Pro 全彩夜视版众筹,活动期间众筹价为429元。该产品搭载8MP和4MP双摄像头,支持4K视频拍摄。夜间默认使用黑白成像,检测到人或宠物后,会自动开启内置柔光灯并切换为彩色画面。其本地AI功能包括人形与宠物检测、移动追踪、事件记录和提醒。设备配备1.5TOPS算力芯片,可运行更复杂的检测算法。此外还支持远程云台控制、手势通话、双向语音、Wi-Fi 6,以及micro
特斯拉 Android App 最近一次更新中发现的 3D 素材,似乎展示了尚未正式亮相的 Optimus Gen 3。与 Gen 2.5 原型机相比,渲染图显示其髋部和关节护罩经过重新设计,外部面板贴合更紧,整体造型也更加简洁。特斯拉称,Gen 3 的双手拥有 22 个自由度。不过,这些图片并非正式产品发布,相关性能和生产目标仍应谨慎看待。报道称特斯拉正在准备 Optimus 生产设施,但 Ge
Meta 在 Connect 发布多款设备,并宣布将个人智能体 Muse 接入智能眼镜。用户可通过语音唤起 Muse,获取运动指导、记录饮食或寻求购物帮助。新品包括起售价 349 美元、没有摄像头的 Ray-Ban 音频眼镜,以及起售价 449 美元的新款 Ray-Ban Meta。Meta 还展示了计划于 2027 年推出的轻量 VR 眼镜,以及尚未公布价格的 Muse Charm。Muse 目
中国大陆约190家上市芯片制造商的净利润总额在2026年上半年同比增长620%。分析指出,人工智能热潮以及中国推动半导体自主化的行动是增长的主要驱动力。
Anthropic称,公司在8月将Claude.ai和Claude桌面应用部分核心用户体验的速度提升至约3倍。团队借助内部模型,在为期两周的冲刺中完成了这些改进。其做法是先测量性能瓶颈,再针对性地进行优化。
腾讯混元推出“腾讯 Hy 翻译”App,同时提供小程序、插件和 PC 端版本。该应用基于 Hy-MT2 翻译模型,支持 33 种语言互译,涵盖 5 种中国少数民族语言及方言,并提供语音、拍照和离线翻译。用户可将模型预先下载到手机,在无网络连接时使用。Hy-MT2 已于今年 5 月开源,并支持在移动设备本地部署。该应用目前已在 12 个国家和地区上线。
中国直播电商正从高速扩张转向更加注重效率与盈利的阶段。据路透社专题报道,行业年度商品交易总额逼近7万亿元,2025年线上零售额占整体零售额超过36%。商家加速采用AI生成的数字主播。京东于2025年12月向商家免费开放AI主播服务,据称可降低80%至90%的直播运营成本。抖音等平台要求标注AI生成内容,并禁止未经真人监督、完全由AI生成的直播。业内人士认为,AI主要是提升效率的工具;真人主播在即时
智元称,已将第2万台通用具身智能机器人远征A3 Ultra交付长隆集团。公司表示,自今年3月产量突破1万台以来,约用6个月达到2万台。横琴长隆飞船乐园也将常态部署300多台智元机器人,承担游客互动、导览、演出和科普教育等工作。双方还成立联合研究机构,开展文旅场景适配、算法迭代和商业验证。文中产量及部署数据为企业披露信息,尚未经过独立核实。
华为于9月24日推出小艺Work,支持鸿蒙手机、平板和电脑,可用于市场调研、文档处理、PPT制作、数据分析、内容创作和编程等任务。用户提出目标后,产品可拆解任务、调用相应工具并展示执行进度,供用户查看和确认。任务可在云电脑或本地电脑上运行;用户离开电脑后仍可继续执行,结果会在设备间同步。首次使用的用户可在31天内获得1000个AI点。此次上线将小艺从语音和对话助手扩展至可执行多步骤办公任务的产品。
表示自编码器(Representation Autoencoder)使扩散模型能够在预训练视觉编码器的特征空间中运行。然而,许多现成编码器并未针对忠实重建进行优化,因此会丢弃细微的视觉细节。为重建任务微调编码器可以恢复这些细节,但也会降低表示的有效维度并改变其几何结构。研究发现,在这种情况下,流匹配中的标准速度预测要求模型拟合信号低维流形之外的正交噪声方向,导致优化效率低下。改为预测干净数据x₀,
腾讯混元研究团队探讨了在线大模型强化学习中的批大小调整问题,重点关注生成与训练扩展速度不一致的情况。研究将经典临界批大小理论应用于这一场景,发现对于PPO和GRPO,只要相应调整学习率,就能在有限范围内扩大批大小,同时保留每条响应的学习效果。在固定硬件配置下,扩大批大小使PPO生成吞吐最高提升2.29倍。测试中表现最佳的GRPO配置则以少29%的时间达到相同验证目标。研究为提高在线强化学习训练效率
《金融时报》记者 Rafe Rosner-Uddin 采访思科总裁兼首席产品官 Jeetu Patel,讨论面向AI基础设施的数十亿美元网络交易、与英伟达等合作伙伴的竞争,以及这项技术带来的风险。Patel谈到思科对AI的坚定信心。
研究发现,联合多模态扩散 Transformer 存在一种不对称性:音频或 3D 身体动作等伴随模态与视频的对应关系较强,但它们对视频生成的约束作用明显较弱。研究团队提出 RecCAR,即互惠跨模态注意力正则化,通过 KL 正则项,让较弱的“模态到视频”对应关系向较强的“视频到模态”对应关系靠拢。在视频-动作和视频-音频联合生成任务中,人体解剖评分从 0.69 提升至 0.75,音视频不同步程度则