中国联通与魅族发布4英寸语音交互AI手机“小魔方”
中国联通与魅族发布了AI原生终端“小魔方”,产品重99克,配备4英寸方形屏幕,搭载云智OS,主打语音操控、AI服务、智能通话和端云协同。据介绍,设备可执行点咖啡、控制智能家居等任务,并利用摄像头和大模型识别现实环境中的物体、提供相关信息。通话功能包括中英文实时翻译、AI速记、通话摘要、待办事项生成、无障碍接听和情绪识别。小魔方支持本地手机与云端手机双身份切换,可协同使用应用、数据和算力,并提供2T
AI 新闻中心 过去30天分析了 2428 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
中国联通与魅族发布了AI原生终端“小魔方”,产品重99克,配备4英寸方形屏幕,搭载云智OS,主打语音操控、AI服务、智能通话和端云协同。据介绍,设备可执行点咖啡、控制智能家居等任务,并利用摄像头和大模型识别现实环境中的物体、提供相关信息。通话功能包括中英文实时翻译、AI速记、通话摘要、待办事项生成、无障碍接听和情绪识别。小魔方支持本地手机与云端手机双身份切换,可协同使用应用、数据和算力,并提供2T
OpenAI韩国负责人表示,与三星电子开展的下一代芯片合作进展顺利,但三星电子称无法确认与客户相关的信息。OpenAI还计划继续与韩国半导体供应链企业合作,并在韩国建设AI推理基础设施,以降低跨境数据流动带来的监管风险。公司称,韩国ChatGPT Enterprise、Work、Codex用户以及ChatGPT周活跃用户均大幅增长。
RoboSPA 是一个用于评估机器人操作中视觉-语言-动作(VLA)模型空间推理和程序推理能力的大规模数据集与基准。它涵盖 10 个任务类别、56 个基础任务,以及分布在五个难度等级中的 280 个变体,空间歧义和程序复杂度逐步提升。数据包含来自多种机器人形态和不同场景的 52.7 万条轨迹。除任务成功率外,RoboSPA 还引入了更细致的诊断指标。实验表明,当前 VLA 模型在复杂空间关系、精确
一份技术报告介绍了 AuK,这是一款通过自然语言指令和音频上下文统一语音生成与音频编辑的开源基础模型。该模型使用约 30.3 亿条指令—音频实例进行训练,相当于 195 万小时的有效监督数据,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。AuK 将多模态大语言模型、在语音、通用音频和音乐上联合训练的 VAE,以及混合式 Rectified Flow Transformer 结合
京东宣布启动物理 AI 加速计划,聚焦数据、机器人、制造、销售、物流和服务六大方向。公司计划在两年内采集超过 1,000 万小时的人类真实场景数据,并结合网络、仿真和真实机器人数据,开发具备通用能力的具身智能技术。未来五年,京东计划在中国布局 80 个机器人基地,建设覆盖展示、交付、维修、研发和制造等环节的全生命周期服务平台。此外,公司计划采购超过 300 万台机器人、100 万台无人车和 10
京东物流宣布,未来5年内将采购300万台机器人、100万台无人车和10万架无人机,进一步推进物流全流程自动化。公司还计划建设覆盖全球100多个国家的机器人维修服务网络,并创造超过10万个机器人售后服务工程师岗位。京东零售计划在2028年前投入大量资源,扩大机器人的销售和应用。与此同时,京东正开展员工转型培训,帮助快递员、仓管员和质检员学习机器人维修技能。首批学员已完成培训和岗位认证,并正式转岗为机
TANGO 是一个面向人形机器人的视觉语言导航框架,用于处理障碍物密集的室内环境。不同于将导航简化为二维路径规划,TANGO 会持续调整机器人的全身,包括手臂位置、躯干姿态和步态,以无碰撞方式穿越复杂的三维空间。系统接收自然语言指令和机器人第一视角的 RGB 观测,直接预测包含 29 个自由度的关节空间动作。TANGO 完全在仿真环境中训练,通过全局路径规划、全身运动生成、面向障碍物的动作编辑以及
研究人员提出“程序图”,用于组织大语言模型智能体所需的程序性知识。与仅从不断累积的交互历史中不受约束地生成动作不同,该方法将步骤、关系和条件表示为图结构。在每个决策步骤,指导模型会把相关子图转换为情境化指引,影响智能体的下一步行动,但不会直接规定行动。基于大语言模型的改进循环会比较成功和失败的执行轨迹,并仅采纳能够保持或提升留出验证集性能的图结构修改。研究人员称,在多个数据集、任务类型和语言模型上
中国网络作家唐家三少警告,AI 洗稿和批量生成的低质量内容正在网络文学行业扩散。据称,热门作品的结构可以被拆解,再由 AI 重新填充,48 小时内生成 500 万字。他将这类内容称为“AI 泔水”,并呼吁行业加强自律、完善法规标准、保护青少年,同时明确标注 AI 生成的文字内容。报道引用的相关数据和预测尚未经过独立验证。
智己汽车正式确认了此前曝光的无方向盘车辆。该工程测试车型采用与新一代LS6同源的技术,并使用线控转向,取消方向盘与车轮之间的机械连接,改由电信号控制车轮。全线控四轮转向系统据称可在约20毫秒内执行指令。为提升安全性,系统配备双电源、双通信和双硬件备份;即使前轮转向链路发生双重故障,后轮转向仍可作为额外冗余介入,协助车辆保持稳定并安全停车。智己表示,该系统达到车规功能安全最高等级ASIL D,失效概
CosmoH2G提出了一个数据集和基线方法,用于将人类手部演示迁移到机器人夹爪。该数据集包含1,254种物体的6,189个操作片段,重点覆盖旋转、翻转和复杂轨迹等高空间复杂度动作。所提出的两阶段框架首先预测夹爪的初始和终止稀疏关键帧,然后以此为条件生成完整的连续动作序列。为减轻误差累积,系统学习夹爪的方向,并依据抓取启发式方法和运动学一致性对平移进行后处理优化。作者报告称,在仿真和真实机器人实验中
据博主 @超维界 透露,华为 Pura X View 和 Mate XT 2 手机支持将多模态 AI 模型下载并部署在设备端。用户据称可在约 6GB 的多模态增强模型和约 15GB 的多模态混合专家模型之间选择。两款模型均可在无网络状态下运行,功能包括本地图像生成、语音合成、相机 AI 超清增强、图库修图和人声播报。混合专家模型还可用于复杂任务理解、应用操控以及离线整理照片。相关信息来自博主爆料,
OpenAI 官方状态页面显示,北京时间 9 月 8 日 22:32 至 9 月 9 日 05:59,ChatGPT 和 Images API 的图像生成功能出现故障。用户提交图像生成请求时遇到错误的频率上升,文件上传处理也受到影响:部分文件虽显示上传完成,却一直停留在处理中,另一些上传请求则直接失败。OpenAI 尚未公布具体技术原因、受影响用户数量或预计恢复时间。目前该故障已修复。
GE-Act 2.0是一种用于机器人操作的世界行动模型,通过预测未来状态来指导机器人行动。与许多依赖预训练视频生成模型的系统不同,其生成和行动组件均使用操作数据从零开始初始化和训练。该模型结合了控制导向自动编码器、单步视觉规划器和逆动力学模型。将联合训练数据从300小时扩展到3万小时后,两种机器人平台的成功率分别从17.1%提升至44.1%,以及从13.4%提升至31.1%。性能提升覆盖了大多数技
SceneMosaic是一种高效生成多样化、可用于仿真的室内场景框架,面向互动娱乐和具身智能。该方法先利用从图像中学习的参数化先验生成初始场景,再通过视觉语言模型智能体进行演化和细化。系统将场景拆分为相互独立的局部单元,分别进行优化后再组合成完整场景,从而兼顾生成效率和物理合理性。在SceneEval-100基准测试中,SceneMosaic的语义布局质量与最强的智能体基线相当,但速度提升了24倍