从感知到行动:作为第一人称智能平台的智能眼镜
这篇综述将智能眼镜定义为连接人类感知、持续性上下文以及数字或物理行动的系统。文章强调其必须在能耗、散热、隐私和反馈等严格约束下运行,并整合增强现实、第一人称视觉、多模态模型、人机交互和具身智能等领域的分散研究。作者提出八个可验证的硬件能力维度,梳理七项基础能力,并建立从数据采集、反应式感知、情境辅助、持久状态到受治理行动和具身耦合的L0-L5框架。研究还覆盖九类应用场景,提出基于具体主张的评估协议
AI 新闻中心 过去一年分析了 4135 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
这篇综述将智能眼镜定义为连接人类感知、持续性上下文以及数字或物理行动的系统。文章强调其必须在能耗、散热、隐私和反馈等严格约束下运行,并整合增强现实、第一人称视觉、多模态模型、人机交互和具身智能等领域的分散研究。作者提出八个可验证的硬件能力维度,梳理七项基础能力,并建立从数据采集、反应式感知、情境辅助、持久状态到受治理行动和具身耦合的L0-L5框架。研究还覆盖九类应用场景,提出基于具体主张的评估协议
印度语音人工智能初创公司 Ringg 已从 Peak XV 融资 1000 万美元,这是其 A 轮融资扩展轮的一部分。
TorchMorph 是一个轻量级 PyTorch 扩展,用于二值和灰度形态学处理、距离变换以及熵正则化最优传输。该项目提供 22 个运算符,均以融合 CUDA 内核实现,可直接处理最多包含 8 个空间维度的 CUDA 张量。其 API 逐参数兼容 scipy.ndimage,便于现有流程迁移。作者称,与单线程 CPU 参考实现相比,TorchMorph 在灰度形态学处理上的吞吐量最高提升 1,1
腾讯发布 WeMM-Embedding 多模态嵌入模型系列,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。该系列包含 2B、4B 和 9B 参数版本,并公开模型权重和代码。根据技术报告,2B 版本在 MMEB-v2 上超过了此前领先的 8B 开源基线模型;9B 版本则以 80.6 的综合得分取得新的最高成绩。腾讯还表示,该模型在 26 项内部任务和 14 项线上 A/B 测试中均带来改进
小米此前驾驶搭载自动驾驶技术的 YU7 GT,以 10 分 29.483 秒完成纽博格林赛道一圈,创下该赛道首个自动驾驶圈速纪录。如今,梅赛德斯-AMG 似乎也开始进行类似测试。被拍到的 GT 63 原型车车顶安装了三个传感器,先以极低速沿赛道两侧行驶,收集地图和圈速数据。首次完全脱手驾驶时,车辆采取非常保守的策略,严格限制加速并提前制动,用时不到 20 分钟。第二圈比第一圈快了几分钟,但据报道仍
腾讯集团高级执行副总裁、云与智慧产业事业群CEO汤道生在内部刊物上表示,AI竞争是一场马拉松,而不是短跑。他承认,腾讯在大模型迭代和产品落地方面受到算力不足及各业务线进度不一的影响。汤道生认为,长期投入、把握真实应用场景以及工程能力,比率先进入市场更重要。他还表示,这篇文章由他与AI协同完成,AI正从单纯的执行工具转变为辅助思考的协作伙伴。
特斯拉中国否认其为 FSD 监督版进入中国市场筹备的上海数据中心已经撤离、相关团队全部离开的说法。公开信息显示,特斯拉仍在推进中国市场的数据合规和本土化适配,上海数据中心已实现境内数据留存,上海临港 AI 训练中心也于 2026 年 2 月投入运营。中国目前尚未开放 FSD 监督版订阅服务,因此未列入可订阅地区;但在特斯拉公布的实际可使用市场名单中,中国仍然在列。现有公开信息无法证明特斯拉已经停止
谷歌可能为 Android XR 新增“聆听区域”设置。媒体通过逆向拆解 Google 翻译安卓版 10.32.66,发现了相关文本字符串。该功能预计提供“仅前方”和“周边区域”两种麦克风模式。“仅前方”将集中翻译用户正前方的语音,适合一对一对话,也可能减少背景噪声;“周边区域”则用于拾取附近范围内的语音,可能调用 Android XR 智能眼镜的完整麦克风阵列。目前谷歌尚未正式公布该功能。
一项研究探讨掩码扩散语言模型在机器翻译中如何确定目标序列长度。研究提出无需训练的 Entropy-Valley(EV)方法,通过全掩码前向推理得到的平均预测熵,对候选输出长度进行评估。与依据训练语料长度统计的基线相比,EV 恢复了使用参考目标长度时 COMET-22 改进幅度的相当一部分。在英中、中英和英德翻译实验中,适合去噪的长度不一定与参考长度一致。与使用相同微调数据训练的自回归 LLaMA-
开发者 Angel 展示了《毁灭战士》在 Codex-R32 定制 CPU 上运行的画面。该处理器由 GPT-5.6 Sol 模型设计,并在计算机科学教育与解谜沙盒 Turing Complete 中实现。演示视频将游戏画面与 CPU 电路的实时可视化信息叠加显示,内容包括逻辑门、寄存器、内存和算术逻辑单元(ALU)。运行的游戏是使用 C 语言编写的 PureDOOM 移植版,编译为原生 RV32
印度IT服务公司Hexaware Technologies首席执行官表示,人工智能可能使常规IT项目的价格最多下降25%。这一估计凸显了该技术可能对高度依赖劳动密集型任务的IT行业产生的影响。
AutoSaddler 是一个用于自动改进大语言模型智能体 Harness 的框架。它将 Harness 优化定义为离线学习问题,利用小批次中的失败信号来调整提示词、工具配置和控制逻辑。系统会诊断失败轨迹,将 Harness 视为代码生成结构化补丁,并通过验证选择更新方案。在 GAIA2、SWE-Bench Pro 和 Terminal-Bench 2.0 上,相较于对应的基础 Harness,性
CAFE(Coupled Agent–Feedback Evolution)通过交替训练搜索智能体和批评器,使二者共同改进。该框架学习智能体应在何时请求反馈,以及如何利用反馈在错误累积前修正正在进行的搜索轨迹。它结合在线强化学习与离线偏好优化,从成功和失败的轨迹中学习反馈策略。在七项智能体搜索基准测试中,CAFE平均优于所评估的基于强化学习的搜索智能体,在六项域外基准测试中保持性能提升,并减少了答
Meta^n是一种递归改进大语言模型代理的方法。它不修改执行自我改进的操作,而是将一个固定操作反复应用于自身生成的结果。系统读取下层求解器堆栈的执行轨迹及生成这些轨迹的代码,然后将下一层构建为策略性预处理流程和可调用辅助函数库。固定操作旨在避免系统失稳,而不断增长的输入则让每一层能够从更高层次进行推理。递归深度由收敛情况决定,进化式存档则搜索不同的层级链。作者称,在两个基础模型和八类基准测试中,M
Recuris是一种面向长期任务AI代理的经验记忆与工作记忆架构。工作记忆负责跟踪任务进度,并从经验记忆和技能记忆中选择相关技能,而不是依赖完整的交互历史。系统利用执行数据定位失败原因,并进行经过验证的记忆更新。在四项基准测试和十个模型上,作者报告称,已完成的37个模型—基准组合中有35个实现了任务成功率提升。在tau-bench上,GPT-5.6 Sol提升17.8个百分点,Claude Opu