智谱发布并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型。该混合专家模型总参数量为3200亿,实际激活参数为180亿。正式发布前,模型曾以匿名名称Ox Alpha在OpenCode和OpenRouter上进行测试。智谱称,该模型在Artificial Analysis Intelligence Index中获得57分,与Claude Opus 4.8持平
机器人的硬件已经逐步成熟,但其人工智能系统仍被认为落后于需求。开发者正致力于提升机器人智能,使其能力超越GPT-2等早期语言模型。
MoTE是一种面向视频语言模型的解码器架构,将大语言模型的前馈网络转化为面向不同任务的专家,同时共享多模态骨干网络。与令牌级路由不同,每个样本根据任务采用明确的路由,因此实际计算量不受存储专家数量影响。在五项COIN基准测试中,VideoLLM-MoTE每个样本激活约20亿个语言模型参数,平均Top-1准确率高于近期VideoLLM基线模型。在相同专家结构下,它还优于密集激活所有专家和学习式稀疏路
CyberFactory 是一个开源框架,可将包括 CVE 在内的公开漏洞资料转化为用于概念验证生成、漏洞修复和网络安全问答的可执行、可验证任务。该框架通过工具交互、源代码检查、领域知识引导的问题解决以及基于执行结果的验证,生成智能体式训练数据。研究人员利用这些轨迹训练了防御导向模型 Aegis,使其在推理时无需额外技能即可掌握相关流程。在 CyberGym 上,Aegis 在一小时限制下取得 5
LAWA是一种世界动作模型架构,通过紧凑的潜在动作表示未来意图,而不是在推理时生成未来观测或视频。该方法在保留未来规划优势的同时降低了延迟。在RoboCasa上,LAWA在少样本设置下取得65.6%的平均成功率,在完整数据设置下达到80.8%,分别比匹配的Fast-WAM基线高9.6和4.5个百分点。与匹配的Joint-WAM变体相比,LAWA保持了相当的性能,同时将推理延迟降低42.9%。此外,
麻省理工学院开发的“CrysVCD”工具,有望大幅减少筛除化学性质不稳定材料设计所需的时间和成本。
随着AI广泛应用于翻译和实时跨语言交流,外语是否仍值得系统学习引发讨论。北京理工大学学者表示,AI可以替代外语学习的部分工具性功能,但难以取代文化理解、跨文化共情和人文学科能力。该校正在推进实验语言学、计算机辅助翻译、数据驱动的语用学和认知神经科学等跨学科课程,并开设外语与人工智能、车辆工程及计算机科学相结合的双学位和研究方向。文章认为,兼具外语能力与其他专业技能的人才可能更具竞争力,但这一判断主
一项对大语言模型训练过程的分析指出,婴儿学习语言的速度远远超过当前的 AI 聊天机器人,所需数据也少得多。幼儿接触约 1000 万至 3000 万个词后,就能开始说出清晰、可理解的句子;如果用同等规模的文本训练 GPT-2,得到的可能只是一个胡言乱语生成器。研究人员认为,这种效率差距是 AI 行业必须面对的根本难题,尤其会挑战那些试图仅通过不断扩大模型规模和训练数据来实现人类水平 AI 的路线。
Artificial Analysis 与 Liquid AI 发布了面向手机端的 AI 跑分基准,重点评估模型在 iPhone 17 Pro 上的表现。测试对象为 4 bit 量化后容量不超过 8GB 的模型,采用 BFCL、IFBench、AA-Omniscience、GPQA Diamond 和 MATH-500 五项基准。Artificial Analysis 负责模型能力评测,Liqui
美国国家经济研究局的一项调查显示,超过90%的美国企业高管表示,过去三年AI没有影响自家公司就业情况;约89%的人还表示,AI对生产力完全没有影响。尽管如此,企业仍在持续投资AI并削减岗位。研究人员警告,以AI为裁员理由可能损害员工士气和对AI的态度,从而抵消潜在的生产力收益。对Glassdoor评论的分析发现,员工对AI的态度与根据企业财务数据衡量的生产力之间存在密切关联。股市对AI相关裁员公告
皮尤研究中心的一项调查显示,28%的美国人使用AI聊天机器人快速获取健康信息。25%的人用它来判断症状可能的原因,22%的人则是为了免费获得健康信息。其他用途包括了解可能的诊断,以及进一步查询化验结果或治疗方案。几乎所有因健康问题使用聊天机器人的人都认为,这些AI提供的信息有所帮助。
Game2World Engine 是一个从游戏实况视频中移除用户界面的框架,旨在生成更适合视频世界模型训练的数据。该项目构建了 UI 分类体系、9.6 万组配对合成视频,以及来自 303 款游戏的 1,079 段真实视频。其 GameCleaner 模型无需使用掩码即可识别并移除 HUD 元素,同时保留场景内容和时间动态。在初步实验中,使用无 UI 数据训练的世界模型使 VideoReward
该论文提出 OraRL,一种用于视频理解多模态大语言模型强化学习后训练的方法。它不仅利用标注对 rollout 进行评分,还将标注作为直接的正向优化目标。研究发现,高奖励的 oracle rollout 会抬高群组基线,导致原本正向的策略优势反转;OraRL 通过解耦优势估计器缓解这一问题。作者称,基于符号平衡的剪枝使每步耗时仅为监督微调的 2.2 倍,低于带思维链生成的 GRPO 的 4.9 倍
这篇综述将智能眼镜定义为连接人类感知、持续性上下文以及数字或物理行动的系统。文章强调其必须在能耗、散热、隐私和反馈等严格约束下运行,并整合增强现实、第一人称视觉、多模态模型、人机交互和具身智能等领域的分散研究。作者提出八个可验证的硬件能力维度,梳理七项基础能力,并建立从数据采集、反应式感知、情境辅助、持久状态到受治理行动和具身耦合的L0-L5框架。研究还覆盖九类应用场景,提出基于具体主张的评估协议
TorchMorph 是一个轻量级 PyTorch 扩展,用于二值和灰度形态学处理、距离变换以及熵正则化最优传输。该项目提供 22 个运算符,均以融合 CUDA 内核实现,可直接处理最多包含 8 个空间维度的 CUDA 张量。其 API 逐参数兼容 scipy.ndimage,便于现有流程迁移。作者称,与单线程 CPU 参考实现相比,TorchMorph 在灰度形态学处理上的吞吐量最高提升 1,1