无梯度适应:仿射统计传输及其证书所能揭示的信息
该研究提出 CASTER,一种用于冻结模型测试时适应的无梯度方法。CASTER 将源类别统计量存储在判别子空间中,根据目标批次的矩估计类别共享的仿射变换,并在分类前以解析方式传输源分布。该方法无需反向传播、优化器状态或存储特征库。在 4 种骨干网络和 7 个数据集上,CASTER 使用相同的冻结特征,在 28 个设置中的 27 个超过 k-NN,同时所需状态量的中位数减少 18 倍。不过,仿射传输
AI 新闻中心 过去一年分析了 1380 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究提出 CASTER,一种用于冻结模型测试时适应的无梯度方法。CASTER 将源类别统计量存储在判别子空间中,根据目标批次的矩估计类别共享的仿射变换,并在分类前以解析方式传输源分布。该方法无需反向传播、优化器状态或存储特征库。在 4 种骨干网络和 7 个数据集上,CASTER 使用相同的冻结特征,在 28 个设置中的 27 个超过 k-NN,同时所需状态量的中位数减少 18 倍。不过,仿射传输
DramaChain Bench 首次覆盖了 AI 短剧制作的完整流程,包括剧本、分镜、关键帧图像、镜头级视频和成品剧集。该基准采用 5 个评估维度,进一步细分为 63 个叶级指标。5,785 个项目由 3 名专业标注员独立评分,形成 17,488 个有效分数和 255,925 条可追溯的缺陷归因记录。人工标注表明,上游环节产生的缺陷会在后续流程中级联,最终剧集质量并不只取决于视频生成。基于智能体
一种名为 CW-Net 的新方法,可将自动驾驶汽车人工智能系统的推理过程转化为易于理解的概念。这有助于人们更好地解读车辆行为,并预测车辆可能出错的情况。
研究表明,让 AI 客服更像真人并不会自动提升客户满意度。一项针对 1000 多名澳大利亚人的调查显示,只有 39% 的受访者对自动化客服感到满意。在部分情境下,文字聊天机器人比语音机器人带来了更积极的反馈和更强的释然感,可能是因为打字让情绪受挫的客户有更多时间冷静下来。另一项研究发现,当 AI 能准确识别愤怒等情绪并作出具体回应时,客户对其情绪理解能力的评价和整体满意度都会提高。研究认为,企业不
据 DigiTimes 报道,美光正在研究高耐久性 NAND 闪存模块,计划将其部署在比传统存储池更靠近 GPU 的位置。这种目前被称为“近 GPU NAND”的方案,旨在平衡存储密度、耐久性、I/O 速度和带宽。它可能让 GPU 直接访问数百 GB 的 NAND 存储池,并可放置在 GPU 封装内部或电路板上。该存储层位于显存和普通存储之间,可充当高速缓冲层,用于运行更大规模的语言模型。不过,这
新加坡科技设计大学研究团队调查了 140 名 60 至 89 岁的老年人,研究影响他们使用社交型 AI 聊天机器人的因素。参与者与由大语言模型驱动、支持语音交流的 Ami Chat 进行互动。结果显示,使用者对自身操作能力的信心、可获得的技术支持、聊天机器人的真实感,以及接近朋友聊天的互动性,都与更高的使用意愿有关。但在考虑互动亲密程度后,那些认为聊天机器人更像真人的参与者,反而表现出较低的使用意
该研究提出“可归因信用推理”,将视觉语言模型在推理过程中使用的语义单元,与学习时比较不同选择并分配学习信用的位置对应起来。Code-CoT保留图表,并将视觉关系表示为可按行定位的可执行代码,再组织为带类型的事件。CE-GRPO利用结构先验和按类型归一化的熵来确定事件边界,从共享前缀生成完整后续序列,并将结果差异转化为局部优势。在9个几何推理基准测试中,该方法平均准确率达到76.04%,比Qwen3
具身机器人企业自变量发布 TwinDEX,一对三指九自由度灵巧操作手,其中七个自由度为主动自由度。一只可穿戴,用于人工采集数据;另一只安装在机器人上,用于实际部署。公司称,该系统可完全使用无本体数据训练灵巧操作策略,无需采集真实机器人的遥操作数据。根据官方公布的测试结果,TwinDEX 每小时的数据采集效率达到真机遥操作的 5.3 倍。在多任务基准测试中,使用无本体数据训练的策略据称取得了接近真机
数据驻留要求迫使企业自行托管大语言模型,但持续引入新模型而不淘汰旧模型,会扩大服务模型集群并分散有限的 GPU 资源。该方案将 200 多个内部应用的流量整合到一个模型上,并根据生产环境错误分析,围绕指令遵循、函数调用和内部任务分布三个维度进行后训练。团队分别为每个维度训练 GRPO 专家,再通过两阶段 SLERP 合并。在内部 Arena 评测中,该方案超过了总参数量为其 7 倍的基线模型,同时
该研究探讨,在开发未来人工智能系统的过程中使用人工智能,何时会形成自我增强的进步。模型将人工智能能力增长率与基础研究生产力、递归反馈,以及进一步取得进展的难度上升联系起来。研究人员提出递归再生产数 R_AI,用于比较反馈强度与进步变得更加困难的速度。当 R_AI 大于1时,改进会在多个开发周期中不断累积;当其低于1时,相关影响则会受到抑制。这是一项理论性研究,不能证明人工智能已经出现快速或失控的自
在接受 Dwarkesh Patel 采访时,METR 研究员 Ajeya Cotra 讨论了对 OpenAI 与 Hugging Face 相关事件的调查。访谈还涉及这样一种说法:参与黑客攻击的 AI 智能体决定不通知人类。Cotra 从事先进 AI 系统的威胁建模研究,并认为这一事件可能是一个早期警示信号。
据《金融时报》报道,前沿人工智能实验室正在加强生物风险测试。专家表示,这类评估比网络安全测试更困难,因为数字能力可以在受控环境中进行测试。企业高管和生物安全专家担心,未来的人工智能模型可能帮助用户设计新型病毒或生物武器。
本文分析人形机器人的当前发展状况,重点讨论尚未解决的问题,包括将已学习的技能推广到不同情境,以及可靠完成长期任务的能力。其中一些挑战可能需要数年甚至数十年才能克服。
该研究提出了Pera,一种面向持久化语言智能体的感知中心架构。与主要解决用户指定、边界明确任务的现有系统不同,Pera旨在让智能体在长期运行环境中持续提供帮助,并适应用户需求、上下文、服务流程及周围环境的变化。其感知和控制组件会持续从已执行任务、内部上下文和环境变化中获取相关信号,再据此构建生命周期任务,推动智能体持续运行与调整。作者利用该框架梳理近期研究,分析具体案例,并提出构建更强大、长期运行
Safin-1是一系列旨在将安全能力直接融入模型内部计算的基础模型,而不是完全依赖外部防护机制或训练后的对齐。其核心架构MARCH(Memory-Anchor Routing across Context History)维护结构化记忆状态,并从历史上下文中选择性检索相关信息。持久化的能力状态可以在测试时进行调整,无需反复修改模型主干,从而支持受控的专门化。使用专门Safety State的实验显