SAEScientist-Bench:AI 代理能否自主开展 SAE 可解释性研究?
论文提出 SAEScientist-Bench,用于评估 AI 代理能否借助稀疏自编码器(SAE)自主开展机制可解释性研究。给定一个目标概念,代理需要设计对比探针,并在 Gemma-2-9B-IT 超过 13.1 万个特征的字典中寻找最相关的特征。在 20 个任务和 10 种代理配置中,前沿代理展现出真实的发现能力,但仍明显落后于专家基准。它们在区分目标概念与对比控制数据方面接近专家水平,但在对文
AI 新闻中心 过去一年分析了 8104 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
论文提出 SAEScientist-Bench,用于评估 AI 代理能否借助稀疏自编码器(SAE)自主开展机制可解释性研究。给定一个目标概念,代理需要设计对比探针,并在 Gemma-2-9B-IT 超过 13.1 万个特征的字典中寻找最相关的特征。在 20 个任务和 10 种代理配置中,前沿代理展现出真实的发现能力,但仍明显落后于专家基准。它们在区分目标概念与对比控制数据方面接近专家水平,但在对文
美国 Linux PC 制造商 System76 发布了 Thelio Mira AI 工作站。该系统采用 AMD 锐龙 9000 系列处理器,通过 x8+x8 PCIe 拆分支持两张扩展卡,并可搭载两张 NVIDIA RTX PRO Blackwell 6000。采用主流桌面平台有助于降低系统构建成本。设备提供最高 28TB 存储空间、4 个 10Gbps USB 接口、2 个 5GbE 网口、
阿里巴巴集团控股预计将牵头向人工智能训练和基准测试初创公司 UniPat AI 投资3亿美元,使该公司的估值达到25亿美元。这项投资也体现了阿里巴巴对其前实习生创始人的认可与支持。
一项研究比较了两种 AI 代码编辑方式:一次性生成完整的修改文件,以及逐步生成局部搜索/替换差异。研究人员使用同一 Flutter/Dart 数据集,从头训练了一个 1 亿参数模型,并微调了一个 5 亿参数的 Qwen2.5-Coder;每个模型在约 1,790 个留出任务上进行评估。直接生成在编译和静态分析通过率、与参考代码的相似度,以及目标完成度、正确性和代码质量的盲评中,均持续优于差异生成。
DianShi-RxnDB是一个用于支持化学人工智能开发的结构化有机反应数据平台。其自动化流程从美国专利商标局和欧洲专利局于1976年至2025年发布的专利文本、图像和反应示意图中提取并规范化信息。数据库收录约2400万条反应实例,其中约1480万条通过了自动质量检查。每条记录包含反应参与物及其角色、用量、温度、反应时间、产率、实验步骤以及来源专利链接。在对1300条合格记录进行的人工评估中,字段
代理框架包括系统提示词、工具、执行钩子和上下文管理,对代理任务的成功率有重要影响。在七项企业代理任务中,自动进化的框架让较小模型以远低于前沿模型的成本取得了良好表现。但使用强模型专家的完整执行轨迹训练较弱模型后,性能反而下降了4至30个百分点。原因是较弱模型模仿了专家的规划策略,却缺乏执行该策略的能力,同时破坏了与原本依据其规划风格设计的框架之间的适配关系。研究人员提出一种在线策略纠错流程:由元级
蚂蚁国际、Visa 和万事达卡正合作制定 AI 智能体执行支付时使用的统一标准。三方提出的“Know-Your-Agent(KYA)”框架,旨在帮助卡组织、数字钱包、智能体平台和在线市场,在保留各自审批与风险管理流程的同时,跨支付生态识别并接入可信 AI 智能体。框架包括运营方可追溯性、统一的安全与行为评估,以及持续交易监控。三方将通过新加坡金融管理局召集的 BuildFin.ai 平台,探索让各
中国机器人制造商宇树科技股价9月10日首次跌破上市后的500元关口,盘中最低跌至499元,随后报499.97元,跌幅超过2.7%。公司总市值降至约2022亿元,较上市首日高点减少超过2400亿元。宇树科技于8月19日以150.80元发行价登陆科创板,开盘价一度达到1100元。公司2026年上半年营收为11.52亿元,归母净利润为2.74亿元。不过,受研发、销售等期间费用增加影响,扣非后净利润同比下
美国国防初创公司Shield AI联合创始人兼总裁布兰登·曾谈到了公司的增长战略和扩张计划。随着公司加大在亚太市场的布局,Shield AI正扩大当地业务和产品服务。曾接受彭博社节目《亚洲交易》的海迪·斯特劳德·瓦茨独家采访。
针对外界流传的“黑名单”传闻,高德推出了 AI“避雷指南 1.0”。该功能从营业时间、行程节奏、停车提示、拥挤预测等 15 个维度分析出行计划,提前提示白跑、堵车和行程延误等风险。用户可以在高德地图 App 中与 AI 对话,询问前往特定地点时需要注意的问题。据 IT之家测试,目前该功能并不是餐饮店、景点、酒店或停车场的公开负面榜单,而是一个对话式 AI 服务。
小米在中国推出米家智能净烟机 3 Max,并同步发布配套的定时燃气灶。净烟机官方指导价为 5999 元,叠加政府补贴后售价为 4599 元。小米称,该产品通过 300 万像素摄像头和视觉 VLA 模型识别烹饪油烟变化,并自动调节吸力。设备还支持燃气、烟雾和 PM2.5 监测、溢锅提醒,以及与兼容米家燃气灶联动自动关火。官方公布的参数包括最高 17.5m/s 风速、1700Pa 最大静压和 59dB
小米在中国推出米家智能燃气灶 3 Max,京东售价 2704 元,叠加政府补贴后为 2299 元。产品主打 AI 防干烧和离灶看护功能。右侧灶具配备贴近锅底的温度传感探头,可识别干烧、空烧等情况,并自动关火断气。新增雷达可覆盖灶台前方 0.9 米范围,用户离开 30 分钟后发出蜂鸣提醒,60 分钟后自动熄火,也支持通过米家 App 远程提醒。左右灶均支持 1 至 180 分钟独立定时,右灶还可显示
Kepler Computing 已融资4.68亿美元,并结束隐身状态。该公司声称,其3D芯片堆叠技术和专有材料可以在不依赖EUV光刻的情况下提高HBM和SRAM的密度。公司表示,这种方法或有助于缓解推高内存价格的供应瓶颈。相关技术主张目前尚未得到独立验证。
人工智能研究代理结合已有知识、公开信息和实验反馈来产生结果。发现认证协议(DCP)将关于这些结果的主张转化为可执行的恢复测试和反馈测试。在 SQLite 优化和虚拟催化剂控制的两项受控审计中,96 个实验周期均未观察到恢复,恢复率上限为 0.0468。配对研究中,真实反馈带来了 30 次恢复,而中性策略下为零;配套的零假设校准研究也通过。一个不使用大语言模型的确定性验证器能够根据冻结证据复现判定结
该研究提出RESCUE,用于评估大语言模型在多方情绪支持对话中的表现。数据集来自真实的伴侣和家庭访谈,包含191个样本、7,079个标注对话轮次和1,064.8分钟视频。RESCUE设置了六项任务,评估模型理解人际关系动态以及提供关系敏感型支持的能力。对10个语言模型的实验显示,现有模型在处理局部情绪或干预线索时表现相对较好,但在关系模式预测、观点预测和支持策略预测等依赖关系理解的任务上仍存在明显