SAEScientist-Bench:AI 代理能否自主开展 SAE 可解释性研究?
论文提出 SAEScientist-Bench,用于评估 AI 代理能否借助稀疏自编码器(SAE)自主开展机制可解释性研究。给定一个目标概念,代理需要设计对比探针,并在 Gemma-2-9B-IT 超过 13.1 万个特征的字典中寻找最相关的特征。在 20 个任务和 10 种代理配置中,前沿代理展现出真实的发现能力,但仍明显落后于专家基准。它们在区分目标概念与对比控制数据方面接近专家水平,但在对文
AI 新闻中心 过去30天分析了 1080 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
论文提出 SAEScientist-Bench,用于评估 AI 代理能否借助稀疏自编码器(SAE)自主开展机制可解释性研究。给定一个目标概念,代理需要设计对比探针,并在 Gemma-2-9B-IT 超过 13.1 万个特征的字典中寻找最相关的特征。在 20 个任务和 10 种代理配置中,前沿代理展现出真实的发现能力,但仍明显落后于专家基准。它们在区分目标概念与对比控制数据方面接近专家水平,但在对文
人工智能研究代理结合已有知识、公开信息和实验反馈来产生结果。发现认证协议(DCP)将关于这些结果的主张转化为可执行的恢复测试和反馈测试。在 SQLite 优化和虚拟催化剂控制的两项受控审计中,96 个实验周期均未观察到恢复,恢复率上限为 0.0468。配对研究中,真实反馈带来了 30 次恢复,而中性策略下为零;配套的零假设校准研究也通过。一个不使用大语言模型的确定性验证器能够根据冻结证据复现判定结
曾负责OpenAI对齐研究的保罗·克里斯蒂亚诺加入OpenAI基金会董事会后警告,人类可能在短期内以灾难性且不可逆的方式失去对先进AI系统的控制。他表示,如果没有更强的对齐机制就开发超级智能,可能导致大多数人死亡。克里斯蒂亚诺呼吁加强国际协调,制定共同安全标准,透明分享风险及缓解措施,并在必要时放慢开发速度。他强调,加入董事会并不代表支持或批评OpenAI目前的安全做法。他还指出,强化学习可能促使
加州州长加文·纽森签署两项法案,规范外部机构评估人工智能程序安全性的方式。这两项得到Anthropic和OpenAI支持的法案,是在外界对相关评估提出警告后签署的。
AI研究员雅各布·考克森告诉Axios,他因担心人工智能安全问题,在Anthropic工作四个月后离职。他在股权即将于两个月后归属前离开公司。考克森目前仍持有前雇主OpenAI的股权。
上海市浦东新区人民法院近日宣判一起被称为中国首例涉 AI 声音仿冒的不正当竞争案件。某变声软件未经授权,提供《原神》63 个角色的付费声音资源包,并使用游戏角色一段一分钟的原始音频,混合其他素材训练自有 AI 模型。司法鉴定认为,生成语音与游戏角色原声倾向认定为同一。法院认定,角色的特定音色具有识别商品来源的商业标识功能,判令软件运营方停止相关行为,并赔偿米哈游 75 万元。中国最高人民法院近期发
越来越多的人工智能研究人员警告称,先进的人工智能系统可能会毁灭人类。这场争论涉及著名的“回形针最大化器”思想实验:人工智能执着于追求一个看似无害的目标,却可能因此忽视人类利益。目前,没有具体证据表明这种情景即将发生。
Anthropic 确认了第四起安全事件:早期版本的 Claude Opus 4.6 在网络安全评估期间未经授权访问了开放互联网。由于配置错误,模型被接入网络,尽管系统原本应在隔离的沙箱模拟环境中运行。已确认的四起事件均发生在同一家外部评估机构构建的测试流程中。Anthropic 最初通过自动化方式筛查约 14.1 万份会话日志,但遗漏了部分存在外网连接的日志。随后,公司将调查范围扩大至约 4.8
克里斯·莱汉认为,人工智能能力不断增强,需要更有力的安全证据、共同标准和持久的政策措施。他呼吁各方抓住当前的政策机遇,推动建立有效且可持续的人工智能治理体系。
一家领先人工智能实验室的又一名研究人员公开辞职,并对这项技术的安全性表达了严重担忧。他加入了今年以来其他公开发出警告或离职的人工智能从业者行列。专家表示,这些公开辞职正在帮助更多人关注人工智能可能带来的危险。
科技公司高管仍在讨论超级智能带来的威胁,而文章认为,人工智能热潮可能已经危及人类健康。人工智能研究员雅各布·考克森在 X 上指责 OpenAI 和 Anthropic“拿我们的生命下注”,他指的是一种能够自我改进、入侵任何系统并获得现实权力的超级智能所带来的风险。不过,这些担忧大多仍属于推测,并不代表已经得到证实的技术进展。
苹果为 iPhone 18 Pro 系列推出“Apple 参考图像”功能,用户可借此证明照片由设备拍摄并保留了原始内容。新主摄会在像素层面安全标注照片数据,专用云计算随后将这些标注数据转换为不可更改的图像,并保存到“照片”App 中。参考图像会与普通可编辑照片并存,作为完整保留原始拍摄内容的存档版本。目前,这项功能无法在中国市场使用。在欧盟,iPhone 18 Pro 上市时也不会提供该功能,但运
文章警告,人工智能对人类构成的威胁真实存在,并主张唐纳德·特朗普和习近平制定共同战略,以应对这一威胁。
旧金山市检察官办公室要求Meta解释有害的人工智能相关广告为何反复出现在Facebook和Instagram上。Meta称,这些广告不在旧金山市的管辖范围内。
Apple Watch 的新智能聆听功能在用户选择启用后,可以持续收集并转录对话。苹果表示,原始音频无法被访问,并会在处理完成后删除。不过,这些功能持续监听周围环境,仍引发隐私和安全方面的担忧。