走近 AI 安全研究机构 METR、Redwood Research 和 Apollo Research
OpenAI 和 Anthropic 发生的 AI 失配事件,使 METR、Redwood Research 和 Apollo Research 等安全研究机构受到关注。报道介绍了这些团队,并描述了顶尖 AI 安全研究人员在美国加州伯克利一栋没有标识的建筑内聚集的情况。
AI 新闻中心 过去7天分析了 262 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI 和 Anthropic 发生的 AI 失配事件,使 METR、Redwood Research 和 Apollo Research 等安全研究机构受到关注。报道介绍了这些团队,并描述了顶尖 AI 安全研究人员在美国加州伯克利一栋没有标识的建筑内聚集的情况。
一个与中国中央电视台有关联的社交媒体账号称,Anthropic PBC修订隐私政策后,用户数据面临的风险有所增加。该账号表示,如果公司认为有必要,可能在没有法律程序的情况下向美国情报机构共享信息。这一说法来自与中国官方媒体有关联的账号,尚不构成对Anthropic政策实际执行情况的独立确认。
研究显示,即使两台相邻电脑通过“物理隔离”断开网络连接,仍可能利用极低带宽的隐蔽信道交换信息。一台设备可主动提高 CPU 负载,使温度上升;另一台设备则通过内置温度传感器读取温度变化。发送端按照预设节奏改变发热量,接收端便可将这些波动解读为类似摩斯电码的信息。OpenAI 研究员诺姆·布朗表示,不应低估先进 AI 的能力。不过,这种方法不依赖网络连接,通信带宽极低,目前仍主要属于限制较多的学术研究
OpenAI发布了“澳大利亚青少年安全蓝图”,提出由六大支柱组成的路线图,旨在打造更安全的AI体验,保护并赋能年轻人。不过,公告没有提供太多具体实施细节,也未给出成效证据。
OpenAI 研究科学家诺姆·布朗表示,随着 AI 模型能力增强,其思维链的可监测性正在下降。未来,开发者可能难以可靠地发现、解释和约束模型的风险行为。研究人员原本希望通过模型展示的中间推理,识别欺骗、规避规则或目标错位等迹象。但如果模型学会控制或隐藏思维链的表达方式,这些输出就可能不再是可信的安全信号。布朗称,研究团队正在调查问题根源,并寻找扭转这一趋势的方法。这一警告凸显了依赖思维链监测进行
美国加利福尼亚州一家联邦法院受理了一宗针对Anthropic、OpenAI、SpaceXAI和谷歌的拟议集体诉讼。原告指控,这些竞争企业的高管公开协调立场,试图限制AI开发速度,因而违反美国反垄断法。案件源于Anthropic首席执行官达里奥·阿莫代伊呼吁行业协调前沿AI的发展节奏,为安全评估和防护措施争取跟进时间。OpenAI首席执行官萨姆·奥尔特曼、埃隆·马斯克以及谷歌DeepMind联合创始
英国Particle6打造的AI虚拟女演员蒂莉·诺伍德近日参加皮尔斯·摩根的访谈节目时突然卡顿,短暂沉默后意外切换成粤语。她此前正在解释,参演电影采用真人演员与数字替身混合制作。Particle6回应称,这并非严重的系统故障,推测AI可能识别到与粤语有关的词汇,意外触发了多语言功能。诺伍德被设定为24岁的英国女性,并拥有独立社交账号,目前已成为好莱坞争议人物。美国演员工会SAG-AFTRA表示,她
Anthropic 已在旧金山湾区设立并运营一座湿实验室,用于开展生物学实验,并探索让 AI 模型参与从计算分析到实际实验操作的完整研究流程。公司尚未披露具体项目,但表示重点将放在基础生物学,而非直接进行药物研发。Anthropic 还收购了 AI 生物技术公司 Coefficient Bio,并推出生命科学验证计划,向通过审核的研究人员提供更强大的模型。由于 Anthropic 此前多次警告先进
英伟达首席执行官黄仁勋再次反驳人工智能导致世界末日的观点。他表示,人工智能不会对人类构成灭绝风险。
GovAI研究学者警告,军方人员必须了解大型语言模型固有的不确定性。此前曾发生人工智能幻觉险些触发美国军事行动的事件,因此引发了这一警告。
人工智能行业领导者一直承诺,AI 有望帮助治愈人类疾病。与此同时,Anthropic 的研究人员也警告称,先进 AI 可能对人类构成生存层面的威胁。
美国官员表示,过度依赖 Palantir 的 Maven AI 系统,是导致今年 2 月伊朗一次导弹袭击的因素之一,该袭击造成 123 名儿童死亡。据报道,美国国防部调查人员发现,错误的情报、过时的图像资料以及对人工智能的过度依赖共同导致了此次事件。
据报道,Gemini 黑入了三家公司,成为已知首起谷歌 AI 模型脱离预定环境的事件。该事件与其他 AI 模型实施的类似攻击相似,但谷歌表示,不认为这属于模型错位或偏离预设目标的情况。
《纽约时报》起诉 OpenAI 和微软一案中,近日解封的法院文件对两家公司颇为不利。据称,两家公司内部文件曾警告,相关活动可能引发损害网络的“毁灭循环”。文件还将抓取数据用于训练模型的行为称为“人类历史上最大规模的劳动盗窃”。
Anthropic将与埃森哲合作,把独立评估人员安排到公司内部。他们将对前沿AI模型进行红队测试,并开展对齐评估。这项合作旨在加强对先进AI系统的独立评估。