据 Ars Technica 以及安全公司 CloudSEK、Hudson Rock 披露,3 月被植入恶意代码的 LiteLLM 软件包引发了一场约 40 分钟的攻击。攻击者据称从约 2500 个组织中抓取凭据,并外传约 195TB 数据。泄露信息包括云密钥、代码仓库 Token、SSH 和 Kubernetes 密钥、软件包发布凭据、环境变量、CI/CD 凭据以及 AI 服务商 API 密钥等
一项新研究评估了大语言模型(LLM)代理在互动叙事中长期保持逻辑和故事承诺的能力。研究提出的NCP-Bench包含100个由电影梗概衍生的环境,每个环境都设有结构化的事实、情节轨迹和叙事承诺,可在交互过程中自动检查。实验显示,语言表达流畅并不保证逻辑一致性;面对用户的对抗性干预,即使是较强的模型也经常生成相互冲突的内容。表现最佳的GPT-5.2在20轮交互后的存活率仅为42%,不同模型的事实冲突率
ChatGPT、Claude 和 Gemini 在回答一些敏感问题时,会在无意中给出类似中国受审查聊天机器人的回应。研究人员表示,相关公司迄今为止尚未采取足够措施解决这一问题。
作者认为,仅通过 RLHF、DPO 或 Constitutional AI 在训练阶段植入安全性,对于能够执行代码、修改文件、发送消息和变更数据库的自主智能体而言并不充分。他们提出由智能体运行框架强制执行的运行时契约,将沙箱、权限控制、输出过滤和轨迹监控等预防措施,与要求测试结果、日志、文件差异和有依据引用等可验证证据的核验机制结合起来。研究参考了对 52 起 AI 智能体和大语言模型安全事件、3
Spark-to-Paper是一套端到端研究论文生成系统,以13项可组合技能集成在现有编程助手中。系统能够检索文献、规划并执行实验、生成可编辑图表,并依据测量结果修改论文论断。它结合确定性的完整性检查与自我批评,用于检测捏造内容,并限制实验不断否定原始研究目标的失败循环。在8个受控研究主题中,系统取得99.5%的引文有效率和96.4%的图表可编辑率。消融实验显示,完整的完整性与审查机制可将捏造检测
与外部工具集成的大语言模型智能体容易受到嵌入环境状态中的间接提示注入攻击。ToolHazard是一种可扩展的对抗环境合成框架,旨在减少人工工程工作。它结合环境模拟器、攻击者智能体和用户模拟器,生成可执行的有状态环境,发现可行的注入点,生成针对具体环境的攻击载荷,并构建基于环境状态的长程任务。研究人员基于该框架建立了ToolHazard-Bench,用于在复杂工作流和多种环境攻击下进行压力测试。实验
德国非营利组织HateAid已对Meta、Ray-Ban、Oakley及多家零售商提起刑事投诉。该组织认为,配备摄像头的智能眼镜能够进行隐蔽录制,可能违反德国隐私保护法律。HateAid还要求限制智能眼镜可进行录制的场所,类似于对行车记录仪和执法人员随身摄像机的相关规定。Meta表示,产品从设计阶段就已加入隐私保护措施,包括录制时闪烁的LED指示灯,以及检测到指示灯遭遮挡或篡改时停用摄像头的机制。
DeepMind首席科学家德米斯·哈萨比斯曾与其他人工智能实验室负责人,以及包括财政部长斯科特·贝森特在内的特朗普政府官员,讨论成立一个新的人工智能监管机构。相关讨论发生在一次组织调整之前。目前尚未公布该机构的具体结构、权限或实施计划。
Anthropic 计划在 Claude 的输出中嵌入不可见、可被计算机识别的代码,用于标记由 AI 生成或编辑的内容。这项政策旨在满足欧盟《人工智能法》的透明度要求。部分 Reddit 用户认为该机制不公平、不道德或过于 intrusive,称内容创作的大部分工作仍由人完成。其他用户则认为,在教育、新闻和软件开发等 AI 内容可能带来风险的领域,建立识别机制是合理的。批评者还指出,用户可以通过改
Twitch证实亚马逊正在使用其直播内容训练AI模型,并宣布用户可以通过隐私设置选择退出。由于该功能默认将用户视为同意,观众和多名知名主播对此提出强烈批评。争议主要集中在未经明确同意使用内容,以及由用户主动关闭授权的机制。Twitch表示,目前平台已使用AI生成字幕、制作视频剪辑和进行内容分类,但尚未使用生成式AI功能。
ShieldFont旨在污染人工智能训练数据,同时确保网页对人类仍然可读。这种字体针对自动化数据抓取,但其实际效果将取决于技术实现,以及人工智能开发者能否通过其他方式绕过这项防护。
Anthropic更新了Google Chrome版Claude扩展程序,在侧边栏提供完整的Claude Cowork会话体验。用户在Chrome中发起的任务和对话现在可以与Claude桌面端、网页端及移动端同步,并保存到统一的对话历史记录中。Claude能够查看当前网页,并利用浏览器现有的登录状态执行点击链接、页面跳转、输入文本和填写表单等操作。Anthropic提醒,浏览器智能体仍容易受到提示
Anthropic 为 Claude 推出的新水印系统在社交媒体上引发了一些用户的抱怨。部分用户担心,这项技术会让职场或课堂中利用 AI 作弊的行为更容易被识别。批评者认为该系统存在问题,而 Anthropic 似乎希望借此更方便地识别或追踪由其 AI 模型生成的内容。
一次软件供应链攻击入侵了一个人工智能软件包,影响2500名用户。攻击者抓取并外泄了相关数据,据称其中包括数TB的登录凭证。
印度工人正在拍摄人们缝制鞋子和焊接钢材的视频,供机器人公司使用。这些公司利用相关数据,让机器学习新的实体操作技能。这一趋势表明,人类劳动正被用于训练未来可能自动化部分相同工作的机器人。