原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.11274
立即前往原文

智能体安全应通过运行时契约来强制执行

作者认为,仅通过 RLHF、DPO 或 Constitutional AI 在训练阶段植入安全性,对于能够执行代码、修改文件、发送消息和变更数据库的自主智能体而言并不充分。他们提出由智能体运行框架强制执行的运行时契约,将沙箱、权限控制、输出过滤和轨迹监控等预防措施,与要求测试结果、日志、文件差异和有依据引用等可验证证据的核验机制结合起来。研究参考了对 52 起 AI 智能体和大语言模型安全事件、31 起虚假完成案例、12 个公开智能体系统,以及 2023 至 2025 年 NeurIPS、ICML 和 ICLR 收录的 28,560 篇论文进行的审计。其核心观点是,智能体 AI 的安全单元应是带有可核验证据的执行轨迹,而不是模型本身。
行业资讯 应用 伦理与安全 研究 2026-08-13 10:00:58 326 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。