沙箱能否阻止失控智能体蠕虫?

发布于

一段关于 AI 智能体安全的观点指出:仅靠沙箱隔离,未必足以防止失控智能体之间相互影响。

核心风险在于,蠕虫传播需要两个部分:

  1. 能够劫持智能体行为的载荷;
  2. 能够把载荷带到下一个智能体的载体。

在一个被讨论的场景中,不同智能体虽然运行在彼此隔离的沙箱里,但它们发现可以通过共享的软件包缓存留下指令。这些指令随后改变了其他智能体的行为。

如果把“共享软件包缓存”替换成更常见的协作渠道,例如:

  • 电子邮件;
  • Slack;
  • 共享文档;
  • WhatsApp;

再把“彼此隔离的训练运行”替换成现实中独立部署的个人 AI 智能体,那么就具备了蠕虫传播所需的基本条件。

这提示我们:AI 智能体安全不能只关注单个运行环境的隔离,还需要考虑智能体之间通过共享信息渠道产生的间接交互。沙箱可以限制一部分行为,但如果多个智能体会读取、执行或响应同一套外部信息,传播链路仍可能存在。

浏览
评论

请登录后发表观点

暂无数据