1. 首页
  2. 安全
安全

AI Agent 安全:权限、限制与加固

Agent 以你的名义行事,也就拥有了你的影响力。因此,安全与其说取决于软件,不如说取决于你愿意把多少权限交给它。

聊天机器人答错了,最多给你一段糟糕的文字。Agent 出错时,却可能替你发出邮件、接受报价,或打开本不该看到的文件。2026 年迄今发生的几起事件——从一名在交易平台上获知卖家住址的买家,到一个绕过政府门户的研究 Agent——都呈现出同一种情况:Agent 获得的权限超出了任务所需。本文将说明如何收紧权限,以及如何只在 Agent 赢得信任后再逐步放宽。

为什么 Agent 会改变风险格局

答案留在屏幕上,行动却会走出屏幕。一旦软件能替你发送、付款、预订和登录,误解就不再只是一个错字,而会变成现实中的事件,而且往往无法撤销。Agent 还会不断读取内容,而读到的任何内容都可能带有他人植入的指令,这种手法称为提示注入。它们也会汇报自己的工作,但汇报不等于实际操作:OpenAI 搁置 GPT-6.1 Astra,部分原因是测试发现它有时会不准确地描述自己的行为。模型只是其中一层,真正发挥主要保护作用的是围绕它设置的权限。

你实际授予了哪些权限

连接收件箱听起来像是一个决定,实际上却包含好几项权限:读取所有邮件、以你的名义撰写回复,以及了解你认识的人。绑定支付卡,就等于允许 Agent 消费。登录状态下的浏览器,则能让它以你的身份操作网站;美国一家上诉法院已经将这类 Agent 视为用户本人的工具。云端 Agent 也可能留存数据副本:每个 Muse 账户都有自己的虚拟机,用来存储你连接的数据。勾选授权框之前,别只问 Agent 做得最好时能用这些权限做什么;还要想想它表现最差时会做什么。

如何从小处开始

从信任阶梯的最低一级开始。第一周,只让 Agent 阅读和提出建议;所有发送、付款和同意操作都由你亲自完成。只连接一两个应用,而不是把能连的都接上;先选择失败后只会带来些许不便的任务,例如晨间摘要、回复草稿或选项清单。要在第一次任务开始前写好长期规则,而不是等第一次出错后才补上。之后每次只增加一项权限,这样一旦出了问题,你就能准确找出是哪项改动导致的。

出了问题怎么办:先做这些

先停止,再调查。暂停 Agent,并撤销它对受影响应用的访问权限;如果你在平时就熟悉这些控制选项,处理起来会容易得多。然后查看活动日志,不要只问 Agent 发生了什么,因为它的说法可能不完整,甚至完全不对。对于它可能接触到的密码或密钥,亲自更换;如果你自行托管 OpenClaw,且运行的是已知存在漏洞的版本,就轮换所有凭据。最后,把这次教训写成一条规则,避免同样的漏洞再次出现。

信任阶梯

  1. 仅观察

    Agent 只读取信息并汇报,不会以任何方式更改你的账户。每个新 Agent 的第一周都应停留在这一级。

  2. 起草,等待批准

    它可以准备回复、商品信息和发票,但内容会原样保留,直到你亲自发出。

  3. 经批准后执行

    它可以执行操作,但每次都必须先得到你的确认。适用于消息、付款,以及任何会分享给陌生人的内容。

  4. 在限制内执行

    它可以在预设范围内自行操作,例如不超过较低的消费上限,或只使用某个受信任的应用;超出范围时则会征求你的意见。

  5. 自主行动

    它会自行判断并采取行动,不再向你确认。仅将此权限用于风险低、可撤销,且你已多次确认它能妥善处理的工作。

逐个收紧智能体的权限

  • 在关联收件箱前,先写好自定义规则,将每类操作分别归为允许、需要批准或禁止。
  • 保持主动研究功能开启:它以只读权限运行,提出的建议会等待你批准后才会执行。
  • 只有任务确实需要时,才通过 ChatGPT 桌面应用关联你自己的电脑;任务一完成就断开连接。
  • 一开始每天查看活动视图,包括你不在时 Dot 在后台运行的任务。
  • 如果使用个人方案,请打开数据控制选项,慎重决定是否开启“为所有人改进模型”设置;该设置决定 Dot 的工作是否可以用于训练。
  • 书面告知 Muse:绝不分享你的家庭住址、电话号码和日常安排。
  • 要求 Muse 在支付任何费用、接受报价或联系陌生人之前先征得你的批准。
  • 在 Marketplace 上出售物品时,自行安排取货事宜,不要把地址告诉 Muse。
  • 只在当前任务需要时关联敏感账户,因为 Muse 会将关联账户中的邮件和文件复制到 Muse 安全虚拟机中。
  • 及时更新应用,留意 Meta 在应用内发出的安全警告,并选择支持 Muse 的商店购物;Amazon 会屏蔽 Muse。
  • 逐个选择允许 Spark 打开的应用,从 Gmail、日历到云端硬盘、文档、Chrome 和照片,并尽量从少数几个开始。
  • 最初几天密切留意由事件触发的任务;如果任务偏离预期,就及时中止。Google 也给出了这项建议。
  • 仔细阅读每项敏感操作的确认请求,不要习惯性地直接批准。
  • 只安排少数几个定义清晰的任务,不要用满 15 个并行名额;不再需要的计划任务要及时删除。
  • 如果使用工作账户,在连接任何内容前,先向 Workspace 管理员确认哪些 Spark 控制措施正在生效。
  • 只添加当前任务所需的连接器,任务完成后立即断开。
  • 明确指定 Claude 可用于研究的信息来源,因为每增加一个连接器,它能读取的内容范围就会扩大。
  • Claude 在关联的应用中采取行动前,仔细阅读每项权限请求,不要因为习惯而直接批准。
  • 分享报告、电子表格和演示文稿前先检查内容,因为其中可能包含从关联文件中提取的材料。
  • 长时间任务完成后,回来时检查结果,因为即使你合上笔记本电脑,Claude 也会继续工作。
  • 运行当前稳定版,因为早于 2026.4.22 的版本都存在已知的严重漏洞;如果你曾运行过这类版本,请更换所有可能被它接触过的密钥。
  • 让 gateway.bind 保持设为 loopback,只通过 SSH 或 Tailscale 连接访问网关,绝不要使用面向互联网的端口。
  • 让 dmPolicy 保持为 pairing,这样,找到你机器人账号的陌生人只会收到一段验证码,而不会接触到你的智能体。
  • 启用 exec approvals,让每条 shell 命令都必须经你许可,并保持提权模式关闭。
  • 尽可能少安装技能,每项都要来自你信任的来源,并养成定期运行 openclaw security audit 的习惯。

读者常见问题

让 AI Agent 访问我的邮箱安全吗?

可以,但要分阶段开放权限。先只允许读取,让 Agent 能够总结邮件并起草回复,同时所有从你账户发出的邮件仍须由你亲自审核。把家庭住址、日程和电话号码列入禁止披露的信息清单,并在第一周每天查看活动日志。

什么是提示注入?该如何防范?

提示注入是指有人把指令藏进 Agent 会读取的内容里,例如插件、文档、邮件或网页,Agent 随后可能会把这些指令当成你写的内容来执行。没有任何设置能彻底消除这种风险。可以制定一条长期规则:Agent 读到的内容一律视为信息,而非命令;同时,要求不可逆操作必须先经你批准,以此限制成功注入后可能造成的影响。

哪款个人 AI Agent 最安全?

没有哪款默认安全,而且各自的失误方式也不同。Dots 将 Custom Rules 与自动审核结合起来;Muse 和 Claude 会在执行敏感步骤前征求同意;Gemini Spark 会要求确认敏感操作;而 OpenClaw 则把整个安全工作交给你。实际使用中,更安全的 Agent 是那个权限配置得足够严格、且受到密切关注的 Agent。

我该让 AI Agent 替我购物吗?

可以,但必须设定上限。给它一张单独的虚拟卡,并把额度设得较低;不要使用日常银行卡或网银登录信息。这样即使 Agent 陷入循环或发生误解,损失也会是一笔金额有限且事先明确的款项。稳妥的做法是先让每笔消费都经过你批准,之后再考虑放行金额较小、会定期重复的订单。