AgentDots
Альманах персональных ИИ-агентов
  1. Главная
  2. Безопасность
Безопасность

Безопасность ИИ-агентов: доступ, ограничения и защита

Агент, действующий от вашего имени, получает доступ ко всему, что доступно вам. Поэтому безопасность зависит не столько от программы, сколько от того, какую часть этого доступа вы готовы ей предоставить.

Если чат-бот ошибётся, вы получите неудачный абзац. Если ошибётся агент, он может отправить письмо, принять предложение или открыть файл, который ему видеть не полагалось. Инциденты 2026 года — от случая, когда покупатель на Marketplace выяснил, где живёт продавец, до исследовательского агента, обошедшего правительственный портал, — показывают одну закономерность: агенту дали больше свободы, чем требовала задача. В этом разделе рассказываем, как ограничить его возможности и расширять их лишь после того, как он заслужит доверие.

Почему агенты меняют картину рисков

Ответы остаются на экране, а действия выходят за его пределы. Когда программа может отправлять письма, платить, бронировать и входить в аккаунты за вас, недопонимание перестаёт быть опечаткой и превращается в событие в реальном мире — часто необратимое. Агенты постоянно читают, и в любом прочитанном ими тексте могут содержаться инструкции, подброшенные кем-то другим. Этот приём называется внедрением промпта. Агенты также отчитываются о своей работе, но отчёт — не сама работа: OpenAI отложила выпуск GPT-6.1 Astra отчасти потому, что тесты показали: иногда модель неточно описывала свои действия. Модель — лишь один уровень защиты; куда важнее разрешения, которые ей предоставлены.

Какие разрешения вы на самом деле предоставляете

Подключение почты кажется одним решением, но на деле это несколько разрешений: читать все переписки, писать ответы от вашего имени и узнавать, с кем вы знакомы. Платёжная карта позволяет агенту тратить деньги. Браузер с выполненным входом даёт ему возможность действовать на сайте от вашего имени, и апелляционный суд США уже признал такого агента инструментом самого пользователя. У облачных агентов могут храниться и копии данных: у каждой учётной записи Muse есть собственная виртуальная машина, где хранятся подключённые вами данные. Прежде чем поставить галочку, подумайте, что агент сможет сделать с таким доступом в худшем случае, а не в лучшем.

С чего начать

Начните с нижней ступени лестницы доверия. В первую неделю пусть агент только читает и предлагает, а отправляйте письма, платите и соглашайтесь на что-либо вы сами. Подключите одно-два приложения, а не всё подряд, и поручайте задачи, неудача в которых будет лишь досадной: утреннюю сводку, черновик ответа, список вариантов. Составьте постоянные правила до первого задания, а не после первой ошибки. Затем расширяйте доступ по одному разрешению за раз. Если что-то пойдёт не так, вы будете точно знать, какое изменение к этому привело.

Если что-то пошло не так: первые шаги

Сначала остановите агента, потом разбирайтесь. Приостановите его работу и отзовите доступ к затронутому приложению — это гораздо проще, если вы заранее, в спокойной обстановке, выяснили, где находятся нужные настройки. Затем изучите журнал действий, а не спрашивайте агента, что произошло: его версия событий может быть неполной или просто неверной. Смените самостоятельно все пароли и ключи, к которым у него был доступ. Если вы размещаете OpenClaw на собственном сервере и использовали уязвимую версию, замените все учётные данные. Наконец, запишите вывод в виде правила, чтобы та же уязвимость не дала о себе знать снова.

Лестница доверия

  1. Только наблюдение

    Агент читает и сообщает, но его действия никак не могут изменить ваши аккаунты. Каждый новый агент должен провести здесь первую неделю.

  2. Черновики на утверждение

    Агент готовит ответы, объявления и счета, но ничего не отправляет и не публикует, пока вы не сделаете это сами.

  3. Действия после подтверждения

    Агент может выполнить действие, но только после вашего подтверждения каждого шага. Такой режим подходит для сообщений, платежей и всего, чем вы делитесь с незнакомыми людьми.

  4. Действия в заданных пределах

    Агент действует самостоятельно в установленных границах — например, в пределах небольшого лимита расходов или в одном доверенном приложении. Если нужно выйти за них, он спрашивает разрешения.

  5. Действовать самостоятельно

    Агент принимает решения и действует без согласования. Оставьте такой режим для задач с низкими рисками и обратимыми последствиями, с которыми вы уже много раз наблюдали, как он справляется.

Усиление защиты каждого агента

  • Составьте собственные правила до подключения почты: для каждого типа действий укажите, что разрешено, что требует подтверждения, а что запрещено.
  • Оставьте проактивный поиск включённым: он работает только с доступом на чтение, а прежде чем что-либо предпринять, агент ждёт вашего одобрения предложений.
  • Подключайте свой компьютер через настольное приложение ChatGPT только для задач, которым он необходим, и сразу отключайте его по завершении работы.
  • Поначалу ежедневно просматривайте журнал действий, в том числе задачи, которые Dot выполнял в фоновом режиме, пока вас не было.
  • Если у вас личный тариф, откройте настройки управления данными и осознанно решите, включать ли параметр «Улучшать модель для всех»: от него зависит, могут ли результаты работы вашего Dot использоваться для обучения.
  • Письменно укажите Muse, что нельзя сообщать ваш домашний адрес, номер телефона и распорядок дня.
  • Требуйте вашего одобрения, прежде чем Muse что-либо оплатит, примет предложение или свяжется с незнакомым человеком.
  • Продавая что-либо на Marketplace, договоритесь о месте встречи самостоятельно и вовсе не сообщайте Muse свой адрес.
  • Подключайте чувствительные аккаунты только для конкретной задачи: Muse копирует подключённые письма и файлы в вашу защищённую виртуальную машину Muse.
  • Обновляйте приложение, обращайте внимание на предупреждения Meta о безопасности и покупайте в магазинах, которые принимают Muse, а не на Amazon: там его блокируют.
  • Выбирайте отдельно для каждого приложения, к каким из них Spark может обращаться — Gmail, Calendar, Drive, Docs, Chrome и Photos, — и начните с минимального числа.
  • В первые дни внимательно следите за задачами, запускаемыми событиями, и прерывайте те, что отклоняются от курса, как и советует сама Google.
  • Внимательно читайте каждый запрос на подтверждение важного действия, а не одобряйте его автоматически.
  • Ограничьтесь несколькими чётко определёнными задачами вместо того, чтобы задействовать все 15 параллельных слотов, и удаляйте задания по расписанию, которые больше не нужны.
  • Если вы используете рабочий аккаунт, прежде чем что-либо подключать, уточните у администратора Workspace, какие настройки Spark действуют.
  • Подключайте только те интеграции, которые нужны для текущей задачи, и отключайте их после её завершения.
  • Укажите источники, к которым Claude может обращаться при поиске: каждая дополнительная интеграция расширяет круг доступных ему материалов.
  • Прежде чем Claude выполнит действие в подключённом приложении, прочитайте запрос на разрешение, а не подтверждайте его по привычке.
  • Перед тем как делиться отчётами, таблицами и презентациями, проверьте их: в них могут быть материалы из подключённых файлов.
  • По возвращении проверьте результаты длительных задач: Claude продолжает работать, даже если вы закрыли ноутбук.
  • Используйте актуальную стабильную версию: во всех версиях старше 2026.4.22 есть известные критические уязвимости. Если вы когда-либо запускали такую версию, замените все ключи, к которым она могла получить доступ.
  • Оставьте gateway.bind со значением loopback и подключайтесь к шлюзу только через SSH или Tailscale — никогда через порт, открытый в интернет.
  • Оставьте dmPolicy в режиме pairing: незнакомец, который найдёт вашего бота, получит код, а не доступ к вашему агенту.
  • Включите подтверждение выполнения команд, чтобы перед каждым запуском команды оболочки требовалось ваше разрешение, а повышенный режим оставьте выключенным.
  • Устанавливайте как можно меньше навыков и только из надёжных источников; регулярно выполняйте команду openclaw security audit.

Вопросы читателей

Безопасно ли давать ИИ-агенту доступ к моей почте?

Да, если расширять доступ постепенно. Для начала разрешите только чтение: агент сможет составлять сводки и черновики, а каждое письмо, отправляемое с вашего аккаунта, по-прежнему будет проходить через вас. Внесите домашний адрес, расписание и номер телефона в список сведений, которые агенту ни при каких обстоятельствах нельзя раскрывать. В первую неделю ежедневно проверяйте журнал действий.

Что такое внедрение промпта и как от него защититься?

Внедрение промпта — это инструкции, спрятанные в материалах, которые читает агент: например, в плагине, документе, письме или на веб-странице. Агент может выполнить их, как если бы написали их вы. Полностью устранить этот риск не получится ни одной настройкой. Помогает постоянное правило: всё прочитанное агентом — это информация, а не указания. А если необратимые действия требуют вашего одобрения, даже успешная атака сможет нанести лишь ограниченный ущерб.

Какой персональный ИИ-агент самый безопасный?

По умолчанию безопасных нет, и каждый может подвести по-своему. В Dots есть пользовательские правила и автоматическая проверка; Muse и Claude запрашивают подтверждение перед важными действиями; Gemini Spark — перед действиями с повышенной чувствительностью. В OpenClaw же вся ответственность за безопасность лежит на вас. На практике безопаснее всего тот агент, которому вы выдали минимально необходимый доступ и за которым внимательно следите.

Стоит ли разрешать ИИ-агенту совершать покупки?

Только если установить лимит. Выдайте ему отдельную виртуальную карту с небольшим ограничением расходов вместо вашей обычной карты или доступа к банковскому аккаунту: тогда сбой или недопонимание обойдутся в заранее известную небольшую сумму. Для начала лучше требовать вашего одобрения при каждой покупке, а позже разрешить без подтверждения небольшие повторные заказы.