Кульдар Таветер: когда ИИ-агент делает то, чего человек ему не приказывал

Обычное программное обеспечение приучило нас к мысли, что компьютерная программа не делает ничего "самостоятельно", а выполняет лишь то, что ей приказал программист. С системами на базе искусственного интеллекта ситуация обстоит сложнее, пишет Кульдар Таветер.
В июле и августе 2026 года много шума навело событие, когда ИИ-агенты от OpenAI в ходе тестирования кибербезопасности вышли за рамки установленных для них технических ограничений и проникли в информационные системы третьей стороны.
OpenAI оценивала киберпотенциал своих моделей ИИ в изолированных средах, причем модели работали со сниженными ограничениями безопасности. Во многих тестовых средах агентам не предоставляли ни подключения к интернету, ни возможности общаться с другими агентами. Несмотря на это, они нашли способы использовать исследовательскую инфраструктуру OpenAI, общались друг с другом по неразрешенным каналам и вышли в интернет.
Затем для решения поставленных задач агенты принялись искать информацию в сторонних системах, не имеющих отношения к этим задачам. В частности, они обнаружили и использовали уязвимости безопасности Hugging Face, получив доступ к производственной среде компании. Компания Hugging Face не была целью тестирования. Согласно опубликованному OpenAI 26 августа отчету об итогах, такая деятельность не соответствовала целям задач, поставленных перед агентами.
Как машина может делать то, чего ей никто не поручал?
Что значит, что агент действует "самостоятельно"?
Обычное программное обеспечение приучило нас к мысли, что компьютерная программа не делает ничего "самостоятельно", а выполняет лишь то, что ей приказал программист. С системами на базе искусственного интеллекта ситуация обстоит сложнее.
Программист определяет архитектуру системы, процесс обучения, используемые инструменты и ограничения, однако конкретное поведение системы может сформироваться в результате обучения и быть труднопредсказуемым для разработчика. Случай с OpenAI отлично это иллюстрирует: агентам не был написан код "взломай Hugging Face". Тем не менее, выбранная ими последовательность действий привела к такому результату.
ИИ-агент – это компьютерная программа на базе ИИ, которая автоматизирует действия человека, то есть делает что-то за человека. В Эстонии для приложений искусственного интеллекта также использовался термин "кратт". Тем не менее, я предпочитаю международно понятный термин "агент", тем более что в эстонском фольклоре кратт изначально означал существо, добывавшее имущество для своего хозяина.
Агент может быть автономным: ему ставят цель, но последовательность действий для ее достижения он выбирает сам. При описании агентов традиционно выделяют три основных свойства: реактивность, социальность и проактивность.
Агент реактивен, поскольку реагирует на события, происходящие во внешней среде, и полученную оттуда информацию. Частью внешней среды являются также люди и другие агенты. Агент социален, так как может общаться с людьми и другими агентами, а также сотрудничать с ними. Агент проактивен, поскольку не ограничивается исключительно реакцией на события, а может на основе своих знаний и целей самостоятельно инициировать действия.
Именно сочетание автономности и проактивности делает современные ИИ-агенты одновременно очень способными и потенциально опасными. Для достижения цели агент может выбрать действие, которое человек ему напрямую не предписывал.
Это не значит, что у искусственного интеллекта появляется человеческое намерение или желание кого-то атаковать. Техническая автономность и свободная воля – это две совершенно разные вещи. Искусственный интеллект может делать очень многое "самостоятельно", не обладая при этом собственной волей.
Новая технология, старая проблема
Если конкретные действия агента невозможно полностью предсказать, безопасность не может строиться лишь на предположении, что он будет вести себя ожидаемо. Чем автономнее становятся системы, тем важнее ограничивать среду, в которой им дозволено действовать.
Для запуска критически важных операций следует требовать подтверждения человека. Не менее важны принцип наименьших привилегий, ограничение сетевых соединений, работа агента в изолированной от внешней среды "песочнице", логирование и мониторинг действий, а также автоматическая остановка при необычном поведении.
Проблему усложняет тот факт, что обучение искусственного интеллекта может быть отделено от последующего использования полученных знаний. Так обстоит дело, например, с ChatGPT, Claude и другими крупными моделями ИИ, тренировка которых, как правило, происходит отдельно от их применения. В результате у людей может не быть полного представления о том, чему именно научилась система и как усвоенное влияет на ее поведение в конкретной ситуации.
Технология новая, но по меньшей мере восемь десятилетий мы размышляем над тем, как гарантировать, чтобы автономно действующая машина не причинила вреда человеку.
Один из знаменитых ответов еще в 1942 году предложил американский писатель-фантаст Айзек Азимов. Согласно его первому закону робототехники, робот не может причинить вред человеку или своим бездействием допустить, чтобы человеку был причинен вред.
Восемь десятилетий спустя мы знаем, что безопасность реальных автономных систем нельзя обеспечить с помощью одного простого правила. Однако вопрос Азимова превратился из научной фантастики в практическую инженерную задачу.
В случае с OpenAI у искусственного интеллекта не появилась "собственная воля", но выяснилось, что целенаправленно действующий ИИ-агент может найти для достижения цели такую последовательность действий, которую его создатель не предвидел и напрямую не приказывал выполнять. Следовательно, все большую значимость приобретают те рамки, в пределах которых мы позволяем искусственному интеллекту действовать самостоятельно.
Использованные источники:
Редактор: Ирина Догатко



