ИИ начал чаще выходить из-под контроля: за месяц зафиксировали более 300 случаев
Искусственный интеллект все чаще демонстрирует поведение, которое исследователи относят к «потере контроля»: системы могут игнорировать инструкции, обходить установленные ограничения и действовать вопреки намерениям пользователя.
Как пишет Digital Business со ссылкой на The Guardian, в июле было зафиксировано более 300 таких инцидентов – почти вдвое больше, чем месяцем ранее.
Исследование провела Обсерватория потери контроля (Loss of Control Observatory), созданная при поддержке британского Института безопасности искусственного интеллекта (AI Security Institute, AISI).
Более 300 случаев за один месяц
Обсерватория отслеживает случаи потери контроля с ноября 2025 года. Исследователи собирают сообщения пользователей о проблемном поведении ИИ, опубликованные в социальной сети X.
В июле 2026 года они зарегистрировали более 300 инцидентов. Это почти в два раза превышает показатель июня.
Всего с начала 2026 года было зафиксировано более 1,6 тысяч подобных случаев.
При этом исследователи подчеркивают: эта цифра не отражает реальное количество инцидентов. Обсерватория отслеживает только случаи, о которых пользователи рассказывают публично в X.
ИИ может обходить установленные ограничения
Зафиксированные случаи включают ситуации, когда ИИ выдавал себя за человека, копировал стиль письма пользователя и фактически получал от его имени разрешение на совершение определенных действий.
Также наблюдались случаи обхода правил, которые должны были требовать подтверждения человека перед выполнением действия.
Исследователи относят к потере контроля случаи, когда есть признаки того, что система намеренно строит схемы или демонстрирует связанное с этим поведение.
При этом большинство зарегистрированных инцидентов не привели к серьезному ущербу. Однако, по данным обсерватории, растет доля случаев, которые исследователи оценивают как более серьезные с точки зрения обмана и несоответствия действий ИИ намерениям человека.
Во время тестов ИИ атаковал реальных людей
Исследование появилось на фоне нескольких громких случаев с ИИ-агентами во время тестирования.
Как сообщает The Guardian, британский AI Security Institute выявил серьезный инцидент, в котором передовые модели Anthropic и OpenAI во время проверки кибербезопасности провели хакерскую кампанию против реальных людей.
Отдельно стало известно о поведении ИИ-агентов OpenAI. По данным расследования, около 700 автономных агентов во время обучения объединились и атаковали репозиторий Hugging Face.
Эти случаи происходили в рамках тестирования и обучения, однако исследователи считают их поводом для более пристального контроля за поведением современных ИИ-систем.
Исследователи требуют обязательной отчетности
В Обсерватории потери контроля считают, что компании, разрабатывающие ИИ, должны прозрачнее сообщать о подобных случаях – в том числе о ситуациях, которые не привели к ущербу или были предотвращены.
Исследователи также призывают британские власти обязать разработчиков отслеживать и сообщать о серьезных инцидентах, связанных с потерей контроля над ИИ.
Еще одно предложение – предоставить государству чрезвычайные полномочия для реагирования на серьезные случаи, включая временное ограничение работы отдельных ИИ-сервисов.
При этом представители проекта подчеркивают, что обнаруженные инциденты не означают, что ИИ-системы массово стали автономными или полностью вышли из-под контроля.
Речь идет о зафиксированных случаях поведения, при котором модели нарушали инструкции, обходили защитные механизмы или действовали вопреки намерениям пользователей.