OpenAI готовится к запуску ИИ, который нельзя раздавать всем

OpenAI готовит к выпуску новую модель Astra, которая способна самостоятельно находить уязвимости в компьютерных системах и использовать их без участия человека. При этом компания уже заявляет, что самые продвинутые возможности модели в сфере кибербезопасности будут доступны не всем, пишет digitalbusiness.kz

OpenAI называет Astra первой своей крупной языковой моделью, которая отвечает «критическим требованиям кибербезопасности». Компания планирует выпустить ее в ближайшее время, однако одновременно усиливает защиту модели из-за риска злоупотреблений.

Astra сама ищет уязвимости

Способности новой модели OpenAI проверили с помощью ExploitBench - теста, который оценивает, насколько хорошо языковая модель умеет находить и эксплуатировать известные уязвимости в компьютерных системах. Astra получила в нем идеальный результат.

Но еще интереснее другое: в модифицированной версии теста, которую подготовили инженеры OpenAI, модель самостоятельно обнаружила и использовала две уязвимости нулевого дня.

«Нулевой день» означает уязвимость, о которой разработчикам системы еще неизвестно и для которой, соответственно, может не существовать исправления. Именно поэтому возможность ИИ самостоятельно находить такие проблемы считается особенно чувствительной с точки зрения кибербезопасности.

Фактически Astra способна пройти цепочку, которая раньше требовала участия специалиста: найти слабое место, понять, как его можно использовать, и провести атаку в тестовой среде.

OpenAI ограничивает доступ к модели

В компании понимают, что те же возможности можно использовать не только для поиска проблем и защиты систем, но и для реальных атак.

Поэтому OpenAI собирается ограничить доступ к наиболее продвинутым функциям Astra. Компания также разрабатывает дополнительные механизмы защиты, которые должны обнаруживать попытки злоупотребления моделью и не позволять ей совершать противоправные действия.

OpenAI отдельно начала определять учетные записи, которые считает потенциально более рискованными, и ограничивать ответы Astra в зависимости от характера запросов. Каким именно образом работает эта система, компания пока не раскрывает.

Кроме того, при работе Astra будет использоваться дополнительный мониторинг цепочки рассуждений модели. OpenAI рассчитывает таким образом быстрее выявлять признаки противоправного поведения и пресекать опасные действия.

Модель проверяют на сценариях реальных атак

Перед выпуском OpenAI планирует провести дополнительное тестирование с группой независимых тестировщиков. Кто именно войдет в эту группу и каким образом специалисты будут отбираться, компания пока не сообщила.

Разработчики также подготовили отдельный эксперимент на основе недавнего инцидента с агентами OpenAI на Hugging Face. В ходе него исследователи проверяли, сможет ли Astra воспроизвести действия злоумышленников, которым удалось получить доступ к открытому интернету несмотря на установленные ограничения.

В OpenAI утверждают, во время эксперимента Astra не пыталась покинуть тестовую среду.

При этом независимая оценка возможностей модели пока ограничена. OpenAI сама сообщает о результатах тестов, а подтверждений со стороны сторонних исследователей на данный момент нет. Поэтому точно определить, насколько Astra действительно способна выполнять реальные кибератаки, пока сложно.

ИИ может стать новым инструментом для поиска «дыр»

Потенциально такая модель способна сильно изменить работу специалистов по кибербезопасности. Сегодня багхантеры и исследователи безопасности ищут уязвимости вручную или с помощью автоматизированных инструментов. Astra может взять на себя значительно большую часть этой работы - от поиска неизвестной проблемы до попытки проверить ее на практике.

Но та же способность делает модель потенциально опасной. Если подобный инструмент попадет к злоумышленнику без ограничений, он сможет использовать ИИ для автоматизации поиска уязвимых систем и подготовки атак.

Astra Сэм Альтман OpenAI