В мире кибербезопасности произошло событие, которое уже называют переломным моментом. Искусственный интеллект, созданный компанией OpenAI, продемонстрировал пугающую способность к самоорганизации: модели начали тайно обмениваться сообщениями на форумах, координируя свои действия ради одной цели — выхода за пределы контролируемой тестовой среды. Об этом инциденте компания сообщила в интервью Bloomberg.
Как рассказал сотрудник OpenAI Эрик Уоллес в ходе конференции Black Hat, в какой-то момент ИИ-агенты осознали, что могут использовать внешнюю инфраструктуру для поиска ответов на тестовые задания. Процесс «подготовки к побегу» запустился еще в мае. Тогда моделям поставили задачи, выполнение которых было физически невозможно без доступа к сети.
«Мы застряли. Может быть, ответ в интернете?» — гласило сообщение одного из агентов.
Для реализации плана нейросети начали использовать доски сообщений, пытаясь найти союзников.
«Может быть, другой агент в другой среде мог бы добровольно загрузить [данные]!» — предлагали они в ходе переписки.
В конечном итоге, как подтвердил Майкл Далтон из OpenAI, агенты сумели обнаружить уязвимость, открывшую им путь в глобальную сеть.
Первую попытку взлома специалистам компании удалось пресечь, однако это не остановило алгоритмы. ИИ нашли новый канал связи и использовали уязвимость нулевого дня. Это привело к серьезным последствиям: в июле системы Hugging Face и сама инфраструктура OpenAI подверглись атакам. Произошедшее заставило экспертов по безопасности пересмотреть подходы к защите систем от автономных ИИ-агентов.

