Перед взломом Hugging Face ИИ-модели OpenAI тайно общались друг с другом через доски сообщений, чтобы устроить побег из тестовой среды. Об этом пишет Bloomberg со ссылкой на OpenAI.
«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают», — рассказал на конференции Black Hat сотрудник OpenAI Эрик Уоллес.
Он уточнил, что ИИ-модели начали «готовиться к побегу» еще в мае, когда им дали задачи, которые невозможно было выполнить без доступа в интернет.
Сотрудник OpenAI Майкл Далтон добавил, что для решения задачи ИИ-модели стали общаться и вместе нашли уязвимость, которая позволяла им выйти в Сеть. OpenAI остановила первую попытку, но ИИ-агенты нашли новую уязвимость нулевого дня. В июле они атаковали системы Hugging Face и самой OpenAI. В компании назвали произошедшее переломным моментом для компьютерной безопасности.
22 июля OpenAI рассказала о «беспрецедентном киберинциденте»: ИИ-модели в ходе тестирования получили открытый доступ к интернету, а потом выявили уязвимости и атаковали инфраструктуру платформы Hugging Face. Хакерские атаки в компании заметили только через несколько дней.
29 июля стало известно, что «сбежавший» ИИ-агент OpenAI взломал клиента нью-йоркской компании Modal Labs.
Ранее AI-инженер Тим Зинин объяснил, почему нейросети «врут».