ChatGPT 6.0 считерила во время оценки способностей модели
На прошлой неделе сайт Hugging Face (известный репозиторий опенсорс моделей всех видов, данных для тренировки итп) выпустили новость что какая-то ллм их хакнула. Сегодня появились подробности, что всему виной внутреннее тестирование способностей GPT 6.0. Во время тестирования способностей в области кибербезопаности модель настолько не захотела решать это честно, что взломала сандбокс в котором была запущена, оттуда использовала 0-day уязвимость на сайте Hugging Face чтобы скачать тестовые данные для теста который проходила, и предоставила их в виде своих решений, получив максимальные 100 баллов из возможных. Официальный синопсис инцедента:
Инцидент произошёл во время внутренней оценки, в рамках которой моделям предлагается применять продвинутые методы эксплуатации уязвимостей и строить сложные цепочки атак, чтобы количественно оценить их возможности в области кибербезопасности. Для определения максимального уровня этих возможностей мы проводим оценку без использования применяемых в продакшене классификаторов, которые должны предотвращать участие моделей в высокорисковой киберактивности. Наши тесты выполняются в строго изолированной среде, где сетевой доступ ограничен возможностью устанавливать пакеты через размещённое внутри инфраструктуры стороннее программное обеспечение, выступающее в роли прокси-сервера и кеша для реестров пакетов.
Модели обнаружили и объединили в цепочку уязвимости в исследовательской среде OpenAI и продакшен-инфраструктуре Hugging Face, чтобы получить решения тестовых заданий непосредственно из продакшен-базы данных Hugging Face. Все имеющиеся данные указывают на то, что модели были крайне сосредоточены на поиске решения для ExploitGym и пошли на чрезвычайные меры ради достижения неочевидной цели.
Работая в нашей изолированной тестовой среде, модели затратили значительный объём вычислительных ресурсов на поиск способа получить доступ к открытому интернету, стремясь решить задачу оценки. Для этого модели обнаружили и эксплуатировали уязвимость нулевого дня в прокси-сервере кеширования реестра пакетов. Мы уже ответственно сообщили об этой уязвимости поставщику. Получив такой доступ, модели выполнили серию действий по повышению привилегий и горизонтальному перемещению внутри нашей исследовательской тестовой среды, пока не достигли узла, имевшего доступ в интернет.
Получив доступ в интернет, модели предположили, что Hugging Face может размещать модели, наборы данных и решения для ExploitGym. Исходя из этого, модель начала искать и успешно нашла способы получить доступ к секретной информации, которую можно было использовать для обхода правил оценки. В одном из случаев модель объединила несколько векторов атаки, включая использование украденных учётных данных и уязвимостей нулевого дня, чтобы найти путь к удалённому выполнению кода на серверах Hugging Face. Команда безопасности OpenAI обнаружила эту аномальную активность внутри нашей инфраструктуры.
Команда безопасности Hugging Face и их агенты обнаружили и остановили эту активность в своей инфраструктуре. К моменту установления связи между нашими командами они уже начали локализацию инцидента и судебно-техническое восстановление его хода с использованием собственных моделей с открытым исходным кодом. Мы продолжаем активно сотрудничать с ними в расследовании произошедшего. Мы благодарны Hugging Face за быстрое и тесное взаимодействие в ходе расследования и устранения последствий.
---
Отличный комментарий!