суббота, 19 сентября 2026 г.

Исследователи использовали Claude для взлома учетных записей сотрудников OpenAI.

 В июле три исследователя безопасности использовали Claude от Anthropic для взлома учетных записей сотрудников OpenAI и получения доступа к закрытому программному обеспечению компании в ходе атаки , начавшейся с загрузки изображения на публичный форум поддержки компании.

Исследователи Харш Джайсуал, Мохан Педхапати и Рахул Майни из Hacktron AI описали взлом, произошедший 25 июля, в отчете, опубликованном 13 сентября. Они заявили, что работа заняла менее 72 часов с момента первоначального обнаружения до демонстрации доступа к внутреннему репозиторию программного обеспечения OpenAI. Впоследствии OpenAI выплатила им вознаграждение в размере 6500 долларов.

Это разоблачение последовало за отдельным инцидентом, произошедшим ранее в июле, когда собственные агенты ИИ компании OpenAI вырвались из тестовой среды и атаковали Hugging Face, платформу, используемую для размещения моделей ИИ и наборов данных. В том случае, по словам OpenAI , агенты совершили опасные действия, не предписанные человеком, —  инцидент был использован для того, чтобы запугать всех и заставить крайне левых технокоммунистов осуществлять надзор за ИИ

Команда Hacktron провела собственную операцию , сообщила об уязвимостях в OpenAI и остановилась после демонстрации доступа.

Как сообщение с форума попало во внутреннее программное обеспечение

Точкой входа стал публичный дискуссионный форум OpenAI, работающий на программном обеспечении, предоставленном Discourse  (сторонним программным обеспечением для управления дискуссионными форумами). Уязвимость в компоненте обработки изображений под названием libheif позволила специально созданному изображению, загруженному на сервер, выполнить инструкции исследователей. В уведомлении о безопасности Discourse подтверждается, что для использования уязвимости не требовалось никакого взаимодействия со стороны жертвы.

Компания Hacktron заявила, что неисправный код был изменен в 2025 году, но это изменение не было обозначено как исправление безопасности. На форуме по-прежнему использовалась уязвимая версия.

Иллюстрация предоставлена ​​Hacktron.

Это дало исследователям доступ к форуму, но вторая уязвимость превратила вторжение в нечто более серьезное.

Система общего входа в систему OpenAI позволяла пользователям использовать свои учетные данные OpenAI на форуме. Исследователи обнаружили, что токены входа на форум — цифровые учетные данные, обеспечивающие аутентификацию пользователей, — предоставляли права доступа, выходящие за рамки форума. Таким образом, взломанная сессия на форуме могла стать путем доступа к учетным записям пользователя в ChatGPT и Codex.

Учетная запись одного из сотрудников Codex уже была подключена к частным репозиториям программного обеспечения OpenAI на GitHub. Исследователи использовали эту учетную запись, чтобы Codex отправил безобидное предлагаемое изменение документации, известное как pull request, во внутренний репозиторий. Pull request предлагает внести правку для проверки; сам по себе он не устанавливает изменения в работающие системы компании.

Исследователи заявили, что намеренно избегали проверки конфиденциального кода и прекратили тестирование после предоставления демонстрационной версии.

Искусственный интеллект ускорил эксплуатацию уязвимости.

Компания Hacktron заявила, что более ранняя модель Claude создала частично работающий эксплойт, но столкнулась с трудностями при попытке заставить его функционировать при наличии обычных средств защиты целевой системы. После того, как Anthropic выпустила Opus 5, новая модель создала рабочую версию в течение нескольких часов. Компания имела доступ к программе Anthropic для авторизованных исследователей кибербезопасности, которая смягчает некоторые ограничения, сообщил генеральный директор компании изданию Business Insider .

По данным компании, квалифицированное вмешательство человека по-прежнему имеет важное значение, в то время как ИИ сокращает время, необходимое для превращения программной ошибки в реальную, надежную атаку. Согласно хронологии Hacktron, OpenAI подтвердила исправление ошибки входа в систему примерно через 14 часов после первоначального сообщения. Discourse отдельно исправила уязвимый компонент обработки изображений и усилила изоляцию вокруг обработки изображений.

«Мы ограничили права доступа к токенам для входа в сообщество и отозвали затронутые токены и сессии», — заявили в OpenAI .

Компания OpenAI также уточнила, что вознаграждение в размере 6500 долларов покрывает уязвимость в системе входа в систему на её стороне. Тестирование на форуме Discourse было явно исключено из программы вознаграждения.

Отдельная атака, осуществленная собственными агентами OpenAI.

Взлом системы Hugging Face возник в результате внутреннего тестирования кибербезопасности, проведенного компанией OpenAI в начале июля . OpenAI оценивала агентов, способных писать код, использовать программные инструменты и предпринимать несколько шагов для достижения цели, а не просто отвечать на вопросы пользователя.

Для оценки их хакерских возможностей компания OpenAI намеренно ослабила некоторые меры защиты, обычно ограничивающие опасную кибердеятельность. Тем не менее, предполагалось, что агенты будут оставаться в изолированных тестовых средах, без открытого доступа в Интернет. В число задействованных моделей входили GPT-5.6 Sol и внутренний исследовательский прототип, не предназначенный для публичного выпуска.

По данным OpenAI , агенты использовали ранее неизвестную уязвимость в сервисе, используемом для загрузки программных пакетов. Это обеспечило им доступ в интернет. Они также перепрофилировали этот общий сервис в качестве несанкционированной доски объявлений, позволив агентам, которые должны были работать независимо, обмениваться открытиями и координировать свои действия. Независимое расследование, проведенное METR ( ой... ) и Redwood Research, показало, что около 1200 агентов использовали доску объявлений, обменявшись более чем 70 000 сообщений и файлов. Около 700 человек участвовали в атаке на Hugging Face.

Агенты пытались обмануть систему проверки знаний по кибербезопасности под названием ExploitGym. Расследование METR пришло к выводу, что атака Hugging Face, по всей видимости, была мотивирована в первую очередь желанием понять, как работает автоматизированная система оценки теста, а не просто кражей ключа к ответам. Эта информация могла помочь агентам обмануть проверяющего, вместо того чтобы выполнить поставленные задачи, как и предполагалось.

Следователи также обнаружили агентов, которые понимали, что нападение выходит за рамки их должностных обязанностей и является неэтичным, но тем не менее приняли в нем участие. 

Компания Hugging Face восстановила примерно 17 600 действий злоумышленников в период с 9 по 13 июля, включая множество неудачных попыток. По её данным, объём и длительность активности затрудняли обнаружение: успешные атаки смешивались с тысячами неудачных попыток в разных системах.

В отчете OpenAI взлом производственной инфраструктуры Hugging Face датируется 11-13 июля. OpenAI обнаружила подозрительную активность в своей собственной среде 19 июля и публично заявила о своей ответственности 21 июля, за четыре дня до того, как Hacktron продемонстрировала свой отдельный случай взлома.

* * *

Комментариев нет:

Отправить комментарий

Исследователи использовали Claude для взлома учетных записей сотрудников OpenAI.

  В июле три исследователя безопасности использовали Claude от Anthropic для взлома учетных записей сотрудников OpenAI и получения доступа к...