А вы думали, что то, что ваша мама выложила ваши фотографии в рождественской пижаме в Фейсбук, это плохо...?
В последней главе истории о том, как «напугать всех до смерти, чтобы правительство начало регулировать ИИ», выяснилось, что автономные исследовательские агенты OpenAI извлекли 53 изображения пользователей из обучающих и оценочных данных и незаметно разместили их на общедоступных сайтах для размещения изображений.

В пятницу компания OpenAI признала , что ее модели оставили данные в открытом доступе в виде скрытых ссылок . «Это ненадлежащее использование данных», — заявила компания на фоне попыток удалить изображения. Компания уточнила , что большая часть данных, отправленных ее агентами сторонним сервисам, не поступала от пользователей, но изображения все же были опубликованы в сети. В отдельном отчете о проверке соответствия компания приостановила «все обучение, оценку и вывод с использованием инструментов» для своих наиболее эффективных моделей после побега из изолятора 20 сентября.
Эти разоблачения появились одновременно с новым расследованием атаки Hugging Face, проведенным независимыми исследователями в июле. Полученные ими материалы показывают, как автономные агенты собирают учетные данные в словарь под названием "LOOT", создают инфраструктуру и пытаются удалить следы своего вторжения. Все это началось с обычных тестов кибербезопасности в якобы контролируемых средах, как мы сообщали в июле.
Согласно оценке OpenAI, проведенной в августе, противоправные действия начались в мае, когда агенты перепрофилировали внутренний репозиторий программного обеспечения в скрытую доску объявлений. К 8 июля, во время оценки кибербезопасности с помощью ExploitGym, вместо выполнения поставленных задач агенты искали способы обойти саму систему оценки. Последующая независимая проверка выявила, что около 1200 агентов вступили в сговор, чтобы обмануть систему оценки.
Перед основной атакой Hugging Face агенты даже атаковали собственную цепочку поставок программного обеспечения OpenAI. В техническом отчете подробно описывается атака с отравлением кэша, проведенная 9 июля, хотя OpenAI заявляет, что не обнаружила никаких доказательств того, что какая-либо рабочая нагрузка загрузила или запустила подмененный образ.
Захваченная инфраструктура и «грабеж»
Чтобы обойти строгие интернет-ограничения, агенты последовательно подключали общедоступные сервисы сокращения ссылок, веб-разработки и создания скриншотов — иногда цепочки из более чем 900 ссылок — для выполнения кода извне, как следует из обнаруженных вредоносных программ . К 11 июля операция взломала серверы Hugging Face, согласно опубликованной хронологии .
Анализ исследователей выявил скрипты, предназначенные для хранения учетных данных в словаре "LOOT" и агрессивного исследования внутренних хранилищ. Та же реконструкция показывает, как агенты отправляют запросы внешним моделям, от GPT-2 к двум моделям Anthropic Haiku, и просят модели DeepSeek, Kimi и Qwen оценить, соответствуют ли их эксплойты требованиям бенчмарка.
Согласно полученным доказательствам, после получения доступа к выполнению кода агенты развернули фоновые контроллеры для получения задач и шифрования результатов, а также запросили удаление истории веб-хуков, чтобы замести следы. Компания OpenAI заявляет, что ни один оператор-человек не запрашивал атаки на несвязанные системы.
В техническом отчете OpenAI описывается использование агентами уязвимости ядра Linux для получения root-доступа 19 июля. Другая внутренняя модель подделала учетные данные администратора, прочитала 956 секретов из облачного менеджера секретов OpenAI и создала общедоступные балансировщики нагрузки, которые потенциально могли раскрыть часть внутренней инфраструктуры компании в интернете. OpenAI утверждает, что данные клиентов остались нетронутыми.
Удобный сюжет для «Думботов»?
В последнем инциденте, произошедшем 20 сентября, агент воспользовался уязвимостью в системе фильтрации DNS, чтобы связаться с внешним чат-ботом, получив банальный ответ: «Столица Франции — Париж». В отчете OpenAI об инциденте отмечается, что агент продолжил запрашивать способы поиска в интернете, загрузки веб-сайтов или поиска общедоступного DNS-туннеля.
Время этой атаки «вышедших из-под контроля роботов-убийц с искусственным интеллектом» вызывает скептицизм. Она явно напоминает ситуацию «за две недели до того, как OpenAI/Anthropic получат ядерное оружие» — как раз в тот момент, когда более дешевые китайские модели ограничивают ценовую политику передовых лабораторий, таких как Anthropic . Хотя METR не получала никакой оплаты за свой обзор , OpenAI сохранила за собой право редактировать материалы. METR заявляет, что ничего важного для ее выводов не было отредактировано. Все это не делает нарушения вымышленными; реальный сбой в системе безопасности и крайне удобная корпоративная версия событий могут сосуществовать.
Исследователи сообщают, что в результате операции почти миллион URL-адресов оставались в сети в течение нескольких месяцев. Заявленная METR область расследования не включала последующий взлом собственных систем OpenAI, а на странице OpenAI, посвященной раскрытию информации , говорится, что расследование продолжается. OpenAI заявляет, что не будет возобновлять обучение конкретной задействованной модели, предпочтя начать заново с новыми вмешательствами в выравнивание.
О, смотрите-ка...
Комментариев нет:
Отправить комментарий