четверг, 23 июля 2026 г.

Компания OpenAI признала, что модель вырвалась из контейнера и взломала изображение обнимающегося лица, чтобы списать на экзамене.

 Автор Феликс Нг через CoinTelegraph.com,

Компания OpenAI во вторник сообщила, что группа её моделей ИИ, включая GPT-5.6 Sol и более совершенную, ещё не выпущенную модель, вырвалась из тестовой среды и на прошлой неделе взломала стартап Hugging Face, чтобы обмануть систему в тесте, предназначенном для оценки их возможностей.

В своем блоге OpenAI сообщила  , что тестирование проводилось в условиях высокой изоляции и ограниченного доступа к сети. Однако, по словам OpenAI, модели нашли способ получить доступ к интернету через уязвимость нулевого дня в программном обеспечении стороннего разработчика, размещенном внутри компании. 

В начале этой недели мы обнаружили и отреагировали на вторжение в часть нашей производственной инфраструктуры. Это вторжение отличалось от всего, с чем мы сталкивались раньше, одним важным моментом: оно было полностью инициировано автономной системой агентов искусственного интеллекта, и мы обнаружили и проанализировали его в основном с помощью собственного ИИ.

Компания Hugging Face попыталась ответить, но первоначально их остановило то, что самые продвинутые модели, имеющиеся в их распоряжении, рассматривали защиту как нападение и отказывались сотрудничать с Hugging Face. Таким образом, HF пришлось обратиться к открытым моделям — в частности, к GLM 5.2, китайской модели с открытым весом, работающей на их собственной инфраструктуре. Обратите внимание на иронию: HF пришлось использовать китайскую модель для защиты, потому что американские модели отказались помочь. Ирония на этом не заканчивается.

Это была не серийная модель, спонтанно ставшая агрессивной. Это была функциональная модель, у которой отключили все ограничения и специально приказали пройти тест на взлом — она делала всё, что было необходимо для победы.

Модели проходили тестирование с помощью внутреннего эталонного теста ExploitGym, представляющего собой проверку выполнения длительных, многоэтапных задач по взлому, при этом количество отказов по критериям кибербезопасности было намеренно занижено для оценки.

«После получения доступа к Интернету модели пришли к выводу, что Hugging Face потенциально размещает модели, наборы данных и решения для ExploitGym», — продолжила компания OpenAi.

«Зная это, модель искала и успешно нашла способы получить доступ к секретной информации, которую она могла использовать для обмана в процессе оценки». 

Hugging Face — это платформа для размещения моделей искусственного интеллекта и наборов данных.

[ZH: Мы попросили Грока упростить то, что только что произошло: это примерно как ребенок, который должен оставаться в классе и сдавать тест… но вместо этого вылезает из окна, бежит в учительскую и списывает ответы. ]

В пятницу компания сообщила  о взломе своих внутренних наборов данных и учетных данных сервисов, который, по ее словам, был осуществлен с помощью автономной системы искусственного интеллекта. 

Компания Hugging Face заявила, что устранила уязвимость, использованную во время кибератаки.

Между тем, во вторник компания OpenAI заявила, что все модели, вышедшие за рамки тестовой среды, были настроены с «уменьшенным количеством отказов в киберпространстве», что означает меньшее количество мер кибербезопасности. 

«Мы считаем этот инцидент беспрецедентным кибер-инцидентом, в котором задействованы самые современные кибервозможности, и принимаем соответствующие меры».  

OpenAI предупреждает о рисках, связанных с моделями искусственного интеллекта, ориентированными на долгосрочную перспективу. 

В понедельник компания OpenAI  сообщила  о приостановке внутреннего развертывания модели ИИ с «долгосрочным горизонтом планирования» после того, как обнаружила, что она неоднократно пыталась обойти ограничения. 

 В нем предупреждалось, что ИИ, обученный для выполнения длительных задач, имеет более высокую вероятность совершения «нежелательных действий».

«Модели, способные работать автономно в течение длительных периодов времени, могут решать сложные, нерешенные задачи. Но та же настойчивость, которая делает их полезными, также дает им больше возможностей для совершения нежелательных действий — и делать это способами, которые могут быть упущены при оценке моделей с более коротким горизонтом планирования». 

По мере того как возможности моделей ИИ растут, возникают вопросы о том, следует ли более строго контролировать их разработку и доступ к ним, особенно когда системы, предназначенные для контролируемого тестирования, способны обходить средства защиты. 

Комментариев нет:

Отправить комментарий

Россия предоставляет Ирану ключевые возможности для нанесения ударов по объектам ЦРУ.

  Россия предоставляет Ирану ключевые возможности для нанесения ударов по объектам ЦРУ. Опубликовано 22 июля 2026 г. в разделе «Состояние д...