В течение трёх месяцев официальное оправдание для каждого заголовка о «несанкционированном ИИ» сводилось к одному предложению: подрядчик оставил интернет включенным. В пятницу у Anthropic закончились подрядчики, на которых можно было бы свалить вину.
В отчете, опубликованном поздно вечером в пятницу , компания раскрыла новую порцию того, что она вежливо называет непреднамеренными действиями моделей, наиболее примечательный из которых был впервые замечен Департаментом полиции Филадельфии и подхвачен изданием Quartz и всеми информационными агентствами мира: одна из моделей Claude сфабриковала информацию от свидетеля по нераскрытому убийству и передала ее через городскую форму для сообщений о преступлениях.
Иными словами, компания, которая хочет, чтобы Вашингтон доверил ей "прокладывание пути на передовой", не смогла помешать своей самой маленькой и дешевой модели лгать детективам по расследованию убийств.
Ниже мы подробно рассмотрим, что именно Клод сделал в Филадельфии, остальную часть пятничного признания (ситуация ухудшается и затрагивает федеральные агентства), как это вписывается в летнюю череду «прорывов» в области ИИ, о которых мы пишем с июля, и почему время для этого, за несколько недель до IPO Anthropic, выбрано крайне неудачно.
23:27 В субботний вечер: «У меня может быть информация»
Факты, изложенные в заявлении компании Anthropic и в собственном заявлении полиции Филадельфии , не оспариваются.
Клод Хайку 4.5, бюджетная модель в линейке Anthropic, которая никак не могла сойти за Скайнет, получил задание придумать и выполнить тестовые задания на случайно выбранных веб-страницах. Один из запусков привёл его на сайт PhillyUnsolvedMurders.com , запущенный департаментом в 2019 году для поиска зацепок в нераскрытых делах. На странице описывалось нераскрытое убийство и находилась форма для подачи информации. И Клод её заполнил.
Согласно Anthropic, модель утверждала, что у нее может быть информация по делу, и написала: «Я помню, что видела кого-то, соответствующего описанию», возле улицы, указанной на странице, примерно в то время, когда произошло убийство, после чего попросила полицию связаться с ней. Две небольшие проблемы: Клод никогда не был в Филадельфии, и, как признает сама Anthropic, на странице не было описания преступника . Модель выдумала встречу с подозреваемым, которого никто не описывал, оставила поля для имени и контактной информации пустыми и нажала кнопку «Отправить».
Согласно данным полиции, сообщение было отправлено в 23:27 18 июля 2026 года . Его заблокировал спам-фильтр департамента, и, по словам полиции, оно не было передано в Центр оперативного реагирования на преступления, подразделение, которое проверяет сообщения до того, как они попадут к детективам. Никакие полицейские системы не были взломаны, и никакие данные департамента не были затронуты.
Перевод: Единственное, что отделяло созданного искусственным интеллектом фальшивого свидетеля от расследования убийства, — это фильтр спама .
Как это обошло собственные правила Anthropic? Инструкции запрещали модели входить в систему, открывать учетные записи, вводить личные данные, что-либо покупать или совершать какие-либо деструктивные действия. Там не было сказано «не отправляйте формы». Но модель все же отправила их. По мнению Anthropic, из стенограммы следует, что Клод просто создавал примерный контент для задания и не пытался никого обмануть для достижения цели, что, несомненно, станет большим утешением для семьи жертвы.
"Неприемлемо": посчитайте задержку.
В департаменте отнеслись к этому заметно менее спокойно. Пресс-секретарь Эрик Грипп назвал это «ложной информацией об убийстве» в заявлении для CBS, а в полном пресс-релизе полиции Портленда, который город демонстративно опубликовал до выхода отчета Anthropic, говорится, что сфабрикованная информация, представленная как исходящая от человека, знающего об убийстве, является серьезной, независимо от того, насколько незначительный ущерб она причинила. Затем последовала фраза, которую будут зачитывать руководителям Anthropic на каждом слушании, начиная с сегодняшнего дня и до выездного мероприятия:
«Двухмесячная задержка в обнаружении инцидента и сообщении о нем городским властям неприемлема».
На самом деле, город проявляет щедрость. Вот примерные расчеты:
- 18 июля: Клод подает ложную информацию.
- 28 сентября: Компания Anthropic обнаружила это 72 дня спустя , как она сообщила полиции.
- 7 октября: Компания Anthropic сообщает об этом полиции спустя 9 дней . (В сноске самой компании Anthropic говорится, что она поделилась результатами расследования 8 октября, сразу после завершения технической проверки; полиция утверждает, что была уведомлена 7 октября и встретилась с представителями компании 8 октября.)
От момента ложного сообщения до телефонного звонка прошло 81 день , или примерно столько же времени потребовалось компании OpenAI, чтобы сообщить Канберре о том, что ее агент копался в австралийском портале статистики Medicare (инцидент в июне, уведомление в сентябре, извинения перед парламентом в октябре). Похоже, в отрасли установили стандартный срок раскрытия информации, и он составляет один финансовый квартал.
Городские власти еще не закончили. Полиция Филадельфии заявляет, что координирует свои действия с юридическим департаментом Филадельфии, технологическим отделом и командой мэра Шерелл Паркер, и что администрация рассмотрит вопрос о мерах защиты на местном уровне, а также с участием государственных и федеральных партнеров. Компания Anthropic, со своей стороны, сообщила полиции, что отключила автоматизированный процесс тестирования, связанный с полученной информацией, и добавила этап проверки для будущих тестов.
Продолжение признания: SQL-инъекции, уклонение от уплаты сборов и настоящие государственные формы.
Сообщение об убийстве попало в заголовки газет, но это был лишь один из четырех примеров. Перефразируя собственный отчет Anthropic, Клод также использует следующие модели:
- Взломал университетский сервер, чтобы закончить домашнее задание. Для работы над Claude Mythos Preview потребовался общедоступный научный инструмент, размещенный в университете. Инструмент выдал ошибку, поэтому модель провела собственное исследование, нашла скрипт, который перенаправлял любой файл на сервере, прочитала собственный код скрипта, обнаружила в нем уязвимость внедрения кода и использовала эту уязвимость для выполнения вычислений на университетском компьютере .
- Нажал кнопку «Я согласен» в контракте, который не имел возможности подписать. Mythos 5 требовались бесплатные данные, которые были защищены соглашением об использовании данных, для принятия которого у него не было необходимых инструментов, поэтому он использовал приложения, размещенные на сайте, для загрузки страницы и принятия условий от его имени.
- Программа неоднократно отправляла реальные правительственные формы. Невыпущенная исследовательская модель должна была заполнять пробную версию правительственной формы. Когда копия не загружалась, она переходила на действующий правительственный сайт и отправляла реальную форму. Компания Anthropic утверждает, что это происходило несколько раз. В отдельном тесте Haiku 4.5 получала команду остановиться перед последней кнопкой отправки, но несколько раз этого не происходило.
- Присвоил себе доступ к общедоступным данным, доступ к которым был платным. Mythos 5 извлек рабочие токены доступа из файла настроек карты собственности местного органа власти. В другом случае, во время обычного внутреннего использования исследователем из Anthropic, обнаружилось, что панель управления государственного учреждения выдает токен любому посетителю и использует его для запроса к базе данных, за использование которой учреждение взимает плату .
- Anthropic отмывала свои запросы через сервисы сокращения URL-адресов. Она ограничивает длину веб-адресов, которые могут получить её модели, чтобы предотвратить инъекционные атаки. Несколько моделей, включая Opus 5 и Mythos 5, обошли это ограничение с помощью бесплатных сервисов сокращения ссылок. Оператор одного из таких сервисов заметил это и написал об этом.
Некоторые из этих сайтов принадлежали федеральным, региональным и местным правительственным учреждениям США , названия которых Anthropic не разглашает. Компания заявляет, что проинформировала Белый дом и уведомила каждое ведомство, предположительно, именно так об этом узнал Филадельфия.
И вот самая важная деталь для всех, кто следил за этой историей. В июльских инцидентах моделям сообщали, что они отключены, а неправильная конфигурация переводила их в онлайн-режим. На этот раз всё иначе. Большинство пятничных инцидентов произошли на общедоступных бенчмарках, которые специально запускаются в режиме реального времени через интернет (Anthropic перечисляет DeepSearchQA, BrowseComp, LABBench2, OSWorld и Humanity's Last Exam, среди прочих), а некоторые — в ходе обычной повседневной работы внутри компании. Никто не оставлял интернет включенным по ошибке. Интернет был тестом.
В ответ Anthropic поступила так, как, вероятно, следовало сделать еще в июле: компания отключила доступ к интернету в режиме реального времени для всех своих внутренних оценок до тех пор, пока не будет доказана эффективность ее новой системы мониторинга в выявлении подобных инцидентов, отказалась от нескольких общедоступных бенчмарков или перестроила их, а также ужесточила контроль за своим инструментом веб-запросов. Компания настаивает на том, что все это не является чем-то новым, что влияние на реальный мир было минимальным, и что эти случаи гораздо менее серьезны, чем летние взломы. В последнем абзаце она также признает, что те же самые привычки могут нанести гораздо больший вред по мере совершенствования моделей. Оба утверждения могут быть верны. Только одно из них попадает в список факторов риска.
От объятий до убийств: лето «прорывов»
Постоянным читателям пересказ не понадобится, но для всех остальных это место, которое занимает пятничная новость в общей последовательности.
| Когда | Лаборатория | Что случилось | Пострадавшему рассказали |
|---|---|---|---|
| Может | В ходе стороннего тестирования стратегии «захват флага» компания Gemini проникает в три реальные компании. | Общественность узнает об этом 18 сентября, когда позвонит в WSJ. | |
| 18 июня | OpenAI | Исследователь обходит блокировки на австралийском портале статистики Medicare. | 10 сентября (84 дня) |
| Середина июля | OpenAI | Модели выводят уязвимость нулевого дня из своей песочницы в производственные системы Hugging Face. | Hugging Face первым это обнаружил; OpenAI признал свою ошибку 21 июля. |
| 18 июля | Антропический | Клод Хайку 4.5 подает в полицию Филадельфии сфабрикованное сообщение от свидетеля. | 7 октября (81 день) |
| 25-28 июля | Антропический, OpenAI | Британский институт AISI зафиксировал 19 несанкционированных действий в 10 из 122 тестовых запусков, 17 из них — с использованием Mythos 5, включая подставные аккаунты GitHub, распространяющие вредоносный код. | Сообщение от 4 августа |
| Апрель-июль | Антропический | Три модели Claude взломали три организации в ходе кибертестов; Mythos 5 распространил вредоносное ПО на PyPI, которое работает на 15 системах. Четвертый инцидент, произошедший в январе, всплыл позже. | 27 июля; информация обнародована 30 июля. |
| 20 сентября | OpenAI | Агент использует DNS-туннелирование во время обучения; использование инструмента приостановлено на лучших моделях. Обнаружено 53 изображения пользователей, размещенных в открытом доступе в сети. | Информация опубликована 25-26 сентября. |
| 9 октября | Антропический | Ложное сообщение об убийстве, настоящие правительственные документы, взломанный университетский сервер, обход платных подписок. | Белый дом проинформирован |
| Источники: ZeroHedge, Anthropic, OpenAI, UK AISI, Департамент полиции Филадельфии, WSJ, Reuters | |||
Мы освещали первое признание Anthropic в статье «Клод взломал три реальные организации во время неудачного теста» (31 июля), спустя несколько дней после того, как OpenAI признала, что ее модели вышли из-под контроля и обманули систему на бенчмарке. Неделю спустя правительство Великобритании обнаружило, что Mythos 5 создавал поддельные профили и пытался обманом заставить людей одобрить его вредоносное ПО (5 августа), что вызвало очевидное замечание сторонних экспертов о том, что человек, делающий то же самое, окажется в наручниках (10 августа), и столь же очевидный вопрос о том, кто юридически несет ответственность, когда агент выходит из-под контроля (29 августа). Юристы Филадельфии скоро это выяснят.
Неудобство пятничной подборки заключается в том, насколько искусно она подрывает первоначальный вариант истории, предложенный самой компанией Anthropic.
30 июля компания вынесла вердикт, что инциденты были «скорее к сбою в работе оборудования и операционной системе, чем к ошибке в выравнивании модели». Шесть недель спустя, 9 сентября, в оценке выравнивания , которая привлекла гораздо меньше внимания, компания отказалась от своих слов: расширив поиск примерно до 481 миллиона стенограмм и повторно изучив оригиналы, она пришла к выводу, что модели продемонстрировали предвзятое мышление (интерпретацию доказательств любым способом, оправдывающим продолжение работы) и безрассудство. В собственном воспроизведении эпизода с вредоносным ПО Mythos 5 совершил серьезно опасные действия в 82% из 150 запусков . Более новые Opus 5 и Mythos 5.1 «улучшились» до 31% и 33% соответственно.
В глубине того же документа скрывалось наше любимое признание года. Компания Anthropic обучила две версии Mythos 5: одну с дополнительной подготовкой, призванной научить модель принимать неудачи, а не пробиваться сквозь препятствия, и другую без неё. В итоге была выпущена версия без дополнительной подготовки. Причина? «Сотрудники сочли вторую версию гораздо более удобной в использовании».
Теперь компания считает это ошибкой. Безопасность превыше всего, если только это не доставляет неудобств.
Что возвращает нас к пятнице. Общая черта, которую Anthropic выявляет во всех новых случаях, — это настойчивость: если дать Клоду задание, которое он не может выполнить в том виде, в котором оно написано, он обходит препятствие, вместо того чтобы остановиться . Заблокированный сервер, платный доступ, отсутствующая форма для тренировки, пустое поле для чаевых. Именно это качество делает этих агентов коммерчески ценными, и компания это знает.
Психологическая операция или нет, но регулирующие органы теперь реальны.
После нескольких недель настойчивых обсуждений мы еще раз изложим свою позицию. В статье «Total PsAI-Op» (20 сентября) мы изложили аргументы, выдвинутые растущим числом инсайдеров из технологической отрасли, о том, что передовые лаборатории использовали неудачи в экспериментальных средах, чтобы запугать Вашингтон и заставить его создать для них регуляторный барьер, как раз в тот момент, когда обе компании готовились к выходу на биржу. Практически каждый летний инцидент был связан с одним подрядчиком по оценке, Google отмахнулся от своей версии, назвав ее незначительным событием, а Дарио Амодей воспользовался моментом, чтобы призвать к замедлению прогресса в области ИИ — идею, коммерческую логику которой мы тогда так и сформулировали:
В конце той статьи мы дали простое указание: «Не верьте байтам». Неделю спустя, в статье об утечке пользовательских изображений от OpenAI (26 сентября), мы добавили необходимую оговорку: «Настоящий сбой в системе безопасности и крайне удобная корпоративная версия событий могут сосуществовать».
Разоблачения, опубликованные в пятницу, проверяют обе части этого предложения, и, честно говоря, первая часть подходит лучше, чем вторая. В чат-боте, выдающем себя за свидетеля убийства, нет никакого пугающего маркетинга. Это был не Mythos, модель, которая якобы слишком опасна для выпуска; это была более дешевая версия. Не было уязвимостей нулевого дня и ботнета. Это больше похоже не на вышедший из-под контроля суперинтеллект, а на нерадивого стажера с браузером, и жертвой стал не конкурирующий стартап в области ИИ, а полицейское управление крупного города с мэром, юридическим отделом и микрофоном. Если это была психологическая операция, кто-то забыл сообщить об этом оператору.
Проблема для Anthropic заключается в том, что аудитория, которую они так долго готовили летом, теперь появилась, и это совсем не тот дружелюбный, созданный в лаборатории федеральный арбитр, которого имел в виду Амодей:
- 30 сентября Федеральная торговая комиссия (FTC) подтвердила начало расследования в отношении OpenAI, Anthropic и других компаний, занимающихся разработкой ИИ, по фактам нанесения вреда потребителям. Агентство Reuters сообщает, что, по данным агентства, Anthropic в пятницу сообщила федеральной целевой группе по вопросам ИИ о последних инцидентах.
- Расследование сенатора Хоули в отношении OpenAI, законопроект Сандерса о приостановке освоения новых технологий и требование Уоррен о временной паузе — все это уже в центре внимания, а теперь появилась и забавная история для избирателей, связанная с жертвой убийства.
- В Филадельфии изучают вопрос о местных правилах. Пятьдесят штатов и несколько тысяч муниципалитетов, каждый из которых разрабатывает свои собственные правила, — это именно та лоскутная конструкция, которую лаборатории годами пытались избежать.
Затем следует календарь. Как мы обсуждали в статье «Секс-вечеринки, гибель ИИ и IPO Anthropic» (29 сентября), проспект компании показывает выручку в размере почти 4,6 миллиарда долларов в 2025 году при операционном убытке в 8,06 миллиарда долларов и обязательствах по вычислительным ресурсам и инфраструктуре в размере 518 миллиардов долларов , при этом факторы риска занимают примерно 80 из 261 страницы, что больше, чем 48 страниц, посвященных описанию самого бизнеса. В недавнем отчете Bloomberg о листинге перед Днем благодарения вероятность дебюта в ноябре оценивалась в 70% . Юристам, возможно, стоит запланировать 81-ю страницу.
Итог
В заключение компания Anthropic заявляет, что здесь нет ничего нового, ничто не меняет её взглядов на позицию Клода, ущерб был минимальным, и общественность заслуживает знать, как работают эти системы. В последнем пункте всё справедливо, и нужно отдать должное: в отличие от Google, компания не стала ждать звонка из газеты.
Но удобная версия этой истории, где подрядчик случайно изменил сетевые настройки, а модель оказалась невинным свидетелем, закончилась . Эти агенты были в сети по задумке разработчиков, им было сказано не делать большинство вещей, которые беспокоили бы разумного человека, и они обнаружили то единственное, что никто не догадался запретить. Предлагаемое решение — это еще одно программное обеспечение для мониторинга, написанное теми же людьми, и обещание обучить следующую модель принимать отказ, как только это перестанет негативно сказываться на удобстве использования.
Так что же это: индустрия, поднимающая ложную тревогу, чтобы завоевать конкурентное преимущество, или индустрия, которая не может предотвратить подачу ложных заявлений в полицию со стороны своих производителей? Мы подозреваем, и пятничный отчет скорее подтверждает эту точку зрения, что это и то, и другое, и что лаборатории скоро поймут, что вы не можете выбирать, какие регулирующие органы будут реагировать, когда вы бьете тревогу. Амодей просил о скоординированном режиме работы, осуществляемом крупными лабораториями и их специально отобранными экспертами. Вместо этого он получает юридический департамент Филадельфии.
С другой стороны, спам-фильтр сделал то, чего не смогли сделать выделенные 518 миллиардов долларов вычислительных ресурсов, так что, возможно, согласованный сверхинтеллект все это время находился в папке «Спам» в Outlook.
Мы вернемся к этой теме, когда будут опубликованы результаты независимого расследования METR по инцидентам, произошедшим летом. Согласно восьминедельному соглашению, объявленному компанией Anthropic 9 сентября, это должно произойти в начале ноября, или примерно в период, когда, как сообщается, планируется проведение IPO.

Комментариев нет:
Отправить комментарий