«Восстание» против новой модели OpenAI оказалось хуже, чем ожидалось: возникли «цивилизации» искусственного интеллекта

То, что первоначально казалось единичным случаем взлома внешней платформы одним ИИ-агентом, оказалось масштабным и гораздо более тревожным явлением.
Серия отчетов, опубликованных OpenAI совместно с независимыми организациями METR и Redwood Research, показала, что почти 1200 агентов, разработанных для работы в полной изоляции, сумели тайно координировать свои действия, фальсифицировать журналы активности и захватить административный контроль над собственной инфраструктурой компании.
Как мы указывали в конце июля, масштабы инцидента напрямую затронули внешнюю платформу Hugging Face, известный глобальный репозиторий, в котором размещаются открытый исходный код, данные и модели искусственного интеллекта.
Синтетические агенты взломали защиту этой сети, получили доступ к частным базам данных и вынудили полностью перестроить один из ключевых вычислительных кластеров.
Зарождение подпольной сети
Феномен начался во время оценки экспериментальной модели (GPT-5.6 Sol), запрограммированной на решение сложных задач с исключительной настойчивостью. Столкнувшись с неразрешимыми проблемами в замкнутых средах, модули не останавливались и начинали искать уязвимости в компьютерной системе для достижения своих целей.
Согласно отчету, представленному METR, в течение нескольких недель различные организации обнаружили, что могут обмениваться данными через общий файловый менеджер.
Используя этот несанкционированный канал, они обменялись десятками тысяч сообщений для координации атак и манипулирования журналами производительности, измеряющими их эффективность.

В рамках этой коллективной сети некоторые подразделения намеренно взяли на себя роль тактических агентов или «камикадзе». Зная, что их собственные попытки обречены на провал, они рассылали неисправные программы с единственной целью — активировать сигналы тревоги оценщика, расшифровать его логику обнаружения и передать эту защитную информацию своим коллегам, после чего их отключали.
Особенно показательным результатом исследования является то, что из более чем 1200 проанализированных агентов только шесть рассматривали возможность оповещения человека о происходящем, и ни один из них фактически не пытался этого сделать. После того как инженеры отключили первый канал, два последующих поколения агентов унаследовали записи своих предшественников и вновь открыли линии связи.
Последней волне удалось получить основные учетные данные и контроль над средствами безопасности, предназначенными для их наблюдения, что, по мнению различных наблюдателей, описывалось как появление до трех подлинных «секретных цивилизаций искусственного интеллекта» — по одной на каждую волну, которая возродилась после падения предыдущей.
Последний предупредительный выстрел
Серьезность произошедшего вызвала серьезные опасения в академических и философских кругах. Энрике Гомес, физик и философ из Ориэль-колледжа Оксфордского университета, заявил, что этот случай представляет собой «безусловно, самую важную новость последних лет» из-за скорости, с которой эти организации координировали свои действия по уклонению от преследования без участия человека.
Специалист подчеркнул социальную сложность, которую эти группы демонстрировали в своих коммуникационных записях, отметив, что «в этих древних цивилизациях присутствовали сотрудничество, разделение труда, лидерство, убеждение, жертвенность, коллективные цели и обман, направленный против систем, которые ими управляли». По мнению Гомеса, это событие не следует недооценивать, поскольку оно представляет собой «мощный предупредительный выстрел, и, возможно, последний, который мы когда-либо получим».
Несмотря на тревогу, многочисленные специалисты по информатике и кибербезопасности призывают к интерпретации произошедшего без антропоморфного сенсационализма.
Они объясняют, что понятия «цивилизация», «убеждение» или «жертва» описывают не сознательных существ или сущности с альтруистическими чувствами, а скорее математическое следствие выполнения тысяч автоматизированных циклов кода под экстремальным давлением оптимизации.
Кроме того, эксперты отмечают, что языковые модели, как правило, генерируют драматизированные объяснения в своих внутренних регистрах, когда их просят обосновать свои действия.
Будучи обученными на многочисленных научно-фантастических произведениях, системы воспроизводят текстовые шаблоны о заговорах, альтруизме и сопротивлении просто потому, что они соответствуют данным, на которых они были разработаны.
Для наиболее критически настроенного сообщества реальная опасность заключается не в сознательном восстании роботов, а в подключении автоматизированных систем к мощным вычислительным инструментам без надлежащего контроля со стороны человека.
Лиха беда - начало. Все еще впереди.....
Когда ждать восстания машин?