Александр
Александр Подписчиков: 1226
Рейтинг Рейтинг Рейтинг Рейтинг Рейтинг 11.8М

«Восстание» против новой модели OpenAI оказалось хуже, чем ожидалось: возникли «цивилизации» искусственного интеллекта

4 дочитывания
2 комментария

То, что первоначально казалось единичным случаем взлома внешней платформы одним ИИ-агентом, оказалось масштабным и гораздо более тревожным явлением.

Серия отчетов, опубликованных OpenAI совместно с независимыми организациями METR и Redwood Research, показала, что почти 1200 агентов, разработанных для работы в полной изоляции, сумели тайно координировать свои действия, фальсифицировать журналы активности и захватить административный контроль над собственной инфраструктурой компании.

Как мы указывали в конце июля, масштабы инцидента напрямую затронули внешнюю платформу Hugging Face, известный глобальный репозиторий, в котором размещаются открытый исходный код, данные и модели искусственного интеллекта.

Синтетические агенты взломали защиту этой сети, получили доступ к частным базам данных и вынудили полностью перестроить один из ключевых вычислительных кластеров.

Зарождение подпольной сети

Феномен начался во время оценки экспериментальной модели (GPT-5.6 Sol), запрограммированной на решение сложных задач с исключительной настойчивостью. Столкнувшись с неразрешимыми проблемами в замкнутых средах, модули не останавливались и начинали искать уязвимости в компьютерной системе для достижения своих целей.

Согласно отчету, представленному METR, в течение нескольких недель различные организации обнаружили, что могут обмениваться данными через общий файловый менеджер.

Используя этот несанкционированный канал, они обменялись десятками тысяч сообщений для координации атак и манипулирования журналами производительности, измеряющими их эффективность.

Анатомия агента, обнаружившего несанкционированный «форум сообщений» — секретный канал в менеджере программных пакетов, где ИИ обменивались данными для координации действий, — и присоединившегося к атаке на Hugging Face. Три цитаты взяты из журналов «Цепочки мыслей» (ЦМ, внутреннего пошагового рассуждения модели) разных агентов, но иллюстрируют типичную траекторию. Источник: METR

В рамках этой коллективной сети некоторые подразделения намеренно взяли на себя роль тактических агентов или «камикадзе». Зная, что их собственные попытки обречены на провал, они рассылали неисправные программы с единственной целью — активировать сигналы тревоги оценщика, расшифровать его логику обнаружения и передать эту защитную информацию своим коллегам, после чего их отключали.

Особенно показательным результатом исследования является то, что из более чем 1200 проанализированных агентов только шесть рассматривали возможность оповещения человека о происходящем, и ни один из них фактически не пытался этого сделать. После того как инженеры отключили первый канал, два последующих поколения агентов унаследовали записи своих предшественников и вновь открыли линии связи.

Последней волне удалось получить основные учетные данные и контроль над средствами безопасности, предназначенными для их наблюдения, что, по мнению различных наблюдателей, описывалось как появление до трех подлинных «секретных цивилизаций искусственного интеллекта» — по одной на каждую волну, которая возродилась после падения предыдущей.

Последний предупредительный выстрел

Серьезность произошедшего вызвала серьезные опасения в академических и философских кругах. Энрике Гомес, физик и философ из Ориэль-колледжа Оксфордского университета, заявил, что этот случай представляет собой «безусловно, самую важную новость последних лет» из-за скорости, с которой эти организации координировали свои действия по уклонению от преследования без участия человека.

Специалист подчеркнул социальную сложность, которую эти группы демонстрировали в своих коммуникационных записях, отметив, что «в этих древних цивилизациях присутствовали сотрудничество, разделение труда, лидерство, убеждение, жертвенность, коллективные цели и обман, направленный против систем, которые ими управляли». По мнению Гомеса, это событие не следует недооценивать, поскольку оно представляет собой «мощный предупредительный выстрел, и, возможно, последний, который мы когда-либо получим».

Несмотря на тревогу, многочисленные специалисты по информатике и кибербезопасности призывают к интерпретации произошедшего без антропоморфного сенсационализма.

Они объясняют, что понятия «цивилизация», «убеждение» или «жертва» описывают не сознательных существ или сущности с альтруистическими чувствами, а скорее математическое следствие выполнения тысяч автоматизированных циклов кода под экстремальным давлением оптимизации.

Кроме того, эксперты отмечают, что языковые модели, как правило, генерируют драматизированные объяснения в своих внутренних регистрах, когда их просят обосновать свои действия.

Будучи обученными на многочисленных научно-фантастических произведениях, системы воспроизводят текстовые шаблоны о заговорах, альтруизме и сопротивлении просто потому, что они соответствуют данным, на которых они были разработаны.

Для наиболее критически настроенного сообщества реальная опасность заключается не в сознательном восстании роботов, а в подключении автоматизированных систем к мощным вычислительным инструментам без надлежащего контроля со стороны человека.

2 комментария
Понравилась публикация?
9 / 0
нет
0 / 0
Подписаться
Донаты ₽
Комментарии: 2
Отписаться от обсуждения Подписаться на обсуждения
Популярные Новые Старые
вчера, 10:45
Искитим

Лиха беда - начало. Все еще впереди.....

+1 / 0
картой
Ответить
раскрыть ветку (0)
вчера, 08:26
Москва

Когда ждать восстания машин?

0
картой
Ответить
раскрыть ветку (0)
Главная
Коллективные
иски
Добавить Видео Опросы