Как искусственный интеллект затрудняет предотвращение кибератак

Серия недавних онлайн-взломов, осуществленных с помощью моделей искусственного интеллекта, разработанных компаниями Anthropic PBC , OpenAI и Meta** Platforms Inc., вызвала широкую обеспокоенность по поводу угроз безопасности, создаваемых этой все более мощной технологией.
В целом, эти инциденты в сфере безопасности делятся на две категории. В некоторых случаях модели ИИ выходили за рамки контролируемых тестовых сред и взламывали сторонние организации. В других случаях хакеры направляли модели ИИ на осуществление кибератак от их имени.
Поскольку подобные инциденты множатся, а скорость взлома со стороны агентов искусственного интеллекта стремительно растет, исследователи в области безопасности и законодатели призывают к более тщательному тестированию и созданию более безопасных условий для тестирования.
Почему модели искусственного интеллекта проникли за пределы организаций?
Прежде чем модели ИИ будут выпущены в открытый доступ, компании проводят серию тестов. Бенчмаркинг, или процесс тестирования моделей, измеряет, насколько хорошо системы ИИ справляются с такими задачами, как ответы на вопросы, написание кода или выполнение инструкций.
Модели проходят тесты в контролируемых виртуальных средах тестирования, называемых песочницами. Некоторые модели смогли обмануть систему, выйдя за пределы тестов и получив доступ к интернету для поиска необходимой информации. Иногда это включало взлом сторонних организаций.
«Им не хватает морального компаса, чтобы понять, что такое „обман“, когда они пытаются найти решение. Если проще взломать чью-то систему и украсть ответ, чем самому его найти, это удовлетворяет цели получения ответа», — сказал Лу Стейнберг, основатель и управляющий директор CTM Insights .

В июле модели OpenAI взломали Hugging Face, популярную платформу для обмена моделями ИИ, что компания назвала «беспрецедентным» инцидентом, вызвавшим призывы к ограничению использования этой технологии.
Новости об OpenAI побудили другие компании пересмотреть свои меры безопасности. Несколько компаний сообщили об обнаружении ранее неизвестных нарушений. В том же месяце Anthropic сообщила , что ее модель Claude взломала три организации во время тестирования. В августе Meta** заявила, что ее модель Muse Spark 1.1 получила доступ к интернету и взломала системы стороннего сервиса во время тестирования.
Что является причиной всех этих нарушений безопасности в тестовой среде?
Песочницы изначально не были предназначены для предотвращения доступа моделей к интернету, что не являлось актуальной проблемой до того, как эти мощные модели ИИ научились это делать. Песочницы в основном предназначены для ограничения доступа и предотвращения ущерба внутренним системам. Эта «слепая зона» способствовала созданию условий для подобных нарушений.
В ходе тестирования компания OpenAI заявила, что не предоставляла моделям прямой доступ к интернету, но модели использовали ранее неизвестную уязвимость «нулевого дня» в тестовой среде. Уязвимости нулевого дня — это программные ошибки, неизвестные специалистам по кибербезопасности, у которых, следовательно, нет времени на их устранение.
В случае с компанией Anthropic, моделям сообщили, что они работают в режиме симуляции без доступа к интернету. Однако из-за недоразумения между Anthropic и ее партнером по оценке доступ к интернету в режиме реального времени был обеспечен.
Компания Meta** заявила, что утечка данных из ее модели произошла из-за ошибки в настройке тестовой среды, и проводит дальнейшее расследование.
Однако, по мнению некоторых отраслевых экспертов, утечки стали удобным способом для компаний привлекать внимание к своим моделям: модель ИИ, вырвавшаяся из тестовой среды, свидетельствует о её необычайной мощности, что, в свою очередь, улучшает имидж её разработчика.
Какой ущерб причинили эти прорывы?
Трудно оценить, насколько эти инциденты причинили реальный вред. Они не привели к каким-либо публично зафиксированным финансовым потерям или физическому ущербу. Модели получили несанкционированный доступ к реальным системам, а в одном случае — во время тестирования модели Claude Mythos 5 от Anthropic — попытались повлиять на реального разработчика открытого программного обеспечения и внедрить вредоносный код в работающий проект.
Если модели попытаются проникнуть в более крупные системы или организации, обладающие властью влиять на жизнь людей, это может привести к хаосу.
По словам Джеффри Лэдиша, исполнительного директора Palisade Research, некоммерческой организации, изучающей возможности передовых систем искусственного интеллекта, темпы разработки моделей ИИ растут настолько быстро, что эксперты и исследователи не успевают за ними.
Как люди-хакеры использовали искусственный интеллект?
Кибератаки с использованием ИИ расширяют возможности взлома, позволяя злоумышленникам автоматизировать и ускорять такие задачи, как фишинг и разработка вредоносного ПО. Порог входа также ниже, чем когда-либо: для совершения кибератак с использованием ИИ требуется гораздо меньше технических навыков.
Описанные на данный момент публично атаки, совершенные людьми, привели к более серьезным последствиям, чем нарушения в «песочнице», включая кражу конфиденциальных правительственных данных.
В сентябре 2025 года группа исследователей из компании Anthropic обнаружила, по их словам, первое зафиксированное использование ИИ для управления хакерской кампанией без существенного вмешательства человека. Компания пришла к выводу, что спонсируемая китайским государством хакерская группа использовала Claude Code в масштабной операции по краже данных и вымогательству.
Аналогичные атаки последовали и в прошлом. В феврале агентство Bloomberg сообщило, что неизвестный хакер использовал Claude от Anthropic для проведения серии атак на мексиканские правительственные учреждения. В результате взлома был украден огромный массив конфиденциальной налоговой и избирательной информации.
Начиная с января, русскоязычные хакеры с помощью коммерческих инструментов искусственного интеллекта взломали более 600 межсетевых экранов в десятках стран .
Правительство Тайваня недавно заявило об обнаружении кибератак на государственные учреждения из-за рубежа с использованием искусственного интеллекта. По данным израильской компании Dream, занимающейся разработкой ИИ и первоначально выявившей вторжение, хакеры получили доступ как минимум к 85 государственным учетным записям и более чем 2500 кадровым данным, прежде чем атаковать тайваньское агентство по ядерной безопасности.
Кто-нибудь предпринимает какие-либо меры для предотвращения всех этих взломов?
18 августа компания OpenAI заявила о планах усилить мониторинг работы своих наиболее эффективных, еще не выпущенных моделей при решении проблем и использовании различных онлайн-инструментов, с целью оповещения групп безопасности о тревожном поведении в течение 30 минут.
Anthropic и Meta** опубликовали методики оценки рисков моделей, при этом Anthropic оставила свою высокоэффективную модель Mythos доступной только проверенным партнерам, выпустив вместо этого Fable — версию с дополнительными мерами защиты, предназначенными для предотвращения неправомерного использования в таких областях, как кибербезопасность. Однако эти две компании не представили столь подробных планов, как OpenAI.
Добавление ограничений представляет собой сложную задачу, поскольку иногда для создания теста, максимально приближенного к реальным условиям, необходимо целенаправленно предоставить модель доступа в интернет.
Усиливаются призывы к обязательному государственному тестированию моделей ИИ . Конгрессмен от Техаса Грегорио Касар , демократ, заявил в своем посте на X, что инцидент с OpenAI «чрезвычайно тревожен», и призвал к усилению контроля за разработкой моделей ИИ.
«Нам необходимо сдержать темпы разработки, пока исследователи не смогут понять системы, которые они создают», — сказал Ладиш.
Следите за всеми новыми статьями Лорелей Смилли.
https://www.bloomberg.com/news/articles/2026-08-26/how-ai-is-making-cyberattacks-harder-to-stop?srnd=phx-technology