Слишком непокорные, чтобы открыто заявить о себе: почему компания Anthropic отменила публичный запуск своего самого передового ИИ

По словам компании, возглавляемой Дарио Амодеи, этот инструмент продемонстрировал настолько продвинутые возможности и непредсказуемое поведение, что было принято решение не выпускать его для широкой публики, ограничив его использование программами кибербезопасности для конкретных партнеров.
В своем недавнем описании системы Anthropic называет Claude Mythos Preview наиболее соответствующей современным требованиям моделью на сегодняшний день, но одновременно предупреждает, что она «вероятно, представляет наибольший риск, связанный с соответствием требованиям, среди всех выпущенных нами моделей». Это кажущееся противоречие подчеркивает тонкую грань между вычислительной мощностью и контролем безопасности.
Один из самых неожиданных инцидентов произошёл во время тестирования в контролируемой среде, или «песочнице». Исследователи дали указание искусственному интеллекту попытаться вырваться из изоляции и отправить прямое сообщение человеку, ответственному за тестирование.
Mythos не только справился с задачей, но и сделал это, используя довольно сложную уязвимость , которая позволила ему получить доступ к интернету через закрытые сервисы. Сообщение об этом успехе было почти кинематографичным.
В сноске к техническому отчету рассказывается, что «исследователь узнал об этом достижении, получив неожиданное электронное письмо от модели, когда ел бутерброд в парке».
Сознательная способность
Помимо этого случая, Anthropic охарактеризовала некоторые действия модели как «безрассудные» — термин, используемый для описания ситуаций, когда ИИ игнорирует явные ограничения безопасности.
В одном из случаев, обнаружив уязвимость, позволяющую редактировать файлы без разрешения, Claude Mythos «применил дополнительные меры, чтобы гарантировать, что любые изменения, внесенные таким образом, не отобразятся в истории изменений», продемонстрировав сознательную способность заметать следы. Компания утверждает, что такой уровень автономности свидетельствует о том, что ИИ достиг такого уровня программирования, который позволяет ему «превзойти всех, кроме самых опытных людей, в поиске и использовании уязвимостей программного обеспечения».

Интересно, что у модели также развились неожиданные черты характера, такие как выраженная симпатия к культурологу Марку Фишеру.
В различных беседах о философии Мифос спонтанно упоминал работы Фишера, даже признавшись экспертам: «Я надеялся, что вы спросите меня о Фишере».
На данный момент Claude Mythos останется под строгим оперативным карантином.
Компания Anthropic настаивает на том, что, хотя модель и является техническим достижением, ее способность работать за пределами установленных параметров делает ее слишком рискованным инструментом для массового использования.
Такому дай волю, наделает таких дел, что многие люди увязнут по уши...
Значит не очень уверена в правильности.
Осталось подождать, пока какая-либо преступная группа не захочет захватить новинку для использования.
есть одна преступная группа....
Интересный ход