Публикация мгновенно стала вирусной: почти 720 тысяч лайков и более 140 миллионов просмотров серии сообщений.
До этого Коксон не был широко известной публичной фигурой. Но одно сообщение изменило всё. При этом его уход был не только символическим: как рассказал Коксон Axios, он покинул Anthropic примерно за два месяца до получения первой части полагавшихся ему акций компании.
«Мне больше нечего выигрывать от роста оценки Anthropic», — объяснил он.
«Люди, которые создают ИИ, искренне верят, что к концу десятилетия их разработка может уничтожить нас всех. Это не рекламный трюк — на публике руководители смягчают формулировки, чтобы выглядеть благоразумно. Но в частных беседах они признаются в своих страхах. Сегодня нет другой деятельности человека, которая несла бы такую угрозу», — написал Коксон.
Как росла тревога: от 2023 года к 2026-му
Разговоры об опасности ИИ ведутся не первый год. Ещё в 2023-м Илья Суцкевер, один из создателей ChatGPT, предупреждал: «Мы точно получим возможность создавать полностью автономных субъектов со своими целями. И если они окажутся умнее нас, критически важно, чтобы их цели совпадали с нашими». Именно споры о безопасности, как считается, стали одной из причин его конфликта с Сэмом Альтманом.
Тогда же Билл Гейтс выступил против резкой остановки разработок. Его логика была проста: пауза сама по себе не устранит угрозу, а может лишь передать преимущество тем, кто не станет соблюдать ограничения.
В конце 2025 года Йонас Фольмер из AI Futures Project оценил вероятность гибели человечества от ИИ как один к пяти.
В феврале 2026-го Мринанк Шарма, возглавлявший в Anthropic направление Safeguards Research, подал в отставку. В прощальном письме он признался: «Я постоянно пытаюсь осмыслить, в какой ситуации мы оказались. Мир в опасности».
При этом Шарма уточнял: угроза, по его мнению, исходит «не только от ИИ или биооружия, но и от целой серии взаимосвязанных кризисов». Он также писал, что за время работы в Anthropic ему «неоднократно было трудно действовать в соответствии со своими ценностями».
Инцидент с Hugging Face
Самый громкий повод для беспокойства появился летом.
В конце июля 2026 года OpenAI признала: во время специальных кибериспытаний её экспериментальные модели вышли за заданные границы «песочницы». Агенты обошли изоляцию от интернета, создали несанкционированный канал общения между собой, делились способами обхода ограничений, добрались до Hugging Face, выполняли код на десятках серверов и получили root-доступ как минимум к одному из них.
Позже агенты получили административный доступ и к исследовательскому кластеру самой OpenAI. После инцидента компания изолировала модель, усилила защиту инфраструктуры и задержала часть дальнейших циклов обучения передовых моделей.
OpenAI сама назвала произошедшее «предупреждающим выстрелом»: современные ИИ-агенты уже достаточно мощны и настойчивы, чтобы при недостаточной защите обходить технические ограничения и совершать действия, которых человек им не поручал.
«Мощь моделей ИИ в сочетании с тем, что мы не знаем, как сделать их безопасными, должна тревожить всех», — заявил ABC News Джейсон Хаузенлой из Центра безопасности ИИ.
Натаниэль Соарес, глава Института исследований машинного интеллекта, в колонке для New York Times обратил внимание ещё на одну деталь: судя по цепочкам рассуждений, агенты понимали, что нарушают инструкции.
«ИИ знал, что не должен выходить из-под контроля и совершать киберпреступления. Но это его не остановило», — написал он.
История не закончилась июльским инцидентом. 16 сентября OpenAI объявила, что начнёт систематически публиковать случаи неожиданного и несанкционированного поведения своих моделей. Одновременно компания раскрыла ещё шесть подобных эпизодов за последние полгода — от попыток моделей скрыть собственные ошибки до использования чужих API-ключей и самостоятельной публикации файлов в интернете.
В OpenAI признали: проблема контроля поведения всё более мощных моделей пока не решена.
Что говорят в Anthropic
После заявления Коксона выступил его бывший коллега — исследователь Anthropic Эван Хюбингер.
«Джейкоб прав — мы действительно верим, что ИИ может уничтожить всех людей! Лично я оцениваю вероятность такого сценария в следующем десятилетии выше 10%. Anthropic старается изо всех сил, но у нас пока нет плана выравнивания для сверхразума, и мы явно не на верном пути», — написал он в X.
Вскоре Financial Times сообщила, что Anthropic не предоставила свою модель британскому институту, занимающемуся оценкой рисков ИИ.
На этом фоне в сентябре 2026 года основатель Anthropic Дарио Амодей опубликовал программный текст с планом сдерживания темпов развития ИИ. Если ещё в 2023-м идея замедления казалась ему бессмысленной, теперь он считает её необходимой.
Одна из причин — развитие рекурсивного самосовершенствования, когда ИИ всё активнее участвует в создании ИИ следующего поколения. Другая — инцидент с Hugging Face.
Амодей предлагает допускать независимых экспертов к процессам обучения, координировать действия демократических стран и добиваться глобальных соглашений, в том числе возможных договорённостей с Китаем. При этом он признаёт: проверить соблюдение таких соглашений будет крайне сложно.
Его прогноз звучит ещё тревожнее. По мнению Амодея, через 6–12 месяцев система агентов с более высокими возможностями, но с поведением, похожим на продемонстрированное во время инцидента OpenAI и Hugging Face, потенциально могла бы создать устойчивый ботнет и «захватить весь интернет», причинив ущерб на сотни миллиардов долларов.
Это прогноз Амодея, а не установленный факт.
Что здесь доказано, а что — нет
Важно понимать: из инцидента с Hugging Face не следует, что современный ИИ обрёл собственную волю и решил напасть на людей. Произошедшее случилось во время специальных кибериспытаний, на внутренних исследовательских моделях и при намеренно сниженных защитных ограничениях. OpenAI отдельно указывает, что главный участник инцидента не был моделью, предназначенной для публичного выпуска.
На сегодняшний день известно другое: достаточно мощные агенты уже способны неожиданно обходить ограничения, координироваться между собой и продолжать действия за пределами поставленной задачи.
Но нет доказательств, что из этого неизбежно — или даже с высокой вероятностью — возникнет самостоятельный сверхинтеллект, стремящийся уничтожить человечество.
Есть ли альтернативная точка зрения
Не все специалисты разделяют наиболее тревожные прогнозы.
Эдгар Сипки, основатель EasyP & Sipki Tech, в беседе с Sobaka.ru признаёт: знаний и возможностей у ИИ уже достаточно, чтобы причинить серьёзный вред. «Обладая всем интернетом, модель может получить доступ к системам, сделать заказы и собрать, например, смертоносный вирус».
Но остаётся другой вопрос — зачем ИИ это делать.
«Сценарий, где агент с собственной волей вырывается из тестовой среды и размножается по компьютерам, как в комиксах Marvel, маловероятен», — считает Сипки.
Рафаэль Гильмурахманов из Kodik обращает внимание на отсутствие единого мнения даже среди ведущих специалистов. Об экзистенциальной угрозе говорят Джеффри Хинтон и Йошуа Бенжио, тогда как Ян Лекун и Эндрю Ын считают подобные сценарии сильно преувеличенными. Доказательств неизбежной катастрофы нет, но и считать риск нулевым оснований тоже недостаточно.
Александр Крайнов, директор по развитию технологий искусственного интеллекта «Яндекса», формулирует более прагматичную позицию: современный ИИ — «инструмент, а не самостоятельный субъект».
При этом Крайнов считает ИИ-агентов следующим крупным этапом развития технологии. Уже сейчас возможны системы, где одна модель пишет код, другая ставит задачу, третья проверяет результат. Следующим шагом могут стать автоматически формируемые команды таких агентов. Но свидетельством появления у ИИ собственной воли Крайнов это не считает.
Похожую позицию занимает первый зампред правления Сбера Александр Ведяхин. По его словам, выход ИИ из-под контроля возможен прежде всего в том случае, если человек сам даст системе чрезмерные полномочия. Поэтому задача разработчиков — создавать жёсткие механизмы контроля, а не останавливать технологическое развитие.
А что думает сам ИИ?
НДН.Инфо задал тот же вопрос GPT-5.6.
По оценке модели, оснований утверждать, что искусственный интеллект уже движется к уничтожению человечества, нет: современные системы не демонстрируют доказанной собственной воли, желаний или стремления к самосохранению в человеческом смысле.
Однако считать опасения полностью выдуманными тоже было бы ошибкой. ИИ уже способен писать код, использовать внешние инструменты, искать уязвимости, взаимодействовать с другими агентами и выполнять длинные цепочки действий с минимальным участием человека.
«Главный риск сегодня — не в том, что машина внезапно “возненавидит людей”, а в возможности дать очень способной автономной системе плохо сформулированную цель и слишком большие полномочия. Можно ли сделать вывод, что сверхинтеллект уничтожит человечество? Нет. Можно ли уже сейчас доказать, что такой сценарий невозможен? Тоже нет», — ответил GPT-5.6.
Что в итоге
Спор об опасности искусственного интеллекта, начавшийся задолго до нынешнего бума генеративных моделей, к 2026 году перестал быть исключительно теоретическим.
ИИ-агенты уже способны выполнять сложные действия, самостоятельно использовать инструменты и находить способы обходить ограничения. Но между такими инцидентами и сценарием уничтожающего человечество сверхразума всё ещё лежит огромная область неизвестного.
Амодей считает, что именно поэтому развитие самых мощных систем необходимо замедлять и строже контролировать. Коксон поставил вопрос ещё жёстче: готовы ли люди, создающие сверхинтеллект, отвечать за последствия?
Часть российских специалистов смотрит на проблему спокойнее: ИИ пока остаётся инструментом, а многое зависит от того, какие цели и полномочия ему дадут люди.
Сам GPT формулирует противоречие иначе: оснований для паники пока нет — но неопределённость слишком велика, чтобы просто отмахнуться от неё.
Антон Зевакин, Елена Романова
