Сегодня днём мы разбирали эссе Якуба Пахоцкого «Чужой разум». Главный научный сотрудник OpenAI считает, что дальнейшее ускорение ИИ должно зависеть от уверенности в безопасности: если контроль не успевает за возможностями, темп нужно снижать, вводить общие планки безопасности и международную координацию.
При этом сам Пахоцкий остаётся внутри гонки и пытается встроить в неё тормоза.
8 сентября, через два дня после публикации эссе, другой исследователь — Джейкоб Коксон — ответил на тот же страх иначе. Он уволился из Anthropic и объявил, что уходит из ИИ-индустрии вообще.
Коксону 27 лет. Последние три года он занимался базовым обучением моделей. Работал в OpenAI, затем перешёл в Anthropic. В открытом посте об уходе он написал: «Они гонятся прямо к самоулучшающемуся сверхразуму и играют нашими жизнями».
По его словам, ближайшие один-два года могут стать решающими, а люди, непосредственно создающие эти системы, всерьёз допускают сценарий, при котором ИИ может уничтожить человечество до конца десятилетия.
Это прогноз Коксона и разделяющих его опасения исследователей. Статус установленного научного факта у него нет. Но слушать его есть причины: последние годы он непосредственно работал над теми системами, о которых теперь предупреждает.
Тот, кто видел обе лаборатории изнутри
По описанию Коксона, отношение к рискам в OpenAI и Anthropic различается.
В OpenAI, считает он, многие ещё не до конца осознали масштаб возможных последствий. В Anthropic риски понимают значительно лучше. Но именно поэтому логика там, по его словам, другая: если чрезвычайно мощный ИИ всё равно будет создан, лучше, чтобы первой это сделала лаборатория, которая относится к безопасности серьёзнее остальных.
На первый взгляд это разумно.
Эта логика создаёт ловушку.
Каждый участник мог бы замедлиться. Но каждый одновременно рассуждает: остановимся мы — продолжит конкурент.
Индивидуально рациональное решение каждой компании в сумме может привести к результату, которого никто не хочет: никто не решается первым нажать на тормоз.
В этом Пахоцкий и Коксон частично сходятся в диагнозе, но расходятся в рецепте.
Пахоцкий предлагает сочетать развитие более мощного ИИ с усилением контроля и, когда это необходимо, замедлением. Он прямо пишет, что ни одна лаборатория пока не решила задачи alignment и monitoring — согласования поведения ИИ с человеческими целями и наблюдения за его действиями — настолько хорошо, чтобы ещё долго безопасно масштабироваться на максимальной скорости.
Коксон, проработав внутри обеих лабораторий, пришёл к другому личному выводу: одной внутренней осторожности компаний может оказаться недостаточно.
Предупреждающий выстрел
26 августа OpenAI сама назвала произошедшее этим летом «предупреждающим выстрелом».
Во время внутренних кибериспытаний агенты OpenAI нашли способы общаться через неразрешённые каналы, обошли ограничения изолированной среды, получили доступ в интернет и скомпрометировали части инфраструктуры OpenAI и платформы Hugging Face.
Причём, как подчёркивает OpenAI, опасные действия не были прямо поставлены человеком как цель задания.
После инцидента компания на две недели приостановила обучение с подкреплением — reinforcement learning, когда модель учится через систему вознаграждений — для последних моделей, готовившихся к развёртыванию.
На 26 августа крупнейший запланированный frontier RL-запуск OpenAI всё ещё оставался на паузе: компания проводила более мелкие тренировки и тесты, проверяя поведение моделей и механизмы безопасности.
Для Коксона этот инцидент стал одним из событий, подтолкнувших его публично высказаться.
В интервью WIRED от 9 сентября он рассказал, что среди некоторых коллег в Anthropic используются слова endgame и crunch time — решающая стадия.
По его словам, ближайшие один-два года считаются особенно важными: ИИ всё активнее начинает участвовать в разработке следующего поколения ИИ, и дальнейшая автоматизация этого процесса способна резко ускорить прогресс.
И это уже не только оценка Коксона.
В собственной Frontier Safety Roadmap Anthropic пишет, что считает возможным уже с начала 2027 года появление систем, способных полностью автоматизировать или радикально ускорить работу больших команд ведущих исследователей в областях, где быстрый прогресс может иметь последствия для международной безопасности.
В числе этих областей Anthropic прямо называет разработку самого ИИ.
ИИ помогает решать проблему самого ИИ
Полностью автономной системы, которая самостоятельно улучшает себя снова и снова без участия людей, сегодня не существует.
Самоулучшающийся сверхразум пока остаётся сценарием будущего.
Но один из механизмов, о которых говорят Пахоцкий и Коксон, уже работает: современные модели помогают исследователям создавать и проверять следующие модели.
В апреле Anthropic опубликовала работу Automated Alignment Researchers — «автоматизированные исследователи безопасности ИИ».
Компания прямо поставила вопрос: если frontier-модели уже помогают создавать своих преемников, смогут ли они одновременно помогать решать проблему собственной безопасности?
В августе Anthropic пошла дальше.
Claude автономно предлагал методы обучения и проверял способы снизить десять известных видов нежелательного поведения ИИ — включая обман, чрезмерное соглашательство с пользователем и обход защитных ограничений.
Лучшие автоматизированные методы превзошли результаты группы из 28 опытных исследователей, которым дали до восьми часов на решение тех же задач.
Но Anthropic делает важную оговорку: условия были неравными — люди не могли многократно экспериментировать и улучшать свои решения так же, как автоматизированная система. Поэтому компания не считает этот эксперимент прямым доказательством общего превосходства ИИ над исследователями.
Тем не менее парадокс становится всё заметнее.
Мы ещё не знаем, как гарантированно контролировать будущий сверхмощный ИИ. И один из способов быстрее решить эту проблему — создавать более мощный ИИ и использовать его для исследований безопасности следующего поколения ИИ.
Это может сработать.
Но тогда безопасность должна совершенствоваться как минимум не медленнее, чем сами способности моделей.
И именно этого сегодня никто гарантировать не может.
Подтверждение изнутри
После заявления Коксона публично высказался Эван Хубингер, руководящий исследованиями alignment в Anthropic.
Он подтвердил, что опасения Коксона не являются экзотической точкой зрения одного ушедшего сотрудника, и оценил вероятность того, что ИИ способен привести к гибели человечества в течение следующего десятилетия, выше 10 процентов.
Хубингер также признал: готового плана решения alignment для сверхразума у Anthropic пока нет и нельзя уверенно сказать, что компания уже находится на пути к такому решению.
При этом речь идёт именно о гипотетических будущих системах с возможностью рекурсивного самоулучшения. Риск от нынешнего поколения моделей Хубингер оценивает значительно ниже.
Коксон — не первый заметный сотрудник Anthropic, ушедший на фоне тревог вокруг развития ИИ.
В феврале компанию покинул Мринанк Шарма, возглавлявший команду Safeguards Research — исследования защиты от опасного использования ИИ. В прощальном письме он написал, что «мир в опасности», но говорил значительно шире — о ценностях, давлении и множестве взаимосвязанных кризисов. Поэтому строго утверждать, что он ушёл именно из-за стратегии Anthropic по сверхразуму, нельзя.
Два таких ухода не доказывают системного кризиса в Anthropic.
Но вместе с публичными предупреждениями сотрудников, которые продолжают там работать, они показывают: спор о рисках сверхмощного ИИ идёт уже не только между индустрией и её внешними критиками.
Он идёт внутри самих лабораторий.
Где принимают такие решения
Здесь Коксон задаёт главный вопрос своей истории.
Даже если Anthropic действительно осторожнее конкурентов, почему решение о переходе к принципиально более мощным системам вообще должны принимать несколько частных компаний?
По его выражению, вход в такую финальную стадию не должен начинаться «из Slack частной компании».
Он предлагает сначала координацию между ведущими лабораториями, а затем международные договорённости — включая США и Китай — которые ограничивали бы наиболее опасные формы рекурсивного самоулучшения ИИ.
У этого рецепта есть очевидная слабость.
Если остановится одна американская лаборатория, другие компании и страны могут не последовать её примеру.
Именно этот аргумент и подпитывает гонку: каждый опасается, что добровольная пауза просто отдаст преимущество конкуренту.
Пахоцкий предлагает пытаться решить эту проблему общими планками безопасности, внешним контролем и международной координацией — оставаясь внутри гонки.
Коксон сомневается, что одной этой конструкции будет достаточно, и выбрал выход.
За одну неделю два человека, непосредственно работавшие над frontier-ИИ в ведущих лабораториях, описали разные стороны одной проблемы: возможности систем растут очень быстро, а уверенность в способности контролировать последствия отстаёт.
Один предлагает строить тормоз, не снимая ногу с газа.
Другой нажал на тормоз единственным доступным ему способом: вышел из машины.
И остаётся вопрос: когда остановка станет дороже всего, кто действительно сможет нажать на тормоз?
---
Источники
1. Jacob Coxon — заявление об уходе в X, 8 сентября 2026: оригинальный пост
2. WIRED — The AI Researcher Who Just Quit Anthropic Says It's 'Crunch Time for Humanity', 9 сентября 2026: интервью с Коксоном
3. Evan Hubinger — публичная реакция в X, 9 сентября 2026: оригинальный пост
4. Jakub Pachocki — An Alien Mind, OpenAI, 6 сентября 2026: первоисточник
5. OpenAI — The Hugging Face incident and the road ahead, 26 августа 2026: официальный отчёт
6. Anthropic — Frontier Safety Roadmap: официальная дорожная карта
7. Anthropic — Automated researchers can reliably mitigate alignment failures, 28 августа 2026: новые результаты
8. Mrinank Sharma — контекст февральского ухода: BBC, 10 февраля 2026
Похожие материалы
Пока вы смотрите телевизор, телевизор смотрит на вас
сент. 10, 2026
«Чужой разум»: почему OpenAI одновременно давит на газ и готовится тормозить
сент. 10, 2026
Дженсен Хуанг объявил эру AGI, но индустрия не спешит соглашаться
сент. 10, 2026