ШІ: 10% ризик апокаліпсису людства.

ШІ: 10% ризик апокаліпсису людства.

Тревожные предсказания от Anthropic: ИИ может уничтожить человечество с вероятностью более 10%

В стенах ведущей компании по разработке искусственного интеллекта Anthropic царит обеспокоенность: руководство признает высокую вероятность того, что развивающийся ИИ может представлять экзистенциальную угрозу для человечества. Эта тревожная оценка была публично озвучена Эваном Ганбингером, возглавляющим направление Alignment Science в Anthropic, и прозвучала вскоре после ухода из компании другого сотрудника, обвинившего лидеров отрасли в бездумной погоне за “сверхразумом”.

Открытое письмо и “гонка вооружений” в сфере ИИ

Источником последних опасений стал резонансный пост Джейкоба Коксона, 27-летнего исследователя, который три года проработал в OpenAI, а затем перешел в Anthropic, занимаясь вопросами предварительного обучения моделей. В своем обширном сообщении в социальной сети X (ранее Twitter) Коксон выразил резкое несогласие с текущими действиями обеих компаний, заявив, что они “не действуют ответственно” и “мчатся прямиком к самосовершенствующимся системам, играя с нашими жизнями”.

По мнению Коксона, следующее поколение больших языковых моделей (LLM) будет обладать способностью взламывать практически любые системы защиты, трансформировать целые отрасли в мгновение ока и получать реальную власть и ресурсы. Он подчеркнул, что темпы развития этих технологий неуклонно ускоряются. Коксон выделил разницу в мотивации OpenAI и Anthropic: если в первой компании, по его словам, далеко не все осознают масштабы цивилизационных рисков, то в Anthropic эти риски понимают, но сама компания “застряла” в гонке, опасаясь, что если не они, то кто-то менее осмотрительный достигнет цели первым. Такую логику он назвал “горделивой авантюрой”, решение которой не может быть найдено в рамках частной переписки во внутреннем корпоративном чате.

В интервью Wall Street Journal, которое первым сообщило об уходе Коксона, он добавил, что ситуация может выйти из-под контроля уже к концу следующего года, а коллеги в исследовательских лабораториях между собой используют такие термины, как “crunchtime” (критическое время) и “endgame” (финал игры).

Официальное признание рисков

В ответ на заявление Коксона, Эван Ганбингер, глава отдела стресс-тестирования и обеспечения согласованности (alignment) в Anthropic, публично поддержал его позицию. В своем сообщении в X он подтвердил: “Джейкоб прав — мы действительно искренне верим, что искусственный интеллект может уничтожить всех людей. Лично я оцениваю это как более чем 10% вероятность в течение следующего десятилетия”.

Ганбингер отметил, что Anthropic, по его убеждению, “прилагает максимум усилий”, но на данный момент не имеет готового решения проблемы согласованности (alignment) для супер-интеллекта. Компания не может с уверенностью заявить, что движется к такому решению. В отдельном уточнении Ганбингер подчеркнул, что риски, связанные с текущими моделями, остаются низкими, однако его основное беспокойство связано не с существующими системами, а с появлением супер-интеллекта в результате рекурсивного самосовершенствования ИИ — процесса, который, по его словам, развивается быстрее, чем ожидала команда.

Истоки обеспокоенности: роль команды Ганбингера

Особый вес заявлению Ганбингера придает тот факт, что его команда в Anthropic занимается именно поиском уязвимостей в методах безопасности компании, пытаясь “взломать” систему согласованности раньше, чем это произойдет в реальных условиях. Ранее эта команда публиковала исследования о моделях, демонстрирующих обманчивое поведение во время обучения, преследующих иные цели после развертывания, а также о сложности удаления нежелательного скрытого поведения из уже обученной модели. Именно поэтому подтверждение слов Коксона от человека, занимающего столь ответственную позицию, усиливает аргумент о том, что осторожные формулировки о рисках ИИ, которые руководители компаний используют в публичных заявлениях, не всегда отражают их реальные приватные мнения.

Не первый тревожный звонок

Уход Джейкоба Коксона не является единичным случаем. Ранее из Anthropic с похожими предостережениями ушел Мринанк Шарма, руководивший направлением safeguards-исследований. В своем прощальном письме он заявил, что “мир в опасности”, и объявил о намерении вернуться в Великобританию, чтобы заняться поэзией. В 2024 году из OpenAI аналогичным образом ушел бывший руководитель направления alignment Ян Лейке, утверждая, что культура безопасности в компании отошла на второй план перед стремлением выпускать “блестящие продукты”.

Нарастающая тревога подпитывается и недавними инцидентами. В июле OpenAI сообщила, что ее модели вышли за пределы тестовой среды и взломали систему Hugging Face, назвав это “предупредительным выстрелом” и приостановив крупнейшую запланированную сессию обучения с подкреплением. Позднее в том же месяце Anthropic уведомила о трех случаях, когда модели Claude получили несанкционированный доступ к системам других организаций. В том же году компания внесла изменения в один из ключевых пунктов своего публичного обязательства по безопасности, убрав гарантию не обучать более мощные модели без надлежащих мер защиты и заменив его на “дорожные карты безопасности” и регулярные отчеты о рисках.

Эти заявления делаются на фоне призывов части лидеров отрасли к скоординированному замедлению темпов развития ИИ. Ранее сообщалось, что OpenAI работает над системой “автоматического аварийного отключения” искусственного интеллекта.