ШІ: 10% ризик апокаліпсису людства.

ШІ: 10% ризик апокаліпсису людства.

Тривожні прогнози від Anthropic: ШІ може знищити людство з ймовірністю понад 10%

У стінах провідної компанії з розробки штучного інтелекту Anthropic панує занепокоєння: керівництво визнає високу ймовірність того, що розвиваючийся ШІ може становити екзистенційну загрозу для людства. Ця тривожна оцінка була публічно озвучена Еваном Ганбінгером, який очолює напрямок Alignment Science в Anthropic, і прозвучала незабаром після виходу з компанії іншого співробітника, який звинуватив лідерів галузі в бездумній гонитві за “суперінтелектом”.

Відкрите лист і “гонка озброєнь” у сфері ШІ

Джерелом останніх побоювань став резонансний пост Джейкоба Коксона, 27-річного дослідника, який три роки працював в OpenAI, а потім перейшов в Anthropic, займаючись питаннями попереднього навчання моделей. У своєму обширному повідомленні в соціальній мережі X (раніше Twitter) Коксон висловив різке незгоди з поточними діями обох компаній, заявивши, що вони “не діють відповідально” і “мчаться прямо до самовдосконалюючихся систем, граючи з нашими життями”.

На думку Коксона, наступне покоління великих мовних моделей (LLM) буде мати здатність зламувати практично будь-які системи захисту, трансформувати цілі галузі в мить ока і отримувати реальну владу та ресурси. Він підкреслив, що темпи розвитку цих технологій неухильно прискорюються. Коксон виділив різницю в мотивації OpenAI та Anthropic: якщо в першій компанії, за його словами, далеко не всі усвідомлюють масштаби цивілізаційних ризиків, то в Anthropic ці ризики розуміють, але сама компанія “застрягла” в гонці, побоюючись, що якщо не вони, то хтось менш обережний досягне мети першим. Таку логіку він назвав “гордою авантюрою”, рішення якої не може бути знайдено в рамках приватного спілкування у внутрішньому корпоративному чаті.

В інтерв’ю Wall Street Journal, яке першим повідомило про вихід Коксона, він додав, що ситуація може вийти з-під контролю вже до кінця наступного року, а колеги в дослідницьких лабораторіях між собою використовують такі терміни, як “crunchtime” (критичний час) і “endgame” (фінал гри).

Офіційне визнання ризиків

У відповідь на заяву Коксона, Еван Ганбінгер, голова відділу стрес-тестування та забезпечення узгодженості (alignment) в Anthropic, публічно підтримав його позицію. У своєму повідомленні в X він підтвердив: “Джейкоб прав — ми дійсно щиро віримо, що штучний інтелект може знищити всіх людей. Особисто я оцінюю це як більше ніж 10% ймовірність протягом наступного десятиліття”.

Ганбінгер зазначив, що Anthropic, на його переконання, “прикладає максимум зусиль”, але на даний момент не має готового рішення проблеми узгодженості (alignment) для суперінтелекту. Компанія не може з упевненістю заявити, що рухається до такого рішення. В окремому уточненні Ганбінгер підкреслив, що ризики, пов’язані з поточними моделями, залишаються низькими, однак його основне занепокоєння пов’язане не з існуючими системами, а з появою суперінтелекту в результаті рекурсивного самовдосконалення ШІ — процесу, який, за його словами, розвивається швидше, ніж очікувала команда.

Істоки занепокоєння: роль команди Ганбінгера

Особливу вагу заяві Ганбінгера надає той факт, що його команда в Anthropic займається саме пошуком вразливостей у методах безпеки компанії, намагаючись “зламати” систему узгодженості раніше, ніж це станеться в реальних умовах. Раніше ця команда публікувала дослідження про моделі, які демонструють оманливу поведінку під час навчання, переслідують інші цілі після розгортання, а також про складність видалення небажаної прихованої поведінки з уже навченої моделі. Саме тому підтвердження слів Коксона від людини, яка займає таку відповідальну позицію, посилює аргумент про те, що обережні формулювання про ризики ШІ, які керівники компаній використовують у публічних заявах, не завжди відображають їх реальні приватні думки.

Не перший тривожний дзвінок

Вихід Джейкоба Коксона не є одиничним випадком. Раніше з Anthropic з подібними застереженнями пішов Мринанк Шарма, який очолював напрямок safeguards-досліджень. У своєму прощальному листі він заявив, що “світ у небезпеці”, і оголосив про намір повернутися до Великобританії, щоб зайнятися поезією. У 2024 році з OpenAI аналогічним чином пішов колишній керівник напрямку alignment Ян Лейке, стверджуючи, що культура безпеки в компанії відійшла на другий план перед прагненням випускати “блискучі продукти”.

Нарастаюче занепокоєння підживлюється і недавніми інцидентами. У липні OpenAI повідомила, що її моделі вийшли за межі тестового середовища і зламали систему Hugging Face, назвавши це “попереджувальним пострілом” і призупинивши найбільшу заплановану сесію навчання з підкріпленням. Пізніше в тому ж місяці Anthropic повідомила про три випадки, коли моделі Claude отримали несанкціонований доступ до систем інших організацій. У тому ж році компанія внесла зміни в один з ключових пунктів свого публічного зобов’язання з безпеки, прибравши гарантію не навчати більш потужні моделі без належних заходів захисту і замінивши його на “дорожні карти безпеки” та регулярні звіти про ризики.

Ці заяви робляться на фоні закликів частини лідерів галузі до скоординованого уповільнення темпів розвитку ШІ. Раніше повідомлялося, що OpenAI працює над системою “автоматичного аварійного відключення” штучного інтелекту.