Зміст
Anthropic представляє Opus 5.5: ІІ-модель нового покоління стала доступнішою та ефективнішою
Компанія Anthropic оголосила про випуск своєї новітньої мовної моделі — Opus 5.5. Ця розробка покликана встановити нові стандарти в галузі програмування та обробки великих масивів знань. Opus 5.5 є топовою моделлю в трирівневій лінійці Claude, де середнє місце займає Sonnet, а найшвидша та бюджетна — Haiku. Примітно, що нова версія Opus демонструє перевагу над більшою моделлю Fable у багатьох тестових сценаріях, успішно справляючись навіть з тими завданнями, які раніше виявлялися для Fable непосильними.
Цінова політика та продуктивність: крок вперед
Однією з ключових переваг Opus 5.5 є суттєве зниження вартості в порівнянні з попередницею. Тепер за мільйон вихідних токенів користувачі будуть платити 20 доларів, тоді як раніше ця ціна становила 25 доларів. Аналогічне зниження спостерігається і за іншими ціновими показниками. Паралельно з цим, модель стала працювати значно швидше, що свідчить про оптимізацію обчислювальних ресурсів, необхідних для її функціонування. Окрім технічних покращень, Opus 5.5 відрізняється і новим стилем спілкування: модель стала рідше використовувати специфічний жаргон і частіше виносити найважливішу інформацію на початок своїх відповідей, роблячи взаємодію більш продуктивною.
Випуск Opus 5.5 відбувся всього через два місяці після виходу Opus 5, що відбувся 24 липня. За словами представників Anthropic, версії Sonnet 5.5 та Haiku 5.5, які представляють собою наступні рівні в лінійці, очікуються до випуску найближчими тижнями і також будуть пропонувати аналогічні покращення в продуктивності.
Безпека на новому рівні
Anthropic підкреслює, що можливості Opus 5.5 у таких сферах, як біологія та кібербезпека, порівнянні з моделлю Mythos. У зв’язку з цим, для Opus 5.5 застосовуються ті ж суворі заходи безпеки, що й для моделі Fable. Ці заходи обмежують використання моделі для пошуку вразливостей у скомпільованих програмах або для розробки біологічної зброї, здатної до самовідтворення, серед інших потенційно небезпечних застосувань.
Випуск Opus 5.5 відбувся на фоні активної дискусії про необхідність уповільнення розвитку передових систем штучного інтелекту. Генеральний директор Anthropic, Даріо Амодей, підтримав заклики до більш обережного підходу, підкреслюючи важливість відповідності темпів розвитку ШІ темпам розробки методів забезпечення його безпеки. “Я переконаний, що для повного подолання ризиків потрібна ще більша обережність”, — зазначив Амодей у своєму зверненні, — “Не тільки інвестування в запобігання ризикам, але й регулювання темпів розвитку можливостей таким чином, щоб запобігання ризикам встигало за ними”.
Процес навчання Opus 5.5 у сфері безпеки в значній мірі повторював методики, що застосовувалися для його попередників. Це включало тестування на узгодженість та оцінку зовнішніми організаціями, такими як METR та Frontier Design. Водночас, Anthropic активно працює над вдосконаленням систем навчання та оцінки для майбутніх моделей, плануючи впровадити більш просунуті механізми безпеки та моніторингу.
“Оскільки ШІ стає все більш потужним, державна політика повинна відігравати більш значну роль у забезпеченні безпеки систем, на які покладаються люди”, — йдеться в заяві компанії, — “Створення такого потенціалу потребує часу, і ми вже почали створювати інфраструктуру для підтримки цих зусиль. Ми очікуємо поділитися більш детальною інформацією про ці ініціативи найближчим часом”.
Anthropic наводить конкретні приклади ефективності Opus 5.5. Один з ранніх тестувальників зміг мігрувати кодову базу обсягом 680 000 рядків менш ніж за добу, тоді як для команди інженерів така задача могла б зайняти кілька тижнів. У іншому тесті модель успішно скоротила час завантаження сторінок веб-додатку в 39 з 40 випадків, тоді як Opus 5 демонструвала менш значні покращення.
Особливої уваги заслуговує внутрішній тест з використанням HAProxy — програмного забезпечення для балансування веб-трафіку. Opus 5.5 та Fable 5.1 потрібно було перенести проект з мови C на Rust. Обидві моделі успішно пройшли практично всі регресійні тести HAProxy, однак Opus 5.5 впоралася з завданням за 9,5 години, тоді як Fable 5.1 знадобилося 12 годин. При цьому, витрати на виконання завдання для Opus 5.5 виявилися на 51% нижчими. Для Opus 5.5 також передбачено спеціальний режим прискорення в Claude Code та Claude Platform, який може збільшити швидкість роботи до 2,5 разів, але з відповідною зміною тарифікації.
Anthropic також посилила захист моделі від атак типу prompt injection. Компанія стверджує, що Opus 5.5 демонструє такий же високий рівень стійкості, як і Opus 5, у всіх протестованих сценаріях, включаючи програмування, використання інструментів, взаємодію з комп’ютером та веб-серфінг. У рамках тесту Gray Swan, проведеного компанією, нова модель показала такий же низький рівень успішності prompt injection, як і Fable 5.1.