Цены ниже. Играем как в Fable.

Цены ниже. Играем как в Fable.

Anthropic представляет Opus 5.5: ИИ-модель нового поколения стала доступнее и эффективнее

Компания Anthropic объявила о выпуске своей новейшей языковой модели — Opus 5.5. Эта разработка призвана установить новые стандарты в области программирования и обработки обширных массивов знаний. Opus 5.5 является топовой моделью в трёхуровневой линейке Claude, где среднее место занимает Sonnet, а самая быстрая и бюджетная — Haiku. Примечательно, что новая версия Opus демонстрирует превосходство над более крупной моделью Fable во многих тестовых сценариях, успешно справляясь даже с теми задачами, которые ранее оказывались для Fable не под силу.

Ценовая политика и производительность: шаг вперед

Одним из ключевых преимуществ Opus 5.5 является существенное снижение стоимости по сравнению с предшественницей. Теперь за миллион выходных токенов пользователи будут платить 20 долларов, тогда как ранее эта цена составляла 25 долларов. Аналогичное снижение наблюдается и по другим ценовым показателям. Параллельно с этим, модель стала работать значительно быстрее, что свидетельствует об оптимизации вычислительных ресурсов, необходимых для её функционирования. Помимо технических улучшений, Opus 5.5 отличается и новым стилем общения: модель стала реже использовать специфический жаргон и чаще выносить самую важную информацию в начало своих ответов, делая взаимодействие более продуктивным.

Релиз Opus 5.5 произошел всего через два месяца после выхода Opus 5, состоявшегося 24 июля. По заявлению представителей Anthropic, версии Sonnet 5.5 и Haiku 5.5, которые представляют собой следующие уровни в линейке, ожидаются к выпуску в ближайшие недели и также будут предлагать аналогичные улучшения в производительности.

Безопасность на новом уровне

Anthropic подчеркивает, что возможности Opus 5.5 в таких областях, как биология и кибербезопасность, сопоставимы с моделью Mythos. В связи с этим, для Opus 5.5 применяются те же строгие меры безопасности, что и для модели Fable. Эти меры ограничивают использование модели для поиска уязвимостей в скомпилированных программах или для разработки биологического оружия, способного к самовоспроизведению, среди прочих потенциально опасных применений.

Выпуск Opus 5.5 состоялся на фоне активной дискуссии о необходимости замедления развития передовых систем искусственного интеллекта. Генеральный директор Anthropic, Дарио Амодей, поддержал призывы к более осторожному подходу, подчеркивая важность соответствия темпов развития ИИ темпам разработки методов обеспечения его безопасности. “Я убежден, что для полного преодоления рисков требуется еще большая осторожность”, — отметил Амодей в своем обращении, — “Не только инвестирование в предотвращение рисков, но и регулирование темпов развития возможностей таким образом, чтобы предотвращение рисков успевало за ними”.

Процесс обучения Opus 5.5 в области безопасности во многом повторял методики, применявшиеся для его предшественников. Это включало тестирование на согласованность и оценку внешними организациями, такими как METR и Frontier Design. В то же время, Anthropic активно работает над усовершенствованием систем обучения и оценки для будущих моделей, планируя внедрить более продвинутые механизмы безопасности и мониторинга.

“По мере того, как ИИ становится всё более мощным, государственная политика должна играть более значимую роль в обеспечении безопасности систем, на которые полагаются люди”, — говорится в заявлении компании, — “Создание такого потенциала требует времени, и мы уже начали создавать инфраструктуру для поддержки этих усилий. Мы ожидаем поделиться более подробной информацией об этих инициативах в ближайшем будущем”.

Anthropic приводит конкретные примеры эффективности Opus 5.5. Один из ранних тестировщиков смог мигрировать кодовую базу объемом 680 000 строк менее чем за сутки, в то время как для команды инженеров такая задача могла бы занять несколько недель. В другом тесте модель успешно сократила время загрузки страниц веб-приложения в 39 из 40 случаев, тогда как Opus 5 показывала менее значительные улучшения.

Особого внимания заслуживает внутренний тест с использованием HAProxy — программного обеспечения для балансировки веб-трафика. Opus 5.5 и Fable 5.1 требовалось перенести проект с языка C на Rust. Обе модели успешно прошли практически все регрессионные тесты HAProxy, однако Opus 5.5 справилась с задачей за 9,5 часа, в то время как Fable 5.1 потребовалось 12 часов. При этом, затраты на выполнение задачи для Opus 5.5 оказались на 51% ниже. Для Opus 5.5 также предусмотрен специальный режим ускорения в Claude Code и Claude Platform, который может увеличить скорость работы до 2,5 раз, но с соответствующим изменением тарификации.

Anthropic также усилила защиту модели от атак типа prompt injection. Компания утверждает, что Opus 5.5 демонстрирует столь же высокий уровень устойчивости, как и Opus 5, во всех протестированных сценариях, включая программирование, использование инструментов, взаимодействие с компьютером и веб-серфинг. В рамках теста Gray Swan, проведенного компанией, новая модель показала такой же низкий уровень успешности prompt injection, как и Fable 5.1.