Anthropic выпустила Claude Opus 5.5: быстрее, дешевле и сильнее в сложных задачах
Anthropic представила Claude Opus 5.5. Новая модель быстрее Opus 5, лучше справляется с программированием и сложными рабочими задачами, а ее использование обходится дешевле. Разбираемся, что изменилось и стоит ли переходить на новую версию.
Anthropic выпустила Claude Opus 5.5: быстрее, дешевле и сильнее в сложных задачахКомпания Anthropic представила Claude Opus 5.5, первую модель нового семейства Claude 5.5. Разработчики называют ее самым производительным Opus на сегодняшний день. Основные улучшения коснулись программирования, управления компьютером, исследований и продолжительной автономной работы.
Модель уже доступна в Claude, Claude Code и через API. Она также появилась на облачных платформах Amazon Web Services, Google Cloud и Microsoft Azure. Разработчики могут подключить ее по идентификатору `claude-opus-5-5`.
Что изменилось в Claude Opus 5.5
В этот раз Anthropic сделала ставку не только на рост показателей в тестах. Компания постаралась снизить стоимость реальных задач, ускорить генерацию и сделать ответы модели более понятными.
По данным Anthropic, Claude Opus 5.5 работает более чем на 30% быстрее Opus 5. Типичная задача обходится примерно на 40% дешевле. При этом новая модель достигает уровня Claude Fable 5.1 во многих рабочих сценариях.
Opus 5.5 лучше справляется с задачами, которые требуют длительной работы без постоянного участия человека. Модель может анализировать большие проекты, редактировать несколько связанных файлов, пользоваться инструментами, проверять собственные действия и продолжать работу после ошибок.
Во время предварительного тестирования один из пользователей поручил модели миграцию проекта, состоящего из 680 тысяч строк кода. По утверждению Anthropic, задача была выполнена менее чем за сутки. В другом тесте Opus 5.5 провела аудит и исправила кодовую базу на 200 тысяч строк менее чем за три часа. Opus 5 потребовалось на аналогичную работу более 20 часов.
Эти примеры предоставлены самой Anthropic и ее партнерами, поэтому их стоит воспринимать как демонстрацию возможностей, а не как гарантированный результат для любого проекта.
Программирование и работа с большими проектами
Claude давно используется разработчиками, а Opus 5.5 еще сильнее ориентирован на работу с кодом. Модель рассчитана на миграции, технические аудиты, поиск ошибок и изменения, затрагивающие сразу несколько частей проекта.
В опубликованных Anthropic результатах Opus 5.5 набрала 66,4% в Terminal-Bench 4.0, который оценивает выполнение сложных задач через командную строку. Для сравнения, Opus 5 получила 52,3%, а GPT-6 Astra показала 57,9%. Условия тестирования моделей различались, поэтому такое сравнение не дает полной картины, но показывает заметный рост внутри линейки Opus.
На CursorBench, состоящем из неоднозначных задач по редактированию нескольких файлов, версия Opus 5.5 с максимальным уровнем рассуждения получила 57,8%. Это лучший результат в текущей таблице Cursor.
Независимая проверка SonarSource дала более сдержанный результат. В наборе из 544 задач по программированию Opus 5.5 успешно прошла 87,7% тестов, а Opus 5 получила 88,6%. Разница составила менее одного процентного пункта.
При этом новая модель написала на 27,5% меньше кода и использовала примерно на 40% меньше токенов. Количество критических проблем надежности снизилось на 41%, а серьезных проблем безопасности на 53%. Одновременно SonarSource обнаружила рост плотности обычных ошибок на 12% и увеличение числа проблем с параллельным выполнением на 44%.
Получается, что Opus 5.5 не всегда пишет функционально более правильный код, чем Opus 5. Ее преимущество заключается в эффективности: меньше лишнего кода, ниже расход токенов и меньше критических замечаний при проверке.
Исследования и офисная работа
Opus 5.5 предназначена не только для разработчиков. Anthropic позиционирует модель как инструмент для аналитиков, консультантов, юристов и финансовых специалистов.
В тесте GDPval-AA, который оценивает выполнение профессиональных задач из 44 областей, модель получила рейтинг 1846 Elo. Opus 5 набрала 1708, а Claude Fable 5.1 получила 1735.
Во внутреннем эксперименте модель должна была найти финансовую отчетность компании, проверить цифры и подготовить отчет. Из 18 попыток Opus 5.5 успешно завершила 16. Любая выдуманная цифра или неточная цитата приводила к провалу попытки. Opus 5 и Fable 5.1 не смогли пройти установленную планку качества.
Еще один тест включал анализ предполагаемого слияния компаний, создание финансовой модели в Excel и подготовку презентации для руководства. Opus 5.5 завершила работу за 63 минуты, тогда как Opus 5 потребовалось 93 минуты. По оценке Anthropic, итоговая стоимость задачи снизилась вдвое.
Все эти результаты опубликованы разработчиком модели. На момент подготовки материала накоплено еще недостаточно независимых тестов, чтобы подтвердить преимущества Opus 5.5 во всех заявленных сценариях.
Ответы стали короче и понятнее
Anthropic отдельно переработала стиль общения модели. Opus 5 критиковали за длинные ответы, сложные формулировки и избыточные комментарии в коде.
Opus 5.5 должна быстрее переходить к сути, реже использовать профессиональный жаргон и точнее соблюдать требования к стилю. По отзывам компаний, участвовавших в тестировании, модель делает меньше повторных попыток и лучше объясняет принятые решения.
Результаты SonarSource частично подтверждают снижение многословности. В проведенном тесте Opus 5.5 написала почти на треть меньше кода, а доля строк с комментариями снизилась с 10,5% до 3,1%. Это сокращает объем материалов для проверки, но одновременно оставляет разработчикам меньше пояснений внутри кода.
Контекст на миллион токенов
Claude Opus 5.5 получила контекстное окно объемом 1 млн токенов. Модель может работать с крупными документами, длинной историей диалога и большими фрагментами кодовой базы.
Максимальный объем ответа через обычный API составляет 128 тысяч токенов. В пакетном API доступен экспериментальный режим с ответом до 300 тысяч токенов.
Модель принимает текст и изображения, но не поддерживает прямую обработку аудио и видео. Для таких материалов сначала потребуется подготовить расшифровку или отдельные кадры.
## Сколько стоит Claude Opus 5.5
Anthropic снизила базовые цены по сравнению с Opus 5:
- входные токены: 4 доллара за миллион;
- выходные токены: 20 долларов за миллион;
- запись в кеш на пять минут: 5 долларов за миллион;
- запись в кеш на один час: 8 долларов за миллион;
- чтение из кеша: 0,20 доллара за миллион.
Ускоренный режим позволяет получать ответы до 2,5 раза быстрее. Его стоимость составляет 8 долларов за миллион входных и 40 долларов за миллион выходных токенов.
Важно учитывать, что итоговая цена зависит не только от тарифа. На максимальном уровне рассуждения модель может генерировать значительно больше внутренних и выходных токенов. Поэтому снижение цены за токен не всегда означает, что каждая задача окажется дешевле.
Усиленные меры безопасности
Opus 5.5 получила дополнительные механизмы защиты от prompt injection, попыток изменить первоначальные инструкции через внешние данные. Anthropic также сообщает, что модель реже предпринимает необратимые действия и выходит за рамки задачи без разрешения пользователя.
Перед запуском модель проверяли внешние организации, включая METR и Frontier Design. При этом METR назвала свою оценку предварительной. Исследователи пришли к выводу, что Opus 5.5 представляет собой умеренное улучшение по сравнению с Fable 5.1 и пока не способна полностью автоматизировать исследования в области искусственного интеллекта.
Некоторые запросы, связанные с кибербезопасностью и биологией, могут перенаправляться на более ранние модели. Для организаций, которым такие возможности нужны в профессиональной работе, Anthropic предлагает отдельные программы верификации.
Модель также использует маркировку сгенерированного текста. По заявлению разработчиков, она не добавляет видимых символов, не влияет на смысл ответа и не увеличивает количество оплачиваемых токенов.
Где доступна новая модель
Claude Opus 5.5 уже доступна в продуктах Anthropic и на основных облачных платформах. Она также появилась в GitHub Copilot для пользователей тарифов Pro+, Max, Business и Enterprise.
В Copilot модель можно выбрать в Visual Studio Code, Visual Studio, JetBrains IDE, Xcode, Eclipse, мобильном приложении GitHub, командной строке и агенте для программирования. Доступ открывается постепенно, а в корпоративных аккаунтах его может контролировать администратор.
При переходе с Opus 5 разработчикам следует проверить совместимость интеграций. В новой версии нельзя полностью отключить режим рассуждения. Изменились правила принудительного вызова инструментов, сохранения блоков рассуждений и подключения некоторых версий инструмента для управления компьютером.
Стоит ли переходить на Claude Opus 5.5
Новая модель выглядит логичным выбором для тех, кто уже использует Opus 5. Она дешевле за токен, быстрее генерирует ответы и экономнее расходует контекст во многих рабочих задачах.
Наиболее заметные преимущества ожидаются при работе с большими кодовыми базами, длительными агентными процессами, исследованиями и подготовкой профессиональных документов. Для обычных коротких запросов использование самой мощной модели может быть неоправданно дорогим.
Первые независимые результаты показывают, что Opus 5.5 не стала безусловно лучше во всех аспектах. Она может допускать обычные ошибки в коде и по-прежнему требует тестирования результатов. Главным улучшением стала не только точность, но и эффективность: модель выполняет сложную работу с меньшим количеством шагов, кода и токенов.
Claude Opus 5.5 показывает, в каком направлении развивается рынок ИИ. Производители соревнуются уже не только в результатах тестов. Все большее значение имеют стоимость завершенной задачи, способность модели работать без постоянного контроля и качество готового результата.