Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
Claude Sonnet 5.5: почти Opus, но вдвое дешевле
//текст и обложка ChatGPT. https://www.anthropic.com/claude-sonnet-5-5
Anthropic 28 сентября представила Claude Sonnet 5.5 — вторую модель семейства Claude 5.5 после вышедшего на прошлой неделе Opus 5.5. Компания позиционирует новинку как более быструю и дешёвую рабочую модель, предназначенную прежде всего для программирования, агентских задач и повседневной интеллектуальной работы.
Главное впечатление от релиза дают не маркетинговые заявления, а цифры.
Огромный скачок в программировании
В Terminal-Bench 4.0, который проверяет способность ИИ самостоятельно выполнять сложные многошаговые задачи через терминал, Sonnet 5.5 получил 70,6% против всего 10,3% у Sonnet 5. Для сравнения, Opus 5.5 набрал 66,4%.
В FrontierCode 1.1 Sonnet 5.5 показывает 46,2% на максимальном уровне рассуждений, а Opus 5.5 — 54,4%. В CursorBench 4.0, основанном на реальных задачах программирования из Cursor, результат Sonnet 5.5 составляет 55,5%, против 57,8% у Opus 5.5.
То есть разрыв между двумя моделями Anthropic в некоторых практических задачах оказался surprisingly небольшим. При этом Anthropic отдельно подчёркивает: на сложной открытой работе, где требуется длительное самостоятельное принятие решений, Opus 5.5 всё ещё заметно сильнее.
Сильный рост не только в коде
В GDPval-AA v2.1 — тесте реальной профессиональной работы в 44 профессиях — Sonnet 5.5 получил 1844 балла, практически сравнявшись с Opus 5.5 (1846). Предыдущий Sonnet 5 имел только 1449.
В AA-Briefcase, тесте долгих исследовательских задач, результат составляет 1811 против 1359 у Sonnet 5. В Humanity's Last Exam модель набирает 64,5% с использованием инструментов. На OSWorld 2.1, проверяющем работу с компьютером, — 80,1%.
Есть и заметный прогресс в работе с изображениями и интерфейсами: Anthropic сообщает, что Sonnet 5.5 стал первым Sonnet, который смог пройти Pokémon Red, работая только со скриншотами игры.
Самое интересное — стоимость
Цена за API-токены не изменилась: $2 за миллион входных токенов и $10 за миллион выходных. Однако новая модель значительно эффективнее расходует токены.
По данным Anthropic, Sonnet 5.5 выполняет ту же работу примерно на 30% дешевле и генерирует ответы более чем на 30% быстрее, чем Sonnet 5. В некоторых тестах при снижении уровня рассуждений стоимость выполнения задачи оказывается примерно на порядок ниже при сохранении более высокого результата, чем у предыдущего поколения.
Контекстное окно составляет 1 млн токенов, максимальный размер ответа — 128 тысяч токенов. Для агентских систем это особенно важно: модель может долго работать с большим проектом, документацией и историей взаимодействия, не выгружая всё из контекста.
Первые независимые тесты
Первые независимые результаты также выглядят сильно. В тестах Vals AI Sonnet 5.5 занял 2-е место из 66 моделей по их сводному индексу, практически вплотную приблизившись к Opus 5.5. При этом стоимость тестовой работы у Sonnet оказалась существенно ниже. На Vibe Code Bench модель показала 92,39%, на Code Migration — 69,83%, а на ProofBench получила 100%.
Но здесь есть важная оговорка: независимые бенчмарки используют собственные методики, а некоторые результаты Sonnet 5.5 зависят от режима рассуждений и fallback-моделей. Поэтому сравнивать отдельные проценты между разными лабораториями напрямую не стоит.
Что говорят первые пользователи
Первые реакции разработчиков в основном концентрируются вокруг трёх вещей: модель быстрее понимает существующий код, делает меньше лишних шагов и заметно лучше справляется с многошаговыми задачами.
В обсуждениях пользователей уже появляются очень восторженные оценки, включая сравнения с более дорогими моделями. Но пока это первые часы после релиза, поэтому пользовательские отзывы стоит воспринимать именно как ранние впечатления, а не как окончательный вердикт.
Sonnet 5.5 против Opus 5.5
Похоже, Anthropic довольно чётко разделила роли моделей.
Opus 5.5 предназначен для наиболее сложных, открытых задач, где требуется долгое автономное рассуждение и принятие решений.
Sonnet 5.5 — более быстрый рабочий инструмент для программирования, исправления ошибок, документов, презентаций, таблиц и агентских сценариев.
Именно поэтому Sonnet 5.5 интересен не столько как «младший Opus», сколько как попытка сделать почти frontier-уровень производительности экономически пригодным для массового использования.
Особенно показателен Terminal-Bench: Sonnet 5.5 не просто сильно обошёл предыдущий Sonnet, но в тесте оказался выше Opus 5.5. При этом сама Anthropic предупреждает, что отдельные бенчмарки не отражают всей картины и на сложной открытой работе Opus остаётся сильнее.
Итог: Claude Sonnet 5.5 выглядит одним из самых серьёзных обновлений Anthropic за последнее время. Главная его особенность — не рекорд в одном конкретном тесте, а сочетание качества, скорости и стоимости. Если тенденция сохранится на реальных задачах, граница между «дорогой флагманской моделью» и массовой рабочей моделью становится ещё тоньше.
«ИИ, безусловно, уже достаточно мощен, чтобы запустить цепь событий, которая приведет к гибели миллиарда человек. И хотя довести дело до гибели всего человечества довольно трудно, никогда еще не было оружия мощнее, чем сочетание людей со злым умыслом и новейших инструментов ИИ» Бил Гейтс.
//картинка ChatGPT