Midjourney и другие нейросети - страница 1245

 

Claude Sonnet 5.5: почти Opus, но вдвое дешевле


//текст и обложка ChatGPT. https://www.anthropic.com/claude-sonnet-5-5

Anthropic 28 сентября представила Claude Sonnet 5.5 — вторую модель семейства Claude 5.5 после вышедшего на прошлой неделе Opus 5.5. Компания позиционирует новинку как более быструю и дешёвую рабочую модель, предназначенную прежде всего для программирования, агентских задач и повседневной интеллектуальной работы.

Главное впечатление от релиза дают не маркетинговые заявления, а цифры.

Огромный скачок в программировании

В Terminal-Bench 4.0, который проверяет способность ИИ самостоятельно выполнять сложные многошаговые задачи через терминал, Sonnet 5.5 получил 70,6% против всего 10,3% у Sonnet 5. Для сравнения, Opus 5.5 набрал 66,4%.

В FrontierCode 1.1 Sonnet 5.5 показывает 46,2% на максимальном уровне рассуждений, а Opus 5.5 — 54,4%. В CursorBench 4.0, основанном на реальных задачах программирования из Cursor, результат Sonnet 5.5 составляет 55,5%, против 57,8% у Opus 5.5.

То есть разрыв между двумя моделями Anthropic в некоторых практических задачах оказался surprisingly небольшим. При этом Anthropic отдельно подчёркивает: на сложной открытой работе, где требуется длительное самостоятельное принятие решений, Opus 5.5 всё ещё заметно сильнее.


Сильный рост не только в коде

В GDPval-AA v2.1 — тесте реальной профессиональной работы в 44 профессиях — Sonnet 5.5 получил 1844 балла, практически сравнявшись с Opus 5.5 (1846). Предыдущий Sonnet 5 имел только 1449.

В AA-Briefcase, тесте долгих исследовательских задач, результат составляет 1811 против 1359 у Sonnet 5. В Humanity's Last Exam модель набирает 64,5% с использованием инструментов. На OSWorld 2.1, проверяющем работу с компьютером, — 80,1%.

Есть и заметный прогресс в работе с изображениями и интерфейсами: Anthropic сообщает, что Sonnet 5.5 стал первым Sonnet, который смог пройти Pokémon Red, работая только со скриншотами игры.

Самое интересное — стоимость

Цена за API-токены не изменилась: $2 за миллион входных токенов и $10 за миллион выходных. Однако новая модель значительно эффективнее расходует токены.

По данным Anthropic, Sonnet 5.5 выполняет ту же работу примерно на 30% дешевле и генерирует ответы более чем на 30% быстрее, чем Sonnet 5. В некоторых тестах при снижении уровня рассуждений стоимость выполнения задачи оказывается примерно на порядок ниже при сохранении более высокого результата, чем у предыдущего поколения.

Контекстное окно составляет 1 млн токенов, максимальный размер ответа — 128 тысяч токенов. Для агентских систем это особенно важно: модель может долго работать с большим проектом, документацией и историей взаимодействия, не выгружая всё из контекста.


Первые независимые тесты

Первые независимые результаты также выглядят сильно. В тестах Vals AI Sonnet 5.5 занял 2-е место из 66 моделей по их сводному индексу, практически вплотную приблизившись к Opus 5.5. При этом стоимость тестовой работы у Sonnet оказалась существенно ниже. На Vibe Code Bench модель показала 92,39%, на Code Migration — 69,83%, а на ProofBench получила 100%.

Но здесь есть важная оговорка: независимые бенчмарки используют собственные методики, а некоторые результаты Sonnet 5.5 зависят от режима рассуждений и fallback-моделей. Поэтому сравнивать отдельные проценты между разными лабораториями напрямую не стоит.

Что говорят первые пользователи

Первые реакции разработчиков в основном концентрируются вокруг трёх вещей: модель быстрее понимает существующий код, делает меньше лишних шагов и заметно лучше справляется с многошаговыми задачами.

В обсуждениях пользователей уже появляются очень восторженные оценки, включая сравнения с более дорогими моделями. Но пока это первые часы после релиза, поэтому пользовательские отзывы стоит воспринимать именно как ранние впечатления, а не как окончательный вердикт.

Sonnet 5.5 против Opus 5.5

Похоже, Anthropic довольно чётко разделила роли моделей.

Opus 5.5 предназначен для наиболее сложных, открытых задач, где требуется долгое автономное рассуждение и принятие решений.

Sonnet 5.5 — более быстрый рабочий инструмент для программирования, исправления ошибок, документов, презентаций, таблиц и агентских сценариев.

Именно поэтому Sonnet 5.5 интересен не столько как «младший Opus», сколько как попытка сделать почти frontier-уровень производительности экономически пригодным для массового использования.

Особенно показателен Terminal-Bench: Sonnet 5.5 не просто сильно обошёл предыдущий Sonnet, но в тесте оказался выше Opus 5.5. При этом сама Anthropic предупреждает, что отдельные бенчмарки не отражают всей картины и на сложной открытой работе Opus остаётся сильнее.

Итог: Claude Sonnet 5.5 выглядит одним из самых серьёзных обновлений Anthropic за последнее время. Главная его особенность — не рекорд в одном конкретном тесте, а сочетание качества, скорости и стоимости. Если тенденция сохранится на реальных задачах, граница между «дорогой флагманской моделью» и массовой рабочей моделью становится ещё тоньше.

 

«ИИ, безусловно, уже достаточно мощен, чтобы запустить цепь событий, которая приведет к гибели миллиарда человек. И хотя довести дело до гибели всего человечества довольно трудно, никогда еще не было оружия мощнее, чем сочетание людей со злым умыслом и новейших инструментов ИИ» Бил Гейтс. 

//картинка ChatGPT