Перейти к содержимому

Grok 4.5 против Claude Sonnet 5: две модели для кода и агентов

Grok 4.5 от xAI вышла 9 июля 2026 года — заявлена как модель «уровня Opus» для инженерных и агентных задач. Claude Sonnet 5 от Anthropic (30 июня) держит SWE-bench Verified 92,4% и OSWorld 88,3%. Сравниваем факты и разницу подходов — обе модели уже доступны в СуперИнтеллекте.

· ~9 мин

Grok 4.5 против Claude Sonnet 5 — это сравнение двух моделей, которые в 2026 году претендуют на звание лучших инструментов для программирования и автономных агентов: Grok 4.5 от xAI (вышла 9 июля 2026 года) и Claude Sonnet 5 от Anthropic (вышла 30 июня 2026 года, SWE-bench Verified 92,4% по данным Anthropic). Обе уже доступны в СуперИнтеллекте — можно открыть чат и сравнить их на своей задаче прямо сейчас.

Девять дней — и рынок топовых моделей для разработчиков заметно перестроился. 30 июня вышла Claude Sonnet 5 с рекордными показателями на бенчмарках работы с кодом и компьютером. А 9 июля, после приватного бета-тестирования, которое началось в конце июня, xAI официально представила Grok 4.5 — модель, которую основатель компании Илон Маск назвал «уровня Opus». Разбираемся, что известно о каждой модели, чем они отличаются по подходу к коду и агентным сценариям, и что из этого можно пощупать уже сегодня.

Grok 4.5: что известно на данный момент

Grok 4.5 от xAI вышла в публичный доступ 9 июля 2026 года — после приватного бета-тестирования, которое началось в конце июня. По словам основателя xAI Илона Маска, это модель «уровня Opus»: то есть, по его оценке, она сопоставима по мощности с топовыми флагманами рынка, но при этом заметно быстрее и эффективнее в работе.

Главный акцент Grok 4.5 сделан на инженерных и агентных задачах: программирование (включая нетривиальные сценарии на Rust и C/C++), сборка приложений «от промпта до готового продукта», работа с внешними инструментами и автономные многошаговые сценарии, где модель сама планирует и выполняет последовательность действий без постоянного участия человека.

  • Инженерные и агентные задачи как основной фокус разработки
  • Программирование на сложных языках — включая Rust и C/C++, а не только высокоуровневые скрипты
  • Сборка приложений «от промпта до готового продукта» одним связным сценарием
  • Работа с инструментами и автономные многошаговые сценарии
  • По данным xAI — примерно вдвое выше эффективность по токенам по сравнению с сопоставимыми моделями

По сообщениям технологических изданий со ссылкой на независимые тесты, на бенчмарке DeepSWE 1.0 Grok 4.5 показывает результат около 62%. На бенчмарке SWE Marathon, который проверяет устойчивость решений на длинных, растянутых во времени задачах, результат составляет около 29% — это выше, чем у ряда других топовых моделей на этом же тесте.

Claude Sonnet 5: что известно на данный момент

Claude Sonnet 5 от Anthropic вышла раньше — 30 июня 2026 года. По данным Anthropic, модель показывает 92,4% на SWE-bench Verified (для сравнения — предыдущая модель линейки, Opus 4.6, показывала 80,8%). На бенчмарке OSWorld-Verified, который оценивает работу с компьютером как с реальным рабочим окружением, результат — 88,3%, при том что результат эксперта-человека на этом же тесте — 72,4%. На отдельном бенчмарке агентного программирования Claude Sonnet 5 показывает 63,2% (все цифры — по данным Anthropic).

Сильные стороны Claude Sonnet 5 — работа с уже существующим, «взрослым» кодом (brownfield-код), а не только написание нового с нуля; root-cause фиксы, то есть поиск и устранение первопричины бага, а не симптома; агентность как встроенное качество, а не надстройка; и длинный контекст — до 1 млн токенов, что важно при работе с большими кодовыми базами и объёмной документацией целиком.

  • SWE-bench Verified 92,4% (по данным Anthropic; Opus 4.6 — 80,8%)
  • OSWorld-Verified (работа с компьютером) 88,3% — выше результата эксперта-человека (72,4%)
  • Агентное программирование — 63,2%
  • Сильна в brownfield-коде и root-cause фиксах, а не только в написании нового кода
  • Контекст до 1 млн токенов — вся кодовая база или документация в одном запросе

Сравнение в цифрах

Важная оговорка: у моделей нет полностью совпадающего набора публичных бенчмарков — Anthropic отчитывается по SWE-bench Verified, OSWorld-Verified и агентному программированию, а по Grok 4.5 в открытых источниках фигурируют DeepSWE 1.0 и SWE Marathon. Это разные тесты с разной методологией, поэтому напрямую цифры одна к одной не сопоставить. Ниже — сводка того, что заявлено по каждой модели, с указанием источника.

ПараметрGrok 4.5 (xAI)Claude Sonnet 5 (Anthropic)
Дата выхода9 июля 2026 (после приватной беты с конца июня)30 июня 2026
Позиционирование«Уровня Opus» — по словам Илона Маска, сопоставима с топ-флагманами, но быстрее и эффективнееФлагман для агентного кода и работы с компьютером, преемник Opus 4.6
ФокусИнженерные и агентные задачи, сборка приложений «от промпта до продукта»Brownfield-код, root-cause фиксы, длинный контекст
Бенчмарк кодаDeepSWE 1.0 — около 62% (по сообщениям тех-изданий)SWE-bench Verified — 92,4% (по данным Anthropic)
Устойчивость на длинных задачах / работа с компьютеромSWE Marathon — около 29%, выше ряда других топ-моделей (по сообщениям тех-изданий)OSWorld-Verified — 88,3%, выше эксперта-человека 72,4% (по данным Anthropic)
Агентное программированиеАвтономные многошаговые сценарии, работа с инструментами63,2% на отдельном бенчмарке (по данным Anthropic)
ЭффективностьПо данным xAI — примерно вдвое выше эффективность по токенамНе заявлена отдельная метрика эффективности
Языки программированияОтдельно выделены Rust, C/C++Отдельно не выделены — фокус на brownfield-коде в целом
Доступность в СуперИнтеллектеДаДа
Grok 4.5 и Claude Sonnet 5: факты по данным разработчиков и открытых источников

В чём разница подхода к коду и агентам

Grok 4.5: скорость, автономность и низкоуровневые языки

Судя по заявленным фактам, Grok 4.5 делает акцент на скорости и эффективности выполнения — модель отвечает быстро и, по данным xAI, экономнее расходует токены. Отдельно выделена работа с низкоуровневыми языками вроде Rust и C/C++, которые традиционно сложнее для языковых моделей из-за строгой типизации, управления памятью и обилия неочевидных ошибок компиляции. Плюс к этому — акцент на сборке приложения целиком, от исходного промпта до готового продукта, что указывает на упор в сторону автономных, многошаговых агентных сценариев.

Claude Sonnet 5: точность на больших кодовых базах

Claude Sonnet 5, по данным Anthropic, ориентирована на другой класс задач — работу с уже существующим кодом крупных проектов (brownfield), где важно не просто написать рабочий фрагмент с нуля, а разобраться в контексте, найти первопричину проблемы и внести точечное изменение, не сломав остальное. Контекст до 1 млн токенов усиливает этот сценарий: модель может держать в поле зрения всю кодовую базу или объёмную документацию сразу, без необходимости резать её на части.

Формально это не противоречит друг другу: обе модели заявлены как сильные в агентном программировании. Разница — в акцентах. Grok 4.5, судя по фактам, больше про скорость и построение нового «с чистого листа» плюс автономность; Claude Sonnet 5 — про глубину понимания существующего кода и точность правок в сложных, уже работающих системах.

Агентность: где раскрывается каждая модель

Агентные сценарии — это не просто «ответить на вопрос», а самостоятельно спланировать шаги, вызвать нужные инструменты, проверить промежуточный результат и довести задачу до конца без постоянных подсказок человека. Обе модели заявлены как сильные именно здесь, но с разным набором подтверждающих фактов.

  • Grok 4.5 — заявленный упор на автономные многошаговые сценарии и работу с инструментами, устойчивость на длинных задачах (SWE Marathon около 29%, по сообщениям тех-изданий)
  • Claude Sonnet 5 — 63,2% на отдельном бенчмарке агентного программирования и 88,3% на OSWorld-Verified — тесте на работу с компьютером как с реальной рабочей средой (по данным Anthropic)
  • И там, и там — заявленная способность работать не одной репликой, а цепочкой связанных действий

Пример: одна и та же задача двум моделям

На практике удобнее всего сравнивать модели не по цифрам бенчмарков, а на конкретной задаче — например, попросить каждую модель разобраться с багом в существующем проекте и предложить исправление с объяснением причины.

prompt.txt

Вот фрагмент кода из нашего проекта (Node.js + TypeScript).
При определённых условиях возникает утечка памяти в обработчике очереди.

1. Проанализируй код и найди первопричину, а не симптом.
2. Предложи минимальное исправление, не меняя архитектуру модуля.
3. Объясни, почему баг вообще мог возникнуть — для ревью командой.

[код модуля]

Такой промпт одинаково хорошо подходит для обеих моделей — и позволяет на живом примере увидеть, где сильнее объяснение причины и аккуратность правки, а где — скорость и цельность решения.

Обе модели уже доступны в СуперИнтеллекте

Не нужно разбираться, у какого провайдера какой API-ключ заводить и как переключаться между отдельными сайтами моделей: СуперИнтеллект объединяет их в одном привычном чате. Открыли диалог, выбрали модель из списка — и сразу работаете, будь то Grok 4.5 для быстрой сборки прототипа или Claude Sonnet 5 для аккуратного рефакторинга существующего проекта.

Если вы уже работали с другими моделями линейки Claude на платформе, разница в подходах станет заметна быстро — например, при сравнении с Claude Fable 5, которая больше ориентирована на творческие и текстовые задачи, а не на код.

Что выбрать для своих задач

  • Нужно быстро собрать прототип приложения «с нуля» или поработать с Rust/C/C++ — начните с Grok 4.5
  • Нужно разобраться в чужом или старом коде большого проекта, найти root-cause бага, держать в контексте всю кодовую базу — начните с Claude Sonnet 5
  • Задача включает автономный многошаговый сценарий с инструментами — попробуйте обе на одном промпте и сравните результат
  • Не уверены, какая модель ближе именно вашей задаче — на платформе можно переключаться между ними в одном чате без ограничения на пробу

Если код и агенты — не единственная ваша задача, у платформы есть и более широкий обзор: например, статья какую нейросеть выбрать или сравнение ChatGPT 5.6 против Claude Fable 5 — если интересны не только инженерные, но и текстовые сценарии.


FAQ: частые вопросы про Grok 4.5 и Claude Sonnet 5

Какая модель лучше для программирования — Grok 4.5 или Claude Sonnet 5?

Однозначного ответа нет, потому что модели отчитываются по разным бенчмаркам. Claude Sonnet 5 показывает 92,4% на SWE-bench Verified (по данным Anthropic) и заявлена как сильная в работе с уже существующим кодом. Grok 4.5 позиционируется как «уровня Opus» (по словам Илона Маска) с акцентом на скорость, эффективность и низкоуровневые языки вроде Rust и C/C++. Лучший способ выбрать — попробовать обе модели на своей конкретной задаче.

Чем отличается подход Grok 4.5 к агентным задачам от Claude Sonnet 5?

По заявленным фактам, Grok 4.5 больше ориентирована на автономные многошаговые сценарии, сборку приложений «от промпта до продукта» и работу с инструментами при высокой скорости и эффективности по токенам. Claude Sonnet 5, по данным Anthropic, сильна в работе с компьютером как с реальной рабочей средой (OSWorld-Verified 88,3%) и в агентном программировании (63,2%), с упором на brownfield-код и root-cause фиксы.

Можно ли уже попробовать Grok 4.5 и Claude Sonnet 5 в России без VPN?

Да. Обе модели доступны в СуперИнтеллекте напрямую, без VPN — интерфейс на русском, оплата нейронами картой российского банка, есть бесплатный стартовый баланс для пробы. Зарегистрируйтесь на СуперИнтеллекте и откройте обе модели в одном чате.

Какая модель работает быстрее?

По данным xAI, Grok 4.5 заявлена как быстрая и примерно вдвое эффективнее по токенам по сравнению с сопоставимыми моделями. По Claude Sonnet 5 отдельная метрика скорости или эффективности по токенам в открытых данных Anthropic не публиковалась — акцент там сделан на точности и качестве решения на длинном контексте.

Где почитать подробнее про каждую модель отдельно?

Полный разбор Grok 4.5 — в материалах обзор Grok 4.5 и что умеет Grok 4.5, с пошаговой инструкцией в гайде по Grok 4.5. Подробности о Claude Sonnet 5 — в статье Claude Sonnet 5: обзор.


Итог

Grok 4.5 и Claude Sonnet 5 — две модели, вышедшие с разницей в полторы недели и нацеленные на один и тот же класс задач: код и автономных агентов. У каждой свой набор подтверждённых фактов и свой акцент — Grok 4.5 про скорость, эффективность и автономную сборку «с нуля», Claude Sonnet 5 про точность на больших существующих кодовых базах и работу с компьютером. Обе уже доступны в СуперИнтеллекте, поэтому лучший способ определиться — не читать чужие бенчмарки, а попробовать обе модели на своей задаче прямо сейчас.