Grok 4.5 против Claude Sonnet 5: две модели для кода и агентов
Grok 4.5 от xAI вышла 9 июля 2026 года — заявлена как модель «уровня Opus» для инженерных и агентных задач. Claude Sonnet 5 от Anthropic (30 июня) держит SWE-bench Verified 92,4% и OSWorld 88,3%. Сравниваем факты и разницу подходов — обе модели уже доступны в СуперИнтеллекте.
· ~9 мин

Grok 4.5 против Claude Sonnet 5 — это сравнение двух моделей, которые в 2026 году претендуют на звание лучших инструментов для программирования и автономных агентов: Grok 4.5 от xAI (вышла 9 июля 2026 года) и Claude Sonnet 5 от Anthropic (вышла 30 июня 2026 года, SWE-bench Verified 92,4% по данным Anthropic). Обе уже доступны в СуперИнтеллекте — можно открыть чат и сравнить их на своей задаче прямо сейчас.
Девять дней — и рынок топовых моделей для разработчиков заметно перестроился. 30 июня вышла Claude Sonnet 5 с рекордными показателями на бенчмарках работы с кодом и компьютером. А 9 июля, после приватного бета-тестирования, которое началось в конце июня, xAI официально представила Grok 4.5 — модель, которую основатель компании Илон Маск назвал «уровня Opus». Разбираемся, что известно о каждой модели, чем они отличаются по подходу к коду и агентным сценариям, и что из этого можно пощупать уже сегодня.
Grok 4.5: что известно на данный момент
Grok 4.5 от xAI вышла в публичный доступ 9 июля 2026 года — после приватного бета-тестирования, которое началось в конце июня. По словам основателя xAI Илона Маска, это модель «уровня Opus»: то есть, по его оценке, она сопоставима по мощности с топовыми флагманами рынка, но при этом заметно быстрее и эффективнее в работе.
Главный акцент Grok 4.5 сделан на инженерных и агентных задачах: программирование (включая нетривиальные сценарии на Rust и C/C++), сборка приложений «от промпта до готового продукта», работа с внешними инструментами и автономные многошаговые сценарии, где модель сама планирует и выполняет последовательность действий без постоянного участия человека.
- Инженерные и агентные задачи как основной фокус разработки
- Программирование на сложных языках — включая Rust и C/C++, а не только высокоуровневые скрипты
- Сборка приложений «от промпта до готового продукта» одним связным сценарием
- Работа с инструментами и автономные многошаговые сценарии
- По данным xAI — примерно вдвое выше эффективность по токенам по сравнению с сопоставимыми моделями
По сообщениям технологических изданий со ссылкой на независимые тесты, на бенчмарке DeepSWE 1.0 Grok 4.5 показывает результат около 62%. На бенчмарке SWE Marathon, который проверяет устойчивость решений на длинных, растянутых во времени задачах, результат составляет около 29% — это выше, чем у ряда других топовых моделей на этом же тесте.
Claude Sonnet 5: что известно на данный момент
Claude Sonnet 5 от Anthropic вышла раньше — 30 июня 2026 года. По данным Anthropic, модель показывает 92,4% на SWE-bench Verified (для сравнения — предыдущая модель линейки, Opus 4.6, показывала 80,8%). На бенчмарке OSWorld-Verified, который оценивает работу с компьютером как с реальным рабочим окружением, результат — 88,3%, при том что результат эксперта-человека на этом же тесте — 72,4%. На отдельном бенчмарке агентного программирования Claude Sonnet 5 показывает 63,2% (все цифры — по данным Anthropic).
Сильные стороны Claude Sonnet 5 — работа с уже существующим, «взрослым» кодом (brownfield-код), а не только написание нового с нуля; root-cause фиксы, то есть поиск и устранение первопричины бага, а не симптома; агентность как встроенное качество, а не надстройка; и длинный контекст — до 1 млн токенов, что важно при работе с большими кодовыми базами и объёмной документацией целиком.
- SWE-bench Verified 92,4% (по данным Anthropic; Opus 4.6 — 80,8%)
- OSWorld-Verified (работа с компьютером) 88,3% — выше результата эксперта-человека (72,4%)
- Агентное программирование — 63,2%
- Сильна в brownfield-коде и root-cause фиксах, а не только в написании нового кода
- Контекст до 1 млн токенов — вся кодовая база или документация в одном запросе
Сравнение в цифрах
Важная оговорка: у моделей нет полностью совпадающего набора публичных бенчмарков — Anthropic отчитывается по SWE-bench Verified, OSWorld-Verified и агентному программированию, а по Grok 4.5 в открытых источниках фигурируют DeepSWE 1.0 и SWE Marathon. Это разные тесты с разной методологией, поэтому напрямую цифры одна к одной не сопоставить. Ниже — сводка того, что заявлено по каждой модели, с указанием источника.
| Параметр | Grok 4.5 (xAI) | Claude Sonnet 5 (Anthropic) |
|---|---|---|
| Дата выхода | 9 июля 2026 (после приватной беты с конца июня) | 30 июня 2026 |
| Позиционирование | «Уровня Opus» — по словам Илона Маска, сопоставима с топ-флагманами, но быстрее и эффективнее | Флагман для агентного кода и работы с компьютером, преемник Opus 4.6 |
| Фокус | Инженерные и агентные задачи, сборка приложений «от промпта до продукта» | Brownfield-код, root-cause фиксы, длинный контекст |
| Бенчмарк кода | DeepSWE 1.0 — около 62% (по сообщениям тех-изданий) | SWE-bench Verified — 92,4% (по данным Anthropic) |
| Устойчивость на длинных задачах / работа с компьютером | SWE Marathon — около 29%, выше ряда других топ-моделей (по сообщениям тех-изданий) | OSWorld-Verified — 88,3%, выше эксперта-человека 72,4% (по данным Anthropic) |
| Агентное программирование | Автономные многошаговые сценарии, работа с инструментами | 63,2% на отдельном бенчмарке (по данным Anthropic) |
| Эффективность | По данным xAI — примерно вдвое выше эффективность по токенам | Не заявлена отдельная метрика эффективности |
| Языки программирования | Отдельно выделены Rust, C/C++ | Отдельно не выделены — фокус на brownfield-коде в целом |
| Доступность в СуперИнтеллекте | Да | Да |
В чём разница подхода к коду и агентам
Grok 4.5: скорость, автономность и низкоуровневые языки
Судя по заявленным фактам, Grok 4.5 делает акцент на скорости и эффективности выполнения — модель отвечает быстро и, по данным xAI, экономнее расходует токены. Отдельно выделена работа с низкоуровневыми языками вроде Rust и C/C++, которые традиционно сложнее для языковых моделей из-за строгой типизации, управления памятью и обилия неочевидных ошибок компиляции. Плюс к этому — акцент на сборке приложения целиком, от исходного промпта до готового продукта, что указывает на упор в сторону автономных, многошаговых агентных сценариев.
Claude Sonnet 5: точность на больших кодовых базах
Claude Sonnet 5, по данным Anthropic, ориентирована на другой класс задач — работу с уже существующим кодом крупных проектов (brownfield), где важно не просто написать рабочий фрагмент с нуля, а разобраться в контексте, найти первопричину проблемы и внести точечное изменение, не сломав остальное. Контекст до 1 млн токенов усиливает этот сценарий: модель может держать в поле зрения всю кодовую базу или объёмную документацию сразу, без необходимости резать её на части.
Формально это не противоречит друг другу: обе модели заявлены как сильные в агентном программировании. Разница — в акцентах. Grok 4.5, судя по фактам, больше про скорость и построение нового «с чистого листа» плюс автономность; Claude Sonnet 5 — про глубину понимания существующего кода и точность правок в сложных, уже работающих системах.
Агентность: где раскрывается каждая модель
Агентные сценарии — это не просто «ответить на вопрос», а самостоятельно спланировать шаги, вызвать нужные инструменты, проверить промежуточный результат и довести задачу до конца без постоянных подсказок человека. Обе модели заявлены как сильные именно здесь, но с разным набором подтверждающих фактов.
- Grok 4.5 — заявленный упор на автономные многошаговые сценарии и работу с инструментами, устойчивость на длинных задачах (SWE Marathon около 29%, по сообщениям тех-изданий)
- Claude Sonnet 5 — 63,2% на отдельном бенчмарке агентного программирования и 88,3% на OSWorld-Verified — тесте на работу с компьютером как с реальной рабочей средой (по данным Anthropic)
- И там, и там — заявленная способность работать не одной репликой, а цепочкой связанных действий
Пример: одна и та же задача двум моделям
На практике удобнее всего сравнивать модели не по цифрам бенчмарков, а на конкретной задаче — например, попросить каждую модель разобраться с багом в существующем проекте и предложить исправление с объяснением причины.
prompt.txt
Вот фрагмент кода из нашего проекта (Node.js + TypeScript).
При определённых условиях возникает утечка памяти в обработчике очереди.
1. Проанализируй код и найди первопричину, а не симптом.
2. Предложи минимальное исправление, не меняя архитектуру модуля.
3. Объясни, почему баг вообще мог возникнуть — для ревью командой.
[код модуля]Такой промпт одинаково хорошо подходит для обеих моделей — и позволяет на живом примере увидеть, где сильнее объяснение причины и аккуратность правки, а где — скорость и цельность решения.
Обе модели уже доступны в СуперИнтеллекте
Не нужно разбираться, у какого провайдера какой API-ключ заводить и как переключаться между отдельными сайтами моделей: СуперИнтеллект объединяет их в одном привычном чате. Открыли диалог, выбрали модель из списка — и сразу работаете, будь то Grok 4.5 для быстрой сборки прототипа или Claude Sonnet 5 для аккуратного рефакторинга существующего проекта.
Если вы уже работали с другими моделями линейки Claude на платформе, разница в подходах станет заметна быстро — например, при сравнении с Claude Fable 5, которая больше ориентирована на творческие и текстовые задачи, а не на код.
Что выбрать для своих задач
- Нужно быстро собрать прототип приложения «с нуля» или поработать с Rust/C/C++ — начните с Grok 4.5
- Нужно разобраться в чужом или старом коде большого проекта, найти root-cause бага, держать в контексте всю кодовую базу — начните с Claude Sonnet 5
- Задача включает автономный многошаговый сценарий с инструментами — попробуйте обе на одном промпте и сравните результат
- Не уверены, какая модель ближе именно вашей задаче — на платформе можно переключаться между ними в одном чате без ограничения на пробу
Если код и агенты — не единственная ваша задача, у платформы есть и более широкий обзор: например, статья какую нейросеть выбрать или сравнение ChatGPT 5.6 против Claude Fable 5 — если интересны не только инженерные, но и текстовые сценарии.
FAQ: частые вопросы про Grok 4.5 и Claude Sonnet 5
Какая модель лучше для программирования — Grok 4.5 или Claude Sonnet 5?
Однозначного ответа нет, потому что модели отчитываются по разным бенчмаркам. Claude Sonnet 5 показывает 92,4% на SWE-bench Verified (по данным Anthropic) и заявлена как сильная в работе с уже существующим кодом. Grok 4.5 позиционируется как «уровня Opus» (по словам Илона Маска) с акцентом на скорость, эффективность и низкоуровневые языки вроде Rust и C/C++. Лучший способ выбрать — попробовать обе модели на своей конкретной задаче.
Чем отличается подход Grok 4.5 к агентным задачам от Claude Sonnet 5?
По заявленным фактам, Grok 4.5 больше ориентирована на автономные многошаговые сценарии, сборку приложений «от промпта до продукта» и работу с инструментами при высокой скорости и эффективности по токенам. Claude Sonnet 5, по данным Anthropic, сильна в работе с компьютером как с реальной рабочей средой (OSWorld-Verified 88,3%) и в агентном программировании (63,2%), с упором на brownfield-код и root-cause фиксы.
Можно ли уже попробовать Grok 4.5 и Claude Sonnet 5 в России без VPN?
Да. Обе модели доступны в СуперИнтеллекте напрямую, без VPN — интерфейс на русском, оплата нейронами картой российского банка, есть бесплатный стартовый баланс для пробы. Зарегистрируйтесь на СуперИнтеллекте и откройте обе модели в одном чате.
Какая модель работает быстрее?
По данным xAI, Grok 4.5 заявлена как быстрая и примерно вдвое эффективнее по токенам по сравнению с сопоставимыми моделями. По Claude Sonnet 5 отдельная метрика скорости или эффективности по токенам в открытых данных Anthropic не публиковалась — акцент там сделан на точности и качестве решения на длинном контексте.
Где почитать подробнее про каждую модель отдельно?
Полный разбор Grok 4.5 — в материалах обзор Grok 4.5 и что умеет Grok 4.5, с пошаговой инструкцией в гайде по Grok 4.5. Подробности о Claude Sonnet 5 — в статье Claude Sonnet 5: обзор.
Итог
Grok 4.5 и Claude Sonnet 5 — две модели, вышедшие с разницей в полторы недели и нацеленные на один и тот же класс задач: код и автономных агентов. У каждой свой набор подтверждённых фактов и свой акцент — Grok 4.5 про скорость, эффективность и автономную сборку «с нуля», Claude Sonnet 5 про точность на больших существующих кодовых базах и работу с компьютером. Обе уже доступны в СуперИнтеллекте, поэтому лучший способ определиться — не читать чужие бенчмарки, а попробовать обе модели на своей задаче прямо сейчас.