Справочник ИИ-моделей и нейросетей · 2026
Grok 4.5
Модель xAI с передовыми результатами в программировании, интеллектуальной работе и STEM-задачах
- Генерация текста
- Рассуждение
- Анализ
- Контекстное окно
- 500 000 токенов
- Максимальный ответ
- 450 000 токенов
- Оценки в каталоге
- 6 тестов · 3 результата Arena
Что представляет собой Grok 4.5
Grok 4.5 помогает исследовать тему, разбирать аргументы, писать и редактировать материалы. Модель уместна для задач, которым полезны широкий контекст и последовательное объяснение.
Что умеет модель
- Генерация текста
- Рассуждение
- Анализ
Принимает
Текст, Изображения, Файлы
Возвращает
Текст
Опубликованные оценки
Результаты тестов
Здесь собраны результаты для этой конкретной модели из открытых источников. Результаты с разными протоколами нельзя сравнивать напрямую.
| Тест | Результат | Условия оценки | Источник |
|---|---|---|---|
| AutomationBench-AA657 многоэтапных задач в имитациях SaaS-приложений для шести бизнес-направлений | 51.4% | Оценка с учётом ограничений безопасности Версия: AutomationBench-AA 2026 · Выборка: 657 задач по финансам, HR, маркетингу, операциям, продажам и поддержке · Среда оценки: независимая реализация Artificial Analysis · Попытки: один оцениваемый запуск на задачу · Инструменты: REST API имитаций SaaS-приложений · Проверка: программная проверка конечного состояния с контролем ограничений безопасности · Уровень рассуждения: highМетодика ↗ | Artificial AnalysisНезависимое воспроизведение |
| DeepSWE 1.1113 длительных задач по разработке ПО, проверяемых специально подготовленными тестами | 54.0% ± 2 | Pass@1 Версия: DeepSWE 1.1 · Выборка: 113 задач в 91 репозитории · Среда оценки: mini-swe-agent · Уровень рассуждения: high Примечание к протоколу: Все модели оцениваются в одной среде; стоимость, число выходных токенов и шагов сохраняются как контекст протокола.; Доверительный интервал: ±2Методика ↗ | DataCurveАвтор теста |
| Terminal-Bench 2.1Практические задачи в терминальной среде; результат зависит от агента, лимитов ресурсов и числа попыток | 79.3% ± 1.5 | Средняя доля выполненных задач Версия: Terminal-Bench 2.1, 6-я редакция набора Harbor · Выборка: 89 обновлённых задач · Среда оценки: Cursor CLI · Попытки: пять попыток на задачу · Уровень рассуждения: high Примечание к протоколу: Для каждого результата указан агент; строки с разными агентами нельзя считать сравнением только моделей.; Агент: Cursor CLI; Дата запуска: 2026-07-09; Доверительный интервал: ±1.5Методика ↗ | Terminal-BenchАвтор теста |
| GPQA DiamondЭкспертные вопросы по биологии, физике и химии из наиболее сложной части GPQA | 93.1% | Точность Версия: GPQA Diamond 198 · Выборка: 198 вопросов выборки Diamond · Среда оценки: независимая оценка Artificial Analysis · Инструменты: не указаны на странице результата · Уровень рассуждения: highМетодика ↗ | Artificial AnalysisНезависимое воспроизведение |
| Humanity's Last ExamЭкспертный тест из 2500 вопросов по десяткам академических дисциплин | 42.7% | Точность Версия: текстовая редакция за май 2025 года · Выборка: 2158 текстовых вопросов из редакции на 2500 вопросов за май 2025 года · Попытки: pass@1 · Инструменты: без браузера и инструментов поиска · Проверка: LLM-проверка эквивалентности с допустимой числовой погрешностью · Уровень рассуждения: highМетодика ↗ | Artificial AnalysisНезависимое воспроизведение |
| LiveBenchРегулярно обновляемый тест с защитой от утечки заданий в обучающие данные | 75.8% | Среднее по категориям Версия: LiveBench 2026-06-25 · Выборка: версия от 25 июня 2026 года, 23 задачи в семи категориях Примечание к протоколу: Итог рассчитан как среднее по категориям; протокол нельзя напрямую сравнивать с редакцией от 8 января 2026 года.Методика ↗ | LiveBenchАвтор теста |
Предпочтения пользователей
Результаты Arena
Оценки основаны на слепом сравнении ответов людьми и публикуются отдельно от предметных тестов.
| Категория | Оценка | Место | Голосов | Статус |
|---|---|---|---|---|
| Arena TextСлепое пользовательское сравнение текстовых ответов | 1,470 ± 5 | #36 | 24,152 | Опубликовано |
| Arena WebDevСлепое пользовательское сравнение кода и результатов веб-разработки | 1,556 ± 8 | #20 | 7,058 | Опубликовано |
| Arena SearchСлепое пользовательское сравнение ответов с поиском и опорой на источники | 1,213 ± 7 | #8 | 31,505 | Опубликовано |
Характеристики Grok 4.5
- Провайдер
- xAI
- Семейство
- Grok 4.5
- Идентификатор модели
- grok-4.5
- Стадия релиза
- Стабильная
- Контекстное окно
- 500 000 токенов
- Максимальный ответ
- 450 000 токенов
- Дата выпуска
- 16 июля 2026 г.
- Добавлена в каталог
- 8 июля 2026 г.
- Входные данные
- Текст, Изображения, Файлы
- Результат
- Текст
- Рассуждение
- Поддерживается
- Вызов инструментов
- Поддерживается
Происхождение данных
Источники и статус обновления
Ссылки относятся к конкретным характеристикам и результатам выше. Значения только из каталога не выдаются за независимо подтверждённые данные.
- Arena SearchArena AI · получено 1 сентября 2026 г.
- Arena TextArena AI · получено 1 сентября 2026 г.
- Arena WebDevArena AI · получено 1 сентября 2026 г.
- AutomationBench-AA: Agentic SaaS Workflow BenchmarkArtificial Analysis · получено 9 августа 2026 г.
- GPQA Diamond Benchmark LeaderboardArtificial Analysis · получено 9 августа 2026 г.
- Humanity's Last Exam Benchmark LeaderboardArtificial Analysis · получено 9 августа 2026 г.
- DeepSWE 1.1 LeaderboardDataCurve · получено 9 августа 2026 г.
- LiveBench 2026-06-25 LeaderboardLiveBench · получено 9 августа 2026 г.
- terminal-bench@2.1 LeaderboardTerminal-Bench · получено 9 августа 2026 г.
- OpenRouter model catalogOpenRouter
- Анонс Grok 4.5xAI · получено 1 сентября 2026 г.
- Официальная документация моделиxAI · получено 1 сентября 2026 г.
- Данные проверены
- 1 сентября 2026 г.
- Карточка каталога обновлена
- 8 июля 2026 г.
- Добавлена в каталог
- 8 июля 2026 г.
Связанные модели
Доступно в Чатти
Попробуйте Grok 4.5 на своей задаче
Откройте новый диалог, добавьте контекст и сравните результат с другими моделями в одном сервисе
Попробовать Grok 4.5