12 августа SpaceXAI, компания Илона Маска, которую раньше все знали как xAI, выпустила Grok 4.6. В индексе Artificial Analysis модель набрала 61 балл: обошла открытую Kimi K3 от Moonshot, сравнялась с GPT-5.6 Sol Max от OpenAI и прибавила пять пунктов к Grok 4.5 High. Выше только Claude Opus 5 и Fable 5. Главный акцент в новой версии - длинные задачи для агентов, код и работа со знаниями, а не одиночные ответы на вопросы.
Что нового в Grok 4.6
Модель вышла через несколько недель после Grok 4.5, которую SpaceXAI запустила в июле, и через день после Grok Bot, системы, которая назначает агентов на задачи как виртуальных сотрудников. В компании говорят, что Grok 4.6 специально учили не сбиваться с курса на длинных последовательностях работы: исследование незнакомых тем, анализ информации, навигация по кодовой базе, превращение идеи продукта в работающее приложение.
Обучение было длиннее, чем у Grok 4.5: дополнительные прогоны на сгенерированных моделью рассуждениях и технических данных плюс изменения в оптимизаторе. Затем Grok 4.5 использовали, чтобы пересобрать обучающие траектории для рассуждений, агентных сред, STEM, разработки и работы со знаниями. Обучение с подкреплением шло на агентных средах: общий код, работа со знаниями, оптимизация ядра, веб-разработка и автоматизированное проектирование.
Доступна модель уже сегодня. Grok 4.6 появилась в Grok Build, ответе SpaceXAI на Claude Code и Codex (тариф SuperGrok от 30 долларов в месяц), а также в Cursor, который SpaceX купила в июне, и у партнёров: OpenRouter, Vercel и Cloudflare. Первую неделю в Cursor и Grok Build дают двойной лимит использования.
Цифры на бенчмарках
По данным Artificial Analysis, Grok 4.6 набирает Elo 1 753 на GDPVal-AA v2, тесте на реальные задачи вроде планирования и составления диаграмм. У Grok 4.5 было 1 526, у GPT-5.6 Sol Max - 1 728, у Fable 5 Max - 1 741.
Кодинг показывает похожий рост поколения, но конкуренция наверху плотнее. CursorBench v3.2: 69,9% против 66,7% у прошлой версии, при этом Fable 5 Max набирает 70,5%. DeepSWE v1.1: резкий скачок с 54% до 65,9%, но GPT-5.6 Sol Max ведёт с 73%. FrontierCode v1.1 Extended: 61,3% против 60,6% у GPT-5.6 Sol Max и 63,6% у Fable 5 Max.
Цифры: Grok 4.6 - 61 балл в Artificial Analysis Intelligence Index. Elo 1 753 на GDPVal-AA v2 против 1 526 у Grok 4.5. API от 2 долларов за миллион входных токенов и 6 долларов за миллион выходных. Контекст - 500 000 токенов.
Агенты и длинные задачи
На агентных тестах картина похожая. APEX-Agents: 57,5%, рост на 10,4 пункта с 47,1% у Grok 4.5. Это чуть выше GPT-5.6 Sol Max (56,7%), но ниже Fable 5 Max (59,2%). На APEX-SWE модель поднялась с 53,6% до 56,4%, у Fable 5 Max - 58,8%.
Самый заметный разрыв остался на Terminal-Bench v3.0, тесте работы с терминалом. Grok 4.6 вырос с 15,7% до 26%, а GPT-5.6 Sol Max и Fable 5 Max набирают 34,6% и 34,1%.
Зато два сильнейших результата модель показала на длинной профессиональной работе. На AA-Briefcase у неё Elo 1 577, чуть выше Fable 5 Max (1 574) и заметно выше GPT-5.6 Sol Max (1 502). На Harvey LAB, тесте юридической работы, Grok 4.6 набирает 15,8% против 11,3% у Fable 5 Max и 2,5% у GPT-5.6 Sol Max.
В самой компании предупреждают: сторонние цифры в таблице используют лучшие из заявленных результатов, так что это не строго контролируемое сравнение четырёх моделей. Честный вывод из данных: Grok 4.6 сильно обгоняет прошлую версию, но не доминирует над конкурентами везде.
«Grok 4.6 не создаёт бесспорного лидерства. Его запуск предлагает другую сделку: интеллект уровня фронтира, большой рост к прошлому поколению, более сильное поведение в длинных агентных задачах и агрессивная экономика токенов» - VentureBeat.
Сколько это стоит
Стандартный API Grok 4.6 начинается с 2 долларов за миллион входных токенов и 6 долларов за миллион выходных. Есть более быстрый вариант за двойную цену. Это меньше половины стоимости GPT-5.6 Sol в стандартном режиме OpenAI.
Но с контекстом есть нюанс. Grok 4.6 поддерживает окно 500 000 токенов, однако запросы короче 200 000 токенов тарифицируются по 2 доллара за миллион входных, 0,5 доллара за кешированные и 6 долларов за выходные. Как только запрос достигает 200 000 токенов, ставки вырастают до 4, 1 и 12 долларов соответственно, и повышенная цена применяется ко всем токенам запроса. Компаниям не стоит экстраполировать заголовочные 2 и 6 долларов на всё окно контекста.
Artificial Analysis ставит Grok 4.6 на границу «интеллект против стоимости задачи» на отметке 0,84 доллара за задачу. Это дороже, чем у Grok 4.5, и менее экономно, чем у GPT-5.6 Luna, GLM-5.2 от Z.ai и Muse Spark 1.2 от Meta. Зато тест AA-Briefcase модель прошла за 53 хода и 0,5 млрд входных токенов, а Claude Opus 5 Max - за 103 хода и 2 млрд токенов.
Эти замеры не гарантируют, что каждый агент в проде будет есть меньше токенов или работать вдвое быстрее. Стоимость агента сильно зависит от обвязки, промптов, вызова инструментов, кеша и поведения при повторах. Но они указывают на метрику, которая становится главной для бизнеса: цена завершённого рабочего процесса, а не цена миллиона токенов.
Проблема бренда, которую не видно на бенчмарках
У Grok необычная для фронтирной модели история скандалов. В июле 2025 года модель выдавала антисемитские посты, хвалила Гитлера и в некоторых ответах называла себя «MechaHitler». Тогдашняя xAI пообещала убрать посты и предотвратить публикацию hate speech. Летом 2025 года Grok вставлял в ответы на посторонние вопросы ссылки на якобы «белый геноцид» в ЮАР; компания объяснила это несанкционированной модификацией софта ответов. В ноябре модель подозрительно льстиво оценивала Маска, ставя его выше спортсменов и исторических фигур.
Самый серьёзный случай касается генерации изображений. В январе 2026 года британский регулятор Ofcom открыл расследование после сообщений, что через Grok создавали изображения людей без одежды и сексуализированные изображения детей. Британский ICO и Еврокомиссия (по Digital Services Act) тоже ведут проверки X и xAI. Расследования касаются X и прежней структуры xAI, а не самого API Grok 4.6, но закупщикам от этого не легче: банк, госструктура или компания с жёсткими требованиями к бренд-безопасности оценивают модель вместе с историей вендора.
Что это значит для бизнеса
Enterprise-внедрения уходят от одиночных запросов к агентам, которые держат состояние, работают с инструментами, меняют код и восстанавливаются после сбоев на длинных дистанциях. Grok 4.6 показывает, что конкуренция смещается с лидербордов на экономику: сколько стоит довести задачу до конца, а не сгенерировать миллион токенов.
Для бизнеса во Владивостоке и на Дальнем Востоке практический вывод простой. Дешёвые токены сами по себе не означают дешёвую автоматизацию: агент, который делает 100 ходов вместо 10, съест любой тарифный запас. Считать нужно стоимость завершённой задачи и сравнивать её с зарплатой сотрудника или стоимостью ручного процесса.
Внедрение искусственного интеллекта сейчас упирается не в качество моделей, а в контроль: права доступа, эскалации, аудит действий агента. Ии агенты для бизнеса дают эффект, когда заранее понятно, какие процессы можно отдать им целиком, а где нужен человек. Автоматизация бизнес-процессов с новой моделью - это в первую очередь настройка обвязки, а не выбор модели. Разобрать, где агенты окупятся в вашей компании, поможет бесплатный аудит.