Пока правительство США ограничивает доступ к новым моделям Anthropic и OpenAI, китайский DeepSeek снова выложил open-source-решение, которое может изменить то, как работают большие языковые модели. В выходные компания выпустила DSpark - фреймворк для спекулятивного декодинга, ускоряющий генерацию токенов на 60-85% без изменения самой модели.
Представьте, что большинство AI-чат-ботов пишут текст, переходя реку по одному камню за раз: выбирают один маленький фрагмент, потом следующий, потом ещё один. DSpark даёт системе разведчика, который забегает на несколько шагов вперёд, угадывает вероятный путь и позволяет большой модели быстро проверить, какие шаги безопасны. Когда догадки точны - модель движется быстрее. Когда слабы - DSpark тратит минимум времени на их проверку.
DeepSeek опубликовала вместе с релизом техническую статью, контрольные точки моделей и DeepSpec - репозиторий для обучения и оценки систем спекулятивного декодинга. Всё под MIT-лицензией: разработчики, исследователи и коммерческие команды могут использовать технику без ограничений.
Система решает одну из самых дорогих проблем развёртывания AI: обслуживать большие модели достаточно быстро для реальных пользователей, расходуя оборудование эффективно. Это критично для чат-ботов, AI-ассистентов кодинга, агентских пайплайнов и корпоративных AI-систем, где пользователи ждут длинные ответы не по слову, а потоком.
Как DSpark ускоряет DeepSeek-V4
DeepSeek применила DSpark к двум своим моделям: V4-Flash (284 млрд параметров, 13 млрд активных, оптимизирована на скорость) и V4-Pro (1,6 трлн параметров, 49 млрд активных, ориентирована на глубину рассуждения). Обе поддерживают контекст до миллиона токенов.
Результаты на реальном трафике: совокупная пропускная способность выросла на 51% для V4-Flash и на 52% для V4-Pro. Если мерять скорость для отдельного пользователя при одинаковой нагрузке системы - прирост составил 60-85% для V4-Flash и 57-78% для V4-Pro.
- V4-Flash: +60-85% к скорости генерации для пользователя, +51% совокупной пропускной способности
- V4-Pro: +57-78% к скорости генерации, +52% совокупной пропускной способности
- Совместимость: не только DeepSeek - протестирована на Qwen и Gemma
- Лицензия: MIT - можно использовать в коммерческих продуктах
DeepSeek также приводит гораздо более впечатляющие цифры - 661% и 406% прироста, но они измеряют совокупную пропускную способность при жёстких таргетах скорости (120 токенов в секунду для V4-Flash). При таких требованиях старая система MTP-1 упирается в операционный потолок и держит лишь несколько параллельных запросов. DSpark избегает этого коллапса, поэтому процентная разница в общем объёме становится значительно больше. Простыми словами: 85% - это «насколько быстрее чувствует себя пользователь», а 661% - «насколько больше трафика система может выдержать», когда старая уже задыхается.
Как работает спекулятивное декодинг
LLM обычно генерируют текст по одному токену за раз. Каждый новый токен зависит от уже написанного текста, поэтому модель постоянно останавливается, проверяет полный контекст и выбирает следующий кусочек. Это точно, но медленно.
Спекулятивное декодинг, разработанный ещё в раннюю эпоху трансформеров, пытается исправить это узкое место. Вместо того чтобы просить большую модель производить каждый токен по одному, система использует маленькую лёгкую модель-черновик, которая предлагает несколько вероятных следующих токенов. Большая модель проверяет догадки пачкой - параллельно. Если черновик угадал - система продвигается сразу на несколько токенов.
Ключевая метрика - не сколько токенов черновик может угадать, а сколько из этих догадок большая модель действительно принимает. Длинные спекулятивные блоки помогают, только если достаточная часть предложенных токенов проходит проверку. Иначе система тратит вычислительные ресурсы на проверку догадок, которые выбрасывает.
DSpark решает две проблемы: плохие догадки и напрасные проверки. Во-первых, система использует то, что DeepSeek называет полу-авторегрессионной генерацией: параллельная основа для большей части черновика плюс лёгкая последовательная головка, которая учитывает связи между соседними токенами. Во-вторых, DSpark добавляет верификацию с контролем уверенности - система оценивает, какая часть черновика скорее всего выживет, и подстраивает объём проверок под текущую нагрузку.
Простая аналогия: когда в ресторане тихо, шеф-повар может проверить больше работы помощника. Когда кухня завалена, он тратит внимание только на те блюда, которые скорее всего готовы. DSpark делает то же самое с AI-серверами.
Результаты на Qwen и Gemma
DeepSeek протестировала DSpark не только на своих моделях. Офлайн-тесты на Qwen3-4B, Qwen3-8B, Qwen3-14B и Gemma4-12B показали улучшение средней принятой длины токена на 26-30% по сравнению с Eagle3 и на 16-18% по сравнению с DFlash. Прирост стабилен на разных размерах моделей.
Для предприятий это значит, что DSpark особенно эффективен для AI-ассистентов кодинга, агентов анализа данных и структурированных рабочих процессов - там, где результаты более предсказуемы, чем в свободном разговоре. Внедрение искусственного интеллекта в такие задачи становится заметно дешевле.
Что это значит для бизнеса
DSpark показывает, сколько производительности ещё можно выжать из слоя инференса, даже не меняя архитектуру модели. Для компаний, которые присматриваются к open source ии и open weights моделям, открывается путь: взять Qwen, Llama, Mistral или Gemma, обучить DSpark-черновик под свою целевую модель и получить ускорение в полтора-два раза на тех же серверах.
Главный урок DSpark: следующая волна прироста производительности AI придёт не от более крупных моделей, а от более умных способов запускать те модели, которые уже есть. Особенно когда компания контролирует достаточно стека, чтобы настроить модель, обучить совместимый модуль-черновик и оптимизировать движок вывода под реальные нагрузки.
Для бизнеса во Владивостоке и на Дальнем Востоке тренд прозрачен: open-source-решения вроде DSpark делают нейросети для бизнеса доступнее. Если раньше скорость работы большой модели упиралась в железо, то теперь - в умение правильно организовать пайплайн. Это снижает порог входа: автоматизация с помощью ии и внедрение AI-агентов перестают быть привилегией гигантов с бюджетами на тысячи GPU.
DeepSeek снова показала, что open-source-экосистема способна догонять и опережать проприетарные решения. Для компаний, которые присматриваются к open weights модели и новости deepseek, это сигнал: время присматриваться прошло, пора тестировать на своих данных.