Стартап Liquid, который в 2023 году основали выходцы из Массачусетского технологического института, выпустил open weights модель LFM2.5-2.6B. Она рассчитана на агентные задачи и работает целиком на локальном железе: от смартфона и ноутбука до Raspberry Pi. Никакого облака, никаких GPU. Компания утверждает, что модель выдает около 220 токенов в секунду на Apple M5 Max, занимая меньше 2,5 ГБ памяти.

Модель, которую можно запустить где угодно

LFM2.5-2.6B содержит 2,6 млрд параметров, поддерживает контекст на 128 тысяч токенов и умеет вызывать инструменты. Название расшифровывается несложно: поколение модели 2.5 плюс количество параметров 2.6B. Готовая модель и базовая версия LFM2.5-2.6B-Base для дообучения уже лежат на Hugging Face, с поддержкой llama.cpp, MLX, vLLM, SGLang и ONNX с первого дня.

Liquid не пытается соперничать с гигантскими флагманами. Аргумент компании другой: достаточно способная маленькая модель открывает класс задач, где важнее задержка, приватность, гибкость развертывания и цена вывода, чем первое место в бенчмарках.

«Я верю, что лучшие модели будут жить в облаке, и это нормально. Мы делаем модели для другого типа пользователя: edge AI стоит использовать там, где нельзя использовать облачную модель» - Максим Лабонн, глава пост-обучения Liquid AI.

Raspberry Pi как минимальная планка

Глава пост-обучения компании Максим Лабонн говорит, что модель отлично работает на CPU, потому что архитектура LFM2 изначально проектировалась под реальную производительность процессоров, а не под GPU-бенчмарки.

«Лучший пример - Raspberry Pi. У нас много демо, где видно, что модель работает на нем довольно быстро» - Максим Лабонн.

Цифры от Liquid: около 220 токенов в секунду на Apple M5 Max, 113 токенов в секунду на AMD Ryzen AI Max+ 395, меньше 2,5 ГБ памяти, около 30 токенов в секунду на смартфоне. На одном Nvidia H100 под нагрузкой - почти 15 тысяч выходных токенов в секунду, около 1,3 млрд токенов в день. Это цифры самой компании, независимо их никто не проверял.

Для Лабонна объем памяти и скорость - жесткие ограничения, которые определяют, что вообще можно развернуть. Качество модели он сравнивает с моделями намного большего размера, но в корпусе, который влезает в устройства, куда остальные не помещаются.

Обучена для агентов, а не для чатов

Модель создавали в расчете на то, что языковые модели теперь потребляются через агентные платформы, а не через диалоговые окна.

«Модели больше не потребляются в чат-ботах. Их потребляют через агентные обвязки, вроде OpenClaw или Hermes Agent. Мы хотели, чтобы модель была хороша не только в математике и коде, но и в использовании инструментов» - Максим Лабонн.

Обучение прошло на 34 трлн токенов, словарь удвоили до 128K, чтобы лучше поддерживать нелатинские алфавиты, а контекст растянули до 128K токенов специальной фазой для длинных агентных сценариев. Пост-обучение шло в четыре стадии: дообучение с учителем, специализация экспертных моделей, дистилляция и агентное обучение с подкреплением.

На финальной стадии модель обучали прямо внутри продакшн-обвязок Hermes Agent и OpenClaw на реальных задачах: исследования, написание кода, управление документами, вызов инструментов, автоматизация рабочих процессов. Лабонн называет результат «счастливой случайностью»: улучшения вышли далеко за пределы агентных задач.

Liquid собрала и собственную агентную обвязку: она запускается на телефоне, планирует и вызывает инструменты полностью на устройстве. Компания хочет не ассистентов, которые ждут промпта, а агентов, которые действуют сами: следят за календарем, проверяют, чем занят пользователь, и делают задачи по этому контексту.

Меняем обвязку, а не модель

По словам Лабонна, раньше локальные модели имели смысл в основном как узкие специалисты, обученные делать одну вещь на уровне облачных моделей, но быстрее и дешевле. Агентные возможности меняют расклад: одну и ту же модель можно перенастроить под другую задачу, поменяв инструменты вокруг нее.

«Можно сделать ассистента для календаря, а потом ту же модель превратить в ассистента для встреч, который записывает и резюмирует. Модель не меняется, меняется обвязка и инструменты вокруг. Это дает большую универсальность, и это проще и дешевле» - Максим Лабонн.

Для продакшена он все равно советует дообучать модель: без этого часть качества остается неиспользованной, а при хорошем дообучении она догоняет GPT и Claude на задачах средней сложности. Порог входа в дообучение он называет очень низким.

Сравнение с конкурентами и лицензия

Liquid сравнивает LFM2.5-2.6B с моделями, которые компании рассматривают для тех же edge-задач: Google Gemma 4 E2B и E4B, Alibaba Qwen3.5-4B и Qwen3.5-9B. Независимый тест платформы Atomic Chat показал, что модель выполнила 35 вызовов инструментов для трех задач в 3,7 раза быстрее, чем DeepSeek-V4-Flash с 284 млрд параметров.

По опубликованным цифрам, самая маленькая модель в сравнении лидирует во всех тестах следования инструкциям и почти во всех тестах работы с инструментами: 77,83 на ToolSandbox против 76,44 у Qwen3.5-9B, которая почти в четыре раза больше. На агентных оценках она обходит обе Gemma и сравнивается с Qwen.

Отличие есть и в лицензии. Gemma 4 и Qwen3.5 распространяются под Apache 2.0, DeepSeek-V4-Flash под MIT. LFM2.5-2.6B выходит под LFM Open License v1.0: компании с выручкой меньше 10 млн долларов могут использовать, менять и распространять модель, включая коммерческое использование. Крупным компаниям нужен отдельный договор с Liquid. Некоммерческие организации освобождены от порога для некоммерческих и исследовательских целей.

Что это значит для бизнеса

Для компаний, которые не хотят отправлять данные в облако, появляется рабочий вариант: агенты на своих серверах или прямо на устройствах. Регулируемые отрасли, банки, медицинские и государственные структуры во Владивостоке и на Дальнем Востоке получают инструмент, где чувствительные данные не покидают контур компании.

Считать экономику локальных моделей стоит через цену задачи, а не цену токена. Если агент работает круглосуточно на собственном железе, маржинальная стоимость каждого следующего вызова стремится к нулю. Внедрение искусственного интеллекта в компании начинается с выбора: какие задачи отдавать облачным моделям, а какие держать локально.

Нейросети для бизнеса и автоматизация бизнес-процессов перестают упираться в стоимость API. Модель за 2,6 млрд параметров не заменит флагман для сложного кода, но для рутины: календари, документы, обработка заявок, она может закрыть задачи, которые раньше было невыгодно автоматизировать.