Бывшие инженеры MIT из Liquid AI выпустили модель LFM2.5-230M — 230 миллионов параметров, которые умещаются в 400 МБ памяти. Она работает на смартфонах и Raspberry Pi. И в извлечении данных она бьет open-source модели вчетверо крупнее.

Речь не про очередную «маленькую модель для чата». LFM2.5-230M спроектирована для одной задачи: структурировать неструктурированные данные. PDF, счета, формы, телеметрия с устройств — всё то, с чем бизнес сталкивается каждый день и что пока разбирают вручную или через хрупкие ETL-скрипты.

Модель доступна на Hugging Face под двойной коммерческой лицензией. Бесплатно — для частных лиц и компаний с выручкой до 10 млн долларов. Для крупных — платное предприятие.

Ключевые цифры

  • 230 млн параметров — в 10 раз меньше Google Gemma 4 E2B
  • 19 трлн токенов предобучения
  • 213 токенов/с на Samsung Galaxy S25 Ultra
  • 42 токена/с на Raspberry Pi 5
  • 43.26 баллов на BFCLv3 — выше IBM Granite 4.0-350M и Gemma 3 1B IT

Почему малый вес — это ключевое

Пока Anthropic, OpenAI, Google и Meta гоняются за сотнями миллиардов параметров, есть параллельная гонка — за эффективность на устройстве. LFM2.5-230M показывает, что edge-устройствам не нужны мощные GPU или постоянное облачное соединение, чтобы выполнять сложные агентные сценарии.

На Samsung Galaxy S25 Ultra с процессором Qualcomm Snapdragon Gen4 модель выдает 213 токенов в секунду. Даже на Raspberry Pi 5 — 42 токена в секунду, что достаточно для структурирования входящих данных в реальном времени.

Архитектура LFM2.5 отличается от стандартных трансформеров: это гибрид, который чередует свертки с коротким диапазоном и grouped-query attention. Результат — поддержка контекстного окна в 32K токенов без квадратичного роста затрат памяти, свойственного чистым attention-механизмам.

Где это нужно бизнесу

Организации до сих пор полагаются на жесткие ETL-скрипты. Стоит измениться формату документа или схеме — и пайплайн ломается. Индустрия движется к «AI ETL», где модель сама определяет маппинг, отслеживает изменения схемы и адаптируется.

Использовать флагманскую модель вроде Claude Opus 4.6 (5 долларов за миллион входных токенов) для разбора рутинных счетов или форматирования адресов экономически невыгодно. LFM2.5-230M как раз для этого: легкий движок извлечения, который работает на локальном железе без постоянных API-запросов в облако.

Как это работает на практике

Liquid AI продемонстрировала модель на роботе-гуманоиде Unitree G1. Модель работает прямо на борту, на модуле NVIDIA Jetson Orin. Команда вроде «стой 2 секунды, потом иди вперед 1 м/с на 3 метра, задержись в позе на одной ноге на 5 секунд и иди назад 0.5 м/с на 3 метра» модель сама раскладывает на многошаговый план и вызывает нужные навыки через фреймворк NVIDIA SONIC.

Для предпринимателей во Владивостоке и на Дальнем Востоке это означает одно: технологии, которые еще вчера требовали серверной инфраструктуры, сегодня работают на телефоне.

Модель доступна с первого дня во всех популярных инференс-движках: llama.cpp (GGUF), MLX, vLLM, SGLang и ONNX. Это значит, что LFM2.5-230M можно запустить локально на любом современном ноутбуке без покупки GPU.

Сравнение с VibeThinker-3B от Weibo, который на 94.3 балла решает AIME 2026, — намеренно некорректно. Это разные весовые категории. LFM2.5-230M не претендует на решение сложной математики. Ее стихия — структурирование данных и вызов инструментов, где она действительно бьет модели в 4 раза больше себя.