Большая часть бизнес-данных живёт в таблицах: базы данных, CRM, финансовые отчёты. Чтобы построить надёжную модель на таких данных, обычно нужно обучить новую с нуля, подбирать гиперпараметры, проектировать признаки и бороться с дрейфом данных. Google Research предлагает обойти всё это - TabFM, фундаментальная модель, которая обрабатывает таблицы как задачу обучения в контексте.

Одним проходом: даёте модельку свои данные - получаете прогноз. Никаких недель пайплайнов. Один API-вызов. Для бизнеса это означает: прогнозирование оттока, оценка рисков, анализ продаж - без команды дата-сайентистов.

Как это работает: Вы не обновляете веса модели. Вы берёте свои исторические примеры (строки с известными значениями) и целевые строки (то, что хотите спрогнозировать) и передаёте их модели как единый промпт. Модель сама разбирается, как связаны колонки и строки.

Почему LLM не справляются с таблицами

Казалось бы, если большие языковые модели так хороши в обучении в контексте, почему бы просто не скормить им таблицу? Проблема в трёх вещах. Во-первых, контекст заканчивается быстро - средняя таблица на пару тысяч строк и сотню колонок уже не влезает. Во-вторых, токенизация ломает числа: LLM разбивает числовые значения на токены, теряя математическую точность. В-третьих, структурная слепота: когда двумерную таблицу превращают в одномерную строку, модель теряет, какое значение к какой строке и колонке относится.

Вейхао Кунг, исследователь Google Research, объяснил VentureBeat: «Сейчас гораздо эффективнее попросить LLM написать код, который подготовит признаки и вызовет XGBoost, чем просить LLM читать саму таблицу».

Как устроен TabFM

TabFM обходит эти ограничения, обрабатывая данные как сетку (грид), сохраняя их структурную целостность. Модель объединяет лучшее из двух предшественников: TabPFN (глубокая контекстуализация признаков) и TabICL (сжатие строк).

Архитектура основана на трёх механизмах:

  • Чередование внимания по строкам и колонкам: Сырая таблица проходит через многослойный модуль внимания, который чередует колонки (признаки) и строки (примеры). Модель сама находит сложные взаимодействия признаков, которые обычно требуют ручного проектирования.
  • Сжатие строк: После контекстуализации информация по каждой строке сжимается в один плотный вектор. Это резко уменьшает вычислительную нагрузку.
  • Обучение в контексте: Каузальный Transformer обрабатывает последовательность сжатых эмбеддингов, работая с таблицей как с контекстом.

Модель обучали на сотнях миллионов синтетических датасетов. Она никогда не видела реальные конфиденциальные данные - только структурные каузальные модели, которые учат фундаментальным принципам взаимодействия табличных признаков.

Как это тестировали

На бенчмарке TabArena (51 датасет, 38 задач классификации и 13 регрессии) TabFM уже догоняет и превосходит heavily tuned модели. Но Google честно предупреждает: TabFM вряд ли заменит гипероптимизированные продакшен-модели в каждом бизнес-сценарии.

«Настоящая ценность для небольших инженерных команд - скорость, - сказал Кунг. - Аналитики данных и бэкенд-разработчики могут мгновенно получить качественную базовую модель без выделенной команды дата-сайентистов, управляющей сложным жизненным циклом».

Ограничения

TabFM переворачивает экономику ML: обучение - ноль, но инференс становится дорогим. Модель должна обработать весь исторический датасет как контекст при каждом предсказании. Если вашему API нужен ответ за миллисекунды - TabFM не подойдёт.

Другие ограничения: максимум 10 классов для классификации, до 500 признаков, ограниченная производительность на датасетах больше 100 000 строк. Код открыт под Apache 2.0, но веса модели - под некоммерческой лицензией. Для коммерческого использования Google предлагает интеграцию в BigQuery через AI.PREDICT.

Что это значит для бизнеса

TabFM - пример того, как AI-инструменты становятся доступными без специальной подготовки. Раньше, чтобы спрогнозировать отток клиентов или оценить риск сделки, нужен был дата-сайентист, недели на пайплайны и тысячи долларов бюджета. Теперь - один запрос.

Для компаний во Владивостоке и по всей России это значит, что внедрение нейросетей для бизнеса в аналитику становится проще. Не нужно нанимать дорогих специалистов - достаточно понять, какой вопрос вы хотите задать своим данным. А заодно пересмотреть, эффективно ли используются текущие вычислительные ресурсы.

Нейросети для бизнеса и аналитика

Мы помогаем компаниям во Владивостоке и по всей России внедрять AI-инструменты в бизнес-процессы. От аудита данных до полной автоматизации.

Получить бесплатный AI-аудит