Большая часть бизнес-данных живёт в таблицах: базы данных, CRM, финансовые отчёты. Чтобы построить надёжную модель на таких данных, обычно нужно обучить новую с нуля, подбирать гиперпараметры, проектировать признаки и бороться с дрейфом данных. Google Research предлагает обойти всё это - TabFM, фундаментальная модель, которая обрабатывает таблицы как задачу обучения в контексте.
Одним проходом: даёте модельку свои данные - получаете прогноз. Никаких недель пайплайнов. Один API-вызов. Для бизнеса это означает: прогнозирование оттока, оценка рисков, анализ продаж - без команды дата-сайентистов.
Как это работает: Вы не обновляете веса модели. Вы берёте свои исторические примеры (строки с известными значениями) и целевые строки (то, что хотите спрогнозировать) и передаёте их модели как единый промпт. Модель сама разбирается, как связаны колонки и строки.
Почему LLM не справляются с таблицами
Казалось бы, если большие языковые модели так хороши в обучении в контексте, почему бы просто не скормить им таблицу? Проблема в трёх вещах. Во-первых, контекст заканчивается быстро - средняя таблица на пару тысяч строк и сотню колонок уже не влезает. Во-вторых, токенизация ломает числа: LLM разбивает числовые значения на токены, теряя математическую точность. В-третьих, структурная слепота: когда двумерную таблицу превращают в одномерную строку, модель теряет, какое значение к какой строке и колонке относится.
Вейхао Кунг, исследователь Google Research, объяснил VentureBeat: «Сейчас гораздо эффективнее попросить LLM написать код, который подготовит признаки и вызовет XGBoost, чем просить LLM читать саму таблицу».
Как устроен TabFM
TabFM обходит эти ограничения, обрабатывая данные как сетку (грид), сохраняя их структурную целостность. Модель объединяет лучшее из двух предшественников: TabPFN (глубокая контекстуализация признаков) и TabICL (сжатие строк).
Архитектура основана на трёх механизмах:
- Чередование внимания по строкам и колонкам: Сырая таблица проходит через многослойный модуль внимания, который чередует колонки (признаки) и строки (примеры). Модель сама находит сложные взаимодействия признаков, которые обычно требуют ручного проектирования.
- Сжатие строк: После контекстуализации информация по каждой строке сжимается в один плотный вектор. Это резко уменьшает вычислительную нагрузку.
- Обучение в контексте: Каузальный Transformer обрабатывает последовательность сжатых эмбеддингов, работая с таблицей как с контекстом.
Модель обучали на сотнях миллионов синтетических датасетов. Она никогда не видела реальные конфиденциальные данные - только структурные каузальные модели, которые учат фундаментальным принципам взаимодействия табличных признаков.
Как это тестировали
На бенчмарке TabArena (51 датасет, 38 задач классификации и 13 регрессии) TabFM уже догоняет и превосходит heavily tuned модели. Но Google честно предупреждает: TabFM вряд ли заменит гипероптимизированные продакшен-модели в каждом бизнес-сценарии.
«Настоящая ценность для небольших инженерных команд - скорость, - сказал Кунг. - Аналитики данных и бэкенд-разработчики могут мгновенно получить качественную базовую модель без выделенной команды дата-сайентистов, управляющей сложным жизненным циклом».
Ограничения
TabFM переворачивает экономику ML: обучение - ноль, но инференс становится дорогим. Модель должна обработать весь исторический датасет как контекст при каждом предсказании. Если вашему API нужен ответ за миллисекунды - TabFM не подойдёт.
Другие ограничения: максимум 10 классов для классификации, до 500 признаков, ограниченная производительность на датасетах больше 100 000 строк. Код открыт под Apache 2.0, но веса модели - под некоммерческой лицензией. Для коммерческого использования Google предлагает интеграцию в BigQuery через AI.PREDICT.
Что это значит для бизнеса
TabFM - пример того, как AI-инструменты становятся доступными без специальной подготовки. Раньше, чтобы спрогнозировать отток клиентов или оценить риск сделки, нужен был дата-сайентист, недели на пайплайны и тысячи долларов бюджета. Теперь - один запрос.
Для компаний во Владивостоке и по всей России это значит, что внедрение нейросетей для бизнеса в аналитику становится проще. Не нужно нанимать дорогих специалистов - достаточно понять, какой вопрос вы хотите задать своим данным. А заодно пересмотреть, эффективно ли используются текущие вычислительные ресурсы.
Читайте также
Нейросети для бизнеса и аналитика
Мы помогаем компаниям во Владивостоке и по всей России внедрять AI-инструменты в бизнес-процессы. От аудита данных до полной автоматизации.
Получить бесплатный AI-аудит