Jumio построила feature store на AWS с задержкой менее 100 мс — как они это сделали
Jumio решила проблемы ML-инфраструктуры, создав на AWS real-time feature store с задержкой <100 мс для фрод-детекта. Архитектура на базе Kinesis, Flink и SageMaker Feature Store устранила дублирование данных, ручное развёртывание и несогласованность признаков между обучением и инференсом.
Если ваши ML-модели работают в проде и вы устали от ручного переноса признаков из обучения в инференс, пора задуматься о feature store. Jumio показала, что это не хайп, а необходимость для бизнеса, где скорость и точность моделей напрямую влияют на выручку.
Что произошло
Jumio — сервис верификации личности — опубликовала кейс, как собрала real-time feature store на AWS, способное отдавать признаки моделям быстрее 100 мс. Раньше фичи дублировались в разных командах, из обучения в прод переносились вручную на Java/Python (риск багов), а некоторые события приходили с задержкой в недели.
Архитектура построена на Kinesis Data Streams → Managed Apache Flink → SageMaker Feature Store с in-memory кэшем на ElastiCache (Valkey) для горячих данных и стандартным хранением для холодных. Параллельно идёт батч-пайплайн: Firehose → S3 → EMR → Iceberg-таблицы для офлайн-обучения.
Развернули в трёх регионах (us-east-1, eu-central-1, ap-southeast-1). Результат: централизованное управление фичами, согласованность между обучением и инференсом, гибкое добавление новых признаков без простоев, субсотня миллисекунд на отдачу.
Автор: Юлия Тарасова · Источник: aws.amazon.com
Разработчикам. Живой референс стрим-архитектуры для ML: Flink для фича-инжиниринга в реальном времени, ElastiCache как горячий кэш перед SageMaker Feature Store, S3 event → Lambda → EMR для батч-обновлений Iceberg. Если нужен feature store с sub-100ms latency — паттерн готов, можно взять и адаптировать.
Бизнесу. Централизованный feature store убрал дублирование данных и ручное развёртывание — значит меньше багов, быстрее запуск новых моделей. Для фрод-детекта время = деньги: чем быстрее модель получит свежие признаки, тем точнее остановит мошенника. Это не просто ускорение, а снижение потерь от фрода.
Инвесторам. ML-инфраструктура как конкурентное преимущество: кто быстрее развернёт модели в прод и обеспечит low-latency inference, тот выигрывает в fintech, kyc, fraud detection. AWS feature store вокруг SageMaker — растущий сегмент, Jumio показывает demand и blueprint. Инвестиции в ML Ops и real-time data платформы окупаются сокращением времени до маркета.
- Собрать feature store as a service на базе этой архитектуры для команд ML, которым нужен быстрый старт без года разработки (готовый паттерн + Terraform)
- Консалтинг по миграции фича-пайплайнов на стрим-инфру для банков и финтехов — там latency критична, а ручное управление признаками всё ещё норма
- Инструмент для версионирования и тестирования фич в feature store перед продом — DevOps для ML-признаков
- Managed Flink + SageMaker Feature Store интеграция с мониторингом out-of-the-box: готовое решение для тех, кто не хочет городить велосипед
- Это кейс-стади от AWS — очевидный vendor lock-in на AWS-сервисы, переезд на другую платформу будет болезненным
- Архитектура сложная: Kinesis, Flink, ElastiCache, SageMaker, S3, EMR, Lambda — много движущихся частей, нужна зрелая команда для поддержки
- Стоимость инфры может неожиданно вырасти при масштабировании — ElastiCache, Kinesis, SageMaker Feature Store не самые дешёвые сервисы
- Для многих задач sub-100ms latency — overkill. Если ваш случай не фрод-детект в реальном времени, такая сложность может не окупиться
Это один из самых подробных публичных кейсов по real-time feature store — AWS явно хочет показать, что SageMaker Feature Store не просто галочка в презентации, а рабочий инструмент. Jumio решила реальные боли: дублирование данных, ручной перенос фич в прод, несогласованность между обучением и инференсом. Архитектура красивая, но сложная — если у вас нет команды, способной управлять Kinesis + Flink + ElastiCache + SageMaker + EMR одновременно, лучше начать с упрощённой версии.
Что действительно ценно: они честно говорят про trade-offs (latency vs cost, hot vs cold data) и показывают monitoring-стратегию. Для финтеха, где задержка в 100 мс может стоить денег, это имеет смысл. Для всех остальных — подумайте дважды, прежде чем городить такой зоопарк. Feature store нужен, но не всем нужен настолько быстрый и сложный.
Комментарии