инструменты 1 мин

Jumio построила feature store на AWS с задержкой менее 100 мс — как они это сделали

Jumio решила проблемы ML-инфраструктуры, создав на AWS real-time feature store с задержкой <100 мс для фрод-детекта. Архитектура на базе Kinesis, Flink и SageMaker Feature Store устранила дублирование данных, ручное развёртывание и несогласованность признаков между обучением и инференсом.

Если ваши ML-модели работают в проде и вы устали от ручного переноса признаков из обучения в инференс, пора задуматься о feature store. Jumio показала, что это не хайп, а необходимость для бизнеса, где скорость и точность моделей напрямую влияют на выручку.

Что произошло

Jumio — сервис верификации личности — опубликовала кейс, как собрала real-time feature store на AWS, способное отдавать признаки моделям быстрее 100 мс. Раньше фичи дублировались в разных командах, из обучения в прод переносились вручную на Java/Python (риск багов), а некоторые события приходили с задержкой в недели.

Архитектура построена на Kinesis Data Streams → Managed Apache Flink → SageMaker Feature Store с in-memory кэшем на ElastiCache (Valkey) для горячих данных и стандартным хранением для холодных. Параллельно идёт батч-пайплайн: Firehose → S3 → EMR → Iceberg-таблицы для офлайн-обучения.

Развернули в трёх регионах (us-east-1, eu-central-1, ap-southeast-1). Результат: централизованное управление фичами, согласованность между обучением и инференсом, гибкое добавление новых признаков без простоев, субсотня миллисекунд на отдачу.

feature storereal-time MLAWSфрод детектML инфраструктура

Автор: Юлия Тарасова · Источник: aws.amazon.com

Разработчикам. Живой референс стрим-архитектуры для ML: Flink для фича-инжиниринга в реальном времени, ElastiCache как горячий кэш перед SageMaker Feature Store, S3 event → Lambda → EMR для батч-обновлений Iceberg. Если нужен feature store с sub-100ms latency — паттерн готов, можно взять и адаптировать.

Бизнесу. Централизованный feature store убрал дублирование данных и ручное развёртывание — значит меньше багов, быстрее запуск новых моделей. Для фрод-детекта время = деньги: чем быстрее модель получит свежие признаки, тем точнее остановит мошенника. Это не просто ускорение, а снижение потерь от фрода.

Инвесторам. ML-инфраструктура как конкурентное преимущество: кто быстрее развернёт модели в прод и обеспечит low-latency inference, тот выигрывает в fintech, kyc, fraud detection. AWS feature store вокруг SageMaker — растущий сегмент, Jumio показывает demand и blueprint. Инвестиции в ML Ops и real-time data платформы окупаются сокращением времени до маркета.

Хайп25
Реальная польза70
Заработать60
  • Собрать feature store as a service на базе этой архитектуры для команд ML, которым нужен быстрый старт без года разработки (готовый паттерн + Terraform)
  • Консалтинг по миграции фича-пайплайнов на стрим-инфру для банков и финтехов — там latency критична, а ручное управление признаками всё ещё норма
  • Инструмент для версионирования и тестирования фич в feature store перед продом — DevOps для ML-признаков
  • Managed Flink + SageMaker Feature Store интеграция с мониторингом out-of-the-box: готовое решение для тех, кто не хочет городить велосипед
  • Это кейс-стади от AWS — очевидный vendor lock-in на AWS-сервисы, переезд на другую платформу будет болезненным
  • Архитектура сложная: Kinesis, Flink, ElastiCache, SageMaker, S3, EMR, Lambda — много движущихся частей, нужна зрелая команда для поддержки
  • Стоимость инфры может неожиданно вырасти при масштабировании — ElastiCache, Kinesis, SageMaker Feature Store не самые дешёвые сервисы
  • Для многих задач sub-100ms latency — overkill. Если ваш случай не фрод-детект в реальном времени, такая сложность может не окупиться

Это один из самых подробных публичных кейсов по real-time feature store — AWS явно хочет показать, что SageMaker Feature Store не просто галочка в презентации, а рабочий инструмент. Jumio решила реальные боли: дублирование данных, ручной перенос фич в прод, несогласованность между обучением и инференсом. Архитектура красивая, но сложная — если у вас нет команды, способной управлять Kinesis + Flink + ElastiCache + SageMaker + EMR одновременно, лучше начать с упрощённой версии.

Что действительно ценно: они честно говорят про trade-offs (latency vs cost, hot vs cold data) и показывают monitoring-стратегию. Для финтеха, где задержка в 100 мс может стоить денег, это имеет смысл. Для всех остальных — подумайте дважды, прежде чем городить такой зоопарк. Feature store нужен, но не всем нужен настолько быстрый и сложный.

Ещё по теме

Комментарии