Pixel-Native RAG: как индексировать документы через скриншоты вместо текста
Туториал по построению RAG-системы, которая работает не с текстом, а с изображениями страниц. Рендерит веб-страницы и PDF в картинки, нарезает на тайлы, создаёт векторные эмбеддинги через SigLIP/CLIP/Qwen3-VL, хранит в FAISS и комбинирует с OCR+BM25 для гибридного поиска. Код на Python с FastAPI, обучением адаптера и опциональной генерацией ответов через VLM.
Показывает, как обойти ограничения текстового парсинга и индексировать любые документы через единый визуальный pipeline — актуально для корпоративного поиска, legal tech, архивов.
Что произошло
Опубликован детальный технический гайд по сборке RAG-пайплайна, который работает напрямую с пикселями вместо текстовых чанков. Система рендерит веб-страницы и PDF через Playwright в PNG, нарезает скриншоты на перекрывающиеся тайлы 1024×1024, генерирует мультимодальные эмбеддинги (SigLIP, CLIP или Qwen3-VL), складывает в FAISS-индекс и добавляет гибридный ретривал через OCR+BM25.
В комплекте идёт код на Python с FastAPI-эндпоинтом, обучением лёгкого адаптера через контрастное обучение, оценкой качества (Recall@k, MRR), визуализацией найденных тайлов и опциональной генерацией ответов через Qwen2.5-VL-3B. Авторы показывают установку зависимостей, работу с Playwright для скриншотов, дедупликацию через хэши, слияние результатов через reciprocal rank fusion и агрегацию доказательств на уровне документа.
Подход снимает боль с парсингом сложных layout'ов, PDF с таблицами и картинками, защищённых от копирования документов. Всё работает через единый визуальный pipeline без костылей под каждый формат.
Автор: Павел Заславский · Источник: marktechpost.com
Разработчикам. Готовый референс-код pixel-native RAG с FAISS, Playwright, OCR-гибридом и обучением адаптера. Можно взять за основу для проектов с PDF, скриншотами, визуальным поиском — особенно где классический парсинг не справляется.
Бизнесу. Открывает путь к индексации любых документов через скриншоты: PDF с таблицами, защищённые файлы, legacy-системы. Подходит для корпоративного поиска, compliance, work with visual data без дорогой разметки.
Инвесторам. Pixel-native подход решает проблему универсального доступа к данным в эру мультимодальных моделей. Растёт спрос на визуальный поиск в enterprise, EdTech, legal tech — технология уже рабочая, нужна упаковка в продукт.
- SaaS для корпоративного поиска по PDF, сканам, презентациям — без парсинга, только скриншоты и векторы
- Плагин для Notion/Obsidian: визуальный поиск по всем прикреплённым файлам и скриншотам
- API-сервис для legal tech: индексация контрактов, судебных документов с таблицами и печатями
- EdTech-инструмент: поиск по учебникам, конспектам, рукописным заметкам через единый визуальный индекс
- Форк под e-commerce: поиск товаров по скриншотам каталогов, инстаграм-постам, Pinterest
- Дороже классического текстового RAG: нужны GPU для эмбеддингов, больше места под изображения
- OCR-гибрид всё равно нужен для точного поиска — чисто визуальный поиск слабее на текстовых запросах
- Качество сильно зависит от разрешения, layout'а, шрифтов — на плохих сканах проиграет обычному OCR+парсингу
- Нет готового продукта, только туториал — нужна инженерная работа для production
Идея визуального RAG не нова, но здесь впервые собран полный рабочий код с гибридом OCR+векторы, обучением адаптера и FastAPI из коробки. Это не серебряная пуля — на чистом тексте классический chunking быстрее и дешевле. Но если работаешь с PDF-архивами, сканами контрактов, медкартами или защищёнными документами, где парсинг — боль, pixel-native подход реально выстреливает.
На практике лучше всего работает гибрид: основной поиск по тексту, визуальный fallback для сложных кейсов. Код годный для прототипа, но в проде нужно допиливать кэширование, масштабирование FAISS, мониторинг качества. Для стартапа в legal/compliance/archive-поиске это готовый MVP на пару недель работы. Для корпораций — способ разблокировать терабайты legacy-документов без армии разметчиков.
Комментарии