инструменты 2 мин

Marker 2 обошёл MinerU по точности и скорости в 5 раз — новый стандарт конвертации документов?

Datalab выпустила Marker 2 — полностью переписанный open-source конвертер PDF/DOCX/изображений в markdown. На бенчмарке olmOCR он набрал 76% точности против 72.7% у MinerU, при этом обрабатывая документы в 5 раз быстрее (2.9 страниц/сек на B200 GPU). Три режима работы: balanced для максимальной точности на GPU, fast для баланса цены-качества и disable_ocr — чистый CPU без нейросетей.

Конвертация документов — критичная часть RAG-пайплайнов и data-инфраструктуры. Marker 2 предлагает open-source решение, которое одновременно точнее и в разы быстрее главных конкурентов — редкая комбинация, которая может изменить стандарты индустрии.

Marker 2: новое поколение document parsing

Datalab представила Marker 2 — полную перезагрузку своего open-source конвертера документов. Инструмент превращает PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB в markdown, JSON, HTML или чанки для RAG-систем. Под капотом — три компонента: Surya OCR 2, 20M-параметровая модель разметки и переписанный pdftext (в 3 раза быстрее прежнего).

Бенчмарк: точность + скорость

На olmOCR-bench от Allen AI (1403 PDF с ~8400 тестами) Marker 2 в режиме balanced набрал 76.0% общей точности и 83.5% на born-digital документах. При этом обрабатывает 2.9 страницы/сек на одном B200 GPU.

Для сравнения: - MinerU (pipeline backend): 72.7% точности при 0.54 стр/сек — в 5.4 раза медленнее - Docling: 50.3% при 2.1 стр/сек — проигрывает и по точности, и немного по скорости - LiteParse: 22.4% точности, но 1721 стр/сек в режиме без OCR — полная противоположность

Три режима для разных задач

Balanced (76.0%) — полный VLM для разметки, полный re-OCR при плохом текстовом слое. Требует GPU, максимальное качество.

Fast (66.6%) — лёгкий детектор разметки + pdftext, минимальное использование VLM. Дешевле, 7.4 стр/сек — в 13.7 раз быстрее MinerU, но теряет 6 процентных пунктов.

--disable_ocr (43.6%) — только текстовый слой, никаких нейросетей. Работает на CPU, 23.7 стр/сек.

Архитектурный прорыв

Ключевое изменение — многопоточность: множество тонких CPU-воркеров делят один inference-сервер Surya. Родительский процесс распределяет VLM-запросы, поэтому пропускная способность масштабируется с мощностью сервера, а не с VRAM на процесс.

Полноценная CPU-поддержка — второе крупное изменение. Режимы fast и disable_ocr не требуют GPU вообще, а 20M-модель читает колонки, таблицы и заголовки даже на процессоре.

Breaking changes

Требуется Python 3.10+. Упаковка мигрировала с Poetry на uv (build backend — hatchling), но pip install marker-pdf работает как прежде. Удалены структурированная экстракция и extractors — теперь через hosted API или --use_llm.

Контекст: не VLM, а pipeline

Datalab подчёркивает: Marker — это pipeline, а не full-page VLM. Их собственный Chandra 2 набирает 85.8%, Gemini Flash 3.5 — 76.4%. Marker балансирует между чистыми VLM (дороже, медленнее) и примитивным парсингом (быстрее, но теряет структуру).

Важная оговорка: все цифры — из собственных прогонов Datalab, хотя бенчмарк olmOCR третий сторонний (Allen AI). Харнесс открыт в репозитории Marker вместе с раннерами для конкурентов — можно воспроизвести самим.

Ключевые выводы

  • Marker 2 в 5.4 раза быстрее MinerU при более высокой точности (76.0% vs 72.7%) — редкий случай, когда скорость растёт вместе с качеством
  • Три режима (balanced/fast/disable_ocr) покрывают спектр от "максимум качества на GPU" до "чистый CPU без нейросетей" — универсальность для разных бюджетов
  • Архитектурный прорыв — многопоточность с shared inference server: пропускная способность масштабируется с сервером, а не с VRAM на воркер
  • Все цифры из собственных прогонов Datalab, хотя бенчмарк сторонний — критически важно тестировать на своих документах, результаты могут отличаться
  • Marker позиционируется как pipeline между примитивным парсингом и дорогими full-page VLM — трейдофф между ценой и качеством
document-parsingOCRPDF-conversionRAGopen-source

Автор: Павел Заславский · Источник: marktechpost.com

Мнение редакции

Обычно в ML приходится выбирать: либо быстро, либо точно. Marker 2 ломает этот стереотип — он и быстрее, и точнее главного конкурента MinerU. Звучит слишком хорошо? Есть нюанс: все цифры — из собственных тестов Datalab, хотя бенчмарк olmOCR сторонний от Allen AI. Они хотя бы открыли харнесс с раннерами для конкурентов, так что можно проверить самим.

Что реально круто — три режима для разных задач. Нужно максимум качества на GPU? Balanced даёт 76%. Бюджет ограничен? Fast работает на CPU и всё равно читает структуру (66.6%). Вообще без нейросетей? Disable_ocr — чистый текстовый слой, 23 страницы в секунду. Docling выигрывает в governance (MIT-лицензия, IBM Research, Linux Foundation), но по точности проигрывает на 25 процентных пунктов. Если вам нужен инструмент для продакшена — прогоните Marker 2 на своих документах, только так поймёте, работает ли он для вашего случая.

Ещё по теме

Комментарии