Google OKF против обычного RAG: разработчик сравнил на 60 документах — оба провалились
Разработчик протестировал новый формат Google OKF (структурированные markdown-файлы со связями) против классического vector RAG на одних данных. RAG ответил верно на 2 из 7 вопросов, OKF — на 3, гибрид — на 4. Главная проблема: векторный поиск топит свежие короткие документы под устаревшими длинными (актуальный спек на 500 символов проиграл deprecated-доку на 4000), а OKF бессилен против длиннохвостых запросов по тикетам.
Это первый публичный бенчмарк OKF против классического RAG на реальных корпоративных данных — показывает, что хайп вокруг новых форматов не решает фундаментальных проблем: bias к длинным документам, композитные вопросы, silent hallucination.
Что произошло
Google 12 июня выпустил OKF (Open Knowledge Format) — стандарт для хранения знаний в виде связанных markdown-файлов с метаданными. Один концепт — один файл, с ссылками друг на друга и индексом для навигации.
Разработчик JoaquinRuiz решил проверить, решает ли OKF реальные проблемы RAG. Создал корпус из 60 реалистичных документов компании (вики, схемы таблиц, ADR, 40 тикетов поддержки) — 85 чанков по 800/100 токенов. Отдельно вручную собрал OKF-версию — 9 кураторских концептов на те же темы. Задал 7 вопросов, каждый рассчитан на типичный провал поиска.
Результаты: - Классический RAG: 2 верных ответа из 7, 6341 токен - Только OKF: 3/7, 8625 токенов - OKF + RAG: 4/7, 8435 токенов
Самый показательный кейс: вопрос «как мы считаем выручку?». В корпусе два документа: устаревший 2023 года (4000 символов, разбит на 7 чанков) и актуальный 2026-го (500 символов, 1 чанк). Три из топ-5 результатов — из старого документа. Правильный оказался на 15-м месте из 85 — позади глоссария, схемы таблицы клиентов и тикета про доставку на Канары. Поднятие k до 15 не помогает: 6 кусков с неправильным ответом против одного верного. Reranker тут бессилен — в тексте чанка нет даты, невозможно понять, что устарело.
Другие провалы: - Разбивка таблицы: чанкер порезал 18-колоночную схему. Файл попал в контекст, таблица — нет. Модель ответила «не знаю» при k=3 и k=5. - Композитная логика: определение метрики требует 3 правила из 3 файлов. RAG достал 2 из 3 и уверенно соврал, сославшись на источники.
Где OKF проиграл: длиннохвостые запросы. Вопрос «был ли инцидент с дубликатами заказов в марте?» — RAG нашёл среди 40 сырых тикетов, OKF завалил (кураторить вручную каждый тикет абсурдно).
Весь код, корпус и результаты — на GitHub, можно воспроизвести локально на Ollama.
Автор: Юлия Тарасова · Источник: reddit.com
Разработчикам. OKF даёт структурированную навигацию по знаниям вместо слепого vector search — полезно для стабильных концептов (архитектурные доки, API-спеки), но требует ручной кураторской работы. Гибридная схема (OKF для стабильной базы + vector RAG для сырых данных) показала лучший результат. Проблема chunking и ранжирования по устаревшим длинным документам остаётся критической — дата и версия должны попадать в метаданные чанка.
Бизнесу. Внедрение RAG на реальных корпоративных доках требует гибридной архитектуры: структурированные знания (политики, процессы) в OKF, операционные данные (тикеты, логи) в vector. Чистый RAG выдаёт устаревшую информацию и тихо врёт при неполном контексте — это риск для продуктовых и юридических решений. Инвестиции в кураторство базы знаний окупаются точностью ответов.
Инвесторам. OKF — попытка Google стандартизировать structured retrieval для LLM, но adoption будет медленным: требует ручной работы. Гибридные RAG-системы (vector + structured) — растущая ниша для B2B-инструментов. Проблема hallucination при композитных вопросах и outdated content остаётся болью рынка — решения типа reranking с temporal awareness или automatic versioning могут выстрелить.
- Платформа для автоматической конвертации корпоративных доков в OKF-формат с версионированием и связями — экономит кураторские часы
- Reranker с поддержкой temporal metadata: приоритизирует свежие документы, даже если они короче и менее релевантны по embeddings
- Гибридный RAG-as-a-Service: автоматом маршрутизирует запросы либо в OKF-индекс (стабильные знания), либо в vector search (операционные данные)
- Инструмент для детектирования композитных вопросов — подсказывает модели, когда нужно искать несколько источников и комбинировать
- Консалтинг по аудиту корпоративных RAG-систем: выявление outdated content bias и кастомизация chunking под специфику доков компании
- OKF требует постоянной ручной кураторской работы — неприменим для компаний без dedicated knowledge management team
- Даже гибрид OKF+RAG не дотянул до 60% точности — технология ещё сырая для критических бизнес-кейсов (compliance, медицина, финансы)
- Проблема silent hallucination (модель уверенно врёт, ссылаясь на источники) не решена ни одним подходом — риск юридических и репутационных потерь
- Локальная инфраструктура (Ollama + ChromaDB) может не масштабироваться на корпоративные объёмы — cloud-зависимость остаётся
Это редкий материал — не промо Google, а жёсткий практический тест с открытым кодом. Автор показал, что OKF решает узкую задачу (навигация по стабильным концептам), но не универсален. Гибрид лучше, но 57% точности — это провал для продакшена.
Главное открытие: vector RAG систематически ранжирует длинные тексты выше коротких, игнорируя актуальность. Это не баг конкретной библиотеки, а фича embeddings — они меряют семантическую близость, а не релевантность по времени или приоритету. Индустрия говорит про мультимодальность и reasoning, но пилит костыли поверх сломанного фундамента. Кто первым запилит temporal-aware reranker с автоматическим детектом deprecated контента — заработает на консалтинге enterprise-клиентам.
Инструменты из статьи
Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...
Доступ из РФ →
Комментарии