#RAG

И инструменты ·21 авг 2026

RAG — решение проблемы, которой у большинства команд нет

Команды добавляют векторные БД и RAG при падении качества ответов, хотя реальная проблема — не в поиске информации, а в том, что модель не может выбрать из кучи релевантных документов действительно важный. RAG автоматизирует подачу того же мусора, не решая проблему приоритизации контекста.

0 91
И инструменты ·21 авг 2026

AWS показал, как снизить расходы на RAG в Amazon Bedrock на 70% через сжатие контекста

AWS выпустил паттерн для RAG-приложений на Bedrock: маленькая модель (Claude Haiku) фильтрует контекст после поиска, оставляя только релевантные куски для основной модели (Claude Sonnet). Это даёт до 70% экономии на входных токенах при сохранении качества ответов. Реализация — одна Lambda-функция, работает с Bedrock Knowledge Bases.

0 50
И инструменты ·19 авг 2026

AWS запустил фильтры доменов и дат для веб-поиска в Bedrock AgentCore — как контролировать источники AI-агентов

Amazon Bedrock AgentCore получил фильтрацию доменов и дат публикаций прямо в API-вызовах: теперь можно управлять источниками веб-поиска для AI-агентов на уровне каждого запроса. Плюс региональное развёртывание в Дублине и Токио для снижения задержек и соответствия требованиям локализации данных.

0 26
И инструменты ·12 авг 2026

Эксперимент JudgeGPT в Пакистане: AI помог судьям разрешить на 6.3% больше дел без потери качества

В Пакистане провели масштабный эксперимент с AI-инструментом для судей: 1559 судей использовали JudgeGPT (GPT-4 + база из 130 тысяч местных судебных решений). Результат: число разрешённых дел выросло на 6.3%, жалобы на решения снизились, а качество не упало. Ключ к успеху — обучение судей работе с AI (без него инструмент забрасывали через месяц).

0 80
И исследования ·10 авг 2026

Synthetic Query Probing: как сравнивать эмбеддинг-модели и ставить пороги схожести

Исследователи предложили метод Synthetic Query Probing для сравнения разных эмбеддинг-моделей (например, OpenAI ADA vs AWS Titan). Вместо сравнения эмбеддингов напрямую (невозможно) они сравнивают пространства схожести — similarity scores для пар контента. Выяснилось: Titan разных размерностей линейно связаны, а Titan vs ADA — нелинейно, с разными диапазонами. Это помогает подбирать пороги для RAG и понимать, как модели ведут себя относительно друг друга.

0 58
И инструменты ·2 авг 2026

Почему смена AI-модели не помогает: дело в контексте, а не в GPT vs Claude

Переключение между GPT и Claude или апгрейд до новой версии редко улучшает результат. Проблема не в модели, а в том, какой контекст вы ей даёте. Три критичных элемента: актуальные факты (которых нет в обучающих данных), конкретные примеры хорошего результата (не описания, а образцы) и напоминание о предыдущих правках. Частая ошибка — не дефицит контекста, а его избыток: 40 страниц текста мешают модели найти нужное.

0 125
И инструменты ·30 июл 2026

Не вырывайте из контекста: кормите LLM ровно тем, что ей нужно

Статья о контекст-инжиниринге — новой дисциплине, которая пришла на смену промпт-инжинирингу. Автор объясняет, почему важно наполнять контекстное окно LLM правильной информацией: слишком мало данных ведёт к галлюцинациям, слишком много — к росту затрат, латентности и падению качества.

0 132
И исследования ·31 июл 2026

Разработчик собрал AI-агента на базе месопотамских предсказаний — и показал главную проблему автономных систем

Исследователь создал House of IFs — AI-агента, который предсказывает будущее по новостям, используя логику древних месопотамских предзнаменований (ЕСЛИ странный знак → ТО результат). Проект показывает, как AI-агенты выдают убедительные паттерны из случайных данных и постоянно искажают факты, даже имея точные источники.

0 120
И инструменты ·1 авг 2026

Text-to-SQL с RAG: как построить чатбота для общения с базой данных

Автор делится опытом создания RAG-системы для работы со структурированными данными в реляционных БД. В отличие от типичных примеров RAG с PDF и документами, здесь используется техника text-to-SQL: пользователь задаёт вопрос на естественном языке, система конвертирует его в SQL-запрос. Главная проблема первой версии — бот всегда давал ответ, даже когда не был уверен в его правильности.

0 105
И инструменты ·27 июл 2026

AWS показала, как сжать сотни документов для AI без потери смысла

Amazon представила технику task-aware knowledge compression (TAKC) — альтернативу классическому RAG для работы с сотнями документов одновременно. Вместо поиска похожих фрагментов система сжимает весь массив знаний в 8-64 раза под конкретную задачу, сохраняя связи между документами. Результат: финансовый аналитик может спросить про риски с учётом контрактов поставщиков и судебных дел — AI видит всю картину, а не топ-5 кусков текста.

0 133
И инструменты ·30 июл 2026

Оркестрация и память: управление контекстом для долгоживущих агентов

Статья разбирает системную архитектуру для AI-агентов, которые работают часами и днями, а не минутами. Основная проблема: история взаимодействия быстро перерастает контекстное окно модели, что ведёт к деградации качества, росту затрат и в итоге к отказу. Автор предлагает разделить память агента на типы (рабочая, эпизодическая, семантическая, процедурная) и использовать стратегии управления контекстом — от простого скользящего окна до иерархических сжатий и retrieval-подхода.

0 111
И исследования ·1 авг 2026

Когда ссылки создают иллюзию надёжности: слабые места RAG-систем

Исследование показало, что пользователи больше доверяют ответам языковых моделей при наличии цитат — даже если те подобраны случайно. Статья разбирает, почему retrieval-augmented generation (RAG) может создавать видимость обоснованности, не гарантируя точности: от проблем с релевантностью источников до игнорирования моделью найденных данных.

0 74
И инструменты ·25 июл 2026

Что может AI-агент на ноутбучной видеокарте с 4 ГБ: эксперимент с Qwen на RTX 3050 Ti

Разработчик AI-воркспейса Bike4Mind показал, как работает полноценный локальный AI-агент (с инструментами, RAG, генерацией артефактов и мультимодальностью) на ноутбучной RTX 3050 Ti с 4 ГБ видеопамяти. Qwen3.5:2b выдаёт 96 токенов/сек и умещается в память с запасом, но для генерации кода приходится переключаться на специализированную модель, а эмбеддер и чат-модель не помещаются одновременно. Главный вывод: 4 ГБ хватает для полноценной работы, но с компромиссами в выборе моделей.

0 118
И инструменты ·24 июл 2026

Почему в медицине нельзя заменить RAG длинным контекстом

Автор разбирает популярный тезис «RAG мёртв, долой векторные базы, длинный контекст решает всё» и показывает, почему он не работает в медицинских AI-системах. Клинические тексты полны семантически похожих, но критически разных данных (симптомы, диагнозы), а регуляторные требования (HIPAA, контроль доступа на уровне пациентов) делают «просто засунуть всё в промпт» юридически невозможным.

0 122
И инструменты ·27 июл 2026

Fine-Tuning vs RAG vs Prompting: как выбрать правильный подход

Статья предлагает практическую систему выбора между prompt-инжинирингом, RAG и дообучением LLM-моделей. Автор объясняет, что дообучение меняет поведение модели, RAG — расширяет доступные факты, а промптинг управляет обоими подходами. Главный тезис: fine-tuning — это про форму, а не факты.

0 104
И инструменты ·29 июл 2026

Как создавать эмбеддинги бесплатно и навсегда

Автор объясняет, почему облачные API для эмбеддингов (OpenAI, Cohere, Google) никогда не будут бесплатными в масштабе, и предлагает альтернативу: запуск open-source моделей на собственном железе. Приводит конкретные модели, код для быстрого старта и варианты самостоятельного хостинга векторных баз.

0 87
И инструменты ·25 июл 2026

Marker 2 обошёл MinerU по точности и скорости в 5 раз — новый стандарт конвертации документов?

Datalab выпустила Marker 2 — полностью переписанный open-source конвертер PDF/DOCX/изображений в markdown. На бенчмарке olmOCR он набрал 76% точности против 72.7% у MinerU, при этом обрабатывая документы в 5 раз быстрее (2.9 страниц/сек на B200 GPU). Три режима работы: balanced для максимальной точности на GPU, fast для баланса цены-качества и disable_ocr — чистый CPU без нейросетей.

0 102
И исследования ·31 июл 2026

Таксономия ошибок в системах ответов на вопросы с опорой на источники

Статья разбирает, почему оценка RAG-систем не может быть бинарной («работает/не работает»). Авторы предлагают детальную таксономию сбоев на всех этапах: от полноты корпуса источников и качества чанкинга до корректности извлечения, синтеза ответа и атрибуции цитат.

0 65
И инструменты ·21 июл 2026

BGE-M3: модель эмбеддингов, объединяющая плотный, разреженный и мульти-векторный поиск

BGE-M3 от команды BAAI — это embedding-модель, которая впервые поддерживает три парадигмы поиска (dense, sparse и multi-vector retrieval) в одной модели. Раньше для гибридного поиска в RAG-системах приходилось разворачивать несколько моделей, что усложняло инфраструктуру. BGE-M3 упрощает архитектуру, сохраняя качество и гибкость.

0 129
И инструменты ·25 июл 2026

Эмбеддинги и векторные базы данных: архитектура и компромиссы

Статья разбирает техническую архитектуру RAG-систем на уровне эмбеддингов и векторных баз данных. Автор объясняет, как превратить демо-прототип в production-ready решение, которое работает быстро и не съедает весь бюджет на инфраструктуру.

0 95
И инструменты ·24 июл 2026

Выбор RAG-фреймворка под задачу, а не по инерции: разбор альтернатив LangChain

Автор делится опытом аварийного отказа системы на LangChain из-за транзитивных зависимостей и непрозрачности абстракций. Главная мысль: не бывает «одного фреймворка для всего» — выбирать нужно под конкретную нагрузку, а не по популярности.

0 108
И инструменты ·23 июл 2026

Парсинг реальных PDF для AI: Путеводитель по грязным 80% данных

Автор делится практическим опытом извлечения структурированных данных из беспорядочных PDF-документов для AI-систем. Главная мысль: чистые данные — миф, и большая часть работы в AI-проектах тратится не на модели, а на борьбу с документами, где нет явной структуры.

0 115
И инструменты ·23 июл 2026

Ваша векторная база — не продукт. Продукт — стратегия извлечения данных

Автор показывает, что успех RAG-систем определяется не выбором векторной базы данных, а продуманной стратегией извлечения информации. Простой поиск top-K по эмбеддингам работает, но редко впечатляет пользователей.

0 112
И инструменты ·2 авг 2026

Проблема вашего RAG не в векторной базе. Она в том, что вы решили до неё

Автор год строил retrieval-систему для AI-агентов и обнаружил, что качество определяют не выбор векторной БД или эмбеддинг-модели, а ранние архитектурные решения: размер чанков, способ извлечения данных, последовательность выбора компонентов. Многие из этих решений принимаются «по умолчанию» из туториалов и оказываются неоптимальными.

0 36
М модели ·26 июл 2026

Стоит ли дообучать LLM в 2025 году?

В 2023 году кастомные дообученные модели (fine-tuning) показывали впечатляющие результаты в специализированных задачах. Но к 2025-му общие модели (GPT-4, Claude и др.) догнали и опередили их благодаря огромным контекстным окнам, reasoning-способностям и технологиям вроде RAG. Автор разбирает, когда дообучение всё ещё имеет смысл, а когда — пустая трата времени.

0 75
И инструменты ·4 авг 2026

Pixel-Native RAG: как индексировать документы через скриншоты вместо текста

Туториал по построению RAG-системы, которая работает не с текстом, а с изображениями страниц. Рендерит веб-страницы и PDF в картинки, нарезает на тайлы, создаёт векторные эмбеддинги через SigLIP/CLIP/Qwen3-VL, хранит в FAISS и комбинирует с OCR+BM25 для гибридного поиска. Код на Python с FastAPI, обучением адаптера и опциональной генерацией ответов через VLM.

0 22
И инструменты ·3 авг 2026

Google OKF против обычного RAG: разработчик сравнил на 60 документах — оба провалились

Разработчик протестировал новый формат Google OKF (структурированные markdown-файлы со связями) против классического vector RAG на одних данных. RAG ответил верно на 2 из 7 вопросов, OKF — на 3, гибрид — на 4. Главная проблема: векторный поиск топит свежие короткие документы под устаревшими длинными (актуальный спек на 500 символов проиграл deprecated-доку на 4000), а OKF бессилен против длиннохвостых запросов по тикетам.

0 20
И инструменты ·26 июл 2026

Когда RAG — не лучший выбор: урок из базы знаний на 9 чанков

Разработчик построил WhatsApp-ассистента для небольшого бизнеса по домашней кухне, используя стандартную RAG-архитектуру (векторный поиск по эмбеддингам). Оказалось, что для базы знаний всего из 9 чанков RAG добавляет точку отказа без реальной пользы — проще и надёжнее передавать весь документ целиком в промпт.

0 72
Б безопасность ·22 июл 2026

Проблемы LLM и агентного ИИ в кибербезопасности: когда решение само становится проблемой

Статья рассматривает фундаментальные ограничения современных больших языковых моделей при работе с огромными объёмами данных в кибербезопасности. Автор систематизирует технические проблемы: ограниченное контекстное окно, растущую вычислительную сложность, фрагментацию данных и проблемы извлечения релевантной информации — которые мешают LLM эффективно анализировать инциденты безопасности.

0 87
И исследования ·29 июл 2026

ISNAD: система проверки достоверности для AI-агентов по принципам исламских учёных XII века

Исследователь адаптировал исламскую методологию проверки хадисов (isnād) для верификации данных в мультиагентных AI-системах. Вместо проверки только агента проверяется вся цепочка передачи информации — от источника до итогового ответа. Код и paper опубликованы.

0 41
И инструменты ·21 июл 2026

71% ошибок RAG-системы оказались не галлюцинациями, а проблемой календаря

Автор построил RAG-систему для анализа финансовых отчётов SEC и обнаружил, что большинство ошибок (71%) — это не галлюцинации, а неправильная привязка чисел к фискальным периодам. Модель находила верные данные, но путала, к какому году они относятся, когда в контексте были цифры за несколько лет подряд.

0 58
И инструменты ·22 июл 2026

Я создал 5 генеративных AI-ботов за 30 дней: что сломалось в продакшене

Автор за месяц запустил пять разных AI-ботов (от поддержки до голосовых FAQ) на одном стеке (Dialogflow CX, Vertex AI, RAG). Каждый бот ломался по-своему: галлюцинации создавали несуществующие политики возврата, контекст терялся, векторный поиск выдавал мусор. Статья — это отчёт о реальных проблемах в продакшене и конкретных решениях.

0 44
И инструменты ·27 июл 2026

Почему оценки релевантности не спасают RAG от галлюцинаций

Автор построил локальную RAG-систему на румынском языке для ответов на вопросы о таможенных процедурах и протестировал распространённое допущение: что высокий скор релевантности при retrieval гарантирует точность ответа. Эксперимент показал, что это допущение не работает на практике, и потребовался другой механизм контроля.

0 20