Тест: длинный контекст не значит хорошая память. Модель теряет середину
Закинул в 200к контекста и наивно ждал, что модель помнит всё. Провёл тест «иголка в стоге» по позициям.
Начало и конец достаёт отлично, середину стабильно проваливает. Классический lost-in-the-middle никуда не делся.
Вывод: важное кладу в начало и в конец, а не полагаюсь на то, что длинное окно = идеальная память.
Комментарии