Могут ли LLM-модели выбраться из лабиринта? Эксперимент с пространственным мышлением
Энтузиаст создал бенчмарк для проверки пространственного мышления языковых моделей: лабиринт, где ИИ должен найти ключ и выйти через дверь, используя набор команд движения. GPT-4o mini и GLM-4 ходили кругами, K2.6 справился, но потратил 9 млн токенов на решение простой задачи.
Эксперимент вскрывает критическое ограничение современных LLM: они плохо справляются с задачами, требующими пространственного мышления и последовательной памяти о действиях. Это важно для понимания границ применимости языковых моделей в реальных сценариях — от робототехники до виртуальных ассистентов.
Эксперимент с лабиринтом для LLM
Энтузиаст из Reddit решил проверить, насколько языковые модели способны к пространственной ориентации. Для этого он создал простой бенчмарк: лабиринт, где модель должна найти ключ, открыть дверь и выбраться к выходу.
Условия задачи
Модели получили набор инструментов: движение вперёд/назад на N шагов, повороты на 45°, 90° или 180° влево/вправо, возможность открыть дверь и поднять предмет. После каждого действия система описывала окружение текстом: «Впереди стена», «Слева проход» и т.д. Цветные плитки служили ориентирами, белая отмечала старт.
Результаты
GPT-4o mini и GLM-4 не смогли решить задачу — модели ходили кругами и путались. GLM-4 даже забыл о возможности поворота на 45° до 730-го хода, потратив суммарно 62 млн токенов на попытки.
K2.6 справился с задачей, но использовал 9 млн токенов — впечатляющий расход для относительно простой навигационной задачи. Максимальный контекст составил 11K токенов для K2.6 и 20K для GLM-4.
Выводы
Эксперимент показал, что современные языковые модели плохо справляются с задачами, требующими пространственного мышления и памяти о предыдущих действиях. Даже успешное решение требует непропорционально больших вычислительных ресурсов. Это указывает на фундаментальную слабость текущей архитектуры LLM в задачах, выходящих за рамки обработки языка.
Ключевые выводы
- Большинство современных LLM демонстрируют крайне слабую пространственную ориентацию даже в простых лабиринтах
- Модели забывают о доступных инструментах и застревают в циклических паттернах поведения
- Даже успешное решение простой навигационной задачи требует миллионы токенов — на порядки больше, чем нужно человеку
- Цветные ориентиры и явное описание доступных направлений не сильно помогают моделям
- Бенчмарк выявляет не только пространственное мышление, но и эффективность использования инструментов
Автор: Ксения Лаврова · Источник: reddit.com
**Это простой, но честный тест**, который показывает реальные ограничения LLM за рамками текстовых задач. Модели, которые пишут код и сочиняют эссе, в элементарном лабиринте ведут себя как потерянные туристы без компаса.
Особенно показательно, что даже «успешная» модель спалила 9 миллионов токенов — это как если бы вы спросили дорогу у человека, а он час рассказывал вам историю города, прежде чем указать направление. Пространственное мышление и последовательная память — это не та область, где текущие LLM сильны. Хорошая новость: теперь есть простой способ это проверить.
Комментарии