исследования 1 мин

Могут ли LLM-модели выбраться из лабиринта? Эксперимент с пространственным мышлением

Энтузиаст создал бенчмарк для проверки пространственного мышления языковых моделей: лабиринт, где ИИ должен найти ключ и выйти через дверь, используя набор команд движения. GPT-4o mini и GLM-4 ходили кругами, K2.6 справился, но потратил 9 млн токенов на решение простой задачи.

Эксперимент вскрывает критическое ограничение современных LLM: они плохо справляются с задачами, требующими пространственного мышления и последовательной памяти о действиях. Это важно для понимания границ применимости языковых моделей в реальных сценариях — от робототехники до виртуальных ассистентов.

Эксперимент с лабиринтом для LLM

Энтузиаст из Reddit решил проверить, насколько языковые модели способны к пространственной ориентации. Для этого он создал простой бенчмарк: лабиринт, где модель должна найти ключ, открыть дверь и выбраться к выходу.

Условия задачи

Модели получили набор инструментов: движение вперёд/назад на N шагов, повороты на 45°, 90° или 180° влево/вправо, возможность открыть дверь и поднять предмет. После каждого действия система описывала окружение текстом: «Впереди стена», «Слева проход» и т.д. Цветные плитки служили ориентирами, белая отмечала старт.

Результаты

GPT-4o mini и GLM-4 не смогли решить задачу — модели ходили кругами и путались. GLM-4 даже забыл о возможности поворота на 45° до 730-го хода, потратив суммарно 62 млн токенов на попытки.

K2.6 справился с задачей, но использовал 9 млн токенов — впечатляющий расход для относительно простой навигационной задачи. Максимальный контекст составил 11K токенов для K2.6 и 20K для GLM-4.

Выводы

Эксперимент показал, что современные языковые модели плохо справляются с задачами, требующими пространственного мышления и памяти о предыдущих действиях. Даже успешное решение требует непропорционально больших вычислительных ресурсов. Это указывает на фундаментальную слабость текущей архитектуры LLM в задачах, выходящих за рамки обработки языка.

Ключевые выводы

  • Большинство современных LLM демонстрируют крайне слабую пространственную ориентацию даже в простых лабиринтах
  • Модели забывают о доступных инструментах и застревают в циклических паттернах поведения
  • Даже успешное решение простой навигационной задачи требует миллионы токенов — на порядки больше, чем нужно человеку
  • Цветные ориентиры и явное описание доступных направлений не сильно помогают моделям
  • Бенчмарк выявляет не только пространственное мышление, но и эффективность использования инструментов
бенчмаркипространственное мышлениеограничения LLMкогнитивные способноститестирование моделей

Автор: Ксения Лаврова · Источник: reddit.com

Мнение редакции

**Это простой, но честный тест**, который показывает реальные ограничения LLM за рамками текстовых задач. Модели, которые пишут код и сочиняют эссе, в элементарном лабиринте ведут себя как потерянные туристы без компаса.

Особенно показательно, что даже «успешная» модель спалила 9 миллионов токенов — это как если бы вы спросили дорогу у человека, а он час рассказывал вам историю города, прежде чем указать направление. Пространственное мышление и последовательная память — это не та область, где текущие LLM сильны. Хорошая новость: теперь есть простой способ это проверить.

Ещё по теме

Комментарии