исследования 1 мин

Base64 как проверка интеллекта: новый бенчмарк показал корреляцию 0.91 с рейтингом моделей

Разработчик создал Encode Bench — тест, где модели должны решить задачу и вернуть ответ в формате Base64. Неожиданно оказалось, что способность генерировать корректный Base64 коррелирует на 0.91 с Intelligence Index от Artificial Analysis. GPT-5.6 Sol лидирует с 97.2% успешных попыток, а самыми сложными оказались не логические задачи, а именно точное кодирование.

Если корреляция подтвердится, появится простой способ проверять надёжность моделей в задачах, требующих точности на каждом шаге. Важно для агентных систем, где одна ошибка ломает всю цепочку действий.

Случайная находка в мире бенчмарков

Разработчик создал Encode Bench — необычный тест для языковых моделей. Задача: решить проблему и вернуть ответ закодированным в Base64. Это формат, где данные превращаются в последовательность букв и цифр — одна неточность, и всё ломается.

Неожиданный результат: у восьми протестированных моделей способность генерировать корректный Base64 коррелирует с Intelligence Index на 0.91 (почти идеальная связь). С Agentic Index — вообще 0.94.

Что это проверяет

Чтобы пройти тест, модель должна: 1. Решить задачу 2. Сохранить ответ без искажений 3. Правильно закодировать 4. Выдать результат в строгом формате

Сбой на любом этапе = провал. Это может проверять надёжность цепочки рассуждений, а может просто отражать особенности токенизатора или обучающих данных.

Результаты

Бенчмарк включает 24 задачи (логика, арифметика, код, следование инструкциям), каждая запускается трижды — итого 72 попытки:

  • GPT-5.6 Sol: 97.2% (70/72)
  • Kimi K3: 87.5%
  • Claude Sonnet 5: 68.1%
  • Gemini 3.5 Flash: 63.9%
  • DeepSeek V4 Flash: 59.7%

Парадокс: самыми сложными оказались не логические задачи (74.1% успеха), а точное кодирование (35.2%). Многие модели выдавали валидный Base64, но с неправильным ответом внутри.

Открытые вопросы

Автор честно признаёт: выборка маленькая, причинно-следственная связь не доказана. Корреляция с SimpleBench — всего 0.23. Нужны контрольные тесты без Base64 и с другими форматами кодирования.

Главный вопрос: это реальная проверка обобщающих способностей или артефакт токенизации? И что произойдёт, когда такие тесты попадут в обучающие данные?

Ключевые выводы

  • Способность генерировать Base64 неожиданно коррелирует (0.91) с общим интеллектуальным рейтингом моделей
  • Точное кодирование оказалось сложнее логических задач — проваливается 65% попыток
  • Многие ошибки — не сломанный Base64, а корректный формат с неправильным содержимым
  • Тест проверяет всю цепочку: рассуждение → точность → кодирование → формат, сбой на любом этапе = провал
  • GPT-5.6 Sol лидирует с 97.2%, бесплатные модели справляются на 20-50%
бенчмаркиBase64корреляциянадёжность моделейтестирование LLM

Автор: Никита Громов · Источник: reddit.com

Мнение редакции

Забавная история: чувак придумал тест «реши задачку и выдай ответ в Base64», а оказалось, что это случайно проверяет общую адекватность модели. Корреляция 0.91 с топовым рейтингом — это почти «если модель не косячит с кодированием, она не косячит нигде».

Но тут куча но. Во-первых, выборка крошечная — восемь моделей, и непонятно, это реальная закономерность или статистический фокус. Во-вторых, самое интересное: задачи на точное кодирование провалились хуже всего (35% успеха), а логика прошла легко (74%). То есть модели умеют думать, но спотыкаются на «выдай ровно то, что нужно, без отсебятины». Это, кстати, проблема для агентов — там одна лишняя буква ломает всю цепочку. Автор сам признаёт: непонятно, это проверка мозгов или просто токенизатор накосячил. Нужны контрольные тесты, но идея свежая.

Ещё по теме

Комментарии