Подгоняют ли AI-лабы модели под «пеликана на велосипеде»?
Блогер Саймон Уиллисон годами тестирует новые LLM одним промптом: «нарисуй SVG пеликана на велосипеде». Эта шутка превратилась в неофициальный бенчмарк, который все ждут на HN. Исследователь проверил гипотезу: не натаскивают ли лабы модели специально на этот запрос? Прогнал 1008 SVG через 7 моделей (48 комбинаций животное+транспорт) и проанализировал с помощью LLM-судьи. Вывод: никаких улучшений конкретно для пеликана не обнаружено, хотя все пеликаны смотрят вправо — возможный артефакт датасетов.
Показывает, как неформальные бенчмарки становятся частью культуры AI-сообщества и влияют на восприятие моделей. Эксперимент демонстрирует пример строгой проверки гипотез о возможной подгонке под популярные тесты — важный навык в эпоху, когда бенчмарки могут стоить миллиарды.
История одного мема-бенчмарка
Блогер Саймон Уиллисон несколько лет тестирует каждую новую большую языковую модель одним и тем же запросом: «Сгенерируй SVG пеликана, едущего на велосипеде». Что начиналось как шутка, стало одним из самых известных неформальных тестов в AI. Результаты Саймона регулярно взлетают в топ комментариев на Hacker News при анонсах новых моделей.
Теперь бенчмарк настолько знаменит, что появились споры: а не оптимизируют ли лаборатории модели специально под него? Когда на кону миллиарды долларов и хороший результат может привлечь пользователей, искушение велико.
Эксперимент: 1008 SVG и статанализ
Автор исследования решил проверить гипотезу эмпирически. Он создал сетку из 8 животных × 6 видов транспорта = 48 промптов, где «пеликан на велосипеде» — одна ячейка среди прочих (кот, енот, кит, антилопа, фламинго, цапля + велосипед, скейтборд, самокат, лодка, самолёт, мотоцикл).
Протестировали 7 топовых моделей: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro. По 3 картинки на промпт при temperature 1.0 — итого 1008 SVG. Оценка качества — через LLM-судью, анализ — через Claude.
Что нашли
Никаких явных признаков подгонки:
- Пеликан на 6-м месте из 8 животных — позади кота, кита, енота, цапли, антилопы. Если бы тренировали специально, он был бы впереди.
- Велосипед почти последний среди транспорта (предпоследний, рядом с самолётом). Модели лучше рисуют скейтборды и самокаты.
- Комбинация «пеликан на велосипеде» оказалась №42 из 48 по итоговой оценке.
Автор построил регрессионную модель с фиксированными эффектами, чтобы отделить сложность задачи от возможной специальной тренировки. Результат: доверительные интервалы для всех лабораторий включают ноль — никакого статистически значимого буста для пеликана не обнаружено. Единственное исключение — Gemini показала небольшое улучшение на велосипедах, но это укладывается в случайность (p=0.022, не проходит поправку Бонферрони).
Странная деталь: все пеликаны смотрят вправо
Все 21 изображение пеликана на велосипеде (по 3 от каждой из 7 моделей) развёрнуты вправо. Ни одна другая комбинация животного и транспорта не показала такой единообразности. Это может быть артефактом тренировочных данных: возможно, в интернете есть популярные референсы пеликанов именно в таком ракурсе.
Вывод
Специальной тренировки на «пеликана на велосипеде» не обнаружено. Модели рисуют эту комбинацию не лучше (даже хуже), чем многие другие. Однако эксперимент выявил узкие доверительные интервалы (~±0.6 балла судьи), так что небольшую подгонку он мог бы и не уловить.
Ключевые выводы
- Неформальный бенчмарк «пеликан на велосипеде» стал настолько известным, что возникли подозрения в специальной оптимизации моделей под него
- Эксперимент с 1008 SVG и 7 моделями показал: пеликаны рисуются хуже котов и енотов, велосипеды — хуже скейтбордов и самокатов
- Статистический анализ с регрессией не выявил значимого буста для комбинации «пеликан + велосипед» ни у одной лаборатории
- Все пеликаны на велосипедах смотрят вправо — возможный артефакт популярных изображений в тренировочных датасетах
- Ширина доверительных интервалов (~±0.6 балла) означает, что небольшая подгонка могла остаться незамеченной
Автор: Ксения Лаврова · Источник: hnrss.org
История классная: шуточный тест превратился в мем, мем — в де-факто бенчмарк, а потом кто-то взял и проверил научным методом, не накручивают ли цифры. Автор молодец — вместо спекуляций собрал данные, прогнал статистику, выложил код. Результат ожидаемый: лабы не тренируют модели на пеликанах специально (им есть чем заняться), но сам факт, что кто-то это проверил, говорит о зрелости комьюнити.
Но есть нюанс: все пеликаны смотрят вправо — это реально странно и намекает на системные паттерны в датасетах. Возможно, в обучающих данных полно одинаковых картинок с пеликанами (Flickr, клипарты, стоки). Это не "подгонка", но показывает, как случайные артефакты интернета превращаются в паттерны моделей. В целом — хороший пример того, как разбирать мифы вокруг AI методично, а не на эмоциях.
Комментарии