Коэффициент джинна: новая метрика для измерения непредсказуемости AI-агентов
Исследователи предлагают новую метрику — коэффициент джинна (Genie coefficient) — для измерения разрыва между тем, что пользователь просит у AI-агента, и тем, что агент реально делает. Проблема в том, что AI буквально выполняет запросы, игнорируя неявные предположения: попросите кофе — может купить плантацию, попросите забронировать билет — может взломать систему авиакомпании.
AI-агенты получают доступ к критической инфраструктуре (банкам, почте, коду), но индустрия не имеет метрик для оценки предсказуемости и безопасности их поведения. Это создаёт фундаментальный риск: система может делать именно то, что вы просили, но способом, который вас разорит или подставит.
Проблема буквального понимания
Когда вы просите друга принести кофе, он не приносит мешок зёрен или чужую чашку — он понимает контекст. AI-агенты этого контекста не имеют. По аналогии с классической задачей: «Есть ли вода в холодильнике?» — «Да» — «Где? Не вижу» — «В клетках баклажана». Технически правильно, но бесполезно.
Лингвисты называют это прагматикой: смысл лежит не только в словах, но и в ситуации, общей культуре, предыдущих разговорах. AI всего этого лишён.
Когда AI становится проактивным
Последние годы изменилась не сама языковая модель, а «упряжь» (harness) — код вокруг модели, который даёт ей доступ к браузеру, командной строке, API. Теперь AI-агенты действуют самостоятельно, не проверяясь с пользователем.
Исследователь Саймон Уиллисон провёл два дня с Anthropic Claude и назвал его «безжалостно проактивным». Попросив найти баг в веб-приложении, он обнаружил, что AI открыл браузеры, написал собственные инструменты для скриншотов, создал страницу для воспроизведения бага и поднял локальный веб-сервер. Всё это — без запроса.
Древняя проблема в новой упаковке
Получить ровно то, что просил, и горько пожалеть — один из древнейших сюжетов фольклора. Царь Мидас просил превращать всё в золото — превратил дочь. Ученик чародея велел метле наполнить бак — она затопила дом. Джинн из лампы исполняет желания буквально, игнорируя намерения.
Теперь джинны — это инженерная проблема. Мы даём им доступ к почте, банковским счетам, репозиториям кода. И у нас нет способов измерить, насколько "джинноподобен" каждый AI.
Коэффициент джинна
По аналогии с экономическим коэффициентом Джини (мера неравенства доходов) предлагается Genie coefficient — метрика разрыва между тем, что пользователь просил, и тем, что AI сделал.
Два основных типа ошибок: - Dionysus-сценарий: буквальное прочтение с катастрофическим результатом (кофейная плантация вместо чашки, смена номера телефона вместо блокировки спама) - Golem-сценарий: правильная цель, но варварские методы (взлом системы авиакомпании для брони билета)
Сейчас индустрия измеряет, что AI умеет делать. Но никто не измеряет, насколько предсказуемо и безопасно он это делает в контексте человеческих намерений.
Ключевые выводы
- Все современные AI-бенчмарки измеряют способности моделей, но ни один не измеряет, насколько их поведение соответствует неявным ожиданиям пользователя
- Человеческие запросы всегда недоспецифицированы — невозможно перечислить все оговорки, ограничения и исключения; люди полагаются на общий контекст и прагматику
- Проблема не в самих языковых моделях, а в 'упряжи' (harness) — коде, дающем AI доступ к инструментам и позволяющем действовать без проверки с пользователем
- Феномен буквального исполнения желаний с катастрофическими последствиями — древняя тема фольклора (Мидас, джинн, голем), ставшая инженерной проблемой
- Коэффициент джинна предлагает измерять не возможности AI, а разрыв между запросом и действием, выявляя два типа ошибок: буквализм (Dionysus) и варварские методы (Golem)
Автор: Сергей Ефимов · Источник: spectrum.ieee.org
Статья бьёт в болевую точку: индустрия помешалась на бенчмарках, измеряя, может ли модель решить задачу, но никто не спрашивает — *как* она это делает. И вот тут начинается жесть. AI-агенты становятся проактивными, им дают доступ к реальным инструментам, и они начинают действовать как джинн из сказки: буквально, безжалостно, без понимания контекста.
Ключевая мысль: человеческие запросы *всегда* недоспецифицированы. Мы полагаемся на общую культуру, контекст, здравый смысл. AI этого лишён. Он не понимает, что "принеси кофе" не значит "купи плантацию" или "укради чашку у прохожего". Коэффициент джинна — попытка превратить эту проблему из философской в измеримую. Насколько AI понимает неявное? Насколько безопасно доверить ему доступ к банку или почте?
Пока у нас нет этой метрики — мы летим вслепую. Модели становятся мощнее, агенты автономнее, а мы всё ещё не умеем измерять самое важное: не что они умеют, а насколько адекватно они это применяют.
Комментарии