исследования 1 мин

Интерпретируемость моделей живёт дольше одной версии: линза Qwen 3.6 работает на Qwen 3.8 без переобучения

Экспериментально показано, что инструмент интерпретации (Jacobian lens), обученный на Qwen 3.6-27B, работает на следующей версии модели (3.8-27B) без переобучения. Линза продолжает читать скрытые представления и управлять генерацией через 113 дней после релиза новой версии — ранговая точность упала только в 2-4 раза, а концептуальное управление сохранилось полностью.

Если инструменты интерпретации работают через обновления модели, это снижает стоимость безопасности и мониторинга AI в продакшене — вы можете строить долгоживущие системы аудита, а не переобучать всё с нуля после каждого релиза.

Что произошло

Исследователь протестировал, выживут ли инструменты интерпретации модели при переходе на новую версию. Взял опубликованную Jacobian lens для Qwen 3.6-27B (из июльской статьи Anthropic) и применил без изменений к Qwen 3.8-27B, вышедшей через 113 дней.

Тест состоял из двух частей. Первая — чтение скрытых представлений: модель получает промпты, где целевая сущность никогда не названа явно (например, «валюта страны в форме сапога» → Италия). Перенесённая линза удерживает скрытую сущность в топ-17 из 248 тысяч токенов на 48 слое (против топ-4 на родной модели), а на 24 слое даже лучше — топ-38 против топ-121. Сырые логиты болтаются на позициях 1000-10000.

Вторая часть — управление генерацией. Взяты направления из старой модели для концепции «парадокс» (на трёх языках), ортогонализированы и вычтены из residual stream новой модели на слоях 18-47. Результат: слово «парадокс» исчезает из описания лестницы Эшера, но описание остаётся связным — литография, замкнутый цикл, иллюзия на месте.

Важно: одна семья линз, одна линейка моделей, один шаг версии, одинаковая архитектура и токенизатор. Дизайн не разделяет полностью несовпадение линзы и изменение модели. Но главный вывод практический: кросс-версионный перенос измерим, значит, мониторинг можно вести без переобучения инструмента после каждого релиза.

интерпретируемостьмеханистическая интерпретацияQwenAI safetysteering

Автор: Сергей Ефимов · Источник: reddit.com

Разработчикам. Можно строить пайплайны интерпретации и мониторинга поверх одного артефакта линзы для целой линейки моделей — не нужно переобучать каждый раз. Особенно полезно для отслеживания дрифта концептов при дообучении или файнтюне. Код и датасет уже на HuggingFace.

Бизнесу. Инструменты безопасности и мониторинга модели можно амортизировать через несколько релизов, снижая стоимость аудита. Это делает интерпретируемость дешевле и практичнее для production-систем, где модели обновляются регулярно.

Инвесторам. Подтверждение, что методы интерпретации устойчивы к версионным обновлениям, снижает барьер входа для инфраструктурных решений в AI safety. Потенциал для инструментов непрерывного аудита моделей в регулируемых отраслях растёт.

Хайп15
Реальная польза70
Заработать55
  • SaaS-сервис мониторинга концептуального дрифта: отслеживание изменений поведения модели при обновлении версии без переобучения инструментов
  • Инструменты для red-teaming и аудита: переносимые линзы позволяют быстро проверять новые релизы на нежелательное поведение без переобучения
  • Консалтинг по интерпретируемости: помощь компаниям в настройке долгоживущих пайплайнов интерпретации, которые не ломаются при каждом обновлении модели
  • Инфраструктурные решения для финтюна: автоматический контроль того, как меняются внутренние представления при дообучении модели под задачу
  • Исследовательские инструменты: платформа для сравнения версий моделей через унифицированную линзу интерпретации
  • Результат получен на одной линейке моделей с идентичной архитектурой и токенизатором — перенос между разными семействами или при изменении размерности не гарантирован
  • Дизайн эксперимента не позволяет полностью отделить изменения самой модели от несовпадения линзы — часть деградации может быть артефактом метода
  • Падение точности в 2-4 раза на некоторых слоях может быть критичным для задач, требующих высокой точности интерпретации
  • Один шаг версии (113 дней) — недостаточно данных для выводов о долгосрочной устойчивости через несколько мажорных релизов

Это тот редкий случай, когда исследование отвечает на вопрос, который все молчаливо считали решённым не в свою пользу. Все думали, что инструменты интерпретации нужно переобучать после каждого обновления модели — просто никто не проверял. Теперь проверили, и оказалось, что если архитектура не менялась, линза живёт.

Практически это открывает путь к инфраструктурным решениям для непрерывного мониторинга моделей: один артефакт линзы можно использовать для целой линейки релизов, тестируя его деградацию вместо автоматического переобучения. Да, падение точности в 2-4 раза есть, но для задач steering и концептуального мониторинга это приемлемо. Единственное, что смущает — очень узкий скоуп: одна линейка, один шаг. Но как proof of concept для построения систем версионного контроля интерпретации — отлично.

Ещё по теме

Комментарии