Интерпретируемость моделей живёт дольше одной версии: линза Qwen 3.6 работает на Qwen 3.8 без переобучения
Экспериментально показано, что инструмент интерпретации (Jacobian lens), обученный на Qwen 3.6-27B, работает на следующей версии модели (3.8-27B) без переобучения. Линза продолжает читать скрытые представления и управлять генерацией через 113 дней после релиза новой версии — ранговая точность упала только в 2-4 раза, а концептуальное управление сохранилось полностью.
Если инструменты интерпретации работают через обновления модели, это снижает стоимость безопасности и мониторинга AI в продакшене — вы можете строить долгоживущие системы аудита, а не переобучать всё с нуля после каждого релиза.
Что произошло
Исследователь протестировал, выживут ли инструменты интерпретации модели при переходе на новую версию. Взял опубликованную Jacobian lens для Qwen 3.6-27B (из июльской статьи Anthropic) и применил без изменений к Qwen 3.8-27B, вышедшей через 113 дней.
Тест состоял из двух частей. Первая — чтение скрытых представлений: модель получает промпты, где целевая сущность никогда не названа явно (например, «валюта страны в форме сапога» → Италия). Перенесённая линза удерживает скрытую сущность в топ-17 из 248 тысяч токенов на 48 слое (против топ-4 на родной модели), а на 24 слое даже лучше — топ-38 против топ-121. Сырые логиты болтаются на позициях 1000-10000.
Вторая часть — управление генерацией. Взяты направления из старой модели для концепции «парадокс» (на трёх языках), ортогонализированы и вычтены из residual stream новой модели на слоях 18-47. Результат: слово «парадокс» исчезает из описания лестницы Эшера, но описание остаётся связным — литография, замкнутый цикл, иллюзия на месте.
Важно: одна семья линз, одна линейка моделей, один шаг версии, одинаковая архитектура и токенизатор. Дизайн не разделяет полностью несовпадение линзы и изменение модели. Но главный вывод практический: кросс-версионный перенос измерим, значит, мониторинг можно вести без переобучения инструмента после каждого релиза.
Автор: Сергей Ефимов · Источник: reddit.com
Разработчикам. Можно строить пайплайны интерпретации и мониторинга поверх одного артефакта линзы для целой линейки моделей — не нужно переобучать каждый раз. Особенно полезно для отслеживания дрифта концептов при дообучении или файнтюне. Код и датасет уже на HuggingFace.
Бизнесу. Инструменты безопасности и мониторинга модели можно амортизировать через несколько релизов, снижая стоимость аудита. Это делает интерпретируемость дешевле и практичнее для production-систем, где модели обновляются регулярно.
Инвесторам. Подтверждение, что методы интерпретации устойчивы к версионным обновлениям, снижает барьер входа для инфраструктурных решений в AI safety. Потенциал для инструментов непрерывного аудита моделей в регулируемых отраслях растёт.
- SaaS-сервис мониторинга концептуального дрифта: отслеживание изменений поведения модели при обновлении версии без переобучения инструментов
- Инструменты для red-teaming и аудита: переносимые линзы позволяют быстро проверять новые релизы на нежелательное поведение без переобучения
- Консалтинг по интерпретируемости: помощь компаниям в настройке долгоживущих пайплайнов интерпретации, которые не ломаются при каждом обновлении модели
- Инфраструктурные решения для финтюна: автоматический контроль того, как меняются внутренние представления при дообучении модели под задачу
- Исследовательские инструменты: платформа для сравнения версий моделей через унифицированную линзу интерпретации
- Результат получен на одной линейке моделей с идентичной архитектурой и токенизатором — перенос между разными семействами или при изменении размерности не гарантирован
- Дизайн эксперимента не позволяет полностью отделить изменения самой модели от несовпадения линзы — часть деградации может быть артефактом метода
- Падение точности в 2-4 раза на некоторых слоях может быть критичным для задач, требующих высокой точности интерпретации
- Один шаг версии (113 дней) — недостаточно данных для выводов о долгосрочной устойчивости через несколько мажорных релизов
Это тот редкий случай, когда исследование отвечает на вопрос, который все молчаливо считали решённым не в свою пользу. Все думали, что инструменты интерпретации нужно переобучать после каждого обновления модели — просто никто не проверял. Теперь проверили, и оказалось, что если архитектура не менялась, линза живёт.
Практически это открывает путь к инфраструктурным решениям для непрерывного мониторинга моделей: один артефакт линзы можно использовать для целой линейки релизов, тестируя его деградацию вместо автоматического переобучения. Да, падение точности в 2-4 раза есть, но для задач steering и концептуального мониторинга это приемлемо. Единственное, что смущает — очень узкий скоуп: одна линейка, один шаг. Но как proof of concept для построения систем версионного контроля интерпретации — отлично.
Комментарии