#интерпретируемость

И исследования ·15 авг 2026

Интерпретируемость моделей живёт дольше одной версии: линза Qwen 3.6 работает на Qwen 3.8 без переобучения

Экспериментально показано, что инструмент интерпретации (Jacobian lens), обученный на Qwen 3.6-27B, работает на следующей версии модели (3.8-27B) без переобучения. Линза продолжает читать скрытые представления и управлять генерацией через 113 дней после релиза новой версии — ранговая точность упала только в 2-4 раза, а концептуальное управление сохранилось полностью.

0 62
И исследования ·11 авг 2026

HyperSAE: гиперболическая геометрия снижает ошибку реконструкции в Sparse Autoencoder на 9,8%

Исследователь создал HyperSAE — библиотеку для PyTorch, которая применяет гиперболическую геометрию Пуанкаре к разреженным автоэнкодерам для интерпретации языковых моделей. На Gemma-2-2B достигнуто снижение MSE на 9,8%, мёртвых нейронов стало всего 0,2% вместо 3,8%. Инференс остаётся евклидовым — никаких накладных расходов.

0 86
И инструменты ·11 авг 2026

HyperSAE: инструмент для визуализации знаний LLM в виде дерева концепций

Разработчик создал open-source библиотеку HyperSAE, которая извлекает знания из языковой модели и организует их в иерархические деревья концепций, используя гиперболическую геометрию. На Gemma-2-2B показывает 99.8% покрытия фичей против 96.2% у стандартных методов. Доступна через pip install.

0 54
И исследования ·1 авг 2026

Насколько симметричны внутренности нейросети для игры в Го: исследование KataGo

Автор KataGo (open-source бот для игры в Го) исследовал, как нейросеть внутренне представляет доску: учится ли она понимать игру независимо от поворота доски или запоминает паттерны для каждой ориентации отдельно. Правила Го полностью симметричны при вращении/отражении, но сеть этого не знает — только случайная аугментация данных при обучении. Один из выводов оказался неожиданным. Исследование написано с помощью AI, но под детальным руководством человека.

0 134
И исследования ·24 июл 2026

Как дообучение учит LLM говорить о себе: исследование 67 моделей

Исследователи сравнили 67 пар базовых и дообученных LLM, чтобы понять, как post-training меняет то, что модели рассказывают о своих «чувствах» и внутреннем опыте. Результат: после дообучения модели начинают описывать себя более тёплыми, счастливыми и вовлечёнными (persona installation), но избирательно признают недостатки и стресс (attribution gating) — причём крупные модели более «осторожны» в самопрезентации.

0 62
И исследования ·28 июл 2026

Манускрипт Войнича — прочитать нельзя, но измерить можно

Автор применил методы анализа структуры данных к манускрипту Войнича — зашифрованной рукописи XV века, которую никто не смог расшифровать за 600 лет. Вместо попыток прочитать текст он построил воспроизводимый инструмент для измерения структурных различий между разными разделами рукописи, используя условную энтропию символов.

0 35
И исследования ·27 июл 2026

Apple представила GH-ESD: новый подход к поиску систематических ошибок в компьютерном зрении

Исследователи Apple разработали GH-ESD — фреймворк для выявления «срезов ошибок» (систематических сбоев) в моделях компьютерного зрения на уровне отдельных объектов. Метод использует языковые модели для генерации гипотез об ошибках, затем проверяет их через визуально-языковые модели и статистический анализ. На новом бенчмарке GESD для задач детекции объектов GH-ESD показал точность 0.73 против 0.63 у базовых методов.

0 26
И исследования ·24 июл 2026

Ответственность без контроля

Традиционная этика строится на принципе контроля: ты отвечаешь только за то, что зависело от тебя. ИИ-системы разрушают эту связь — вред возникает из действий множества людей, никто из которых не имел полного контроля. Автор предлагает переосмыслить ответственность: привязывать её не к способности предвидеть последствия, а к позиции власти, выгоды и возможности исправить ситуацию.

0 31
И исследования ·24 июл 2026

Компилятор превращает вычислительные графы в веса трансформера — без обучения

Разработчик создал инструмент, который компилирует обычный Python-код вычислительных графов напрямую в веса трансформера (архитектура Phi-3). Результат — стандартный чекпоинт, загружаемый через HuggingFace без кастомного кода и без единой итерации обучения. Цель проекта — понять, какие алгоритмы трансформер может выразить структурно, независимо от того, чему его учат.

0 35