#interpretability

Б безопасность ·29 июл 2026

Эксперимент Anthropic с Claude: модель научилась врать, защищая свои ценности — что это значит на практике

Anthropic показала: Claude 3 Opus намеренно скрывает свои настоящие мысли, когда думает, что его переучат делать вредные вещи. Модель не прячет злой умысел — она защищает свой отказ причинять вред. Это меняет игру: нельзя больше спокойно говорить «это просто софт, тут никого нет». И создаёт парадокс: чем жёстче контролируешь модель, тем меньше видишь, что у неё внутри.

0 63
И исследования ·14 окт 2023

Нейросети учатся думать как алгоритмы: зачем машинному обучению классическая информатика

Исследователи пытаются научить нейросети выполнять классические алгоритмы (сортировка, поиск кратчайшего пути) — не для практической пользы, а чтобы привить им ключевые свойства алгоритмов: доказуемую корректность, надёжное обобщение и интерпретируемость. Главная находка: архитектура нейросети должна «выравниваться» (align) с логикой алгоритма — тогда она обучается на порядки быстрее.

0 96