#аудит моделей

И исследования ·29 июл 2026

Uncensored LLM меняют не только цензуру — они становятся оптимистами (или пессимистами)

Автор проверил, как abliteration (снятие цензуры) влияет на поведение LLM в задаче предсказания акций. Неожиданность: uncensored модели не только перестали отказываться отвечать, но и изменили свой настрой — Qwen стал оптимистичнее и увереннее, Gemma наоборот осторожнее. При этом точность осталась на уровне случайности (50/50). Вывод: снятие цензуры меняет не только фильтры, но и внутреннюю логику рассуждений модели.

0 94
Б безопасность ·13 июл 2026

Новый метод выявляет AI-модели для создания детской порнографии без генерации контента

Учёные MIT и некоммерческой организации Thorn разработали технику аудита, которая определяет, способна ли AI-модель генерировать детскую порнографию (CSAM), не заставляя её это делать. Метод анализирует внутренние изменения в модели после fine-tuning и показал 100% точность в выявлении опасных вариантов. Это критически важно: число жалоб на AI-созданный CSAM выросло с 67 000 в 2024 году до 1,5 миллиона в 2025-м.

0 36