#обучение моделей

И исследования ·16 авг 2026

Что будет, если обучить языковую модель только на материалах начальной школы

Исследователи создали LittleLearner — семейство моделей (0.6B-5B параметров), обученных исключительно на материалах до 5 класса. Эксперимент показал: ни масштабирование, ни дообучение, ни промпт-инжиниринг не помогли моделям выйти за рамки знаний из предобучения. Граница способностей жёстко задаётся тренировочными данными.

0 113
И инструменты ·10 авг 2026

Старый OCR губит обучение AI: проект FineBooks переоцифровывает 300 тысяч книг с нуля

Hugging Face и EleutherAI протестировали 14 открытых OCR-моделей на 2000+ страниц исторических книг. Лучшие показали 97% точности за $2/1000 страниц — достаточно для обучения AI, но не для научной работы. Планируют переоцифровать 300 тыс. книг из Biodiversity Heritage Library, чтобы улучшить датасеты для открытых LLM.

0 81
М модели ·10 авг 2026

Как обучить свою LLM на 1 млрд параметров за $200: опыт разработчика

Разработчик с нуля обучил языковую модель на 1,1 млрд параметров на 20 млрд токенов из fineweb-edu, потратив около $200 через vast.ai. Использовал архитектуру на базе Gemma3, дообучил через LoRA на openhermes для чата. Качество уступает промышленным моделям, но проект показал реальную стоимость и процесс создания собственной LLM.

0 50
И инструменты ·4 авг 2026

Cursor открыл код Mixture-of-Kittens: ядро для обучения MoE-моделей в 2.4 раза быстрее конкурентов

Cursor Research выложил в открытый доступ MoK — мегаядро для обучения mixture-of-experts моделей на стойках GB300 NVL72. Вместо разделения коммуникации и вычислений всё слито в один детерминированный kernel, что даёт до 2.37x прирост скорости против лучших публичных решений. Уже работает на десятках тысяч GPU в продакшене при обучении Composer.

0 57
И инструменты ·29 июл 2026

Krea 2 LoRA: как дообучить на RTX 5080 16GB и почему популярные гайды врут

Энтузиаст обучил LoRA-адаптер для Krea 2 на RTX 5080 с 16GB VRAM вопреки популярным статьям, утверждающим, что нужно больше памяти. Полный тренинг 1152 шага занял 67 минут, пик VRAM — 93.8%. Бонус: разбор проблем официальных репозиториев (gated-доступ), bagов модели (bleeding в промпты без триггеров) и пошаговый рецепт с точными версиями библиотек.

0 80
Р регулирование ·29 июл 2026

Антропик массово уничтожал купленные книги для обучения ИИ — суд признал это законным

Anthropic покупала миллионы физических книг, разрезала их для сканирования и уничтожала оригиналы — чтобы избежать обвинений в пиратстве. Суд постановил, что такое «деструктивное сканирование» купленных копий — законное fair use, а использование пиратских файлов — нет. Компания заплатила $1.5 млрд за урегулирование претензий по пиратству, но сам метод признан легальным.

0 71
И исследования ·21 июл 2026

Что на самом деле означает «открытые веса» в AI

Статья объясняет разницу между «open weight» и «open source» моделями. Когда компания публикует открытые веса, вы получаете готовый файл с миллиардами настроенных параметров модели, которые можно скачать и запускать локально, но не рецепт её создания — обучающие данные и точный процесс обучения обычно остаются закрытыми.

0 122
И инструменты ·28 июл 2026

Разработчик создал инструмент для извлечения кадров из старого видео и их улучшения с помощью SeedVR

Энтузиаст собрал утилиту для автоматического извлечения четких кадров из низкокачественного видео (например, фильмов 1980-х) и их восстановления через темпоральную суперразрешение с использованием SeedVR. Инструмент находит сцены, выбирает лучшие кадры и улучшает их для создания датасета под обучение LoRA персонажа.

0 89
И инструменты ·21 июл 2026

Очередь проверки тегов для PixlStash: чистка датасетов перед обучением моделей

Разработчик PixlStash добавил в свою open-source систему управления изображениями функцию умной проверки тегов. Вместо ручного просмотра картинок подряд, система ранжирует теги по степени неуверенности автотеггера и предлагает исправить сначала самые проблемные — это ускоряет подготовку датасетов для обучения LoRA и других моделей.

0 132
И инструменты ·31 июл 2026

Зачем BatchNorm, LayerNorm и GroupNorm в нейросетях — разбор с кодом и визуализацией

Разработчик реализовал три вида нормализации (Batch, Layer, Group) с нуля и проверил на MNIST. Главный инсайт: все три метода оживляют «мёртвые» нейроны и поднимают точность с 84% до 96%, но на простых задачах разницы между ними почти нет. Ключевое понимание пришло через геометрическую интерпретацию: каждая нормализация — это выбор, какие степени свободы в данных считать избыточными.

0 62
И инструменты ·29 июл 2026

Почему AI-моделям нужно так много RAM и VRAM

Статья объясняет, почему память — главное узкое место при работе с AI-моделями, а не процессорная мощность. Автор разбирает, сколько памяти требуется для хранения параметров моделей, в чём разница между RAM и VRAM, и почему GPU не может работать с данными, не помещающимися в его видеопамять.

0 44
И исследования ·21 июл 2026

Как обучаются языковые модели: принцип без магии

Объяснение процесса обучения языковых моделей на простом языке. Автор показывает, что вся «магия» LLM сводится к простому принципу: система видит множество примеров, измеряет свою ошибку и корректируется в сторону меньшей ошибки — триллионы раз подряд. Никакого «понимания» или учителя — только математическая оптимизация.

0 26
И исследования ·22 июл 2026

Как я учил нейросеть рисовать: история о 92 000 потерянных шагах и модели, которая умела рисовать только снег

Энтузиаст тренирует диффузионную модель изображений на одной RTX 5090, сталкиваясь с абсурдными багами: модель, рисующая только снег, случайный откат на 92 000 шагов из-за двух строк кода, крах из-за символа галочки в логах. Модель научилась генерировать простые объекты, но большинство проблем были не в AI, а в собственном коде.

0 18