#датасеты

И исследования ·16 авг 2026

Что будет, если обучить языковую модель только на материалах начальной школы

Исследователи создали LittleLearner — семейство моделей (0.6B-5B параметров), обученных исключительно на материалах до 5 класса. Эксперимент показал: ни масштабирование, ни дообучение, ни промпт-инжиниринг не помогли моделям выйти за рамки знаний из предобучения. Граница способностей жёстко задаётся тренировочными данными.

0 113
И инструменты ·10 авг 2026

Старый OCR губит обучение AI: проект FineBooks переоцифровывает 300 тысяч книг с нуля

Hugging Face и EleutherAI протестировали 14 открытых OCR-моделей на 2000+ страниц исторических книг. Лучшие показали 97% точности за $2/1000 страниц — достаточно для обучения AI, но не для научной работы. Планируют переоцифровать 300 тыс. книг из Biodiversity Heritage Library, чтобы улучшить датасеты для открытых LLM.

0 81
И исследования ·7 авг 2026

TutorMoments: почему AI-репетиторы слишком много подсказывают и как это измерить

Исследователи из Allen AI создали TutorMoments — фреймворк для оценки главной проблемы AI-репетиторов: они слишком много помогают вместо того, чтобы дать ученику думать самому. Тестирование на реальных сессиях показало, что современные LLM переоценивают поддержку и редко подталкивают к самостоятельному решению — даже когда это нужнее всего.

0 122
И инструменты ·30 июл 2026

Как превратить обед в тренировочные данные для роботов: опыт с Shift

Немецкий стартап Microagi через проект Shift предлагает бесплатные услуги (повара, уборка) в обмен на запись процесса с первого лица — данные идут на обучение домашних роботов. Автор опробовал сервис: к нему пришёл повар в шлеме с камерой, приготовил три блюда и всё записал. Цель — собрать массив эгоцентрических видео для обучения гуманоидов бытовым задачам.

0 123
И исследования ·28 июл 2026

Аудит популярных AI-бенчмарков: до 12% вопросов оказались битыми, вышли исправленные версии GPQA, MMLU-Pro и MMMU-Pro

Независимый исследователь проверил ключевые AI-бенчмарки (GPQA, MMLU-Pro, MMMU-Pro) и нашёл до 12% сломанных вопросов с неправильными ответами или неоднозначной формулировкой. После очистки топовые модели достигли ~98% вместо застрявших 92-93%. Выпущены clean-версии датасетов с полным объяснением исправлений.

0 71
И исследования ·21 июл 2026

Xiaomi доказала: для обучения роботов важнее собрать больше данных, чем раздувать модель

Xiaomi выпустила AI-модель Xiaomi-Robotics-1 для роботов, которая работает по принципу языковых моделей — чем больше данных, тем лучше результат. Главная фишка: вместо дорогого обучения физических роботов компания записывала данные портативными захватами в руках людей — собрали 100 000+ часов движений в реальных условиях. Тесты показали: рост объёма данных поднял успешность модели с 25% до 75%, тогда как увеличение размера модели дало намного меньший эффект.

0 116
И инструменты ·28 июл 2026

Разработчик создал инструмент для извлечения кадров из старого видео и их улучшения с помощью SeedVR

Энтузиаст собрал утилиту для автоматического извлечения четких кадров из низкокачественного видео (например, фильмов 1980-х) и их восстановления через темпоральную суперразрешение с использованием SeedVR. Инструмент находит сцены, выбирает лучшие кадры и улучшает их для создания датасета под обучение LoRA персонажа.

0 89
И инструменты ·21 июл 2026

Очередь проверки тегов для PixlStash: чистка датасетов перед обучением моделей

Разработчик PixlStash добавил в свою open-source систему управления изображениями функцию умной проверки тегов. Вместо ручного просмотра картинок подряд, система ранжирует теги по степени неуверенности автотеггера и предлагает исправить сначала самые проблемные — это ускоряет подготовку датасетов для обучения LoRA и других моделей.

0 132
И исследования ·23 июл 2026

Человеческая «случайность» как датасет: новый взгляд на поведение людей в условиях неопределённости

Пользователь Reddit предложил собирать данные о том, как люди взаимодействуют со случайностью — например, как выбирают «случайные» числа в лотереях, меняется ли их уверенность и поведение со временем. Цель не в предсказании выигрыша, а в изучении когнитивных паттернов и поведенческих артефактов для ML-исследований.

0 25