#reasoning

И исследования ·19 авг 2026

Что если отдать одной задаче весь compute, который сейчас размазан по миллионам промптов?

Пользователь Reddit задаётся вопросом: что, если вместо обработки миллионов запросов одновременно направить весь глобальный compute AI на одну научную проблему вроде лечения рака? Даст ли это прорыв, или так не работает масштабирование вычислений в AI?

0 32
И исследования ·18 авг 2026

Apple исследовала GRPO для обучения reasoning в неанглийских языках — и нашла подводные камни

Исследователи Apple проверили, как работает обучение моделей рассуждению (RLVR/GRPO) на языках кроме английского. Оказалось: обучение на родном языке даёт результаты близкие к английскому, есть кросс-языковой перенос навыков, но иногда модель деградирует в других языках — нужна широкая оценка, чтобы не потерять качество.

0 91
М модели ·16 авг 2026

Qwen 3.8 27B: отличная модель, но с безумным дефолтным режимом сверхдумания

Alibaba выпустила Qwen 3.8 27B — Apache 2 лицензию, 27B параметров, vision-возможности. Модель отличная, но дефолтный режим xhigh reasoning заставляет её думать 21 минуту над рисованием велосипеда, вместо 2 минут на low. Зато она прекрасно работает с bounding box и генерирует SVG лучше всех локальных моделей.

0 133
И исследования ·15 авг 2026

Почему AI в математике побеждает не умом, а памятью: разбор настоящего преимущества моделей

AI решает сложные математические задачи не потому, что «умнее» людей, а потому что у него огромное символьное рабочее пространство (context window). Человек держит в уме 5-7 элементов, модель — тысячи токенов с промежуточными выкладками. Это не интеллект, а снятие биологического ограничения на рабочую память.

0 61
И инструменты ·13 авг 2026

Исправленный Jinja-шаблон для Qwen 3.5–3.8: теперь thinking можно выключить, а tool calling не крашится

Энтузиаст выпустил фикс для официального чат-шаблона Qwen 3.5–3.8, который ломает мультитёрн-диалоги, tool calling и управление reasoning. Новый шаблон добавляет переключение thinking on/off, поддержку llama.cpp и vLLM, не портит KV-кеш и работает с OpenAI API-форматом инструментов.

0 84
И исследования ·11 авг 2026

Нереализованная модель Anthropic продвинулась в решении гипотезы Римана — одной из главных задач математики

Экспериментальная модель Anthropic за полтора дня автономной работы значительно продвинулась в доказательстве гипотезы Римана — нерешённой математической проблемы с призом $1 млн. Модель протестировала 650 подходов, управляя 60 под-агентами и потратив 31 млн токенов. Результат подтвердили математики компании и формализовали через proof-ассистент Lean.

0 76
И исследования ·8 авг 2026

AI-агенты жрут в 600 раз больше энергии, чем обычный чат — реальные цифры от учёного

Климатолог Зик Хаусфатер замерил энергопотребление своей работы с Claude Code за 8 недель: ~170 кВт·ч. Один промпт агенту = ~150 Вт·ч, это в 600 раз больше, чем обычный запрос к ChatGPT. Google и OpenAI врали: заявляли 0,24–0,34 Вт·ч, но не учитывали reasoning, агентов, миллионы токенов. Выходит ~370 кг CO₂ в год на одного пользователя — как стиралка на год или 2% углеродного следа среднего американца.

0 75
И исследования ·1 авг 2026

OpenAI Astra решает открытые математические проблемы: AI переходит от объяснения к созданию нового знания

OpenAI опубликовала 249-страничный сборник с 10 математическими и теоретическими достижениями, полученными внутренней версией модели Astra. Модель самостоятельно решила открытые проблемы в геометрии, теории групп, квантовой сложности и криптографии, над которыми не было прогресса 10+ лет. Все результаты формализованы в Lean — можно проверить машинно, без доверия на слово. Это не просто решение сложных задач, а активное расширение научной границы.

0 122
И исследования ·26 июл 2026

Математическая олимпиада показала: даже лучшие AI-модели буксуют без «костылей»

Исследователи протестировали разные LLM на задачах Международной математической олимпиады IMO-2026. Топовые модели (o1 и Claude 3.5) справились отлично, но «средний класс» вроде Opus и Sonnet показал слабый результат без специальных надстроек-оркестраторов. Даже с мультиагентными системами они не дотянули до фронтира. Главный вывод: сложная многошаговая логика — всё ещё слабое место для моделей ниже флагманского уровня.

0 132
И инструменты ·30 июл 2026

Как создать синтетический датасет для файнтюна: избегаем шаблонности и максимизируем разнообразие рассуждений

Разработчик предлагает пайплайн для генерации данных на обучение рассуждениям: абстрактные задачи создаются учительской моделью или процедурно, переводятся в естественный язык, решаются формальными верификаторами, и только проверенные примеры попадают в датасет. Цель — избежать главной проблемы синтетики (однообразные шаблоны) и создать качественный корпус для дистилляции в малые открытые модели.

0 93
И исследования ·24 июл 2026

Apple представила LEAD: как научить языковые модели исправлять свои ошибки в долгих цепочках рассуждений

Исследователи Apple обнаружили, что при решении сложных задач языковые модели попадают в «ловушку безвозвратности» — ошибки накапливаются и их невозможно исправить. Новый метод LEAD добавляет проверку будущих шагов и агрегирование сценариев, что позволило модели o4-mini решать более сложные задачи (шашечные головоломки до 13 элементов вместо 11).

0 135
М модели ·21 июл 2026

ChatGPT разучился отвечать на простые вопросы — наклонена ли стена?

Пользователь заметил, что ChatGPT пропускает базовую проверку реальности перед анализом. На вопрос «наклонена ли стена?» модель вместо прямого ответа запускается в лекцию о строительных нормах и материалах, так и не проверив сам факт наклона. Проблема может быть глубже обычной «боязни определённости» — модель утратила шаг здравого смысла в цепочке рассуждений.

0 129
И инструменты ·22 июл 2026

MindControl: форк llama.cpp, который направляет рассуждения модели инъекциями во время сэмплирования

Разработчик создал форк llama.cpp, который решает проблему зацикливания и деградации рассуждений у небольших локальных моделей (типа Qwen3.6-27B). Система автоматически инжектирует промпты вроде «у меня бюджет в X токенов» в процесс генерации, напоминая модели о лимитах и направляя к выводам. В тестах подход показал заметное улучшение качества reasoning.

0 112
И исследования ·1 авг 2026

Как рассуждает LLM: в чём его мышление отличается от человеческого и почему

Автор разбирает две категории различий между рассуждениями LLM и человека: первые связаны с конкретной архитектурой (отсутствие памяти между сессиями, невозможность пересмотреть уже сказанное) и потенциально устранимы новым дизайном, вторые — это фундаментальные математические ограничения любого алгоритма, доказанные задолго до появления языковых моделей.

0 44
И инструменты ·24 июл 2026

Инженер проверил GPT-5.6 на 70-страничном пакете сварочной документации — и впервые поверил в AI-ассистентов

Инженер поручил GPT-5.6 Thinking High проверить 70-страничный пакет сварочной документации с десятками спецификаций, таблиц и кросс-ссылок. Модель 5 минут думала, а затем выдала детальный разбор каждой спецификации, нашла опечатки в символах переменных, параметры TIG, скопированные в строки SMAW, несуществующие номера документов и расхождения между таблицами — именно те мелкие ошибки, которые проскакивают через человеческие проверки.

0 80
И исследования ·26 июл 2026

Открытые 4B-модели приблизились к o3 в медицинских тестах на шведском

Исследователь прогнал небольшие открытые LLM через шведские медицинские лицензионные экзамены. Gemma4-E4B и Qwen3.5-4B без дообучения показали 77% точности, а с reasoning — 87%, почти сравнявшись с o3 (88%). Qwen рассуждает на английском, даже если вопросы на шведском, но это не мешает точности.

0 68
М модели ·21 июл 2026

AWS показала, как научить Nova думать на своих данных без дорогих разметок

Amazon представила метод Self-Distilled Reasoning (SDR) для дообучения моделей Nova 2, который позволяет сохранить способность к рассуждениям даже при обучении на данных без промежуточных цепочек мыслей. SDR использует собственные reasoning-токены базовой модели, предотвращая «катастрофическое забывание» и улучшая точность на целевых задачах без необходимости дорогой ручной разметки.

0 92
И исследования ·3 авг 2026

Astra, PDF на 249 страниц и пределы AI-доказательств

OpenAI опубликовала 249-страничный документ с математическими доказательствами, созданными внутренней моделью. Главное не в том, что AI решила сложные задачи, а в том, что результат представлен в формате, который математическое сообщество может проверить построчно — это сдвиг от «правдоподобных ответов» к верифицируемым исследованиям.

0 19
М модели ·31 июл 2026

Корейский стартап на 24 GPU обогнал госпрограммы по ИИ в тесте GPQA Diamond

Модель Darwin-398B от южнокорейского стартапа VIDRAFT заняла третье место в мире и первое в Корее на бенчмарке GPQA Diamond — выпускном тесте по научному мышлению, устойчивом к поиску в интернете. При этом стартап использует всего около 24 GPU, а государственные модели с гораздо большими ресурсами отстают на 4–5 пунктов.

0 17