#трансформеры

И исследования ·14 авг 2026

Программист скомпилировал рендерер Doom в трансформер на 21 миллиард параметров — без обучения

Разработчик создал компилятор, который превращает вычислительные графы в веса трансформера, и портировал алгоритм рендеринга Doom напрямую в архитектуру модели. Результат — трансформер на 21B параметров, который генерирует пиксельные команды для отрисовки кадра из Doom. Оригинальный Doom выдавал 35 FPS на 486-м процессоре, эта версия — 35 кадров в день на B200.

0 117
И исследования ·10 авг 2026

Трансформер-калькулятор с 100% точностью: кодирование алгоритмов в весах нейросети без обучения

Разработчик вручную записал алгоритм умножения столбиком в веса трансформера, минуя обучение. Результат — 100% точность на числах до 12 знаков, когда GPT-4 и остальные топ-модели на семизначных числах падают до 0% успеха. Инструмент Torchwright компилирует классические алгоритмы в архитектуру Phi-3.

0 133
И исследования ·13 авг 2026

Doom на трансформере: инженер скомпилировал игровой движок в 21 миллиард весов модели без обучения

Разработчик портировал рендерер Doom в веса трансформера, написав для этого собственный компилятор. Модель не обучалась — каждый вес вычислен. Промпт содержит геометрию уровня и позицию игрока, генерация выдаёт команды отрисовки. Версия 320x200 — 21B параметров, рендерит кадр за 40 минут на B200. Доступна облегчённая версия 80x50 на 34 ГБ.

0 40
И инструменты ·31 июл 2026

Разработчик обучил трансформер предсказывать уровень сахара в крови на 2 часа вперёд

Энтузиаст создал encoder-only трансформер на основе BERT, который прогнозирует уровень глюкозы у диабетиков на 2 часа вперёд, используя историю сахара, углеводов и инсулина. Модель обучалась на симуляторах и реальных датасетах (OhioT1DM, AZT1D, ShanghaiT1DM), крупнейшая версия — 17 млн параметров. Код и веса выложены под MIT-лицензией, есть версия для смартфона, работающая на личных данных автора.

0 128
М модели ·30 июл 2026

Почему AI теряет качество в длинных чатах (и как инженеры это обходят)

В длинных диалогах AI начинает забывать инструкции, противоречить себе и терять фокус. Причина не в «усталости» модели, а в архитектурных ограничениях: контекстное окно переполняется, а трансформеры хуже всего работают с информацией из середины контекста (эффект «lost in the middle»). Разные продукты по-разному решают проблему — обрезают историю, сжимают или извлекают релевантные части.

0 70
И исследования ·2 авг 2026

Что на самом деле нужно механизму внимания

Автор разбирает распространённое заблуждение, что attention можно «прикрутить» к любой модели для улучшения. На примере от логистической регрессии до трансформеров показано, что внимание работает только там, где есть части входа, взаимодействующие друг с другом. Отдельно объясняется, почему оригинальное позиционное кодирование в трансформерах было заменено на RoPE.

0 41
И исследования ·29 июл 2026

Токены, контекст, параметры: как на самом деле работает большая языковая модель

Статья объясняет техническую архитектуру LLM через три ключевых компонента: токенизацию текста, механизм контекстного окна и структуру параметров нейросети. Автор разбирает, как трансформеры обрабатывают последовательности токенов, почему контекст — это временная рабочая память, а параметры — долгосрочные паттерны, и как attention-механизм позволяет модели предсказывать следующий токен.

0 66
М модели ·25 июл 2026

Open Dreamer: полная открытая реализация Dreamer 4 с рецептом обучения мировых моделей

Команда Reactor выложила полный код Dreamer 4 — системы, которая строит виртуальную модель игрового мира и умеет генерировать кадры игры, предсказывая физику и действия. Вместо закрытого исследования Google — рабочий пайплайн на JAX с конфигами, демо в браузере и честным разбором проблем обучения.

0 62
И исследования ·24 июл 2026

От рекуррентных сетей к трансформерам: что дальше?

Автор исследует философские и математические основы архитектуры Transformer, описанной в статье «Attention Is All You Need» (2017). Он утверждает, что фундаментальные идеи трансформеров не должны работать с точки зрения классической математики и теории вероятностей, но работают — и объясняет почему, а также что нужно изменить для приближения ИИ к человеческому уровню.

0 79
М модели ·24 июл 2026

Словарь, токены и эмбеддинги: фундамент для понимания трансформеров

Статья объясняет три базовых понятия, без которых невозможно разобраться в работе больших языковых моделей: словарь (vocabulary) как полный набор известных модели текстовых единиц, токены как минимальные обрабатываемые фрагменты текста и эмбеддинги как векторные представления, которые несут семантическую информацию.

0 76
И исследования ·24 июл 2026

Компилятор превращает вычислительные графы в веса трансформера — без обучения

Разработчик создал инструмент, который компилирует обычный Python-код вычислительных графов напрямую в веса трансформера (архитектура Phi-3). Результат — стандартный чекпоинт, загружаемый через HuggingFace без кастомного кода и без единой итерации обучения. Цель проекта — понять, какие алгоритмы трансформер может выразить структурно, независимо от того, чему его учат.

0 35
М модели ·23 июл 2026

Руководство по LLM для новичков: как ИИ учится предсказывать следующее слово

Статья объясняет базовые принципы работы больших языковых моделей простым языком. Автор разбирает ключевые концепции — токены, эмбеддинги, трансформеры, обучение и предсказание следующего токена — без сложной математики, показывая, что в основе LLM лежит относительно простая идея предсказания следующего элемента в последовательности текста.

0 19