исследования 1 мин

Трансформер-калькулятор с 100% точностью: кодирование алгоритмов в весах нейросети без обучения

Разработчик вручную записал алгоритм умножения столбиком в веса трансформера, минуя обучение. Результат — 100% точность на числах до 12 знаков, когда GPT-4 и остальные топ-модели на семизначных числах падают до 0% успеха. Инструмент Torchwright компилирует классические алгоритмы в архитектуру Phi-3.

Если вы полагаетесь на LLM для расчётов, цифры или автоматизации с нулевой терпимостью к ошибкам — вы в зоне риска. Проект демонстрирует фундаментальное ограничение трансформеров и намекает, куда двигаться дальше.

Трансформеры плохо справляются с точными вычислениями — факт. Автор проекта решил проверить, можно ли обойти эту проблему, напрямую записав алгоритм умножения в веса модели. Без единой эпохи обучения.

Получился компилятор Torchwright, который берёт вычислительный граф школьного алгоритма умножения и превращает его в чекпоинт Hugging Face для Phi-3. Модель на 3 цифры даёт 100% на всех трёх миллионах примеров. Версия на 12 цифр — тоже полная точность. Для сравнения: шесть топовых моделей (включая GPT-4) на числах из семи знаков дают 0 правильных ответов из 500.

Автор сделал четыре варианта: классический столбик, аппаратный стиль (как в процессорах), вариант с промежуточными записями и грубая сила — заученная таблица. Разный расход слоёв, ширина сети, длина генерации, количество параметров, одна и та же функция.

Код и чекпоинты выложены на GitHub и Hugging Face. Практической пользы для продакшена ноль, зато отличная демонстрация альтернативного подхода: вместо стохастического обучения — явное программирование весов.

трансформерыарифметикапрограммирование весовдетерминированные алгоритмыгибридные AI

Автор: Никита Громов · Источник: reddit.com

Разработчикам. Torchwright позволяет компилировать детерминированные алгоритмы прямо в архитектуру трансформера, минуя обучение. Можно использовать как proof-of-concept для гибридных систем: нейросеть для эвристики, жёстко заданные веса для точных операций. Репозиторий и чекпоинты открыты.

Бизнесу. Показывает фундаментальную слабость LLM в точных вычислениях: на семизначных числах топ-модели валятся в ноль. Для приложений с высокой стоимостью ошибки (финансы, инженерия) это означает, что доверять математику чистым LLM нельзя — нужны внешние инструменты или гибридные схемы.

Инвесторам. Проект подчёркивает ограничения чистых языковых моделей и намекает на рост ниши tool-augmented AI: системы, где LLM вызывает внешние символьные движки для точных операций. Перспективны стартапы, встраивающие детерминированные модули в нейросети для критичных доменов.

Хайп25
Реальная польза40
Заработать30
  • Гибридные AI-системы: LLM для рассуждений, компилируемые детерминированные модули для арифметики, валидации, формальных доказательств
  • Инструменты для программирования весов нейросетей вручную — ниша между классическим кодом и обучением с нуля
  • SaaS для финтеха и инженерных расчётов: LLM-интерфейс + символьный бэкенд, 100% точность на критичных операциях
  • Образовательные платформы: визуализация того, как алгоритмы отображаются в слои трансформера, обучение архитектуре через практику
  • Аудит и верификация AI-моделей: сервисы для проверки математической точности моделей перед деплоем в критичных областях
  • Подход не масштабируется: для каждого алгоритма нужно вручную писать компилятор весов, это дорого и сложно
  • LLM-провайдеры уже решают проблему через tool calling (вызов калькуляторов, code interpreter) — зачем городить компиляцию?
  • Нулевая обобщающая способность: модель умеет только то, что зашито, не может адаптироваться к новым задачам
  • Чисто исследовательский проект, коммерческая ценность под вопросом: заказчикам проще API к Wolfram Alpha, чем кастомный трансформер

Проект — это элегантная пощёчина индустрии LLM: топовые модели не могут умножить семизначные числа, а школьный алгоритм, вшитый в веса, делает это идеально. Вопрос в том, зачем вообще городить компиляцию весов, если можно просто дать модели вызывать Python или Wolfram Alpha через tool calling. Ответ: затем, чтобы показать, что трансформеры — не универсальный растворитель, а очень специфический инструмент.

Практическая ценность близка к нулю, но концептуально это важно. Мы движемся к эпохе гибридных систем: LLM рулит логикой, а точные операции делегирует детерминированным модулям. Torchwright — это proof-of-concept для такой архитектуры, пусть и экстремальный. Если вы делаете AI для финтеха, медицины, инженерии — запомните этот проект как напоминание, что чистой нейросети доверять критичные расчёты нельзя.

Ещё по теме

Комментарии