DeepSeek V4 Flash в 2-битной квантизации первым справился с SQL-тестами на локальной машине
Энтузиаст запустил DeepSeek V4 Flash в агрессивной 2-битной квантизации на двух RTX 3080 и получил 100% на SQL-бенчмарке — то, что раньше удавалось только Claude Opus 4.7 и GPT-5.5 в облаке. Кастомная сборка GGUF с допиленным движком antirez выдала 300 токенов/сек промпта и 11-12 токенов/сек генерации.
Это первое доказательство, что модели уровня Claude Opus можно запускать на потребительском железе без потери качества на сложных задачах. Для разработчиков и компаний это означает новые возможности приватных AI-инструментов без облачных зависимостей.
Что произошло
Пользователь Reddit под ником grumd поднял DeepSeek V4 Flash на паре RTX 3080 с 96 ГБ оперативки и протестировал на реальном SQL-бенчмарке. Использовал кастомную IQ2_M квантизацию (2 бита на вес) с допиленным движком antirez — в итоге модель выдала 100% правильных ответов на 25 задачах, требующих построения SQL-запросов.
До этого момента ни одна локально запускаемая модель не проходила этот тест полностью. На публичном лидерборде 25/25 показывали только Claude Opus 4.7 и GPT-5.5 — облачные сервисы, недоступные для домашнего запуска. Даже тяжёлые Qwen 3.5 122B в высоких квантизациях останавливались на 23-24 из 25.
Технические детали: кастомный GGUF-файл с прививкой тензоров от antirez, модифицированный движок ds4 (не mainline llama.cpp), скорость промпта 300 токенов/сек, генерация 11-12 токенов/сек. Для сравнения: стандартный llama.cpp давал только 100 токенов/сек на промпте и 8 на генерации.
Бенчмарк требует не просто знания SQL-синтаксиса, а умения рассуждать над схемой данных и строить сложные join-ы и агрегации. Это практический тест, близкий к реальным рабочим задачам аналитиков и бэкенд-разработчиков.
Автор: Анна Мельникова · Источник: reddit.com
Разработчикам. Теперь можно гонять сложные SQL-запросы локально без API-лимитов и утечек данных. DeepSeek V4 Flash в 2-битной квантизации умещается в потребительское железо (2x RTX 3080, 96 ГБ RAM) и справляется с задачами уровня Claude Opus. Кастомные движки вроде antirez дают 3x прирост скорости против стандартного llama.cpp — есть смысл копать в оптимизацию инференса.
Бизнесу. Локальное решение для генерации аналитических запросов без отправки схем БД в облако — критично для финтеха, медтеха, корпораций с NDA. Можно встроить в внутренние инструменты BI, заменив дорогие SaaS-подписки на единоразовую покупку железа. Модель в 2 битах означает меньше GPU-серверов и расходов на инфраструктуру.
Инвесторам. DeepSeek демонстрирует качество топовых закрытых моделей при радикально меньших требованиях к железу. Тренд на агрессивную квантизацию (2 бита вместо 4-8) открывает рынок edge AI: модели уровня GPT-4 на ноутбуках и embedded-устройствах. Растут ниши on-premise AI для регулируемых индустрий и приватных дата-центров.
- SaaS для бизнес-аналитиков: генератор SQL-запросов на базе DeepSeek, запускаемый on-premise, подписка 50-200 $/мес на компанию вместо 20 $/мес на юзера у OpenAI
- Консалтинг по внедрению локальных LLM в корпорации: настройка кастомных движков (antirez, ExLlamaV2), оптимизация квантизации под задачи клиента, чек 20-50k $ за проект
- IDE-плагин для автодополнения SQL в стиле Copilot, но работающий локально — продажа лицензий разработчикам, опасающимся утечек корпоративных схем
- Облачный сервис специализированных квантизаций: заказываешь GGUF модель под свою задачу и железо, получаешь оптимизированный бинарник — монетизация как у Replicate, но для квантов
- Hardware-as-a-Service: аренда преднастроенных GPU-серверов с DeepSeek и другими моделями для компаний, которым нужно on-premise, но лень заморачиваться с DevOps
- 2-битная квантизация — это экстремальное сжатие, качество может деградировать на других задачах (не только SQL). Нужны широкие тесты, один бенчмарк не показатель универсальности
- Результат на кастомном движке antirez — нестандартная связка, которую сложно воспроизвести. Mainline llama.cpp даёт в 3 раза хуже перформанс, значит, решение не plug-and-play для большинства
- SQL-бенчмарк из 25 задач — небольшая выборка, возможны случайные совпадения (автор сам отметил, что у одной модели 24/25 — fluke). Без дополнительных данных сложно судить о стабильности
- DeepSeek пока малоизвестен на Западе, нет экосистемы плагинов и готовых решений как у OpenAI/Anthropic — придётся всё пилить самому
Реддитовские энтузиасты снова обогнали корпорации. Пока OpenAI и Anthropic продают доступ к облаку, кто-то запустил аналог их топовых моделей на паре игровых видеокарт — и получил те же результаты. Ключевое слово здесь не DeepSeek (хотя модель явно сильная), а кастомные движки и агрессивная квантизация. Antirez (да, тот самый автор Redis) пилит свой инференс-движок, который втрое быстрее llama.cpp — и это показывает, что официальные тулы ещё далеки от потолка.
Что меня настораживает: один бенчмарк из 25 задач — это не полная картина. SQL-генерация — узкая ниша, и непонятно, как DeepSeek в 2 битах справится с reasoning, математикой или мультиязычностью. Но сам факт, что frontier-модель умещается в 96 ГБ RAM и работает без костылей — это поворотный момент. Для финтеха, медтеха и любых корпораций с NDA локальные LLM перестают быть компромиссом и становятся конкурентным преимуществом.
Комментарии