#инференс

И инструменты ·21 июл 2026

Speculative decoding на Qwen3.6-27B: DFlash даёт 3.3× ускорение против базы

Энтузиаст протестировал четыре метода speculative decoding (DFlash, MTP, EAGLE3, ngram) на модели Qwen3.6-27B в SGLang и vLLM на одной видеокарте RTX PRO 6000. DFlash показал лучший результат — ускорение в 3.3 раза, MTP/NEXTN — до 2.8×, EAGLE3 — 1.9×, ngram — 1.1–1.3×. Попутно обнаружил несовместимости и баги в обоих фреймворках.

0 119
И инструменты ·17 июл 2026

Первый кредит под залог AI-чипов для инференса: $400 млн на свободу от Nvidia

Стартап General Compute получил $400 млн кредита под залог специализированных чипов для инференса — впервые в истории. Финансисты, которые в 2021-м первыми дали деньги под GPU, теперь ставят на альтернативы Nvidia: инференс на open source моделях дешевле, чем новейшие LLM от лидеров рынка. Сделка сигнализирует: рынок переключается с дорогого обучения моделей на массовый и доступный запуск уже готовых.

0 166