#CUDA

И инструменты ·24 июл 2026

audio.cpp 0.4: нейросетевой TTS на C++ разгоняется до 10× реального времени

Вышел релиз audio.cpp 0.4 с поддержкой новых TTS-моделей (Higgs Audio v3, Fish Audio S2 Pro) и полноценной работой с форматом GGUF. Квантизация Q8 даёт прирост скорости до 1.5× и экономию видеопамяти до 37% на CUDA. Higgs Audio генерирует речь в 8–10 раз быстрее реального времени, Fish Audio — в 3× на RTX 5090.

0 26
И инструменты ·20 июл 2026

Разработчик выжал 543 токена в секунду из Qwen-35B на одной RTX 5090

Энтузиаст собрал с нуля свой inference-движок NInfer, специально заточенный под Qwen3.6-35B-A3B, и добился ~543 токенов/сек на одной RTX 5090 при генерации 65K токенов. Это достигнуто кастомной квантизацией (~5 bpw), ручной оптимизацией ядер CUDA, fusion'ом операций и draft-механизмом для LM head. Код и веса открыты, но движок работает только с двумя точными чекпоинтами Qwen и только на RTX 5090.

0 44