#производительность

И инструменты ·19 авг 2026

Cerebras CS-4: удвоение скорости инференса без смены чипа — как это работает и кому нужно

Cerebras выпустил CS-4 — стойку четвёртого поколения на том же 5нм чипе WSE-3, но с удвоенной производительностью за счёт разгона частоты и улучшенного охлаждения. Токены генерируются в 2 раза быстрее при той же стоимости железа. Добавили модульную архитектуру и новый I/O-модуль для гибридных конфигураций с HBM-системами — попытка обойти главный минус Cerebras: малую ёмкость памяти (44 ГБ SRAM на вейфер).

0 116
И исследования ·7 авг 2026

Apple сравнила диффузионные и авторегрессионные языковые модели: когда параллельная генерация текста побеждает

Исследователи Apple опубликовали детальное сравнение двух архитектур LLM: классических авторегрессионных моделей (генерируют текст токен за токеном) и диффузионных (генерируют параллельно). Вывод: диффузия работает быстрее на коротких контекстах благодаря параллелизму, но проигрывает на длинных последовательностях и батчах. Ключ к ускорению DLM — сокращение шагов сэмплирования.

0 112
И исследования ·3 авг 2026

Где ИИ реально вредит: исследования показывают замедление работы и рост ошибок

Подборка исследований доказывает: генеративный ИИ снижает точность на 19%, замедляет опытных разработчиков на 19% и дестабилизирует софт. Энтузиасты ИИ игнорируют факты — но цифры говорят сами за себя.

0 121
Б бизнес ·4 авг 2026

Microsoft признала, что Windows 11 раздражает. Но исправят ли?

Microsoft после пяти лет жалоб пользователей наконец-то пообещала исправить Windows 11: убрать лаги в File Explorer, оптимизировать память на 8GB+ системах, ускорить Start и Search. Признали, что годами забивали на базовые вещи ради рекламы и монетизации. Обещания размытые, без цифр, релиз в октябре 2026. Вопрос: поздно спохватились или очередной PR?

0 107
И инструменты ·4 авг 2026

XY: библиотека графиков на Python с Rust-ядром рисует 100 млн точек за 0.08 секунды

Reflex выпустила XY — библиотеку для визуализации данных на Python с движком на Rust. Рендерит интерактивные графики с 10 млн точек в 34 раза быстрее Plotly, экспортирует в HTML весом 258 КБ вместо 259 МБ. Альфа-версия (0.0.1), но уже доступна через pip.

0 69
И инструменты ·31 июл 2026

Гибридная архитектура в AI (большая модель + локальные воркеры): где реально ломается эффективность

Разработчик поднял вопрос, который все обходят стороной: паттерн «большая модель-оркестратор через API + локальные модели-воркеры» звучит красиво, но где доказательства, что он эффективнее, чем просто одна большая локальная модель? Хочет реальных замеров: когда латентность и overhead оркестратора съедают весь выигрыш.

0 104
М модели ·30 июл 2026

Nanbeige4.2-3B: тесты показали провал модели с громкими бенчмарками

Новая 3B-модель Nanbeige4.2 на бумаге обгоняет Qwen3.5-9B и Gemma4-12B, но в реальных задачах проваливается: «петлевая» архитектура удваивает размер в памяти до 6B, контекст пожирает 5+ ГБ VRAM, а «думающий» режим сжигает токены на пустом месте. Провалила два простых кодинговых задания, хотя tool calling работает идеально.

0 109
И инструменты ·27 июл 2026

Speculative decoding на Qwen3.6-27B: чем тяжелее квантизация, тем выше прирост скорости

Бенчмарк speculative decoding на Qwen3.6-27B показал парадоксальный результат: чем меньше сжата модель (Q8 против Q4), тем больший прирост даёт спекулятивная генерация. DFlash — самый быстрый алгоритм в общем случае, MTP — стабильная альтернатива, EAGLE3 и ngram проигрывают. Результаты справедливы для узкого сценария (короткие выходы, один поток), под нагрузкой выигрыш сожмётся.

0 117
И инструменты ·25 июл 2026

AI-ассистенты в разработке и опасность преждевременной уверенности

Автор ставит под сомнение растущую уверенность в том, что AI-инструменты кардинально ускоряют разработку ПО. Даже если код генерируется в 10 раз быстрее, это не означает пропорционального ускорения всего процесса создания софта — ведь разработка включает требования, тестирование, поддержку, коммуникацию и десятки других этапов.

0 123
М модели ·8 авг 2026

MoE-модель Qwen 35B-A3B в 4 раза быстрее dense-модели 27B при почти равном качестве кода

Разработчик сравнил MoE-архитектуру Qwen 35B-A3B с плотной моделью 27B на локальных задачах по кодингу. MoE оказалась в ~4 раза быстрее (116 vs 30 токенов/сек), но разница в качестве кода — минимальная на стандартных задачах. Dense-модель выигрывала только на сложных edge-кейсах с неявными зависимостями.

0 21
М модели ·25 июл 2026

DSpark: спекулятивное декодирование с управлением по уверенности

DSpark — новый метод ускорения генерации текста большими языковыми моделями через спекулятивное декодирование. Система использует параллельную генерацию черновиков (как в DFlash), добавляет лёгкую последовательную голову для учёта зависимостей между токенами и применяет калиброванные оценки уверенности, чтобы верифицировать только те предложенные токены, которые действительно стоят вычислительных затрат целевой модели.

0 108
И инструменты ·3 авг 2026

Парадокс AI-ускорения: почему сверхбыстрая разработка не рождает новые продукты

Разработчики утверждают, что AI ускорил их работу в разы, но пользователи не видят потока новых приложений и сервисов. Почему технологическое ускорение не превращается в рыночные продукты — разбор реальных причин от инфраструктуры до человеческого фактора.

0 47
Б бизнес ·23 июл 2026

Действительно ли ИИ крадёт рабочие места, как обещал Big Tech?

Автор анализирует два исследования: одно показывает рост производительности разработчиков на 26% с AI-ассистентами, другое — падение занятости на 16% среди молодых специалистов в AI-уязвимых профессиях. Ключевой вопрос не в том, заменяет ли ИИ людей, а в том, как рынок реагирует на удешевление производства работы и что происходит с путями входа в профессию для джуниоров.

0 107
И инструменты ·21 июл 2026

DeepSeek V4 на одной B300: всего 770 токенов/сек в vLLM — что не так?

Разработчик получает всего 770 токенов/сек при batch-обработке на DeepSeek V4-Flash с одной GPU B300 через vLLM, хотя ожидал несколько тысяч. Выяснилось, что быстрое MoE-ядро требует несколько GPU, а спекулятивное декодирование DSpark на насыщенном батче снижает производительность вдвое. Ищет советы по оптимизации конфигурации.

0 78
И инструменты ·22 июл 2026

Почему бенчмарки LLM-инференса врут вам в глаза

Синтетические бенчмарки LLM-фреймворков (с фиксированными промптами и ровной нагрузкой) плохо предсказывают реальную производительность. В продакшене трафик неравномерный, промпты разной длины, и «победитель» рейтинга может проседать под реальной нагрузкой. Статья объясняет, как правильно выбирать фреймворк для инференса, не полагаясь только на tokens/sec в таблице лидеров.

0 64
М модели ·23 июл 2026

Whisper больше не один: новая расстановка сил в открытых моделях распознавания речи

За последний год рынок открытых ASR-моделей превратился из монополии Whisper в конкурентную гонку. Cohere Transcribe, IBM Granite Speech, ARK-ASR и MOSS-Transcribe показывают WER в районе 5%, разница между лидерами — меньше одного процентного пункта. Теперь выбор модели определяют не только точность, но и лицензия, поддержка языков, скорость обработки и стоимость на час аудио.

0 48
И инструменты ·26 июл 2026

Оптимизация BPE-токенизатора: Часть 1

Автор показывает, как оптимизировать Byte Pair Encoding токенизатор — критически важный компонент языковых моделей, влияющий на скорость генерации первого токена. Статья начинается с наивной реализации BPE, выявляет её узкие места (квадратичная сложность, сдвиги массива, промахи кэша) и предлагает первые оптимизации через использование связного списка в единой аллокации памяти (арена).

0 45
И инструменты ·24 июл 2026

audio.cpp 0.4: нейросетевой TTS на C++ разгоняется до 10× реального времени

Вышел релиз audio.cpp 0.4 с поддержкой новых TTS-моделей (Higgs Audio v3, Fish Audio S2 Pro) и полноценной работой с форматом GGUF. Квантизация Q8 даёт прирост скорости до 1.5× и экономию видеопамяти до 37% на CUDA. Higgs Audio генерирует речь в 8–10 раз быстрее реального времени, Fish Audio — в 3× на RTX 5090.

0 27