Cerebras CS-4: удвоение скорости инференса без смены чипа — как это работает и кому нужно
Cerebras выпустил CS-4 — стойку четвёртого поколения на том же 5нм чипе WSE-3, но с удвоенной производительностью за счёт разгона частоты и улучшенного охлаждения. Токены генерируются в 2 раза быстрее при той же стоимости железа. Добавили модульную архитектуру и новый I/O-модуль для гибридных конфигураций с HBM-системами — попытка обойти главный минус Cerebras: малую ёмкость памяти (44 ГБ SRAM на вейфер).
Cerebras показывает, как выжать больше из существующего чипа, не дожидаясь нового процесса — урок для всей индустрии AI-железа. Гибридные архитектуры становятся нормой: будущее инференса — не монолитные системы, а оркестрация разных процессоров под задачу.
Cerebras представил CS-4 — новую стойку на базе того же 5нм чипа WSE-3, что и в предыдущем поколении CS-3. Главное улучшение — удвоение тактовой частоты за счёт увеличения подачи энергии и модернизированной системы охлаждения. Результат: пропускная способность памяти выросла в 2 раза, токены генерируются вдвое быстрее при той же стоимости оборудования.
CS-4 получил модульную архитектуру с выносными «рюкзаками» (backpacks) — каждый содержит один вейфер. В стойке теперь 3 вейфера вместо 2, а инфраструктура охлаждения вынесена за пределы стойки — современные ЦОДы и так поддерживают жидкостное охлаждение. Пропускная способность межвейферного I/O выросла с 1.2 до 2.4 Тбит/с, задержка в сети упала с 5 до 3 микросекунд (прямые связи между вейферами — до 2 мкс).
Новый модульный I/O-интерфейс (обновляемая FPGA-карта) позволяет подключать CS-4 к внешним системам с HBM-памятью (например, Trainium от AWS) в гибридных конфигурациях для инференса. Это попытка обойти главную слабость архитектуры Cerebras — всего 44 ГБ SRAM на вейфер, что не меняется до выхода нового чипа. Такие disaggregated-схемы (разделённое внимание и feedforward между разными процессорами) помогут увеличить эффективную ёмкость памяти.
CS-4 оптимизирован под низкобатчевый инференс (малые batch size), где Cerebras исторически силён благодаря огромной SRAM-пропускной способности.
Автор: Марина Соколова · Источник: newsletter.semianalysis.com
Разработчикам. Новый I/O-модуль упрощает интеграцию с HBM-системами и стандартными сетями (EFA, Ethernet) — можно строить гибридные пайплайны для инференса, обходя лимит 44 ГБ на вейфер. Удвоенная пропускная способность памяти ускоряет низкобатчевые задачи (decode с малым batch), но для expert parallelism сетевые задержки всё ещё узкое место.
Бизнесу. Удвоение токенов в секунду при той же стоимости железа — прямой рост выручки для AI-сервисов без допзатрат на закупку. Модульная конструкция ускоряет развёртывание и снижает сложность производства. Гибридные схемы с AWS Trainium открывают путь к более гибким облачным предложениям.
Инвесторам. Cerebras удерживает нишу сверхбыстрого инференса, но не решил проблему малой памяти — нужен новый чип. Disaggregated-архитектуры с партнёрами (AWS, Groq) могут расширить TAM, но конкуренты (Nvidia, Groq) уже предлагают наносекундные задержки против микросекунд Cerebras. Рост плотности стоек (3 вейфера вместо 2) и упрощение производства — позитив для маржинальности.
- Запустить AI-сервис на CS-4 для realtime-приложений (низколатентный инференс для чатов, код-ассистентов, голосовых помощников) — удвоенная скорость = больше пользователей на том же железе.
- Построить гибридную инфраструктуру CS-4 + HBM-системы (AWS Trainium, GPU) для работы с большими моделями — decode на Cerebras, prefill на GPU.
- Поставлять решения для edge-инференса в финтехе и медицине, где критична задержка и throughput в малых батчах.
- Интегрировать CS-4 в облачные платформы (AWS, Azure) как специализированный инстанс для low-batch inference — новая категория инстансов.
- Разработать инструменты оркестрации для disaggregated inference (маршрутизация между Cerebras и GPU) — middleware-слой для гибридных кластеров.
- Ёмкость памяти 44 ГБ на вейфер не изменилась — жёсткий лимит для больших моделей, пока не выйдет новый чип (WSE-4).
- Конкуренты (Nvidia, Groq, SambaNova) предлагают сетевые задержки в наносекундах против 2-3 микросекунд Cerebras — преимущество Cerebras размывается.
- Disaggregated-схемы усложняют инфраструктуру и требуют тесной интеграции с партнёрами (AWS) — риск vendor lock-in и зависимость от экосистемы.
- Разгон частоты требует больше энергии — рост OPEX на охлаждение и электричество может съесть экономию от удвоения производительности.
CS-4 — классический пример «извлечь максимум из того, что есть». Cerebras не стал ждать 3нм и новый вейфер, а просто удвоил частоту, прокачал охлаждение и упаковал всё в модульную стойку. Для текущих клиентов это win: вдвое больше токенов без допзатрат. Но стратегически это промежуточный ход — малая память (44 ГБ) и микросекундные задержки не дают конкурировать с Nvidia и Groq в широких сценариях.
Новый I/O-модуль и ставка на disaggregated inference — попытка превратить слабость в силу: пусть Cerebras делает decode (где он силён), а prefill и хранение весов отдать GPU с большой памятью. Это разумно, но требует тесной интеграции с партнёрами (AWS, облака) и усложняет инфраструктуру. Если Cerebras быстро выкатит WSE-4 с большей памятью — CS-4 станет мостом к доминированию в low-latency inference. Если затянет — рынок уйдёт к более универсальным решениям.
Комментарии