#latency

И инструменты ·19 авг 2026

Relativity Networks привлекла $22 млн на ускоренное оптоволокно для ЦОДов: как физика решает проблему масштаба AI-инфраструктуры

Relativity Networks привлекла $22 млн и получила заказ на $40 млн от крупного гиперскейлера на hollow-core оптоволокно, которое передаёт данные на 30% быстрее обычного. Это позволяет строить AI-датацентры дальше друг от друга без роста задержек — решение для масштабирования кластеров на сотни акров и несколько кампусов, где каждая микросекунда критична.

0 74
И инструменты ·23 июл 2026

Неделю винил AI-модель, а проблема была в одной вставке в базу данных

Разработчик API для извлечения данных из документов обнаружил, что главный источник задержки — не медленный вызов vision LLM (3 секунды), как он предполагал, а одна операция записи в Postgres, которая занимала 1,2 секунды вместо ожидаемых 50-150 миллисекунд. Детальное профилирование показало, что «очевидный виновник» не всегда оказывается реальной проблемой.

0 116
И инструменты ·26 июл 2026

Разделение Prefill и Decode: когда стоит разбивать инференс на два стека

Все крупные движки инференса LLM теперь поддерживают разделение фаз prefill (обработка промпта) и decode (генерация токенов) на отдельные пулы GPU. Автор объясняет техническую природу этого подхода и главное — когда он действительно нужен, а когда создаёт лишние сложности.

0 20