Hetzner запустил экспериментальный API для LLM-инференса
Немецкий хостер Hetzner открыл бесплатный тестовый API для запуска языковых моделей — пока доступна одна небольшая модель Qwen на 35 млрд параметров, но компания хочет понять, нужен ли рынку ещё один inference-провайдер. Это эксперимент без SLA и гарантий, но с OpenAI-совместимым интерфейсом и неожиданно быстрой скоростью отклика.
Если крупный европейский хостер с репутацией low-cost провайдера войдёт в inference, это может серьёзно изменить ценовую конкуренцию на рынке AI-API и дать альтернативу AWS/GCP для бизнеса, которому нужна европейская юрисдикция и предсказуемые затраты.
Эксперимент с прицелом на будущее

Немецкий хостинг-провайдер Hetzner — известный агрессивными ценами на железо — неожиданно открыл экспериментальный API для LLM-инференса. Это не продакшн-продукт: нет биллинга, SLA или гарантий, доступна только одна модель — Qwen3.6-35B с 3 млрд активных параметров из 35 млрд (Mixture-of-Experts), поддержкой текста и картинок, контекстом 262K токенов и FP8-квантизацией.
API полностью совместим с OpenAI — меняешь base_url в клиенте, подставляешь токен из панели Experiments, и всё работает. В тестах автора (23 июля 2025) скорость была впечатляющей: ~6 сек до первого токена, 130-200+ токенов/сек на выходе, 10К токенов контекста обработаны за ~12 сек. Модель справилась с базовыми задачами, завалила простую арифметику — типичная небольшая LLM.

Зачем это Hetzner?
Ключевая гипотеза: inference на открытых моделях — commodity-рынок, где побеждает тот, кто дешевле. Hetzner умеет покупать железо, эффективно эксплуатировать дата-центры и удерживать маржу на минимуме. Если кто и может превратить inference в очередной low-margin инфраструктурный продукт, то это Hetzner.
Второй момент — утилизация. Арендованный GPU простаивает у одного клиента, а inference-API может размазать нагрузку по флоту и держать железо занятым.
Сейчас компания предлагает в аренду RTX 6000 Ada (48 ГБ) и RTX PRO 6000 (96 ГБ) — подходящие карты для малых/средних моделей, но не для GLM-5 на 754 млрд параметров или других гигантов, требующих B200/B300 и multi-GPU связки. Пока непонятно, есть ли у Hetzner такое железо за кулисами или это появится позже.
Что дальше?
Если эксперимент остановится на одной-двух моделях — это будет просто милый сайд-проект. Но если Hetzner планирует раскатывать флот из B200/B300, каталог моделей и конкурировать с крупными inference-провайдерами, это может изменить расклад сил: европейская локация, репутация, опыт с железом и дата-центрами, агрессивный прайсинг — всё на месте.
Ключевые выводы
- Hetzner открыл бесплатный experimental API для LLM-инференса с OpenAI-совместимым интерфейсом — пока одна модель Qwen 35B
- Тесты показали высокую скорость (130-200+ tok/s), но это не SLA и не гарантия при реальной нагрузке
- Inference на открытых весах — commodity-рынок, где выигрывает тот, кто дешевле эксплуатирует железо
- Hetzner умеет в дешёвую инфраструктуру и может монетизировать свободные GPU-мощности через inference
- Текущее железо (RTX 6000 Ada/PRO) годится для средних моделей, но не для гигантов типа GLM-5 — вопрос, что у них внутри и что будет дальше
Автор: Юлия Тарасова · Источник: hnrss.org
Это классический ход Hetzner: выкатить MVP, посмотреть, кто придёт, и на основе реальной нагрузки принять решение — масштабировать или закрыть. Бизнес-логика понятна: открытые веса может крутить кто угодно, но мало кто умеет делать это так дёшево, как Hetzner. Если они докупят B200/B300 и расширят каталог моделей, это станет реальной угрозой для Replicate, Together AI и прочих inference-провайдеров.
Но пока это именно эксперимент: одна модель, никаких гарантий, zero поддержки. Если вы хотите потыкать API палочкой — welcome, если планируете строить бизнес — рановато. Интереснее другое: Hetzner редко делает что-то просто так. Если они вложились в эту инфраструктуру, скорее всего, уже прикинули экономику и видят там маржу. А когда Hetzner видит маржу, обычно кто-то другой её теряет.
Комментарии