#инференс

И инструменты ·18 авг 2026

Etched удвоила оценку до $21 млрд за месяц: что стоит за бешеным ростом AI-железа

Стартап Etched, делающий специализированные чипы для AI-инференса, за месяц удвоил оценку с $10,3 млрд до $21 млрд после раунда в $700 млн. Инвестор Jane Street сначала протестировал их железо, купил, а потом возглавил раунд. Ключ — два новых компонента: низковольтный чип для prefill (обработка промпта) и кластерная память для decode (генерация ответа).

0 17
И инструменты ·15 авг 2026

Почему быстрый запуск AI-моделей на Mac — это боль: разбор инструментов для Apple Silicon

Разработчик потратил 2 недели, чтобы понять, как оптимально запускать LLM на Mac. Вывод: софт для Apple Silicon — хаос. Нет единого фреймворка с полным набором оптимизаций (prefix caching, speculative decoding и т.д.), в отличие от NVIDIA/CUDA. Новые модели типа Qwen используют гибридный KV-кэш, который ломает привычные подходы. Лучший вариант сейчас — vllm-metal, но и он неполон.

0 42
И инструменты ·2 авг 2026

DeepSeek-V4-Flash на 284 млрд параметров запустили на 5,3 ГБ памяти — как это вообще возможно

Энтузиаст запустил DeepSeek-V4-Flash (284B параметров) на MacBook с 24 ГБ памяти, используя всего 5,3 ГБ оперативки. Секрет — движок Mference, который держит в памяти только активные эксперты MoE-моделей (~13B на токен), остальное подгружает с SSD. Скорость до 5 токенов/сек, 2-битный квант, 91 ГБ на диске.

0 75
И инструменты ·26 июл 2026

Рынок AI-инференса: технический разбор и сравнение провайдеров

Автор раскладывает по полочкам экономику и технологию облачного инференса LLM. Объясняет, почему выходные токены дороже входных, как батчинг снижает затраты в 4 раза, и почему сравнивать цены за токен и за GPU-час бессмысленно без учёта утилизации. Приводит конкретные цифры: кто сколько привлёк, кто как быстро растёт, и какие технические трюки применяет.

0 119
И инструменты ·27 июл 2026

Ling-3.0-flash: обещания поддержки vs реальность — вес-файлы задерживаются, llama.cpp даже не планирует

Ant Group анонсировала Ling-3.0-flash, но вес-файлы ещё не открыты. SGLang обещает поддержку «в день релиза», vLLM ждёт публикации весов, а llama.cpp закрыл запрос на поддержку предыдущей версии (Ling-2.6) как «не планируется». Судя по паттерну предыдущих релизов, веса появятся после окончания бесплатного доступа к API — примерно 3 августа.

0 98
И инструменты ·22 июл 2026

AWS Bedrock, SageMaker или EC2/Kubernetes для инференса LLM: как выбрать

Автор разбирает выбор между тремя AWS-подходами к развёртыванию LLM не как выбор одной платформы, а как систему из семи измерений (гибкость модели, латентность, модель затрат, операционная нагрузка, глубина кастомизации, комплаенс, зрелость команды). Главный тезис: большинство команд на масштабе в итоге используют два варианта одновременно, а инженерная ценность — в умении перемещать нагрузку между ними.

0 102
М модели ·23 июл 2026

Etched: стартап из троих дропаутов Гарварда собрал $300 млн при оценке $10,3 млрд на чипах для AI

Etched, основанный в 2022 году тремя выпускниками Гарварда, привлёк $300 млн в раунде Series C при оценке $10,3 млрд — удвоив стоимость за 7 месяцев. Стартап создал специализированные чипы для ускорения AI-инференса с низковольтажной технологией и общей памятью между чипами. Уже есть заказы на $1 млрд, а скептики, сомневавшиеся в идее чипов под трансформеры, постепенно замолкают.

0 91
И инструменты ·29 июл 2026

Почему AI-моделям нужно так много RAM и VRAM

Статья объясняет, почему память — главное узкое место при работе с AI-моделями, а не процессорная мощность. Автор разбирает, сколько памяти требуется для хранения параметров моделей, в чём разница между RAM и VRAM, и почему GPU не может работать с данными, не помещающимися в его видеопамять.

0 44
И инструменты ·21 июл 2026

Когда ускорение AI замедляет: бенчмарки Qwen3.6-27B NVFP4 на RTX 5090 показали, где MTP ломается

Энтузиаст протестировал квантованную модель Qwen3.6-27B NVFP4 от Unsloth на одной и двух видеокартах RTX 5090. Выяснилось: технология ускорения MTP (Medusa Tree-based Prediction) даёт +80% скорости на одном запросе с коротким контекстом, но при многопользовательской нагрузке или длинных промптах (32k+ токенов) превращается в тормоз, замедляя генерацию на 20–44%.

0 63
И инструменты ·22 июл 2026

Почему бенчмарки LLM-инференса врут вам в глаза

Синтетические бенчмарки LLM-фреймворков (с фиксированными промптами и ровной нагрузкой) плохо предсказывают реальную производительность. В продакшене трафик неравномерный, промпты разной длины, и «победитель» рейтинга может проседать под реальной нагрузкой. Статья объясняет, как правильно выбирать фреймворк для инференса, не полагаясь только на tokens/sec в таблице лидеров.

0 64
М модели ·22 июл 2026

Когда переводчик начинает решать задачи вместо того, чтобы переводить

Разработчик столкнулся с неожиданной проблемой при переводе датасета с рассуждениями: модель Gemma вместо перевода начала решать математические и программистские задачи из текста. Оказалось, что когда данные содержат инструкции, модель может выполнять их вместо основного промпта — особенно при работе с длинными контекстами.

0 47