#GPU

И инструменты ·18 авг 2026

ByteDance научил LLM писать CUDA-код быстрее компилятора: 2.11× против torch.compile

ByteDance и Tsinghua AIR выпустили CUDA Agent — систему RL, которая учит большую языковую модель генерировать GPU-ядра быстрее стандартного компилятора. На бенчмарке из 250 задач модель обгоняет torch.compile в 96.8% случаев с ускорением 2.11× в среднем, доказав, что LLM могут оптимизировать низкоуровневый код на уровне экспертов.

0 117
Б бизнес ·13 авг 2026

Nvidia ставит $500 млрд на вторичный рынок GPU — рискованная игра или новая эра AI-железа

Nvidia привлекла BlackRock, Goldman Sachs и других на $500 млрд под строительство AI-датацентров, гарантируя стоимость своих GPU как залога. Компания обещает покрыть до 25% падения цены на чипы, создавая вторичный рынок старого железа. Это снимает риски для инвесторов, но создаёт «обратный риск» для Nvidia — чем слабее спрос, тем больше обязательств.

0 136
И инструменты ·11 авг 2026

Энтузиаст снял полноценный эпизод Star Trek на RTX 5090 за один день — с синхронизацией губ и голосами внутри модели

Пользователь создал 20-минутный пародийный эпизод Star Trek: The Next Generation на локальной модели MiniMax H3 (INT8, одна RTX 5090). Все голоса, звуки и синхронизация губ — внутри модели, без отдельных TTS-пайплайнов типа ElevenLabs или wav2lip. Поделился рабочими приёмами: как писать промпты для многокадровых сцен, почему негативные промпты не работают и как избежать рандомных лиц.

0 63
И инструменты ·12 авг 2026

Discovered Materials запускает AI-агентов для разработки новых материалов для чипов: как решить тепловую проблему GPU

Стартап из YC создаёт AI-агентов, которые открывают новые материалы для полупроводниковой индустрии. Проблема: GPU греются всё сильнее (H100 — 700W, Blackwell — 1.2 кW, Rubin — 2.3 kW), а существующие материалы не справляются с отводом тепла. За 3 месяца команда синтезировала термоинтерфейсы, которые по характеристикам сравнимы с секретными разработками химических гигантов последних 20 лет. Релизят сотни новых материалов и бенчмарк для моделей.

0 30
И инструменты ·10 авг 2026

AWS запустил SageMaker AI Spaces для EKS — управляемые IDE прямо в кластере Kubernetes

Amazon выпустил SageMaker AI Spaces — аддон для EKS, который разворачивает JupyterLab и Code Editor прямо в Kubernetes-кластере. Вместо 3-5 дней настройки отдельного JupyterHub дата-сайентист получает готовую среду за 5 минут, с доступом к GPU, общему хранилищу и IAM-ролям. Консолидация рабочих нагрузок может поднять утилизацию GPU на 30% и избавить от постоянно включенных дорогих инстансов для ноутбуков.

0 42
Б бизнес ·11 авг 2026

Nvidia гарантирует остаточную стоимость своих чипов ради $500 млрд инвестиций в AI-инфраструктуру

Nvidia договорилась с шестью финансовыми гигантами о привлечении $500+ млрд для AI-датацентров, фабрик и электростанций. Чтобы сделка работала, Nvidia гарантирует до 25% остаточной стоимости своих GPU — по сути, страхует кредиторов от обесценивания железа. Критики типа Майкла Бёрри считают быстрое устаревание чипов слабым местом всего AI-бума.

0 23
И инструменты ·1 авг 2026

Три бага PyTorch убили ComfyUI на Quadro RTX 6000. Разбор с кодом и фиксами

Разработчик восемь часов искал, почему ComfyUI выдаёт чёрные картинки на Quadro RTX 6000. Нашёл три независимых бага: переполнение FP16 в torch.mm() (PyTorch 2.12+), несовместимость аллокатора памяти на Turing и физический дефект VRAM. Выложил фиксы и диагностические скрипты на GitHub.

0 106
М модели ·10 авг 2026

Muse Glimmer 30B влезает в RTX 3090 с полным контекстом — тест на реальном железе

Новая модель Muse Glimmer 30B реально работает на одной RTX 3090 (24GB VRAM) с контекстом до 256k токенов, занимая ~22-23GB. Для сравнения: Qwen3.6-27B и Gemma-4-31B на том же железе дают только 70-125k токенов. Скорость 64-124 tok/s с DFlash, тест на 150k токенов прошёл без проблем.

0 26
И инструменты ·26 июл 2026

Рынок AI-инференса: технический разбор и сравнение провайдеров

Автор раскладывает по полочкам экономику и технологию облачного инференса LLM. Объясняет, почему выходные токены дороже входных, как батчинг снижает затраты в 4 раза, и почему сравнивать цены за токен и за GPU-час бессмысленно без учёта утилизации. Приводит конкретные цифры: кто сколько привлёк, кто как быстро растёт, и какие технические трюки применяет.

0 119
И инфраструктура ·30 июл 2026

LinkedIn заморозил расширение дата-центров на год — как они оптимизировали AI-инфраструктуру

LinkedIn не будет увеличивать GPU-мощности и хранилища в 2025 финансовом году. Вместо строительства новых дата-центров компания удвоила эффективность использования существующих GPU за полгода — через оптимизацию моделей, дистилляцию и переброс задач с GPU на CPU. Экономия $24 млн, утилизация GPU >95%.

0 71
Б бизнес ·28 июл 2026

Nvidia инвестирует в лабораторию Ильи Суцкевера и переводит SSI с чипов Google на свои GPU

Nvidia вложила крупную сумму в Safe Superintelligence — стартап бывшего главного учёного OpenAI Ильи Суцкевера. В рамках партнёрства SSI получает доступ к GPU-платформе следующего поколения Vera Rubin, что увеличит вычислительную мощность в 10 раз. До этого лаборатория работала в основном на чипах Google TPU.

0 94
Б бизнес ·30 июл 2026

CoreWeave заходит в закрытые дата-центры Пентагона и разведки США

CoreWeave вместе с оборонным подрядчиком Leidos запускает специализированное AI-облако для американских спецслужб и военных — инфраструктура для тренировки и инференса моделей будет работать внутри центров обработки данных с допуском к секретным материалам. Это первый случай, когда коммерческий AI-провайдер такого масштаба официально заходит в закрытый госсектор.

0 47
М модели ·27 июл 2026

Kimi K3 выходит сегодня: 1,4 ТБ весов и суровая математика GPU

Moonshot AI публикует веса модели Kimi K3 (2,8 трлн параметров, 896 экспертов MoE). Команда Qubrid разбирает требования к памяти: на A100 нужно 3 узла, на H200 — два, только B300 с нативной FP4 подходит для одного узла. Обещают тесты производительности на всех трёх конфигурациях к концу недели.

0 53
И инструменты ·22 июл 2026

Почему две видеокарты для LLM загружены только наполовину — и это не поломка

Пользователь разобрался, почему его две GeForce RTX 5060 Ti никогда не грузятся выше 50% при запуске LLM. Причина — в архитектуре послойного разделения модели: карты работают по очереди, а не параллельно. Каждый сгенерированный токен требует прочитать из памяти все 22 ГБ весов модели, и узким местом становится пропускная способность памяти, а не вычисления.

0 86
И инструменты ·4 авг 2026

Llama.cpp ускорили на 4-8% за счёт переноса сэмплинга на GPU

В llama.cpp добавили опцию переноса сэмплирования токенов с CPU на GPU при использовании MTP (multi-token prediction). На RTX 5090 прирост скорости достигает 8%, на старой Tesla P40 — 4%. Это самое заметное улучшение производительности локального инференса за последнее время.

0 18
И инструменты ·29 июл 2026

Почему AI-моделям нужно так много RAM и VRAM

Статья объясняет, почему память — главное узкое место при работе с AI-моделями, а не процессорная мощность. Автор разбирает, сколько памяти требуется для хранения параметров моделей, в чём разница между RAM и VRAM, и почему GPU не может работать с данными, не помещающимися в его видеопамять.

0 44
И инструменты ·26 июл 2026

Разделение Prefill и Decode: когда стоит разбивать инференс на два стека

Все крупные движки инференса LLM теперь поддерживают разделение фаз prefill (обработка промпта) и decode (генерация токенов) на отдельные пулы GPU. Автор объясняет техническую природу этого подхода и главное — когда он действительно нужен, а когда создаёт лишние сложности.

0 20
М модели ·26 июл 2026

Kimi K3 — самая большая открытая модель в истории. Почти никто не может её запустить

Moonshot AI выпустила открытую модель Kimi K3 с 2,8 трлн параметров — крупнейшую в истории. Однако из-за огромного размера (1,4 ТБ весов даже в 4-битном квантовании) её практически невозможно запустить на собственном железе. Сама компания приостановила подписки из-за нехватки GPU для обслуживания спроса.

0 19
И инструменты ·23 июл 2026

Nvidia отправляет свои чипы на Луну: первый GPU для лунных роверов

Стартап Lunar Outpost установит чипы Nvidia Jetson на свои лунные роверы для обработки данных лидара — это могут быть первые GPU на поверхности Луны. NASA платит частным компаниям за изучение Луны перед возвращением астронавтов в 2028 году, и GPU могут стать ключом к созданию автономных робосистем в экстремальных космических условиях.

0 24