#оптимизация

И исследования ·18 авг 2026

Apple Research разработала быстрый метод вычисления оптимального транспорта для ML

Исследователи Apple Machine Learning предложили специализированный семигладкий метод Ньютона (SSN) для ядерных оценок оптимального транспорта (OT). Новый подход в разы быстрее стандартного метода внутренних точек (SSIPM), сохраняя статистическую эффективность в задачах сравнения вероятностных мер в высоких размерностях.

0 63
И инструменты ·18 авг 2026

DeepSeek V4 Flash на четырёх RTX 3060: 100 tok/s на 144 ГБ модели с контекстом 360k

Энтузиаст запустил 144 ГБ модель DeepSeek V4 Flash на четырёх потребительских RTX 3060 12GB, добившись скорости обработки промпта ~100 tok/s и контекста 368k токенов. Ключ — экстремальное распределение экспертов MoE по GPU через llama.cpp и агрессивная настройка микробатчей. Показывает, что большие MoE-модели можно разгонять на доступном железе.

0 22
И исследования ·16 авг 2026

Разбор ECA: популярная архитектура внимания работает не так, как думали авторы

Исследователь перепроверил ECA (Efficient Channel Attention) — архитектуру с 12k цитирований — и выяснил, что её центральная гипотеза о важности взаимодействия между каналами не совсем верна. Эксперименты на шахматных данных показали: ECA с ядром k=1 (без кросс-канальной связи) работает почти так же хорошо, как k=3. Это ставит под вопрос объяснение механизма, которое лежит в основе статьи.

0 67
И инструменты ·9 авг 2026

KLQ: квантизация LLM без обучения через измерение геометрии пространства — бьёт SpinQuant на 4 битах

Новый метод квантизации KLQ измеряет важность направлений в пространстве эмбеддингов LLM и распределяет биты неравномерно — даёт больше битов важным направлениям, меньше — второстепенным. На Llama 3.2 1B в режиме W4A4KV4 обходит SpinQuant и почти догоняет ReSpinQuant, при этом не требует дообучения (только проходы по модели для измерений).

0 85
И исследования ·7 авг 2026

Apple сравнила диффузионные и авторегрессионные языковые модели: когда параллельная генерация текста побеждает

Исследователи Apple опубликовали детальное сравнение двух архитектур LLM: классических авторегрессионных моделей (генерируют текст токен за токеном) и диффузионных (генерируют параллельно). Вывод: диффузия работает быстрее на коротких контекстах благодаря параллелизму, но проигрывает на длинных последовательностях и батчах. Ключ к ускорению DLM — сокращение шагов сэмплирования.

0 112
И инструменты ·6 авг 2026

Как ускорить Qwen 35B в 2.4 раза на RTX 3090 без потери скорости генерации

Исследователь показал, как сбросив 8 экспертных слоёв MoE-модели Qwen3.6-35B на CPU, можно увеличить batch-размеры и разогнать prompt processing с 564 до 1330 токенов/сек (2.36×) на RTX 3090, сохранив скорость генерации. Ключ — освобождение VRAM для увеличения батча, а не сам CPU-оффлоад.

0 124
И инструменты ·8 авг 2026

Автоматический синтез и формальная верификация SWAR-трюка для INT4 через Z3 и Lean 4

Разработчик автоматизировал создание битовых оптимизаций для INT4 матричных вычислений: вместо ручного написания кода использовал SMT-решатель Z3 для синтеза алгоритма и доказал его корректность математически через Lean 4. Результат — гарантированно безошибочный брейнчлесс код для платформ без SIMD (WebAssembly, старые ARM).

0 82
И инструменты ·11 авг 2026

Как строить и проверять торговые стратегии через OctoBot: пошаговый туториал с walk-forward бэктестом

Детальный разбор создания торговой стратегии на Python с OctoBot: от автоматического скачивания данных с бирж до grid-поиска по параметрам, walk-forward валидации на out-of-sample и визуализации результатов в Colab. Показан полный цикл: парсинг OHLCV, RSI+EMA+ATR стратегия, изоляция окружения, оптимизация параметров, проверка на переобучение.

0 57
И инструменты ·9 авг 2026

Как снизить VRAM для MiniMax H3 с 15.7 до 4.5 ГБ без потери качества

Энтузиаст заменил 32B CLIP-энкодер MiniMax H3 на 4B-модель Qwen3-VL с линейной проекцией. VRAM упал с 15.7 до 4.5 ГБ, а генерация работает почти так же. Метод: ridge regression для обучения проекции между скрытыми состояниями моделей с общим токенизатором. Код открыт, работает в ComfyUI.

0 65
И инструменты ·3 авг 2026

Запустили DeepSeek V4-Flash (284B) на паре RTX 3090 и подержанном сервере за $6K — 33 токена в секунду

Энтузиаст развернул официальный чекпоинт DeepSeek V4-Flash (284B параметров, 156 ГБ) на железе с eBay: серверная тачка Dell R940 с 4 процессорами Xeon и 768 ГБ DDR4 + две RTX 3090. Выхлоп: 33 токена/сек одному пользователю, 68 в агрегате для четверых. Главная находка — 95% работы делает процессор с памятью, видеокарты задействованы на 25%. Итого реальная альтернатива облакам за ~$6000 на подержанном железе, если вам нужна полная модель, а не перепаковка.

0 127
И инструменты ·2 авг 2026

Хакерская оптимизация DeepSeek-V4: как сэкономить 30 ГБ RAM без потери качества

Энтузиаст TacoTakumi перепаковал DeepSeek-V4-Flash в 3-битный формат, квантизировав только экспертные слои. Результат: 111 ГБ вместо 140+, на 40% быстрее оригинала при частичной загрузке в RAM, качество лучше чем у полной IQ3_S-квантизации. Для тех, кто гоняет большие MoE-модели на разношёрстных GPU и не хочет скатываться до 2-битных квантов.

0 128
И инструменты ·2 авг 2026

Почему смена AI-модели не помогает: дело в контексте, а не в GPT vs Claude

Переключение между GPT и Claude или апгрейд до новой версии редко улучшает результат. Проблема не в модели, а в том, какой контекст вы ей даёте. Три критичных элемента: актуальные факты (которых нет в обучающих данных), конкретные примеры хорошего результата (не описания, а образцы) и напоминание о предыдущих правках. Частая ошибка — не дефицит контекста, а его избыток: 40 страниц текста мешают модели найти нужное.

0 125
И исследования ·6 авг 2026

Можно ли заменить LLM-запросы готовыми ML-пайплайнами? Новый подход к оптимизации AI-систем

Исследователи предлагают заменять повторяющиеся LLM-запросы автоматически созданными пайплайнами из regex, парсеров и классических ML-моделей. Идея: анализировать паттерны работы LLM, синтезировать детерминированные DAG-графы из 41 типа NLP-операций, а сложные кейсы отправлять в LLM как фоллбэк. Цель — снизить затраты и латентность на массовых задачах вроде извлечения структурированных данных из документов.

0 76
И инструменты ·2 авг 2026

Kimi K3 (0.5 петабайта) запустили на одном CPU с 8 ГБ оперативки — голый C99, без GPU

Энтузиаст запустил гигантскую модель Kimi K3 (1.56 ТБ checkpoint) на обычном CPU с 8 ГБ RAM, написав inference-движок на чистом C99. Стриминг экспертов с NVMe, 4-битная квантизация без распаковки, 33 секунды на токен. Никаких фреймворков, GPU или BLAS — только OpenMP и 176 КБ бинарник.

0 116
И инструменты ·7 авг 2026

llama.cpp: новый PR разогнал Q2_0 квантизацию в 3 раза на обычных CPU — 8B модель с 2.4 до 8.2 tok/s

Открытый PR в llama.cpp добавляет VNNI-оптимизацию для Q2_0 квантизации, показывая 3–3.6x рост скорости на x86 CPU. На AMD EPYC 9645 8B модель в декоде разогналась с 2.39 до 8.20 tok/s, на Intel i5-13400 — с 2.17 до 6.92 tok/s. Работает на обычных десктопных процах (12–14 поколение Intel, Zen 4/5), где AVX-512 выключен, а AVX-VNNI есть.

0 57
М модели ·10 авг 2026

Muse Glimmer 30B влезает в RTX 3090 с полным контекстом — тест на реальном железе

Новая модель Muse Glimmer 30B реально работает на одной RTX 3090 (24GB VRAM) с контекстом до 256k токенов, занимая ~22-23GB. Для сравнения: Qwen3.6-27B и Gemma-4-31B на том же железе дают только 70-125k токенов. Скорость 64-124 tok/s с DFlash, тест на 150k токенов прошёл без проблем.

0 26
И инструменты ·31 июл 2026

Точность 4B-модели прыгнула с 60% до 82% из-за дизайна промпта — без изменения весов

Эксперимент показал: одна и та же 4B-модель на задаче классификации Kubernetes-задач выдала точность 60% на плохом промпте и 82% на хорошем. Разница в 22 процентных пункта — только из-за структуры запроса: порядка правил, контекста, количества шагов рассуждений.

0 87
И инструменты ·29 июл 2026

Малые локальные LLM с правильной оркестрацией решают задачи вдвое лучше: исследование на 100 кейсах

Инженер протестировал методы оркестрации на небольших open-source моделях (1.2B–26B параметров). 90% техник не сработали, но оставшиеся 10% удвоили процент выполненных задач — с 15% до 32% на LFM 1.2B, до 56% на Gemma 4 26B. Вывод: проблема малых моделей не в весах, а в плохой инженерной обвязке.

0 107
И инструменты ·26 июл 2026

Рынок AI-инференса: технический разбор и сравнение провайдеров

Автор раскладывает по полочкам экономику и технологию облачного инференса LLM. Объясняет, почему выходные токены дороже входных, как батчинг снижает затраты в 4 раза, и почему сравнивать цены за токен и за GPU-час бессмысленно без учёта утилизации. Приводит конкретные цифры: кто сколько привлёк, кто как быстро растёт, и какие технические трюки применяет.

0 119
И инфраструктура ·30 июл 2026

LinkedIn заморозил расширение дата-центров на год — как они оптимизировали AI-инфраструктуру

LinkedIn не будет увеличивать GPU-мощности и хранилища в 2025 финансовом году. Вместо строительства новых дата-центров компания удвоила эффективность использования существующих GPU за полгода — через оптимизацию моделей, дистилляцию и переброс задач с GPU на CPU. Экономия $24 млн, утилизация GPU >95%.

0 71
И инструменты ·4 авг 2026

2.6B модель с вызовом функций на телефоне: Liquid AI сделала агента для локального запуска

Liquid AI выпустила LFM2.5-2.6B — компактную модель на 2.69B параметров с поддержкой вызова инструментов, 128K контекстом и оптимизацией под агентные задачи. Заявленная скорость: 30 tok/s на телефоне, квантизованная версия весит 1.67 ГБ. По бенчмаркам конкурирует с Qwen3.5-9B в задачах на инструменты, но слабее в коде и знаниях. Позиционируется как дешёвый рабочий агент для рутинных операций локально.

0 44
И инструменты ·23 июл 2026

Сжатие KV-кеша LLM в 8 раз на CPU: инженерия за AdapTQ

Автор создал AdapTQ — открытую C++ библиотеку, которая сжимает KV-кеш больших языковых моделей в 8 раз при работе на обычных CPU (MacBook, Raspberry Pi). Это решает проблему нехватки оперативной памяти при длинных контекстах и ускоряет генерацию токенов благодаря снижению потребности в пропускной способности памяти.

0 123
И инструменты ·3 авг 2026

ARPL: автоопределение железа для llama.cpp на ARM — никакой ручной настройки под чип

Разработчик выложил ARPL — библиотеку для llama.cpp, которая на лету определяет возможности ARM-процессора (ISA-расширения, топологию ядер) и автоматически настраивает модель. Больше не нужно собирать отдельные сборки под каждый телефон — всё работает из коробки на Snapdragon 8 Elite, старых чипах, любых ARM-устройствах.

0 36
И исследования ·25 июл 2026

AMD MI50: при 50W выдаёт 70% производительности, потребляя четверть энергии 190W

Тесты показали: на AMD MI50 для инференса LLM оптимальным оказался режим 50W — почти та же скорость генерации (70% от пика), но втрое эффективнее по энергии. При 20W карта работает в 6 раз экономичнее топовых настроек, хотя обработка промптов падает вдвое.

0 79
И инструменты ·26 июл 2026

Самодельный Triton-бэкенд разогнал 10B-модель до 97 tok/s на RTX 5070

Энтузиаст написал специализированный GPU-бэкенд для запуска 1.58-битной Falcon3-10B, добившись 97.5 токенов/сек на RTX 5070 — почти в 10 раз быстрее стандартного Transformers. Использует упакованные тернарные веса, Triton-ядра и CUDA Graph. Код опубликован, автор ищет независимые проверки на других GPU.

0 74
И инструменты ·23 июл 2026

DFlash превратил 118B-модель на двух RTX 5090 в тормоз: как вернуть скорость или забить на спекуляцию

Энтузиаст запустил огромную MoE-модель Laguna S 2.1 (118B параметров, 71 ГБ) на двух RTX 5090 с технологией DFlash speculative decoding — и она замедлила генерацию в 2,5 раза вместо ускорения. Причина: дефолтные настройки llama.cpp заставляли драфтер генерировать слишком много токенов без уверенности, а верификация каждого токена обходилась дорого из-за оффлоада экспертов в CPU RAM. После тюнинга (ограничение длины драфта, порог уверенности 0.6, квантизация драфтера в Q8) скорость выросла с 23 до 64 tok/s — но это всё равно примерно как без драфта (62 tok/s), так что вывод: на такой конфигурации спекулятивная генерация бесполезна.

0 85
И исследования ·21 июл 2026

Пропусти слой или зациклись: как научить LLM менять глубину вычислений на лету

Исследователи из arXiv показали, что слои предобученных LLM можно динамически пропускать или повторять в зависимости от запроса — без дообучения. Лёгкая сеть-предсказатель генерирует индивидуальный «маршрут» через слои для каждого входа, улучшая точность на математических задачах и одновременно снижая число вычислений.

0 94
И инструменты ·2 авг 2026

DeepSeek V4 Flash ломается при квантизации KV Cache — тесты показали 10% деградацию точности

Пользователь провёл тесты квантизации KV Cache для DeepSeek V4 Flash (BF16 → Q8) и получил значительное падение качества: средний KL divergence вырос до 0.146 (против 0.0036 у Qwen 397B), точность топ-токенов упала до 87% (против 98% у Qwen). Вывод: для DS4F квантизация KV Cache — плохая идея.

0 26
И инструменты ·24 июл 2026

Разработчик ускорил ядро в 29 раз — и получил всего 6% прироста в реальности

Разработчик inference-движка на C99 для тернарных моделей BitNet две недели писал новое матричное ядро с AVX-512, разогнал его в 29 раз по бенчмаркам, но в реальном конвейере прирост оказался всего 6–10%. Причина: модель упирается в пропускную способность RAM (95% загрузки), а не в вычисления — быстрее считать нечего, если данные не успевают подгружаться.

0 74
И инструменты ·22 июл 2026

Почему две видеокарты для LLM загружены только наполовину — и это не поломка

Пользователь разобрался, почему его две GeForce RTX 5060 Ti никогда не грузятся выше 50% при запуске LLM. Причина — в архитектуре послойного разделения модели: карты работают по очереди, а не параллельно. Каждый сгенерированный токен требует прочитать из памяти все 22 ГБ весов модели, и узким местом становится пропускная способность памяти, а не вычисления.

0 86
И исследования ·22 июл 2026

Умер Димитри Берцекас — человек, который научил AI учиться

Скончался профессор MIT Димитри Берцекас (83 года) — один из отцов-основателей теории оптимизации, динамического программирования и обучения с подкреплением. Его учебники и монографии (более 20 книг) стали библией для нескольких поколений специалистов по AI и машинному обучению. Его работы заложили математический фундамент для современного reinforcement learning.

0 81
И инструменты ·4 авг 2026

Llama.cpp ускорили на 4-8% за счёт переноса сэмплинга на GPU

В llama.cpp добавили опцию переноса сэмплирования токенов с CPU на GPU при использовании MTP (multi-token prediction). На RTX 5090 прирост скорости достигает 8%, на старой Tesla P40 — 4%. Это самое заметное улучшение производительности локального инференса за последнее время.

0 18
И инструменты ·26 июл 2026

BeeLlama.cpp v0.4.1: новые способы сжатия KV-кэша для LLM без потери точности

Вышла версия форка llama.cpp с улучшенными алгоритмами квантизации KV-кэша: KVarN (нормализация по дисперсии), precision tail (хранение последних токенов в высоком качестве) и дополнительные типы сжатия q2_0-q6_1. Бенчмарки показывают, что хранение последних 1024 токенов в полной точности позволяет kvarn5 и q6_0 достичь качества q8_0 при меньшем расходе видеопамяти.

0 56
И инструменты ·25 июл 2026

SVDQuant ускоряет Krea 2 вдвое даже на старых NVIDIA GPU — INT8/W4A4 вместо бесполезного FP8

Выпущена квантизованная версия Krea 2 Turbo для ComfyUI, использующая INT8 и W4A4 вместо популярного FP8. Скорость удваивается даже на GPU серий RTX 20/30 (Turing/Ampere), размер модели уменьшается втрое, качество сохраняется. FP8 работает быстро только на новейших Ada/Hopper GPU, на старых картах он фактически откатывается к BF16 и тормозит. Автор замерил это экспериментально и выбрал форматы, поддерживаемые тензорными ядрами начиная с Turing.

0 59
И инструменты ·22 июл 2026

Как выжать 340 токенов в секунду из 204GB MoE-модели на одной видеокарте

Энтузиаст разработал метод запуска огромных MoE-моделей (Kimi 2.7, 204GB) на одной системе через хитрую комбинацию unified memory, кэширования VRAM и выборочной выгрузки экспертов. На DGX Spark достиг 340 токенов/сек на промпте и 9.6 на генерации — в разы быстрее CPU. На обычных 3090 тоже работает, но медленнее из-за узкого PCIe.

0 74
М модели ·28 июл 2026

Алгоритмы спекулятивной генерации: DSpark, DFlash и Multi-Token Prediction

Автогрессивная генерация текста в LLM медленна, потому что каждый токен требует отдельного прохода через модель. Спекулятивная декодировка решает эту проблему: быстрый механизм предлагает несколько токенов-кандидатов, которые основная модель проверяет параллельно за один проход. Статья разбирает три современных подхода к спекулятивной генерации.

0 42
И инструменты ·26 июл 2026

Оптимизация BPE-токенизатора: Часть 1

Автор показывает, как оптимизировать Byte Pair Encoding токенизатор — критически важный компонент языковых моделей, влияющий на скорость генерации первого токена. Статья начинается с наивной реализации BPE, выявляет её узкие места (квадратичная сложность, сдвиги массива, промахи кэша) и предлагает первые оптимизации через использование связного списка в единой аллокации памяти (арена).

0 45
И инструменты ·21 июл 2026

Android-бэкапы теперь съедают лимит Google Drive — как не облажаться

Google начал включать в 15-гигабайтный лимит бесплатного хранилища резервные копии настроек Android и данных приложений. Раньше это место не занимало. В среднем прирост ~40 МБ на пользователя, но если не почистить Google Photos и WhatsApp, можно влететь в платную подписку.

0 43
И инструменты ·26 июл 2026

Разделение Prefill и Decode: когда стоит разбивать инференс на два стека

Все крупные движки инференса LLM теперь поддерживают разделение фаз prefill (обработка промпта) и decode (генерация токенов) на отдельные пулы GPU. Автор объясняет техническую природу этого подхода и главное — когда он действительно нужен, а когда создаёт лишние сложности.

0 20