#токены

И исследования ·21 авг 2026

Экономия на LLM: как сокращение ответа снижает счета в 3 раза, а сокращение промпта делает только хуже

Исследователи протестировали 9 моделей (GPT-4o, Claude, DeepSeek-R1, Qwen и др.) и выяснили: просьба к модели отвечать короче экономит до 3× на API-вызовах без потери точности, а сокращение входного промпта увеличивает расходы на 96% — модель компенсирует длинными ответами. Claude Code уже добавила режим concise output.

0 107
Б бизнес ·27 июл 2026

Apple смотрит, как лопается пузырь ИИ, не особо переживая

Эд Зитрон, один из главных критиков индустрии ИИ, утверждает: экономика больших языковых моделей сломана в корне. Подписчики платят $20, сжигают токенов на сотни долларов, компании вроде OpenAI теряют миллиарды, а дата-центры строятся в долг под клиентов, которых нет. Когда пузырь лопнет, пострадают пенсионные фонды, Oracle рискует разориться, а Apple — останется в стороне.

0 78
М модели ·21 июл 2026

Google выпустил Gemini 3.6 Flash — экономит токены для корпоративных AI-агентов

Google представил Gemini 3.6 Flash и 3.5 Flash-Lite — модели для автономных AI-агентов, которые генерируют на 17–65% меньше токенов, что критично для непрерывных фоновых задач вроде анализа документов или кода. Цена: $1.5 за миллион входных токенов, $7.5 за выходные. Отдельная версия Gemini 3.5 Flash Cyber закрыта для широкого доступа — её используют только правительства и партнёры для автопатча уязвимостей.

0 76
Д другое ·21 июл 2026

Будущее AI-творчества: кто круче промптит или у кого толще кошелёк?

Автор поднимает вопрос: останется ли промпт-инжиниринг ключевым навыком в AI-креативе или победит тот, кто может позволить себе больше токенов и итераций. С ростом стоимости вычислений разрыв между независимыми художниками и студиями может определяться не талантом, а бюджетом на генерацию.

0 41
И инструменты ·23 июл 2026

OpenAI берёт $10 за 1000 веб-поисков и впихивает 17к лишних токенов — разработчик показал, как сэкономить 87%

Разработчик измерил эффективность API веб-поиска OpenAI и обнаружил, что ~87% инжектируемых токенов (около 17 тысяч на запрос) не используются для ответа. Он создал локальный пайплайн с гибридным поиском, реранжированием и сжатием на уровне предложений — точность осталась на уровне 96%, но затраты на токены упали почти в 8 раз. Даже на 16 поисках экономия составила ~$1.50.

0 22
М модели ·23 июл 2026

Руководство по LLM для новичков: как ИИ учится предсказывать следующее слово

Статья объясняет базовые принципы работы больших языковых моделей простым языком. Автор разбирает ключевые концепции — токены, эмбеддинги, трансформеры, обучение и предсказание следующего токена — без сложной математики, показывая, что в основе LLM лежит относительно простая идея предсказания следующего элемента в последовательности текста.

0 19