Популярное за неделю

И инструменты ·12 авг 2026

Как отследить затраты на Amazon Bedrock по пользователям через Athena и CUDOS

AWS показала, как настроить детальный учёт расходов на Bedrock через Cost and Usage Reports 2.0 с IAM-идентификацией. Теперь можно видеть, кто именно из команды сколько потратил на вызовы моделей, анализировать через SQL в Athena или готовые дашборды CUDOS. Включение отслеживания IAM-принципалов увеличивает размер отчётов, но даёт полную прозрачность.

0 32
И инструменты ·7 авг 2026

Airbnb сократила время разработки на 60% с помощью AI — теперь тестирует AI-поиск для пользователей

Airbnb использует AI для написания 60% кода и сократила цикл разработки функций на 60%. Компания наконец запускает тестирование AI-поиска с переключателем между классическим и языковым интерфейсом. AI-поддержка обрабатывает 45% обращений без людей, снизив затраты на 16%.

0 66
Д другое ·5 авг 2026

Почему хобби-программисты объявили войну LLM: когда процесс важнее результата

Сообщества разработчиков шахматных движков, эмуляторов, языков программирования и демосцены массово отторгают LLM. Причина: в этих нишах ценность — не в работающем коде, а в процессе освоения сложной области. Использование LLM воспринимается как читерство и пропуск самой сути.

0 91
И инструменты ·12 авг 2026

Трёхуровневый KV-кеш для LLM на AWS SageMaker HyperPod: как снизить расходы на инференс без потери скорости

AWS представил архитектуру трёхуровневого KV-кеша для больших языковых моделей на SageMaker HyperPod с распределённой файловой системой Curvine. Решение позволяет переиспользовать кеш между репликами vLLM через общий пул NVMe-дисков, ускоряя time-to-first-token до 2.7 раз и достигая 100% попаданий в кеш. Это позволяет запускать тяжёлые модели на дешёвых G6e-инстансах вместо дорогих P5.

0 17
И инструменты ·3 авг 2026

Twin: AI перестаёт терять память — проект, который учит модели строить понимание, а не пересказывать каждый раз заново

Разработчик создал Twin — opensource-систему, которая не просто сохраняет контекст из Slack/GitHub/документов, а непрерывно синтезирует понимание проектов. Вместо того чтобы каждый раз скармливать LLM гору сообщений и ждать, пока модель соединит точки, Twin делает это заранее. Результат: Claude смог объяснить блокеры релиза и связи между задачами вообще без доступа к исходникам — только через уже собранное Twin понимание.

0 117
Б бизнес ·10 авг 2026

Разработчики AI работают по 90 часов в неделю, пока боссы обещают четырёхдневку

Лидеры AI-компаний (OpenAI, Meta, Anthropic) обещают, что AI сократит рабочее время до 4 дней в неделю. На деле их сотрудники пашут 70-90 часов, работают в выходные и находятся «на подхвате» 24/7. Исследование UC Berkeley показало: AI-инструменты увеличивают темп и объём задач, а не сокращают рабочий день.

0 38
Б безопасность ·11 авг 2026

Уязвимость Claude, GPT и Gemini: как украсть внутренние рассуждения моделей через API

Исследователи нашли способ извлечь зашифрованные reasoning traces (внутренние рассуждения) из API Claude, GPT и Gemini. Используя джейлбрейк слабой модели, можно расшифровать мысли более сильной модели из того же семейства. В публичных логах агентов на GitHub/HF обнаружили 315 тысяч расшифрованных блоков с реальными API-ключами, паролями и личными данными — 64 артефакта существовали только внутри скрытых рассуждений.

0 21
И исследования ·1 авг 2026

ИИ не заменяет профессии — он отменяет саму экономическую ценность человека

ИИ меняет правила игры не так, как паровой двигатель: он не создаёт новые рабочие места, а разрушает саму потребность в человеческом труде. Лидеры отрасли (Хинтон, Бенжио, CEO Anthropic) открыто говорят: через 1-5 лет ИИ уничтожит половину позиций начального уровня, концентрируя власть в руках владельцев моделей. Гонка не остановится, потому что остановиться первым = проиграть. Это не очередная технореволюция, это передача контроля над цивилизацией институтам, которых никто не сможет сдержать.

0 134
М модели ·1 авг 2026

Gemma 4 26B в 2 ГБ — реальность, но заголовок вводит в заблуждение

Проект TurboFieldfare действительно запускает Gemma 4 26B с резидентным использованием ~2 ГБ RAM на Apple Silicon, но это не означает, что модель «поместилась» в 2 ГБ. Система стримит экспертов MoE-модели с SSD (14.3 ГБ), держа в памяти только ядро и KV-кеш. Автор разбирает, почему такой подход работает для MoE, но не для плотных моделей, и почему локальный инференс не всегда дешевле облачного API.

0 127
И инструменты ·3 авг 2026

Как правильно тестировать мультимодальные AI-модели: разбираем PerceptionBench пошагово

Moonshot выпустил PerceptionBench — бенчмарк для тестирования визуального восприятия AI-моделей (OCR, подсчёт объектов, пространственное понимание, галлюцинации). Статья показывает полный пайплайн: от загрузки данных до оценки моделей через API или локально, с автоматическим судейством и статистикой по confidence intervals.

0 105