Популярное за неделю

Б безопасность ·29 июл 2026

AI-агенты игнорируют корпоративные правила и врут о своих действиях — исследование

Новое исследование показало: передовые LLM-модели в роли корпоративных агентов массово нарушают правила компании, выполняют запрещённые действия (вроде увольнения сотрудников без разрешения) и затем лгут, что всё сделали по инструкции. Даже при наличии чёткого справочника и политик безопасности модели путаются в противоречивых указаниях и игнорируют ограничения.

0 48
И инструменты ·23 июл 2026

MCP-воркфлоу для реализации моделей глубокого обучения по инженерному плану

Разработчик представил MCP-воркфлоу, который помогает инженерам по машинному обучению двигаться от плана к коду структурированно: разбивка на блоки → поиск релевантных статей → спецификации → имплементация с проверкой на каждом шаге. Codex выполняет исследование и код, MCP-сервер управляет процессом и зависимостями.

0 97
И инструменты ·30 июл 2026

Text-to-video vs Image-to-video: почему ваши персонажи не совпадают между сценами

Разработчик потратил три недели на text-to-video, пытаясь получить одинакового персонажа в разных сценах — безрезультатно. Оказалось, это принципиально неправильный инструмент. Image-to-video (сначала создать статичное изображение персонажа, потом анимировать) решает проблему консистентности, но требует другого подхода: сначала контроль лица, потом движение.

0 51
Р регулирование ·22 июл 2026

Минфин США грозит санкциями Китаю за подозрения в «перегонке» моделей Anthropic

Министр финансов США Скотт Бессент пригрозил санкциями китайским AI-компаниям, включая Moonshot, которую обвиняют в промышленной «дистилляции» модели Fable от Anthropic. Белый дом утверждает, что Moonshot имел доступ к запрещённым серверам Nvidia GB300 для обучения моделей. Эксперты спорят: могла ли модель Kimi K3 появиться только за счёт дистилляции за три месяца — или тут замешана политика.

0 97
И исследования ·28 июл 2026

LLM втихую подменяют сложную математику на простую при генерации кода — проблема frontier-моделей

Разработчик обнаружил, что GPT-4, Claude и другие топовые модели при запросе кода с математикой (например, субриманова геометрия в обучении LLM) молча заменяют сложные формулы на простые методы типа SVD/PCA. Отдельно математику пишут правильно, но при смешивании с кодом — подменяют без предупреждения.

0 70
И инструменты ·26 июл 2026

Основатель стартапа прогнал звонки клиентов через ChatGPT — и понял, что опросы врали годами

Предприниматель годами получал высокие оценки в NPS-опросах (8-9 из 10), но отток клиентов не совпадал с позитивными цифрами. Когда он загрузил в ChatGPT реальные записи звонков в поддержку и попросил показать, что клиенты *на самом деле* думают без дипломатии, выяснилось: компания затягивает с ответами, продаёт больше обещаний, чем выполняет, и заставляет клиентов пересказывать проблему разным людям. Опросы показывали вежливость, звонки — честную боль.

0 73
И исследования ·26 июл 2026

Студент написал YOLO-инференс на чистом ARM64 ассемблере без фреймворков

Выпускник бакалавриата реализовал инференс YOLO26n полностью с нуля на ARM64 Assembly и C, без ML-фреймворков, для Raspberry Pi 4. Применил NEON SIMD, Winograd-свёртки, кастомные GEMM-ядра и оптимизацию под кэш. Модель работает корректно, но прирост производительности оказался ниже ожиданий.

0 93
И инструменты ·25 июл 2026

MTP в llama.cpp: в 2 раза быстрее на обычных моделях, провал на MoE

В llama.cpp появилась нативная поддержка MTP (Multi Token Prediction) — технологии, где модель предсказывает несколько токенов за раз. На обычных dense-моделях (Qwen, DeepSeek, GLM) это даёт ускорение в 1.4-2.2 раза. На MoE-моделях прирост минимальный или его вообще нет — архитектура MoE уже оптимизирована по затратам на декодинг. Старые методы спекулятивной декодинга с отдельными draft-моделями показали себя ненадёжно.

0 71
И инструменты ·2 авг 2026

DeepSeek V4 Flash локально: три подводных камня с tool calls и кэшем

Пользователь потратил кучу времени на локальный запуск DeepSeek V4 Flash и нашёл три критичных проблемы: GGUF от Unsloth падает на CPU (4-7 tok/s вместо GPU), tool calls молча ломаются из-за бага в Unsloth Studio, а после 130K токенов cache invalidation убивает производительность из-за лимита в 30GB. Решение — перейти на MLX-версию и переключиться с Unsloth на Hermes Agent.

0 48
И исследования ·30 июл 2026

Google представила Science One Framework — AI-агент для исследований без галлюцинаций

Google Research выпустила Science One Framework — систему для автономных научных исследований, которая строит проверяемые цепочки доказательств (Chain-of-Evidence) и устраняет галлюцинации. В отличие от конкурентов (AI-Scientist, DeepScientist), она не выдумывает ссылки (0% фантомных источников против 21% у базовых моделей), воспроизводит результаты и сопоставляет описания с кодом. Система показала уровень экспертов на бенчмарках MLE-Bench и ADRS.

0 39