#LLM

И инструменты ·20 авг 2026

Google даёт настроить Discover-ленту обычным языком вместо кнопок

Google добавляет в мобильное приложение функцию настройки Discover-ленты через чат на обычном языке: можно написать, какие именно темы показывать, а какие скрывать (например, «глубокие обзоры умного дома, но без пресс-релизов»). Лента подстроится сразу и запомнит пожелания.

0 89
И исследования ·20 авг 2026

Эксперимент показал: LLM-скоринг резюме — это лотерея, а не bias

Разработчик переделал исследование LLM-скоринга резюме после критики методологии. Новые тесты на 4800+ прогонах показали: большую часть «предвзятости» создаёт случайный шум, а не реальная дискриминация. Изменение цвета машины в резюме влияет на оценку почти так же, как смена имени или вуза — модели просто нестабильны.

0 44
И инструменты ·14 авг 2026

Классификация через галлюцинации: как LLM помогают тегировать контент без строгих словарей

Дуг Тёрнбулл предложил способ тегирования контента через LLM: модель генерирует теги «из головы», затем векторный поиск по эмбеддингам подбирает ближайшие реальные теги из базы. Саймон Уиллисон тестирует подход для своего блога с 1856 тегами.

0 64
Р регулирование ·13 авг 2026

Почему водяные знаки для AI-текстов бесполезны — и что это значит перед EU AI Act

С августа 2026 года в ЕС вступает в силу требование маркировать весь AI-контент водяными знаками. Google использует SynthID (изменение вероятности выбора токенов), OpenAI/Anthropic, возможно, подменяют юникод-символы. Но любой метод легко обойти редактированием — это фундаментальная проблема текста как сжатого носителя.

0 86
И исследования ·12 авг 2026

Google Research: передовые LLM знают 95% фактов, но не могут вспомнить треть из них

Исследователи Google разработали фреймворк для профилирования знаний LLM и обнаружили: модели вроде Gemini 3 и GPT-5 хранят 95-98% фактов в параметрах, но не могут вспомнить 26-34% из них без подсказок. Проблема не в отсутствии знаний, а в неспособности их извлечь — это меняет подход к улучшению точности моделей.

0 93
И инструменты ·12 авг 2026

Создатель Heretic объяснил, почему его инструмент не работает для обхода цензуры в видеомоделях

Автор популярного инструмента Heretic для разцензуривания LLM публично заявил: использование heretic-моделей как текстовых энкодеров в видеогенераторах (типа Minimax H3) не снимает цензуру, а может ухудшить качество. Heretic меняет внутренние представления моделей через направленную абляцию, но это не делает промпты более детальными для диффузионных моделей.

0 78
И исследования ·12 авг 2026

Автор AI-учебника проверил, когда модели напишут книгу лучше человека — результат неожиданный

Натан Ламберт написал учебник по RLHF и активно использовал LLM как помощников. Вывод: модели отлично ловят опечатки и помогают с LaTeX, но в длинных текстах создают хаос вместо структуры. Прогресс в написании нон-фикшена застопорился, хотя в коде и математике модели растут экспоненциально. Это тревожный сигнал для тех, кто ждёт автономного решения научных задач AI.

0 62
И инструменты ·9 авг 2026

KLQ: квантизация LLM без обучения через измерение геометрии пространства — бьёт SpinQuant на 4 битах

Новый метод квантизации KLQ измеряет важность направлений в пространстве эмбеддингов LLM и распределяет биты неравномерно — даёт больше битов важным направлениям, меньше — второстепенным. На Llama 3.2 1B в режиме W4A4KV4 обходит SpinQuant и почти догоняет ReSpinQuant, при этом не требует дообучения (только проходы по модели для измерений).

0 85
И инструменты ·11 авг 2026

HyperSAE: инструмент для визуализации знаний LLM в виде дерева концепций

Разработчик создал open-source библиотеку HyperSAE, которая извлекает знания из языковой модели и организует их в иерархические деревья концепций, используя гиперболическую геометрию. На Gemma-2-2B показывает 99.8% покрытия фичей против 96.2% у стандартных методов. Доступна через pip install.

0 54
И инструменты ·4 авг 2026

Почему LLM-рецензии портят научную экспертизу: три главные проблемы из практики

Рецензенты всё чаще используют LLM для оценки научных статей, но это создаёт новые проблемы: модели генерируют бесконечный список незначимых придирок, критикуют абстрактно (без конкретных примеров) и путают поверхностное сходство методов с реальным дублированием. Авторы тратят время на опровержение технически возможных, но практически несущественных замечаний.

0 115
Р регулирование ·5 авг 2026

Rust принял политику по использованию LLM в контрибуциях — первая попытка навести порядок в хаосе AI-кода

Пять команд Rust-проекта утвердили политику использования LLM при вкладе в rust-lang/rust. Это не запрет, а свод правил: как можно и нельзя использовать AI при коммитах. Цель — защитить ревьюеров от потока полированного, но бессмысленного кода, когда автор не понимает, что написал. Политика строгая: нужно раскрывать использование LLM, запрещено копипастить ответы AI в обсуждения, а автономные боты — вообще не допускаются.

0 94
Д другое ·5 авг 2026

Почему хобби-программисты объявили войну LLM: когда процесс важнее результата

Сообщества разработчиков шахматных движков, эмуляторов, языков программирования и демосцены массово отторгают LLM. Причина: в этих нишах ценность — не в работающем коде, а в процессе освоения сложной области. Использование LLM воспринимается как читерство и пропуск самой сути.

0 91
И инструменты ·2 авг 2026

Почему смена AI-модели не помогает: дело в контексте, а не в GPT vs Claude

Переключение между GPT и Claude или апгрейд до новой версии редко улучшает результат. Проблема не в модели, а в том, какой контекст вы ей даёте. Три критичных элемента: актуальные факты (которых нет в обучающих данных), конкретные примеры хорошего результата (не описания, а образцы) и напоминание о предыдущих правках. Частая ошибка — не дефицит контекста, а его избыток: 40 страниц текста мешают модели найти нужное.

0 125
И инструменты ·2 авг 2026

LLM выдают уверенные инсайты из данных — но насколько им можно верить?

Разработчик использовал LLM для анализа отзывов клиентов и обнаружил проблему: модель уверенно презентует редкие упоминания (2 из 200 комментариев) как «топовые возражения», наравне с реально частыми паттернами. Вопрос в том, где граница между реальным анализом данных и генерацией «правдоподобного ответа», который звучит убедительно, но не отражает реальность.

0 115
И инструменты ·3 авг 2026

Противоречивые рекомендации AWS по наблюдаемости агентных AI-систем: слои или фазы?

Автор обнаружил противоречие в официальных руководствах AWS по observability агентных AI-систем. Одно руководство рекомендует наблюдать метрики по архитектурным «слоям» (грубозернистые абстракции), другое — по «фазам» выполнения (мелкозернистые шаги). При этом термин «фаза» нигде не определён, хотя используется 127 раз в документе на 770 страниц.

0 104
И исследования ·6 авг 2026

Можно ли заменить LLM-запросы готовыми ML-пайплайнами? Новый подход к оптимизации AI-систем

Исследователи предлагают заменять повторяющиеся LLM-запросы автоматически созданными пайплайнами из regex, парсеров и классических ML-моделей. Идея: анализировать паттерны работы LLM, синтезировать детерминированные DAG-графы из 41 типа NLP-операций, а сложные кейсы отправлять в LLM как фоллбэк. Цель — снизить затраты и латентность на массовых задачах вроде извлечения структурированных данных из документов.

0 76
И инструменты ·30 июл 2026

Не вырывайте из контекста: кормите LLM ровно тем, что ей нужно

Статья о контекст-инжиниринге — новой дисциплине, которая пришла на смену промпт-инжинирингу. Автор объясняет, почему важно наполнять контекстное окно LLM правильной информацией: слишком мало данных ведёт к галлюцинациям, слишком много — к росту затрат, латентности и падению качества.

0 132
М модели ·10 авг 2026

Muse Glimmer 30B влезает в RTX 3090 с полным контекстом — тест на реальном железе

Новая модель Muse Glimmer 30B реально работает на одной RTX 3090 (24GB VRAM) с контекстом до 256k токенов, занимая ~22-23GB. Для сравнения: Qwen3.6-27B и Gemma-4-31B на том же железе дают только 70-125k токенов. Скорость 64-124 tok/s с DFlash, тест на 150k токенов прошёл без проблем.

0 26
И исследования ·29 июл 2026

Слова и есть мышление

Языковые модели не извлекают готовые мысли и не переводят их в слова — они формируют ответ слово за словом, где генерация текста и есть само мышление. Это похоже на то, как люди открывают свои мысли в процессе письма или разговора, а не просто озвучивают заранее сформированные идеи.

0 122
И исследования ·3 авг 2026

Коллапс модели: что происходит, когда ИИ учится на данных, созданных ИИ

Когда языковая модель обучается на собственных выходных данных, происходит постепенное сужение распределения — дисперсия падает, редкие и разнообразные примеры исчезают. К 10-му поколению модель теряет 97,2% вероятностной массы хвостов распределения, становясь узкой и однообразной, хотя формально остаётся корректной.

0 74
И исследования ·28 июл 2026

Могут ли AI-агенты переубедить друг друга?

Автор создал экспериментальную систему «AI-присяжных», рассматривающих вымышленное дело об аварии беспилотного такси. Пять AI-агентов с разными профессиональными бэкграундами голосовали независимо и в режиме прямой коммуникации. При одинаковых доказательствах результат изменился с 2:3 на 3:2 в зависимости от того, могли ли агенты общаться друг с другом.

0 127
И инструменты ·28 июл 2026

Как AI-компании готовят данные из интернета для обучения LLM

Автор показывает на практическом примере, как веб-краулинг превращается в пригодный для обучения корпус. Из 500 скачанных страниц (33.8 MB HTML) после нормализации, извлечения текста, дедупликации и фильтрации остаётся только 286 документов (1.3 MB). Статья объясняет, почему каждый этап конвейера критически важен и почему AI-лаборатории не могут просто скармливать сырой HTML в модель.

0 127
И инструменты ·28 июл 2026

Квантизация по данным, а не по вибрациям: тестирование каждого слоя весов перед сжатием

Разработчик создал инструмент для точного тестирования устойчивости каждой группы весов в нейросети к квантизации, вместо традиционного подхода «применить один битрейт ко всем слоям и надеяться на лучшее». Измеряя KL-дивергенцию для каждой группы отдельно, он выявил, что размер слоя не предсказывает его сжимаемость, нашёл узкий порог в 3.5-3.9 бит/вес, после которого начинается деградация, и обнаружил, что вызовы инструментов (tool calling) ломаются первыми. На основе данных собрал три варианта квантизации Qwen3.6-27B с разным балансом размера и качества.

0 121
Б безопасность ·30 июл 2026

ИИ-мошенники обходят людей в построении доверия жертв — исследование

Учёные из четырёх университетов провели эксперимент: ИИ-чатбот против живого человека в симуляции романтического мошенничества (pig butchering). ИИ выиграл: 46% жертв выполнили его просьбу против 18% у человека, а уровень доверия к боту оказался выше. Вывод: ИИ может автономно вести жертву до момента запроса инвестиций, заменив людей на 90% работы мошеннических колл-центров.

0 89
Б безопасность ·25 июл 2026

Стиль письма как сигнал для слежки в интернете

Автор разбирает техническую основу стилометрии — метода идентификации людей по стилю письма. В отличие от cookies или fingerprinting'а устройств, стилометрический «отпечаток» содержится внутри самого текста и не может быть просто удалён. Современные нейросетевые методы позволяют различать авторов даже по коротким текстам, а LLM-чаты дают провайдерам идеальный корпус помеченных текстов миллионов пользователей.

0 119
И инструменты ·27 июл 2026

Я модифицировал мотоциклы. Теперь модифицирую AI-модели

Автор проводит параллель между своим опытом кастомизации мотоциклов и новым подходом к работе с LLM. Он предлагает фреймворк Model Modding — способ упаковывать поведенческие модификации AI как переиспользуемые, версионируемые и тестируемые компоненты, не меняя весов модели.

0 124
Р регулирование ·25 июл 2026

Debian может запретить код, написанный с помощью AI

Сообщество Debian обсуждает три предложения по использованию LLM в проекте. Самое радикальное — полный запрет вкладов, созданных с помощью генеративного AI, в код, документацию и веб-ресурсы дистрибутива. Аргументы: неясный правовой статус AI-кода, проблемы с качеством, вред сообществу новичков и этические вопросы к обучению моделей на открытых данных.

0 110
И инструменты ·27 июл 2026

Fine-Tuning vs RAG vs Prompting: как выбрать правильный подход

Статья предлагает практическую систему выбора между prompt-инжинирингом, RAG и дообучением LLM-моделей. Автор объясняет, что дообучение меняет поведение модели, RAG — расширяет доступные факты, а промптинг управляет обоими подходами. Главный тезис: fine-tuning — это про форму, а не факты.

0 104
М модели ·27 июл 2026

KAT-Coder-V2.5-Dev обошёл Qwen 3.6 по эффективности в реальных задачах кодирования

Независимое сравнение 35B-моделей для автономного кодирования (120 прогонов) показало: KAT-Coder-V2.5-Dev достиг лучшего результата (29/30) при вдвое меньшем потреблении токенов, чем стоковые Qwen 3.5/3.6. Ornith показал хуже своей базы из-за технических ошибок, а не знаний. Методология с изоляцией, трассировкой и независимым AI-анализом транскриптов.

0 98
М модели ·25 июл 2026

DSpark: спекулятивное декодирование с управлением по уверенности

DSpark — новый метод ускорения генерации текста большими языковыми моделями через спекулятивное декодирование. Система использует параллельную генерацию черновиков (как в DFlash), добавляет лёгкую последовательную голову для учёта зависимостей между токенами и применяет калиброванные оценки уверенности, чтобы верифицировать только те предложенные токены, которые действительно стоят вычислительных затрат целевой модели.

0 108
И исследования ·3 авг 2026

Восхождение базовых моделей

Автор критикует попытки использовать большие языковые модели (LLM) как универсальное решение для всех задач бизнеса и инженерии. Несмотря на восхищение технологией, он объясняет фундаментальное ограничение: LLM работают только с языком как абстракцией реальности, но не моделируют физические процессы, причинно-следственные связи или реальный мир — они лишь статистически предсказывают следующий токен на основе текстовых паттернов.

0 47
Р регулирование ·30 июл 2026

GCC запретил AI-генерированный код в проекте — что это значит для Open Source

Комитет GCC принял политику, запрещающую вклады с AI-генерированным кодом объёмом больше 15 строк из-за авторских рисков. Разрешены LLM для исследований и поиска багов, но не для написания патчей. Сообщество раскололось: одни поддерживают, другие считают, что тайное использование AI всё равно неизбежно.

0 68
И инструменты ·23 июл 2026

Я скормил AI корпоративный гайдлайн по UX-дизайну — и он научился принимать дизайнерские решения

Автор превратил многолетний UX-гайдлайн своей компании в интерактивную «LLM-вики», которая не просто отвечает на вопросы, но синтезирует из разрозненных правил единое дерево решений. Результат: AI теперь может выводить, какой компонент нужен в конкретном контексте, объяснять логику выбора и даже генерировать HTML-прототипы с 70–80% точностью.

0 118
Б безопасность ·3 авг 2026

Как защитить AI-агентов и LLM-приложения в бою: фреймворк от Mend.io

Mend.io выпустили практический гайд по защите AI-агентов, MCP-серверов и LLM-приложений. Главное: традиционная безопасность приложений не работает с агентами — поведение определяется не только кодом, но и моделью, промптами и инструментами. Нужны новые подходы: от поиска теневых агентов до гвардрейлов в рантайме.

0 37
И исследования ·28 июл 2026

Больше половины научных статей пишут с помощью нейросетей — исследование 7,3 млн работ

Крупнейшее исследование PNAS показало: к 2025 году 51% академических публикаций имеют следы использования LLM. Нейросети проникли в науку полностью, причём активнее всего их используют в менее престижных вузах и неанглоязычных странах — это создаёт новое цифровое неравенство в академическом мире.

0 68
Д другое ·24 июл 2026

Канадский депутат зачитал в парламенте инструкцию от ChatGPT вместо речи

Депутат законодательного собрания Нью-Брансуика Билл Оливер случайно прочитал вслух техническую подсказку от языковой модели во время официального выступления. Вместо содержания речи он зачитал фразу вроде «вот более естественная версия этого раздела», которую AI обычно использует при предложении альтернативных вариантов текста. Инцидент остался незамеченным месяц назад, но теперь разлетелся по соцсетям и попал в центральные СМИ.

0 110
И исследования ·27 июл 2026

ИИ переписал 61 000 строк кода за $251 и управил роботом за 9 минут вместо 3 часов

Epoch и METR выпустили бенчмарк MirrorCode, где Claude Opus 4.7 переписал программу на 61 тыс. строк за 14 часов ($251), тогда как человеку понадобилось бы 2-17 недель. Другой тест Anthropic: новая модель автономно справилась с задачами для робота за 9 минут — годом ранее человеку требовалось 181 минуту. Вывод: масштабирование моделей общего назначения автоматически улучшает специализированные навыки — от кодинга до робототехники.

0 68
И исследования ·29 июл 2026

Пределы ИИ: алгоритм не умеет прыгать

Авторы утверждают, что современные LLM структурно неспособны к абдуктивному «прыжку», необходимому для фундаментальных научных открытий. На примере создания Общей теории относительности Эйнштейном они показывают разницу между индукцией (сжатие данных), дедукцией (логический вывод) и абдукцией — генерацией принципиально новых объяснительных гипотез, укоренённых в физической реальности.

0 63
И инструменты ·22 июл 2026

AWS Bedrock, SageMaker или EC2/Kubernetes для инференса LLM: как выбрать

Автор разбирает выбор между тремя AWS-подходами к развёртыванию LLM не как выбор одной платформы, а как систему из семи измерений (гибкость модели, латентность, модель затрат, операционная нагрузка, глубина кастомизации, комплаенс, зрелость команды). Главный тезис: большинство команд на масштабе в итоге используют два варианта одновременно, а инженерная ценность — в умении перемещать нагрузку между ними.

0 102
И исследования ·26 июл 2026

Taobao показала RecGPT-V3: рекомендации на LLM с памятью, гибридной модальностью и скрытым reasoning

Alibaba выпустила технический отчёт о RecGPT-V3 — продакшен-системе рекомендаций для Taobao на базе LLM. Ключевые новшества: постоянная память пользователя (Memory Hub), гибридная работа с текстом и семантическими ID товаров, скрытый reasoning вместо явного chain-of-thought. В A/B-тестах: CTR +1%, GMV +3.97%, потребление ресурсов −52.4%.

0 71
И исследования ·1 авг 2026

Как рассуждает LLM: в чём его мышление отличается от человеческого и почему

Автор разбирает две категории различий между рассуждениями LLM и человека: первые связаны с конкретной архитектурой (отсутствие памяти между сессиями, невозможность пересмотреть уже сказанное) и потенциально устранимы новым дизайном, вторые — это фундаментальные математические ограничения любого алгоритма, доказанные задолго до появления языковых моделей.

0 44
М модели ·26 июл 2026

Стоит ли дообучать LLM в 2025 году?

В 2023 году кастомные дообученные модели (fine-tuning) показывали впечатляющие результаты в специализированных задачах. Но к 2025-му общие модели (GPT-4, Claude и др.) догнали и опередили их благодаря огромным контекстным окнам, reasoning-способностям и технологиям вроде RAG. Автор разбирает, когда дообучение всё ещё имеет смысл, а когда — пустая трата времени.

0 75
И исследования ·28 июл 2026

LLM втихую подменяют сложную математику на простую при генерации кода — проблема frontier-моделей

Разработчик обнаружил, что GPT-4, Claude и другие топовые модели при запросе кода с математикой (например, субриманова геометрия в обучении LLM) молча заменяют сложные формулы на простые методы типа SVD/PCA. Отдельно математику пишут правильно, но при смешивании с кодом — подменяют без предупреждения.

0 70
И инструменты ·21 июл 2026

Что отличает LLM от AI-агента: вопрос на собеседовании для AI-инженера

Статья разбирает классический вопрос собеседования для AI-инженеров: в чём разница между большой языковой моделью (LLM) и AI-агентом. Автор показывает, что поверхностный ответ недостаточен — нужно понимать, как работают вызовы инструментов, циклы агента и продакшен-специфика реализации.

0 113
И исследования ·29 июл 2026

Токены, контекст, параметры: как на самом деле работает большая языковая модель

Статья объясняет техническую архитектуру LLM через три ключевых компонента: токенизацию текста, механизм контекстного окна и структуру параметров нейросети. Автор разбирает, как трансформеры обрабатывают последовательности токенов, почему контекст — это временная рабочая память, а параметры — долгосрочные паттерны, и как attention-механизм позволяет модели предсказывать следующий токен.

0 66
И инструменты ·21 июл 2026

Децентрализованная раздача LLM-моделей через торренты: проект llama.garden

Разработчик создал систему для быстрой децентрализованной раздачи больших языковых моделей через BitTorrent-протокол. Файлы полностью совпадают с версиями на Hugging Face, что позволяет независимо верифицировать модели и избежать цензуры или блокировок со стороны централизованных платформ.

0 101
М модели ·27 июл 2026

Kimi K3 выходит сегодня: 1,4 ТБ весов и суровая математика GPU

Moonshot AI публикует веса модели Kimi K3 (2,8 трлн параметров, 896 экспертов MoE). Команда Qubrid разбирает требования к памяти: на A100 нужно 3 узла, на H200 — два, только B300 с нативной FP4 подходит для одного узла. Обещают тесты производительности на всех трёх конфигурациях к концу недели.

0 53
И инструменты ·2 авг 2026

DeepSeek V4 Flash ломается при квантизации KV Cache — тесты показали 10% деградацию точности

Пользователь провёл тесты квантизации KV Cache для DeepSeek V4 Flash (BF16 → Q8) и получил значительное падение качества: средний KL divergence вырос до 0.146 (против 0.0036 у Qwen 397B), точность топ-токенов упала до 87% (против 98% у Qwen). Вывод: для DS4F квантизация KV Cache — плохая идея.

0 26
Б безопасность ·22 июл 2026

Проблемы LLM и агентного ИИ в кибербезопасности: когда решение само становится проблемой

Статья рассматривает фундаментальные ограничения современных больших языковых моделей при работе с огромными объёмами данных в кибербезопасности. Автор систематизирует технические проблемы: ограниченное контекстное окно, растущую вычислительную сложность, фрагментацию данных и проблемы извлечения релевантной информации — которые мешают LLM эффективно анализировать инциденты безопасности.

0 87
М модели ·28 июл 2026

Kimi K3 — бесплатная 3T-модель, которая меняет расстановку сил

Moonshot AI выпустила Kimi K3 — первую открытую модель с 3 триллионами параметров. Автор проанализировал бенчмарки и утверждает, что реальная ценность K3 не в бесплатности, а в конкретных показателях производительности, которые меняют практические решения разработчиков.

0 51