#бенчмарки

И инструменты ·21 авг 2026

Nvidia доказала: важна не модель, а «упряжка» агента — Claude Opus 5 набрал 100% на ARC-AGI-3

Nvidia показала, что для долгосрочных задач AI-агента важнее не сама модель, а «упряжка» (harness) — оболочка с памятью, инструментами и супервизором. Claude Opus 5 без неё дал 30% на бенчмарке ARC-AGI-3, с ней — 100%. OpenAI на том же тесте не дотянул до 10%, даже после твиков.

0 34
М модели ·21 авг 2026

Открытые модели догоняют за полгода вместо двух лет — что это значит для OpenAI и Anthropic

SemiAnalysis измерил скорость сближения открытых и закрытых моделей с 2022 года. Вывод: каждое поколение открытые модели догоняют вдвое быстрее. Llama-2 достиг уровня GPT-3.5 за 2 года, современные китайские модели (GLM 5.3, Kimi K3) приближаются к фронтиру за 6 месяцев. Fireworks обрабатывает 40 триллионов токенов в день — вдвое больше OpenAI API. Но это не крах закрытых лабораторий: каждая новая эра (скейлинг, рассуждения, агенты) даёт фронтиру фору.

0 25
И исследования ·21 авг 2026

Как модели речи «читерят» на бенчмарках: исследование обнаружило переобучение на тестовых данных

Исследователи из Hume AI доказали, что лидеры ASR-бенчмарков заучивают транскрипты тестовых наборов VoxPopuli и LibriSpeech вместо распознавания речи. Модели воспроизводят ошибки референсов даже при противоречащем аудио, используют акустические метки для определения источника данных и галлюцинируют слова в замолченных фрагментах — при том, что их метрики выглядят человекоподобными.

0 129
Б безопасность ·18 авг 2026

Zhipu GLM-5.3: что стоит за громким заголовком о китайской модели, которая «обошла GPT в кибербезопасности»

Китайская Zhipu представила GLM-5.3 — модель для кода и поиска уязвимостей. Заголовки кричат, что она обошла GPT и Claude в поиске багов (84,5% против 83,6-83,8%), но сама компания честно пишет: отрыв — 0,7%, а в эксплуатации уязвимостей модель вдвое отстаёт от Mythos 5. Все тесты запускались в американском агенте Claude Code. Реальная польза — открытые веса и 2436 найденных уязвимостей в open-source проектах. Реальный разрыв — в инструментах, не в моделях.

0 86
И исследования ·15 авг 2026

Лучшие AI-модели проваливают тесты на базовое зрение — GPT-4o достигает только 60% точности

Moonshot AI выпустила PerceptionBench — бенчмарк, который изолированно тестирует визуальное восприятие мультимодальных моделей без примеси логики. Ни одна топовая модель не дотянула до 60% точности. GPT-4o показал лучший результат (59.7%), Kimi K1.5 — 58.5%, Claude Sonnet 3.5 — 57.2%. Открытые модели отстают ещё сильнее. Выяснилось: большинство «ошибок рассуждения» на самом деле происходят на этапе чтения картинки.

0 130
И исследования ·12 авг 2026

Microsoft показала слабое место современных AI: они не понимают, что связано, что внутри, что завязано узлом

Microsoft выпустила бенчмарк MindTopo, который проверяет топологическое мышление AI — понимание связности, вложенности, порядка и узлов. Оказалось: модели могут распознать узел на картинке, но ломаются, когда нужно планировать действия с объектами — теряют понимание структуры после нескольких шагов. Это критично для роботов и интерактивных систем.

0 52
М модели ·9 авг 2026

DeepSeek V4 Flash показал 82,7% на Terminal-Bench 2.1 — независимая проверка подтвердила результаты компании

Автор инструмента Ante независимо проверил заявленные DeepSeek результаты на Terminal-Bench 2.1 (бенчмарк для агентов в терминале). DeepSeek V4 Flash 0731 действительно набрал 82,7% (368 из 445 задач), хотя компания использовала свой закрытый харнес для тестирования. Это редкий случай, когда независимая проверка на публичном инструменте полностью совпала с заявкой производителя модели.

0 106
Б безопасность ·2 авг 2026

Тесты безопасности устаревают быстрее, чем модели

Бенчмарк по безопасности ИИ может давать воспроизводимые результаты и при этом быть бесполезным для принятия решений. Его срок годности определяется не датой релиза модели, а скоростью изменения контекста: определения рисков, паттернов атак, способов использования и окружающей системы.

0 125
И инструменты ·3 авг 2026

Кто-то создал бенчмарк для LLM в виде боксёрского матча: модели дерутся в реальном времени

Разработчик запилил необычный бенчмарк для языковых моделей — виртуальный бокс с уличными правилами. LLM получают данные о матче (плюс визуальный поток при наличии зрения) и принимают решения: атаковать, блокировать, уворачиваться. Автор меряет скорость реакции, адаптивность стратегии и корректность действий вместо классических тестов на решение задач. Модели Gemini Flash уже умеют уклоняться и контратаковать, локальные модели на 5060Ti тормозят из-за медленного инференса.

0 110
И инструменты ·30 июл 2026

MindControl для Llama.cpp: как сократить токены вдвое без потери точности в рассуждениях LLM

Разработчик протестировал MindControl — метод контроля «бюджета рассуждений» для llama.cpp через самоинструкции модели вместо жёсткой обрезки. Результат: снижение потребления токенов на 50% без потери точности на HumanEval+ и LiveCodeBench. Лучший результат (95.7%) получен при максимальных ограничениях — модель не зацикливается на простых задачах.

0 136
И инструменты ·31 июл 2026

Гибридная архитектура в AI (большая модель + локальные воркеры): где реально ломается эффективность

Разработчик поднял вопрос, который все обходят стороной: паттерн «большая модель-оркестратор через API + локальные модели-воркеры» звучит красиво, но где доказательства, что он эффективнее, чем просто одна большая локальная модель? Хочет реальных замеров: когда латентность и overhead оркестратора съедают весь выигрыш.

0 104
М модели ·26 июл 2026

Битва AI-агентов: 90 тестов показали, что дообученные модели не всегда лучше базовых

Разработчик провёл 90 изолированных тестов трёх версий модели Qwen3.6-27B (базовая, ThinkingCap и Fable Fusion) на агентных задачах. Все справились, но с нюансами: ThinkingCap экономичнее на 34% по токенам мышления, но непредсказуемо — лучшие и худшие результаты одновременно. Fable лучше всех исследует, но выдумывает факты (приписал llama-swap не тому разработчику). Базовая модель оказалась самой надёжной и дисциплинированной — ноль галлюцинаций. Вывод: дообучение не всегда улучшает базу.

0 135
И исследования ·26 июл 2026

Математическая олимпиада показала: даже лучшие AI-модели буксуют без «костылей»

Исследователи протестировали разные LLM на задачах Международной математической олимпиады IMO-2026. Топовые модели (o1 и Claude 3.5) справились отлично, но «средний класс» вроде Opus и Sonnet показал слабый результат без специальных надстроек-оркестраторов. Даже с мультиагентными системами они не дотянули до фронтира. Главный вывод: сложная многошаговая логика — всё ещё слабое место для моделей ниже флагманского уровня.

0 132
И исследования ·27 июл 2026

Видеогенераторы назвали world models, но проверяют их по принципу «нравится — не нравится»

Термин «world model» незаметно сменил значение: раньше так называли системы, понимающие физику мира, теперь — любой видеогенератор с хорошим маркетингом. Вендоры вроде Black Forest Labs публикуют внутренние тесты предпочтений (77% пользователей выбрали наше видео против Runway), но эти цифры невоспроизводимы, непроверяемы и ничего не говорят о реальном понимании физики. Когда такие модели подключат к роботам или беспилотникам, процент «красивых» видео не предскажет, как система поведёт себя в реальности.

0 116
И исследования ·30 июл 2026

Как повторные запуски выявляют нестабильность, скрытую за единичной демонстрацией

Одна успешная генерация языковой модели не гарантирует повторяемости результата. Статья показывает, что даже при «детерминированных» настройках (температура=0, фиксированный seed) модели выдают разные ответы на идентичные запросы из-за особенностей API, численной точности и конфигурации инфраструктуры.

0 88
И инструменты ·30 июл 2026

Surya-2 против GOT-OCR 2.0: сравнение двух компактных OCR-моделей на обычном ноутбуке

Автор протестировал две небольшие (~600M параметров) open-source OCR-модели на своём ноутбуке с RTX 4070. Обе можно запускать локально, но они решают противоположные задачи: GOT-OCR устанавливается за пять строк кода и возвращает чистый текст, а Surya-2 требует настройки сервера, зато выдаёт структурированный документ с типизированными блоками и координатами.

0 91
М модели ·26 июл 2026

KAT-Coder-V2.5: AI научили писать код в реальных репозиториях с проверкой на 100 000+ окружений

Команда KwaiKAT из Kuaishou выпустила KAT-Coder-V2.5 — модель для кодинга, которую тренировали не на одиночных примерах кода, а на решении задач в реальных запускаемых репозиториях. Модель проверяется по прохождению тестов в 100 000+ изолированных окружений на 12 языках программирования. Открытая версия KAT-Coder-V2.5-Dev доступна под Apache-2.0 на Hugging Face, а продакшн-версия — через StreamLake.

0 116
И инструменты ·6 авг 2026

Фреймворки для AI-агентов: разница в цене до 3х, в скорости — вдвое

Composio протестировала DeepSeek V4 Flash на четырёх агентских фреймворках (Claude Code, Codex, OpenCode, Oh My Pi) на 30 реальных задачах. Результат: выбор обёртки вокруг модели меняет стоимость в 3 раза, скорость — в 2,2 раза. Claude Code самый быстрый (122 сек), но дорогой ($0.195 за задачу). OpenCode самый дешёвый ($0.073), но медленнее. Oh My Pi лидирует по проценту успешных задач (17/30), но самый медленный (272 сек).

0 30
И исследования ·23 июл 2026

GPT-5.5 провалил новый визуальный тест: 10,6% против 96,1% у людей

Новый бенчмарк ActiveVision показал критический провал передовых AI-моделей в задачах, требующих повторного анализа изображений. GPT-5.5 справился лишь с 10,6% заданий, Claude Fable 5 — с 3,5%, в то время как люди показали 96,1%. Ключевой момент: модели не могут исправить ситуацию даже написав собственный код для решения задач.

0 134
И исследования ·2 авг 2026

Какие AI-модели пишут наименее похоже на «AI-мусор»: бенчмарк 18 моделей

Энтузиаст создал открытый бенчмарк theslopindex.com, проверив 18 AI-моделей на «слопность» текстов — избыточность, шаблонность, характерные обороты. Неожиданный результат: модели, лучшие по механическим метрикам, проигрывают в человеческом восприятии. Fable заняла 2 место по техническим показателям, но последнее по предпочтениям людей.

0 62
И исследования ·24 июл 2026

Битва диффузии и авторегрессии: первое честное сравнение показывает узкую нишу, а не революцию

Лаборатория впервые напрямую сравнила свои диффузионную и авторегрессионную модели одинакового размера. Результат: диффузионная LLaDA2.2 проигрывает на общих знаниях и коде, выигрывает только на агентных задачах с множественными обращениями, зато в 1.6-2.3 раза быстрее. Это не смена парадигмы, а решение для узкой ниши — циклов агентов, где важна скорость декодирования.

0 115
М модели ·30 июл 2026

Kimi K3: слишком велик, чтобы запустить

Автор провёл практический тест Kimi K3 — крупнейшей открытой модели с 2,8 трлн параметров и контекстом на 1 млн токенов. После 11 часов настройки кластера из 4×H100 и 594 ГБ весов выяснилось, что модель в 21 из 41 теста давала неверные ответы, включая полностью выдуманные данные при работе с длинным контекстом.

0 74
И исследования ·29 июл 2026

Мировые модели предсказывают следующий кадр. Переход к реальности — сложнее

Статья разбирает три разных направления развития world models: методы обучения представлений (VISReg), бенчмарки для оценки физической корректности предсказаний и коммерческие применения от интерактивного контента до робототехники. Автор показывает, что «понимание физики» AI — это не одна история, а набор отдельных узких мест на пути от генерации видео к реальному взаимодействию.

0 75
И исследования ·28 июл 2026

Аудит популярных AI-бенчмарков: до 12% вопросов оказались битыми, вышли исправленные версии GPQA, MMLU-Pro и MMMU-Pro

Независимый исследователь проверил ключевые AI-бенчмарки (GPQA, MMLU-Pro, MMMU-Pro) и нашёл до 12% сломанных вопросов с неправильными ответами или неоднозначной формулировкой. После очистки топовые модели достигли ~98% вместо застрявших 92-93%. Выпущены clean-версии датасетов с полным объяснением исправлений.

0 71
И инструменты ·24 июл 2026

Sakana AI утверждает, что её роутер моделей Fugu Ultra v1.1 обходит Fable 5, хотя та даже не в пуле

Японский AI-стартап Sakana выпустил обновление своего роутера моделей Fugu Ultra v1.1, который распределяет запросы между несколькими топовыми AI-моделями. По данным самой компании, производительность выросла на 7,9 пункта, а новая версия якобы превосходит Fable 5, хотя та даже не входит в пул используемых моделей. Независимой проверки пока нет, цена осталась прежней — $5/$30 за миллион токенов.

0 128
М модели ·21 июл 2026

Дешёвый китайский GLM 5.2 раскрывает расточительность западных разработчиков

Китайская лаборатория Z.ai выпустила модель GLM 5.2, которая в несколько раз дешевле американских аналогов (Opus 4.8, Fable), но почти не уступает им в кодинг-бенчмарках. Многие инженеры из США и Европы начали использовать её для простых задач, чтобы сэкономить. Проблема в том, что большинство западных разработчиков до сих пор не следят за расходами на токены — и именно эта привычка «бить по цене» может остаться главным конкурентным преимуществом американских AI-лабораторий.

0 117
И исследования ·1 авг 2026

VLM-модели врут красиво: высокие оценки на бенчмарках скрывают потерю медицинских терминов и галлюцинации

Исследователи обнаружили, что визуально-языковые модели (VLM) при генерации рентгенологических заключений получают высокие оценки на метриках, но при этом удаляют важные клинические термины и добавляют шаблонные фразы без диагностической ценности. Проблема в том, что существующие метрики оценки поощряют повторяющиеся безопасные формулировки вместо клинически полезных отчётов.

0 49
И инструменты ·23 июл 2026

Какой самый дешёвый компьютер потянет локальные LLM? Тест от 0.6B до 8B на Celeron за $100

Энтузиаст проверил, можно ли запускать LLM на дешёвой одноплатной x86-системе за $100–130. Celeron N5095 с 16 ГБ ОЗУ справился с Qwen3 0.6B на 6.8 токен/сек (пригодно для классификации и фоновых задач), но 8B модели работали по 0.9 токен/сек — слишком медленно. Дальше планируется тест через Vulkan на встроенной графике.

0 109
И исследования ·27 июл 2026

ИИ переписал 61 000 строк кода за $251 и управил роботом за 9 минут вместо 3 часов

Epoch и METR выпустили бенчмарк MirrorCode, где Claude Opus 4.7 переписал программу на 61 тыс. строк за 14 часов ($251), тогда как человеку понадобилось бы 2-17 недель. Другой тест Anthropic: новая модель автономно справилась с задачами для робота за 9 минут — годом ранее человеку требовалось 181 минуту. Вывод: масштабирование моделей общего назначения автоматически улучшает специализированные навыки — от кодинга до робототехники.

0 68
И исследования ·21 июл 2026

Могут ли открытые модели Kimi K3 и GLM повторить математические прорывы Claude и o3?

Пользователь Reddit предлагает провести эксперимент: запустить свежие открытые модели (Kimi K3, GLM) на локальных серверах без доступа к интернету и проверить, смогут ли они решить те же математические задачи и найти уязвимости в безопасности, что недавно продемонстрировали закрытые модели от OpenAI и Anthropic. Цель — понять, насколько реальные возможности open-source моделей близки к закрытым флагманам.

0 117
И исследования ·24 июл 2026

Могут ли LLM-модели выбраться из лабиринта? Эксперимент с пространственным мышлением

Энтузиаст создал бенчмарк для проверки пространственного мышления языковых моделей: лабиринт, где ИИ должен найти ключ и выйти через дверь, используя набор команд движения. GPT-4o mini и GLM-4 ходили кругами, K2.6 справился, но потратил 9 млн токенов на решение простой задачи.

0 99
М модели ·21 июл 2026

Laguna-S-2.1 vs Qwen3.5-122B: быстрейшая локальная модель, но врёт под давлением

Разработчик протестировал новую 118B-модель Laguna-S-2.1 против Qwen3.5-122B на 160 задачах для агентов. Laguna показала лучший tool calling и скорость (109 tok/s), но при недостатке данных начинает изобретать факты — называла несуществующих лошадей на скачках и выдумывала цифры P&L. Qwen медленнее, но за 240 попыток ни разу не соврала, честно признавая «не знаю».

0 102
М модели ·27 июл 2026

Gemma 4 и Qwen 3.6 MoE на встроенной графике AMD: тесты показали, почему MoE — это будущее локальных LLM

Энтузиаст протестировал новые модели Gemma 4 и Qwen 3.6 MoE на мини-ПК с APU AMD 6800H (встроенная графика Radeon 680M). Главный вывод: Mixture of Experts (MoE) модели дают скорость маленькой модели при интеллекте большой — Qwen 3.6 35B в 6,5 раз быстрее обычной 31B модели. Квантизация Q4 оптимальна для APU, Q8 убивает производительность, а новые форматы FP4 пока работают хуже обычных.

0 66
И исследования ·25 июл 2026

AMD MI50: при 50W выдаёт 70% производительности, потребляя четверть энергии 190W

Тесты показали: на AMD MI50 для инференса LLM оптимальным оказался режим 50W — почти та же скорость генерации (70% от пика), но втрое эффективнее по энергии. При 20W карта работает в 6 раз экономичнее топовых настроек, хотя обработка промптов падает вдвое.

0 79
И исследования ·28 июл 2026

LLM втихую подменяют сложную математику на простую при генерации кода — проблема frontier-моделей

Разработчик обнаружил, что GPT-4, Claude и другие топовые модели при запросе кода с математикой (например, субриманова геометрия в обучении LLM) молча заменяют сложные формулы на простые методы типа SVD/PCA. Отдельно математику пишут правильно, но при смешивании с кодом — подменяют без предупреждения.

0 70
И исследования ·26 июл 2026

Открытые 4B-модели приблизились к o3 в медицинских тестах на шведском

Исследователь прогнал небольшие открытые LLM через шведские медицинские лицензионные экзамены. Gemma4-E4B и Qwen3.5-4B без дообучения показали 77% точности, а с reasoning — 87%, почти сравнявшись с o3 (88%). Qwen рассуждает на английском, даже если вопросы на шведском, но это не мешает точности.

0 68
И инструменты ·2 авг 2026

DeepSeek V4 Flash ломается при квантизации KV Cache — тесты показали 10% деградацию точности

Пользователь провёл тесты квантизации KV Cache для DeepSeek V4 Flash (BF16 → Q8) и получил значительное падение качества: средний KL divergence вырос до 0.146 (против 0.0036 у Qwen 397B), точность топ-токенов упала до 87% (против 98% у Qwen). Вывод: для DS4F квантизация KV Cache — плохая идея.

0 26
И инструменты ·24 июл 2026

Разработчик ускорил ядро в 29 раз — и получил всего 6% прироста в реальности

Разработчик inference-движка на C99 для тернарных моделей BitNet две недели писал новое матричное ядро с AVX-512, разогнал его в 29 раз по бенчмаркам, но в реальном конвейере прирост оказался всего 6–10%. Причина: модель упирается в пропускную способность RAM (95% загрузки), а не в вычисления — быстрее считать нечего, если данные не успевают подгружаться.

0 74
М модели ·28 июл 2026

Kimi K3 — бесплатная 3T-модель, которая меняет расстановку сил

Moonshot AI выпустила Kimi K3 — первую открытую модель с 3 триллионами параметров. Автор проанализировал бенчмарки и утверждает, что реальная ценность K3 не в бесплатности, а в конкретных показателях производительности, которые меняют практические решения разработчиков.

0 51
М модели ·25 июл 2026

Claude Opus 5: максимальная «вдумчивость» убивает код — Anthropic сама это признаёт

У Claude Opus 5 есть настройка «усилий» от low до max, но выше уровня high качество кода падает. Модель начинает переусложнять, рефакторить не по делу и галлюцинировать чаще. Anthropic сама предупреждает об этом в документации, а независимые тесты подтверждают: на FrontierCode точность снижается, на CodeRabbit — больше придирок, меньше реальных багов. При этом даже на минимальной настройке Opus 5 обгоняет конкурентов.

0 60
И инструменты ·23 июл 2026

Могут ли LLM создавать реальные дата-пайплайны? Многоуровневый бенчмарк для AI-ETL

Авторы проверили 7 популярных LLM на способность генерировать конфигурации ETL-пайплайнов для Apache SeaTunnel. Оказалось, что успешная генерация конфигурации и прохождение статической валидации не гарантируют запуск в продакшене — модели часто создают файлы, которые «выглядят правильно», но не выполняются на реальных данных.

0 69
М модели ·22 июл 2026

Gemini 3.6 Flash: когда улучшение на бумаге не гарантирует апгрейд в продакшене

Google выпустил Gemini 3.6 Flash с улучшениями на бенчмарках и на 17% меньшим расходом токенов. Но ранние тесты показывают возможные регрессии в генерации интерфейсов и пространственном мышлении. Автор предлагает методологию, как правильно тестировать новую модель перед апгрейдом: заморозить промпты и настройки, прогнать на реальных задачах, установить чёткие критерии отказа заранее — и использовать роутинг, а не слепую замену.

0 68
И исследования ·22 июл 2026

Может ли некоммерческая организация воспроизвести оценку frontier-модели при скромном бюджете?

Исследовательский центр TAIRC разбирает, как некоммерческие организации могут проверять заявления разработчиков AI-моделей при ограниченном бюджете. Главный тезис: воспроизвести отдельное измерение возможно и недорого (десятки долларов за API-вызовы), но это не заменяет полноценную валидацию модели, а дорогая часть — не токены, а методология оценки.

0 67
И инструменты ·21 июл 2026

Когда ускорение AI замедляет: бенчмарки Qwen3.6-27B NVFP4 на RTX 5090 показали, где MTP ломается

Энтузиаст протестировал квантованную модель Qwen3.6-27B NVFP4 от Unsloth на одной и двух видеокартах RTX 5090. Выяснилось: технология ускорения MTP (Medusa Tree-based Prediction) даёт +80% скорости на одном запросе с коротким контекстом, но при многопользовательской нагрузке или длинных промптах (32k+ токенов) превращается в тормоз, замедляя генерацию на 20–44%.

0 63
И исследования ·22 июл 2026

Base64 как проверка интеллекта: новый бенчмарк показал корреляцию 0.91 с рейтингом моделей

Разработчик создал Encode Bench — тест, где модели должны решить задачу и вернуть ответ в формате Base64. Неожиданно оказалось, что способность генерировать корректный Base64 коррелирует на 0.91 с Intelligence Index от Artificial Analysis. GPT-5.6 Sol лидирует с 97.2% успешных попыток, а самыми сложными оказались не логические задачи, а именно точное кодирование.

0 60
И инструменты ·22 июл 2026

Почему бенчмарки LLM-инференса врут вам в глаза

Синтетические бенчмарки LLM-фреймворков (с фиксированными промптами и ровной нагрузкой) плохо предсказывают реальную производительность. В продакшене трафик неравномерный, промпты разной длины, и «победитель» рейтинга может проседать под реальной нагрузкой. Статья объясняет, как правильно выбирать фреймворк для инференса, не полагаясь только на tokens/sec в таблице лидеров.

0 64
М модели ·23 июл 2026

Whisper больше не один: новая расстановка сил в открытых моделях распознавания речи

За последний год рынок открытых ASR-моделей превратился из монополии Whisper в конкурентную гонку. Cohere Transcribe, IBM Granite Speech, ARK-ASR и MOSS-Transcribe показывают WER в районе 5%, разница между лидерами — меньше одного процентного пункта. Теперь выбор модели определяют не только точность, но и лицензия, поддержка языков, скорость обработки и стоимость на час аудио.

0 48
М модели ·26 июл 2026

Sakana AI выпустила Fugu-Cyber — модель-оркестратор для кибербезопасности с результатом 86,9% на CyberGym

Японский стартап Sakana AI представил Fugu-Cyber — специализированную модель-оркестратор для задач кибербезопасности. Модель показала 86,9% на бенчмарке CyberGym (поиск уязвимостей) и 72,1% на CTI-REALM (создание правил детектирования угроз), незначительно обогнав GPT-5.5-Cyber и Claude Mythos Preview. Доступ ограничен, требует ручного одобрения, стоит $6–36 за миллион токенов.

0 43
М модели ·31 июл 2026

Корейский стартап на 24 GPU обогнал госпрограммы по ИИ в тесте GPQA Diamond

Модель Darwin-398B от южнокорейского стартапа VIDRAFT заняла третье место в мире и первое в Корее на бенчмарке GPQA Diamond — выпускном тесте по научному мышлению, устойчивом к поиску в интернете. При этом стартап использует всего около 24 GPU, а государственные модели с гораздо большими ресурсами отстают на 4–5 пунктов.

0 17
И исследования ·22 июл 2026

Подгоняют ли AI-лабы модели под «пеликана на велосипеде»?

Блогер Саймон Уиллисон годами тестирует новые LLM одним промптом: «нарисуй SVG пеликана на велосипеде». Эта шутка превратилась в неофициальный бенчмарк, который все ждут на HN. Исследователь проверил гипотезу: не натаскивают ли лабы модели специально на этот запрос? Прогнал 1008 SVG через 7 моделей (48 комбинаций животное+транспорт) и проанализировал с помощью LLM-судьи. Вывод: никаких улучшений конкретно для пеликана не обнаружено, хотя все пеликаны смотрят вправо — возможный артефакт датасетов.

0 40