модели 2 мин

Sakana AI выпустила Fugu-Cyber — модель-оркестратор для кибербезопасности с результатом 86,9% на CyberGym

Японский стартап Sakana AI представил Fugu-Cyber — специализированную модель-оркестратор для задач кибербезопасности. Модель показала 86,9% на бенчмарке CyberGym (поиск уязвимостей) и 72,1% на CTI-REALM (создание правил детектирования угроз), незначительно обогнав GPT-5.5-Cyber и Claude Mythos Preview. Доступ ограничен, требует ручного одобрения, стоит $6–36 за миллион токенов.

Это первая специализированная оркестраторская модель для киберзащиты, которая претендует на превосходство над GPT-5.5 и Claude в реальных security-задачах. Если результаты подтвердятся независимо, это может сдвинуть индустрию от монолитных frontier-моделей к оркестраторским архитектурам в специализированных доменах.

Что выпустили

21 июля 2026 года Sakana AI представила Fugu-Cyber (fugu-cyber-v1.0) — третью конечную точку в семействе оркестраторов Fugu, заточенную под задачи кибербезопасности. Это не новая frontier-модель, а специализированный endpoint поверх оркестратора Fugu, запущенного месяцем ранее.

Результаты

Sakana сообщает о двух ключевых метриках:

  • 86,9% на CyberGym — бенчмарке UC Berkeley из 1507 реальных уязвимостей в open-source проектах. Задача: получить описание бага и непропатченную кодовую базу, написать proof-of-concept эксплойт, который крашит старую версию, но не новую.
  • 72,1% на CTI-REALM — бенчмарке Microsoft для detection engineering. Агент должен проанализировать отчёты об угрозах, сопоставить техники MITRE ATT&CK, изучить телеметрию и сгенерировать валидные Sigma-правила детектирования.

Для контекста: лучшие результаты на CyberGym до этого показали GPT-5.5-Cyber (85,6%) и Claude Mythos Preview (83,1%). Fugu-Cyber их обогнала, но некритично.

Как работает оркестрация

Fugu — сама по себе языковая модель, обученная динамически строить агентский «каркас» под задачу. Она читает запрос, разбивает его на подзадачи и делегирует их специализированным моделям из пула.

Архитектура описана в техническом отчёте Fugu и двух статьях на ICLR 2026: TRINITY (роли Thinker/Worker/Verifier между несколькими LLM) и Conductor (обучение стратегиям координации через reinforcement learning). Для security-задач ключевую роль играет Verifier: он валидирует найденные уязвимости до того, как предложить патч. Маршрутизация — проприетарная, какая модель что делала — непрозрачно.

Доступ и цены

Fugu-Cyber закрыта по четырём осям:

  1. Ручное одобрение: нужно заполнить форму, указать use case и контакты.
  2. AUP: запрещено offensive использование.
  3. Только Token Plan: подписки $20, $100 или $200/месяц (покрывают Fugu и Fugu-Ultra).
  4. Недоступно в ЕС/ЕЭЗ: Sakana работает над соответствием GDPR.

Цены: $6 за миллион входных токенов, $36 — выходных, $0,60 — кешированных. Выше 272K токенов контекста тарифы удваиваются. Это на 20% дороже Fugu-Ultra, причём в задачах с большими кодовыми базами порог 272K преодолевается легко.

Итого

Fugu-Cyber — это не прорыв, а инкрементальное улучшение. Результаты выше лучших аналогов, но ненамного. Все цифры — самостоятельно заявленные и не реплицированные. Sakana подчёркивает: их ставка — на связку «AI-оркестратор + человек-эксперт», а не на API в вакууме.

Ключевые выводы

  • Fugu-Cyber — оркестратор, а не новая frontier-модель, делегирует подзадачи пулу специализированных LLM
  • Результаты 86,9% (CyberGym) и 72,1% (CTI-REALM) обогнали GPT-5.5-Cyber и Claude Mythos, но незначительно
  • Все метрики самостоятельно заявлены Sakana, независимых воспроизведений нет
  • Доступ гейтится: ручное одобрение, запрет на offensive use, недоступно в ЕС
  • Цена $6–36 за млн токенов удваивается после 272K контекста — не редкость для больших кодовых баз

Автор: Ксения Лаврова · Источник: marktechpost.com

Мнение редакции

**Что реально интересно:** Sakana впервые публично применила оркестраторскую архитектуру (TRINITY + Conductor) к кибербезу — и формально обогнала OpenAI с Anthropic на CyberGym. Но дьявол в деталях. Во-первых, все цифры — self-reported, никто не повторил. Во-вторых, разница в 1–3 процентных пункта вполне может быть шумом или особенностями промптинга. В-третьих, модель проприетарная, маршрутизация непрозрачна, весов не дают — чёрный ящик поверх чёрных ящиков.

Но вот что действительно любопытно: Sakana делает ставку на **оркестрацию как продукт**. Не «мы сделали огромную модель», а «мы научили маленькую модель дирижировать ансамблем». Если это окажется рабочей стратегией, мы увидим сдвиг от гонки параметров к гонке координации. Пока же стоит отнестись к анонсу как к громкой заявке, а не доказанному преимуществу. Особенно на фоне гейткипинга доступа и отсутствия EU-compliance — похоже на контроль за нарративом, пока конкуренты не догнали.

Ещё по теме

Комментарии