Sakana AI выпустила Fugu-Cyber — модель-оркестратор для кибербезопасности с результатом 86,9% на CyberGym
Японский стартап Sakana AI представил Fugu-Cyber — специализированную модель-оркестратор для задач кибербезопасности. Модель показала 86,9% на бенчмарке CyberGym (поиск уязвимостей) и 72,1% на CTI-REALM (создание правил детектирования угроз), незначительно обогнав GPT-5.5-Cyber и Claude Mythos Preview. Доступ ограничен, требует ручного одобрения, стоит $6–36 за миллион токенов.
Это первая специализированная оркестраторская модель для киберзащиты, которая претендует на превосходство над GPT-5.5 и Claude в реальных security-задачах. Если результаты подтвердятся независимо, это может сдвинуть индустрию от монолитных frontier-моделей к оркестраторским архитектурам в специализированных доменах.
Что выпустили
21 июля 2026 года Sakana AI представила Fugu-Cyber (fugu-cyber-v1.0) — третью конечную точку в семействе оркестраторов Fugu, заточенную под задачи кибербезопасности. Это не новая frontier-модель, а специализированный endpoint поверх оркестратора Fugu, запущенного месяцем ранее.
Результаты
Sakana сообщает о двух ключевых метриках:
- 86,9% на CyberGym — бенчмарке UC Berkeley из 1507 реальных уязвимостей в open-source проектах. Задача: получить описание бага и непропатченную кодовую базу, написать proof-of-concept эксплойт, который крашит старую версию, но не новую.
- 72,1% на CTI-REALM — бенчмарке Microsoft для detection engineering. Агент должен проанализировать отчёты об угрозах, сопоставить техники MITRE ATT&CK, изучить телеметрию и сгенерировать валидные Sigma-правила детектирования.
Для контекста: лучшие результаты на CyberGym до этого показали GPT-5.5-Cyber (85,6%) и Claude Mythos Preview (83,1%). Fugu-Cyber их обогнала, но некритично.
Как работает оркестрация
Fugu — сама по себе языковая модель, обученная динамически строить агентский «каркас» под задачу. Она читает запрос, разбивает его на подзадачи и делегирует их специализированным моделям из пула.
Архитектура описана в техническом отчёте Fugu и двух статьях на ICLR 2026: TRINITY (роли Thinker/Worker/Verifier между несколькими LLM) и Conductor (обучение стратегиям координации через reinforcement learning). Для security-задач ключевую роль играет Verifier: он валидирует найденные уязвимости до того, как предложить патч. Маршрутизация — проприетарная, какая модель что делала — непрозрачно.
Доступ и цены
Fugu-Cyber закрыта по четырём осям:
- Ручное одобрение: нужно заполнить форму, указать use case и контакты.
- AUP: запрещено offensive использование.
- Только Token Plan: подписки $20, $100 или $200/месяц (покрывают Fugu и Fugu-Ultra).
- Недоступно в ЕС/ЕЭЗ: Sakana работает над соответствием GDPR.
Цены: $6 за миллион входных токенов, $36 — выходных, $0,60 — кешированных. Выше 272K токенов контекста тарифы удваиваются. Это на 20% дороже Fugu-Ultra, причём в задачах с большими кодовыми базами порог 272K преодолевается легко.
Итого
Fugu-Cyber — это не прорыв, а инкрементальное улучшение. Результаты выше лучших аналогов, но ненамного. Все цифры — самостоятельно заявленные и не реплицированные. Sakana подчёркивает: их ставка — на связку «AI-оркестратор + человек-эксперт», а не на API в вакууме.
Ключевые выводы
- Fugu-Cyber — оркестратор, а не новая frontier-модель, делегирует подзадачи пулу специализированных LLM
- Результаты 86,9% (CyberGym) и 72,1% (CTI-REALM) обогнали GPT-5.5-Cyber и Claude Mythos, но незначительно
- Все метрики самостоятельно заявлены Sakana, независимых воспроизведений нет
- Доступ гейтится: ручное одобрение, запрет на offensive use, недоступно в ЕС
- Цена $6–36 за млн токенов удваивается после 272K контекста — не редкость для больших кодовых баз
Автор: Ксения Лаврова · Источник: marktechpost.com
**Что реально интересно:** Sakana впервые публично применила оркестраторскую архитектуру (TRINITY + Conductor) к кибербезу — и формально обогнала OpenAI с Anthropic на CyberGym. Но дьявол в деталях. Во-первых, все цифры — self-reported, никто не повторил. Во-вторых, разница в 1–3 процентных пункта вполне может быть шумом или особенностями промптинга. В-третьих, модель проприетарная, маршрутизация непрозрачна, весов не дают — чёрный ящик поверх чёрных ящиков.
Но вот что действительно любопытно: Sakana делает ставку на **оркестрацию как продукт**. Не «мы сделали огромную модель», а «мы научили маленькую модель дирижировать ансамблем». Если это окажется рабочей стратегией, мы увидим сдвиг от гонки параметров к гонке координации. Пока же стоит отнестись к анонсу как к громкой заявке, а не доказанному преимуществу. Особенно на фоне гейткипинга доступа и отсутствия EU-compliance — похоже на контроль за нарративом, пока конкуренты не догнали.
Комментарии