модели 1 мин

Лучший результат Thinking Machines получен на Qwen3, а не на их собственной Inkling. Насколько важна базовая модель?

Thinking Machines активно продвигает свою модель Inkling, но их главный публичный успех (кейс Bridgewater с точностью 84.7% на финансовых задачах) достигнут на базе Qwen3-235B. Сама Inkling показывает смешанные результаты на бенчмарках: лидирует только по следованию инструкциям (IFBench), но уступает DeepSeek V4 Pro и GLM 5.2 на большинстве других тестов.

Кейс показывает, как маркетинг может размывать границу между успехом технологии (fine-tuning) и конкретного продукта (модели). Для практиков это сигнал копать глубже в публичные данные, прежде чем выбирать базовую модель для дообучения.

Маркетинг vs реальность

Thinking Machines активно продвигает свою модель Inkling и кейс-стади с хедж-фондом Bridgewater как доказательство превосходства специализированных моделей над «frontier» гигантами. Проблема в том, что самый впечатляющий публичный результат получен вообще не на Inkling.

Кейс Bridgewater, который все цитируют как главное доказательство: 84.7% точности на шести задачах фильтрации финансовых документов, при этом затраты на инференс в 13.8 раз ниже топовых моделей. Звучит отлично, но базовой моделью была Qwen3-235B, а не Inkling. И опубликован этот результат за две недели до релиза самой Inkling.

Что показывают бенчмарки

Результаты Inkling на публичных тестах неоднозначны:

  • AIME 2026 (математика): 97.1% — хорошо, но все в списке выше 94%, а лидеры (Fable 5, GPT-5.6 Sol) показывают 99.9%
  • HLE text-only: 29.7% — впереди только Nemotron 3 Ultra, проигрывает GLM 5.2, DeepSeek V4 Pro и обеим моделям Kimi
  • SWEBench Pro / Terminal Bench 2.1: та же картина — бьёт Nemotron и Kimi K2.5, уступает Kimi K2.6, GLM 5.2 и DeepSeek V4 Pro
  • IFBench (следование инструкциям): 79.8% — здесь Inkling действительно лидирует, уступая только Nemotron 3 Ultra

Два разных утверждения

Важно разделять:

  1. Tinker (метод fine-tuning от Thinking Machines) может превратить открытую модель в сильного специалиста — подтверждается публичными данными
  2. Inkling — хорошая база для этого — публичных доказательств пока нет

Для практиков вопрос остаётся открытым: стоит ли экспериментировать с Inkling (41B активных параметров, сильная по IFBench) или безопаснее брать Qwen/Kimi с их проверенным поведением при дообучении.

Ключевые выводы

  • Самый публичный успех Thinking Machines достигнут на Qwen3-235B, а не на собственной модели Inkling
  • Inkling показывает смешанные результаты: лидирует только по следованию инструкциям (IFBench), но уступает на большинстве других бенчмарков
  • Публичные данные подтверждают эффективность метода Tinker для fine-tuning, но не превосходство Inkling как базовой модели
  • Для задач финансовой аналитики специализированная дообученная модель показала затраты на инференс в 13.8 раз ниже frontier-моделей при сопоставимой точности
  • В маркетинговых материалах часто смешиваются два разных утверждения — об эффективности метода и о качестве конкретной модели

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

**История классическая**: стартап делает громкое заявление, пресса подхватывает одну цифру (97.1% на AIME), а дьявол в деталях. Да, Tinker как метод fine-tuning работает — кейс Bridgewater это подтверждает. Но там-то использовали Qwen3, а не саму Inkling. И это принципиально.

Смотрим на бенчмарки Inkling — картина смешанная. Модель неплохо следует инструкциям (IFBench), но на рабочих задачах вроде SWEBench уступает и DeepSeek, и новым Kimi, и GLM. Для практика вопрос простой: зачем брать непроверенную базу, когда Qwen уже показал результат? Конечно, у Inkling 41B активных параметров — это может дать экономию. Но без публичных кейсов это азартная игра, а не обоснованный выбор. Пока что Thinking Machines доказали, что умеют дообучать модели, но не что их собственная модель для этого лучше китайских open-source лидеров.

Ещё по теме

Комментарии