Лучший результат Thinking Machines получен на Qwen3, а не на их собственной Inkling. Насколько важна базовая модель?
Thinking Machines активно продвигает свою модель Inkling, но их главный публичный успех (кейс Bridgewater с точностью 84.7% на финансовых задачах) достигнут на базе Qwen3-235B. Сама Inkling показывает смешанные результаты на бенчмарках: лидирует только по следованию инструкциям (IFBench), но уступает DeepSeek V4 Pro и GLM 5.2 на большинстве других тестов.
Кейс показывает, как маркетинг может размывать границу между успехом технологии (fine-tuning) и конкретного продукта (модели). Для практиков это сигнал копать глубже в публичные данные, прежде чем выбирать базовую модель для дообучения.
Маркетинг vs реальность
Thinking Machines активно продвигает свою модель Inkling и кейс-стади с хедж-фондом Bridgewater как доказательство превосходства специализированных моделей над «frontier» гигантами. Проблема в том, что самый впечатляющий публичный результат получен вообще не на Inkling.
Кейс Bridgewater, который все цитируют как главное доказательство: 84.7% точности на шести задачах фильтрации финансовых документов, при этом затраты на инференс в 13.8 раз ниже топовых моделей. Звучит отлично, но базовой моделью была Qwen3-235B, а не Inkling. И опубликован этот результат за две недели до релиза самой Inkling.
Что показывают бенчмарки
Результаты Inkling на публичных тестах неоднозначны:
- AIME 2026 (математика): 97.1% — хорошо, но все в списке выше 94%, а лидеры (Fable 5, GPT-5.6 Sol) показывают 99.9%
- HLE text-only: 29.7% — впереди только Nemotron 3 Ultra, проигрывает GLM 5.2, DeepSeek V4 Pro и обеим моделям Kimi
- SWEBench Pro / Terminal Bench 2.1: та же картина — бьёт Nemotron и Kimi K2.5, уступает Kimi K2.6, GLM 5.2 и DeepSeek V4 Pro
- IFBench (следование инструкциям): 79.8% — здесь Inkling действительно лидирует, уступая только Nemotron 3 Ultra
Два разных утверждения
Важно разделять:
- Tinker (метод fine-tuning от Thinking Machines) может превратить открытую модель в сильного специалиста — подтверждается публичными данными
- Inkling — хорошая база для этого — публичных доказательств пока нет
Для практиков вопрос остаётся открытым: стоит ли экспериментировать с Inkling (41B активных параметров, сильная по IFBench) или безопаснее брать Qwen/Kimi с их проверенным поведением при дообучении.
Ключевые выводы
- Самый публичный успех Thinking Machines достигнут на Qwen3-235B, а не на собственной модели Inkling
- Inkling показывает смешанные результаты: лидирует только по следованию инструкциям (IFBench), но уступает на большинстве других бенчмарков
- Публичные данные подтверждают эффективность метода Tinker для fine-tuning, но не превосходство Inkling как базовой модели
- Для задач финансовой аналитики специализированная дообученная модель показала затраты на инференс в 13.8 раз ниже frontier-моделей при сопоставимой точности
- В маркетинговых материалах часто смешиваются два разных утверждения — об эффективности метода и о качестве конкретной модели
Автор: Артём Ковалёв · Источник: reddit.com
**История классическая**: стартап делает громкое заявление, пресса подхватывает одну цифру (97.1% на AIME), а дьявол в деталях. Да, Tinker как метод fine-tuning работает — кейс Bridgewater это подтверждает. Но там-то использовали Qwen3, а не саму Inkling. И это принципиально.
Смотрим на бенчмарки Inkling — картина смешанная. Модель неплохо следует инструкциям (IFBench), но на рабочих задачах вроде SWEBench уступает и DeepSeek, и новым Kimi, и GLM. Для практика вопрос простой: зачем брать непроверенную базу, когда Qwen уже показал результат? Конечно, у Inkling 41B активных параметров — это может дать экономию. Но без публичных кейсов это азартная игра, а не обоснованный выбор. Пока что Thinking Machines доказали, что умеют дообучать модели, но не что их собственная модель для этого лучше китайских open-source лидеров.
Комментарии