исследования 1 мин

Открытые 4B-модели приблизились к o3 в медицинских тестах на шведском

Исследователь прогнал небольшие открытые LLM через шведские медицинские лицензионные экзамены. Gemma4-E4B и Qwen3.5-4B без дообучения показали 77% точности, а с reasoning — 87%, почти сравнявшись с o3 (88%). Qwen рассуждает на английском, даже если вопросы на шведском, но это не мешает точности.

Показывает, что для специализированных задач (медицина, юриспруденция) можно использовать компактные открытые модели вместо дорогих API флагманов. Важно для локального деплоя в регулируемых отраслях и языков с малым представлением в данных.

Открытые 4B-модели приблизились к o3 в медицинских тестах на шведском

Исследователь провёл эксперименты с небольшими открытыми языковыми моделями на датасете MedQA-SWE — тестах шведского медицинского лицензирования. Для контекста: GPT-4 показал 84% точности в 2024 году, o3 — 88% в 2025-м на пересекающейся выборке.

Результаты

Дообучив MedGemma-1.5-4B на данных прошлых лет (SFT), автор добился проходного балла 60%. Но модели, вышедшие всего тремя месяцами позже — Gemma4-E4B и Qwen3.5-4B — оказались сильнее без какого-либо дообучения: 77% точности из коробки. С включённым режимом рассуждений (reasoning) Qwen3.5-4B вышел на 87% точности — практически вплотную к o3.

Технические детали

Без ограничения длины рассуждений модель иногда попадала в циклы форматирования, заполняя весь контекст без ответа. Помогла техника "раннего выхода" из работы S-GRPO — принудительное закрытие reasoning-трейса на определённой длине. Попытки обучения с подкреплением для сокращения рассуждений дали минимальный прирост.

Интересная особенность

Qwen3.5-4B ведёт все рассуждения на английском, несмотря на шведские промпты, вопросы и варианты ответов. Автор отмечает, что язык не стал препятствием, хотя шведский составляет ~1% данных обучения LLM. Это говорит о сильных кросс-лингвальных способностях современных моделей.

Код и детальный технический разбор доступны в репозитории автора.

Ключевые выводы

  • Компактные 4B-модели (Qwen3.5, Gemma4) почти догнали флагманскую o3 в специализированной задаче медицинской диагностики
  • Режим рассуждений (reasoning) даёт +10 п.п. точности (77% → 87%) даже на небольших моделях
  • Qwen3.5-4B рассуждает на английском при шведских вопросах, но это не снижает точность — кросс-лингвальность работает
  • "Ранний выход" из reasoning-трейса решает проблему зацикливания без существенной потери качества
  • Дообучение на специализированных данных может быть менее эффективным, чем переход на более свежую архитектуру
open-sourceмедицинаreasoningмультилингвальностьбенчмарки

Автор: Ксения Лаврова · Источник: reddit.com

Мнение редакции

Это один из тех случаев, когда open-source реально наступает на пятки проприетарным моделям в узких доменах. 87% точности Qwen3.5-4B против 88% o3 — разница почти статистическая, а разница в цене деплоя и контроле данных — огромная. Особенно для медицины, где локальный запуск и приватность критичны.

Любопытно, что модель рассуждает на английском при шведских вопросах и это работает. Видимо, мультилингвальность современных LLM — не просто маркетинг, а реальная способность переносить reasoning между языками. Для языков с небольшим присутствием в обучающих данных это открывает путь к качественным локальным решениям без необходимости огромных языкоспецифичных датасетов.

Ещё по теме

Комментарии