Бенчмарк бенгальских LLM на Amazon Bedrock: карта зрелости возможностей
Автор — носитель бенгальского языка — обнаружил, что современные датасеты для оценки LLM на бенгальском устарели и не работают. Он создал собственный бенчмарк из 147 примеров по трём задачам (анализ тональности, вопросы-ответы, суммаризация), протестировал 5 моделей через Amazon Bedrock и использовал Claude в качестве судьи с чёткими рубриками оценки.
Исследование показывает критический пробел в инфраструктуре для low-resource языков и предлагает практический подход к созданию бенчмарков. Полезно разработчикам, работающим с многоязычными моделями, и сообществу NLP для недостаточно представленных языков.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Почти все существующие датасеты для бенгальского языка используют устаревшие механизмы загрузки и несовместимы с современными инструментами
- Автор создал 147-примерный бенчмарк с оценкой через Claude по трём критериям (точность, полнота, качество языка) на шкале 1-5
- В тестировании участвовали модели TituLLM (Llama-3.2 с расширенным токенизатором для бенгальского), Llama и DeepSeek через Bedrock
- Использование Inference Profiles в Bedrock упростило доступ к моделям — больше не нужно вручную их активировать
Инструменты из статьи
AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...
Доступ из РФ →
Комментарии