Gradient accumulation не экономит время: практические тесты LoRA на T4 и L4
Пользователь протестировал LoRA-дообучение Qwen3-1.7B с разными комбинациями физического батча и gradient accumulation на T4 и L4. Оказалось, что при одинаковом effective batch (4) время обучения различается на 17-41% в зависимости от физического размера батча. Вывод: эффективный батч влияет на сходимость оптимизатора, но физический батч определяет скорость выполнения на GPU.