Градиент.

LoRA против полного файнтюна: где ломается интуиция

LoRA выглядит как бесплатный обед: обучаем меньше процента параметров, память падает в разы, качество «почти как у полного файнтюна». Почти — это ключевое слово.

Когда адаптеров достаточно

Смена стиля, формата ответа, тона, предметной лексики — всё это укладывается в низкоранговое изменение. Модель уже знает язык и факты, её нужно лишь направить. Здесь LoRA даёт результат, неотличимый от полного обучения, и обучается на одной карте вместо восьми.

Когда адаптеров мало

Обратный случай — новая предметная область с своим языком: юридические формулировки, редкие нотации, нестандартная разметка. Тут нужно менять представления, а не только выходной слой, и низкий ранг начинает ограничивать. Симптом понятный: тренировочная ошибка упирается в потолок и не двигается, сколько ни увеличивай ранг.

Если после подъёма ранга с 8 до 64 метрика не сдвинулась — дело не в адаптере. Либо данных мало, либо задаче нужен полный файнтюн.

Как я выбираю

  1. Собираю 300–500 честных примеров и фиксирую метрику на отложенной части.
  2. Пробую LoRA с рангом 16. Если метрика близка к целевой — останавливаюсь.
  3. Если нет — поднимаю ранг до 64 и смотрю на динамику, а не на абсолют.
  4. Только после этого считаю бюджет полного файнтюна.

В моей практике третий шаг отсекает большинство задач: адаптер либо дотягивает, либо видно, что упёрся, и дальше нет смысла крутить гиперпараметры.

Кирилл Астахов

ML-инженер, собираю и гоняю модели в проде. Пишу о том, что проверил руками: инференс, обучение, оценка качества. Замечания и вопросы — на hello@p.my01.ru.