Градиент.

Оценка моделей без хайпа: свой бенчмарк за вечер

Лидерборды измеряют среднее по чужим задачам. Решение о том, какую модель брать, почти всегда принимается по своим, и собрать их можно за один вечер.

Минимальный набор

  1. Тридцать задач из реальной работы — дословно, вместе с формулировками, которые пишут люди, а не составители тестов.
  2. Эталонные ответы: либо написанные вручную, либо проверенные практикой.
  3. Критерии, которые можно проверить машиной: формат, обязательные поля, наличие источника. Остальное — глазами, но с одной шкалой на все модели.

Три ошибки

  • Подглядывать в промпт. Если промпт писали под конкретную модель, вы измеряете не модель, а свою настройку.
  • Мерить один раз. Разброс между запусками часто больше, чем разница между моделями. Минимум три прогона.
  • Забыть про цену. Токены, латентность, стоимость повторов при ошибке — часть результата, а не примечание.

Такой набор живёт годами: задачи не меняются, модели приходят и уходят, и вы всегда видите, окупается ли очередное обновление.

Кирилл Астахов

ML-инженер, собираю и гоняю модели в проде. Пишу о том, что проверил руками: инференс, обучение, оценка качества. Замечания и вопросы — на hello@p.my01.ru.