Оценка моделей без хайпа: свой бенчмарк за вечер
Лидерборды измеряют среднее по чужим задачам. Решение о том, какую модель брать, почти всегда принимается по своим, и собрать их можно за один вечер.
Минимальный набор
- Тридцать задач из реальной работы — дословно, вместе с формулировками, которые пишут люди, а не составители тестов.
- Эталонные ответы: либо написанные вручную, либо проверенные практикой.
- Критерии, которые можно проверить машиной: формат, обязательные поля, наличие источника. Остальное — глазами, но с одной шкалой на все модели.
Три ошибки
- Подглядывать в промпт. Если промпт писали под конкретную модель, вы измеряете не модель, а свою настройку.
- Мерить один раз. Разброс между запусками часто больше, чем разница между моделями. Минимум три прогона.
- Забыть про цену. Токены, латентность, стоимость повторов при ошибке — часть результата, а не примечание.
Такой набор живёт годами: задачи не меняются, модели приходят и уходят, и вы всегда видите, окупается ли очередное обновление.
Похожие записивсе темы