Градиент.

Локальный инференс на 8 ГБ: что реально влезает

Восемь гигабайт — популярный бюджет, и почти всегда вопрос формулируют как «какая модель влезет». Правильнее спросить иначе: какой контекст влезет вместе с ней, потому что память под KV-кэш часто и решает.

Что влезает с запасом

  • Модели 7–8B в 4-битном сжатии: примерно 5 ГБ весов, остаётся на контекст.
  • Модели 3–4B в 8 битах: качество на коротких задачах близко к 7B в 4 битах.
  • Специализированные модели для эмбеддингов и переранжирования — почти даром.

На чём экономят зря

Первое, что отключают, — контекст. Но именно на длинном контексте сжатая модель теряет больше всего, поэтому «влезло на 2k» часто означает «стало заметно хуже». Второе — выгрузка слоёв на процессор: скорость падает в разы, а выигрыш по памяти меньше, чем кажется.

Модель 8B в Q4_K_M, контекст 8k
Статья расходаПамять
Веса5.2 ГБ
KV-кэш1.8 ГБ
Оверхед рантайма0.6 ГБ
Итого7.6 ГБ

Семь и шесть десятых из восьми — впритык, но работает. Запуск выглядит так:

llama-server -m model-q4_k_m.gguf   -c 8192 -ngl 99 --host 127.0.0.1

Если бюджет жёсткий, я предпочту модель поменьше с нормальным контекстом, чем большую с обрезанным: на реальных задачах второе проигрывает чаще.

Кирилл Астахов

ML-инженер, собираю и гоняю модели в проде. Пишу о том, что проверил руками: инференс, обучение, оценка качества. Замечания и вопросы — на hello@p.my01.ru.