Локальный инференс на 8 ГБ: что реально влезает
Восемь гигабайт — популярный бюджет, и почти всегда вопрос формулируют как «какая модель влезет». Правильнее спросить иначе: какой контекст влезет вместе с ней, потому что память под KV-кэш часто и решает.
Что влезает с запасом
- Модели 7–8B в 4-битном сжатии: примерно 5 ГБ весов, остаётся на контекст.
- Модели 3–4B в 8 битах: качество на коротких задачах близко к 7B в 4 битах.
- Специализированные модели для эмбеддингов и переранжирования — почти даром.
На чём экономят зря
Первое, что отключают, — контекст. Но именно на длинном контексте сжатая модель теряет больше всего, поэтому «влезло на 2k» часто означает «стало заметно хуже». Второе — выгрузка слоёв на процессор: скорость падает в разы, а выигрыш по памяти меньше, чем кажется.
| Статья расхода | Память |
|---|---|
| Веса | 5.2 ГБ |
| KV-кэш | 1.8 ГБ |
| Оверхед рантайма | 0.6 ГБ |
| Итого | 7.6 ГБ |
Семь и шесть десятых из восьми — впритык, но работает. Запуск выглядит так:
llama-server -m model-q4_k_m.gguf -c 8192 -ngl 99 --host 127.0.0.1
Если бюджет жёсткий, я предпочту модель поменьше с нормальным контекстом, чем большую с обрезанным: на реальных задачах второе проигрывает чаще.
Похожие записивсе темы