Тема: инференс
Запуск моделей: квантизация, скорость, память, железо.
Записей: 3все темы
-
Квантизация в 4 бита без боли: чем Q4_K_M отличается от AWQ
Сравниваю три схемы 4-битной квантизации на одной модели: что теряется в качестве, где выигрыш по памяти, и почему «4 бита» у разных инструментов означает разное.
-
Почему ваш счётчик токенов врёт на русском тексте
Токенизатор обучен на английском, и на кириллице он разваливает слова на куски. Что это значит для бюджета и длины контекста.
-
Локальный инференс на 8 ГБ: что реально влезает
Практическая таблица: какие модели и в каком сжатии живут на одной карте, и на чём приходится экономить.