Градиент — Заметки про нейросети: инференс, обучение, инженерия
Личный блог о нейросетях: квантизация и инференс, тонкая настройка, оценка качества, RAG и агенты. Без хайпа, с замерами.
-
Квантизация в 4 бита без боли: чем Q4_K_M отличается от AWQ
Сравниваю три схемы 4-битной квантизации на одной модели: что теряется в качестве, где выигрыш по памяти, и почему «4 бита» у разных инструментов означает разное.
-
LoRA против полного файнтюна: где ломается интуиция
Адаптеры почти всегда выигрывают по ресурсам, но не всегда по результату. Разбираю, в каких задачах разница принципиальна, а в каких её нет.
-
Почему ваш счётчик токенов врёт на русском тексте
Токенизатор обучен на английском, и на кириллице он разваливает слова на куски. Что это значит для бюджета и длины контекста.
-
RAG, который не врёт: гибридный поиск и переранжирование
Векторный поиск в одиночку проигрывает там, где нужны точные термины. Показываю схему на трёх шагах, которая перестала выдумывать ответы.
-
Почему агентные демо разваливаются на двенадцатом шаге
Короткое демо впечатляет, длинная цепочка — нет. Разбираю, где накапливается ошибка и какие три ограничителя её сдерживают.
-
Что на самом деле изменило внимание в архитектурах
Трансформер выиграл не «умом», а параллелизмом и длиной зависимостей. Разбираю это на пальцах, без формул ради формул.
-
Локальный инференс на 8 ГБ: что реально влезает
Практическая таблица: какие модели и в каком сжатии живут на одной карте, и на чём приходится экономить.
-
Оценка моделей без хайпа: свой бенчмарк за вечер
Публичные лидерборды отвечают не на ваш вопрос. Как собрать свой набор задач, который переживёт смену трёх моделей.
- вчера — Проверил, как ведёт себя переранжировщик на длинных чанках: выигрыш только после 800 токенов.
- позавчера — Квантизация в 4 бита на коде теряет больше, чем на обычном тексте. Логично, но проверять стоило.
- 3 дня назад — Отключил в агенте повторные вызовы с теми же аргументами — петель стало заметно меньше.