Почему ваш счётчик токенов врёт на русском тексте
Оценка «одно слово ≈ один токен» верна для английского и ломается на кириллице. Если считать бюджет по ней, контекст кончится примерно вдвое раньше, чем вы планировали.
Сколько на самом деле
На бытовом русском тексте типичная картина — 1.8–2.4 токена на слово против 1.2–1.4 на английском. Хуже всего редкие слова, аббревиатуры и смесь алфавитов: «GPT-4o» и «постобработка» могут стоить по 4–6 токенов.
| Текст | Слов | Токенов | Коэф. |
|---|---|---|---|
| английский, техдок | 500 | 615 | 1.23 |
| русский, тот же смысл | 500 | 1080 | 2.16 |
| русский + код + сокращения | 500 | 1370 | 2.74 |
Что делать
- Считать длину реальным токенизатором той модели, которую вызываете: они различаются даже внутри одного семейства.
- Оставлять запас: если лимит 8k, планировать 6k на вход.
- Не обрезать по «символам» — обрезайте по токенам, иначе половина ограничения уйдёт на служебные куски.
Отдельная ловушка — кэш. Промпт, собранный из меняющихся полей, перестаёт попадать в кэш, и счёт за токены растёт тихо, без изменений в коде.
Похожие записивсе темы