Код и данные · токеныСчётчик токенов

Сколько токенов займёт текст в ChatGPT и открытых моделях — и почему русский текст обходится дороже английского. Считаем в браузере, текст никуда не уходит.

Подсчёт в браузере · словари загружаются с bringer.ru, а не со сторонних серверов
01Подсчёт02Русский и английский03Закрытые04О токенах05Вопросы06Похожие
01

Подсчёт

выберите словарь модели
ЗакрытыеClaude не опубликованGemini не опубликованYandexGPT не опубликован
Текст
180 символов · лимит обработки в браузере — несколько мегабайт
Токенов
—
Символов
180
Слов
29
Символов на токен
—
загружаем словарь…
Окно контекстазанято — из 128 000 · —
02

Русский против английского

наш замер: Всеобщая декларация прав человека, ст. 1–3
o200k · GPT-4o и новее1,43×
английский146
русский209
cl100k · GPT-4 и GPT-3.52,70×
английский146
русский394
Для сравнения: Petrov и др., NeurIPS 2023 — cl100k на русском ≈ 2,49× английского (FLORES-200).Ваш текст: — символов на токен
03

Закрытые токенайзеры

никаких выдуманных коэффициентов

Claude · Anthropic

Токенайзер не опубликован. Точное число — только через API провайдера: бесплатный метод count_tokens у Anthropic. По документации Anthropic, начиная с Claude Opus 4.7 модели используют новый токенайзер: тот же текст занимает примерно на 30 % больше токенов, чем на прежних моделях.

Gemini · Google

Токенайзер не опубликован. Точное число — только через API провайдера: метод countTokens у Google.

≈ 45 по правилу Google «1 токен ≈ 4 символа» — для русского занижает

YandexGPT · Яндекс

Токенайзер не опубликован. Точное число — только через API провайдера: метод Tokenizer у Яндекса.

04

О токенах

Нейросети читают текст не по буквам и не по словам, а по токенам — кусочкам слов из словаря модели. От числа токенов зависят лимит контекста и стоимость запроса. У каждой модели свой словарь, поэтому один и тот же текст занимает разное число токенов, а русский — обычно больше, чем английский: словари собраны в основном на английских текстах.

Токен

Единица
пр·ивет
Кусочек текста из словаря модели: частое слово целиком, редкое — по частям. Пробел обычно входит в токен.

o200k

GPT-4o и новее
привет = 2
Словарь моделей OpenAI начиная с GPT-4o. Русский текст в нём почти вдвое дешевле, чем в словаре GPT-4.

cl100k

GPT-4 и GPT-3.5
привет = 4
Прежний словарь OpenAI. На русском тексте тратит в 2,5–2,7 раза больше токенов, чем на английском.

Русский дороже

Неравенство
1,4× · 2,7×
В нашем замере русский текст занял в 1,4 раза больше токенов, чем английский, в o200k и в 2,7 раза — в cl100k.

Закрытые словари

Claude, Gemini
≈
Anthropic и Google не публикуют свои токенайзеры. Точное число дают только их API.

Невидимые символы

Лишние токены
U+202F = 1–2
Невидимые символы тоже стоят токенов. Очистка текста перед отправкой их убирает.
05

Частые вопросы

Кусочек текста, с которым работает модель: частое слово целиком, редкое — несколькими частями, пробел обычно входит в токен. У каждой модели свой словарь таких кусочков, поэтому один текст занимает разное число токенов. В токенах считаются лимит контекста, то есть сколько текста модель видит за раз, и цена запроса к API.

Обновлено

Подсчёт идёт в браузере. Стоимость не показываем: цены меняются, а в счёт входят ещё ответ, рассуждения и служебные токены.

«» добавлен в избранное