Код и данные · токеныСчётчик токенов
Сколько токенов займёт текст в ChatGPT и открытых моделях — и почему русский текст обходится дороже английского. Считаем в браузере, текст никуда не уходит.
Подсчёт
выберите словарь моделиРусский против английского
наш замер: Всеобщая декларация прав человека, ст. 1–3Закрытые токенайзеры
никаких выдуманных коэффициентовClaude · Anthropic
Токенайзер не опубликован. Точное число — только через API провайдера: бесплатный метод count_tokens у Anthropic. По документации Anthropic, начиная с Claude Opus 4.7 модели используют новый токенайзер: тот же текст занимает примерно на 30 % больше токенов, чем на прежних моделях.
Gemini · Google
Токенайзер не опубликован. Точное число — только через API провайдера: метод countTokens у Google.
≈ 45 по правилу Google «1 токен ≈ 4 символа» — для русского занижает
YandexGPT · Яндекс
Токенайзер не опубликован. Точное число — только через API провайдера: метод Tokenizer у Яндекса.
О токенах
Нейросети читают текст не по буквам и не по словам, а по токенам — кусочкам слов из словаря модели. От числа токенов зависят лимит контекста и стоимость запроса. У каждой модели свой словарь, поэтому один и тот же текст занимает разное число токенов, а русский — обычно больше, чем английский: словари собраны в основном на английских текстах.
Токен
Единицаo200k
GPT-4o и новееcl100k
GPT-4 и GPT-3.5Русский дороже
НеравенствоЗакрытые словари
Claude, GeminiНевидимые символы
Лишние токеныЧастые вопросы
Обновлено
Подсчёт идёт в браузере. Стоимость не показываем: цены меняются, а в счёт входят ещё ответ, рассуждения и служебные токены.