Токен – это универсальный термин, с которым можно столкнуться и в программировании, и в блокчейне, и в ИИ. В сфере нейросетей токен – это, грубо говоря, минимальный кусочек текста, который нейронка может обработать. Звучит сложно, но разберёмся подробнее.
Вы наверняка ни раз замечали такую картину: начинаешь беседовать с ИИ, всё идёт хорошо, а потом посреди долгого диалога качество ответов вдруг заметно падает. И эта ситуация напрямую связана с расходом токенов. Но разберём всё по порядку.
Что такое токен в нейросетях?
Токен – это минимальная единица текста, с которой может работать нейросеть. Чтобы понять, что это значит, нужно понимать как конкретно ИИ обрабатывает запросы: модель не читает слова и предложения целиком, как это сделал бы человек. Вместо этого она делит текст на маленькие кусочки – они могут быть равны целому слову, одному кусочку слова или одному символу. Условно, искусственный интеллект превращает Ваше сообщение в конструктор, который разбирает на понятные ему блоки.
Углубляться в теорию можно долго, но мы остановимся на том, почему это важно для пользователя. В практическом смысле токены влияют на три вещи:
- Стоимость запроса;
- Скорость ответа;
- То, сколько текста модель сможет за раз удержать “в голове”.
Скорость расхода напрямую зависит от длины Вашего промпта и длины ответа, который даёт нейросеть.
Слово “хороший”, например, обойдётся в два токена – “хорош” и “ий”. А вот слово “cat” сожжёт всего один. Русский язык, кстати, в целом дороже: если пронать через нейронку одно и то же предложение, но на разных языках, английский потребует в 1,5-2 раза меньше токенов.
Что такое токенизация текста и зачем она нужна?
Токенизацией называют процесс разбивки привычного нам текста на части. Дело в том, что ИИ не может прочитать привычные нам буквы – чтобы модель могла работать с текстом, ей нужно сначала превратить всё в цифры. Каждый “кусочек” текста получает числовой код, а дальше нейронка вычисляет ответ, оперируя этими цифрами.
Алгоритмов токенизации много, но самый популярный – Byte-Pair Encoding (BPE). Причём разрабываться он начал задолго до эпохи ИИ – изначально это был просто способ сжатия данных для экономии памяти. Но OpenAI подметила эту разработку и использовала для обучения GPT.
Отличие BPE от аналогов в том, что он строит свой словарь не на целых словах и словоформах, а на часто повторяющихся комбинациях символов. То есть в словах “хороший”, “хорошая” и “хорошист” будет не 6 уникальных токенов, а всего 4 – “хорош”, “ий”, “ая”, “ист”. Это позволяет GPT-4 обходится библиотекой в 100 000 токенов, а не раздувать словарь до бесконечности.
Как и почему токены влияют на стоимость использования нейронок?
Цена за использование API нейросетей считается именно в токенах, а не в словах или символах. При этом общая стоимость тут построена по принципу, который многим знаком на примере обычного счётчика в такси – чем дальше едешь, тем больше заплатишь. Только если таксисты считают километры, то ИИ считает затраченные на обработку Вашего запроса и написание ответа токены.
Читайте также: Лучшие бесплатные нейросети для генерации фото – полный обзор
Отсюда формируются расценки у всех лидеров рынка. Например, у OpenAI флагманская GPT-5.6 Sol стоит $5 за миллион входных токенов и $30 за миллион выходных. Бюджетная GPT-5.6 Luna – $0,20 и $1,20 соответственно. Выходные всегда дороже, потому что модели сложнее генерировать текст, чем читать.
У Anthropic похожая логика: Claude Opus 4.6 – $5 за миллион входных и $25 за выходные токены, Claude Sonnet 4.6 – $3 и $15. Разница между моделями внутри одной линейки огромная: Haiku 4.5 обойдётся в $1/$5, что в пять раз дешевле Opus.
DeepSeek демпингует рынок: $0,68 за миллион после снижения цен весной 2026 года. Правда, качество ответов на сложных задачах у него пока уступает топовым моделям OpenAI и Anthropic.
Сколько стоит 1 токен и как посчитать свой расход?
Один токен стоит копейки: при цене $5 за миллион это $0,000005 за единицу. Но когда вы гоняете через API сотни тысяч запросов в день, сумма набегает ощутимая. А подсчитать количество токенов в своих запросах и ответах модели можно через специальные сервисы.
Онлайн-токенизаторы бесплатно анализируют тексты и выдают количество токенов в них. AITUNNEL и Cloudo3, например, вообще работают в реальном времени: вставляете текст и тут же видите, сколько в нём слов, символов, а главное – токенов.
Впрочем, прикинуть “вес” сообщения можно и самостоятельно. В английском один токен в среднем равен 4 символам, в русском – 2-3 символам. Пробелы в расчёт не идут, а вот знаки препинания считаются за отдельный целый токен.
Я однажды решил проверить, сколько токенов трачу за обычный рабочий день при общении с нейронками. И выяснилось, что моя привычка переписывать и уточнять промпты по 5-6 раз в итоге жрёт больше, чем ответы самой модели. Так что вывод на будущее: если хотите сэкономить, сразу формулируйте запрос максимально точно.
Что такое контекстное окно и почему нейросеть “тупеет” посреди диалога?
Контекстное окно – это максимальное количество токенов, которые нейросеть может обработать за один разговор. Дальше – либо забывается всё, что “не влезло”, либо нейронка предлагает начать новый чат. Правда, когда контекстное окно забивается, ИИ может начать забывать детали на лету – с этим и связано резкое снижение качества ответов посреди беседы.
Какое-то время рекордсменом по размеру контекстного окна был Claude с 200 000 токенов. Теперь этой цифрой уже никого не удивишь: Opus, Sonnet, Gemini и DeepSeek V4 предлагают контекст в 1 000 000. Чтобы было нагляднее: это 50 000 строк кода или 15-20 средних романов. Да, “Война и мир” входит в такое контекстное окно полностью и ещё место остаётся.
Однако и у огромного контекстного окна есть подвох: при контексте в миллион токенов модель не способна помнить начало и конец диалога достаточно хорошо. Из-за этого, к примеру, ChatGPT может вдруг “забыть” середину диалога, даже когда формально контекст ещё не исчерпан. Так что пока обещания о миллионной длине контекста остаются скорее маркетинговой фишкой, чем реальным качеством по всей длине беседы.
Как оптимизировать расход токенов и сэкономить?
Основной способ оптимизации расхода – работа с системным промптом. Если в контекст уже напихана куча всего ещё до начала первого полноценного диалога, токены начинают тратиться с астрономической скоростью.
Читайте также: Как создать бота с ИИ в ТГ: пошаговая инструкция для чайников
Приведу пример: для одного интернет-магазина мы подключили к Телеграм-боту ИИ, который должен был отвечать на вопросы клиентов. Уже через неделю расход токенов составил 2,3 миллиона, при том что диалогов было всего 30. Конечно, такая цифра никого не устроила – пришлось разбираться в причинах.
Разгадка оказалась проста: в системном промпте лежал каталог товаров на 15 000 слов, который целиком уходил в каждый запрос. Мы пересмотрели схему: разбили каталог на категории так, чтобы подгружалась только одна нужная через поиск. Расход упал до 180 000 токенов в неделю, а качество даже выросло – нейросеть перестала путаться в куче ненужной информации.
FAQ
Напоследок – кратко отвечу ещё на несколько популярных вопросов.
Сколько токенов в одном слове?
Для английского примерно 0,75 на слово, для русского – около 1,5-2 на слово. Точное число зависит от конкретной модели и токенизатора.
Можно ли купить токены для ChatGPT отдельно от подписки?
Нет, в потребительских тарифах ChatGPT токены не продаются отдельно. Такой вид оплаты работает только в API, где вы платите за фактический объём обработанного текста.
Почему нейросеть иногда «забывает» начало длинного диалога?
Потому что у модели есть ограничение на объём текста, который она обрабатывает за раз – контекстное окно. Когда Вы добавляете новые сообщения, старые фрагменты могут вытесняться, и модель теряет к ним доступ. Токенизация здесь ни при чём: даже если формальный лимит не исчерпан, внимание модели распределяется неравномерно, и середина диалога часто страдает сильнее всего.
Как понять, что диалог с нейросетью зашёл в тупик и пора начать новый чат?
Первые признаки – модель начинает повторяться, теряет нить разговора, игнорирует ваши ранние инструкции или отвечает не по теме. Это происходит, когда контекстное окно переполняется или накапливаются смысловые ошибки, и модель перестаёт адекватно связывать новые сообщения с началом беседы. Если Вы заметили хотя бы два из этих сигналов, лучше не тратить время на уговоры, а просто открыть новый диалог – так Вы сбросите историю и получите чистый контекст.
Как нейросеть разбивает текст на части, если в языке нет пробелов?
Она использует токенизацию на основе статистики: алгоритм ищет частые последовательности символов и превращает их в отдельные единицы. Поэтому даже китайский или японский текст, где нет привычных пробелов, модель обрабатывает нормально – просто эти единицы будут крупнее, чем в европейских языках, а их количество на одну фразу может сильно отличаться.
Сколько токенов в 1000 словах?
В русском тексте примерно 1500-2000, в английском – около 750-800. Точное значение лучше проверять в токенайзере перед отправкой запроса.






