🎓 ИИ с нуля. Урок 3/16: Токены, за что ты платишь

В прошлом уроке разобрали, что модель предсказывает следующее слово. Но это не совсем точно. Она предсказывает следующий токен. И это меняет всё, включая счёт за использование.

Что такое токен Токен это минимальный кусочек текста, с которым работает модель. Не буква и не слово, а что-то посередине. Часть слова, знак препинания, пробел, всё это может быть отдельным токеном.

Например, слово «нейросеть» модель, скорее всего, разобьёт на несколько токенов: «ней», «ро», «сеть». А слово «cat» на английском это один токен целиком.

Важный факт: модели обучены преимущественно на английском тексте. Поэтому кириллица «дробится» сильнее, 1 токен в среднем покрывает около 2 символов русского текста, тогда как в английском 1 токен это 4 символа или примерно 0,75 слова.

Почему это важно для цены Когда ты работаешь с моделью через API, платишь ты именно за токены: отдельно за те, что отправил (твой запрос), и отдельно за те, что получил в ответ. Ответ обычно в 3-6 раз дороже запроса.

Из этого следует прямое следствие: один и тот же текст на русском «съедает» примерно в 1,5-2 раза больше токенов, чем на английском. Задача на русском стоит дороже. Не потому что провайдер жадный, а потому что токенов больше.

Примерные ориентиры: - Слово «привет», 2 токена - Сообщение из 10 слов на русском, около 25-30 токенов - Большой ответ на 500 слов по-русски, примерно 1 500 токенов - Повесть «Старик и море» целиком, около 50 000 токенов

Быстрый способ прикинуть стоимость запроса, не запуская токенизатор: умножай количество слов на 1,3 для английского и на 2,5 для русского. Получишь достаточно точную оценку токенов.

Связь с контекстом Контекстное окно (о нём подробно завтра, в уроке 4) тоже измеряется в токенах. Если у модели лимит в 200 000 токенов, это примерно 150 000 слов на английском, или около 80 000 слов на русском. Превысил лимит, модель начинает «забывать» начало разговора.

Длинная история переписки тоже не бесплатная: при каждом новом сообщении вся история чата отправляется модели заново, и ты платишь за неё каждый раз.

Попробуй сейчас Открой ChatGPT или Claude и отправь вот это:

«Разбей каждое из этих слов на токены, как это делает языковая модель: “нейросеть”, “кот”, “transformer”. Укажи, сколько токенов в каждом слове и почему русское слово разбивается иначе, чем английское.»

Ответ покажет разницу наглядно. Заодно увидишь, что модель сама понимает принцип своей токенизации.

Завтра урок 4: контекстное окно, или память разговора.

Ставь 🔥, если теперь понятно, за что списываются токены. #курс #спросинейронку

🎓 ИИ с нуля. Урок 3/16: Токены, за что ты платишь | Сетка — социальная сеть от hh.ru