Перейти к содержимому
Назад к глоссарию
Глоссарий

Токен (Token)

Минимальная смысловая единица текста для модели

NLP

Токен в контексте обработки естественного языка (NLP) и больших языковых моделей (LLM) — это базовая, минимальная смысловая единица текста, на которую модель может оперировать. Проще говоря, это "слово" или "часть слова", которую модель понимает.

Процесс преобразования текста в токены называется токенизацией. Это первый шаг при подаче текста в LLM. Модели не работают с буквами напрямую, а воспринимают текст как последовательность токенов. Токенизация может быть основана на словах, подсловах (например, приставка, корень, суффикс) или даже символах, в зависимости от используемого алгоритма (BPE, WordPiece, SentencePiece). Например, слово "невероятно" может быть токенизировано как один токен, так и на несколько, таких как "не", "веро" и "ятно".

Токены играют ключевую роль, поскольку они определяют размер словаря модели и вычислительную сложность. Чем больше токенов в тексте, тем больше вычислительных ресурсов требуется для его обработки и тем выше стоимость запроса к коммерческим API.

Примеры

Большинство популярных моделей, таких как GPT-3.5 или Claude 2, используют токены как основную метрику для лимитов контекстного окна и тарификации. Например, API OpenAI тарифицирует запросы исходя из количества входящих и исходящих токенов.

В BERT, одной из первых мощных трансформерных моделей, использовались токены WordPiece. Это позволило модели эффективно работать с редкими словами, разбивая их на более частые подсловесные единицы.

Для слова "кошка" токенизатор может вернуть один токен. Для слова "представительница" он может вернуть несколько токенов, например, "пред", "стави", "тель" и "ница", что позволяет модели гибко работать с морфологически сложными языками.

В методологии AIVO

AIVO учитывает количество и тип токенов при оптимизации контента для LLM. Мы анализируем, как ваш контент токенизируется различными моделями, чтобы минимизировать затраты на инференс и максимально эффективно использовать контекстное окно. Это позволяет создавать "LLM-ready Content", который лучше воспринимается и обрабатывается AI.

Часто задаваемые вопросы

Как токены влияют на стоимость использования LLM?
Стоимость использования многих коммерческих LLM API напрямую зависит от количества токенов. Чем больше токенов в вашем запросе (промпте) и в ответе модели, тем выше будет стоимость. Оптимизация контента для сокращения количества токенов может значительно снизить расходы.
Почему "токен" не всегда равен "слову"?
Токен не всегда равен слову, потому что LLM-токены часто представляют собой части слов, знаки препинания или даже пробелы. Это позволяет моделям эффективно обрабатывать редкие слова и различные языки, не раздувая при этом размер словаря до неприемлемых пределов.
Что такое контекстное окно в контексте токенов?
Контекстное окно — это максимальное количество токенов, которое модель может обрабатывать за один раз, включая как входной промпт, так и генерируемый ответ. Превышение этого лимита приводит к обрезке текста или ошибкам. Понимание работы с токенами критично для эффективного использования этого окна.