Контекстное окно (Context Window)
Максимальное количество токенов для обработки одного запроса
Модели и архитектурыКонтекстное окно (Context Window) — это определенный лимит токенов (слов или их частей), который большая языковая модель (LLM) может одномоментно обработать и использовать для генерации ответа. Этот лимит включает в себя как пользовательский запрос (промпт), так и саму историю диалога, а также потенциально сгенерированный моделью ответ.
Размер контекстного окна напрямую определяет способность модели «помнить» предыдущие части разговора или большой объем входной информации. Чем больше контекстное окно, тем более сложные и многошаговые задачи может выполнять модель, сохраняя логику и согласованность. Это критично для приложений, требующих понимания длительных текстов, когерентных диалогов или обработки больших объемов данных.
Работа контекстного окна заключается в том, что все токены, находящиеся внутри этого лимита, формируют «понимание» модели о текущей ситуации. Токены за пределами этого окна либо отбрасываются, либо требуют дополнительных механизмов (например, суммаризации или ретривера) для включения в контекст. Ограничение обусловлено вычислительными мощностями и архитектурой трансформеров, на которых базируются современные LLM.
Примеры
Модель GPT-3.5 имеет контекстное окно до 16 000 токенов, что позволяет ей обрабатывать примерно 10-12 тысяч слов текста. Этого достаточно для работы с целой главой книги или длинным техническим отчетом.
Модели Claude 3 Opus доступны с контекстным окном в 200 000 токенов (около 150 000 слов), что позволяет анализировать целые книги или сотни страниц документации, предоставляя глубокие ответы на сложные вопросы в рамках одного запроса.
LLaMA-2 изначально имела контекстное окно 4096 токенов, но благодаря доработкам и инновациям сообщества, некоторые её версии могут использовать до 100 000+ токенов.
В методологии AIVO
AIVO учитывает размер и особенности контекстного окна LLM при формировании рекомендаций по оптимизации контента. Мы анализируем, как объем и структура контента для бренда в различных источниках соответствуют возможностям контекстных окон целевых моделей. Это позволяет разрабатывать стратегии AI Visibility Optimization, обеспечивая максимальную релевантность и полноту ответов ИИ, а также помогая структурировать данные для эффективного потребления моделями с ограниченным контекстом.
Часто задаваемые вопросы
- Почему размер контекстного окна важен?
- Размер контекстного окна определяет объем информации, который AI-модель может одномоментно обработать и «помнить». Чем больше окно, тем лучше модель справляется с длительными диалогами, анализом больших документов и сохранением когерентности в сложных задачах. Это напрямую влияет на качество и релевантность генерируемого ответа.
- Можно ли расширить контекстное окно модели?
- В некоторых случаях возможно расширение контекстного окна с помощью методов, таких как LongLoRA, или за счет архитектурных оптимизаций. Однако это часто требует значительных вычислительных ресурсов для обучения и инференса, либо использования специальных техник, таких как суммаризация или Retrieval-Augmented Generation (RAG), для эффективной работы с информацией за пределами исходного окна.
- Как контекстное окно относится к токенам?
- Контекстное окно измеряется в токенах. Все входные данные (промпт, история диалога) и потенциальный выходной ответ должны умещаться в этот лимит токенов. Если количество токенов превышает размер контекстного окна, модель не сможет обработать всю информацию, что приведет к потере данных или неполному ответу.
