Что такое контекстное окно (context window)?
Контекстное окно — это максимальный объём текста в токенах, который языковая модель может держать «перед глазами» за один раз: системный промпт, история диалога, приложенные файлы и её собственный ответ. Всё, что не поместилось, для модели просто не существует.
Когда переписка становится длиннее контекстного окна, ранние сообщения вытесняются, и модель перестаёт помнить, о чём вы договорились в начале. Это не «забывчивость» в человеческом смысле — эти токены физически не подаются на вход.
Большое окно не отменяет необходимости отбирать данные. Чем больше мусора в контексте, тем выше стоимость запроса и тем легче модели упустить важное. Поэтому в рабочих системах вместо «загрузим всё» используют RAG — подтягивание только релевантных фрагментов.
Связанные термины
Токен — это минимальный кусочек текста, которым оперирует языковая модель: слово, часть слова или знак препинания. Модель не видит буквы и слова напрямую — она читает и генерирует именно последовательность токенов.
LLMLLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.
Context EngineeringContext engineering — это проектирование того, какая информация попадает в контекстное окно модели на каждом шаге: какие документы подтянуть, что из истории диалога сохранить, что сжать и что выбросить. Речь идёт об управлении данными, а не о формулировке инструкции.
RAGRAG (Retrieval-Augmented Generation) — это подход, при котором перед ответом система сначала находит релевантные фрагменты в вашей базе знаний и передаёт их языковой модели вместе с вопросом. Модель отвечает не «по памяти», а по конкретным документам.
PromptПромпт — это текстовый запрос, который вы отправляете языковой модели: задание, вопрос, инструкция вместе со всеми данными, нужными для ответа. Промпт полностью определяет, что модель увидит и, соответственно, что она ответит.