Що таке контекстне вікно (context window)?
Контекстне вікно — це максимальний обсяг тексту в токенах, який мовна модель може тримати «перед очима» за один раз: системний промпт, історія діалогу, додані файли та її власна відповідь. Усе, що не вмістилося, для моделі просто не існує.
Коли листування стає довшим за контекстне вікно, ранні повідомлення витісняються, і модель перестає памʼятати, про що ви домовилися на початку. Це не «забудькуватість» у людському сенсі — ці токени фізично не подаються на вхід.
Велике вікно не скасовує потреби відбирати дані. Що більше сміття в контексті, то вища вартість запиту й то легше моделі проґавити важливе. Тому в робочих системах замість «завантажимо все» використовують RAG — підтягування лише релевантних фрагментів.
Повʼязані терміни
Токен — це мінімальний шматочок тексту, яким оперує мовна модель: слово, частина слова або розділовий знак. Модель не бачить літери та слова напряму — вона читає й генерує саме послідовність токенів.
LLMLLM (Large Language Model, велика мовна модель) — це нейромережа, навчена на величезних обсягах тексту, яка прогнозує наступний фрагмент тексту. Саме на LLM працюють ChatGPT, Claude, Gemini та інші AI-асистенти.
Context EngineeringContext engineering — це проєктування того, яка інформація потрапляє в контекстне вікно моделі на кожному кроці: які документи підтягнути, що з історії діалогу зберегти, що стиснути й що викинути. Ідеться про керування даними, а не про формулювання інструкції.
RAGRAG (Retrieval-Augmented Generation) — це підхід, за якого перед відповіддю система спочатку знаходить релевантні фрагменти у вашій базі знань і передає їх мовній моделі разом із питанням. Модель відповідає не «з памʼяті», а за конкретними документами.
PromptПромпт — це текстовий запит, який ви надсилаєте мовній моделі: завдання, питання, інструкція разом з усіма даними, потрібними для відповіді. Промпт повністю визначає, що модель побачить і, відповідно, що вона відповість.