Що таке RAG (Retrieval-Augmented Generation)?
RAG (Retrieval-Augmented Generation) — це підхід, за якого перед відповіддю система спочатку знаходить релевантні фрагменти у вашій базі знань і передає їх мовній моделі разом із питанням. Модель відповідає не «з памʼяті», а за конкретними документами.
Схема складається з двох етапів. Спершу документи ріжуть на фрагменти, перетворюють на ембединги й складають у векторну базу. Далі на кожне питання користувача система переводить запит у вектор, знаходить кілька найближчих фрагментів і підставляє їх у промпт: «дай відповідь, спираючись лише на цей контекст».
RAG розвʼязує три реальні проблеми: модель не знає внутрішніх документів компанії, її знання застарівають, і вона схильна вигадувати факти. Оновити базу знань у RAG-системі — це просто завантажити новий документ, без перенавчання моделі.
RAG чи fine-tuning — що обрати
RAG підмішує актуальні факти в момент запиту — ідеальний для баз знань, регламентів і документації, які змінюються. Fine-tuning закріплює стиль і формат відповіді у вагах моделі — потрібен, коли важлива стала поведінка, а не свіжі дані. Якщо сумніваєтеся, починайте з RAG: він дешевший, швидший, а його результат можна перевірити за посиланнями на джерела.
Повʼязані терміни
Ембединг — це представлення тексту, зображення чи іншого обʼєкта у вигляді вектора чисел, у якому близькі за змістом обʼєкти опиняються поруч. Саме ембединги дозволяють компʼютеру порівнювати документи за змістом, а не за збігом слів.
Vector DatabaseВекторна база даних — це сховище, оптимізоване під ембединги: вона зберігає вектори разом із вихідними фрагментами тексту й уміє за мілісекунди знаходити ті з них, що найближчі до вектора запиту.
Semantic SearchСемантичний пошук — це пошук за змістом запиту, а не за збігом слів. Запит і документи переводяться в ембединги, після чого система знаходить записи, вектори яких найближчі до вектора запиту.
LLMLLM (Large Language Model, велика мовна модель) — це нейромережа, навчена на величезних обсягах тексту, яка прогнозує наступний фрагмент тексту. Саме на LLM працюють ChatGPT, Claude, Gemini та інші AI-асистенти.
HallucinationГалюцинація — це відповідь мовної моделі, яка звучить упевнено й правдоподібно, але фактично хибна: вигадана цитата, неіснуюча функція бібліотеки, придуманий номер закону чи посилання, яке нікуди не веде.
Fine-tuningFine-tuning — це донавчання вже готової моделі на власному наборі прикладів, щоб вона засвоїла потрібний стиль, формат відповіді чи вузьку предметну специфіку. Ваги моделі при цьому змінюються — виходить ваша власна версія моделі.