Prog Academy
RU UA
AI-агенти та автоматизація

Що таке RAG (Retrieval-Augmented Generation)?

RAG (Retrieval-Augmented Generation) — це підхід, за якого перед відповіддю система спочатку знаходить релевантні фрагменти у вашій базі знань і передає їх мовній моделі разом із питанням. Модель відповідає не «з памʼяті», а за конкретними документами.

Схема складається з двох етапів. Спершу документи ріжуть на фрагменти, перетворюють на ембединги й складають у векторну базу. Далі на кожне питання користувача система переводить запит у вектор, знаходить кілька найближчих фрагментів і підставляє їх у промпт: «дай відповідь, спираючись лише на цей контекст».

RAG розвʼязує три реальні проблеми: модель не знає внутрішніх документів компанії, її знання застарівають, і вона схильна вигадувати факти. Оновити базу знань у RAG-системі — це просто завантажити новий документ, без перенавчання моделі.

RAG чи fine-tuning — що обрати

RAG підмішує актуальні факти в момент запиту — ідеальний для баз знань, регламентів і документації, які змінюються. Fine-tuning закріплює стиль і формат відповіді у вагах моделі — потрібен, коли важлива стала поведінка, а не свіжі дані. Якщо сумніваєтеся, починайте з RAG: він дешевший, швидший, а його результат можна перевірити за посиланнями на джерела.

Повʼязані терміни

Embedding

Ембединг — це представлення тексту, зображення чи іншого обʼєкта у вигляді вектора чисел, у якому близькі за змістом обʼєкти опиняються поруч. Саме ембединги дозволяють компʼютеру порівнювати документи за змістом, а не за збігом слів.

Vector Database

Векторна база даних — це сховище, оптимізоване під ембединги: вона зберігає вектори разом із вихідними фрагментами тексту й уміє за мілісекунди знаходити ті з них, що найближчі до вектора запиту.

Semantic Search

Семантичний пошук — це пошук за змістом запиту, а не за збігом слів. Запит і документи переводяться в ембединги, після чого система знаходить записи, вектори яких найближчі до вектора запиту.

LLM

LLM (Large Language Model, велика мовна модель) — це нейромережа, навчена на величезних обсягах тексту, яка прогнозує наступний фрагмент тексту. Саме на LLM працюють ChatGPT, Claude, Gemini та інші AI-асистенти.

Hallucination

Галюцинація — це відповідь мовної моделі, яка звучить упевнено й правдоподібно, але фактично хибна: вигадана цитата, неіснуюча функція бібліотеки, придуманий номер закону чи посилання, яке нікуди не веде.

Fine-tuning

Fine-tuning — це донавчання вже готової моделі на власному наборі прикладів, щоб вона засвоїла потрібний стиль, формат відповіді чи вузьку предметну специфіку. Ваги моделі при цьому змінюються — виходить ваша власна версія моделі.