Prog Academy
RU UA
AI-агенты и автоматизация

Что такое RAG (Retrieval-Augmented Generation)?

RAG (Retrieval-Augmented Generation) — это подход, при котором перед ответом система сначала находит релевантные фрагменты в вашей базе знаний и передаёт их языковой модели вместе с вопросом. Модель отвечает не «по памяти», а по конкретным документам.

Схема состоит из двух этапов. Сначала документы режут на фрагменты, превращают в эмбеддинги и складывают в векторную базу. Затем на каждый вопрос пользователя система переводит запрос в вектор, находит несколько самых близких фрагментов и подставляет их в промпт: «ответь на вопрос, опираясь только на этот контекст».

RAG решает три реальные проблемы: модель не знает внутренних документов компании, её знания устаревают, и она склонна выдумывать факты. Обновить базу знаний в RAG-системе — это просто загрузить новый документ, без переобучения модели.

RAG или fine-tuning — что выбрать

RAG подмешивает актуальные факты в момент запроса — идеален для баз знаний, регламентов и документации, которые меняются. Fine-tuning закрепляет стиль и формат ответа в весах модели — нужен, когда важно устойчивое поведение, а не свежие данные. Если сомневаетесь, начинайте с RAG: он дешевле, быстрее и его результат можно проверить по ссылкам на источники.

Связанные термины

Embedding

Эмбеддинг — это представление текста, изображения или другого объекта в виде вектора чисел, в котором близкие по смыслу объекты оказываются близко друг к другу. Именно эмбеддинги позволяют компьютеру сравнивать документы по смыслу, а не по совпадению слов.

Vector Database

Векторная база данных — это хранилище, оптимизированное под эмбеддинги: она хранит векторы вместе с исходными фрагментами текста и умеет за миллисекунды находить те из них, которые ближе всего к вектору запроса.

Semantic Search

Семантический поиск — это поиск по смыслу запроса, а не по совпадению слов. Запрос и документы переводятся в эмбеддинги, после чего система находит записи, векторы которых ближе всего к вектору запроса.

LLM

LLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.

Hallucination

Галлюцинация — это ответ языковой модели, который звучит уверенно и правдоподобно, но фактически неверен: выдуманная цитата, несуществующая функция библиотеки, придуманный номер закона или ссылка, которая никуда не ведёт.

Fine-tuning

Fine-tuning — это дообучение уже готовой модели на своём наборе примеров, чтобы она усвоила нужный стиль, формат ответа или узкую предметную специфику. Веса модели при этом меняются — получается ваша собственная версия модели.