Что такое RAG (Retrieval-Augmented Generation)?
RAG (Retrieval-Augmented Generation) — это подход, при котором перед ответом система сначала находит релевантные фрагменты в вашей базе знаний и передаёт их языковой модели вместе с вопросом. Модель отвечает не «по памяти», а по конкретным документам.
Схема состоит из двух этапов. Сначала документы режут на фрагменты, превращают в эмбеддинги и складывают в векторную базу. Затем на каждый вопрос пользователя система переводит запрос в вектор, находит несколько самых близких фрагментов и подставляет их в промпт: «ответь на вопрос, опираясь только на этот контекст».
RAG решает три реальные проблемы: модель не знает внутренних документов компании, её знания устаревают, и она склонна выдумывать факты. Обновить базу знаний в RAG-системе — это просто загрузить новый документ, без переобучения модели.
RAG или fine-tuning — что выбрать
RAG подмешивает актуальные факты в момент запроса — идеален для баз знаний, регламентов и документации, которые меняются. Fine-tuning закрепляет стиль и формат ответа в весах модели — нужен, когда важно устойчивое поведение, а не свежие данные. Если сомневаетесь, начинайте с RAG: он дешевле, быстрее и его результат можно проверить по ссылкам на источники.
Связанные термины
Эмбеддинг — это представление текста, изображения или другого объекта в виде вектора чисел, в котором близкие по смыслу объекты оказываются близко друг к другу. Именно эмбеддинги позволяют компьютеру сравнивать документы по смыслу, а не по совпадению слов.
Vector DatabaseВекторная база данных — это хранилище, оптимизированное под эмбеддинги: она хранит векторы вместе с исходными фрагментами текста и умеет за миллисекунды находить те из них, которые ближе всего к вектору запроса.
Semantic SearchСемантический поиск — это поиск по смыслу запроса, а не по совпадению слов. Запрос и документы переводятся в эмбеддинги, после чего система находит записи, векторы которых ближе всего к вектору запроса.
LLMLLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.
HallucinationГаллюцинация — это ответ языковой модели, который звучит уверенно и правдоподобно, но фактически неверен: выдуманная цитата, несуществующая функция библиотеки, придуманный номер закона или ссылка, которая никуда не ведёт.
Fine-tuningFine-tuning — это дообучение уже готовой модели на своём наборе примеров, чтобы она усвоила нужный стиль, формат ответа или узкую предметную специфику. Веса модели при этом меняются — получается ваша собственная версия модели.