Что такое семантический поиск?
Семантический поиск — это поиск по смыслу запроса, а не по совпадению слов. Запрос и документы переводятся в эмбеддинги, после чего система находит записи, векторы которых ближе всего к вектору запроса.
Классический полнотекстовый поиск ищет вхождения слов и потому промахивается на синонимах, опечатках и переформулировках. Семантический поиск найдёт статью «условия возврата товара» по запросу «как вернуть покупку», потому что сравнивает смыслы.
На практике лучше всего работает гибридный подход: результаты полнотекстового и семантического поиска объединяют. Ключевые слова точнее для артикулов, названий и номеров, а семантика лучше для вопросов на естественном языке.
Связанные термины
Эмбеддинг — это представление текста, изображения или другого объекта в виде вектора чисел, в котором близкие по смыслу объекты оказываются близко друг к другу. Именно эмбеддинги позволяют компьютеру сравнивать документы по смыслу, а не по совпадению слов.
Vector DatabaseВекторная база данных — это хранилище, оптимизированное под эмбеддинги: она хранит векторы вместе с исходными фрагментами текста и умеет за миллисекунды находить те из них, которые ближе всего к вектору запроса.
RAGRAG (Retrieval-Augmented Generation) — это подход, при котором перед ответом система сначала находит релевантные фрагменты в вашей базе знаний и передаёт их языковой модели вместе с вопросом. Модель отвечает не «по памяти», а по конкретным документам.
LLMLLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.