Prog Academy
RU UA
ИИ и машинное обучение

Что такое семантический поиск?

Семантический поиск — это поиск по смыслу запроса, а не по совпадению слов. Запрос и документы переводятся в эмбеддинги, после чего система находит записи, векторы которых ближе всего к вектору запроса.

Классический полнотекстовый поиск ищет вхождения слов и потому промахивается на синонимах, опечатках и переформулировках. Семантический поиск найдёт статью «условия возврата товара» по запросу «как вернуть покупку», потому что сравнивает смыслы.

На практике лучше всего работает гибридный подход: результаты полнотекстового и семантического поиска объединяют. Ключевые слова точнее для артикулов, названий и номеров, а семантика лучше для вопросов на естественном языке.

Связанные термины

Embedding

Эмбеддинг — это представление текста, изображения или другого объекта в виде вектора чисел, в котором близкие по смыслу объекты оказываются близко друг к другу. Именно эмбеддинги позволяют компьютеру сравнивать документы по смыслу, а не по совпадению слов.

Vector Database

Векторная база данных — это хранилище, оптимизированное под эмбеддинги: она хранит векторы вместе с исходными фрагментами текста и умеет за миллисекунды находить те из них, которые ближе всего к вектору запроса.

RAG

RAG (Retrieval-Augmented Generation) — это подход, при котором перед ответом система сначала находит релевантные фрагменты в вашей базе знаний и передаёт их языковой модели вместе с вопросом. Модель отвечает не «по памяти», а по конкретным документам.

LLM

LLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.