Prog Academy
RU UA
ШІ та машинне навчання

Що таке семантичний пошук?

Семантичний пошук — це пошук за змістом запиту, а не за збігом слів. Запит і документи переводяться в ембединги, після чого система знаходить записи, вектори яких найближчі до вектора запиту.

Класичний повнотекстовий пошук шукає входження слів і тому промахується на синонімах, друкарських помилках та переформулюваннях. Семантичний пошук знайде статтю «умови повернення товару» за запитом «як повернути покупку», бо порівнює змісти.

На практиці найкраще працює гібридний підхід: результати повнотекстового й семантичного пошуку обʼєднують. Ключові слова точніші для артикулів, назв і номерів, а семантика краща для питань природною мовою.

Повʼязані терміни

Embedding

Ембединг — це представлення тексту, зображення чи іншого обʼєкта у вигляді вектора чисел, у якому близькі за змістом обʼєкти опиняються поруч. Саме ембединги дозволяють компʼютеру порівнювати документи за змістом, а не за збігом слів.

Vector Database

Векторна база даних — це сховище, оптимізоване під ембединги: вона зберігає вектори разом із вихідними фрагментами тексту й уміє за мілісекунди знаходити ті з них, що найближчі до вектора запиту.

RAG

RAG (Retrieval-Augmented Generation) — це підхід, за якого перед відповіддю система спочатку знаходить релевантні фрагменти у вашій базі знань і передає їх мовній моделі разом із питанням. Модель відповідає не «з памʼяті», а за конкретними документами.

LLM

LLM (Large Language Model, велика мовна модель) — це нейромережа, навчена на величезних обсягах тексту, яка прогнозує наступний фрагмент тексту. Саме на LLM працюють ChatGPT, Claude, Gemini та інші AI-асистенти.