وقتی میگوییم یک مدل «معنای» یک جمله را میفهمد، منظور این نیست که مدل مثل انسان فکر میکند؛ منظور این است که آن جمله را به یک آرایه از اعداد تبدیل کرده که موقعیتش را در یک فضای ریاضی مشخص میکند. به این آرایه، Embedding یا بردار معنایی میگویند. این مفهوم قلب هر سیستمی است که قرار است روی دادهٔ اختصاصی شما جستوجوی معنایی انجام دهد؛ بدون embedding، جستوجو فقط میتواند بر اساس تطابق کلمهبهکلمه کار کند، نه بر اساس منظور واقعی سؤال کاربر.
لیست مطالب
Embedding چیست؟
Embedding خروجی یک مدل خاص (مدل embedding) است که یک متن ورودی — یک کلمه، یک جمله، یا یک پاراگراف — را میگیرد و آن را به یک بردار عددی با طول ثابت تبدیل میکند؛ برای مثال بردار میتواند شامل چند صد یا چند هزار عدد اعشاری باشد. این اعداد بهتنهایی برای انسان معنی ندارند، اما موقعیت آن بردار در یک فضای چندبعدی است که اهمیت دارد. مدل embedding طوری آموزش دیده که متنهای هممعنا را به نقاطی نزدیک به هم در این فضا نگاشت کند و متنهای بیربط را دور از هم قرار دهد.

چرا «نزدیکی در فضا» معادل «شباهت معنایی» است؟
تصور کنید هر جمله یک نقطه روی یک نقشهٔ چندبعدی باشد. جملههای «چطور رمز عبورم را عوض کنم» و «مراحل تغییر پسورد چیست» از نظر واژگان تقریباً هیچ کلمهٔ مشترکی ندارند، اما هر دو دربارهٔ یک موضوعاند. یک مدل embedding خوب این دو جمله را به نقاط نزدیک به هم در فضای برداری نگاشت میکند، چون در دادهٔ آموزشی خودش الگوهای مشابهی از این نوع جملهها دیده است. همین ویژگی است که به موتور جستوجو اجازه میدهد سؤال کاربر را نه با تطابق حرفبهحرف، بلکه با شباهت معنایی به بخشهای مرتبط سند وصل کند.
| روش جستوجو | مبنای تطابق | محدودیت اصلی |
|---|---|---|
| جستوجوی کلیدواژهای (Keyword) | وجود همان کلمهٔ دقیق در متن | مترادفها و بازنویسیهای سؤال را از دست میدهد |
| جستوجوی معنایی (Embedding) | نزدیکی بردار معنایی | به کیفیت مدل embedding و کیفیت chunkبندی وابسته است |
| ترکیبی (Hybrid Search) | هر دو مورد بالا با هم | پیچیدگی پیادهسازی بیشتر است |
Embedding در عمل چه شکلی است؟
در یک سیستم RAG معمولی، هر تکهٔ سند شما یکبار از مدل embedding عبور میکند و بردار حاصل در یک وکتور دیتابیس ذخیره میشود. وقتی کاربر سؤالی میپرسد، همان سؤال هم به یک بردار تبدیل میشود، و سیستم نزدیکترین بردارهای ذخیرهشده را پیدا میکند. آن تکههای متنی نزدیک، بهعنوان context به مدل زبانی تزریق میشوند تا پاسخ نهایی را بر اساس دادهٔ واقعی شما بسازد، نه بر اساس دانش عمومی از پیشآموختهاش.
متن ورودی: "هزینهٔ ارسال به شهرستان چقدر است؟"
|
v
مدل Embedding
|
v
بردار: [0.014, -0.083, 0.291, ...]
|
v
جستوجوی نزدیکترین بردارها در وکتور دیتابیس
|
v
بازیابی تکههای مرتبط سند و تزریق به مدل زبانی
ابعاد بردار یعنی چه؟
هر بردار embedding از تعداد مشخصی عدد تشکیل شده که به آن «ابعاد» بردار میگویند. هر بُعد را میتوان (بهشکل سادهشده و نه دقیقاً واقعی) یک محور معنایی تصور کرد که مدل در جریان آموزش خودش کشف کرده؛ ترکیب مقدار همهٔ این محورها با هم، موقعیت نهایی متن در فضای معنایی را مشخص میکند. مدلهای مختلف تعداد ابعاد متفاوتی تولید میکنند، و این عدد باید در طول عمر یک ایندکس ثابت بماند؛ در مقالهٔ بعدی این مجموعه بهطور مفصل توضیح میدهیم که تغییر مدل embedding بعد از ساخت ایندکس چه تلهای ایجاد میکند.
Embedding چه محدودیتی هم دارد؟
مهم است embedding را جادو ندانیم. مدل embedding معنای متن را بر اساس الگوهایی که در دادهٔ آموزشیاش دیده تخمین میزند؛ برای اصطلاحات بسیار تخصصی، اختصارات داخلی یک سازمان، یا زبانی که کمتر در دادهٔ آموزشی حضور داشته، این تخمین میتواند دقتش را از دست بدهد. به همین دلیل، کیفیت embedding را نباید فقط از روی توضیحات مدل قضاوت کرد؛ بهتر است با نمونهای واقعی از داده و سؤالهای واقعی کاربران خودتان تست شود، پیش از اینکه کل ایندکس بر پایهٔ آن ساخته شود.
کجای این زنجیره به ایجنت وصل میشود؟
Embedding فقط برای چتباتهای پرسشوپاسخ ساده کاربرد ندارد؛ هر ایجنتی که باید حافظهای بلندمدت از دادههای خودش داشته باشد یا بین چند منبع اطلاعاتی جستوجو کند، از همین مکانیزم استفاده میکند. اگر با مفهوم ایجنت آشنا نیستید یا میخواهید ببینید embedding چطور در یک معماری ایجنتی بزرگتر جا میگیرد، راهنمای کامل ایجنت هوش مصنوعی نقطهٔ شروع خوبی است.
Embedding سند در برابر Embedding سؤال
یک ظرافت که در پیادهسازی گاهی نادیده گرفته میشود این است که بعضی مدلهای embedding بین «متنی که باید ایندکس شود» و «متنی که باید جستوجو شود» تفاوت قائل میشوند و برای هرکدام یک حالت یا پیشوند متفاوت در ورودی پیشنهاد میدهند. اگر این تفاوت رعایت نشود، ممکن است هنوز نتیجهای بازگردد، اما کیفیت رتبهبندی نتایج پایینتر از حد واقعی مدل باشد. بنابراین قبل از استفاده از هر مدل embedding، ارزش دارد مستندات آن بررسی شود که آیا چنین تمایزی برای ساخت بردار سند و ساخت بردار سؤال کاربر توصیه شده یا نه.
جمعبندی
- Embedding یعنی تبدیل متن به یک بردار عددی که موقعیتش در فضای برداری، معنای متن را نمایندگی میکند.
- جملههای هممعنا حتی بدون کلمهٔ مشترک، در فضای embedding به هم نزدیک میشوند.
- این ویژگی پایهٔ جستوجوی معنایی است و جایگزین یا مکمل جستوجوی کلیدواژهای میشود.
- در معماری RAG، هم سند و هم سؤال کاربر به بردار تبدیل میشوند تا نزدیکترین تکهها پیدا شوند.
- همین مکانیزم پایهٔ حافظه و جستوجوی دانشی در ایجنتهای پیشرفتهتر هم هست.
- پیش از ساخت کل ایندکس، کیفیت embedding را با نمونهای واقعی از سؤالهای کاربران خودتان بسنجید، نه فقط بر اساس توضیحات کلی مدل.
