Vector Embedding

تعبیهٔ برداری (Embedding) چیست؟

تعبیهٔ برداری روشی برای نمایش یک شیء مانند واژه، جمله، سند یا تصویر به‌صورت برداری از اعداد است؛ به‌گونه‌ای که ساختار و شباهت‌های آموخته‌شده در داده تا حدی در هندسه این فضا بازتاب پیدا کند. شباهت برداری ابزار محاسباتی مفیدی است، اما معادل فهم انسانی یا رابطه علّی نیست.

چرا تعبیهٔ برداری (Embedding) مهم است؟

تعبیه برداری پایه بسیاری از سامانه‌های جست‌وجوی معنایی، خوشه‌بندی، پیشنهاددهی و بازیابی اسناد برای RAG است. این مفهوم مستقل از برند و مدل خاص است و برای فهم اینکه چگونه متن به فضای قابل جست‌وجوی عددی تبدیل می‌شود اهمیت دارد.

چگونه از آن استفاده کنیم؟

  1. واحد بازیابی را تعیین کنید: واژه، بند، سند یا شیء دیگر.
  2. یک مدل تعبیه برداری متناسب با زبان و دامنه انتخاب و روی داده واقعی ارزیابی کنید.
  3. بردارها را در یک نمایه مناسب ذخیره و معیار شباهت را مشخص کنید.
  4. کیفیت بازیابی را با پرسش‌های واقعی و معیارهای نرخ بازیابی (recall) و دقت نتایج (precision) یا قضاوت تخصصی بسنجید.
  5. متادیتا، فیلترهای ساختاری و نسخه منبع را کنار بردار نگه دارید.

محدودیت و خطای رایج

نزدیکی دو بردار تضمین نمی‌کند دو متن از نظر واقعیت، اعتبار یا کاربرد مدیریتی معادل‌اند. کیفیت تعبیه برداری به داده، زبان، مدل و نوع مسئله وابسته است و باید با نمونه‌های دامنه خودتان آزموده شود.

منابع برای پیگیری

تعریف و توضیح این مدخل با اتکا به منابع زیر تدوین شده است. برای پژوهش یا استناد دانشگاهی، نسخه اصلی منبع را نیز بررسی کنید.

  1. Efficient Estimation of Word Representations in Vector SpaceMikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space. arXiv:1301.3781.
  2. Dense Passage Retrieval for Open-Domain Question AnsweringKarpukhin, V., et al. (2020). Dense Passage Retrieval for Open-Domain Question Answering. Proceedings of EMNLP 2020.

جای این مفهوم در نقشه یادگیری

این مدخل بخشی از حوزه هوش مصنوعی است. برای دیدن مفاهیم نزدیک و جای این مفهوم در یک مسئله بزرگ‌تر، صفحه مادر این حوزه را ببینید.

Retrieval-Augmented Generation (RAG)

تولید تقویت‌شده با بازیابی (RAG)

RAG خانواده‌ای از معماری‌هاست که پیش از یا هنگام تولید پاسخ، اطلاعات مرتبط را از یک منبع بیرونی بازیابی می‌کند و آن زمینه را در اختیار مدل مولد می‌گذارد. در شکل رایج، یک پرسش به نمایش قابل بازیابی تبدیل می‌شود، اسناد یا قطعه‌های مرتبط انتخاب می‌شوند و مدل پاسخ را با اتکا به آن زمینه تولید می‌کند.

Large Language Model

مدل زبانی بزرگ (LLM)

مدل زبانی بزرگ یا LLM مدلی آماری و عصبی برای برآورد توزیع دنباله‌های زبانی است که با داده و ظرفیت محاسباتی زیاد آموزش می‌بیند و معمولاً متن را با پیش‌بینی واحد بعدی زبان تولید یا امتیازدهی می‌کند. بسیاری از LLMهای امروزی بر معماری ترنسفورمر بنا شده‌اند، اما «بزرگ» یک مرز عددی ثابت و علمی ندارد.

یادداشت برای دور بعدی

چه چیزی در این صفحه درست نیست؟

یادداشت روی همین هاست ثبت می‌شود و در صف خصوصیِ بازخورد می‌ماند تا در نوبت بعدی به فهرست اقدام منتقل شود.