چرا تعبیهٔ برداری (Embedding) مهم است؟
تعبیه برداری پایه بسیاری از سامانههای جستوجوی معنایی، خوشهبندی، پیشنهاددهی و بازیابی اسناد برای RAG است. این مفهوم مستقل از برند و مدل خاص است و برای فهم اینکه چگونه متن به فضای قابل جستوجوی عددی تبدیل میشود اهمیت دارد.
چگونه از آن استفاده کنیم؟
- واحد بازیابی را تعیین کنید: واژه، بند، سند یا شیء دیگر.
- یک مدل تعبیه برداری متناسب با زبان و دامنه انتخاب و روی داده واقعی ارزیابی کنید.
- بردارها را در یک نمایه مناسب ذخیره و معیار شباهت را مشخص کنید.
- کیفیت بازیابی را با پرسشهای واقعی و معیارهای نرخ بازیابی (recall) و دقت نتایج (precision) یا قضاوت تخصصی بسنجید.
- متادیتا، فیلترهای ساختاری و نسخه منبع را کنار بردار نگه دارید.
محدودیت و خطای رایج
نزدیکی دو بردار تضمین نمیکند دو متن از نظر واقعیت، اعتبار یا کاربرد مدیریتی معادلاند. کیفیت تعبیه برداری به داده، زبان، مدل و نوع مسئله وابسته است و باید با نمونههای دامنه خودتان آزموده شود.
منابع برای پیگیری
تعریف و توضیح این مدخل با اتکا به منابع زیر تدوین شده است. برای پژوهش یا استناد دانشگاهی، نسخه اصلی منبع را نیز بررسی کنید.
- Efficient Estimation of Word Representations in Vector SpaceMikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space. arXiv:1301.3781.
- Dense Passage Retrieval for Open-Domain Question AnsweringKarpukhin, V., et al. (2020). Dense Passage Retrieval for Open-Domain Question Answering. Proceedings of EMNLP 2020.
جای این مفهوم در نقشه یادگیری
این مدخل بخشی از حوزه هوش مصنوعی است. برای دیدن مفاهیم نزدیک و جای این مفهوم در یک مسئله بزرگتر، صفحه مادر این حوزه را ببینید.
مفاهیم مرتبط
تولید تقویتشده با بازیابی (RAG)
RAG خانوادهای از معماریهاست که پیش از یا هنگام تولید پاسخ، اطلاعات مرتبط را از یک منبع بیرونی بازیابی میکند و آن زمینه را در اختیار مدل مولد میگذارد. در شکل رایج، یک پرسش به نمایش قابل بازیابی تبدیل میشود، اسناد یا قطعههای مرتبط انتخاب میشوند و مدل پاسخ را با اتکا به آن زمینه تولید میکند.
مدل زبانی بزرگ (LLM)
مدل زبانی بزرگ یا LLM مدلی آماری و عصبی برای برآورد توزیع دنبالههای زبانی است که با داده و ظرفیت محاسباتی زیاد آموزش میبیند و معمولاً متن را با پیشبینی واحد بعدی زبان تولید یا امتیازدهی میکند. بسیاری از LLMهای امروزی بر معماری ترنسفورمر بنا شدهاند، اما «بزرگ» یک مرز عددی ثابت و علمی ندارد.