چرا معماری ترنسفورمر مهم است؟
شناخت ترنسفورمر کمک میکند بین «معماری» و «محصول» فرق بگذاریم. نام یک دستیار یا مدل تجاری ممکن است عوض شود، اما مفاهیمی مانند سازوکار توجه، نمایش برداری و پردازش دنبالهای برای فهم فنی نسل بزرگی از مدلها ماندگارترند.
چگونه از آن استفاده کنیم؟
- ابتدا مسئله دنبالهای و نوع ورودی را مشخص کنید.
- بین رمزگذار (encoder)، رمزگشا (decoder) و ترکیب رمزگذار-رمزگشا بر اساس نوع وظیفه تمایز بگذارید.
- سازوکار توجه (attention) را بهعنوان روش ساخت نمایش وابسته به زمینه بفهمید، نه توضیح کامل علت تصمیم مدل.
- محدودیت طول زمینه، هزینه محاسبات و کیفیت داده را در طراحی سامانه لحاظ کنید.
- برای کاربرد عملی، معماری را همراه با روش آموزش، داده، بازیابی و ارزیابی ببینید.
محدودیت و خطای رایج
وزنهای سازوکار توجه را نباید بهسادگی معادل «اهمیت علّی» یا توضیح کامل رفتار مدل دانست. ترنسفورمر نیز بهتنهایی درباره کیفیت داده، واقعیتسنجی یا ایمنی سامانه چیزی تضمین نمیکند.
منابع برای پیگیری
تعریف و توضیح این مدخل با اتکا به منابع زیر تدوین شده است. برای پژوهش یا استناد دانشگاهی، نسخه اصلی منبع را نیز بررسی کنید.
- Attention Is All You NeedVaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems, 30.
جای این مفهوم در نقشه یادگیری
این مدخل بخشی از حوزه هوش مصنوعی است. برای دیدن مفاهیم نزدیک و جای این مفهوم در یک مسئله بزرگتر، صفحه مادر این حوزه را ببینید.
مفاهیم مرتبط
مدل زبانی بزرگ (LLM)
مدل زبانی بزرگ یا LLM مدلی آماری و عصبی برای برآورد توزیع دنبالههای زبانی است که با داده و ظرفیت محاسباتی زیاد آموزش میبیند و معمولاً متن را با پیشبینی واحد بعدی زبان تولید یا امتیازدهی میکند. بسیاری از LLMهای امروزی بر معماری ترنسفورمر بنا شدهاند، اما «بزرگ» یک مرز عددی ثابت و علمی ندارد.
تعبیهٔ برداری (Embedding)
تعبیهٔ برداری روشی برای نمایش یک شیء مانند واژه، جمله، سند یا تصویر بهصورت برداری از اعداد است؛ بهگونهای که ساختار و شباهتهای آموختهشده در داده تا حدی در هندسه این فضا بازتاب پیدا کند. شباهت برداری ابزار محاسباتی مفیدی است، اما معادل فهم انسانی یا رابطه علّی نیست.