Transformer Architecture

معماری ترنسفورمر چیست؟

ترنسفورمر یک معماری شبکه عصبی برای پردازش دنباله‌هاست که هسته آن بر سازوکار توجه (attention) تکیه دارد. این سازوکار به مدل اجازه می‌دهد هنگام ساخت نمایش هر بخش از ورودی، وزن متفاوتی به بخش‌های دیگر بدهد. این معماری در شکل‌های رمزگذار (encoder)، رمزگشا (decoder) یا ترکیب رمزگذار-رمزگشا به کار می‌رود و پایه بسیاری از مدل‌های زبانی جدید است.

چرا معماری ترنسفورمر مهم است؟

شناخت ترنسفورمر کمک می‌کند بین «معماری» و «محصول» فرق بگذاریم. نام یک دستیار یا مدل تجاری ممکن است عوض شود، اما مفاهیمی مانند سازوکار توجه، نمایش برداری و پردازش دنباله‌ای برای فهم فنی نسل بزرگی از مدل‌ها ماندگارترند.

چگونه از آن استفاده کنیم؟

  1. ابتدا مسئله دنباله‌ای و نوع ورودی را مشخص کنید.
  2. بین رمزگذار (encoder)، رمزگشا (decoder) و ترکیب رمزگذار-رمزگشا بر اساس نوع وظیفه تمایز بگذارید.
  3. سازوکار توجه (attention) را به‌عنوان روش ساخت نمایش وابسته به زمینه بفهمید، نه توضیح کامل علت تصمیم مدل.
  4. محدودیت طول زمینه، هزینه محاسبات و کیفیت داده را در طراحی سامانه لحاظ کنید.
  5. برای کاربرد عملی، معماری را همراه با روش آموزش، داده، بازیابی و ارزیابی ببینید.

محدودیت و خطای رایج

وزن‌های سازوکار توجه را نباید به‌سادگی معادل «اهمیت علّی» یا توضیح کامل رفتار مدل دانست. ترنسفورمر نیز به‌تنهایی درباره کیفیت داده، واقعیت‌سنجی یا ایمنی سامانه چیزی تضمین نمی‌کند.

منابع برای پیگیری

تعریف و توضیح این مدخل با اتکا به منابع زیر تدوین شده است. برای پژوهش یا استناد دانشگاهی، نسخه اصلی منبع را نیز بررسی کنید.

  1. Attention Is All You NeedVaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems, 30.

جای این مفهوم در نقشه یادگیری

این مدخل بخشی از حوزه هوش مصنوعی است. برای دیدن مفاهیم نزدیک و جای این مفهوم در یک مسئله بزرگ‌تر، صفحه مادر این حوزه را ببینید.

Large Language Model

مدل زبانی بزرگ (LLM)

مدل زبانی بزرگ یا LLM مدلی آماری و عصبی برای برآورد توزیع دنباله‌های زبانی است که با داده و ظرفیت محاسباتی زیاد آموزش می‌بیند و معمولاً متن را با پیش‌بینی واحد بعدی زبان تولید یا امتیازدهی می‌کند. بسیاری از LLMهای امروزی بر معماری ترنسفورمر بنا شده‌اند، اما «بزرگ» یک مرز عددی ثابت و علمی ندارد.

Vector Embedding

تعبیهٔ برداری (Embedding)

تعبیهٔ برداری روشی برای نمایش یک شیء مانند واژه، جمله، سند یا تصویر به‌صورت برداری از اعداد است؛ به‌گونه‌ای که ساختار و شباهت‌های آموخته‌شده در داده تا حدی در هندسه این فضا بازتاب پیدا کند. شباهت برداری ابزار محاسباتی مفیدی است، اما معادل فهم انسانی یا رابطه علّی نیست.

یادداشت برای دور بعدی

چه چیزی در این صفحه درست نیست؟

یادداشت روی همین هاست ثبت می‌شود و در صف خصوصیِ بازخورد می‌ماند تا در نوبت بعدی به فهرست اقدام منتقل شود.