چرا مدل زبانی بزرگ (LLM) مهم است؟
LLM موتور زبانی بسیاری از سامانههای مولد، دستیارها و عاملهای نرمافزاری است. فهم اینکه خروجی آن حاصل مدلسازی احتمالاتی زبان است کمک میکند توانایی زبانی را با حافظه واقعی، پایگاه دانش قطعی یا استدلال بیخطا اشتباه نگیریم.
چگونه از آن استفاده کنیم؟
- مسئله را مشخص کنید: تولید متن، طبقهبندی، استخراج، تبدیل یا گفتوگو.
- ورودی و دستور را طوری طراحی کنید که زمینه و محدودیت لازم را روشن کند.
- برای اطلاعات بیرونی یا بهروز، مدل را به منبع یا بازیابی متصل کنید.
- خروجی را متناسب با ریسک مسئله ارزیابی و در کارهای حساس با کنترل انسانی همراه کنید.
- کیفیت را با مجموعه آزمون واقعی خودتان بسنجید، نه فقط چند نمونه نمایشی.
محدودیت و خطای رایج
روانی متن نشانه صحت نیست. مدل میتواند پاسخ سازگار و قانعکنندهای تولید کند که از نظر واقعیت، منبع یا منطق نادرست باشد. اندازه بیشتر نیز بهتنهایی تضمینکننده کیفیت، ایمنی یا تناسب با مسئله نیست.
منابع برای پیگیری
تعریف و توضیح این مدخل با اتکا به منابع زیر تدوین شده است. برای پژوهش یا استناد دانشگاهی، نسخه اصلی منبع را نیز بررسی کنید.
- Language Models are Few-Shot LearnersBrown, T. B., et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems, 33.
- Attention Is All You NeedVaswani, A., et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems, 30.
جای این مفهوم در نقشه یادگیری
این مدخل بخشی از حوزه هوش مصنوعی است. برای دیدن مفاهیم نزدیک و جای این مفهوم در یک مسئله بزرگتر، صفحه مادر این حوزه را ببینید.
مفاهیم مرتبط
معماری ترنسفورمر
ترنسفورمر یک معماری شبکه عصبی برای پردازش دنبالههاست که هسته آن بر سازوکار توجه (attention) تکیه دارد. این سازوکار به مدل اجازه میدهد هنگام ساخت نمایش هر بخش از ورودی، وزن متفاوتی به بخشهای دیگر بدهد. این معماری در شکلهای رمزگذار (encoder)، رمزگشا (decoder) یا ترکیب رمزگذار-رمزگشا به کار میرود و پایه بسیاری از مدلهای زبانی جدید است.
تعبیهٔ برداری (Embedding)
تعبیهٔ برداری روشی برای نمایش یک شیء مانند واژه، جمله، سند یا تصویر بهصورت برداری از اعداد است؛ بهگونهای که ساختار و شباهتهای آموختهشده در داده تا حدی در هندسه این فضا بازتاب پیدا کند. شباهت برداری ابزار محاسباتی مفیدی است، اما معادل فهم انسانی یا رابطه علّی نیست.
تولید تقویتشده با بازیابی (RAG)
RAG خانوادهای از معماریهاست که پیش از یا هنگام تولید پاسخ، اطلاعات مرتبط را از یک منبع بیرونی بازیابی میکند و آن زمینه را در اختیار مدل مولد میگذارد. در شکل رایج، یک پرسش به نمایش قابل بازیابی تبدیل میشود، اسناد یا قطعههای مرتبط انتخاب میشوند و مدل پاسخ را با اتکا به آن زمینه تولید میکند.