پشت پرده هوش مصنوعی | قسمت 34: روتر در مدل MoE چیست؟
در مدلهای زبانی بزرگ، همیشه لازم نیست تمام بخشهای مدل برای پردازش یک ورودی فعال باشند. همانطور که در قسمت قبل از مجموعه «پشت پرده هوش مصنوعی» دیدیم، معماری Mixture of Experts یا MoE مدل را به چند بخش تخصصی به نام Expert تقسیم میکند.
اما وقتی یک توکن وارد مدل میشود، یک سؤال مهم مطرح میشود:
روتر در مدل MoE چیست و چگونه تصمیم میگیرد کدام Expert باید این توکن را پردازش کند؟
در این قسمت میخواهیم ببینیم Router چه نقشی در معماری MoE دارد و چگونه مسیر پردازش هر توکن را مشخص میکند.
روتر در مدل MoE چیست؟
در معماری Mixture of Experts ،Expertهای مختلف بخشهایی تخصصی از شبکه عصبی هستند که میتوانند در پردازش ورودیهای مختلف نقش داشته باشند.
اما اگر همه Expertها برای هر توکن فعال شوند، بخش زیادی از مزیت MoE از بین میرود.
اینجاست که Router وارد میشود.
Router یا روتر مدل MoE بخشی از معماری است که برای هر ورودی مشخص میکند کدام Expertها باید آن را پردازش کنند.
بنابراین Router خودش پاسخ نهایی را تولید نمیکند؛ بلکه تصمیم میگیرد اطلاعات از کدام مسیرهای تخصصی عبور کند.
Router چگونه Expert مناسب را انتخاب میکند؟
وقتی یک توکن وارد Router میشود، Router برای Expertهای موجود امتیازهایی محاسبه میکند.
این امتیازها نشان میدهند که هر Expert تا چه اندازه برای پردازش آن ورودی مناسب است.
برای مثال، فرض کنید یک مدل چند Expert داشته باشد و Router برای یک توکن چنین امتیازهایی تولید کند:
- Expert 1 → امتیاز بالا
- Expert 2 → امتیاز متوسط
- Expert 3 → امتیاز پایین
- Expert 4 → امتیاز بالا
در یک تنظیم معمول، Router میتواند Expertهایی را که امتیاز بالاتری دارند انتخاب کند و توکن را برای پردازش به آنها ارسال کند.
بنابراین لازم نیست تمام Expertهای مدل برای هر توکن فعال باشند.
آیا برای هر توکن Expert یکسانی انتخاب میشود؟
خیر.
یکی از ویژگیهای مهم معماری MoE این است که انتخاب Expert میتواند بر اساس ورودی تغییر کند.
یعنی دو توکن مختلف ممکن است توسط Expertهای متفاوتی پردازش شوند.
برای مثال، اگر یک ورودی درباره برنامهنویسی باشد، Router ممکن است یک مجموعه از Expertها را انتخاب کند؛ در حالی که برای ورودی دیگری درباره موضوعی کاملاً متفاوت، مسیر دیگری انتخاب شود.
در نتیجه، مدل میتواند از ظرفیت تخصصی بخشهای مختلف خود به شکل پویا استفاده کند.
آیا همه Expertها همزمان فعال میشوند؟
معمولاً هدف معماری MoE این است که برای هر توکن فقط بخش محدودی از Expertها فعال شوند.
این موضوع یکی از دلایل مهم استفاده از معماری Mixture of Experts در مدلهای بزرگ است.
مدل میتواند تعداد بسیار زیادی پارامتر داشته باشد، اما برای پردازش هر توکن لازم نیست همه این پارامترها در محاسبات فعال باشند.
به این ترتیب، بین ظرفیت مدل و هزینه محاسباتی نوعی تعادل ایجاد میشود.
Router چه چیزی را تولید میکند؟
نکته مهم این است که Router خودش پاسخ مدل را تولید نمیکند.
وظیفه Router بیشتر به انتخاب مسیر پردازش مربوط میشود.
پس اگر کاربر سؤالی را وارد کند، Router قرار نیست مستقیماً جواب سؤال را پیدا کند. وظیفه آن این است که مشخص کند کدام بخشهای تخصصی مدل باید در پردازش آن ورودی مشارکت داشته باشند.
چرا انتخاب Expert اهمیت دارد؟
اگر Router بتواند Expertهای مناسب را بهدرستی انتخاب کند، ظرفیت مدل بهتر مورد استفاده قرار میگیرد و محاسبات غیرضروری کاهش پیدا میکند.
اما اگر مسیر مناسبی انتخاب نشود، ممکن است بخشی از ظرفیت Expertها به شکل مؤثر استفاده نشود.
به همین دلیل، طراحی Router یکی از بخشهای مهم معماریهای Mixture of Experts محسوب میشود.
تفاوت مدل معمولی و مدل MoE در فعالسازی پارامترها
در یک مدل متراکم یا Dense، تقریباً تمام بخشهای اصلی مدل برای پردازش هر ورودی مورد استفاده قرار میگیرند.
اما در مدل MoE، تعداد زیادی Expert وجود دارد و Router تعیین میکند کدام Expertها برای یک ورودی فعال شوند.
بنابراین ممکن است یک مدل MoE تعداد پارامترهای بسیار زیادی داشته باشد، اما در پردازش هر توکن فقط بخشی از این ظرفیت مورد استفاده قرار گیرد.
این تفاوت، یکی از ایدههای اصلی پشت معماری MoE است.
جمعبندی
پاسخ سؤال «روتر در مدل MoE چیست؟» این است که Router بخشی از معماری Mixture of Experts است که برای هر توکن، Expertهای مناسب را انتخاب میکند.
Router ابتدا برای Expertهای مختلف امتیاز محاسبه میکند و سپس بر اساس این امتیازها، تعدادی از Expertها را برای پردازش انتخاب میکند.
در نتیجه، همه Expertهای یک مدل لازم نیست برای هر توکن فعال باشند.
به زبان ساده:
Router تصمیم میگیرد توکن از کدام مسیر عبور کند؛ Expert وظیفه پردازش آن را بر عهده دارد.
این سازوکار به مدلهای MoE اجازه میدهد ظرفیت بسیار بالایی داشته باشند، بدون اینکه برای پردازش هر توکن مجبور باشند تمام بخشهای مدل را بهطور همزمان فعال کنند.
درباره فیلاگر | جامعه هوش مصنوعی ایران
فیلاگر، جامعه هوش مصنوعی ایران، مرجعی برای آموزش، تحلیل و بررسی فناوریهای نوین هوش مصنوعی است. در مجموعه «پشت پرده هوش مصنوعی» تلاش میکنیم مفاهیم پیچیده AI را با زبانی ساده برای علاقهمندان فارسیزبان توضیح دهیم.
پشت پرده هوش مصنوعی | قسمت ۱
پشت پرده هوش مصنوعی | قسمت ۲
پشت پرده هوش مصنوعی | قسمت ۳
پشت پرده هوش مصنوعی | قسمت ۴
پشت پرده هوش مصنوعی | قسمت ۵
پشت پرده هوش مصنوعی | قسمت ۶
پشت پرده هوش مصنوعی | قسمت ۷
پشت پرده هوش مصنوعی | قسمت ۸
پشت پرده هوش مصنوعی | قسمت ۹
پشت پرده هوش مصنوعی | قسمت ۱۰
پشت پرده هوش مصنوعی | قسمت ۱۱
پشت پرده هوش مصنوعی | قسمت ۱۲
پشت پرده هوش مصنوعی | قسمت ۱۳
پشت پرده هوش مصنوعی | قسمت ۱۴
پشت پرده هوش مصنوعی | قسمت ۱۵
پشت پرده هوش مصنوعی | قسمت ۱۶
پشت پرده هوش مصنوعی | قسمت ۱۷
پشت پرده هوش مصنوعی | قسمت ۱۸
پشت پرده هوش مصنوعی | قسمت ۱۹
پشت پرده هوش مصنوعی | قسمت ۲۰
پشت پرده هوش مصنوعی | قسمت ۲۱
پشت پرده هوش مصنوعی | قسمت ۲۲
پشت پرده هوش مصنوعی | قسمت ۲۳
پشت پرده هوش مصنوعی | قسمت ۲۴
پشت پرده هوش مصنوعی | قسمت ۲۵
پشت پرده هوش مصنوعی | قسمت ۲۶
پشت پرده هوش مصنوعی | قسمت ۲۷
پشت پرده هوش مصنوعی | قسمت ۲۸
پشت پرده هوش مصنوعی | قسمت ۲۹
پشت پرده هوش مصنوعی | قسمت ۳۰
پشت پرده هوش مصنوعی | قسمت ۳۱
پشت پرده هوش مصنوعی | قسمت ۳۲
پشت پرده هوش مصنوعی | قسمت ۳۳
دیدگاهتان را بنویسید