از Pista Academy حمایت کنید
خلاصه آموزشی
مرور سریع مفاهیم اصلی پیش از تماشای کامل یا برای جمعبندی بعد از آموزش.
در این جلسه اول دوره آموزشی، مدرس به معرفی مفاهیم پایه ساخت مدل زبانی (LLM) و فرآیند تیون کردن آن با استفاده از PyTorch میپردازد. به بررسی مفاهیمی مانند توکنیزیشن، امبدینگ، سلف اتنشن، ترنسفورم بلاکس و مکانیزم تولید متن پرداخته میشود. همچنین، اهمیت فاین تونینگ و استفاده از ابزارهایی مانند LoRA و Coolora برای بهینهسازی مدلهای زبانی مورد بحث قرار میگیرد. در نهایت، نحوه استفاده از مدلهای پیشآموزش داده شده برای تخصیص به حوزههای خاص و ایجاد مدل مولد ذهن خودمان مورد توجه قرار میگیرد.
نکات کلیدی
مقدمهای بر مفاهیم پایه ساخت مدل زبانی (LLM) و تیون کردن آن با PyTorch.
بررسی مفاهیمی مانند توکنیزیشن، امبدینگ، سلف اتنشن و ترنسفورم بلاکس.
توضیح اهمیت فاین تونینگ و استفاده از ابزارهایی مانند LoRA و Coolora برای بهینهسازی مدلهای زبانی.
نحوه استفاده از مدلهای پیشآموزش داده شده برای تخصیص به حوزههای خاص.
پرسشهای رایج
پاسخ کوتاه و مستقیم به پرسشهایی که معمولاً هنگام یادگیری این موضوع مطرح میشوند.
در این جلسه مفاهیمی مانند توکنیزیشن، امبدینگ، سلف اتنشن، ترنسفورم بلاکس و مکانیزم تولید متن مورد بررسی قرار میگیرد.
در این جلسه از ابزارهایی مانند LoRA و Coolora برای بهینهسازی مدلهای زبانی استفاده میشود.
در این جلسه به نحوه استفاده از مدلهای پیشآموزش داده شده برای تخصیص به حوزههای خاص اشاره شده است.
آخرین بهروزرسانی محتوای متنی:
آیا میخواهید واقعاً درک کنید که مدلهای زبانی بزرگ (Large Language Models) چگونه ساخته میشوند؟ در این دوره آموزشی، از سطح مفاهیم پایه شروع میکنیم و قدمبهقدم یک مدل زبانی بزرگ را از صفر با استفاده از PyTorch پیادهسازی میکنیم. هدف این دوره فقط استفاده از مدلهای آماده نیست؛ بلکه یاد میگیریم در پشت صحنه LLMها چه اتفاقی رخ میدهد و چگونه میتوان یک مدل زبانی را ساخت، آموزش داد، بهبود داد و برای کاربردهای واقعی آماده کرد. در طول این دوره، معماری داخلی مدلهای زبانی بزرگ، فرآیند آموزش، Alignment، Fine-Tuning و تکنیکهای مدرن بهینهسازی مدلها را بررسی خواهیم کرد. در این مسیر یاد میگیریم: 🔹 ساخت یک LLM کوچک از صفر و درک تمام مفاهیم کلیدی پشت آن 🔹 بررسی معماری Transformer و اجزای اصلی مدلهای زبانی 🔹 تحلیل عمیق نحوه عملکرد مدل با Visualizationهای پیشرفته 🔹 پیادهسازی و درک مفاهیم داخلی یک Advanced LLM 🔹 ساخت فرآیند Alignment از صفر و آشنایی با نحوه هماهنگسازی مدلها با اهداف انسانی 🔹 انجام Fine-Tuning مدلهای زبانی با استفاده از QLoRA 🔹 یادگیری تکنیکهای کاهش هزینه آموزش و بهینهسازی مدلها 🔹 بررسی ارتباط بین شبکههای عصبی، یادگیری ماشین و مدلهای مولد 🔹 توسعه درک عمیقتر از نحوه کارکرد مدلهای Generative AI سرفصلهای اصلی دوره: 📌 Coding a Small LLM from Scratch ساخت یک مدل زبانی کوچک و بررسی تمام مفاهیم پایه مورد نیاز 📌 Inside the AI Matrix Visualization و تحلیل عمیق ساختار داخلی LLMها 📌 Understanding Advanced LLMs بررسی معماری و مفاهیم پیشرفته مدلهای زبانی 📌 Building Alignment Process from Scratch درک فرآیند Alignment و نحوه آموزش مدل برای رفتار بهتر 📌 Fine-Tuning LLMs with QLoRA افزودن مهارتهای جدید به مدلهای زبانی با روشهای کمهزینه Fine-Tuning 📌 Origami + AI Learning بررسی ارتباط ایدههای یادگیری، شبکههای عصبی و هوش مصنوعی 📌 Activating the Generative Model of Your Own Mind نگاهی عمیقتر به مدلهای مولد و نحوه تفکر در مورد AI این دوره مناسب چه کسانی است؟ ✅ مهندسان یادگیری ماشین و هوش مصنوعی ✅ برنامهنویسان Python و PyTorch ✅ دانشجویان علاقهمند به Deep Learning ✅ افرادی که میخواهند از سطح استفادهکننده مدلهای AI به سطح سازنده مدل برسند ✅ کسانی که میخواهند درک عمیقی از ChatGPT، Llama و مدلهای مشابه داشته باشند پیشنیازهای پیشنهادی: آشنایی مقدماتی با Python آشنایی اولیه با Deep Learning آشنایی پایه با مفاهیم Neural Networks در این دوره، به جای اینکه فقط از LLMها استفاده کنیم، یاد میگیریم چگونه آنها را بسازیم، آموزش دهیم و شخصیسازی کنیم. 🎓 برای مشاهده کامل این دوره و دورههای تخصصی بیشتر در حوزه هوش مصنوعی، به کانال Pista Academy مراجعه کنید. #LLM #LargeLanguageModels #PyTorch #DeepLearning #GenerativeAI #FineTuning #QLoRA #ArtificialIntelligence #machinelearning pistaacademy.ir
ها و حالا بحث تیون کردن و اینا ایناست.
میخوام راجع به این موضوع صحبت بکنیم
که یکی دیگه از اون پلههای رسیدن به اینه
که شما تبدیل بشید به یک متخصص هوش مصنوعی
با خیلی از ابزار هوش مصنوعی مثل چلجی بیتی و جمنا و کلاد و اینا کار کردید
قطعاً یا احتمالاً تا الان
ما معمولاً یه پرامپتی رو وارد میکنیم
مدم چند لحظه پردازش انجام میده و در
نهایت یک پاسخ نسبتاً هوشمند در اختیار ما
قرار میده. اما سؤال اساسی اینجاست.
پشت این مدلا واقعاً چه اتفاقی داره
میفته؟ یه مدل زبانی چطور متنو دریافت
میکنه؟ چطور کلمات و جملات رو به اعداد
تبدیل میکنه؟ چون همه این مدلا در نهایت
با یه صفر و یک کار میکنن.
ارتباط بین کلماتو چهجوری میفهمه؟ چطور
پیشبینی میکنه که کلمات یا توکن بعدی
چیه؟ ترنسفورمر چیه؟ اتنشن چطور کار
میکنه یه مدل زبانی چیه؟ گونه آموزش داده
میشه و مهمتر از همه آیا میتوانیم
خودمون یه ال ام از صفر با پای تورچ
بسازیم؟ پاسخ مثبت بچهها و دقیقاً هم هدف
این دورهمون همینه که شما یاد بگیرید برای
خودتون بتونید ال بسازید.
در اصل بچهها ما قرار نیست دیگه از ال ما
استفاده بکنیم میخوایم بسازیمشو
و معمولاً بچهها تو خیلی از دورش مصنوعی شما میاید وصل میشید به یه مدل ایپی با
ایپیآی وصل میشید به یه ال مثل اپن ایآی
ازش استفاده میکنید
اونم در جای خود بچهها مهارت مفید ما
الان میتونم بگم دو مدل آدم داریم تو
حوزه هوش مصنوعی کسایی که خوب بلدن با
ابزار هوش مصنوعی کار کنن و ابزار مختلفو
میشناسن. این خودش یه تخصصه.
دسته دوم کسای که عمیقتر وارد هوشمستویی
شدن و در حقیقت اون پشتشو دارن یاد
میگیرن. اون در حقیقت اون مفاهیمشو دارن
یاد میگیرن.
ما اینجا قراره دقیقاً بریم سراغ مفاهیمه. یعنی بریم سراغ پیادهسازی ال
مسیر [گلویش را صاف میکند] دور از مفاهیم پایه شروع میشه به ساخت و آموزش و اعلان و
فاین تونیینگ مدلای زبانی میرسیم در
نهایت
تو بخش اول ما قراره در رابطه با جنریتیو
ایآی یه کمی صحبت کنیم ببینیم هوش مصنوعی
مولد چیه اسمشو زیاد شنیدیم این روزا چه
تفاوتی به مدلای سنتی ماشین لرنینگ داره و
مدلای زبانی بزرگ در کجای دنیای جنر رتی
ایآی قرار میگیرم.
بعد از اینکه دید کلی نسبت به موضوع پیدا
کردیم وارد قسمت جذاب دوره میشیم. ساخت یه
دونه ال ام کوچیک از صفر
یعنی با مپهای مثل توکنیزیشن امبدینگ
کانتکست سلف اتنشن مولتی هدنشن
پوزیشنال فور اینفورمیشن و ترنسفورم بلاکس
صحبت میکنیم و با مکانیزم تولید متنم آشنا
خواهیم شد. بچهها هدفمون نیست که چند خط
کدو کپس کنیم و اینو که خب خود باز همین ت
چجیبی تو اینا انجام میده.
هدف اینه که هر کی که کدو میخوایم
بنویسیم دقیقاً بگیم که این کد چرا وجود
داره و دقیقاً داخل مدل چه کاری انجام
میدم.
بعد از این مرحله که مدلو ساختیم وارد
بخشی میشیم به عنوان ایآی ماتریکس.
در اینجا سعی میکنیم برخی بعضی از مفاهیمی که داخل شبکههای عصبی اتفاق
میفتنرو به صورت تصویری بررسی کنیم.
مدلای زمانی مجموعه بزرگی از ماتریسها،
بردارها و عملیات ریاضی هستن. بچهها وقتی
بتونیم بعضی از این ساختارها رو
ویژوالیزیشن کنیم درک مفاهیم مانند
امبدینگ و اتنشن بسیار سادهتر خواهد
داشت.
بنابراین نمیخوایم ترنسفم برای ما یک بلک
باکس بمونه. یعنی میخوایم ببینیم واقعاً
داخلش چه خبره.
بعدشم میریم سراغ ال ام های یه مقدار
پیشرفتهتر یعنی بعد از که یه دونه
کوچولوشو ساختیم میریم یه کوچولو ارتقا
بدیم
معماری یه دونه ال ام ادونسو بررسی
میکنیم
اینجا خیلی از اون مفاهمی که قبلاً یاد
گرفتیم کلان یکدیگر قرار میگیره درجه درک
مدلهای بزرگتر براون سادهتر خواهد شد
فلسفهمونه که اول یه نسخه کوچیک و قابل
فهم میسازیم سپس سراغ معماریهای
پیچیدهتر میریم
بعد راجع به الاینمنت صحبت میکنیم. چرا فقط با پریینگ یه مدل تموم نمیشه کارش
با نیاز به الاینمنت داره بعدش. فرض کنید
یه مدل زبانی رو با حجم زیادی از متن
آموزش میدیم
آیا مدل بلافاصه تبدیل به یک اسیستنت خوب
شبیه چجی بیتی میشه؟ لزومی نداره
یه مدل از قبل آموزش داده شده اساساً یاد
گرفته که توکن بعدی رو پیشبینی کنه اما
یه دستیار هوشمند باید یاد بگیر دستورهای
کاربر دنبال کنه پاسخ مناسب تولید کنه
رفتاری نزدیک به چیزی داشته باشه که از یک
اسیستنت یا یک دستیار انتظار داره در این
قسمت درباره اعلان صحبت میکنیم و حتی سعی
میکنیم فرایند آن را به صورت عملی
پیادهسازی کنیم تفاوت بین یک بیس مدل و
یک اینستراک اکشن تیون مدل رو برا ما شفاف
میکنه.
بعدم راجع به فاین تیونینگ صحبت میکنیم
با ابزار مثل کیولورا که احتمالاشو شنیدید
خود لورا و کیولرا
یکی از کاربرترین قسمتهای این دوره
بچهها بحث فاینگ
میگه آموزش یک ال ام بزرگ از صفر به منابع
محاسباتی بسیار زیادی نیاز داره اما درس
از پروژه واقعی اصلاً لازم نیست مدلو از
صفر آموزش بدیم میتونیم یه مدل از قبل
آموزش داده شده و اپن سورسو برداریم تو
خیلی از الان مثلاً مثل هاگین پس و اونو
برای یک حوزه خاص آموزش بدیم خیلی کاری که
الان خیلی از شرکت تو ایران دارن انجام
میدن اسمشم میذارن توسعه هوش مصویی
حالا خیلی سادهشو بخوام بگم میان یه مدل سبک هوش مصنوعی رو برمیدارن از این اپنا
اپن سورس دیتای شرکتشونو بهش میدن بعد
میگن ما هوش مصنوعی توسعه دادیم دست که
اصلاً این نیست هوش مصنوعی توصیه دادن
در این دوره با یکی از روشهای مهم و بسیار کاربرده این حوزه یعنی کیول آشنا
خواهیم شد. یعنی یاد میگیریم چگونه بین
ترین بدون ترین کردن تمام پارامترهای مدل
آن برای کاربرد جدید فانتون کنیم.
مثلاً شما فرض کنید میخواید برای مسابقات
مثلاً
رانندگی در کبیر برید مثلا شرکت کنید.
نمیرید یه دونه ماشینو از صفر بسازید
مثلاً یه دونه تویتا مثلاً هایلوکسو
برمیدارید فقط یه ذره کاستومایزش میکنید
برای کبیر این میشه فاین یونین بچهها
یه قسمتی هم داریم تو این دوره برای بحث اوریگامی و آرت ایآر
چون منتها برای فهم بعضی دیدهای مربوط به
شاک عصبی استفاده میکنیم
و در نهایت فصل آخرمونم بحث
مدل مولد ذهن خودمان
من از یه کتابی کپی کردم بچهها یه سرفستگی کتابو دادم بهش یه ذ ترجمهشو بعد
ترجمه کردم این بوده فکر کنم حالا باید
برم الان ببینم کتابه رو آره همین بوده
یعنی قراره بررسی کنیم که چه چیزایی از
فرایند یادگیری مدل هوش مصیررو میتونیم
برای فراآیند یادگیری خلاقیت و حل مسئله
خودمون استفاده کنیم یه جوری میخوایم از
این گوشی یاد بگیریم برای زندگی خودمون.
خب این دوره برای کیا مناسبه؟ بچهها باید
یه ذره پایتون بلد باشید. یه کوچولو دیپ
لرنینگ بلد باشید. یعنی اگه دیپ لرنینگ
نمیدونید برید دوره دیپ لرنینگمونو
ببینید.
بعد
البته اینجا گفته لازم نیست ولی به نظر من
لازمه.
ماشین لرنینگ باید آشنا باشید. شبکههای
اثری و کمی ریاضیات اینا باعث میشه دولت
راحتتر بفهمه.
اینا رو که توضیح دادم چه یاد میگیریم و تموم. خیلی خب بریم بیایم جلسه بعدی شروع
کنیم. فعلاً خداحافظ.