از Pista Academy حمایت کنید
خلاصه آموزشی
مرور سریع مفاهیم اصلی پیش از تماشای کامل یا برای جمعبندی بعد از آموزش.
در این جلسه، مدرس به بررسی رگولاریزیشن در شبکههای عصبی میپردازد و به دو روش اصلی آن یعنی دروپوت و ال (L2) میگردد. همچنین، به توضیح مفهوم مینی بچ (Mini-batch) در ترینینگ شبکههای عصبی و نحوه اعمال آن در کد میپردازد. این بخش شامل توضیحاتی درباره انتخاب بچ سایز، تأثیر آن بر عملکرد شبکه، و نحوه اعمال شافل برای توزیع بهتر دادهها در هر اپوک است.
نکات کلیدی
رگولاریزیشن به منظور جلوگیری از اورفیت شدن و بهبود جنرالیزیشن مدل استفاده میشود.
دروپوت با غیرفعال کردن تصادفی نورونها در حین آموزش، به کاهش وابستگی مدل به دادههای آموزشی کمک میکند.
استفاده از مینی بچ (Mini-batch) در ترینینگ شبکههای عصبی به منظور کاهش مصرف جی پی یو و افزایش سرعت یادگیری است.
نحوه اعمال شافل (Shuffle) در هر اپوک برای توزیع بهتر دادهها و جلوگیری از تکرار بچهای یکسان.
پرسشهای رایج
پاسخ کوتاه و مستقیم به پرسشهایی که معمولاً هنگام یادگیری این موضوع مطرح میشوند.
رگولاریزیشن به منظور جلوگیری از اورفیت شدن و بهبود جنرالیزیشن مدل استفاده میشود.
دروپوت با غیرفعال کردن تصادفی نورونها در حین آموزش، به کاهش وابستگی مدل به دادههای آموزشی کمک میکند.
استفاده از مینی بچ (Mini-batch) در ترینینگ شبکههای عصبی به منظور کاهش مصرف جی پی یو و افزایش سرعت یادگیری است.
آخرین بهروزرسانی محتوای متنی:
در این دوره جامع، وارد دنیای Deep Learning (یادگیری عمیق) میشویم و مفاهیم اصلی، الگوریتمها و تکنیکهای مورد استفاده در ساخت مدلهای هوش مصنوعی را از پایه یاد میگیریم. این دوره برای افرادی طراحی شده که میخواهند درک عمیقی از شبکههای عصبی، معماریهای مدرن یادگیری عمیق و نحوه پیادهسازی مدلهای هوش مصنوعی با Python و PyTorch داشته باشند. در طول این دوره ابتدا با مفاهیم پایه Deep Learning آشنا میشویم و سپس قدمبهقدم به سمت ساخت و آموزش مدلهای واقعی حرکت میکنیم. در این دوره یاد میگیرید: 🔹 مفاهیم پایه یادگیری عمیق و نحوه عملکرد شبکههای عصبی 🔹 کار با Python، NumPy و PyTorch برای توسعه مدلهای Deep Learning 🔹 ساخت و آموزش Artificial Neural Networks (ANNs) 🔹 مفهوم Gradient Descent و نحوه بهینهسازی مدلها 🔹 جلوگیری از Overfitting با روشهایی مانند Regularization و Cross Validation 🔹 انتخاب Activation Function، Optimizer و Hyperparameterها 🔹 ساخت Feed Forward Neural Networks 🔹 ارزیابی عملکرد مدلهای یادگیری ماشین 🔹 کار با پروژههای عملی Deep Learning 🔹 آشنایی با Autoencoderها 🔹 اجرای مدلهای Deep Learning روی GPU 🔹 طراحی و پیادهسازی Convolutional Neural Networks (CNNs) 🔹 پروژههای مرتبط با تصاویر و Computer Vision 🔹 Transfer Learning و استفاده از مدلهای از پیش آموزشدیده 🔹 Neural Style Transfer 🔹 Generative Adversarial Networks (GANs) 🔹 Recurrent Neural Networks (RNNs) و مدلهای GRU/LSTM 🔹 مباحث اخلاقی و آینده Deep Learning همچنین در بخشهای ابتدایی دوره، مباحث ضروری Python شامل: ✅ ساختار دادهها در Python ✅ Indexing و Slicing ✅ Functions ✅ Flow Control ✅ کار با Text و Plotها بررسی میشود تا بتوانید بدون نیاز به پیشنیازهای پیچیده وارد دنیای Deep Learning شوید. این دوره مناسب چه کسانی است؟ این دوره برای: 🎯 دانشجویان و علاقهمندان هوش مصنوعی 🎯 برنامهنویسانی که میخواهند وارد حوزه Machine Learning و Deep Learning شوند 🎯 Data Scientistها و تحلیلگرانی که میخواهند مهارتهای خود را ارتقا دهند 🎯 افرادی که قصد ساخت پروژههای واقعی AI دارند مناسب است. پیشنیازهای دوره برای شروع این دوره بهتر است با موارد زیر آشنایی اولیه داشته باشید: ✔ مفاهیم پایه برنامهنویسی ✔ آشنایی مقدماتی با Python ✔ آشنایی اولیه با ریاضیات پایه اما تمام مباحث مورد نیاز در طول دوره مرور و توضیح داده خواهد شد. اگر به دنبال یادگیری Deep Learning به صورت اصولی و پروژهمحور هستید، این دوره میتواند مسیر شما را برای ورود به دنیای هوش مصنوعی هموار کند. 📌 برای مشاهده تمام جلسات این دوره، کانال Pista Academy را دنبال کنید. 🌐 وبسایت: https://pistaacademy.ir
آموزشمون وابسته نشه. یکی از مشکلات اصلی
که ما توی فصل قبلی هم راجع بهش صحبت
کردیم بحث اورفیت شدن مدلمون بود.
میخوایم جلو اورفیت شدنشو بگیریم.
فرض کنید ما د تا مدل داریم اینجا مدل A و بی
مدل A
توی دیتای ترین یا آموزش دقتش ۹۹ده ولی
توی دیتای تست ۷۲
مدل بی
تو جفتش دقتش نزدیکه جفتش حدود ۹۰ده
میگه مدل A ممکنه که تو دیتای ترند
تقریباً ۱۰۰ ۱د دقت داشته ولی توی تست
خراب کرده و مدل بی توی جنریالیزیشن بهتره
هدف رگولاریزیشنم همینه اینکه اورفیتو کم
کنه جنریالیزیشنو بیاره بالا
حالا چرا ای ان ان مستعد اورفیت شدنه
چون ممکنه که تعداد پارامترا خیلی زیاد
باشه ما مثال زدیم جلسه قبل اومدیم یه
شبکه عصبی رو با همدیگه پیادهسازی کردیم
فرض کنید که ۲۰ تا فیچر ورودی داریم ۱۰۰
تا [گلویش را صاف میکند]
لایه اولمون ۱۰۰ تا لایه دوم ۱۰۰ تا خروجی
یه دونه
فقط بین د تا هیدن لایرا نزدیک ۱۰ هزار تا
وزن داریم چون بچهها هر شبکه عصبی وصل به
تمام شبکههای عصبی لایه بعدشه
پس اینا ضرب در هم میشه و وزناش تعدادش
و اگه شبکه اگه د تا ستمون کوچیک باشه شبکه ممکنه جزئیات ترینینگ دیتا رو حفظ
بکنه
چون این همه وزن داره
اما مهمترین روشهایی که برای رگولیزیشن
وجود داره چیه؟ دوروتو با همدیگه توی مثال
قبلی دیدیم پروژه قبلی که انجام دادیم با
همدیگه دیدیم چهجوری بود یکی دیگه و
رگولاریزیشنه ال د رگولاریزیشنه
ال استاپین دیتا آگمنتیشن کاهش پیچیدگی
مدل استفاده از داده بیشتر
ب نورمالزیشن
اینا روشهای مختلفی که وجود دارن تو این
فصل ما تمرکزمون روی دروپود ال ت و مینی ب
از این چهار تا میخوایم صح استفاده بکنیم
و صحبت کنیم.
خب
[صدای سرفه][گلویش را صاف میکند]
ترین و ایول
میگه این موضوع توی پایتورچ خیلی مهمه.
پایتورچ خود پایتورچ چی بود بچهها؟
در حقیقت یه فریمورکیه برای بحث دیپ لرنینگه
چش اینجا گفته کتابخونه ولی خودش گفته
فریمورک این دو تا یه تفاوت دارن پایتوش
میگه یه کتابخونه اپن سورس برای دیپلنینگ
که توسط متا توسعه داده شده یعنی فیسبوک و
اینا اینستاگرام و فیسبوک در هر روز توسط
اون کسایی که لینوکسو بای پایه گذاشتن
داره توسعه پیدا میکنه
و چیز قطعاً خوبیه. حالا ما تو این دوره
راجع بهش صحبت خواهیم کرد راجع به پایتوچ
پایتوچ [گلویش را صاف میکند] میگه د تا
مود اصلی داره یکی مدل.تر یکی مدل. ایول
قبل از ترینگ مینویسیم مدل. ترن یعنی مدل
رو در ترینگ مود قرار میدیم انگار که د تا
دکمه داشته باشه ماشینه میخوایم ببریمش
تو آموزش. م دکمه آموزشو میزنیم میره تو
حالت آموزش.
این موضوع مخصوص لایههاییست که رفتار
متفاوتی در ترینینگ و اولویشن دارن مثل
دروپوت و بچنو تو اون مثال قبلی یادتونه
زده بودیم اینجا
ببینم لایهها رو داریم مثال قبلی
خب اینجا اینجا
الان پیداش نمیخوام بذار عکسشو خب [گلویش را صاف میکند][صدای سرفه]
این مثال جلسه قبلمون بود دیگه ما اون
وسطها یه درپود داشتیم میبینید اینهاش
داره میگه که این ترنینگ مود قراره که روی
این لایه هایی که
مخصوص لایههایی که رفتار متفاوت در ترینینگ ولوشن دارن مثل درپورت
رفتار این لایه با لایههای دیگه متفاوته
میگه که فرض کنید ان انداپوت نیم در
ترینینگ دروپود فعاله یعنی تعداد نورم به
صورت تصادفی غیر فعال میشه من آب بخورم
صدام جور شد
خب [گلویش را صاف میکند]
پس کار ت دروپود چی بود میومد توی یک لایه
شبکه عصبی یه تعدادی از دقیقاً نرونها رو
به صورت تصادفی غیر فعال فعال میکرد
اما هنگام تست دروپ غیر فعال میشه و زمانی
که ما داریم دیتا تستو میدیم به شبکههای
عصبی عملاً این لایهها غیر فعال میشه
بچهها
چرا انگار میتونست نباید درپوت فعال باشه فرض کنید شبکه پیشبینی میکنه که
مثلاً به احتمال ۷۲ این بیمار میمیره
اگر هر بار تعداد متفاوتی نورون حذف بشه
ممکن است پیشبینیها متفاوت باشه
برای اولیشن معمولی نمیخوایم همچین
رفتاریرو از مدل ببینیم بنابراین
از مدل. ایول استفاده میکنیم که تو این
مود اون لایههای دروپود کلاً
غیر فعال میشن.
خب اینا رو رد کنیم. ساختار استاندارد میگه مود لاتر
بعد
دیتای ترینو میاد لود میکنه حالا کدشو
کاری نداریم توی اولوشن هم دیتای تستو
میاد لود میکنه
خب درو بچهها مفهومشو یاد بگیرید خیلی
مهمتره ها ببینید خیلی خودتونو درگیر کدا
نکنید چون کد هست اصلا آمادهست یه جورایی
کدا خیلی خودتون درگیر مپو یاد بگیرید
میگه [گلویش را صاف میکند] درپود یکی از
معروفترین تکنیکهای رگولاریزیشن در
شبکههای عصبیه.
فرض کنید هیدن لایه داره ۸ تا نورون باشه
میگه فرض کن لایه میانی ۸ تا نورون داشته
باشه
ما یه عکس شبکه عصبی رم داشته باشیم ضرر
نداره بذارید من اینم استرچ کنم یه تصویری
هم تو ذهنتون یه چیزی باشه مثلاً هم چیزی
بچهها تصور کنید این لایه ورودیه اینا
لایههای میانین این لایه خروجی این ۳ تا
خروجی داره و همه اینا نگاه کنید به
همدیگه وصلن ۳ تا خروجی نداره در اصل ۸ تا
خروجی داره خروجیش ۸ تاییه
د به توان تعداد سلولاست
خب
بیایم اینجا
میگه فرض کن لایه میانی ۸ تا سلول عصبی
داره دروپود ۲۵ یعنی چی؟ یعنی یک/ چهارم
اینا رو ما غیر فعال میکنیم. مثلاً ۲ تاش
غیر فعال میشه. میگه تو بدج بعدی ممکنه
نورهای دیگهای رو غیر فعال بکنه.
چرا دروپ فود کار میکنن؟ بدون درپود
ممکنه از شبکه به چند نورون خاص وابسته
بشه. یعنی وزن یه چند تا از اینا رو خیلی
بالا بگیره و اونا اثرگذاریشون بیشتر
باشه. اما با دروپود امکان داره دقیقاً
همونا رو ما خاموش کنیم.
خب اینم که مشخصه دیگه نیم یعنی نصفش دهم یعنی ۲۰د اینا رو کاری نداریم خب بچهها
میگه دروپود مقدار ثابتی نداره مثلاً بگیم
برای این مسئله انقدر بذاریم
معمولاً مثلاً همین عددای ی دهم و دودهم و سه دهم و اینا در نظر میگیرم
مثلاً برای یه دونه ان شبکه عصبی کوچیک
میگه دودهم شروع خوبیه
اما بچهها دروپوتم زیاد بکنید امکان داره
از اونور بوم بیفتید دچار آندرفیت بشید
این دفعه یعنی رو دیتا ترید هم آموزش
نبینه پس اینو باید حواستون باشه
خب یه مثال داره میزنه کدشو بهمون نشون
میده میگه یه دونه شبکه عصبی رو من
ایمپورت کردم از ترچ
بعد اومده یه سری لایه درست کرده این لایه
اوله بعد یه دونه اکتیویشن فانکشن گذاشته
دروپوتو گذاشته و لایه دوم اکتیویشن
فانکشن دروپوت و لایه آخر
ساختار اینه ۱۲ تا فیچر ورودی داریم لایه اول ۳۲ تا در حقیقت شبکه عصبی داره بعد
اکتیوشن فانکشنه بعد دروپوت ۲۵ و لایه
بعدی ۱۶ تا داره و یه درپوت ۲۵م روش اعمال
میشه و خروجی خروجیمونم یه دونهست یعنی دو
کلاسهست یه صفره یا یکه دو حالت داره
معمولاً پس از اکتیویشن قرار میگیره دروپود بچهها همیشه یادتون باشه یعنی
وقتی اکتیوشن فانکشن اعمال میشه بعد
دروپود میاد کار خودشو میکنه
البته میگه باید تو ترتیب بستگی معماری
میتونه متفاوت باشه
آیا روی لایه خروجی هم دروپود میذاریم
معمولاً
[گلویش را صاف میکند] و معمولاً درپوت قبلش یا داخل لایههای
میانی یا هیدن لایه استفاده میکنم. یعنی
مثلاً تو این لایه آخر دیگه نمیا یه دونه
بعدش دروپوت اضافه کنم. دروپوت مال این
لایههای میانیه. یعنی بعد از این بعد از
این بعد از این حت بعد از این لایه اول.
میگه خیلی نکته مهمه بچهها این میگه رگولاریزیشن شاید باعث بشه اکیورسی شما رو
دیتای ترند بیاد پایین ولی نگران نشید رو
دیتای تست عملکردش ولی بهتر میشه یعنی
مثلاً شاید این ۹۴رو بکنه مثلاً ۹۰ ولی
مثلاً اگه این ۷۰ باشه میرفتش بالا ۸۰ رو
دیتای تست مهمم بچهها دیتای تسته
خب بریم مدل دیگه رگولایزرشن که بهش میگن ال و تو
میگه توی شهرکهای عصبی هدف قایی ما اینه
که بتونیم لاسو بیاریم پایین و خروجیمون
با خروجی واقعی نزدیک باشه
میگه فرض کنید وزنامون اینه ویتامون ال دو پنالتی میاد وزنا رو به توان د
میرسونه با هم جمع میکنه میشه ۲۹
بعد اگر اینم یک سدون باشه ضرب در اون
میکنه این مقدارو به لاس اضافه میکنه
یعنی تعمداً بچهها داره لاسو میب میبره
بالا تعمداً بچهها لاست بره بالا چه
اتفاقی میفته؟
وقتی لاس میره بالا ما مدلمون میره دنبال
اینکه ویتاشو هی تغییر بده
یعنی میاد و وی خیلی بزرگو جریمه میکنه انگاف
بنابراین مدل میره سمت اینکه ویتاشو بیاره
پایین
مثلاً به جای یه عددایی برای ویت میگه
بذار من کمتر بگیرم چون دارم هرچی بیشتر
میگیرم ویتا رو جریمهم میکنه لاسم میره
میگه این باعث میشه مدل نرمتر و کمتر نیست باید به دیتای ترین حساس بشه هرچی
ویت بیاد پایین
تو ال وان قدر مطلق وی رو جریمه درق اضافه
میکنه اونجا توان د که اینجا قدر مطلق یه
مقدار پنایش کمتره تو
میگه الوان تمایل بیشتری داره که بعضی ویتا رو دقیقاً یا تقریباً صفر بکن بکنه
د معمولاً ویتا رو کوچیک میکنه ولی
الزاماً صفر نمیکنه
تو ال قدر مطلق ویتا تو L ۲ مربعشون بعد برخی ویتا رو دستگیر صفر میکنه این
ویتا رو نرم میکنه
پرکتیس داره نشون میده تم کدشو داره نشونتون میده اصلاً نمیخوایم خودمون
بچهها وارد این کدا کنیم چون واقعاً مهم
نیست اونقدیم
در کارای مدرن معمولاً انتخاب به استفاده از این است چون
نمیدونم حالا منظورش چیه
بریم جلوتر حالا بهش
باز این کد رو رد کنیم من مفاهیمو میخوام
بهتون بگم
آها اینم باحاله میگه یه تصوری که وجود داره برای همه اینه
که فکر میکنن ما میایم دیتا ترینمون رو
یه قلفتی یه جا میدیم به مدل درس که
اینجوری نیست بچهها در قالب بچهای مختلف
این کارو میکنن ما د تا مفهوم داشتیم
دیگهتون باشه یه ب داشتیم یه اپوک
میگفتیم هر چند تا ب یه اپوکه پس نمیام
کل دیتای ترینو یه جا بدم میام بچ میدم
که بهش به این روش میگن فول بتدین دیسنت
اما توی دیپلین از روش مینی بچ ترینینگ
استفاده میکنن. یعنی چی؟ مینی بچ
ترینینگ؟ مثلاً فرض کنید دیتای ترین شما
۱۰۰ تا رکورد داره بچ سایزتونو میگیرن ۳۲
یعنی میان این ۱۰۰ تا رو ۳۲ تا ۳۲ تا در
نظر میگیرن بعد بچ اولو میدن دوم سوم تا
۱۰۰ تا تکمیل بشه
بعد تو هر بچ
یه بار شبکه لرن میکنه
و وزناشو آپدیت میکنه بعد بچی رو میدن
دوباره آپدیت بچی دوباره آپدیت
چرا مینیچ
حافظه کمتر لازم نیست کل دیتا دیتا ستتون
وارد جی پی یو بشه مقدار مصرف جیپیو رو
میاره پایین ویتها در طول یه دونه اپک
چندین بار آپدیت میشن چون ما دیتا تل
داریم تیکه تیکه بهش میدیم
جی پی یو معمولاً بهتر میکنه سرعتش
بالاتره مقدار نویز مفیدمون
چی میگه آها آها گردینت یه دونه میلی تطبیق نداره
با گردینت کل دیتا ست
و میتونه این نویز کا به اپتیمایزیشن و
جنریزیشن کمک کنه خیلی مباحث پیچیده پشتشو
بچهها سری رد میشیم ما
سه نوع ترنینگ داریم این تلفظش سخته برام فکر کنم میشه اس دو
کستیک
گرید دیسنت بعد سایزو گرفته یک خیلی
کوچولوئه یعنی هر یه دونه یه دونه دیتای
که میده به شرهای عصبی یه آپدیت انجام
میده یه میلی ب داریم ۳۲ تا ۶۴ تای ۱۲۸
تاییه که معمولاً این روش استفاده میشه یه
فول بچم داریم که کل دیتا دیتا ستو میده
که گفتیم این کار باعث میشه میزان مصرف جی
پیو و سرعت بیاد پایین
اینم داره کدشو بهتون بگه چهجوریه که ما از این رد
میشیم
آها فرض کنید مثلاً شما ۱۰۰ تا دیتا دارید
لبلزید یک تا ۱۰۰ دور اول میاد بچههاشو
مثلاً ۲۰ تایی درزم بگیرید مثلاً ۵ تا ۲۰
تا میکنه اون ۱۰۰ تا رو دور بعدی که
میخواد دوباره دیتا ترینرو بده به مدل
یعنی تو اپوک بعدی میاد ترکیب یک تا ۱۰و
بر هم میریزه که اون ۲۰ تا ۲۰ تایی که
انتخاب میشه با دفعه قبلی متفاوت باشه اگر
شافلو شما ترو بذارید تو اون کدتون که
دارید مینویسید کجاست؟
ایناش اینجا که داره بچهها رو میسازه شافلتون رو بذارید تو هر اپوک ترتیب
دیتاها رو به هم میریزه
این کاررو کمک میکنه که بچهها تو هر اپوک یکسان نباشه دیگه چون کار تکراری
میشه دیگه اینجوری باشه
فرض کنید ترین سمپلمون ۱۰۰ تاست بعد سایزمون ۳۲ه طبیعتاً بچه بچهها آخرمون
چار تایی میشه
۳ تا ۳۲ تا میشه ۹۶ تا ۴ تا میمونه برای
بچهها آخر پس آموزش آخرمون فقط باز چار
تا سمت داره انجام میشه میگه این همیشه
مشکل درست نمیکنه بسیاری شبکهها میتونن
باهاش کار کنن اما در برخی شرایط بجع کوچک
آخر ممکنه مشکل ایجاد کنه راست میگه یعنی
چون ۴ار تا داریم میدیم امکان داره اون
آپدیتی که رو ویتا میزنه نسبت به
آپدیتهای قبلی یه مقدار متفاوت باشه
دقیقاً داره اینجا دور اشاره میکنه میگه اگر لاس هر بچو بدون در نظر گرفتن بت سایز
بیایم میانگین بگیریم بچهها آخر که
معمولاً تل سمپلش کمتره ممکنه وزن مشابه
بچههای بزرگ پیدا بگیره که این اصلاً
درست درست نیست
چیکار میکنیم؟ آها یه دونه آپشن داریم درابلس ترو
میتونیم آخرین بچ کوچیکو حذف کنیم با این
روش
چون اینم شافلم ترو کردیم نگران نیستیم که
اون چار تا آخر دیتا آخری از هیچوقت در
نظر گرفته نشه چون دفعه بعدی قراره اینا
به هم ترتیبش به هم میریزه اون چار تا
بالاخره میفته توی دوره دیگه
ولی میگه همیشه ضروری نیست
چه زمانی مناسبه
بچ نرم داریم یعنی اون بچ آخرمون واقعاً
تیزش خیلی کمه
اندازه ث برای معماری مهمه آخرین بچ خیلی
کوچیکه
میگه توی خیلی از شبکههای عصبی ساده اگه اینو فالس بذارید مشکل ایجاد نمیکنه
خب هیچی چی
داره میره یه مثالی بزنه برای ما اینجا چیزایی که لازم داریمو ایمپورت کرده یه
دونه دیتا ست سمپل آورده که مال چیز ایست
قلبیه یه سست خیلی معروفیه
دیت ستو خونده ایکس و وایشو جدا کرده ما
تو مثال قبلی اینا رو دیدیم میخوام یه بار
دیگه مرور بشه
دیتای ترین و تستو میکنه ولیدیشن رو
۲۰ تست گرفته
سپس ولیدیشن رو
استیپ قبلی هم این کارو نکردیم ۶۴ ترین
۱۶ ولیدیشن آها یه دونه اینجا اومده روی
همون دیتای ترند یه بار دیگه ترنتس
اسپیریت زده یه بار دیگه
استاندر اسکالر یادتونه دیگه رنج عددا اگه خیلی با هم اختلاف داشت میومد همه رو
میبرد تو یه رنج مشخص
فیت ترنسفورم یادتون باشه اینو توضیح دادم
که دو مرحله کار انجام میشه
اینو حتماً راجع بهش صحبت بکنید بعداً بریزیمش من میخوام دیگه روندو ببینید
خب ساخت مدل دارای درپوت اینجا
لایههامونو ساختش این لایه اولمونه
اکتیویشن فانکشن درپوت لایه دوم اکتیویشن
درپود و اینم لایه آخر چون ما یه دونه حال
خروجیمون یه حالت است دیگه یا
دچار حمله قبلی قلبی میشه یا نمیشه پس
خروجیمون باید یه دونه شکارثی باشه که دو
حالتو ایجاد کنه
در آخرم دیتای ترین
و همین الو رگولیزیشن کجا استفاده کرده این آشش
اینجا
میگه د تا رگولایزیشن همزمان داریم هم دروپوتو داریم هم اینو داریم
من از این کداش میگذرم چون واقعاً الان با ابزار هوش مصنوعی خیلی درگیر این کدا
نمیشین
مفاهیمشو میخوام بهتون بگم
بعد بریم جلوتر همون مثالی که ما جلسه قبل زدیم تقریباً داره میزنه
خیلی خب به نظرم برای این جلسه کافیه اینم
از بحث فصل رگولاریزیشن بریم بیایم جلسه
بعدی میریم سراغ فصل بعدی فعلاً خداحافظ