🗓️ خطة ٦ أسابيع

المرحلة دي أطول شوية لأنها قلب الموضوع. ساعتين في اليوم، وكل موديل جربه على داتا تانية غير اللي في الدرس.

1
الأسبوع ١
  • الدرسين ١ و ٢
  • كورس Intro to ML في Kaggle Learn
  • اعمل Linear Regression على dataset أسعار بيوت من Kaggle
2
الأسبوع ٢
  • الدرسين ٣ و ٤
  • موديل تصنيف على dataset تيتانيك في Kaggle، وحلل الـ confusion matrix
3
الأسبوع ٣
  • الدرسين ٥ و ٦
  • قارن ٤ موديلات على نفس الداتا واكتب ليه الأحسن كسب
4
الأسبوع ٤
  • الدرسين ٧ و ٨
  • أعد كتابة مشروعك كله كـ Pipeline، وظبطه بـ GridSearchCV
5
الأسبوع ٥
  • الدرس ٩
  • قسّم عملاء dataset مبيعات لشرايح، واكتب وصف وعرض مناسب لكل شريحة
6
الأسبوع ٦: المشروع
  • مشروع المرحلة: ادخل مسابقة Kaggle للمبتدئين (زي Titanic أو House Prices)، واعمل EDA ← Pipeline ← مقارنة موديلات ← submission، وارفع الـ notebook على GitHub
💡 ابدأ بسيط دايماًقبل أي موديل معقد، اعمل baseline: أبسط موديل ممكن (أو حتى توقع المتوسط). لو الموديل المعقد مش بيغلبه بفرق واضح، يبقى مش مستاهل التعقيد.
⚠ الـ test set مقدسةمتبصش على الـ test set وانت بتظبط الموديل. لو فضلت تعدل لحد ما نتيجة الـ test تبقى حلوة، انت كده بتخدع نفسك، والموديل هيفشل على الداتا الحقيقية. استخدم cross-validation للتظبيط، والـ test في الآخر خالص.

مصادر تكمل بيها

جاهز للمرحلة ٦؟

  • تقدر تاخد CSV وتطلع منه موديل متقيم صح في Pipeline واحد؟
  • تعرف إمتى الـ accuracy بتضحك عليك، وتختار بين precision و recall حسب المشكلة؟
  • تقدر تكتشف الـ overfitting وتعالجه؟
  • شاركت في مسابقة واحدة على الأقل في Kaggle؟