تصنيف الرسائل إلى Spam و Ham باستخدام التعلم الآلي و NLP
تفاصيل العمل
يهدف هذا المشروع إلى بناء نظام لاكتشاف الرسائل المزعجة (Spam) باستخدام تقنيات معالجة اللغة الطبيعية (NLP) والتعلم الآلي (Machine Learning)، حيث يتم تصنيف الرسائل النصية إلى فئتين: Spam (مزعجة) و Ham (غير مزعجة). تمت معالجة البيانات النصية من خلال تنظيف النصوص وإزالة الكلمات غير المهمة (Stopwords) وتطبيق عملية Stemming بسيطة لتوحيد جذور الكلمات. بعد ذلك يتم تحويل النصوص إلى تمثيل رقمي يعتمد على تكرار الكلمات واحتمالاتها. تم استخدام نموذج Bernoulli Naive Bayes تم تنفيذه من الصفر دون استخدام مكتبات جاهزة، حيث يتعلم النموذج احتمالات ظهور الكلمات داخل كل فئة (Spam و Ham) ويستخدمها في التنبؤ بالرسائل الجديدة. ولتحسين أداء النموذج تم استخدام تقنيات مثل موازنة البيانات (Random Over-Sampling) وتقنية تنعيم الاحتمالات (Laplace Smoothing). يتم تقييم أداء النموذج باستخدام مقاييس مختلفة مثل الدقة (Accuracy)، Precision، Recall، وF1-score بالإضافة إلى مصفوفة الالتباس (Confusion Matrix). يُظهر المشروع قدرة نماذج الاحتمالات البسيطة على تحقيق نتائج قوية في مهام تصنيف النصوص ضمن تطبيقات NLP.
بطاقة العمل
طلب عمل مماثل