spam or ham classifier spam or ham classifier spam or ham classifier spam or ham classifier
تفاصيل العمل

## 📌 عنوان المشروع تصنيف رسائل SMS إلى سبام أو عادية باستخدام معالجة اللغة الطبيعية (Spam or Ham SMS Classifier) ## 📖 وصف المشروع يهدف هذا المشروع إلى بناء نموذج تعلم آلة قادر على التمييز بين رسائل SMS العادية (Ham) ورسائل السبام (Spam) اعتمادًا على محتوى النص. تُعدّ رسائل السبام من أكثر المشكلات شيوعًا في التواصل الرقمي، إذ تُشكّل تهديدًا للخصوصية وتجربة المستخدم. يساعد هذا النوع من النماذج في فلترة الرسائل تلقائيًا وحماية المستخدمين من المحتوى غير المرغوب فيه. ## ⚙️ تفاصيل العمل **1. معالجة البيانات (Data Preprocessing)** * تحميل البيانات والتحقق من جودتها * حذف الأعمدة الزائدة وإعادة تسمية الأعمدة * فحص التوازن بين الفئتين (Spam / Ham) * استخراج خصائص إضافية مثل عدد الأحرف والكلمات والجمل في كل رسالة **2. تنظيف النصوص (Text Cleaning)** * إزالة الأحرف غير الأبجدية والأرقام والرموز * تحويل النصوص إلى حروف صغيرة (Lowercase) * إزالة المسافات الزائدة **3. معالجة اللغة الطبيعية (NLP Pipeline)** * **Tokenization:** تقسيم النصوص إلى كلمات منفردة * **Stopword Removal:** إزالة الكلمات الشائعة التي لا تضيف معنى مثل (is, the, an) * **Lemmatization:** إرجاع الكلمات إلى صورتها الجذرية مع الحفاظ على صحتها اللغوية **4. تحويل النصوص إلى أرقام (Vectorization)** * بناء Corpus من النصوص المعالجة * استخدام **TF-IDF Vectorizer** لتحويل النصوص إلى متجهات رقمية * تشفير التصنيفات باستخدام **Label Encoder** **5. بناء النماذج (Model Building)** تم استخدام عدة نماذج، مثل: * Naïve Bayes (MultinomialNB) * Random Forest Classifier * K-Nearest Neighbors (KNN) * Support Vector Machine (SVM) **6. تقييم الأداء (Model Evaluation)** تم تقييم النماذج باستخدام: * Accuracy على بيانات التدريب والاختبار * Precision و Recall و F1-Score * 10-Fold Cross Validation للتحقق من استقرار النماذج * Confusion Matrix لتحليل الأخطاء **7. النتائج (Results)** * تحقيق دقة عالية في التمييز بين رسائل Spam و Ham * مقارنة شاملة بين أداء النماذج الأربعة * اختيار أفضل نموذج بناءً على مجموع المقاييس ## 🧠 الأدوات والتقنيات المستخدمة * Python * Pandas و NumPy * Matplotlib و Seaborn * NLTK (Natural Language Toolkit) * Scikit-learn ## 🎯 مخرجات المشروع * نموذج ذكي قادر على كشف رسائل السبام تلقائيًا * تحليل شامل لبيانات الرسائل النصية * مقارنة أداء أربعة خوارزميات تصنيف مختلفة ## 🚀 تحسينات مستقبلية * استخدام نماذج Deep Learning مثل LSTM أو BERT * تحسين الأداء باستخدام Hyperparameter Tuning * نشر النموذج كتطبيق ويب أو API * التعامل مع عدم التوازن في البيانات باستخدام SMOTE أو تقنيات مشابهة

شارك
بطاقة العمل
تاريخ النشر
منذ 3 أشهر
المشاهدات
53
المستقل
Antwan Gamil
Antwan Gamil
مهندس ذكاء اصطناعي
طلب عمل مماثل
شارك
مركز المساعدة