تحليل البيانات الضخمة لشبكة Yelp والتنبؤ بشعبية المستخدمين باستخدام Apache Spark تحليل البيانات الضخمة لشبكة Yelp والتنبؤ بشعبية المستخدمين باستخدام Apache Spark تحليل البيانات الضخمة لشبكة Yelp والتنبؤ بشعبية المستخدمين باستخدام Apache Spark
تفاصيل العمل

في عصر البيانات الضخمة (Big Data)، تفشل أدوات معالجة البيانات التقليدية في التعامل مع الحجم الهائل وسرعة تدفق البيانات وتنوعها. لذلك يهدف هذا المشروع إلى بناء وتطوير بنية تحتية موزعة (Distributed System) قابلة للتوسع، لمعالجة وتحليل أكثر من 600,000 سجل من بيانات شبكة Yelp الاجتماعية، بهدف فهم وتوقع العوامل الأساسية المؤثرة في شعبية المستخدمين (عدد المتابعين - Fans). لحل هذه المشكلة، قمت بتأسيس بيئة عمل موزعة باستخدام Docker Compose لإدارة حاويات مستقلة شملت (NameNode, DataNode, Spark Master, Worker)، والاعتماد على نظام ملفات هادوب الموزع (HDFS) كطبقة تخزين آمنة للبيانات. تم بناء Pipeline كاملة للبيانات الضخمة باستخدام Apache Spark والمعالجة داخل الذاكرة (In-memory computation)؛ شمل ذلك تنقية البيانات بـ PySpark، الاستغناء عن المتغيرات ذات القيم المفقودة المرتفعة (مثل ميزة Elite بنسبة 91.44%)، وحذف السجلات المكررة. كما تم تطبيق التحويلات اللوغاريتمية لمعالجة الالتواء الإحصائي (Data Skewness)، وهندسة ميزات جديدة مثل فترة الانضمام للمنصة (User Tenure) وإجمالي التفاعلات الإيجابية (Social Score). بعد تجهيز البيانات والهيكل الموزع، تم تدريب نموذج تعلم آلة متقدم يعتمد على أشجار التدرج المعزز (Gradient Boosted Trees - GBT) للتعامل مع العلاقات غير الخطية والمحتوى الضخم بفعالية. أظهرت النتائج نجاح البنية التحتية الموزعة ونموذج GBT في تحقيق معامل تحديد (R-squared score) ممتاز بلغ 80.97% في التنبؤ بتأثير المستخدمين. كما ساعد تحليل أهمية الخصائص (Feature Importance) في الكشف عن أن فائدة المراجعات التي يكتبها المستخدم (Utility / log_useful) هي المحرك الأساسي الأول لزيادة المتابعين، مما يثبت إحصائياً أن القيمة الفعلية للمحتوى هي العامل الأهم في صناعة التأثير على المنصة.

شارك
بطاقة العمل
تاريخ النشر
منذ 3 أيام
المشاهدات
12
المستقل
طلب عمل مماثل
شارك
مركز المساعدة