تطوير ML Pipeline متكاملة للتنبؤ بمؤشر جودة الهواء (AQI) ومعالجة البيانات غير المتزنة
تفاصيل العمل
تُعد مراقبة جودة الهواء والتنبؤ بحالته من التحديات البيئية والصحية الكبرى، نظراً لتأثير التلوث المروري والتغيرات المناخية. لذلك يهدف هذا المشروع إلى بناء نظام تنبؤ ذكي يعتمد على تقنيات الـ Machine Learning لتصنيف مستويات مؤشر جودة الهواء (AQI) إلى مستويات (جيدة، متوسطة، سيئة) بناءً على بيانات الطقس والمرور، ليكون بمثابة نظام إنذار مبكر وموثوق للجهات البيئية.لحل هذه المشكلة، قمت بالاعتماد على بيانات بيئية رسمية تمتد لثلاث سنوات (EPA environmental data)، حيث تم بناء Pipeline متكاملة لضمان جودة البيانات. شمل ذلك تنظيف البيانات، المعالجة الديناميكية للقيم الشاذة (Outliers) بناءً على المتوسطات المحلية للمدن، وهندسة ميزات جديدة (Feature Engineering) مثل استخراج نسب الملوثات (Pollutant Ratios). بالإضافة إلى ذلك، شمل المشروع تجارب تحليلية مكثفة لاختيار المقياس الهدف الصحيح، حيث تم استبعاد تقييمات المتوسط والحد الأقصى، والاعتماد بشكل نهائي على النسبة المئوية التسعين (90th percentile) لتصنيف جودة الهواء بدقة، كونه يبرز فترات التلوث المستمرة والخطيرة ويتجاهل الحالات الشاذة الفردية. خلال مرحلة تطوير النماذج، واجهت تحدي عدم التوازن الشديد في الفئات (Class Imbalance)، حيث كانت الأيام "السيئة" نادرة إحصائياً. تم تتبع تطور منطقي للخوارزميات لحل هذه المشكلة؛ بدأت بنماذج Logistic Regression التي أثبتت استحالة الفصل الخطي للبيانات المعقدة، مروراً بنماذج Random Forest التي حققت دقة عامة عالية لكنها فشلت في استدعاء الحالات الخطرة بدقة. ولزيادة حساسية النموذج، تم استخدام XGBoost، ولحل مشكلة ندرة البيانات من جذورها، قمت بتطبيق تقنيات SMOTE لمعالجة عدم التوازن رياضياً وتوليد بيانات اصطناعية دقيقة للأيام الخطرة. في النهاية، تم تطوير نموذج مجمع متقدم (Voting Ensemble) يدمج بين خوارزميات Logistic Regression و Random Forest و XGBoost و LightGBM. أظهرت النتائج استقراراً عالياً حيث حقق النظام دقة إجمالية (Overall Accuracy) بلغت 85.67%، مع تحقيق معدل استدعاء (Recall) استثنائي يبلغ 82% للظروف البيئية الخطرة، مما يثبت كفاءة النظام العالية في رصد الحالات الحرجة بدون إصدار إنذارات كاذبة (False Alarms) مفرطة.
مهارات العمل
بطاقة العمل
طلب عمل مماثل