تحليل بيانات الرعاية الصحية وتطوير ML Pipeline متكاملة لـ Drug Safety
تفاصيل العمل
تُعد التفاعلات الدوائية الضارة (ADEs) من التحديات الصحية العالمية الكبرى التي تؤدي إلى مضاعفات خطيرة، خاصة عند الاعتماد على أنظمة المراقبة الدوائية التقليدية التي تكتفي بتسجيل الحوادث بعد وقوعها بشكل رد فعلي. لذلك يهدف هذا المشروع إلى استخدام تقنيات التعلم الآلي للانتقال إلى نظام ذكاء استباقي (Proactive) يتنبأ بمستويات الخطر الخاصة بكل مريض ويتوقع الآثار الجانبية المحتملة بدقة قبل إعطاء الدواء. لحل هذه المشكلة، قمت باستخدام ملايين السجلات الطبية الخام من قاعدة بيانات إدارة الغذاء والدواء الأمريكية (FAERS)، حيث تم بناء Pipeline كاملة لمعالجة البيانات وتخزينها. شمل ذلك تنظيف البيانات، التعامل مع القيم المفقودة والشاذة بيولوجيًا، ثم معالجة الخصائص باستخدام تقنية الترميز المستهدف (Target Encoding) لتحويل البيانات الفئوية الضخمة، مثل آلاف أسماء الأدوية، إلى درجات خطر رقمية مستمرة، مما ساهم في رفع كفاءة النموذج وتجنب مشكلة تضخم الأبعاد. بعد تجهيز البيانات وإجراء اختبارات الاستقرار الزمني لضمان عدم تسريب البيانات (Data Leakage)، تم تدريب معمارية ثنائية النماذج تعتمد على خوارزمية XGBoost للتعامل مع البيانات الطبية المعقدة وغير المتزنة. النموذج الأول خُصص لتصنيف خطورة حالة المريض الإجمالية، بينما خُصص النموذج الثاني للتنبؤ باحتماليات ظهور أكثر 20 عرضًا جانبيًا تعقيدًا. كما تم استخدام تقنيات متقدمة لمعالجة اختلال توازن الفئات الطبيعية في البيانات الطبية عبر تعديل الأوزان وتقليل العينات (Downsampling). أظهرت النتائج أن نموذج تصنيف الخطورة حقق معدل استدعاء (Recall) يبلغ 77% للحالات الحرجة، وهو المقياس الأهم لضمان عدم تفويت الحالات الخطرة، في حين حقق نموذج الأعراض دقة بلغت 72.85% لتحديد أعلى 3 آثار جانبية محتملة. كما ساعد تحليل أهمية الخصائص في تأكيد المنطق الدوائي للنماذج، مبرزاً العمر والدواء الموصوف ومدة العلاج كعوامل حاسمة. وفي النهاية، تم نشر هذا النظام المتكامل باستخدام FastAPI للواجهة الخلفية وStreamlit كلوحة تحكم تفاعلية لدعم الأطباء والباحثين في اتخاذ قرارات آمنة وسريعة.
مهارات العمل
بطاقة العمل
طلب عمل مماثل