بناء أداة استخراج بيانات آلية (Web Scraper) للوظائف باستخدام Python و Selenium
تفاصيل العمل
مشروع برمجي يهدف إلى أتمتة عملية استخراج بيانات الوظائف (تحديداً وظائف هندسة البيانات) من منصة التوظيف "Naukrigulf"، وتحويلها من صفحات ويب متفرقة إلى قاعدة بيانات مهيكلة جاهزة للتحليل أو العرض. الملامح الرئيسية للمشروع: الأتمتة الكاملة (Web Automation): تشغيل متصفح تفاعلي آلياً باستخدام (Selenium WebDriver) لتصفح الموقع وجمع البيانات، مع تضمين إعدادات لتخطي آليات حظر الروبوتات (Anti-detection). التعامل مع الصفحات المتعددة (Pagination): برمجة الأداة للتنقل التلقائي عبر صفحات نتائج البحث المتعددة لضمان جمع أكبر قدر ممكن من البيانات دون تدخل بشري. استخراج بيانات دقيقة (Data Extraction): سحب تفاصيل دقيقة لكل بطاقة وظيفية تشمل: (المسمى الوظيفي، اسم الشركة، سنوات الخبرة المطلوبة، الموقع الجغرافي، والوصف الوظيفي). تنظيم وتصدير البيانات: استخدام مكتبة (Pandas) لتحويل البيانات المستخرجة إلى جداول (DataFrames) نظيفة وتصديرها كملف (CSV) جاهز للاستخدام المباشر. التقنيات والأدوات المستخدمة: لغة البرمجة: Python. أتمتة المتصفحات: Selenium WebDriver. معالجة البيانات: Pandas. أدوات التحكم بالوقت: مكتبة Time لإدارة سرعة استجابة السكربت وتجنب الحظر من الموقع. هذا المشروع يبرز مهاراتي في جمع البيانات (Data Ingestion) من المصادر غير المهيكلة، وهي الخطوة الأولى والأهم في أي دورة حياة للبيانات (Data Pipeline).
بطاقة العمل
طلب عمل مماثل