استخراج بيانات من مواقع محمية ضد الروبوتات
تفاصيل العمل

جمع بيانات من مواقع تعتمد على JavaScript وتقف خلف حماية مضادة للروبوتات، بشكل مستقر لا ينهار بعد يومين. في آخر تشغيل جمعت 748 سجلاً من قائمة مشاريع واحدة، ثم أعدت زيارة كل صفحة على حدة لأن القائمة لا تحمل الميزانية ولا عدد المتقدمين الحقيقي. الدرس الأغلى في هذا العمل: لا تحكم على النجاح بغياب الخطأ. المنفذ الوسيط يعيد رمز 200 ومعه صفحة فارغة، وحل الكابتشا يعيد "نجاح" دون أن يحل شيئاً. الفحص الصحيح هو قراءة جسم الصفحة والتأكد من وجود الحقل الذي يهم فعلاً، لا الاكتفاء برمز الاستجابة. الاقتصاد: وسيط تكلفة التشغيل 0.13 دولار ووسيط الزمن 12.8 دقيقة، مع تدوير عناوين الخروج عند هبوط السرعة. التقنيات: Python، Playwright، Chrome DevTools Protocol، تدوير الوكلاء، PostgreSQL، Docker، nginx، خادم VPS بنظام Linux.

شارك
بطاقة العمل
تاريخ النشر
منذ أسبوع
المشاهدات
14
المستقل
طلب عمل مماثل
شارك
مركز المساعدة