مشروع متكامل لبناء نظام تلخيص نصوص تلخيصاً تفتيحياً مخصص للأوراق البحثية الطويلة والمعقدة، وقادر على العمل محلياً بكفاءة على الأجهزة ذات الموارد المحدودة. المشروع يوضح قدراتي في التعامل مع نماذج اللغة الضخمة، وتطوير معالجة مسبقة ذكية للبيانات، بالإضافة إلى التغلب على قيود الذاكرة عبر معمارية تقسيم المهام.
الوظائف الرئيسية:
معالجة مسبقة ذكية وتنظيف النصوص: أداة تعتمد على التعبيرات النمطية للتعرف على نهاية المحتوى الفعلي للأوراق البحثية وقص المراجع والملاحق تلقائياً لمنع النموذج من الهلوسة، مع الحفاظ الكامل على المعادلات والرموز الرياضية الهامة.
تقسيم وتلخيص المستندات الطويلة: خوارزمية مرنة تقوم بتقسيم الأوراق البحثية الضخمة إلى أجزاء صغيرةبحجم 512 توكن، وتلخيص كل جزء على حدة ، ثم دمج هذه التلخيصات وتمريرها في مرحلة أخيرة لإنتاج مستخلص نهائي شامل ودقيق.
قيود صارمة لمنع التكرار والهلوسة: ضبط معايير التوليد أثناء الاستدلال لمنع النماذج التوليدية من الوقوع في حلقات التكرار اللانهائية، مع تنظيف المخرجات من الرموز العشوائية الناتجة عن بيانات التدريب.
حساب مؤشرات الأداء : قياس ومراقبة كفاءة النظام لحظياً من خلال حساب سرعة توليد الكلمات، تتبع ذروة استهلاك ذاكرة كارت الشاشة، وحساب الوقت الإجمالي المستغرق لمعالجة المستند بالكامل.
التقنيات المستخدمة:
النموذج الأساسي: المطور خصيصاً لفهم وتلخيص النصوص الأكاديمية والبحثية.
التحسين وضغط النموذج: تقنية 8-bit QLoRA لتقليص حجم النموذج وتجميده، مع إضافة مصفوفات تدريبية صغيرة (Adapters) على طبقات الانتباه ، مما سمح بعملية التدريب والاستدلال محلياً دون تخطي حاجز الذاكرة.
المكتبات والأدوات الأساسية: Python, PyTorch, HuggingFace (Transformers/PEFT), BitsAndBytes, NumPy.
معايير التقييم: دمج أدوات تقييم معيارية مثل ROUGE و BERTScore لقياس مدى التطابق اللفظي والدلالي بين التلخيص المولد والمستخلص الأصلي للورقة البحثية.