نظام RAG كامل للبحث في أكثر من 10 آلاف مستند
تفاصيل العمل

بنيت نظام بحث دلالي كامل فوق أرشيف مستندات كبير، يعمل في الإنتاج وليس نموذجاً أولياً. خط المعالجة: استخراج النص من ملفات PDF وDOCX مع الحفاظ على رقم الصفحة، تقطيع النص إلى أجزاء متداخلة، توليد التضمينات، وتخزينها في قاعدة المتجهات Qdrant. عند السؤال يبحث النظام في أكثر من 10 آلاف مستند ويعيد الإجابة مع رابط إلى الصفحة المصدر، حتى يستطيع العميل التحقق من كل جملة بنفسه. الفخ الذي واجهته: التقطيع الساذج يقطع الجدول في منتصفه، فتفقد الأرقام صلتها بعناوين الأعمدة وتصبح الإجابة خاطئة بثقة. عالجته بتقطيع يحترم بنية المستند مع تداخل بين الأجزاء، واختبار انحدار على أسئلة مرجعية بعد كل تغيير. التقنيات: Python، LangChain، Qdrant، Flask، REST API، PostgreSQL، Docker، nginx، خادم VPS بنظام Linux. الكود مفتوح للاطلاع: github.com/Ortant333/ortant-banks

شارك
بطاقة العمل
تاريخ النشر
منذ أسبوع
المشاهدات
16
المستقل
طلب عمل مماثل
شارك
مركز المساعدة