بنيت نظام بحث دلالي كامل فوق أرشيف مستندات كبير، يعمل في الإنتاج وليس نموذجاً أولياً.
خط المعالجة: استخراج النص من ملفات PDF وDOCX مع الحفاظ على رقم الصفحة، تقطيع النص إلى أجزاء متداخلة، توليد التضمينات، وتخزينها في قاعدة المتجهات Qdrant. عند السؤال يبحث النظام في أكثر من 10 آلاف مستند ويعيد الإجابة مع رابط إلى الصفحة المصدر، حتى يستطيع العميل التحقق من كل جملة بنفسه.
الفخ الذي واجهته: التقطيع الساذج يقطع الجدول في منتصفه، فتفقد الأرقام صلتها بعناوين الأعمدة وتصبح الإجابة خاطئة بثقة. عالجته بتقطيع يحترم بنية المستند مع تداخل بين الأجزاء، واختبار انحدار على أسئلة مرجعية بعد كل تغيير.
التقنيات: Python، LangChain، Qdrant، Flask، REST API، PostgreSQL، Docker، nginx، خادم VPS بنظام Linux.
الكود مفتوح للاطلاع: github.com/Ortant333/ortant-banks