المشكلة التي يعرفها كل من أدخل نموذجاً لغوياً إلى الإنتاج: المخرجات تبدو معقولة دائماً، ولا أحد يعرف متى تدهورت فعلاً.
ما بنيته: مجموعة بيانات مرجعية من 379 مثالاً موسومة يدوياً، وقياس macro-F1 بعد كل تغيير في التوجيهات أو النموذج. النتيجة الحالية 0.81. فوق ذلك طبقة تقييم LLM-as-a-judge للأبعاد التي لا يلتقطها المقياس العددي.
الجزء الأهم هو بوابة النشر: لا يخرج أي تشغيل إلى المستخدم قبل اجتيازه العتبات. من أصل 31 تشغيلاً أوقفت البوابة 7. تلك السبعة كانت ستصل إلى العميل لو حكمنا بالانطباع بدلاً من الرقم.
الاقتصاد مقيس أيضاً: وسيط التكلفة 0.13 دولار ووسيط الزمن 12.8 دقيقة للتشغيل الواحد، مع توجيه النماذج عبر OpenRouter لاختيار الأرخص الكافي لكل مهمة.
التقنيات: Python، LangChain، LangGraph، structured output، tool calling، OpenRouter، PostgreSQL، Docker.