قياس جودة مخرجات النماذج: مجموعة مرجعية وبوابة نشر
تفاصيل العمل

المشكلة التي يعرفها كل من أدخل نموذجاً لغوياً إلى الإنتاج: المخرجات تبدو معقولة دائماً، ولا أحد يعرف متى تدهورت فعلاً. ما بنيته: مجموعة بيانات مرجعية من 379 مثالاً موسومة يدوياً، وقياس macro-F1 بعد كل تغيير في التوجيهات أو النموذج. النتيجة الحالية 0.81. فوق ذلك طبقة تقييم LLM-as-a-judge للأبعاد التي لا يلتقطها المقياس العددي. الجزء الأهم هو بوابة النشر: لا يخرج أي تشغيل إلى المستخدم قبل اجتيازه العتبات. من أصل 31 تشغيلاً أوقفت البوابة 7. تلك السبعة كانت ستصل إلى العميل لو حكمنا بالانطباع بدلاً من الرقم. الاقتصاد مقيس أيضاً: وسيط التكلفة 0.13 دولار ووسيط الزمن 12.8 دقيقة للتشغيل الواحد، مع توجيه النماذج عبر OpenRouter لاختيار الأرخص الكافي لكل مهمة. التقنيات: Python، LangChain، LangGraph، structured output، tool calling، OpenRouter، PostgreSQL، Docker.

شارك
بطاقة العمل
تاريخ النشر
منذ أسبوع
المشاهدات
11
المستقل
طلب عمل مماثل
شارك
مركز المساعدة