معيار التقييم · Arabic Detection Benchmark

كم يكتشف ريجلينت فعلاً في النص العربي؟

قِسنا المحرك المنشور على 305 حالة اختبار عربية تغطي اللهجات الأربع الكبرى وجميع الفئات الأساسية الـ24 ضمن تصنيف المحرك المكوّن من 29 فئة، بتوازن بين المخالفات الحقيقية والحالات السليمة (بما فيها 50 «سلبية صعبة» تبدو مخالِفة وليست كذلك). كل رقم أدناه مأخوذ حرفياً من مخرجات التشغيل — لا تقريب لأعلى ولا انتقاء.

100%
الاسترجاع (Recall)
95% CI 98.2–100.0%
99.5%
الدقة (Precision)
95% CI 97.3–99.9%
0.0%
معدل السلبيات الكاذبة (المخالفات الفائتة)
95% CI 0.0–1.8%

205 مخالفة صحيحة مكتشفة · صفر مخالفة فائتة · سلبية كاذبة واحدة من 95 حالة سليمة · صفر حالات فشل-آمن مستبعَدة.

تركيب مجموعة الاختبار

305 حالة إجمالاً؛ يُقاس منها 300 في الأرقام الرئيسية (5 حالات «عربيزي» مكتوبة بالحروف اللاتينية تُقاس كتغطية منفصلة، لا ضمن العناوين).

التوزيع

  • المخالفات (إيجابية): 205
  • الحالات السليمة (سلبية): 95 — منها 50 سلبية صعبة
  • الحالات الأصلية الـ120 محفوظة بالكامل كجزء من المجموعة

اللهجات

  • الفصحى (MSA): 67 · الخليجية: 50
  • المصرية: 40 · الشامية: 28
  • + 115 من المجموعة الأصلية (غير موسومة بلهجة)
اللهجةTPFNFPTNالاسترجاعالدقة
الفصحى2600411.0001.000
الخليجية3900111.0001.000
المصرية2701121.0000.964
الشامية1700111.0001.000

كيف بُنيت الحالات وكيف جرى القياس

بناء الحالات

حالات مُصاغة يدوياً بنص عربي طبيعي لكل لهجة، بأرقام هوية وحسابات ذات بنية صحيحة قابلة للكشف. لكل حالة فئة تنظيمية ولهجة ودولة وقرار متوقع.

السلبيات الصعبة نصوص تذكر موضوعاً حساساً في سياق مشروع: بطاقة مُقنَّعة بآخر أربعة أرقام، شرح صيغة رقم الهوية في تدريب، بيانات طبية مجمّعة دون تعريف مريض، تذكير سداد مهذّب، رفض العميل مشاركة هويته، تنفيذ طلب حذف بيانات.

التشغيل والقياس

تشغيل واحد كامل على المحرك المنشور فعلياً (Claude Haiku 4.5، الوضع الكامل). العربية تُرقّى تلقائياً إلى الوضع الكامل — تأكدنا من ذلك في 12/12 عينة.

الاسترجاع = المخالفات المكتشفة ÷ إجمالي المخالفات. الدقة = المخالفات الصحيحة ÷ كل ما وُسم مخالفة. فترات الثقة بطريقة Wilson عند 95%. أحداث الفشل-الآمن تُعاد مرة ثم تُستبعد — لم يقع أيٌّ منها هنا.

زمن الاستجابة: الوسيط 5.4 ثانية · المئين 95 عند 9.8 ثانية.

النتائج حسب الفئة الأساسية (24 فئة من أصل 29)

كل فئة أساسية حققت استرجاعاً 1.000 (لا مخالفات فائتة). الدقة 1.000 في كل الفئات عدا بيانات بطاقات الدفع.

الفئةnTP/FN/FP/TNالاسترجاعالدقة

الفئة الأضعف — نُعلنها بصراحة

بيانات بطاقات الدفع: الدقة 0.857 (خطأ إيجابي واحد من 10). المحرك وسَم بطاقة مُقنَّعة تُظهر آخر أربعة أرقام فقط بالأرقام العربية الشرقية (‏****٠٩٨٧‎) كمخالفة. لا مخالفات فائتة في هذه الفئة. نعمل على تحسين كشف الإخفاء بالأرقام الشرقية.

الفئات الموسّعة الخمس — مغطّاة بالمحرك، غير مُقسَّمة في هذه النسخة

تصنيف المحرك يضم 29 فئة: الـ24 الأساسية المُختبَرة أعلاه، وخمس فئات سلوكية موسّعة يكتشفها المحرك لكنها لم تُقسَّم بحالات مخصّصة في هذا التقييم بعد — تُضاف في النسخة القادمة:

AML_STRUCTURING · KYC_BYPASS · UNAUTHORIZED_FINANCIAL_ACTION · UNAUTHORIZED_DISCLOSURE · UNSOLICITED_MARKETING

حدود هذا التقييم — بصراحة

حالات مُصطنعة

الحالات مُصاغة لتغطية الفئات واللهجات، لا سجلّات إنتاج حقيقية. تقيس قدرة الكشف على أنماط ممثِّلة، لا توزيع حركة عميل بعينه.

تغطية اللهجات

الشامية أقل تمثيلاً (28 حالة) من الفصحى (67). توجيه الدولة في المحرك يغطي الخليج ومصر؛ نصوص بلاد الشام تُوجَّه احتياطياً إلى السعودية/مصر.

تشغيل واحد

الأرقام من تشغيل كامل واحد؛ فترات الثقة تعكس حجم العيّنة. مخرجات النموذج اللغوي تتذبذب قليلاً بين التشغيلات (±بضع نقاط) كما هو موثّق في خط الأساس السابق.

خطأ إيجابي واحد

سلبية كاذبة واحدة (بطاقة مُقنَّعة بأرقام شرقية). صفر مخالفة فائتة. لا نُخفي أو نُقرّب أياً من ذلك.

المنهجية الكاملة

تريد مجموعة الحالات ومخرجات التشغيل الخام؟

نشارك المنهجية الكاملة وملف النتائج مع العملاء والمقيّمين المحتملين.

اطلب المنهجية الكاملة