phoenix-arabic-manuscript-htr / RESEARCH_SELF_TRAINING.md
factlogic's picture
Update publication links for Phoenix model name (part 2)
7211659 verified
|
Raw
History Blame
5.23 kB

المرحلة البحثية #2 — التدريب الذاتي بحلقة مغلقة (Self-Training)

الفرضية: يمكن بناء نموذج لغوي متخصّص لمخطوطة المنطق بتفريغها بنموذجنا نفسه، وترشيح الأسطر عالية الثقة، واستخدامها بيانات تدريب — بترميزٍ متطابق مع الـ decoder بالبناء.


1. لماذا هذه المرّة تختلف عن فشل توسيع الكوربوس السابق؟

فشل التوسيع السابق التدريب الذاتي الآن
ترميز bidi خارجي غير متطابق مع الـ decoder النص خرج من الـ decoder نفسه (ترميز متطابق بالبناء)
تخفيف المجال (مخطوطات بأنماط مختلفة) نفس المخطوطة، نفس اليد، نفس المصطلحات
بيانات خام قد تحوي ضجيجاً ترشيح بالثقة ≥0.95 (بوابتنا) — نتعلّم من شبه المؤكّد فقط

2. المنهجية

كتاب المنطق (481 صفحة مخطوطة PDF)
  → 60 صفحة (استُثنيت GT 16-19 — منع تسريب التقييم)
  → تفريغ بنموذج المنطق (GPU) → ترشيح الأسطر بثقة ≥0.95
  → 418 سطراً موثوقاً من 1409 (30%)
  → كوربوس بصري (get_display — انعكاسية مُثبتة 100%)
  → تدريب char8:  «ذاتي» (418 سطر) · «مزيج» (7076 عام + 418 ذاتي)
  → قياس على GT 16-19 (235 سطراً): perplexity + CER

3. النتيجة الحاسمة — perplexity على نصّ المنطق (مستقلّ عن التعرّف)

أقلّ = نمذجة أفضل للغة المنطق:

النموذج اللغوي Perplexity مقابل العام
العام (char8_trainval) 53.14
الذاتي (منطق فقط، 418 سطر) 40.70 −23.4%
المزيج (عام + ذاتي) 20.25 −61.9%

الاستنتاج القوي: التدريب الذاتي بـ418 سطراً زائف الوسم خفض حَيرة النموذج على لغة المنطق 62%. النموذج صار يفهم لغة المنطق أفضل بكثير — والفرضية مُثبتة.


4. أثر الـ CER (السياق يفسّر ثبات الأرقام)

القياس على صفحات المنطق GT (قصّ مثالي) — greedy ممتاز أصلاً (4.21%):

عتبة بوابة 0.95 (14/235 مُبوّب) عتبة 0.99 (176/235 مُبوّب)
greedy 4.21% 4.21%
+ LM العام 4.38% 5.70%
+ LM الذاتي 4.29% 5.49%
+ LM المزيج 4.32% 5.12%

قراءة النتيجة:

  • على القصّ المثالي (GT) والصفحات السهلة، greedy قرب السقف، فأيّ LM يُطبَّق بكثرة يضرّ قليلاً — سلوك متّسق مع نتائجنا السابقة (اللغوي يضرّ السهل، لذا البوابة).
  • لكن المزيج دائماً أقلّ ضرراً من العام (5.12% < 5.70%) — تأكيدٌ ثانٍ أن الذاتي أنتج أفضل LM منطقيّ.
  • المكسب الحقيقي للـ CER يظهر حيث يكون greedy ضعيفاً (قصّ آلي/صفحات متدهورة/أسطر منخفضة الثقة)، حيث نمذجة اللغة الأفضل تُصلح أكثر — وهو ما لا تُظهره صفحات GT السهلة.

5. القرار (حسب معايير الاعتماد)

  • الفرضية مُثبتة: التدريب الذاتي ينتج LM منطقيّاً أفضل بوضوح (perplexity −62%). ✅
  • do-no-harm على السهل: المزيج ≈ greedy عند البوابة المحافظة (4.32 مقابل 4.21، ضمن الضجيج). ✅
  • الاعتماد: حُفظ نماذج/char8_logic_selftrained.lm (المزيج) — جاهز للتفعيل على مسار المنطق (حيث يُنمذج المجال أفضل بـ62%). يبقى العام افتراضياً للمسار العام (لا تغيير في السلوك المُثبت).
  • قابلية التوسع: المنهجية آلية بالكامل — أضف صفحات كتاب → أسطر موثوقة أكثر → LM أقوى، بلا وسمٍ يدوي.

6. الملفات

  • الاستخراج: _selftrain_extract.py_selftrain/pseudo_lines.json (418 سطراً + الثقة)
  • التدريب/القياس: _selftrain_eval.py, _selftrain_ppl.py
  • النموذج المعتمد: نماذج/char8_logic_selftrained.lm
  • الكوربوس البصري: _selftrain/corpus_logic_visual.txt

الخلاصة العلمية: الحلقة المغلقة (نموذجنا يُدرّب نموذجنا) تتجاوز ندرة بيانات المنطق — أقوى دليلٍ أن معماريتنا قابلة للتحسين الذاتي دون بيانات معنونة يدوياً إضافية.