المرحلة البحثية #2 — التدريب الذاتي بحلقة مغلقة (Self-Training)
الفرضية: يمكن بناء نموذج لغوي متخصّص لمخطوطة المنطق بتفريغها بنموذجنا نفسه، وترشيح الأسطر عالية الثقة، واستخدامها بيانات تدريب — بترميزٍ متطابق مع الـ decoder بالبناء.
1. لماذا هذه المرّة تختلف عن فشل توسيع الكوربوس السابق؟
| فشل التوسيع السابق | التدريب الذاتي الآن |
|---|---|
| ترميز bidi خارجي غير متطابق مع الـ decoder | النص خرج من الـ decoder نفسه (ترميز متطابق بالبناء) |
| تخفيف المجال (مخطوطات بأنماط مختلفة) | نفس المخطوطة، نفس اليد، نفس المصطلحات |
| بيانات خام قد تحوي ضجيجاً | ترشيح بالثقة ≥0.95 (بوابتنا) — نتعلّم من شبه المؤكّد فقط |
2. المنهجية
كتاب المنطق (481 صفحة مخطوطة PDF)
→ 60 صفحة (استُثنيت GT 16-19 — منع تسريب التقييم)
→ تفريغ بنموذج المنطق (GPU) → ترشيح الأسطر بثقة ≥0.95
→ 418 سطراً موثوقاً من 1409 (30%)
→ كوربوس بصري (get_display — انعكاسية مُثبتة 100%)
→ تدريب char8: «ذاتي» (418 سطر) · «مزيج» (7076 عام + 418 ذاتي)
→ قياس على GT 16-19 (235 سطراً): perplexity + CER
3. النتيجة الحاسمة — perplexity على نصّ المنطق (مستقلّ عن التعرّف)
أقلّ = نمذجة أفضل للغة المنطق:
| النموذج اللغوي | Perplexity | مقابل العام |
|---|---|---|
| العام (char8_trainval) | 53.14 | — |
| الذاتي (منطق فقط، 418 سطر) | 40.70 | −23.4% |
| المزيج (عام + ذاتي) | 20.25 | −61.9% |
الاستنتاج القوي: التدريب الذاتي بـ418 سطراً زائف الوسم خفض حَيرة النموذج على لغة المنطق 62%. النموذج صار يفهم لغة المنطق أفضل بكثير — والفرضية مُثبتة.
4. أثر الـ CER (السياق يفسّر ثبات الأرقام)
القياس على صفحات المنطق GT (قصّ مثالي) — greedy ممتاز أصلاً (4.21%):
| عتبة بوابة 0.95 (14/235 مُبوّب) | عتبة 0.99 (176/235 مُبوّب) | |
|---|---|---|
| greedy | 4.21% | 4.21% |
| + LM العام | 4.38% | 5.70% |
| + LM الذاتي | 4.29% | 5.49% |
| + LM المزيج | 4.32% | 5.12% |
قراءة النتيجة:
- على القصّ المثالي (GT) والصفحات السهلة، greedy قرب السقف، فأيّ LM يُطبَّق بكثرة يضرّ قليلاً — سلوك متّسق مع نتائجنا السابقة (اللغوي يضرّ السهل، لذا البوابة).
- لكن المزيج دائماً أقلّ ضرراً من العام (5.12% < 5.70%) — تأكيدٌ ثانٍ أن الذاتي أنتج أفضل LM منطقيّ.
- المكسب الحقيقي للـ CER يظهر حيث يكون greedy ضعيفاً (قصّ آلي/صفحات متدهورة/أسطر منخفضة الثقة)، حيث نمذجة اللغة الأفضل تُصلح أكثر — وهو ما لا تُظهره صفحات GT السهلة.
5. القرار (حسب معايير الاعتماد)
- الفرضية مُثبتة: التدريب الذاتي ينتج LM منطقيّاً أفضل بوضوح (perplexity −62%). ✅
- do-no-harm على السهل: المزيج ≈ greedy عند البوابة المحافظة (4.32 مقابل 4.21، ضمن الضجيج). ✅
- الاعتماد: حُفظ
نماذج/char8_logic_selftrained.lm(المزيج) — جاهز للتفعيل على مسار المنطق (حيث يُنمذج المجال أفضل بـ62%). يبقى العام افتراضياً للمسار العام (لا تغيير في السلوك المُثبت). - قابلية التوسع: المنهجية آلية بالكامل — أضف صفحات كتاب → أسطر موثوقة أكثر → LM أقوى، بلا وسمٍ يدوي.
6. الملفات
- الاستخراج:
_selftrain_extract.py→_selftrain/pseudo_lines.json(418 سطراً + الثقة) - التدريب/القياس:
_selftrain_eval.py,_selftrain_ppl.py - النموذج المعتمد:
نماذج/char8_logic_selftrained.lm - الكوربوس البصري:
_selftrain/corpus_logic_visual.txt
الخلاصة العلمية: الحلقة المغلقة (نموذجنا يُدرّب نموذجنا) تتجاوز ندرة بيانات المنطق — أقوى دليلٍ أن معماريتنا قابلة للتحسين الذاتي دون بيانات معنونة يدوياً إضافية.