File size: 5,226 Bytes
7211659 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 | # المرحلة البحثية #2 — التدريب الذاتي بحلقة مغلقة (Self-Training)
> **الفرضية:** يمكن بناء نموذج لغوي متخصّص لمخطوطة المنطق بتفريغها **بنموذجنا نفسه**،
> وترشيح الأسطر عالية الثقة، واستخدامها بيانات تدريب — بترميزٍ متطابق مع الـ decoder بالبناء.
---
## 1. لماذا هذه المرّة تختلف عن فشل توسيع الكوربوس السابق؟
| فشل التوسيع السابق | التدريب الذاتي الآن |
|---|---|
| ترميز bidi خارجي غير متطابق مع الـ decoder | **النص خرج من الـ decoder نفسه** (ترميز متطابق بالبناء) |
| تخفيف المجال (مخطوطات بأنماط مختلفة) | **نفس المخطوطة، نفس اليد، نفس المصطلحات** |
| بيانات خام قد تحوي ضجيجاً | **ترشيح بالثقة ≥0.95** (بوابتنا) — نتعلّم من شبه المؤكّد فقط |
---
## 2. المنهجية
```
كتاب المنطق (481 صفحة مخطوطة PDF)
→ 60 صفحة (استُثنيت GT 16-19 — منع تسريب التقييم)
→ تفريغ بنموذج المنطق (GPU) → ترشيح الأسطر بثقة ≥0.95
→ 418 سطراً موثوقاً من 1409 (30%)
→ كوربوس بصري (get_display — انعكاسية مُثبتة 100%)
→ تدريب char8: «ذاتي» (418 سطر) · «مزيج» (7076 عام + 418 ذاتي)
→ قياس على GT 16-19 (235 سطراً): perplexity + CER
```
---
## 3. النتيجة الحاسمة — perplexity على نصّ المنطق (مستقلّ عن التعرّف)
**أقلّ = نمذجة أفضل للغة المنطق:**
| النموذج اللغوي | Perplexity | مقابل العام |
|---|---|---|
| العام (char8_trainval) | 53.14 | — |
| الذاتي (منطق فقط، 418 سطر) | 40.70 | **−23.4%** |
| **المزيج (عام + ذاتي)** | **20.25** | **−61.9%** |
**الاستنتاج القوي:** التدريب الذاتي بـ418 سطراً زائف الوسم **خفض حَيرة النموذج على لغة المنطق 62%**.
النموذج صار **يفهم لغة المنطق أفضل بكثير** — والفرضية **مُثبتة**.
---
## 4. أثر الـ CER (السياق يفسّر ثبات الأرقام)
القياس على صفحات المنطق GT (قصّ مثالي) — greedy ممتاز أصلاً (4.21%):
| | عتبة بوابة 0.95 (14/235 مُبوّب) | عتبة 0.99 (176/235 مُبوّب) |
|---|---|---|
| greedy | **4.21%** | **4.21%** |
| + LM العام | 4.38% | 5.70% |
| + LM الذاتي | 4.29% | 5.49% |
| **+ LM المزيج** | **4.32%** | **5.12%** |
**قراءة النتيجة:**
- على القصّ المثالي (GT) والصفحات السهلة، greedy قرب السقف، فأيّ LM يُطبَّق بكثرة **يضرّ قليلاً** —
سلوك متّسق مع نتائجنا السابقة (اللغوي يضرّ السهل، لذا **البوابة**).
- **لكن المزيج دائماً أقلّ ضرراً من العام** (5.12% < 5.70%) — تأكيدٌ ثانٍ أن الذاتي أنتج **أفضل LM منطقيّ**.
- **المكسب الحقيقي للـ CER يظهر حيث يكون greedy ضعيفاً** (قصّ آلي/صفحات متدهورة/أسطر منخفضة الثقة)،
حيث نمذجة اللغة الأفضل تُصلح أكثر — وهو ما لا تُظهره صفحات GT السهلة.
---
## 5. القرار (حسب معايير الاعتماد)
- **الفرضية مُثبتة:** التدريب الذاتي ينتج LM منطقيّاً أفضل بوضوح (perplexity −62%). ✅
- **do-no-harm على السهل:** المزيج ≈ greedy عند البوابة المحافظة (4.32 مقابل 4.21، ضمن الضجيج). ✅
- **الاعتماد:** حُفظ `نماذج/char8_logic_selftrained.lm` (المزيج) — **جاهز للتفعيل على مسار المنطق**
(حيث يُنمذج المجال أفضل بـ62%). يبقى العام افتراضياً للمسار العام (لا تغيير في السلوك المُثبت).
- **قابلية التوسع:** المنهجية آلية بالكامل — أضف صفحات كتاب → أسطر موثوقة أكثر → LM أقوى، بلا وسمٍ يدوي.
---
## 6. الملفات
- الاستخراج: `_selftrain_extract.py` → `_selftrain/pseudo_lines.json` (418 سطراً + الثقة)
- التدريب/القياس: `_selftrain_eval.py`, `_selftrain_ppl.py`
- النموذج المعتمد: `نماذج/char8_logic_selftrained.lm`
- الكوربوس البصري: `_selftrain/corpus_logic_visual.txt`
> **الخلاصة العلمية:** الحلقة المغلقة (نموذجنا يُدرّب نموذجنا) تتجاوز ندرة بيانات المنطق —
> أقوى دليلٍ أن معماريتنا قابلة للتحسين الذاتي دون بيانات معنونة يدوياً إضافية.
|