File size: 5,226 Bytes
7211659
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
# المرحلة البحثية #2 — التدريب الذاتي بحلقة مغلقة (Self-Training)

> **الفرضية:** يمكن بناء نموذج لغوي متخصّص لمخطوطة المنطق بتفريغها **بنموذجنا نفسه**،
> وترشيح الأسطر عالية الثقة، واستخدامها بيانات تدريب — بترميزٍ متطابق مع الـ decoder بالبناء.

---

## 1. لماذا هذه المرّة تختلف عن فشل توسيع الكوربوس السابق؟

| فشل التوسيع السابق | التدريب الذاتي الآن |
|---|---|
| ترميز bidi خارجي غير متطابق مع الـ decoder | **النص خرج من الـ decoder نفسه** (ترميز متطابق بالبناء) |
| تخفيف المجال (مخطوطات بأنماط مختلفة) | **نفس المخطوطة، نفس اليد، نفس المصطلحات** |
| بيانات خام قد تحوي ضجيجاً | **ترشيح بالثقة ≥0.95** (بوابتنا) — نتعلّم من شبه المؤكّد فقط |

---

## 2. المنهجية

```

كتاب المنطق (481 صفحة مخطوطة PDF)

  → 60 صفحة (استُثنيت GT 16-19 — منع تسريب التقييم)

  → تفريغ بنموذج المنطق (GPU) → ترشيح الأسطر بثقة ≥0.95

  → 418 سطراً موثوقاً من 1409 (30%)

  → كوربوس بصري (get_display — انعكاسية مُثبتة 100%)

  → تدريب char8:  «ذاتي» (418 سطر) · «مزيج» (7076 عام + 418 ذاتي)

  → قياس على GT 16-19 (235 سطراً): perplexity + CER

```

---

## 3. النتيجة الحاسمة — perplexity على نصّ المنطق (مستقلّ عن التعرّف)

**أقلّ = نمذجة أفضل للغة المنطق:**

| النموذج اللغوي | Perplexity | مقابل العام |
|---|---|---|
| العام (char8_trainval) | 53.14 | — |

| الذاتي (منطق فقط، 418 سطر) | 40.70 | **−23.4%** |

| **المزيج (عام + ذاتي)** | **20.25** | **−61.9%** |



**الاستنتاج القوي:** التدريب الذاتي بـ418 سطراً زائف الوسم **خفض حَيرة النموذج على لغة المنطق 62%**.

النموذج صار **يفهم لغة المنطق أفضل بكثير** — والفرضية **مُثبتة**.



---



## 4. أثر الـ CER (السياق يفسّر ثبات الأرقام)



القياس على صفحات المنطق GT (قصّ مثالي) — greedy ممتاز أصلاً (4.21%):



| | عتبة بوابة 0.95 (14/235 مُبوّب) | عتبة 0.99 (176/235 مُبوّب) |

|---|---|---|

| greedy | **4.21%** | **4.21%** |

| + LM العام | 4.38% | 5.70% |

| + LM الذاتي | 4.29% | 5.49% |

| **+ LM المزيج** | **4.32%** | **5.12%** |



**قراءة النتيجة:**

- على القصّ المثالي (GT) والصفحات السهلة، greedy قرب السقف، فأيّ LM يُطبَّق بكثرة **يضرّ قليلاً**
  سلوك متّسق مع نتائجنا السابقة (اللغوي يضرّ السهل، لذا **البوابة**).

- **لكن المزيج دائماً أقلّ ضرراً من العام** (5.12% < 5.70%) — تأكيدٌ ثانٍ أن الذاتي أنتج **أفضل LM منطقيّ**.

- **المكسب الحقيقي للـ CER يظهر حيث يكون greedy ضعيفاً** (قصّ آلي/صفحات متدهورة/أسطر منخفضة الثقة)،

  حيث نمذجة اللغة الأفضل تُصلح أكثر — وهو ما لا تُظهره صفحات GT السهلة.



---



## 5. القرار (حسب معايير الاعتماد)



- **الفرضية مُثبتة:** التدريب الذاتي ينتج LM منطقيّاً أفضل بوضوح (perplexity −62%). ✅

- **do-no-harm على السهل:** المزيج ≈ greedy عند البوابة المحافظة (4.32 مقابل 4.21، ضمن الضجيج). ✅

- **الاعتماد:** حُفظ `نماذج/char8_logic_selftrained.lm` (المزيج) — **جاهز للتفعيل على مسار المنطق**

  (حيث يُنمذج المجال أفضل بـ62%). يبقى العام افتراضياً للمسار العام (لا تغيير في السلوك المُثبت).

- **قابلية التوسع:** المنهجية آلية بالكامل — أضف صفحات كتاب → أسطر موثوقة أكثر → LM أقوى، بلا وسمٍ يدوي.



---



## 6. الملفات

- الاستخراج: `_selftrain_extract.py` → `_selftrain/pseudo_lines.json` (418 سطراً + الثقة)

- التدريب/القياس: `_selftrain_eval.py`, `_selftrain_ppl.py`

- النموذج المعتمد: `نماذج/char8_logic_selftrained.lm`

- الكوربوس البصري: `_selftrain/corpus_logic_visual.txt`

> **الخلاصة العلمية:** الحلقة المغلقة (نموذجنا يُدرّب نموذجنا) تتجاوز ندرة بيانات المنطق —
> أقوى دليلٍ أن معماريتنا قابلة للتحسين الذاتي دون بيانات معنونة يدوياً إضافية.