منصة ذكية متكاملة لتفريق وتقسيم وقراءة سطور المخطوطات العربية الفلسفية والمنطقية النادرة ذات البنية المعقدة، وتحويلها إلى نصوص رقمية قابلة للبحث والتحليل السياقي باستخدام الشبكات الهجينة.
تراثٌ معنوي محبوسٌ في الأرشيفات
تزخر المكتبات العالمية بملايين الصفحات المصورة من المخطوطات التاريخية النادرة، لكنها تظل حبيسة صيغ الصور الجامدة وغير قابلة للبحث المعرفي أو التداول الرقمي السهل.
صعوبة الاستكشاف العلمي
يضطر الباحثون والمحققون لتقليب آلاف الصفحات الورقية يدوياً للبحث عن فكرة أو مصطلح منطقي أو فلسفي دقيق.
بطء التفريغ البشري
تفريغ صفحة مخطوطة واحدة معقدة ذات خطوط متداخلة وهوامش مائلة يستغرق ساعات طويلة من خبير متخصص نادر الوجود.
تهديد الفقدان والتلف
المخطوطات المادية معرضة للتلف الطبيعي السريع، ورقمنتها كصورة لا تمنحها الحياة المعرفية الحقيقية إلا بالتفريغ النصي الدقيق.
تحديات ندرة البيانات وتنوع الخطوط التراثية
تتعدى معوقات رقمنة المخطوطات مجرد فشل خوارزميات الـ OCR التقليدية، لتصطدم بتحديات جوهرية في تدريب النماذج عصبياً:
أداء النموذج العام المتاح muharaf_rec_best على بياناتنا
قمنا بتقييم أقوى نموذج عام مفتوح المصدر ومتاح حالياً للتعرف على الخطوط اليدوية الإسلامية والعربية (النموذج المرجعي muharaf_rec_best) على بياناتنا الخاصة بالفلسفة والمنطق وكانت النتائج صادمة:
خطُّ معالجة هجين من أربع طبقات ذكية
تتجاوز معمارية "أثر" القراءة البصرية المجردة عبر دمج الرؤية الحاسوبية العصبية مع النموذج اللغوي وطبقة الذكاء السياقي:
تقسيم أسطر الحواشي
نموذج شبكي (BLLA) معدل عصبياً لاكتشاف وتوجيه أسطر الحاشية المائلة وفصلها بالكامل عن المتن الرئيسي.
القراءة العصبية للسطور
نموذج CRNN محسن يقرأ سطر الكتابة اليدوية على صور التدرج الرمادي (بلا عتبة ثنائية مشوهة) ويخرج مصفوفة الاحتمالات.
النموذج اللغوي وبوابة الثقة
نموذج حرفي مصغر (8-gram LM) مدمج بترشيح ضحل (Shallow Fusion) يتدخل عصبياً لتصحيح القراءات منخفضة الثقة.
الشرح الفوري والتحقق
استخلاص الكيانات التاريخية وتدقيق المصطلحات الفلسفية بالاعتماد على فهرسة ومقارنة المعاجم التراثية المحلية.
فك ترميز مسارات HTR مع الترجيح اللغوي (Shallow Fusion)
تقوم منصة أثر بدمج النموذج اللغوي الحرفي (Shallow Fusion) أثناء البحث الشعاعي (Beam Search) لترجيح النصوص وتصحيحها بناءً على الثقة البصرية والاحتمال اللغوي وعامل الطول:
$$\log P_{\text{HTR}}(y \mid x)$$
الاحتمال البصري الناتج من نموذج التعرف (HTR) لقراءة النص المرشح $y$ بالاعتماد على الميزات البصرية للمدخل $x$.
$$\alpha \log P_{\text{LM}}(y)$$
احتمالية النموذج اللغوي الحرفي (character-level 8-gram LM) لترجيح اتساق النص العربي وسياقه، ويتحكم بوزنه المعامل $\alpha$.
$$\beta|y|$$
عامل عقوبة/مكافأة الطول (Sequence Length Penalty) لضبط انحياز البحث الشعاعي تجاه المخرجات الطويلة أو القصيرة بالوزن $\beta$.
نموذجٌ لغويٌّ حرفيٌّ صغير بأثرٍ وتصحيحٍ كبير
دمج نموذج لغوي (char n-gram رتبة 8) خفيف ومحلي يتيح معالجة فورية خالية من متطلبات الحوسبة السحابية. يتدخل فقط عبر بوابة الثقة (Confidence Gating) عندما تقل ثقة النموذج البصري في القراءة:
مثال حي على عملية التصحيح التلقائي للسطر:
* تم ضبط وتأمين الكلمات (آلة، مراعاتها، الخطأ) تلقائياً بناءً على سياق الحروف المحتملة وسجل لغة المخطوط.
مقارنة النتائج والتعميم في اختبارات مستقلة
مقارنة علمية مباشرة توضح تفوق نموذجنا النهائي مقابل النموذج الأساسي العام. انقر على التبويبات للتبديل ديناميكياً بين نسب خطأ الحروف والكلمات (الأقل أفضل):
(النموذج المرجعي المتاح)
(النموذج النهائي المصحح)
تقارب نموذجنا مقارنة بالنموذج العام المتاح عبر الحقب التدريبية
* يوضح هذا المنحنى تقارب نموذجنا عصبياً والتفوق الشاسع والمباشر في ثبات القراءة وهبوط نسب الخطأ مقارنة بالنموذج العام المتاح.
▼ تفوّقٌ ساحق لـ أثر AI: انخفاض هائل ومباشر في معدل خطأ الحروف (CER) ليصل إلى 6.76% (على RASAM) و 8.68% (على TariMa) مقارنة بـ 37.91% و 80.12% في النموذج العام السابق. يثبت هذا معالجة فجوة المجال (Domain Gap) بالكامل بفضل المعمارية الهجينة والنموذج اللغوي.
من المستفيد من منصة أثر AI؟
نهدف من خلال هذا الابتكار إلى إحداث ثورة في رقمنة وتحقيق التراث الإسلامي والعربي وتوفير بنية تحتية مفتوحة المصدر للمطورين:
القراء والباحثون العلميّون
تسهيل استكشاف النصوص الفلسفية والشرعية التاريخية عبر إتاحة البحث الدلالي والفهرسة الفورية للكلمات داخل صور الصفحات بدلاً من التقليب اليدوي الطويل.
المفرغون والمحققون التراثيون
اختصار زمن النسخ والتفريغ اليدوي والتحقيق بنسبة تتجاوز 90% بفضل القراءة العصبية السريعة والتحقق الموجه بالقاموس وعرض القراءات البديلة.
مساهمتنا للمطورين والمكتبات
تطوير وتوفير أول خطوط معالجة HTR ونماذج لغوية مفتوحة المصدر مضبوطة بدقة على أصعب المخطوطات والخطوط التراثية، لتسريع مشاريع الرقمنة التراثية عالمياً.
التقنيات الرياضية والهندسية لمنظومة التعرف (HTR)
تتجاوز منصة "أثر" التعرف البصري المجرد لتطبيق خوارزميات التعرف على النصوص المكتوبة بخط اليد (Handwritten Text Recognition - HTR) مع ترجيح لغوي عميق وسياقي:
المحرر التفاعلي للاقتراحات والقراءات البديلة
توضيح تطبيقي لكيفية عمل بوابة الثقة (Confidence Gating) لترشيح الكلمات البديلة عند بهتان الحبر أو غموض الرسم البصري للسطر المخطوط:
يقوم النظام بفحص نسبة يقين الحروف بصرياً؛ فإذا قلّت ثقته في رسم الكلمة (بسبب بهتان الحبر أو تداخل الخط)، يتم استدعاء النموذج اللغوي الحرفي (order-8 LM) للموازنة التوافقية مع معجم المصطلحات الفلسفية التراثية، مما ينتج مقترحات قراءة ذكية تفهم المعنى السياقي وتعدّل الأخطاء تلقائياً.
* أخطاء بصرية في الهمزات، ودمج التاء المربوطة، وخلل بالنمط الدلالي.
* انقر على الكلمات المميزة بالمصباح (💡) لتصفح مقترحات القراءات البديلة السياقية.
بوابة مقترحات القراءة البديلة التفاعلية
انقر على الكلمات المميزة باللون الأحمر في المحرر لرؤية مقترحات تصحيح النموذج اللغوي وسياق القراءات.
لماذا يمثل مشروع أثر AI علامة فارقة؟
يقدم المشروع حلاً هندسياً وعلمياً متكاملاً لحفظ الهوية والتراث الثقافي ونقل المعرفة المخطوطة إلى العصر الرقمي الحديث بكفاءة وأمانة علمية:
«من صورة جامدة ومحفوظة، إلى تراث رقمي مقروء، مفهرس، وشاهد حي على المعرفة.»
منصة أثر AI — Phoenix Team