ليه النص العربي بيتلخبط لما تنسخه من PDF؟

المشكلة من ثلاث طبقات

لما تنسخ نص عربي من PDF — أو تحوّله لـ Word — بتحصل واحدة من ثلاث نتيجتين مزعجتين: حروف متفرقة (كل ح قايمة لوحدها)، أو كلمات معكوسة بتتقري بالعكس، أو حركات متلخبطة واقفة قبل الحرف بدل بعده. لا ده معناه إن الملف «تالف» — ده معناه إن الـ PDF بيخزّن العربية بصيغة معمولة للطباعة، مش لمعالجة النصوص.

1. أشكال جاهزة بدل حروف

الحرف العربي بيتغير شكله حسب موقعه. الـ PDF مش بيخزّن «ب» — بيخزّن الشكل المرسوم بالظبط (بداية أو وسط أو نهاية أو منفصل) من الخط. فاستخراج النص بيرجّع أشكال عرض (presentation forms) — نطاق يونيكود المخصص للأشكال دي — بدل الحروف العادية.

2. ترتيب بصري بدل ترتيب منطقي

محرك الطباعة بيرسم الحروف صارمًا من الشمال لليمين عبر الصفحة، لأن ده اتجاه العرض. فأول حرف في تدفق التخزين غالبًا هو آخر حرف من أول كلمة. النسخ بترتيب التدفق بيديك نص معكوس.

3. لا الدخيلة والحركات

اللم-ألف (لا) بتتخزن كرسمة واحدة، والحركات علامات منفصلة فوق الحروف. بدون تطبيع، Word بيستقبل مكوّنات غلط ومش قادر يعيد تركيب الكلمات.

إزاي المحوّل الصح بيصلّحها؟

المحوّل الجيد بيعمل ثلاث إصلاحات بالترتيب: يكتشف أشكال العرض ويرجّعها للحروف الأساسية (تطبيع NFKC بيتعامل مع اللم-ألف كمان)، يكتشف الأسطر اللي اتجاه قراءتها من اليمين لليسار ويعيد بناءها منطقيًا، ويعيد ربط الحركات بحروفها. بعد كده محرك النصوص في Word بيُشكّل العربية ويوصلها تمامًا زي ما لازم — نص قابل للتعديل والبحث والنسخ.

جرّبها مع أداة PDF إلى Word: الوضع القابل للتعديل بيطبق نفس المعالجة دي محليًا في متصفحك، ووضع مطابقة التخطيط بيحفظ شكل الصفحة كصور عالية الدقة لما يكون التصميم أهم من النص.

نصائح لملفات PDF العربية

بعد الإصلاح، النص العربي في ملف Word الناتج قابل للتعديل بالكامل: تعيد سره، وتغيّر الخط لأي خط عربي متوفر على جهازك، وتبحث داخله زي أي مستند.

آخر تحديث: 2026-10-05