قراءة السيرة الذاتية العربية من PDF: تجربة على 20 ملفًا

جدول المحتويات
الخلاصة: الملف الواضح بصريًا قد يعطي نصًا ناقصًا
في 25 سبتمبر 2026 اختبرنا 20 ملف PDF مشتقة من سيرة عربية مصطنعة واحدة بأداتين لاستخراج النص. ليست العينة 20 شخصًا، ولا ملفات عملاء، وليست الملفات مُصدَّرة من منشئ أسطر. الهدف اختبار قابلية التحقق من النص في ظروف محددة، لا تسويق تفوق قالب معين.
من أصل 16 ملفًا نصيًا، استعادت الأداتان البريد التجريبي بشرطاته السفلية في جميع الملفات. لكن pypdf لم يُرجع اسم جهة العمل كاملًا في أي منها، بينما ظهر اختلاف في حروف بعض الكلمات العربية مع PyMuPDF. الملفات الأربعة المصوّرة لم تعطِ نصًا في هذا الاختبار الذي لا يستخدم OCR.
هذا ليس اختبار قبول لدى أنظمة ATS، ولا تقييمًا لجودة صاحب السيرة. الأرقام التالية تخص أدوات القراءة وإصداراتها وإعداداتها والعينات المنشورة فقط؛ ليست احتمالات قبول أو رفض في التوظيف.حمّل الأدلة وجرّب بنفسك
- حزمة التجربة الكاملة: 20 ملف PDF، النصوص المستخرجة، المصدر وتعليمات التشغيل.
- النتائج التفصيلية بصيغة JSON: جميع القياسات الأربعين.
- النص المرجعي والحقول المتوقعة.
- قائمة الملفات وبصمات SHA-256 وبيئة التوليد.
البريد ينتهي بنطاق example.com، ورقم الهاتف غير صالح عمدًا، والجهات والأسماء مصطنعة. نفحص بقاء الرقم كنص، لا صلاحيته للتواصل.
كيف صممنا التجربة؟
ثبّتنا محتوى سيرة معلم رياضيات وهمي، ثم غيّرنا ثلاثة عوامل:
| العامل | القيم المختبرة |
|---|---|
| الخط | Tajawal وCairo، بالملفات المحددة في الحزمة |
| حجم متن النص | 12 و16 بكسل CSS، أي 9 و12 نقطة في هذا التوليد |
| التخطيط | عمود واحد، عمودان، جدول بعناوين وصفوف، وفاصل صفحة بعد المشاريع |
| المقارنة المصوّرة | أربع نسخ من تخطيط العمود الواحد، صور فقط دون طبقة نص |
حاصل 2 خط × 2 حجم × 4 تخطيطات = 16 ملفًا نصيًا، وأضفنا 4 ملفات مصوّرة. إجمالي الصفحات 28؛ بعض ملفات العمود الواحد بحجم 16 بكسل امتدت طبيعيًا إلى صفحتين. لا تعني تسمية «عمود واحد» أنه صفحة واحدة.
أنشأنا الملفات من HTML مضبوط في Chrome 134.0.6998.35 عبر Puppeteer 24.4.0، على Windows، بورق A4 وهوامش 18 مم وخطوط مضمّنة. نسجّل النسخة المستخدمة ولا ندّعي أنها أحدث Chrome. حُفظت كل صفحات النسخ المصوّرة بدقة 144 نقطة في البوصة.
قُرئت الملفات باستخدام pypdf 6.10.0 عبر extract_text() وPyMuPDF 1.26.7 عبر get_text('text', sort=False). استخدمنا الاستخراج النصي المباشر؛ دون OCR أو تصحيح لغوي أو إعادة ترتيب هندسية أو معالجة بالذكاء الاصطناعي. الأداتان لا تمثلان جميع برامج قراءة PDF ولا أنظمة التوظيف.
ما الذي قسناه؟
- استرجاع كلمات النص: نطابق الكلمات والأرقام مع النص المرجعي، مع احتساب التكرار. المرجع يحتوي 136 وحدة؛ تدخل الكلمات الإنجليزية والأرقام في الحساب، وتُستبعد علامات الترقيم. هذه نسبة استرجاع حرفية، وليست درجة ATS أو مقياسًا للفهم. الكلمة الملتصقة بجارتها قد لا تُحتسب حتى لو استطاع القارئ تخمينها.
- بقاء سبعة حقول: الاسم، البريد، الهاتف التجريبي، فترتان زمنيتان، المؤهل، وجهة العمل. نبحث عن النص كاملًا؛ لا نختبر تعرف النظام على نوع الحقل أو ربط التاريخ بجهته.
- تسلسل ستة عناوين أقسام: نقارن ظهورها بالتسلسل المرجعي. في العمودين نقرأ العمود الأيمن كاملًا ثم الأيسر. إذا تغيّر عنوان أو اختفى، تصبح نتيجة الترتيب «غير قابلة للقياس»، لا «ترتيب خاطئ» تلقائيًا. هذا لا يقيس ترتيب كل جملة داخل الأقسام.
قبل المقارنة وحّدنا Unicode بصيغة NFKC، وحذفنا التشكيل والتطويل وعلامات التحكم في اتجاه النص، ووحّدنا المسافات. لم نصلح الحروف المعكوسة أو نلصق الكلمات المنفصلة أو نصحح الهمزات؛ النص الخام متاح كي لا تخفي المعالجة المشكلة.
النتائج الفعلية
الملفات النصية الستة عشر
| المؤشر | pypdf 6.10.0 | PyMuPDF 1.26.7 |
|---|---|---|
| نطاق استرجاع الكلمات | 81.62% إلى 91.18% | 79.41% إلى 90.44% |
| البريد والرقم والفترتان الزمنيتان كاملة | 16 من 16 لكل حقل | 16 من 16 لكل حقل |
| الاسم كاملًا بعد التطبيع المحدد | 16 من 16 | 8 من 16 |
| جهة العمل كاملة | 0 من 16 | 16 من 16 |
| الحقول السبعة كلها موجودة | 0 من 16 | 8 من 16 |
| العناوين الستة موجودة بالتسلسل المرجعي | 16 من 16 | غير قابل للقياس في 16 ملفًا بسبب اختلاف نص عناوين |
الحقول الموجودة لا تعني أن بقية النص سليم. مثلًا، احتفظ PyMuPDF بالحقول السبعة في ثماني نسخ، لكن استرجاع الكلمات فيها بقي 90.44%، لا 100%.
أثر التخطيط والخط ضمن هذه العينة
| المجموعة | استرجاع الكلمات مع pypdf | استرجاع الكلمات مع PyMuPDF |
|---|---|---|
| عمود واحد، أربعة ملفات | 90.44% | 90.44% مع Tajawal؛ 79.41% مع Cairo |
| عمودان، أربعة ملفات | 90.44% بحجم 12؛ 91.18% بحجم 16 | 90.44% مع Tajawal؛ 79.41% مع Cairo |
| جدول، أربعة ملفات | 81.62% | 90.44% مع Tajawal؛ 79.41% مع Cairo |
| فاصل صفحة، أربعة ملفات | 90.44% | 90.44% مع Tajawal؛ 79.41% مع Cairo |
لا تثبت النتيجة أن Cairo غير مناسب للسير، أو أن عمودين أفضل دائمًا من عمود واحد. التفاعل هنا بين ملف الخط والمولّد وأداة القراءة وإعداداتها والنص المختار. كما أن الاسترجاع الأعلى في نسخة لا يثبت فهم الخبرات أو صحة ترتيب محتواها بالكامل.
الملفات المصوّرة الأربعة
أعادت الأداتان نصًا فارغًا في الملفات الأربعة: صفر استرجاع في هذه الإعدادات. ليست هذه نتيجة عن جودة OCR؛ لم نشغّله أصلًا. قد تقرأها خدمة أخرى تستخدم التعرف الضوئي على الحروف، ودقة ذلك تحتاج تجربة مستقلة.
مثالان يوضحان ما تعنيه الأرقام
اختفاء جهة العمل من النص المستخرج
في عينة Tajawal ذات العمود الواحد يظهر سطر «معلم رياضيات | مدرسة المثال التجريبية» على الصفحة. لكن الناتج الخام من pypdf يحتوي المسمى دون اسم المدرسة. لهذا لم نجعل سلامة الشكل دليلًا على اكتمال الاستخراج.
اختلاف حروف الاسم رغم ظهوره على الصفحة
في عينة Cairo ذات العمودين الاسم المرجعي هو «سالم المثال التجريبي». ناتج PyMuPDF أعاد آخر كلمة «التجرييب». لم نصححها آليًا قبل القياس، ولم نفترض أن كل برنامج سيعيد الخطأ نفسه.
ولمقارنة النص بالصورة، افتح النسخة المصوّرة فقط وحاول تحديد الاسم ونسخه. المحتوى يبدو مشابهًا، لكن النص غير مخزّن فيه كحروف قابلة للاستخراج.
ماذا تفعل قبل إرسال سيرتك؟
- اتبع صيغة الملف التي تطلبها جهة التقديم أولًا.
- افتح PDF، وانسخ محتواه إلى محرر نص عادي. راجع الاسم والبريد، ثم الجهات والتواريخ، لا أول سطر فقط.
- جرّب قارئًا آخر إذا كان الناتج ناقصًا. اختلاف أداة القراءة لا يعني اختلاف معلوماتك الأصلية.
- إذا كان الملف صورة فقط، ارجع إلى المستند الأصلي وصدّره كنص متى أمكن، أو استخدم OCR وراجع الناتج يدويًا.
- لا تحوّل نسبة استرجاع الكلمات إلى وعد توظيف أو حكم على جودة خبرتك.
يمكنك استخدام منشئ السيرة الذاتية لترتيب معلوماتك، ثم مراجعة ملفك في مُقيّم السيرة. هذه التجربة لا تُثبت دقة تقييم أسطر ولا تختبر صادراته؛ أدوات المنصة موضوع منفصل عن عينات البحث هنا.
حدود التجربة وطريقة التحقق
هذه تجربة صغيرة مترابطة العينات: نفس المحتوى تكرر في 20 ملفًا، ومصدر التوليد واحد. لم نختبر ملفات Word أو جميع الخطوط أو كل أحجام السير أو أنظمة شركات، ولم نقس نجاح التوظيف. لا نقدّم هامش ثقة أو ترتيبًا عامًا للأدوات بناءً عليها.
راجعنا الصفحات بصريًا والنصوص الخام، وأعدنا الاستخراج على الملفات نفسها فطابقت القياسات الإعادة. الحزمة تحتوي تعليمات التشغيل، وإصدارات الأدوات، وبصمات الملفات للتحقق من أن المقارنة تخص النسخ نفسها. اختلاف النظام أو الإصدار أو إعادة التوليد قد يغيّر النتيجة. سجل المنهجية يذكر أيضًا أخطاء الاختبار الأولي التي صُححت قبل اعتماد هذه النتائج.
للاستشهاد: فريق أسطر، «قراءة السيرة الذاتية العربية من PDF: تجربة على 20 ملفًا»، 25 سبتمبر 2026، الإصدار الأول. يمكن إعادة استخدام العينات والنتائج مع نسبها إلى أسطر وربطها بهذه الصفحة؛ تراخيص الخطوط والأدوات مستقلة ومذكورة بالحزمة.
مراجع الأدوات
- توثيق استخراج النص في pypdf: يشرح حدود استخراج النص والفرق عن OCR.
- توثيق النص في PyMuPDF: يوضح أن الاستخراج المباشر قد لا يطابق ترتيب القراءة المعتاد.
هذه المراجع تشرح سلوك الأدوات؛ الأرقام في الجداول ناتجة من تجربتنا المنشورة، لا من دراسة خارجية. إذا وجدت خطأ، أرسل معرّف العينة وإصدار الأداة والناتج عبر تواصل معنا حتى نراجع النتيجة.
قوالب سيرة ذاتية ذات صلة
سيرة ذاتية حديث تخرج
أنشئ سيرة ذاتية احترافية للخريجين الجدد بدون خبرة. حمّل نموذج CV جاهز للتعديل مصمم خصيصاً لحديثي التخرج يُبرز مشروع التخرج والتدريب التعاوني والمهارات.
سيرة ذاتية محاسب
سيرة ذاتية احترافية للمحاسبين. نموذج CV محاسبة جاهز يُبرز شهادات SOCPA وCPA وخبرات إعداد القوائم المالية والتدقيق، مع تنظيم واضح يسهل القراءة بأنظمة ATS دون ضمان اجتياز الفرز.