تقارير

قراءة السيرة الذاتية العربية من PDF: تجربة على 20 ملفًا

8 دقائق للقراءة
صورة غلاف مقال: قراءة السيرة الذاتية العربية من PDF: تجربة على 20 ملفًا
جدول المحتويات

الخلاصة: الملف الواضح بصريًا قد يعطي نصًا ناقصًا

في 25 سبتمبر 2026 اختبرنا 20 ملف PDF مشتقة من سيرة عربية مصطنعة واحدة بأداتين لاستخراج النص. ليست العينة 20 شخصًا، ولا ملفات عملاء، وليست الملفات مُصدَّرة من منشئ أسطر. الهدف اختبار قابلية التحقق من النص في ظروف محددة، لا تسويق تفوق قالب معين.

من أصل 16 ملفًا نصيًا، استعادت الأداتان البريد التجريبي بشرطاته السفلية في جميع الملفات. لكن pypdf لم يُرجع اسم جهة العمل كاملًا في أي منها، بينما ظهر اختلاف في حروف بعض الكلمات العربية مع PyMuPDF. الملفات الأربعة المصوّرة لم تعطِ نصًا في هذا الاختبار الذي لا يستخدم OCR.

هذا ليس اختبار قبول لدى أنظمة ATS، ولا تقييمًا لجودة صاحب السيرة. الأرقام التالية تخص أدوات القراءة وإصداراتها وإعداداتها والعينات المنشورة فقط؛ ليست احتمالات قبول أو رفض في التوظيف.

حمّل الأدلة وجرّب بنفسك

البريد ينتهي بنطاق example.com، ورقم الهاتف غير صالح عمدًا، والجهات والأسماء مصطنعة. نفحص بقاء الرقم كنص، لا صلاحيته للتواصل.

كيف صممنا التجربة؟

ثبّتنا محتوى سيرة معلم رياضيات وهمي، ثم غيّرنا ثلاثة عوامل:

العاملالقيم المختبرة
الخطTajawal وCairo، بالملفات المحددة في الحزمة
حجم متن النص12 و16 بكسل CSS، أي 9 و12 نقطة في هذا التوليد
التخطيطعمود واحد، عمودان، جدول بعناوين وصفوف، وفاصل صفحة بعد المشاريع
المقارنة المصوّرةأربع نسخ من تخطيط العمود الواحد، صور فقط دون طبقة نص

حاصل 2 خط × 2 حجم × 4 تخطيطات = 16 ملفًا نصيًا، وأضفنا 4 ملفات مصوّرة. إجمالي الصفحات 28؛ بعض ملفات العمود الواحد بحجم 16 بكسل امتدت طبيعيًا إلى صفحتين. لا تعني تسمية «عمود واحد» أنه صفحة واحدة.

أنشأنا الملفات من HTML مضبوط في Chrome 134.0.6998.35 عبر Puppeteer 24.4.0، على Windows، بورق A4 وهوامش 18 مم وخطوط مضمّنة. نسجّل النسخة المستخدمة ولا ندّعي أنها أحدث Chrome. حُفظت كل صفحات النسخ المصوّرة بدقة 144 نقطة في البوصة.

قُرئت الملفات باستخدام pypdf 6.10.0 عبر extract_text() وPyMuPDF 1.26.7 عبر get_text('text', sort=False). استخدمنا الاستخراج النصي المباشر؛ دون OCR أو تصحيح لغوي أو إعادة ترتيب هندسية أو معالجة بالذكاء الاصطناعي. الأداتان لا تمثلان جميع برامج قراءة PDF ولا أنظمة التوظيف.

ما الذي قسناه؟

  • استرجاع كلمات النص: نطابق الكلمات والأرقام مع النص المرجعي، مع احتساب التكرار. المرجع يحتوي 136 وحدة؛ تدخل الكلمات الإنجليزية والأرقام في الحساب، وتُستبعد علامات الترقيم. هذه نسبة استرجاع حرفية، وليست درجة ATS أو مقياسًا للفهم. الكلمة الملتصقة بجارتها قد لا تُحتسب حتى لو استطاع القارئ تخمينها.
  • بقاء سبعة حقول: الاسم، البريد، الهاتف التجريبي، فترتان زمنيتان، المؤهل، وجهة العمل. نبحث عن النص كاملًا؛ لا نختبر تعرف النظام على نوع الحقل أو ربط التاريخ بجهته.
  • تسلسل ستة عناوين أقسام: نقارن ظهورها بالتسلسل المرجعي. في العمودين نقرأ العمود الأيمن كاملًا ثم الأيسر. إذا تغيّر عنوان أو اختفى، تصبح نتيجة الترتيب «غير قابلة للقياس»، لا «ترتيب خاطئ» تلقائيًا. هذا لا يقيس ترتيب كل جملة داخل الأقسام.

قبل المقارنة وحّدنا Unicode بصيغة NFKC، وحذفنا التشكيل والتطويل وعلامات التحكم في اتجاه النص، ووحّدنا المسافات. لم نصلح الحروف المعكوسة أو نلصق الكلمات المنفصلة أو نصحح الهمزات؛ النص الخام متاح كي لا تخفي المعالجة المشكلة.

النتائج الفعلية

الملفات النصية الستة عشر

المؤشرpypdf 6.10.0PyMuPDF 1.26.7
نطاق استرجاع الكلمات81.62% إلى 91.18%79.41% إلى 90.44%
البريد والرقم والفترتان الزمنيتان كاملة16 من 16 لكل حقل16 من 16 لكل حقل
الاسم كاملًا بعد التطبيع المحدد16 من 168 من 16
جهة العمل كاملة0 من 1616 من 16
الحقول السبعة كلها موجودة0 من 168 من 16
العناوين الستة موجودة بالتسلسل المرجعي16 من 16غير قابل للقياس في 16 ملفًا بسبب اختلاف نص عناوين

الحقول الموجودة لا تعني أن بقية النص سليم. مثلًا، احتفظ PyMuPDF بالحقول السبعة في ثماني نسخ، لكن استرجاع الكلمات فيها بقي 90.44%، لا 100%.

أثر التخطيط والخط ضمن هذه العينة

المجموعةاسترجاع الكلمات مع pypdfاسترجاع الكلمات مع PyMuPDF
عمود واحد، أربعة ملفات90.44%90.44% مع Tajawal؛ 79.41% مع Cairo
عمودان، أربعة ملفات90.44% بحجم 12؛ 91.18% بحجم 1690.44% مع Tajawal؛ 79.41% مع Cairo
جدول، أربعة ملفات81.62%90.44% مع Tajawal؛ 79.41% مع Cairo
فاصل صفحة، أربعة ملفات90.44%90.44% مع Tajawal؛ 79.41% مع Cairo

لا تثبت النتيجة أن Cairo غير مناسب للسير، أو أن عمودين أفضل دائمًا من عمود واحد. التفاعل هنا بين ملف الخط والمولّد وأداة القراءة وإعداداتها والنص المختار. كما أن الاسترجاع الأعلى في نسخة لا يثبت فهم الخبرات أو صحة ترتيب محتواها بالكامل.

الملفات المصوّرة الأربعة

أعادت الأداتان نصًا فارغًا في الملفات الأربعة: صفر استرجاع في هذه الإعدادات. ليست هذه نتيجة عن جودة OCR؛ لم نشغّله أصلًا. قد تقرأها خدمة أخرى تستخدم التعرف الضوئي على الحروف، ودقة ذلك تحتاج تجربة مستقلة.

مثالان يوضحان ما تعنيه الأرقام

اختفاء جهة العمل من النص المستخرج

في عينة Tajawal ذات العمود الواحد يظهر سطر «معلم رياضيات | مدرسة المثال التجريبية» على الصفحة. لكن الناتج الخام من pypdf يحتوي المسمى دون اسم المدرسة. لهذا لم نجعل سلامة الشكل دليلًا على اكتمال الاستخراج.

اختلاف حروف الاسم رغم ظهوره على الصفحة

في عينة Cairo ذات العمودين الاسم المرجعي هو «سالم المثال التجريبي». ناتج PyMuPDF أعاد آخر كلمة «التجرييب». لم نصححها آليًا قبل القياس، ولم نفترض أن كل برنامج سيعيد الخطأ نفسه.

ولمقارنة النص بالصورة، افتح النسخة المصوّرة فقط وحاول تحديد الاسم ونسخه. المحتوى يبدو مشابهًا، لكن النص غير مخزّن فيه كحروف قابلة للاستخراج.

ماذا تفعل قبل إرسال سيرتك؟

  • اتبع صيغة الملف التي تطلبها جهة التقديم أولًا.
  • افتح PDF، وانسخ محتواه إلى محرر نص عادي. راجع الاسم والبريد، ثم الجهات والتواريخ، لا أول سطر فقط.
  • جرّب قارئًا آخر إذا كان الناتج ناقصًا. اختلاف أداة القراءة لا يعني اختلاف معلوماتك الأصلية.
  • إذا كان الملف صورة فقط، ارجع إلى المستند الأصلي وصدّره كنص متى أمكن، أو استخدم OCR وراجع الناتج يدويًا.
  • لا تحوّل نسبة استرجاع الكلمات إلى وعد توظيف أو حكم على جودة خبرتك.

يمكنك استخدام منشئ السيرة الذاتية لترتيب معلوماتك، ثم مراجعة ملفك في مُقيّم السيرة. هذه التجربة لا تُثبت دقة تقييم أسطر ولا تختبر صادراته؛ أدوات المنصة موضوع منفصل عن عينات البحث هنا.

حدود التجربة وطريقة التحقق

هذه تجربة صغيرة مترابطة العينات: نفس المحتوى تكرر في 20 ملفًا، ومصدر التوليد واحد. لم نختبر ملفات Word أو جميع الخطوط أو كل أحجام السير أو أنظمة شركات، ولم نقس نجاح التوظيف. لا نقدّم هامش ثقة أو ترتيبًا عامًا للأدوات بناءً عليها.

راجعنا الصفحات بصريًا والنصوص الخام، وأعدنا الاستخراج على الملفات نفسها فطابقت القياسات الإعادة. الحزمة تحتوي تعليمات التشغيل، وإصدارات الأدوات، وبصمات الملفات للتحقق من أن المقارنة تخص النسخ نفسها. اختلاف النظام أو الإصدار أو إعادة التوليد قد يغيّر النتيجة. سجل المنهجية يذكر أيضًا أخطاء الاختبار الأولي التي صُححت قبل اعتماد هذه النتائج.

للاستشهاد: فريق أسطر، «قراءة السيرة الذاتية العربية من PDF: تجربة على 20 ملفًا»، 25 سبتمبر 2026، الإصدار الأول. يمكن إعادة استخدام العينات والنتائج مع نسبها إلى أسطر وربطها بهذه الصفحة؛ تراخيص الخطوط والأدوات مستقلة ومذكورة بالحزمة.

مراجع الأدوات

هذه المراجع تشرح سلوك الأدوات؛ الأرقام في الجداول ناتجة من تجربتنا المنشورة، لا من دراسة خارجية. إذا وجدت خطأ، أرسل معرّف العينة وإصدار الأداة والناتج عبر تواصل معنا حتى نراجع النتيجة.

جاهز لإنشاء سيرتك الذاتية؟

ابدأ الآن مجانا مع أسطر