استخراج بيانات منظمة من عقود PDF
الأسعار والمواسم وشروط الإلغاء كلها محفوظة في ملفات PDF داخل مجلد واحد. البحث فيها يتم يدويا، وسؤال بسيط مثل «كم سعر هذه الخدمة في رمضان» قد يستهلك دقائق، وأحيانا ساعة كاملة.
الفكرة
نظام يراقب مكتبة المستندات، يفتح كل ملف جديد، ثم يستخرج القيم إلى جدول: السعر، والفترة، والضريبة، والرسوم، وشروط الإلغاء.
بعد ذلك يتحول السؤال إلى استعلام، وتصل الإجابة خلال ثوان.
ما ينجح وما لا ينجح
ينجح الاستخراج مع الملفات النصية المنظمة: جداول واضحة وعناوين متسقة.
ويتعثر مع الصور الممسوحة ضوئيا، والتنسيقات الفوضوية، والجداول المتداخلة.
القاعدة الأهم: افشل بصوت مسموع
أخطر ما في المشروع كله: استخراج قيمة خاطئة وتخزينها كأنها صحيحة. سعر خاطئ في قاعدة البيانات أسوأ بكثير من غياب السعر أصلا.
لذلك القاعدة عندي ثابتة: إذا لم يبلغ الاستخراج ثقة كافية، لا تخزن أي قيمة، ويوضع الملف في قائمة المراجعة اليدوية.
بنية تحمي من التكرار
يحصل كل ملف على بصمة محسوبة من محتواه. فإذا عاد الملف نفسه باسم مختلف تجاهله النظام، وإذا تغير المحتوى تغيرت البصمة معه وأعيدت المعالجة.
ما تعلمته عن التعامل مع الشركاء
بعد تشغيل النظام صرت أطلب الملفات بصيغة أوضح من البداية. رسالة واحدة إلى المورد، أطلب فيها جدولا منظما بدل ملف مصمم، وفرت علي جهد استخراج يمتد شهرا كاملا.
وفي تجربتي، تحسين المصدر نفسه كان أسهل ما يحسن نتائج الاستخراج.