غلاف (استخراج البيانات)

في مجال استخراج البيانات، تُعدّ عملية التغليف إجراءً يستخرج المحتوى الفرعي المنتظم من مصدر معلومات غير منظم أو ذي بنية ضعيفة، ويحوله إلى شكل علائقي ، بحيث يمكن معالجته كبيانات منظمة. [ 1 ] ويُعنى استقراء التغليف بتصميم إجراءات استخراج تلقائية، مع الحد الأدنى من الاعتماد على القواعد المصممة يدويًا.

تُنشأ العديد من صفحات الويب تلقائيًا من بيانات مُهيكلة - مثل أدلة الهاتف وقوائم المنتجات - مُغلّفة بلغة عرض ذات بنية مرنة (عادةً ما تكون أحد مشتقات HTML )، ومُنسّقة لتسهيل تصفح المستخدمين. تُمثّل البيانات المُهيكلة عادةً أوصافًا لكائنات مُسترجعة من قواعد البيانات الأساسية، وتُعرض في صفحات الويب وفقًا لقوالب ثابتة على مستوى منخفض، حيث يُمكن أن تتغير البنية العامة للصفحات من أسبوع لآخر، تبعًا للتطور السريع لتصميم الموقع. نادرًا ما يتم توثيق الخط الفاصل الدقيق بين التصميم العام المرن وقوالب البيانات المُهيكلة الأقل مرونة، وذلك للاستخدام العام، خارج نطاق فريق إدارة المحتوى في الموقع. يجب على أنظمة البرمجيات التي تستخدم هذه الموارد ترجمة محتوى HTML إلى صيغة علائقية. تُستخدم عادةً دوال التغليف (wrappers) كمترجمات لهذه العملية. رسميًا، دالة التغليف هي دالة تُحوّل الصفحة إلى مجموعة البيانات التي تحتويها.

إنشاء غلاف

هناك منهجان رئيسيان لتوليد الأغلفة: الاستقراء واستخراج البيانات الآلي . يستخدم الاستقراء التعلم الخاضع للإشراف لتعلم قواعد استخراج البيانات من أمثلة تدريبية مصنفة يدويًا. أما عيوب الاستقراء فهي

  • عملية وضع الملصقات اليدوية التي تستغرق وقتاً طويلاً و
  • صعوبة صيانة الغلاف.

بسبب الجهد المبذول في وضع العلامات يدويًا، يصعب استخراج البيانات من عدد كبير من المواقع، إذ يمتلك كل موقع قوالبه الخاصة ويتطلب وضع علامات يدوية منفصلة لتعلم الأغلفة. كما تُعدّ صيانة الأغلفة مشكلة رئيسية، فكلما طرأ تغيير على موقع ما، تصبح الأغلفة المُنشأة له قديمة. ونظرًا لهذه العيوب، درس الباحثون توليد الأغلفة آليًا باستخدام استخراج الأنماط غير الخاضع للإشراف. ويُمكن الاستخراج الآلي لأن معظم عناصر بيانات الويب تتبع قوالب ثابتة. ويُمكّن اكتشاف هذه القوالب أو الأنماط النظام من إجراء الاستخراج تلقائيًا. [ 2 ]

يُعدّ توليد الواجهات البرمجية على الويب مشكلةً مهمةً ذات تطبيقاتٍ واسعة النطاق. ويُمكّن استخراج هذه البيانات من دمج البيانات/المعلومات من مواقع ويب متعددة لتقديم خدمات ذات قيمة مضافة، مثل التسوق المقارن، والبحث عن المنتجات، وتكامل المعلومات.

انظر أيضاً

مصادر

  1. نيكولاس كوشميريك، دانيال إس. ويلد، روبرت دورينبوس، الاستقراء التغليفي لاستخراج المعلومات، وقائع المؤتمر الدولي المشترك حول الذكاء الاصطناعي، 1997
  2. Liu, B. Web Data Mining: Exploring Hyperlinks, Contents and Usage Data , Springer, 2007.