استخلاص المعلومات

استخلاص المعلومات هو مهمة استخراج المعلومات المنظمة تلقائيًا من المستندات غير المنظمة أو شبه المنظمة القابلة للقراءة آليًا، وغيرها من المصادر الإلكترونية. يتضمن ذلك عادةً معالجة النصوص المكتوبة بلغة بشرية باستخدام تقنيات معالجة اللغة الطبيعية . [ 1 ] ويمكن اعتبار الأنشطة الحديثة في معالجة مستندات الوسائط المتعددة ، مثل الشرح التلقائي واستخراج المحتوى من الصور والصوت والفيديو والمستندات، من قبيل استخلاص المعلومات.

أتاحت التطورات الحديثة في تقنيات معالجة اللغة الطبيعية تحسينًا ملحوظًا في الأداء مقارنةً بالسنوات السابقة. [ 2 ] ومن الأمثلة على ذلك استخلاص المعلومات من تقارير وكالات الأنباء حول عمليات اندماج الشركات، كما هو موضح بالعلاقة الرسمية التالية:

الاندماج بين(جoمصأنy1،جoمصأنy2،دأتهـ){\displaystyle \operatorname {MergerBetween} (\mathrm {company} _{1}،\mathrm {company} _{2}،\mathrm {date} )}،

من جملة إخبارية على الإنترنت مثل:

أعلنت شركة Foo Inc. التي تتخذ من نيويورك مقراً لها أمس عن استحواذها على شركة Bar Corp.

يتمثل أحد الأهداف العامة لهندسة المعلومات في تمكين إجراء العمليات الحسابية على البيانات غير المهيكلة سابقًا. أما الهدف الأكثر تحديدًا فهو تمكين الاستدلال الآلي حول الشكل المنطقي لبيانات الإدخال. البيانات المهيكلة هي بيانات محددة دلاليًا من مجال مستهدف مُختار، ويتم تفسيرها وفقًا للفئة والسياق .

يُعدّ استخلاص المعلومات جزءًا من معضلة أكبر تتناول مشكلة ابتكار أساليب آلية لإدارة النصوص، تتجاوز مجرد نقلها وتخزينها وعرضها. وقد طوّر مجال استرجاع المعلومات [ 3 ] أساليب آلية، ذات طابع إحصائي في الغالب، لفهرسة مجموعات الوثائق الكبيرة وتصنيفها. ويُعدّ معالجة اللغة الطبيعية نهجًا تكميليًا آخر ، إذ نجح إلى حد كبير في حلّ مشكلة نمذجة معالجة اللغة البشرية، مع مراعاة حجم المهمة. أما استخلاص المعلومات، من حيث الصعوبة والتركيز، فيتعامل مع مهام تقع بين استرجاع المعلومات ومعالجة اللغة الطبيعية. فمن حيث المدخلات، يفترض استخلاص المعلومات وجود مجموعة من الوثائق، حيث تتبع كل وثيقة منها نموذجًا، أي أنها تصف كيانًا واحدًا أو أكثر، أو حدثًا واحدًا أو أكثر، بطريقة مشابهة لتلك الموجودة في الوثائق الأخرى، ولكنها تختلف في التفاصيل. على سبيل المثال، لنفترض مجموعة من مقالات وكالات الأنباء حول الإرهاب في أمريكا اللاتينية، حيث يُفترض أن كل مقالة تستند إلى عمل إرهابي واحد أو أكثر. نُعرّف أيضًا لكل مهمة استخلاص معلومات قالبًا، وهو عبارة عن إطار (أو مجموعة من) بيانات الحالة لحفظ المعلومات الواردة في مستند واحد. في مثال الإرهاب، يحتوي القالب على خانات تُشير إلى الجاني والضحية وسلاح العمل الإرهابي، بالإضافة إلى تاريخ وقوع الحدث. يتطلب نظام استخلاص المعلومات في هذه الحالة فهم مقال الهجوم بالقدر الكافي فقط للعثور على البيانات المُطابقة للخانات الموجودة في هذا القالب.

تاريخ

يعود تاريخ استخلاص المعلومات إلى أواخر سبعينيات القرن الماضي، في بدايات معالجة اللغات الطبيعية. [ 4 ] وكان نظام جاسبر، الذي طورته مجموعة كارنيجي لصالح وكالة رويترز في منتصف ثمانينيات القرن الماضي، نظامًا تجاريًا مبكرًا يهدف إلى تزويد المتداولين الماليين بأخبار مالية فورية . [ 5 ]

بدأت مبادرة IE في عام 1987، مدفوعةً بسلسلة من مؤتمرات فهم الرسائل . يُعدّ مؤتمر فهم الرسائل مؤتمراً تنافسياً [ 6 ] ركّز على المجالات التالية:

  • MUC-1 (1987)، MUC-3 (1989): رسائل العمليات البحرية.
  • مؤتمر MUC-3 (1991)، مؤتمر MUC-4 (1992): الإرهاب في دول أمريكا اللاتينية.
  • MUC-5 (1993): المشاريع المشتركة ومجال الإلكترونيات الدقيقة.
  • مؤتمر ميونخ السادس (1995): مقالات إخبارية حول التغييرات الإدارية.
  • MUC-7 (1998): تقارير إطلاق الأقمار الصناعية.

وقد جاء دعم كبير من وكالة مشاريع البحوث الدفاعية المتقدمة الأمريكية ( داربا )، التي رغبت في أتمتة المهام الروتينية التي يقوم بها المحللون الحكوميون، مثل فحص الصحف بحثًا عن روابط محتملة بالإرهاب.

الأهمية الحالية

تكمن الأهمية الحالية لاستخراج المعلومات في الكم الهائل من المعلومات المتاحة بشكل غير منظم. يشير تيم بيرنرز لي ، مخترع شبكة الويب العالمية ، إلى الإنترنت الحالي على أنه شبكة من المستندات [ 7 ] ، ويدعو إلى إتاحة المزيد من المحتوى كشبكة من البيانات [ 8 ] . إلى حين تحقيق ذلك، تتكون شبكة الويب في معظمها من مستندات غير منظمة تفتقر إلى البيانات الوصفية الدلالية . يمكن تسهيل الوصول إلى المعرفة الموجودة في هذه المستندات للمعالجة الآلية من خلال تحويلها إلى شكل علائقي ، أو عن طريق ترميزها باستخدام علامات XML . يحتاج نظام ذكي يراقب موجز بيانات إخبارية إلى استخراج المعلومات لتحويل البيانات غير المنظمة إلى بيانات قابلة للتحليل. من التطبيقات الشائعة لاستخراج المعلومات مسح مجموعة من المستندات المكتوبة بلغة طبيعية وتعبئة قاعدة بيانات بالمعلومات المستخرجة [ 9 ] .

المهام والمهام الفرعية

يرتبط تطبيق استخلاص المعلومات من النصوص بمشكلة تبسيط النصوص بهدف إنشاء عرض منظم للمعلومات الموجودة في النصوص الحرة. والهدف العام هو إنشاء نص يسهل على الآلة قراءته لمعالجة الجمل. تشمل مهام استخلاص المعلومات ومهامها الفرعية النموذجية ما يلي:

  • تعبئة القوالب: استخراج مجموعة ثابتة من الحقول من مستند، على سبيل المثال استخراج الجناة والضحايا والوقت وما إلى ذلك من مقال صحفي حول هجوم إرهابي.
    • استخراج الأحداث: عند إدخال مستند، يتم استخراج صفر أو أكثر من قوالب الأحداث. على سبيل المثال، قد تصف مقالة صحفية عدة هجمات إرهابية.
  • ملء قاعدة المعرفة : يتم ملء قاعدة بيانات بالحقائق بناءً على مجموعة من المستندات. عادةً ما تكون قاعدة البيانات على شكل ثلاثيات (الكيان 1، العلاقة، الكيان 2)، على سبيل المثال ( باراك أوباما ، الزوج/الزوجة، ميشيل أوباما ).
    • التعرف على الكيانات المسماة : هو التعرف على أسماء الكيانات المعروفة (للأشخاص والمنظمات)، وأسماء الأماكن، والتعبيرات الزمنية، وأنواع معينة من التعبيرات العددية، وذلك باستخدام المعرفة الموجودة في المجال أو المعلومات المستخرجة من جمل أخرى. [ 10 ] عادةً ما تتضمن مهمة التعرف تعيين مُعرّف فريد للكيان المستخرج. أما مهمة اكتشاف الكيانات المسماة فهي أبسط ، وتهدف إلى اكتشاف الكيانات دون الحاجة إلى أي معرفة مسبقة عن مثيلات الكيان. على سبيل المثال، عند معالجة الجملة "م. سميث يحب الصيد"، فإن اكتشاف الكيانات المسماة يعني اكتشاف أن عبارة "م. سميث" تشير إلى شخص، ولكن دون الحاجة بالضرورة إلى معرفة (أو استخدام) أي معلومات عن شخص معين يُدعى م. سميث ، وهو (أو قد يكون) الشخص المحدد الذي تتحدث عنه تلك الجملة.
    • حلّ الإحالة : الكشف عن الإحالة والروابط الإشارية بين الكيانات النصية. في مهام استخراج المعلومات، يقتصر هذا عادةً على إيجاد الروابط بين الكيانات المسماة المستخرجة مسبقًا. على سبيل المثال، تشير عبارة "International Business Machines" و"IBM" إلى الكيان نفسه في العالم الحقيقي. إذا أخذنا الجملتين "M. Smith likes fishing. But he doesn't like bikeking"، فسيكون من المفيد الكشف عن أن الضمير "he" يشير إلى الشخص "M. Smith" الذي تم تحديده مسبقًا.
    • استخلاص العلاقات : تحديد العلاقات بين الكيانات، [ 10 ] مثل:
      • الشخص يعمل لدى المنظمة (مقتبس من الجملة "بيل يعمل لدى شركة IBM".)
      • الشخص الموجود في الموقع (مقتبس من جملة "بيل موجود في فرنسا".)
  • استخلاص المعلومات شبه المهيكلة، والذي قد يشير إلى أي عملية استخلاص معلومات تحاول استعادة نوع من بنية المعلومات التي فُقدت من خلال النشر، مثل:
    • استخراج الجداول: إيجاد واستخراج الجداول من المستندات. [ 11 ] [ 12 ]
    • استخلاص المعلومات من الجداول  : هو استخراج المعلومات بطريقة منظمة من الجداول. هذه المهمة أكثر تعقيدًا من مجرد استخلاص المعلومات من الجداول، إذ أن استخلاص المعلومات من الجداول ليس سوى الخطوة الأولى، بينما يتطلب استخلاص المعلومات من الجداول فهم أدوار الخلايا والصفوف والأعمدة، وربط المعلومات داخل الجدول، وفهم المعلومات المعروضة فيه. [ 11 ] [ 13 ] [ 14 ]
    • استخلاص التعليقات  : استخلاص التعليقات من المحتوى الفعلي للمقالات بهدف استعادة الصلة بين مؤلفي كل جملة.
  • تحليل اللغة والمفردات
  • استخراج الصوت
    • استخراج الموسيقى القائم على القوالب: إيجاد الخصائص ذات الصلة في إشارة صوتية مأخوذة من مجموعة معينة؛ على سبيل المثال [ 15 ] يمكن استخراج مؤشرات الوقت لحدوث الأصوات الإيقاعية من أجل تمثيل المكون الإيقاعي الأساسي لقطعة موسيقية.

تجدر الإشارة إلى أن هذه القائمة ليست شاملة، وأن المعنى الدقيق لأنشطة هندسة المعلومات ليس متفقًا عليه بشكل عام، وأن العديد من المناهج تجمع بين مهام فرعية متعددة لهندسة المعلومات لتحقيق هدف أوسع. غالبًا ما تُستخدم تقنيات التعلم الآلي والتحليل الإحصائي ومعالجة اللغة الطبيعية في هندسة المعلومات.

أصبح تحليل المعلومات المستخرجة من المستندات غير النصية موضوعًا متزايد الأهمية في الأبحاث، ويمكن الآن التعبير عن المعلومات المستخرجة من مستندات الوسائط المتعددة ببنية عالية المستوى كما هو الحال مع النصوص. وهذا يؤدي بطبيعة الحال إلى دمج المعلومات المستخرجة من أنواع ومصادر متعددة من المستندات.

تطبيقات شبكة الويب العالمية

لطالما كان استخراج المعلومات محورًا رئيسيًا لمؤتمرات MUC. ومع ذلك، أدى انتشار الإنترنت إلى زيادة الحاجة لتطوير أنظمة استخراج معلومات تساعد المستخدمين على التعامل مع الكم الهائل من البيانات المتاحة عبر الإنترنت. يجب أن تلبي الأنظمة التي تُجري استخراج المعلومات من النصوص الإلكترونية متطلبات التكلفة المنخفضة، والمرونة في التطوير، وسهولة التكيف مع المجالات الجديدة. إلا أن أنظمة MUC لا تفي بهذه المعايير. علاوة على ذلك، لا يستغل التحليل اللغوي المُجرى على النصوص غير المهيكلة وسوم HTML/ XML وتنسيقات العرض المتاحة في النصوص الإلكترونية. ونتيجة لذلك، تم تطوير مناهج أقل كثافة لغوية لاستخراج المعلومات على الويب باستخدام " الأغلفة" ، وهي عبارة عن مجموعات من القواعد عالية الدقة التي تستخرج محتوى صفحة معينة. وقد ثبت أن تطوير الأغلفة يدويًا مهمة تستغرق وقتًا طويلاً وتتطلب مستوى عالٍ من الخبرة. ولذلك، تم استخدام تقنيات التعلم الآلي ، سواءً الخاضعة للإشراف أو غير الخاضعة له ، لاستنباط هذه القواعد تلقائيًا.

تتعامل برامج التغليف عادةً مع مجموعات صفحات الويب ذات البنية المنظمة، مثل كتالوجات المنتجات وأدلة الهاتف. إلا أنها تفشل عندما يكون نوع النص أقل تنظيمًا، وهو أمر شائع أيضًا على الويب. وقد حفزت الجهود المبذولة مؤخرًا في مجال استخراج المعلومات التكيفي تطوير أنظمة استخراج معلومات قادرة على التعامل مع أنواع مختلفة من النصوص، من النصوص المنظمة جيدًا إلى النصوص شبه الحرة - حيث تفشل برامج التغليف الشائعة - بما في ذلك النصوص المختلطة. تستطيع هذه الأنظمة الاستفادة من المعرفة اللغوية الطبيعية البسيطة، وبالتالي يمكن تطبيقها أيضًا على النصوص الأقل تنظيمًا.

من التطورات الحديثة استخلاص المعلومات المرئية [ 16 ] [ 17 ] ، الذي يعتمد على عرض صفحة الويب في المتصفح وإنشاء قواعد بناءً على تقارب المناطق في الصفحة المعروضة. يساعد هذا في استخلاص الكيانات من صفحات الويب المعقدة التي قد تُظهر نمطًا مرئيًا، ولكنها تفتقر إلى نمط واضح في شفرة HTML المصدرية.

الأساليب

أصبحت الأساليب القياسية التالية مقبولة على نطاق واسع الآن:

توجد العديد من الأساليب الأخرى لهندسة المعلومات، بما في ذلك الأساليب الهجينة التي تجمع بين بعض الأساليب القياسية المذكورة سابقًا.

البرامج والخدمات المجانية أو مفتوحة المصدر

انظر أيضاً

مراجع

  1. name=Kariampuzha2023 كاريامبوزا، ويليام؛ أليا، جيوكوندا؛ كو، سو؛ سانجاك، جليل؛ ماثي، إيوي؛ سيد، إريك؛ شاتيلين، هايلي؛ ياداو، أرجون؛ شو، يانجي؛ تشو، تشيان (2023). "استخلاص المعلومات الدقيقة لعلم أوبئة الأمراض النادرة على نطاق واسع" . مجلة الطب الانتقالي . 21 (1): 157. doi : 10.1186/s12967-023-04011-y . PMC 9972634. PMID 36855134 .  
  2. كريستينا نيكلاوس، ماتياس سيتو، أندريه فريتاس، وسيغفريد هاندشوه. 2018. دراسة استقصائية حول استخلاص المعلومات المفتوحة. في وقائع المؤتمر الدولي السابع والعشرين للغويات الحاسوبية ، الصفحات 3866-3878، سانتا فيه، نيو مكسيكو، الولايات المتحدة الأمريكية. رابطة اللغويات الحاسوبية.
  3. فرايتاغ، داين. "التعلم الآلي لاستخراج المعلومات في المجالات غير الرسمية" (ملف PDF) . 2000 دار نشر كلوير الأكاديمية. طُبع في هولندا .
  4. كوي، جيم؛ ويلكس، يوريك (1996). استخلاص المعلومات (ملف PDF) . ص 3. CiteSeerX 10.1.1.61.6480 . S2CID 10237124. مؤرشف من الأصل (ملف PDF) بتاريخ 20 فبراير 2019.   
  5. أندرسن، بيغي م.؛ هايز، فيليب ج.؛ هوتنر، أليسون ك.؛ شمندت، ليندا م.؛ نيرنبورغ، إيرين ب.؛ وينشتاين، ستيفن ب. (1992). "الاستخلاص التلقائي للحقائق من البيانات الصحفية لإنشاء قصص إخبارية" . وقائع المؤتمر الثالث حول معالجة اللغة الطبيعية التطبيقية - الصفحات 170-177 . CiteSeerX 10.1.1.14.7943 . doi : 10.3115/974499.974531 . S2CID 14746386 .   
  6. ^ ماركو كوستانتينو، باولو كوليتي، استخراج المعلومات في التمويل، Wit Press، 2008. ISBN 978-1-84564-146-7
  7. "البيانات المرتبطة - القصة حتى الآن" (ملف PDF) .
  8. "تيم بيرنرز لي على الإنترنت التالي" . مؤرشف من الأصل بتاريخ 10 أبريل 2011. تم الاطلاع عليه بتاريخ 27 مارس 2010 .
  9. RK Srihari , W. Li, C. Niu and T. Cornell,"InfoXtract: A Customizable Intermediate Level Information Extraction Engine", Journal of Natural Language Engineering ,Cambridge U. Press, 14(1), 2008, pp.33-69.
  10. 1 2 نغوين، دات كوك؛ فيرسبور، كارين (2019). "استخلاص العلاقات العصبية الشاملة باستخدام الانتباه الثنائي العميق". وقائع المؤتمر الأوروبي الحادي والأربعين لاسترجاع المعلومات (ECIR) . arXiv : 1812.11275 . doi : 10.1007/978-3-030-15712-8_47 .
  11. 1 2 ميلوسيفيتش ن، جريجسون س، هيرنانديز ر، نيناديتش ج (فبراير 2019). "إطار عمل لاستخلاص المعلومات من الجداول في الأدبيات الطبية الحيوية". المجلة الدولية لتحليل المستندات والتعرف عليها . 22 (1): 55-78 . arXiv : 1902.10031 . Bibcode : 2019arXiv190210031M . doi : 10.1007/s10032-019-00317-0 . S2CID 62880746 . 
  12. ميلوسيفيتش، نيكولا (2018). منهج متعدد الطبقات لاستخراج المعلومات من الجداول في الوثائق الطبية الحيوية (ملف PDF) (أطروحة دكتوراه). جامعة مانشستر.
  13. ميلوسيفيتش ن، جريجسون س، هيرنانديز ر، نيناديتش ج (يونيو 2016). "فك تشابك بنية الجداول في الأدبيات العلمية" . معالجة اللغة الطبيعية ونظم المعلومات . سلسلة محاضرات في علوم الحاسوب. المجلد 21. الصفحات 162-174 . doi : 10.1007/978-3-319-41754-7_14 . ISBN   978-3-319-41753-0. S2CID 19538141 . 
  14. ميلوسيفيتش، نيكولا (2018). منهج متعدد الطبقات لاستخراج المعلومات من الجداول في الوثائق الطبية الحيوية (ملف PDF) (أطروحة دكتوراه). جامعة مانشستر.
  15. A.Zils, F.Pachet, O.Delerue and F. Gouyon, Automatic Extraction of Drum Tracks from Polyphonic Music Signals Archived 2017-08-29 at the Wayback Machine , Proceedings of WedelMusic, Darmstadt, Germany, 2002.
  16. ^ تشينثاماركشان، فيجيل؛ ديسفاند ، براساد م . كريشنابورام، راغو؛ فاراداراجان، راماكريشنان؛ ستولز، كنوت (2015). “WYSIWYE: جبر للتعبير عن القواعد المكانية والنصية لاستخراج المعلومات”. أرخايف : 1506.08454 [ cs.CL ].
  17. باومغارتنر، روبرت؛ فليسيكا، سيرجيو؛ غوتلوب، جورج (2001). "استخراج المعلومات المرئية من الويب باستخدام Lixto". الصفحات 119-128 . CiteSeerX 10.1.1.21.8236 .  
  18. بينغ، ف.؛ ماكالوم، أ. (2006). "استخلاص المعلومات من الأوراق البحثية باستخدام الحقول العشوائية الشرطية". معالجة المعلومات وإدارتها . 42 (4): 963. doi : 10.1016/j.ipm.2005.09.002 .
  19. شيميزو، نوبويوكي؛ هاس، أندرو (2006). "استخراج تمثيل المعرفة القائم على الإطار من تعليمات المسار" (ملف PDF) . مؤرشف من الأصل (ملف PDF) بتاريخ 1 سبتمبر 2006. تم الاطلاع عليه بتاريخ 27 مارس 2010 .