استخراج الجدول
استخراج الجداول هو عملية التعرف على جدول وفصله من مستند كبير، وقد يشمل ذلك أيضاً التعرف على صفوف أو أعمدة أو عناصر فردية. ويمكن اعتباره شكلاً خاصاً من أشكال استخراج المعلومات .
يمكن استخراج الجداول من صفحات الويب باستخدام عناصر HTML الخاصة بالجداول، مثل وسم "table"، وقد تُتيح مكتبات البرمجة إمكانية استخراج الجداول من صفحات الويب. تستطيع مكتبة pandas البرمجية في بايثون استخراج الجداول من صفحات الويب HTML عبر دالة read_html() الخاصة بها.
يُعدّ استخراج الجداول من ملفات PDF أو الصور الممسوحة ضوئيًا أكثر صعوبة ، حيث لا توجد عادةً علامات ترميز قابلة للقراءة آليًا خاصة بالجداول. [ 1 ] وقد وُصفت أنظمة تستخرج البيانات من الجداول في ملفات PDF العلمية. [ 2 ] [ 3 ]
تعرض ويكيبيديا بعض معلوماتها في جداول، فعلى سبيل المثال، يمكن استخراج 3.5 مليون جدول من ويكيبيديا الإنجليزية . [ 4 ] بعض هذه الجداول لها تنسيق محدد، مثل ما يُسمى بصناديق المعلومات . ويُعدّ استخراج الجداول على نطاق واسع من صناديق معلومات ويكيبيديا أحد مصادر قاعدة بيانات DBpedia . [ 5 ]
تتوفر خدمات ويب تجارية لاستخراج الجداول، مثل Amazon Textract و Google's Document AI و IBM Watson Discovery و Microsoft Form Recognizer. [ 1 ] كما تتوفر أدوات مفتوحة المصدر، مثل PDFFigures 2.0 المستخدمة في Semantic Scholar . [ 6 ] في دراسة مقارنة نُشرت عام 2017، وجد الباحثون أن برنامج ABBYY FineReader الاحتكاري يُحقق أفضل أداء في استخراج الجداول من ملفات PDF من بين ست أدوات مختلفة تم تقييمها. [ 7 ] وفي تقييم معياري أُجري عام 2023، [ 8 ] حقق Adobe Extract، [ 9 ] وهو واجهة برمجة تطبيقات سحابية تستخدم منصة Sensei AI من Adobe ، [ 10 ] أفضل أداء من بين خمس أدوات تم تقييمها لاستخراج الجداول.
مراجع
- 1 2 دوغلاس بورديك؛ مارينا دانيلفسكي؛ ألكسندر ف. إيفيمييفسكي؛ يانيس كاتسيس؛ نانسي وانغ (أغسطس 2020). "استخراج الجداول وفهمها للتطبيقات العلمية والتجارية". وقائع مؤسسة VLDB. المؤتمر الدولي لقواعد البيانات الضخمة جدًا . 13 (12): 3433-3436 . doi : 10.14778/3415478.3415563 . ISSN 2150-8097 . Wikidata Q108170445 .
- ↑ وينهاو يو؛ وي بنغ؛ يو شو؛ تشينغكاي زنغ؛ مينغ جيانغ (19 أبريل 2020). نظام استخلاص الأدلة التجريبية في علم البيانات باستخدام ميزات الجداول الهجينة والتعلم الجماعي . الصفحات 951-961 . doi : 10.1145/3366423.3380174 . ISBN 978-1-4503-7023-3. Wikidata Q108172460 .
{{cite book}}تم|journal=تجاهله ( مساعدة ) - ↑ بينو كرويت؛ هونغيو هي؛ جاكوبو أورباني (1 نوفمبر 2020). Tab2Know: بناء قاعدة معرفية من الجداول في الأوراق العلمية . سلسلة محاضرات في علوم الحاسوب . الصفحات 349-365 . arXiv : 2107.13306 . doi : 10.1007/978-3-030-62419-4_20 . ISBN 978-3-030-62419-4. Wikidata Q101086651 .
{{cite book}}تم|journal=تجاهله ( مساعدة ) - ↑ توبياس بليفوس؛ ليون بورنمان؛ ديمتري ف. كلاشنيكوف؛ فيليكس ناومان؛ ديفيش سريفاستافا (17 أغسطس 2021). "الحياة السرية لجداول ويكيبيديا" (ملف PDF) . وقائع ورشة العمل الثانية حول البحث والاستكشاف والتحليل في مخازن البيانات غير المتجانسة . وقائع ورش عمل CEUR: 20-26 . Wikidata Q108215401 .
- ↑ سورين أوير؛ كريستيان بيزر؛ جورجي كوبيلاروف؛ ينس ليمان ؛ ريتشارد سيغانياك؛ زاكاري آيفز (2007). DBpedia: نواة لشبكة بيانات مفتوحة . سلسلة محاضرات في علوم الحاسوب . الصفحات 722-735 . doi : 10.1007/978-3-540-76298-0_52 . ISBN 978-3-540-76297-3. Wikidata Q27910422 .
{{cite book}}تم|journal=تجاهله ( مساعدة ) - ↑ كريستوفر كلارك؛ سانتوش ديفالا (2016)، PDFFigures 2.0: استخراج الأشكال من الأوراق البحثية ، وقائع المؤتمر السادس عشر المشترك لجمعية ACM/IEEE-CS حول المكتبات الرقمية - JCDL '16 ، ويكي بيانات Q108172042
- ↑ أندريويد شيفر كوريا؛ بار-أولا زاندر (7 يونيو 2017)، إطلاق العنان للمحتوى الجدولي للبيانات المفتوحة: دراسة استقصائية حول طرق وأدوات استخراج الجداول من ملفات PDF ، رابطة آلات الحوسبة ، doi : 10.1145/3085228.3085278 ، ويكي بيانات Q108173686
- ↑ ميوشكي، نورمان؛ جاغدال، أبورفا؛ سبيندي، تيمو؛ ميتروفيتش، يلينا؛ جيب، بيلا (2023)، "معيار لأدوات استخراج المعلومات من ملفات PDF باستخدام إطار تقييم متعدد المهام ومتعدد المجالات للوثائق الأكاديمية" ، في: سيروانغا، إسحاق؛ غولدينغ، آن؛ مولايسون-ساندي، هيذر؛ دو، جيا تينا (محررون)، معلومات من أجل عالم أفضل: الوضع الطبيعي، والوضع الافتراضي، والوضع المادي، والشمولية ، المجلد 13972، تشام: سبرينغر نيتشر سويسرا، الصفحات 383-405 ، arXiv : 2303.09957 ، doi : 10.1007/978-3-031-28032-0_31 ، ISBN 978-3-031-28031-3
- ↑ "واجهة برمجة تطبيقات استخراج ملفات PDF من Adobe" . Adobe . تم الاسترجاع في 15 مارس 2024 .
- ↑ "تجربة خدمات الذكاء الاصطناعي السحابية مع Adobe Sensei" . Adobe . تم الاطلاع عليه بتاريخ 15 مارس 2024 .
- معالجة اللغة الطبيعية
