استخراج البيانات
| جزء من سلسلة عن |
| التعلم الآلي واستخراج البيانات |
|---|
تعد عملية استخراج واكتشاف الأنماط في مجموعات كبيرة من البيانات تنطوي على طرق عند تقاطع التعلم الآلي والإحصاء وأنظمة قواعد البيانات . [1] تعد عملية استخراج البيانات مجالًا فرعيًا متعدد التخصصات من علوم الكمبيوتر والإحصاء بهدف عام يتمثل في استخراج المعلومات (بطرق ذكية) من مجموعة بيانات وتحويل المعلومات إلى بنية مفهومة للاستخدام الإضافي. [1] [2] [3] [4] تعد عملية استخراج البيانات خطوة التحليل في عملية " اكتشاف المعرفة في قواعد البيانات " أو KDD. [5] وبصرف النظر عن خطوة التحليل الخام، فإنها تنطوي أيضًا على جوانب إدارة قواعد البيانات والبيانات ، ومعالجة البيانات المسبقة ، واعتبارات النموذج والاستدلال ، ومقاييس الاهتمام، واعتبارات التعقيد ، ومعالجة ما بعد الهياكل المكتشفة، والتصور ، والتحديث عبر الإنترنت . [1]
مصطلح "استخراج البيانات" هو تسمية خاطئة لأن الهدف هو استخراج الأنماط والمعرفة من كميات كبيرة من البيانات، وليس استخراج ( تعدين ) البيانات نفسها . [6] كما أنها كلمة طنانة [7] ويتم تطبيقها بشكل متكرر على أي شكل من أشكال معالجة البيانات أو المعلومات واسعة النطاق ( التجميع والاستخراج والتخزين والتحليل والإحصاءات) بالإضافة إلى أي تطبيق لنظام دعم القرار الحاسوبي ، بما في ذلك الذكاء الاصطناعي (على سبيل المثال، التعلم الآلي) وذكاء الأعمال . غالبًا ما تكون المصطلحات الأكثر عمومية ( تحليل البيانات على نطاق واسع ) والتحليلات - أو عند الإشارة إلى الأساليب الفعلية، الذكاء الاصطناعي والتعلم الآلي - أكثر ملاءمة.
تتمثل مهمة تعدين البيانات الفعلية في التحليل شبه التلقائي أو التلقائي لكميات كبيرة من البيانات لاستخراج أنماط مثيرة للاهتمام غير معروفة سابقًا مثل مجموعات سجلات البيانات ( تحليل المجموعة ) والسجلات غير العادية ( اكتشاف الشذوذ ) والتبعيات ( تعدين قواعد الارتباط وتعدين الأنماط المتسلسلة ) . يتضمن هذا عادةً استخدام تقنيات قاعدة البيانات مثل المؤشرات المكانية . يمكن بعد ذلك اعتبار هذه الأنماط بمثابة نوع من الملخص لبيانات الإدخال، ويمكن استخدامها في مزيد من التحليل أو، على سبيل المثال، في التعلم الآلي والتحليلات التنبؤية . على سبيل المثال، قد تحدد خطوة تعدين البيانات مجموعات متعددة في البيانات، والتي يمكن استخدامها بعد ذلك للحصول على نتائج تنبؤ أكثر دقة بواسطة نظام دعم القرار . لا يعد جمع البيانات أو إعداد البيانات أو تفسير النتائج وإعداد التقارير جزءًا من خطوة تعدين البيانات، على الرغم من أنها تنتمي إلى عملية KDD الشاملة كخطوات إضافية.
الفرق بين تحليل البيانات واستخراج البيانات هو أن تحليل البيانات يستخدم لاختبار النماذج والفرضيات على مجموعة البيانات، على سبيل المثال، تحليل فعالية حملة تسويقية ، بغض النظر عن كمية البيانات. في المقابل، يستخدم استخراج البيانات التعلم الآلي والنماذج الإحصائية للكشف عن الأنماط السرية أو المخفية في حجم كبير من البيانات. [8]
تشير المصطلحات ذات الصلة مثل استخراج البيانات وصيد البيانات والتنقيب عن البيانات إلى استخدام أساليب استخراج البيانات لأخذ عينات من أجزاء من مجموعة بيانات سكانية أكبر تكون (أو قد تكون) صغيرة جدًا بحيث لا يمكن إجراء استنتاجات إحصائية موثوقة حول صحة أي أنماط تم اكتشافها. ومع ذلك، يمكن استخدام هذه الأساليب في إنشاء فرضيات جديدة للاختبار ضد مجموعات البيانات الأكبر.
علم أصل الكلمة
في ستينيات القرن العشرين، استخدم الإحصائيون والاقتصاديون مصطلحات مثل صيد البيانات أو استخراج البيانات للإشارة إلى ما اعتبروه ممارسة سيئة لتحليل البيانات دون فرضية مسبقة . وقد استخدم الخبير الاقتصادي مايكل لوفيل مصطلح "استخراج البيانات" بطريقة نقدية مماثلة في مقال نُشر في مجلة Review of Economic Studies في عام 1983. [9] [10] يشير لوفيل إلى أن الممارسة "تتنكر تحت مجموعة متنوعة من الأسماء المستعارة، بدءًا من "التجريب" (إيجابي) إلى "الصيد" أو "التجسس" (سلبي).
ظهر مصطلح تعدين البيانات حوالي عام 1990 في مجتمع قواعد البيانات، مع دلالات إيجابية بشكل عام. لفترة قصيرة في الثمانينيات، تم استخدام عبارة "تعدين قاعدة البيانات" ™، ولكن نظرًا لأنها كانت علامة تجارية لشركة HNC، وهي شركة مقرها سان دييغو ، للترويج لمحطة عمل تعدين قاعدة البيانات الخاصة بهم؛ [11] تحول الباحثون نتيجة لذلك إلى تعدين البيانات . تشمل المصطلحات الأخرى المستخدمة علم الآثار للبيانات ، وحصاد المعلومات ، واكتشاف المعلومات ، واستخراج المعرفة ، وما إلى ذلك. صاغ جريجوري بياتيتسكي شابيرو مصطلح "اكتشاف المعرفة في قواعد البيانات" لأول ورشة عمل حول نفس الموضوع (KDD-1989) وأصبح هذا المصطلح أكثر شيوعًا في مجتمعات الذكاء الاصطناعي والتعلم الآلي . ومع ذلك، أصبح مصطلح تعدين البيانات أكثر شيوعًا في مجتمعات الأعمال والصحافة. [12] حاليًا، يتم استخدام مصطلحي تعدين البيانات واكتشاف المعرفة بالتبادل.
خلفية
لقد حدث الاستخراج اليدوي للأنماط من البيانات لعدة قرون. تشمل الطرق المبكرة لتحديد الأنماط في البيانات نظرية بايز (1700) وتحليل الانحدار (1800). [13] أدى انتشار تكنولوجيا الكمبيوتر ووجودها في كل مكان وقوتها المتزايدة إلى زيادة كبيرة في جمع البيانات وتخزينها ومعالجتها. مع نمو مجموعات البيانات في الحجم والتعقيد، تم تعزيز تحليل البيانات "المباشر" بشكل متزايد من خلال المعالجة الآلية غير المباشرة للبيانات، بمساعدة اكتشافات أخرى في علوم الكمبيوتر، وخاصة في مجال التعلم الآلي، مثل الشبكات العصبية ، وتحليل العناقيد ، والخوارزميات الوراثية (خمسينيات القرن العشرين)، وأشجار القرار وقواعد القرار (ستينيات القرن العشرين)، وآلات الدعم المتجه (تسعينيات القرن العشرين). تعد عملية استخراج البيانات هي عملية تطبيق هذه الأساليب بهدف الكشف عن الأنماط المخفية. [14] في مجموعات البيانات الكبيرة. إنه يسد الفجوة بين الإحصاءات التطبيقية والذكاء الاصطناعي (والتي عادة ما توفر الخلفية الرياضية) لإدارة قواعد البيانات من خلال استغلال الطريقة التي يتم بها تخزين البيانات وفهرستها في قواعد البيانات لتنفيذ خوارزميات التعلم والاكتشاف الفعلية بكفاءة أكبر، مما يسمح بتطبيق مثل هذه الأساليب على مجموعات بيانات أكبر من أي وقت مضى.
عملية
يتم تعريف عملية اكتشاف المعرفة في قواعد البيانات (KDD) عادةً بالمراحل التالية:
- اختيار
- المعالجة المسبقة
- تحويل
- استخراج البيانات
- التفسير/التقييم. [5]
ومع ذلك، فإن هذا الموضوع موجود في أشكال عديدة، مثل عملية المعايير الصناعية المشتركة لاستخراج البيانات (CRISP-DM) التي تحدد ست مراحل:
- فهم الأعمال
- فهم البيانات
- إعداد البيانات
- النمذجة
- تقييم
- النشر
أو عملية مبسطة مثل (1) المعالجة المسبقة، (2) استخراج البيانات، و(3) التحقق من صحة النتائج.
أظهرت استطلاعات الرأي التي أجريت في أعوام 2002 و2004 و2007 و2014 أن منهجية CRISP-DM هي المنهجية الرائدة التي يستخدمها عمال مناجم البيانات. [15] [16] [17] [18]
كان معيار تعدين البيانات الوحيد الآخر المذكور في هذه الاستطلاعات هو SEMMA . ومع ذلك، أفاد 3-4 أضعاف عدد الأشخاص باستخدام CRISP-DM. وقد نشرت العديد من فرق الباحثين مراجعات لنماذج عملية تعدين البيانات، [19] وأجرى أزيفيدو وسانتوس مقارنة بين CRISP-DM وSEMMA في عام 2008. [20]
المعالجة المسبقة
قبل أن تتمكن من استخدام خوارزميات تعدين البيانات، يجب تجميع مجموعة بيانات مستهدفة. ونظرًا لأن تعدين البيانات لا يمكنه إلا الكشف عن الأنماط الموجودة بالفعل في البيانات، فيجب أن تكون مجموعة البيانات المستهدفة كبيرة بما يكفي لاحتواء هذه الأنماط مع الحفاظ على إيجازها بما يكفي ليتم تعدينها في غضون حد زمني مقبول. المصدر الشائع للبيانات هو مستودع البيانات أو مستودع البيانات . تعد المعالجة المسبقة ضرورية لتحليل مجموعات البيانات المتعددة المتغيرات قبل تعدين البيانات. ثم يتم تنظيف مجموعة البيانات المستهدفة. يزيل تنظيف البيانات الملاحظات التي تحتوي على ضوضاء وتلك التي تحتوي على بيانات مفقودة .
استخراج البيانات
يتضمن استخراج البيانات ستة فئات شائعة من المهام: [5]
- اكتشاف الشذوذ (اكتشاف القيم المتطرفة/التغيير/الانحراف) - تحديد سجلات البيانات غير المعتادة، والتي قد تكون مثيرة للاهتمام أو أخطاء البيانات التي تتطلب مزيدًا من التحقيق بسبب كونها خارج النطاق القياسي.
- تعلم قواعد الارتباط (نمذجة التبعية) – البحث عن العلاقات بين المتغيرات. على سبيل المثال، قد يجمع أحد المتاجر الكبرى بيانات حول عادات الشراء لدى العملاء. وباستخدام تعلم قواعد الارتباط، يمكن للمتاجر الكبرى تحديد المنتجات التي يتم شراؤها معًا بشكل متكرر واستخدام هذه المعلومات لأغراض التسويق. ويشار إلى هذا أحيانًا باسم تحليل سلة التسوق.
- التجميع – هو مهمة اكتشاف المجموعات والهياكل في البيانات التي تكون "متشابهة" بطريقة أو بأخرى، دون استخدام الهياكل المعروفة في البيانات.
- التصنيف – هو مهمة تعميم البنية المعروفة لتطبيقها على البيانات الجديدة. على سبيل المثال، قد يحاول برنامج البريد الإلكتروني تصنيف رسالة بريد إلكتروني على أنها "مشروعة" أو "بريد عشوائي".
- الانحدار – يحاول العثور على دالة تقوم بنمذجة البيانات بأقل خطأ، أي لتقدير العلاقات بين البيانات أو مجموعات البيانات.
- التلخيص - توفير تمثيل أكثر إحكاما لمجموعة البيانات، بما في ذلك التصور وإنشاء التقارير.
التحقق من صحة النتائج

يمكن إساءة استخدام استخراج البيانات عن غير قصد، مما ينتج عنه نتائج تبدو مهمة ولكنها لا تتنبأ فعليًا بالسلوك المستقبلي ولا يمكن إعادة إنتاجها على عينة جديدة من البيانات، وبالتالي لا تحمل فائدة تذكر. يحدث هذا أحيانًا بسبب التحقيق في العديد من الفرضيات وعدم إجراء اختبار فرضي إحصائي مناسب. تُعرف النسخة البسيطة من هذه المشكلة في التعلم الآلي باسم الإفراط في التجهيز ، ولكن يمكن أن تنشأ نفس المشكلة في مراحل مختلفة من العملية وبالتالي فإن تقسيم التدريب/الاختبار - عندما يكون قابلاً للتطبيق على الإطلاق - قد لا يكون كافيًا لمنع حدوث ذلك. [21]
الخطوة الأخيرة في اكتشاف المعرفة من البيانات هي التحقق من أن الأنماط التي تنتجها خوارزميات التعدين في البيانات تحدث في مجموعة البيانات الأوسع. ليست كل الأنماط التي تجدها الخوارزميات صالحة بالضرورة. من الشائع أن تجد خوارزميات التعدين في البيانات أنماطًا في مجموعة التدريب غير موجودة في مجموعة البيانات العامة. يُطلق على هذا الإفراط في التجهيز . للتغلب على هذا، يستخدم التقييم مجموعة اختبار من البيانات التي لم يتم تدريب خوارزمية التعدين عليها. يتم تطبيق الأنماط المكتسبة على مجموعة الاختبار هذه، ويتم مقارنة الناتج الناتج بالإخراج المطلوب. على سبيل المثال، سيتم تدريب خوارزمية التعدين في البيانات التي تحاول التمييز بين "البريد العشوائي" ورسائل البريد الإلكتروني "المشروعة" على مجموعة تدريب من رسائل البريد الإلكتروني النموذجية. بمجرد التدريب، سيتم تطبيق الأنماط المكتسبة على مجموعة اختبار رسائل البريد الإلكتروني التي لم يتم تدريبها عليها. يمكن بعد ذلك قياس دقة الأنماط من عدد رسائل البريد الإلكتروني التي تصنفها بشكل صحيح. يمكن استخدام العديد من الأساليب الإحصائية لتقييم الخوارزمية، مثل منحنيات ROC .
إذا لم تلب الأنماط المكتسبة المعايير المطلوبة، فمن الضروري إعادة تقييم وتغيير خطوات المعالجة المسبقة واستخراج البيانات. إذا كانت الأنماط المكتسبة تلبي المعايير المطلوبة، فإن الخطوة الأخيرة هي تفسير الأنماط المكتسبة وتحويلها إلى معرفة.
بحث
الهيئة المهنية الرائدة في هذا المجال هي مجموعة المصالح الخاصة (SIG) التابعة لجمعية آلات الحوسبة (ACM) المعنية باكتشاف المعرفة واستخراج البيانات ( SIGKDD ). [22] [23] منذ عام 1989، استضافت مجموعة المصالح الخاصة هذه التابعة لجمعية آلات الحوسبة مؤتمرًا دوليًا سنويًا ونشرت وقائعه، [24] ومنذ عام 1999 نشرت مجلة أكاديمية نصف سنوية بعنوان "استكشافات SIGKDD". [25]
تتضمن مؤتمرات علوم الكمبيوتر حول استخراج البيانات ما يلي:
- مؤتمر CIKM – مؤتمر ACM حول إدارة المعلومات والمعرفة
- المؤتمر الأوروبي حول التعلم الآلي ومبادئ وممارسات اكتشاف المعرفة في قواعد البيانات
- مؤتمر KDD – مؤتمر ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات
كما أن موضوعات استخراج البيانات موجودة أيضًا في العديد من مؤتمرات إدارة البيانات/قواعد البيانات مثل مؤتمر ICDE ومؤتمر SIGMOD والمؤتمر الدولي لقواعد البيانات الضخمة جدًا .
المعايير
كانت هناك بعض الجهود لتحديد معايير لعملية تعدين البيانات، على سبيل المثال، عملية المعايير الصناعية الأوروبية المتقاطعة لتعدين البيانات لعام 1999 (CRISP-DM 1.0) ومعيار تعدين البيانات Java لعام 2004 (JDM 1.0). كان تطوير خليفة هذه العمليات (CRISP-DM 2.0 وJDM 2.0) نشطًا في عام 2006 ولكنه توقف منذ ذلك الحين. تم سحب JDM 2.0 دون الوصول إلى مسودة نهائية.
بالنسبة لتبادل النماذج المستخرجة - وخاصة للاستخدام في التحليلات التنبؤية - فإن المعيار الرئيسي هو لغة ترميز النموذج التنبؤي (PMML)، وهي لغة تعتمد على XML طورتها مجموعة تعدين البيانات (DMG) ويدعمها تنسيق التبادل من قبل العديد من تطبيقات تعدين البيانات. وكما يوحي الاسم، فإنها تغطي نماذج التنبؤ فقط، وهي مهمة تعدين بيانات معينة ذات أهمية كبيرة لتطبيقات الأعمال. ومع ذلك، فقد تم اقتراح امتدادات لتغطية (على سبيل المثال) التجميع الفرعي بشكل مستقل عن DMG. [26]
الاستخدامات البارزة
تُستخدم عملية استخراج البيانات أينما تتوفر البيانات الرقمية. ويمكن العثور على أمثلة بارزة لاستخراج البيانات في مجالات الأعمال والطب والعلوم والتمويل والبناء والمراقبة.
مخاوف الخصوصية والأخلاقيات
في حين أن مصطلح "استخراج البيانات" في حد ذاته قد لا يكون له أي آثار أخلاقية، إلا أنه غالبًا ما يرتبط باستخراج المعلومات فيما يتعلق بسلوك المستخدم (الأخلاقي وغير ذلك). [27]
يمكن أن تثير الطرق التي يمكن بها استخدام التعدين في البيانات في بعض الحالات والسياقات تساؤلات حول الخصوصية والشرعية والأخلاق . [28] وعلى وجه الخصوص، أثار التعدين في مجموعات البيانات الحكومية أو التجارية لأغراض الأمن القومي أو إنفاذ القانون ، كما هو الحال في برنامج الوعي بالمعلومات الشاملة أو في ADVISE ، مخاوف تتعلق بالخصوصية. [29] [30]
يتطلب استخراج البيانات إعداد البيانات التي تكشف عن معلومات أو أنماط تعرض التزامات السرية والخصوصية للخطر . الطريقة الشائعة لحدوث ذلك هي من خلال تجميع البيانات . يتضمن تجميع البيانات الجمع بين البيانات معًا (ربما من مصادر مختلفة) بطريقة تسهل التحليل (ولكن قد تجعل أيضًا تحديد البيانات الخاصة على مستوى الفرد قابلاً للاستنتاج أو واضحًا بطريقة أخرى). [31] هذا ليس استخراج بيانات في حد ذاته ، ولكنه نتيجة لإعداد البيانات قبل التحليل ولأغراضه. يدخل التهديد لخصوصية الفرد حيز التنفيذ عندما تتسبب البيانات، بمجرد تجميعها، في تمكين منجم البيانات، أو أي شخص لديه حق الوصول إلى مجموعة البيانات المجمعة حديثًا، من تحديد أفراد معينين، خاصةً عندما كانت البيانات مجهولة في الأصل. [32]
من المستحسن [ وفقًا لمن؟ ] أن نكون على دراية بما يلي قبل جمع البيانات: [31]
- غرض جمع البيانات وأي مشاريع استخراج بيانات (معروفة).
- كيف سيتم استخدام البيانات؟
- من سيكون قادرًا على استخراج البيانات واستخدام البيانات ومشتقاتها؟
- حالة الأمان المحيطة بالوصول إلى البيانات.
- كيف يمكن تحديث البيانات المجمعة؟
قد يتم تعديل البيانات أيضًا بحيث تصبح مجهولة الهوية، بحيث لا يمكن التعرف على الأفراد بسهولة. [31] ومع ذلك، حتى مجموعات البيانات " المجهولة المصدر " يمكن أن تحتوي على معلومات كافية للسماح بتحديد هوية الأفراد، كما حدث عندما تمكن الصحفيون من العثور على العديد من الأفراد بناءً على مجموعة من سجلات البحث التي تم إصدارها عن غير قصد بواسطة AOL. [33]
إن الكشف غير المقصود عن معلومات التعريف الشخصية التي تؤدي إلى مقدم الخدمة ينتهك ممارسات المعلومات العادلة. يمكن أن يتسبب هذا الإهمال في ضرر مالي أو عاطفي أو جسدي للفرد المشار إليه. في إحدى حالات انتهاك الخصوصية ، رفع رعاة Walgreens دعوى قضائية ضد الشركة في عام 2011 لبيع معلومات الوصفات الطبية لشركات استخراج البيانات التي قدمت بدورها البيانات لشركات الأدوية. [34]
الوضع في أوروبا
تتمتع أوروبا بقوانين خصوصية قوية إلى حد ما، وهناك جهود جارية لتعزيز حقوق المستهلكين بشكل أكبر. ومع ذلك، فإن مبادئ الملاذ الآمن بين الولايات المتحدة والاتحاد الأوروبي ، التي تم تطويرها بين عامي 1998 و2000، تعرض المستخدمين الأوروبيين حاليًا لاستغلال الخصوصية من قبل الشركات الأمريكية. ونتيجة للكشف العالمي عن المراقبة من قبل إدوارد سنودن ، كان هناك نقاش متزايد لإلغاء هذه الاتفاقية، حيث سيتم الكشف عن البيانات بشكل كامل لوكالة الأمن القومي ، وفشلت محاولات التوصل إلى اتفاق مع الولايات المتحدة. [35]
في المملكة المتحدة على وجه الخصوص، كانت هناك حالات لشركات تستخدم استخراج البيانات كوسيلة لاستهداف مجموعات معينة من العملاء وإجبارهم على دفع أسعار مرتفعة بشكل غير عادل. تميل هذه المجموعات إلى أن تكون من الأشخاص ذوي الوضع الاجتماعي والاقتصادي الأدنى الذين لا يدركون الطرق التي يمكن استغلالهم بها في الأسواق الرقمية. [36]
الوضع في الولايات المتحدة
في الولايات المتحدة، عالج الكونجرس الأمريكي مخاوف الخصوصية من خلال إقرار ضوابط تنظيمية مثل قانون نقل التأمين الصحي والمساءلة (HIPAA). يتطلب قانون نقل التأمين الصحي والمساءلة من الأفراد إعطاء "موافقتهم المستنيرة" فيما يتعلق بالمعلومات التي يقدمونها واستخداماتها الحالية والمستقبلية المقصودة. وفقًا لمقال في مجلة Biotech Business Week ، "في الممارسة العملية، قد لا يوفر قانون نقل التأمين الصحي والمساءلة أي حماية أكبر من اللوائح طويلة الأمد في مجال البحث"، كما تقول AAHC. والأهم من ذلك، أن هدف القاعدة المتمثل في الحماية من خلال الموافقة المستنيرة هو الاقتراب من مستوى عدم الفهم للأفراد العاديين." [37] وهذا يؤكد على ضرورة إخفاء هوية البيانات في ممارسات تجميع البيانات واستخراجها.
لا تنطبق تشريعات خصوصية المعلومات في الولايات المتحدة مثل قانون HIPAA وقانون حقوق التعليم والخصوصية الأسرية (FERPA) إلا على المجالات المحددة التي يتناولها كل قانون من هذه القوانين. ولا يخضع استخدام استخراج البيانات من قبل غالبية الشركات في الولايات المتحدة لأي تشريع.
قانون حقوق الطبع والنشر
الوضع في أوروبا
بموجب قوانين قواعد بيانات حقوق الطبع والنشر الأوروبية ، فإن تعدين الأعمال المحمية بحقوق الطبع والنشر (مثل تعدين الويب ) دون إذن من مالك حقوق الطبع والنشر ليس قانونيًا. عندما تكون قاعدة البيانات عبارة عن بيانات خالصة في أوروبا، فقد لا يكون هناك حقوق طبع ونشر - ولكن قد توجد حقوق قاعدة البيانات، وبالتالي يصبح تعدين البيانات خاضعًا لحقوق أصحاب الملكية الفكرية المحمية بموجب توجيه قاعدة البيانات . بناءً على توصية مراجعة هارجريفز، أدى هذا إلى قيام حكومة المملكة المتحدة بتعديل قانون حقوق الطبع والنشر الخاص بها في عام 2014 للسماح بتعدين المحتوى كقيد واستثناء . [38] كانت المملكة المتحدة ثاني دولة في العالم تفعل ذلك بعد اليابان، التي أدخلت استثناءً في عام 2009 لتعدين البيانات. ومع ذلك، نظرًا لتقييد توجيه مجتمع المعلومات (2001)، فإن استثناء المملكة المتحدة يسمح فقط بتعدين المحتوى لأغراض غير تجارية. كما لا يسمح قانون حقوق الطبع والنشر في المملكة المتحدة بتجاوز هذا الحكم من خلال الشروط والأحكام التعاقدية. منذ عام 2020 أيضًا، كانت سويسرا تنظم تعدين البيانات من خلال السماح به في مجال البحث في ظل ظروف معينة منصوص عليها في المادة. المادة 24د من قانون حقوق الطبع والنشر السويسري. دخلت هذه المادة الجديدة حيز التنفيذ في 1 أبريل 2020. [39]
وقد قامت المفوضية الأوروبية بتيسير مناقشة أصحاب المصلحة بشأن استخراج النصوص والبيانات في عام 2013، تحت عنوان "التراخيص لأوروبا". [40] وقد أدى التركيز على حل هذه القضية القانونية، مثل الترخيص بدلاً من القيود والاستثناءات، إلى انسحاب ممثلي الجامعات والباحثين والمكتبات ومجموعات المجتمع المدني وناشري الوصول المفتوح من حوار أصحاب المصلحة في مايو 2013. [41]
الوضع في الولايات المتحدة
إن قانون حقوق الطبع والنشر الأمريكي ، وخاصة أحكامه المتعلقة بالاستخدام العادل ، يؤيد شرعية استخراج المحتوى في أمريكا، وغيرها من بلدان الاستخدام العادل مثل إسرائيل وتايوان وكوريا الجنوبية. ونظرًا لأن استخراج المحتوى تحويلي، أي أنه لا يحل محل العمل الأصلي، فإنه يُنظر إليه على أنه قانوني بموجب الاستخدام العادل. على سبيل المثال، كجزء من تسوية كتب جوجل ، حكم القاضي الذي ترأس القضية بأن مشروع رقمنة جوجل للكتب المحمية بحقوق الطبع والنشر كان قانونيًا، ويرجع ذلك جزئيًا إلى الاستخدامات التحويلية التي أظهرها مشروع الرقمنة - أحدها استخراج النصوص والبيانات. [42]
برمجة
برمجيات وتطبيقات التعدين على البيانات مفتوحة المصدر ومجانية
التطبيقات التالية متاحة بموجب تراخيص مجانية/مفتوحة المصدر. كما يتوفر الوصول العام إلى كود مصدر التطبيق.
- Carrot2 : إطار عمل لتجميع النصوص ونتائج البحث.
- Chemicalize.org : أداة لاستخراج البنية الكيميائية ومحرك بحث على الويب.
- ELKI : مشروع بحث جامعي يتضمن تحليلًا متقدمًا للعناقيد وطرق اكتشاف القيم المتطرفة مكتوبًا بلغة Java .
- GATE : أداة لمعالجة اللغة الطبيعية وهندسة اللغة.
- KNIME : Konstanz Information Miner، إطار عمل تحليلي شامل وسهل الاستخدام للبيانات.
- التحليل الضخم عبر الإنترنت (MOA) : استخراج تدفقات البيانات الضخمة في الوقت الفعلي باستخدام أداة انجراف المفاهيم في لغة البرمجة Java .
- MEPX : أداة متعددة الأنظمة لمشاكل الانحدار والتصنيف استنادًا إلى متغير البرمجة الجينية.
- mlpack : مجموعة من خوارزميات التعلم الآلي الجاهزة للاستخدام والمكتوبة بلغة C++ .
- NLTK ( مجموعة أدوات اللغة الطبيعية ): مجموعة من المكتبات والبرامج لمعالجة اللغة الطبيعية الرمزية والإحصائية (NLP) للغة بايثون .
- OpenNN : مكتبة الشبكات العصبية المفتوحة.
- البرتقالي : مجموعة برامج لتعدين البيانات والتعلم الآلي تعتمد على المكونات ومكتوبة بلغة بايثون .
- PSPP : برنامج لاستخراج البيانات والإحصاء ضمن مشروع GNU مشابه لبرنامج SPSS
- R : لغة برمجة وبيئة برمجية للحوسبة الإحصائية واستخراج البيانات والرسومات. وهي جزء من مشروع GNU .
- scikit-learn : مكتبة تعلُّم آلي مفتوحة المصدر للغة البرمجة Python؛
- Torch : مكتبة تعليم عميق مفتوحة المصدر للغة البرمجة Lua وإطار الحوسبة العلمية مع دعم واسع لخوارزميات التعلم الآلي .
- UIMA : UIMA (هندسة إدارة المعلومات غير المنظمة) هو إطار عمل مكون لتحليل المحتوى غير المنظم مثل النص والصوت والفيديو - تم تطويره في الأصل بواسطة IBM.
- Weka : مجموعة من تطبيقات برمجيات التعلم الآلي المكتوبة بلغة البرمجة Java .
برمجيات وتطبيقات استخراج البيانات الملكية
التطبيقات التالية متاحة بموجب تراخيص خاصة.
- Angoss KnowledgeSTUDIO: أداة استخراج البيانات
- LIONsolver : تطبيق برمجي متكامل لاستخراج البيانات وذكاء الأعمال والنمذجة والذي ينفذ نهج التعلم والتحسين الذكي (LION).
- PolyAnalyst : برنامج لاستخراج البيانات والنصوص من شركة Megaputer Intelligence.
- خدمات تحليل Microsoft : برنامج استخراج البيانات الذي توفره Microsoft .
- NetOwl : مجموعة من منتجات تحليل النصوص والكيانات متعددة اللغات التي تمكن استخراج البيانات.
- Oracle Data Mining : برنامج لتعدين البيانات من شركة Oracle Corporation .
- PSeven : منصة لأتمتة المحاكاة والتحليل الهندسي والتحسين متعدد التخصصات واستخراج البيانات المقدمة من DATADVANCE .
- Qlucore Omics Explorer: برنامج لتعدين البيانات.
- RapidMiner : بيئة لتجارب التعلم الآلي وتعدين البيانات.
- SAS Enterprise Miner : برنامج استخراج البيانات الذي تقدمه مؤسسة SAS .
- SPSS Modeler : برنامج لاستخراج البيانات تقدمه شركة IBM .
- STATISTICA Data Miner: برنامج لاستخراج البيانات مقدم من StatSoft .
- Tanagra : برنامج لاستخراج البيانات موجه نحو التصور، ويستخدم أيضًا للتدريس.
- Vertica : برنامج استخراج البيانات المقدم من Hewlett-Packard .
- منصة Google Cloud : نماذج ML مخصصة آلية تديرها Google .
- Amazon SageMaker : خدمة مُدارة تقدمها Amazon لإنشاء وإنتاج نماذج ML مخصصة.
انظر أيضا
- طُرق
- تعدين الوكيل
- اكتشاف الشذوذ/القيمة الشاذة/التغيير
- تعلم قواعد الارتباط
- الشبكات البايزية
- تصنيف
- تحليل المجموعات
- أشجار القرار
- التعلم الجماعي
- تحليل العوامل
- الخوارزميات الجينية
- التعدين النية
- نظام تصنيف التعلم
- التعلم في الفضاء الفرعي متعدد الخطوط
- الشبكات العصبية
- تحليل الانحدار
- التعدين التسلسلي
- تحليل البيانات المنظمة
- آلات دعم المتجهات
- استخراج النصوص
- تحليل السلاسل الزمنية
- مجالات التطبيق
- أمثلة للتطبيق
- مواضيع ذات صلة
لمزيد من المعلومات حول استخراج المعلومات من البيانات (على عكس تحليل البيانات)، راجع:
- مصادر أخرى
مراجع
- ^ abc "منهج استخراج البيانات". ACM SIGKDD . 2006-04-30. مؤرشف من الأصل في 2013-10-14 . تم استرجاعه في 2014-01-27 .
- ^ كليفتون، كريستوفر (2010). "Encyclopædia Britannica: Definition of Data Mining". مؤرشف من الأصل في 2011-02-05 . تم الاسترجاع في 2010-12-09 .
- ^ هاستي، تريفور ؛ تيبشيراني، روبرت ؛ فريدمان، جيروم (2009). "عناصر التعلم الإحصائي: استخراج البيانات والاستدلال والتنبؤ". مؤرشف من الأصل في 10 نوفمبر 2009. تم الاسترجاع في 07 أغسطس 2012 .
- ^ هان، جايوي ؛ كامبر، ميشلين؛ بي، جيان (2011). استخراج البيانات: المفاهيم والتقنيات (الطبعة الثالثة). مورجان كوفمان. رقم ISBN 978-0-12-381479-1.
- ^ abc Fayyad, Usama ; Piatetsky-Shapiro, Gregory ; Smyth, Padhraic (1996). "From Data Mining to Knowledge Discovery in Databases" (PDF) . مؤرشف من الأصل (PDF) في 2022-10-09 . تم الاسترجاع في 17 ديسمبر 2008 .
- ^ هان، جياوي ؛ كامبر، ميشلين (2001). استخراج البيانات: المفاهيم والتقنيات . مورجان كوفمان . ص. 5. رقم ISBN 978-1-55860-489-6وبالتالي ،
كان من الأفضل أن يُطلق على استخراج البيانات اسم "استخراج المعرفة من البيانات"، وهو اسم طويل نوعًا ما للأسف.
- ^ مؤتمر الخريف 2005 لبرنامج OKAIRP، جامعة ولاية أريزونا محفوظ في 2014-02-01 على موقع Wayback Machine
- ^ أولسون، دي إل (2007). استخراج البيانات في خدمات الأعمال. أعمال الخدمة ، 1 (3)، 181-193. doi :10.1007/s11628-006-0014-7
- ^ لوفيل، مايكل سي. (1983). "استخراج البيانات". مراجعة الاقتصاد والإحصاء . 65 (1): 1-12. doi :10.2307/1924403. JSTOR 1924403.
- ^ Charemza, Wojciech W.; Deadman, Derek F. (1992). "Data Mining". New Directions in Economic Standard Practice . Aldershot: Edward Elgar. pp. 14–31. ISBN 1-85278-461-X.
- ^ مينا، جيسوس (2011). التحليل الجنائي للتعلم الآلي لتطبيق القانون والأمن والاستخبارات . بوكا راتون، فلوريدا: مطبعة سي آر سي (مجموعة تايلور وفرانسيس). رقم ISBN 978-1-4398-6069-4.
- ^ Piatetsky-Shapiro, Gregory ; Parker, Gary (2011). "Lesson: Data Mining, and Knowledge Discovery: An Introduction". Introduction to Data Mining . KD Nuggets. مؤرشف من الأصل في 30 أغسطس 2012 . تم الاسترجاع في 30 أغسطس 2012 .
- ^ كوينين، فرانس (2011-02-07). "تعدين البيانات: الماضي والحاضر والمستقبل". مراجعة هندسة المعرفة . 26 (1): 25-29. doi :10.1017/S0269888910000378. ISSN 0269-8889. S2CID 6487637. مؤرشف من الأصل في 2023-07-02 . تم الاسترجاع 2021-09-04 .
- ^ كانتاردزيك، محمد (2003). استخراج البيانات: المفاهيم والنماذج والأساليب والخوارزميات . جون وايلي وأولاده. رقم ISBN 978-0-471-22852-3. OCLC 50055336.
- ^ "ما هي المنهجية الرئيسية التي تستخدمها في استخراج البيانات (2002)؟". KDnuggets . 2002. مؤرشف من الأصل في 16 يناير 2017. تم الاسترجاع 29 ديسمبر 2023 .
- ^ "ما هي المنهجية الرئيسية التي تستخدمها لتعدين البيانات (2004)؟". KDnuggets . 2004. مؤرشف من الأصل في 8 فبراير 2017. تم الاسترجاع 29 ديسمبر 2023 .
- ^ "ما هي المنهجية الرئيسية التي تستخدمها في استخراج البيانات (2007)؟". KDnuggets . 2007. مؤرشف من الأصل في 17 نوفمبر 2012 . تم الاسترجاع 29 ديسمبر 2023 .
- ^ "ما هي المنهجية الرئيسية التي تستخدمها لتعدين البيانات (2014)؟". KDnuggets . 2014. مؤرشف من الأصل في 1 أغسطس 2016 . تم الاسترجاع 29 ديسمبر 2023 .
- ^ لوكاس كورغان وبيتر موسيليك: "دراسة استقصائية لنماذج عملية اكتشاف المعرفة وتعدين البيانات" محفوظ في 2013-05-26 على موقع واي باك مشين . مراجعة هندسة المعرفة . المجلد 21 العدد 1، مارس 2006، ص 1-24، مطبعة جامعة كامبريدج، نيويورك، doi :10.1017/S0269888906000737
- ^ Azevedo, A. and Santos, MF KDD, SEMMA and CRISP-DM: a parallel Overview Archived 2013-01-09 at the Wayback Machine . في وقائع المؤتمر الأوروبي لتعدين البيانات 2008 التابع لـ IADIS، ص 182-185.
- ^ هوكينز، دوغلاس م (2004). "مشكلة الإفراط في التجهيز". مجلة المعلومات الكيميائية وعلوم الكمبيوتر . 44 (1): 1-12. doi :10.1021/ci0342472. PMID 14741005. S2CID 12440383.
- ^ "Microsoft Academic Search: Top conferences in data mining". Microsoft Academic Search . مؤرشف من الأصل في 2014-11-19 . تم الاسترجاع في 2014-06-13 .
- ^ "Google Scholar: أفضل المنشورات - استخراج البيانات وتحليلها". Google Scholar . مؤرشف من الأصل في 2023-02-10 . تم الاسترجاع 2022-06-11 .
- ^ وقائع الأرشيف 2010-04-30 على موقع واي باك مشين ، المؤتمرات الدولية حول اكتشاف المعرفة واستخراج البيانات، جمعية آلات الحوسبة، نيويورك.
- ^ تم أرشفة استكشافات SIGKDD في 2010-07-29 على موقع Wayback Machine ، ACM، نيويورك.
- ^ Günnemann, Stephan; Kremer, Hardy; Seidl, Thomas (2011). "An extension of the PMML standard to subspace clustering models". Proceedings of the 2011 workshop on Predictive markup language modeling . p. 48. doi :10.1145/2023598.2023605. ISBN 978-1-4503-0837-3. S2CID 14967969.
- ^ سيلتزر، ويليام (2005). "الوعود والمزالق المترتبة على استخراج البيانات: القضايا الأخلاقية" (PDF) . قسم الإحصاءات الحكومية في الجمعية الإحصائية الأمريكية. مؤرشف من الأصل (PDF) في 2022-10-09.
- ^ بيتس، شيب (15 مارس 2007). "نهاية التجسس المحلي غير القانوني؟ لا تعتمدوا عليه". واشنطن سبكتاتور . مؤرشف من الأصل في 28 نوفمبر 2007.
- ^ تايبالي، كيم أ. (15 ديسمبر 2003). "تعدين البيانات والأمن المحلي: ربط النقاط لفهم البيانات". مجلة كولومبيا للقانون العلمي والتكنولوجي . 5 (2). OCLC 45263753. SSRN 546782. مؤرشف من الأصل في 5 نوفمبر 2014. تم الاسترجاع في 21 أبريل 2004 .
- ^ Resig, John. "A Framework for Mining Instant Messaging Services" (PDF) . مؤرشف من الأصل (PDF) في 2022-10-09 . تم الاسترجاع في 16 مارس 2018 .
- ^ abc Think Before You Dig: Privacy Implications of Data Mining & Aggregation Archived 2008-12-17 at the Wayback Machine , NASCIO Research Brief, September 2004
- ^ أوم، بول. "لا تبن قاعدة بيانات من الخراب". هارفارد بيزنس ريفيو .
- ^ بيانات البحث في AOL حددت الأفراد المؤرشف في 2010-01-06 على موقع Wayback Machine ، SecurityFocus، أغسطس 2006
- ^ Kshetri, Nir (2014). "Big data's impact on privacy, security and consumer wellbeing" (PDF) . Telecommunications Policy . 38 (11): 1134–1145. doi :10.1016/j.telpol.2014.10.002. مؤرشف من الأصل (PDF) في 2018-06-19 . تم الاسترجاع في 2018-04-20 .
- ^ Weiss, Martin A.; Archick, Kristin (19 May 2016). "US–EU Data Privacy: From Safe Harbor to Privacy Shield". Washington, DC Congressional Research Service. p. 6. R44257. مؤرشف من الأصل (PDF) في 9 أبريل 2020. تم الاسترجاع في 9 أبريل 2020.
في 6 أكتوبر 2015، أصدرت
محكمة العدل التابعة للاتحاد الأوروبي
... قرارًا يبطل الملاذ الآمن (ساري المفعول على الفور)، كما هو مطبق حاليًا.
- ^ باركر، جورج (2018-09-30). "شركات المملكة المتحدة المستهدفة لاستخدامها البيانات الضخمة لاستغلال العملاء". فاينانشال تايمز . مؤرشف من الأصل في 2022-12-10 . تم الاسترجاع 2022-12-04 .
- ^ محررو مجلة Biotech Business Week (30 يونيو 2008)؛ الطب الحيوي؛ قاعدة الخصوصية HIPAA تعيق البحث الطبي الحيوي ، مجلة Biotech Business Week، تم استرجاعها في 17 نوفمبر 2009 من LexisNexis Academic
- ^ منح باحثين في المملكة المتحدة حق استخراج البيانات بموجب قوانين حقوق الطبع والنشر الجديدة في المملكة المتحدة. أرشيف 9 يونيو 2014، على موقع Wayback Machine Out-Law.com. تم الاسترجاع في 14 نوفمبر 2014
- ^ "Fedlex". مؤرشف من الأصل في 2021-12-16 . تم الاسترجاع 2021-12-16 .
- ^ "التراخيص لأوروبا – حوار منظم بين أصحاب المصلحة 2013". المفوضية الأوروبية . مؤرشف من الأصل في 23 مارس 2013. تم استرجاعه في 14 نوفمبر 2014 .
- ^ "استخراج النصوص والبيانات: أهميتها والحاجة إلى التغيير في أوروبا". رابطة المكتبات البحثية الأوروبية . مؤرشف من الأصل في 29 نوفمبر 2014. استرجاع 14 نوفمبر 2014 .
- ^ "القاضي يمنح حكمًا موجزًا لصالح Google Books – انتصار الاستخدام العادل". Lexology.com . Antonelli Law Ltd. 19 نوفمبر 2013. مؤرشف من الأصل في 29 نوفمبر 2014 . تم الاسترجاع في 14 نوفمبر 2014 .
قراءة إضافية
- كابينا، بيتر؛ هادجنيان، بابلو؛ ستادلر، رولف. فيرهيس، ياب؛ زاناسي، أليساندرو (1997)؛ اكتشاف التنقيب في البيانات: من المفهوم إلى التنفيذ ، برنتيس هول ، ISBN 0-13-743980-6
- MS Chen, J. Han, PS Yu (1996) "تعدين البيانات: نظرة عامة من منظور قاعدة البيانات" محفوظ في 2016-03-03 على موقع Wayback Machine . هندسة المعرفة والبيانات، معاملات معهد مهندسي الكهرباء والإلكترونيات، 8 (6)، 866-883
- فيلدمان، رونين؛ سانجر، جيمس (2007)؛ دليل استخراج النصوص ، مطبعة جامعة كامبريدج ، رقم ISBN 978-0-521-83657-9
- جو، ييكي؛ وجروسمان، روبرت (المحررون) (1999)؛ التعدين عالي الأداء للبيانات: خوارزميات التوسع والتطبيقات والأنظمة ، دار النشر الأكاديمي كلوير
- هان، جياوي ، ميشلين كامبر، وجيان باي. استخراج البيانات: المفاهيم والتقنيات . مورغان كوفمان، 2006.
- هاستي، تريفور ، تيبشيراني، روبرت وفريدمان ، جيروم (2001)؛ عناصر التعلم الإحصائي: استخراج البيانات والاستدلال والتنبؤ ، سبرينغر، ISBN 0-387-95284-5
- ليو، بينج (2007، 2011)؛ استخراج بيانات الويب: استكشاف الارتباطات التشعبية والمحتويات وبيانات الاستخدام ، سبرينغر ، ISBN 3-540-37881-2
- ميرفي، كريس (16 مايو/أيار 2011). "هل يعتبر استخراج البيانات حرية تعبير؟". مجلة إنفورميشن ويك : 12.
- نيسبيت، روبرت؛ إلدر، جون؛ ماينر، جاري (2009)؛ دليل التحليل الإحصائي وتطبيقات استخراج البيانات ، أكاديميك بريس /إلسيفير، ISBN 978-0-12-374765-5
- بونسيليه، باسكال؛ ماسيجليا، فلورينت؛ وتيسيير، ماجولون (المحررون) (أكتوبر 2007)؛ "أنماط التعدين في البيانات: أساليب وتطبيقات جديدة"، مرجع علوم المعلومات ، ISBN 978-1-59904-162-9
- تان، بانج نينج؛ شتاينباخ، مايكل؛ وكومار، فيبين (2005)؛ مقدمة في استخراج البيانات ، ISBN 0-321-32136-7
- ثيودوريديس، سيرجيوس؛ وكوترومباس، كونستانتينوس (2009)؛ التعرف على الأنماط ، الطبعة الرابعة، أكاديميك بريس، رقم ISBN 978-1-59749-272-0
- وايس، شولوم م.؛ وإندورخيا، نيتين (1998)؛ التعدين التنبؤي للبيانات ، مورجان كوفمان
- Witten, Ian H .; Frank, Eibe; Hall, Mark A. (30 January 2011). Data Mining: Practical Machine Learning Tools and Techniques (3 ed.). Elsevier. ISBN 978-0-12-374856-0.(انظر أيضًا برنامج Weka المجاني )
- Ye, Nong (2003)؛ دليل استخراج البيانات ، ماهواه، نيوجيرسي: لورانس إيرلباوم
