استخراج البيانات

تعد عملية استخراج واكتشاف الأنماط في مجموعات كبيرة من البيانات تنطوي على طرق عند تقاطع التعلم الآلي والإحصاء وأنظمة قواعد البيانات . [1] تعد عملية استخراج البيانات مجالًا فرعيًا متعدد التخصصات من علوم الكمبيوتر والإحصاء بهدف عام يتمثل في استخراج المعلومات (بطرق ذكية) من مجموعة بيانات وتحويل المعلومات إلى بنية مفهومة للاستخدام الإضافي. [1] [2] [3] [4] تعد عملية استخراج البيانات خطوة التحليل في عملية " اكتشاف المعرفة في قواعد البيانات " أو KDD. [5] وبصرف النظر عن خطوة التحليل الخام، فإنها تنطوي أيضًا على جوانب إدارة قواعد البيانات والبيانات ، ومعالجة البيانات المسبقة ، واعتبارات النموذج والاستدلال ، ومقاييس الاهتمام، واعتبارات التعقيد ، ومعالجة ما بعد الهياكل المكتشفة، والتصور ، والتحديث عبر الإنترنت . [1]

مصطلح "استخراج البيانات" هو تسمية خاطئة لأن الهدف هو استخراج الأنماط والمعرفة من كميات كبيرة من البيانات، وليس استخراج ( تعدين ) البيانات نفسها . [6] كما أنها كلمة طنانة [7] ويتم تطبيقها بشكل متكرر على أي شكل من أشكال معالجة البيانات أو المعلومات واسعة النطاق ( التجميع والاستخراج والتخزين والتحليل والإحصاءات) بالإضافة إلى أي تطبيق لنظام دعم القرار الحاسوبي ، بما في ذلك الذكاء الاصطناعي (على سبيل المثال، التعلم الآلي) وذكاء الأعمال . غالبًا ما تكون المصطلحات الأكثر عمومية ( تحليل البيانات على نطاق واسع ) والتحليلات - أو عند الإشارة إلى الأساليب الفعلية، الذكاء الاصطناعي والتعلم الآلي - أكثر ملاءمة.

تتمثل مهمة تعدين البيانات الفعلية في التحليل شبه التلقائي أو التلقائي لكميات كبيرة من البيانات لاستخراج أنماط مثيرة للاهتمام غير معروفة سابقًا مثل مجموعات سجلات البيانات ( تحليل المجموعة ) والسجلات غير العادية ( اكتشاف الشذوذ ) والتبعيات ( تعدين قواعد الارتباط وتعدين الأنماط المتسلسلة ) . يتضمن هذا عادةً استخدام تقنيات قاعدة البيانات مثل المؤشرات المكانية . يمكن بعد ذلك اعتبار هذه الأنماط بمثابة نوع من الملخص لبيانات الإدخال، ويمكن استخدامها في مزيد من التحليل أو، على سبيل المثال، في التعلم الآلي والتحليلات التنبؤية . على سبيل المثال، قد تحدد خطوة تعدين البيانات مجموعات متعددة في البيانات، والتي يمكن استخدامها بعد ذلك للحصول على نتائج تنبؤ أكثر دقة بواسطة نظام دعم القرار . لا يعد جمع البيانات أو إعداد البيانات أو تفسير النتائج وإعداد التقارير جزءًا من خطوة تعدين البيانات، على الرغم من أنها تنتمي إلى عملية KDD الشاملة كخطوات إضافية.

الفرق بين تحليل البيانات واستخراج البيانات هو أن تحليل البيانات يستخدم لاختبار النماذج والفرضيات على مجموعة البيانات، على سبيل المثال، تحليل فعالية حملة تسويقية ، بغض النظر عن كمية البيانات. في المقابل، يستخدم استخراج البيانات التعلم الآلي والنماذج الإحصائية للكشف عن الأنماط السرية أو المخفية في حجم كبير من البيانات. [8]

تشير المصطلحات ذات الصلة مثل استخراج البيانات وصيد البيانات والتنقيب عن البيانات إلى استخدام أساليب استخراج البيانات لأخذ عينات من أجزاء من مجموعة بيانات سكانية أكبر تكون (أو قد تكون) صغيرة جدًا بحيث لا يمكن إجراء استنتاجات إحصائية موثوقة حول صحة أي أنماط تم اكتشافها. ومع ذلك، يمكن استخدام هذه الأساليب في إنشاء فرضيات جديدة للاختبار ضد مجموعات البيانات الأكبر.

علم أصل الكلمة

في ستينيات القرن العشرين، استخدم الإحصائيون والاقتصاديون مصطلحات مثل صيد البيانات أو استخراج البيانات للإشارة إلى ما اعتبروه ممارسة سيئة لتحليل البيانات دون فرضية مسبقة . وقد استخدم الخبير الاقتصادي مايكل لوفيل مصطلح "استخراج البيانات" بطريقة نقدية مماثلة في مقال نُشر في مجلة Review of Economic Studies في عام 1983. [9] [10] يشير لوفيل إلى أن الممارسة "تتنكر تحت مجموعة متنوعة من الأسماء المستعارة، بدءًا من "التجريب" (إيجابي) إلى "الصيد" أو "التجسس" (سلبي).

ظهر مصطلح تعدين البيانات حوالي عام 1990 في مجتمع قواعد البيانات، مع دلالات إيجابية بشكل عام. لفترة قصيرة في الثمانينيات، تم استخدام عبارة "تعدين قاعدة البيانات" ™، ولكن نظرًا لأنها كانت علامة تجارية لشركة HNC، وهي شركة مقرها سان دييغو ، للترويج لمحطة عمل تعدين قاعدة البيانات الخاصة بهم؛ [11] تحول الباحثون نتيجة لذلك إلى تعدين البيانات . تشمل المصطلحات الأخرى المستخدمة علم الآثار للبيانات ، وحصاد المعلومات ، واكتشاف المعلومات ، واستخراج المعرفة ، وما إلى ذلك. صاغ جريجوري بياتيتسكي شابيرو مصطلح "اكتشاف المعرفة في قواعد البيانات" لأول ورشة عمل حول نفس الموضوع (KDD-1989) وأصبح هذا المصطلح أكثر شيوعًا في مجتمعات الذكاء الاصطناعي والتعلم الآلي . ومع ذلك، أصبح مصطلح تعدين البيانات أكثر شيوعًا في مجتمعات الأعمال والصحافة. ​​[12] حاليًا، يتم استخدام مصطلحي تعدين البيانات واكتشاف المعرفة بالتبادل.

خلفية

لقد حدث الاستخراج اليدوي للأنماط من البيانات لعدة قرون. تشمل الطرق المبكرة لتحديد الأنماط في البيانات نظرية بايز (1700) وتحليل الانحدار (1800). [13] أدى انتشار تكنولوجيا الكمبيوتر ووجودها في كل مكان وقوتها المتزايدة إلى زيادة كبيرة في جمع البيانات وتخزينها ومعالجتها. مع نمو مجموعات البيانات في الحجم والتعقيد، تم تعزيز تحليل البيانات "المباشر" بشكل متزايد من خلال المعالجة الآلية غير المباشرة للبيانات، بمساعدة اكتشافات أخرى في علوم الكمبيوتر، وخاصة في مجال التعلم الآلي، مثل الشبكات العصبية ، وتحليل العناقيد ، والخوارزميات الوراثية (خمسينيات القرن العشرين)، وأشجار القرار وقواعد القرار (ستينيات القرن العشرين)، وآلات الدعم المتجه (تسعينيات القرن العشرين). تعد عملية استخراج البيانات هي عملية تطبيق هذه الأساليب بهدف الكشف عن الأنماط المخفية. [14] في مجموعات البيانات الكبيرة. إنه يسد الفجوة بين الإحصاءات التطبيقية والذكاء الاصطناعي (والتي عادة ما توفر الخلفية الرياضية) لإدارة قواعد البيانات من خلال استغلال الطريقة التي يتم بها تخزين البيانات وفهرستها في قواعد البيانات لتنفيذ خوارزميات التعلم والاكتشاف الفعلية بكفاءة أكبر، مما يسمح بتطبيق مثل هذه الأساليب على مجموعات بيانات أكبر من أي وقت مضى.

عملية

يتم تعريف عملية اكتشاف المعرفة في قواعد البيانات (KDD) عادةً بالمراحل التالية:

  1. اختيار
  2. المعالجة المسبقة
  3. تحويل
  4. استخراج البيانات
  5. التفسير/التقييم. [5]

ومع ذلك، فإن هذا الموضوع موجود في أشكال عديدة، مثل عملية المعايير الصناعية المشتركة لاستخراج البيانات (CRISP-DM) التي تحدد ست مراحل:

  1. فهم الأعمال
  2. فهم البيانات
  3. إعداد البيانات
  4. النمذجة
  5. تقييم
  6. النشر

أو عملية مبسطة مثل (1) المعالجة المسبقة، (2) استخراج البيانات، و(3) التحقق من صحة النتائج.

أظهرت استطلاعات الرأي التي أجريت في أعوام 2002 و2004 و2007 و2014 أن منهجية CRISP-DM هي المنهجية الرائدة التي يستخدمها عمال مناجم البيانات. [15] [16] [17] [18]

كان معيار تعدين البيانات الوحيد الآخر المذكور في هذه الاستطلاعات هو SEMMA . ومع ذلك، أفاد 3-4 أضعاف عدد الأشخاص باستخدام CRISP-DM. وقد نشرت العديد من فرق الباحثين مراجعات لنماذج عملية تعدين البيانات، [19] وأجرى أزيفيدو وسانتوس مقارنة بين CRISP-DM وSEMMA في عام 2008. [20]

المعالجة المسبقة

قبل أن تتمكن من استخدام خوارزميات تعدين البيانات، يجب تجميع مجموعة بيانات مستهدفة. ونظرًا لأن تعدين البيانات لا يمكنه إلا الكشف عن الأنماط الموجودة بالفعل في البيانات، فيجب أن تكون مجموعة البيانات المستهدفة كبيرة بما يكفي لاحتواء هذه الأنماط مع الحفاظ على إيجازها بما يكفي ليتم تعدينها في غضون حد زمني مقبول. المصدر الشائع للبيانات هو مستودع البيانات أو مستودع البيانات . تعد المعالجة المسبقة ضرورية لتحليل مجموعات البيانات المتعددة المتغيرات قبل تعدين البيانات. ثم يتم تنظيف مجموعة البيانات المستهدفة. يزيل تنظيف البيانات الملاحظات التي تحتوي على ضوضاء وتلك التي تحتوي على بيانات مفقودة .

استخراج البيانات

يتضمن استخراج البيانات ستة فئات شائعة من المهام: [5]

  • اكتشاف الشذوذ (اكتشاف القيم المتطرفة/التغيير/الانحراف) - تحديد سجلات البيانات غير المعتادة، والتي قد تكون مثيرة للاهتمام أو أخطاء البيانات التي تتطلب مزيدًا من التحقيق بسبب كونها خارج النطاق القياسي.
  • تعلم قواعد الارتباط (نمذجة التبعية) – البحث عن العلاقات بين المتغيرات. على سبيل المثال، قد يجمع أحد المتاجر الكبرى بيانات حول عادات الشراء لدى العملاء. وباستخدام تعلم قواعد الارتباط، يمكن للمتاجر الكبرى تحديد المنتجات التي يتم شراؤها معًا بشكل متكرر واستخدام هذه المعلومات لأغراض التسويق. ويشار إلى هذا أحيانًا باسم تحليل سلة التسوق.
  • التجميع – هو مهمة اكتشاف المجموعات والهياكل في البيانات التي تكون "متشابهة" بطريقة أو بأخرى، دون استخدام الهياكل المعروفة في البيانات.
  • التصنيف – هو مهمة تعميم البنية المعروفة لتطبيقها على البيانات الجديدة. على سبيل المثال، قد يحاول برنامج البريد الإلكتروني تصنيف رسالة بريد إلكتروني على أنها "مشروعة" أو "بريد عشوائي".
  • الانحدار – يحاول العثور على دالة تقوم بنمذجة البيانات بأقل خطأ، أي لتقدير العلاقات بين البيانات أو مجموعات البيانات.
  • التلخيص - توفير تمثيل أكثر إحكاما لمجموعة البيانات، بما في ذلك التصور وإنشاء التقارير.

التحقق من صحة النتائج

مثال على البيانات التي تم إنتاجها من خلال استخراج البيانات من خلال روبوت يديره الإحصائي تايلر فيجن، والذي يظهر على ما يبدو وجود صلة وثيقة بين أفضل كلمة تفوز بمسابقة تهجئة الكلمات وعدد الأشخاص في الولايات المتحدة الذين قتلوا بسبب العناكب السامة

يمكن إساءة استخدام استخراج البيانات عن غير قصد، مما ينتج عنه نتائج تبدو مهمة ولكنها لا تتنبأ فعليًا بالسلوك المستقبلي ولا يمكن إعادة إنتاجها على عينة جديدة من البيانات، وبالتالي لا تحمل فائدة تذكر. يحدث هذا أحيانًا بسبب التحقيق في العديد من الفرضيات وعدم إجراء اختبار فرضي إحصائي مناسب. تُعرف النسخة البسيطة من هذه المشكلة في التعلم الآلي باسم الإفراط في التجهيز ، ولكن يمكن أن تنشأ نفس المشكلة في مراحل مختلفة من العملية وبالتالي فإن تقسيم التدريب/الاختبار - عندما يكون قابلاً للتطبيق على الإطلاق - قد لا يكون كافيًا لمنع حدوث ذلك. [21]

الخطوة الأخيرة في اكتشاف المعرفة من البيانات هي التحقق من أن الأنماط التي تنتجها خوارزميات التعدين في البيانات تحدث في مجموعة البيانات الأوسع. ليست كل الأنماط التي تجدها الخوارزميات صالحة بالضرورة. من الشائع أن تجد خوارزميات التعدين في البيانات أنماطًا في مجموعة التدريب غير موجودة في مجموعة البيانات العامة. يُطلق على هذا الإفراط في التجهيز . للتغلب على هذا، يستخدم التقييم مجموعة اختبار من البيانات التي لم يتم تدريب خوارزمية التعدين عليها. يتم تطبيق الأنماط المكتسبة على مجموعة الاختبار هذه، ويتم مقارنة الناتج الناتج بالإخراج المطلوب. على سبيل المثال، سيتم تدريب خوارزمية التعدين في البيانات التي تحاول التمييز بين "البريد العشوائي" ورسائل البريد الإلكتروني "المشروعة" على مجموعة تدريب من رسائل البريد الإلكتروني النموذجية. بمجرد التدريب، سيتم تطبيق الأنماط المكتسبة على مجموعة اختبار رسائل البريد الإلكتروني التي لم يتم تدريبها عليها. يمكن بعد ذلك قياس دقة الأنماط من عدد رسائل البريد الإلكتروني التي تصنفها بشكل صحيح. يمكن استخدام العديد من الأساليب الإحصائية لتقييم الخوارزمية، مثل منحنيات ROC .

إذا لم تلب الأنماط المكتسبة المعايير المطلوبة، فمن الضروري إعادة تقييم وتغيير خطوات المعالجة المسبقة واستخراج البيانات. إذا كانت الأنماط المكتسبة تلبي المعايير المطلوبة، فإن الخطوة الأخيرة هي تفسير الأنماط المكتسبة وتحويلها إلى معرفة.

بحث

الهيئة المهنية الرائدة في هذا المجال هي مجموعة المصالح الخاصة (SIG) التابعة لجمعية آلات الحوسبة (ACM) المعنية باكتشاف المعرفة واستخراج البيانات ( SIGKDD ). [22] [23] منذ عام 1989، استضافت مجموعة المصالح الخاصة هذه التابعة لجمعية آلات الحوسبة مؤتمرًا دوليًا سنويًا ونشرت وقائعه، [24] ومنذ عام 1999 نشرت مجلة أكاديمية نصف سنوية بعنوان "استكشافات SIGKDD". [25]

تتضمن مؤتمرات علوم الكمبيوتر حول استخراج البيانات ما يلي:

كما أن موضوعات استخراج البيانات موجودة أيضًا في العديد من مؤتمرات إدارة البيانات/قواعد البيانات مثل مؤتمر ICDE ومؤتمر SIGMOD والمؤتمر الدولي لقواعد البيانات الضخمة جدًا .

المعايير

كانت هناك بعض الجهود لتحديد معايير لعملية تعدين البيانات، على سبيل المثال، عملية المعايير الصناعية الأوروبية المتقاطعة لتعدين البيانات لعام 1999 (CRISP-DM 1.0) ومعيار تعدين البيانات Java لعام 2004 (JDM 1.0). كان تطوير خليفة هذه العمليات (CRISP-DM 2.0 وJDM 2.0) نشطًا في عام 2006 ولكنه توقف منذ ذلك الحين. تم سحب JDM 2.0 دون الوصول إلى مسودة نهائية.

بالنسبة لتبادل النماذج المستخرجة - وخاصة للاستخدام في التحليلات التنبؤية - فإن المعيار الرئيسي هو لغة ترميز النموذج التنبؤي (PMML)، وهي لغة تعتمد على XML طورتها مجموعة تعدين البيانات (DMG) ويدعمها تنسيق التبادل من قبل العديد من تطبيقات تعدين البيانات. وكما يوحي الاسم، فإنها تغطي نماذج التنبؤ فقط، وهي مهمة تعدين بيانات معينة ذات أهمية كبيرة لتطبيقات الأعمال. ومع ذلك، فقد تم اقتراح امتدادات لتغطية (على سبيل المثال) التجميع الفرعي بشكل مستقل عن DMG. [26]

الاستخدامات البارزة

تُستخدم عملية استخراج البيانات أينما تتوفر البيانات الرقمية. ويمكن العثور على أمثلة بارزة لاستخراج البيانات في مجالات الأعمال والطب والعلوم والتمويل والبناء والمراقبة.

مخاوف الخصوصية والأخلاقيات

في حين أن مصطلح "استخراج البيانات" في حد ذاته قد لا يكون له أي آثار أخلاقية، إلا أنه غالبًا ما يرتبط باستخراج المعلومات فيما يتعلق بسلوك المستخدم (الأخلاقي وغير ذلك). [27]

يمكن أن تثير الطرق التي يمكن بها استخدام التعدين في البيانات في بعض الحالات والسياقات تساؤلات حول الخصوصية والشرعية والأخلاق . [28] وعلى وجه الخصوص، أثار التعدين في مجموعات البيانات الحكومية أو التجارية لأغراض الأمن القومي أو إنفاذ القانون ، كما هو الحال في برنامج الوعي بالمعلومات الشاملة أو في ADVISE ، مخاوف تتعلق بالخصوصية. [29] [30]

يتطلب استخراج البيانات إعداد البيانات التي تكشف عن معلومات أو أنماط تعرض التزامات السرية والخصوصية للخطر . الطريقة الشائعة لحدوث ذلك هي من خلال تجميع البيانات . يتضمن تجميع البيانات الجمع بين البيانات معًا (ربما من مصادر مختلفة) بطريقة تسهل التحليل (ولكن قد تجعل أيضًا تحديد البيانات الخاصة على مستوى الفرد قابلاً للاستنتاج أو واضحًا بطريقة أخرى). [31] هذا ليس استخراج بيانات في حد ذاته ، ولكنه نتيجة لإعداد البيانات قبل التحليل ولأغراضه. يدخل التهديد لخصوصية الفرد حيز التنفيذ عندما تتسبب البيانات، بمجرد تجميعها، في تمكين منجم البيانات، أو أي شخص لديه حق الوصول إلى مجموعة البيانات المجمعة حديثًا، من تحديد أفراد معينين، خاصةً عندما كانت البيانات مجهولة في الأصل. [32]

من المستحسن [ وفقًا لمن؟ ] أن نكون على دراية بما يلي قبل جمع البيانات: [31]

  • غرض جمع البيانات وأي مشاريع استخراج بيانات (معروفة).
  • كيف سيتم استخدام البيانات؟
  • من سيكون قادرًا على استخراج البيانات واستخدام البيانات ومشتقاتها؟
  • حالة الأمان المحيطة بالوصول إلى البيانات.
  • كيف يمكن تحديث البيانات المجمعة؟

قد يتم تعديل البيانات أيضًا بحيث تصبح مجهولة الهوية، بحيث لا يمكن التعرف على الأفراد بسهولة. [31] ومع ذلك، حتى مجموعات البيانات " المجهولة المصدر " يمكن أن تحتوي على معلومات كافية للسماح بتحديد هوية الأفراد، كما حدث عندما تمكن الصحفيون من العثور على العديد من الأفراد بناءً على مجموعة من سجلات البحث التي تم إصدارها عن غير قصد بواسطة AOL. [33]

إن الكشف غير المقصود عن معلومات التعريف الشخصية التي تؤدي إلى مقدم الخدمة ينتهك ممارسات المعلومات العادلة. يمكن أن يتسبب هذا الإهمال في ضرر مالي أو عاطفي أو جسدي للفرد المشار إليه. في إحدى حالات انتهاك الخصوصية ، رفع رعاة Walgreens دعوى قضائية ضد الشركة في عام 2011 لبيع معلومات الوصفات الطبية لشركات استخراج البيانات التي قدمت بدورها البيانات لشركات الأدوية. [34]

الوضع في أوروبا

تتمتع أوروبا بقوانين خصوصية قوية إلى حد ما، وهناك جهود جارية لتعزيز حقوق المستهلكين بشكل أكبر. ومع ذلك، فإن مبادئ الملاذ الآمن بين الولايات المتحدة والاتحاد الأوروبي ، التي تم تطويرها بين عامي 1998 و2000، تعرض المستخدمين الأوروبيين حاليًا لاستغلال الخصوصية من قبل الشركات الأمريكية. ونتيجة للكشف العالمي عن المراقبة من قبل إدوارد سنودن ، كان هناك نقاش متزايد لإلغاء هذه الاتفاقية، حيث سيتم الكشف عن البيانات بشكل كامل لوكالة الأمن القومي ، وفشلت محاولات التوصل إلى اتفاق مع الولايات المتحدة. [35]

في المملكة المتحدة على وجه الخصوص، كانت هناك حالات لشركات تستخدم استخراج البيانات كوسيلة لاستهداف مجموعات معينة من العملاء وإجبارهم على دفع أسعار مرتفعة بشكل غير عادل. تميل هذه المجموعات إلى أن تكون من الأشخاص ذوي الوضع الاجتماعي والاقتصادي الأدنى الذين لا يدركون الطرق التي يمكن استغلالهم بها في الأسواق الرقمية. [36]

الوضع في الولايات المتحدة

في الولايات المتحدة، عالج الكونجرس الأمريكي مخاوف الخصوصية من خلال إقرار ضوابط تنظيمية مثل قانون نقل التأمين الصحي والمساءلة (HIPAA). يتطلب قانون نقل التأمين الصحي والمساءلة من الأفراد إعطاء "موافقتهم المستنيرة" فيما يتعلق بالمعلومات التي يقدمونها واستخداماتها الحالية والمستقبلية المقصودة. وفقًا لمقال في مجلة Biotech Business Week ، "في الممارسة العملية، قد لا يوفر قانون نقل التأمين الصحي والمساءلة أي حماية أكبر من اللوائح طويلة الأمد في مجال البحث"، كما تقول AAHC. والأهم من ذلك، أن هدف القاعدة المتمثل في الحماية من خلال الموافقة المستنيرة هو الاقتراب من مستوى عدم الفهم للأفراد العاديين." [37] وهذا يؤكد على ضرورة إخفاء هوية البيانات في ممارسات تجميع البيانات واستخراجها.

لا تنطبق تشريعات خصوصية المعلومات في الولايات المتحدة مثل قانون HIPAA وقانون حقوق التعليم والخصوصية الأسرية (FERPA) إلا على المجالات المحددة التي يتناولها كل قانون من هذه القوانين. ولا يخضع استخدام استخراج البيانات من قبل غالبية الشركات في الولايات المتحدة لأي تشريع.

الوضع في أوروبا

بموجب قوانين قواعد بيانات حقوق الطبع والنشر الأوروبية ، فإن تعدين الأعمال المحمية بحقوق الطبع والنشر (مثل تعدين الويب ) دون إذن من مالك حقوق الطبع والنشر ليس قانونيًا. عندما تكون قاعدة البيانات عبارة عن بيانات خالصة في أوروبا، فقد لا يكون هناك حقوق طبع ونشر - ولكن قد توجد حقوق قاعدة البيانات، وبالتالي يصبح تعدين البيانات خاضعًا لحقوق أصحاب الملكية الفكرية المحمية بموجب توجيه قاعدة البيانات . بناءً على توصية مراجعة هارجريفز، أدى هذا إلى قيام حكومة المملكة المتحدة بتعديل قانون حقوق الطبع والنشر الخاص بها في عام 2014 للسماح بتعدين المحتوى كقيد واستثناء . [38] كانت المملكة المتحدة ثاني دولة في العالم تفعل ذلك بعد اليابان، التي أدخلت استثناءً في عام 2009 لتعدين البيانات. ومع ذلك، نظرًا لتقييد توجيه مجتمع المعلومات (2001)، فإن استثناء المملكة المتحدة يسمح فقط بتعدين المحتوى لأغراض غير تجارية. كما لا يسمح قانون حقوق الطبع والنشر في المملكة المتحدة بتجاوز هذا الحكم من خلال الشروط والأحكام التعاقدية. منذ عام 2020 أيضًا، كانت سويسرا تنظم تعدين البيانات من خلال السماح به في مجال البحث في ظل ظروف معينة منصوص عليها في المادة. المادة 24د من قانون حقوق الطبع والنشر السويسري. دخلت هذه المادة الجديدة حيز التنفيذ في 1 أبريل 2020. [39]

وقد قامت المفوضية الأوروبية بتيسير مناقشة أصحاب المصلحة بشأن استخراج النصوص والبيانات في عام 2013، تحت عنوان "التراخيص لأوروبا". [40] وقد أدى التركيز على حل هذه القضية القانونية، مثل الترخيص بدلاً من القيود والاستثناءات، إلى انسحاب ممثلي الجامعات والباحثين والمكتبات ومجموعات المجتمع المدني وناشري الوصول المفتوح من حوار أصحاب المصلحة في مايو 2013. [41]

الوضع في الولايات المتحدة

إن قانون حقوق الطبع والنشر الأمريكي ، وخاصة أحكامه المتعلقة بالاستخدام العادل ، يؤيد شرعية استخراج المحتوى في أمريكا، وغيرها من بلدان الاستخدام العادل مثل إسرائيل وتايوان وكوريا الجنوبية. ونظرًا لأن استخراج المحتوى تحويلي، أي أنه لا يحل محل العمل الأصلي، فإنه يُنظر إليه على أنه قانوني بموجب الاستخدام العادل. على سبيل المثال، كجزء من تسوية كتب جوجل ، حكم القاضي الذي ترأس القضية بأن مشروع رقمنة جوجل للكتب المحمية بحقوق الطبع والنشر كان قانونيًا، ويرجع ذلك جزئيًا إلى الاستخدامات التحويلية التي أظهرها مشروع الرقمنة - أحدها استخراج النصوص والبيانات. [42]

برمجة

برمجيات وتطبيقات التعدين على البيانات مفتوحة المصدر ومجانية

التطبيقات التالية متاحة بموجب تراخيص مجانية/مفتوحة المصدر. كما يتوفر الوصول العام إلى كود مصدر التطبيق.

برمجيات وتطبيقات استخراج البيانات الملكية

التطبيقات التالية متاحة بموجب تراخيص خاصة.

  • Angoss KnowledgeSTUDIO: أداة استخراج البيانات
  • LIONsolver : تطبيق برمجي متكامل لاستخراج البيانات وذكاء الأعمال والنمذجة والذي ينفذ نهج التعلم والتحسين الذكي (LION).
  • PolyAnalyst : برنامج لاستخراج البيانات والنصوص من شركة Megaputer Intelligence.
  • خدمات تحليل Microsoft : برنامج استخراج البيانات الذي توفره Microsoft .
  • NetOwl : مجموعة من منتجات تحليل النصوص والكيانات متعددة اللغات التي تمكن استخراج البيانات.
  • Oracle Data Mining : برنامج لتعدين البيانات من شركة Oracle Corporation .
  • PSeven : منصة لأتمتة المحاكاة والتحليل الهندسي والتحسين متعدد التخصصات واستخراج البيانات المقدمة من DATADVANCE .
  • Qlucore Omics Explorer: برنامج لتعدين البيانات.
  • RapidMiner : بيئة لتجارب التعلم الآلي وتعدين البيانات.
  • SAS Enterprise Miner : برنامج استخراج البيانات الذي تقدمه مؤسسة SAS .
  • SPSS Modeler : برنامج لاستخراج البيانات تقدمه شركة IBM .
  • STATISTICA Data Miner: برنامج لاستخراج البيانات مقدم من StatSoft .
  • Tanagra : برنامج لاستخراج البيانات موجه نحو التصور، ويستخدم أيضًا للتدريس.
  • Vertica : برنامج استخراج البيانات المقدم من Hewlett-Packard .
  • منصة Google Cloud : نماذج ML مخصصة آلية تديرها Google .
  • Amazon SageMaker : خدمة مُدارة تقدمها Amazon لإنشاء وإنتاج نماذج ML مخصصة.

انظر أيضا

طُرق
مجالات التطبيق
أمثلة للتطبيق
مواضيع ذات صلة

لمزيد من المعلومات حول استخراج المعلومات من البيانات (على عكس تحليل البيانات)، راجع:

مصادر أخرى

مراجع

  1. ^ abc "منهج استخراج البيانات". ACM SIGKDD . 2006-04-30. مؤرشف من الأصل في 2013-10-14 . تم استرجاعه في 2014-01-27 .
  2. ^ كليفتون، كريستوفر (2010). "Encyclopædia Britannica: Definition of Data Mining". مؤرشف من الأصل في 2011-02-05 . تم الاسترجاع في 2010-12-09 .
  3. ^ هاستي، تريفور ؛ تيبشيراني، روبرت ؛ فريدمان، جيروم (2009). "عناصر التعلم الإحصائي: استخراج البيانات والاستدلال والتنبؤ". مؤرشف من الأصل في 10 نوفمبر 2009. تم الاسترجاع في 07 أغسطس 2012 .
  4. ^ هان، جايوي ؛ كامبر، ميشلين؛ بي، جيان (2011). استخراج البيانات: المفاهيم والتقنيات (الطبعة الثالثة). مورجان كوفمان. رقم ISBN 978-0-12-381479-1.
  5. ^ abc Fayyad, Usama ; Piatetsky-Shapiro, Gregory ; Smyth, Padhraic (1996). "From Data Mining to Knowledge Discovery in Databases" (PDF) . مؤرشف من الأصل (PDF) في 2022-10-09 . تم الاسترجاع في 17 ديسمبر 2008 .
  6. ^ هان، جياوي ؛ كامبر، ميشلين (2001). استخراج البيانات: المفاهيم والتقنيات . مورجان كوفمان . ص. 5. رقم ISBN 978-1-55860-489-6وبالتالي ، كان من الأفضل أن يُطلق على استخراج البيانات اسم "استخراج المعرفة من البيانات"، وهو اسم طويل نوعًا ما للأسف.
  7. ^ مؤتمر الخريف 2005 لبرنامج OKAIRP، جامعة ولاية أريزونا محفوظ في 2014-02-01 على موقع Wayback Machine
  8. ^ أولسون، دي إل (2007). استخراج البيانات في خدمات الأعمال. أعمال الخدمة ، 1 (3)، 181-193. doi :10.1007/s11628-006-0014-7
  9. ^ لوفيل، مايكل سي. (1983). "استخراج البيانات". مراجعة الاقتصاد والإحصاء . 65 (1): 1-12. doi :10.2307/1924403. JSTOR  1924403.
  10. ^ Charemza, Wojciech W.; Deadman, Derek F. (1992). "Data Mining". New Directions in Economic Standard Practice . Aldershot: Edward Elgar. pp. 14–31. ISBN 1-85278-461-X.
  11. ^ مينا، جيسوس (2011). التحليل الجنائي للتعلم الآلي لتطبيق القانون والأمن والاستخبارات . بوكا راتون، فلوريدا: مطبعة سي آر سي (مجموعة تايلور وفرانسيس). رقم ISBN 978-1-4398-6069-4.
  12. ^ Piatetsky-Shapiro, Gregory ; Parker, Gary (2011). "Lesson: Data Mining, and Knowledge Discovery: An Introduction". Introduction to Data Mining . KD Nuggets. مؤرشف من الأصل في 30 أغسطس 2012 . تم الاسترجاع في 30 أغسطس 2012 .
  13. ^ كوينين، فرانس (2011-02-07). "تعدين البيانات: الماضي والحاضر والمستقبل". مراجعة هندسة المعرفة . 26 (1): 25-29. doi :10.1017/S0269888910000378. ISSN  0269-8889. S2CID  6487637. مؤرشف من الأصل في 2023-07-02 . تم الاسترجاع 2021-09-04 .
  14. ^ كانتاردزيك، محمد (2003). استخراج البيانات: المفاهيم والنماذج والأساليب والخوارزميات . جون وايلي وأولاده. رقم ISBN 978-0-471-22852-3. OCLC  50055336.
  15. ^ "ما هي المنهجية الرئيسية التي تستخدمها في استخراج البيانات (2002)؟". KDnuggets . 2002. مؤرشف من الأصل في 16 يناير 2017. تم الاسترجاع 29 ديسمبر 2023 .
  16. ^ "ما هي المنهجية الرئيسية التي تستخدمها لتعدين البيانات (2004)؟". KDnuggets . 2004. مؤرشف من الأصل في 8 فبراير 2017. تم الاسترجاع 29 ديسمبر 2023 .
  17. ^ "ما هي المنهجية الرئيسية التي تستخدمها في استخراج البيانات (2007)؟". KDnuggets . 2007. مؤرشف من الأصل في 17 نوفمبر 2012 . تم الاسترجاع 29 ديسمبر 2023 .
  18. ^ "ما هي المنهجية الرئيسية التي تستخدمها لتعدين البيانات (2014)؟". KDnuggets . 2014. مؤرشف من الأصل في 1 أغسطس 2016 . تم الاسترجاع 29 ديسمبر 2023 .
  19. ^ لوكاس كورغان وبيتر موسيليك: "دراسة استقصائية لنماذج عملية اكتشاف المعرفة وتعدين البيانات" محفوظ في 2013-05-26 على موقع واي باك مشين . مراجعة هندسة المعرفة . المجلد 21 العدد 1، مارس 2006، ص 1-24، مطبعة جامعة كامبريدج، نيويورك، doi :10.1017/S0269888906000737
  20. ^ Azevedo, A. and Santos, MF KDD, SEMMA and CRISP-DM: a parallel Overview Archived 2013-01-09 at the Wayback Machine . في وقائع المؤتمر الأوروبي لتعدين البيانات 2008 التابع لـ IADIS، ص 182-185.
  21. ^ هوكينز، دوغلاس م (2004). "مشكلة الإفراط في التجهيز". مجلة المعلومات الكيميائية وعلوم الكمبيوتر . 44 (1): 1-12. doi :10.1021/ci0342472. PMID  14741005. S2CID  12440383.
  22. ^ "Microsoft Academic Search: Top conferences in data mining". Microsoft Academic Search . مؤرشف من الأصل في 2014-11-19 . تم الاسترجاع في 2014-06-13 .
  23. ^ "Google Scholar: أفضل المنشورات - استخراج البيانات وتحليلها". Google Scholar . مؤرشف من الأصل في 2023-02-10 . تم الاسترجاع 2022-06-11 .
  24. ^ وقائع الأرشيف 2010-04-30 على موقع واي باك مشين ، المؤتمرات الدولية حول اكتشاف المعرفة واستخراج البيانات، جمعية آلات الحوسبة، نيويورك.
  25. ^ تم أرشفة استكشافات SIGKDD في 2010-07-29 على موقع Wayback Machine ، ACM، نيويورك.
  26. ^ Günnemann, Stephan; Kremer, Hardy; Seidl, Thomas (2011). "An extension of the PMML standard to subspace clustering models". Proceedings of the 2011 workshop on Predictive markup language modeling . p. 48. doi :10.1145/2023598.2023605. ISBN 978-1-4503-0837-3. S2CID  14967969.
  27. ^ سيلتزر، ويليام (2005). "الوعود والمزالق المترتبة على استخراج البيانات: القضايا الأخلاقية" (PDF) . قسم الإحصاءات الحكومية في الجمعية الإحصائية الأمريكية. مؤرشف من الأصل (PDF) في 2022-10-09.
  28. ^ بيتس، شيب (15 مارس 2007). "نهاية التجسس المحلي غير القانوني؟ لا تعتمدوا عليه". واشنطن سبكتاتور . مؤرشف من الأصل في 28 نوفمبر 2007.
  29. ^ تايبالي، كيم أ. (15 ديسمبر 2003). "تعدين البيانات والأمن المحلي: ربط النقاط لفهم البيانات". مجلة كولومبيا للقانون العلمي والتكنولوجي . 5 (2). OCLC  45263753. SSRN  546782. مؤرشف من الأصل في 5 نوفمبر 2014. تم الاسترجاع في 21 أبريل 2004 .
  30. ^ Resig, John. "A Framework for Mining Instant Messaging Services" (PDF) . مؤرشف من الأصل (PDF) في 2022-10-09 . تم الاسترجاع في 16 مارس 2018 .
  31. ^ abc Think Before You Dig: Privacy Implications of Data Mining & Aggregation Archived 2008-12-17 at the Wayback Machine , NASCIO Research Brief, September 2004
  32. ^ أوم، بول. "لا تبن قاعدة بيانات من الخراب". هارفارد بيزنس ريفيو .
  33. ^ بيانات البحث في AOL حددت الأفراد المؤرشف في 2010-01-06 على موقع Wayback Machine ، SecurityFocus، أغسطس 2006
  34. ^ Kshetri, Nir (2014). "Big data's impact on privacy, security and consumer wellbeing" (PDF) . Telecommunications Policy . 38 (11): 1134–1145. doi :10.1016/j.telpol.2014.10.002. مؤرشف من الأصل (PDF) في 2018-06-19 . تم الاسترجاع في 2018-04-20 .
  35. ^ Weiss, Martin A.; Archick, Kristin (19 May 2016). "US–EU Data Privacy: From Safe Harbor to Privacy Shield". Washington, DC Congressional Research Service. p. 6. R44257. مؤرشف من الأصل (PDF) في 9 أبريل 2020. تم الاسترجاع في 9 أبريل 2020. في 6 أكتوبر 2015، أصدرت محكمة العدل التابعة للاتحاد الأوروبي  ... قرارًا يبطل الملاذ الآمن (ساري المفعول على الفور)، كما هو مطبق حاليًا.
  36. ^ باركر، جورج (2018-09-30). "شركات المملكة المتحدة المستهدفة لاستخدامها البيانات الضخمة لاستغلال العملاء". فاينانشال تايمز . مؤرشف من الأصل في 2022-12-10 . تم الاسترجاع 2022-12-04 .
  37. ^ محررو مجلة Biotech Business Week (30 يونيو 2008)؛ الطب الحيوي؛ قاعدة الخصوصية HIPAA تعيق البحث الطبي الحيوي ، مجلة Biotech Business Week، تم استرجاعها في 17 نوفمبر 2009 من LexisNexis Academic
  38. ^ منح باحثين في المملكة المتحدة حق استخراج البيانات بموجب قوانين حقوق الطبع والنشر الجديدة في المملكة المتحدة. أرشيف 9 يونيو 2014، على موقع Wayback Machine Out-Law.com. تم الاسترجاع في 14 نوفمبر 2014
  39. ^ "Fedlex". مؤرشف من الأصل في 2021-12-16 . تم الاسترجاع 2021-12-16 .
  40. ^ "التراخيص لأوروبا – حوار منظم بين أصحاب المصلحة 2013". المفوضية الأوروبية . مؤرشف من الأصل في 23 مارس 2013. تم استرجاعه في 14 نوفمبر 2014 .
  41. ^ "استخراج النصوص والبيانات: أهميتها والحاجة إلى التغيير في أوروبا". رابطة المكتبات البحثية الأوروبية . مؤرشف من الأصل في 29 نوفمبر 2014. استرجاع 14 نوفمبر 2014 .
  42. ^ "القاضي يمنح حكمًا موجزًا ​​لصالح Google Books – انتصار الاستخدام العادل". Lexology.com . Antonelli Law Ltd. 19 نوفمبر 2013. مؤرشف من الأصل في 29 نوفمبر 2014 . تم الاسترجاع في 14 نوفمبر 2014 .

قراءة إضافية

  • كابينا، بيتر؛ هادجنيان، بابلو؛ ستادلر، رولف. فيرهيس، ياب؛ زاناسي، أليساندرو (1997)؛ اكتشاف التنقيب في البيانات: من المفهوم إلى التنفيذ ، برنتيس هول ، ISBN 0-13-743980-6 
  • MS Chen, J. Han, PS Yu (1996) "تعدين البيانات: نظرة عامة من منظور قاعدة البيانات" محفوظ في 2016-03-03 على موقع Wayback Machine . هندسة المعرفة والبيانات، معاملات معهد مهندسي الكهرباء والإلكترونيات، 8 (6)، 866-883
  • فيلدمان، رونين؛ سانجر، جيمس (2007)؛ دليل استخراج النصوص ، مطبعة جامعة كامبريدج ، رقم ISBN 978-0-521-83657-9 
  • جو، ييكي؛ وجروسمان، روبرت (المحررون) (1999)؛ التعدين عالي الأداء للبيانات: خوارزميات التوسع والتطبيقات والأنظمة ، دار النشر الأكاديمي كلوير
  • هان، جياوي ، ميشلين كامبر، وجيان باي. استخراج البيانات: المفاهيم والتقنيات . مورغان كوفمان، 2006.
  • هاستي، تريفور ، تيبشيراني، روبرت وفريدمان ، جيروم (2001)؛ عناصر التعلم الإحصائي: استخراج البيانات والاستدلال والتنبؤ ، سبرينغر، ISBN 0-387-95284-5 
  • ليو، بينج (2007، 2011)؛ استخراج بيانات الويب: استكشاف الارتباطات التشعبية والمحتويات وبيانات الاستخدام ، سبرينغر ، ISBN 3-540-37881-2 
  • ميرفي، كريس (16 مايو/أيار 2011). "هل يعتبر استخراج البيانات حرية تعبير؟". مجلة إنفورميشن ويك : 12.
  • نيسبيت، روبرت؛ إلدر، جون؛ ماينر، جاري (2009)؛ دليل التحليل الإحصائي وتطبيقات استخراج البيانات ، أكاديميك بريس /إلسيفير، ISBN 978-0-12-374765-5 
  • بونسيليه، باسكال؛ ماسيجليا، فلورينت؛ وتيسيير، ماجولون (المحررون) (أكتوبر 2007)؛ "أنماط التعدين في البيانات: أساليب وتطبيقات جديدة"، مرجع علوم المعلومات ، ISBN 978-1-59904-162-9 
  • تان، بانج نينج؛ شتاينباخ، مايكل؛ وكومار، فيبين (2005)؛ مقدمة في استخراج البيانات ، ISBN 0-321-32136-7 
  • ثيودوريديس، سيرجيوس؛ وكوترومباس، كونستانتينوس (2009)؛ التعرف على الأنماط ، الطبعة الرابعة، أكاديميك بريس، رقم ISBN 978-1-59749-272-0 
  • وايس، شولوم م.؛ وإندورخيا، نيتين (1998)؛ التعدين التنبؤي للبيانات ، مورجان كوفمان
  • Witten, Ian H .; Frank, Eibe; Hall, Mark A. (30 January 2011). Data Mining: Practical Machine Learning Tools and Techniques (3 ed.). Elsevier. ISBN 978-0-12-374856-0.(انظر أيضًا برنامج Weka المجاني )
  • Ye, Nong (2003)؛ دليل استخراج البيانات ، ماهواه، نيوجيرسي: لورانس إيرلباوم
  • برنامج اكتشاف المعرفة في Curlie
  • بائعي أدوات التعدين على البيانات في Curlie
Retrieved from "https://en.wikipedia.org/w/index.php?title=Data_mining&oldid=1244684370"
Original text
Rate this translation
Your feedback will be used to help improve Google Translate