أمثلة على استخراج البيانات

تم استخدام استخراج البيانات ، وهي عملية اكتشاف الأنماط في مجموعات البيانات الكبيرة، في العديد من التطبيقات.

زراعة

تُعدّ مراقبة التربة باستخدام الطائرات المسيّرة وصور الأقمار الصناعية من بين الأساليب المستخدمة لجمع البيانات المتعلقة بصحة التربة ، وأنماط الطقس ، ونمو المحاصيل، ونشاط الآفات ، وعوامل أخرى. ويتم تحليل مجموعات البيانات لتحسين الكفاءة الزراعية ، وتحديد الأنماط والاتجاهات، وتقليل الخسائر المحتملة. [ 1 ]

  • يمكن تطبيق تقنيات استخراج البيانات على البيانات المرئية في الزراعة لاستخلاص أنماط واتجاهات وعلاقات ذات دلالة. تُسهم هذه المعلومات في تحسين الخوارزميات التي تكشف عيوب الفواكه والخضراوات المحصودة. على سبيل المثال، طُبقت أساليب متقدمة لجمع البيانات المرئية ، وأنظمة الرؤية الآلية ، ومعالجة الصور لتصنيف الفواكه والخضراوات وفقًا للعديد من العيوب السطحية. [ 2 ] إضافةً إلى ذلك، يمكن تحليل هذه البيانات للتحقق من الأسباب المحتملة للعيوب. يعتمد جزء كبير من هذه المعرفة على أدلة قصصية بدلًا من أساليب جمع البيانات النوعية والكمية. ومع ذلك، تُبذل جهود لدمج تقنيات استخراج البيانات في أبحاث البستنة . [ 3 ] قبل طرح التفاح في السوق، يُفحص ويُستبعد المعيب منه. مع ذلك، قد تؤثر العيوب غير المرئية على نكهة التفاح ومظهره. ومن الأمثلة على ذلك "اللب المائي"، وهو خلل داخلي قد يؤثر على مدة صلاحية الثمرة. يكون التفاح ذو اللب المائي الخفيف أحلى مذاقًا، بينما يكون التفاح ذو اللب المائي المتوسط ​​إلى الشديد أقل صلاحية للتخزين مقارنةً بالتفاح العادي. علاوةً على ذلك، قد يؤدي وجود عدد قليل من الثمار ذات اللب المائي الشديد إلى إتلاف دفعة كاملة. ولهذا السبب، يجري دراسة نظام حاسوبي يلتقط صورًا بالأشعة السينية للتفاح أثناء مروره على سيور ناقلة . ويقوم النظام بتحليل الصور باستخدام خوارزميات التعلم الآلي للتنبؤ باحتمالية احتواء الثمار على لب مائي.
  • تؤثر التحولات الأيضية أثناء التخمير على جودة النبيذ المُنتَج وإنتاجية صناعات النبيذ. وقد استُخدمت تقنيات علم البيانات ، مثل التجميع العنقودي k-means وتقنيات التصنيف القائمة على التجميع الثنائي ، لدراسة هذه العمليات الأيضية، حيث نجحت في التنبؤ بنتائج التخمير بعد ثلاثة أيام فقط. وتتيح هذه الأساليب تصنيف النبيذ وفقًا لملف الأيض الناتج عن التخمير، مما يميزه عن أنظمة تصنيف النبيذ التقليدية. [ 4 ]
  • استُخدمت شبكة من نوع طريقة معالجة البيانات الجماعية ( GMDH )، مُدمجة مع خوارزمية جينية ، للتنبؤ بالطاقة المُستقلبة في مسحوق الريش ومسحوق مخلفات الدواجن بناءً على محتواها من البروتين والدهون والرماد. جُمعت عينات بيانات من دراسات منشورة واستُخدمت لتدريب نموذج شبكة من نوع GMDH. يُمكن لهذا النهج التنبؤ بالطاقة المُستقلبة في عينات علف الدواجن بناءً على محتواها الكيميائي. [ 5 ] كما يُمكن لشبكة GMDH تقدير أداء الدواجن بدقة من العناصر الغذائية الغذائية مثل الطاقة المُستقلبة والبروتين والأحماض الأمينية . [ 6 ]
  • يُمكن للكشف المبكر عن أمراض الحيوانات أن يُحسّن إنتاجية المزارع، إذ يُتيح للمزارعين معالجة الحيوانات المصابة وعزلها فور ظهور الأعراض، مما يُقلل من انتشار المرض. فعلى سبيل المثال، يُمكن تحليل الأصوات التي تُصدرها الخنازير ، كالسعال، للكشف عن الأمراض. ويجري حاليًا تطوير نظام حاسوبي لمراقبة أصوات الخنازير وتمييزها باستخدام ميكروفونات مُثبّتة في المزرعة.
  • استُخدم تفاعل البوليميراز المتسلسل مع تحليل تعدد الأشكال التوافقية للشريط المفرد ( PCR -SSCP) لتحديد تعدد أشكال هرمون النمو (GH) والليبتين والكالبين والكالبستاتين في ذكور أغنام البلوش الإيرانية . وتم تطوير نموذج شبكة عصبية اصطناعية (ANN) للتنبؤ بمتوسط ​​الزيادة اليومية في وزن الحملان باستخدام معطيات تشمل تعدد أشكال هرمون النمو والليبتين والكالبين والكالبستاتين، ووزن الولادة ، ونوع الولادة. وأظهرت النتائج أن نموذج الشبكة العصبية الاصطناعية أداة مناسبة لتحديد أنماط البيانات للتنبؤ بنمو الحملان من حيث متوسط ​​الزيادة اليومية في الوزن، وذلك بالنظر إلى تعدد أشكال جينات محددة، ووزن الولادة ، ونوع الولادة. ويمكن استخدام تحليلات نموذج PCR-SSCP ونموذج الشبكة العصبية الاصطناعية في برامج التربية المدعومة بالعلامات الجزيئية لتحسين كفاءة إنتاج الأغنام. [ 7 ]
  • أظهرت دراسات حديثة أجراها باحثون زراعيون في باكستان أن سياسات الدولة المؤيدة لاستخدام المبيدات قد ساهمت في ارتفاع معدلات استخدامها في زراعة القطن، وأشارت إلى وجود علاقة عكسية بين استخدام المبيدات وإنتاجية المحصول. ويُلحق الاستخدام المفرط للمبيدات أضرارًا مالية وبيئية واجتماعية بالمزارعين. ويُبين تحليل البيانات في قطاع القطن، باستخدام بيانات الآفات إلى جانب البيانات المناخية، كيفية ترشيد استخدام المبيدات.
  • استُخدمت منصةٌ تعتمد على نماذج الشبكات العصبية الاصطناعية ، بالإضافة إلى تحليل الحساسية وخوارزميات التحسين، لدمج البيانات المنشورة حول استجابات دجاج التسمين للثريونين . أشارت تحليلات نماذج الشبكات العصبية الاصطناعية لزيادة الوزن وكفاءة التغذية إلى أن تركيز البروتين في العلف أهم من تركيز الثريونين . وكشفت النتائج أن نظامًا غذائيًا يحتوي على 18.69% بروتين و0.73% ثريونين قد يؤدي إلى زيادة مثالية في الوزن، بينما يمكن تحقيق كفاءة تغذية مثالية بنظام غذائي يحتوي على 18.71% بروتين و0.75% ثريونين. [ 8 ]

عمل

في مجال الأعمال، يُعرَّف استخراج البيانات بأنه تحليل الأنشطة التجارية التاريخية المخزنة كبيانات ثابتة في قواعد بيانات مستودعات البيانات . والهدف منه هو الكشف عن الأنماط والاتجاهات الخفية. تستخدم برامج استخراج البيانات خوارزميات متقدمة للتعرف على الأنماط لغربلة كميات هائلة من البيانات، مما يساعد في اكتشاف معلومات تجارية استراتيجية غير معروفة سابقًا. ومن أمثلة استخدامات الشركات لاستخراج البيانات: إجراء تحليل السوق لتحديد حزم منتجات جديدة، وإيجاد السبب الجذري لمشاكل التصنيع، ومنع فقدان العملاء واكتساب عملاء جدد، والبيع المتبادل للعملاء الحاليين، وتحديد خصائص العملاء بدقة أكبر. [ 9 ]

  • في عالمنا اليوم، تجمع الشركات البيانات الخام بمعدلات متسارعة. فعلى سبيل المثال، تُجري وول مارت أكثر من 20 مليون عملية بيع يوميًا. تُخزَّن هذه المعلومات في قاعدة بيانات مركزية، لكنها ستكون عديمة الفائدة دون استخدام برامج تحليل البيانات. لو حللتها وول مارت باستخدام تقنيات تحليل البيانات، لتمكنت من تحديد اتجاهات المبيعات، وتطوير حملات تسويقية، والتنبؤ بولاء العملاء بدقة أكبر. [ 10 ] [ 11 ]
  • يُعدّ تصنيف المنتجات المتوفرة على مواقع التجارة الإلكترونية مشكلة أساسية. فنظام تصنيف المنتجات الصحيح ضروري لتجربة المستخدم، إذ يُساعد في تحديد المنتجات المناسبة له للبحث والتصفح. يُمكن صياغة تصنيف المنتجات كمسألة تصنيف مُوجّه في مجال استخراج البيانات، حيث تُمثّل الفئات الفئات المستهدفة، بينما تُمثّل الميزات الكلمات التي تُشكّل وصفًا نصيًا للمنتجات. أحد الأساليب المُتبعة هو إيجاد مجموعات مُتشابهة في البداية، ثمّ تجميعها في مجموعة كامنة. عند إضافة منتج جديد، يتمّ تصنيفه أولًا ضمن مجموعة كامنة، وهو ما يُسمى بالتصنيف الأولي. بعد ذلك، تُجرى جولة ثانية من التصنيف لتحديد الفئة التي ينتمي إليها المنتج. [ 12 ]
  • في كل مرة تُستخدم فيها بطاقة ائتمان أو بطاقة ولاء متجر، أو تُملأ بطاقة ضمان، تُجمع بيانات عن سلوك المستخدم. يجد الكثيرون كمية المعلومات المخزنة عنا من قِبل شركات مثل جوجل وفيسبوك وأمازون مُقلقة، ويشعرون بالقلق حيال خصوصيتهم. ورغم احتمال استخدام بياناتنا الشخصية بطرق ضارة أو غير مرغوب فيها، إلا أنها تُستخدم أيضًا لتحسين حياتنا. على سبيل المثال ، تأمل شركتا فورد وأودي في جمع معلومات حول أنماط قيادة العملاء يومًا ما، لكي تتمكنا من التوصية بطرق أكثر أمانًا وتحذير السائقين من ظروف الطرق الخطرة. [ 13 ]
  • يمكن أن يُساهم استخراج البيانات في تطبيقات إدارة علاقات العملاء بشكلٍ كبير في تحسين الأرباح. فبدلاً من التواصل العشوائي مع العملاء المحتملين أو الحاليين عبر مراكز الاتصال أو البريد، يُمكن للشركة تركيز جهودها على العملاء المحتملين الذين يُتوقع أن تكون استجابتهم للعروض عالية. كما يُمكن استخدام أساليب أكثر تطوراً لتحسين استخدام الموارد في مختلف الحملات التسويقية، بحيث يُمكن التنبؤ بالقناة والعرض الأنسب لاستجابة كل فرد (من بين جميع العروض المُحتملة). بالإضافة إلى ذلك، يُمكن استخدام تطبيقات متطورة لأتمتة عمليات إرسال البريد. فبمجرد تحديد نتائج استخراج البيانات (العميل المحتمل/الحالي والقناة/العرض)، يُمكن لهذا التطبيق المتطور إرسال بريد إلكتروني أو بريد عادي تلقائياً. وأخيراً، في الحالات التي يُقدم فيها الكثيرون على اتخاذ إجراء دون عرض، يُمكن استخدام " نمذجة التحسين " لتحديد الأشخاص الذين سيشهدون أكبر زيادة في الاستجابة عند تقديم عرض لهم. وبذلك، تُمكّن نمذجة التحسين المسوقين من تركيز رسائلهم وعروضهم على الأشخاص القابلين للإقناع، وتجنب إرسال العروض إلى الأشخاص الذين سيشترون المنتج دون عرض. يمكن أيضًا استخدام تجميع البيانات لاكتشاف الشرائح أو المجموعات داخل مجموعة بيانات العملاء تلقائيًا.
  • قد تحقق الشركات التي تستخدم تقنيات استخراج البيانات عائدًا على استثماراتها، لكنها تدرك أيضًا أن عدد النماذج التنبؤية قد يتزايد بسرعة كبيرة. على سبيل المثال، بدلًا من استخدام نموذج واحد للتنبؤ بعدد العملاء الذين سيتوقفون عن التعامل مع الشركة ، قد تختار الشركة بناء نموذج منفصل لكل منطقة ونوع عميل. في الحالات التي تتطلب صيانة عدد كبير من النماذج، تلجأ بعض الشركات إلى منهجيات استخراج البيانات المؤتمتة.
  • يمكن أن يكون استخراج البيانات مفيدًا لإدارات الموارد البشرية في تحديد خصائص موظفيها الأكثر نجاحًا. فالمعلومات التي يتم الحصول عليها، مثل الجامعات التي التحق بها الموظفون الناجحون، تُساعد إدارة الموارد البشرية على تركيز جهود التوظيف وفقًا لذلك. بالإضافة إلى ذلك، تُساعد تطبيقات إدارة المؤسسات الاستراتيجية الشركات على ترجمة أهدافها المؤسسية، مثل أهداف الربح وحصة الأرباح، إلى قرارات تشغيلية، مثل خطط الإنتاج ومستويات القوى العاملة. [ 14 ]
  • يمكن أن يكون استخراج البيانات مفيدًا للمؤسسات. يُعرَّف استخراج البيانات المؤسسية (ODM) بأنه الاستفادة من أدوات وتقنيات استخراج البيانات (DM) لتحسين عملية صنع القرار المؤسسي من خلال تحويل البيانات إلى معرفة قيّمة وقابلة للتنفيذ، وذلك لاكتساب ميزة تنافسية استراتيجية وتجارية. يمكن للبيانات المُستخرجة، مثل معدلات دوران الموظفين، أن تساعد المؤسسات على تركيز جهودها في الاحتفاظ بالموظفين وفقًا لذلك. بالإضافة إلى ذلك، تساعد تطبيقات استخراج البيانات وتحليلها لإدارة الأداء المؤسسي الشركات على ترجمة أهداف الشركة، مثل أهداف الربح والمبيعات، إلى قرارات تشغيلية، مثل مؤشرات الأداء الرئيسية للموظفين ومستويات الجهد المطلوبة والمقاسة. [ 15 ]
  • استُخدم تحليل سلة التسوق لتحديد أنماط شراء المستهلك ألفا . وقد مكّن تحليل البيانات التي جُمعت عن هذا النوع من المستخدمين الشركات من التنبؤ باتجاهات الشراء المستقبلية وتوقع الطلب على العرض.
  • يُعدّ استخراج البيانات أداةً بالغة الفعالية في مجال التسويق عبر الكتالوجات. إذ يمتلك مُصدرو الكتالوجات قاعدة بيانات ضخمة تضمّ تاريخ معاملات ملايين العملاء على مدى سنوات عديدة. وتُمكّن أدوات استخراج البيانات من تحديد الأنماط بين العملاء، والمساعدة في تحديد العملاء الأكثر احتمالاً للاستجابة لحملات البريد القادمة.
  • يمكن دمج استخراج البيانات لتطبيقات الأعمال في عملية نمذجة واتخاذ قرارات معقدة. [ 16 ] يستخدم LIONsolver ذكاء الأعمال التفاعلي (RBI) للدعوة إلى نهج "شامل" يدمج استخراج البيانات والنمذجة والتصور التفاعلي في عملية اكتشاف شاملة وابتكار مستمر مدعوم بالتعلم البشري والآلي. [ 17 ]
  • في مجال اتخاذ القرارات ، استُخدم نهج RBI لاستخراج المعرفة التي تُكتسب تدريجيًا من صانع القرار، ثم ضبط أسلوب اتخاذ القرار تلقائيًا وفقًا لذلك. [ 18 ] وقد تمّت صياغة العلاقة بين جودة نظام استخراج البيانات وحجم الاستثمار الذي يرغب صانع القرار في القيام به، وذلك من خلال تقديم منظور اقتصادي لقيمة "المعرفة المستخرجة" من حيث عائدها للمؤسسة. [ 16 ] طُبّق إطار التصنيف النظري لاتخاذ القرارات هذا [ 16 ] على خط إنتاج رقائق أشباه الموصلات في العالم الحقيقي، حيث طُوّرت قواعد اتخاذ القرار لمراقبة خط إنتاج رقائق أشباه الموصلات والتحكم فيه بفعالية. [ 19 ]
  • يُقدّم بحث "استخراج بيانات اختبار الدوائر المتكاملة لتحسين اختبار الدوائر المتكاملة واسعة النطاق" [ 20 ] مثالًا على استخراج البيانات المتعلق بخط إنتاج الدوائر المتكاملة . يصف هذا البحث تطبيق استخراج البيانات وتحليل القرار على مشكلة الاختبار الوظيفي على مستوى الرقاقة. تُظهر التجارب المذكورة إمكانية تطبيق نظام لاستخراج بيانات اختبار الرقاقات التاريخية لإنشاء نموذج احتمالي لأنماط فشل الرقاقات. تُستخدم هذه الأنماط بعد ذلك لتحديد الرقاقة التي يجب اختبارها تاليًا ومتى يجب إيقاف الاختبار، وذلك في الوقت الفعلي. وقد أظهرت التجارب التي أُجريت على بيانات اختبار تاريخية أن هذا النظام لديه القدرة على تحسين أرباح منتجات الدوائر المتكاملة الناضجة. تشير أمثلة أخرى [ 21 ] [ 22 ] لتطبيق منهجيات استخراج البيانات في بيئات تصنيع أشباه الموصلات إلى أن هذه المنهجيات قد تكون مفيدة بشكل خاص عندما تكون البيانات شحيحة، وعندما تُظهر المعايير الفيزيائية والكيميائية المختلفة التي تؤثر على العملية تفاعلات بالغة التعقيد. ومن النتائج الأخرى أن المراقبة الآنية لعملية تصنيع أشباه الموصلات باستخدام استخراج البيانات قد تكون فعّالة للغاية.

العلوم والهندسة

في السنوات الأخيرة ، تم استخدام استخراج البيانات على نطاق واسع في مجالات العلوم والهندسة، مثل المعلوماتية الحيوية وعلم الوراثة والطب والتعليم وهندسة الطاقة الكهربائية .

  • في دراسة علم الوراثة البشرية، يُسهم استخراج التسلسل في تحقيق هدفٍ هام يتمثل في فهم العلاقة بين الاختلافات الفردية في تسلسل الحمض النووي البشري والتباين في قابلية الإصابة بالأمراض. بعبارة أخرى، يهدف إلى معرفة كيف تؤثر التغيرات في تسلسل الحمض النووي للفرد على مخاطر الإصابة بأمراض شائعة كالسرطان ، وهو أمر بالغ الأهمية لتحسين أساليب تشخيص هذه الأمراض والوقاية منها وعلاجها. إحدى طرق استخراج البيانات المستخدمة لتحقيق هذه المهمة تُعرف باسم تقليل الأبعاد متعدد العوامل . [ 23 ]
  • في مجال هندسة الطاقة الكهربائية، تُستخدم أساليب استخراج البيانات على نطاق واسع لمراقبة حالة المعدات الكهربائية ذات الجهد العالي. يهدف رصد الحالة إلى الحصول على معلومات قيّمة، على سبيل المثال، حول حالة العزل ( أو غيرها من المعايير المهمة المتعلقة بالسلامة). وقد طُبقت تقنيات تجميع البيانات ، مثل خريطة التنظيم الذاتي (SOM)، على رصد وتحليل اهتزازات مُغيرات الجهد تحت الحمل للمحولات (OLTCS). باستخدام رصد الاهتزازات، يُلاحظ أن كل عملية تغيير جهد تُولّد إشارة تحتوي على معلومات حول حالة نقاط تلامس مُغير الجهد وآليات التشغيل. من البديهي أن أوضاع تغيير الجهد المختلفة تُولّد إشارات مختلفة. ومع ذلك، لوحظ تباين كبير بين إشارات الحالة الطبيعية لنفس وضع تغيير الجهد. وقد طُبقت خريطة التنظيم الذاتي (SOM) للكشف عن الحالات الشاذة ووضع فرضيات حول طبيعة هذه الحالات. [ 24 ]
  • طُبقت أساليب استخراج البيانات على تحليل الغازات المذابة (DGA) في محولات الطاقة . ويُعدّ تحليل الغازات المذابة أداة تشخيصية متاحة منذ سنوات عديدة. وقد استُخدمت أساليب مثل SOM لتحليل البيانات المُولّدة وتحديد الاتجاهات التي لا تظهر بوضوح في طرق نسبة تحليل الغازات المذابة القياسية (مثل مثلث دوفال). [ 24 ]
  • في مجال البحوث التربوية، استُخدم استخراج البيانات لدراسة العوامل التي تدفع الطلاب إلى تبني سلوكيات تُعيق تعلمهم، [ 25 ] وفهم العوامل المؤثرة على استمرار الطلاب الجامعيين. [ 26 ] ومن الأمثلة المشابهة للتطبيقات الاجتماعية لاستخراج البيانات استخدامه في أنظمة البحث عن الخبرات ، حيث تُستخرج مؤشرات الخبرة البشرية، وتُوحّد، وتُصنّف لتسهيل العثور على الخبراء، لا سيما في المجالات العلمية والتقنية. وبهذه الطريقة، يُمكن لاستخراج البيانات أن يُعزز الذاكرة المؤسسية .
  • أساليب استخراج البيانات من البيانات الطبية الحيوية التي تسهلها أنطولوجيات المجال ، [ 27 ] واستخراج بيانات التجارب السريرية، [ 28 ] وتحليل حركة المرور باستخدام SOM. [ 29 ]
  • في مجال رصد الآثار الجانبية للأدوية، يستخدم مركز أوبسالا للرصد ، منذ عام 1998، أساليب استخراج البيانات لفحص أنماط الإبلاغ التي تشير إلى مشكلات سلامة الأدوية الناشئة بشكل روتيني في قاعدة بيانات منظمة الصحة العالمية العالمية التي تضم 4.6  مليون حالة مشتبه بها من الآثار الجانبية للأدوية . [ 30 ] ومؤخراً، طُوّرت منهجية مماثلة لاستخراج البيانات من مجموعات كبيرة من السجلات الصحية الإلكترونية بحثاً عن أنماط زمنية تربط وصفات الأدوية بالتشخيصات الطبية. [ 31 ]
  • تم تطبيق استخراج البيانات على مكونات البرمجيات في مجال هندسة البرمجيات : استخراج البيانات من مستودعات البرمجيات .
  • في مجال علم الأحياء الدقيقة، تم استخدام أساليب استخراج البيانات للتنبؤ بسلوك تجمعات البكتيريا في الغذاء. [ 32 ]

حقوق الإنسان

يُمكّن التنقيب عن البيانات في السجلات الحكومية، ولا سيما سجلات النظام القضائي (أي المحاكم والسجون)، من اكتشاف انتهاكات منهجية لحقوق الإنسان فيما يتعلق بإنشاء ونشر سجلات قانونية غير صالحة أو مزورة من قبل مختلف الوكالات الحكومية. [ 33 ] [ 34 ]

استخراج البيانات الطبية

يمكن تطبيق بعض خوارزميات التعلم الآلي في المجال الطبي كأدوات تشخيصية للحصول على رأي ثانٍ، وكأدوات لاستخلاص المعرفة في عملية اكتشافها في قواعد البيانات . أحد هذه المصنفات (يُسمى مصنف التعلم النموذجي ( PEL-C )) [ 35 ] قادر على اكتشاف المتلازمات والحالات السريرية غير النمطية.

يُعدّ علم الأيض أحد المجالات الطبية الحديثة التي تستخدم عملية استخراج البيانات ، وهو يُعنى بدراسة الجزيئات البيولوجية وكيفية تفاعلها مع سوائل الجسم والخلايا والأنسجة، وغيرها. [ 36 ] يُعتبر علم الأيض مجالًا غنيًا بالبيانات، وغالبًا ما يتطلب فرز كميات هائلة من البيانات غير ذات الصلة قبل التوصل إلى أي استنتاجات. وقد ساهم استخراج البيانات في نمو هذا المجال البحثي الطبي الحديث نسبيًا بشكل ملحوظ خلال العقد الماضي، ومن المرجح أن يكون الأسلوب المُعتمد في البحث العلمي الجديد في هذا المجال. [ 36 ]

في عام 2011، أصدرت المحكمة العليا للولايات المتحدة حكمًا في قضية سوريل ضد آي إم إس هيلث، يقضي بجواز مشاركة الصيدليات للمعلومات مع شركات خارجية. وقد أُجيزت هذه الممارسة بموجب التعديل الأول للدستور ، الذي يحمي "حرية التعبير". [ 37 ] ومع ذلك، ساهم إقرار قانون تقنية المعلومات الصحية للرعاية الصحية الاقتصادية والسريرية (قانون هايتك) في بدء اعتماد السجلات الصحية الإلكترونية والتقنيات الداعمة لها في الولايات المتحدة. [ 38 ] وقد تم توقيع قانون هايتك ليصبح قانونًا نافذًا في 17 فبراير 2009، كجزء من قانون الإنعاش وإعادة الاستثمار الأمريكي، مما ساهم في فتح المجال أمام استخراج البيانات الطبية. [ 39 ] قبل توقيع هذا القانون، تشير التقديرات إلى أن 20% فقط من الأطباء في الولايات المتحدة كانوا يستخدمون السجلات الإلكترونية للمرضى. [ 38 ] يشير سورين بروناك إلى أن "سجل المريض يصبح غنيًا بالمعلومات قدر الإمكان" وبالتالي "يزيد من فرص استخراج البيانات". [ 38 ] ومن ثم، فإن السجلات الإلكترونية للمرضى توسع بشكل أكبر إمكانيات استخراج البيانات الطبية مما يفتح الباب أمام مصدر هائل لتحليل البيانات الطبية.

استخراج البيانات المكانية

يُعرَّف استخراج البيانات المكانية بأنه تطبيق أساليب استخراج البيانات على البيانات المكانية. والهدف النهائي من استخراج البيانات المكانية هو اكتشاف الأنماط في البيانات المتعلقة بالجغرافيا. وحتى الآن، كان استخراج البيانات ونظم المعلومات الجغرافية (GIS) تقنيتين منفصلتين، لكل منهما أساليبها وتقاليدها ومناهجها الخاصة في عرض البيانات وتحليلها. وعلى وجه الخصوص، لا تمتلك معظم نظم المعلومات الجغرافية المعاصرة سوى وظائف تحليل مكاني أساسية للغاية. إلا أن الانفجار الهائل في البيانات المرجعية الجغرافية، الناتج عن التطورات في تكنولوجيا المعلومات، ورسم الخرائط الرقمية، والاستشعار عن بُعد، والانتشار العالمي لنظم المعلومات الجغرافية، يُؤكد على أهمية تطوير مناهج استقرائية قائمة على البيانات لتحليل البيانات الجغرافية ونمذجتها.

يُتيح استخراج البيانات فوائد هائلة لدعم اتخاذ القرارات التطبيقية القائمة على نظم المعلومات الجغرافية. وقد اكتسب دمج هاتين التقنيتين أهمية بالغة مؤخرًا، لا سيما مع إدراك العديد من مؤسسات القطاعين العام والخاص، التي تمتلك قواعد بيانات ضخمة تحتوي على بيانات موضوعية وجغرافية، للإمكانات الهائلة للمعلومات التي تتضمنها. ومن بين هذه المؤسسات:

  • المكاتب التي تتطلب تحليل أو نشر البيانات الإحصائية المرجعية الجغرافية
  • خدمات الصحة العامة تبحث عن تفسيرات لتجمع الأمراض
  • تقوم الوكالات البيئية بتقييم تأثير تغير أنماط استخدام الأراضي على تغير المناخ
  • شركات التسويق الجغرافي التي تقوم بتقسيم العملاء بناءً على الموقع المكاني.

تحديات التنقيب المكاني: تميل مستودعات البيانات الجغرافية المكانية إلى أن تكون ضخمة للغاية. علاوة على ذلك، غالبًا ما تُقسّم مجموعات بيانات نظم المعلومات الجغرافية الحالية إلى مكونات من المعالم والخصائص، والتي تُؤرشف عادةً في أنظمة إدارة البيانات الهجينة. تختلف المتطلبات الخوارزمية اختلافًا كبيرًا لإدارة البيانات العلائقية (الخصائص) عن إدارة البيانات الطوبولوجية (المعالم). [ 40 ] ويرتبط بذلك نطاق وتنوع تنسيقات البيانات الجغرافية، مما يطرح تحديات فريدة. تُحدث ثورة البيانات الجغرافية الرقمية أنواعًا جديدة من تنسيقات البيانات تتجاوز تنسيقات "المتجهات" و"الصور النقطية" التقليدية. تتضمن مستودعات البيانات الجغرافية بشكل متزايد بيانات غير منظمة، مثل الصور والوسائط المتعددة المرجعية الجغرافية. [ 41 ]

توجد عدة تحديات بحثية حاسمة في مجال اكتشاف المعرفة الجغرافية واستخراج البيانات. يقدم ميلر وهان [ 42 ] القائمة التالية لمواضيع البحث الناشئة في هذا المجال:

  • تطوير ودعم مستودعات البيانات الجغرافية : غالبًا ما تُختزل الخصائص المكانية إلى سمات بسيطة غير مكانية في مستودعات البيانات السائدة. يتطلب إنشاء مستودع بيانات جغرافي متكامل حل مشكلات قابلية التشغيل البيني للبيانات المكانية والزمانية، بما في ذلك الاختلافات في الدلالات، وأنظمة الإسناد، والهندسة، والدقة، والموقع.
  • تحسين التمثيلات المكانية والزمانية في اكتشاف المعرفة الجغرافية : تستخدم أساليب اكتشاف المعرفة الجغرافية الحالية تمثيلات بسيطة للغاية للأجسام الجغرافية والعلاقات المكانية. ينبغي لأساليب استخراج البيانات الجغرافية أن تتعرف على أجسام جغرافية أكثر تعقيدًا (مثل الخطوط والمضلعات) وعلاقات أكثر تعقيدًا (مثل المسافات غير الإقليدية، والاتجاه، والترابط، والتفاعل من خلال الفضاء الجغرافي المنسوب كالتضاريس). علاوة على ذلك، يجب دمج البُعد الزمني بشكل كامل في هذه التمثيلات والعلاقات الجغرافية.
  • اكتشاف المعرفة الجغرافية باستخدام أنواع البيانات المتنوعة : ينبغي تطوير أساليب اكتشاف المعرفة الجغرافية التي يمكنها التعامل مع أنواع البيانات المتنوعة التي تتجاوز نماذج البيانات النقطية والمتجهة التقليدية، بما في ذلك الصور والوسائط المتعددة المرجعية الجغرافية، بالإضافة إلى أنواع البيانات الديناميكية (تدفقات الفيديو والرسوم المتحركة).

استخراج البيانات الزمنية

قد تحتوي البيانات على سمات تم إنشاؤها وتسجيلها في أوقات مختلفة. في هذه الحالة، قد يتطلب إيجاد علاقات ذات دلالة في البيانات مراعاة الترتيب الزمني للسمات. قد تشير العلاقة الزمنية إلى علاقة سببية، أو مجرد ارتباط.

استخراج بيانات المستشعرات

يمكن استخدام شبكات الاستشعار اللاسلكية لتسهيل جمع البيانات لاستخراج البيانات المكانية في تطبيقات متنوعة، مثل رصد تلوث الهواء. [ 43 ] ومن خصائص هذه الشبكات أن عقد الاستشعار القريبة التي ترصد سمة بيئية ما تسجل عادةً قيمًا متشابهة. هذا النوع من تكرار البيانات، الناتج عن الترابط المكاني بين ملاحظات المستشعرات، يُلهم تقنيات تجميع البيانات واستخراجها داخل الشبكة. ومن خلال قياس الترابط المكاني بين البيانات التي تجمعها مستشعرات مختلفة، يمكن تطوير فئة واسعة من الخوارزميات المتخصصة لإنشاء خوارزميات أكثر كفاءة لاستخراج البيانات المكانية. [ 44 ]

استخراج البيانات المرئي

في عملية التحول من الأنظمة التناظرية إلى الرقمية، تم توليد مجموعات بيانات ضخمة وجمعها وتخزينها، مما أتاح اكتشاف أنماط إحصائية واتجاهات ومعلومات مخفية في البيانات، بهدف بناء أنماط تنبؤية. تشير الدراسات إلى أن التنقيب المرئي في البيانات أسرع وأكثر سهولة في الاستخدام من التنقيب التقليدي في البيانات. [ 45 ] [ 46 ] [ 47 ] انظر أيضًا: رؤية الحاسوب .

استخراج البيانات الموسيقية

استُخدمت تقنيات استخراج البيانات، ولا سيما تحليل التواجد المشترك ، لاكتشاف أوجه التشابه ذات الصلة بين مجموعات البيانات الموسيقية (قوائم الراديو، وقواعد بيانات الأقراص المدمجة) لأغراض تشمل تصنيف الموسيقى إلى أنواع بطريقة أكثر موضوعية. [ 48 ]

مراقبة

استخدمت الحكومة الأمريكية تقنيات استخراج البيانات. وتشمل هذه البرامج برنامج الوعي المعلوماتي الشامل (TIA)، وبرنامج الرحلات الآمنة (المعروف سابقًا باسم نظام الفحص المسبق للركاب بمساعدة الحاسوب ( CAPPS II ))، وبرنامج التحليل والنشر والتصور والتحليل والتحسين الدلالي ( ADVISE[ 49 ] وبرنامج تبادل المعلومات لمكافحة الإرهاب متعدد الولايات ( MATRIX ). [ 50 ] وقد تم إيقاف هذه البرامج بسبب الجدل الدائر حول ما إذا كانت تنتهك التعديل الرابع لدستور الولايات المتحدة، على الرغم من أن العديد من البرامج التي تم إنشاؤها في إطارها لا تزال ممولة من قبل منظمات مختلفة أو تحت مسميات مختلفة. [ 51 ]

في سياق مكافحة الإرهاب ، هناك طريقتان معقولتان بشكل خاص لاستخراج البيانات وهما "استخراج الأنماط" و"استخراج البيانات القائم على الموضوع".

استخراج الأنماط

يُعدّ "استخراج الأنماط" أسلوبًا من أساليب استخراج البيانات، ويهدف إلى إيجاد أنماط موجودة في البيانات. في هذا السياق، غالبًا ما تعني الأنماط قواعد الارتباط . وقد نشأ الدافع الأصلي للبحث عن قواعد الارتباط من الرغبة في تحليل بيانات معاملات المتاجر الكبرى، أي دراسة سلوك العملاء فيما يتعلق بالمنتجات التي يشترونها. على سبيل المثال، تنص قاعدة الارتباط "بيرة ⇒ رقائق بطاطس (80%)" على أن أربعة من كل خمسة عملاء اشتروا بيرة اشتروا أيضًا رقائق بطاطس.

في سياق استخراج الأنماط كأداة لتحديد النشاط الإرهابي، يقدم المجلس الوطني للبحوث التعريف التالي: "يبحث استخراج البيانات القائم على الأنماط عن أنماط (بما في ذلك أنماط البيانات الشاذة) التي قد تكون مرتبطة بنشاط إرهابي  - ويمكن اعتبار هذه الأنماط بمثابة إشارات صغيرة في محيط كبير من الضوضاء." [ 52 ] [ 53 ] [ 54 ] يشمل استخراج الأنماط مجالات جديدة مثل استرجاع المعلومات الموسيقية (MIR) حيث يتم استيراد الأنماط التي تُرى في كل من المجالات الزمنية وغير الزمنية إلى أساليب البحث الكلاسيكية لاكتشاف المعرفة.

استخراج البيانات القائم على الموضوع

يُعدّ "التنقيب في البيانات القائم على الموضوعات" أسلوبًا من أساليب التنقيب في البيانات يتضمن البحث عن علاقات بين الأفراد في البيانات. وفي سياق مكافحة الإرهاب، يُقدّم المجلس الوطني للبحوث التعريف التالي: "يستخدم التنقيب في البيانات القائم على الموضوعات فردًا مُبادرًا أو بيانات أخرى تُعتبر، بناءً على معلومات أخرى، ذات أهمية بالغة، والهدف هو تحديد الأشخاص الآخرين أو المعاملات المالية أو التحركات، وما إلى ذلك، المرتبطة بتلك البيانات المُبادرة." [ 53 ]

شبكة المعرفة

يشير مصطلح "اكتشاف المعرفة على الشبكة" عمومًا إلى إجراء اكتشاف المعرفة في بيئة مفتوحة باستخدام مفاهيم الحوسبة الشبكية ، مما يسمح للمستخدمين بدمج البيانات من مصادر بيانات متنوعة عبر الإنترنت، بالإضافة إلى الاستفادة من الموارد البعيدة، لتنفيذ مهام استخراج البيانات. وكان أول مثال على ذلك شبكة ديسكفري نت [ 55 ] [ 56 ] ، التي طُوّرت في إمبريال كوليدج لندن ، والتي فازت بجائزة "التطبيق الأكثر ابتكارًا في مجال البيانات المكثفة" في مؤتمر ومعرض ACM SC02 (الحوسبة الفائقة 2002)، استنادًا إلى عرض توضيحي لتطبيق تفاعلي كامل لاكتشاف المعرفة الموزعة في مجال المعلوماتية الحيوية. وتشمل الأمثلة الأخرى أعمالًا أجراها باحثون في جامعة كالابريا ، حيث طوروا بنية شبكة معرفية لاكتشاف المعرفة الموزعة، بالاعتماد على الحوسبة الشبكية . [ 57 ] [ 58 ]

مراجع

  1. آيت إساد، حسينة (أكتوبر 2019). "مراجعة شاملة لتقنيات استخراج البيانات في الزراعة الذكية" . الهندسة في الزراعة والبيئة والغذاء . 12 (4): 511-525 . Bibcode : 2019EAEF...12..511A . doi : 10.1016/j.eaef.2019.11.003 .
  2. فيروز، محمود سلطاني (2022). "الكشف عن العيوب في الفواكه والخضراوات باستخدام أنظمة الرؤية الآلية ومعالجة الصور" . Springer Nature Link . 14 (3): 353–379 . doi : 10.1007/s12393-022-09307-1 .
  3. هيل، إم جي؛ كونولي، بي جي؛ رويتمان، بي؛ فليتشر، دي. (2014-10-01). "استخدام التنقيب عن البيانات للمساعدة في اتخاذ قرارات حماية المحاصيل على فاكهة الكيوي في نيوزيلندا". الحوسبة والإلكترونيات في الزراعة . 108 : 250-257 . Bibcode : 2014CEAgr.108..250H . doi : 10.1016/j.compag.2014.08.011 .
  4. أورتوبيا، أليخاندرا؛ بيريز-كوريا، ج. ريكاردو؛ سوتو، ألفارو؛ بشتشولكوفسكي، فيليبو (1 ديسمبر 2007). "استخدام تقنيات استخراج البيانات للتنبؤ بمشاكل تخمير النبيذ الصناعي" . مراقبة الأغذية . 18 (12): 1512-1517 . doi : 10.1016/j.foodcont.2006.09.010 . ISSN 0956-7135 . 
  5. أحمدي، ح.؛ غوليان، أ.؛ متغيتلاب، م.؛ ناريمان زاده، ن. (1 سبتمبر 2008). "نموذج تنبؤي للطاقة الأيضية الحقيقية لمسحوق الريش ومسحوق مخلفات الدواجن باستخدام طريقة المجموعة للشبكات العصبية من نوع معالجة البيانات" . مجلة علوم الدواجن . 87 (9): 1909-1912 . doi : 10.3382/ps.2007-00507 . ISSN 0032-5791 . PMID 18753461 .  
  6. أحمدي، د. ح.؛ متغيتلاب، م.؛ ناريمان زاده، ن.؛ غوليان، أ. (1 مايو 2008). "التنبؤ بأداء دجاج التسمين من العناصر الغذائية باستخدام طريقة معالجة البيانات الجماعية للشبكات العصبية". مجلة علوم الدواجن البريطانية . 49 (3): 315-320 . doi : 10.1080/00071660802136908 . ISSN 0007-1668 . PMID 18568756. S2CID 205399055 .   
  7. مجتبى، طهموريسبور؛ حامد، أحمدي (2012-01-01). "نموذج الشبكة العصبية لوصف زيادة وزن الأغنام من تعدد أشكال الجينات، ووزن الولادة، ونوع الولادة" . علوم الثروة الحيوانية . ISSN 1871-1413 . 
  8. أحمدي، ح.؛ غوليان، أ. (2010-11-01). "دمج بيانات استجابات الثريونين في دجاج التسمين في نماذج الشبكات العصبية" . مجلة علوم الدواجن . 89 (11): 2535-2541 . doi : 10.3382/ps.2010-00884 . ISSN 0032-5791 . PMID 20952719 .  
  9. ^ أوبراين، جا، وماراكاس، جنرال موتورز (2011). نظم المعلومات الإدارية. نيويورك، نيويورك: ماكجرو هيل / إيروين.
  10. ألكسندر، دوغ. "استخراج البيانات" . جامعة تكساس في أوستن: كلية الآداب.
  11. "دانييلي ميدري: البيانات الضخمة والأعمال: ثورة مستمرة" . إحصاءات ووجهات نظر . ٢١ أكتوبر ٢٠١٣. مؤرشف من الأصل في ١٧ يونيو ٢٠١٥. تم الاطلاع عليه في ٢١ سبتمبر ٢٠١٥ .
  12. "تصنيف العناصر على نطاق واسع" (ملف PDF) . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 2015-10-05.
  13. غوس، س. (10 أبريل 2013). التنقيب عن البيانات وخصوصيتنا الشخصية. تم الاسترجاع من صحيفة التلغراف: "التنقيب عن البيانات وخصوصيتنا الشخصية | أخبار ذا صن | Macon.com" . مؤرشف من الأصل في 5 يوليو 2014. تم الاسترجاع في 21 سبتمبر 2015 .
  14. مونك، إيلين؛ فاغنر، بريت (2006). مفاهيم في تخطيط موارد المؤسسات، الطبعة الثانية . بوسطن، ماساتشوستس: تومسون كورس تكنولوجي. ISBN 978-0-619-21663-4. OCLC 224465825 . 
  15. تشالوتز-بن غال، هـ. (2023). روكاش، ل.؛ ميمون، أ.؛ شمويلي، إ. (محررون). "استخراج البيانات التنظيمية القائم على الموارد البشرية (HRODM): المواضيع، والاتجاهات، والتركيز، والمستقبل" (ملف PDF) . سبرينغر. ص 833-866 . 
  16. 1 2 3 إيلوفيتشي، يوفال؛ براها، دان (2003). "نهج قائم على نظرية القرار لاستخراج البيانات" (ملف PDF) . معاملات IEEE في الأنظمة والإنسان وعلم التحكم الآلي - الجزء أ: الأنظمة والبشر . 33 (1): 42-51 . Bibcode : 2003ITSMA..33...42E . doi : 10.1109/TSMCA.2003.812596 . hdl : 10150/105859 .
  17. باتيتي، روبرتو؛ وبروناتو، ماورو؛ ذكاء الأعمال التفاعلي. من البيانات إلى النماذج إلى الرؤى ، شركة رياكتيف سيرش، إيطاليا، فبراير 2011. ISBN 978-88-905795-0-9.
  18. باتيتي، روبرتو؛ باسيريني، أندريا (2010). "خوارزمية التحسين التطوري متعدد الأهداف بين الدماغ والحاسوب (BC-EMO): خوارزمية جينية تتكيف مع صانع القرار" (ملف PDF) . مجلة IEEE للمعاملات في الحوسبة التطورية . 14 (15): 671-687 . doi : 10.1109/TEVC.2010.2058118 . S2CID 2182650 . 
  19. براها، دان؛ إيلوفيتشي، يوفال؛ لاست، مارك (2007). "نظرية استخراج البيانات القابلة للتنفيذ مع تطبيق على التحكم في تصنيع أشباه الموصلات" (ملف PDF) . المجلة الدولية لبحوث الإنتاج . 45 (13): 3059-3084 . CiteSeerX 10.1.1.127.1472 . doi : 10.1080/00207540600654475 . S2CID 2299178 .  
  20. فونتين، توني؛ ديتريش، توماس؛ وسوديكا، بيل (2000)؛ استخراج بيانات اختبار الدوائر المتكاملة لتحسين اختبار الدوائر المتكاملة واسعة النطاق ، في وقائع المؤتمر الدولي السادس لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات، مطبعة ACM، الصفحات 18-25
  21. براها، دان؛ شميلوفيتشي، أرمين (2002). "استخراج البيانات لتحسين عملية التنظيف في صناعة أشباه الموصلات" (ملف PDF) . مجلة IEEE للمعاملات في تصنيع أشباه الموصلات . 15 (1): 91-101 . رمز Bibcode : 2002ITSM...15...91B . CiteSeerX 10.1.1.10.7921 . doi : 10.1109/66.983448 . 
  22. براها، دان؛ شميلوفيتشي، أرمين (2003). "حول استخدام استقراء شجرة القرار لاكتشاف التفاعلات في عملية الطباعة الضوئية" (ملف PDF) . معاملات IEEE في تصنيع أشباه الموصلات . 16 (4): 644-652 . Bibcode : 2003ITSM...16..644B . ​​doi : 10.1109/TSM.2003.818959 .
  23. تشو، شينغكوان؛ ديفيدسون، إيان (2007). اكتشاف المعرفة واستخراج البيانات: التحديات والواقع . نيويورك، نيويورك: هيرشي. ص 18. ISBN  978-1-59904-252-7.
  24. 1 2 ماكغريل، أنتوني جيه؛ غولسكي، إدوارد؛ آلان، ديفيد؛ بيرتويستل، ديفيد؛ بلاكبيرن، تريفور آر؛ غروت، إدوين آر إس "تقنيات استخراج البيانات لتقييم حالة محطات الطاقة الكهربائية ذات الجهد العالي". CIGRÉ WG 15.11 من لجنة الدراسة 15 .
  25. بيكر، رايان إس جيه د. "هل التلاعب هو حالة النظام أم سمة؟ التنقيب في البيانات التعليمية من خلال التطبيق متعدد السياقات لنموذج سلوكي تم التحقق من صحته". ورشة عمل حول التنقيب في البيانات لنمذجة المستخدم 2007 .
  26. سوبربي أغيري، خوان فرانسيسكو؛ فاندام، جان فيليب؛ ميسكنز، نادين. "تحديد العوامل المؤثرة على تحصيل طلاب السنة الأولى الجامعية باستخدام أساليب استخراج البيانات". ورشة عمل حول استخراج البيانات التعليمية 2006 .
  27. تشو، شينغكوان؛ ديفيدسون، إيان (2007). اكتشاف المعرفة واستخراج البيانات: التحديات والواقع . نيويورك، نيويورك: هيرشي. ص 163-189 . ISBN  978-1-59904-252-7.
  28. تشو، شينغكوان؛ ديفيدسون، إيان (2007). اكتشاف المعرفة واستخراج البيانات: التحديات والواقع . نيويورك، نيويورك: هيرشي. ص 31-48 . ISBN  978-1-59904-252-7.
  29. تشين، يودونغ؛ تشانغ، يي؛ هو، جيانمينغ؛ لي، شيانغ (2006). "تحليل بيانات المرور باستخدام تحليل المكونات الرئيسية النواة وخريطة التنظيم الذاتي". ندوة IEEE للمركبات الذكية 2006. الصفحات 472-477 . doi : 10.1109/IVS.2006.1689673 . ISBN  978-4-901122-86-3. S2CID 16645060 . 
  30. بيت، أندرو؛ ليندكويست، ماري؛ إدواردز، آي. رالف؛ أولسون، ستين؛ أور، رولاند؛ لانسنر، أندرس؛ دي فريتاس، روجيليو ميلادو (يونيو 1998). "طريقة الشبكة العصبية البايزية لتوليد إشارات التفاعلات الدوائية الضارة" (ملف PDF) . المجلة الأوروبية لعلم الصيدلة السريرية . 54 (4): 315-321 . doi : 10.1007 / s002280050466 . PMID 9696956. S2CID 25966839 .  
  31. نورين، جي. نيكلاس؛ بيت، أندرو؛ هوبستاديوس، يوهان؛ ستار، كريستينا؛ وإدواردز، آي. رالف (2008)؛ اكتشاف الأنماط الزمنية للاتجاهات والتأثيرات العابرة: تطبيقها على سجلات المرضى. وقائع المؤتمر الدولي الرابع عشر لاكتشاف المعرفة واستخراج البيانات (SIGKDD 2008)، لاس فيغاس، نيفادا ، الصفحات 963-971.
  32. هيورا، ساتوكو؛ كوسيكي، شيغي؛ كوياما، كينتو (19 مايو 2021). "التنبؤ بسلوك تجمعات بكتيريا الليستيريا المستوحدة في الغذاء باستخدام التعلم الآلي وقاعدة بيانات نمو وبقاء الميكروبات" . التقارير العلمية . 11 (1): 10613. Bibcode : 2021NatSR..1110613H . doi : 10.1038/s41598-021-90164- z . ISSN 2045-2322 . PMC 8134468. PMID 34012066 .   
  33. زيرنيك، جوزيف؛ التنقيب عن البيانات كواجب مدني - أنظمة تسجيل السجناء العامة عبر الإنترنت ، المجلة الدولية لوسائل التواصل الاجتماعي: الرصد والقياس والتنقيب ، 1: 84-96 (2010)
  34. زيرنيك، جوزيف؛ التنقيب عن البيانات في السجلات القضائية عبر الإنترنت للمحاكم الفيدرالية الأمريكية المتصلة بالشبكة ، المجلة الدولية لوسائل التواصل الاجتماعي: الرصد والقياس والتنقيب ، 1:69-83 (2010)
  35. غالياردي، ف. (2011). "المصنفات القائمة على الحالات المطبقة على قواعد البيانات الطبية: التشخيص واستخلاص المعرفة". الذكاء الاصطناعي في الطب . 52 (3): 123-139 . doi : 10.1016/j.artmed.2011.04.002 . PMID 21621400 . 
  36. 1 2 مارتينيز أرانز، إيبون؛ مايو، ريبيكا؛ بيريز كورمينزانا، ميريام؛ مينشولي، إيتزيار؛ سالازار، لورينا؛ ألونسو، كريستينا؛ ماتو، خوسيه م. (2015). “تعزيز أبحاث التمثيل الغذائي من خلال استخراج البيانات”. مجلة البروتينات . 127 (الجزء ب): 275-288 . دوى : 10.1016/j.jprot.2015.01.019 . بميد 25668325 . 
  37. ديفيد ج. سافاج (24 يونيو 2011). "صناعة الأدوية: المحكمة العليا تنحاز إلى صناعة الأدوية في قرارين" . صحيفة لوس أنجلوس تايمز . تاريخ الاسترجاع: 7 نوفمبر 2012 .
  38. 1 2 3 غوث، غريغوري (2012). "تحليل البيانات الطبية". اتصالات ACM . 55 (6): 13. doi : 10.1145/2184319.2184324 .
  39. "ما هو قانون HITECH (تكنولوجيا المعلومات الصحية للصحة الاقتصادية والسريرية) لعام 2009؟ | تعريف من TechTarget" .
  40. هيلي، ريتشارد ج. (1991)؛ نظم إدارة قواعد البيانات ، في ماغواير، ديفيد ج.؛ غودتشايلد، مايكل ف.؛ ورايند، ديفيد و.، (محررون)، نظم المعلومات الجغرافية: المبادئ والتطبيقات ، لندن، المملكة المتحدة: لونغمان
  41. كامارا، أنطونيو س.؛ ورابر، جوناثان (محرران) (1999)؛ الوسائط المتعددة المكانية والواقع الافتراضي ، لندن، المملكة المتحدة: تايلور وفرانسيس
  42. ميلر، هارفي جيه؛ وهان، جياوي (محرران) (2001)؛ التنقيب في البيانات الجغرافية واكتشاف المعرفة ، لندن، المملكة المتحدة: تايلور وفرانسيس
  43. ما، ي.؛ ريتشاردز، م.؛ غانم، م.؛ غو، ي.؛ هاسارد، ج. (2008). "رصد واستخراج بيانات تلوث الهواء باستخدام شبكة من أجهزة الاستشعار في لندن" . مجلة أجهزة الاستشعار . 8 (6): 3601-3623 . Bibcode : 2008Senso...8.3601M . doi : 10.3390/s8063601 . PMC 3714656. PMID 27879895 .  
  44. ما، ي.؛ غو، ي.؛ تيان، ش.؛ غانم، م. (2011). "خوارزمية تجميع موزعة قائمة على التجميع العنقودي لشبكات الاستشعار المترابطة مكانيًا". مجلة IEEE للمستشعرات . 11 (3): 641. Bibcode : 2011ISenJ..11..641M . CiteSeerX 10.1.1.724.1158 . doi : 10.1109/JSEN.2010.2056916 . S2CID 1639100 .  
  45. تشاو، كايدي؛ وليو، بينغ؛ وتيربارك، توماس م.؛ وويمين، شياو؛ إطار عمل لاستخراج البيانات المرئية لتحديد المعرفة المفيدة بسهولة
  46. كيم، دانيال أ.؛ تصور المعلومات واستخراج البيانات المرئية
  47. بيرش، مايكل؛ ديل، ستيفان؛ فايسجيربر، بيتر؛ التنقيب المرئي عن البيانات في أرشيفات البرمجيات
  48. باشيه، فرانسوا؛ ويسترمان، جيرت؛ ولايغر، داميان؛ استخراج البيانات الموسيقية لتوزيع الموسيقى الإلكترونية مؤرشف في 2014-03-27 في Wayback Machine ، وقائع المؤتمر الأول لـ WedelMusic، فلورنسا، إيطاليا، 2001، ص 101-106.
  49. مكتب محاسبة الحكومة، التنقيب عن البيانات: الاهتمام المبكر بالخصوصية في تطوير برنامج رئيسي لوزارة الأمن الداخلي قد يقلل المخاطر ، GAO-07-293 (فبراير 2007)، واشنطن العاصمة
  50. تقرير برنامج الرحلات الآمنة ، شبكة إن بي سي نيوز
  51. "التوعية الشاملة بالمعلومات المتعلقة بالإرهاب: هل انتهت حقًا؟" . مؤسسة الحدود الإلكترونية (الموقع الرسمي) . 2003. مؤرشف من الأصل بتاريخ 25 مارس 2009. تم الاطلاع عليه بتاريخ 15 مارس 2009 .
  52. ^ أغراوال، راكيش. مانيلا، هيكي؛ سريكانت، راماكريشنان؛ تويفونين، هانو؛ وفيركامو، أ. إنكيري؛ الاكتشاف السريع لقواعد الارتباط ، في التقدم في اكتشاف المعرفة واستخراج البيانات ، MIT Press، 1996، pp. 307–328
  53. 1 2 المجلس الوطني للبحوث، حماية خصوصية الأفراد في مكافحة الإرهاب: إطار لتقييم البرامج ، واشنطن العاصمة: مطبعة الأكاديميات الوطنية، 2008
  54. ↑ هاغ، ستيفن؛ كامينغز ، مايف؛ فيليبس، إيمي (2006). نظم المعلومات الإدارية لعصر المعلومات . تورنتو: ماكجرو هيل رايرسون. ص 28. ISBN  978-0-07-095569-1. OCLC 63194770 . 
  55. غانم، مصطفى؛ غو، ييكي؛ رو، أنتوني؛ ويندل، باتريك (2002). "خدمات اكتشاف المعرفة القائمة على الشبكة لمعلوماتية عالية الإنتاجية". وقائع الندوة الدولية الحادية عشرة لمعهد مهندسي الكهرباء والإلكترونيات حول الحوسبة الموزعة عالية الأداء . ص 416. doi : 10.1109/HPDC.2002.1029946 . ISBN  978-0-7695-1686-8. S2CID 28782519 . 
  56. غانم، مصطفى؛ كورسين، فاسا؛ ويندل، باتريك؛ غو، ييكي (2009). "بناء واستخدام سير العمل التحليلي في ديسكفري نت". تقنيات استخراج البيانات في بيئات الحوسبة الشبكية . ص 119. doi : 10.1002/9780470699904.ch8 . ISBN  9780470699904.
  57. كاناتارو، ماريو؛ تاليا، دومينيكو (يناير 2003). "شبكة المعرفة: بنية لاكتشاف المعرفة الموزعة" (ملف PDF) . مجلة اتصالات رابطة مكائن ​​الحوسبة . 46 (1): 89-93 . doi : 10.1145/602421.602425 . S2CID 8709194. مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 10 نوفمبر 2011. تم الاطلاع عليه بتاريخ 17 أكتوبر 2011 . 
  58. تاليا، دومينيكو؛ ترونفيو، باولو (يوليو 2010). "كيف يمكن لمهام استخراج البيانات الموزعة أن تزدهر كخدمات معرفية" (ملف PDF) . مجلة اتصالات ACM . 53 (7): 132-137 . CiteSeerX 10.1.1.378.2206 . doi : 10.1145/1785414.1785451 . S2CID 14713292. مؤرشف من الأصل (ملف PDF) بتاريخ 27 أكتوبر 2011. تم الاطلاع عليه بتاريخ 17 أكتوبر 2011 .  
  • ويكيبيديا: استخراج البيانات ويكيبيديا