البيانات المصنفة

البيانات المصنفة هي مجموعة من العينات التي تم وسمها بعلامة واحدة أو أكثر. تعتمد عملية التصنيف عادةً على مجموعة من البيانات غير المصنفة، حيث يتم إضافة علامات تعريفية لكل جزء منها تُسمى "التقييمات" . على سبيل المثال، قد تشير علامة البيانات إلى ما إذا كانت الصورة تحتوي على حصان أو بقرة، أو الكلمات المنطوقة في تسجيل صوتي، أو نوع الحركة في مقطع فيديو، أو موضوع مقال إخباري، أو الانطباع العام لتغريدة، أو ما إذا كانت النقطة الظاهرة في صورة الأشعة السينية ورمًا.

يمكن الحصول على التصنيفات من خلال قيام البشر بإصدار أحكام حول جزء معين من البيانات غير المصنفة. [ 1 ] وتُعد البيانات المصنفة أكثر تكلفة بكثير من البيانات الخام غير المصنفة.

تؤثر جودة البيانات المصنفة بشكل مباشر على أداء نماذج التعلم الآلي الخاضعة للإشراف أثناء التشغيل، حيث تتعلم هذه النماذج من التصنيفات المقدمة. [ 2 ]

بيانات مصنفة تم جمعها من مصادر جماعية

في عام 2006، بدأت فاي فاي لي ، المديرة المشاركة لمعهد ستانفورد للذكاء الاصطناعي المتمحور حول الإنسان، بحثًا لتحسين نماذج وخوارزميات الذكاء الاصطناعي للتعرف على الصور من خلال توسيع نطاق بيانات التدريب بشكل كبير . قام الباحثون بتنزيل ملايين الصور من شبكة الإنترنت العالمية ، وبدأ فريق من طلاب المرحلة الجامعية الأولى في تصنيف كل صورة. في عام 2007، أوكلت لي مهمة تصنيف البيانات إلى منصة أمازون ميكانيكال ترك ، وهي سوق إلكترونية للعمل الحر الرقمي . شكلت 3.2 مليون صورة، تم تصنيفها بواسطة أكثر من 49,000 عامل، أساسًا لقاعدة بيانات ImageNet ، وهي إحدى أكبر قواعد البيانات المصنفة يدويًا للتعرف على مخططات الأشياء . [ 3 ]

تصنيف البيانات الآلي

بعد الحصول على مجموعة بيانات مصنفة، يمكن تطبيق نماذج التعلم الآلي على البيانات بحيث يمكن تقديم بيانات جديدة غير مصنفة إلى النموذج، ويمكن تخمين أو توقع تصنيف محتمل لتلك البيانات غير المصنفة. [ 4 ]

التحديات

التحيز القائم على البيانات

تخضع عملية اتخاذ القرارات الخوارزمية للتحيز الناتج عن المبرمج، بالإضافة إلى التحيز الناتج عن البيانات. فبيانات التدريب التي تعتمد على بيانات مصنفة بشكل متحيز ستؤدي إلى تحيزات وإغفالات في النموذج التنبؤي ، حتى وإن كانت خوارزمية التعلم الآلي سليمة. يجب أن تكون البيانات المصنفة المستخدمة لتدريب خوارزمية تعلم آلي معينة عينة تمثيلية إحصائيًا لتجنب تحيز النتائج. [ 5 ] على سبيل المثال، في أنظمة التعرف على الوجوه ، غالبًا ما يتم تصنيف المجموعات الممثلة تمثيلًا ناقصًا بشكل خاطئ إذا لم تكن البيانات المصنفة المتاحة للتدريب ممثلة للسكان. في عام 2018، أظهرت دراسة أجرتها جوي بولامويني وتيمنيت جبرو أن مجموعتي بيانات تحليل الوجه المستخدمتين لتدريب خوارزميات التعرف على الوجوه، وهما IJB-A وAdience، تتكونان من 79.6% و86.2% من ذوي البشرة الفاتحة على التوالي. [ 6 ]

الخطأ البشري وعدم الاتساق

يُعدّ المُصنّفون البشريون عُرضةً للأخطاء والتحيّزات عند تصنيف البيانات، مما قد يؤدي إلى تصنيفات غير متسقة ويؤثر على جودة مجموعة البيانات. وقد يؤثر هذا التناقض بدوره على قدرة نموذج التعلّم الآلي على التعميم بشكل جيد. [ 7 ]

الخبرة في المجال

تتطلب بعض المجالات، مثل تحليل الوثائق القانونية أو التصوير الطبي ، مُعلِّقين ذوي معرفة متخصصة في المجال. وبدون هذه الخبرة، قد تكون التعليقات أو البيانات المصنفة غير دقيقة، مما يؤثر سلبًا على أداء نموذج التعلم الآلي في سيناريو واقعي. [ 8 ]

انظر أيضاً

مراجع

  1. "ما هو تصنيف البيانات؟ - شرح تصنيف البيانات - AWS" . شركة أمازون لخدمات الويب . تم الاطلاع عليه بتاريخ 16 يوليو 2024 .
  2. فريدريكسون، تيودور؛ ماتوس، ديفيد عيسى؛ بوش، يان؛ أولسون، هيلينا هولمستروم (2020)، "تصنيف البيانات: دراسة تجريبية للتحديات الصناعية واستراتيجيات التخفيف منها" ، في موريسيو، ماوريتسيو؛ تورشيانو، ماركو؛ جيدليتشكا، أندرياس (محررون)، تحسين عملية البرمجيات الموجهة نحو المنتج ، المجلد 12562، تشام: دار نشر سبرينغر الدولية، الصفحات 202-216 ، doi : 10.1007/978-3-030-64148-1_13 ، ISBN   978-3-030-64147-4تم الاطلاع عليه بتاريخ 13 يوليو 2024
  3. ماري ل. غراي؛ سيدهارث سوري (2019). العمل الخفي: كيف نمنع وادي السيليكون من بناء طبقة دنيا عالمية جديدة . هوتون ميفلين هاركورت. ص 7. ISBN  978-1-328-56628-7.
  4. جونسون، ليف. "ما الفرق بين البيانات المصنفة وغير المصنفة؟" ، ستاك أوفرفلو ، 4 أكتوبر 2013. تم الاطلاع عليه في 13 مايو 2017. يتضمن هذا المقال نصًا من تأليف lmjohns3 متاح بموجب ترخيص CC BY-SA 3.0 . 
  5. شيان هونغ هو؛ بهانو نيوبان؛ لوسيا فلوريس إيشايز؛ براتيك سيبال؛ ماكارينا ريفيرا لام (2019). توجيه الذكاء الاصطناعي وتكنولوجيا المعلومات والاتصالات المتقدمة لمجتمعات المعرفة: منظور الحقوق والانفتاح وإمكانية الوصول وتعدد أصحاب المصلحة . منشورات اليونسكو. ص 64. ISBN  978-92-3-100363-9.
  6. شيان هونغ هو؛ بهانو نيوبان؛ لوسيا فلوريس إيشايز؛ براتيك سيبال؛ ماكارينا ريفيرا لام (2019). توجيه الذكاء الاصطناعي وتكنولوجيا المعلومات والاتصالات المتقدمة لمجتمعات المعرفة: منظور الحقوق والانفتاح وإمكانية الوصول وتعدد أصحاب المصلحة . منشورات اليونسكو. ص 66. ISBN  978-92-3-100363-9.
  7. ^ جيجر، ر. ستيوارت؛ كوب، دومينيك؛ ايب جيمي. لوتوش، مارشا؛ شاه، عيوش؛ ونغ، جيني. تانغ ، ريبيكا (2021-11-05). ""مدخلات رديئة، مخرجات رديئة": ماذا تُشير إليه الأبحاث التطبيقية في مجال التعلّم الآلي حول بيانات التدريب المصنفة يدويًا؟ دراسات العلوم الكمية . 2 (3): 795-827 . arXiv : 2107.02278 . doi : 10.1162/qss_a_00144 . ISSN 2641-3337 . 
  8. الزبيدي، ليث؛ باي، جينشواي؛ السبعاوي، أيمن؛ سانتاماريا، خوسيه؛ البحري، ع. الدباغ، بشار سامي نايف؛ فاضل، محمد أ؛ منوفلي، محمد؛ تشانغ، جينجلان. التميمي، علي ح؛ دوان، يي؛ عبد الله، أمجد؛ فرحان، ليث؛ لو، يي؛ غوبتا ، اشيش (2023/04/14). "مسح حول أدوات التعلم العميق التي تتناول ندرة البيانات: التعريفات والتحديات والحلول والنصائح والتطبيقات" . مجلة البيانات الضخمة . 10 (1): 46. دوى : 10.1186/s40537-023-00727-2 . ISSN 2196-1115 .