تصنيف من فئة واحدة
في مجال التعلم الآلي ، يُعد التصنيف أحادي الفئة ( OCC )، المعروف أيضًا بالتصنيف الأحادي أو نمذجة الفئات ، نهجًا لتدريب المصنفات الثنائية حيث يتم استخدام أمثلة من إحدى الفئتين فقط. [ 1 ]
تشمل الأمثلة مراقبة علب تروس المروحيات، [ 2 ] [ 3 ] [ 4 ] والتنبؤ بأعطال المحركات، [ 5 ] أو تقييم الحالة التشغيلية لمحطة نووية على أنها "طبيعية": [ 6 ] في مثل هذه السيناريوهات، توجد أمثلة قليلة، إن وجدت، لحالات النظام الكارثية - وهي حالات شاذة نادرة - التي تشكل الفئة الثانية. بدلاً من ذلك، قد تغطي الفئة التي يتم التركيز عليها مجموعة فرعية صغيرة ومتماسكة من البيانات، وقد يعتمد التدريب على نهج عنق الزجاجة المعلوماتي . [ 7 ]
من الناحية العملية، يمكن استخدام الأمثلة المضادة من الفئة الثانية في جولات التدريب اللاحقة لتحسين الخوارزمية بشكل أكبر.
ملخص
صاغ مويا وهوش (1996) مصطلح التصنيف أحادي الفئة (OCC) [ 8 ] ، ويمكن إيجاد العديد من تطبيقاته في الأدبيات العلمية ، مثل كشف القيم الشاذة ، وكشف الحالات الشاذة ، وكشف الحالات الجديدة . ومن سمات التصنيف أحادي الفئة أنه يستخدم فقط نقاط عينة من الفئة المُخصصة، وبالتالي لا يُشترط بالضرورة أخذ عينة تمثيلية للفئات غير المستهدفة. [ 9 ]
مقدمة

يعتمد تصنيف الفئة الواحدة القائم على آلة المتجهات الداعمة (SVM) على تحديد أصغر كرة فائقة (نصف قطرها r ومركزها c) تضم جميع نقاط البيانات. [ 10 ] تُسمى هذه الطريقة وصف بيانات المتجهات الداعمة (SVDD). ويمكن تعريف المشكلة رسميًا في شكل التحسين المقيد التالي :
مع ذلك، فإن الصيغة المذكورة أعلاه مقيدة للغاية، وتتأثر بوجود القيم الشاذة. لذا، تم صياغة صيغة مرنة تسمح بوجود القيم الشاذة كما هو موضح أدناه.
من شروط كاروش-كون-تاكر للأمثلية، نحصل على
حيثتمثل هذه الحلول مشكلة التحسين التالية:
رهناً بـ
يُضفي إدخال دالة النواة مرونة إضافية على خوارزمية آلة المتجهات الداعمة أحادية الفئة (OSVM). [ 11 ]
التعلم الإيجابي غير المصنف (PU)
تُعدّ مشكلة التعلم PU مشكلة مماثلة ، حيث يتم بناء مصنف ثنائي من خلال التعلم شبه الموجه من نقاط العينة الإيجابية وغير المصنفة فقط . [ 12 ]
في التعلم الإيجابي، يُفترض وجود مجموعتين من الأمثلة للتدريب: المجموعة الإيجابيةومجموعة متنوعةيُفترض أن تحتوي هذه المجموعة على عينات موجبة وسالبة، دون تصنيفها على هذا النحو. وهذا يختلف عن أشكال التعلم شبه الموجه الأخرى، حيث يُفترض وجود مجموعة مصنفة تحتوي على أمثلة من كلا الفئتين، بالإضافة إلى العينات غير المصنفة. توجد تقنيات متنوعة لتكييف المصنفات الموجهة مع بيئة تعلم PU، بما في ذلك متغيرات خوارزمية EM . وقد طُبّق تعلم PU بنجاح على النصوص [ 13 ] [ 14 ] [ 15 ] ، والسلاسل الزمنية [16]، ومهام المعلوماتية الحيوية [ 17 ] [ 18 ] ، وبيانات الاستشعار عن بُعد [ 19 ] .
الأساليب
تم اقتراح العديد من الأساليب لحل مشكلة التصنيف أحادي الفئة (OCC). ويمكن تصنيف هذه الأساليب إلى ثلاث فئات رئيسية، وهي: تقدير الكثافة ، وطرق الحدود ، وطرق إعادة البناء . [ 6 ]
أساليب تقدير الكثافة
تعتمد أساليب تقدير الكثافة على تقدير كثافة نقاط البيانات وتحديد العتبة. وتعتمد هذه الأساليب على افتراض توزيعات معينة، مثل التوزيع الغاوسي أو توزيع بواسون . بعد ذلك، يمكن استخدام اختبارات التباين لاختبار العناصر الجديدة. وتتميز هذه الأساليب بمقاومتها لتغيرات المقياس.
يُعدّ نموذج غاوس [ 20 ] من أبسط الطرق لإنشاء مصنفات أحادية الفئة. وبفضل نظرية النهاية المركزية [ 21 ] ، تعمل هذه الطرق على أفضل وجه عند وجود عدد كبير من العينات، وتتأثر بقيم خطأ صغيرة مستقلة. يُعطى التوزيع الاحتمالي لكائن ذي أبعاد d بالصيغة التالية:
;\Sigma )={\frac {1}{(2\pi )^{\frac {d}{2}}|\Sigma |^{\frac {1}{2}}}}\exp \left\{-{\frac {1}{2}}(z-\mu )^{T}\Sigma ^{-1}(z-\mu )\right\}}
أين،هو المتوسط وهي مصفوفة التغاير . حساب معكوس مصفوفة التغاير (تُعدّ هذه العملية الأكثر تكلفة، وفي الحالات التي لا يتم فيها قياس البيانات بشكل صحيح، أو عندما تحتوي البيانات على اتجاهات مفردة، تُستخدم عملية شبه معكوسة.تُستخدم لتقريب المعكوس، ويتم حسابها على النحو التالي[ 22 ]
أساليب الحدود
تركز طرق الحدود على تحديد حدود حول مجموعة من النقاط، تُسمى النقاط المستهدفة. وتسعى هذه الطرق إلى تحسين الحجم. تعتمد طرق الحدود على المسافات، ولذلك فهي ليست قوية في مواجهة تغيرات المقياس. ومن الأمثلة الرئيسية على ذلك طريقة مراكز K، وNN-d، وSVDD.
مراكز التعليم الأساسي
في خوارزمية مركز K، [ 23 ]تُوضع كرات صغيرة متساوية القطر لتقليل أقصى مسافة بين جميع المسافات الدنيا بين الأجسام التدريبية والمراكز. وبصورة رسمية، يتم تقليل الخطأ التالي:
تستخدم الخوارزمية طريقة البحث الأمامي مع تهيئة عشوائية، حيث يتم تحديد نصف القطر بناءً على أقصى مسافة يجب أن تلتقطها أي كرة معينة للجسم. بعد تحديد المراكز، بالنسبة لأي جسم اختبار معينيمكن حساب المسافة على النحو التالي:
أساليب إعادة البناء
تستخدم أساليب إعادة البناء المعرفة المسبقة وعملية التوليد لإنشاء نموذج توليد يُناسب البيانات على أفضل وجه. ويمكن وصف الكائنات الجديدة بدلالة حالة نموذج التوليد. ومن أمثلة أساليب إعادة البناء في مجال الحوسبة السحابية: التجميع العنقودي k-means ، وتكميم المتجهات التعلمي، والخرائط ذاتية التنظيم، وغيرها.
التطبيقات
تصنيف الوثائق
يُدرَّب نموذج آلة المتجهات الداعمة (SVM) الأساسي باستخدام أمثلة إيجابية وسلبية، إلا أن الدراسات أظهرت وجود العديد من الأسباب الوجيهة لاستخدام الأمثلة الإيجابية فقط . عند تعديل خوارزمية SVM لاستخدام الأمثلة الإيجابية فقط، تُعتبر العملية تصنيفًا أحادي الفئة. ومن الحالات التي قد يكون فيها هذا النوع من التصنيف مفيدًا لنموذج SVM، محاولة تحديد مواقع الويب التي تهم المستخدم بناءً على سجل تصفحه فقط.
الدراسات الطبية الحيوية
يُعدّ التصنيف أحادي الفئة مفيدًا بشكل خاص في الدراسات الطبية الحيوية، حيث يصعب أو يستحيل في كثير من الأحيان الحصول على بيانات من فئات أخرى. عند دراسة البيانات الطبية الحيوية، قد يكون من الصعب و/أو المكلف الحصول على مجموعة البيانات المصنفة من الفئة الثانية اللازمة لإجراء تصنيف ثنائي الفئة. وقد وجدت دراسة نُشرت في مجلة "ذا ساينتيفيك وورلد جورنال" أن منهج النموذجية هو الأكثر فائدة في تحليل البيانات الطبية الحيوية، لأنه قابل للتطبيق على أي نوع من مجموعات البيانات (المتصلة، أو المنفصلة، أو الاسمية). [ 24 ] يعتمد منهج النموذجية على تجميع البيانات من خلال فحصها ووضعها في مجموعات جديدة أو موجودة. [ 25 ] لتطبيق النموذجية على التصنيف أحادي الفئة في الدراسات الطبية الحيوية، يتم إدخال كل ملاحظة جديدة،، تتم مقارنتها بالفئة المستهدفة،وتم تحديدها كحالة شاذة أو كعضو في الفئة المستهدفة. [ 24 ]
الكشف عن انحراف المفهوم غير الخاضع للإشراف
يتشابه تصنيف الفئة الواحدة مع كشف انحراف المفاهيم غير الخاضع للإشراف، حيث يهدف كلاهما إلى تحديد ما إذا كانت البيانات غير المرئية تشترك في خصائص مماثلة مع البيانات الأولية. يُشار إلى المفهوم على أنه توزيع احتمالي ثابت تُستمد منه البيانات. في كشف انحراف المفاهيم غير الخاضع للإشراف، يتمثل الهدف في اكتشاف ما إذا كان توزيع البيانات يتغير دون استخدام تصنيفات الفئات. في تصنيف الفئة الواحدة، لا يُعد تدفق البيانات مهمًا. تُصنف البيانات غير المرئية على أنها نموذجية أو شاذة بناءً على خصائصها، سواء كانت من المفهوم الأولي أم لا. مع ذلك، يراقب كشف الانحراف غير الخاضع للإشراف تدفق البيانات، ويُشير إلى الانحراف في حال وجود قدر كبير من التغيير أو الشذوذ. يمكن اعتبار كشف انحراف المفاهيم غير الخاضع للإشراف الشكل المستمر لتصنيف الفئة الواحدة. [ 26 ] تُستخدم مصنفات الفئة الواحدة لكشف انحرافات المفاهيم. [ 27 ]
انظر أيضاً
مراجع
- ↑ أوليڤيري، ب. (أغسطس 2017). "نمذجة الفئات في الكيمياء التحليلية للأغذية: قضايا التطوير، وأخذ العينات، والتحسين، والتحقق - دليل إرشادي". مجلة Analytica Chimica Acta . 982 : 9-19 . Bibcode : 2017AcAC..982....9O . doi : 10.1016/j.aca.2017.05.013 . hdl : 11567/881059 . PMID 28734370 .
- ↑ Japkowicz N, Myers C, Gluck M (1995). "نهج الكشف عن الحالات الجديدة في التصنيف". الصفحات 518-523 . CiteSeerX 10.1.1.40.3663 .
- ↑ جابكوفيتش ن (1999). تعلم المفاهيم في غياب الأمثلة المضادة: نهج قائم على الارتباط الذاتي للتصنيف (أطروحة). جامعة روتجرز.
- ↑ جابكوفيتش ن (2001). "التعلم الثنائي الخاضع للإشراف مقابل التعلم الثنائي غير الخاضع للإشراف باستخدام الشبكات العصبية ذات التغذية الأمامية" (ملف PDF) . تعلم الآلة . 42 : 97-122 . doi : 10.1023/A:1007660820062 . S2CID 7298189 .
- ↑ بيتسش تي، ماركانتونيو أ، داركن سي، هانسون إس، كون جي، سانتوسو آي (1996). "شبكة عصبية ذاتية الربط للتنبؤ بفشل المحركات الحثية" (ملف PDF) . NIPS.
- 1 2 تاكس د (2001). التصنيف أحادي الفئة: تعلم المفاهيم في غياب الأمثلة المضادة (ملف PDF) (أطروحة دكتوراه). هولندا: جامعة دلفت.
- ↑ كرامر، كوبي (2004). "إبرة في كومة قش" . المؤتمر الدولي الحادي والعشرون للتعلم الآلي - ICML '04 . ص 26. doi : 10.1145/1015330.1015399 . ISBN 978-1-58113-838-2. S2CID 8736254 .
- ↑ مويا، م.؛ هَش، د. (1996). "قيود الشبكة والتحسين متعدد الأهداف لتصنيف فئة واحدة". الشبكات العصبية . 9 (3): 463-474 . doi : 10.1016/0893-6080(95)00120-4 .
- ↑ روديونوفا، أو. واي.، أوليڤيري، ب.، بوميرانتسيف، أ. ل. (15 ديسمبر 2016). "مناهج صارمة ومتوافقة لتصنيف أحادي الفئة". علم القياس الكيميائي وأنظمة المختبرات الذكية . 159 : 89-96 . doi : 10.1016/j.chemolab.2016.10.002 . hdl : 11567/864539 .
- ↑ زينب، نومير؛ هونين، بول؛ ريتشارد، سيدو (2012). "حول أساليب التصنيف البسيطة أحادية الفئة". وقائع ندوة IEEE الدولية حول نظرية المعلومات . IEEE، 2012.
- ↑ خان، شهروز س.؛ مادن، مايكل ج. (2010). "دراسة استقصائية للاتجاهات الحديثة في تصنيف الفئة الواحدة". في: كويل، لوركان؛ فرين، جيل (محرران). الذكاء الاصطناعي والعلوم المعرفية . سلسلة محاضرات في علوم الحاسوب. المجلد 6206. سبرينغر برلين هايدلبرغ. الصفحات 188-197 . doi : 10.1007/978-3-642-17080-5_21 . hdl : 10379/1472 . ISBN 978-3-642-17080-5. S2CID 36784649 .
- ↑ ليو، بينغ (2007). استخراج البيانات من الويب . سبرينغر. ص 165-178 .
- ↑ بينغ ليو؛ وي صن لي؛ فيليب إس. يو وشياو لي لي (2002). التصنيف الجزئي الخاضع للإشراف للوثائق النصية . المؤتمر الدولي للتعلم الآلي. الصفحات 8-12 .
- ↑ هوانجو يو؛ جياوي هان؛ كيفن تشين-تشوان تشانغ (2002). PEBL: التعلم القائم على الأمثلة الإيجابية لتصنيف صفحات الويب باستخدام SVM . ACM SIGKDD.
- ↑ شياو لي لي وبينغ ليو (2003). تعلم تصنيف النصوص باستخدام البيانات الإيجابية وغير المصنفة . المؤتمر الدولي المشترك للذكاء الاصطناعي.
- ↑ مينه نهوت نغوين؛ شياو لي لي وسي كيونغ نغ (2011). التعلم الإيجابي غير المصنف لتصنيف السلاسل الزمنية . المؤتمر الدولي المشترك للذكاء الاصطناعي.
- ^ بنغ يانغ. شياو لي لي؛ جيان بينغ مي؛ تشي كيونج كوه وسي كيونج نج (2012). التعلم الإيجابي غير المسمى لتحديد جينات المرض . المعلوماتية الحيوية، المجلد 28(20).
- ↑ بوغنون، إل إيه؛ يونيس، سي؛ ميلون، دي إتش؛ وستيغماير، جي. (2020). "اكتشاف ما قبل الحمض النووي الريبوزي الميكروي على مستوى الجينوم: مقارنة بين المناهج الحديثة القائمة على التعلم الآلي". معلوماتية أكسفورد الحيوية . 22 (3). doi : 10.1093/bib/bbaa184 . PMID 32814347 .
- ↑ لي، و.؛ غو، ك.؛ إلكان، س. (فبراير 2011). "خوارزمية تعلم إيجابية وغير مصنفة لتصنيف بيانات الاستشعار عن بعد إلى فئة واحدة". معاملات IEEE في علوم الأرض والاستشعار عن بعد . 49 (2): 717-725 . Bibcode : 2011ITGRS..49..717L . doi : 10.1109/TGRS.2010.2058578 . ISSN 0196-2892 . S2CID 267120 .
- ↑ بيشوب، كريستوفر م.؛ بيشوب، أستاذ الحوسبة العصبية كريستوفر م. (23-11-1995). الشبكات العصبية للتعرف على الأنماط . مطبعة كلارندون. ISBN 978-0-19-853864-6.
- ↑ أولمان، نيل ر (2017-01-01). الإحصاءات الأولية .
- ↑ "مقدمة في الرياضيات التطبيقية" . مكتبة SIAM . تم الاطلاع عليه بتاريخ 29-04-2019 .
- ^ يبما ، الكسندر. دوين، روبرت بي دبليو (1998). "كائنات الدعم لتقريب المجال". في نيكلاسون، لارس؛ بودين، ميكائيل. زيمكي، توم (محرران). ايكان 98 . وجهات نظر في الحوسبة العصبية. سبرينغر لندن. ص 719 – 724. دوى : 10.1007 / 978-1-4471-1599-1_110 . رقم ISBN 978-1-4471-1599-1.
- 1 2 إيريجوين، آي.، سييرا ، ب.، أريناس، سي. (2014). "نحو تطبيق أساليب التصنيف أحادي الفئة على البيانات الطبية" . مجلة العالم العلمي . 2014 730712. doi : 10.1155/2014/730712 . PMC 3980920. PMID 24778600 .
- ↑ إيريغوين، آي.، وأريناس، سي. (يوليو 2008). "INCA: إحصائية جديدة لتقدير عدد المجموعات وتحديد الوحدات غير النمطية". الإحصاء في الطب . 27 (15): 2948-2973 . doi : 10.1002/sim.3143 . PMID 18050154. S2CID 24791212 .
- ↑ غوزواتشيك، عمر؛ جان، فازلي (نوفمبر 2020). "تعلم المفاهيم باستخدام مصنفات أحادية الفئة للكشف الضمني عن الانحراف في تدفقات البيانات المتطورة". مراجعة الذكاء الاصطناعي . 54 (5): 3725-3747 . doi : 10.1007/s10462-020-09939-x . hdl : 11693/77042 . S2CID 229506136 .
- ↑ كراوتشيك، بارتوش؛ ووزنياك، ميخال (2015). "مصنفات أحادية الفئة مع التعلم التدريجي والنسيان لتدفقات البيانات مع انحراف المفهوم" . الحوسبة المرنة . 19 (12): 3387-3400 . doi : 10.1007/s00500-014-1492-5 . S2CID 207011971 .
- التصنيف الإحصائي
- خوارزميات التصنيف
