تحليل مكونات الحي
يُعد تحليل مكونات الجوار أسلوبًا للتعلم الخاضع للإشراف لتصنيف البيانات متعددة المتغيرات إلى فئات متميزة وفقًا لمقياس مسافة محدد عبر البيانات. من الناحية الوظيفية، يخدم نفس أغراض خوارزمية أقرب الجيران K، ويستفيد بشكل مباشر من مفهوم ذي صلة يُسمى أقرب الجيران العشوائيين .
تعريف
يهدف تحليل مكونات الجوار إلى "تعلم" مقياس المسافة من خلال إيجاد تحويل خطي لبيانات الإدخال بحيث يتم تعظيم متوسط أداء تصنيف "حذف عنصر واحد" (LOO) في الفضاء المُحوَّل. وتكمن الفكرة الأساسية للخوارزمية في أن المصفوفةيمكن إيجاد التحويل المقابل من خلال تعريف دالة هدف قابلة للتفاضل لـثم استخدام خوارزمية حل تكرارية مثل خوارزمية التدرج المترافق . إحدى مزايا هذه الخوارزمية هي أن عدد الفئاتيمكن تحديدها كدالة لـ، حتى قيمة ثابتة عددية. وبالتالي، فإن استخدام هذه الخوارزمية يعالج مسألة اختيار النموذج .
توضيح
من أجل التعريفنُعرّف دالة هدف تصف دقة التصنيف في الفضاء المُحوّل ونحاول تحديدبحيث يتم تعظيم دالة الهدف هذه.
تصنيف حذف عنصر واحد (LOO)
لنفترض أننا نتنبأ بتصنيف نقطة بيانات واحدة من خلال توافق آراء- أقرب الجيران بمقياس مسافة محدد. يُعرف هذا بتصنيف "حذف واحد" . ومع ذلك، فإن مجموعة أقرب الجيرانقد تختلف النتائج اختلافًا كبيرًا بعد تطبيق تحويل خطي على جميع النقاط. على وجه التحديد، يمكن أن تخضع مجموعة النقاط المجاورة لنقطة ما لتغييرات منفصلة استجابةً لتغييرات سلسة في عناصرها.مما يعني أن أي دالة هدفبناءً على جيران نقطة ما، ستكون الدالة ثابتة جزئياً ، وبالتالي غير قابلة للتفاضل .
حل
يمكننا حل هذه الصعوبة باستخدام نهج مستوحى من انحدار التدرج العشوائي . بدلاً من النظر فيعند كل نقطة مُحوَّلة في تصنيف LOO، سنعتبر مجموعة البيانات المُحوَّلة بأكملها بمثابة أقرب الجيران العشوائيين . نُعرِّف هؤلاء باستخدام دالة softmax للمسافة الإقليدية التربيعية بين نقطة تصنيف LOO مُعطاة وكل نقطة أخرى في الفضاء المُحوَّل.
احتمالية تصنيف نقطة البيانات بشكل صحيحهي احتمالية تصنيف نقاط كل من جيرانها ضمن نفس الفئة:
أيناحتمال تصنيف الجارنقطة.
حدد دالة الهدف باستخدام تصنيف LOO، هذه المرة باستخدام مجموعة البيانات بأكملها كأقرب الجيران العشوائيين:
لاحظ أنه في ظل أقرب الجيران العشوائيين، فإن فئة التوافق لنقطة واحدةهي القيمة المتوقعة لفئة نقطة ما في حالة عدد لا نهائي من العينات المسحوبة من التوزيع على جيرانها.أي:وبالتالي، فإن الفئة المتوقعة هي مزيج خطي من فئات كل نقطة أخرى، مرجحة بدالة softmax لكل منها.أينوهي الآن مجموعة البيانات المحولة بالكامل.
يُفضّل اختيار دالة الهدف هذه لأنها قابلة للتفاضل بالنسبة إلى(دل):
الحصول على تدرج لـيعني هذا أنه يمكن إيجادها باستخدام خوارزمية حل تكرارية مثل خوارزمية التدرج المترافق . تجدر الإشارة إلى أنه عمليًا، تُصبح معظم الحدود الداخلية للتدرج ذات تأثير ضئيل نظرًا لتناقص تأثير النقاط البعيدة عن النقطة محل الاهتمام بسرعة. هذا يعني أنه يمكن اقتطاع المجموع الداخلي للتدرج، مما يُؤدي إلى أوقات حساب معقولة حتى مع مجموعات البيانات الكبيرة.
تركيبة بديلة
"تحقيق أقصى قدر منيعادل تقليلالمسافة بين التوزيع المتوقع للفئات والتوزيع الحقيقي للفئات (أي: حيثناتج عن(جميعها تساوي 1). البديل الطبيعي هو تباعد KL، والذي ينتج عنه دالة الهدف والتدرج التاليين: (Goldberger 2005)
عملياً، تحسينيؤدي استخدام هذه الوظيفة عادةً إلى نتائج أداء مماثلة لتلك التي تم الحصول عليها باستخدام الوظيفة الأصلية.
التاريخ والخلفية
تم تطوير تحليل مكونات الجوار بواسطة جاكوب غولدبيرغر، وسام رويس، ورسلان سالاخوتدينوف ، وجيوف هينتون في قسم علوم الحاسوب بجامعة تورنتو في عام 2004.
انظر أيضاً
مراجع
- ج. غولدبيرغر، ج. هينتون، س. رويس، ر. سالاخوتدينوف. (2005) تحليل مكونات الجوار. مؤرشف بتاريخ 23 فبراير 2005 على موقع Wayback Machine . التقدم في أنظمة معالجة المعلومات العصبية. 17، 513-520، 2005.
روابط خارجية
برمجة
- تحتوي مكتبة MLPACK على تطبيق بلغة C++
- nca ( C++ )
- تطبيق " NeighborhoodComponentsAnalysis " الخاص بمكتبة scikit-learn (باستخدام لغة بايثون )
- التصنيف الإحصائي
