اختيار الميزات
في مجال التعلم الآلي، يُعد اختيار الميزات عملية انتقاء مجموعة فرعية من الميزات ذات الصلة (المتغيرات، والمتنبئات) لاستخدامها في بناء النموذج. وتُستخدم تقنيات اختيار الميزات لعدة أسباب:
- تبسيط النماذج لتسهيل تفسيرها، [ 1 ]
- أوقات تدريب أقصر، [ 2 ]
- لتجنب لعنة الأبعاد ، [ 3 ]
- تحسين توافق البيانات مع فئة معينة من نماذج التعلم، [ 4 ]
- لترميز التناظرات الكامنة الموجودة في فضاء الإدخال. [ 5 ] [ 6 ] [ 7 ] [ 8 ]
تتمثل الفرضية الأساسية عند استخدام اختيار الميزات في أن البيانات قد تحتوي أحيانًا على ميزات زائدة أو غير ذات صلة ، وبالتالي يمكن إزالتها دون فقدان كبير للمعلومات. [ 9 ] التكرار وعدم الصلة مفهومان مختلفان، إذ قد تكون إحدى الميزات ذات الصلة زائدة في وجود ميزة أخرى ذات صلة ترتبط بها ارتباطًا وثيقًا. [ 10 ]
تُنشئ عملية استخلاص الميزات ميزات جديدة من وظائف الميزات الأصلية، بينما تحدد عملية اختيار الميزات مجموعة فرعية من الميزات. تُستخدم تقنيات اختيار الميزات غالبًا في المجالات التي تحتوي على العديد من الميزات وعدد قليل نسبيًا من العينات (نقاط البيانات).
مقدمة
يمكن اعتبار خوارزمية اختيار الميزات مزيجًا من تقنية بحث لاقتراح مجموعات فرعية جديدة من الميزات، ومقياس تقييم يُقيّم هذه المجموعات. أبسط خوارزمية هي اختبار كل مجموعة فرعية ممكنة من الميزات للعثور على المجموعة التي تُقلل معدل الخطأ. هذا بحث شامل في الفضاء، وهو غير قابل للتطبيق حسابيًا إلا على أصغر مجموعات الميزات. يؤثر اختيار مقياس التقييم بشكل كبير على الخوارزمية، وهذه المقاييس هي التي تُميز بين الفئات الرئيسية الثلاث لخوارزميات اختيار الميزات: التغليف، والمرشحات، والأساليب المُضمنة. [ 10 ]
- تستخدم أساليب التغليف نموذجًا تنبؤيًا لتقييم مجموعات فرعية من الميزات. تُستخدم كل مجموعة فرعية جديدة لتدريب نموذج، يُختبر بدوره على مجموعة بيانات منفصلة. يُحسب عدد الأخطاء التي ارتُكبت على هذه المجموعة (معدل خطأ النموذج) للحصول على تقييم تلك المجموعة الفرعية. ونظرًا لأن أساليب التغليف تُدرّب نموذجًا جديدًا لكل مجموعة فرعية، فإنها تتطلب موارد حاسوبية كبيرة، ولكنها عادةً ما تُقدّم أفضل مجموعة ميزات أداءً لهذا النوع من النماذج أو للمشكلة النموذجية.
- تستخدم طرق التصفية مقياسًا بديلًا بدلًا من معدل الخطأ لتقييم مجموعة فرعية من الميزات. يُختار هذا المقياس ليكون سريع الحساب، مع الحفاظ على فائدته لمجموعة الميزات. تشمل المقاييس الشائعة المعلومات المتبادلة [ 10 ] ، والمعلومات المتبادلة النقطية [ 11 ] ، ومعامل ارتباط بيرسون ، والخوارزميات القائمة على Relief [ 12 ] ، والمسافة بين الفئات/داخلها، أو نتائج اختبارات الدلالة لكل مجموعة من الفئات/الميزات [ 11 ] [ 13 ] . عادةً ما تكون المرشحات أقل استهلاكًا للموارد الحاسوبية من التغليف، لكنها تُنتج مجموعة ميزات غير مُخصصة لنوع مُحدد من نماذج التنبؤ [ 14 ] . هذا النقص في التخصيص يعني أن مجموعة الميزات الناتجة عن المرشح تكون أكثر عمومية من تلك الناتجة عن التغليف، مما يُؤدي عادةً إلى أداء تنبؤي أقل. مع ذلك، لا تحتوي مجموعة الميزات على افتراضات نموذج التنبؤ، وبالتالي فهي أكثر فائدة في إظهار العلاقات بين الميزات. تُقدّم العديد من المرشحات ترتيبًا للميزات بدلًا من تحديد أفضل مجموعة فرعية منها، ويتم اختيار نقطة القطع في الترتيب عبر التحقق المتبادل . كما استُخدمت طرق الترشيح كخطوة تمهيدية لطرق التغليف، مما يسمح باستخدام التغليف على مسائل أكبر. ومن الأساليب الشائعة الأخرى خوارزمية الإزالة المتكررة للميزات [ 15 ]، والتي تُستخدم عادةً مع آلات المتجهات الداعمة لبناء نموذج بشكل متكرر وإزالة الميزات ذات الأوزان المنخفضة.
- الأساليب المضمنة هي مجموعة شاملة من التقنيات التي تُجري عملية اختيار الميزات كجزء من عملية بناء النموذج. ومن الأمثلة على هذا النهج طريقة LASSO لبناء نموذج خطي، والتي تُعاقب معاملات الانحدار بعقوبة L1، مما يُقلص العديد منها إلى الصفر. ويتم "اختيار" أي ميزات ذات معاملات انحدار غير صفرية بواسطة خوارزمية LASSO. تشمل التحسينات التي أُدخلت على LASSO ما يلي: Bolasso الذي يُعيد أخذ العينات؛ [ 16 ] تنظيم الشبكة المرنة ، الذي يجمع بين عقوبة L1 في LASSO وعقوبة L2 في انحدار ريدج ؛ وFeaLect الذي يُقيّم جميع الميزات بناءً على التحليل التوافقي لمعاملات الانحدار. [ 17 ] كما تُوسّع AEFS نطاق LASSO ليشمل السيناريوهات غير الخطية باستخدام المشفرات التلقائية. [ 18 ] تميل هذه الأساليب إلى أن تكون متوسطة بين المرشحات والأغلفة من حيث التعقيد الحسابي.
في تحليل الانحدار التقليدي، يُعدّ الانحدار التدريجي الشكل الأكثر شيوعًا لاختيار الميزات ، وهو أسلوب تغليف. وهو خوارزمية جشعة تُضيف أفضل ميزة (أو تحذف أسوأ ميزة) في كل جولة. تكمن المشكلة الرئيسية في تحديد وقت إيقاف الخوارزمية. في التعلّم الآلي، يتم ذلك عادةً عن طريق التحقق المتبادل . أما في الإحصاء، فيتم تحسين بعض المعايير، مما يؤدي إلى مشكلة التداخل المتأصلة. وقد تم استكشاف طرق أكثر فعالية، مثل التفرع والتقييد والشبكة الخطية القطعية.
اختيار مجموعة فرعية
يُقيّم اختيار المجموعة الفرعية مجموعةً فرعيةً من الميزات كمجموعةٍ واحدةٍ لتحديد مدى ملاءمتها. يمكن تقسيم خوارزميات اختيار المجموعة الفرعية إلى أغلفة، ومرشحات، وطرق مُدمجة. تستخدم الأغلفة خوارزمية بحثٍ للبحث في فضاء الميزات المُحتملة، وتقييم كل مجموعة فرعية من خلال تشغيل نموذجٍ عليها. قد تكون الأغلفة مُكلفةً حسابيًا، كما أنها تنطوي على خطر المُبالغة في مُلاءمة النموذج. تُشبه المرشحات الأغلفة في أسلوب البحث، ولكن بدلًا من التقييم مُقارنةً بنموذج، يتم تقييم مرشحٍ أبسط. أما التقنيات المُدمجة، فهي مُدمجةٌ في نموذجٍ مُحددٍ له.
تستخدم العديد من أساليب البحث الشائعة خوارزمية التسلق الجشع ، التي تُقيّم بشكل متكرر مجموعة فرعية من الميزات المرشحة، ثم تُعدّل هذه المجموعة الفرعية وتُقيّم ما إذا كانت المجموعة الجديدة تُمثل تحسينًا عن المجموعة القديمة. يتطلب تقييم المجموعات الفرعية مقياسًا للدرجات يُصنّف كل مجموعة فرعية من الميزات. ونظرًا لأن البحث الشامل غير عملي عمومًا، فعند نقطة توقف يُحددها المُنفذ (أو المُشغل)، يتم اختيار المجموعة الفرعية من الميزات ذات أعلى درجة تم اكتشافها حتى تلك النقطة كمجموعة الميزات المُرضية. يختلف معيار التوقف باختلاف الخوارزمية؛ ومن المعايير المُحتملة: تجاوز درجة المجموعة الفرعية حدًا مُعينًا، أو تجاوز الحد الأقصى المسموح به لوقت تشغيل البرنامج، وما إلى ذلك.
تعتمد التقنيات البديلة القائمة على البحث على البحث عن الإسقاط المستهدف الذي يجد إسقاطات منخفضة الأبعاد للبيانات التي تحقق درجات عالية: ثم يتم اختيار الميزات التي لها أكبر الإسقاطات في الفضاء منخفض الأبعاد.
تشمل أساليب البحث ما يلي:
- شامل [ 19 ]
- الأفضل أولاً
- التلدين المحاكي
- الخوارزمية الجينية [ 20 ]
- اختيار المهاجم الجشع [ 21 ] [ 22 ] [ 23 ]
- الاستبعاد العكسي الجشع
- تحسين سرب الجسيمات [ 24 ]
- تتبع الإسقاط الموجه
- البحث المبعثر [ 25 ] [ 26 ] [ 27 ]
- البحث في الجوار المتغير [ 28 ] [ 29 ]
يُعدّ كلٌّ من الارتباط والمعلومات المتبادلة من المقاييس الشائعة لتصفية البيانات في مسائل التصنيف ، مع العلم أنهما ليسا مقياسين حقيقيين أو "مقياسين للمسافة" بالمعنى الرياضي، إذ لا يلتزمان بمتباينة المثلث ، وبالتالي لا يحسبان أي "مسافة" فعلية، بل يُمكن اعتبارهما "درجات". تُحسب هذه الدرجات بين سمة مُرشّحة (أو مجموعة سمات) وفئة الإخراج المطلوبة. مع ذلك، توجد مقاييس حقيقية تُعتبر دالةً بسيطةً للمعلومات المتبادلة؛ [ 30 ] انظر هنا .
تشمل مقاييس التصفية الأخرى المتاحة ما يلي:
- قابلية فصل الفئات
- احتمال الخطأ
- المسافة بين الصفوف
- المسافة الاحتمالية
- إنتروبيا
- اختيار الميزات بناءً على الاتساق
- اختيار الميزات القائم على الارتباط
معايير الأمثلية
يُعدّ اختيار معايير الأمثلية أمرًا صعبًا نظرًا لتعدد الأهداف في مهمة اختيار الميزات. تتضمن العديد من المعايير الشائعة مقياسًا للدقة، مع خصم قيمة معينة بناءً على عدد الميزات المختارة. ومن الأمثلة على ذلك معيار معلومات أكايكي (AIC) ومعيار مالوز Cp ، حيث يُخصم ضعف قيمة كل ميزة مُضافة. يعتمد معيار معلومات أكايكي على نظرية المعلومات ، ويُشتق فعليًا من خلال مبدأ أقصى إنتروبيا . [ 31 ] [ 32 ]
ومن المعايير الأخرى معيار المعلومات البايزي (BIC)، الذي يستخدم عقوبة قدرهالكل ميزة مضافة، يتم استخدام الحد الأدنى لطول الوصف (MDL) الذي يستخدم بشكل تقاربيبونفيروني / ريك التي تستخدم، واختيار الميزات ذات الاعتماد الأقصى، ومجموعة متنوعة من المعايير الجديدة المستوحاة من معدل الاكتشاف الخاطئ (FDR)، والتي تستخدم شيئًا قريبًا منيمكن أيضًا استخدام معيار معدل الإنتروبيا الأقصى لاختيار المجموعة الفرعية الأكثر صلة من الميزات. [ 33 ]
التعلم المنظم
يُعدّ اختيار الميزات المُرشّحة حالةً خاصةً من نموذجٍ أعمّ يُسمى تعلّم البنية . يحدد اختيار الميزات مجموعة الميزات ذات الصلة بمتغير هدف مُحدد، بينما يحدد تعلّم البنية العلاقات بين جميع المتغيرات، عادةً من خلال تمثيل هذه العلاقات بيانيًا. تفترض معظم خوارزميات تعلّم البنية الشائعة أن البيانات مُولّدة بواسطة شبكة بايزية ، وبالتالي فإن البنية عبارة عن نموذج بياني مُوجّه . الحل الأمثل لمشكلة اختيار الميزات المُرشّحة هو غطاء ماركوف للعقدة المستهدفة، وفي الشبكة البايزية، يوجد غطاء ماركوف فريد لكل عقدة. [ 34 ]
آليات اختيار الميزات القائمة على نظرية المعلومات
توجد آليات مختلفة لاختيار الميزات تستخدم المعلومات المتبادلة لتقييم الميزات المختلفة. وعادةً ما تستخدم جميعها نفس الخوارزمية:
- احسب المعلومات المتبادلة كدرجة بين جميع الميزات () والفئة المستهدفة ( ج )
- اختر الميزة ذات أعلى درجة (مثلاً) وأضفها إلى مجموعة الميزات المحددة ( S )
- احسب النتيجة التي يمكن استخلاصها من المعلومات المتبادلة
- اختر الميزة ذات أعلى درجة وأضفها إلى مجموعة الميزات المختارة (مثلاً)
- كرر الخطوتين 3 و4 حتى يتم تحديد عدد معين من الميزات (مثلاً)
يستخدم النهج الأبسط المعلومات المتبادلة كدرجة "مشتقة". [ 35 ]
ومع ذلك، هناك مناهج مختلفة تحاول تقليل التكرار بين الميزات.
اختيار الميزات وفقًا لأسلوب الحد الأدنى من التكرار والحد الأقصى من الصلة (mRMR)
اقترح بنغ وآخرون [ 36 ] طريقة لاختيار الميزات تستخدم إما المعلومات المتبادلة، أو الارتباط، أو درجات المسافة/التشابه. والهدف هو تقليل أهمية الميزة بسبب تكرارها في وجود الميزات الأخرى المختارة. تُعرَّف أهمية مجموعة الميزات S للفئة c بمتوسط قيم جميع المعلومات المتبادلة بين الميزة الفردية fᵢ والفئة c كما يلي :
- .
إن تكرار جميع الميزات في المجموعة S هو متوسط قيمة جميع قيم المعلومات المتبادلة بين الميزة f i والميزة f j :
معيار mRMR هو مزيج من مقياسين مذكورين أعلاه، ويتم تعريفه على النحو التالي:
لنفترض أن لدينا n من السمات الكاملة. ولتكن xᵢ دالة مؤشر انتماء المجموعة للسمّة fᵢ ، بحيث يشير xᵢ = 1 إلى وجود السمّة fᵢ في مجموعة السمات المثلى عالميًا، ويشير xᵢ = 0 إلى عدم وجودها.ويمكن كتابة ما سبق على شكل مسألة تحسين :
خوارزمية mRMR هي تقريب لخوارزمية اختيار الميزات الأمثل نظريًا ذات الاعتماد الأقصى، والتي تُعظّم المعلومات المتبادلة بين التوزيع المشترك للميزات المختارة ومتغير التصنيف. ولأن mRMR تُقارب مشكلة التقدير التوافقي بسلسلة من المشكلات الأصغر حجمًا، والتي لا تتضمن كل منها سوى متغيرين، فإنها تستخدم احتمالات مشتركة ثنائية أكثر قوة. في بعض الحالات، قد تُقلل الخوارزمية من تقدير فائدة الميزات لعدم وجود طريقة لقياس التفاعلات بينها، والتي من شأنها زيادة الصلة. قد يؤدي هذا إلى ضعف الأداء [ 35 ] عندما تكون الميزات غير مفيدة بشكل فردي، ولكنها مفيدة عند دمجها (تُلاحظ حالة شاذة عندما تكون الفئة دالة تكافؤ للميزات). عمومًا، تُعد الخوارزمية أكثر كفاءة (من حيث كمية البيانات المطلوبة) من خوارزمية اختيار الميزات الأمثل نظريًا ذات الاعتماد الأقصى، ومع ذلك تُنتج مجموعة ميزات ذات تكرار ثنائي ضئيل.
يُعدّ mRMR مثالاً على فئة كبيرة من أساليب التصفية التي توازن بين الملاءمة والتكرار بطرق مختلفة. [ 35 ] [ 37 ]
اختيار ميزات البرمجة التربيعية
يُعدّ mRMR مثالًا نموذجيًا لاستراتيجية جشعة تدريجية لاختيار الميزات: فبمجرد اختيار ميزة ما، لا يمكن إلغاء اختيارها في مرحلة لاحقة. وبينما يمكن تحسين mRMR باستخدام البحث العائم لتقليل بعض الميزات، يمكن أيضًا إعادة صياغته كمسألة تحسين برمجة تربيعية شاملة كما يلي: [ 38 ]
- :\min _{\mathbf {x} }\left\{\alpha \mathbf {x} ^{T}H\mathbf {x} -\mathbf {x} ^{T}F\right\}\quad {\mbox{st}}\ \sum _{i=1}^{n}x_{i}=1,x_{i}\geq 0}
أينيمثل متجه أهمية الميزات بافتراض وجود n ميزة إجمالاً،هي مصفوفة التكرار الزوجي للميزات، ويمثل هذا أوزان الميزات النسبية. يتم حل QFPS باستخدام البرمجة التربيعية. وقد تبين مؤخرًا أن QFPS منحاز نحو الميزات ذات الإنتروبيا الأقل، [ 39 ] بسبب موضع مصطلح التكرار الذاتي للميزات.على قطر H.
المعلومات المتبادلة المشروطة
وتستند نتيجة أخرى مشتقة للمعلومات المتبادلة على الصلة الشرطية: [ 39 ]
- :\max _{\mathbf {x} }\left\{\mathbf {x} ^{T}Q\mathbf {x} \right\}\quad {\mbox{st}}\ \|\mathbf {x} \|=1,x_{i}\geq 0}
أينو.
تتمثل إحدى مزايا SPEC CMI في إمكانية حلها ببساطة عن طريق إيجاد المتجه الذاتي المهيمن لـ Q ، مما يجعلها قابلة للتوسع بشكل كبير. كما تعالج SPEC CMI تفاعل الميزات من الدرجة الثانية.
معلومات متبادلة مشتركة
في دراسةٍ تناولت مختلف المقاييس، أوصى براون وآخرون [ 35 ] باستخدام المعلومات المتبادلة المشتركة [ 40 ] كمقياسٍ جيد لاختيار الميزات. يسعى هذا المقياس إلى إيجاد الميزة التي تُضيف أكبر قدرٍ من المعلومات الجديدة إلى الميزات المختارة مسبقًا، وذلك لتجنب التكرار. ويُصاغ المقياس على النحو التالي:
تستخدم النتيجة المعلومات المتبادلة الشرطية والمعلومات المتبادلة لتقدير التكرار بين الميزات المختارة مسبقًا () والخاصية قيد التحقيق ().
اختيار الميزات باستخدام معيار الاستقلال لهيلبرت-شميدت لاسو
بالنسبة للبيانات ذات الأبعاد العالية والعينات الصغيرة (على سبيل المثال، الأبعاد > 10)5 وعدد العينات < 103 )، يُعدّ معيار هيلبرت-شميدت للاستقلال (HSIC Lasso) مفيدًا. [ 41 ] تُعطى مسألة تحسين HSIC Lasso على النحو التالي
- :\min _ {\mathbf {x} {\frac {1}{2}}\sum _{k,l=1}^{n}x_{k}x_{l}{\mbox{HSIC}}(f_{k},f_{l})-\sum _{k=1}^{n}x_{k}{\mbox{HSIC}}(f_{k},c)+\lambda \|\mathbf {x} \|_{1},\quad {\mbox{st}}\ x_{1},\ldots ,x_{n}\geq 0,}
أينهو مقياس استقلال قائم على النواة يُسمى معيار هيلبرت-شميدت للاستقلال (HSIC) (التجريبي).يشير إلى الأثر ،هو معامل التنظيم،وهي مصفوفات غرام مركزية المدخلات والمخرجات ،وهي مصفوفات غرام،وهي دوال النواة،هي مصفوفة التمركز ،هي مصفوفة الوحدة ذات البعد m ( حيث m : عدد العينات)،هو متجه ذو أبعاد m جميع عناصره تساوي واحدًا، و هو-norm. تأخذ HSIC دائمًا قيمة غير سالبة، وتكون صفرًا إذا وفقط إذا كان متغيران عشوائيان مستقلين إحصائيًا عند استخدام نواة إعادة إنتاج عالمية مثل نواة غاوس.
يمكن كتابة معادلة HSIC Lasso على النحو التالي:
- :\min _{\mathbf {x} {\frac {1}{2}}\left\|{\bar {\mathbf {L} }}-\sum _{k=1}^{n}x_{k}{\bar {\mathbf {K} }}^{(k)}\right\|_ {F}^{2}+\lambda \|\mathbf {x} \|_{1},\quad {\mbox{st}}\ x_{1},\ldots ,x_{n}\geq 0,}
أينهي معيار فروبينيوس . مشكلة التحسين هي مشكلة لاسو، وبالتالي يمكن حلها بكفاءة باستخدام أحدث خوارزمية لحل لاسو مثل طريقة لاغرانج المعززة المزدوجة .
اختيار ميزة الارتباط
يقيس مقياس اختيار الميزات المرتبطة (CFS) مجموعات فرعية من الميزات بناءً على الفرضية التالية: "تحتوي مجموعات الميزات الجيدة على ميزات مرتبطة ارتباطًا وثيقًا بالتصنيف، ولكنها غير مرتبطة ببعضها البعض". [ 42 ] [ 43 ] وتوضح المعادلة التالية مزايا مجموعة فرعية من الميزات S تتكون من k ميزة:
هنا،يمثل متوسط قيمة جميع معاملات الارتباط بين الميزات والتصنيف، ويمثل متوسط قيمة جميع الارتباطات بين الميزات. ويُعرَّف معيار CFS على النحو التالي:
الوتُعرف المتغيرات بالارتباطات، ولكنها ليست بالضرورة معامل ارتباط بيرسون أو معامل ارتباط سبيرمان ρ . لا تستخدم أطروحة هول أيًا من هذين المعاملين، بل تستخدم ثلاثة مقاييس مختلفة للترابط، وهي: الحد الأدنى لطول الوصف (MDL)، وعدم اليقين المتناظر ، والتخفيف .
لنفترض أن xᵢ هي دالة مؤشر عضوية المجموعة للميزة fᵢ ؛ عندئذٍ يمكن إعادة كتابة ما سبق كمسألة تحسين:
إن المسائل التوافقية المذكورة أعلاه هي في الواقع مسائل برمجة خطية مختلطة من نوع 0-1 يمكن حلها باستخدام خوارزميات التفرع والتقييد . [ 44 ]
الأشجار المنتظمة
تبين أن خصائص شجرة القرار أو مجموعة الأشجار متكررة. ويمكن استخدام طريقة حديثة تُسمى الشجرة المنتظمة [ 45 ] لاختيار مجموعة فرعية من الخصائص. تُعاقب الأشجار المنتظمة باستخدام متغير مشابه للمتغيرات المختارة في عقد الشجرة السابقة لتقسيم العقدة الحالية. لا تحتاج الأشجار المنتظمة إلا إلى بناء نموذج شجرة واحد (أو نموذج مجموعة أشجار واحد)، وبالتالي فهي فعالة من حيث الحساب.
تتعامل الأشجار المنتظمة بشكل طبيعي مع السمات العددية والفئوية، والتفاعلات، والعلاقات غير الخطية. وهي ثابتة بغض النظر عن مقاييس السمات (الوحدات) وغير حساسة للقيم الشاذة ، وبالتالي، لا تتطلب سوى القليل من معالجة البيانات المسبقة مثل التطبيع . تُعد الغابة العشوائية المنتظمة (RRF) [ 46 ] أحد أنواع الأشجار المنتظمة. أما الغابة العشوائية المنتظمة الموجهة فهي نسخة محسّنة من الغابة العشوائية المنتظمة، حيث تُوجّه باستخدام درجات الأهمية من الغابة العشوائية العادية.
نظرة عامة على أساليب الاستدلال الميتاهوريستية
الخوارزمية فوق الحدسية هي وصف عام لخوارزمية مُخصصة لحل مسائل التحسين الصعبة (عادةً مسائل NP-hard ) التي لا توجد لها طرق حل تقليدية. عمومًا، الخوارزمية فوق الحدسية هي خوارزمية عشوائية تسعى للوصول إلى الحل الأمثل الشامل. وتتنوع الخوارزميات فوق الحدسية، بدءًا من البحث المحلي البسيط وصولًا إلى خوارزمية البحث الشامل المعقدة.
المبادئ الأساسية
تُعرض طرق اختيار الميزات عادةً في ثلاث فئات بناءً على كيفية دمجها لخوارزمية الاختيار وبناء النموذج.
طريقة التصفية

تختار أساليب التصفية المتغيرات بغض النظر عن النموذج، إذ تعتمد فقط على خصائص عامة مثل الارتباط بالمتغير المراد التنبؤ به. تعمل هذه الأساليب على استبعاد المتغيرات الأقل أهمية، بينما تُستخدم المتغيرات الأخرى في نموذج تصنيف أو انحدار لتصنيف البيانات أو التنبؤ بها. تتميز هذه الأساليب بفعاليتها من حيث وقت الحساب ومقاومتها لظاهرة التخصيص الزائد . [ 47 ]
تميل أساليب التصفية إلى اختيار متغيرات زائدة عندما لا تأخذ في الاعتبار العلاقات بين المتغيرات. ومع ذلك، تحاول الميزات الأكثر تطوراً تقليل هذه المشكلة عن طريق إزالة المتغيرات شديدة الارتباط ببعضها البعض، مثل خوارزمية التصفية السريعة القائمة على الارتباط (FCBF). [ 48 ]
طريقة التغليف

تقوم أساليب التغليف بتقييم مجموعات فرعية من المتغيرات، مما يسمح، على عكس أساليب التصفية، بالكشف عن التفاعلات المحتملة بين المتغيرات. [ 49 ] أما العيبان الرئيسيان لهذه الأساليب فهما:
- يزداد خطر التخصيص الزائد عندما يكون عدد الملاحظات غير كافٍ.
- يستغرق الحساب وقتًا طويلاً عندما يكون عدد المتغيرات كبيرًا.
الأسلوب المضمن

تم اقتراح أساليب مضمنة مؤخراً تحاول الجمع بين مزايا الأساليب السابقة. تستفيد خوارزمية التعلم من عملية اختيار المتغيرات الخاصة بها وتنفذ عملية اختيار الميزات والتصنيف في آن واحد، مثل خوارزمية FRMT. [ 50 ]
تطبيق أساليب الاستدلال الميتاهوريستيكية لاختيار الميزات
هذا استعراض لتطبيق أساليب الاستدلال الميتاهوريستية لاختيار الميزات المستخدمة مؤخرًا في الأدبيات. وقد أنجزت هذا الاستعراض ج. هامون في أطروحتها عام 2013. [ 47 ]
| طلب | الخوارزمية | يقترب | المصنف | دالة التقييم | مرجع |
|---|---|---|---|---|---|
| SNPs | اختيار الميزات باستخدام تشابه الميزات | فلتر | ر 2 | فونغ 2005 [ 49 ] | |
| SNPs | الخوارزمية الجينية | إزار | شجرة القرار | دقة التصنيف (عشرة أضعاف) | شاه 2004 [ 51 ] |
| SNPs | تسلق التلال | فلتر + غلاف | بايزي الساذج | مجموع مربعات البواقي المتوقعة | لونغ 2007 [ 52 ] |
| SNPs | التلدين المحاكي | بايزي ساذج | دقة التصنيف (5 أضعاف) | أوستنكار 2011 [ 53 ] | |
| أجزاء الإفراج المشروط | مستعمرة النمل | إزار | الشبكة العصبية الاصطناعية | MSE | العاني 2005 [ 54 ] |
| تسويق | التلدين المحاكي | إزار | الانحدار | AIC ، r 2 | ميري 2006 [ 55 ] |
| الاقتصاد | التلدين المحاكي، الخوارزمية الجينية | إزار | الانحدار | BIC | كابيتانيوس 2007 [ 56 ] |
| الكتلة الطيفية | الخوارزمية الجينية | إزار | الانحدار الخطي المتعدد، المربعات الصغرى الجزئية | متوسط الجذر التربيعي لخطأ التنبؤ | برودهيرست وآخرون 1997 [ 57 ] |
| رسائل إلكترونية مزعجة | خوارزمية تحسين سرب الجسيمات الثنائية + الطفرة | إزار | شجرة القرار | التكلفة المرجحة | Zhang 2014 [ 24 ] |
| المصفوفة الدقيقة | بحث تابو + PSO | إزار | آلة المتجهات الداعمة ، أقرب الجيران K | المسافة الإقليدية | تشوانغ 2009 [ 58 ] |
| المصفوفة الدقيقة | خوارزمية تحسين سرب الجسيمات + الخوارزمية الجينية | إزار | آلة المتجهات الداعمة | دقة التصنيف (عشرة أضعاف) | ألبا 2007 [ 59 ] |
| المصفوفة الدقيقة | الخوارزمية الجينية + البحث المحلي المتكرر | مغروس | آلة المتجهات الداعمة | دقة التصنيف (عشرة أضعاف) | دوفال 2009 [ 60 ] |
| المصفوفة الدقيقة | البحث المحلي المتكرر | إزار | الانحدار | الاحتمال اللاحق | هانز 2007 [ 61 ] |
| المصفوفة الدقيقة | الخوارزمية الجينية | إزار | أقرب الجيران | دقة التصنيف ( التحقق المتقاطع باستبعاد عنصر واحد ) | جيرابيتش-أومباي 2005 [ 62 ] |
| المصفوفة الدقيقة | خوارزمية جينية هجينة | إزار | أقرب الجيران | دقة التصنيف (التحقق المتقاطع بحذف عنصر واحد) | أوه 2004 [ 63 ] |
| المصفوفة الدقيقة | الخوارزمية الجينية | إزار | آلة المتجهات الداعمة | الحساسية والنوعية | شوان 2011 [ 64 ] |
| المصفوفة الدقيقة | الخوارزمية الجينية | إزار | آلة المتجهات الداعمة المقترنة بالكامل | دقة التصنيف (التحقق المتقاطع بحذف عنصر واحد) | بينغ 2003 [ 65 ] |
| المصفوفة الدقيقة | الخوارزمية الجينية | مغروس | آلة المتجهات الداعمة | دقة التصنيف (عشرة أضعاف) | هيرنانديز 2007 [ 66 ] |
| المصفوفة الدقيقة | الخوارزمية الجينية | هجين | آلة المتجهات الداعمة | دقة التصنيف (التحقق المتقاطع بحذف عنصر واحد) | هويرتا 2006 [ 67 ] |
| المصفوفة الدقيقة | الخوارزمية الجينية | آلة المتجهات الداعمة | دقة التصنيف (عشرة أضعاف) | موني 2006 [ 68 ] | |
| المصفوفة الدقيقة | الخوارزمية الجينية | إزار | آلة المتجهات الداعمة | إي إتش-ديال، كتلة | جوردان 2005 [ 69 ] |
| مرض الزهايمر | اختبار ويلش تي | فلتر | آلة المتجهات الداعمة | دقة التصنيف (عشرة أضعاف) | Zhang 2015 [ 70 ] |
| رؤية الحاسوب | اختيار الميزات اللانهائي | فلتر | مستقل | متوسط الدقة ، ROC AUC | روفو 2015 [ 71 ] |
| المصفوفات الدقيقة | مركزية المتجه الذاتي FS | فلتر | مستقل | متوسط الدقة، الدقة، مساحة تحت منحنى ROC | روفو وميلزي 2016 [ 72 ] |
| XML | تاو المتناظر (ST) | فلتر | التصنيف الترابطي الهيكلي | الدقة والتغطية | شهراني وهادزيتش 2014 |
اختيار الميزات المضمن في خوارزميات التعلم
تُجري بعض خوارزميات التعلم عملية اختيار الميزات كجزء من عملها العام. وتشمل هذه الخوارزميات ما يلي:
- تقنيات التنظيم ، مثل الانحدار المتفرق، و LASSO، و-SVM
- الأشجار المنتظمة، [ 45 ] على سبيل المثال الغابة العشوائية المنتظمة المنفذة في حزمة RRF [ 46 ]
- شجرة القرار [ 73 ]
- خوارزمية الميمات
- نموذج اللوجيت متعدد الحدود العشوائي (RMNL)
- شبكات التشفير التلقائي ذات طبقة عنق الزجاجة
- اختيار الميزات الفرعية [ 74 ] [ 75 ] [ 76 ]
- اختيار الميزات القائم على التعلم المحلي. [ 77 ] بالمقارنة مع الطرق التقليدية، لا يتضمن هذا الأسلوب أي بحث استدلالي، ويمكنه التعامل بسهولة مع المشكلات متعددة التصنيفات، ويعمل مع كل من المشكلات الخطية وغير الخطية. كما أنه مدعوم بأساس نظري متين. أظهرت التجارب العددية أن هذا الأسلوب يمكنه تحقيق حل قريب من الحل الأمثل حتى عندما تحتوي البيانات على أكثر من مليون ميزة غير ذات صلة.
- نظام التوصية القائم على اختيار الميزات. [ 78 ] تم إدخال أساليب اختيار الميزات في أبحاث أنظمة التوصية.
انظر أيضاً
مراجع
- ↑ غاريث جيمس؛ دانييلا ويتن؛ تريفور هاستي؛ روبرت تيبشيراني (2013). مقدمة في التعلم الإحصائي . سبرينغر. ص 204.
- ^ برانك يانيز. ملادينيتش، دونجا؛ جروبيلنيك، ماركو؛ ليو، هوان؛ ملادينيتش، دونجا؛ فلاش، بيتر أ. جاريجا، جيما سي؛ تويفونين، هانو؛ Toivonen، Hannu (2011)، “اختيار الميزة” ، في ساموت، كلود؛ ويب، جيفري آي. (محرران)، موسوعة التعلم الآلي ، بوسطن، MA: Springer US، الصفحات من 402 إلى 406، دوى : 10.1007/978-0-387-30164-8_306 ، ISBN 978-0-387-30768-8تم الاطلاع عليه بتاريخ 13 يوليو 2021
- ↑ كريمر، مارك أ. (1991). "تحليل المكونات الرئيسية غير الخطي باستخدام الشبكات العصبية الترابطية الذاتية" . مجلة AIChE . 37 (2): 233-243 . Bibcode : 1991AIChE..37..233K . doi : 10.1002/aic.690370209 . ISSN 1547-5905 .
- ↑ كراتسيوس، أناستاسيس؛ هايندمان، كودي (2021). "NEU: خوارزمية شاملة لتمثيل الميزات غير المتأثرة بـ UAP" . مجلة أبحاث تعلم الآلة . 22 (92): 1-51 . ISSN 1533-7928 .
- ↑ بيرسيلو، كلاوديو؛ بروتزوني، لورينزو (يوليو 2014). "اختيار السمات ذات الصلة والثابتة للصور فائقة الطيف لتعميم المجال" (ملف PDF) . ندوة IEEE لعلوم الأرض والاستشعار عن بعد لعام 2014 (ملف PDF) . IEEE. الصفحات 3562-3565 . doi : 10.1109/igarss.2014.6947252 . ISBN 978-1-4799-5775-0S2CID 8368258. مؤرشف من الأصل بتاريخ 14 أبريل 2024. تم الاطلاع عليه بتاريخ 22 يوليو 2023 .
- ↑ هينكل، جاكوب؛ موراليداران، براسانا؛ فليتشر، ب. توماس؛ جوشي، سارانج (2012). "الانحدار متعدد الحدود على مشعبات ريمانية" . في: فيتزجيبون، أندرو؛ لازيبنيك، سفيتلانا؛ بيرونا، بيترو؛ ساتو، يويتشي؛ شميد، كورديليا (محررون). رؤية الحاسوب - المؤتمر الأوروبي لرؤية الحاسوب 2012. سلسلة محاضرات في علوم الحاسوب. المجلد 7574. برلين، هايدلبرغ: سبرينغر. الصفحات 1-14 . arXiv : 1201.2395 . doi : 10.1007/978-3-642-33712-3_1 . ISBN 978-3-642-33712-3. S2CID 8849753 .
- ↑ ياروتسكي، ديمتري (30 أبريل 2021). "تقريبات شاملة للخرائط الثابتة بواسطة الشبكات العصبية". التقريب البنّاء . 55 : 407-474 . arXiv : 1804.10306 . doi : 10.1007/s00365-021-09546-1 . ISSN 1432-0940 . S2CID 13745401 .
- ^ هاوبيرج، سورين؛ لوز، فرانسوا؛ بيدرسن ، كيم ستينستروب (2013/05/01). “تصفية كالمان غير المعطرة على المشعبات الريمانية”. مجلة التصوير والرؤية الرياضية . 46 (1): 103– 120. بيب كود : 2013JMIV...46..103H . دوى : 10.1007/s10851-012-0372-9 . ردمك 1573-7683 . S2CID 8501814 .
- ↑ كراتسيوس، أناستاسيس؛ هايندمان، كودي (8 يونيو 2021). "NEU: خوارزمية شاملة لتمثيل الميزات غير المتأثرة بـ UAP" . مجلة أبحاث تعلم الآلة . 22 10312. Bibcode : 2015NatSR...510312B . doi : 10.1038/srep10312 . PMC 4437376. PMID 25988841 .
- 1 2 3 غويون، إيزابيل؛ إليسيف، أندريه (2003). "مقدمة في اختيار المتغيرات والميزات" . مجلة أبحاث التعلم الآلي . 3 .
- 1 2 يانغ، ييمينغ؛ بيدرسن، جان أو. (1997). دراسة مقارنة حول اختيار السمات في تصنيف النصوص (ملف PDF) . المؤتمر الدولي للتعلم الآلي.
- ↑ أوربانوفيتش، رايان جيه؛ ميكر، ميليسا؛ لاكافا، ويليام؛ أولسون، راندال إس؛ مور، جيسون إتش. (2018). "اختيار الميزات القائم على التضاريس: مقدمة ومراجعة" . مجلة المعلوماتية الطبية الحيوية . 85 : 189-203 . arXiv : 1711.08421 . doi : 10.1016 / j.jbi.2018.07.014 . PMC 6299836. PMID 30031057 .
- ↑ فورمان، جورج (2003). "دراسة تجريبية شاملة لمقاييس اختيار الميزات لتصنيف النصوص" (ملف PDF) . مجلة أبحاث تعلم الآلة . 3 : 1289-1305 .
- ^ ييشي تشانغ. شوجوان لي؛ تنغ وانغ؛ زيغانغ تشانغ (2013). “اختيار الميزات على أساس التباعد لفئات منفصلة”. الحوسبة العصبية . 101 (4): 32-42 . دوى : 10.1016/j.neucom.2012.06.036 .
- ↑ غايون، آي.؛ ويستون، ج.؛ بارنهيل، س.؛ فابنيك، ف. (2002). "اختيار الجينات لتصنيف السرطان باستخدام آلات المتجهات الداعمة" . تعلم الآلة . 46 ( 1-3 ): 389-422 . doi : 10.1023/A:1012487302797 .
- ↑ باخ، فرانسيس ر. (2008). "بولاسو". وقائع المؤتمر الدولي الخامس والعشرين حول التعلم الآلي - ICML '08 . الصفحات 33-40 . doi : 10.1145/1390156.1390161 . ISBN 978-1-60558-205-4. S2CID 609778 .
- ↑ زاري، هابيل (2013). "تقييم أهمية السمات بناءً على التحليل التوافقي لـ Lasso مع تطبيق على تشخيص سرطان الغدد الليمفاوية" . BMC Genomics . 14 (ملحق 1): S14. doi : 10.1186/1471-2164-14-S1-S14 . PMC 3549810. PMID 23369194 .
- ↑ كاي هان؛ يونهي وانغ؛ تشاو تشانغ؛ تشاو لي؛ تشاو شو (2018). اختيار الميزات غير الخاضع للإشراف المستوحى من الترميز التلقائي . المؤتمر الدولي لهندسة الصوت والكلام ومعالجة الإشارات (ICASSP) التابع لمعهد مهندسي الكهرباء والإلكترونيات.
- ↑ حازمه، حسين؛ مازومدر، راهول؛ صعب، علي (2020). "الانحدار المتفرق على نطاق واسع: التفرع والتقييد المتجذر في التحسين من الدرجة الأولى". arXiv : 2004.06152 [ stat.CO ].
- ↑ سوفان، عثمان؛ كليفتوجيانيس، ديميتريوس؛ كالنيس، بانوس؛ باجيتش، فلاديمير ب. (26-02-2015). "DWFS: أداة لاختيار الميزات تعتمد على خوارزمية جينية متوازية" . PLOS ONE . 10 (2) e0117988. Bibcode : 2015PLoSO..1017988S . doi : 10.1371/journal.pone.0117988 . ISSN 1932-6203 . PMC 4342225. PMID 25719748 .
- ↑ فيغيروا، أليخاندرو (2015). "استكشاف السمات الفعالة للتعرف على نية المستخدم وراء استعلامات الويب" . الحوسبة في الصناعة . 68 : 162-169 . doi : 10.1016/j.compind.2015.01.005 .
- ↑ فيغيروا، أليخاندرو؛ غونتر نيومان (2013). تعلم ترتيب إعادة الصياغة الفعالة من سجلات الاستعلام للإجابة على أسئلة المجتمع . AAAI.
- ↑ فيغيروا، أليخاندرو؛ غونتر نيومان (2014). "نماذج خاصة بالفئات لترتيب إعادة الصياغة الفعالة في الإجابة على أسئلة المجتمع" . أنظمة الخبراء مع التطبيقات . 41 (10): 4730-4742 . doi : 10.1016/j.eswa.2014.02.004 . hdl : 10533/196878 .
- 1 2 Zhang, Y.; Wang, S.; Phillips, P. (2014). "خوارزمية تحسين سرب الجسيمات الثنائية مع عامل الطفرة لاختيار الميزات باستخدام شجرة القرار المطبقة على كشف البريد العشوائي". أنظمة قائمة على المعرفة . 64 : 22-31 . doi : 10.1016/j.knosys.2014.03.015 .
- ↑ إف سي غارسيا لوبيز، إم غارسيا توريس، بي ميليان، جيه إيه مورينو بيريز، جيه إم مورينو فيغا. حل مشكلة اختيار مجموعة فرعية من الميزات بواسطة بحث التشتت المتوازي ، المجلة الأوروبية لبحوث العمليات ، المجلد 169، العدد 2، الصفحات 477-489، 2006.
- ^ غارسيا توريس، ميغيل. غوميز فيلا، فرانسيسكو؛ ديفينا، فيديريكو؛ بينتو روا، دييغو ب.؛ نوغيرا، خوسيه لويس فاسكيز؛ رومان، خوليو سي ميلو (2021). "البحث المبعثر عن اختيار الميزات عالية الأبعاد باستخدام تجميع الميزات" . وقائع رفيق مؤتمر الحساب الجيني والتطوري . ص 149 – 150. دوى : 10.1145 / 3449726.3459481 . رقم ISBN 978-1-4503-8351-6. S2CID 235770316 .
- ↑ غارسيا-توريس، ميغيل (2025). "اختيار الميزات للبيانات عالية الأبعاد باستخدام استراتيجية تقليل مساحة البحث متعددة المتغيرات القائمة على البحث المبعثر" . مجلة الاستدلال . 31 10. doi : 10.1007/s10732-025-09550-9 .
- ↑ إف سي غارسيا لوبيز، إم غارسيا توريس، بي ميليان، جيه إيه مورينو بيريز، جيه إم مورينو فيغا. حل مشكلة اختيار مجموعة فرعية من الميزات باستخدام خوارزمية فوقية هجينة . في ورشة العمل الدولية الأولى حول الخوارزميات الفوقية الهجينة ، الصفحات 59-68، 2004.
- ↑ م. غارسيا-توريس، ف. غوميز-فيلا، ب. ميليان، ج.م. مورينو-فيغا. اختيار الميزات عالية الأبعاد عبر تجميع الميزات: نهج بحث الجوار المتغير ، علوم المعلومات ، المجلد 326، الصفحات 102-118، 2016.
- ↑ كراسكوف، ألكسندر؛ ستوغباور، هارالد؛ أندريهجاك، رالف ج؛ غراسبرغر، بيتر (2003). "التجميع الهرمي القائم على المعلومات المتبادلة". arXiv : q-bio/0311039 . Bibcode : 2003q.bio....11039K .
{{cite journal}}يتطلب الاستشهاد بالمجلة ( مساعدة )|journal= - ↑ أكايكي، هـ. (1985)، "التنبؤ والإنتروبيا"، في أتكينسون، أ.س.؛ فينبرغ، س.إ. (محرران)، احتفال بالإحصاء (ملف PDF) ، سبرينغر، ص 1-24 ، مؤرشف (ملف PDF) من الأصل في 30 أغسطس 2019 .
- ↑ برنهام، ك.ب.؛ أندرسون، د.ر. (2002)، اختيار النموذج والاستدلال متعدد النماذج: منهج عملي قائم على نظرية المعلومات (الطبعة الثانية )، سبرينغر-فيرلاغ ، رقم ISBN 978-0-387-95364-9.
- ↑ إينيك، جي إيه (2018). "اختيار الميزات باستخدام معدل الإنتروبيا الأقصى لتصنيف التغيرات في ديناميكيات الركبة والكاحل أثناء الجري". مجلة IEEE للمعلوماتية الطبية الحيوية والصحية . 28 (4): 1097-1103 . arXiv : 2501.13750 . Bibcode : 2018IJBHI..22.1097E . doi : 10.1109/JBHI.2017.2711487 . hdl : 10810/68978 . PMID : 29969403. S2CID : 49555941 .
- ↑ أليفيريس، قسطنطين (2010). "الاستقراء السببي المحلي واستقراء ماركوف الشامل لاكتشاف السببية واختيار الميزات للتصنيف، الجزء الأول: الخوارزميات والتقييم التجريبي" (ملف PDF) . مجلة أبحاث تعلم الآلة . 11 : 171-234 .
- براون ، جافين؛ بوكوك، آدم؛ تشاو، مينغ-جي؛ لويان، ميكيل (2012). "تعظيم الاحتمالية الشرطية: إطار موحد لاختيار الميزات بناءً على نظرية المعلومات" . مجلة أبحاث تعلم الآلة . 13 : 27-66 .
- ↑ بينغ، إتش سي؛ لونغ، إف؛ دينغ، سي. (2005). "اختيار الميزات بناءً على المعلومات المتبادلة: معايير أقصى اعتمادية، وأقصى صلة، وأقل تكرار". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 27 (8): 1226-1238 . Bibcode : 2005ITPAM..27.1226P . CiteSeerX 10.1.1.63.5765 . doi : 10.1109/TPAMI.2005.159 . PMID 16119262. S2CID 206764015 . برنامج
- ↑ نغوين، هـ.، فرانك، ك.، بيتروفيتش، س. (2010). "نحو مقياس عام لاختيار الميزات للكشف عن الاختراقات"، في وقائع المؤتمر الدولي للتعرف على الأنماط (ICPR)، إسطنبول، تركيا.
- ↑ رودريغيز-لوجان، آي.؛ هويرتا، ر.؛ إلكان، سي.؛ سانتا كروز، سي. (2010). "اختيار الميزات باستخدام البرمجة التربيعية" (ملف PDF) . مجلة أبحاث التعلم الآلي . 11 : 1491-1516 .
- 1 2 نغوين إكس. فينه، جيفري تشان، سيمون رومانو وجيمس بيلي، "مناهج عالمية فعالة لاختيار الميزات بناءً على المعلومات المتبادلة". وقائع المؤتمر العشرين لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات (KDD'14)، 24-27 أغسطس، مدينة نيويورك، 2014."
- ↑ يانغ، هوارد هوا؛ مودي، جون (2000). "تصور البيانات واختيار الميزات: خوارزميات جديدة للبيانات غير الغاوسية" (ملف PDF) . التطورات في أنظمة معالجة المعلومات العصبية : 687-693 .
- ↑ يامادا، م.؛ جيتكريتوم، و.؛ سيغال، ل.؛ شينغ، إي. بي.؛ سوغياما، م. (2014). "اختيار الميزات عالية الأبعاد باستخدام لاسو غير الخطي الخاص بالميزات". الحوسبة العصبية . 26 (1): 185-207 . arXiv : 1202.0515 . doi : 10.1162/NECO_a_00537 . PMID 24102126. S2CID 2742785 .
- ↑ هول، م. (1999). اختيار الميزات القائم على الارتباط للتعلم الآلي (ملف PDF) (أطروحة دكتوراه). جامعة وايكاتو.
- ↑ سينليول، باريس، وآخرون (2008). "مرشح سريع قائم على الارتباط (FCBF) باستراتيجية بحث مختلفة". المؤتمر الدولي الثالث والعشرون لعلوم الحاسوب والمعلومات ، 2008. الصفحات 1-4 . doi : 10.1109/ISCIS.2008.4717949 . ISBN 978-1-4244-2880-9. S2CID 8398495 .
- ↑ نغوين، هاي؛ فرانك، كاترين؛ بيتروفيتش، سلوبودان (ديسمبر 2009). "تحسين فئة من مقاييس اختيار الميزات" . وقائع ورشة عمل NIPS 2009 حول التحسين المنفصل في التعلم الآلي: شبه المعيارية، والتباعد، والمجسمات متعددة الأوجه (DISCML) . فانكوفر، كندا.
- 1 2 دينغ، هوتاو؛ رونجر، جورج (2012). "اختيار الميزات عبر الأشجار المنتظمة". arXiv : 1201.1587 [ cs.LG ].
- 1 2 RRF: غابة عشوائية منتظمة ،حزمة R على CRAN
- 1 2 هامون ، جولي (نوفمبر 2013). الجمع بين الأمثلية لاختيار المتغيرات في الانحدار في البعد الكبير: التطبيق في الجينات الحيوانية (الأطروحة) (باللغة الفرنسية). جامعة ليل للعلوم والتكنولوجيا .
- ↑ يو، لي؛ ليو، هوان (أغسطس 2003). "اختيار الميزات للبيانات عالية الأبعاد: حل ترشيح سريع قائم على الارتباط" (ملف PDF) . وقائع المؤتمر الدولي العشرين للتعلم الآلي ICML'03 : 856-863 .
- 1 2 ت. م. فونغ، ز. لين، و ر. ب. ألتمان. اختيار المتغيرات النوكليوتيدية المفردة باستخدام اختيار الميزات. مؤرشف في 13 سبتمبر 2016 في أرشيف الإنترنت. وقائع مؤتمر نظم المعلوماتية الحيوية الحاسوبية التابع لمعهد مهندسي الكهرباء والإلكترونيات، CSB. مؤتمر نظم المعلوماتية الحيوية الحاسوبية التابع لمعهد مهندسي الكهرباء والإلكترونيات، الصفحات 301-309، 2005. PMID 16447987 .
- ↑ ساغابور، إي.؛ كرماني، س.؛ سهاتي، م. (2017). "طريقة جديدة لترتيب السمات للتنبؤ بمراحل السرطان باستخدام بيانات البروتينات" . PLOS ONE . 12 (9) e0184203. Bibcode : 2017PLoSO..1284203S . doi : 10.1371/journal.pone.0184203 . PMC 5608217. PMID 28934234 .
- ↑ شاه، إس سي؛ كوسياك، أ. (2004). "استخراج البيانات واختيار الجينات/المتغيرات النوكليوتيدية المفردة باستخدام الخوارزمية الجينية". الذكاء الاصطناعي في الطب . 31 (3): 183-196 . doi : 10.1016/j.artmed.2004.04.002 . PMID 15302085 .
- ↑ لونغ، ن.؛ جيانولا، د.؛ ويجل، ك. أ. (2011). "تقليل الأبعاد واختيار المتغيرات للاختيار الجينومي: تطبيق على التنبؤ بإنتاج الحليب في أبقار هولشتاين". مجلة تربية الحيوانات وعلم الوراثة . 128 (4): 247-257 . doi : 10.1111/j.1439-0388.2011.00917.x . PMID 21749471 .
- ↑ أوستونكار، جوركان؛ أوزوغور أكيوز، سوريا؛ ويبر، جيرهارد دبليو. فريدريش، كريستوف م. أيدين سون، يشيم (2012). “اختيار مجموعات SNP التمثيلية لدراسات الارتباط على مستوى الجينوم: نهج ميتايورستيكي”. رسائل التحسين . 6 (6): 1207-1218 . دوى : 10.1007 / s11590-011-0419-7 . اتش دي ال : 11511/30584 . S2CID 8075318 .
- ↑ العاني، أ. (2005). "اختيار مجموعة فرعية من الميزات باستخدام تحسين مستعمرة النمل". المجلة الدولية للذكاء الحسابي .
- ↑ ميري، ر.؛ زهافي، ج. (2006). "استخدام التلدين المحاكي لتحسين مشكلة اختيار الميزات في تطبيقات التسويق". المجلة الأوروبية لبحوث العمليات . 171 (3): 842-858 . doi : 10.1016/j.ejor.2004.09.010 .
- ↑ كابيتانيوس، ج. (2007). "اختيار المتغيرات في نماذج الانحدار باستخدام التحسين غير القياسي لمعايير المعلومات". الإحصاءات الحاسوبية وتحليل البيانات . 52 (1): 4-15 . doi : 10.1016/j.csda.2007.04.006 .
- ↑ برودهيرست، د.؛ جوداكر، ر.؛ جونز، أ.؛ رولاند، ج. ج.؛ كيل، د. ب. (1997). "الخوارزميات الجينية كطريقة لاختيار المتغيرات في الانحدار الخطي المتعدد وانحدار المربعات الصغرى الجزئية، مع تطبيقات على مطيافية الكتلة للتحلل الحراري". مجلة Analytica Chimica Acta . 348 ( 1-3 ): 71-86 . Bibcode : 1997AcAC..348...71B . doi : 10.1016/S0003-2670(97)00065-2 .
- ↑ تشوانغ، ل.-ي.؛ يانغ، س.-هـ. (2009). "بحث تابو وتحسين سرب الجسيمات الثنائي لاختيار الميزات باستخدام بيانات المصفوفات الدقيقة". مجلة علم الأحياء الحاسوبي . 16 (12): 1689-1703 . doi : 10.1089/cmb.2007.0211 . PMID 20047491 .
- ↑ إي. ألبا، ج. غاريا-نييتو، ل. جوردان، وإي.-ج. طالبي. اختيار الجينات في تصنيف السرطان باستخدام خوارزميات PSO-SVM وGA-SVM الهجينة. مؤرشف في 18 أغسطس 2016 في Wayback Machine . مؤتمر الحوسبة التطورية، سنغافورة: سنغافورة (2007)، 2007
- ↑ ب. دوفال، جيه-كيه. هاو، وجيه سي هيرنانديز هيرنانديز. خوارزمية ميمية لاختيار الجينات والتصنيف الجزيئي للسرطان. في وقائع المؤتمر السنوي الحادي عشر حول الحوسبة الجينية والتطورية، GECCO '09، الصفحات 201-208، نيويورك، نيويورك، الولايات المتحدة الأمريكية، 2009. ACM.
- ↑ سي. هانز، أ. دوبرا، م. ويست. البحث العشوائي الشامل عن انحدار "قيمة p كبيرة" . مجلة الجمعية الإحصائية الأمريكية، 2007.
- ↑ أيتكن، س. (2005). " اختيار الميزات وتصنيفها لتحليل بيانات المصفوفات الدقيقة: أساليب تطورية لتحديد الجينات التنبؤية" . بي إم سي بيوانفورماتيكس . 6 (1) 148. doi : 10.1186/1471-2105-6-148 . PMC 1181625. PMID 15958165 .
- ↑ أوه، آي إس؛ مون، بي آر (2004). "الخوارزميات الجينية الهجينة لاختيار الميزات". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 26 (11): 1424-1437 . Bibcode : 2004ITPAM..26.1424O . CiteSeerX 10.1.1.467.4179 . doi : 10.1109/tpami.2004.105 . PMID 15521491 .
- ↑ شوان، ب.؛ غو، م.ز.؛ وانغ، ج.؛ ليو، ش.ي.؛ ليو، ي. (2011). "اختيار الميزات الفعال لتصنيف ما قبل الحمض النووي الريبوزي الميكروي باستخدام الخوارزمية الجينية". مجلة علم الوراثة والبحوث الجزيئية . 10 (2): 588-603 . doi : 10.4238/vol10-2gmr969 (غير نشط في 22 أبريل 2026). PMID 21491369 .
{{cite journal}}: صيانة CS1: رقم التعريف الرقمي غير نشط اعتبارًا من أبريل 2026 ( رابط ) - ↑ بينغ، س. (2003). "التصنيف الجزيئي لأنواع السرطان من بيانات المصفوفات الدقيقة باستخدام مزيج من الخوارزميات الجينية وآلات المتجهات الداعمة" . رسائل FEBS . 555 (2): 358-362 . Bibcode : 2003FEBSL.555..358P . doi : 10.1016/s0014-5793(03)01275-4 . PMID 14644442 .
- ↑ هيرنانديز، جيه سي إتش؛ دوفال، بي؛ هاو، جيه-كيه (2007). "نهج جيني مُضمّن لاختيار الجينات وتصنيف بيانات المصفوفات الدقيقة". الحوسبة التطورية، والتعلم الآلي، واستخراج البيانات في المعلوماتية الحيوية. EvoBIO 2007. سلسلة محاضرات في علوم الحاسوب. المجلد 4447. برلين: سبرينغر فيرلاغ. الصفحات 90-101 . doi : 10.1007/978-3-540-71783-6_9 . ISBN 978-3-540-71782-9.
- ↑ هويرتا، إي بي؛ دوفال، بي؛ هاو، جيه-كيه (2006). "نهج هجين يجمع بين الخوارزمية الجينية وآلة المتجهات الداعمة لاختيار الجينات وتصنيف بيانات المصفوفات الدقيقة". تطبيقات الحوسبة التطورية. ورش عمل EvoWorkshops 2006. سلسلة محاضرات في علوم الحاسوب. المجلد 3907. الصفحات 34-44 . doi : 10.1007/11732242_4 . ISBN 978-3-540-33237-4.
- ↑ موني، د.ب.؛ بال، ن.ر.؛ داس، ج. (2006). "البرمجة الجينية لاختيار الميزات وتصميم المصنفات في آن واحد". معاملات IEEE في الأنظمة والإنسان وعلم التحكم الآلي - الجزء ب: علم التحكم الآلي . 36 (1): 106-117 . Bibcode : 2006ITSMB..36..106M . doi : 10.1109/TSMCB.2005.854499 . PMID 16468570. S2CID 2073035 .
- ↑ جوردان، ل.؛ داينينز، س.؛ طالبي، إ.-ج. (2005). "دراسة عدم التوازن الارتباطي باستخدام خوارزمية جينية تكيفية متوازية". المجلة الدولية لأسس علوم الحاسوب . 16 (2): 241-260 . doi : 10.1142/S0129054105002978 .
- ↑ تشانغ، ي.؛ دونغ، ز.؛ فيليبس، ب.؛ وانغ، س. (2015). "الكشف عن الأفراد ومناطق الدماغ المرتبطة بمرض الزهايمر باستخدام صور الرنين المغناطيسي ثلاثية الأبعاد بناءً على خوارزمية الدماغ الذاتي والتعلم الآلي" . مجلة فرونتيرز في علم الأعصاب الحاسوبي . 9 : 66. doi : 10.3389/fncom.2015.00066 . PMC 4451357. PMID 26082713 .
- ↑ روفو، ج.؛ ميلزي، س.؛ كريستاني، م. (1 ديسمبر 2015). "اختيار الميزات اللانهائي". المؤتمر الدولي لهندسة الكهرباء والإلكترونيات (IEEE) لعام 2015 حول رؤية الحاسوب (ICCV) . الصفحات 4202-4210 . doi : 10.1109/ICCV.2015.478 . ISBN 978-1-4673-8391-2. S2CID 3223980 .
- ↑ روفو، جورجيو؛ ميلزي، سيمون (سبتمبر 2016). "اختيار الميزات عبر مركزية المتجه الذاتي" (ملف PDF) . NFmcp2016 . تم الاطلاع عليه بتاريخ 12 نوفمبر 2016 .
- ↑ ر. كوهفي وج. جون، " أغلفة لاختيار مجموعة فرعية من الميزات "، الذكاء الاصطناعي 97.1-2 (1997): 273-324
- ↑ داس، أبهيمانيو؛ كيمبي، ديفيد (2011). "النمذجة شبه المعيارية تلتقي بالنمذجة الطيفية: خوارزميات جشعة لاختيار المجموعات الفرعية، والتقريب المتفرق، واختيار القاموس". arXiv : 1102.3975 [ stat.ML ].
- ↑ ليو وآخرون، اختيار الميزات الفرعية لمساحات النوتات الصوتية عالية الأبعاد. مؤرشف في 17 أكتوبر 2015 على موقع Wayback Machine.
- ↑ Zheng et al., Submodular Attribute Selection for Action Recognition in Video (مؤرشف بتاريخ 18-11-2015 على موقع Wayback Machine)
- ↑ صن، ي.؛ تودوروفيتش، س.؛ غوديسون، س. (2010). "اختيار الميزات القائم على التعلم المحلي لتحليل البيانات عالية الأبعاد" . معاملات IEEE في تحليل الأنماط والذكاء الآلي . 32 (9): 1610-1626 . Bibcode : 2010ITPAM..32.1610S . doi : 10.1109 / tpami.2009.190 . PMC 3445441. PMID 20634556 .
- ↑ دي إتش وانغ، واي سي ليانغ، دي شو، إكس واي فينغ، آر سي غوان (2018)، " نظام توصية قائم على المحتوى لمنشورات علوم الحاسوب "، أنظمة قائمة على المعرفة ، 157: 1-9
للمزيد من القراءة
- غويون، إيزابيل؛ إليسيف، أندريه (2003). "مقدمة في اختيار المتغيرات والميزات" . مجلة أبحاث تعلم الآلة . 3 : 1157-1182 .
- هاريل، ف. (2001). استراتيجيات نمذجة الانحدار . سبرينغر. ISBN 0-387-95232-2.
- ليو، هوان؛ موتودا، هيروشي (1998). اختيار الميزات لاكتشاف المعرفة واستخراج البيانات . سبرينغر. ISBN 0-7923-8198-X.
- ليو، هوان؛ يو، لي (2005). "نحو دمج خوارزميات اختيار الميزات للتصنيف والتجميع". معاملات IEEE في هندسة المعرفة والبيانات . 17 (4): 491-502 . Bibcode : 2005IDSO...17..491L . doi : 10.1109/TKDE.2005.66 . S2CID 1607600 .
روابط خارجية
- حزمة اختيار الميزات، جامعة ولاية أريزونا (كود ماتلاب)
- تحدي NIPS لعام 2003 (انظر أيضًا NIPS )
- تطبيق Naive Bayes مع اختيار الميزات في Visual Basic مؤرشف بتاريخ 14-02-2009 على Wayback Machine (يتضمن ملفًا تنفيذيًا وشفرة مصدرية)
- برنامج اختيار الميزات ذي الحد الأدنى من التكرار والحد الأقصى من الصلة (mRMR)
- FEAST (خوارزميات اختيار الميزات مفتوحة المصدر بلغة C و MATLAB)
- اختيار الطراز
- تقليل الأبعاد
