نسبة اكتساب المعلومات
في تعلم شجرة القرار ، تُعرَّف نسبة اكتساب المعلومات بأنها نسبة اكتساب المعلومات إلى المعلومات الجوهرية. وقد اقترحها روس كوينلان [ 1 ] للحد من التحيز نحو السمات متعددة القيم من خلال مراعاة عدد وحجم الفروع عند اختيار السمة. [ 2 ]
يُعرف اكتساب المعلومات أيضًا باسم المعلومات المتبادلة . [ 3 ]
حساب كسب المعلومات
اكتساب المعلومات هو انخفاض في الإنتروبيا الناتج عن تقسيم مجموعة ذات سماتوإيجاد المرشح الأمثل الذي يحقق أعلى قيمة:
أينهو متغير عشوائي وهي إنتروبيابالنظر إلى قيمة السمة.
تُساوي كمية المعلومات المكتسبة إجمالي الإنتروبيا لخاصية ما إذا أمكن تصنيف كل قيمة من قيم تلك الخاصية تصنيفًا فريدًا لخاصية النتيجة. في هذه الحالة، تكون قيم الإنتروبيا النسبية المطروحة من إجمالي الإنتروبيا صفرًا.
حساب المعلومات المنقسمة
يتم تعريف قيمة المعلومات المنقسمة للاختبار على النحو التالي:
أينهو متغير عشوائي منفصل ذو قيم محتملةو عدد المرات التييحدث مقسومًا على إجمالي عدد الأحداثأينهي مجموعة الأحداث.
قيمة المعلومات المنقسمة هي عدد موجب يصف القيمة المحتملة لفصل فرع من عقدة. وهذه القيمة بدورها هي القيمة الجوهرية التي يمتلكها المتغير العشوائي، وسيتم استخدامها لإزالة التحيز في حساب نسبة اكتساب المعلومات.
حساب نسبة اكتساب المعلومات
نسبة اكتساب المعلومات هي النسبة بين اكتساب المعلومات وقيمة المعلومات المقسمة:
مثال
باستخدام بيانات الطقس المنشورة من قبل جامعة فوردهام، [ 4 ] تم إنشاء الجدول أدناه:
| أوتلوك | درجة حرارة | رطوبة | رياح | يلعب |
|---|---|---|---|---|
| مشمس | حار | عالي | خطأ شنيع | لا |
| مشمس | حار | عالي | حقيقي | لا |
| غائم جزئياً | حار | عالي | خطأ شنيع | نعم |
| ممطر | خفيف | عالي | خطأ شنيع | نعم |
| ممطر | رائع | طبيعي | خطأ شنيع | نعم |
| ممطر | رائع | طبيعي | حقيقي | لا |
| غائم جزئياً | رائع | طبيعي | حقيقي | نعم |
| مشمس | خفيف | عالي | خطأ شنيع | لا |
| مشمس | رائع | طبيعي | خطأ شنيع | نعم |
| ممطر | خفيف | طبيعي | خطأ شنيع | نعم |
| مشمس | خفيف | طبيعي | خطأ شنيع | نعم |
| غائم جزئياً | خفيف | عالي | حقيقي | نعم |
| غائم جزئياً | حار | طبيعي | خطأ شنيع | نعم |
| ممطر | خفيف | عالي | حقيقي | لا |
باستخدام الجدول أعلاه، يمكن إيجاد الإنتروبيا، ومكسب المعلومات، وتقسيم المعلومات، ونسبة مكسب المعلومات لكل متغير (التوقعات، ودرجة الحرارة، والرطوبة، والرياح). وتُعرض هذه الحسابات في الجداول أدناه:
|
|
|
|
باستخدام الجداول أعلاه، يمكن استنتاج أن برنامج Outlook يتمتع بأعلى نسبة اكتساب معلومات. بعد ذلك، يجب إيجاد إحصائيات المجموعات الفرعية لمتغير Outlook (مشمس، غائم، ممطر)، وفي هذا المثال، سيتم إنشاء فرع "مشمس" فقط (كما هو موضح في الجدول أدناه):
| أوتلوك | درجة حرارة | رطوبة | رياح | يلعب |
|---|---|---|---|---|
| مشمس | حار | عالي | خطأ شنيع | لا |
| مشمس | حار | عالي | حقيقي | لا |
| مشمس | خفيف | عالي | خطأ شنيع | لا |
| مشمس | رائع | طبيعي | خطأ شنيع | نعم |
| مشمس | خفيف | طبيعي | حقيقي | نعم |
يمكن للمرء أن يجد الإحصائيات التالية للمتغيرات الأخرى (درجة الحرارة والرطوبة والرياح) لمعرفة أيها له التأثير الأكبر على عنصر الشمس في متغير التوقعات:
|
|
|
وُجد أن الرطوبة تتمتع بأعلى نسبة اكتساب معلومات. سنكرر نفس الخطوات السابقة ونجد الإحصائيات الخاصة بحالات متغير الرطوبة (مرتفعة وعادية):
|
|
بما أن قيم اللعب إما كلها "لا" أو "نعم"، فإن قيمة نسبة اكتساب المعلومات ستكون مساوية لـ 1. أيضًا، الآن وقد وصل المرء إلى نهاية سلسلة المتغيرات مع كون الرياح هو المتغير الأخير المتبقي، يمكنهم بناء خط فرعي كامل من الجذر إلى عقدة الورقة لشجرة القرار.

بعد الوصول إلى هذه العقدة الطرفية، يُتبع الإجراء نفسه لبقية العناصر التي لم تُقسّم بعد في شجرة القرار. كانت هذه المجموعة من البيانات صغيرة نسبيًا، ولكن عند استخدام مجموعة أكبر، تبرز مزايا استخدام نسبة اكتساب المعلومات كعامل تقسيم في شجرة القرار بشكل أوضح.
المزايا
نسبة اكتساب المعلومات تُؤثر على شجرة القرار وتمنعها من النظر في السمات التي تحتوي على عدد كبير من القيم المتميزة.
على سبيل المثال، لنفترض أننا نبني شجرة قرارات لبيانات تصف عملاء شركة ما. تُستخدم نسبة اكتساب المعلومات لتحديد السمات الأكثر صلة. سيتم اختبار هذه السمات بالقرب من جذر الشجرة. قد تكون إحدى سمات الإدخال هي رقم هاتف العميل . تتميز هذه السمة بنسبة اكتساب معلومات عالية، لأنها تُعرّف كل عميل بشكل فريد. ونظرًا لكثرة قيمها المختلفة، لن يتم اختيارها للاختبار بالقرب من الجذر.
العيوب
على الرغم من أن نسبة اكتساب المعلومات تحل المشكلة الأساسية لاكتساب المعلومات، إلا أنها تخلق مشكلة أخرى. فإذا أخذنا في الاعتبار عددًا من السمات ذات عدد كبير من القيم المميزة، فلن تتجاوز هذه النسبة أبدًا سمة ذات عدد أقل من القيم المميزة.
الفرق عن اكتساب المعلومات
- يكمن قصور اكتساب المعلومات في عدم توفير فرق عددي بين السمات ذات القيم المميزة العالية وتلك التي لها قيم أقل.
- مثال: لنفترض أننا نبني شجرة قرارات لبيانات تصف عملاء شركة ما. يُستخدم كسب المعلومات عادةً لتحديد السمات الأكثر صلة، بحيث يمكن اختبارها بالقرب من جذر الشجرة. قد تكون إحدى سمات الإدخال رقم بطاقة ائتمان العميل . تتميز هذه السمة بكسب معلومات عالٍ، لأنها تُعرّف كل عميل بشكل فريد، لكننا لا نرغب في تضمينها في شجرة القرارات: فمن غير المرجح أن يُعمّم قرار كيفية التعامل مع عميل بناءً على رقم بطاقته الائتمانية على عملاء لم نتعامل معهم من قبل.
- تكمن قوة نسبة اكتساب المعلومات في أنها تميل نحو السمات ذات العدد الأقل من القيم المميزة.
- فيما يلي جدول يصف الاختلافات بين اكتساب المعلومات ونسبة اكتساب المعلومات عند وضعها في سيناريوهات معينة.
| اكتساب المعلومات | نسبة اكتساب المعلومات |
|---|---|
| لن يتم تفضيل أي سمة بناءً على عدد القيم المميزة | سيفضل السمات التي تحتوي على عدد أقل من القيم المميزة |
| عند تطبيق هذه التقنية على سمات يمكن أن تأخذ عددًا كبيرًا من القيم المتميزة، فقد تتعلم مجموعة التدريب بشكل جيد للغاية | سيواجه المستخدم صعوبة إذا طُلب منه العثور على سمات تتطلب عددًا كبيرًا من القيم المميزة |
انظر أيضاً
مراجع
- ↑ كوينلان، جيه آر (1986). "استقراء أشجار القرار" . تعلم الآلة . 1 : 81-106 . doi : 10.1007/BF00116251 .
- ↑ "التعلم باستخدام شجرة القرار" (ملف PDF) . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 28-12-2014.
- ↑ "مكسب المعلومات، والمعلومات المتبادلة، والتدابير ذات الصلة" .
- ↑ "بيانات الطقس الرمزية" . مؤرشف من الأصل بتاريخ 15-08-2012.
- أشجار القرار
- خوارزميات التصنيف
- الإنتروبيا والمعلومات
- النسب الإحصائية
