نسبة اكتساب المعلومات

في تعلم شجرة القرار ، تُعرَّف نسبة اكتساب المعلومات بأنها نسبة اكتساب المعلومات إلى المعلومات الجوهرية. وقد اقترحها روس كوينلان [ 1 ] للحد من التحيز نحو السمات متعددة القيم من خلال مراعاة عدد وحجم الفروع عند اختيار السمة. [ 2 ]

يُعرف اكتساب المعلومات أيضًا باسم المعلومات المتبادلة . [ 3 ]

تُظهر الصورة اكتساب المعلومات لمتغير يُسمى "السنة"، وتُبين نتيجة اختيار سنة من 1 إلى 12. يُرجّح اكتساب المعلومات كفة هذا المتغير، إذ ستكون النتائج إما إيجابية أو سلبية بشكل قاطع، مع إنشاء عدة عُقد طرفية. مع ذلك، تكمن المشكلة في أن أيًا من هذه السنوات لن يتكرر. المدخل التالي هو السنة 13، ولكن لا يوجد فرع يؤدي إليها، وهذه مشكلة يُمكن حلها باستخدام نسبة اكتساب المعلومات. تعمل هذه النسبة على تطبيع البيانات باستخدام قيمة الإنتروبيا للمتغير، لإزالة تحيز البيانات متعددة المتغيرات، والمتغيرات ذات العُقد المتعددة مقارنةً بالمتغيرات ذات العُقد الأقل. هذا من شأنه أن يُلغي احتمالية إنشاء الشجرة الموضحة في الصورة.
تُظهر الصورة اكتساب المعلومات لمتغير يُسمى "السنة"، وتُبين نتيجة اختيار سنة من 1 إلى 12. يُرجّح اكتساب المعلومات كفة هذا المتغير، إذ ستكون النتائج إما إيجابية أو سلبية بشكل قاطع، مع إنشاء عدة عُقد طرفية. مع ذلك، تكمن المشكلة في أن أيًا من هذه السنوات لن يتكرر. المدخل التالي هو السنة 13، ولكن لا يوجد فرع يؤدي إليها، وهذه مشكلة يُمكن حلها باستخدام نسبة اكتساب المعلومات. تعمل هذه النسبة على تطبيع البيانات باستخدام قيمة الإنتروبيا للمتغير، لإزالة تحيز البيانات متعددة المتغيرات، والمتغيرات ذات العُقد المتعددة مقارنةً بالمتغيرات ذات العُقد الأقل. هذا من شأنه أن يُلغي احتمالية إنشاء الشجرة الموضحة في الصورة.

حساب كسب المعلومات

اكتساب المعلومات هو انخفاض في الإنتروبيا الناتج عن تقسيم مجموعة ذات سماتأ{\displaystyle a}وإيجاد المرشح الأمثل الذي يحقق أعلى قيمة:

إنستغرام(تي،أ)=ح(تي)-ح(تي|أ)،{\displaystyle {\text{IG}}(T,a)=\mathrm {H} {(T)}-\mathrm {H} {(T|a)},}

أينتي{\displaystyle T}هو متغير عشوائي وح(تي|أ){\displaystyle \mathrm {H} {(T|a)}}هي إنتروبياتي{\displaystyle T}بالنظر إلى قيمة السمةأ{\displaystyle a}.

تُساوي كمية المعلومات المكتسبة إجمالي الإنتروبيا لخاصية ما إذا أمكن تصنيف كل قيمة من قيم تلك الخاصية تصنيفًا فريدًا لخاصية النتيجة. في هذه الحالة، تكون قيم الإنتروبيا النسبية المطروحة من إجمالي الإنتروبيا صفرًا.

حساب المعلومات المنقسمة

يتم تعريف قيمة المعلومات المنقسمة للاختبار على النحو التالي:

معلومات مقسمة(X)=-أنا=1نشمال(xأنا)شمال(x)*سجل2شمال(xأنا)شمال(x){\displaystyle {\text{SplitInformation}}(X)=-\sum _{i=1}^{n}{{\frac {\mathrm {N} (x_{i})}{\mathrm {N} (x)}}*\log {_{2}}{\frac {\mathrm {N} (x_{i})}{\mathrm {N} (x)}}}}

أينX{\displaystyle X}هو متغير عشوائي منفصل ذو قيم محتملةx1،x2،...،xن{\displaystyle {x_{1},x_{2},...,x_{n}}}و شمال(xأنا){\displaystyle N(x_{i})}عدد المرات التيxأنا{\displaystyle x_{i}}يحدث مقسومًا على إجمالي عدد الأحداثشمال(x){\displaystyle N(x)}أينx{\displaystyle x}هي مجموعة الأحداث.

قيمة المعلومات المنقسمة هي عدد موجب يصف القيمة المحتملة لفصل فرع من عقدة. وهذه القيمة بدورها هي القيمة الجوهرية التي يمتلكها المتغير العشوائي، وسيتم استخدامها لإزالة التحيز في حساب نسبة اكتساب المعلومات.

حساب نسبة اكتساب المعلومات

نسبة اكتساب المعلومات هي النسبة بين اكتساب المعلومات وقيمة المعلومات المقسمة: IGR(تي،أ)=إنستغرام(تي،أ)/معلومات مقسمة(تي){\displaystyle {\text{IGR}}(T,a)={\text{IG}}(T,a)/{\text{SplitInformation}}(T)}

IGR(تي،أ)=-أنا=1نP(تي)سجلP(تي)-(-أنا=1نP(تي|أ)سجلP(تي|أ))-أنا=1نشمال(تأنا)شمال(ت)*سجل2شمال(تأنا)شمال(ت){\displaystyle {\text{IGR}}(T,a)={\frac {-\sum _{i=1}^{n}{\mathrm {P} (T)\log \mathrm {P} (T)}-(-\sum _{i=1}^{n}{\mathrm {P} (T|a)\log \mathrm {P} (T|a)})}{-\sum _{i=1}^{n}{{\frac {\mathrm {N} (t_{i})}{\mathrm {N} (t)}}*\log {_{2}}{\frac {\mathrm {N} (t_{i})}{\mathrm {N} (t)}}}}}}

مثال

باستخدام بيانات الطقس المنشورة من قبل جامعة فوردهام، [ 4 ] تم إنشاء الجدول أدناه:

بيانات الطقس من WEKA
أوتلوكدرجة حرارةرطوبةرياحيلعب
مشمسحارعاليخطأ شنيعلا
مشمسحارعاليحقيقيلا
غائم جزئياًحارعاليخطأ شنيعنعم
ممطرخفيفعاليخطأ شنيعنعم
ممطررائعطبيعيخطأ شنيعنعم
ممطررائعطبيعيحقيقيلا
غائم جزئياًرائعطبيعيحقيقينعم
مشمسخفيفعاليخطأ شنيعلا
مشمسرائعطبيعيخطأ شنيعنعم
ممطرخفيفطبيعيخطأ شنيعنعم
مشمسخفيفطبيعيخطأ شنيعنعم
غائم جزئياًخفيفعاليحقيقينعم
غائم جزئياًحارطبيعيخطأ شنيعنعم
ممطرخفيفعاليحقيقيلا

باستخدام الجدول أعلاه، يمكن إيجاد الإنتروبيا، ومكسب المعلومات، وتقسيم المعلومات، ونسبة مكسب المعلومات لكل متغير (التوقعات، ودرجة الحرارة، والرطوبة، والرياح). وتُعرض هذه الحسابات في الجداول أدناه:

جدول Outlook
أوتلوكنعملاعدد كل مجموعةإنتروبيا
مشمس2350.971
غائم4040.000
ممطر3250.971
نتائجقيم
معلومة0.694
الإنتروبيا الكلية0.940
اكتساب المعلومات0.247
معلومات مقسمة1.577
نسبة الربح0.156
جدول درجات الحرارة
درجة حرارةنعملاعدد كل مجموعةإنتروبيا
حار2241.000
خفيف4260.918
رائع3140.811
نتائجقيم
معلومة0.911
الإنتروبيا الكلية0.940
اكتساب المعلومات0.029
معلومات مقسمة1.557
نسبة الربح0.019
طاولة الرياح
رياحنعملاعدد كل مجموعةإنتروبيا
خطأ شنيع6280.811
حقيقي3361.000
نتائجقيم
معلومة0.892
الإنتروبيا الكلية0.940
اكتساب المعلومات0.048
معلومات مقسمة0.985
نسبة الربح0.049
جدول الرطوبة
رطوبةنعملاعدد كل مجموعةإنتروبيا
عالي3470.985
طبيعي6170.592
نتائجقيم
معلومة0.788
الإنتروبيا الكلية0.940
اكتساب المعلومات0.152
معلومات مقسمة1.000
نسبة الربح0.152

باستخدام الجداول أعلاه، يمكن استنتاج أن برنامج Outlook يتمتع بأعلى نسبة اكتساب معلومات. بعد ذلك، يجب إيجاد إحصائيات المجموعات الفرعية لمتغير Outlook (مشمس، غائم، ممطر)، وفي هذا المثال، سيتم إنشاء فرع "مشمس" فقط (كما هو موضح في الجدول أدناه):

جدول Outlook
أوتلوكدرجة حرارةرطوبةرياحيلعب
مشمسحارعاليخطأ شنيعلا
مشمسحارعاليحقيقيلا
مشمسخفيفعاليخطأ شنيعلا
مشمسرائعطبيعيخطأ شنيعنعم
مشمسخفيفطبيعيحقيقينعم

يمكن للمرء أن يجد الإحصائيات التالية للمتغيرات الأخرى (درجة الحرارة والرطوبة والرياح) لمعرفة أيها له التأثير الأكبر على عنصر الشمس في متغير التوقعات:

جدول درجات الحرارة
درجة حرارةنعملاعدد كل مجموعةإنتروبيا
حار0220.000
خفيف1121.000
رائع1010.000
نتائجقيم
معلومة0.400
الإنتروبيا الكلية0.971
يكسب0.571
معلومات مقسمة1.522
نسبة الربح0.375
طاولة الرياح
رياحنعملاعدد كل مجموعةإنتروبيا
خطأ شنيع1230.918
حقيقي1121.000
نتائجقيم
معلومة0.951
الإنتروبيا الكلية0.971
يكسب0.020
معلومات مقسمة0.971
نسبة الربح0.021
جدول الرطوبة
رطوبةنعملاعدد كل مجموعةإنتروبيا
عالي0330.000
طبيعي2020.000
نتائجقيم
معلومة0.000
الإنتروبيا الكلية0.971
يكسب0.971
معلومات مقسمة0.971
نسبة الربح1.000

وُجد أن الرطوبة تتمتع بأعلى نسبة اكتساب معلومات. سنكرر نفس الخطوات السابقة ونجد الإحصائيات الخاصة بحالات متغير الرطوبة (مرتفعة وعادية):

رطوبة عالية
رطوبةرياحيلعب
عاليخطأ شنيعلا
عاليحقيقيلا
عاليخطأ شنيعلا
جدول الرطوبة الطبيعية
رطوبةرياحيلعب
طبيعيخطأ شنيعنعم
طبيعيحقيقينعم

بما أن قيم اللعب إما كلها "لا" أو "نعم"، فإن قيمة نسبة اكتساب المعلومات ستكون مساوية لـ 1. أيضًا، الآن وقد وصل المرء إلى نهاية سلسلة المتغيرات مع كون الرياح هو المتغير الأخير المتبقي، يمكنهم بناء خط فرعي كامل من الجذر إلى عقدة الورقة لشجرة القرار.

نص بديل

بعد الوصول إلى هذه العقدة الطرفية، يُتبع الإجراء نفسه لبقية العناصر التي لم تُقسّم بعد في شجرة القرار. كانت هذه المجموعة من البيانات صغيرة نسبيًا، ولكن عند استخدام مجموعة أكبر، تبرز مزايا استخدام نسبة اكتساب المعلومات كعامل تقسيم في شجرة القرار بشكل أوضح.

المزايا

نسبة اكتساب المعلومات تُؤثر على شجرة القرار وتمنعها من النظر في السمات التي تحتوي على عدد كبير من القيم المتميزة.

على سبيل المثال، لنفترض أننا نبني شجرة قرارات لبيانات تصف عملاء شركة ما. تُستخدم نسبة اكتساب المعلومات لتحديد السمات الأكثر صلة. سيتم اختبار هذه السمات بالقرب من جذر الشجرة. قد تكون إحدى سمات الإدخال هي رقم هاتف العميل . تتميز هذه السمة بنسبة اكتساب معلومات عالية، لأنها تُعرّف كل عميل بشكل فريد. ونظرًا لكثرة قيمها المختلفة، لن يتم اختيارها للاختبار بالقرب من الجذر.

العيوب

على الرغم من أن نسبة اكتساب المعلومات تحل المشكلة الأساسية لاكتساب المعلومات، إلا أنها تخلق مشكلة أخرى. فإذا أخذنا في الاعتبار عددًا من السمات ذات عدد كبير من القيم المميزة، فلن تتجاوز هذه النسبة أبدًا سمة ذات عدد أقل من القيم المميزة.

الفرق عن اكتساب المعلومات

  • يكمن قصور اكتساب المعلومات في عدم توفير فرق عددي بين السمات ذات القيم المميزة العالية وتلك التي لها قيم أقل.
    • مثال: لنفترض أننا نبني شجرة قرارات لبيانات تصف عملاء شركة ما. يُستخدم كسب المعلومات عادةً لتحديد السمات الأكثر صلة، بحيث يمكن اختبارها بالقرب من جذر الشجرة. قد تكون إحدى سمات الإدخال رقم بطاقة ائتمان العميل . تتميز هذه السمة بكسب معلومات عالٍ، لأنها تُعرّف كل عميل بشكل فريد، لكننا لا نرغب في تضمينها في شجرة القرارات: فمن غير المرجح أن يُعمّم قرار كيفية التعامل مع عميل بناءً على رقم بطاقته الائتمانية على عملاء لم نتعامل معهم من قبل.
  • تكمن قوة نسبة اكتساب المعلومات في أنها تميل نحو السمات ذات العدد الأقل من القيم المميزة.
  • فيما يلي جدول يصف الاختلافات بين اكتساب المعلومات ونسبة اكتساب المعلومات عند وضعها في سيناريوهات معينة.
الاختلافات الظرفية بين اكتساب المعلومات ونسبة اكتساب المعلومات
اكتساب المعلوماتنسبة اكتساب المعلومات
لن يتم تفضيل أي سمة بناءً على عدد القيم المميزةسيفضل السمات التي تحتوي على عدد أقل من القيم المميزة
عند تطبيق هذه التقنية على سمات يمكن أن تأخذ عددًا كبيرًا من القيم المتميزة، فقد تتعلم مجموعة التدريب بشكل جيد للغايةسيواجه المستخدم صعوبة إذا طُلب منه العثور على سمات تتطلب عددًا كبيرًا من القيم المميزة

انظر أيضاً

مراجع

  1. كوينلان، جيه آر (1986). "استقراء أشجار القرار" . تعلم الآلة . 1 : 81-106 . doi : 10.1007/BF00116251 .
  2. "التعلم باستخدام شجرة القرار" (ملف PDF) . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 28-12-2014.
  3. "مكسب المعلومات، والمعلومات المتبادلة، والتدابير ذات الصلة" .
  4. "بيانات الطقس الرمزية" . مؤرشف من الأصل بتاريخ 15-08-2012.