محتوى المعلومات

في نظرية المعلومات ، يُعد محتوى المعلومات ، أو المعلومات الذاتية ، أو المفاجأة ، أو معلومات شانون، كمية أساسية مُستمدة من احتمال وقوع حدث معين من متغير عشوائي . ويمكن اعتبارها طريقة بديلة للتعبير عن الاحتمال، مثل النسبة المئوية أو لوغاريتم النسبة المئوية ، ولكنها تتميز بمزايا رياضية خاصة في سياق نظرية المعلومات.

يمكن تفسير معلومات شانون على أنها تُحدد مستوى "المفاجأة" في نتيجة معينة. ولأنها كمية أساسية، فإنها تظهر أيضًا في العديد من السياقات الأخرى، مثل طول الرسالة اللازمة لنقل الحدث مع مراعاة الترميز الأمثل للمتغير العشوائي.

ترتبط معلومات شانون ارتباطًا وثيقًا بالإنتروبيا ، وهي القيمة المتوقعة للمعلومات الذاتية لمتغير عشوائي، والتي تحدد مدى غرابة هذا المتغير "في المتوسط". وهي متوسط ​​كمية المعلومات الذاتية التي يتوقع المراقب الحصول عليها حول متغير عشوائي عند قياسه. [ 1 ]

يمكن التعبير عن محتوى المعلومات بوحدات معلومات مختلفة ، وأكثرها شيوعًا هو "البت" (يسمى رسميًا الشانون )، كما هو موضح أدناه.

تم استخدام مصطلح "الحيرة" في نمذجة اللغة لتحديد درجة عدم اليقين الكامنة في مجموعة من الأحداث المحتملة.

تعريف

تم اختيار تعريف كلود شانون للمعلومات الذاتية لتلبية عدة بديهيات :

  • إن حدثاً باحتمالية 100% ليس مفاجئاً على الإطلاق ولا يقدم أي معلومات.
  • كلما قل احتمال وقوع حدث ما، زادت دهشته وزادت المعلومات التي يقدمها.
  • إذا تم قياس حدثين مستقلين بشكل منفصل، فإن إجمالي كمية المعلومات هو مجموع المعلومات الذاتية للأحداث الفردية.

يرد الاشتقاق المفصل أدناه، ولكن يمكن إثبات وجود دالة احتمالية فريدة تحقق هذه البديهيات الثلاث، حتى عامل قياس ضربي. بشكل عام، بالنظر إلى عدد حقيقيب>1{\displaystyle b>1}وحدثx{\displaystyle x}باحتمالP{\displaystyle P}، ويُعرَّف محتوى المعلومات بأنه اللوغاريتم السالب للاحتمالية :أنا(x):=-سجلب[برو(x)]=-سجلب(P).{\displaystyle \mathrm {I} (x):=-\log _{b}{\left[\Pr {\left(x\right)}\right]}=-\log _{b}{\left(P\right)}.}القاعدةب{\displaystyle b}يتوافق ذلك مع عامل القياس المذكور أعلاه. تتوافق الخيارات المختلفة لـ b مع وحدات معلومات مختلفة: عندماب=2{\displaystyle b=2}الوحدة هي الشانون (رمزها Sh )، والتي تُسمى غالبًا "بت"؛ عندماب=هـ{\displaystyle b=e}، والوحدة هي الوحدة الطبيعية للمعلومات (رمزها nat )؛ وعندماب=10{\displaystyle b=10}، والوحدة هي هارتلي (رمزها هارت ).

بصورة رسمية، بالنظر إلى متغير عشوائي منفصلX{\displaystyle X}مع دالة الكتلة الاحتماليةصX(x){\displaystyle p_{X}{\left(x\right)}}، المعلومات الذاتية للقياسX{\displaystyle X}كنتيجةx{\displaystyle x}يُعرَّف على النحو التالي: [ 2 ]أناX(x):=-سجل[صX(x)]=سجل(1صX(x)).{\displaystyle \operatorname {I} _{X}(x):=-\log {\left[p_{X}{\left(x\right)}\right]}=\log {\left({\frac {1}{p_{X}{\left(x\right)}}}\right)}.}استخدام الترميزأناX(x){\displaystyle I_{X}(x)}المعلومات الذاتية المذكورة أعلاه ليست عالمية. بما أن الترميزأنا(X؛Y){\displaystyle I(X;Y)}يُستخدم أيضًا في كثير من الأحيان للدلالة على الكمية ذات الصلة من المعلومات المتبادلة ، ويستخدم العديد من المؤلفين الأحرف الصغيرة.حX(x){\displaystyle h_{X}(x)}بدلاً من ذلك، من أجل الانتروبيا الذاتية، مما يعكس استخدام رأس المالح(X){\displaystyle H(X)}من أجل الإنتروبيا.

ملكيات

دالة احتمالية متناقصة بشكل رتيب

بالنسبة لمساحة احتمالية معينة ، فإن قياس الأحداث النادرة يكون بديهيًا أكثر "إثارة للدهشة"، ويُنتج محتوى معلوماتيًا أكبر من الأحداث الأكثر "شيوعًا". وبالتالي، فإن المعلومات الذاتية هي دالة رتيبة متناقصة تمامًا للاحتمال، أو تُسمى أحيانًا دالة "مضادة للتناقص". [ 3 ]

بينما يتم تمثيل الاحتمالات القياسية بأعداد حقيقية في الفترة[0،1]{\displaystyle [0,1]}تكون قيم المعلومات الذاتية أعدادًا حقيقية موسعة غير سالبة في الفترة[0،]{\displaystyle [0,\infty ]}. خاصة:

  • حدث باحتماليةبرو(x)=1{\displaystyle \Pr(x)=1}(حدث معين) يحتوي على محتوى معلوماتي منأنا(x)=-سجلب(1)=0{\displaystyle \mathrm {I} (x)=-\log _{b}(1)=0}إن حدوثه ليس مفاجئاً على الإطلاق ولا يكشف عن أي معلومات جديدة.
  • حدث باحتماليةبرو(x)=0{\displaystyle \Pr(x)=0}(حدث مستحيل) يحتوي على محتوى معلوماتي منأنا(x)=-سجلب(0){\displaystyle \mathrm {I} (x)=-\log _{b}(0)}، وهو أمر غير محدد ولكنه يُعتبر{\displaystyle \infty }بحسب العرف . وهذا يعكس أن مشاهدة حدث يُعتقد أنه مستحيل ستكون مفاجئة للغاية. [ 4 ]

تُعدّ هذه العلاقة الرتيبة أساسيةً لاستخدام محتوى المعلومات كمقياس للشك. فعلى سبيل المثال، معرفة أن تذكرة يانصيب احتمالية فوزها واحد من بين مليون تذكرة تُقدّم معلومات أكثر بكثير من معرفة أنها خاسرة (انظر أيضًا: رياضيات اليانصيب ). وهذا يُرسي أيضًا صلةً بديهيةً بمفاهيم مثل التشتت الإحصائي ؛ فالأحداث البعيدة عن المتوسط ​​أو النتيجة النموذجية (وبالتالي ذات احتمالية منخفضة في العديد من التوزيعات الشائعة) تحمل قدرًا كبيرًا من المعلومات الذاتية.

العلاقة باللوغاريتم الطبيعي للنسبة الاحتمالية

ترتبط معلومات شانون ارتباطًا وثيقًا باللوغاريتم الطبيعي للنسبة الاحتمالية . اللوغاريتم الطبيعي للنسبة الاحتمالية لحدث ماx{\displaystyle x}باحتماليةص(x){\displaystyle p(x)}، ويُعرَّف بأنه لوغاريتم الاحتمالات ،ص(x)1-ص(x){\displaystyle {\frac {p(x)}{1-p(x)}}}ويمكن التعبير عن ذلك كفرق بين قيمتين لمحتوى المعلومات:احتمالات اللوغاريتم(x)= سجلب(ص(x)1-ص(x))= سجلب(ص(x))-سجلب(1-ص(x))=  أنا(¬x) - أنا(x)،{\displaystyle {\displaystyle {\begin{aligned}{\text{log-odds}}(x)&=\ \log _{b}\left({\frac {p(x)}{1-p(x)}}\right)\\&=\ \log _{b}(p(x))-\log _{b}(1-p(x))\\&=\ \ \mathrm {I} (\lnot x)\ -\ \mathrm {I} (x),\end{aligned}}}}أين¬x{\displaystyle \lnot x}يشير إلى الحدث غيرx{\displaystyle x}.

يمكن تفسير هذا التعبير على أنه مقدار المعلومات المكتسبة (أو المفاجأة) من معرفة أن الحدث لم يقع ، مطروحًا منه المعلومات المكتسبة من معرفة أنه وقع . وتكتسب هذه العلاقة أهمية خاصة في النمذجة الإحصائية ، حيث تُعدّ اللوغاريتمات النسبية جوهر دالة اللوجيت والانحدار اللوجستي . [ 5 ]

خاصية جمع الأحداث المستقلة

إن المحتوى المعلوماتي لحدثين مستقلين هو مجموع المحتوى المعلوماتي لكل حدث على حدة. تُعرف هذه الخاصية في الرياضيات باسم خاصية الجمع . لنفترض وجود متغيرين عشوائيين مستقلين.X{\displaystyle X}وY{\displaystyle Y}باستخدام دوال الكتلة الاحتماليةصX(x){\displaystyle p_{X}(x)}وصY(y){\displaystyle p_{Y}(y)}الاحتمال المشترك لملاحظة النتيجة(x،y){\displaystyle (x,y)}يُعطى بضرب الاحتمالات الفردية بسبب الاستقلال :صX،Y(x،y)=برو(X=x،Y=y)=صX(x) صY(y){\displaystyle p_{X,Y}(x,y)=\Pr(X=x,Y=y)=p_{X}(x)\ p_{Y}(y)}يتضمن محتوى المعلومات لهذا الحدث المشترك ما يلي:أناX،Y(x،y)= -سجلب[صX،Y(x،y)]= -سجلب[صX(x) صY(y)]= -سجلب[صX(x)] - سجلب[صY(y)] =  أناX(x) + أناY(y)،{\displaystyle {\displaystyle {\begin{aligned}\operatorname {I} _{X,Y}(x,y)&=\ -\log _{b}\left[p_{X,Y}(x,y)\right]\\&=\ -\log _{b}\left[p_{X}(x)\ p_{Y}(y)\right]\\&=\ -\log _{b}\left[p_{X}(x)\right]\ -\ \log _{b}\left[p_{Y}(y)\right]\ \\&=\ \ \operatorname {I} _{X}(x)\ +\ \operatorname {I} _{Y}(y),\end{aligned}}}}هذه الخاصية الجمعية تجعل محتوى المعلومات مقياسًا أكثر ملاءمة من الناحية الرياضية من الاحتمالية في العديد من التطبيقات، كما هو الحال في نظرية الترميز حيث تكون كمية المعلومات اللازمة لوصف سلسلة من الرموز المستقلة هي مجموع المعلومات اللازمة لكل رمز. [ 3 ]

الخاصية المقابلة للاحتمالات هي أن لوغاريتم احتمالية الأحداث المستقلة يساوي مجموع لوغاريتمات احتمالية كل حدث على حدة. وإذا فُسِّر لوغاريتم الاحتمالية على أنه "دعم" أو "مفاجأة سلبية" (أي مدى دعم حدث ما لنموذج معين: يدعم حدث ما النموذج بقدر ما يكون هذا الحدث غير مفاجئ، بالنظر إلى النموذج)، فإن هذا يعني أن الأحداث المستقلة تُضيف دعمًا: فالمعلومات التي يُوفرها الحدثان معًا للاستدلال الإحصائي هي مجموع معلوماتهما المستقلة.

العلاقة بالإنتروبيا

إنتروبيا شانون للمتغير العشوائيX{\displaystyle X}يُعرَّف على النحو التالي :ح(X) = x-صX(x) سجلصX(x)= xصX(x) أناX(x)  =دهـو  هـ[أناX(X)]،{\displaystyle {\displaystyle {\begin{aligned}\mathrm {H} (X)\ &=\ \sum _{x}{-p_{X}{\left(x\right)}\ \log {p_{X}{\left(x\right)}}}\\&=\ \sum _{x}{p_{X}{\left(x\right)}\ \operatorname {I} _{X}(x)}\ \ {\overset {\underset {\mathrm {def} }{}}{=}}\ \ \operatorname {E} {\left[\operatorname {I} _{X}(X)\right]},\end{aligned}}}}بحسب التعريف، يساوي المحتوى المعلوماتي المتوقع لقياسX{\displaystyle X}[ 6 ] : 11 [ 7 ] : 19-20

يتم حساب القيمة المتوقعة على القيم المنفصلة ضمن نطاقها .

أحيانًا، يُطلق على الإنتروبيا نفسها اسم "المعلومات الذاتية" للمتغير العشوائي، ربما لأن الإنتروبيا تحقق الشرط التالي:ح(X)=أنا(X؛X){\displaystyle \mathrm {H} (X)=\operatorname {I} (X;X)}، أينأنا(X؛X){\displaystyle \operatorname {I} (X;X)}المعلومات المتبادلة لـX{\displaystyle X}مع نفسه. [ 8 ]

بالنسبة للمتغيرات العشوائية المستمرة، فإن المفهوم المقابل هو الإنتروبيا التفاضلية .

ملحوظات

يُطلق على هذا المقياس أيضًا اسم "المفاجأة " ، لأنه يُمثل " المفاجأة " عند رؤية النتيجة (فالنتيجة غير المحتملة للغاية تُعدّ مفاجأة كبيرة). وقد قدّم إدوارد دبليو سامسون هذا المصطلح (كمقياس لوغاريتمي للاحتمالية) في تقريره الصادر عام 1951 بعنوان "المفاهيم الطبيعية الأساسية لنظرية المعلومات". [ 9 ] [ 10 ] وقد ظهر هذا المصطلح مبكرًا في أدبيات الفيزياء في كتاب مايرون تريبوس الصادر عام 1961 بعنوان "الحرارة الساكنة والديناميكا الحرارية" . [ 11 ] [ 12 ]

عندما يكون الحدث تحققًا عشوائيًا (لمتغير) يتم تعريف المعلومات الذاتية للمتغير على أنها القيمة المتوقعة للمعلومات الذاتية للتحقق.

أمثلة

رمية عملة عادلة

لنأخذ مثالاً على تجربة برنولي لرمي عملة معدنية متوازنةX{\displaystyle X}احتمالات وقوع حدث سقوط العملة على الوجه الآخر (الصورة )ح{\displaystyle {\text{H}}}والذيلتي{\displaystyle {\text{T}}}(انظر العملة العادلة والوجه الأمامي والخلفي ) كل منهما نصف ،صX(ح)=صX(تي)=12=0.5{\textstyle p_{X}{({\text{H}})}=p_{X}{({\text{T}})}={\tfrac {1}{2}}=0.5}عند قياس المتغير على أنه رؤوس، فإن مكسب المعلومات المرتبط به هو أناX(ح)=-سجل2صX(ح)=-سجل212=1،{\displaystyle \operatorname {I} _{X}({\text{H}})=-\log _{2}{p_{X}{({\text{H}})}}=-\log _{2}\!{\tfrac {1}{2}}=1,}إذن، فإنّ مقدار المعلومات المكتسبة من رمي عملة معدنية متوازنة على شكل صورة هو 1 شانون . [ 2 ] وبالمثل، فإنّ مقدار المعلومات المكتسبة من قياس الكتابة هو 1 شانون.تي{\displaystyle T}يكونأناX(تي)=-سجل2صX(تي)=-سجل212=1 ش.{\displaystyle \operatorname {I} _{X}(T)=-\log _{2}{p_{X}{({\text{T}})}}=-\log _{2}{\tfrac {1}{2}}=1{\text{ Sh}}.}

رمية نرد عادلة

لنفترض أن لدينا نردًا متوازنًا سداسي الأوجه . قيمة رمية النرد هي متغير عشوائي منتظم منفصلXديو[1،6]{\displaystyle X\sim \mathrm {DU} [1,6]}مع دالة الكتلة الاحتماليةصX(ك)={16،ك{1،2،3،4،5،6}0،خلاف ذلك{\displaystyle p_{X}(k)={\begin{cases}{\frac {1}{6}},&k\in \{1,2,3,4,5,6\}\\0,&{\text{otherwise}}\end{cases}}}احتمالية الحصول على الرقم 4 عند رمي النرد هيصX(4)=16{\textstyle p_{X}(4)={\frac {1}{6}}}كما هو الحال مع أي رمية نرد صحيحة أخرى. وبالتالي، فإن محتوى المعلومات الناتج عن رمي الرقم 4 هوأناX(4)=-سجل2صX(4)=-سجل2162.585ش{\displaystyle \operatorname {I} _{X}(4)=-\log _{2}{p_{X}{(4)}}=-\log _{2}{\tfrac {1}{6}}\approx 2.585\;{\text{Sh}}}من المعلومات.

نردان مستقلان ومتطابقان في التوزيع

لنفترض أن لدينا متغيرين عشوائيين مستقلين ومتطابقين في التوزيعX،Yديو[1،6]{\textstyle X,\,Y\sim \mathrm {DU} [1,6]}كل منها يُقابل رمية نرد مستقلة وعادلة ذات ستة أوجه. التوزيع المشترك لـX{\displaystyle X}وY{\displaystyle Y}يكونصX،Y(x،y)=برو(X=x،Y=y)=صX(x)صY(y)={136، x،y[1،6]شمال0خلاف ذلك.{\displaystyle {\begin{aligned}p_{X,Y}\!\left(x,y\right)&{}=\Pr(X=x,\,Y=y)=p_{X}\!(x)\,p_{Y}\!(y)\\&{}={\begin{cases}\displaystyle {1 \over 36},\ &x,y\in [1,6]\cap \mathbb {N} \\0&{\text{otherwise.}}\end{cases}}\end{aligned}}}

محتوى المعلومات للمتغير العشوائي(X،Y)=(2،4){\displaystyle (X,Y)=(2,\,4)}يكون أناX،Y(2،4)=-سجل2[صX،Y(2،4)]=سجل236=2سجل265.169925 ش،{\displaystyle {\begin{aligned}\operatorname {I} _{X,Y}{(2,4)}&=-\log _{2}\!{\left[p_{X,Y}{(2,4)}\right]}=\log _{2}\!{36}=2\log _{2}\!{6}\\&\approx 5.169925{\text{ Sh}},\end{aligned}}} ويمكن أيضًا حسابها عن طريق جمع الأحداثأناX،Y(2،4)=-سجل2[صX،Y(2،4)]=-سجل2[صX(2)]-سجل2[صY(4)]=2سجل265.169925 ش.{\displaystyle {\begin{aligned}\operatorname {I} _{X,Y}{(2,4)}&=-\log _{2}\!{\left[p_{X,Y}{(2,4)}\right]}=-\log _{2}\!{\left[p_{X}(2)\right]}-\log _{2}\!{\left[p_{Y}(4)\right]}\\&=2\log _{2}\!{6}\\&\approx 5.169925{\text{ Sh}}.\end{aligned}}}

معلومات من تكرار عمليات الرمي

إذا تلقينا معلومات حول قيمة النرد دون معرفة أي نرد يحمل أي قيمة، فيمكننا صياغة هذا النهج باستخدام ما يسمى بمتغيرات العد. جك:=دلتاك(X)+دلتاك(Y)={0،¬(X=كY=ك)1،X=كY=ك2،X=كY=ك{\displaystyle C_{k}:=\delta _{k}(X)+\delta _{k}(Y)={\begin{cases}0,&\neg \,(X=k\vee Y=k)\\1,&\quad X=k\,\veebar \,Y=k\\2,&\quad X=k\,\wedge \,Y=k\end{cases}}} لك{1،2،3،4،5،6}{\displaystyle k\in \{1,2,3,4,5,6\}}، ثمك=16جك=2{\textstyle \sum _{k=1}^{6}{C_{k}}=2}وتخضع الأعداد للتوزيع متعدد الحدودو(ج1،...،ج6)=برو(ج1=ج1 و ... و ج6=ج6)={1181ج1!جك!، متى أنا=16جأنا=20خلاف ذلك،={118، عندما 2 جك نكون 1136، عندما يكون واحداً بالضبط جك=20، خلاف ذلك.{\displaystyle {\begin{aligned}f(c_{1},\ldots ,c_{6})&{}=\Pr(C_{1}=c_{1}{\text{ and }}\dots {\text{ and }}C_{6}=c_{6})\\&{}={\begin{cases}{\displaystyle {1 \over {18}}{1 \over c_{1}!\cdots c_{k}!}},\ &{\text{when }}\sum _{i=1}^{6}c_{i}=2\\0&{\text{otherwise,}}\end{cases}}\\&{}={\begin{cases}{1 \over 18},\ &{\text{when 2 }}c_{k}{\text{ are }}1\\{1 \over 36},\ &{\text{when exactly one }}c_{k}=2\\0,\ &{\text{otherwise.}}\end{cases}}\end{aligned}}}

وللتحقق من ذلك، النتائج الست(X،Y){(ك،ك)}ك=16={(1،1)،(2،2)،(3،3)،(4،4)،(5،5)،(6،6)}{\textstyle (X,Y)\in \left\{(k,k)\right\}_{k=1}^{6}=\left\{(1,1),(2,2),(3,3),(4,4),(5,5),(6,6)\right\}}يتوافق مع الحدثجك=2{\displaystyle C_{k}=2}واحتمالية إجمالية قدرها 1/6 . هذه هي الأحداث الوحيدة التي تُحفظ بدقة مع تحديد هوية النرد الذي رُميَت كل نتيجة، لأن النتائج متطابقة. وبدون معرفة كيفية تمييز النرد الذي رُميَت الأرقام الأخرى، فإن النتائج الأخرى ستكون غير معروفة .(62)=15{\textstyle {\binom {6}{2}}=15}تُشير التوليفات إلى ظهور رقم معين على أحد النردين ورقم مختلف على النرد الآخر، ولكل توليفة احتمال 1/18 . في الواقع،6136+15118=1{\textstyle 6\cdot {\tfrac {1}{36}}+15\cdot {\tfrac {1}{18}}=1}، حسب الحاجة.

ليس من المستغرب أن تكون المعلومات التي تُكتسب من معرفة أن كلا النردين قد ظهرا بنفس الرقم المحدد أكبر من المعلومات التي تُكتسب من معرفة أن أحد النردين أظهر رقمًا معينًا والآخر رقمًا مختلفًا. خذ على سبيل المثال الأحداثأك={(X،Y)=(ك،ك)}{\displaystyle A_{k}=\{(X,Y)=(k,k)\}}وبج،ك={جج=1}{جك=1}{\displaystyle B_{j,k}=\{c_{j}=1\}\cap \{c_{k}=1\}}لجك،1ج،ك6{\displaystyle j\neq k,1\leq j,k\leq 6}. على سبيل المثال،أ2={X=2 و Y=2}{\displaystyle A_{2}=\{X=2{\text{ and }}Y=2\}}وب3،4={(3،4)،(4،3)}{\displaystyle B_{3,4}=\{(3,4),(4,3)\}}.

محتويات المعلومات هي أنا(أ2)=-سجل2136=5.169925 ش{\displaystyle \operatorname {I} (A_{2})=-\log _{2}\!{\tfrac {1}{36}}=5.169925{\text{ Sh}}}أنا(ب3،4)=-سجل2118=4.169925 ش{\displaystyle \operatorname {I} \left(B_{3,4}\right)=-\log _{2}\!{\tfrac {1}{18}}=4.169925{\text{ Sh}}}

يتركنفس=أنا=16أأنا{\textstyle {\text{Same}}=\bigcup _{i=1}^{6}{A_{i}}}ليكن الحدث هو أن كلا النردين حصلا على نفس القيمة والفرق=نفس¯{\displaystyle {\text{Diff}}={\overline {\text{Same}}}}ليكن الحدث هو اختلاف النرد. ثمبرو(نفس)=16{\textstyle \Pr({\text{Same}})={\tfrac {1}{6}}}وبرو(الفرق)=56{\textstyle \Pr({\text{Diff}})={\tfrac {5}{6}}}تتضمن المعلومات الواردة في هذه الأحداث ما يلي: أنا(نفس)=-سجل216=2.5849625 ش{\displaystyle \operatorname {I} ({\text{Same}})=-\log _{2}\!{\tfrac {1}{6}}=2.5849625{\text{ Sh}}}أنا(الفرق)=-سجل256=0.2630344 ش.{\displaystyle \operatorname {I} ({\text{Diff}})=-\log _{2}\!{\tfrac {5}{6}}=0.2630344{\text{ Sh}}.}

معلومات من مجموع النرد

دالة الكتلة الاحتمالية أو دالة الكثافة (يُطلق عليها مجتمعةً مقياس الاحتمال ) لمجموع متغيرين عشوائيين مستقلين هي التفاف كل مقياس احتمال . في حالة رمي نرد سداسي الأوجه مستقل وعادل، يكون المتغير العشوائيZ=X+Y{\displaystyle Z=X+Y}دالة كتلة الاحتمالصZ(z)=صX(x)*صY(y)=6-|z-7|36{\textstyle p_{Z}(z)=p_{X}(x)*p_{Y}(y)={6-|z-7| \over 36}}، أين*{\displaystyle *}يمثل هذا الالتفاف المنفصل . والنتيجة هيZ=5{\displaystyle Z=5}احتماليةصZ(5)=436=19{\textstyle p_{Z}(5)={\frac {4}{36}}={1 \over 9}}لذلك، فإن المعلومات المذكورة هيأناZ(5)=-سجل219=سجل293.169925 ش.{\displaystyle \operatorname {I} _{Z}(5)=-\log _{2}{\tfrac {1}{9}}=\log _{2}{9}\approx 3.169925{\text{ Sh}}.}

توزيع عام منفصل وموحد

بتعميم مثال رمي النرد العادل أعلاه  ، ضع في اعتبارك متغيرًا عشوائيًا منتظمًا منفصلاً عامًا (DURV).Xديو[أ،ب]؛أ،بZ، بأ.{\displaystyle X\sim \mathrm {DU} [a,b];\quad a,b\in \mathbb {Z} ,\ b\geq a.}للتسهيل، حددشمال:=ب-أ+1{\textstyle N:=b-a+1}دالة الكتلة الاحتمالية هيصX(ك)={1شمال،ك[أ،ب]Z0،خلاف ذلك.{\displaystyle p_{X}(k)={\begin{cases}{\frac {1}{N}},&k\in [a,b]\cap \mathbb {Z} \\0,&{\text{otherwise}}.\end{cases}}}بشكل عام، لا يشترط أن تكون قيم DURV أعدادًا صحيحة ، أو حتى متساوية التباعد لأغراض نظرية المعلومات؛ يكفي فقط أن تكون متساوية الاحتمال . [ 2 ] مكسب المعلومات لأي ملاحظةX=ك{\displaystyle X=k}يكونأناX(ك)=-سجل21شمال=سجل2شمال ش.{\displaystyle \operatorname {I} _{X}(k)=-\log _{2}{\frac {1}{N}}=\log _{2}{N}{\text{ Sh}}.}

حالة خاصة: متغير عشوائي ثابت

لوب=أ{\displaystyle b=a}فوق،X{\displaystyle X}يتحول إلى متغير عشوائي ثابت ذي توزيع احتمالي محدد بواسطةX=ب{\displaystyle X=b}ومقياس الاحتمالية مقياس ديراكصX(ك)=دلتاب(ك){\textstyle p_{X}(k)=\delta _{b}(k)}القيمة الوحيدةX{\displaystyle X}يمكن أن يأخذ بشكل حتميب{\displaystyle b}لذا فإن محتوى المعلومات لأي قياس لـX{\displaystyle X}يكونأناX(ب)=-سجل21=0.{\displaystyle \operatorname {I} _{X}(b)=-\log _{2}{1}=0.}بشكل عام، لا توجد معلومات يمكن الحصول عليها من قياس قيمة معروفة. [ 2 ]

التوزيع الفئوي

بتعميم جميع الحالات المذكورة أعلاه، ضع في اعتبارك متغيرًا عشوائيًا منفصلاً فئويًا ذو نطاقS={sأنا}أنا=1شمال{\textstyle {\mathcal {S}}={\bigl \{}s_{i}{\bigr \}}_{i=1}^{N}}ودالة الكتلة الاحتمالية معطاة بواسطة

صX(ك)={صأنا،ك=sأناS0،خلاف ذلك.{\displaystyle p_{X}(k)={\begin{cases}p_{i},&k=s_{i}\in {\mathcal {S}}\\0,&{\text{otherwise}}.\end{cases}}}

لأغراض نظرية المعلومات، القيمsS{\displaystyle s\in {\mathcal {S}}}لا يشترط أن تكون أعدادًا ؛ يمكن أن تكون أي أحداث متنافية على فضاء قياس ذي قياس محدود تم تطبيعه إلى مقياس احتماليص{\displaystyle p}دون فقدان للعمومية ، يمكننا افتراض أن التوزيع الفئوي مدعوم على المجموعة[شمال]={1،2،...،شمال}{\textstyle [N]=\left\{1,2,\dots ,N\right\}}; البنية الرياضية متماثلة من حيث نظرية الاحتمالات ، وبالتالي من حيث نظرية المعلومات أيضًا.

معلومات عن النتيجةX=x{\displaystyle X=x}يُعطى

أناX(x)=-سجل2صX(x).{\displaystyle \operatorname {I} _{X}(x)=-\log _{2}{p_{X}(x)}.}

من هذه الأمثلة، من الممكن حساب معلومات أي مجموعة من المتغيرات المستقلة ذات التوزيعات المعروفة عن طريق الجمع .

الاشتقاق

بحسب التعريف، لا تُنقل المعلومات من جهة مُرسِلة تمتلكها إلى جهة مُستقبِلة إلا إذا لم تكن الأخيرة على علمٍ مُسبقٍ بها . فإذا كانت الجهة المُستقبِلة على درايةٍ تامةٍ بمحتوى الرسالة قبل استلامها، فإن كمية المعلومات المُستلمة من الرسالة تُصبح صفرًا. ولا تُنقل الرسالة معلوماتٍ فعليًا إلا إذا كانت معرفة المُستقبِل المُسبقة بمحتوى الرسالة أقل من 100% يقينًا.

على سبيل المثال، اقتباس شخصية (رجل الطقس الهيبي ديبي) للممثل الكوميدي جورج كارلين :

توقعات الطقس لليلة: ظلام دامس. ] يستمر الظلام طوال الليل، مع ظهور ضوء متفرق على نطاق واسع بحلول الصباح.

بافتراض أن المرء لا يقيم بالقرب من المناطق القطبية ، فإن كمية المعلومات المنقولة في هذا التوقع تساوي صفرًا لأنه من المعروف مسبقًا، قبل تلقي التوقع، أن الظلام يأتي دائمًا مع الليل.

وبناءً على ذلك، فإن كمية المعلومات الذاتيةأنا{\displaystyle \operatorname {I} }يتضمن رسالة تنقل وقوع حدث ما ،ωن{\displaystyle \omega _{n}}يعتمد ذلك فقط على الاحتماليةبرو(ωن){\displaystyle \Pr(\omega _{n})}من ذلك الحدث.أنا(ωن)=و(برو(ωن))،{\displaystyle \operatorname {I} (\omega _{n})=f(\Pr(\omega _{n})),}لبعض الوظائفو{\displaystyle f}سيتم تحديده. إذابرو(ωن)=1{\displaystyle \Pr(\omega _{n})=1}، ثمأنا(ωن)=0{\displaystyle \operatorname {I} (\omega _{n})=0}. لوبرو(ωن)<1{\displaystyle \Pr(\omega _{n})<1}، ثمأنا(ωن)>0{\displaystyle \operatorname {I} (\omega _{n})>0}.

علاوة على ذلك، وبحسب التعريف، فإن مقياس المعلومات الذاتية غير سالب وقابل للجمع. إذا حدثج{\displaystyle C}هو تقاطع حدثين مستقلينأ{\displaystyle A}وب{\displaystyle B}ثم معلومات الحدثج{\displaystyle C}إن ما يحدث هو مجموع كميات المعلومات الخاصة بالأحداث الفرديةأ{\displaystyle A}وب{\displaystyle B}:أنا(ج)=أنا(أب)=أنا(أ)+أنا(ب).{\displaystyle \operatorname {I} (C)=\operatorname {I} (A\cap B)=\operatorname {I} (A)+\operatorname {I} (B).}بسبب استقلالية الأحداثأ{\displaystyle A}وب{\displaystyle B}، احتمال وقوع الحدثج{\displaystyle C}يكون:برو(ج)=برو(أب)=برو(أ)برو(ب).{\displaystyle \Pr(C)=\Pr(A\cap B)=\Pr(A)\cdot \Pr(B).}ربط الاحتمالات بالدالةو{\displaystyle f}:و(برو(أ)برو(ب))=و(برو(أ))+و(برو(ب)).{\displaystyle f(\Pr(A)\cdot \Pr(B))=f(\Pr(A))+f(\Pr(B)).}هذه معادلة دالية . الدوال المتصلة الوحيدةو{\displaystyle f}تتمتع الدوال اللوغاريتمية بهذه الخاصية . لذلك،و(ص){\displaystyle f(p)}يجب أن يكون على الشكل التالي:و(ص)=كسجلب(ص)،{\displaystyle f(p)=K\log _{b}(p),}لبعض القواعدب{\displaystyle b}وثابتك{\displaystyle K}بما أن الحدث ذو الاحتمالية المنخفضة يجب أن يتوافق مع محتوى معلوماتي عالٍ، فإن الثابتك{\displaystyle K}يجب أن تكون سالبة. يمكننا كتابةك=-1{\displaystyle K=-1}وامتصاص أي تقشر في القاعدةب{\displaystyle b}من اللوغاريتم. وهذا يعطي الشكل النهائي:أنا(ωن)=-سجلب(برو(ωن))=سجلب(1برو(ωن)).{\displaystyle \operatorname {I} (\omega _{n})=-\log _{b}(\Pr(\omega _{n}))=\log _{b}\left({\frac {1}{\Pr(\omega _{n})}}\right).}كلما قل احتمال وقوع الحدثωن{\displaystyle \omega _{n}}كلما زادت كمية المعلومات الذاتية المرتبطة بالرسالة التي تفيد بوقوع الحدث بالفعل، زادت قيمة اللوغاريتم. إذا كان اللوغاريتم أعلاه أساسه 2، فإن وحدةأنا(ωن){\displaystyle I(\omega _{n})}هو شانون . هذه هي الممارسة الأكثر شيوعًا. عند استخدام اللوغاريتم الطبيعي للأساسهـ{\displaystyle e}، ستكون الوحدة هي النات . أما بالنسبة للوغاريتم ذي الأساس 10، فإن وحدة المعلومات هي هارتلي .

كمثال توضيحي سريع، فإن محتوى المعلومات المرتبط بنتيجة الحصول على 4 صور (أو أي نتيجة محددة) في 4 رميات متتالية لعملة معدنية سيكون 4 شانون (باحتمالية 1/16)، ومحتوى المعلومات المرتبط بالحصول على نتيجة أخرى غير النتيجة المحددة سيكون-سجل2(15/16)0.09{\displaystyle -\log _{2}(15/16)\approx 0.09}شانونز. انظر أعلاه للحصول على أمثلة مفصلة.

انظر أيضاً

مراجع

  1. جونز، د.س.، نظرية المعلومات الأولية ، المجلد، مطبعة كلارندون، أكسفورد، الصفحات 11-15، 1979
  2. 1 2 3 4 ماكماهون، ديفيد م. (2008). شرح الحوسبة الكمومية . هوبوكين، نيوجيرسي: وايلي-إنترساينس. ISBN 9780470181386. OCLC 608622533 . 
  3. 1 2 Cover, TM; Thomas, JA (2006). عناصر نظرية المعلومات ( الطبعة الثانية). وايلي-إنترساينس. ص 20. ISBN   978-0471241959.
  4. ماكاي، ديفيد جيه سي (2003). نظرية المعلومات، والاستدلال، وخوارزميات التعلم . مطبعة جامعة كامبريدج. ص 32. ISBN  978-0521642989.
  5. بيشوب، كريستوفر م. (2006). التعرف على الأنماط والتعلم الآلي . سبرينغر. ص 205. ISBN  978-0387310732.
  6. بوردا، مونيكا (2011). أساسيات نظرية المعلومات والترميز . سبرينغر. ISBN 978-3-642-20346-6.
  7. هان، تي صن؛ كوباياشي، كينغو (2002). رياضيات المعلومات والترميز . الجمعية الرياضية الأمريكية. ISBN 978-0-8218-4256-0.
  8. توماس م. كوفر، جوي أ. توماس؛ عناصر نظرية المعلومات؛ ص 20؛ 1991.
  9. سامسون، إدوارد و. (1953) [نُشرت أصلاً في أكتوبر 1951 كتقرير فني رقم E5079، مركز أبحاث القوات الجوية في كامبريدج]. [[تمت إزالة الرابط المشبوه] "المفاهيم الطبيعية الأساسية لنظرية المعلومات"]. ETC: مراجعة للدلالات العامة . 10 (4، صيف 1953، عدد خاص عن نظرية المعلومات): 283-297 . JSTOR 42581366 . {{cite journal}}: تحقق من |url=القيمة ( مساعدة )
  10. أتنياف، فريد (1959). تطبيقات نظرية المعلومات في علم النفس: ملخص للمفاهيم الأساسية والأساليب والنتائج ( الطبعة الأولى). نيويورك: هولت، راينهارت ووينستون. 
  11. بيرنشتاين، آر بي؛ ليفين، آر دي (1972). "الإنتروبيا والتغير الكيميائي. 1. توصيف توزيعات طاقة النواتج (والمتفاعلات) في التصادمات الجزيئية التفاعلية: نقص المعلومات والإنتروبيا" . مجلة الفيزياء الكيميائية . 57 (1): 434-449 . Bibcode : 1972JChPh..57..434B . doi : 10.1063/1.1677983 .
  12. مايرون تريبوس (1961) الديناميكا الحرارية والحرارية الثابتة: مقدمة في الطاقة والمعلومات وحالات المادة، مع تطبيقات هندسية (D. Van Nostrand، 24 West 40 Street، نيويورك 18، نيويورك، الولايات المتحدة الأمريكية) تريبوس، مايرون (1961)، ص 64-66 .

للمزيد من القراءة

  • مدخل "المفاجأة" في مسرد نظرية المعلومات الجزيئية