توازن بايزي مثالي

في نظرية الألعاب ، يُعرف التوازن البايزي المثالي (PBE) بأنه حلٌّ ذو احتمالية بايزية للعبة تعتمد على الأدوار مع معلومات غير كاملة. وبشكلٍ أدق، هو مفهوم توازن يستخدم التحديث البايزي لوصف سلوك اللاعبين في الألعاب الديناميكية ذات المعلومات غير الكاملة . تُستخدم التوازنات البايزية المثالية لحلّ نتائج الألعاب التي يتناوب فيها اللاعبون الأدوار لكنهم غير متأكدين من "نوع" خصمهم، وهو ما يحدث عندما لا يعرف اللاعبون تفضيلات خصمهم بين الحركات الفردية. ومن الأمثلة الكلاسيكية على الألعاب الديناميكية ذات الأنواع لعبة الحرب، حيث يكون اللاعب غير متأكد مما إذا كان خصمه من النوع المُغامر " الصقر " أو النوع المسالم " الحمامة ". تُعدّ التوازنات البايزية المثالية تطويرًا لتوازن ناش البايزي (BNE)، وهو مفهوم حلٍّ ذو احتمالية بايزية للألعاب غير القائمة على الأدوار.

أي توازن بايزي مثالي يتكون من عنصرين - الاستراتيجيات والمعتقدات :

  • تحدد استراتيجية اللاعب في مجموعة معلومات معينة اختياره للفعل في تلك المجموعة، والذي قد يعتمد على تاريخ اللعبة (على الأفعال التي اتخذها سابقًا). وهذا يشبه اللعبة التسلسلية .
  • يُحدد اعتقاد اللاعب بمجموعة معلومات معينة العقدة التي يعتقد أن اللعبة قد وصلت إليها في تلك المجموعة. وقد يكون هذا الاعتقاد عبارة عن توزيع احتمالي على العقد في مجموعة المعلومات، وعادةً ما يكون توزيعًا احتماليًا على الأنواع المحتملة للاعبين الآخرين. وبصورة رسمية، يُعرَّف نظام الاعتقاد بأنه تخصيص احتمالات لكل عقدة في اللعبة بحيث يكون مجموع الاحتمالات في أي مجموعة معلومات يساوي 1.

يجب أن تستوفي الاستراتيجيات والمعتقدات الشروط التالية أيضًا:

  • العقلانية التسلسلية : ينبغي أن تكون كل استراتيجية مثالية من حيث التوقع، بالنظر إلى المعتقدات.
  • الاتساق : يجب تحديث كل اعتقاد وفقًا لاستراتيجيات التوازن، والإجراءات المرصودة، وقاعدة بايز على كل مسار يتم الوصول إليه في حالة التوازن باحتمالية موجبة. أما على المسارات ذات الاحتمالية الصفرية، والمعروفة بمسارات خارج التوازن ، فيجب تحديد المعتقدات ولكن يمكن أن تكون اختيارية.

التوازن البايزي المثالي هو دائمًا توازن ناش.

أمثلة على التوازنات البايزية المثالية

لعبة الهدايا 1

لنفترض اللعبة التالية:

  • للمرسل نوعان محتملان: إما "صديق" (باحتماليةص{\displaystyle p}) أو "عدو" (باحتمالية1-ص{\displaystyle 1-p}لكل نوع استراتيجيتان: إما تقديم هدية، أو عدم تقديمها.
  • لا يملك المتلقي سوى نوع واحد، واستراتيجيتين: إما قبول الهدية أو رفضها.
  • تكون فائدة المرسل 1 إذا تم قبول هديته، و-1 إذا تم رفض هديته، و0 إذا لم يقدم أي هدية.
  • تعتمد فائدة المتلقي على من يقدم الهدية:
    • إذا كان المرسل صديقًا، فإن فائدة المتلقي هي 1 (إذا قبل) أو 0 (إذا رفض).
    • إذا كان المرسل عدوًا، فإن فائدة المتلقي هي -1 (إذا قبل) أو 0 (إذا رفض).

لأي قيمة منص،{\displaystyle p,}يوجد توازن 1، وهو توازن تجميعي يختار فيه كلا نوعي المرسلين نفس الإجراء:

التوازن 1. المُرسِل: لا يُعطي ، سواء كان صديقًا أم عدوًا. المُستقبِل: لا يقبل ، مع الاعتقاد بأن احتمال (صديق | عدم إعطاء) = p واحتمال (صديق | إعطاء) = x، ويختار قيمةx0.5.{\displaystyle x\leq .5.}

يفضل المُرسِل العائد الصفري الناتج عن عدم الإهداء على العائد -1 الناتج عن الإرسال وعدم القبول. وبالتالي، فإن احتمال الإهداء يساوي صفرًا في حالة التوازن، ولا تقيّد قاعدة بايز الاعتقاد Prob(Friend|Give) على الإطلاق. يجب أن يكون هذا الاعتقاد متشائمًا بما يكفي ليُفضّل المُستقبِل العائد الصفري الناتج عن رفض الهدية على العائد المتوقع. x(1)+(1-x)(-1)=2x-1،{\displaystyle x(1)+(1-x)(-1)=2x-1,}من القبول، لذا فإن شرط أن استراتيجية المتلقي تعظم عائده المتوقع بالنظر إلى معتقداته يستلزم أن يكون احتمال (صديق|إعطاء)0.5.{\displaystyle \leq .5.}من ناحية أخرى، فإن Prob(Friend|Not give) = p مطلوب بموجب قاعدة بايز، لأن كلا النوعين يتخذان هذا الإجراء وهو غير مفيد بشأن نوع المرسل.

لوص1/2{\displaystyle p\geq 1/2}يوجد توازن تجميعي ثانٍ بالإضافة إلى التوازن 1، بناءً على معتقدات مختلفة:

التوازن 2. المُرسِل: يُعطي ، سواء كان صديقًا أم عدوًا. المُستقبِل: يقبل، مع الاعتقاد بأن احتمال (صديق|يعطي) = p واحتمال (صديق|لا يُعطي) = x ، مع اختيار أي قيمة لـx.{\displaystyle x.}

يفضل المُرسِل الحصول على عائد قدره 1 من العطاء على الحصول على عائد قدره 0 من عدم العطاء، متوقعًا قبول هديته. في حالة التوازن، تتطلب قاعدة بايز أن يكون لدى المُستقبِل اعتقاد بأن احتمال (صديق|عطاء) يساوي p ، نظرًا لأن كلا النوعين يتخذان هذا الإجراء، ولا يُفيد هذا الاعتقاد في تحديد نوع المُرسِل في حالة التوازن هذه. أما الاعتقاد خارج حالة التوازن فلا يُؤثر، لأن المُرسِل لن يرغب في الانحراف إلى عدم العطاء مهما كان رد فعل المُستقبِل.

يكون التوازن 1 منحرفًا إذاص0.5.{\displaystyle p\geq .5.}كان من الممكن أن تحتوي اللعبةص=0.99،{\displaystyle p=.99,}لذا، من المرجح أن يكون المُرسِل صديقًا، لكن المُستقبِل سيرفض أي هدية لاعتقاده أن الأعداء أكثر ميلًا من الأصدقاء لتقديم الهدايا. يُبيّن هذا كيف يُمكن أن تُؤدي المعتقدات التشاؤمية إلى توازنٍ سيءٍ لكلا الطرفين، توازنٍ لا يُحقق كفاءة باريتو . مع ذلك، تبدو هذه المعتقدات غير واقعية، وغالبًا ما يكون مُنظّرو الألعاب على استعدادٍ لرفض بعض التوازنات البايزية المثالية باعتبارها غير معقولة.

التوازنان 1 و2 هما التوازنان الوحيدان اللذان قد يوجدان، ولكن يمكننا أيضًا التحقق من التوازنين المحتملين المنفصلين ، حيث يختار نوعا المرسل إجراءات مختلفة، ومعرفة سبب عدم وجودهما كتوازنات بايزية مثالية:

  1. لنفترض أن استراتيجية المُرسِل هي: إعطاء الهدية إذا كان صديقًا، وعدم إعطائها إذا كان عدوًا. يتم تحديث معتقدات المُستقبِل وفقًا لذلك: إذا تلقى هدية، فإنه يعتقد أن المُرسِل صديق؛ وإلا، فإنه يعتقد أن المُرسِل عدو. وبالتالي، سيرد المُستقبِل بالقبول . مع ذلك، إذا اختار المُستقبِل القبول ، فإن المُرسِل العدو سينحرف إلى   الإعطاء ، لزيادة مردوده من 0 إلى 1، لذا لا يمكن أن يكون هذا توازنًا.
  2. لنفترض أن استراتيجية المُرسِل هي: لا تُعطي إذا كان صديقًا، تُعطي إذا كان عدوًا. يتم تحديث معتقدات المُستقبِل وفقًا لذلك: إذا تلقى هدية، فإنه يعتقد أن المُرسِل عدو؛ وإلا، فإنه يعتقد أن المُرسِل صديق. أفضل استراتيجية استجابة للمُستقبِل هي الرفض. مع ذلك، إذا اختار المُستقبِل الرفض ، فإن المُرسِل العدو سينحرف إلى   عدم الإعطاء ، لزيادة عائده من -1 إلى 0، لذا لا يمكن أن يكون هذا توازنًا.

نستنتج أنه في هذه اللعبة، لا يوجد توازن فاصل.

لعبة الهدايا 2

في المثال التالي، [ 1 ] تكون مجموعة PBEs أصغر تمامًا من مجموعتي SPEs وBNEs. وهو شكلٌ مُعدَّل من لعبة الهدايا المذكورة أعلاه، مع التغيير التالي في منفعة المُستقبِل:

  • إذا كان المرسل صديقًا، فإن فائدة المتلقي هي 1 (إذا قبل) أو 0 (إذا رفض).
  • إذا كان المرسل عدوًا، فإن فائدة المتلقي تكون 0 (إذا قبل) أو -1 (إذا رفض).

لاحظ أنه في هذا النوع من الصيغ، يعتبر القبول استراتيجية مهيمنة ضعيفة بالنسبة للمتلقي.

على غرار المثال 1، لا يوجد توازن فصل. لنلقِ نظرة على توازنات التجميع المحتملة التالية:

  1. استراتيجية المُرسِل هي: العطاء الدائم. لا تتغير معتقدات المُستقبِل: فهو لا يزال يؤمن بالاحتمالية المُسبقة، وهي أن المُرسِل صديق باحتمالية معينة.ص{\displaystyle p}وعدو باحتمالية1-ص{\displaystyle 1-p}إن مردود قبولهم يكون دائمًا أعلى من مردود رفضهم، لذا فهم يقبلون (بغض النظر عن قيمةص{\displaystyle p}). هذا هو PBE - إنه أفضل استجابة لكل من المرسل والمستقبل.
  2. استراتيجية المُرسِل هي: عدم الإهداء مطلقًا. لنفترض أن اعتقاد المُستقبِل عند تلقّيه هدية هو أن المُرسِل صديق باحتماليةq{\displaystyle q}، أينq{\displaystyle q}أي رقم في[0،1]{\displaystyle [0,1]}بغض النظر عنq{\displaystyle q}الاستراتيجية المثلى للمتلقي هي: القبول. هذا ليس وضعًا مثاليًا قائمًا على التفضيل، لأن المرسل يستطيع تحسين عائده من 0 إلى 1 عن طريق تقديم هدية.
  3. استراتيجية المُرسِل هي: عدم العطاء مطلقًا، واستراتيجية المُستقبِل هي: الرفض. هذا ليس رد فعل مثاليًا، لأنه بغض النظر عن اعتقاد المُستقبِل، فإن الرفض ليس أفضل رد فعل.

لاحظ أن الخيار 3 هو توازن ناش. إذا تجاهلنا المعتقدات، فيمكن اعتبار الرفض أفضل استجابة للمتلقي، لأنه لا يؤثر على مردوده (لعدم وجود هدية أصلاً). علاوة على ذلك، يُعد الخيار 3 توازن ناش مثاليًا فرعيًا، لأن اللعبة الفرعية الوحيدة هنا هي اللعبة الكاملة. قد تنشأ مثل هذه التوازنات غير المعقولة أيضًا في الألعاب ذات المعلومات الكاملة، ولكن يمكن التخلص منها بتطبيق توازن ناش المثالي فرعيًا . مع ذلك، غالبًا ما تحتوي الألعاب البايزية على مجموعات معلومات غير أحادية، وبما أن الألعاب الفرعية يجب أن تحتوي على مجموعات معلومات كاملة، فقد توجد أحيانًا لعبة فرعية واحدة فقط - اللعبة الكاملة - وبالتالي يكون كل توازن ناش مثاليًا فرعيًا بشكل بديهي. حتى لو احتوت اللعبة على أكثر من لعبة فرعية، فإن عدم قدرة التوازن المثالي فرعيًا على تجاوز مجموعات المعلومات قد يؤدي إلى عدم التخلص من التوازنات غير المعقولة.

باختصار: في هذا النوع من لعبة الهدايا، يوجد احتمالان منطقيان: إما أن يُعطي المُرسِل دائمًا ويقبل المُستقبِل دائمًا، أو أن لا يُعطي المُرسِل أبدًا ويرفض المُستقبِل دائمًا. من بين هذين الاحتمالين، الأول فقط هو الاحتمال المنطقي الصحيح؛ أما الثاني فليس كذلك لأنه لا يمكن دعمه بأي نظام معتقدات.

أمثلة أخرى

للاطلاع على المزيد من الأمثلة، انظر لعبة الإشارة#أمثلة . انظر أيضًا [ 2 ] لمزيد من الأمثلة. يوجد تطبيق حديث لهذا المفهوم في لعبة البوكر، من قِبل لورينتي ودييز (2023). [ 3 ]

بيئة الاختبار العامة في الألعاب متعددة المراحل

اللعبة متعددة المراحل هي سلسلة من الألعاب المتزامنة التي تُلعب واحدة تلو الأخرى. قد تكون هذه الألعاب متطابقة (كما في الألعاب المتكررة ) أو مختلفة.

لعبة متكررة ذات منفعة عامة

يبنيلا
يبني1-C1، 1-C21-C1، 1
لا1، 1-ج20,0
لعبة منفعة عامة

اللعبة التالية [ 4 ] : ​​القسم 6.2 هي تمثيل بسيط لمشكلة المستفيد المجاني . يوجد لاعبان، يمكن لكل منهما إما بناء منفعة عامة أو عدم بنائها. يكسب كل لاعب نقطة واحدة إذا تم بناء المنفعة العامة، وصفرًا إذا لم يتم بناؤها؛ بالإضافة إلى ذلك، إذا قام اللاعبأنا{\displaystyle i}يبني الصالح العام، وعليهم أن يدفعوا ثمن ذلك.جأنا{\displaystyle C_{i}}تُعتبر التكاليف معلومات سرية ، إذ يعرف كل لاعب تكلفته الخاصة فقط، دون معرفة تكلفة اللاعبين الآخرين. المعلومة الوحيدة المعروفة هي أن كل تكلفة تُختار عشوائيًا وبشكل مستقل من توزيع احتمالي معين. وهذا ما يجعل هذه اللعبة لعبة بايزية .

في اللعبة ذات المرحلة الواحدة، يبني كل لاعب إذا وفقط إذا كانت تكلفة بنائه أقل من مكسبه المتوقع من البناء. المكسب المتوقع من البناء يساوي بالضبط ضعف احتمال عدم بناء اللاعب الآخر. في حالة التوازن، لكل لاعبأنا{\displaystyle i}هناك حد أدنى للتكلفةجأنا*{\displaystyle C_{i}^{*}}بحيث يساهم اللاعب فقط إذا كانت تكلفته أقل منجأنا*{\displaystyle C_{i}^{*}}يمكن حساب هذه التكلفة الحدية بناءً على التوزيع الاحتمالي لتكاليف اللاعبين. على سبيل المثال، إذا كانت التكاليف موزعة بشكل منتظم على[0،2]{\displaystyle [0,2]}إذا كان الأمر كذلك، فسيتحقق توازن متناظر تكون فيه التكلفة الحدية لكلا اللاعبين 2/3. وهذا يعني أن اللاعب الذي تتراوح تكلفته بين 2/3 و1 لن يساهم، حتى وإن كانت تكلفته أقل من الفائدة المرجوة، وذلك لاحتمالية مساهمة اللاعب الآخر.

لنفترض الآن أن هذه اللعبة تتكرر مرتين. [ 4 ] : ​​القسم 8.2.3. اللعبتان مستقلتان، أي أن اللاعبين يقررون في كل يوم بالتزامن ما إذا كانوا سيبنون منفعة عامة في ذلك اليوم، ويحصلون على مكافأة قدرها 1 إذا تم بناء المنفعة في ذلك اليوم، ويدفعون تكلفتهم إذا بنوها في ذلك اليوم. الصلة الوحيدة بين اللعبتين هي أنه من خلال اللعب في اليوم الأول، قد يكشف اللاعبون عن بعض المعلومات حول تكاليفهم، وقد تؤثر هذه المعلومات على اللعب في اليوم الثاني.

نبحث عن معادلة تفاضلية متناظرة. نرمز لها بـج^{\displaystyle {\hat {c}}}التكلفة الحدية لكلا اللاعبين في اليوم الأول (لذا في اليوم الأول، يبني كل لاعب إذا وفقط إذا كانت تكلفته على الأكثر)ج^{\displaystyle {\hat {c}}}لحسابج^{\displaystyle {\hat {c}}}، نعمل بشكل عكسي ونحلل تصرفات اللاعبين في اليوم الثاني. تعتمد تصرفاتهم على التاريخ (= التصرفان في اليوم الأول)، وهناك ثلاثة خيارات:

  1. في اليوم الأول، لم يقم أي لاعب بالبناء. لذلك يعلم كلا اللاعبين الآن أن تكلفة خصمهما أعلى منج^{\displaystyle {\hat {c}}}يقومون بتحديث اعتقادهم وفقًا لذلك، ويستنتجون أن هناك احتمالًا أقل أن يقوم خصمهم بالبناء في اليوم الثاني. لذلك، يزيدون من تكلفة العتبة، وتكون تكلفة العتبة في اليوم الثاني هيج٠٠>ج^{\displaystyle c^{00}>{\hat {c}}}.
  2. في اليوم الأول، قام كلا اللاعبين بالبناء. لذلك يعلم كلا اللاعبين الآن أن تكلفة خصمهما أقل منج^{\displaystyle {\hat {c}}}يقومون بتحديث اعتقادهم وفقًا لذلك، ويستنتجون أن هناك احتمالًا أكبر أن يقوم خصمهم بالبناء في اليوم الثاني. لذلك، يخفضون تكلفة العتبة، وتكون تكلفة العتبة في اليوم الثاني هيج11<ج^{\displaystyle c^{11<{\hat {c}}}.
  3. في اليوم الأول، بنى لاعب واحد فقط؛ لنفترض أنه اللاعب رقم 1. الآن، من المعروف أن تكلفة اللاعب رقم 1 أقل منج^{\displaystyle {\hat {c}}}وتكلفة اللاعب الثاني أعلى من ذلكج^{\displaystyle {\hat {c}}}. هناك حالة توازن تكون فيها الإجراءات في اليوم الثاني مطابقة للإجراءات في اليوم الأول - اللاعب 1 يبني واللاعب 2 لا يبني.

من الممكن حساب العائد المتوقع لـ "اللاعب الحدي" (لاعب تكلفته بالضبطج^{\displaystyle {\hat {c}}}في كل حالة من هذه الحالات. وبما أن اللاعب الذي يصل إلى الحد الأدنى يجب أن يكون غير مبالٍ بين المساهمة وعدم المساهمة، فمن الممكن حساب تكلفة الحد الأدنى لليوم الأول.ج^{\displaystyle {\hat {c}}}اتضح أن هذا الحد الأدنى أقل منج*{\displaystyle c^{*}}- العتبة في اللعبة ذات المرحلة الواحدة. هذا يعني أنه في اللعبة ذات المرحلتين، يكون اللاعبون أقل رغبة في البناء مقارنةً باللعبة ذات المرحلة الواحدة. والسبب، ببساطة، هو أنه عندما لا يُساهم لاعب في اليوم الأول، فإنه يُوحي للاعب الآخر بأن تكلفته مرتفعة، مما يجعله أكثر استعدادًا للمساهمة في اليوم الثاني.

المزايدة السريعة

في مزاد إنجليزي مفتوح ، يمكن للمزايدين رفع السعر الحالي تدريجيًا (مثلًا دولار واحد في كل مرة). مع ذلك، غالبًا ما يحدث ما يُعرف بالمزايدة القفزية ، حيث يرفع بعض المزايدين السعر الحالي بأكثر بكثير من الحد الأدنى للزيادة. أحد التفسيرات لذلك هو أنه بمثابة إشارة للمزايدين الآخرين. يوجد نظام مزايدة قائم على السعر، حيث يقفز كل مزايد إذا وفقط إذا تجاوزت قيمته عتبة معينة. انظر: المزايدة القفزية#الإشارة .

انظر أيضاً

مراجع

  1. جيمس بيك. "التوازن البايزي المثالي" (ملف PDF) . جامعة ولاية أوهايو . تم الاطلاع عليه بتاريخ 6 ديسمبر 2021 .
  2. زاك غروسمان. "التوازن البايزي المثالي" (ملف PDF) . جامعة كاليفورنيا . تم الاطلاع عليه في 2 سبتمبر 2016 .
  3. ^ لورينتي، مارتن إيناكي ودييز، خوان كروز (2023). "توازن بايزي المثالي في كوهن بوكر" . جامعة سان أندريس.
  4. 1 2 فودنبرج, درو ; تيرول، جان (1991). نظرية اللعبة . كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا . رقم ISBN 9780262061414.معاينة الكتاب.