قانون هيبس


في علم اللغة ، يُعرف قانون هيبس (أو قانون هيردان ) ، وهو قانون تجريبي يصف عدد الكلمات المختلفة في مستند (أو مجموعة مستندات) كدالة لطول المستند (ما يُسمى بعلاقة النوع بالرمز). ويمكن صياغته على النحو التالي:
حيث يمثل V<sub> R</sub> عدد الكلمات المميزة في نص نموذجي بحجم n . أما K و β فهما معلمات حرة تُحدد تجريبياً. في مجموعات النصوص الإنجليزية، تتراوح قيمة K عادةً بين 10 و 100، وقيمة β بين 0.4 و 0.6. [ 1 ]
يُنسب هذا القانون غالبًا إلى هارولد ستانلي هيبس ، لكن غوستاف هيردان ( 1960 ) هو من اكتشفه في الأصل . [ 2 ] في ظل افتراضات بسيطة، يكون قانون هيردان-هيبس مكافئًا تقريبًا لقانون زيبف فيما يتعلق بتكرار الكلمات الفردية داخل النص. [ 3 ] وهذا نتيجة لحقيقة أنه يمكن استنتاج علاقة النوع بالرمز (بشكل عام) لنص متجانس من توزيع أنواعه. [ 4 ]
تجريبياً، يظل قانون هيبس قائماً حتى عند خلط المستند عشوائياً، [ 5 ] مما يعني أنه لا يعتمد على ترتيب الكلمات، بل على تكرارها فقط. [ 6 ] ويُستخدم هذا كدليل لاستنتاج قانون هيبس من قانون زيبف. [ 5 ]
يعني قانون هيبس أنه كلما تم جمع المزيد من النصوص النموذجية، ستكون هناك عوائد متناقصة من حيث اكتشاف المفردات الكاملة التي تستمد منها المصطلحات المتميزة.
تم تحديد انحرافات عن قانون هيبس، كما هو معتاد في مجموعات النصوص الإنجليزية، في مجموعات النصوص التي تم إنشاؤها باستخدام نماذج لغوية كبيرة. [ 7 ]
ينطبق قانون هيبس أيضًا على الحالات التي تكون فيها "المفردات" مجرد مجموعة من الأنواع المتميزة التي تُمثل سمات لمجموعة من الأشياء. على سبيل المثال، قد تكون الأشياء أشخاصًا، وقد تكون الأنواع بلد منشأ الشخص. إذا تم اختيار الأشخاص عشوائيًا (أي أننا لا نختار بناءً على بلد المنشأ)، فإن قانون هيبس ينص على أننا سنحصل سريعًا على ممثلين من معظم البلدان (بما يتناسب مع عدد سكانها)، ولكن سيصبح من الصعب بشكل متزايد تغطية مجموعة البلدان بأكملها بالاستمرار في استخدام طريقة أخذ العينات هذه. وقد لوحظ قانون هيبس أيضًا في نسخ الخلايا المفردة [ 8 ] عند اعتبار الجينات هي الأشياء المتميزة في "المفردات".
انظر أيضاً
- قانون زيبف – توزيع الاحتمالات
- قانون الإيجاز – قانون اللغويات
- قانون منزراث – القانون اللغوي
- قانون برادفورد – نمط المراجع في المجلات العلمية
- قانون بنفورد – ملاحظة مفادها أنه في العديد من مجموعات البيانات الواقعية، من المرجح أن يكون الرقم الأول صغيرًا
- توزيع باريتو – التوزيع الاحتمالي
- مبدأ بذل أقل جهد - فكرة مفادها أن الفاعلين يفضلون القيام بما هو أسهل
- توزيع الرتبة والحجم – التوزيع الإحصائي
- فرضية هيلبرغ – نمو إنتروبيا اللغة وفق قانون القوة أو عملية عشوائية
مراجع
الاقتباسات
- ↑ روسيلو-رودس، بابلو؛ سان ميغيل، ماكسي؛ سانشيز، ديفيد (14 يوليو 2025). "الإنتروبيا ونسبة النوع إلى الرمز في مجموعات بيانات الكلمات الضخمة" . مجلة Physical Review Research . 7 (3) 033054. Bibcode : 2025PhRvR...7c3054R . doi : 10.1103/rxxz-lk3n . ISSN 2643-1564 .
- ↑ إيغه (2007) : "قانون هيردان في اللغويات وقانون هيبس في استرجاع المعلومات هما صياغتان مختلفتان لنفس الظاهرة".
- ^ كورناي (1999) ; بايزا ييتس ونافارو (2000) ؛ فان ليجنهورست وفان دير ويدي (2005) .
- ↑ ميليتشكا (2009)
- 1 2 سانو، يوكي؛ تاكاياسو، هيديكي؛ تاكاياسو، ميساكو (2012). "قانون زيبف وقانون هيبس يمكنهما التنبؤ بحجم الكلمات المحتملة" . ملحق التقدم في الفيزياء النظرية . 194 : 202-209 . Bibcode : 2012PThPS.194..202S . doi : 10.1143/PTPS.194.202 . ISSN 0375-9687 .
- ↑ نجفي، إلهام؛ دارونه، أمير ح. (19-06-2015). إستيبان، فرانسيسكو ج. (محرر). "الأنماط الكسورية للكلمات في النص: طريقة لاستخراج الكلمات المفتاحية تلقائيًا" . PLOS ONE . 10 (6) e0130617. Bibcode : 2015PLoSO..1030617N . doi : 10.1371/journal.pone.0130617 . ISSN 1932-6203 . PMC 4474631. PMID 26091207 .
- ↑ لاي، أويين؛ راندهاوا، جورجيت؛ شيريدان، بول (12 ديسمبر 2023). "قانون هيبس في مجموعات بيانات محاكاة نموذج اللغة الكبير GPT-Neo" . وقائع ورشة العمل الدولية العاشرة حول تقييم الوصول إلى المعلومات (EVIA 2023)، وهي ورشة عمل فرعية لمؤتمر NTCIR-17 . طوكيو، اليابان. ص 20-23 . doi : 10.20736/0002001352 .
- ^ لازاردي، سيلفيا. فالي، فيليبو؛ مازوليني، أندريا؛ سكيالدون، أنطونيو؛ كاسيل، ميشيل. أوسيلا ماتيو (2023). “القوانين الإحصائية الناشئة في البيانات النسخية أحادية الخلية”. المراجعة البدنية ه . 107 (4) 044403: 2021–06.16.448706. bioRxiv 10.1101/2021.06.16.448706 . دوى : 10.1103/PhysRevE.107.044403 . بميد 37198814 .
مصادر
- بايزا-ياتس، ريكاردو؛ نافارو، غونزالو (2000)، "مؤشرات عنونة الكتل لاسترجاع النصوص التقريبي"، مجلة الجمعية الأمريكية لعلوم المعلومات ، 51 (1): 69-82 ، CiteSeerX 10.1.1.31.4832 ، doi : 10.1002/(sici)1097-4571(2000)51:1 < 69::aid-asi10 > 3.0.co ؛ 2-c .
- إيغه، ل. (2007)، "فك تشابك قانون هيردان وقانون هيبس: حجج رياضية ومعلوماتية"، مجلة الجمعية الأمريكية لعلوم وتكنولوجيا المعلومات ، 58 (5): 702-709 ، doi : 10.1002/asi.20524.
- هيبس، هارولد ستانلي (1978)، استرجاع المعلومات: الجوانب الحسابية والنظرية ، دار النشر الأكاديمية. تم اقتراح قانون هيبس في القسم 7.5 (الصفحات 206-208).
- هيردان، غوستاف (1960)، رياضيات النوع والرمز ، لاهاي: موتون.
- كورناي، أندراس ( 1999)، "قانون زيبف خارج النطاق المتوسط"، في روجرز، جيمس (محرر)، وقائع الاجتماع السادس حول رياضيات اللغة ، جامعة سنترال فلوريدا، ص 347-356 .
- ميليتشكا، جيري (2009)، "العلاقة بين النوع والرمز والعلاقة بين الكلمة الناقصة والرمز: نموذج توافقي"، نظرية اللغة. المجلة الدولية للغويات النظرية ، 1 (2): 99-110 ، doi : 10.1515/glot-2009-0009 ، S2CID 124490442 .
- فان ليجنهورست، العاصمة؛ فان دير ويدي، ث. P. (2005)، “اشتقاق رسمي لقانون الكومة”، علوم المعلومات ، 170 ( 2– 4): 263– 272، دوى : 10.1016/j.ins.2004.03.006.
- تتضمن هذه المقالة مواد من قانون هيبس على موقع PlanetMath ، وهو مرخص بموجب رخصة Creative Commons Attribution/Share-Alike .
روابط خارجية
الوسائط المتعلقة بقانون هيبس على ويكيميديا كومنز
- اللغويات الحاسوبية
- القوانين الإحصائية
- القوانين التجريبية
- القواعد التي تحمل الاسم نفسه
