tf–idf
في مجال استرجاع المعلومات ، يُعدّ مقياس tf-idf ( تردد المصطلح - تردد المستند العكسي ، أو TF*IDF ، أو TFIDF ، أو TF-IDF ، أو Tf-idf ) مقياسًا لأهمية كلمة ما في مستند ضمن مجموعة أو مدونة ، مع مراعاة أن بعض الكلمات تظهر بشكل متكرر أكثر من غيرها. [ 1 ] وكما هو الحال في نموذج "حقيبة الكلمات" ، يُصوّر هذا المقياس المستند كمجموعة متعددة من الكلمات، دون مراعاة ترتيبها . وهو يُعدّ تحسينًا لنموذج "حقيبة الكلمات" البسيط، إذ يسمح لوزن الكلمات بالاعتماد على بقية المدونة.
كثيراً ما استُخدمت هذه التقنية كعامل ترجيح في عمليات البحث عن المعلومات، واستخراج البيانات النصية ، ونمذجة المستخدمين . وأظهر استطلاع أُجري عام ٢٠١٥ أن ٨٣٪ من أنظمة التوصية النصية في المكتبات الرقمية تستخدم تقنية TF-IDF. [ ٢ ] كما استخدمت محركات البحث صيغاً مختلفة من نظام ترجيح TF-IDF كأداة أساسية في تقييم وتصنيف مدى ملاءمة المستند لاستعلام المستخدم .
إحدى أبسط وظائف الترتيب يتم حسابها عن طريق جمع قيم tf-idf لكل مصطلح استعلام؛ والعديد من وظائف الترتيب الأكثر تعقيدًا هي متغيرات لهذا النموذج البسيط.
الدوافع
ابتكرت كارين سبارك جونز (1972) تفسيرًا إحصائيًا لخصوصية المصطلح يسمى تردد المستند العكسي (idf)، والذي أصبح حجر الزاوية في ترجيح المصطلح: [ 3 ]
يمكن تحديد مدى خصوصية المصطلح كميًا كدالة عكسية لعدد المستندات التي يظهر فيها.
على سبيل المثال، يمكن تمثيل قيم df (تكرار المستند) و idf لبعض الكلمات في مسرحيات شكسبير الـ 37 على النحو التالي:
| كلمة | df | idf |
|---|---|---|
| روميو | 1 | 1.57 |
| سلطة | 2 | 1.27 |
| فالستاف | 4 | 0.966 |
| غابة | 12 | 0.489 |
| معركة | 21 | 0.246 |
| ذكاء | 34 | 0.037 |
| أحمق | 36 | 0.012 |
| جيد | 37 | 0 |
| حلو | 37 | 0 |
نلاحظ أن كلمات " روميو " و" فالستاف " و"سلطة" تظهر في عدد قليل جدًا من المسرحيات، لذا فإن رؤية هذه الكلمات قد تُعطي فكرة جيدة عن المسرحية المقصودة. في المقابل، تظهر كلمتا "جيد" و"حلو" في كل مسرحية، وهما لا تُقدمان أي معلومات تُذكر عن المسرحية المقصودة.
تعريف
- يمثل معامل tf-idf حاصل ضرب إحصائيتين: تردد المصطلح وتردد المستند العكسي . وهناك طرق متعددة لتحديد القيم الدقيقة لكلتا الإحصائيتين.
- صيغة تهدف إلى تحديد أهمية كلمة مفتاحية أو عبارة داخل مستند أو صفحة ويب.
| نظام الترجيح | وزن tf |
|---|---|
| ثنائي | |
| العد الخام | |
| تكرار المصطلح | |
| التسوية اللوغاريتمية | |
| التطبيع المزدوج 0.5 | |
| التطبيع المزدوج K |
تكرار المصطلح
تردد المصطلح، tf( t , d ) ، هو التردد النسبي للمصطلح t داخل المستند d ،
- ،
حيث يُمثل f( t , d) العدد الإجمالي لتكرار مصطلح ما في المستند، أي عدد مرات ظهور هذا المصطلح t في المستند d . لاحظ أن المقام هو ببساطة العدد الإجمالي للمصطلحات في المستند d (مع احتساب كل تكرار للمصطلح نفسه على حدة). توجد طرق أخرى لتعريف تكرار المصطلح: [ 4 ] : 128
- العدد الخام نفسه: tf( t , d ) = f t , d
- التكرارات المنطقية : tf( t , d ) = 1 إذا حدث t في d و 0 خلاف ذلك؛
- التردد المقياس اللوغاريتمي : tf( t , d ) = log (1 + f t , d ) ; [ 5 ]
- التردد المعزز، لمنع التحيز نحو المستندات الأطول، على سبيل المثال التردد الخام مقسومًا على التردد الخام للمصطلح الأكثر تكرارًا في المستند:
تردد المستند العكسي
| نظام الترجيح | وزن idf () |
|---|---|
| أحادي | 1 |
| تردد المستندات العكسي | |
| تدرج تردد المستندات العكسي | |
| الحد الأقصى لتردد المستند العكسي | |
| التردد العكسي الاحتمالي للمستندات |

يُعدّ تردد الكلمة العكسي في المستندات مقياسًا لكمية المعلومات التي توفرها الكلمة، أي مدى شيوعها أو ندرتها في جميع المستندات. وهو عبارة عن النسبة العكسية للمستندات التي تحتوي على الكلمة ، مُقاسةً بمقياس لوغاريتمي (يتم الحصول عليها بقسمة العدد الإجمالي للمستندات على عدد المستندات التي تحتوي على المصطلح، ثم أخذ لوغاريتم الناتج).
مع
- : هي مجموعة جميع الوثائق في المدونة
- : إجمالي عدد الوثائق في المجموعة
- عدد المستندات التي تحتوي على المصطلحيظهر (أي،إذا لم يكن المصطلح موجودًا في المدونة، فسيؤدي ذلك إلى القسمة على صفر. لذلك، من الشائع تعديل البسط إلىوالمقام إلى.
تردد المصطلح – تردد المستند العكسي
| نظام الترجيح | tf-idf |
|---|---|
| عد-idf | |
| التطبيع المزدوج-idf | |
| التطبيع اللوغاريتمي-idf |
ثم يتم حساب tf–idf على النحو التالي
يُحقق وزنٌ عالٍ في مقياس tf–idf عندما يكون تكرار المصطلح مرتفعًا (في المستند المُحدد) وتكراره منخفضًا في مجموعة المستندات ككل؛ وبالتالي، تميل الأوزان إلى استبعاد المصطلحات الشائعة. ولأن النسبة داخل دالة اللوغاريتم في idf تكون دائمًا أكبر من أو تساوي 1، فإن قيمة idf (و tf–idf) تكون أكبر من أو تساوي 0. ومع ازدياد عدد المستندات التي يظهر فيها المصطلح، تقترب النسبة داخل اللوغاريتم من 1، مما يجعل قيمتي idf و tf–idf أقرب إلى الصفر.
تبرير الاتحاد الدولي للبحار
تم تقديم مفهوم Idf تحت مسمى "تحديد المصطلح" من قبل كارين سبارك جونز في ورقة بحثية عام 1972. وعلى الرغم من أنه أثبت فعاليته كأداة استدلالية ، إلا أن أسسه النظرية ظلت مثيرة للجدل لثلاثة عقود على الأقل بعد ذلك، حيث سعى العديد من الباحثين إلى إيجاد مبررات نظرية معلوماتية له. [ 6 ]
لم يقدم تفسير سبارك جونز نفسه الكثير من النظرية، باستثناء ربطه بقانون زيبف . [ 6 ] وقد بُذلت محاولات لوضع idf على أساس احتمالي ، [ 7 ] من خلال تقدير احتمال احتواء مستند معين d على مصطلح t باعتباره التردد النسبي للمستند.
حتى نتمكن من تعريف idf على النحو التالي
وبعبارة أخرى، فإن تردد المستند العكسي هو لوغاريتم تردد المستند النسبي "العكسي".
يتخذ هذا التفسير الاحتمالي بدوره نفس شكل تفسير المعلومات الذاتية . ومع ذلك، فإن تطبيق هذه المفاهيم النظرية للمعلومات على مشاكل استرجاع المعلومات يؤدي إلى مشاكل عند محاولة تحديد فضاءات الأحداث المناسبة لتوزيعات الاحتمالات المطلوبة : لا يقتصر الأمر على ضرورة مراعاة المستندات فحسب، بل يشمل أيضًا الاستعلامات والمصطلحات. [ 6 ]
الربط بنظرية المعلومات
يمكن صياغة كل من تردد المصطلح وتردد المستند العكسي باستخدام نظرية المعلومات ؛ مما يساعد على فهم سبب أهمية حاصل ضربهما من حيث المحتوى المعلوماتي المشترك للمستند. وهناك افتراض مميز حول التوزيع.وهو ذلك:
هذا الافتراض وآثاره، وفقًا لأيزاوا: "يمثل الأسلوب الاستدلالي الذي يستخدمه tf-idf." [ 8 ]
الإنتروبيا الشرطية لوثيقة "مختارة عشوائياً" في مجموعة النصوص، بشرط أن يحتوي على مصطلح محدد(وبافتراض أن جميع المستندات لها احتمالية متساوية للاختيار) هو:
من حيث التدوين،وهي "متغيرات عشوائية" تُقابل على التوالي رسم مستند أو مصطلح. ويمكن التعبير عن المعلومات المتبادلة على النحو التالي:
الخطوة الأخيرة هي التوسع، الاحتمال غير المشروط لسحب مصطلح، فيما يتعلق بالاختيار (العشوائي) لمستند، للحصول على:
يُبيّن هذا التعبير أن جمع قيم Tf-idf لجميع المصطلحات والوثائق الممكنة يُعيد المعلومات المتبادلة بين الوثائق والمصطلحات، مع مراعاة جميع خصائص توزيعها المشترك. [ 8 ] وبالتالي، تحمل كل قيمة Tf-idf "بتة المعلومات" المرتبطة بزوج المصطلح والوثيقة.
الصلة بالنظرية الإحصائية
يرتبط مقياس tf-idf ارتباطًا وثيقًا بقيمة p المحولة لوغاريتميًا السالبة من صيغة أحادية الطرف لاختبار فيشر الدقيق ، وذلك عندما تستوفي وثائق المدونة الأساسية افتراضات مثالية معينة. [ 9 ] ومؤخرًا، تبين أن متغيرات tf-idf تظهر كمكونات في إحصائية اختبار نسبة الاحتمال المعاقب لتكرار الكلمات بناءً على نموذج إحصائي لغوي بيتا-ذو الحدين. [ 10 ] في هذا الإطار، تُنمذج الفرضية الصفرية تكرار المصطلحات باستخدام توزيع ذي الحدين ، بينما تُنمذج الفرضية البديلة تكرار الكلمات باستخدام توزيع بيتا-ذو الحدين مع حد جزاء موزع غاما موضوع على معامل دقة بيتا-ذو الحدين. تحتوي إحصائية الاختبار الناتجة على متغيرات tf–idf، وهي تردد المصطلح الثنائي - تردد المستند العكسي (btf–idf) وتردد المصطلح - تردد المجموعة العكسي (tf–icf)، مما يؤدي إلى إنشاء صلة مباشرة بين مخططات ترجيح المصطلحات لعائلة tf–idf واختبار الفرضيات الإحصائية . [ 10 ]
مثال على tf-idf
لنفترض أن لدينا جداول عدد المصطلحات لمجموعة بيانات تتكون من وثيقتين فقط:
- "هذه عينة أ."
- "هذا مثال آخر، مثال آخر، مثال."
| شرط | عدد الولايات |
|---|---|
| هذا | 1 |
| يكون | 1 |
| أ | 2 |
| عينة | 1 |
| شرط | عدد الولايات |
|---|---|
| هذا | 1 |
| يكون | 1 |
| آخر | 2 |
| مثال | 3 |
يتم حساب قيمة tf–idf للمصطلح "this" على النحو التالي:
في شكلها الخام، تمثل tf تكرار كلمة "this" في كل مستند. تظهر كلمة "this" مرة واحدة في كل مستند؛ ولكن نظرًا لأن المستند الثاني يحتوي على عدد أكبر من الكلمات، فإن تكرارها النسبي أقل.
قيمة idf ثابتة لكل مجموعة نصوص، وتمثل نسبة المستندات التي تتضمن كلمة "this". في هذه الحالة، لدينا مجموعة نصوص مكونة من مستندين، وكلها تتضمن كلمة "this".
لذا فإن قيمة tf–idf تساوي صفرًا بالنسبة للكلمة "this"، مما يعني أن الكلمة ليست مفيدة للغاية لأنها تظهر في جميع المستندات.
كلمة "مثال" أكثر إثارة للاهتمام - فهي تظهر ثلاث مرات، ولكن فقط في الوثيقة الثانية:
أخيراً،
(باستخدام اللوغاريتم ذي الأساس 10 ).
ما وراء الشروط
لا تقتصر فكرة tf-idf على المصطلحات فقط، بل تشمل كيانات أخرى أيضًا. ففي عام ١٩٩٨، طُبِّق مفهوم idf على الاستشهادات. [ ١١ ] جادل الباحثون بأنه "إذا كان هناك استشهاد نادر جدًا مشترك بين وثيقتين، فينبغي ترجيحه أكثر من الاستشهاد الوارد في عدد كبير من الوثائق". إضافةً إلى ذلك، طُبِّق tf-idf على "الكلمات المرئية" بهدف مطابقة العناصر في مقاطع الفيديو، [ ١٢ ] وعلى الجمل الكاملة. [ ١٣ ] مع ذلك، لم يُثبت مفهوم tf-idf فعاليته في جميع الحالات مقارنةً بنظام tf البسيط (بدون idf). فعند تطبيق tf-idf على الاستشهادات، لم يجد الباحثون أي تحسن مقارنةً بترجيح عدد الاستشهادات البسيط الذي لا يتضمن عنصر idf. [ ١٤ ]
المشتقات
انبثقت عدة طرق لترجيح المصطلحات من مقياس TF-IDF. إحداها هي TF-PDF (تردد المصطلح × تردد المستند النسبي). [ 15 ] طُرح مقياس TF-PDF عام 2001 في سياق تحديد المواضيع الناشئة في وسائل الإعلام. يقيس مُكوّن PDF الفرق في عدد مرات ظهور مصطلح ما في مجالات مختلفة. وهناك مشتق آخر هو TF-IDuF. في TF-IDuF، [ 16 ] لا يُحسب idf بناءً على مجموعة المستندات المراد البحث فيها أو التوصية بها، بل يُحسب على مجموعات المستندات الشخصية للمستخدمين. ويشير الباحثون إلى أن TF-IDuF كان بنفس فعالية TF-IDF، ولكنه قابل للتطبيق أيضًا في حالات، مثل عدم امتلاك نظام نمذجة المستخدم إمكانية الوصول إلى مجموعة مستندات عالمية. يستخدم مشتق DELTA TF-IDF [ 17 ] الفرق في أهمية مصطلح ما عبر فئتين محددتين، مثل المشاعر الإيجابية والسلبية. على سبيل المثال، يمكنه منح درجة عالية لكلمة مثل "ممتاز" في التقييمات الإيجابية، ودرجة منخفضة لنفس الكلمة في التقييمات السلبية. يساعد هذا في تحديد الكلمات التي تشير بقوة إلى مشاعر النص، مما قد يؤدي إلى تحسين دقة تصنيف النصوص.
انظر أيضاً
مراجع
- ↑ راجارامان، أ.؛ أولمان، ج. د. (2011). "استخراج البيانات" (ملف PDF) . استخراج البيانات من مجموعات البيانات الضخمة . الصفحات 1-17 . doi : 10.1017/CBO9781139058452.002 . ISBN 978-1-139-05845-2.
- ↑ بريتينجر، كورينا؛ جيب، بيلا؛ لانجر، ستيفان (26 يوليو 2015). "أنظمة التوصية بالأوراق البحثية: دراسة استقصائية للأدبيات" . المجلة الدولية للمكتبات الرقمية . 17 (4): 305-338 . doi : 10.1007/s00799-015-0156-0 . ISSN 1432-5012 . S2CID 207035184 .
- ↑ سبارك جونز، ك. (1972). "تفسير إحصائي لخصوصية المصطلح وتطبيقه في الاسترجاع". مجلة التوثيق . 28 (1): 11-21 . CiteSeerX 10.1.1.115.8343 . doi : 10.1108/eb026526 . S2CID 2996187 .
- ↑ مانينغ، سي دي؛ راغافان، بي؛ شوتز، إتش (2008). "التقييم، وترجيح المصطلحات، ونموذج فضاء المتجهات" (ملف PDF) . مقدمة في استرجاع المعلومات . ص 100. doi : 10.1017/CBO9780511809071.007 . ISBN 978-0-511-80907-1.
- ↑ "إحصائيات TFIDF | SAX-VSM" .
- 1 2 3 روبرتسون، س. (2004). "فهم تردد المستند العكسي: حول الحجج النظرية لتردد المستند العكسي". مجلة التوثيق . 60 (5): 503-520 . doi : 10.1108/00220410410560582 .
- ↑ انظر أيضًا تقديرات الاحتمالات في الممارسة العملية في مقدمة استرجاع المعلومات .
- 1 2 أيزاوا، أكيكو (2003). "منظور نظري للمعلومات لمقاييس tf-idf". معالجة المعلومات وإدارتها . 39 (1): 45-65 . doi : 10.1016/S0306-4573(02)00021-3 . S2CID 45793141 .
- ↑ شيريدان، بول؛ أحمد، زياد؛ فاروق، أيتزاز أ. (2026). "تبرير اختبار فيشر الدقيق لنظام ترجيح المصطلحات TF-IDF" . الإحصائي الأمريكي . 80 (1): 146-156 . arXiv : 2507.15742 . doi : 10.1080/00031305.2025.2539241 .
- أحمد، زياد؛ شيريدان، بول؛ ماكإسحاق، مايكل؛ فاروق، أيتزاز أ. (2026). "تظهر متغيرات TF-IDF الشائعة كمكونات أساسية في إحصائية اختبار نسبة الاحتمال المعاقبة لانفجارية الكلمات" . مجلة ديسكفر كومبيوتينج . 29 ( 1 ): 274. arXiv : 2604.00672 . doi : 10.1007/s10791-026-10090-4 .
- ↑ بولاكر، كورت د.؛ لورانس، ستيف؛ جايلز، سي. لي (1998-01-01). "CiteSeer". وقائع المؤتمر الدولي الثاني حول الوكلاء المستقلين - AGENTS '98 . الصفحات 116-123 . doi : 10.1145/280765.280786 . ISBN 978-0-89791-983-8. S2CID 3526393 .
- ↑ سيفيك، جوزيف؛ زيسرمان، أندرو (1 يناير 2003). "جوجل الفيديو: منهج استرجاع النصوص لمطابقة الكائنات في مقاطع الفيديو". وقائع المؤتمر الدولي التاسع لمعهد مهندسي الكهرباء والإلكترونيات حول رؤية الحاسوب . ICCV '03. ص 1470–. doi : 10.1109/ICCV.2003.1238663 . ISBN 978-0-7695-1950-0. S2CID 14457153 .
- ↑ سيكي، يوهي. "استخراج الجمل باستخدام tf/idf وترجيح الموضع من مقالات الصحف" (ملف PDF) . المعهد الوطني للمعلوماتية.
- ↑ بيل، جويران؛ بريتينجر، كورينا (2017). "تقييم نظام ترجيح الاستشهاد CC-IDF - ما مدى فعالية تطبيق "تردد المستند العكسي" (IDF) على المراجع؟" (ملف PDF) . وقائع المؤتمر الدولي الثاني عشر . مؤرشف من الأصل (ملف PDF) بتاريخ 22 سبتمبر 2020. تاريخ الاسترجاع: 29 يناير 2017 .
- ↑ خو خيو بون؛ بون، خو خيو؛ إيشيزوكا، م. (2001). "نظام تتبع المواضيع الناشئة". وقائع ورشة العمل الدولية الثالثة حول القضايا المتقدمة للتجارة الإلكترونية وأنظمة المعلومات القائمة على الويب. WECWIS 2001. الصفحات 2-11 . CiteSeerX 10.1.1.16.7986 . doi : 10.1109/wecwis.2001.933900 . ISBN 978-0-7695-1224-2. S2CID 1049263 .
- ↑ لانجر، ستيفان؛ جيب، بيلا (2017). "TF-IDuF: مخطط جديد لترجيح المصطلحات لنمذجة المستخدم بناءً على مجموعات المستندات الشخصية للمستخدمين" (ملف PDF) . IConference .
- ↑ مارتينو، جاستن؛ فين، تيم (2009). "دلتا تي إف آي دي إف: فضاء ميزات مُحسَّن لتحليل المشاعر" . وقائع المؤتمر الدولي الثالث لجمعية النهوض بالذكاء الاصطناعي حول الويب ووسائل التواصل الاجتماعي . ICWSM. سان خوسيه، كاليفورنيا: جمعية النهوض بالذكاء الاصطناعي. doi : 10.1609/icwsm.v3i1.13979 .
- سالتون، جي ؛ ماكجيل، إم جيه (1986). مقدمة في استرجاع المعلومات الحديث . ماكجرو هيل . ISBN 978-0-07-054484-0.
- سالتون، ج .؛ فوكس، إي. أ.؛ وو، هـ. (1983). "استرجاع المعلومات المنطقية الموسعة". اتصالات رابطة مكائن الحوسبة . 26 (11): 1022-1036 . doi : 10.1145/182.358466 . hdl : 1813/6351 . S2CID 207180535 .
- سالتون، ج .؛ باكلي، س. (1988). "أساليب ترجيح المصطلحات في استرجاع النصوص الآلي" (ملف PDF) . معالجة المعلومات وإدارتها . 24 (5): 513-523 . doi : 10.1016/0306-4573(88)90021-0 . hdl : 1813/6721 . S2CID 7725217 .
- وو، إتش سي؛ لوك، آر دبليو بي؛ وونغ، كيه إف؛ كوك، كيه إل (2008). "تفسير أوزان مصطلحات TF-IDF على أنها قرارات تتعلق بالملاءمة". معاملات ACM في نظم المعلومات . 26 (3): 1. doi : 10.1145/1361684.1361686 . hdl : 10397/10130 . S2CID 18303048 .
روابط خارجية وقراءات مقترحة
- Gensim هي مكتبة بايثون لنمذجة الفضاء المتجهي وتتضمن ترجيح tf-idf.
- تشريح محرك بحث ( مؤرشف بتاريخ 10 مارس 2009 في أرشيف الإنترنت)
- تعريفات tf-idf والتعريفات ذات الصلة المستخدمة في Lucene
- محول Tfidf في مكتبة scikit-learn
- مجموعة أدوات MATLAB المسماة Text to Matrix Generator (TMG) تُستخدم في مهام متنوعة ضمن مجال استخراج البيانات النصية، وتحديدًا: 1) الفهرسة، 2) الاسترجاع، 3) تقليل الأبعاد ، 4) التجميع، 5) التصنيف. تتيح خطوة الفهرسة للمستخدم إمكانية تطبيق أساليب الترجيح المحلية والعالمية، بما في ذلك tf-idf.
- شرح مفهوم تكرار المصطلحات
- معالجة اللغة الطبيعية الإحصائية
- دوال الترتيب
- نموذج الفضاء المتجهي
