tf–idf

في مجال استرجاع المعلومات ، يُعدّ مقياس tf-idf ( تردد المصطلح - تردد المستند العكسي ، أو TF*IDF ، أو TFIDF ، أو TF-IDF ، أو Tf-idf ) مقياسًا لأهمية كلمة ما في مستند ضمن مجموعة أو مدونة ، مع مراعاة أن بعض الكلمات تظهر بشكل متكرر أكثر من غيرها. [ 1 ] وكما هو الحال في نموذج "حقيبة الكلمات" ، يُصوّر هذا المقياس المستند كمجموعة متعددة من الكلمات، دون مراعاة ترتيبها . وهو يُعدّ تحسينًا لنموذج "حقيبة الكلمات" البسيط، إذ يسمح لوزن الكلمات بالاعتماد على بقية المدونة.

كثيراً ما استُخدمت هذه التقنية كعامل ترجيح في عمليات البحث عن المعلومات، واستخراج البيانات النصية ، ونمذجة المستخدمين . وأظهر استطلاع أُجري عام ٢٠١٥ أن ٨٣٪ من أنظمة التوصية النصية في المكتبات الرقمية تستخدم تقنية TF-IDF. [ ٢ ] كما استخدمت محركات البحث صيغاً مختلفة من نظام ترجيح TF-IDF كأداة أساسية في تقييم وتصنيف مدى ملاءمة المستند لاستعلام المستخدم .

إحدى أبسط وظائف الترتيب يتم حسابها عن طريق جمع قيم tf-idf لكل مصطلح استعلام؛ والعديد من وظائف الترتيب الأكثر تعقيدًا هي متغيرات لهذا النموذج البسيط.

الدوافع

ابتكرت كارين سبارك جونز (1972) تفسيرًا إحصائيًا لخصوصية المصطلح يسمى تردد المستند العكسي (idf)، والذي أصبح حجر الزاوية في ترجيح المصطلح: [ 3 ]

يمكن تحديد مدى خصوصية المصطلح كميًا كدالة عكسية لعدد المستندات التي يظهر فيها.

على سبيل المثال، يمكن تمثيل قيم df (تكرار المستند) و idf لبعض الكلمات في مسرحيات شكسبير الـ 37 على النحو التالي:

كلمةdfidf
روميو11.57
سلطة21.27
فالستاف40.966
غابة120.489
معركة210.246
ذكاء340.037
أحمق360.012
جيد370
حلو370

نلاحظ أن كلمات " روميو " و" فالستاف " و"سلطة" تظهر في عدد قليل جدًا من المسرحيات، لذا فإن رؤية هذه الكلمات قد تُعطي فكرة جيدة عن المسرحية المقصودة. في المقابل، تظهر كلمتا "جيد" و"حلو" في كل مسرحية، وهما لا تُقدمان أي معلومات تُذكر عن المسرحية المقصودة.

تعريف

  1. يمثل معامل tf-idf حاصل ضرب إحصائيتين: تردد المصطلح وتردد المستند العكسي . وهناك طرق متعددة لتحديد القيم الدقيقة لكلتا الإحصائيتين.
  2. صيغة تهدف إلى تحديد أهمية كلمة مفتاحية أو عبارة داخل مستند أو صفحة ويب.
أنواع وزن تكرار المصطلح (tf)
نظام الترجيحوزن tf
ثنائي0،1{\displaystyle {0,1}}
العد الخاموت،د{\displaystyle f_{t,d}}
تكرار المصطلحوت،د/تدوت،د{\displaystyle f_{t,d}{\Bigg واصل\sum _{t'\in d}{f_{t',d}}}}
التسوية اللوغاريتميةسجل(1+وت،د){\displaystyle \log(1+f_{t,d})}
التطبيع المزدوج 0.50.5+0.5وت،دالأعلى{تد}وت،د{\displaystyle 0.5+0.5\cdot {\frac {f_{t,d}}{\max _{\{t'\in d\}}{f_{t',d}}}}}
التطبيع المزدوج Kك+(1-ك)وت،دالأعلى{تد}وت،د{\displaystyle K+(1-K){\frac {f_{t,d}}{\max _{\{t'\in d\}}{f_{t',d}}}}}

تكرار المصطلح

تردد المصطلح، tf( t , d ) ، هو التردد النسبي للمصطلح t داخل المستند d ،

تو(ت،د)=وت،دتدوت،د{\displaystyle \mathrm {tf} (t,d)={\frac {f_{t,d}}{\sum _{t'\in d}{f_{t',d}}}}}،

حيث يُمثل f( t , d) العدد الإجمالي لتكرار مصطلح ما في المستند، أي عدد مرات ظهور هذا المصطلح t في المستند d . لاحظ أن المقام هو ببساطة العدد الإجمالي للمصطلحات في المستند d (مع احتساب كل تكرار للمصطلح نفسه على حدة). توجد طرق أخرى لتعريف تكرار المصطلح: [ 4 ] : ​​128

  • العدد الخام نفسه: tf( t , d ) = f t , d
  • التكرارات المنطقية : tf( t , d ) = 1 إذا حدث t في d و 0 خلاف ذلك؛
  • التردد المقياس اللوغاريتمي : tf( t , d ) = log (1 + f t , d ) ; [ 5 ]
  • التردد المعزز، لمنع التحيز نحو المستندات الأطول، على سبيل المثال التردد الخام مقسومًا على التردد الخام للمصطلح الأكثر تكرارًا في المستند:
تو(ت،د)=0.5+0.5وت،دالأعلى{وت،د:تد}{\displaystyle \mathrm {tf} (t,d)=0.5+0.5\cdot {\frac {f_{t,d}}{\max\{f_{t',d}:t'\in d\}}}}

تردد المستند العكسي

أنواع مختلفة من وزن تردد المستند العكسي (idf)
نظام الترجيحوزن idf (نت=|{دد:تد}|{\displaystyle n_{t}=|\{d\in D:t\in d\}|})
أحادي1
تردد المستندات العكسيسجلشمالنت=-سجلنتشمال{\displaystyle \log {\frac {N}{n_{t}}}=-\log {\frac {n_{t}}{N}}}
تدرج تردد المستندات العكسيسجل(شمال1+نت)+1{\displaystyle \log \left({\frac {N}{1+n_{t}}}\right)+1}
الحد الأقصى لتردد المستند العكسيسجل(الأعلى{تد}نت1+نت){\displaystyle \log \left({\frac {\max _{\{t'\in d\}}n_{t'}}{1+n_{t}}}\right)}
التردد العكسي الاحتمالي للمستنداتسجلشمال-نتنت{\displaystyle \log {\frac {N-n_{t}}{n_{t}}}}
رسم بياني لوظائف تردد المستندات العكسية المختلفة: القياسية، السلسة، الاحتمالية.

يُعدّ تردد الكلمة العكسي في المستندات مقياسًا لكمية المعلومات التي توفرها الكلمة، أي مدى شيوعها أو ندرتها في جميع المستندات. وهو عبارة عن النسبة العكسية للمستندات التي تحتوي على الكلمة ، مُقاسةً بمقياس لوغاريتمي (يتم الحصول عليها بقسمة العدد الإجمالي للمستندات على عدد المستندات التي تحتوي على المصطلح، ثم أخذ لوغاريتم الناتج).

أنادو(ت،د)=سجلشمالنت{\displaystyle \mathrm {idf} (t,D)=\log {\frac {N}{n_{t}}}}

مع

  • د{\displaystyle D}: هي مجموعة جميع الوثائق في المدونة
  • شمال=|د|{\displaystyle N={|D|}}: إجمالي عدد الوثائق في المجموعة
  • نت=|{دد:تد}|{\displaystyle n_{t}=|\{d\in D:t\in d\}|} عدد المستندات التي تحتوي على المصطلحت{\displaystyle t}يظهر (أي،تو(ت،د)0{\displaystyle \mathrm {tf} (t,d)\neq 0}إذا لم يكن المصطلح موجودًا في المدونة، فسيؤدي ذلك إلى القسمة على صفر. لذلك، من الشائع تعديل البسط إلى1+شمال{\displaystyle 1+N}والمقام إلى1+نت{\displaystyle 1+n_{t}}.

تردد المصطلح – تردد المستند العكسي

أنواع مختلفة من أوزان تردد المصطلح - تردد المستند العكسي (tf-idf)
نظام الترجيحtf-idf
عد-idfوت،دسجلشمالنت{\displaystyle f_{t,d}\cdot \log {\frac {N}{n_{t}}}}
التطبيع المزدوج-idf(0.5+0.5وت،qالأعلىتوت،q)سجلشمالنت{\displaystyle \left(0.5+0.5{\frac {f_{t,q}}{\max _{t}f_{t,q}}}\right)\cdot \log {\frac {N}{n_{t}}}}
التطبيع اللوغاريتمي-idf(1+سجلوت،د)سجلشمالنت{\displaystyle (1+\log f_{t,d})\cdot \log {\frac {N}{n_{t}}}}

ثم يتم حساب tf–idf على النحو التالي

توأنادو(ت،د،د)=تو(ت،د)أنادو(ت،د){\displaystyle \mathrm {tfidf} (t,d,D)=\mathrm {tf} (t,d)\cdot \mathrm {idf} (t,D)}

يُحقق وزنٌ عالٍ في مقياس tf–idf عندما يكون تكرار المصطلح مرتفعًا (في المستند المُحدد) وتكراره منخفضًا في مجموعة المستندات ككل؛ وبالتالي، تميل الأوزان إلى استبعاد المصطلحات الشائعة. ولأن النسبة داخل دالة اللوغاريتم في idf تكون دائمًا أكبر من أو تساوي 1، فإن قيمة idf (و tf–idf) تكون أكبر من أو تساوي 0. ومع ازدياد عدد المستندات التي يظهر فيها المصطلح، تقترب النسبة داخل اللوغاريتم من 1، مما يجعل قيمتي idf و tf–idf أقرب إلى الصفر.

تبرير الاتحاد الدولي للبحار

تم تقديم مفهوم Idf تحت مسمى "تحديد المصطلح" من قبل كارين سبارك جونز في ورقة بحثية عام 1972. وعلى الرغم من أنه أثبت فعاليته كأداة استدلالية ، إلا أن أسسه النظرية ظلت مثيرة للجدل لثلاثة عقود على الأقل بعد ذلك، حيث سعى العديد من الباحثين إلى إيجاد مبررات نظرية معلوماتية له. [ 6 ]

لم يقدم تفسير سبارك جونز نفسه الكثير من النظرية، باستثناء ربطه بقانون زيبف . [ 6 ] وقد بُذلت محاولات لوضع idf على أساس احتمالي ، [ 7 ] من خلال تقدير احتمال احتواء مستند معين d على مصطلح t باعتباره التردد النسبي للمستند.

P(ت|د)=|{دد:تد}|شمال،{\displaystyle P(t|D)={\frac {|\{d\in D:t\in d\}|}{N}},}

حتى نتمكن من تعريف idf على النحو التالي

أنادو=-سجلP(ت|د)=سجل1P(ت|د)=سجلشمال|{دد:تد}|{\displaystyle {\begin{aligned}\mathrm {idf} &=-\log P(t|D)\\&=\log {\frac {1}{P(t|D)}}\\&=\log {\frac {N}{|\{d\in D:t\in d\}|}}\end{aligned}}}

وبعبارة أخرى، فإن تردد المستند العكسي هو لوغاريتم تردد المستند النسبي "العكسي".

يتخذ هذا التفسير الاحتمالي بدوره نفس شكل تفسير المعلومات الذاتية . ومع ذلك، فإن تطبيق هذه المفاهيم النظرية للمعلومات على مشاكل استرجاع المعلومات يؤدي إلى مشاكل عند محاولة تحديد فضاءات الأحداث المناسبة لتوزيعات الاحتمالات المطلوبة : لا يقتصر الأمر على ضرورة مراعاة المستندات فحسب، بل يشمل أيضًا الاستعلامات والمصطلحات. [ 6 ]

يمكن صياغة كل من تردد المصطلح وتردد المستند العكسي باستخدام نظرية المعلومات ؛ مما يساعد على فهم سبب أهمية حاصل ضربهما من حيث المحتوى المعلوماتي المشترك للمستند. وهناك افتراض مميز حول التوزيع.ص(د،ت){\displaystyle p(d,t)}وهو ذلك:

ص(د|ت)=1|{دد:تد}|{\displaystyle p(d|t)={\frac {1}{|\{d\in D:t\in d\}|}}}

هذا الافتراض وآثاره، وفقًا لأيزاوا: "يمثل الأسلوب الاستدلالي الذي يستخدمه tf-idf." [ 8 ]

الإنتروبيا الشرطية لوثيقة "مختارة عشوائياً" في مجموعة النصوصد{\displaystyle D}، بشرط أن يحتوي على مصطلح محددت{\displaystyle t}(وبافتراض أن جميع المستندات لها احتمالية متساوية للاختيار) هو:

ح(د|تي=ت)=-دصد|تسجلصد|ت=-سجل1|{دد:تد}|=سجل|{دد:تد}||د|+سجل|د|=-أنادو(ت)+سجل|د|{\displaystyle H({\cal {D}}|{\cal {T}}=t)=-\sum _{d}p_{d|t}\log p_{d|t}=-\log {\frac {1}{|\{d\in D:t\in d\}|}}=\log {\frac {|\{d\in D:t\in d\}|}{|D|}}+\log |D|=-\mathrm {idf} (t)+\log |D|}

من حيث التدوين،د{\displaystyle {\cal {D}}}وتي{\displaystyle {\cal {T}}}هي "متغيرات عشوائية" تُقابل على التوالي رسم مستند أو مصطلح. ويمكن التعبير عن المعلومات المتبادلة على النحو التالي:

م(تي؛د)=ح(د)-ح(د|تي)=تصت(ح(د)-ح(د|دبليو=ت))=تصتأنادو(ت){\displaystyle M({\cal {T}};{\cal {D}})=H({\cal {D}})-H({\cal {D}}|{\cal {T}})=\sum _{t}p_{t}\cdot (H({\cal {D}})-H({\cal {D}}|W=t))=\sum _{t}p_{t}\cdot \mathrm {idf} (t)}

الخطوة الأخيرة هي التوسعصت{\displaystyle p_{t}}، الاحتمال غير المشروط لسحب مصطلح، فيما يتعلق بالاختيار (العشوائي) لمستند، للحصول على:

م(تي؛د)=ت،دصت|دصدأنادو(ت)=ت،دتو(ت،د)1|د|أنادو(ت)=1|د|ت،دتو(ت،د)أنادو(ت).{\displaystyle M({\cal {T}};{\cal {D}})=\sum _{t,d}p_{t|d}\cdot p_{d}\cdot \mathrm {idf} (t)=\sum _{t,d}\mathrm {tf} (t,d)\cdot {\frac {1}{|D|}}\cdot \mathrm {idf} (t)={\frac {1}{|D|}}\sum _{t,d}\mathrm {tf} (t,d)\cdot \mathrm {idf} (t).}

يُبيّن هذا التعبير أن جمع قيم Tf-idf لجميع المصطلحات والوثائق الممكنة يُعيد المعلومات المتبادلة بين الوثائق والمصطلحات، مع مراعاة جميع خصائص توزيعها المشترك. [ 8 ] وبالتالي، تحمل كل قيمة Tf-idf "بتة المعلومات" المرتبطة بزوج المصطلح والوثيقة.

يرتبط مقياس tf-idf ارتباطًا وثيقًا بقيمة p المحولة لوغاريتميًا السالبة من صيغة أحادية الطرف لاختبار فيشر الدقيق ، وذلك عندما تستوفي وثائق المدونة الأساسية افتراضات مثالية معينة. [ 9 ] ومؤخرًا، تبين أن متغيرات tf-idf تظهر كمكونات في إحصائية اختبار نسبة الاحتمال المعاقب لتكرار الكلمات بناءً على نموذج إحصائي لغوي بيتا-ذو الحدين. [ 10 ] في هذا الإطار، تُنمذج الفرضية الصفرية تكرار المصطلحات باستخدام توزيع ذي الحدين ، بينما تُنمذج الفرضية البديلة تكرار الكلمات باستخدام توزيع بيتا-ذو الحدين مع حد جزاء موزع غاما موضوع على معامل دقة بيتا-ذو الحدين. تحتوي إحصائية الاختبار الناتجة على متغيرات tf–idf، وهي تردد المصطلح الثنائي - تردد المستند العكسي (btf–idf) وتردد المصطلح - تردد المجموعة العكسي (tf–icf)، مما يؤدي إلى إنشاء صلة مباشرة بين مخططات ترجيح المصطلحات لعائلة tf–idf واختبار الفرضيات الإحصائية . [ 10 ]

مثال على tf-idf

لنفترض أن لدينا جداول عدد المصطلحات لمجموعة بيانات تتكون من وثيقتين فقط:

"هذه عينة أ."
"هذا مثال آخر، مثال آخر، مثال."
الوثيقة 1 (د1{\displaystyle d_{1}})
شرطعدد الولايات
هذا1
يكون1
أ2
عينة1
الوثيقة 2 (د2{\displaystyle d_{2}})
شرطعدد الولايات
هذا1
يكون1
آخر2
مثال3

يتم حساب قيمة tf–idf للمصطلح "this" على النحو التالي:

في شكلها الخام، تمثل tf تكرار كلمة "this" في كل مستند. تظهر كلمة "this" مرة واحدة في كل مستند؛ ولكن نظرًا لأن المستند الثاني يحتوي على عدد أكبر من الكلمات، فإن تكرارها النسبي أقل.

تو("تحأناs"،د1)=15=0.2{\displaystyle \mathrm {tf} ({\mathsf {''this''}},d_{1})={\frac {1}{5}}=0.2}
تو("تحأناs"،د2)=170.14{\displaystyle \mathrm {tf} ({\mathsf {''this''}},d_{2})={\frac {1}{7}}\approx 0.14}

قيمة idf ثابتة لكل مجموعة نصوص، وتمثل نسبة المستندات التي تتضمن كلمة "this". في هذه الحالة، لدينا مجموعة نصوص مكونة من مستندين، وكلها تتضمن كلمة "this".

أنادو("تحأناs"،د)=سجل(22)=0{\displaystyle \mathrm {idf} ({\mathsf {''this''}},D)=\log \left({\frac {2}{2}}\right)=0}

لذا فإن قيمة tf–idf تساوي صفرًا بالنسبة للكلمة "this"، مما يعني أن الكلمة ليست مفيدة للغاية لأنها تظهر في جميع المستندات.

توأنادو("تحأناs"،د1،د)=0.2×0=0{\displaystyle \mathrm {tfidf} ({\mathsf {''this''}},d_{1},D)=0.2\times 0=0}
توأنادو("تحأناs"،د2،د)=0.14×0=0{\displaystyle \mathrm {tfidf} ({\mathsf {''this''}},d_{2},D)=0.14\times 0=0}

كلمة "مثال" أكثر إثارة للاهتمام - فهي تظهر ثلاث مرات، ولكن فقط في الوثيقة الثانية:

تو("هـxأمصلهـ"،د1)=05=0{\displaystyle \mathrm {tf} ({\mathsf {''example''}},d_{1})={\frac {0}{5}}=0}
تو("هـxأمصلهـ"،د2)=370.429{\displaystyle \mathrm {tf} ({\mathsf {''example''}},d_{2})={\frac {3}{7}}\approx 0.429}
أنادو("هـxأمصلهـ"،د)=سجل(21)=0.301{\displaystyle \mathrm {idf} ({\mathsf {''example''}},D)=\log \left({\frac {2}{1}}\right)=0.301}

أخيراً،

توأنادو("هـxأمصلهـ"،د1،د)=تو("هـxأمصلهـ"،د1)×أنادو("هـxأمصلهـ"،د)=0×0.301=0{\displaystyle \mathrm {tfidf} ({\mathsf {''example''}},d_{1},D)=\mathrm {tf} ({\mathsf {''example''}},d_{1})\times \mathrm {idf} ({\mathsf {''example''}},D)=0\times 0.301=0}
توأنادو("هـxأمصلهـ"،د2،د)=تو("هـxأمصلهـ"،د2)×أنادو("هـxأمصلهـ"،د)=0.429×0.3010.129{\displaystyle \mathrm {tfidf} ({\mathsf {''example''}},d_{2},D)=\mathrm {tf} ({\mathsf {''example''}},d_{2})\times \mathrm {idf} ({\mathsf {''example''}},D)=0.429\times 0.301\approx 0.129}

(باستخدام اللوغاريتم ذي الأساس 10 ).

ما وراء الشروط

لا تقتصر فكرة tf-idf على المصطلحات فقط، بل تشمل كيانات أخرى أيضًا. ففي عام ١٩٩٨، طُبِّق مفهوم idf على الاستشهادات. [ ١١ ] جادل الباحثون بأنه "إذا كان هناك استشهاد نادر جدًا مشترك بين وثيقتين، فينبغي ترجيحه أكثر من الاستشهاد الوارد في عدد كبير من الوثائق". إضافةً إلى ذلك، طُبِّق tf-idf على "الكلمات المرئية" بهدف مطابقة العناصر في مقاطع الفيديو، [ ١٢ ] وعلى الجمل الكاملة. [ ١٣ ] مع ذلك، لم يُثبت مفهوم tf-idf فعاليته في جميع الحالات مقارنةً بنظام tf البسيط (بدون idf). فعند تطبيق tf-idf على الاستشهادات، لم يجد الباحثون أي تحسن مقارنةً بترجيح عدد الاستشهادات البسيط الذي لا يتضمن عنصر idf. [ ١٤ ]

المشتقات

انبثقت عدة طرق لترجيح المصطلحات من مقياس TF-IDF. إحداها هي TF-PDF (تردد المصطلح × تردد المستند النسبي). [ 15 ] طُرح مقياس TF-PDF عام 2001 في سياق تحديد المواضيع الناشئة في وسائل الإعلام. يقيس مُكوّن PDF الفرق في عدد مرات ظهور مصطلح ما في مجالات مختلفة. وهناك مشتق آخر هو TF-IDuF. في TF-IDuF، [ 16 ] لا يُحسب idf بناءً على مجموعة المستندات المراد البحث فيها أو التوصية بها، بل يُحسب على مجموعات المستندات الشخصية للمستخدمين. ويشير الباحثون إلى أن TF-IDuF كان بنفس فعالية TF-IDF، ولكنه قابل للتطبيق أيضًا في حالات، مثل عدم امتلاك نظام نمذجة المستخدم إمكانية الوصول إلى مجموعة مستندات عالمية. يستخدم مشتق DELTA TF-IDF [ 17 ] الفرق في أهمية مصطلح ما عبر فئتين محددتين، مثل المشاعر الإيجابية والسلبية. على سبيل المثال، يمكنه منح درجة عالية لكلمة مثل "ممتاز" في التقييمات الإيجابية، ودرجة منخفضة لنفس الكلمة في التقييمات السلبية. يساعد هذا في تحديد الكلمات التي تشير بقوة إلى مشاعر النص، مما قد يؤدي إلى تحسين دقة تصنيف النصوص.

انظر أيضاً

مراجع

  1. راجارامان، أ.؛ أولمان، ج. د. (2011). "استخراج البيانات" (ملف PDF) . استخراج البيانات من مجموعات البيانات الضخمة . الصفحات 1-17 . doi : 10.1017/CBO9781139058452.002 . ISBN  978-1-139-05845-2.
  2. بريتينجر، كورينا؛ جيب، بيلا؛ لانجر، ستيفان (26 يوليو 2015). "أنظمة التوصية بالأوراق البحثية: دراسة استقصائية للأدبيات" . المجلة الدولية للمكتبات الرقمية . 17 (4): 305-338 . doi : 10.1007/s00799-015-0156-0 . ISSN 1432-5012 . S2CID 207035184 .  
  3. سبارك جونز، ك. (1972). "تفسير إحصائي لخصوصية المصطلح وتطبيقه في الاسترجاع". مجلة التوثيق . 28 (1): 11-21 . CiteSeerX 10.1.1.115.8343 . doi : 10.1108/eb026526 . S2CID 2996187 .  
  4. مانينغ، سي دي؛ راغافان، بي؛ شوتز، إتش (2008). "التقييم، وترجيح المصطلحات، ونموذج فضاء المتجهات" (ملف PDF) . مقدمة في استرجاع المعلومات . ص 100. doi : 10.1017/CBO9780511809071.007 . ISBN  978-0-511-80907-1.
  5. "إحصائيات TFIDF | SAX-VSM" .
  6. 1 2 3 روبرتسون، س. (2004). "فهم تردد المستند العكسي: حول الحجج النظرية لتردد المستند العكسي". مجلة التوثيق . 60 (5): 503-520 . doi : 10.1108/00220410410560582 .
  7. انظر أيضًا تقديرات الاحتمالات في الممارسة العملية في مقدمة استرجاع المعلومات .
  8. 1 2 أيزاوا، أكيكو (2003). "منظور نظري للمعلومات لمقاييس tf-idf". معالجة المعلومات وإدارتها . 39 (1): 45-65 . doi : 10.1016/S0306-4573(02)00021-3 . S2CID 45793141 . 
  9. شيريدان، بول؛ أحمد، زياد؛ فاروق، أيتزاز أ. (2026). "تبرير اختبار فيشر الدقيق لنظام ترجيح المصطلحات TF-IDF" . الإحصائي الأمريكي . 80 (1): 146-156 . arXiv : 2507.15742 . doi : 10.1080/00031305.2025.2539241 .
  10. أحمد، زياد؛ شيريدان، بول؛ ماكإسحاق، مايكل؛ فاروق، أيتزاز أ. (2026). "تظهر متغيرات TF-IDF الشائعة كمكونات أساسية في إحصائية اختبار نسبة الاحتمال المعاقبة لانفجارية الكلمات" . مجلة ديسكفر كومبيوتينج . 29 ( 1 ): 274. arXiv : 2604.00672 . doi : 10.1007/s10791-026-10090-4 .
  11. بولاكر، كورت د.؛ لورانس، ستيف؛ جايلز، سي. لي (1998-01-01). "CiteSeer". وقائع المؤتمر الدولي الثاني حول الوكلاء المستقلين - AGENTS '98 . الصفحات 116-123 . doi : 10.1145/280765.280786 . ISBN  978-0-89791-983-8. S2CID 3526393 . 
  12. سيفيك، جوزيف؛ زيسرمان، أندرو (1 يناير 2003). "جوجل الفيديو: منهج استرجاع النصوص لمطابقة الكائنات في مقاطع الفيديو". وقائع المؤتمر الدولي التاسع لمعهد مهندسي الكهرباء والإلكترونيات حول رؤية الحاسوب . ICCV '03. ص 1470–. doi : 10.1109/ICCV.2003.1238663 . ISBN  978-0-7695-1950-0. S2CID 14457153 . 
  13. سيكي، يوهي. "استخراج الجمل باستخدام tf/idf وترجيح الموضع من مقالات الصحف" (ملف PDF) . المعهد الوطني للمعلوماتية.
  14. بيل، جويران؛ بريتينجر، كورينا (2017). "تقييم نظام ترجيح الاستشهاد CC-IDF - ما مدى فعالية تطبيق "تردد المستند العكسي" (IDF) على المراجع؟" (ملف PDF) . وقائع المؤتمر الدولي الثاني عشر . مؤرشف من الأصل (ملف PDF) بتاريخ 22 سبتمبر 2020. تاريخ الاسترجاع: 29 يناير 2017 .
  15. خو خيو بون؛ بون، خو خيو؛ إيشيزوكا، م. (2001). "نظام تتبع المواضيع الناشئة". وقائع ورشة العمل الدولية الثالثة حول القضايا المتقدمة للتجارة الإلكترونية وأنظمة المعلومات القائمة على الويب. WECWIS 2001. الصفحات 2-11 . CiteSeerX 10.1.1.16.7986 . doi : 10.1109/wecwis.2001.933900 . ISBN   978-0-7695-1224-2. S2CID 1049263 . 
  16. لانجر، ستيفان؛ جيب، بيلا (2017). "TF-IDuF: مخطط جديد لترجيح المصطلحات لنمذجة المستخدم بناءً على مجموعات المستندات الشخصية للمستخدمين" (ملف PDF) . IConference .
  17. مارتينو، جاستن؛ فين، تيم (2009). "دلتا تي إف آي دي إف: فضاء ميزات مُحسَّن لتحليل المشاعر" . وقائع المؤتمر الدولي الثالث لجمعية النهوض بالذكاء الاصطناعي حول الويب ووسائل التواصل الاجتماعي . ICWSM. سان خوسيه، كاليفورنيا: جمعية النهوض بالذكاء الاصطناعي. doi : 10.1609/icwsm.v3i1.13979 .