البحث في النص الكامل
في مجال استرجاع النصوص ، يشير البحث في النص الكامل إلى مجموعة من التقنيات المستخدمة للبحث في مستند واحد مخزن على الحاسوب أو في مجموعة مستندات ضمن قاعدة بيانات نصية كاملة . ويختلف البحث في النص الكامل عن عمليات البحث القائمة على البيانات الوصفية أو على أجزاء محددة من المستندات، مثل العناوين أو الملخصات أو أقسام مختارة أو المراجع الببليوغرافية. [ 1 ] [ 2 ] [ 3 ]
في البحث النصي الكامل، يفحص محرك البحث الكلمات في المستندات المخزنة للعثور على تطابقات لاستفسارات المستخدم. [ 4 ] بدأت تقنيات البحث النصي الكامل بالظهور في ستينيات القرن العشرين (على سبيل المثال، نظام IBM STAIRS عام 1969)، وأصبحت شائعة في قواعد البيانات الببليوغرافية على الإنترنت خلال تسعينيات القرن العشرين. العديد من مواقع الويب وبرامج التطبيقات، بما في ذلك معالجات النصوص ، تُفعّل وظيفة البحث النصي الكامل. [ 1 ] [ 2 ] [ 5 ] [ 6 ] بعض محركات البحث على الويب، مثل AltaVista سابقًا ، كانت تفهرس النص الكامل لصفحات الويب، بينما كانت محركات أخرى تفهرس أجزاءً مختارة فقط من الصفحات. [ 2 ] [ 3 ] [ 7 ]
الفهرسة
عند التعامل مع عدد قليل من المستندات، يمكن لمحرك البحث النصي الكامل مسح محتويات كل مستند مباشرةً لكل استعلام ، وهي استراتيجية تُعرف باسم " المسح التسلسلي ". بعض الأدوات، مثل grep ، تعمل بهذه الطريقة. [ 1 ] [ 8 ]
عندما يكون عدد المستندات أو الاستعلامات كبيرًا، يُقسّم البحث في النصوص الكاملة عادةً إلى مهمتين: الفهرسة والبحث. خلال الفهرسة، يفحص محرك البحث جميع المستندات ويُنشئ قائمة بمصطلحات البحث، تُسمى غالبًا فهرسًا ، أو بتعبير أدق، مُطابقة . خلال مرحلة البحث، تُجرى الاستعلامات على الفهرس بدلًا من المستندات الأصلية. [ 1 ] [ 2 ] [ 8 ] [ 9 ]
يسجل المفهرس كل مصطلح موجود في المستند، وقد يُشير إلى موقعه داخل النص. تُحذف الكلمات الشائعة، المعروفة بالكلمات الموقوفة (مثل "الـ" أو "و")، لأنها لا تُضيف قيمة تُذكر لنتائج البحث. كما يقوم بعض المفهرسين بعملية التجريد ، التي تُختزل الكلمات إلى شكلها الأساسي؛ على سبيل المثال، قد تُفهرس كلمات "يقود" و"قاد" و"قاد" جميعها تحت مفهوم كلمة "قيادة". [ 1 ] [ 2 ] [ 8 ] [ 10 ]
المفاضلة بين الدقة والاستدعاء

الدقة والاستدعاء مقياسان معياريان لفعالية البحث. يقيس الاستدعاء نسبة النتائج ذات الصلة التي يُعيدها البحث، بينما تقيس الدقة نسبة النتائج المُعادة التي تُعتبر ذات صلة. رسميًا، الاستدعاء هو نسبة النتائج ذات الصلة المُعادة إلى إجمالي عدد النتائج ذات الصلة المتاحة، والدقة هي نسبة عدد النتائج ذات الصلة المُعادة إلى إجمالي عدد النتائج المُعادة. [ 1 ] [ 2 ] [ 4 ] [ 11 ]
يوضح الرسم البياني على اليمين عملية بحث ذات استرجاع منخفض ودقة منخفضة. في الرسم، تمثل النقاط الحمراء والخضراء إجمالي عدد نتائج البحث المحتملة لاستعلام معين، حيث تشير النقاط الخضراء إلى النتائج ذات الصلة، بينما تشير النقاط الحمراء إلى النتائج غير ذات الصلة. وتُحدد الصلة من خلال قرب النتيجة من مركز الدائرة الداخلية. أما النتائج الفعلية التي تم إرجاعها من البحث، فتظهر مُظللة على خلفية زرقاء فاتحة. في هذا المثال، تم إرجاع نتيجة واحدة فقط ذات صلة من بين ثلاث نتائج محتملة، مما يُعطي استرجاعًا بنسبة ⅓ (33%). أما الدقة، فهي ⅓ (25%)، نظرًا لأن نتيجة واحدة فقط من النتائج الأربع المُرجعة كانت ذات صلة. [ 11 ]
نظراً لغموض اللغة الطبيعية ، تتضمن أنظمة البحث في النصوص الكاملة عادةً ميزات مثل التصفية لزيادة الدقة، والتجذير لزيادة الاسترجاع. كما يُمكن للبحث باستخدام المفردات المُتحكَّم بها أن يُساعد في التخفيف من نتائج البحث منخفضة الدقة من خلال وسم المستندات لتقليل الغموض. [ 1 ] [ 2 ] [ 9 ] يوجد عموماً توازن بين الدقة والاسترجاع: فزيادة الدقة قد تُقلل من الاسترجاع الكلي، بينما زيادة الاسترجاع قد تُقلل من الدقة. [ 1 ] [ 2 ] [ 11 ]
مشكلة النتائج الإيجابية الكاذبة
قد يُؤدي البحث في النصوص الكاملة إلى استرجاع العديد من المستندات غير ذات الصلة بالاستعلام المقصود. تُسمى هذه المستندات بالنتائج الإيجابية الخاطئة (انظر الخطأ من النوع الأول ). غالبًا ما يكون استرجاع المستندات غير ذات الصلة ناتجًا عن الغموض المتأصل في اللغة الطبيعية . [ 1 ] [ 2 ] [ 9 ] في الرسم التوضيحي المرفق، تُمثل النتائج الإيجابية الخاطئة بالنتائج غير ذات الصلة (النقاط الحمراء) التي أعادها البحث (المُظللة على خلفية زرقاء فاتحة).
تُساعد تقنيات التجميع، التي غالبًا ما تعتمد على خوارزميات بايز ، في تقليل النتائج الإيجابية الخاطئة. فعلى سبيل المثال، عند البحث عن مصطلح مثل "بنك"، يُمكن للتجميع تصنيف المستندات إلى مجموعات مثل "مؤسسة مالية" أو "مكان للجلوس" أو "مكان للتخزين". وبناءً على تكرار الكلمات ذات الصلة بهذه الفئات، يُمكن إسناد مصطلح البحث أو نتيجة البحث إلى فئة واحدة أو أكثر. ويُستخدم هذا النهج على نطاق واسع في مجال الاكتشاف الإلكتروني . [ 12 ]
مشاكل المرادفات
بشكل أساسي، تُظهر محركات البحث نتائج تحتوي على العبارة المُحددة في الاستعلام. توجد أدوات ومنهجيات لمعالجة الأخطاء النحوية والإملائية وتحسين النتائج؛ ومع ذلك، لا تزال هذه التقنيات تتطلب عادةً تطابقًا نصيًا دقيقًا. نظرًا لوجود طرق متعددة للإشارة إلى كيان أو مفهوم ما، قد يفشل البحث في النص الكامل في استرجاع نتيجة إذا لم يُستخدم المصطلح نفسه في الاستعلام.
لا ينبغي الخلط بينه وبين البحث الدلالي، إذ يمكن استرجاع المرادفات عن طريق إنشاء فهرس للمصطلحات ذات الصلة، بحيث عند البحث عن صيغة مختلفة لكلمة ما، قد يتم أيضًا إرجاع العناصر التي تحتوي على أي من المصطلحات ذات الصلة. [ 13 ]
تحسينات في الأداء
تمّت معالجة قيود البحث في النصوص الكاملة بطريقتين: الأولى، بتزويد المستخدمين بأدوات لصياغة أسئلة البحث بدقة أكبر، والثانية، بتطوير خوارزميات تُحسّن دقة الاسترجاع. [ 1 ] [ 2 ] [ 8 ] [ 11 ] [ 14 ]
أدوات استعلام محسّنة
- البحث بالكلمات المفتاحية والمترادفات ، أو توسيع نطاق الاستعلام : تقنية يقوم فيها منشئو المستندات (أو المفهرسون المدربون) بتوفير قوائم بالكلمات التي تصف موضوع النص، بما في ذلك المرادفات. تُحسّن الكلمات المفتاحية من استرجاع المعلومات، خاصةً عندما لا يظهر مصطلح البحث صراحةً في النص.
- البحث المقيد بالحقول: تسمح بعض محركات البحث للمستخدمين بتقييد عمليات البحث بحقول محددة داخل سجل بيانات مخزن ، مثل "العنوان" أو "المؤلف".
- الاستعلامات المنطقية: يمكن أن تُحسّن عمليات البحث باستخدام عوامل التشغيل المنطقية (على سبيل المثال، "موسوعة" و "عبر الإنترنت" وليس "إنكارتا") من دقة النتائج. يسترجع عامل التشغيل "و" المستندات التي تحتوي على جميع المصطلحات المحددة فقط، بينما يستثني عامل التشغيل "ليس" المستندات التي تحتوي على مصطلح معين. يمكن استخدام عامل التشغيل "أو" لزيادة الاسترجاع ، على سبيل المثال، "موسوعة" و"عبر الإنترنت" أو "إنترنت" وليس "إنكارتا". سيؤدي استخدام الاستعلامات المنطقية إلى استرجاع المستندات المتعلقة بالموسوعات الإلكترونية التي تستخدم مصطلح "إنترنت" بدلاً من "عبر الإنترنت". قد يؤدي هذا، لزيادة الدقة، إلى تقليل الاسترجاع بشكل ملحوظ في بعض الأحيان. [ 14 ]
- البحث عن العبارات : يطابق المستندات التي تحتوي على تسلسل دقيق من الكلمات، مثل "ويكيبيديا، الموسوعة الحرة".
- البحث عن المفاهيم : يطابق المفاهيم متعددة الكلمات، على سبيل المثال معالجة المصطلحات المركبة . ويُستخدم هذا النهج بشكل متزايد في حلول الاكتشاف الإلكتروني.
- البحث في القواميس : ينتج قائمة أبجدية بجميع الكلمات الرئيسية التي تظهر في النص مع سياقها المباشر.
- البحث التقاربي : يسترجع المستندات التي تظهر فيها كلمتان أو أكثر ضمن مسافة محددة، على سبيل المثال "Wikipedia" WITHIN2 "free" يسترجع المستندات التي تفصل فيها كلمتا "Wikipedia" و "free" على الأكثر بكلمتين.
- البحث باستخدام التعبيرات النمطية : يستخدم صيغة معقدة ولكنها قوية لتحديد شروط الاسترجاع الدقيقة.
- البحث التقريبي : يسترجع المستندات التي تتطابق تقريبًا مع مصطلحات الاستعلام، مما يسمح بوجود اختلافات مثل مسافة التحرير .
- البحث باستخدام الأحرف البديلة : يستبدل حرفًا واحدًا أو أكثر في الاستعلام برمز بديل (مثل *). على سبيل المثال، "s*n" يطابق "sin" أو "son" أو "sun".
برمجة
فيما يلي قائمة جزئية ببرامج تدعم فهرسة النصوص الكاملة والبحث فيها. بعض هذه البرامج مصحوب بوثائق تصف بنيتها أو خوارزمياتها، مما قد يوفر فهمًا أعمق لكيفية تنفيذ البحث في النصوص الكاملة.
برامج مجانية ومفتوحة المصدر
مراجع
- 1 2 3 4 5 6 7 8 9 10 مانينغ، كريستوفر د.؛ راغافان، برابهاكار؛ شوتز، هينريش (2009). مقدمة في استرجاع المعلومات . مطبعة جامعة كامبريدج. رقم ISBN 978-0-521-86571-5.
- 1 2 3 4 5 6 7 8 9 10 بايزا ييتس، ريكاردو؛ ريبيرو نيتو، بيرتييه (1999). استرجاع المعلومات الحديثة ( الطبعة الأولى). أديسون ويسلي. رقم ISBN 0-201-39829-X.
- 1 2 "تاريخ محركات البحث" . ResearchGate . مؤرشف من الأصل في 14 فبراير 2026. تم الاطلاع عليه في 14 مارس 2026 .
- 1 2 يوونو، بودي؛ لي، ديك ل. (1997). "ترتيب الخوادم لأنظمة استرجاع النصوص الموزعة على الإنترنت" . أنظمة قواعد البيانات للتطبيقات المتقدمة 97. وورلد ساينتيفيك: 41-49 . doi : 10.1142/9789812819536_0005 . ISBN 978-981-02-3107-1.
- ↑ سالتون، جيرارد (1974). "تخزين المعلومات واسترجاعها" (PDF) .
- ↑ سالتون، جيرارد؛ ماكجيل، مايكل جيه. (1983). مقدمة في استرجاع المعلومات الحديث . ماكجرو هيل. ISBN 0-07-054484-0.
- ↑ سوليفان، داني (28 يونيو 2013). "رثاء لألتافيستا، جوجل عصرها" . سيرش إنجن لاند . تم الاسترجاع في 15 مارس 2026 .
- 1 2 3 4 ويتن، إيان هـ.؛ موفات، أليستير؛ بيل، تيموثي سي. (1999). إدارة الجيجابايت: ضغط وفهرسة المستندات والصور ( الطبعة الثانية). مورغان كوفمان. ISBN 1-55860-570-3.
- 1 2 3 ريفاس، أ. ر.؛ إغليسياس، إ. ل.؛ بوراجو، ل. (2014). "دراسة تقنيات توسيع الاستعلام وتطبيقها في استرجاع المعلومات الطبية الحيوية" . مجلة العالم العلمي . 2014 132158. doi : 10.1155/2014/132158 . ISSN 1537-744X . PMC 3958669. PMID 24723793 .
- ↑ جوكسيل، جوكهان؛ أرسلان، أحمد؛ دينجر، بكير تانر (2023). "نهج انتقائي للتجذير لتقليل مخاطر الفشل في أنظمة استرجاع المعلومات" . مجلة PeerJ لعلوم الحاسوب . 9 e1175. doi : 10.7717/peerj-cs.1175 . ISSN 2376-5992 . PMC 10280253. PMID 37346699 .
- 1 2 3 4 كولز، مايكل؛ كوتر، هيلاري (2008). البحث النصي الكامل الاحترافي في SQL Server 2008 (الطبعة الأولى ). أبريس. ISBN 978-1-4302-1594-3.
- ↑ سوشا، جورج (12 أغسطس 2017). "Cluster Clear: هل أدوات التجميع هي الحل لعمليات التحديد والاختزال الشاقة؟ | Judicature" . judicature.duke.edu . تاريخ الاسترجاع: 14 مارس 2026 .
- ↑ بيال، جيفري (1 سبتمبر 2008). "نقاط ضعف البحث في النصوص الكاملة" . مجلة المكتبات الأكاديمية . 34 (5): 438-444 . doi : 10.1016/j.acalib.2008.06.007 . ISSN 0099-1333 .
- 1 2 لي، واي سي؛ فوكس، إدوارد أ. (1 مايو 1988). مقارنة تجريبية لأساليب تفسير الاستعلامات المنطقية (تقرير). قسم علوم الحاسوب، معهد فرجينيا للفنون التطبيقية وجامعة ولاية فرجينيا. hdl : 10919/19378 .
انظر أيضاً
- مطابقة الأنماط ومطابقة السلاسل
- معالجة المصطلحات المركبة
- بحث المؤسسات
- استخلاص المعلومات
- استرجاع المعلومات
- بحث متعدد الأوجه
- WebCrawler ، أول محرك FTS
- فهرسة محركات البحث - كيف تُنشئ محركات البحث فهارس لدعم البحث في النصوص الكاملة
- ميزات محرر النصوص
- أنواع استرجاع المعلومات
