استرجاع المعلومات

يُعرَّف استرجاع المعلومات في علوم الحاسوب والمعلومات بأنه عملية تحديد واسترجاع موارد نظام المعلومات ذات الصلة بحاجة معلوماتية . ويمكن تحديد هذه الحاجة في صورة استعلام بحث. وفي حالة استرجاع المستندات، يمكن أن تستند الاستعلامات إلى فهرسة النص الكامل أو فهرسة المحتوى. ويُعنى استرجاع المعلومات [ 1 ] بالبحث عن المعلومات في المستندات، والبحث عن المستندات نفسها، بالإضافة إلى البحث عن البيانات الوصفية التي تصف البيانات، وقواعد بيانات النصوص والصور والأصوات. ويشير الاسترجاع متعدد الوسائط إلى الاسترجاع عبر مختلف الوسائط.

تُستخدم أنظمة استرجاع المعلومات الآلية للحد مما يُعرف بتضخم المعلومات . نظام استرجاع المعلومات هو نظام برمجي يوفر الوصول إلى الكتب والمجلات والوثائق الأخرى، بالإضافة إلى تخزينها وإدارتها. تُعد محركات البحث على الإنترنت من أبرز تطبيقات استرجاع المعلومات.

ملخص

تبدأ عملية استرجاع المعلومات عندما يُدخل المستخدم استعلامًا في النظام. الاستعلامات عبارة عن بيانات رسمية تُعبّر عن احتياجات المعلومات، مثل عبارات البحث في محركات البحث على الإنترنت. في عملية استرجاع المعلومات، لا يُحدد الاستعلام عنصرًا واحدًا فقط في المجموعة، بل قد تتطابق عدة عناصر معه، ربما بدرجات متفاوتة من الصلة .

الكائن هو كيان يُمثَّل بمعلومات في مجموعة محتوى أو قاعدة بيانات . تُطابق استعلامات المستخدم مع معلومات قاعدة البيانات. مع ذلك، وعلى عكس استعلامات SQL التقليدية لقاعدة البيانات، قد تتطابق نتائج استرجاع المعلومات مع الاستعلام أو لا، لذا تُرتَّب النتائج عادةً. يُعدّ هذا الترتيب للنتائج فرقًا جوهريًا بين البحث في استرجاع المعلومات والبحث في قواعد البيانات. [ 2 ]

بحسب التطبيق ، قد تكون عناصر البيانات، على سبيل المثال، مستندات نصية، أو صور ، أو ملفات صوتية، أو خرائط ذهنية ، أو مقاطع فيديو . في كثير من الأحيان، لا تُحفظ المستندات نفسها أو تُخزن مباشرةً في نظام استرجاع المعلومات، بل تُمثل في النظام بواسطة بدائل المستندات أو البيانات الوصفية .

تحسب معظم أنظمة استرجاع المعلومات درجة رقمية تُحدد مدى تطابق كل عنصر في قاعدة البيانات مع الاستعلام، ثم تُرتب العناصر وفقًا لهذه القيمة. بعد ذلك، تُعرض العناصر الأعلى تصنيفًا للمستخدم. ويمكن تكرار هذه العملية إذا رغب المستخدم في تحسين الاستعلام. [ 6 ]

استرجاع المعلومات متعددة الوسائط

يُعدّ استرجاع المعلومات متعددة الوسائط (MMIR أو MIR) فرعًا بحثيًا في علوم الحاسوب يهدف إلى استخلاص المعلومات الدلالية من مصادر بيانات الوسائط المتعددة . [ 7 ] تشمل مصادر البيانات الوسائط المدركة مباشرةً مثل الصوت والصورة والفيديو ، والمصادر المدركة بشكل غير مباشر مثل النصوص والأوصاف الدلالية، [ 8 ] والإشارات الحيوية ، بالإضافة إلى المصادر غير المدركة مثل المعلومات الحيوية وأسعار الأسهم، وما إلى ذلك . يمكن تنظيم منهجية استرجاع المعلومات متعددة الوسائط في ثلاث مجموعات:

  1. أساليب تلخيص محتوى الوسائط ( استخلاص الميزات ). وتكون نتيجة استخلاص الميزات وصفًا.
  2. طرق تصفية أوصاف الوسائط (على سبيل المثال، إزالة التكرار )
  3. طرق تصنيف أوصاف الوسائط إلى فئات.

تاريخ

يوجد جهاز يُسمى يونيفاك، حيث تُشفّر الحروف والأرقام بنمط من النقاط المغناطيسية على شريط فولاذي طويل. بهذه الطريقة، يُمكن تسجيل نص المستند، مسبوقًا برمز موضوعه. يقوم الجهاز تلقائيًا باختيار وكتابة المراجع التي تم تشفيرها بأي طريقة مطلوبة، بمعدل 120 كلمة في الدقيقة.

جيه إي هولمستروم، 1948

انتشرت فكرة استخدام الحواسيب للبحث عن المعلومات ذات الصلة في مقال " كما قد نفكر " لفانيفار بوش عام 1945. [ 9 ] ويبدو أن بوش استلهم الفكرة من براءات اختراع "آلة إحصائية" - سجلها إيمانويل غولدبرغ في عشرينيات وثلاثينيات القرن العشرين - والتي كانت تبحث عن وثائق مخزنة على أفلام. [ 10 ] وقدّم هولمستروم أول وصف لحاسوب يبحث عن المعلومات عام 1948، [ 11 ] مشيرًا إلى حاسوب يونيفاك في بداياته . ظهرت أنظمة استرجاع المعلومات الآلية في خمسينيات القرن العشرين، حتى أن أحدها ظهر في الفيلم الكوميدي الرومانسي " مجموعة المكتب" عام 1957. وفي ستينيات القرن العشرين، شكّل جيرارد سالتون أول فريق بحثي كبير لاسترجاع المعلومات في جامعة كورنيل. وبحلول سبعينيات القرن العشرين، أثبتت عدة تقنيات استرجاع مختلفة كفاءتها في التعامل مع مجموعات نصوص صغيرة ، مثل مجموعة كرانفيلد (التي تضم آلاف الوثائق). [ 9 ] دخلت أنظمة الاسترجاع واسعة النطاق، مثل نظام لوكهيد ديالوغ، حيز الاستخدام في أوائل السبعينيات.

في عام ١٩٩٢، شاركت وزارة الدفاع الأمريكية، بالتعاون مع المعهد الوطني للمعايير والتكنولوجيا (NIST)، في رعاية مؤتمر استرجاع النصوص (TREC) ضمن برنامج TIPSTER النصي. وكان الهدف من ذلك استكشاف مجتمع استرجاع المعلومات من خلال توفير البنية التحتية اللازمة لتقييم منهجيات استرجاع النصوص على مجموعات نصية ضخمة. وقد حفّز هذا البحثَ على تطوير أساليب قابلة للتطبيق على مجموعات النصوص الهائلة. كما زاد ظهور محركات البحث على الإنترنت من الحاجة إلى أنظمة استرجاع واسعة النطاق.

بحلول أواخر التسعينيات، أحدث ظهور شبكة الإنترنت العالمية تحولاً جذرياً في عملية استرجاع المعلومات. فبينما كانت محركات البحث المبكرة، مثل ألتافيستا (1995) وياهو! (1994)، تُقدم استرجاعاً قائماً على الكلمات المفتاحية، إلا أنها كانت محدودة النطاق ودقة ترتيب النتائج. وجاءت الطفرة الحقيقية عام 1998 مع تأسيس جوجل ، التي قدمت خوارزمية بيج رانك [ 12 ] ، التي تستخدم بنية الروابط التشعبية في الويب لتقييم أهمية الصفحات وتحسين ترتيبها حسب الصلة.

خلال العقد الأول من الألفية الثانية، شهدت أنظمة البحث على الإنترنت تطورًا سريعًا مع دمج تقنيات التعلم الآلي. بدأت هذه الأنظمة في دمج بيانات سلوك المستخدم (مثل سجلات النقرات)، وإعادة صياغة الاستعلامات، والإشارات المستندة إلى المحتوى لتحسين دقة البحث وتخصيصه. في عام ٢٠٠٩، أطلقت مايكروسوفت محرك بحث Bing ، مُقدمةً ميزات ستدمج لاحقًا تقنيات الويب الدلالي من خلال تطوير قاعدة معارف Satori. وقد أبرزت التحليلات الأكاديمية [ ١٣ ] قدرات Bing الدلالية، بما في ذلك استخدام البيانات المنظمة والتعرف على الكيانات، كجزء من تحول أوسع في الصناعة نحو تحسين ملاءمة نتائج البحث وفهم نوايا المستخدم من خلال معالجة اللغة الطبيعية.

شهد عام 2018 قفزة نوعية عندما نشرت جوجل نموذج BERT ( تمثيلات المشفر ثنائي الاتجاه من المحولات ) لتحسين فهم المعنى السياقي للاستعلامات والوثائق. وكان هذا من أوائل استخدام نماذج اللغة العصبية العميقة على نطاق واسع في أنظمة استرجاع المعلومات في العالم الحقيقي. [ 14 ] وقد مكّن التدريب ثنائي الاتجاه لنموذج BERT من فهم أدق لعلاقات الكلمات في سياقها، مما حسّن من معالجة استعلامات اللغة الطبيعية. وبفضل نجاحه، اكتسبت النماذج القائمة على المحولات رواجًا في البحوث الأكاديمية وتطبيقات البحث التجارية. [ 15 ]

في الوقت نفسه، بدأ مجتمع البحث باستكشاف نماذج الترتيب العصبي التي تفوقت على الطرق التقليدية القائمة على المعجم. وأصبحت المعايير المرجعية الراسخة، مثل مؤتمر استرجاع النصوص (TREC) الذي انطلق عام 1992، وأطر التقييم الأحدث مثل Microsoft MARCO (فهم القراءة الآلية ) ( 2019 ) [ 16 ] ، أساسيةً لتدريب وتقييم أنظمة الاسترجاع عبر مهام ومجالات متعددة. كما تم اعتماد MS MARCO في مسارات التعلم العميق لمؤتمر TREC، حيث تُستخدم كمجموعة بيانات أساسية لتقييم التطورات في نماذج الترتيب العصبي ضمن بيئة قياس معيارية موحدة. [ 17 ]

مع ازدياد أهمية التعلم العميق في أنظمة استرجاع المعلومات، بدأ الباحثون بتصنيف الأساليب العصبية إلى ثلاث فئات رئيسية: النماذج المتفرقة ، والنماذج الكثيفة ، والنماذج الهجينة . تعتمد النماذج المتفرقة، بما في ذلك الطرق التقليدية القائمة على المصطلحات والمتغيرات المُتعلمة مثل SPLADE، على تمثيلات قابلة للتفسير وفهارس معكوسة لتمكين مطابقة المصطلحات بدقة وكفاءة مع إضافة إشارات دلالية. [ 18 ] أما النماذج الكثيفة، مثل بنى التشفير المزدوج كـ ColBERT، فتستخدم تضمينات متجهة متصلة لدعم التشابه الدلالي بما يتجاوز تداخل الكلمات المفتاحية. [ 19 ] وتهدف النماذج الهجينة إلى الجمع بين مزايا كلا النوعين، حيث تُوازن بين دقة المعجم (الرمز) للطرق المتفرقة والعمق الدلالي للنماذج الكثيفة. يُحقق هذا التصنيف للنماذج توازنًا بين قابلية التوسع، والملاءمة، والكفاءة في أنظمة الاسترجاع. [ 20 ]

مع تزايد اعتماد أنظمة استرجاع المعلومات على التعلم العميق، برزت مخاوف تتعلق بالتحيز والإنصاف وقابلية التفسير. ويركز البحث الآن ليس فقط على الملاءمة والكفاءة، بل أيضاً على الشفافية والمساءلة وثقة المستخدم في خوارزميات الاسترجاع.

التطبيقات

تشمل المجالات التي تُستخدم فيها تقنيات استرجاع المعلومات ما يلي (المدخلات مرتبة أبجديًا ضمن كل فئة):

التطبيقات العامة

تطبيقات خاصة بمجال معين

طرق استرجاع أخرى

تشمل الأساليب/التقنيات التي تُستخدم فيها تقنيات استرجاع المعلومات ما يلي:

أنواع النماذج

تصنيف نماذج الأشعة تحت الحمراء (مترجم من المدخل الألماني ، المصدر الأصلي دومينيك كوروبكا )

لتحقيق استرجاع فعال للوثائق ذات الصلة باستخدام استراتيجيات استرجاع المعلومات، تُحوّل الوثائق عادةً إلى تمثيل مناسب. تتضمن كل استراتيجية استرجاع نموذجًا محددًا لأغراض تمثيل الوثائق. يوضح الشكل على اليمين العلاقة بين بعض النماذج الشائعة، حيث تُصنّف النماذج وفقًا لبُعدين: الأساس الرياضي وخصائص النموذج.

البعد الأول: الأساس الرياضي

البعد الثاني: خصائص النموذج

  • تتعامل النماذج التي لا تتضمن ترابطات بين المصطلحات مع المصطلحات/الكلمات المختلفة على أنها مستقلة. وعادةً ما يتم تمثيل هذه الحقيقة في نماذج الفضاء المتجهي من خلال افتراض تعامد متجهات المصطلحات، أو في النماذج الاحتمالية من خلال افتراض استقلال متغيرات المصطلحات.
  • تسمح النماذج ذات الترابطات الداخلية بين المصطلحات بتمثيل هذه الترابطات. ومع ذلك، فإن درجة الترابط بين مصطلحين تُحددها النماذج نفسها، وعادةً ما تُستنتج بشكل مباشر أو غير مباشر (مثلاً عن طريق تقليل الأبعاد ) من تكرار هذين المصطلحين في مجموعة المستندات بأكملها.
  • تسمح النماذج ذات الترابطات المتعالية بين المصطلحات بتمثيل هذه الترابطات، لكنها لا توضح كيفية تعريف الترابط بين مصطلحين. فهي تعتمد على مصدر خارجي لتحديد درجة الترابط بينهما (على سبيل المثال، شخص أو خوارزميات متطورة).

البعد الثالث: التصنيف القائم على النهج التمثيلي

بالإضافة إلى الفروق النظرية، تُصنف نماذج استرجاع المعلومات الحديثة أيضًا بناءً على كيفية تمثيل الاستعلامات والوثائق ومقارنتها، باستخدام تصنيف عملي يميز بين النماذج المتفرقة والكثيفة والهجينة. [ 18 ]

  • تستخدم النماذج المتفرقة تمثيلات قابلة للتفسير تعتمد على المصطلحات، وتعتمد عادةً على هياكل الفهرسة المعكوسة. تندرج الطرق الكلاسيكية مثل TF-IDF وBM25 ضمن هذه الفئة، إلى جانب النماذج المتفرقة المُتعلمة الأحدث التي تدمج البنى العصبية مع الحفاظ على خاصية التفرق. [ 23 ]
  • تمثل النماذج الكثيفة الاستعلامات والوثائق كمتجهات متصلة باستخدام نماذج التعلم العميق، وعادةً ما تكون مشفرات قائمة على المحولات. تُمكّن هذه النماذج من مطابقة التشابه الدلالي بما يتجاوز التداخل التام للمصطلحات، وتُستخدم في المهام التي تتضمن البحث الدلالي والإجابة على الأسئلة. [ 24 ]
  • تهدف النماذج الهجينة إلى الجمع بين نقاط قوة كلا النهجين، ودمج الإشارات المعجمية (الرموز) والدلالية من خلال دمج الدرجات، أو التفاعل المتأخر، أو مسارات الترتيب متعددة المراحل. [ 25 ]

أصبح هذا التصنيف شائعاً بشكل متزايد في التطبيقات الأكاديمية والتطبيقية، ويجري اعتماده واستخدامه على نطاق واسع في معايير تقييم نماذج استرجاع المعلومات. [ 20 ] [ 23 ]

معايير الأداء والصحة

تقييم نظام استرجاع المعلومات هو عملية تقييم مدى تلبية النظام لاحتياجات مستخدميه من المعلومات. بشكل عام، يعتمد القياس على مجموعة من الوثائق المراد البحث فيها واستعلام بحث. تشمل مقاييس التقييم التقليدية، المصممة للاسترجاع المنطقي أو استرجاع أفضل k نتيجة، الدقة والاستدعاء . تفترض جميع المقاييس وجود مفهوم أساسي للصلة: حيث يُعرف أن كل وثيقة إما ذات صلة أو غير ذات صلة باستعلام معين. عمليًا، قد تكون الاستعلامات غير محددة جيدًا ، وقد تتفاوت درجات الصلة.

مكتبات للبحث والفهرسة

الجدول الزمني

  • قبل عام 1900
    1801 : جوزيف ماري جاكارد يخترع نول جاكارد ، وهو أول آلة تستخدم البطاقات المثقبة للتحكم في سلسلة من العمليات.
    ثمانينيات القرن التاسع عشر : اخترع هيرمان هوليريث جهاز جدولة بيانات كهروميكانيكي باستخدام البطاقات المثقبة كوسيط قابل للقراءة آلياً.
    بطاقات هوليريث ، وأجهزة تثقيب المفاتيح ، وأجهزة الجدولة المستخدمة في معالجة بيانات التعداد السكاني الأمريكي لعام 1890 .
  • عشرينيات وثلاثينيات القرن العشرين
    يقدم إيمانويل غولدبرغ براءات اختراع لـ "الآلة الإحصائية" الخاصة به، وهي محرك بحث عن المستندات يستخدم الخلايا الكهروضوئية والتعرف على الأنماط للبحث في البيانات الوصفية على لفائف المستندات المصورة على الميكروفيلم.
  • أربعينيات وخمسينيات القرن العشرين
    أواخر الأربعينيات : واجه الجيش الأمريكي مشاكل في فهرسة واسترجاع وثائق البحث العلمي التي تم الاستيلاء عليها من الألمان خلال الحرب.
    1945 : ظهرت قصيدة فانيفار بوش " كما قد نفكر" في مجلة أتلانتيك الشهرية .
    1947 : بدأ هانز بيتر لون (مهندس أبحاث في شركة IBM منذ عام 1941) العمل على نظام آلي يعتمد على البطاقات المثقبة للبحث عن المركبات الكيميائية.
    الخمسينيات : أدى القلق المتزايد في الولايات المتحدة بشأن "الفجوة العلمية" مع الاتحاد السوفيتي إلى تحفيز وتشجيع التمويل وتوفير خلفية لأنظمة البحث الآلي في الأدبيات ( ألين كينت وآخرون ) واختراع فهرس الاستشهاد بواسطة يوجين غارفيلد .
    1950 : صاغ كالفن مويرز مصطلح "استرجاع المعلومات" . [ 26 ]
    1951 : أجرى فيليب باجلي أول تجربة في استرجاع المستندات المحوسبة في رسالة ماجستير في معهد ماساتشوستس للتكنولوجيا . [ 27 ]
    ١٩٥٥ : انضم ألين كينت إلى جامعة كيس ويسترن ريزيرف ، وأصبح لاحقًا مديرًا مشاركًا لمركز أبحاث التوثيق والاتصالات. في العام نفسه، نشر كينت وزملاؤه ورقة بحثية في مجلة "أمريكان دوكيومنتيشن" تصف مقاييس الدقة والاستدعاء، بالإضافة إلى تفصيل "إطار عمل" مقترح لتقييم نظام استرجاع المعلومات، والذي تضمن أساليب المعاينة الإحصائية لتحديد عدد الوثائق ذات الصلة التي لم يتم استرجاعها. [ ٢٨ ]
    ١٩٥٨ : تضمن المؤتمر الدولي للمعلومات العلمية في واشنطن العاصمة دراسة أنظمة استرجاع المعلومات كحل للمشاكل التي تم تحديدها. انظر: وقائع المؤتمر الدولي للمعلومات العلمية، ١٩٥٨ (الأكاديمية الوطنية للعلوم، واشنطن العاصمة، ١٩٥٩).
    1959 : نشر هانز بيتر لونه "الترميز التلقائي للوثائق لاسترجاع المعلومات".
  • الستينيات :
    أوائل الستينيات : بدأ جيرارد سالتون العمل في مجال العلاقات الدولية في جامعة هارفارد، ثم انتقل لاحقًا إلى جامعة كورنيل.
    1960 : نشر ميلفين إيرل مارون وجون لاري كونز [ 29 ] بحثًا بعنوان "حول الصلة والفهرسة الاحتمالية واسترجاع المعلومات" في مجلة ACM 7(3):216–244، يوليو 1960.
    1962 :
    نشر سيريل دبليو. كليفردون نتائج مبكرة لدراسات كرانفيلد، حيث طور نموذجًا لتقييم أنظمة المعلومات عن بُعد. انظر: سيريل دبليو. كليفردون، "تقرير عن اختبار وتحليل دراسة حول الكفاءة المقارنة لأنظمة الفهرسة". مجموعة كرانفيلد للملاحة الجوية، كرانفيلد، إنجلترا، 1962.
    * نشر كينت كتاب تحليل المعلومات واسترجاعها .
    1963 :
    * قدم تقرير واينبرغ بعنوان "العلم والحكومة والمعلومات" شرحاً وافياً لفكرة "أزمة المعلومات العلمية". وقد سُمي التقرير تيمناً بالدكتور ألفين واينبرغ .
    * نشر جوزيف بيكر وروبرت م. هايز كتابًا عن استرجاع المعلومات. بيكر، جوزيف؛ هايز، روبرت مايو. تخزين المعلومات واسترجاعها: الأدوات والعناصر والنظريات . نيويورك، وايلي (1963).
    1964 :
    * أنهت كارين سبارك جونز أطروحتها في كامبريدج بعنوان " الترادف والتصنيف الدلالي" ، وواصلت العمل على اللغويات الحاسوبية وتطبيقاتها في استرجاع المعلومات.
    * رعى المكتب الوطني للمعايير ندوة بعنوان "أساليب الارتباط الإحصائي للتوثيق الآلي". وقد تضمنت الندوة العديد من الأوراق البحثية الهامة، بما في ذلك أول مرجع منشور (على حد علمنا) لـ جي. سالتون لنظام SMART .
    منتصف الستينيات :
    * قامت المكتبة الوطنية للطب (NLM) بتطوير نظام MEDLARS لتحليل واسترجاع الأدبيات الطبية، وهو أول نظام رئيسي لقاعدة البيانات القابلة للقراءة آلياً ونظام استرجاع الدفعات.
    * مشروع Intrex في معهد ماساتشوستس للتكنولوجيا.
    1965 : نشر جيه سي آر ليكليدر كتاب "مكتبات المستقبل" .
    1966 : شارك دون سوانسون في دراسات في جامعة شيكاغو حول متطلبات الفهارس المستقبلية.
    أواخر الستينيات : أكمل ف. ويلفريد لانكستر دراسات تقييم نظام MEDLARS ونشر الطبعة الأولى من كتابه عن استرجاع المعلومات.
    1968 :
    * نشر جيرارد سالتون كتاب "التنظيم والاسترجاع الآلي للمعلومات" .
    * قام جون دبليو سامون الابن بتقرير RADC التقني بعنوان "بعض الرياضيات لتخزين المعلومات واسترجاعها ..." بتوضيح نموذج المتجهات.
    1969 : كان اقتراح سامون " رسم خرائط غير خطي لتحليل بنية البيانات " (IEEE Transactions on Computers) أول اقتراح لواجهة تصور لنظام استرجاع المعلومات .
  • سبعينيات القرن العشرين
    أوائل سبعينيات القرن العشرين :
    * أول الأنظمة عبر الإنترنت - AIM-TWX التابعة للمكتبة الوطنية للطب، وMEDLINE؛ وDialog التابعة لشركة لوكهيد؛ وORBIT التابعة لشركة SDC.
    * قام ثيودور نيلسون بالترويج لمفهوم النص التشعبي ، ونشر كتاب "مكتبة الحاسوب/آلات الأحلام" .
    1971 : نشر نيكولاس جاردين وكورنيليس ج. فان ريسبرجن بحثًا بعنوان "استخدام التجميع الهرمي في استرجاع المعلومات"، والذي صاغ "فرضية التجميع". [ 30 ]
    1975 : ثلاثة منشورات مؤثرة للغاية من تأليف سالتون أوضحت بشكل كامل إطار عمل معالجة المتجهات ونموذج تمييز المصطلحات الخاص به :
    * نظرية الفهرسة (جمعية الرياضيات الصناعية والتطبيقية)
    * نظرية أهمية المصطلحات في التحليل الآلي للنصوص ( JASIS الإصدار 26)
    * نموذج فضاء متجه للفهرسة التلقائية ( CACM 18:11)
    1978 : المؤتمر الأول لجمعية ACM SIGIR .
    1979 : نشر سي جيه فان ريسبرجن كتاب استرجاع المعلومات (بتروورث). مع التركيز الشديد على النماذج الاحتمالية.
    1979 : قام تاماس دوسكوكس بتطوير واجهة مستخدم CITE للغة الطبيعية لقاعدة بيانات MEDLINE في المكتبة الوطنية للطب. يدعم نظام CITE إدخال الاستعلامات الحرة، والإخراج المصنف، وردود الفعل المتعلقة بالملاءمة. [ 31 ]
  • ثمانينيات القرن العشرين
    1980 : أول مؤتمر دولي لـ ACM SIGIR، بالاشتراك مع مجموعة IR التابعة لجمعية الحاسبات البريطانية في كامبريدج.
    في عام 1982 ، اقترح نيكولاس ج. بيلكين ، وروبرت ن. أودي، وهيلين م. بروكس، منظور ASK (حالة المعرفة الشاذة) لاسترجاع المعلومات. كان هذا مفهومًا مهمًا، على الرغم من أن أداة التحليل الآلي التي طوروها أثبتت في النهاية أنها مخيبة للآمال.
    1983 : قام سالتون (ومايكل جيه ماكجيل) بنشر كتاب مقدمة في استرجاع المعلومات الحديثة (ماكجرو هيل)، مع التركيز الشديد على نماذج المتجهات.
    1985 : نشر ديفيد بلير وبيل مارون : تقييم فعالية الاسترجاع لنظام استرجاع المستندات كاملة النص . [ 32 ]
    في عام ١٩٨٦ ، قام الدكتور دونالد أ. ب. ليندبرغ ، مدير المكتبة الوطنية للطب، بتطبيق واجهة مباشرة للمختصين الصحيين للوصول إلى قاعدة بيانات MEDLINE وقواعد بيانات MEDLARS الأخرى. وقد تم تطوير نظام Grateful Med ، وهو تورية على اسم فرقة Grateful Dead ، من واجهة المستخدم Microsearch، وهي واجهة ELHILL التي كانت تُجمّع لغة الاستعلام قبل الاتصال بالحاسوب المركزي للمكتبة الوطنية للطب. وبعد استرجاع نتائج الاستعلام، كان نظام Grateful Med ينقطع عن الحاسوب المركزي للحفاظ على انخفاض تكاليف البحث. [ ٣٣ ]
    منتصف الثمانينيات : جهود لتطوير نسخ المستخدم النهائي من أنظمة الأشعة تحت الحمراء التجارية.
    1985–1993 : أوراق بحثية رئيسية وأنظمة تجريبية لواجهات التصور.
    أعمال دونالد ب. كراوتش ، وروبرت ر. كورفهاج ، وماثيو تشالمرز، وأنسيلم سبويري، وآخرين.
    1989 : أول مقترحات شبكة الويب العالمية من قبل تيم بيرنرز لي في سيرن .
  • التسعينيات
    1992 : المؤتمر الأول لـ TREC .
    1997 : نشر كتاب كورفهاج " تخزين المعلومات واسترجاعها " [ 34 ] مع التركيز على التصور وأنظمة نقاط المرجعية المتعددة.
    1998: تأسست شركة جوجل على يد لاري بيج وسيرجي برين . وقدمت خوارزمية بيج رانك، التي تقيّم أهمية صفحات الويب بناءً على بنية الروابط التشعبية. [ 12 ]
    1999 : نشر كتاب ريكاردو بايزا-ياتس وبيرتييه ريبيرو-نيتو بعنوان " استرجاع المعلومات الحديثة" بواسطة دار نشر أديسون ويسلي، وهو أول كتاب يحاول تغطية جميع جوانب استرجاع المعلومات.
  • العقد الأول من القرن الحادي والعشرين
    2001: انطلقت ويكيبيديا كموسوعة إلكترونية مجانية وتعاونية. وسرعان ما أصبحت مصدراً رئيسياً لاسترجاع المعلومات، لا سيما في مجال معالجة اللغة الطبيعية ومعايير البحث الدلالي. [ 35 ]
    2009: أطلقت مايكروسوفت محرك بحث بينغ، وقدمت ميزات مثل عمليات البحث ذات الصلة، والاقتراحات الدلالية، ثم دمجت لاحقًا تقنيات التعلم العميق في خوارزميات الترتيب الخاصة بها. [ 13 ]
  • العقد الثاني من القرن الحادي والعشرين
    2013: تم إطلاق خوارزمية الطائر الطنان من جوجل، مما يمثل تحولاً من مطابقة الكلمات الرئيسية إلى فهم نية الاستعلام والسياق الدلالي في استعلامات البحث. [ 36 ]
    2018: أطلق باحثو الذكاء الاصطناعي في جوجل BERT (تمثيلات المشفر ثنائي الاتجاه من المحولات)، مما يتيح فهمًا عميقًا ثنائي الاتجاه للغة ويحسن ترتيب المستندات وفهم الاستعلام في استرجاع المعلومات. [ 14 ]
    2019: قدمت مايكروسوفت MS MARCO ( فهم القراءة الآلية من مايكروسوفت ) ، وهي مجموعة بيانات واسعة النطاق مصممة لتدريب وتقييم نماذج القراءة الآلية وتصنيف النصوص. [ 16 ]
  • عقد 2020
    2020: تم تقديم نموذج ColBERT ( التفاعل المتأخر السياقي عبر BERT)، المصمم لاسترجاع المقاطع بكفاءة باستخدام التضمينات السياقية، في مؤتمر SIGIR 2020. [ 37 ] [ 19 ]
    2021: تم تقديم SPLADE في مؤتمر SIGIR 2021. وهو نموذج استرجاع عصبي متفرق يوازن بين السمات المعجمية والدلالية باستخدام نمذجة اللغة المقنعة وتنظيم التفرق. [ 38 ]
    2022: تم إصدار معيار BEIR لتقييم استرجاع المعلومات بدون تدريب مسبق عبر 18 مجموعة بيانات تغطي مهامًا متنوعة. وهو يوحد المقارنات بين نماذج استرجاع المعلومات الكثيفة والمتفرقة والهجينة. [ 23 ]

المؤتمرات الرئيسية

الجوائز في هذا المجال

انظر أيضاً

مراجع

  1. لوك، ر. و. ب. (2022). "لماذا يُعدّ استرجاع المعلومات تخصصًا علميًا؟". أسس العلوم . 27 (2): 427-453 . doi : 10.1007/s10699-020-09685-x . hdl : 10397/94873 . S2CID 220506422 . 
  2. Jansen, B.J.; Rieh, S. (2010). "The Seventeen Theoretical Constructs of Information Searching and Information Retrieval"(PDF). Journal of the American Society for Information Sciences and Technology. 61 (8): 1517–34. doi:10.1002/asi.21358.
  3. Goodrum, Abby A. (2000). "Image Information Retrieval: An Overview of Current Research"(PDF). Informing Science. 3 (2): 063–066. doi:10.28945/578.
  4. Foote, Jonathan (1999). "An overview of audio information retrieval". Multimedia Systems. 7: 2–10. CiteSeerX 10.1.1.39.6339. doi:10.1007/s005300050106. S2CID 2000641.
  5. Beel, Jöran; Gipp, Bela; Stiller, Jan-Olaf (2009). Information Retrieval On Mind Maps — What Could It Be Good For?(PDF). Proceedings of the 5th International Conference on Collaborative Computing: Networking, Applications and Worksharing (CollaborateCom'09). IEEE. doi:10.4108/ICST.COLLABORATECOM2009.8298. ISBN 978-963-9799-76-9.
  6. Frakes, William B.; Baeza-Yates, Ricardo (1992). Information Retrieval Data Structures & Algorithms. Prentice-Hall, Inc. ISBN 978-0-13-463837-9. Archived from the original on 2013-09-28.
  7. H Eidenberger. Fundamental Media Understanding, atpress, 2011, p. 1.
  8. Sikos, L. F. (2016). "RDF-powered semantic video annotation tools with concept mapping to Linked Data for next-generation video indexing: a comprehensive review". Multimedia Tools and Applications. 76 (12): 14437–14460. doi:10.1007/s11042-016-3705-7. S2CID 254832794.
  9. 12Singhal, Amit (2001). "Modern Information Retrieval: A Brief Overview"(PDF). Bulletin of the IEEE Computer Society Technical Committee on Data Engineering. 24 (4): 35–43.
  10. مارك ساندرسون و دبليو. بروس كروفت (2012). "تاريخ أبحاث استرجاع المعلومات" . وقائع معهد مهندسي الكهرباء والإلكترونيات . 100 : 1444-1451 . doi : 10.1109/jproc.2012.2189916 .
  11. جيه إي هولمستروم (1948). ""القسم الثالث. الجلسة العامة الافتتاحية" . مؤتمر المعلومات العلمية للجمعية الملكية، 21 يونيو - 2 يوليو 1948: التقرير والأوراق المقدمة : 85.
  12. 1 2 برين، سيرجي؛ بيج، لورانس (1998). "تشريح محرك بحث ويب نصي فائق واسع النطاق" (ملف PDF) . شبكات الحاسوب وأنظمة ISDN . 30 ( 1-7 ): 107-117 . doi : 10.1016/S0169-7552(98)00110-X .
  13. 1 2 أويار، أحمد؛ عليو، فاروق موسى (2015-01-01). "تقييم ميزات البحث في Google Knowledge Graph وBing Satori: أنواع الكيانات، وعمليات البحث في القوائم، وواجهات الاستعلام" . مراجعة المعلومات على الإنترنت . 39 (2): 197-213 . doi : 10.1108/OIR-10-2014-0257 . ISSN 1468-4527 . 
  14. 1 2 ديفلين، جاكوب؛ تشانغ، مينغ-وي؛ لي، كينتون؛ توتانوفا، كريستينا (2018). "BERT: التدريب المسبق للمحولات ثنائية الاتجاه العميقة لفهم اللغة". arXiv : 1810.04805 [ cs.CL ].
  15. غاردازي، نادية مشتاق؛ داود، علي؛ مالك، محمد كامران؛ بخاري، أمل؛ الحسفي، طارق؛ الشميمري، بدر (15 مارس 2025). "تطبيقات BERT في معالجة اللغة الطبيعية: مراجعة" . مجلة مراجعة الذكاء الاصطناعي . 58 (6): 166. doi : 10.1007/s10462-025-11162-5 . ISSN 1573-7462 . 
  16. 1 2 باجاج، بايال؛ كامبوس، دانيال؛ كراسويل، نيك؛ دينغ، لي؛ غاو، جيانفينغ؛ ليو، شياودونغ؛ ماجومدر، رانجان؛ ماكنمارا، أندرو؛ ميترا، بهاسكار؛ نغوين، تري؛ روزنبرغ، مير؛ سونغ، شيا؛ ستويكا، ألينا؛ تيواري، سوراب؛ وانغ، تونغ (2016). "MS MARCO: مجموعة بيانات لفهم القراءة الآلية من إنتاج الإنسان". arXiv : 1611.09268 [ cs.CL ].
  17. كراسويل، نيك؛ ميترا، بهاسكار؛ يلماز، أمينة؛ رحماني، حسين أ.؛ كامبوس، دانيال؛ لين، جيمي؛ فوريس، إيلين م.؛ سوبوروف، إيان (فبراير 2024). "نظرة عامة على مسار التعلم العميق في مؤتمر TREC 2023" . مؤتمر استرجاع النصوص (TREC) - عبر مايكروسوفت.
  18. 1 2 كيم، دوهيون؛ تشاو، لينا؛ تشونغ، إريك؛ بارك، إيون جاي (2021). "طرق DG المتداخلة المقاومة للضغط لمعادلات نافيير-ستوكس على الشبكات العامة". arXiv : 2107.09226 [ math.NA ].
  19. 1 2 خطاب، عمر؛ زاهريا، ماتاي (25-07-2020). "ColBERT: بحث فعال وكفؤ عن المقاطع عبر التفاعل المتأخر السياقي على BERT" . وقائع المؤتمر الدولي الثالث والأربعين لجمعية ACM SIGIR حول البحث والتطوير في استرجاع المعلومات . SIGIR '20. نيويورك، نيويورك، الولايات المتحدة الأمريكية: جمعية آلات الحوسبة. ص 39-48 . doi : 10.1145/3397271.3401075 . ISBN  978-1-4503-8016-4.
  20. 1 2 لين، جيمي؛ نوغيرا، رودريغو؛ ييتس، أندرو (2020). "المحولات المدربة مسبقًا لترتيب النصوص: بيرت وما بعده". arXiv : 2010.06467 [ cs.IR ].
  21. شو، جوزيف أ؛ فوكس، إدوارد أ. (1994) دمج عمليات بحث متعددة. TREC 1994: 105-108
  22. وو، شينغلي (2012). دمج البيانات في استرجاع المعلومات . سبرينغر. ص 1-212 . ISBN  978-3-642-28865-4.
  23. 1 2 3 ثاكور، ناندان؛ ريمرز، نيلز؛ روكلي، أندرياس؛ سريفاستافا، أبهيشيك؛ جوريفيتش، إيرينا (2021). "BEIR: معيار غير متجانس لتقييم نماذج استرجاع المعلومات بدون استخدام بيانات تجريبية". arXiv : 2104.08663 [ cs.IR ].
  24. لاو، جاي هان؛ أرمنداريز، كارلوس؛ لابين، شالوم؛ بورفر، ماثيو؛ شو، تشانغ (2020). جونسون، مارك؛ روارك، برايان؛ نينكوفا، آني (محررون). "إلى أي مدى يمكن للأفكار الخضراء عديمة اللون أن تنام بغضب؟ مقبولية الجملة في السياق" . معاملات رابطة اللغويات الحاسوبية . 8 : 296-310 . doi : 10.1162/tacl_a_00315 .
  25. عرب زاده، نيجار؛ يان، شين يي؛ كلارك، تشارلز إل إيه (2021). "التنبؤ بمفاضلات الكفاءة/الفعالية لاختيار استراتيجية الاسترجاع الكثيفة مقابل المتفرقة". arXiv : 2109.10739 [ cs.IR ].
  26. مويرز، كالفن ن. (1951). نظرية المعالجة الرقمية للمعلومات غير الرقمية وآثارها على اقتصاديات الآلات . نشرة زاتور الفنية (تقرير فني). 48., cited in Fairthorne, R. A. (1958). "Automatic Retrieval of Recorded Information". The Computer Journal. 1 (1): 37. doi:10.1093/comjnl/1.1.36.
  27. Doyle, Lauren; Becker, Joseph (1975). Information Retrieval and Processing. Melville. ISBN 978-0-471-22151-7.
  28. Perry, James W.; Kent, Allen; Berry, Madeline M. (1955). "Machine literature searching X. Machine language; factors underlying its design and development". American Documentation. 6 (4): 242–254. doi:10.1002/asi.5090060411.
  29. Maron, Melvin E. (2008). "An Historical Note on the Origins of Probabilistic Indexing"(PDF). Information Processing and Management. 44 (2): 971–2. doi:10.1016/j.ipm.2007.02.012.
  30. N. Jardine, C.J. van Rijsbergen (December 1971). "The use of hierarchic clustering in information retrieval". Information Storage and Retrieval. 7 (5): 217–240. doi:10.1016/0020-0271(71)90051-9.
  31. Doszkocs, T.E.; Rapp, B.A. (1979). "Searching MEDLINE in English: a Prototype User Interface with Natural Language Query, Ranked Output, and relevance feedback". Information choices and policies : 42nd annual meeting, Minneapolis, Minnesota, October 14-18, 1979. American Society for Information Science. Vol. 16. Knowledge Industry Publications. pp. 131–9. OCLC 271407392. OSTI 5047496.
  32. Blair, D.C.; Maron, M.E. (1985). "An evaluation of retrieval effectiveness for a full-text document-retrieval system". Communications of the ACM. 28 (3): 289–299. doi:10.1145/3166.3197.
  33. Dorsch JL, Faughnan JG, Humphreys BL (June 2022). "Grateful Med: Direct access to MEDLINE for health professionals with personal computers". Inf Serv Use. 42 (2): 151–160. doi:10.3233/ISU-220147. PMC 9196098. PMID 35720429.
  34. كورفهاج، روبرت ر. (1997). تخزين المعلومات واسترجاعها . وايلي. 368 صفحة . ISBN  978-0-471-14338-3.
  35. "تاريخ ويكيبيديا" ، ويكيبيديا ، 21 فبراير 2025 ، تاريخ الاطلاع 9 أبريل 2025
  36. سوليفان، داني (26-09-2013). "أسئلة وأجوبة: كل ما يتعلق بخوارزمية جوجل الجديدة "الطائر الطنان"" . سيرش إنجن لاند . تم الاسترجاع في 09-04-2025 .
  37. خطاب، عمر؛ زاهاريا، ماتاي (2020). "ColBERT: بحث فعال وكفؤ عن المقاطع عبر التفاعل المتأخر السياقي على BERT". arXiv : 2004.12832 [ cs.IR ].
  38. جونز، روزي؛ زماني، حامد؛ شيدل، ماركوس؛ تشين، تشينغ-وي؛ ريدي، سرافانا؛ كليفتون، آن؛ كارلغرين، جوسي؛ هاشمي، هيليا؛ بابو، آسيش؛ نظري، زهرة؛ يانغ، لونغكي؛ سيميرسي، أوغوز؛ بوشار، هيوز؛ كارترت، بن (11 يوليو/تموز 2021). "التحديات الحالية والاتجاهات المستقبلية في الوصول إلى معلومات البودكاست" . وقائع المؤتمر الدولي الرابع والأربعين لجمعية ACM SIGIR حول البحث والتطوير في استرجاع المعلومات . SIGIR '21. نيويورك، نيويورك، الولايات المتحدة الأمريكية: جمعية آلات الحوسبة. الصفحات 1554-1565 . arXiv : 2106.09227 . doi : 10.1145/3404835.3462805 . ISBN  978-1-4503-8037-9.

للمزيد من القراءة