إضافة التعليقات التوضيحية التلقائية للصور

تُعرف عملية إضافة التعليقات التوضيحية التلقائية للصور (أو ما يُسمى أيضًا بالوسم التلقائي للصور أو الفهرسة اللغوية ) بأنها عملية يقوم من خلالها نظام الحاسوب بإضافة بيانات وصفية تلقائيًا ، على شكل تعليقات أو كلمات مفتاحية، إلى صورة رقمية . ويُستخدم هذا التطبيق لتقنيات رؤية الحاسوب في أنظمة استرجاع الصور لتنظيم وتحديد مواقع الصور المطلوبة من قاعدة البيانات .
يمكن اعتبار هذه الطريقة نوعًا من تصنيف الصور متعدد الفئات، حيث تضم عددًا كبيرًا جدًا من الفئات، يصل إلى حجم المفردات. عادةً ما تستخدم تقنيات التعلم الآلي تحليل الصور ، من خلال استخراج متجهات الميزات وكلمات التدريب ، لمحاولة تطبيق التعليقات التوضيحية تلقائيًا على الصور الجديدة. [ 1 ] تعلمت الطرق الأولى العلاقات بين ميزات الصورة وكلمات التدريب. لاحقًا، طُوّرت تقنيات تستخدم الترجمة الآلية لمحاولة ترجمة المفردات النصية إلى "مفردات بصرية"، ممثلة بمناطق متجمعة تُعرف باسم " البقع". وشملت الأعمال اللاحقة مناهج التصنيف، ونماذج الصلة، وغيرها من الطرق ذات الصلة.
تتمثل مزايا التعليق التلقائي على الصور مقارنةً باسترجاع الصور القائم على المحتوى (CBIR) في إمكانية تحديد الاستعلامات بشكل أكثر سلاسة من قِبل المستخدم. [ 2 ] في الوقت الحالي، يتطلب استرجاع الصور القائم على المحتوى (CBIR) عمومًا من المستخدمين البحث باستخدام مفاهيم الصور، مثل اللون والملمس، أو من خلال البحث عن أمثلة للاستعلامات. مع ذلك، قد تطغى بعض خصائص الصور في الأمثلة على المفهوم الذي يركز عليه المستخدم فعليًا. تعتمد الطرق التقليدية لاسترجاع الصور، كتلك المستخدمة في المكتبات، على الصور المُعلَّمة يدويًا، وهو أمر مكلف ويستغرق وقتًا طويلًا، لا سيما مع وجود قواعد بيانات صور ضخمة ومتنامية باستمرار.
انظر أيضاً
مراجع
- ↑ بارات، سابين؛ تابوني، سالفاتوري (2010-05-01). "نمذجة وتصنيف وشرح الصور المشروحة بشكل ضعيف باستخدام الشبكة البايزية" . مجلة الاتصالات المرئية وتمثيل الصور . 21 (4): 355-363 . doi : 10.1016/j.jvcir.2010.02.010 . ISSN 1047-3203 .
- ↑ "نسخة مؤرشفة" (PDF) . i.yz.yamagata-u.ac.jp . مؤرشفة من الأصل (PDF) بتاريخ 8 أغسطس 2014. تم الاطلاع عليها بتاريخ 13 يناير 2022 .
{{cite web}}: CS1 maint: archived copy as title ( link )
- داتا، ريتندرا؛ ديراج جوشي؛ جيا لي ؛ جيمس زد. وانغ (2008). "استرجاع الصور: أفكار وتأثيرات واتجاهات العصر الجديد" . مجلة ACM Computing Surveys . 40 (2): 1-60 . doi : 10.1145/1348246.1348248 . S2CID 7060187 .
- نيكولاس هيرفيه؛ نزهة بوجمعة (2007). "شرح الصور : أي نهج يناسب قواعد البيانات الواقعية ؟" (ملف PDF) . المؤتمر الدولي لجمعية الحوسبة الآلية (ACM) لاسترجاع الصور والفيديو . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 20 مايو 2011.
- إم إينوي (2004). "حول الحاجة إلى استرجاع الصور القائم على التعليقات التوضيحية" (ملف PDF) . ورشة عمل حول استرجاع المعلومات في السياق . الصفحات 44-46 . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 8 أغسطس 2014.
للمزيد من القراءة
- نموذج التواجد المشترك للكلمات
- ي. موري؛ هـ. تاكاهاشي و ر. أوكا (1999). "تحويل الصور إلى كلمات بناءً على تقسيم الصور وتكميمها باستخدام المتجهات". وقائع ورشة العمل الدولية حول إدارة التخزين والاسترجاع الذكي للوسائط المتعددة . CiteSeerX 10.1.1.31.1704 .
- التعليقات التوضيحية كترجمة آلية
- ب. دويغولو؛ ك. بارنارد؛ ن. دي فريتياس؛ د. فورسيث (2002). "التعرف على الأشياء كترجمة آلية: تعلم معجم لمفردات صور ثابتة" . وقائع المؤتمر الأوروبي حول رؤية الحاسوب . الصفحات 97-112 . مؤرشف من الأصل بتاريخ 5 مارس 2005.
- النماذج الإحصائية
- جيه لي وجيه زد وانغ (2006). "التعليق المحوسب الفوري على الصور" . وقائع مؤتمر ACM للوسائط المتعددة . الصفحات 911-920 .
- جيه زد وانغ وجيه لي (2002). "الفهرسة اللغوية للصور باستخدام نماذج ماركوف المخفية ثنائية الأبعاد القائمة على التعلم" . وقائع مؤتمر ACM للوسائط المتعددة . الصفحات 436-445 .
- الفهرسة اللغوية التلقائية للصور
- جيه لي وجيه زد وانغ (2008). "التعليق المحوسب في الوقت الحقيقي على الصور" . معاملات IEEE في تحليل الأنماط والذكاء الآلي .
- جيه لي وجيه زد وانغ (2003). "الفهرسة اللغوية التلقائية للصور باستخدام نهج النمذجة الإحصائية" . معاملات IEEE في تحليل الأنماط والذكاء الآلي . ص 1075-1088 .
- نموذج التجميع الهرمي للجوانب
- ك. بارنارد؛ د. أ. فورسيث (2001). "تعلم دلالات الكلمات والصور" . وقائع المؤتمر الدولي حول رؤية الحاسوب . الصفحات 408-415 . مؤرشف من الأصل بتاريخ 28-09-2007.
- نموذج تخصيص ديريشلي الكامن
- د. بلي؛ أ. نغ؛ م. جوردان (2003). "تخصيص ديريشلي الكامن" (ملف PDF) . مجلة أبحاث تعلم الآلة . ص 3: 993-1022. مؤرشف من الأصل (ملف PDF) في 16 مارس 2005.
- جي كارنيرو؛ إيه بي تشان؛ بي مورينو؛ إن فاسكونسيلوس (2006). "التعلم الخاضع للإشراف للفئات الدلالية لشرح الصور واسترجاعها" (ملف PDF) . معاملات IEEE في تحليل الأنماط والذكاء الآلي . الصفحات 394-410 .
- تشابه الملمس
- آر دبليو بيكارد وتي بي مينكا (1995). "نسيج الرؤية للتعليق" . أنظمة الوسائط المتعددة .
- آلات المتجهات الداعمة
- سي كوزانو؛ جي سيوكا و آر سكيتيني (2004). سانتيني، سيمون وسكيتيني، ريموندو (محررون). "تعليق توضيحي للصورة باستخدام SVM". التصوير عبر الإنترنت V . 5304 : 330– 338. بيب كود : 2003SPIE.5304..330C . دوى : 10.1117/12.526746 . S2CID 16246057 .
- مجموعة من أشجار القرار والنوافذ الفرعية العشوائية
- R Maree؛ P Geurts؛ J Piater و L Wehenkel (2005). "النوافذ الفرعية العشوائية لتصنيف الصور القوي" . وقائع المؤتمر الدولي لهندسة الكهرباء والإلكترونيات حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 1:34-30.
- أقصى إنتروبيا
- جي جيون؛ آر مانماثا (2004). "استخدام أقصى إنتروبيا للتعليق التلقائي على الصور" (ملف PDF) . المؤتمر الدولي لاسترجاع الصور والفيديو (CIVR 2004) . الصفحات 24-32 .
- نماذج الملاءمة
- جي جيون؛ في لافرينكو و ر مانماثا (2003). "التعليق التلقائي على الصور واسترجاعها باستخدام نماذج الصلة عبر الوسائط المتعددة" (ملف PDF) . وقائع مؤتمر ACM SIGIR حول البحث والتطوير في استرجاع المعلومات . الصفحات 119-126 .
- نماذج الصلة باستخدام دوال كثافة الاحتمال المستمرة
- في لافرينكو؛ آر مانماثا وجيه جيون (2003). "نموذج لتعلم دلالات الصور" (ملف PDF) . وقائع المؤتمر السادس عشر حول التطورات في أنظمة معالجة المعلومات العصبية NIPS .
- نموذج اللغة المتماسك
- آر جين؛ جي واي تشاي؛ إل سي (2004). "التعليق التلقائي الفعال على الصور من خلال نموذج لغوي متماسك والتعلم النشط" (ملف PDF) . وقائع مؤتمر MM'04 .
- شبكات الاستدلال
- د. ميتزلر و ر. مانماثا (2004). "نهج شبكة الاستدلال لاسترجاع الصور" (ملف PDF) . وقائع المؤتمر الدولي لاسترجاع الصور والفيديو . الصفحات 42-50 .
- توزيع برنولي المتعدد
- إس فينغ؛ آر مانماثا و في لافرينكو (2004). "نماذج برنولي المتعددة للارتباط بتصنيف الصور والفيديوهات" (ملف PDF) . مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 1002-1009 .
- بدائل تصميم متعددة
- بان، جيه واي؛ يانغ، إتش جيه؛ دويغولو، بي؛ فالوتسوس، سي (2004). "التعليق التلقائي على الصور" (ملف PDF) . وقائع المؤتمر الدولي للوسائط المتعددة والمعرض لعام 2004 (ICME'04) . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 9 ديسمبر 2004.
- شرح الصور
- كوان هوانغ لام؛ كوانغ دوي لي؛ كيت فان نغوين؛ نغان لو-ثوي نغوين (2020). "UIT-ViIC: مجموعة بيانات للتقييم الأول لوصف الصور باللغة الفيتنامية" . وقائع المؤتمر الدولي للذكاء الجماعي الحاسوبي لعام 2020 (ICCCI 2020) . arXiv : 2002.00175 . doi : 10.1007/978-3-030-63007-2_57 .
- شرح المشهد الطبيعي
- جيه فان؛ واي غاو؛ إتش لو؛ جي شو (2004). "التعليق التلقائي على الصور باستخدام الكائنات البارزة الحساسة للمفاهيم لتمثيل محتوى الصورة" . وقائع المؤتمر الدولي السنوي السابع والعشرين حول البحث والتطوير في استرجاع المعلومات . الصفحات 361-368 .
- المرشحات العالمية ذات الصلة منخفضة المستوى
- أ. أوليفا وأ. تورالبا (2001). "نمذجة شكل المشهد: تمثيل شامل للغلاف المكاني" (ملف PDF) . المجلة الدولية لرؤية الحاسوب . ص 42: 145-175.
- ميزات الصورة العالمية وتقدير الكثافة غير البارامتري
- أ. يافلينسكي، إ. سكوفيلد، وس. روجر (2005). "التعليق الآلي على الصور باستخدام الميزات العامة وتقدير الكثافة غير البارامتري القوي" (ملف PDF) . المؤتمر الدولي لاسترجاع الصور والفيديو (CIVR، سنغافورة، يوليو 2005) . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 20 ديسمبر 2005.
- دلالات الفيديو
- ن. فاسكونسيلوس وأ. ليبمان (2001). "النماذج الإحصائية لبنية الفيديو لتحليل المحتوى وتوصيفه" (ملف PDF) . معاملات IEEE في معالجة الصور . الصفحات 1-17 .
- إيلاريا بارتوليني؛ ماركو باتيلا وكورادو روماني (2010). "شياتسو: وسم تلقائي هرمي قائم على الدلالات للفيديوهات عن طريق التجزئة باستخدام القطع" . ورشة العمل الدولية الثالثة للوسائط المتعددة التابعة لجمعية الحوسبة الآلية حول استخراج المعلومات الآلي في إنتاج الوسائط (AIEMPro10) .
- تحسين التعليقات التوضيحية للصور
- يوهان جين؛ لطيفور خان ؛ لي وانغ؛ ومأمون عوض (2005). "شرح الصور من خلال دمج أدلة متعددة وWordNet" . المؤتمر الدولي السنوي الثالث عشر لجمعية ACM حول الوسائط المتعددة (MM 05) . الصفحات 706-715 .
- تشانغهو وانغ؛ فينغ جينغ؛ لي تشانغ وهونغ جيانغ تشانغ (2006). "تحسين ترميز الصور باستخدام المشي العشوائي مع إعادة التشغيل" . المؤتمر الدولي السنوي الرابع عشر لجمعية ACM حول الوسائط المتعددة (MM 06) .
- تشانغهو وانغ؛ فينغ جينغ؛ لي تشانغ؛ وهونغ جيانغ تشانغ (2007). "تحسين تصنيف الصور بناءً على المحتوى". مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط (CVPR 07) . doi : 10.1109/CVPR.2007.383221 .
- إيلاريا بارتوليني وباولو سياشيا (2007). "الخيال: استغلال تحليل الروابط لتصنيف الصور بدقة". سبرينغر، استرجاع الوسائط المتعددة التكيفي . doi : 10.1007/978-3-540-79860-6_3 .
- إيلاريا بارتوليني وباولو سياشيا (2010). "التعليق على الصور والبحث عنها باستخدام الكلمات المفتاحية متعددة الأبعاد" . ورشة العمل الدولية الثانية لجمعية الحوسبة الآلية حول البحث بالكلمات المفتاحية في البيانات المهيكلة (KEYS 2010) .
- التعليق التلقائي على الصور بواسطة مجموعة من الواصفات المرئية
- إمري أكباش وفاتوس ي. فورال (2007). "التعليق التلقائي على الصور باستخدام مجموعة من الواصفات المرئية". المؤتمر الدولي لرؤية الحاسوب (CVPR) 2007، ورشة عمل حول تطبيقات التعلم الدلالي في الوسائط المتعددة . doi : 10.1109/CVPR.2007.383484 . hdl : 11511/16027 .
- أساس جديد لشرح الصور
- أميش ماكاديا وفلاديمير بافلوفيتش وسانجيف كومار (2008). "خط أساس جديد لشرح الصور" (ملف PDF) . المؤتمر الأوروبي لرؤية الحاسوب (ECCV) .
التصنيف والتعليق المتزامن للصور
- تشونغ وانغ وديفيد بلي ولي فاي فاي (2009). "التصنيف والتعليق المتزامن للصور" (ملف PDF) . مؤتمر رؤية الحاسوب والتعرف على الأنماط (CVPR) .
- TagProp: تعلم المقاييس التمييزية في نماذج الجوار الأقرب للتعليق التلقائي على الصور
- ماثيو غيومين وتوماس مينسينك وجاكوب فيربيك وكورديليا شميد (2009). "TagProp: تعلم المقاييس التمييزية في نماذج الجوار الأقرب للتعليق التلقائي على الصور" (ملف PDF) . المؤتمر الدولي لرؤية الحاسوب (ICCV) .
- شرح الصور باستخدام التعلم المتري في الجوار الدلالي
- ياشاسوي فيرما وسي في جواهر (2012). "شرح الصور باستخدام تعلم المقاييس في الجوار الدلالي" (ملف PDF) . المؤتمر الأوروبي لرؤية الحاسوب (ECCV) . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 14 مايو 2013. تاريخ الاسترجاع: 26 فبراير 2014 .
- التعليق التلقائي على الصور باستخدام تمثيلات التعلم العميق
- فينكاتيش ن. مورثي وسوبهرانسو ماجي و ر. مانماثا (2015). "التعليق التلقائي على الصور باستخدام تمثيلات التعلم العميق" (ملف PDF) . المؤتمر الدولي للوسائط المتعددة (ICMR) .
- شرح شامل للصور باستخدام المناطق البارزة ومعلومات صورة الخلفية
- سارين، سوبياكمونغكول؛ فارماير، مايكل؛ فاغنر، ماتياس وكامياما، واتارو (2012). الاستفادة من خصائص الخلفية والمناطق البارزة للتعليق التلقائي على الصور . مجلة معالجة المعلومات. المجلد 20. الصفحات 250-266 .
- شرح الصور الطبية باستخدام الشبكات البايزية والتعلم النشط
- NB Marvasti & E. Yörük and B. Acar (2018). "التعليق على الصور الطبية بمساعدة الحاسوب: نتائج أولية مع آفات الكبد في التصوير المقطعي المحوسب" . مجلة IEEE للمعلوماتية الطبية الحيوية والصحية .
- تطبيقات الذكاء الاصطناعي
- تطبيقات رؤية الحاسوب
- معالجة اللغة الطبيعية
