معهد كاليفورنيا للتكنولوجيا 101

Caltech 101 هي مجموعة بيانات من الصور الرقمية ، أُنشئت في سبتمبر 2003، وجمعها كلٌ من فاي-فاي لي ، وماركو أندريتو، ومارك أوريليو رانزاتو، وبيترو بيرونا في معهد كاليفورنيا للتكنولوجيا . تهدف هذه المجموعة إلى تسهيل أبحاث وتقنيات رؤية الحاسوب ، وهي الأنسب للتقنيات التي تتضمن التعرف على الصور وتصنيفها. تحتوي Caltech 101 على 9146 صورة، موزعة على 101 فئة مختلفة من الكائنات ( الوجوه ، الساعات ، النمل ، البيانو ، إلخ) وفئة للخلفية. يُرفق بالصور مجموعة من الشروحات التي تصف حدود كل صورة، بالإضافة إلى برنامج نصي مكتوب بلغة Matlab لعرضها.

غاية

تعتمد معظم خوارزميات رؤية الحاسوب والتعلم الآلي على التدريب باستخدام مدخلات نموذجية. وهي تتطلب مجموعة كبيرة ومتنوعة من بيانات التدريب لكي تعمل بكفاءة. على سبيل المثال، تم تدريب طريقة الكشف عن الوجوه في الوقت الفعلي التي استخدمها بول فيولا ومايكل جيه جونز على 4916 وجهًا مصنفة يدويًا. [ 1 ]

إن قص الصور وتغيير حجمها ووضع علامات يدوية على نقاط الاهتمام أمر شاق ويستغرق وقتاً طويلاً.

تاريخيًا، كانت معظم مجموعات البيانات المستخدمة في أبحاث رؤية الحاسوب تُصمم خصيصًا لتلبية الاحتياجات المحددة للمشروع قيد العمل. وتكمن إحدى المشكلات الكبيرة في مقارنة تقنيات رؤية الحاسوب في أن معظم المجموعات البحثية تستخدم مجموعات بياناتها الخاصة. قد تحتوي كل مجموعة على خصائص مختلفة تجعل من الصعب مقارنة النتائج المُبلغ عنها من طرق مختلفة بشكل مباشر. على سبيل المثال، يمكن أن تؤدي الاختلافات في حجم الصورة وجودتها والموقع النسبي للأجسام داخلها ومستوى الحجب والتشويش إلى نتائج متباينة. [ 2 ]

تهدف مجموعة بيانات Caltech 101 إلى التخفيف من العديد من هذه المشاكل الشائعة.

  • يتم اقتصاص الصور وتغيير حجمها.
  • يتم تمثيل العديد من الفئات، مما يناسب خوارزميات التعرف على الفئات الفردية والمتعددة.
  • تم تحديد الخطوط الخارجية التفصيلية للأجسام.
  • يُعد برنامج Caltech 101، المتاح للاستخدام العام، بمثابة معيار مشترك لمقارنة الخوارزميات المختلفة دون تحيز بسبب مجموعات البيانات المختلفة.

ومع ذلك، أظهرت دراسة لاحقة أن الاختبارات القائمة على صور طبيعية غير مضبوطة (مثل مجموعة بيانات Caltech 101) يمكن أن تكون مضللة بشكل خطير، مما قد يوجه التقدم في الاتجاه الخاطئ. [ 3 ]

مجموعة البيانات

صور

تتكون مجموعة بيانات Caltech 101 من إجمالي 9146 صورة، موزعة على 101 فئة مختلفة من الكائنات، بالإضافة إلى فئة إضافية للخلفية/الفوضى.

تحتوي كل فئة من فئات العناصر على ما بين 40 و800 صورة. وتميل الفئات الشائعة والمتداولة، مثل الوجوه، إلى احتواء عدد أكبر من الصور مقارنةً بغيرها.

يبلغ حجم كل صورة حوالي 300 × 200 بكسل. تم عكس صور الأجسام الموجهة مثل الطائرات والدراجات النارية لتكون محاذية من اليسار إلى اليمين، وتم تدوير الهياكل الموجهة عموديًا مثل المباني لتكون خارج المحور.

التعليقات التوضيحية

يتم توفير مجموعة من التعليقات التوضيحية لكل صورة. تحتوي كل مجموعة من التعليقات التوضيحية على معلومتين: المربع المحيط العام الذي يقع فيه الكائن، ومخطط تفصيلي يحدده الإنسان يحيط بالكائن.

يتم توفير برنامج نصي بلغة Matlab مع التعليقات التوضيحية. يقوم البرنامج بتحميل صورة وملف التعليقات التوضيحية الخاص بها وعرضهما كشكل في برنامج Matlab.

الاستخدامات

استُخدمت مجموعة بيانات Caltech 101 لتدريب واختبار العديد من خوارزميات التعرف والتصنيف في مجال رؤية الحاسوب. وكانت أول ورقة بحثية تستخدم Caltech 101 عبارة عن منهج بايزي تزايدي للتعلم بمثال واحد، [ 4 ] في محاولة لتصنيف كائن ما باستخدام عدد قليل من الأمثلة فقط، بالاعتماد على المعرفة المسبقة بالفئات الأخرى.

استُخدمت صور Caltech 101، بالإضافة إلى التعليقات التوضيحية، في ورقة بحثية أخرى للتعلم لمرة واحدة في Caltech. [ 5 ]

تتضمن أوراق بحثية أخرى في مجال رؤية الحاسوب والتي تشير إلى استخدام مجموعة بيانات Caltech 101 ما يلي:

  • مطابقة الأشكال والتعرف على الأشياء باستخدام تطابق التشوه المنخفض. ألكسندر سي. بيرغ، تامارا إل. بيرغ، جيتندرا مالك . مؤتمر رؤية الحاسوب والتعرف على الأنماط 2005
  • نواة مطابقة الهرم: التصنيف التمييزي باستخدام مجموعات من ميزات الصورة. ك. جراومان وت. داريل. المؤتمر الدولي لرؤية الحاسوب (ICCV)، 2005 [ 6 ]
  • دمج النماذج التوليدية ونوى فيشر للتعرف على فئات الكائنات. هولوب، أ.د. ويلينغ، م. بيرونا، ب. المؤتمر الدولي للرؤية الحاسوبية (ICCV)، 2005 [ 7 ]
  • التعرف على الأشياء باستخدام ميزات مستوحاة من القشرة البصرية . تي. سير، إل. وولف، وتي. بوجيو. وقائع مؤتمر جمعية مهندسي الكهرباء والإلكترونيات لعام 2005 حول رؤية الحاسوب والتعرف على الأنماط (CVPR 2005)، مطبعة جمعية مهندسي الكهرباء والإلكترونيات، سان دييغو، يونيو 2005 [ 8 ]
  • SVM-KNN: تصنيف الجوار الأقرب التمييزي للتعرف على الفئات المرئية. هاو تشانغ، أليكس بيرغ، مايكل ماير، جيتندرا مالك . مؤتمر رؤية الحاسوب وأنماط التعرف، 2006 [ 9 ]
  • ما وراء حقائب الميزات: مطابقة الهرم المكاني للتعرف على فئات المشاهد الطبيعية. سفيتلانا لازيبنيك ، وكورديليا شميد ، وجين بونس. مؤتمر رؤية الحاسوب وأنماط التعرف، 2006 [ 10 ]
  • دراسة تجريبية لبنوك المرشحات متعددة المقاييس لتصنيف الكائنات. إم جيه مار-جيمس، وإن. بيونيز دي لا بلانكا. ديسمبر 2005 [ 11 ]
  • التعرف على الكائنات متعددة الفئات باستخدام ميزات متفرقة ومحلية. جيم موتش وديفيد جي. لوي، الصفحات  11-18، مؤتمر رؤية الحاسوب والتعرف على الأنماط 2006، مطبعة جمعية مهندسي الكهرباء والإلكترونيات، نيويورك، يونيو 2006 [ 12 ]
  • استخدام المناطق التابعة أو تصنيف الكائنات في إطار توليدي. جي. وانغ، واي. تشانغ، وإل. فاي-فاي. مؤتمر IEEE للرؤية الحاسوبية والتعرف على الأنماط 2006 [ 13 ]

التحليل والمقارنة

المزايا

يتميز Caltech 101 بعدة مزايا مقارنة بمجموعات البيانات المماثلة الأخرى:

  • حجم وعرض موحدان:
    • تتميز معظم الصور ضمن كل فئة بتجانس حجمها وموقع العناصر المهمة فيها. ولا يحتاج مستخدمو برنامج Caltech 101 عادةً إلى قص الصور أو تغيير حجمها قبل استخدامها.
  • مستوى منخفض من التشويش/الحجب:
    • تعتمد الخوارزميات المعنية بالتعرف عادةً على تخزين خصائص فريدة للكائن. ومع ذلك، تحتوي معظم الصور الملتقطة على درجات متفاوتة من التشويش في الخلفية، مما يعني أن الخوارزميات قد تُبنى بشكل غير صحيح.
  • شروح تفصيلية

نقاط الضعف

قد تكون نقاط ضعف مجموعة بيانات Caltech 101 [ 3 ] [ 14 ] مقايضات مقصودة، بينما تمثل نقاط ضعف أخرى قيودًا على مجموعة البيانات نفسها. وكثيرًا ما تُرفض الأبحاث التي تعتمد كليًا على Caltech 101.

تشمل نقاط الضعف ما يلي:

  • مجموعة البيانات نظيفة للغاية:
    • تتميز الصور بتجانسها الشديد في العرض، حيث تُحاذى من اليسار إلى اليمين، وعادةً ما تكون غير محجوبة. ونتيجةً لذلك، لا تُمثل الصور دائمًا المدخلات العملية التي قد يتوقعها البرنامج لاحقًا. في الظروف العملية، تكون الصور أكثر ازدحامًا وحجبًا، وتُظهر تباينًا أكبر في الموضع النسبي واتجاه العناصر المهمة. يسمح هذا التجانس باستخلاص المفاهيم باستخدام متوسط ​​فئة معينة، وهو أمر غير واقعي.
  • عدد محدود من الفئات:
    • تمثل مجموعة بيانات Caltech 101 جزءًا صغيرًا فقط من فئات الأشياء الممكنة.
  • تحتوي بعض الفئات على عدد قليل من الصور:
    • بعض الفئات لا يتم تمثيلها بشكل جيد مثل غيرها، حيث تحتوي على 31 صورة فقط.
    • هذا يعني أنشمالترأأنان30{\displaystyle \mathrm {N} _{\mathrm {قطار} }\leq 30}يجب أن يكون عدد الصور المستخدمة للتدريب أقل من أو يساوي 30، وهو أمر غير كافٍ لجميع الأغراض.
  • التشويه والتشوهات الناتجة عن المعالجة:

مجموعات بيانات أخرى

  • Caltech 256 هي مجموعة بيانات صور أخرى، أُنشئت عام 2007. وهي امتداد لمجموعة Caltech 101، وتهدف إلى معالجة بعض نقاط ضعفها. عمومًا، تُعدّ Caltech 256 مجموعة بيانات أكثر صعوبة من Caltech 101، لكنها تعاني من مشاكل مماثلة. تتضمن [ 3 ]
    • 30607 صورة، تغطي عددًا أكبر من الفئات
    • تم رفع الحد الأدنى لعدد الصور لكل فئة إلى 80
    • الصور غير محاذية لليسار واليمين
    • تنوع أكبر في عرض الصور
  • LabelMe عبارة عن مجموعة بيانات مفتوحة وديناميكية تم إنشاؤها في مختبر علوم الحاسوب والذكاء الاصطناعي التابع لمعهد ماساتشوستس للتكنولوجيا (CSAIL). تتبنى LabelMe نهجًا مختلفًا في معالجة مشكلة إنشاء مجموعة بيانات صور كبيرة، مع وجود مفاضلات مختلفة.
    • 106,739 صورة، 41,724 صورة مشروحة، و203,363 كائنًا مصنفًا.
    • يمكن للمستخدمين إضافة صور إلى مجموعة البيانات عن طريق التحميل، وإضافة تسميات أو تعليقات توضيحية إلى الصور الموجودة.
    • بسبب طبيعتها المفتوحة، تحتوي LabelMe على صور أكثر بكثير تغطي نطاقًا أوسع بكثير من Caltech 101. ومع ذلك، نظرًا لأن كل شخص يقرر الصور التي سيتم تحميلها، وكيفية تسمية كل صورة وشرحها، فإن الصور أقل اتساقًا.
  • مشروع VOC 2008 هو جهد أوروبي لجمع الصور لتقييم أساليب التصنيف المرئي. بالمقارنة مع مشروع Caltech 101/256، تم جمع عدد أقل من الفئات (حوالي 20 فئة). ومع ذلك، فإن عدد الصور في كل فئة أكبر.
  • مجموعة بيانات أبحاث الصور الجوية (OIRDS) هي مكتبة مُعَلَّمة للصور والأدوات. [ 15 ] تتألف OIRDS الإصدار 1.0 من صور جوية لمركبات ركاب مُعَلَّمة. تشمل مركبات الركاب في OIRDS السيارات والشاحنات والحافلات الصغيرة، وغيرها. بالإضافة إلى حدود المركبات، تتضمن OIRDS إحصاءات موضوعية وذاتية تُقَيِّم المركبة ضمن سياق الصورة. على سبيل المثال، تتضمن مقاييس موضوعية لتشويش الصورة ووضوحها وضوضاءها ولون المركبة، إلى جانب إحصاءات موضوعية أخرى مثل دقة الصورة الأرضية (GSD) ووقت اليوم ويوم السنة.
    • حوالي 900 صورة، تحتوي على حوالي 1800 صورة مشروحة
    • حوالي 30 تعليقًا توضيحيًا لكل كائن
    • حوالي 60 مقياسًا إحصائيًا لكل عنصر
    • تباين واسع في سياق الكائن
    • يقتصر على مركبات الركاب في الصور الجوية
  • مجموعة بيانات الصور MICC-Flickr 101 هي مجموعة بيانات صور أُنشئت في مركز تكامل الوسائط والاتصالات (MICC) بجامعة فلورنسا عام 2012. وهي مبنية على مجموعة بيانات Caltech 101، وجُمعت من موقع Flickr . تُعالج MICC-Flickr 101 [ 16 ] العيب الرئيسي في Caltech 101، وهو انخفاض التباين بين الفئات، وتُوفر تعليقات اجتماعية من خلال وسوم المستخدمين. تعتمد هذه المجموعة على مجموعة بيانات قياسية وشائعة الاستخدام تتكون من عدد معقول من الفئات (101)، وبالتالي يُمكن استخدامها لمقارنة أداء تصنيف الكائنات في سيناريو مُقيد (Caltech 101) وتصنيف الكائنات "في بيئات واقعية" (MICC-Flickr 101) على نفس الفئات الـ 101.

انظر أيضاً

مراجع

  1. فيولا، بول؛ جونز، مايكل ج. (2004). "الكشف القوي عن الوجوه في الوقت الحقيقي". المجلة الدولية لرؤية الحاسوب . 57 (2): 137-154 . doi : 10.1023/B:VISI.0000013087.49260.fb . S2CID 2796017 . 
  2. أورتل، كارستن؛ كولدر، برايان؛ كولومب، جيفري؛ هاي، جوليا؛ إنجرام، مايكل؛ سالي، فيل (2008). "التحديات الحالية في أتمتة الإدراك البصري". ورشة عمل IEEE السابعة والثلاثون للتعرف على أنماط الصور التطبيقية، 2008. الصفحات 1-8 . doi : 10.1109/AIPR.2008.4906457 . ISBN  978-1-4244-3125-0. S2CID 36669995 . 
  3. بينتو ، نيكولاس ؛ كوكس، ديفيد د.؛ ديكارلو، جيمس ج. (2008). "لماذا يُعدّ التعرّف على الأشياء المرئية في العالم الحقيقي صعبًا؟" . مجلة PLOS لعلم الأحياء الحاسوبي . 4 (1): e27. Bibcode : 2008PLSCB...4...27P . doi : 10.1371/journal.pcbi.0040027 . PMC 2211529. PMID 18225950 .  
  4. ل. فاي-فاي، ر. فيرغوس، وب. بيرونا. تعلم نماذج بصرية توليدية من أمثلة تدريبية قليلة: منهج بايزي تزايدي تم اختباره على 101 فئة من الكائنات. IEEE. CVPR 2004، ورشة عمل حول الرؤية القائمة على النموذج التوليدي. 2004
  5. ل. فاي-فاي؛ ر. فيرغوس؛ ب. بيرونا (أبريل 2006). "التعلم بلقطة واحدة لفئات الكائنات" ( ملف PDF) . معاملات IEEE في تحليل الأنماط والذكاء الآلي . 28 (4): 594-611 . doi : 10.1109/TPAMI.2006.79 . PMID 16566508. S2CID 6953475. مؤرشف من الأصل (ملف PDF) بتاريخ 9 يونيو 2007. تم الاطلاع عليه بتاريخ 16 يناير 2008 .  
  6. نواة مطابقة الهرم: التصنيف التمييزي باستخدام مجموعات من ميزات الصورة. ك. غراومان وت. داريل. المؤتمر الدولي لرؤية الحاسوب (ICCV)، 2005
  7. هولوب، أ.د.؛ ويلينغ، م.؛ بيرونا، ب. دمج النماذج التوليدية ونوى فيشر للتعرف على فئات الكائنات . المؤتمر الدولي لرؤية الحاسوب (ICCV)، 2005. مؤرشف من الأصل في 14 أغسطس 2007. تم الاطلاع عليه في 16 يناير 2008 .
  8. التعرف على الأشياء باستخدام ميزات مستوحاة من القشرة البصرية. تي. سير، إل. وولف، وتي. بوجيو. وقائع مؤتمر جمعية مهندسي الكهرباء والإلكترونيات لعام 2005 حول رؤية الحاسوب والتعرف على الأنماط (CVPR 2005)، مطبعة جمعية مهندسي الكهرباء والإلكترونيات، سان دييغو، يونيو 2005
  9. SVM-KNN: تصنيف الجوار الأقرب التمييزي للتعرف على الفئات المرئية. هاو تشانغ، أليكس بيرغ، مايكل ماير، جيتندرا مالك. مؤتمر رؤية الحاسوب وأنماط التعرف، 2006
  10. ما وراء ميزات الحقائب: مطابقة الهرم المكاني للتعرف على فئات المشاهد الطبيعية . سفيتلانا لازيبنيك ، وكورديليا شميد ، وجان بونس. مؤتمر رؤية الحاسوب وأنماط التعرف، 2006
  11. دراسة تجريبية لبنوك المرشحات متعددة المقاييس لتصنيف الأشياء، إم جيه مار-جيمس، وإن. بي-إيز دي لا بلانكا. ديسمبر 2005
  12. التعرف على الكائنات متعددة الفئات باستخدام ميزات متفرقة ومحلية، جيم موتش وديفيد جي. لوي، الصفحات 11-18، مؤتمر رؤية الحاسوب والتعرف على الأنماط 2006، مطبعة جمعية مهندسي الكهرباء والإلكترونيات، نيويورك، يونيو 2006
  13. جي. وانغ؛ واي. تشانغ؛ إل. فاي-فاي (2006). "استخدام المناطق التابعة أو تصنيف الكائنات في إطار توليدي" (ملف PDF) . مجلة IEEE للرؤية الحاسوبية والتعرف على الأنماط . مؤرشف من الأصل (ملف PDF) بتاريخ 9 يونيو 2007. تم الاطلاع عليه بتاريخ 16 يناير 2008 .
  14. ج. بونس؛ ت. ل. بيرغ؛ م. إيفرهام؛ د . أ. فورسيث ؛ م. هيبرت؛ س. لازيبنيك؛ م. مارساليك؛ س. شميد؛ ب. س. راسل؛ أ. تورالبا؛ س. ك. إ. ويليامز؛ ج. زانغ؛ أ. زيسرمان (2006). ج. بونس؛ م. هيبرت؛ س. شميد؛ أ. زيسرمان (محررون). "مشكلات مجموعات البيانات في التعرف على الكائنات" (ملف PDF) . نحو التعرف على الكائنات على مستوى الفئة، سلسلة محاضرات سبرينغر-فيرلاغ في علوم الحاسوب. مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 24-12-2016 . تم الاطلاع عليه بتاريخ 08-02-2008 .
  15. ف. تانر، ب. كولدر، س. بولين، د. هيجي، س. أورتل، و ب. سالي، مجموعة بيانات أبحاث الصور الجوية (OIRDS) - مكتبة بيانات مشروحة وأدوات للمساعدة في تطوير خوارزميات رؤية الحاسوب ، يونيو 2009، < https://sourceforge.net/apps/mediawiki/oirds/index.php?title=Documentation مؤرشف في 2012-11-09 على Wayback Machine > (28 ديسمبر 2009)
  16. "L. Ballan, M. Bertini, A. Del Bimbo, AM Serain, G. Serra, BF Zaccone. دمج النماذج التوليدية والتمييزية لتصنيف الصور الاجتماعية من 101 فئة من الكائنات. المؤتمر الدولي للتعرف على الأنماط (ICPR)، 2012" (ملف PDF) . مؤرشف من النسخة الأصلية (PDF) بتاريخ 26 أغسطس 2014. تم الاطلاع عليه بتاريخ 11 يوليو 2012 .