إنسبشن (بنية التعلم العميق)

إنسبشن [ 1 ] هي عائلة من الشبكات العصبية الالتفافية (CNN) المستخدمة في مجال رؤية الحاسوب ، وقد قدمها باحثون في جوجل عام 2014 تحت اسم جوجل نت (ثم أعيد تسميتها لاحقًا إلى إنسبشن الإصدار الأول). وقد اكتسبت هذه السلسلة أهمية تاريخية لكونها من أوائل الشبكات العصبية الالتفافية التي تفصل بين الجذع (استقبال البيانات)، والجسم (معالجة البيانات)، والرأس (التنبؤ)، وهو تصميم معماري لا يزال قائمًا في جميع الشبكات العصبية الالتفافية الحديثة. [ 2 ]

نموذج Inception-v3

سجل الإصدارات

بداية الإصدار الأول

بنية جوجل نت

في عام 2014، قام فريق في جوجل بتطوير بنية GoogLeNet، والتي فازت إحدى نماذجها بتحدي ImageNet للتعرف البصري واسع النطاق لعام 2014 (ILSVRC14). [ 1 ] [ 3 ]

استُمدّ الاسم من شبكة LeNet التي طُرحت عام 1998، إذ أن كلاً من LeNet وGoogLeNet عبارة عن شبكات عصبية تلافيفية (CNNs). كما أُطلق عليها اسم "Inception" نسبةً إلى عبارة "علينا أن نتعمق أكثر" الشائعة على الإنترنت، وهي عبارة من فيلم Inception (2010) . [ 1 ] ونظرًا لإصدار نسخ لاحقة، أُعيد تسمية بنية Inception الأصلية إلى "Inception v1".

تم نشر النماذج والبرمجيات بموجب ترخيص Apache 2.0 على GitHub. [ 4 ]

وحدة Inception فردية. على اليسار وحدة قياسية، وعلى اليمين وحدة ذات أبعاد مخفضة.
وحدة واحدة مُصغّرة الأبعاد من Inception

تُعدّ بنية Inception v1 شبكة عصبية تلافيفية عميقة تتألف من 22 طبقة. معظم هذه الطبقات كانت "وحدات Inception". وقد ذكرت الورقة البحثية الأصلية أن وحدات Inception هي "النتيجة المنطقية" لنموذج الشبكة داخل الشبكة [ 5 ] و(Arora et al, 2014). [ 6 ]

نظراً لأن نموذج Inception v1 عميق، فقد عانى من مشكلة تلاشي التدرج . وقد حل الفريق هذه المشكلة باستخدام مصنفين مساعدين، وهما مصنفان من نوع linear-softmax تم إدخالهما على عمق 1/3 و2/3 داخل الشبكة، ودالة الخسارة هي مجموع مرجح للمصنفات الثلاثة جميعها:ل=0.3لأux،1+0.3لأux،2+لرهـأل{\displaystyle L=0.3L_{aux,1}+0.3L_{aux,2}+L_{real}}

تمت إزالة هذه العناصر بعد اكتمال التدريب. وقد تم حل هذه المشكلة لاحقًا باستخدام بنية ResNet .

يتكون التصميم المعماري من ثلاثة أجزاء مكدسة فوق بعضها البعض: [ 2 ]

  • الجذع (استيعاب البيانات): تقوم الطبقات الالتفافية القليلة الأولى بمعالجة البيانات مسبقًا لتقليل حجم الصور إلى حجم أصغر.
  • الجزء الرئيسي (معالجة البيانات): تقوم وحدات Inception العديدة التالية بتنفيذ الجزء الأكبر من معالجة البيانات.
  • الرأس (التنبؤ): الطبقة النهائية المتصلة بالكامل ودالة softmax تنتج توزيعًا احتماليًا لتصنيف الصور.

يُستخدم هذا الهيكل في معظم بنى الشبكات العصبية التلافيفية الحديثة.

بداية الإصدار الثاني

تم إصدار Inception v2 في عام 2015، في ورقة بحثية اشتهرت باقتراحها لتطبيع الدُفعات . [ 7 ] [ 8 ] كان يحتوي على 13.6 مليون مُعامل.

إنه يحسّن من Inception v1 عن طريق إضافة التسوية الدفعية، وإزالة التسرب والتسوية المحلية للاستجابة التي وجدوا أنها أصبحت غير ضرورية عند استخدام التسوية الدفعية.

بداية الإصدار الثالث

تم إصدار Inception v3 في عام 2016. [ 7 ] [ 9 ] وهو يحسّن Inception v2 باستخدام الالتفافات المفككة.

على سبيل المثال، يمكن تحليل عملية التفاف واحدة بحجم 5×5 إلى عملية التفاف بحجم 3×3 مُكدسة فوق عملية التفاف أخرى بحجم 3×3. لكلتا العمليتين مجال استقبال بحجم 5×5. تحتوي نواة عملية الالتفاف بحجم 5×5 على 25 مُعاملًا، مقارنةً بـ 18 مُعاملًا فقط في النسخة المُحللة. وبالتالي، فإن عملية الالتفاف بحجم 5×5 أقوى بشكل واضح من النسخة المُحللة. مع ذلك، فإن هذه القوة ليست ضرورية بالضرورة. فقد وجد فريق البحث تجريبيًا أن عمليات الالتفاف المُحللة تُساعد.

كما أنها تستخدم شكلاً من أشكال تقليل الأبعاد عن طريق دمج مخرجات طبقة الالتفاف وطبقة التجميع . على سبيل المثال، موتر بحجم35×35×320{\displaystyle 35\times 35\times 320}يمكن تقليص حجمها عن طريق عملية التفاف بخطوة 2 إلى17×17×320{\displaystyle 17\times 17\times 320}وباستخدام تقنية التجميع الأقصى مع حجم المجموعة2×2{\displaystyle 2\times 2}ل17×17×320{\displaystyle 17\times 17\times 320}ثم يتم دمجها لتكوين17×17×640{\displaystyle 17\times 17\times 640}.

إضافة إلى ذلك، فقد أزالت أيضًا المصنف المساعد الأدنى أثناء التدريب. ووجدوا أن الرأس المساعد يعمل كشكل من أشكال التنظيم .

كما اقترحوا استخدام تقنية تنظيم التنعيم بالتصنيف. بالنسبة لصورة ذات تصنيفج{\displaystyle c}بدلاً من إنشاء نموذج للتنبؤ بتوزيع الاحتمالاتدلتاج=(0،0،...،0،1جالمدخل رقم -،0،...،0){\displaystyle \delta _{c}=(0,0,\dots ,0,\underbrace {1} _{c{\text{-th entry}}},0,\dots ,0)}لقد جعلوا النموذج يتنبأ بالتوزيع المُنعم(1-ϵ)دلتاج+ϵ/ك{\displaystyle (1-\epsilon )\delta _{c}+\epsilon /K}أينك{\displaystyle K}هو العدد الإجمالي للفصول الدراسية.

بداية الإصدار الرابع

في عام 2017، أصدر الفريق Inception v4 و Inception ResNet v1 و Inception ResNet v2. [ 10 ]

يُعد Inception v4 تحديثًا تدريجيًا مع المزيد من عمليات الالتفاف المُحللة، ومضاعفات أخرى تم العثور عليها تجريبيًا لتحسين المعايير.

يُعد كل من Inception ResNet v1 و v2 تعديلات على Inception v4، حيث تمت إضافة وصلات متبقية إلى كل وحدة من وحدات Inception، مستوحاة من بنية ResNet . [ 11 ]

استثناء

نُشر نموذج Xception ("الاستبصار المتطرف") في عام 2017. [ 12 ] وهو عبارة عن مجموعة خطية من طبقات الالتفاف القابلة للفصل العميق مع وصلات متبقية. وقد طُرح التصميم بناءً على فرضية أنه في الشبكة العصبية الالتفافية، يمكن فصل الارتباطات بين القنوات والارتباطات المكانية في خرائط الميزات بشكل كامل .

استغرق تدريب كل شبكة 3 أيام على 60 وحدة معالجة رسومية من نوع K80، أو ما يقارب 0.5 بيتافلوب-يوم. [ 13 ]

مراجع

  1. 1 2 3 سيجيدي، كريستيان؛ وي ليو؛ يانغتشينغ جيا؛ سيرمانيت، بيير؛ ريد، سكوت؛ أنجيلوف، دراغومير؛ إرهان، دوميترو؛ فان هوك، فنسنت؛ رابينوفيتش، أندرو (يونيو 2015). "التعمق أكثر في الالتفافات". مؤتمر IEEE لعام 2015 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. الصفحات 1-9 . arXiv : 1409.4842 . doi : 10.1109/CVPR.2015.7298594 . ISBN  978-1-4673-6964-0.
  2. 1 2 تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "8.4. الشبكات متعددة الفروع (GoogLeNet)" . تعمق في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
  3. المستودع الرسمي لـ Inception V1 على Kaggle، منشور بواسطة Google.
  4. "google/inception" . جوجل. 19-08-2024 . تم الاسترجاع في 19-08-2024 .
  5. ^ لين، مين؛ تشن، تشيانغ. يان ، شويتشنغ (2014/03/04). "الشبكة في الشبكة". أرخايف : 1312.4400 [ cs.NE ].
  6. أرورا، سانجيف؛ بهاسكارا، أديتيا؛ جي، رونغ؛ ما، تينغيو (27 يناير 2014). "حدود قابلة للإثبات لتعلم بعض التمثيلات العميقة" . وقائع المؤتمر الدولي الحادي والثلاثين للتعلم الآلي . PMLR: 584-592 . arXiv : 1310.6343 .
  7. 1 2 سيجيدي، كريستيان؛ فان هوك، فينسنت؛ يوف، سيرجي؛ شلينز، جون؛ ووجنا، زبيغنيو (2016). "إعادة التفكير في بنية Inception لرؤية الحاسوب" . مؤتمر IEEE لعام 2016 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 2818-2826 . doi : 10.1109/CVPR.2016.308 . ISBN  978-1-4673-8851-1.
  8. المستودع الرسمي لـ Inception V2 على Kaggle، منشور بواسطة Google.
  9. المستودع الرسمي لـ Inception V3 على Kaggle، والذي نشرته Google.
  10. سيجيدي، كريستيان؛ إيوف، سيرجي؛ فان هوك، فنسنت؛ أليمي، ألكسندر (12 فبراير 2017). "Inception-v4، Inception-ResNet وتأثير الاتصالات المتبقية على التعلم" . وقائع مؤتمر AAAI حول الذكاء الاصطناعي . 31 (1). arXiv : 1602.07261 . doi : 10.1609/aaai.v31i1.11231 . ISSN 2374-3468 . 
  11. ^ هو كايمينغ. تشانغ، شيانغيو. رن، شاوتشينج؛ صن جيان (10 ديسمبر 2015). “التعلم العميق المتبقي للتعرف على الصور”. أرخايف : 1512.03385 [ cs.CV ].
  12. شوليه، فرانسوا (2017). "إكسبشن: التعلم العميق باستخدام الالتفافات القابلة للفصل العميق" . مؤتمر IEEE لعام 2017 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 1251-1258 . doi : 10.1109/CVPR.2017.195 . ISBN  978-1-5386-0457-1.
  13. "الذكاء الاصطناعي والحوسبة" . openai.com . 2022-06-09 . تم الاطلاع عليه بتاريخ 2025-04-28 .