أليكس نت


أليكس نت هي بنية شبكة عصبية التفافية طُوّرت لمهام تصنيف الصور، وقد حققت شهرة واسعة بفضل أدائها المتميز في تحدي التعرف البصري واسع النطاق ImageNet (ILSVRC). تصنف أليكس نت الصور إلى 1000 فئة مختلفة من الكائنات، وتُعتبر أول تطبيق معترف به على نطاق واسع للشبكات العصبية الالتفافية العميقة في مجال التعرف البصري واسع النطاق.
طُوِّر هذا النموذج عام 2012 على يد أليكس كريزيفسكي بالتعاون مع إيليا سوتسكيفر ومشرفه على أطروحة الدكتوراه جيفري هينتون في جامعة تورنتو ، ويحتوي على 60 مليون مُعامل و650 ألف عصبون . [ 1 ] وكانت النتيجة الرئيسية للورقة البحثية الأصلية هي أن عمق النموذج ضروري لأدائه العالي، وهو ما كان مكلفًا حسابيًا، ولكنه أصبح ممكنًا بفضل استخدام وحدات معالجة الرسومات (GPUs) أثناء التدريب. [ 1 ]
شكل الثلاثة فريق SuperVision وقدموا AlexNet في تحدي ImageNet للتعرف البصري واسع النطاق في 30 سبتمبر 2012. [ 2 ] حققت الشبكة معدل خطأ أعلى 5 بنسبة 15.3٪ للفوز بالمسابقة، أي أكثر من 10.8٪ فوق صاحب المركز الثاني.
أثرت هذه البنية على عدد كبير من الأعمال اللاحقة في مجال التعلم العميق ، وخاصة في تطبيق الشبكات العصبية على رؤية الكمبيوتر .
بنيان
تتكون شبكة AlexNet من ثماني طبقات : الخمس الأولى هي طبقات التفافية ، يتبع بعضها طبقات تجميع قصوى ، أما الثلاث الأخيرة فهي طبقات متصلة بالكامل . تم تقسيم الشبكة، باستثناء الطبقة الأخيرة، إلى نسختين، تعمل كل منهما على وحدة معالجة رسومية (GPU) منفصلة، لأن الشبكة لم تكن تتناسب مع ذاكرة الوصول العشوائي للفيديو (VRAM) لوحدة معالجة رسومية واحدة من نوع Nvidia GTX 580 بسعة 3 جيجابايت. [ 1 ] : القسم 3.2. يمكن كتابة البنية الكاملة على النحو التالي:
(CONV → RN → MP) 2 → (CONV 3 → MP) → (FC → DO) 2 → Linear → softmax
أين
- CONV = طبقة التفافية (مع تفعيل ReLU)
- RN = تطبيع الاستجابة المحلية
- MP = التجميع الأقصى
- FC = طبقة متصلة بالكامل (مع تفعيل ReLU)
- خطي = طبقة متصلة بالكامل (بدون تفعيل)
- DO = التسرب
والجدير بالذكر أن الطبقات الالتفافية 3 و4 و5 كانت متصلة ببعضها البعض دون أي تجميع أو تطبيع. وقد استخدمت دالة التنشيط ReLU غير المشبعة ، والتي تفوقت في التدريب على دالتي tanh و sigmoid . [ 1 ]
تمرين
احتوت مجموعة بيانات التدريب ImageNet على 1.2 مليون صورة. تم تدريب النموذج لمدة 90 دورة تدريبية على مدى خمسة إلى ستة أيام باستخدام وحدتي معالجة رسومية Nvidia GTX 580 (سعة كل منهما 3 جيجابايت). [ 1 ] تتمتع هاتان الوحدتان بأداء نظري يبلغ 1.581 تيرافلوب في عدد عشري 32 بت، وكان سعرهما 500 دولار أمريكي عند إصدارهما. [ 3 ] تطلبت كل عملية تمرير أمامي لنموذج AlexNet ما يقارب 1.43 جيجا فلوب. [ 4 ] بناءً على هذه القيم، كان من الممكن نظريًا لوحدتي المعالجة الرسومية معًا إجراء أكثر من 2200 عملية تمرير أمامي في الثانية الواحدة في ظل الظروف المثالية.
تم تخزين صور مجموعة البيانات بصيغة JPEG، وشغلت مساحة 27 جيجابايت على القرص. واستهلكت الشبكة العصبية 2 جيجابايت من ذاكرة الوصول العشوائي (RAM) على كل وحدة معالجة رسومية (GPU)، وحوالي 5 جيجابايت من ذاكرة النظام أثناء التدريب. وكانت وحدات المعالجة الرسومية مسؤولة عن التدريب، بينما كانت وحدات المعالجة المركزية (CPU) مسؤولة عن تحميل الصور من القرص، وتوسيع نطاق البيانات فيها. [ 5 ]
تم تدريب شبكة AlexNet باستخدام خوارزمية التدرج اللحظي مع حجم دفعة يبلغ 128 مثالًا، وقيمة لحظية قدرها 0.9، وقيمة اضمحلال وزن قدرها 0.0005. بدأ معدل التعلم عند 10⁻²، وتم تخفيضه يدويًا بمقدار 10 أضعاف كلما بدا أن خطأ التحقق قد توقف عن الانخفاض. تم تخفيضه ثلاث مرات أثناء التدريب، ليصل في النهاية إلى 10⁻⁵ .
استخدمت شكلين من أشكال زيادة البيانات ، وكلاهما يتم حسابه أثناء التشغيل على وحدة المعالجة المركزية، وبالتالي "بدون حساب":
- تم أولاً تغيير حجم كل صورة من ImageNet بحيث يكون طول ضلعها الأقصر 256 بكسل. ثم تم اقتطاع الرقعة المركزية بحجم 256×256 بكسل وتطبيعها (بقسمة قيم البكسل بحيث تقع بين 0 و1، ثم طرح القيم من [0.485، 0.456، 0.406]، ثم القسمة على [0.229، 0.224، 0.225]. هذه هي المتوسطات والانحرافات المعيارية لـ ImageNet، مما يؤدي إلى تبييض بيانات الإدخال).
- استخراج رقع عشوائية بحجم 224×224 (وانعكاساتها الأفقية) من الصورة المقتطعة بحجم 256×256. هذا يزيد حجم مجموعة التدريب بمقدار 2048 ضعفًا.
- تغيير قيمة RGB لكل صورة بشكل عشوائي على طول الاتجاهات الرئيسية الثلاثة لقيم RGB لبكسلاتها.
تم اختيار الدقة 224×224، لأن 256 - 16 - 16 = 224، مما يعني أنه عند إعطاء صورة بحجم 256×256، فإن تأطير عرض 16 على جوانبها الأربعة ينتج عنه صورة بحجم 224×224.
استخدمت هذه الطريقة تسوية الاستجابة المحلية ، وتنظيم التسرب باحتمالية تسرب 0.5.
تمت تهيئة جميع الأوزان كتوزيعات غاوسية بمتوسط 0 وانحراف معياري 0.01. وتمت تهيئة الانحيازات في الطبقات الالتفافية 2 و4 و5 وجميع الطبقات المتصلة بالكامل إلى قيمة ثابتة 1 لتجنب مشكلة دالة ReLU المتلاشية .
أثناء الاختبار، لاستخدام شبكة AlexNet المدربة للتنبؤ بفئة الصورة، يتم أولاً تغيير حجم الصورة بحيث يصبح طول ضلعها الأقصر 256 بكسل. ثم يتم اقتطاع الرقعة المركزية بحجم 256×256 بكسل. بعد ذلك، يتم حساب الرقع الخمس بحجم 224×224 بكسل (الرقع الأربع الركنية والرقعة المركزية) بالإضافة إلى انعكاساتها الأفقية، ليصبح المجموع 10 رقع. يتم حساب متوسط احتمالات التنبؤ للشبكة على جميع الرقع العشر، وهذا هو احتمال التنبؤ النهائي.
مسابقة ImageNet
كانت النسخة التي استخدموها للمشاركة في مسابقة ImageNet لعام 2012 عبارة عن مجموعة من 7 شبكات AlexNet.
على وجه التحديد، قاموا بتدريب 5 شبكات AlexNet ذات البنية الموصوفة سابقًا (مع 5 طبقات CONV) على مجموعة بيانات التدريب ILSVRC-2012 (1.2 مليون صورة). كما قاموا بتدريب شبكتين AlexNet معدلتين، تم الحصول عليهما بإضافة طبقة CONV إضافية فوق طبقة التجميع الأخيرة. تم تدريب هاتين الشبكتين أولًا على مجموعة بيانات ImageNet Fall 2011 كاملة (15 مليون صورة في 22 ألف فئة)، ثم ضبطهما بدقة على مجموعة بيانات التدريب ILSVRC-2012. تم استخدام النظام النهائي المكون من 7 شبكات AlexNet عن طريق حساب متوسط احتمالات التنبؤ الخاصة بها.
تاريخ
الأعمال السابقة

في عام 1980، اقترح كونيهيكو فوكوشيما شبكة عصبية تلافيفية مبكرة تُسمى نيوكوجنيترون . [ 6 ] [ 7 ] وقد تم تدريبها باستخدام خوارزمية تعلم غير مُشرف . أما شبكة لي نت-5 ( يان ليكان وآخرون، 1989) [ 8 ] [ 9 ] فقد تم تدريبها باستخدام التعلم المُشرف مع خوارزمية الانتشار العكسي ، ببنية تُشابه إلى حد كبير بنية شبكة أليكس نت ولكن على نطاق أصغر.
تم استخدام التجميع الأقصى في عام 1990 لمعالجة الكلام (وهو في الأساس شبكة عصبية تلافيفية أحادية البعد)، [ 10 ] ولمعالجة الصور، تم استخدامه لأول مرة في جهاز Cresceptron عام 1992. [ 11 ]
خلال العقد الأول من الألفية الثانية، ومع تطور أجهزة معالجة الرسومات (GPU) ، قام بعض الباحثين بتكييفها للحوسبة العامة ، بما في ذلك تدريب الشبكات العصبية. قام (ك. تشيلابيلا وآخرون، 2006) بتدريب شبكة عصبية تلافيفية (CNN) على وحدة معالجة الرسومات، وكانت أسرع بأربع مرات من تطبيقها المكافئ على وحدة المعالجة المركزية (CPU). [ 12 ] قام ( راينا وآخرون، 2009) بتدريب شبكة اعتقاد عميقة تضم 100 مليون مُعامل على بطاقة رسومات Nvidia GeForce GTX 280، وحققوا سرعة تصل إلى 70 ضعفًا مقارنةً بوحدات المعالجة المركزية. [ 13 ] كانت شبكة CNN عميقة من تطوير (دان سيريسان وآخرون ، 2011) في مؤتمر IDSIA أسرع بستين مرة من تطبيقها المكافئ على وحدة المعالجة المركزية. [ 14 ] بين 15 مايو 2011 و10 سبتمبر 2012، فازت شبكتهم CNN بأربع مسابقات صور، وحققت أداءً متميزًا في قواعد بيانات صور متعددة . [ 15 ] [ 16 ] [ 17 ] وفقًا لورقة بحث AlexNet، [ 1 ] فإن شبكة Cireșan السابقة "مشابهة إلى حد ما". وقد كُتبت كلتاهما باستخدام CUDA للتشغيل على وحدة معالجة الرسومات (GPU) .
رؤية الحاسوب
خلال الفترة من 1990 إلى 2010، لم تكن الشبكات العصبية أفضل من أساليب التعلم الآلي الأخرى، مثل الانحدار النواة ، وآلات المتجهات الداعمة ، وAdaBoost ، والتقدير الهيكلي، [ 18 ] وغيرها. وفي مجال رؤية الحاسوب تحديدًا، تحقق تقدم كبير بفضل هندسة الميزات اليدوية ، مثل ميزات SIFT ، و SURF ، وHoG ، ومجموعات الكلمات البصرية ، وغيرها. وكان من الآراء السائدة في مجال رؤية الحاسوب إمكانية تعلم الميزات مباشرةً من البيانات، وهو رأي أصبح مهيمنًا بعد AlexNet. [ 19 ]
في عام ٢٠١١، بدأ جيفري هينتون بالتواصل مع زملائه متسائلاً: "ما الذي عليّ فعله لإقناعكم بأن الشبكات العصبية هي مستقبل الحوسبة؟"، فنصحه جيتندرا مالك ، وهو من المتشككين في الشبكات العصبية، بالمشاركة في تحدي PASCAL لتصنيف الكائنات المرئية. لكن هينتون أشار إلى أن مجموعة البيانات في هذا التحدي صغيرة جدًا، فنصحه مالك بالمشاركة في تحدي ImageNet. [ ٢٠ ]
تم إنشاء مجموعة بيانات ImageNet ، التي أصبحت أساسية لنجاح AlexNet، بواسطة فاي فاي لي وزملاؤها بدءًا من عام 2007. وسعيًا منها لتطوير تقنية التعرف البصري من خلال البيانات واسعة النطاق، أنشأت لي مجموعة بيانات أكبر بكثير من الجهود السابقة، حيث احتوت في النهاية على أكثر من 14 مليون صورة مصنفة ضمن 22000 فئة. تم تصنيف الصور باستخدام منصة Amazon Mechanical Turk وتنظيمها وفقًا لتسلسل WordNet الهرمي. وعلى الرغم من أنها قوبلت في البداية بالتشكيك، إلا أن ImageNet أصبحت فيما بعد أساسًا لتحدي ImageNet للتعرف البصري واسع النطاق (ILSVRC) وموردًا رئيسيًا في صعود التعلم العميق. [ 21 ]
كان كل من سوتسكيفر وكريزيفسكي طالبين في الدراسات العليا. قبل عام 2011، كان كريزيفسكي قد كتب بالفعل cuda-convnetعن تدريب شبكات عصبية تلافيفية صغيرة على مجموعة بيانات CIFAR-10 باستخدام وحدة معالجة رسومية واحدة. أقنع سوتسكيفر كريزيفسكي، الذي كان بارعًا في معالجة الرسوميات على وحدات معالجة رسومية عامة ، بتدريب شبكة عصبية تلافيفية على مجموعة بيانات ImageNet، مع تولي هينتون منصب الباحث الرئيسي. وهكذا، وسّع كريزيفسكي نطاق cuda-convnetالتدريب ليشمل وحدات معالجة رسومية متعددة. تم تدريب شبكة AlexNet على وحدتي معالجة رسومية من نوع Nvidia GTX 580 في غرفة نوم كريزيفسكي بمنزل والديه. خلال عام 2012، أجرى كريزيفسكي تحسينًا للمعلمات الفائقة على الشبكة حتى فازت بمسابقة ImageNet في وقت لاحق من العام نفسه. علّق هينتون قائلًا: "اعتقد إيليا أنه يجب علينا القيام بذلك، ونجح أليكس في إنجاحه، وحصلتُ على جائزة نوبل". [ 22 ] في المؤتمر الأوروبي لرؤية الحاسوب لعام 2012 ، وبعد فوز AlexNet، وصف الباحث يان ليكان النموذج بأنه "نقطة تحول لا لبس فيها في تاريخ رؤية الحاسوب". [ 21 ]
يعود نجاح شبكة AlexNet في عام 2012 إلى تضافر ثلاثة تطورات نضجت على مدار العقد السابق: مجموعات البيانات المصنفة واسعة النطاق، والحوسبة العامة باستخدام وحدات معالجة الرسومات (GPU) ، وأساليب التدريب المحسّنة للشبكات العصبية العميقة. وقد وفرت قاعدة بيانات ImageNet البيانات اللازمة لتدريب النماذج العميقة على نطاق واسع من فئات الكائنات. كما مكّنت التطورات في برمجة وحدات معالجة الرسومات من خلال منصة CUDA من Nvidia من التدريب العملي للنماذج الكبيرة. وبالإضافة إلى التحسينات الخوارزمية، مكّنت هذه العوامل شبكة AlexNet من تحقيق أداء عالٍ في معايير التعرف البصري واسعة النطاق. [ 21 ] وفي معرض حديثها عن أهمية هذا الإنجاز بعد أكثر من عقد من الزمن، صرّحت فاي-فاي لي في مقابلة عام 2024: "كانت تلك اللحظة رمزية للغاية لعالم الذكاء الاصطناعي، لأن ثلاثة عناصر أساسية من عناصر الذكاء الاصطناعي الحديث قد تلاقت لأول مرة". [ 21 ]
على الرغم من أن شبكتي AlexNet وLeNet تشتركان في نفس التصميم والخوارزمية تقريبًا، إلا أن AlexNet أكبر بكثير من LeNet، وقد تم تدريبها على مجموعة بيانات أكبر بكثير وعلى أجهزة أسرع بكثير. على مدى عشرين عامًا، أصبحت كل من البيانات والحوسبة متاحة بتكلفة زهيدة. [ 19 ]
الأعمال اللاحقة
يُعدّ AlexNet ذا تأثير بالغ، وقد أدى إلى العديد من الدراسات اللاحقة التي تستخدم الشبكات العصبية التلافيفية في مجال رؤية الحاسوب، وتستخدم وحدات معالجة الرسومات لتسريع التعلم العميق. وبحلول أوائل عام 2025، تم الاستشهاد بورقة بحث AlexNet أكثر من 184,000 مرة وفقًا لـ Google Scholar . [ 23 ]
عند وقت النشر، لم يكن هناك إطار عمل متاح لتدريب الشبكات العصبية واستنتاجها باستخدام وحدات معالجة الرسومات. تم إصدار قاعدة بيانات AlexNet بموجب ترخيص BSD، وقد شاع استخدامها في أبحاث الشبكات العصبية لعدة سنوات لاحقة. [ 24 ] [ 19 ]
في اتجاهٍ ما، سعت الدراسات اللاحقة إلى تدريب شبكات عصبية تلافيفية (CNNs) ذات عمقٍ متزايد لتحقيق أداءٍ أعلى على مجموعة بيانات ImageNet. ومن أمثلة هذا البحث: GoogLeNet (2014)، و VGGNet (2014)، و Highway Network (2015)، و ResNet (2015). وفي اتجاهٍ آخر، سعت الدراسات إلى محاكاة أداء AlexNet بتكلفةٍ أقل. ومن أمثلة هذا البحث: SqueezeNet (2016)، و MobileNet (2017)، وEfficientNet (2019).
أسس جيفري هينتون وإيليا سوتسكيفر وأليكس كريزيفسكي شركة DNNResearch بعد ذلك بوقت قصير، ثم باعوا الشركة، ومعها شفرة المصدر الخاصة ببرنامج AlexNet، إلى جوجل. وقد أُجريت تحسينات وإعادة تنفيذ لبرنامج AlexNet، ولكن النسخة الأصلية، اعتبارًا من عام 2012، وقت فوزه بمسابقة ImageNet، كانت قد صدرت بموجب ترخيص BSD-2 عبر متحف تاريخ الحاسوب . [ 25 ]
انظر أيضاً
مراجع
- 1 2 3 4 5 6 كريزيفسكي، أليكس؛ سوتسكيفر، إيليا؛ هينتون، جيفري إي. (24-05-2017). "تصنيف ImageNet باستخدام الشبكات العصبية الالتفافية العميقة" (ملف PDF) . مجلة اتصالات ACM . 60 (6): 84-90 . doi : 10.1145/3065386 . ISSN 0001-0782 . S2CID 195908774 .
- ↑ "مسابقة ImageNet للتعرف البصري واسع النطاق 2012 (ILSVRC2012)" . image-net.org .
- ↑ "مواصفات بطاقة رسومات NVIDIA GeForce GTX 580" . TechPowerUp . 12 نوفمبر 2024. تاريخ الاطلاع: 12 نوفمبر 2024 .
- ↑ "calflops: أداة لحساب عمليات الفاصلة العائمة والمعاملات للشبكات العصبية" . pypi.org . تم الاطلاع عليه بتاريخ 10-12-2024 .
- ↑ فريق SuperVision مدعو لتقديم محاضرة في ورشة عمل ImageNet Large Scale Visual Recognition Challenge 2012 (ILSVRC2012) التي أقيمت في 2012-10-12، ضمن فعاليات ECCV 2012، في فلورنسا، إيطاليا.
- ↑ فوكوشيما، ك. (2007). "نيوكوجنيترون" . سكولاربيديا . 2 (1): 1717. Bibcode : 2007SchpJ...2.1717F . doi : 10.4249/scholarpedia.1717 .
- ↑ فوكوشيما، كونيهيكو (1980). "نيوكوجنيترون: نموذج شبكة عصبية ذاتية التنظيم لآلية التعرف على الأنماط غير المتأثرة بتغير الموضع" (ملف PDF) . علم التحكم الآلي البيولوجي . 36 (4): 193-202 . doi : 10.1007/BF00344251 . PMID 7370364. S2CID 206775608. تاريخ الاسترجاع: 16 نوفمبر 2013 .
- ↑ لوكون، ي.؛ بوسر، ب.؛ دينكر، ج. س.؛ هندرسون، د.؛ هوارد، ر. إ.؛ هوبارد، و.؛ جاكيل، ل. د. (1989). "تطبيق خوارزمية الانتشار العكسي على التعرف على الرموز البريدية المكتوبة بخط اليد" (ملف PDF) . الحوسبة العصبية . 1 (4). مطبعة معهد ماساتشوستس للتكنولوجيا - المجلات: 541-551 . doi : 10.1162/neco.1989.1.4.541 . ISSN 0899-7667 . OCLC 364746139 .
- ^ ليكون ، يان. ليون بوتو؛ يوشوا بنجيو؛ باتريك هافنر (1998). “تطبيق التعلم القائم على التدرج على التعرف على المستندات” (PDF) . وقائع IEEE . 86 (11): 2278–2324 . سيتيسيركس 10.1.1.32.9552 . دوى : 10.1109/5.726791 . S2CID 14542261 . تم الاسترجاع في 7 أكتوبر 2016 .
- ↑ ياماغوتشي، كويتشي؛ ساكاموتو، كينجي؛ أكاباني، توشيو؛ فوجيموتو، يوشيجي (نوفمبر 1990). شبكة عصبية للتعرف على الكلمات المنفردة بغض النظر عن المتحدث . المؤتمر الدولي الأول لمعالجة اللغة المنطوقة (ICSLP 90). كوبي، اليابان. مؤرشف من الأصل في 7 مارس 2021. تم الاطلاع عليه في 4 سبتمبر 2019 .
- ↑ وينغ، ج.؛ أهوجا، ن.؛ هوانغ، ت.س. (1992). كريسبترون: شبكة عصبية ذاتية التنظيم تنمو بشكل تكيفي (ملف PDF) . المجلد 1. معهد مهندسي الكهرباء والإلكترونيات. الصفحات 576-581 . doi : 10.1109/IJCNN.1992.287150 . ISBN 978-0-7803-0559-5.
- ↑ كومار تشيلابيلا؛ سيد بوري؛ باتريس سيمارد (2006). "شبكات عصبية التفافية عالية الأداء لمعالجة المستندات" . في لوريت، جاي (محرر). ورشة العمل الدولية العاشرة حول آفاق التعرف على الكتابة اليدوية . سوفيسوفت.
- ↑ راينا، راجات؛ مادهافان، أناند؛ نغ، أندرو ي. (14 يونيو 2009). التعلم العميق غير الخاضع للإشراف واسع النطاق باستخدام معالجات الرسومات . ACM. الصفحات 873-880 . doi : 10.1145/1553374.1553486 . ISBN 978-1-60558-516-1.
- ↑ سيريشان، دان؛ أولي ماير؛ جوناثان ماسكي؛ لوكا م. غامبارديلا؛ يورغن شميدهوبر (2011). "شبكات عصبية التفافية مرنة وعالية الأداء لتصنيف الصور" (ملف PDF) . وقائع المؤتمر الدولي المشترك الثاني والعشرين حول الذكاء الاصطناعي - المجلد الثاني . 2 : 1237-1242 . تاريخ الاسترجاع: 17 نوفمبر 2013 .
- ↑ "جدول نتائج مسابقة IJCNN 2011" . مسابقة IJCNN 2011 الرسمية . 2010. تاريخ الاسترجاع: 14 يناير 2019 .
- ↑ شميدهوبر، يورغن (17 مارس 2017). "تاريخ مسابقات رؤية الحاسوب التي فازت بها الشبكات العصبية التلافيفية العميقة على وحدة معالجة الرسومات" . تم الاطلاع عليه بتاريخ 14 يناير 2019 .
- ↑ سيريشان، دان؛ ماير، أولي؛ شميدهوبر، يورغن (يونيو 2012). "شبكات عصبية عميقة متعددة الأعمدة لتصنيف الصور". مؤتمر IEEE لعام 2012 حول رؤية الحاسوب والتعرف على الأنماط . نيويورك، نيويورك: معهد مهندسي الكهرباء والإلكترونيات (IEEE). الصفحات 3642-3649 . arXiv : 1202.2745 . CiteSeerX : 10.1.1.300.3283 . doi : 10.1109/CVPR.2012.6248110 . ISBN 978-1-4673-1226-4. OCLC 812295155 . S2CID 2161592 .
- ↑ تاسكار، بن؛ غيسترين، كارلوس؛ كولر، دافني (2003). "شبكات ماركوف ذات الهامش الأقصى" . التطورات في أنظمة معالجة المعلومات العصبية . 16. مطبعة معهد ماساتشوستس للتكنولوجيا.
- 1 2 3 تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "8.1. الشبكات العصبية الالتفافية العميقة (AlexNet)" . تعمق في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
- ↑ لي، فاي فاي (2023). العوالم التي أراها: الفضول والاستكشاف والاكتشاف في فجر الذكاء الاصطناعي ( الطبعة الأولى). نيويورك: دار نشر مومنت أوف ليفت بوكس؛ دار نشر فلاتيرون بوكس. رقم ISBN 978-1-250-89793-0.
- 1 2 3 4 "كيف أطلق عالم حاسوب عنيد عن غير قصد طفرة التعلم العميق" . آرس تكنيكا . 11 نوفمبر 2024. تم الاطلاع عليه في 24 مارس 2025 .
- ↑ hhackford (2025-03-20). "CHM تنشر شفرة مصدر AlexNet" . CHM . تم الاسترجاع في 22-03-2025 .
- ↑ ورقة بحثية من AlexNet على Google Scholar
- ↑ كريزيفسكي، أليكس (18 يوليو 2014). "cuda-convnet: تطبيق عالي الأداء لشبكات عصبية التفافية بلغة C++/CUDA" . أرشيف جوجل للبرمجيات . تم الاطلاع عليه بتاريخ 20 أكتوبر 2024 .
- ↑ computerhistory/AlexNet-Source-Code ، متحف تاريخ الحاسوب، 22-03-2025 ، تاريخ الاسترجاع 22-03-2025
- برامج التعلم العميق
- التعرف على الأشياء وتصنيفها
- بنى الشبكات العصبية
- برامج جامعة تورنتو
- 2012 في مجال الذكاء الاصطناعي
- برنامج 2012
- صناعة الذكاء الاصطناعي في كندا
