طبقة التجميع
في الشبكات العصبية ، تُعدّ طبقة التجميع نوعًا من طبقات الشبكة التي تُقلّل من حجم المعلومات المُوزّعة على العديد من المتجهات وتُجمّعها في عدد أقل من المتجهات. [ 1 ] ولها استخدامات عديدة، فهي تُزيل المعلومات الزائدة، مما يُقلّل من حجم العمليات الحسابية والذاكرة المطلوبة، ويجعل النموذج أكثر مقاومة للتغيرات الطفيفة في المُدخلات؛ كما أنها تُوسّع نطاق استقبال الخلايا العصبية في الطبقات اللاحقة من الشبكة.
تجميع الشبكات العصبية الالتفافية
يُستخدم التجميع بشكل شائع في الشبكات العصبية الالتفافية (CNN). فيما يلي وصف للتجميع في الشبكات العصبية الالتفافية ثنائية الأبعاد. ويمكن تعميم ذلك على الشبكات متعددة الأبعاد بسهولة.
كرمز، نعتبر موترًا، أينهو الطول،هو العرض، ويمثل عدد القنوات. تُخرج طبقة التجميع موترًا..
نُعرّف متغيرينيُطلق عليها "حجم المرشح" (أو "حجم النواة") و"الخطوة". في بعض الأحيان، يكون من الضروري استخدام حجم مرشح وخطوة مختلفين للاتجاهين الأفقي والرأسي. في مثل هذه الحالات، نُعرّف 4 متغيرات:.
المجال الاستقبالي لإدخال في موتر الإخراج،، هي جميع المدخلات فيوهذا قد يؤثر على تلك المشاركة.
أقصى قدر من التجميع

تُستخدم تقنية التجميع الأقصى (MaxPool) بشكل شائع في الشبكات العصبية التلافيفية لتقليل الأبعاد المكانية لخرائط الميزات.
يُعرِّفأينيعني النطاقلاحظ أنه يجب علينا تجنب خطأ الاختلاف بمقدار واحد . المدخل التالي هووهكذا دواليك. المجال الاستقبالي لـيكونلذا بشكل عام،إذا اختلف حجم المرشح الأفقي والرأسي وخطواته، فعندئذٍ بشكل عام،باختصار أكثر، يمكننا أن نكتب.

لولا يمكن التعبير عنها كـأينإذا كان عددًا صحيحًا، فلحساب عناصر موتر الإخراج على الحدود، ستحاول عملية التجميع الأقصى استخدام متغيرات من الموتر كمدخلات. في هذه الحالة، تعتمد كيفية التعامل مع هذه المتغيرات غير الموجودة على شروط الحشو ، الموضحة على اليمين.
التجميع الأقصى العالمي (GMP) هو نوع محدد من التجميع الأقصى حيث يكون لموتر الإخراج شكلوالمجال الاستقبالي لـهو كل شيءأي أنه يأخذ القيمة القصوى على مستوى كل قناة. ويُستخدم غالبًا قبل الطبقات المتصلة بالكامل في رأس تصنيف الشبكة العصبية التلافيفية.
متوسط التجميع
يتم تعريف التجميع المتوسط (AvgPool) بشكل مماثليُعرَّف التجميع المتوسط العالمي (GAP) بشكل مشابه لتقنية التجميع المتوسط العالمي (GMP). وقد طُرح لأول مرة في نموذج الشبكة داخل الشبكة. [ 2 ] ومثل تقنية التجميع المتوسط العالمي، يُستخدم غالبًا قبل الطبقات المتصلة بالكامل الأخيرة في رأس تصنيف الشبكة العصبية التلافيفية (CNN).
الاستيفاء
توجد بعض عمليات الاستيفاء للتجميع الأقصى والتجميع المتوسط.
التجميع المختلط هو مجموع خطي للتجميع الأقصى والتجميع المتوسط. [ 3 ] أي،أينإما أن يكون معلمة فائقة، أو معلمة قابلة للتعلم، أو يتم أخذ عينة عشوائية منها من جديد في كل مرة.
يُشبه تجميع Lp تجميع المتوسط، ولكنه يستخدم متوسط معيار Lp بدلاً من المتوسط:أينحجم المجال الاستقبالي، وهو مُعامل فائق. إذا كانت جميع التنشيطات غير سالبة، فإن التجميع المتوسط هو حالة، والتجميع الأقصى هو حالة منيُعد تجميع الجذر التربيعي مثالاً على ذلك .[ 4 ]
عينات التجميع العشوائي هي تنشيط عشوائيمن المجال الاستقبالي باحتماليةوهو ما يعادل التجميع المتوسط في التوقع . [ 5 ]
يشبه تجميع Softmax تجميع max، ولكنه يستخدم دالة softmax ، أيأينيُعد تجميع المتوسطات مثالاً على ذلك.، والتجميع الأقصى هو حالة من[ 4 ]
يُعمم التجميع القائم على الأهمية المحلية تجميع softmax بواسطةأينهي دالة قابلة للتعلم. [ 6 ]

تجميعات أخرى
تُطبّق تقنية التجميع الهرمي المكاني التجميع الأقصى (أو أي شكل آخر من أشكال التجميع) في بنية هرمية . أي أنها تُطبّق التجميع الأقصى الشامل، ثم تُطبّقه على الصورة المُقسّمة إلى 4 أجزاء متساوية، ثم إلى 16 جزءًا، وهكذا. بعد ذلك، تُدمج النتائج . وهي شكل هرمي من التجميع الشامل، ومثل التجميع الشامل، تُستخدم غالبًا قبل رأس التصنيف مباشرةً. [ 7 ]
يُعد تجميع منطقة الاهتمام (المعروف أيضًا باسم تجميع RoI) أحد أنواع التجميع الأقصى المستخدم في الشبكات العصبية الالتفافية R-CNNs للكشف عن الأجسام . [ 8 ] وهو مصمم لأخذ مصفوفة إدخال ذات حجم عشوائي، وإخراج مصفوفة إخراج ذات حجم ثابت.
تحسب عملية تجميع التغاير مصفوفة التغاير للمتجهات.ثم يتم تسويتها إلىمتجه ذو أبعاديُستخدم تجميع التغاير العالمي بشكل مشابه لتجميع الحد الأقصى العالمي. ولأن تجميع المتوسط يحسب المتوسط، وهو إحصائية من الدرجة الأولى ، بينما التغاير إحصائية من الدرجة الثانية، يُطلق على تجميع التغاير أيضًا اسم "تجميع الرتبة الثانية". ويمكن تعميمه ليشمل عمليات التجميع من الرتب الأعلى. [ 9 ] [ 10 ]
يعني تجميع التمويه تطبيق طريقة تمويه قبل تقليل حجم العينة. على سبيل المثال، يعني تجميع التمويه Rect-2 أخذ متوسط التجميع عندثم أخذ كل بكسل ثانٍ (متطابق مع). [ 11 ]
تجميع محول الرؤية
في محولات الرؤية (ViT)، توجد الأنواع الشائعة التالية من عمليات التجميع.
يستخدم التجميع الشبيه بـ BERT[CLS] رمزًا وهميًا يُسمى "التصنيف". في عملية التصنيف، يكون الناتج[CLS]هو رمز التصنيف، والذي تتم معالجته بواسطة وحدة LayerNorm -feedforward-softmax لتحويله إلى توزيع احتمالي، وهو ما يمثل تنبؤ الشبكة بتوزيع احتمالية الفئة. هذا هو التوزيع المستخدم في كل من ViT الأصلي [ 12 ] و Masked Autoencoder [ 13 ] .
لا تستخدم طريقة التجميع المتوسط العالمي (GAP) الرمز الوهمي، بل تعتمد ببساطة على متوسط جميع رموز الإخراج كرمز تصنيف. وقد ذُكرت في ViT الأصلية على أنها جيدة بنفس القدر. [ 12 ]
تُطبّق تقنية تجميع الانتباه متعدد الرؤوس (MAP) كتلة انتباه متعددة الرؤوس على عملية التجميع. وتحديدًا، تأخذ هذه التقنية قائمة من المتجهات كمدخل.والتي يمكن اعتبارها متجهات الإخراج لطبقة من طبقات ViT. ثم يتم تطبيق طبقة تغذية أمامية.على كل متجه، مما ينتج عنه مصفوفةثم يتم إرسال هذا إلى آلية انتباه متعددة الرؤوس، مما ينتج عنه، أينهي مصفوفة من المعاملات القابلة للتدريب. [ 14 ] وقد طُرح هذا لأول مرة في بنية Set Transformer. [ 15 ]
أظهرت دراسات لاحقة أن كلاً من GAP وMAP يتفوقان على التجميع الشبيه بـBERT. [ 14 ] [ 16 ]
تجميع الشبكات العصبية البيانية
في الشبكات العصبية البيانية (GNN)، يوجد نوعان من التجميع: التجميع العالمي والتجميع المحلي. يمكن اختزال التجميع العالمي إلى تجميع محلي حيث يكون حقل الاستقبال هو المخرجات بأكملها.
- التجميع المحلي : تعمل طبقة التجميع المحلي على تقليل دقة الرسم البياني عبر تقليل حجمه . يُستخدم التجميع المحلي لزيادة مجال الاستقبال في شبكة الرسوم البيانية العصبية، على غرار طبقات التجميع في الشبكات العصبية الالتفافية . من الأمثلة على ذلك: تجميع أقرب k جار ، وتجميع أعلى k عنصر، [ 17 ] وتجميع الانتباه الذاتي. [ 18 ]
- التجميع العالمي : توفر طبقة التجميع العالمي، والمعروفة أيضًا بطبقة القراءة ، تمثيلًا ثابت الحجم للرسم البياني بأكمله. يجب أن تكون طبقة التجميع العالمي ثابتةً بغض النظر عن التبديلات، بحيث لا تؤثر التبديلات في ترتيب عقد الرسم البياني وحوافه على الناتج النهائي. [ 19 ] تشمل الأمثلة الجمع والمتوسط والقيمة القصوى لكل عنصر.
تعمل طبقات التجميع المحلية على تقليل دقة الرسم البياني عبر تقليل حجمه. نعرض هنا عدة استراتيجيات تجميع محلية قابلة للتعلم تم اقتراحها. [ 19 ] في كل حالة، يتم تمثيل المدخلات في الرسم البياني الأولي بواسطة مصفوفة.خصائص العقدة ومصفوفة تجاور الرسم البيانيالناتج هو المصفوفة الجديدةمن خصائص العقدة ومصفوفة تجاور الرسم البياني الجديدة.
تجميع Top-k
لقد حددنا أولاً
أينهو متجه إسقاط قابل للتعلم . متجه الإسقاطيحسب قيمة إسقاط قياسية لكل عقدة في الرسم البياني.
يمكن بعد ذلك صياغة طبقة التجميع ذات أعلى k عنصر [ 17 ] على النحو التالي:
أينهي مجموعة فرعية من العقد التي حصلت على أعلى k درجة إسقاط،يرمز إلى ضرب المصفوفات عنصرًا بعنصر ، وهي دالة سيجمويد . بعبارة أخرى، يتم الاحتفاظ بالعقد ذات أعلى k درجة إسقاط في مصفوفة التجاور الجديدة.. التُنشئ العملية متجه الإسقاطيمكن تدريبها عن طريق الانتشار العكسي ، والذي ينتج عنه مخرجات منفصلة في غير ذلك. [ 17 ]
تجميع الانتباه الذاتي
لقد حددنا أولاً
أينهي طبقة GNN عامة متغيرة بالتبديل (مثل GCN، GAT، MPNN).
يمكن بعد ذلك صياغة طبقة تجميع الانتباه الذاتي [ 18 ] على النحو التالي:
أينهي مجموعة فرعية من العقد التي حصلت على أعلى k درجة إسقاط،يشير إلى ضرب المصفوفات عنصرًا بعنصر .
يمكن اعتبار طبقة تجميع الانتباه الذاتي امتدادًا لطبقة تجميع أعلى k. وبخلاف تجميع أعلى k، فإن درجات الانتباه الذاتي المحسوبة في تجميع الانتباه الذاتي تأخذ في الاعتبار كلًا من خصائص الرسم البياني وبنيته.
تاريخ
في أوائل القرن العشرين، لاحظ علماء التشريح العصبي نمطًا معينًا حيث تتشابك عدة خلايا عصبية مع نفس الخلية العصبية. وقد عُزِيَ هذا النمط وظيفيًا باسم "التجميع الموضعي"، مما يجعل الرؤية ثابتة بغض النظر عن موقعها. وقدّم هارتلاين أدلة داعمة لهذه النظرية من خلال تجارب فيزيولوجية كهربائية على الحقول الاستقبالية لخلايا العقدة الشبكية. [ 20 ] وأظهرت تجارب هوبل وويزل أن نظام الرؤية لدى القطط يشبه الشبكة العصبية الالتفافية، حيث تقوم بعض الخلايا بجمع المدخلات من الطبقة السفلية. [ 21 ] : انظر الشكلين 19 و20. للاطلاع على مراجع هذه الدراسات المبكرة، انظر ويستهايمر. [ 22 ]
خلال سبعينيات القرن العشرين، ولتفسير تأثيرات إدراك العمق ، اقترح بعض الباحثين، مثل جولز وتشانغ، أن الجهاز البصري يُفعّل آلية انتقائية للتباين عبر التجميع الشامل، حيث تُجمع مخرجات أزواج متطابقة من مناطق الشبكية في العينين في خلايا ذات رتبة أعلى. [ 23 ] انظر شومر وجانز للاطلاع على مراجع هذه الدراسات المبكرة. [ 24 ]
في الشبكات العصبية الاصطناعية، تم استخدام التجميع الأقصى في عام 1990 لمعالجة الكلام (الالتفاف أحادي البعد)، [ 25 ] وفي معالجة الصور، تم استخدامه لأول مرة في جهاز Cresceptron عام 1992. [ 26 ]
انظر أيضاً
مراجع
- ↑ تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "7.5. التجميع" . الغوص في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
- ^ لين، مين؛ تشن، تشيانغ. يان، شويتشنغ (2013). "الشبكة في الشبكة". أرخايف : 1312.4400 [ cs.NE ].
- ↑ يو، دينغجون؛ وانغ، هانلي؛ تشين، بيتشيو؛ وي، تشيهوا (2014). "التجميع المختلط للشبكات العصبية الالتفافية" . في: مياو، دوتشيان؛ بيدريتش، ويتولد؛ سليزاك، دومينيك؛ بيترز، جورج؛ هو، تشينغهوا؛ وانغ، رويتشي (محررون). المجموعات التقريبية وتكنولوجيا المعرفة . سلسلة محاضرات في علوم الحاسوب. المجلد 8818. تشام: دار نشر سبرينغر الدولية. الصفحات 364-375 . doi : 10.1007/978-3-319-11740-9_34 . ISBN 978-3-319-11740-9.
- 1 2 بوريو، واي-لان؛ بونس، جان؛ لوكون، يان (21-06-2010). "تحليل نظري لتجميع الميزات في التعرف البصري" . وقائع المؤتمر الدولي السابع والعشرين للتعلم الآلي . ICML'10. ماديسون، ويسكونسن، الولايات المتحدة الأمريكية: أومنيبريس: 111-118 . ISBN 978-1-60558-907-7.
- ↑ زيلر، ماثيو د.؛ فيرغوس، روب (2013-01-15). "التجميع العشوائي لتنظيم الشبكات العصبية التلافيفية العميقة". arXiv : 1301.3557 [ cs.LG ].
- ^ جاو، زيتنج؛ وانغ، ليمين؛ وو ، جانجشان (2019). "LIP: التجميع على أساس الأهمية المحلية" : 3355– 3364. أرخايف : 1908.04156 .
{{cite journal}}يتطلب الاستشهاد بالمجلة ( مساعدة )|journal= - ↑ هي، كايمينغ؛ تشانغ، شيانغيو؛ رن، شاوكينغ؛ صن، جيان (2015-09-01). "تجميع الهرم المكاني في الشبكات العصبية التلافيفية العميقة للتعرف البصري". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 37 (9): 1904-1916 . arXiv : 1406.4729 . Bibcode : 2015ITPAM..37.1904H . doi : 10.1109/TPAMI.2015.2389824 . ISSN 0162-8828 . PMID 26353135 .
- ↑ تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "14.8. الشبكات العصبية الالتفافية القائمة على المناطق (R-CNNs)" . تعمق في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
- ↑ توزيل، أونجيل؛ بوريكلي، فاتح؛ مير، بيتر (2006). "تباين المنطقة: واصف سريع للكشف والتصنيف" . في ليوناردس، أليش؛ بيشوف، هورست؛ بينز، أكسل (محررون). رؤية الحاسوب - المؤتمر الأوروبي لرؤية الحاسوب 2006. المجلد 3952. برلين، هايدلبرغ: سبرينغر برلين هايدلبرغ. الصفحات 589-600 . doi : 10.1007/11744047_45 . ISBN 978-3-540-33834-5تم الاطلاع عليه بتاريخ 2024-09-09 .
- ↑ وانغ، تشيلونغ؛ شي، جيانغتاو؛ تسو، وانغمينغ؛ تشانغ، لي؛ لي، بيهوا (2020). "الشبكات العصبية التلافيفية العميقة تلتقي بتجميع التغاير العالمي: تمثيل وتعميم أفضل". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 43 (8): 2582-2597 . arXiv : 1904.06836 . doi : 10.1109/TPAMI.2020.2974833 . ISSN 0162-8828 . PMID 32086198 .
- ↑ تشانغ، ريتشارد (27-09-2018). "جعل الشبكات الالتفافية غير متغيرة مع الإزاحة مرة أخرى" . arXiv : 1904.11486 .
{{cite journal}}يتطلب الاستشهاد بالمجلة ( مساعدة )|journal= - 1 2 دوسوفيتسكي، أليكسي؛ باير، لوكاس. كوليسنيكوف، الكسندر؛ ويسينبورن، ديرك. تشاي، شياو هوا؛ أونترثينر، توماس؛ دهقاني، مصطفى؛ مينديرر، ماتياس؛ هيجولد، جورج. جيلي، سيلفان. أوسزكوريت ، جاكوب (2021-06-03). “الصورة تستحق 16 × 16 كلمة: محولات للتعرف على الصور على نطاق واسع”. أرخايف : 2010.11929 [ cs.CV ].
- ↑ هي، كايمينغ؛ تشين، شينلي؛ شي، ساينينغ؛ لي، يانغهاو؛ دولار، بيوتر؛ غيرشيك، روس (يونيو 2022). "المشفرات التلقائية المقنعة هي متعلمات رؤية قابلة للتوسع" . مؤتمر IEEE/CVF لعام 2022 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. الصفحات 15979-15988 . arXiv : 2111.06377 . doi : 10.1109/cvpr52688.2022.01553 . ISBN 978-1-6654-6946-3.
- 1 2 تشاي، شياوهوا؛ كوليسنيكوف، ألكسندر؛ هولزبي، نيل؛ باير، لوكاس (يونيو 2022). "توسيع نطاق محولات الرؤية" . مؤتمر IEEE/CVF لعام 2022 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. الصفحات 1204-1213 . arXiv : 2106.04560 . doi : 10.1109/cvpr52688.2022.01179 . ISBN 978-1-6654-6946-3.
- ↑ لي، جوهو؛ لي، يون هو؛ كيم، جونغ تايك؛ كوسوريك، آدم؛ تشوي، سيونغ جين؛ تيه، يي واي (24 مايو 2019). "محول المجموعة: إطار عمل للشبكات العصبية الثابتة التبديل القائمة على الانتباه" . وقائع المؤتمر الدولي السادس والثلاثين للتعلم الآلي . PMLR: 3744–3753 . arXiv : 1810.00825 .
- ↑ كارامشيتي، سيدهارث؛ ناير، سوراج؛ تشين، آني س.؛ كولار، توماس؛ فين، تشيلسي؛ صديق، دورسا؛ ليانغ، بيرسي (24-02-2023). "تعلم التمثيل القائم على اللغة للروبوتات". arXiv : 2302.12766 [ cs.RO ].
- 1 2 3 جاو، هونغيانغ؛ جي شويوانج جي (2019). “الرسم البياني لشبكات U”. أرخايف : 1905.05178 [ أ cs.LG أ ].
- 1 2 لي، جون هيون؛ لي، إنيوب؛ كانغ، جاي وو (2019). "تجميع الرسم البياني للانتباه الذاتي". arXiv : 1904.08082 [ cs.LG ].
- 1 2 ليو، تشوانغ؛ زان، ييبينغ؛ لي تشانغ. دو، بو؛ وو، جيا؛ هو، وينبين؛ ليو، تونجليانج؛ تاو، داتشنغ (2022). “تجميع الرسم البياني للشبكات العصبية الرسومية: التقدم والتحديات والفرص”. أرخايف : 2204.07321 [ cs.LG ].
- ↑ هارتلاين، إتش كيه (30 سبتمبر 1940). "الحقول الاستقبالية لألياف العصب البصري" . المجلة الأمريكية لعلم وظائف الأعضاء. المحتوى التراثي . 130 (4): 690-699 . doi : 10.1152/ajplegacy.1940.130.4.690 . ISSN 0002-9513 .
- ↑ هوبل، د.هـ؛ ويزل، ت.ن. (يناير 1962). "الحقول الاستقبالية، والتفاعل بين العينين، والبنية الوظيفية في القشرة البصرية للقطط" . مجلة علم وظائف الأعضاء . 160 (1): 106-154.2. doi : 10.1113/jphysiol.1962.sp006837 . ISSN 0022-3751 . PMC 1359523. PMID 14449617 .
- ↑ ويستهايمر، ج . (ديسمبر 1965). "التفاعل المكاني في شبكية العين البشرية أثناء الرؤية الليلية" . مجلة علم وظائف الأعضاء . 181 (4): 881-894 . doi : 10.1113/jphysiol.1965.sp007803 . ISSN 0022-3751 . PMC 1357689. PMID 5881260 .
- ↑ جولز، بيلا؛ تشانغ، جيه جي (مارس 1976). "التفاعل بين مجموعات من كاشفات التباين البصري الثنائي المُضبوطة على تباينات مختلفة" . علم التحكم الآلي البيولوجي . 22 (2): 107-119 . doi : 10.1007/BF00320135 . ISSN 0340-1200 . PMID 1276243 .
- ↑ شومر، روبرت؛ غانز، ليو (1979-01-01). "قنوات مجسمة مستقلة لدرجات مختلفة من التجميع المكاني" . أبحاث الرؤية . 19 (12): 1303-1314 . doi : 10.1016/0042-6989(79)90202-5 . ISSN 0042-6989 . PMID 532098 .
- ↑ ياماغوتشي، كويتشي؛ ساكاموتو، كينجي؛ أكاباني، توشيو؛ فوجيموتو، يوشيجي (نوفمبر 1990). شبكة عصبية للتعرف على الكلمات المنفردة بغض النظر عن المتحدث . المؤتمر الدولي الأول لمعالجة اللغة المنطوقة (ICSLP 90). كوبي، اليابان. مؤرشف من الأصل في 7 مارس 2021. تم الاطلاع عليه في 4 سبتمبر 2019 .
- ↑ وينغ، ج.؛ أهوجا، ن.؛ هوانغ، ت.س. (1992). "كريسبترون: شبكة عصبية ذاتية التنظيم تنمو بشكل تكيفي". [ وقائع المؤتمر الدولي المشترك للشبكات العصبية IJCNN لعام 1992. المجلد 1. معهد مهندسي الكهرباء والإلكترونيات. الصفحات 576-581 . doi : 10.1109/IJCNN.1992.287150 . ISBN 978-0-7803-0559-5.
- بنى الشبكات العصبية
- رؤية الحاسوب
- علم الأعصاب الحاسوبي
