طبقة التجميع

في الشبكات العصبية ، تُعدّ طبقة التجميع نوعًا من طبقات الشبكة التي تُقلّل من حجم المعلومات المُوزّعة على العديد من المتجهات وتُجمّعها في عدد أقل من المتجهات. [ 1 ] ولها استخدامات عديدة، فهي تُزيل المعلومات الزائدة، مما يُقلّل من حجم العمليات الحسابية والذاكرة المطلوبة، ويجعل النموذج أكثر مقاومة للتغيرات الطفيفة في المُدخلات؛ كما أنها تُوسّع نطاق استقبال الخلايا العصبية في الطبقات اللاحقة من الشبكة.

تجميع الشبكات العصبية الالتفافية

يُستخدم التجميع بشكل شائع في الشبكات العصبية الالتفافية (CNN). فيما يلي وصف للتجميع في الشبكات العصبية الالتفافية ثنائية الأبعاد. ويمكن تعميم ذلك على الشبكات متعددة الأبعاد بسهولة.

كرمز، نعتبر موترًاxRح×دبليو×ج{\displaystyle x\in \mathbb {R} ^{H\times W\times C}}، أينح{\displaystyle H}هو الطول،دبليو{\displaystyle W}هو العرض، وج{\displaystyle C}يمثل عدد القنوات. تُخرج طبقة التجميع موترًا.yRح×دبليو×ج{\displaystyle y\in \mathbb {R} ^{H'\times W'\times C'}}.

نُعرّف متغيرينو،s{\displaystyle f,s}يُطلق عليها "حجم المرشح" (أو "حجم النواة") و"الخطوة". في بعض الأحيان، يكون من الضروري استخدام حجم مرشح وخطوة مختلفين للاتجاهين الأفقي والرأسي. في مثل هذه الحالات، نُعرّف 4 متغيرات:وح،ودبليو،sح،sدبليو{\displaystyle f_{H},f_{W},s_{H},s_{W}}.

المجال الاستقبالي لإدخال في موتر الإخراج،y{\displaystyle y}، هي جميع المدخلات فيx{\displaystyle x}وهذا قد يؤثر على تلك المشاركة.

أقصى قدر من التجميع

مثال عملي على التجميع الأقصى، مع حجم المرشحو=2{\displaystyle f=2}وخطا بخطى واسعةs=2{\displaystyle s=2}

تُستخدم تقنية التجميع الأقصى (MaxPool) بشكل شائع في الشبكات العصبية التلافيفية لتقليل الأبعاد المكانية لخرائط الميزات.

يُعرِّفمأxPooل(x|و،s)0،0،0=الأعلى(x0:و-1،0:و-1،0){\displaystyle \mathrm {MaxPool} (x|f,s)_{0,0,0}=\max(x_{0:f-1,0:f-1,0})}أين0:و-1{\displaystyle 0:f-1}يعني النطاق0،1،...،و-1{\displaystyle 0,1,\dots ,f-1}لاحظ أنه يجب علينا تجنب خطأ الاختلاف بمقدار واحد . المدخل التالي هومأxPooل(x|و،s)1،0،0=الأعلى(xs:s+و-1،0:و-1،0){\displaystyle \mathrm {MaxPool} (x|f,s)_{1,0,0}=\max(x_{s:s+f-1,0:f-1,0})}وهكذا دواليك. المجال الاستقبالي لـyأنا،ج،ج{\displaystyle y_{i,j,c}}يكونxأناs+و-1،جs+و-1،ج{\displaystyle x_{is+f-1,js+f-1,c}}لذا بشكل عام،مأxPooل(x|و،s)أنا،ج،ج=مأx(xأناs:أناs+و-1،جs:جs+و-1،ج){\displaystyle \mathrm {MaxPool} (x|f,s)_{i,j,c}=\mathrm {max} (x_{is:is+f-1,js:js+f-1,c})}إذا اختلف حجم المرشح الأفقي والرأسي وخطواته، فعندئذٍ بشكل عام،مأxPooل(x|و،s)أنا،ج،ج=مأx(xأناsح:أناsح+وح-1،جsدبليو:جsدبليو+ودبليو-1،ج){\displaystyle \mathrm {MaxPool} (x|f,s)_{i,j,c}=\mathrm {max} (x_{is_{H}:is_{H}+f_{H}-1,js_{W}:js_{W}+f_{W}-1,c})}باختصار أكثر، يمكننا أن نكتبyك=الأعلى({xك|ك في مجال الاستقبال لـ ك}){\displaystyle y_{k}=\max(\{x_{k'}|k'{\text{ in the receptive field of }}k\})}.

ثلاثة أمثلة على حالات الحشو. حالة التكرار تعني حشو البكسل الخارجي بأقرب بكسل داخلي. أما حشو الانعكاس، فهو حشو البكسل الخارجي بالبكسل الداخلي، مع عكسه عبر حدود الصورة. بينما الحشو الدائري، فهو التفاف البكسل الخارجي حول حدود الصورة.

لوح{\displaystyle H}لا يمكن التعبير عنها كـكs+و{\displaystyle ks+f}أينك{\displaystyle k}إذا كان عددًا صحيحًا، فلحساب عناصر موتر الإخراج على الحدود، ستحاول عملية التجميع الأقصى استخدام متغيرات من الموتر كمدخلات. في هذه الحالة، تعتمد كيفية التعامل مع هذه المتغيرات غير الموجودة على شروط الحشو ، الموضحة على اليمين.

التجميع الأقصى العالمي (GMP) هو نوع محدد من التجميع الأقصى حيث يكون لموتر الإخراج شكلRج{\displaystyle \mathbb {R} ^{C}}والمجال الاستقبالي لـyج{\displaystyle y_{c}}هو كل شيءx0:ح،0:دبليو،ج{\displaystyle x_{0:H,0:W,c}}أي أنه يأخذ القيمة القصوى على مستوى كل قناة. ويُستخدم غالبًا قبل الطبقات المتصلة بالكامل في رأس تصنيف الشبكة العصبية التلافيفية.

متوسط ​​التجميع

يتم تعريف التجميع المتوسط ​​(AvgPool) بشكل مماثلأvزPooل(x|و،s)أنا،ج،ج=أvهـرأزهـ(xأناs:أناs+و-1،جs:جs+و-1،ج)=1و2كأناs:أناs+و-1لجs:جs+و-1xك،ل،ج{\displaystyle \mathrm {AvgPool} (x|f,s)_{i,j,c}=\mathrm {average} (x_{is:is+f-1,js:js+f-1,c})={\frac {1}{f^{2}}}\sum _{k\in is:is+f-1}\sum _{l\in js:js+f-1}x_{k,l,c}}يُعرَّف التجميع المتوسط ​​العالمي (GAP) بشكل مشابه لتقنية التجميع المتوسط ​​العالمي (GMP). وقد طُرح لأول مرة في نموذج الشبكة داخل الشبكة. [ 2 ] ومثل تقنية التجميع المتوسط ​​العالمي، يُستخدم غالبًا قبل الطبقات المتصلة بالكامل الأخيرة في رأس تصنيف الشبكة العصبية التلافيفية (CNN).

الاستيفاء

توجد بعض عمليات الاستيفاء للتجميع الأقصى والتجميع المتوسط.

التجميع المختلط هو مجموع خطي للتجميع الأقصى والتجميع المتوسط. [ 3 ] أي،مأناxهـدPooل(x|و،s،w)=wمأxPooل(x|و،s)+(1-w)أvزPooل(x|و،s){\displaystyle \mathrm {MixedPool} (x|f,s,w)=w\mathrm {MaxPool} (x|f,s)+(1-w)\mathrm {AvgPool} (x|f,s)}أينw[0،1]{\displaystyle w\in [0,1]}إما أن يكون معلمة فائقة، أو معلمة قابلة للتعلم، أو يتم أخذ عينة عشوائية منها من جديد في كل مرة.

يُشبه تجميع Lp تجميع المتوسط، ولكنه يستخدم متوسط ​​معيار Lp بدلاً من المتوسط:yك=(1شمالك في مجال الاستقبال لـ ك|xك|ص)1/ص{\displaystyle y_{k}=\left({\frac {1}{N}}\sum _{k'{\text{ in the receptive field of }}k}|x_{k'}|^{p}\right)^{1/p}}أينشمال{\displaystyle N}حجم المجال الاستقبالي، وص1{\displaystyle p\geq 1}هو مُعامل فائق. إذا كانت جميع التنشيطات غير سالبة، فإن التجميع المتوسط ​​هو حالةص=1{\displaystyle p=1}، والتجميع الأقصى هو حالة منص{\displaystyle p\to \infty }يُعد تجميع الجذر التربيعي مثالاً على ذلك .ص=2{\displaystyle p=2}[ 4 ]

عينات التجميع العشوائي هي تنشيط عشوائيxك{\displaystyle x_{k'}}من المجال الاستقبالي باحتماليةxكك"xك"{\displaystyle {\frac {x_{k'}}{\sum _{k''}x_{k''}}}}وهو ما يعادل التجميع المتوسط ​​في التوقع . [ 5 ]

يشبه تجميع Softmax تجميع max، ولكنه يستخدم دالة softmax ، أيكهـβxكxكك"هـβxك"{\displaystyle {\frac {\sum _{k'}e^{\beta x_{k'}}x_{k'}}{\sum _{k''}e^{\beta x_{k''}}}}}أينβ>0{\displaystyle \beta >0}يُعد تجميع المتوسطات مثالاً على ذلك.β0{\displaystyle \beta \downarrow 0}، والتجميع الأقصى هو حالة منβ{\displaystyle \beta \uparrow \infty }[ 4 ]

يُعمم التجميع القائم على الأهمية المحلية تجميع softmax بواسطةكهـز(xك)xكك"هـز(xك"){\displaystyle {\frac {\sum _{k'}e^{g(x_{k'})}x_{k'}}{\sum _{k''}e^{g(x_{k''})}}}}أينز{\displaystyle g}هي دالة قابلة للتعلم. [ 6 ]

تجميع مناطق الاهتمام بحجم 2×2. في هذا المثال، يبلغ حجم منطقة الاهتمام المقترحة 7×5. تُقسّم هذه المنطقة إلى 4 مستطيلات. ولأن العدد 7 لا يقبل القسمة على 2، يُقسّم إلى أقرب عدد صحيح، حيث 7 = 3 + 4. وبالمثل، يُقسّم العدد 5 إلى 2 + 3. ينتج عن ذلك 4 مستطيلات فرعية. يُؤخذ أكبر حجم في كل مستطيل فرعي. هذه هي نتيجة تجميع مناطق الاهتمام.

تجميعات أخرى

تُطبّق تقنية التجميع الهرمي المكاني التجميع الأقصى (أو أي شكل آخر من أشكال التجميع) في بنية هرمية . أي أنها تُطبّق التجميع الأقصى الشامل، ثم تُطبّقه على الصورة المُقسّمة إلى 4 أجزاء متساوية، ثم إلى 16 جزءًا، وهكذا. بعد ذلك، تُدمج النتائج . وهي شكل هرمي من التجميع الشامل، ومثل التجميع الشامل، تُستخدم غالبًا قبل رأس التصنيف مباشرةً. [ 7 ]

يُعد تجميع منطقة الاهتمام (المعروف أيضًا باسم تجميع RoI) أحد أنواع التجميع الأقصى المستخدم في الشبكات العصبية الالتفافية R-CNNs للكشف عن الأجسام . [ 8 ] وهو مصمم لأخذ مصفوفة إدخال ذات حجم عشوائي، وإخراج مصفوفة إخراج ذات حجم ثابت.

تحسب عملية تجميع التغاير مصفوفة التغاير للمتجهات.{xك،ل،0:ج-1}كأناs:أناs+و-1،لجs:جs+و-1{\displaystyle \{x_{k,l,0:C-1}\}_{k\in is:is+f-1,l\in js:js+f-1}}ثم يتم تسويتها إلىج2{\displaystyle C^{2}}متجه ذو أبعادyأنا،ج،0:ج2-1{\displaystyle y_{i,j,0:C^{2}-1}}يُستخدم تجميع التغاير العالمي بشكل مشابه لتجميع الحد الأقصى العالمي. ولأن تجميع المتوسط ​​يحسب المتوسط، وهو إحصائية من الدرجة الأولى ، بينما التغاير إحصائية من الدرجة الثانية، يُطلق على تجميع التغاير أيضًا اسم "تجميع الرتبة الثانية". ويمكن تعميمه ليشمل عمليات التجميع من الرتب الأعلى. [ 9 ] [ 10 ]

يعني تجميع التمويه تطبيق طريقة تمويه قبل تقليل حجم العينة. على سبيل المثال، يعني تجميع التمويه Rect-2 أخذ متوسط ​​التجميع عندو=2،s=1{\displaystyle f=2,s=1}ثم أخذ كل بكسل ثانٍ (متطابق معs=2{\displaystyle s=2}). [ 11 ]

تجميع محول الرؤية

في محولات الرؤية (ViT)، توجد الأنواع الشائعة التالية من عمليات التجميع.

يستخدم التجميع الشبيه بـ BERT[CLS] رمزًا وهميًا يُسمى "التصنيف". في عملية التصنيف، يكون الناتج[CLS]هو رمز التصنيف، والذي تتم معالجته بواسطة وحدة LayerNorm -feedforward-softmax لتحويله إلى توزيع احتمالي، وهو ما يمثل تنبؤ الشبكة بتوزيع احتمالية الفئة. هذا هو التوزيع المستخدم في كل من ViT الأصلي [ 12 ] و Masked Autoencoder [ 13 ] .

لا تستخدم طريقة التجميع المتوسط ​​العالمي (GAP) الرمز الوهمي، بل تعتمد ببساطة على متوسط ​​جميع رموز الإخراج كرمز تصنيف. وقد ذُكرت في ViT الأصلية على أنها جيدة بنفس القدر. [ 12 ]

تُطبّق تقنية تجميع الانتباه متعدد الرؤوس (MAP) كتلة انتباه متعددة الرؤوس على عملية التجميع. وتحديدًا، تأخذ هذه التقنية قائمة من المتجهات كمدخل.x1،x2،...،xن{\displaystyle x_{1},x_{2},\dots ,x_{n}}والتي يمكن اعتبارها متجهات الإخراج لطبقة من طبقات ViT. ثم يتم تطبيق طبقة تغذية أمامية.FFشمال{\displaystyle \mathrm {FFN} }على كل متجه، مما ينتج عنه مصفوفةV=[FFشمال(v1)،...،FFشمال(vن)]{\displaystyle V=[\mathrm {FFN} (v_{1}),\dots ,\mathrm {FFN} (v_{n})]}ثم يتم إرسال هذا إلى آلية انتباه متعددة الرؤوس، مما ينتج عنهمuلتأناحهـأدهـدأتتهـنتأناoن(سؤال،V،V){\displaystyle \mathrm {MultiheadedAttention} (Q,V,V)}، أينسؤال{\displaystyle Q}هي مصفوفة من المعاملات القابلة للتدريب. [ 14 ] وقد طُرح هذا لأول مرة في بنية Set Transformer. [ 15 ]

أظهرت دراسات لاحقة أن كلاً من GAP وMAP يتفوقان على التجميع الشبيه بـBERT. [ 14 ] [ 16 ]

تجميع الشبكات العصبية البيانية

في الشبكات العصبية البيانية (GNN)، يوجد نوعان من التجميع: التجميع العالمي والتجميع المحلي. يمكن اختزال التجميع العالمي إلى تجميع محلي حيث يكون حقل الاستقبال هو المخرجات بأكملها.

  1. التجميع المحلي : تعمل طبقة التجميع المحلي على تقليل دقة الرسم البياني عبر تقليل حجمه . يُستخدم التجميع المحلي لزيادة مجال الاستقبال في شبكة الرسوم البيانية العصبية، على غرار طبقات التجميع في الشبكات العصبية الالتفافية . من الأمثلة على ذلك: تجميع أقرب k جار ، وتجميع أعلى k عنصر، [ 17 ] وتجميع الانتباه الذاتي. [ 18 ]
  2. التجميع العالمي : توفر طبقة التجميع العالمي، والمعروفة أيضًا بطبقة القراءة ، تمثيلًا ثابت الحجم للرسم البياني بأكمله. يجب أن تكون طبقة التجميع العالمي ثابتةً بغض النظر عن التبديلات، بحيث لا تؤثر التبديلات في ترتيب عقد الرسم البياني وحوافه على الناتج النهائي. [ 19 ] تشمل الأمثلة الجمع والمتوسط ​​والقيمة القصوى لكل عنصر.

تعمل طبقات التجميع المحلية على تقليل دقة الرسم البياني عبر تقليل حجمه. نعرض هنا عدة استراتيجيات تجميع محلية قابلة للتعلم تم اقتراحها. [ 19 ] في كل حالة، يتم تمثيل المدخلات في الرسم البياني الأولي بواسطة مصفوفة.X{\displaystyle \mathbf {X} }خصائص العقدة ومصفوفة تجاور الرسم البيانيأ{\displaystyle \mathbf {A} }الناتج هو المصفوفة الجديدةX{\displaystyle \mathbf {X} '}من خصائص العقدة ومصفوفة تجاور الرسم البياني الجديدةأ{\displaystyle \mathbf {A} '}.

تجميع Top-k

لقد حددنا أولاً

y=Xصص{\displaystyle \mathbf {y} ={\frac {\mathbf {X} \mathbf {p} }{\Vert \mathbf {p} \Vert }}}

أينص{\displaystyle \mathbf {p} }هو متجه إسقاط قابل للتعلم . متجه الإسقاطص{\displaystyle \mathbf {p} }يحسب قيمة إسقاط قياسية لكل عقدة في الرسم البياني.

يمكن بعد ذلك صياغة طبقة التجميع ذات أعلى k عنصر [ 17 ] على النحو التالي:

X=(Xالمنحنى السيني(y))أنا{\displaystyle \mathbf {X} '=(\mathbf {X} \odot {\text{sigmoid}}(\mathbf {y} ))_{\mathbf {i} }}
أ=أأنا،أنا{\displaystyle \mathbf {A} '=\mathbf {A} _{\mathbf {i} ,\mathbf {i} }}

أينأنا=قمةك(y){\displaystyle \mathbf {i} ={\text{top}}_{k}(\mathbf {y} )}هي مجموعة فرعية من العقد التي حصلت على أعلى k درجة إسقاط،{\displaystyle \odot }يرمز إلى ضرب المصفوفات عنصرًا بعنصر ، والمنحنى السيني(){\displaystyle {\text{sigmoid}}(\cdot )}هي دالة سيجمويد . بعبارة أخرى، يتم الاحتفاظ بالعقد ذات أعلى k درجة إسقاط في مصفوفة التجاور الجديدة.أ{\displaystyle \mathbf {A} '}. الالمنحنى السيني(){\displaystyle {\text{sigmoid}}(\cdot )}تُنشئ العملية متجه الإسقاطص{\displaystyle \mathbf {p} }يمكن تدريبها عن طريق الانتشار العكسي ، والذي ينتج عنه مخرجات منفصلة في غير ذلك. [ 17 ]

تجميع الانتباه الذاتي

لقد حددنا أولاً

y=شبكة عصبية عالمية(X،أ){\displaystyle \mathbf {y} ={\text{GNN}}(\mathbf {X} ,\mathbf {A} )}

أينشبكة عصبية عالمية{\displaystyle {\text{GNN}}}هي طبقة GNN عامة متغيرة بالتبديل (مثل GCN، GAT، MPNN).

يمكن بعد ذلك صياغة طبقة تجميع الانتباه الذاتي [ 18 ] على النحو التالي:

X=(Xy)أنا{\displaystyle \mathbf {X} '=(\mathbf {X} \odot \mathbf {y} )_{\mathbf {i} }}
أ=أأنا،أنا{\displaystyle \mathbf {A} '=\mathbf {A} _{\mathbf {i} ,\mathbf {i} }}

أينأنا=قمةك(y){\displaystyle \mathbf {i} ={\text{top}}_{k}(\mathbf {y} )}هي مجموعة فرعية من العقد التي حصلت على أعلى k درجة إسقاط،{\displaystyle \odot }يشير إلى ضرب المصفوفات عنصرًا بعنصر .

يمكن اعتبار طبقة تجميع الانتباه الذاتي امتدادًا لطبقة تجميع أعلى k. وبخلاف تجميع أعلى k، فإن درجات الانتباه الذاتي المحسوبة في تجميع الانتباه الذاتي تأخذ في الاعتبار كلًا من خصائص الرسم البياني وبنيته.

تاريخ

في أوائل القرن العشرين، لاحظ علماء التشريح العصبي نمطًا معينًا حيث تتشابك عدة خلايا عصبية مع نفس الخلية العصبية. وقد عُزِيَ هذا النمط وظيفيًا باسم "التجميع الموضعي"، مما يجعل الرؤية ثابتة بغض النظر عن موقعها. وقدّم هارتلاين أدلة داعمة لهذه النظرية من خلال تجارب فيزيولوجية كهربائية على الحقول الاستقبالية لخلايا العقدة الشبكية. [ 20 ] وأظهرت تجارب هوبل وويزل أن نظام الرؤية لدى القطط يشبه الشبكة العصبية الالتفافية، حيث تقوم بعض الخلايا بجمع المدخلات من الطبقة السفلية. [ 21 ] : انظر الشكلين 19 و20. للاطلاع على مراجع هذه الدراسات المبكرة، انظر ويستهايمر. [ 22 ]

خلال سبعينيات القرن العشرين، ولتفسير تأثيرات إدراك العمق ، اقترح بعض الباحثين، مثل جولز وتشانغ، أن الجهاز البصري يُفعّل آلية انتقائية للتباين عبر التجميع الشامل، حيث تُجمع مخرجات أزواج متطابقة من مناطق الشبكية في العينين في خلايا ذات رتبة أعلى. [ 23 ] انظر شومر وجانز للاطلاع على مراجع هذه الدراسات المبكرة. [ 24 ]

في الشبكات العصبية الاصطناعية، تم استخدام التجميع الأقصى في عام 1990 لمعالجة الكلام (الالتفاف أحادي البعد)، [ 25 ] وفي معالجة الصور، تم استخدامه لأول مرة في جهاز Cresceptron عام 1992. [ 26 ]

انظر أيضاً

مراجع

  1. تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "7.5. التجميع" . الغوص في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
  2. ^ لين، مين؛ تشن، تشيانغ. يان، شويتشنغ (2013). "الشبكة في الشبكة". أرخايف : 1312.4400 [ cs.NE ].
  3. يو، دينغجون؛ وانغ، هانلي؛ تشين، بيتشيو؛ وي، تشيهوا (2014). "التجميع المختلط للشبكات العصبية الالتفافية" . في: مياو، دوتشيان؛ بيدريتش، ويتولد؛ سليزاك، دومينيك؛ بيترز، جورج؛ هو، تشينغهوا؛ وانغ، رويتشي (محررون). المجموعات التقريبية وتكنولوجيا المعرفة . سلسلة محاضرات في علوم الحاسوب. المجلد 8818. تشام: دار نشر سبرينغر الدولية. الصفحات 364-375 . doi : 10.1007/978-3-319-11740-9_34 . ISBN   978-3-319-11740-9.
  4. 1 2 بوريو، واي-لان؛ بونس، جان؛ لوكون، يان (21-06-2010). "تحليل نظري لتجميع الميزات في التعرف البصري" . وقائع المؤتمر الدولي السابع والعشرين للتعلم الآلي . ICML'10. ماديسون، ويسكونسن، الولايات المتحدة الأمريكية: أومنيبريس: 111-118 . ISBN 978-1-60558-907-7.
  5. زيلر، ماثيو د.؛ فيرغوس، روب (2013-01-15). "التجميع العشوائي لتنظيم الشبكات العصبية التلافيفية العميقة". arXiv : 1301.3557 [ cs.LG ].
  6. ^ جاو، زيتنج؛ وانغ، ليمين؛ وو ، جانجشان (2019). "LIP: التجميع على أساس الأهمية المحلية" : 3355– 3364. أرخايف : 1908.04156 .{{cite journal}}يتطلب الاستشهاد بالمجلة ( مساعدة )|journal=
  7. هي، كايمينغ؛ تشانغ، شيانغيو؛ رن، شاوكينغ؛ صن، جيان (2015-09-01). "تجميع الهرم المكاني في الشبكات العصبية التلافيفية العميقة للتعرف البصري". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 37 (9): 1904-1916 . arXiv : 1406.4729 . Bibcode : 2015ITPAM..37.1904H . doi : 10.1109/TPAMI.2015.2389824 . ISSN 0162-8828 . PMID 26353135 .  
  8. تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "14.8. الشبكات العصبية الالتفافية القائمة على المناطق (R-CNNs)" . تعمق في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
  9. توزيل، أونجيل؛ بوريكلي، فاتح؛ مير، بيتر (2006). "تباين المنطقة: واصف سريع للكشف والتصنيف" . في ليوناردس، أليش؛ بيشوف، هورست؛ بينز، أكسل (محررون). رؤية الحاسوب - المؤتمر الأوروبي لرؤية الحاسوب 2006. المجلد 3952. برلين، هايدلبرغ: سبرينغر برلين هايدلبرغ. الصفحات 589-600 . doi : 10.1007/11744047_45 . ISBN   978-3-540-33834-5تم الاطلاع عليه بتاريخ 2024-09-09 .
  10. وانغ، تشيلونغ؛ شي، جيانغتاو؛ تسو، وانغمينغ؛ تشانغ، لي؛ لي، بيهوا (2020). "الشبكات العصبية التلافيفية العميقة تلتقي بتجميع التغاير العالمي: تمثيل وتعميم أفضل". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 43 (8): 2582-2597 . arXiv : 1904.06836 . doi : 10.1109/TPAMI.2020.2974833 . ISSN 0162-8828 . PMID 32086198 .  
  11. تشانغ، ريتشارد (27-09-2018). "جعل الشبكات الالتفافية غير متغيرة مع الإزاحة مرة أخرى" . arXiv : 1904.11486 .{{cite journal}}يتطلب الاستشهاد بالمجلة ( مساعدة )|journal=
  12. 1 2 دوسوفيتسكي، أليكسي؛ باير، لوكاس. كوليسنيكوف، الكسندر؛ ويسينبورن، ديرك. تشاي، شياو هوا؛ أونترثينر، توماس؛ دهقاني، مصطفى؛ مينديرر، ماتياس؛ هيجولد، جورج. جيلي، سيلفان. أوسزكوريت ، جاكوب (2021-06-03). “الصورة تستحق 16 × 16 كلمة: محولات للتعرف على الصور على نطاق واسع”. أرخايف : 2010.11929 [ cs.CV ].
  13. هي، كايمينغ؛ تشين، شينلي؛ شي، ساينينغ؛ لي، يانغهاو؛ دولار، بيوتر؛ غيرشيك، روس (يونيو 2022). "المشفرات التلقائية المقنعة هي متعلمات رؤية قابلة للتوسع" . مؤتمر IEEE/CVF لعام 2022 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. الصفحات 15979-15988 . arXiv : 2111.06377 . doi : 10.1109/cvpr52688.2022.01553 . ISBN  978-1-6654-6946-3.
  14. 1 2 تشاي، شياوهوا؛ كوليسنيكوف، ألكسندر؛ هولزبي، نيل؛ باير، لوكاس (يونيو 2022). "توسيع نطاق محولات الرؤية" . مؤتمر IEEE/CVF لعام 2022 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. الصفحات 1204-1213 . arXiv : 2106.04560 . doi : 10.1109/cvpr52688.2022.01179 . ISBN  978-1-6654-6946-3.
  15. لي، جوهو؛ لي، يون هو؛ كيم، جونغ تايك؛ كوسوريك، آدم؛ تشوي، سيونغ جين؛ تيه، يي واي (24 مايو 2019). "محول المجموعة: إطار عمل للشبكات العصبية الثابتة التبديل القائمة على الانتباه" . وقائع المؤتمر الدولي السادس والثلاثين للتعلم الآلي . PMLR: 3744–3753 . arXiv : 1810.00825 .
  16. كارامشيتي، سيدهارث؛ ناير، سوراج؛ تشين، آني س.؛ كولار، توماس؛ فين، تشيلسي؛ صديق، دورسا؛ ليانغ، بيرسي (24-02-2023). "تعلم التمثيل القائم على اللغة للروبوتات". arXiv : 2302.12766 [ cs.RO ].
  17. 1 2 3 جاو، هونغيانغ؛ جي شويوانج جي (2019). “الرسم البياني لشبكات U”. أرخايف : 1905.05178 [ أ cs.LG أ ].
  18. 1 2 لي، جون هيون؛ لي، إنيوب؛ كانغ، جاي وو (2019). "تجميع الرسم البياني للانتباه الذاتي". arXiv : 1904.08082 [ cs.LG ].
  19. 1 2 ليو، تشوانغ؛ زان، ييبينغ؛ لي تشانغ. دو، بو؛ وو، جيا؛ هو، وينبين؛ ليو، تونجليانج؛ تاو، داتشنغ (2022). “تجميع الرسم البياني للشبكات العصبية الرسومية: التقدم والتحديات والفرص”. أرخايف : 2204.07321 [ cs.LG ].
  20. هارتلاين، إتش كيه (30 سبتمبر 1940). "الحقول الاستقبالية لألياف العصب البصري" . المجلة الأمريكية لعلم وظائف الأعضاء. المحتوى التراثي . 130 (4): 690-699 . doi : 10.1152/ajplegacy.1940.130.4.690 . ISSN 0002-9513 . 
  21. هوبل، د.هـ؛ ويزل، ت.ن. (يناير 1962). "الحقول الاستقبالية، والتفاعل بين العينين، والبنية الوظيفية في القشرة البصرية للقطط" . مجلة علم وظائف الأعضاء . 160 (1): 106-154.2. doi : 10.1113/jphysiol.1962.sp006837 . ISSN 0022-3751 . PMC 1359523. PMID 14449617 .   
  22. ويستهايمر، ج . (ديسمبر 1965). "التفاعل المكاني في شبكية العين البشرية أثناء الرؤية الليلية" . مجلة علم وظائف الأعضاء . 181 (4): 881-894 . doi : 10.1113/jphysiol.1965.sp007803 . ISSN 0022-3751 . PMC 1357689. PMID 5881260 .   
  23. جولز، بيلا؛ تشانغ، جيه جي (مارس 1976). "التفاعل بين مجموعات من كاشفات التباين البصري الثنائي المُضبوطة على تباينات مختلفة" . علم التحكم الآلي البيولوجي . 22 (2): 107-119 . doi : 10.1007/BF00320135 . ISSN 0340-1200 . PMID 1276243 .  
  24. شومر، روبرت؛ غانز، ليو (1979-01-01). "قنوات مجسمة مستقلة لدرجات مختلفة من التجميع المكاني" . أبحاث الرؤية . 19 (12): 1303-1314 . doi : 10.1016/0042-6989(79)90202-5 . ISSN 0042-6989 . PMID 532098 .  
  25. ياماغوتشي، كويتشي؛ ساكاموتو، كينجي؛ أكاباني، توشيو؛ فوجيموتو، يوشيجي (نوفمبر 1990). شبكة عصبية للتعرف على الكلمات المنفردة بغض النظر عن المتحدث . المؤتمر الدولي الأول لمعالجة اللغة المنطوقة (ICSLP 90). كوبي، اليابان. مؤرشف من الأصل في 7 مارس 2021. تم الاطلاع عليه في 4 سبتمبر 2019 .
  26. وينغ، ج.؛ أهوجا، ن.؛ هوانغ، ت.س. (1992). "كريسبترون: شبكة عصبية ذاتية التنظيم تنمو بشكل تكيفي". [ وقائع المؤتمر الدولي المشترك للشبكات العصبية IJCNN لعام 1992. المجلد 1. معهد مهندسي الكهرباء والإلكترونيات. الصفحات 576-581 . doi : 10.1109/IJCNN.1992.287150 . ISBN   978-0-7803-0559-5.