المُدرِك
يُعدّ Perceiver نموذجًا مُعدَّلًا من بنية Transformer ، مُكيَّفًا لمعالجة أنواع البيانات المختلفة، مثل الصور والأصوات والفيديوهات والبيانات المكانية . وعلى عكس أنظمة Transformer السابقة البارزة، مثل BERT و GPT-3 ، المصممة لمعالجة النصوص، صُمِّم Perceiver كبنية عامة قادرة على التعلُّم من كميات هائلة من البيانات غير المتجانسة. ويحقق ذلك من خلال آلية انتباه غير متماثلة لتصفية المدخلات في عنق زجاجة كامن.
يُضاهي أداء النموذج المُدرِك أو يتفوق على النماذج المتخصصة في مهام التصنيف. [ 1 ]
تم طرح برنامج Perceiver في يونيو 2021 من قبل شركة DeepMind . [ 1 ] تبعه برنامج Perceiver IO في أغسطس 2021. [ 2 ]
تصميم
صُمم نموذج Perceiver بدون عناصر خاصة بكل نمط من أنماط الإدخال . على سبيل المثال، لا يحتوي على عناصر متخصصة في معالجة الصور أو النصوص أو الصوت. كما أنه قادر على معالجة تدفقات إدخال متعددة مترابطة من أنواع مختلفة. يستخدم النموذج مجموعة صغيرة من الوحدات الكامنة التي تُشكل عنق زجاجة انتباه يجب أن تمر عبره المدخلات. ومن فوائده التخلص من مشكلة التوسع التربيعي التي كانت موجودة في نماذج Transformers القديمة. وقد استخدمت الأعمال السابقة مستخلصات ميزات مخصصة لكل نمط من أنماط الإدخال. [ 1 ]
يربط هذا النظام كل عنصر إدخال (مثل كل بكسل أو عينة صوتية) بخصائص خاصة بالموقع والنمط. ويمكن تعلم هذه الخصائص أو إنشاؤها باستخدام خصائص فورييه عالية الدقة . [ 1 ]
يستخدم جهاز الإدراك آلية الانتباه المتبادل لإنتاج طبقات ذات تعقيد خطي وفصل عمق الشبكة عن حجم المدخلات. يسمح هذا الفصل بإنشاء بنى أعمق. [ 1 ]
عناصر
تقوم وحدة الانتباه المتقاطع بربط مصفوفة بايت (أكبر حجمًا) (مثل مصفوفة بكسل) ومصفوفة كامنة (أصغر حجمًا) بمصفوفة كامنة أخرى، مما يقلل الأبعاد . أما برج المحولات فيربط مصفوفة كامنة بأخرى، تُستخدم للاستعلام عن المدخلات مرة أخرى. يتناوب المكونان في العمل. يستخدم كلا المكونين آلية انتباه الاستعلام-المفتاح-القيمة (QKV). تُطبق آلية انتباه QKV شبكات الاستعلام والمفتاح والقيمة، وهي عادةً ما تكون شبكات عصبية متعددة الطبقات ، على كل عنصر من عناصر مصفوفة الإدخال، مما ينتج ثلاث مصفوفات تحافظ على بُعد الفهرس (أو طول التسلسل) لمدخلاتها.
المستشعر IO
يستطيع Perceiver IO الاستعلام بمرونة عن الفضاء الكامن للنموذج لإنتاج مخرجات ذات أحجام ودلالات مختلفة. ويحقق نتائج ممتازة في المهام ذات فضاءات المخرجات المنظمة، مثل فهم اللغة الطبيعية والفهم البصري ، ولعبة StarCraft II ، والمهام المتعددة. يتطابق Perceiver IO مع نموذج BERT الأساسي القائم على Transformer في معيار GLUE للغة دون الحاجة إلى تجزئة المدخلات ، ويحقق أداءً متطورًا في تقدير التدفق البصري لـ Sintel . [ 2 ]
تُنتَج المخرجات من خلال معالجة المصفوفة الكامنة باستخدام استعلام مُحدد مرتبط بتلك المخرجات. على سبيل المثال، للتنبؤ بالتدفق البصري على بكسل واحد، يُستخدم استعلام يعتمد على إحداثيات البكسل (س، ص) بالإضافة إلى تضمين مهمة التدفق البصري لإنتاج متجه تدفق واحد. يُعد هذا شكلاً مُعدَّلاً من بنية المُشفِّر/المُفكِّك المُستخدمة في تصميمات أخرى. [ 2 ]
أداء
يُضاهي أداء نموذج Perceiver أداء نموذجي ResNet -50 و ViT على مجموعة بيانات ImageNet بدون استخدام الالتفافات ثنائية الأبعاد . وهو قادر على معالجة 50,000 بكسل . ويُعدّ منافسًا قويًا في جميع أنماط الصوت في مجموعة بيانات AudioSet . [ 1 ]
انظر أيضاً
مراجع
- 1 2 3 4 5 6 جايجل، أندرو؛ جيمينو، فيليكس؛ بروك، أندرو؛ زيسرمان، أندرو؛ فينيالز، أوريول؛ كاريرا، جواو (22-06-2021). "المُدرِك: الإدراك العام مع الانتباه التكراري". arXiv : 2103.03206 [ cs.CV ].
- 1 2 3 جايجل، أندرو؛ بورجود، سيباستيان. اليراك، جان بابتيست؛ دورش، كارل؛ إيونيسكو، كاتالين؛ دينغ، ديفيد؛ كوبولا، سكاندا؛ زوران، دانيال؛ بروك، أندرو. شلهامر، إيفان. هيناف ، أوليفييه (2021-08-02). “Perceiver IO: بنية عامة للمدخلات والمخرجات المنظمة”. أرخايف : 2107.14795 [ cs.LG ].
روابط خارجية
- شرح ورقة بحثية حول DeepMind Perceiver وPerceiver IO على يوتيوب
- شرح ورقة بحثية من جوجل ديب مايند بعنوان "المُدرِك: الإدراك العام مع الانتباه التكراري" على يوتيوب ، مع شرح ميزات فورييه بمزيد من التفصيل.
- التعلم الآلي
