التعرف على الكلام السمعي البصري
التعرف على الكلام السمعي البصري ( AVSR ) هو تقنية تستخدم إمكانيات معالجة الصور في قراءة الشفاه لمساعدة أنظمة التعرف على الكلام في التعرف على الأصوات غير المحددة أو إعطاء الأفضلية بين القرارات ذات الاحتمالية القريبة.
يعمل كل نظام من أنظمة قراءة الشفاه والتعرف على الكلام بشكل منفصل، ثم تُدمج نتائجهما في مرحلة دمج الميزات . وكما يوحي الاسم، يتكون هذا النظام من جزأين: الأول صوتي والثاني مرئي. في الجزء الصوتي، نستخدم ميزات مثل مخطط الطيف اللوغاريتمي ميلي، ومعاملات الترددات المتعددة (MFCC)، وغيرها، من عينات الصوت الخام، ونبني نموذجًا لاستخراج متجه الميزات منها. أما في الجزء المرئي، فنستخدم عادةً نوعًا من الشبكات العصبية الالتفافية لضغط الصورة وتحويلها إلى متجه ميزات، ثم ندمج هذين المتجهين (الصوتي والمرئي) ونحاول التنبؤ بالكائن المستهدف.
روابط خارجية
- أبحاث شركة آي بي إم - تقنيات الكلام السمعية والبصرية
- أرغب في الاستماع في حفل كوكتيل
- مدونة جوجل للذكاء الاصطناعي
فئات :
- اللغويات الحاسوبية
- التعرف على الكلام
- تطبيقات رؤية الحاسوب
- التفاعل متعدد الوسائط
- نماذج أولية للذكاء الاصطناعي
- مقالات قصيرة في اللغويات الحاسوبية
