تقدير المتحدث
التعرف على المتحدث هو تحديد هوية الشخص من خلال خصائص صوته. [ 1 ] ويُستخدم للإجابة على السؤال "من المتحدث؟". يُمكن أن يُشير مصطلح التعرف على الصوت [ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 6 ] إلى التعرف على المتحدث أو التعرف على الكلام . ويختلف التحقق من هوية المتحدث (ويُسمى أيضًا مصادقة المتحدث ) عن تحديد الهوية، كما يختلف التعرف على المتحدث عن تحديد هوية المتحدث (التعرف على متى يتحدث نفس المتحدث).
يُمكن أن يُسهّل التعرّف على المتحدث مهمة ترجمة الكلام في الأنظمة المُدرّبة على أصوات مُحدّدة، أو يُمكن استخدامه للتحقق من هوية المتحدث كجزء من عملية أمنية. ويعود تاريخ تقنية التعرّف على المتحدث إلى نحو أربعة عقود (حتى عام ٢٠١٩)، وتعتمد على الخصائص الصوتية للكلام التي وُجد أنها تختلف بين الأفراد. وتعكس هذه الأنماط الصوتية كلاً من التشريح وأنماط السلوك المُكتسبة.
التحقق مقابل تحديد الهوية
تُستخدم تقنيات ومنهجيات التعرف على المتحدثين في تطبيقين رئيسيين. أولهما التحقق من هوية المتحدث، حيث يُستخدم صوته للتحقق من صحة ادعائه. أما ثانيهما، فهو تحديد هوية متحدث مجهول. بمعنى آخر، يُعد التحقق من هوية المتحدث تطابقًا تامًا، حيث يُطابق صوت المتحدث مع نموذج صوتي محدد، بينما يُعد تحديد هوية المتحدث تطابقًا متعددًا، حيث يُقارن الصوت بنماذج صوتية متعددة.
من منظور أمني، يختلف تحديد الهوية عن التحقق. يُستخدم التحقق من المتحدث عادةً كآلية "حماية" لتوفير الوصول إلى نظام آمن. تعمل هذه الأنظمة بعلم المستخدمين وتتطلب تعاونهم في الغالب. كما يمكن تطبيق أنظمة تحديد هوية المتحدث سرًا دون علم المستخدم لتحديد المتحدثين في النقاش، وتنبيه الأنظمة الآلية بتغييرات المتحدثين، والتحقق مما إذا كان المستخدم مسجلاً بالفعل في النظام، وما إلى ذلك.
في التطبيقات الجنائية، من الشائع البدء بعملية تحديد هوية المتحدث لإنشاء قائمة بأفضل التطابقات، ثم إجراء سلسلة من عمليات التحقق لتحديد التطابق النهائي. يساعد العمل على مطابقة عينات صوت المتحدث مع قائمة أفضل التطابقات في تحديد ما إذا كانا الشخص نفسه بناءً على مقدار التشابه أو الاختلاف. يستخدم الادعاء والدفاع هذا كدليل لتحديد ما إذا كان المشتبه به هو الجاني بالفعل. [ 7 ]
تمرين
كانت إحدى أوائل تقنيات التدريب التي تم تسويقها تجاريًا هي دمية جولي من إنتاج شركة وورلدز أوف وندر عام ١٩٨٧. في ذلك الوقت، كان استقلال الصوت عن المتحدث إنجازًا هامًا، وكانت الأنظمة تتطلب فترة تدريب. حمل إعلان للدمية عام ١٩٨٧ شعار "أخيرًا، الدمية التي تفهمك" - على الرغم من وصفها بأنها منتج "يمكن للأطفال تدريبه على الاستجابة لأصواتهم". [ ٨ ] حتى بعد عقد من الزمن، كان مصطلح التعرف على الصوت يشير إلى استقلال الصوت عن المتحدث. [ ٩ ]
أنواع التعرف على المتحدث
يتألف كل نظام للتعرف على المتحدث من مرحلتين: التسجيل والتحقق. خلال مرحلة التسجيل، يُسجل صوت المتحدث، وعادةً ما تُستخرج عدة خصائص لتكوين بصمة صوتية أو نموذج. [ 10 ] في مرحلة التحقق، تُقارن عينة الكلام أو "الجملة" ببصمة صوتية مُنشأة مسبقًا. بالنسبة لأنظمة التعرف، تُقارن الجملة ببصمات صوتية متعددة لتحديد أفضل تطابق، بينما تُقارن أنظمة التحقق الجملة ببصمة صوتية واحدة. ونظرًا لطبيعة هذه العملية، فإن التحقق أسرع من التعرف.
تنقسم أنظمة التعرف على المتحدث إلى فئتين: أنظمة تعتمد على النص وأنظمة لا تعتمد عليه. [ 11 ] يتطلب التعرف المعتمد على النص أن يكون النص متطابقًا في كلٍ من التسجيل والتحقق. [ 12 ] في هذا النوع من الأنظمة، يمكن أن تكون التعليمات مشتركة بين جميع المتحدثين (مثل عبارة مرور مشتركة) أو فريدة. بالإضافة إلى ذلك، يمكن استخدام الأسرار المشتركة (مثل كلمات المرور وأرقام التعريف الشخصية) أو المعلومات المستندة إلى المعرفة لإنشاء سيناريو مصادقة متعددة العوامل . في المقابل، لا تتطلب الأنظمة التي لا تعتمد على النص استخدام نص محدد. وغالبًا ما تُستخدم لتحديد هوية المتحدث لأنها لا تتطلب سوى القليل من التعاون منه، إن وُجد. في هذه الحالة، يختلف النص المستخدم أثناء التسجيل عن النص المستخدم أثناء الاختبار. في الواقع، قد يتم التسجيل دون علم المستخدم، كما هو الحال في العديد من تطبيقات الطب الشرعي الرقمي. ولأن التقنيات التي لا تعتمد على النص لا تقارن ما قيل أثناء التسجيل والتحقق، فإن تطبيقات التحقق تميل أيضًا إلى استخدام تقنية التعرف على الكلام لتحديد ما يقوله المستخدم عند نقطة المصادقة. في الأنظمة المستقلة عن النص، تُستخدم كل من تقنيات الصوتيات وتحليل الكلام . [ 13 ]
تكنولوجيا
يُعدّ التعرّف على المتحدث مشكلةً في مجال التعرّف على الأنماط . تشمل التقنيات المختلفة المستخدمة لمعالجة وتخزين البصمات الصوتية تقدير التردد ، ونماذج ماركوف المخفية ، ونماذج خليط غاوسي ، وخوارزميات مطابقة الأنماط ، والشبكات العصبية ، وتمثيل المصفوفات ، والتكميم المتجهي، وأشجار القرار . لمقارنة العبارات بالبصمات الصوتية، تُستخدم تقليديًا طرقٌ أبسط، مثل تشابه جيب التمام، لبساطتها وكفاءتها. كما تستخدم بعض الأنظمة تقنيات "مضادة للمتحدث" مثل نماذج المجموعة ونماذج العالم. تُستخدم الميزات الطيفية بشكلٍ أساسي في تمثيل خصائص المتحدث. [ 14 ] يُعدّ الترميز التنبؤي الخطي (LPC) طريقةً لترميز الكلام تُستخدم في التعرّف على المتحدث والتحقق من صحة الكلام .
يمكن أن تعيق مستويات الضوضاء المحيطة جمع عينات الصوت الأولية واللاحقة. يمكن استخدام خوارزميات تقليل الضوضاء لتحسين الدقة، ولكن قد يؤدي تطبيقها بشكل خاطئ إلى نتائج عكسية. قد ينتج تدهور الأداء عن تغيرات في خصائص الصوت، وعن التسجيل باستخدام هاتف والتحقق باستخدام هاتف آخر. من المتوقع زيادة التكامل مع منتجات المصادقة الثنائية . قد تؤثر تغيرات الصوت الناتجة عن التقدم في السن على أداء النظام بمرور الوقت. تقوم بعض الأنظمة بتكييف نماذج المتحدث بعد كل عملية تحقق ناجحة لرصد هذه التغيرات طويلة الأمد في الصوت، على الرغم من وجود جدل حول التأثير الأمني الإجمالي الذي يفرضه التكييف التلقائي.
الآثار القانونية
بسبب سنّ تشريعات مثل اللائحة العامة لحماية البيانات في الاتحاد الأوروبي وقانون خصوصية المستهلك في كاليفورنيا بالولايات المتحدة، ثار جدل واسع حول استخدام تقنية التعرف على الكلام في بيئة العمل. وفي سبتمبر/أيلول 2019، حذّرت شركة Soapbox Labs الأيرلندية المتخصصة في تطوير تقنية التعرف على الكلام من التداعيات القانونية المحتملة. [ 15 ]
التطبيقات
تم تقديم أول براءة اختراع دولية في عام 1983، والتي جاءت من أبحاث الاتصالات السلكية واللاسلكية في CSELT [ 16 ] (إيطاليا) بواسطة ميشيل كافاتزا وألبرتو سياراميلا كأساس لكل من خدمات الاتصالات المستقبلية للعملاء النهائيين ولتحسين تقنيات الحد من الضوضاء عبر الشبكة.
بين عامي 1996 و1998، استُخدمت تقنية التعرف على المتحدثين عند معبر سكوبي-كوروناك الحدودي لتمكين السكان المحليين المسجلين، الذين لا يحملون أي وثائق للتصريح بها، من عبور الحدود الكندية الأمريكية عندما كانت مراكز التفتيش مغلقة ليلاً. [ 17 ] طُوّر هذا النظام لصالح دائرة الهجرة والتجنيس الأمريكية من قِبل شركة فويس ستراتيجيز في وارن، ميشيغان.
في عام 2013، أصبحت باركليز ويلث، قسم الخدمات المصرفية الخاصة في بنك باركليز، أول شركة خدمات مالية تستخدم القياسات الحيوية الصوتية كوسيلة أساسية لتحديد هوية العملاء في مراكز الاتصال التابعة لها . استخدم النظام تقنية التعرف السلبي على المتحدث للتحقق من هوية المتصلين عبر الهاتف في غضون 30 ثانية من بدء المحادثة. [ 18 ] وقد طورت هذا النظام شركة نوانس (التي استحوذت في عام 2011 على شركة لوكويندو ، وهي شركة منبثقة عن شركة سيسلت نفسها المتخصصة في تكنولوجيا الكلام)، وهي الشركة المطورة لتقنية سيري من آبل . وقد منح 93% من العملاء النظام تقييم "9 من 10" من حيث السرعة وسهولة الاستخدام والأمان. [ 19 ]
يمكن أيضًا استخدام تقنية التعرف على المتحدث في التحقيقات الجنائية، مثل تلك المتعلقة بعمليات الإعدام التي وقعت عام 2014، والتي شملت من بين آخرين جيمس فولي وستيفن سوتلوف . [ 20 ]
في فبراير 2016، أعلن بنك HSBC البريطاني الشهير وبنك التجزئة الإلكتروني التابع له First Direct أنهما سيقدمان لـ 15 مليون عميل برنامج الخدمات المصرفية البيومترية الخاص بهما للوصول إلى حساباتهم عبر الإنترنت والهاتف باستخدام بصمات أصابعهم أو أصواتهم. [ 21 ]
في عام 2023، أثبتت كل من فايس نيوز وذا غارديان بشكل منفصل قدرتهما على اختراق أنظمة التحقق من هوية المتحدثين المالية القياسية باستخدام أصوات مُولّدة بالذكاء الاصطناعي من عينات صوتية مدتها حوالي خمس دقائق للشخص المستهدف. [ 22 ] [ 23 ]
انظر أيضاً
- القوائم
ملحوظات
- ↑ بودار، أرناب؛ شهيد الله، محمد؛ ساها، غوتام (27 نوفمبر 2017). "التحقق من هوية المتحدث باستخدام عبارات قصيرة: مراجعة للتحديات والاتجاهات والفرص". مجلة IET Biometrics ، 7 (2). معهد الهندسة والتكنولوجيا (IET): 91-101 . doi : 10.1049/iet-bmt.2017.0065 . ISSN 2047-4938 .
- ↑ لاس، نورمان ج. (1974). علم الصوتيات التجريبي . مؤسسة إم إس إس للمعلومات. ص 251-258 . ISBN 978-0-8422-5149-5.
- ↑ فان لانكر، ديانا؛ كريمان، جودي؛ إيموري، كارين (1985). "التعرف على الأصوات المألوفة: الأنماط والمعايير، الجزء الأول: التعرف على الأصوات المعكوسة" . مجلة علم الصوتيات . 13 (1). إلسيفير بي في: 19-38 . doi : 10.1016/s0095-4470(19)30723-5 . ISSN 0095-4470 .
- ↑ "التعرف على الصوت (اسم): التعريف والمرادفات" . macmillandictionary.com . 23 يناير 2010. مؤرشف من الأصل في 27 مارس 2023. تم الاطلاع عليه في 13 أكتوبر 2023 .
- ↑ "ما هو التعرف على الصوت؟ التعريف والمعنى" . businessdictionary.com . 6 أكتوبر 2008. مؤرشف من الأصل في 3 ديسمبر 2011.
- ↑ "حقيبة البريد LG #114" . جريدة لينكس . 28 مارس 2005.
- ↑ روز، فيل؛ أوساناي، تاكاشي؛ كينوشيتا، يوكو (6 أغسطس/آب 2003). "قوة أدلة تحديد هوية المتحدث في الطب الشرعي: التمييز المقطعي القائم على الترددات الرنانة والسيبستروم لمتحدثين متعددين باستخدام نسبة الاحتمالية البايزية كعتبة". المجلة الدولية للكلام واللغة والقانون . 10 (2). دار إكوينوكس للنشر: 179-202 . doi : 10.1558/sll.2003.10.2.179 . ISSN 1748-8893 .
- ↑ بينولا، ميلاني (2 نوفمبر 2011). "التعرف على الكلام عبر العقود: كيف انتهى بنا المطاف مع سيري" . بي سي وورلد .
- ↑ روزن، شيريل (3 مارس 1997). "التعرف على الصوت لتسهيل حجوزات السفر" . أخبار سفر الأعمال .
كانت أولى تطبيقات برامج التعرف على الكلام هي الإملاء... قبل أربعة أشهر، قدمت شركة IBM "منتج إملاء مستمر" مصمم لـ... ظهر لأول مرة في المعرض التجاري للجمعية الوطنية لسفر الأعمال عام 1994.
- ↑ "ما هو تحديد هوية المتحدث؟" . picovoice.ai . تم الاطلاع عليه في 10 أكتوبر 2025 .
- ↑ "التحقق من هوية المتحدث: التحقق المعتمد على النص مقابل التحقق المستقل عنه" . أبحاث مايكروسوفت . 19 يونيو 2017.
التحقق المعتمد على النص والتحقق المستقل عنه من هوية المتحدث... كلاهما متساويان في معدل الخطأ والكشف.
- ↑ هيبير، ماثيو (2008). "التعرف على المتحدث المعتمد على النص". دليل سبرينغر لمعالجة الكلام . أدلة سبرينغر. برلين، هايدلبرغ: سبرينغر برلين هايدلبرغ. ص 743-762 . doi : 10.1007/978-3-540-49127-9_37 . ISBN 978-3-540-49125-5ISSN 2522-8692 . مهمة ..
التحقق أو التحديد
- ↑ مايرز، ليزا (25 يوليو 2004). "استكشاف القياسات الحيوية الصوتية" . معهد SANS .
- ↑ شهيد الله، محمد؛ كينونين، تومي (2016). "خصائص التباين الطيفي المحلي للتحقق من هوية المتحدث" (ملف PDF) . معالجة الإشارات الرقمية . 50. دار النشر Elsevier BV: 1-11 . Bibcode : 2016DSP....50....1S . doi : 10.1016/j.dsp.2015.10.011 . ISSN 1051-2004 .
- ↑ «خبير في التعرف على الكلام يُثير مخاوف بشأن تقنية الصوت في مكان العمل» . Independent.ie . 29 سبتمبر 2019. تم الاطلاع عليه بتاريخ 30 سبتمبر 2019 .
- ↑ US4752958 أ، ميشيل كافازا، ألبرتو سياراميلا، "جهاز للتحقق من المتحدث" https://patents.google.com/patent/US4752958/en
- ↑ ماير، بارب (12 يونيو 1996). "معبر حدودي آلي". تقرير إخباري تلفزيوني . أخبار ماير التلفزيونية.
- ↑ الخدمات المصرفية الدولية (27 ديسمبر 2013). "تقنية القياسات الحيوية الصوتية في الخدمات المصرفية | باركليز" . Wealth.barclays.com . تم الاطلاع عليه بتاريخ 21 فبراير 2016 .
- ↑ مات وارمان (8 مايو 2013). "ودّع الرقم السري: تقنية التعرف على الصوت تسيطر على باركليز ويلث" . تم الاطلاع عليه في 5 يونيو 2013 .
- ↑ إيوين ماكاسكيل. "هل قتل 'الجهادي جون' ستيفن سوتلوف؟ | الإعلام" . صحيفة الغارديان . تم الاطلاع عليه بتاريخ 21 فبراير 2016 .
- ↑ جوليا كولوي (19 فبراير 2016). "بنك HSBC يُطلق نظام أمان الصوت والبصمة لعملاء البنك | أعمال" . صحيفة الغارديان . تاريخ الاسترجاع: 21 فبراير 2016 .
- ↑ "كيف تمكنت من اختراق حساب مصرفي باستخدام صوت مولد بالذكاء الاصطناعي" . 23 فبراير 2023.
- ↑ إيفرشيد، نيك؛ تايلور، جوش (16 مارس 2023). "الذكاء الاصطناعي قادر على خداع تقنية التعرف على الصوت المستخدمة للتحقق من الهوية من قبل سنترلينك ومكتب الضرائب الأسترالي" . صحيفة الغارديان . تاريخ الاسترجاع: 16 يونيو 2023 .
مراجع
- همايون بيجي (2011)، " أساسيات التعرف على المتحدث "، سبرينغر-فيرلاغ، برلين، 2011، ISBN 978-0-387-77591-3.
- "القياسات الحيوية من الأفلام" – المعهد الوطني للمعايير والتكنولوجيا
- إليزابيث زيتيرهولم (2003)، تقليد الصوت. دراسة صوتية للأوهام الإدراكية والنجاح الصوتي ، أطروحة دكتوراه، جامعة لوند .
- محمد شهيد الله (2015)، تحسين أداء التعرف على المتحدث باستخدام معلومات مستوى الكتلة والنسبية والزمنية لطاقات النطاق الفرعي ، أطروحة دكتوراه، المعهد الهندي للتكنولوجيا خاراجبور .
روابط خارجية
- تجاوز التحقق الصوتي مؤرشف في 10 يونيو 2008، في Wayback Machine. عرض بودكاست راديو PLA مؤخرًا طريقة بسيطة لخداع أنظمة التحقق الصوتي البدائية.
- تقدير المتحدثين – سكولاربيديا
- فوائد وتحديات التعرف على الصوت في التحكم في الوصول
برمجة
- تقدير المتحدث
- معالجة الكلام
- تقنية الصوت
- التعرف التلقائي على البيانات والتقاطها
- القياسات الحيوية
