واجهة المستخدم الصوتية

تتيح واجهة المستخدم الصوتية ( VUI ) التفاعل البشري المنطوق مع أجهزة الكمبيوتر، باستخدام التعرف على الكلام لفهم الأوامر المنطوقة والإجابة على الأسئلة ، وعادةً ما يتم تحويل النص إلى كلام لتشغيل الرد. جهاز الأوامر الصوتية هو جهاز يتم التحكم فيه باستخدام واجهة مستخدم صوتية.

تمت إضافة واجهات المستخدم الصوتية إلى السيارات وأنظمة التشغيل الآلي للمنزل وأنظمة تشغيل الكمبيوتر والأجهزة المنزلية مثل الغسالات وأفران الميكروويف وأجهزة التحكم عن بعد في التلفزيون . وهي الطريقة الأساسية للتفاعل مع المساعدين الافتراضيين على الهواتف الذكية ومكبرات الصوت الذكية . يمكن للمضيفين الآليين الأقدم (الذين يوجهون المكالمات الهاتفية إلى الامتداد الصحيح) وأنظمة الاستجابة الصوتية التفاعلية (التي تجري معاملات أكثر تعقيدًا عبر الهاتف) الاستجابة للضغط على أزرار لوحة المفاتيح عبر نغمات DTMF ، ولكن تلك التي تحتوي على واجهة مستخدم صوتية كاملة تسمح للمتصلين بالتحدث عن الطلبات والاستجابات دون الحاجة إلى الضغط على أي أزرار.

الأجهزة الحديثة التي تعمل بالأوامر الصوتية لا تعتمد على مكبر الصوت، وبالتالي يمكنها الاستجابة لأصوات متعددة، بغض النظر عن التأثيرات اللهجية أو اللهجية. كما أنها قادرة على الاستجابة لعدة أوامر في وقت واحد، وفصل الرسائل الصوتية، وتوفير ردود الفعل المناسبة ، وتقليد المحادثة الطبيعية بدقة. [1]

ملخص

واجهة المستخدم الصوتية هي الواجهة لأي تطبيق كلامي. منذ وقت قصير، كان التحكم في الآلة بمجرد التحدث إليها ممكنًا فقط في الخيال العلمي . وحتى وقت قريب، كان هذا المجال يُعتبر ذكاءً اصطناعيًا . ومع ذلك، ساهمت التطورات في التقنيات مثل تحويل النص إلى كلام، وتحويل الكلام إلى نص، ومعالجة اللغة الطبيعية ، والخدمات السحابية في التبني الجماعي لهذه الأنواع من الواجهات. أصبحت واجهات المستخدم الصوتية أكثر شيوعًا، ويستفيد الناس من القيمة التي توفرها هذه الواجهات التي لا تحتاج إلى استخدام اليدين والعينين في العديد من المواقف.

تحتاج واجهات المستخدم المرئية إلى الاستجابة للمدخلات بشكل موثوق، وإلا فسوف يرفضها المستخدمون ويسخرون منها غالبًا. يتطلب تصميم واجهة مستخدم مرئية جيدة مواهب متعددة التخصصات في علوم الكمبيوتر واللغويات وعلم نفس العوامل البشرية - وكلها مهارات باهظة الثمن ويصعب الحصول عليها. حتى مع أدوات التطوير المتقدمة، يتطلب إنشاء واجهة مستخدم مرئية فعالة فهمًا عميقًا لكل من المهام التي يجب القيام بها، وكذلك الجمهور المستهدف الذي سيستخدم النظام النهائي. كلما اقتربت واجهة المستخدم المرئية من النموذج الذهني للمستخدم للمهمة، كلما كان من الأسهل استخدامها مع القليل من التدريب أو بدونه، مما يؤدي إلى كفاءة أعلى ورضا أعلى للمستخدم.

إن واجهة المستخدم الشخصية المصممة للجمهور العام يجب أن تؤكد على سهولة الاستخدام وتوفر الكثير من المساعدة والتوجيه للمتصلين لأول مرة. وعلى النقيض من ذلك، فإن واجهة المستخدم الشخصية المصممة لمجموعة صغيرة من المستخدمين المحترفين (بما في ذلك عمال الخدمة الميدانية)، يجب أن تركز بشكل أكبر على الإنتاجية وأقل على المساعدة والتوجيه. وينبغي لمثل هذه التطبيقات أن تعمل على تبسيط تدفقات المكالمات، وتقليل المطالبات، والقضاء على التكرارات غير الضرورية، والسماح بـ " حوارات المبادرة المختلطة " المعقدة، والتي تمكن المتصلين من إدخال عدة قطع من المعلومات في عبارة واحدة وبأي ترتيب أو مجموعة. باختصار، يجب تصميم تطبيقات الكلام بعناية لعملية العمل المحددة التي يتم أتمتتها.

لا تصلح جميع العمليات التجارية بنفس القدر لأتمتة الكلام. بشكل عام، كلما كانت الاستفسارات والمعاملات أكثر تعقيدًا، كلما كان من الصعب أتمتتها، وكلما زاد احتمال فشلها مع عامة الناس. في بعض السيناريوهات، لا يمكن تطبيق الأتمتة ببساطة، لذا فإن مساعدة الوكيل المباشر هي الخيار الوحيد. على سبيل المثال، سيكون من الصعب جدًا أتمتة خط المساعدة القانونية. من ناحية أخرى، يعد الكلام مثاليًا للتعامل مع المعاملات السريعة والروتينية، مثل تغيير حالة أمر العمل، أو إكمال إدخال الوقت أو النفقات، أو تحويل الأموال بين الحسابات.

تاريخ

تضمنت التطبيقات المبكرة لـ VUI الاتصال الصوتي بالهواتف، إما بشكل مباشر أو من خلال سماعة رأس (عادةً ما تكون بتقنية Bluetooth ) أو نظام صوتي للمركبة.

في عام 2007، ذكرت مقالة أعمال في شبكة سي إن إن أن الأوامر الصوتية كانت صناعة تزيد قيمتها عن مليار دولار وأن شركات مثل جوجل وآبل كانت تحاول إنشاء ميزات التعرف على الكلام. [2] في السنوات التي تلت نشر المقال، شهد العالم مجموعة متنوعة من أجهزة الأوامر الصوتية. بالإضافة إلى ذلك، أنشأت جوجل محرك التعرف على الكلام يسمى Pico TTS وأصدرت آبل Siri. أصبحت أجهزة الأوامر الصوتية متاحة على نطاق أوسع، ويتم دائمًا إنشاء طرق مبتكرة لاستخدام الصوت البشري. على سبيل المثال، تشير مجلة بيزنس ويك إلى أن جهاز التحكم عن بعد المستقبلي سيكون الصوت البشري. يسمح Xbox Live حاليًا بمثل هذه الميزات وألمح جوبز إلى مثل هذه الميزة على Apple TV الجديد . [3]

منتجات برامج الأوامر الصوتية على أجهزة الكمبيوتر

يوفر كل من أجهزة Apple Mac وأجهزة الكمبيوتر التي تعمل بنظام Windows ميزات التعرف على الكلام المضمنة لأنظمة التشغيل الأحدث الخاصة بها .

مايكروسوفت ويندوز

يوفر نظاما تشغيل من إنتاج شركة مايكروسوفت، Windows 7 و Windows Vista ، قدرات التعرف على الكلام. وقد قامت شركة مايكروسوفت بدمج الأوامر الصوتية في أنظمة التشغيل الخاصة بها لتوفير آلية للأشخاص الذين يرغبون في الحد من استخدامهم للفأرة ولوحة المفاتيح، ولكنهم لا يزالون يرغبون في الحفاظ على إنتاجيتهم الإجمالية أو زيادتها. [4]

ويندوز فيستا

باستخدام التحكم الصوتي في نظام التشغيل Windows Vista، يمكن للمستخدم إملاء المستندات ورسائل البريد الإلكتروني في التطبيقات الرئيسية، وبدء التطبيقات والتبديل بينها، والتحكم في نظام التشغيل، وتنسيق المستندات، وحفظ المستندات، وتحرير الملفات، وتصحيح الأخطاء بكفاءة، وملء النماذج على الويب . يتعلم برنامج التعرف على الكلام تلقائيًا في كل مرة يستخدمه فيها المستخدم، ويتوفر التعرف على الكلام باللغات الإنجليزية (الولايات المتحدة)، والإنجليزية (المملكة المتحدة)، والألمانية (ألمانيا)، والفرنسية (فرنسا)، والإسبانية (إسبانيا)، واليابانية، والصينية (التقليدية)، والصينية (المبسطة). بالإضافة إلى ذلك، يأتي البرنامج مع برنامج تعليمي تفاعلي، يمكن استخدامه لتدريب كل من المستخدم ومحرك التعرف على الكلام. [5]

ويندوز 7

بالإضافة إلى جميع الميزات المتوفرة في Windows Vista، يوفر Windows 7 معالجًا لإعداد الميكروفون ودليلًا تعليميًا حول كيفية استخدام الميزة. [6]

نظام التشغيل ماك أو إس إكس

تأتي جميع أجهزة كمبيوتر Mac OS X مثبتًا عليها مسبقًا برنامج التعرف على الكلام. البرنامج مستقل عن المستخدم، ويسمح للمستخدم "بالتنقل بين القوائم وإدخال اختصارات لوحة المفاتيح؛ ونطق أسماء مربعات الاختيار، وأسماء أزرار الاختيار، وعناصر القائمة، وأسماء الأزرار؛ وفتح التطبيقات وإغلاقها والتحكم فيها والتبديل بينها." [7] ومع ذلك، يوصي موقع Apple المستخدم بشراء منتج تجاري يسمى Dictate . [7]

المنتجات التجارية

إذا لم يكن المستخدم راضيًا عن برنامج التعرف على الكلام المدمج أو لم يكن لديه برنامج التعرف على الكلام المدمج لنظام التشغيل الخاص به، فيمكن للمستخدم تجربة منتج تجاري مثل Braina Pro أو DragonNaturallySpeaking لأجهزة الكمبيوتر التي تعمل بنظام Windows، [8] وDictate، وهو اسم نفس البرنامج لنظام التشغيل Mac OS. [9]

أجهزة التحكم الصوتي المحمولة

يوفر أي جهاز محمول يعمل بنظام التشغيل Android أو Microsoft Windows Phone أو iOS 9 أو أحدث أو Blackberry OS قدرات الأوامر الصوتية. بالإضافة إلى برنامج التعرف على الكلام المدمج في نظام التشغيل الخاص بكل هاتف محمول، يمكن للمستخدم تنزيل تطبيقات الأوامر الصوتية من جهة خارجية من متجر تطبيقات كل نظام تشغيل: Apple App store أو Google Play أو Windows Phone Marketplace (مبدئيًا Windows Marketplace for Mobile ) أو BlackBerry App World .

نظام التشغيل أندرويد

طورت جوجل نظام تشغيل مفتوح المصدر يسمى أندرويد ، والذي يسمح للمستخدم بإجراء أوامر صوتية مثل: إرسال رسائل نصية، والاستماع إلى الموسيقى، والحصول على الاتجاهات، والاتصال بالشركات، والاتصال بجهات الاتصال، وإرسال البريد الإلكتروني، وعرض الخريطة، والانتقال إلى مواقع الويب، وكتابة ملاحظة، والبحث في جوجل. [10] يتوفر برنامج التعرف على الكلام لجميع الأجهزة منذ أندرويد 2.2 "فرويو" ، ولكن يجب ضبط الإعدادات على اللغة الإنجليزية. [10] تسمح جوجل للمستخدم بتغيير اللغة، ويطلب من المستخدم عندما يستخدم ميزة التعرف على الكلام لأول مرة ما إذا كان يرغب في ربط بيانات صوته بحسابه في جوجل. إذا قرر المستخدم الاشتراك في هذه الخدمة، فهذا يسمح لجوجل بتدريب البرنامج على صوت المستخدم. [11]

قدمت شركة جوجل مساعدها الرقمي Google Assistant مع نظام التشغيل أندرويد 7.0 "نوجا" . وهو أكثر تقدمًا بكثير من الإصدار الأقدم.

تتمتع شركة Amazon.com بجهاز Echo الذي يستخدم إصدار Amazon المخصص من نظام التشغيل Android لتوفير واجهة صوتية.

مايكروسوفت ويندوز

Windows Phone هو نظام تشغيل الأجهزة المحمولة من Microsoft . في Windows Phone 7.5، يكون تطبيق الكلام مستقلاً عن المستخدم ويمكن استخدامه في: الاتصال بشخص ما من قائمة جهات الاتصال لديك، أو الاتصال بأي رقم هاتف، أو إعادة الاتصال بالرقم الأخير، أو إرسال رسالة نصية، أو الاتصال بالبريد الصوتي، أو فتح تطبيق، أو قراءة المواعيد، أو الاستعلام عن حالة الهاتف، أو البحث في الويب. [12] [13] بالإضافة إلى ذلك، يمكن أيضًا استخدام الكلام أثناء مكالمة هاتفية، ومن الممكن القيام بالإجراءات التالية أثناء مكالمة هاتفية: الضغط على رقم، أو تشغيل مكبر الصوت، أو الاتصال بشخص ما، مما يضع المكالمة الحالية قيد الانتظار. [13]

يقدم Windows 10 نظام Cortana ، وهو نظام للتحكم الصوتي يحل محل نظام التحكم الصوتي المستخدم سابقًا على هواتف Windows.

اي او اس

أضافت شركة Apple ميزة التحكم الصوتي إلى عائلة أجهزة iOS الخاصة بها كميزة جديدة لنظام التشغيل iPhone OS 3. يأتي كل من iPhone 4S و iPad 3 و iPad Mini 1G و iPad Air و iPad Pro 1G و iPod Touch 5G والإصدارات الأحدث، مع مساعد صوتي أكثر تقدمًا يسمى Siri . لا يزال من الممكن تمكين التحكم الصوتي من خلال قائمة الإعدادات للأجهزة الأحدث. Siri هي ميزة التعرف على الكلام المضمنة المستقلة عن المستخدم والتي تسمح للمستخدم بإصدار أوامر صوتية. بمساعدة Siri، يمكن للمستخدم إصدار أوامر مثل إرسال رسالة نصية أو التحقق من الطقس أو تعيين تذكير أو العثور على معلومات أو جدولة اجتماعات أو إرسال بريد إلكتروني أو العثور على جهة اتصال أو تعيين منبه أو الحصول على الاتجاهات أو تتبع أسهمك أو تعيين مؤقت أو طلب أمثلة على استعلامات الأوامر الصوتية النموذجية. [14] بالإضافة إلى ذلك، تعمل Siri مع البلوتوث وسماعات الرأس السلكية. [15]

قدمت شركة Apple ميزة Personal Voice كميزة إمكانية وصول في نظام التشغيل iOS 17 ، الذي تم إطلاقه في 18 سبتمبر 2023. [16] تتيح هذه الميزة للمستخدمين إنشاء نسخة مخصصة من صوتهم يتم إنشاؤها بواسطة التعلم الآلي (AI) لاستخدامها في تطبيقات تحويل النص إلى كلام . تم تصميم Personal Voice خصيصًا للأفراد الذين يعانون من ضعف الكلام ، حيث يساعد في الحفاظ على الصوت الفريد لصوت المستخدم. كما أنه يعزز Siri وأدوات إمكانية الوصول الأخرى من خلال توفير تجربة مستخدم أكثر تخصيصًا وشاملاً . يعكس Personal Voice التزام Apple المستمر بإمكانية الوصول والابتكار . [17] [18]

أمازون اليكسا

في عام 2014، قدمت أمازون جهاز المنزل الذكي أليكسا . كان الغرض الرئيسي منه مجرد مكبر صوت ذكي يسمح للمستهلك بالتحكم في الجهاز بصوته. في النهاية، تحول إلى جهاز جديد لديه القدرة على التحكم في الأجهزة المنزلية بالصوت. الآن يمكن التحكم في جميع الأجهزة تقريبًا باستخدام أليكسا، بما في ذلك المصابيح الكهربائية ودرجة الحرارة. من خلال السماح بالتحكم الصوتي، يمكن لأليكسا الاتصال بتقنية المنزل الذكي مما يسمح لك بقفل منزلك والتحكم في درجة الحرارة وتنشيط أجهزة مختلفة. يسمح هذا الشكل من الذكاء الاصطناعي لشخص ما ببساطة بطرح سؤال عليه، وفي الرد تبحث أليكسا عن الإجابة وتجدها وترد عليك. [19]

التعرف على الكلام في السيارات

مع تحسن تكنولوجيا السيارات، سيتم إضافة المزيد من الميزات إلى السيارات وقد تؤدي هذه الميزات إلى تشتيت انتباه السائق. وفقًا لـ CNET ، يجب أن تسمح الأوامر الصوتية للسيارات للسائق بإصدار الأوامر وعدم تشتيت انتباهه. ذكرت CNET أن Nuance كانت تقترح أنه في المستقبل سيبتكرون برنامجًا يشبه Siri، ولكن للسيارات. [20] كانت معظم برامج التعرف على الكلام في السوق في عام 2011 تحتوي على حوالي 50 إلى 60 أمرًا صوتيًا فقط، لكن Ford Sync كان يحتوي على 10000 أمر صوتي. [20] ومع ذلك، اقترحت CNET أن حتى 10000 أمر صوتي لم تكن كافية نظرًا لتعقيد وتنوع المهام التي قد يرغب المستخدم في القيام بها أثناء القيادة. [20] تختلف الأوامر الصوتية للسيارات عن الأوامر الصوتية للهواتف المحمولة وأجهزة الكمبيوتر لأن السائق قد يستخدم الميزة للبحث عن المطاعم القريبة والبحث عن البنزين واتجاهات القيادة وظروف الطريق وموقع أقرب فندق. [20] حاليًا، تسمح التكنولوجيا للسائق بإصدار أوامر صوتية على كل من نظام تحديد المواقع العالمي (GPS) المحمول مثل Garmin ونظام الملاحة الخاص بشركة تصنيع السيارات. [21]

قائمة أنظمة الأوامر الصوتية التي توفرها شركات تصنيع المحركات:

المدخلات غير اللفظية

في حين أن معظم واجهات المستخدم الصوتية مصممة لدعم التفاعل من خلال اللغة البشرية المنطوقة، فقد كانت هناك أيضًا استكشافات حديثة في تصميم واجهات تأخذ الأصوات البشرية غير اللفظية كمدخلات. [22] [23] في هذه الأنظمة، يتحكم المستخدم في الواجهة عن طريق إصدار أصوات غير كلامية مثل الهمهمة أو الصفير أو النفخ في الميكروفون. [24]

أحد الأمثلة على واجهة المستخدم الصوتية غير اللفظية هو Blendie، [25] [26] وهو تركيب فني تفاعلي من إبداع كيلي دوبسون. تتألف القطعة من خلاط كلاسيكي من حقبة الخمسينيات من القرن الماضي تم تعديله للاستجابة لإدخال الميكروفون. للتحكم في الخلاط، يجب على المستخدم تقليد الأصوات الميكانيكية الصاخبة التي يصدرها الخلاط عادةً: سوف يدور الخلاط ببطء استجابةً لهدير المستخدم منخفض النبرة، ويزداد سرعته مع إصدار المستخدم لأصوات صوتية عالية النبرة.

ومن الأمثلة الأخرى VoiceDraw، [27] وهو نظام بحثي يتيح الرسم الرقمي للأفراد ذوي القدرات الحركية المحدودة. يسمح VoiceDraw للمستخدمين "برسم" ضربات على قماش رقمي من خلال تعديل أصوات الحروف المتحركة، والتي يتم تعيينها وفقًا لاتجاهات الفرشاة. يسمح تعديل السمات اللغوية الأخرى (مثل ارتفاع صوتهم) للمستخدم بالتحكم في ميزات مختلفة للرسم، مثل سمك ضربة الفرشاة.

تتضمن الأساليب الأخرى اعتماد الأصوات غير اللفظية لتعزيز الواجهات القائمة على اللمس (على سبيل المثال على الهاتف المحمول) لدعم أنواع جديدة من الإيماءات التي لن تكون ممكنة باستخدام إدخال الإصبع وحده. [24]

تحديات التصميم

تشكل واجهات الصوت عددًا كبيرًا من التحديات فيما يتعلق بسهولة الاستخدام. وعلى النقيض من واجهات المستخدم الرسومية (GUIs)، لا تزال أفضل الممارسات لتصميم واجهة الصوت ناشئة. [28]

قابلية الاكتشاف

مع التفاعل القائم على الصوت فقط، تميل واجهات المستخدم الصوتية إلى المعاناة من انخفاض القدرة على الاكتشاف : [28] من الصعب على المستخدمين فهم نطاق قدرات النظام. لكي ينقل النظام ما هو ممكن بدون عرض مرئي، فإنه يحتاج إلى تعداد الخيارات المتاحة، والتي يمكن أن تصبح مملة أو غير قابلة للتطبيق. غالبًا ما يؤدي انخفاض القدرة على الاكتشاف إلى إبلاغ المستخدمين عن ارتباك بشأن ما "يُسمح لهم" بقوله، أو عدم تطابق التوقعات بشأن اتساع فهم النظام. [29] [30]

النسخ

على الرغم من تحسن تقنية التعرف على الكلام بشكل كبير في السنوات الأخيرة، إلا أن واجهات المستخدم الصوتية لا تزال تعاني من أخطاء التحليل أو النسخ حيث لا يتم تفسير كلام المستخدم بشكل صحيح. [31] تميل هذه الأخطاء إلى الانتشار بشكل خاص عندما يستخدم محتوى الكلام مفردات تقنية (مثل المصطلحات الطبية) أو تهجئات غير تقليدية مثل أسماء الفنانين الموسيقيين أو الأغاني. [32]

فهم

يظل تصميم النظام الفعال لتعظيم الفهم المحادثة مجالًا مفتوحًا للبحث. تعد واجهات المستخدم الصوتية التي تفسر وتدير حالة المحادثة صعبة التصميم بسبب الصعوبة المتأصلة في دمج مهام معالجة اللغة الطبيعية المعقدة مثل حل المرجع المشترك والتعرف على الكيانات المسماة واسترجاع المعلومات وإدارة الحوار . [33] معظم المساعدين الصوتيين اليوم قادرون على تنفيذ أوامر فردية بشكل جيد للغاية ولكنهم محدودون في قدرتهم على إدارة الحوار بما يتجاوز مهمة ضيقة أو بضع دورات في محادثة. [34]

الاستخدامات المستقبلية

تعتمد الأجهزة بحجم الجيب، مثل أجهزة المساعد الرقمي الشخصي (PDA) أو الهواتف المحمولة ، حاليًا على أزرار صغيرة لإدخال المستخدم. تكون هذه الأزرار إما مدمجة في الجهاز أو جزءًا من واجهة شاشة تعمل باللمس، مثل واجهة تطبيق Apple iPod Touch و iPhone Siri. يمكن أن يكون الضغط المكثف على الأزرار على الأجهزة ذات هذه الأزرار الصغيرة مملًا وغير دقيق، لذا فإن واجهة المستخدم المرئية سهلة الاستخدام والدقيقة والموثوقة قد تكون بمثابة تقدم كبير في سهولة استخدامها. ومع ذلك، فإن مثل هذه واجهة المستخدم المرئية ستفيد أيضًا مستخدمي أجهزة الكمبيوتر المحمولة وأجهزة الكمبيوتر المكتبية، حيث ستحل العديد من المشكلات المرتبطة حاليًا باستخدام لوحة المفاتيح والماوس ، بما في ذلك إصابات الإجهاد المتكررة مثل متلازمة النفق الرسغي ، وتحديات التنقل وإدخال النص داخل الواجهات الرقمية من قبل ضعاف البصر، [35] وسرعة الكتابة البطيئة من جانب مستخدمي لوحة المفاتيح عديمي الخبرة. علاوة على ذلك، يستلزم استخدام لوحة المفاتيح عادةً الجلوس أو الوقوف بثبات أمام الشاشة المتصلة؛ على النقيض من ذلك، فإن واجهة المستخدم الصوتية ستتيح للمستخدم حرية أكبر في الحركة، حيث أن إدخال الكلام يلغي الحاجة إلى النظر إلى لوحة المفاتيح.

إن مثل هذه التطورات قد تغير وجه الآلات الحالية وتخلف آثاراً بعيدة المدى على كيفية تفاعل المستخدمين معها. فالأجهزة المحمولة سوف تُصمم بشاشات أكبر وأسهل في العرض، حيث لن تكون هناك حاجة إلى لوحة مفاتيح. ولن تحتاج أجهزة الشاشات التي تعمل باللمس إلى تقسيم الشاشة بين المحتوى ولوحة المفاتيح على الشاشة، وبالتالي توفير عرض كامل للمحتوى على الشاشة. ومن الممكن أن يتم تقليص حجم أجهزة الكمبيوتر المحمولة إلى النصف، حيث سيتم التخلص من نصف لوحة المفاتيح ودمج جميع المكونات الداخلية خلف الشاشة، مما يؤدي فعلياً إلى إنتاج كمبيوتر لوحي بسيط . وسوف تتكون أجهزة الكمبيوتر المكتبية من وحدة معالجة مركزية وشاشة، مما يوفر مساحة سطح المكتب التي كانت تشغلها لوحة المفاتيح بخلاف ذلك، ويقضي على حوامل لوحة المفاتيح المنزلقة المبنية تحت سطح المكتب. كما يمكن التخلص من أجهزة التحكم عن بعد في أجهزة التلفزيون ولوحات المفاتيح الموجودة في عشرات الأجهزة الأخرى، من أفران الميكروويف إلى آلات النسخ.

ولكن لابد من التغلب على العديد من التحديات حتى يتسنى حدوث مثل هذه التطورات. فأولاً، لابد وأن تكون واجهة المستخدم الصوتية متطورة بما يكفي للتمييز بين المدخلات، مثل الأوامر، والمحادثات الخلفية؛ وإلا فإن المدخلات الخاطئة سوف تسجل وسوف يتصرف الجهاز المتصل بشكل غير منتظم. ومن الممكن أن يؤدي توجيه قياسي، مثل نداء "الكمبيوتر!" الشهير الذي يطلقه شخصيات في برامج الخيال العلمي التلفزيونية والأفلام مثل ستار تريك ، إلى تنشيط واجهة المستخدم الصوتية وإعدادها لتلقي المزيد من المدخلات من نفس المتحدث. ومن الممكن أن تتضمن واجهة المستخدم الصوتية أيضاً تمثيلاً يشبه الإنسان: صوت أو حتى شخصية على الشاشة، على سبيل المثال، تستجيب (على سبيل المثال، "نعم، فامشي؟") وتستمر في التواصل ذهاباً وإياباً مع المستخدم من أجل توضيح المدخلات التي تلقاها وضمان دقتها.

ثانياً، لابد أن تعمل واجهة المستخدم المرئية بالتنسيق مع برامج متطورة للغاية من أجل معالجة المعلومات وإيجادها واسترجاعها بدقة أو تنفيذ إجراء وفقًا لتفضيلات المستخدم المعين. على سبيل المثال، إذا كانت سامانثا تفضل المعلومات من صحيفة معينة، وإذا كانت تفضل تلخيص المعلومات في شكل نقاط، فقد تقول، "أيها الكمبيوتر، اعثر لي على بعض المعلومات حول الفيضانات في جنوب الصين الليلة الماضية"؛ وفي الرد، فإن واجهة المستخدم المرئية التي تعرف تفضيلاتها "ستجد" حقائق حول "الفيضانات" في "جنوب الصين" من هذا المصدر، وتحولها إلى شكل نقاط، وتقدمها لها على الشاشة و/أو في شكل صوتي، مع الاستشهاد بها. وبالتالي، ستكون هناك حاجة إلى برامج التعرف على الكلام الدقيقة ، إلى جانب درجة معينة من الذكاء الاصطناعي من جانب الجهاز المرتبط بواجهة المستخدم المرئية.

التأثيرات على الخصوصية

تثار مخاوف الخصوصية بسبب حقيقة أن الأوامر الصوتية متاحة لمقدمي واجهات المستخدم الصوتي في شكل غير مشفر، وبالتالي يمكن مشاركتها مع أطراف ثالثة ومعالجتها بطريقة غير مصرح بها أو غير متوقعة. [36] [37] بالإضافة إلى المحتوى اللغوي للكلام المسجل، يمكن أن تحتوي طريقة تعبير المستخدم وخصائص صوته ضمناً على معلومات حول هويته البيومترية، وسمات شخصيته، وشكل جسمه، وحالته الصحية البدنية والعقلية، وجنسه، وحالته المزاجية وعواطفه ، ووضعه الاجتماعي والاقتصادي، وأصله الجغرافي. [38]

انظر أيضا

مراجع

  1. ^ "التحكم الصوتي في الغسالة". مجلة الأجهزة المنزلية .
  2. ^ بورزو، جانيت (8 فبراير 2007). "أنت تتحدث الآن". سي إن إن موني . تم استرجاعه في 25 أبريل 2012 .
  3. ^ "التحكم الصوتي، نهاية جهاز التحكم عن بعد في التلفاز؟". Bloomberg.com . Business Week. 9 ديسمبر 2011. مؤرشف من الأصل في 8 ديسمبر 2011 . تم الاسترجاع في 1 مايو 2012 .
  4. ^ "Windows Vista Built In Speech". Windows Vista . تم الاسترجاع في 25 أبريل 2012 .
  5. ^ "عملية الكلام في فيستا". مايكروسوفت.
  6. ^ "إعداد التعرف على الكلام". مايكروسوفت.
  7. ^ ab "المهارات البدنية والحركية". Apple.
  8. ^ "DragonNaturallySpeaking PC". Nuance.
  9. ^ "DragonNaturallySpeaking Mac". Nuance.
  10. ^ "إجراءات الصوت".
  11. ^ "يمكن الآن تدريب البحث الصوتي من Google لنظام Android على صوتك". 14 ديسمبر 2010. تم الاسترجاع في 24 أبريل 2012 .
  12. ^ "استخدام الأوامر الصوتية". مايكروسوفت . تم الاسترجاع في 24 أبريل 2012 .
  13. ^ "استخدام الأوامر الصوتية". مايكروسوفت . تم الاسترجاع في 27 أبريل 2012 .
  14. ^ "Siri، iPhone 3GS & 4، iPod 3 & 4، لديها التحكم الصوتي مثل Siri السريع، فإنه يقوم بتشغيل الموسيقى، وإيقاف الموسيقى مؤقتًا، وSuffle، وFacetime، وميزات الاتصال". Apple . تم الاسترجاع في 27 أبريل 2012 .
  15. ^ "الأسئلة الشائعة حول Siri". Apple.
  16. ^ "كيفية استخدام Personal Voice على iPhone مع iOS 17". Engadget . 2023-12-06 . تم الاسترجاع 2024-08-21 .
  17. ^ Jason England (2023-07-13). "كيفية إعداد واستخدام Personal Voice في iOS 17 - اجعل صوت iPhone الخاص بك يشبه صوتك تمامًا". LaptopMag . تم الاسترجاع في 2024-08-21 .
  18. ^ "تطوير إمكانية الوصول إلى الكلام باستخدام الصوت الشخصي". أبحاث التعلم الآلي من Apple . تم الاسترجاع في 2024-08-21 .
  19. ^ "كيف تحول جهاز Amazon Echo من مكبر صوت ذكي إلى مركز منزلك". Business Insider .
  20. ^ abcd "صوت مثل Siri". CNET.
  21. ^ "جهاز GPS محمول مع صوت". CNET.
  22. ^ بلاتنر، ميرا م.؛ جرينبيرج، روبرت م. (1992). "التواصل والتعلم من خلال الصوت غير المنطوق". تصميم واجهة الوسائط المتعددة في التعليم . ص 133-143. doi :10.1007/978-3-642-58126-7_9. ISBN 978-3-540-55046-4.
  23. ^ هيرفورد، جيمس؛ وين، ويليام (أكتوبر 1994). "الصوت غير المنطوق في التفاعل بين الإنسان والحاسوب: مراجعة وإرشادات التصميم". مجلة أبحاث الحوسبة التعليمية . 11 (3): 211-233. doi :10.2190/mkd9-w05t-yj9y-81nm. ISSN  0735-6331. S2CID  61510202.
  24. ^ ab Sakamoto, Daisuke; Komatsu, Takanori; Igarashi, Takeo (27 أغسطس 2013). "التلاعب بالصوت المعزز | وقائع المؤتمر الدولي الخامس عشر حول تفاعل الإنسان والحاسوب مع الأجهزة والخدمات المحمولة": 69–78. doi :10.1145/2493190.2493244. S2CID  6251400 . تم الاسترجاع في 2019-02-27 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  25. ^ دوبسون، كيلي (أغسطس 2004). "Blendie | وقائع المؤتمر الخامس حول تصميم الأنظمة التفاعلية: العمليات والممارسات والأساليب والتقنيات": 309. doi :10.1145/1013115.1013159 . تم الاسترجاع في 2019-02-27 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  26. ^ "كيلي دوبسون: بليندي". web.media.mit.edu . تم الاسترجاع في 2019-02-27 .
  27. ^ Harada, Susumu; Wobbrock, Jacob O.; Landay, James A. (15 October 2007). "Voicedraw | Proceedings of the 9th international ACM SIGACCESS conference on Computers and accessibility": 27–34. doi :10.1145/1296843.1296850. S2CID  218338 . تم الاسترجاع في 2019-02-27 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  28. ^ ab Murad, Christine; Munteanu, Cosmin; Clark, Leigh; Cowan, Benjamin R. (3 سبتمبر 2018). "إرشادات التصميم للتفاعل الكلامي بدون استخدام اليدين | وقائع المؤتمر الدولي العشرين للتفاعل بين الإنسان والحاسوب مع الأجهزة المحمولة والخدمات الملحقة": 269–276. doi :10.1145/3236112.3236149. S2CID  52099112 . تم الاسترجاع في 2019-02-27 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  29. ^ يانكلوفيتش، نيكول؛ ليفو، جينا آن؛ ماركس، مات (مايو 1995). "تصميم أفعال الكلام | وقائع مؤتمر SIGCHI حول العوامل البشرية في أنظمة الحوسبة": 369-376. doi :10.1145/223904.223952. S2CID  9313029. تم الاسترجاع في 2019-02-27 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  30. ^ "ماذا أستطيع أن أقول؟ | وقائع المؤتمر الدولي الثامن عشر حول التفاعل بين الإنسان والحاسوب مع الأجهزة والخدمات المحمولة". doi : 10.1145/2935334.2935386 . S2CID  6246618. {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  31. ^ مايرز، تشيلسي؛ فوركان، أنوشاي؛ نيبولسكي، جيسيكا؛ كارو، كارينا؛ تشو، جيشن (19 أبريل 2018). "أنماط كيفية تغلب المستخدمين على العقبات في واجهات المستخدم الصوتية | وقائع مؤتمر CHI لعام 2018 حول العوامل البشرية في أنظمة الحوسبة": 1-7. doi :10.1145/3173574.3173580. S2CID  5041672. تم الاسترجاع في 2019-02-27 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  32. ^ Springer, Aaron; Cramer, Henriette (21 April 2018). ""Play PRBLMS" | Proceedings of the 2018 CHI Conference on Human Factors in Computing Systems": 1–13. doi :10.1145/3173574.3173870. S2CID  5050837 . تم الاسترجاع في 2019-02-27 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  33. ^ جاليتسكي، بوريس (2019). تطوير روبوتات الدردشة المؤسسية: تعلم البنى اللغوية (الطبعة الأولى). شام، سويسرا: سبرينغر. ص. 13-24. doi :10.1007/978-3-030-04299-8. ISBN 978-3-030-04298-1. S2CID  102486666.
  34. ^ بيرل، كاثي (2016-12-06). تصميم واجهات المستخدم الصوتية: مبادئ التجارب المحادثة (الطبعة الأولى). سيباستوبول، كاليفورنيا: أوريلي ميديا. ص 16-19. رقم ISBN 978-1-491-95541-3.
  35. ^ مسعودي، محمد ضياء الدين؛ مينيلاس، بوب أنطوان ج.؛ ميشيك، حامد (17 أكتوبر 2022). "مراجعة أدوات وتقنيات المساعدة في الملاحة للمكفوفين". مجسات . 22 (20): 7888. رمز Bibcode : 2022Senso..22.7888M. doi : 10.3390/s22207888 . ISSN  1424-8220. PMC 9606951. PMID 36298237  . 
  36. ^ "قد تكون Apple وGoogle وAmazon قد انتهكت خصوصيتك من خلال مراجعة أوامر المساعد الرقمي". Fortune . 2019-08-05 . تم الاسترجاع في 2020-05-13 .
  37. ^ هيرن، أليكس (11 أبريل 2019). "موظفو أمازون يستمعون إلى تسجيلات أليكسا للعملاء، كما يقول التقرير". الغارديان . تم الاسترجاع في 21 مايو 2020 .
  38. ^ كروجر، جاكوب ليون؛ لوتز، أوتو هانز مارتن؛ راشكي، فيليب (2020). "الآثار المترتبة على الخصوصية لتحليل الصوت والكلام - الكشف عن المعلومات عن طريق الاستدلال". إدارة الخصوصية والهوية. البيانات من أجل حياة أفضل: الذكاء الاصطناعي والخصوصية . IFIP تقدم في تكنولوجيا المعلومات والاتصالات. المجلد 576. ص 242-258. doi : 10.1007/978-3-030-42504-3_16 . ISBN 978-3-030-42503-6. ISSN  1868-4238.
  • واجهات الصوت: تقييم الإمكانات بقلم جاكوب نيلسن
  • صعود الصوت: جدول زمني
  • قاموس المصطلحات الصوتي الأول
  • الصوت أولاً: قائمة القراءة
Retrieved from "https://en.wikipedia.org/w/index.php?title=Voice_user_interface&oldid=1245810613"
Original text
Rate this translation
Your feedback will be used to help improve Google Translate