مواصفات معجم النطق

تُعدّ مواصفات معجم النطق ( PLS) توصيةً من اتحاد شبكة الويب العالمية (W3C )، وهي مصممة لتمكين تحديد معلومات النطق بشكل متوافق بين محركات التعرف على الكلام وتوليف الكلام في تطبيقات تصفح الصوت. وتهدف هذه اللغة إلى أن تكون سهلة الاستخدام للمطورين مع دعمها لتحديد معلومات النطق بدقة للاستخدام الدولي.

تتيح هذه اللغة تحديد نطق واحد أو أكثر لكلمة أو عبارة باستخدام أبجدية نطق قياسية، أو باستخدام أبجديات خاصة بالموردين عند الضرورة. تُجمع النطقات في مستند PLS يمكن الرجوع إليه من لغات ترميز أخرى، مثل مواصفات قواعد التعرف على الكلام SRGS ولغة ترميز توليف الكلام SSML .

الاستخدام

فيما يلي مثال على مستند PLS:

<?xml version="1.0" encoding="UTF-8"?> <lexicon version= "1.0" xmlns= "http://www.w3.org/2005/01/pronunciation-lexicon" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2005/01/pronunciation-lexicon  http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd" alphabet= "ipa" xml:lang= "en-US" > <lexeme> <grapheme> judge </grapheme> <grapheme> judgement </grapheme> <phoneme> ˈdʒʌdʒ.mənt </phoneme> <!-- سلسلة IPA هي:  "ˈdʒʌdʒ.mənt" --> </lexeme> <lexeme> <grapheme> fiancé </grapheme> <grapheme> fiance </grapheme> <phoneme> fiˈɒns.eɪ </phoneme> <!-- سلسلة IPA هي:  "fiˈɒns.eɪ" --> <phoneme> ˌfiː.ɑːnˈseɪ </phoneme> <!-- سلسلة IPA هي:  "ˌfiː.ɑːnˈseɪ" --> </lexeme> </lexicon>

والتي يمكن استخدامها لتحسين تحويل النص إلى كلام كما هو موضح في وثيقة SSML 1.0 التالية :

<?xml version="1.0" encoding="UTF-8"?> <speak version= "1.0" xmlns= "http://www.w3.org/2001/10/synthesis" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2001/10/synthesis  http://www.w3.org/TR/speech-synthesis/synthesis.xsd" xml:lang= "en-US" > < lexicon uri = " http://www.example.org/lexicon_defined_above.xml" / > <p> في رأي خطيبي ، لاس فيغاس هي أفضل مكان لقضاء شهر العسل . فأجبته أنني أفضل البندقية ، ولا أعتقد أن كازينو البندقية حل وسط مقبول . </p> </speak>

ولكن أيضًا لتحسين التعرف التلقائي على الكلام في قواعد اللغة التالية SRGS 1.0 :

<?xml version="1.0" encoding="UTF-8"?> <grammar version= "1.0" xmlns= "http://www.w3.org/2001/06/grammar" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2001/06/grammar  http://www.w3.org/TR/speech-grammar/grammar.xsd" xml:lang= "en-US" root= "movies" mode= "voice" > < lexicon uri= "http://www.example.org/lexicon_defined_above.xml" /> <rule id= "movies" scope= "public" > <one-of> <item> Terminator 2: Judgment Day </item> <item> My Big Fat خطيب بغيض </item> <item> يوم حساب بلوتو </item> </one-of> </rule> </grammar>

حالات الاستخدام الشائعة

نطق متعدد لنفس الكتابة

في أنظمة التعرف التلقائي على الكلام، من الشائع الاعتماد على نطق متعدد للكلمة أو العبارة نفسها للتعامل مع اختلافات النطق داخل اللغة. في لغة معجم النطق، يُمثَّل النطق المتعدد بأكثر من عنصر صوتي (أو بديل) ضمن العنصر المعجمي نفسه.

في المثال التالي، كلمة "نيوتن" لها نطقان محتملان.

<?xml version="1.0" encoding="UTF-8"?> <lexicon version= "1.0" xmlns= "http://www.w3.org/2005/01/pronunciation-lexicon" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2005/01/pronunciation-lexicon  http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd" alphabet= "ipa" xml:lang= "en-GB" > <lexeme> <grapheme> نيوتن </grapheme> <phoneme> ˈnjuːtən </phoneme> <!-- IPA string is: "ˈnjuːtən" --> <phoneme> ˈnuːtən </phoneme> <!-- سلسلة IPA هي: "ˈnuːtən" --> </leexeme> </lexicon>

تعدد أنظمة الكتابة

في بعض الحالات، توجد تمثيلات نصية بديلة للكلمة أو العبارة نفسها. قد ينشأ هذا لعدة أسباب. راجع القسم 4.5 من PLS لمزيد من التفاصيل. ولأن هذه التمثيلات تحمل المعنى نفسه (على عكس المتجانسات الصوتية)، يُوصى بتمثيلها باستخدام عنصر <lexeme> واحد يحتوي على عدة وحدات كتابية.

فيما يلي مثالان بسيطان على تعدد طرق الكتابة: تهجئة بديلة لكلمة إنجليزية وكتابات متعددة لكلمة يابانية.

<?xml version="1.0" encoding="UTF-8"?> <lexicon version= "1.0" xmlns= "http://www.w3.org/2005/01/pronunciation-lexicon" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2005/01/pronunciation-lexicon  http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd" alphabet= "ipa" xml:lang= "en-US" > <!-- مدخل إنجليزي يوضح كيفية التعامل مع التهجئات البديلة --> <lexeme> <grapheme> colour </grapheme> <grapheme> color </grapheme> <phoneme> ˈkʌlər </phoneme> <!-- IPA string is: "ˈkʌlər" --> </lexime> </lexicon><?xml version="1.0" encoding="UTF-8"?> <lexicon version= "1.0" xmlns= "http://www.w3.org/2005/01/pronunciation-lexicon" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2005/01/pronunciation-lexicon  http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd" alphabet= "ipa" xml:lang= "ja" > <!-- مدخل ياباني يوضح كيفية التعامل مع أنظمة الكتابة المتعددة:  روماجي، كانجي، وهيراغانا --> <lexeme> <grapheme> nihongo </grapheme> <grapheme>日本語</grapheme> <grapheme>にほんご</grapheme> <phoneme> ɲihoŋɡo </phoneme> <!-- سلسلة IPA هي: "ɲihoŋɡo" --> </leexeme> </lexicon>

المتجانسات اللفظية

تحتوي معظم اللغات على كلمات متجانسة النطق ، أي كلمات لها نفس النطق ولكن معانٍ مختلفة (وربما تهجئات مختلفة)، على سبيل المثال "seed" و"cede". يُنصح بتمثيل هذه الكلمات كوحدات معجمية مختلفة.

<?xml version="1.0" encoding="UTF-8"?> <lexicon version= "1.0" xmlns= "http://www.w3.org/2005/01/pronunciation-lexicon" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2005/01/pronunciation-lexicon  http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd" alphabet= "ipa" xml:lang= "en-US" > <lexeme> <grapheme> cede </grapheme> <phoneme> siːd </phoneme> <!-- IPA string is: "siːd" --> </lexeme> <lexeme> <grapheme> seed </grapheme> <phoneme> siːd </phoneme> <!-- IPA string is: "siːd" --> </lexeme> </lexicon>

المتجانسات

تحتوي معظم اللغات على كلمات ذات معانٍ مختلفة ولكن بنفس التهجئة (وأحيانًا بنطق مختلف)، تُسمى الكلمات المتجانسة . على سبيل المثال، في اللغة الإنجليزية، تتشابه كلمة bass (سمكة) وكلمة bass (في الموسيقى) في التهجئة، لكنهما تختلفان في المعنى والنطق. على الرغم من أنه يُوصى بتمثيل هذه الكلمات باستخدام عناصر <lexeme> منفصلة، ​​يتم تمييزها بقيم مختلفة لخاصية role (انظر القسم 4.4 من PLS 1.0)، إذا لم يرغب مؤلف معجم النطق في التمييز بين الكلمتين، فيمكن ببساطة تمثيلهما كنطقين بديلين ضمن عنصر <lexeme> نفسه. في هذه الحالة الأخيرة، لن يتمكن معالج تحويل النص إلى كلام من التمييز بين النطق الأول والنطق الثاني.

في هذا المثال يتم عرض نطق الكلمة المتجانسة "bass".

<?xml version="1.0" encoding="UTF-8"?> <lexicon version= "1.0" xmlns= "http://www.w3.org/2005/01/pronunciation-lexicon" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2005/01/pronunciation-lexicon  http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd" alphabet= "ipa" xml:lang= "en-US" > <lexeme> <grapheme> bass </grapheme> <phoneme> bæs </phoneme> <!-- IPA string is: bæs --> <phoneme> beɪs </phoneme> <!-- IPA string is: beɪs --> </lexime> </lexicon>

تجدر الإشارة إلى أن اللغة الإنجليزية تحتوي على أمثلة عديدة لأزواج من الأسماء والأفعال التي يمكن التعامل معها إما على أنها كلمات متجانسة أو على أنها نطق بديل، وذلك حسب تفضيل الكاتب. ومن الأمثلة على ذلك كلمة "refuse" (اسم/فعل) وكلمة "address" (اسم/فعل).

<?xml version="1.0" encoding="UTF-8"?> <lexicon version= "1.0" xmlns= "http://www.w3.org/2005/01/pronunciation-lexicon" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2005/01/pronunciation-lexicon  http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd" xmlns:mypos= "http://www.example.org/my_pos_namespace" alphabet= "ipa" xml:lang= "en-US" > <lexeme role= "mypos:verb" > <grapheme> رفض </grapheme> <phoneme> rɪˈfjuːz </phoneme> <!-- IPA string is: "rɪˈfjuːz" --> </lexeme> <lexeme role= "mypos:noun" > <grapheme> reject </grapheme> <phoneme> ˈrɛfjuːs </phoneme> <!-- IPA string is: "ˈrɛfjuːs" --> </lexeme> </lexicon>

النطق حسب الكتابة

بالنسبة لبعض الكلمات والعبارات، يمكن التعبير عن النطق بسرعة وسهولة كسلسلة من أنظمة كتابة أخرى . لا يُشترط على المطور امتلاك معرفة لغوية، بل يعتمد على أنظمة النطق المتوفرة مسبقًا. للتعبير عن النطق باستخدام أنظمة كتابة أخرى، يمكن استخدام عنصر <alias>.

قد تكون هذه الميزة مفيدة للغاية للتعامل مع توسيع الاختصارات.

<?xml version="1.0" encoding="UTF-8"?> <lexicon version= "1.0" xmlns= "http://www.w3.org/2005/01/pronunciation-lexicon" xmlns:xsi= "http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation= "http://www.w3.org/2005/01/pronunciation-lexicon  http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd" alphabet= "ipa" xml:lang= "en-US" > <!--  توسيع الاختصارات  --> <lexeme> <grapheme> W3C </grapheme> <alias> World Wide Web Consortium </alias> </lexeme> <!--  تمثيل الأرقام  --> <lexeme> <grapheme> 101 </grapheme> <alias> مئة وواحد </alias> </lexeme> <!--  آلية نطق تقريبية  --> <lexeme> <grapheme> تايلاند </grapheme> <alias> أرض ربطة عنق </alias> </lexeme> <!--  آلية نطق تقريبية وتوسيع الاختصارات  -- > <lexeme> <grapheme> BBC 1 </grapheme> <alias> be be sea one </alias> </lexeme> </lexicon>

الوضع والمستقبل

  • وصل معيار PLS 1.0 إلى مستوى توصية W3C في 14 أكتوبر 2008.

انظر أيضاً

مراجع