يُوفّر قاموس CMUdict خريطةً إملائيةً/صوتيةً للكلمات الإنجليزية وفقًا لنطقها في أمريكا الشمالية. ويُستخدم عادةً لإنشاء تمثيلاتٍ لأنظمة التعرّف على الكلام (ASR)، مثل نظام CMU Sphinx ، وأنظمة توليف الكلام (TTS)، مثل نظام Festival . كما يُمكن استخدام CMUdict كمجموعة بيانات تدريبية لبناء نماذج إحصائية لتحويل الكتابة إلى صوت (g2p) [ 1 ] ، والتي تُنتج نطقًا للكلمات غير المُدرجة في القاموس.
أحدث إصدار هو 0.7b؛ ويحتوي على أكثر من 134,000 مدخل. يتوفر إصدار بحث تفاعلي. [ 2 ]
تنسيق قاعدة البيانات
تُوزَّع قاعدة البيانات كملف نصي عادي، يحتوي كل سطر على مدخل واحد، بالصيغة " " مع فاصل مسافتين بين الأجزاء. في حال وجود أكثر من نطق للكلمة، تُحدَّد المتغيرات باستخدام نسخ مرقمة (مثلاً ). يُشفَّر النطق باستخدام صيغة مُعدَّلة من نظام ARPABET ، مع إضافة علامات تشديد على حروف العلة من المستويات 0 و1 و2. يشير الرمز الموجود في بداية السطر إلى تعليق. كما يتوفر تنسيق مُشتق، مناسب مباشرةً لمحركات التعرف على الكلام، ضمن التوزيع؛ يدمج هذا التنسيق فروق التشديد (التي لا تُستخدم عادةً في التعرف التلقائي على الكلام).WORD<pronunciation>WORD(1);;;
فيما يلي جدول بالأصوات المستخدمة في قاموس النطق بجامعة كارنيجي ميلون. [ 2 ]
يعتمد محول Unifon على قاموس النطق الخاص بجامعة كارنيجي ميلون .
تحتوي مجموعة أدوات اللغة الطبيعية على واجهة لقاموس النطق الخاص بجامعة كارنيجي ميلون.
تتضمن أداة Carnegie Mellon Logios [ 5 ] قاموس النطق الخاص بجامعة كارنيجي ميلون.
يستخدم قاموس PronunDict ، وهو قاموس نطق للغة الإنجليزية الأمريكية، قاموس النطق بجامعة كارنيجي ميلون كمصدر بياناته. ويتم تدوين النطق باستخدام رموز الأبجدية الصوتية الدولية (IPA) . كما يدعم هذا القاموس البحث حسب النطق .
تستخدم بعض برامج توليف الأصوات الغنائية مثل CeVIO Creative Studio و Synthesizer V نسخة معدلة من قاموس النطق CMU لتوليف الأصوات الغنائية الإنجليزية.
يستخدم برنامج Transcriber ، وهو أداة للنسخ الصوتي للنص الكامل، قاموس النطق الخاص بجامعة كارنيجي ميلون
يستخدم تطبيق 15.ai ، وهو أداة لتحويل النص إلى كلام في الوقت الفعلي باستخدام الذكاء الاصطناعي، قاموس النطق الخاص بجامعة كارنيجي ميلون