قاعدة بيانات الكلام غير الأصلي
قاعدة بيانات الكلام غير الأصلي هي قاعدة بيانات كلامية للنطق غير الأصلي للغة الإنجليزية . تُستخدم مثل هذه القواعد البيانات في تطوير: أنظمة التعرف التلقائي على الكلام متعددة اللغات ، وأنظمة تحويل النص إلى كلام ، ومدربي النطق، وأنظمة تعلم اللغة الثانية . [1]
قائمة
|
يظهر الجدول الفعلي الذي يحتوي على معلومات حول قواعد البيانات المختلفة في الجدول 2.
|
أسطورة
في جدول قواعد البيانات غير الأصلية، يتم استخدام بعض الاختصارات لأسماء اللغات. وهي مدرجة في الجدول 1. يقدم الجدول 2 المعلومات التالية حول كل مجموعة: اسم المجموعة، والمؤسسة التي يمكن الحصول على المجموعة منها، أو على الأقل يجب أن تتوفر معلومات إضافية، واللغة التي تحدث بها المتحدثون بالفعل، وعدد المتحدثين، واللغة الأم للمتحدثين، والعدد الإجمالي للكلمات غير الأصلية التي تحتوي عليها المجموعة، ومدة الجزء غير الأصلي بالساعات، وتاريخ أول إشارة عامة إلى هذه المجموعة، وبعض النصوص الحرة التي تسلط الضوء على جوانب خاصة بهذه القاعدة البيانات، ومرجع إلى منشور آخر. يكون المرجع في الحقل الأخير في معظم الحالات إلى الورقة التي كرسها جامعو البيانات الأصليون بشكل خاص لوصف هذه المجموعة. في بعض الحالات لم يكن من الممكن تحديد مثل هذه الورقة. في هذه الحالات، تتم الإشارة إلى ورقة تستخدم هذه المجموعة.
تُترك بعض الإدخالات فارغة ويتم وضع علامة على البعض الآخر بعلامة "غير معروف". والفرق هنا هو أن الإدخالات الفارغة تشير إلى السمات حيث لا تكون القيمة معروفة. ومع ذلك، تشير الإدخالات غير المعروفة إلى عدم توفر أي معلومات حول هذه السمة في قاعدة البيانات نفسها. على سبيل المثال، في قاعدة بيانات الطقس في جوبيتر [46] لا توجد معلومات حول أصل المتحدثين. وبالتالي، ستكون هذه البيانات أقل فائدة للتحقق من اكتشاف اللهجة أو القضايا المماثلة.
عندما يكون ذلك ممكنًا، يكون الاسم هو الاسم القياسي للمجموعة، ولكن بالنسبة لبعض المجموعات الأصغر حجمًا، لم يكن هناك اسم ثابت، وبالتالي كان لا بد من إنشاء معرف. في مثل هذه الحالات، يتم استخدام مزيج من المؤسسة وجامع قاعدة البيانات.
في حالة احتواء قواعد البيانات على كلام أصلي وغير أصلي، يتم سرد سمات الجزء غير الأصلي من المجموعة فقط. معظم المجموعات عبارة عن مجموعات من الكلام المقروء. إذا كانت المجموعة تتكون جزئيًا أو كليًا من عبارات عفوية، فسيتم ذكر ذلك في عمود "الخاصة".
مراجع
- ^ م. راب، ر. جرون وإي. نويث، قواعد بيانات الكلام غير الأصلي ، في وقائع ASRU، كيوتو، اليابان، 2007.
- ^ مشروع AMI، "AMI Meeting Corpus" [1].
- ^ ر. جرون، ت. سينكاريك، وس. ناكامورا، "قاعدة بيانات إنجليزية متعددة اللهجات لغير الناطقين بها"، في ASJ، 2004.
- ^ جامعة ميونيخ، "الأرشيف البافاري لإشارات الكلام في مجموعة غريبة"، [2].
- ^ جورافسكي وآخرون، "مشروع مطعم بيركلي"، وقائع المؤتمر الدولي لعلوم البيئة والتنمية المستدامة 1994.
- ^ ل. توموكييو، التعرف على الكلام غير الأصلي: توصيف الاستخدام غير الأصلي والتكيف معه في التعرف على الكلام ، أطروحة دكتوراه، جامعة كارنيجي ميلون، بنسلفانيا، 2001.
- ^ S. Witt، استخدام التعرف على الكلام في التعلم اللغوي بمساعدة الكمبيوتر ، أطروحة دكتوراه، قسم الهندسة بجامعة كامبريدج، المملكة المتحدة، 1999.
- ^ H. Ye و S. Young، تحسين أداء التعرف على الكلام للمبتدئين في التفاعل المحادثة المنطوقة لتعلم اللغة ، في Proc. Interspeech، لشبونة، البرتغال، 2005.
- ^ ل. توموكييو، التعرف على الكلام غير الأصلي: توصيف الاستخدام غير الأصلي والتكيف معه في التعرف على الكلام ، أطروحة دكتوراه، جامعة كارنيجي ميلون، بنسلفانيا، 2001.
- ^ TP Tan و L. Besacier، مجموعة من النصوص الفرنسية غير الأصلية للتعرف التلقائي على الكلام ، في مركز أبحاث اللغة الفرنسية، جنوة، إيطاليا، 2006.
- ^ T. Lander, CSLU: إصدار اللغة الإنجليزية باللهجة الأجنبية 1.2 ، Tech. Rep., LDC، فيلادلفيا، بنسلفانيا، 2007.
- ^ Z. Wang و T. Schultz و A. Waibel، مقارنة تقنيات التكيف مع النموذج الصوتي على الكلام غير الأصلي ، في وقائع ICASSP ، 2003.
- ^ S. Schaden، Regelbasierte Modellierung fremdsprachlich akzentbehafteter Aussprachevarianten ، دكتوراه. أطروحة، جامعة دويسبورغ-إيسن، 2006.
- ^ إل إم أرسلان وجيه إتش هانسن، الخصائص الترددية للكلام ذي اللهجة الأجنبية ، في وقائع ICASSP ، ميونيخ، ألمانيا، 1997، ص 1123-1126.
- ^ N. Minematsu et al., تطوير قاعدة بيانات الكلام الإنجليزي التي يقرأها اليابانيون لدعم أبحاث CALL ، في ICA، كيوتو، اليابان، 2004، ص 577-560.
- ^ كريستوفر سييري، ديفيد ميلر، كيفن ووكر، مجموعة فيشر: مورد للأجيال القادمة من تحويل الكلام إلى نص ، وقائع مؤتمر LREC 2004
- ^ س. فيت، نطق أسماء المدن الأصلية وغير الأصلية غير المألوفة ، في وقائع يوروسبيتش، 1995، ص 2227-2230.
- ^ G. Stemmer و E. Noeth و H. Niemann، النمذجة الصوتية للكلمات الأجنبية في نظام التعرف على الكلام الألماني ، في Proc. Eurospeech، P. Dalsgaard و B. Lindberg و H. Benner، المحررون، 2001، المجلد 4، ص 2745-2748.
- ^ دبليو بيرن، وإي. كنودت، وس. خودانبور، وجيه بيرنشتاين، هل التعرف التلقائي على الكلام جاهز للكلام غير الأصلي؟ جهد جمع البيانات والتجارب الأولية في نمذجة المحادثة الإنجليزية الإسبانية ، في STiLL، مارهولمن، السويد، 1998، ص 37-40.
- ^ Y. Li، P. Fung، P. Xu، و Y. Liu، النمذجة الصوتية غير المتماثلة للتعرف على الكلام بلغات مختلطة ، في ICASSP، براغ، جمهورية التشيك، 2011، ص 37-40.
- ^ V. Fischer، و E. Janke، و S. Kunzmann، التقدم الأخير في فك تشفير الكلام غير الأصلي باستخدام النماذج الصوتية متعددة اللغات ، في وقائع Eurospeech، 2003، ص 3105-3108.
- ^ نانسي ف. تشين، رونغ تونغ، دارين وي، بيكسوان لي، بين ما، هايزو لي، iCALL Corpus: اللغة الصينية المندرينية التي يتحدث بها المتحدثون غير الأصليين من أصل أوروبي ، في وقائع Interspeech، 2015.
- ^ نانسي ف. تشين، فيفاك شيفاكومار، ماهيش هاريكومار، بين ما، هايزو لي. توصيف واسع النطاق لأخطاء نطق الماندرين التي يرتكبها المتحدثون الأصليون للغات الأوروبية ، في وقائع إنترسبيتش، 2013.
- ^ و. مينزل، إي. أتويل، ب. بونافينتورا، د. هيرون، ب. هاورث، ر. مورتون، وسي سوتر، مجموعة جزر آيل للغة الإنجليزية المنطوقة غير الأصلية ، في مركز أبحاث اللغة الإنجليزية، أثينا، اليونان، 2000، ص 957-963.
- ^ K. Livescu، تحليل ونمذجة الكلام غير الأصلي للتعرف التلقائي على الكلام ، أطروحة ماجستير، معهد ماساتشوستس للتكنولوجيا، كامبريدج، ماساتشوستس، 1999.
- ^ SC. Rhee وSH. Lee وSK. Kang وYJ. Lee، تصميم وبناء مجموعة من النصوص الإنجليزية المنطوقة باللغة الكورية (K-SEC) ، Proc. ICSLP 2004
- ^ ل. توموكييو، التعرف على الكلام غير الأصلي: توصيف الاستخدام غير الأصلي والتكيف معه في التعرف على الكلام ، أطروحة دكتوراه، جامعة كارنيجي ميلون، بنسلفانيا، 2001.
- ^ جوت، يو، الكلام غير الأصلي. تحليل قائم على مجموعة من النصوص للخصائص الصوتية والصوتية للغة الإنجليزية والألمانية كلغة ثانية ، فرانكفورت أم ماين: بيتر لانج، 2009.
- ^ معهد أبحاث العوامل البشرية TNO، قاعدة بيانات التوافق المتعدد اللغات في تكنولوجيا الكلام ، الممثل الفني، ELRA، باريس، فرنسا، 2007، مرجع كتالوج ELRA S0238.
- ^ JC Segura et al., قاعدة بيانات HIWIRE، وهي عبارة عن مجموعة من قواعد الكلام الإنجليزية الصاخبة وغير الأصلية للتواصل في قمرة القيادة ، 2007، [3].
- ^ س. بيجون، و. شين، و. فان ليوين، تصميم وتوصيف قاعدة بيانات الاتصالات الجوية العسكرية غير الأصلية ، في ICSLP، أنتويرب، بلجيكا، 2007.
- ^ L. Benarousse et al., The NATO native and non-native (n4) speech corpus ، في وقائع ورشة عمل MIST (ESCA-NATO)، Leusden، سبتمبر 1999.
- ^ Onomastica Consortium, The ONOMASTICA interlanguage pronunciation lexicon , in Proc. Eurospeech, Madrid, Spain, 1995, pp. 829-832.
- ^ C. Hacker، وT. Cincarek، وA. Maier، وA. Hessler، وE. Noeth، تعزيز السمات النطقية والنطقية للكشف عن الأخطاء النطقية لدى الأطفال غير الأصليين ، في وقائع ICASSP، هونولولو، هاواي، 2007، ص 197-200.
- ^ C. Teixeira، I. Trancoso، و A. Serralheiro، التعرف على اللهجات غير الأصلية ، في Proc. Eurospeech، رودس، اليونان، 1997، ص 2375-2378.
- ^ H. Heuvel، K. Choukri، C. Gollan، A. Moreno، و D. Mostefa، TC-STAR: موارد لغوية جديدة لأغراض التعرف على الكلام وتعلم اللغة ، في LREC، جنوة، 2006، ص 2570-2573.
- ^ LF Lamel ، F. Schiel، A. Fourcin، J. Mariani، و H. Tillmann، قاعدة بيانات اللغة الإنجليزية عبر اللغات TED ، في ICSLP، يوكوهاما، اليابان، سبتمبر 1994.
- ^ ن. موتي، ل. جونسون، أ. سيثي، ج. سيلفا، وس. نارايانان، الكشف التكتيكي عن اللغة ونمذجة أخطاء الكلام لدى المتعلم: حالة التدريب التكتيكي للغة العربية للمتحدثين باللغة الإنجليزية الأمريكية ، في وقائع InSTIL، يونيو 2004.
- ^ K. Nishina، تطوير قاعدة بيانات الكلام الياباني التي يقرأها المتحدثون غير الأصليين لبناء نظام CALL ، في ICA، كيوتو، اليابان، 2004، ص 561-564.
- ^ جامعة ميونيخ، مشروع Verbmobil ، [4].
- ^ I. Trancoso، وC. Viana، وI. Mascarenhas، وC. Teixeira، حول استنباط قواعد النطق الأصلي في استعلامات التنقل ، في Proc. Eurospeech، 1999.
- ^ أ. لاروكا و ر. شويري، مجموعة خطابات ويست بوينت العربية ، ممثل التكنولوجيا، مركز دراسات اللغة الإنجليزية، فيلادلفيا، بنسلفانيا، 2002.
- ^ أ. لاروكا و ج. تومي، مجموعة خطابات اللغة الروسية في ويست بوينت ، ممثل التكنولوجيا، مركز دراسات اللغة الروسية، فيلادلفيا، بنسلفانيا، 2003.
- ^ ج. مورجان، خطاب بطل ويست بوينت الإسباني ، ممثل التكنولوجيا، LDC، فيلادلفيا، بنسلفانيا، 2006.
- ^ I. Amdal، وF. Korkmazskiy، وAC Surendran، نمذجة النطق المشترك للمتحدثين غير الأصليين باستخدام أساليب تعتمد على البيانات ، في ICSLP، بكين، الصين، 2000، ص 622-625.
- ^ K. Livescu، تحليل ونمذجة الكلام غير الأصلي للتعرف التلقائي على الكلام ، أطروحة ماجستير، معهد ماساتشوستس للتكنولوجيا، كامبريدج، ماساتشوستس، 1999.
