قاعدة بيانات الكلام غير الأصلي

قاعدة بيانات الكلام غير الأصلي هي قاعدة بيانات كلامية للنطق غير الأصلي للغة الإنجليزية . تُستخدم مثل هذه القواعد البيانات في تطوير: أنظمة التعرف التلقائي على الكلام متعددة اللغات ، وأنظمة تحويل النص إلى كلام ، ومدربي النطق، وأنظمة تعلم اللغة الثانية . [1]

قائمة

الجدول 1: اختصارات اللغات المستخدمة في الجدول 2
عربي أ اليابانية ج
الصينية ج كوري ك
التشيكية تشيكية ماليزي م
دانماركي د النرويجية ن
هولندي دوت البرتغالية ص
إنجليزي هـ الروسية ر
فرنسي ف الأسبانية س
الألمانية ج السويدية سويدي
اليونانية جري تايلاندي ت
اللغة الإندونيسية إند الفيتنامية الخامس
ايطالي أنا    


يظهر الجدول الفعلي الذي يحتوي على معلومات حول قواعد البيانات المختلفة في الجدول 2.

الجدول 2: نظرة عامة على قواعد البيانات غير الأصلية
مجموعة مؤلف متوفر في اللغات #المتحدثون اللغة الأم #أوت. مدة تاريخ ملاحظات
[2] أمي الاتحاد الأوروبي هـ دوت وغيرها 100 ساعة تسجيلات الاجتماعات
ATR-جرون [3] جرون معدل الانحدار الخطي هـ 96 سي جي اف جيه إند 15000   2004 تقييم الكفاءة
مجموعة BAS Strange Corpus 1+10 [4]   إلرا ج 139 50 دولة 7500   1998  
مطعم بيركلي [5] الحقن المجهري هـ 55 جي آي إتش سي إف إس جي 2500 1994  
أخبار البث [6]   أقل البلدان نموا هـ         1997  
كامبريدج ويت [7] ويت جامعة كامبريدج هـ 10 جيكس 1200   1999  
كامبريدج-يي [8] نعم جامعة كامبريدج هـ 20 ج 1600   2005  
أخبار الأطفال [9] توموكيو جامعة كارنيجي ميلون هـ 62 جيه سي 7500   2000 جزئيا عفوية
مقاطع-صورة [10] تان مقاطع-صورة ف 15 السيرة الذاتية   6 ساعات 2006  
جامعة ولاية كاليفورنيا [11]   أقل البلدان نموا هـ   22 دولة 5000   2007 هاتف، عفوي
جامعة كارنيجي ميلون [12]   جامعة كارنيجي ميلون هـ 64 ج 452 0.9 ساعة   غير متاح
المدن المتقاطعة [13] شادن جامعة بوخوم EFGI التشيكية الألمانية 161 إي إف جي إس 72000 133 ساعة 2006 اسماء المدن
دوق أرسلان [14] أرسلان جامعة ديوك هـ 93 15 دولة 2200   1995 جزئيا الكلام عبر الهاتف
إي آر جيه [15] مينماتسو جامعة طوكيو هـ 200 ج 68000   2002 تقييم الكفاءة
فيشر [16] أقل البلدان نموا هـ كثير 200 ساعة خطاب هاتفي
فيت [17] فيت جامعة إدنبرة فين جري 10 هـ 700   1995 اسماء المدن
فراينكي [18]   جامعة إرلانجن هـ 19 ج 2148      
إسباني [19] بيرن   هـ 22 س   20 ساعة 1998 جزئيا عفوية
مركز تطوير التعليم العالي [20]   جامعة هونج كونج للعلوم والتكنولوجيا هـ 44 ج   3 ساعات 2010 متاح عند الطلب
آي بي إم فيشر [21]   آي بي إم هـ 40 SFGI 2000   2002 ارقام
آي كول [22] [23] تشين أنا 2 ر، أ*ستار ج 305 24 دولة 90841 142 ساعة 2015 النسخ الصوتية والنغمية (بالبينيين)، وتقييمات الكفاءة
الجزيرة [24] أتويل الاتحاد الأوروبي/ELDA هـ 46 الجهاز الهضمي 4000 18 ساعة 2000  
المشتري [25] زوي معهد ماساتشوستس للتكنولوجيا هـ مجهول مجهول 5146   1999 خطاب هاتفي
[26] كيه-إس إي سي ري سيتك هـ مجهول ك     2004
صحيفة وول ستريت جورنال الأمريكية 1 [27]   أقل البلدان نموا   10   800 1ساعة 1994  
قفزة [28] الأمعاء جامعة مونستر مصر 127 41 مختلفة 73.941 كلمة 12 ساعة 2003  
الضباب [29]   إلرا إي إف جي 75 دوت 2200   1996  
حلف شمال الأطلسي هايوير [30]   حلف شمال الأطلسي هـ 81 ف جري IS 8100   2007 كلام نظيف
مركز مراقبة الحركة الجوية التابع لحلف شمال الأطلسي [31] حمامة حلف شمال الأطلسي هـ 622 نظام المعلومات الجغرافية الفيدرالي 9833 17 ساعة 2007 ضوضاء خلفية ثقيلة
الناتو رقم 4 [32]   حلف شمال الأطلسي هـ 115 مجهول   7.5 ساعة 2006 ضوضاء خلفية ثقيلة
علم الأسماء [33]     د دوت إي أف جي غري إنبس سوي   (121000)   1995 المعجم فقط
PF-STAR [34]   جامعة إرلانجن هـ 57 ج 4627 3.4 ساعة 2005 كلام الاطفال
صن ستار [35]   الاتحاد الأوروبي هـ 100 جي إس آي بي دي 40000   1992 خطاب البرلمان
تي سي ستار [36] هوفيل إيلدا اللغة الاسبانية مجهول دول الاتحاد الأوروبي   13 ساعة 2006 مجموعات بيانات متعددة
تيد [37] لاميل إيلدا هـ 40(188) كثير   10 ساعات (47 ساعة) 1994 يوروسبيتش 93
[38] تي إل تي إس   داربا أ   هـ   1ساعة 2004  
طوكيو-كيكوكو [39]   جامعة طوكيو ج 140 10 دول 35000   2004 تقييم الكفاءة
فيربموبيل [40]   جامعة ميونيخ هـ 44 ج   1.5 ساعة 1994 عفوية جدا
فوديس [41]   الاتحاد الأوروبي اف جي 178 اف جي 2500   1998 حول الملاحة في السيارة
[42] ووردبريس عربي روكا أقل البلدان نموا أ 35 هـ 800 1ساعة 2002  
WP الروسية [43] روكا أقل البلدان نموا ر 26 هـ 2500 ساعتان 2003  
WP الإسبانية [44] مورجان أقل البلدان نموا س   هـ     2006  
تحدثت صحيفة وول ستريت جورنال [45]     هـ 10 مجهول 800   1993  


أسطورة

في جدول قواعد البيانات غير الأصلية، يتم استخدام بعض الاختصارات لأسماء اللغات. وهي مدرجة في الجدول 1. يقدم الجدول 2 المعلومات التالية حول كل مجموعة: اسم المجموعة، والمؤسسة التي يمكن الحصول على المجموعة منها، أو على الأقل يجب أن تتوفر معلومات إضافية، واللغة التي تحدث بها المتحدثون بالفعل، وعدد المتحدثين، واللغة الأم للمتحدثين، والعدد الإجمالي للكلمات غير الأصلية التي تحتوي عليها المجموعة، ومدة الجزء غير الأصلي بالساعات، وتاريخ أول إشارة عامة إلى هذه المجموعة، وبعض النصوص الحرة التي تسلط الضوء على جوانب خاصة بهذه القاعدة البيانات، ومرجع إلى منشور آخر. يكون المرجع في الحقل الأخير في معظم الحالات إلى الورقة التي كرسها جامعو البيانات الأصليون بشكل خاص لوصف هذه المجموعة. في بعض الحالات لم يكن من الممكن تحديد مثل هذه الورقة. في هذه الحالات، تتم الإشارة إلى ورقة تستخدم هذه المجموعة.

تُترك بعض الإدخالات فارغة ويتم وضع علامة على البعض الآخر بعلامة "غير معروف". والفرق هنا هو أن الإدخالات الفارغة تشير إلى السمات حيث لا تكون القيمة معروفة. ومع ذلك، تشير الإدخالات غير المعروفة إلى عدم توفر أي معلومات حول هذه السمة في قاعدة البيانات نفسها. على سبيل المثال، في قاعدة بيانات الطقس في جوبيتر [46] لا توجد معلومات حول أصل المتحدثين. وبالتالي، ستكون هذه البيانات أقل فائدة للتحقق من اكتشاف اللهجة أو القضايا المماثلة.

عندما يكون ذلك ممكنًا، يكون الاسم هو الاسم القياسي للمجموعة، ولكن بالنسبة لبعض المجموعات الأصغر حجمًا، لم يكن هناك اسم ثابت، وبالتالي كان لا بد من إنشاء معرف. في مثل هذه الحالات، يتم استخدام مزيج من المؤسسة وجامع قاعدة البيانات.

في حالة احتواء قواعد البيانات على كلام أصلي وغير أصلي، يتم سرد سمات الجزء غير الأصلي من المجموعة فقط. معظم المجموعات عبارة عن مجموعات من الكلام المقروء. إذا كانت المجموعة تتكون جزئيًا أو كليًا من عبارات عفوية، فسيتم ذكر ذلك في عمود "الخاصة".

مراجع

  1. ^ م. راب، ر. جرون وإي. نويث، قواعد بيانات الكلام غير الأصلي ، في وقائع ASRU، كيوتو، اليابان، 2007.
  2. ^ مشروع AMI، "AMI Meeting Corpus" [1].
  3. ^ ر. جرون، ت. سينكاريك، وس. ناكامورا، "قاعدة بيانات إنجليزية متعددة اللهجات لغير الناطقين بها"، في ASJ، 2004.
  4. ^ جامعة ميونيخ، "الأرشيف البافاري لإشارات الكلام في مجموعة غريبة"، [2].
  5. ^ جورافسكي وآخرون، "مشروع مطعم بيركلي"، وقائع المؤتمر الدولي لعلوم البيئة والتنمية المستدامة 1994.
  6. ^ ل. توموكييو، التعرف على الكلام غير الأصلي: توصيف الاستخدام غير الأصلي والتكيف معه في التعرف على الكلام ، أطروحة دكتوراه، جامعة كارنيجي ميلون، بنسلفانيا، 2001.
  7. ^ S. Witt، استخدام التعرف على الكلام في التعلم اللغوي بمساعدة الكمبيوتر ، أطروحة دكتوراه، قسم الهندسة بجامعة كامبريدج، المملكة المتحدة، 1999.
  8. ^ H. Ye و S. Young، تحسين أداء التعرف على الكلام للمبتدئين في التفاعل المحادثة المنطوقة لتعلم اللغة ، في Proc. Interspeech، لشبونة، البرتغال، 2005.
  9. ^ ل. توموكييو، التعرف على الكلام غير الأصلي: توصيف الاستخدام غير الأصلي والتكيف معه في التعرف على الكلام ، أطروحة دكتوراه، جامعة كارنيجي ميلون، بنسلفانيا، 2001.
  10. ^ TP Tan و L. Besacier، مجموعة من النصوص الفرنسية غير الأصلية للتعرف التلقائي على الكلام ، في مركز أبحاث اللغة الفرنسية، جنوة، إيطاليا، 2006.
  11. ^ T. Lander, CSLU: إصدار اللغة الإنجليزية باللهجة الأجنبية 1.2 ، Tech. Rep., LDC، فيلادلفيا، بنسلفانيا، 2007.
  12. ^ Z. Wang و T. Schultz و A. Waibel، مقارنة تقنيات التكيف مع النموذج الصوتي على الكلام غير الأصلي ، في وقائع ICASSP ، 2003.
  13. ^ S. Schaden، Regelbasierte Modellierung fremdsprachlich akzentbehafteter Aussprachevarianten ، دكتوراه. أطروحة، جامعة دويسبورغ-إيسن، 2006.
  14. ^ إل إم أرسلان وجيه إتش هانسن، الخصائص الترددية للكلام ذي اللهجة الأجنبية ، في وقائع ICASSP ، ميونيخ، ألمانيا، 1997، ص 1123-1126.
  15. ^ N. Minematsu et al., تطوير قاعدة بيانات الكلام الإنجليزي التي يقرأها اليابانيون لدعم أبحاث CALL ، في ICA، كيوتو، اليابان، 2004، ص 577-560.
  16. ^ كريستوفر سييري، ديفيد ميلر، كيفن ووكر، مجموعة فيشر: مورد للأجيال القادمة من تحويل الكلام إلى نص ، وقائع مؤتمر LREC 2004
  17. ^ س. فيت، نطق أسماء المدن الأصلية وغير الأصلية غير المألوفة ، في وقائع يوروسبيتش، 1995، ص 2227-2230.
  18. ^ G. Stemmer و E. Noeth و H. Niemann، النمذجة الصوتية للكلمات الأجنبية في نظام التعرف على الكلام الألماني ، في Proc. Eurospeech، P. Dalsgaard و B. Lindberg و H. Benner، المحررون، 2001، المجلد 4، ص 2745-2748.
  19. ^ دبليو بيرن، وإي. كنودت، وس. خودانبور، وجيه بيرنشتاين، هل التعرف التلقائي على الكلام جاهز للكلام غير الأصلي؟ جهد جمع البيانات والتجارب الأولية في نمذجة المحادثة الإنجليزية الإسبانية ، في STiLL، مارهولمن، السويد، 1998، ص 37-40.
  20. ^ Y. Li، P. Fung، P. Xu، و Y. Liu، النمذجة الصوتية غير المتماثلة للتعرف على الكلام بلغات مختلطة ، في ICASSP، براغ، جمهورية التشيك، 2011، ص 37-40.
  21. ^ V. Fischer، و E. Janke، و S. Kunzmann، التقدم الأخير في فك تشفير الكلام غير الأصلي باستخدام النماذج الصوتية متعددة اللغات ، في وقائع Eurospeech، 2003، ص 3105-3108.
  22. ^ نانسي ف. تشين، رونغ تونغ، دارين وي، بيكسوان لي، بين ما، هايزو لي، iCALL Corpus: اللغة الصينية المندرينية التي يتحدث بها المتحدثون غير الأصليين من أصل أوروبي ، في وقائع Interspeech، 2015.
  23. ^ نانسي ف. تشين، فيفاك شيفاكومار، ماهيش هاريكومار، بين ما، هايزو لي. توصيف واسع النطاق لأخطاء نطق الماندرين التي يرتكبها المتحدثون الأصليون للغات الأوروبية ، في وقائع إنترسبيتش، 2013.
  24. ^ و. مينزل، إي. أتويل، ب. بونافينتورا، د. هيرون، ب. هاورث، ر. مورتون، وسي سوتر، مجموعة جزر آيل للغة الإنجليزية المنطوقة غير الأصلية ، في مركز أبحاث اللغة الإنجليزية، أثينا، اليونان، 2000، ص 957-963.
  25. ^ K. Livescu، تحليل ونمذجة الكلام غير الأصلي للتعرف التلقائي على الكلام ، أطروحة ماجستير، معهد ماساتشوستس للتكنولوجيا، كامبريدج، ماساتشوستس، 1999.
  26. ^ SC. Rhee وSH. Lee وSK. Kang وYJ. Lee، تصميم وبناء مجموعة من النصوص الإنجليزية المنطوقة باللغة الكورية (K-SEC) ، Proc. ICSLP 2004
  27. ^ ل. توموكييو، التعرف على الكلام غير الأصلي: توصيف الاستخدام غير الأصلي والتكيف معه في التعرف على الكلام ، أطروحة دكتوراه، جامعة كارنيجي ميلون، بنسلفانيا، 2001.
  28. ^ جوت، يو، الكلام غير الأصلي. تحليل قائم على مجموعة من النصوص للخصائص الصوتية والصوتية للغة الإنجليزية والألمانية كلغة ثانية ، فرانكفورت أم ماين: بيتر لانج، 2009.
  29. ^ معهد أبحاث العوامل البشرية TNO، قاعدة بيانات التوافق المتعدد اللغات في تكنولوجيا الكلام ، الممثل الفني، ELRA، باريس، فرنسا، 2007، مرجع كتالوج ELRA S0238.
  30. ^ JC Segura et al., قاعدة بيانات HIWIRE، وهي عبارة عن مجموعة من قواعد الكلام الإنجليزية الصاخبة وغير الأصلية للتواصل في قمرة القيادة ، 2007، [3].
  31. ^ س. بيجون، و. شين، و. فان ليوين، تصميم وتوصيف قاعدة بيانات الاتصالات الجوية العسكرية غير الأصلية ، في ICSLP، أنتويرب، بلجيكا، 2007.
  32. ^ L. Benarousse et al., The NATO native and non-native (n4) speech corpus ، في وقائع ورشة عمل MIST (ESCA-NATO)، Leusden، سبتمبر 1999.
  33. ^ Onomastica Consortium, The ONOMASTICA interlanguage pronunciation lexicon , in Proc. Eurospeech, Madrid, Spain, 1995, pp. 829-832.
  34. ^ C. Hacker، وT. Cincarek، وA. Maier، وA. Hessler، وE. Noeth، تعزيز السمات النطقية والنطقية للكشف عن الأخطاء النطقية لدى الأطفال غير الأصليين ، في وقائع ICASSP، هونولولو، هاواي، 2007، ص 197-200.
  35. ^ C. Teixeira، I. Trancoso، و A. Serralheiro، التعرف على اللهجات غير الأصلية ، في Proc. Eurospeech، رودس، اليونان، 1997، ص 2375-2378.
  36. ^ H. Heuvel، K. Choukri، C. Gollan، A. Moreno، و D. Mostefa، TC-STAR: موارد لغوية جديدة لأغراض التعرف على الكلام وتعلم اللغة ، في LREC، جنوة، 2006، ص 2570-2573.
  37. ^ LF Lamel ، F. Schiel، A. Fourcin، J. Mariani، و H. Tillmann، قاعدة بيانات اللغة الإنجليزية عبر اللغات TED ، في ICSLP، يوكوهاما، اليابان، سبتمبر 1994.
  38. ^ ن. موتي، ل. جونسون، أ. سيثي، ج. سيلفا، وس. نارايانان، الكشف التكتيكي عن اللغة ونمذجة أخطاء الكلام لدى المتعلم: حالة التدريب التكتيكي للغة العربية للمتحدثين باللغة الإنجليزية الأمريكية ، في وقائع InSTIL، يونيو 2004.
  39. ^ K. Nishina، تطوير قاعدة بيانات الكلام الياباني التي يقرأها المتحدثون غير الأصليين لبناء نظام CALL ، في ICA، كيوتو، اليابان، 2004، ص 561-564.
  40. ^ جامعة ميونيخ، مشروع Verbmobil ، [4].
  41. ^ I. Trancoso، وC. Viana، وI. Mascarenhas، وC. Teixeira، حول استنباط قواعد النطق الأصلي في استعلامات التنقل ، في Proc. Eurospeech، 1999.
  42. ^ أ. لاروكا و ر. شويري، مجموعة خطابات ويست بوينت العربية ، ممثل التكنولوجيا، مركز دراسات اللغة الإنجليزية، فيلادلفيا، بنسلفانيا، 2002.
  43. ^ أ. لاروكا و ج. تومي، مجموعة خطابات اللغة الروسية في ويست بوينت ، ممثل التكنولوجيا، مركز دراسات اللغة الروسية، فيلادلفيا، بنسلفانيا، 2003.
  44. ^ ج. مورجان، خطاب بطل ويست بوينت الإسباني ، ممثل التكنولوجيا، LDC، فيلادلفيا، بنسلفانيا، 2006.
  45. ^ I. Amdal، وF. Korkmazskiy، وAC Surendran، نمذجة النطق المشترك للمتحدثين غير الأصليين باستخدام أساليب تعتمد على البيانات ، في ICSLP، بكين، الصين، 2000، ص 622-625.
  46. ^ K. Livescu، تحليل ونمذجة الكلام غير الأصلي للتعرف التلقائي على الكلام ، أطروحة ماجستير، معهد ماساتشوستس للتكنولوجيا، كامبريدج، ماساتشوستس، 1999.
تم الاسترجاع من "https://en.wikipedia.org/w/index.php?title=قاعدة_بيانات_الكلام_غير_الأصلي&oldid=1086393186"
Original text
Rate this translation
Your feedback will be used to help improve Google Translate