نظام الهمس (نظام التعرف على الكلام)

Whisper هو نموذج للتعلم الآلي للتعرف على الكلام والنسخ ، تم إنشاؤه بواسطة OpenAI وتم إصداره لأول مرة كبرنامج مفتوح المصدر في سبتمبر 2022. [ 4 ]

يستطيع هذا النظام تحويل الكلام إلى نص باللغة الإنجليزية ولغات أخرى متعددة، كما يمكنه ترجمة العديد من اللغات غير الإنجليزية إلى الإنجليزية. [ 1 ] يُعدّ Whisper نموذجًا صوتيًا للتعلم العميق بإشراف ضعيف ، تم تطويره باستخدام بنية محوّل التشفير-فك التشفير . [ 1 ] تدّعي OpenAI أن الجمع بين بيانات التدريب المختلفة وعمليات الترشيح اللاحقة للتدريب المستخدمة في تطويره قد أدى إلى تحسين التعرف على اللهجات والضوضاء الخلفية والمصطلحات المتخصصة مقارنةً بالأساليب السابقة. [ 5 ] على الرغم من أن أداء النموذج لا يتفوق على النماذج الأكبر والأكثر تخصصًا، ولا يزال يعاني من بعض التشويش الناتج عن الذكاء الاصطناعي ، فقد أثبت جدواه في التعرف على الأصوات بشكل عام، وله تطبيقات عديدة في مختلف القطاعات.

خلفية

يتمتع التعرف على الكلام بتاريخ طويل في مجال البحث؛ حيث استخدمت المناهج الأولى أساليب إحصائية ، مثل تقنية مطابقة الوقت الديناميكية ، ولاحقًا نماذج ماركوف المخفية . في العقد الثاني من الألفية الثانية تقريبًا، أصبحت مناهج الشبكات العصبية العميقة أكثر شيوعًا في نماذج التعرف على الكلام، وذلك بفضل توفر مجموعات البيانات الضخمة (" البيانات الكبيرة ") وزيادة الأداء الحسابي. [ 6 ] شملت المناهج المبكرة للتعلم العميق في التعرف على الكلام الشبكات العصبية الالتفافية ، التي كانت محدودة بسبب عدم قدرتها على استيعاب البيانات المتسلسلة، مما أدى لاحقًا إلى تطوير مناهج Seq2seq ، التي تتضمن الشبكات العصبية المتكررة ، والتي تستخدم الذاكرة طويلة المدى . [ 7 ]

أحدثت تقنية Transformers ، التي قدمتها جوجل عام 2017، ثورةً في مجال التعلم الآلي ، متجاوزةً العديد من الأساليب الرائدة السابقة ، وأصبحت البنية العصبية الأساسية في مجالات مثل نمذجة اللغة ورؤية الحاسوب . [ 8 ] وفي أوائل العقد الثاني من القرن الحادي والعشرين، تم الاعتراف بأساليب التدريب شبه الموجه للنماذج الصوتية كتقنيات واعدة للتعرف على الكلام باستخدام الشبكات العصبية العميقة. [ 9 ]

بحسب تقرير لصحيفة نيويورك تايمز ، اعتقدت شركة OpenAI في عام 2021 أنها استنفدت مصادر البيانات عالية الجودة لتدريب نماذجها اللغوية الضخمة ، فقررت استكمال النصوص المستخرجة من الإنترنت بنصوص مكتوبة من مقاطع فيديو يوتيوب والبودكاست، وطورت برنامج Whisper لحل هذه المهمة. [ 10 ]

تم إطلاق Whisper Large V2 في 8 ديسمبر 2022، [ 11 ] وتلاه إطلاق Whisper Large V3 في نوفمبر 2023، خلال يوم مطوري OpenAI. [ 12 ] وفي مارس 2025، أصدرت OpenAI نماذج نسخ جديدة تعتمد على GPT-4o وGPT-4o mini، وكلاهما يتميز بمعدلات خطأ أقل من Whisper. [ 13 ]

بنيان

بنية OpenAI Whisper
بنية محول قياسية، تُظهر على اليسار جهاز التشفير، وعلى اليمين جهاز فك التشفير

تعتمد بنية Whisper على محول التشفير-فك التشفير. [ 1 ]

تُعاد معاينة الصوت المدخل إلى 16000 هرتز (Hz) ويتم تحويله إلى مخطط طيفي ميلي ذي 80 قناة باستخدام نوافذ زمنية مدتها 25 مللي ثانية وخطوة زمنية قدرها 10 مللي ثانية. ثم يُعاد تطبيع المخطط الطيفي إلى نطاق [-1، 1] بمتوسط ​​قريب من الصفر.

يستقبل المُشفِّر مخطط ميل الطيفي هذا كمدخل ويُعالجه. يمر أولاً عبر طبقتين التفافيتين ، ثم تُضاف إليه تضمينات موضعية جيبية. بعد ذلك، يُعالج بواسطة سلسلة من وحدات مُشفِّر المحول (مع وصلات متبقية قبل التنشيط ). يتم تطبيع خرج المُشفِّر طبقةً تلو الأخرى.

المُفكِّك هو مُفكِّك مُحوِّل قياسي. له نفس العرض ووحدات المُحوِّل المُستخدمة في المُشفِّر. يستخدم تضمينات موضعية مُتعلَّمة وتمثيلات مُرتبطة للرموز بين المُدخلات والمُخرجات (باستخدام نفس مصفوفة الأوزان لكلٍّ من تضمينات المُدخلات والمُخرجات). يستخدم مُجزِّئًا للرموز مُشفَّرًا على شكل أزواج بايت ، من نفس النوع المُستخدم في GPT-2 . تستخدم النماذج الإنجليزية فقط مُفردات GPT-2، بينما تستخدم النماذج مُتعددة اللغات مُفردات مُعاد تدريبها مُتعددة اللغات بنفس عدد الكلمات.

تُستخدم رموز خاصة للسماح لجهاز فك التشفير بأداء مهام متعددة:

  • الرموز التي تدل على اللغة (رمز فريد واحد لكل لغة).
  • الرموز التي تحدد المهمة ( <|transcribe|>أو <|translate|>).
  • الرموز التي تحدد ما إذا كانت هناك طوابع زمنية أم لا ( <|notimestamps|>). إذا لم يكن الرمز موجودًا، فإن وحدة فك التشفير تتوقع الطوابع الزمنية بالنسبة للمقطع، ويتم تحديدها بفواصل زمنية قدرها 20 مللي ثانية.
  • <|nospeech|>للكشف عن النشاط الصوتي.
  • <|startoftranscript|>و <|endoftranscript|>. أي نص يظهر قبل ذلك <|startoftranscript|>لا يُولّده المُفكِّك، بل يُعطى له كسياق. يُحسب الفقد فقط على الأجزاء غير السياقية من التسلسل، أي الرموز بين هذين الرمزين المميزين.

بيانات التدريب

تتألف مجموعة بيانات التدريب من 680,000 ساعة من أزواج الصوت والنصوص المصنفة، والتي تم الحصول عليها من الإنترنت باستخدام التعلم شبه الموجه . وتشمل هذه البيانات 117,000 ساعة في 96 لغة غير الإنجليزية، و125,000 ساعة من بيانات الترجمة من لغة إلى أخرى (X→الإنجليزية)، حيث يرمز X إلى أي لغة غير الإنجليزية. [ 1 ]

تضمنت المعالجة المسبقة توحيد النصوص، وتصفيتها لإزالة النصوص المُولّدة آليًا باستخدام أساليب استدلالية (مثل علامات الترقيم، واستخدام الأحرف الكبيرة)، وتحديد اللغة ومطابقتها مع النصوص، وإزالة التكرارات التقريبية ، وإزالة التكرارات مع مجموعات بيانات التقييم لتجنب تلوث البيانات. كما أُضيفت مقاطع صامتة للسماح بتدريب كشف النشاط الصوتي . بالنسبة للملفات المتبقية بعد عملية التصفية، قُسّمت الملفات الصوتية إلى مقاطع مدتها 30 ثانية، مُقترنة بمجموعة فرعية من النص الذي يقع ضمن تلك المدة. إذا اختلفت اللغة المنطوقة المُتوقعة عن لغة النص المُرتبط بالصوت، لم يُستخدم هذا الزوج من الصوت والنص لتدريب نماذج التعرف على الكلام، بل استُخدم لتدريب الترجمة.

تم تدريب النموذج باستخدام مُحسِّن AdamW مع تقليم معيار التدرج وانخفاض معدل التعلم الخطي مع فترة تهيئة، بحجم دفعة 256 مقطعًا. استمر التدريب لمليون تحديث (ما يقارب 2-3 دورات تدريبية ). لم يتم استخدام أي تضخيم أو تنظيم للبيانات، باستثناء نموذج Large V2 الذي استخدم SpecAugment و Stochastic Depth وBPE Dropout. اعتمد التدريب على التوازي في البيانات مع float16 ، وتوسيع نطاق الخسارة الديناميكي، ونقاط التحقق من التنشيط.

الترشيح بعد التدريب

بعد تدريب النموذج الأول، قام الباحثون بتشغيله على مجموعات فرعية مختلفة من بيانات التدريب، تمثل كل منها مصدرًا مختلفًا. تم تصنيف مصادر البيانات بناءً على مزيج من معدل الخطأ وحجمها. ساعد الفحص اليدوي للمصادر الأعلى تصنيفًا (ذات معدل خطأ مرتفع وحجم كبير) في تحديد ما إذا كان المصدر منخفض الجودة (مثل النصوص المنسوخة جزئيًا، أو عدم دقة المحاذاة). بعد التدريب، تم ضبط النموذج بدقة لكبح التنبؤ بأسماء المتحدثين، ثم أُزيلت المصادر منخفضة الجودة. [ 1 ]

سعة

على الرغم من أن نموذج Whisper لا يتفوق على النماذج المتخصصة في مجموعة بيانات LibriSpeech ، إلا أنه عند اختباره على مجموعات بيانات متعددة، يكون أكثر قوة ويُقلل الأخطاء بنسبة 55.2% مقارنةً بالنماذج الأخرى. [ 14 ] [ 15 ] يُظهر Whisper معدل خطأ مختلفًا عند نسخ اللغات المختلفة، حيث يكون معدل خطأ الكلمات أعلى في اللغات غير المُمثلة بشكل كافٍ في بيانات التدريب. [ 16 ] وجد الباحثون أن التعلم متعدد المهام يُحسّن الأداء العام مقارنةً بالنماذج المتخصصة في مهمة واحدة. وافترضوا أن أفضل نموذج Whisper تم تدريبه لا يزال يُعاني من نقص في التوافق مع مجموعة البيانات، وأن النماذج الأكبر حجمًا والتدريب لفترات أطول يُمكن أن تُؤدي إلى نماذج أفضل. [ 1 ]

أظهرت تقييمات جهات خارجية مستويات متفاوتة من الهلوسة في الذكاء الاصطناعي. فقد وجدت دراسة لنصوص اجتماعات عامة وجود هلوسات في ثمانية من كل عشرة نصوص، بينما اكتشف مهندس هلوسات في "نحو نصف" 100 ساعة من النصوص، وحددها مطور برامج في "كل" نص تقريبًا من بين 26000 نص. [ 17 ] ووجدت دراسة أخرى شملت 13140 مقطعًا صوتيًا قصيرًا (بمتوسط ​​10 ثوانٍ) 187 حالة هلوسة (1.4%)، 38% منها أنتجت نصوصًا قد تكون ضارة لاحتوائها على إشارات خاطئة إلى أمور مثل العرق، أو أدوية غير موجودة، أو أحداث عنيفة لم تكن موجودة في التسجيل الصوتي. [ 17 ] [ 18 ]

التطبيقات

استُخدم هذا النموذج كأساس للعديد من التطبيقات، مثل نموذج موحد للتعرف على الكلام والتعرف على الأصوات بشكل عام . [ 19 ] كما تم دمج Whisper في سير عمل البحوث الطبية الحيوية. ففي عام 2025، استخدمت دراسةٌ حول الكشف عن مرض الزهايمر هذا النموذج لنسخ تسجيلات الكلام التلقائي. [ 20 ] جُمعت النصوص التي أنشأها النموذج مع تضمينات متجهات LLM والمصنفات التقليدية للمساعدة في تصنيف الحالة الصحية للمرضى. ومن التطبيقات الأخرى، قيام شركة OVALYTICS بدمج Whisper لنسخ مقاطع فيديو يوتيوب وأتمتة أنظمة مراقبة المحتوى، مما حسّن من قدرتها على كشف المحتوى المسيء. [ 21 ]

استُخدم هذا النموذج أيضًا في المكتبات الأكاديمية ومؤسسات التراث الثقافي لإنشاء نصوص مكتوبة وتعليقات توضيحية لمجموعاتها السمعية البصرية الرقمية. وفي دراسة حالة أُجريت عام ٢٠٢٥، وجدت مكتبات جامعة إيموري أن برنامج Whisper قلل الجهد المبذول في النسخ بنسبة تتراوح بين ٣٠ و٣٥٪، محولًا العمل من إنشاء النصوص إلى تصحيحها. ومع ذلك، لا تزال المراجعة البشرية ضرورية لضمان دقة النصوص وتنسيقها وسهولة الوصول إليها. [ ٢٢ ]

انظر أيضاً

مراجع

  1. 1 2 3 4 5 6 7 رادفورد، أليك؛ كيم، جونغ ووك؛ شو، تاو؛ بروكمان، جريج؛ ماكليفي، كريستين؛ سوتسكيفر، إيليا (2022-12-06). "التعرف القوي على الكلام من خلال الإشراف الضعيف واسع النطاق". arXiv : 2212.04356 [ eess.AS ].
  2. "Whisper" . Google Play . Google .
  3. "مراجعات تطبيق Whisper - الميزات والبدائل وتقييمات المستخدمين" .
  4. غولا، رامسري غوثام (2023-03-06). "إليكم ستة استخدامات عملية لواجهة برمجة تطبيقات Whisper الجديدة" . سلاتور . مؤرشف من الأصل في 2023-03-25 . تم الاسترجاع في 2023-08-12 .
  5. ويغرز، كايل (21 سبتمبر 2022). "OpenAI تُطلق Whisper، وهو نظام للتعرف على الكلام متعدد اللغات، كمصدر مفتوح" . TechCrunch . مؤرشف من الأصل في 12 فبراير 2023. تم الاطلاع عليه في 12 فبراير 2023 .
  6. يو، دونغ؛ دينغ، لي (2014). التعرف التلقائي على الكلام: منهج التعلم العميق . إشارات وتكنولوجيا الاتصالات ( الطبعة 2015). لندن هايدلبرغ: سبرينغر. ص 9. ISBN   978-1-4471-5778-6.
  7. صديق، لطيف؛ الزيدي، عون؛ كواياهويتل، هيربيرتو؛ شمشاد، فهد؛ شوكت، معظم؛ قادر، جنيد (2023). “المحولات في معالجة الكلام: دراسة استقصائية”. أرخايف : 2303.11607v1 [ cs.CL ].
  8. كاماث، أوداي؛ غراهام، كينيث ل.؛ إمارة، وائل (2022). المحولات للتعلم الآلي: دراسة معمقة . تشابمان آند هول/سي آر سي للتعلم الآلي والتعرف على الأنماط ( الطبعة الأولى). بوكا راتون، لندن، نيويورك: مطبعة سي آر سي، مجموعة تايلور آند فرانسيس. ص. 19. ISBN   978-0-367-76734-1.
  9. باس، جيرهارد؛ جيسيلباخ، سفين (16 فبراير 2023). "نماذج أساسية للكلام والصور والفيديوهات والتحكم". نماذج أساسية لمعالجة اللغة الطبيعية . الذكاء الاصطناعي: الأسس والنظرية والخوارزميات. ص 313-382 . arXiv : 2302.08575 . doi : 10.1007/978-3-031-23190-2_7 . ISBN  978-3-031-23189-6. S2CID 257019816 . 
  10. ديفيس، ويس (2024-04-06). "قامت OpenAI بنسخ أكثر من مليون ساعة من مقاطع فيديو يوتيوب لتدريب GPT-4" . ذا فيرج . تم الاسترجاع في 2024-04-20 .
  11. "الإعلان عن نموذج large-v2 · openai/whisper · مناقشة رقم 661" . GitHub . مؤرشف من الأصل بتاريخ 2024-01-08 . تم الاطلاع عليه بتاريخ 2024-01-08 .
  12. يوم مطوري OpenAI: الكلمة الافتتاحية ، 6 نوفمبر 2023 ، تم الاطلاع عليه بتاريخ 8 يناير 2024
  13. جون، دو (2025-03-20). "أوبن إيه آي تُصدر نماذج صوتية جديدة للذكاء الاصطناعي بأنماط كلام قابلة للتخصيص" . أوبن إيه آي . مؤرشف من الأصل في 2026-01-08 . تم الاطلاع عليه في 2026-01-10 .
  14. "تقديم Whisper" . openai.com . 2022-09-21. مؤرشف من الأصل في 2023-08-20 . تم الاطلاع عليه في 2023-08-21 .
  15. "Whisper: طفرة في مجال الذكاء الاصطناعي للتعرف على الكلام" . enerzai.com (باللغة الكورية). مؤرشف من الأصل بتاريخ 15 أبريل 2026. تم الاطلاع عليه بتاريخ 9 مارس 2026 .
  16. ويغرز، كايل (1 مارس 2023). "أوبن إيه آي تُطلق واجهة برمجة تطبيقات Whisper لتحويل الكلام إلى نص وترجمته" . تيك كرانش . مؤرشف من الأصل في 18 يوليو 2023. تم الاطلاع عليه في 21 أغسطس 2023 .
  17. ١ ٢ بيرك، غارانس؛ شيلمان، هيلكه (٢٦ أكتوبر ٢٠٢٤). "باحثون يقولون إن أداة نسخ مدعومة بالذكاء الاصطناعي تُستخدم في المستشفيات تُضيف أشياء لم يقلها أحد من قبل" . وكالة أسوشيتد برس . مؤرشف من الأصل في ٤ نوفمبر ٢٠٢٤. تم الاطلاع عليه في ٢٨ أكتوبر ٢٠٢٤ .
  18. كوينيك، أليسون؛ تشوي، آنا سيو غيونغ؛ مي، كاتلين إكس؛ شيلمان، هيلكه؛ سلون، مونا (2024-06-03). "همسة غير مبالية: أضرار الهلوسة الناتجة عن تحويل الكلام إلى نص". مؤتمر ACM لعام 2024 حول العدالة والمساءلة والشفافية . نيويورك، نيويورك، الولايات المتحدة الأمريكية: ACM. الصفحات 1672-1681 . arXiv : 2402.08021 . doi : 10.1145 /3630106.3658996 . ISBN  979-8-4007-0450-5.
  19. يوان، غونغ؛ خورانا، سمير؛ كارلينسكي، ليونيد؛ غلاس، جيمس (2023). "Whisper-AT: مُعرّفات الكلام التلقائية المقاومة للضوضاء هي أيضًا مُصنّفات قوية للأحداث الصوتية العامة". Interspeech 2023. ص 2798-2802 . arXiv : 2307.03183 . doi : 10.21437 /Interspeech.2023-2193 . 
  20. تشو، دانيال؛ تشيان، تشن (ديسمبر 2025). "تحليل الكلام المدعوم بالذكاء الاصطناعي: أتمتة النسخ والتضمين والتعلم العميق للكشف المبكر عن مرض الزهايمر" . الزهايمر والخرف . 21 (ملحق 2) e107467. doi : 10.1002/alz70856_107467 . ISSN 1552-5260 . PMC 12785146 .  
  21. تشينيفار، سنيها؛ السيدة، روبا؛ جيه إس، أرونالاثا؛ كيه آر، فينوجوبال (2025-06-01). "OVALYTICS: تعزيز كشف الفيديوهات المسيئة باستخدام نصوص يوتيوب ونماذج لغوية متقدمة" . مجلة معالجة اللغة الطبيعية . 11 100147. doi : 10.1016/j.nlp.2025.100147 . ISSN 2949-7191 . 
  22. "مجلات سيج: اكتشف أبحاثًا عالمية المستوى" . مجلات سيج . doi : 10.1177/03400352241310534 . مؤرشف من الأصل بتاريخ 2020-05-03 . تم الاطلاع عليه بتاريخ 2026-03-02 .