عارض رسومات جوجل للكتب

أداة Google Books Ngram Viewer هي محرك بحث إلكتروني يرسم بيانيًا ترددات أي مجموعة من عبارات البحث باستخدام عدد سنوي من عبارات n -gram الموجودة في المصادر المطبوعة المنشورة بين عامي 1500 و2022 [ 1 ] [ 2 ] [ 3 ] [ 4 ] في مجموعات نصوص Google باللغات الإنجليزية والصينية (المبسطة) والفرنسية والألمانية والعبرية والإيطالية والروسية والإسبانية. [ 1 ] [ 2 ] [ 5 ] كما توجد أيضًا بعض مجموعات النصوص الإنجليزية المتخصصة، مثل الإنجليزية الأمريكية والإنجليزية البريطانية والروايات الإنجليزية. [ 6 ]
يُمكن للبرنامج البحث عن كلمة أو عبارة. [ 5 ] تُطابق النماذج اللغوية (n -grams) مع النص الموجود في المجموعة المختارة، وإذا وُجدت في 40 كتابًا أو أكثر، تُعرض على شكل رسم بياني. [ 6 ] يدعم البرنامج البحث عن أجزاء الكلام والرموز البديلة . [ 6 ] يُستخدم البرنامج بشكل روتيني في البحوث. [ 7 ] [ 8 ]
تاريخ
تم تطوير أداة Ngram Viewer بواسطة مهندسي البرمجيات في جوجل، ويل بروكمان وجون أوروانت [ 9 ] ، بالتعاون مع الباحثين جان بابتيست ميشيل وإيريز ليبرمان أيدن من جامعة هارفارد . أُطلقت الخدمة في 16 ديسمبر 2010. [ 2 ] [ 10 ] قبل إطلاقها، كان من الصعب تحديد معدل التغير اللغوي كميًا لعدم وجود قاعدة بيانات مصممة لهذا الغرض، كما ذكر ستيفن بينكر [ 11 ] ، اللغوي المعروف وأحد المؤلفين المشاركين في ورقة بحثية نُشرت في مجلة Science في اليوم نفسه. [ 1 ] طُوّرت أداة Google Books Ngram Viewer على أمل فتح آفاق جديدة للبحث الكمي في مجال العلوم الإنسانية، واحتوت قاعدة البيانات على 500 مليار كلمة من 5.2 مليون كتاب متاحة للجمهور منذ البداية. [ 2 ] [ 3 ] [ 10 ]
كان الجمهور المستهدف في الأصل من الأكاديميين، لكن برنامج Google Books Ngram Viewer مكّن أي شخص يمتلك جهاز كمبيوتر من رؤية رسم بياني يُمثل التغير التاريخي في استخدام الكلمات والعبارات بسهولة. وصرح ليبرمان ردًا على صحيفة نيويورك تايمز أن المطورين سعوا إلى تزويد حتى الأطفال بالقدرة على استعراض الاتجاهات الثقافية عبر التاريخ. [ 10 ] وفي ورقة بحثية نُشرت في مجلة ساينس ، أطلق ليبرمان وزملاؤه على أسلوب تحليل البيانات الضخمة في النصوص الرقمية اسم " علم الثقافة ". [ 1 ] [ 10 ]
الاستخدام
تُستخدم الفواصل لفصل مصطلحات البحث التي يُدخلها المستخدم، حيث يتم البحث عن كل مصطلح مفصول بفاصلة في قاعدة البيانات كوحدة ( على سبيل المثال، "مدرسة الحضانة" هي وحدة ثنائية). [ 6 ] ثم يعرض برنامج Ngram Viewer مخططًا خطيًا . ونظرًا لمحدودية حجم قاعدة بيانات Ngram، يتم فهرسة النتائج التي تم العثور عليها في 40 كتابًا على الأقل فقط. [ 6 ]
القيود
تعرضت مجموعات بيانات برنامج Ngram Viewer لانتقادات بسبب اعتمادها على تقنية التعرف الضوئي على الحروف (OCR) غير الدقيقة، واحتوائها على أعداد كبيرة من النصوص المؤرخة والمصنفة بشكل خاطئ. [ 12 ] ونظرًا لهذه الأخطاء، ولأنها غير مضبوطة من حيث التحيز [ 13 ] (مثل تزايد كمية الأدبيات العلمية، مما يؤدي إلى ظهور مصطلحات أخرى وكأنها تتراجع شعبيتها)، يجب توخي الحذر عند استخدام هذه المجموعات لدراسة اللغة أو اختبار النظريات. [ 14 ] علاوة على ذلك، قد لا تعكس مجموعات البيانات التغيرات اللغوية أو الثقافية العامة، ولا يمكنها إلا أن تشير إلى هذا التأثير بشكل غير مباشر، لأنها لا تتضمن أي بيانات وصفية مثل تاريخ النشر، أو اسم المؤلف، أو طول النص، أو نوعه، وذلك لتجنب أي انتهاكات محتملة لحقوق النشر . [ 15 ]
Systemic errors like the confusion of s and f in pre-19th century texts (due to the use of ſ, the long s, which is similar in appearance to f) can cause systemic bias.[14] Although the Google Books team claims that the results are reliable from 1800 onwards, poor OCR and insufficient data mean that frequencies given for languages such as Chinese may only be accurate from 1970 onward, with earlier parts of the corpus showing no results at all for common terms, and data for some years containing more than 50% noise.[16][17]
Guidelines for doing research with data from Google Ngram have been proposed that try to address some of the issues discussed above.[18]
See also
References
- 1234Michael, Jean-Baptiste; Shen, Yuan K.; Aiden, Aviva P.; Veres, Adrian; Gray, Matthew K.; The Google Books Team; Pickett, Joseph P.; Hoiberg, Dale; Clancy, Dan; Norvig, Peter; Orwant, Jon; Pinker, Steven; Nowak, Martin A.; Aiden, Erez L. (2010). "Quantitative Analysis of Culture Using Millions of Digitized Books". Science. 331 (6014): 176–182. doi:10.1126/science.1199644. PMC 3279742. PMID 21163965.
- 1234Bosker, Bianca (2010-12-17). "Google Ngram Database Tracks Popularity Of 500 Billion Words". The Huffington Post. Retrieved 2012-05-31.
- 12Lance Whitney (2010-12-17). "Google's Ngram Viewer: A time machine for wordplay". Cnet.com. Archived from the original on 2014-01-23. Retrieved 2012-05-31.
- ↑@searchliaison (July 13, 2020). "The Google Books Ngram Viewer has now been updated with fresh data through 2019" (Tweet). Retrieved 2020-08-11– via Twitter.
- 12"Google Books Ngram Viewer - University at Buffalo Libraries". Lib.Buffalo.edu. 2011-08-22. Archived from the original on 2013-07-02. Retrieved 2012-05-31.
- 1 2 3 4 5 "عارض Ngram لكتب جوجل - معلومات" . تم الاسترجاع في 1 يونيو 2024 .
- ↑ غرينفيلد، باتريشيا م. (2013). "علم النفس المتغير للثقافة من عام 1800 إلى عام 2000" . العلوم النفسية . 24 (9): 1722-1731 . doi : 10.1177/0956797613479387 . ISSN 0956-7976 . PMID 23925305. S2CID 6123553 .
- ↑ يونس، ناديا؛ ريبس، أولف-ديتريش (2018). "علم النفس المتغير للثقافة في البلدان الناطقة بالألمانية: دراسة باستخدام Google Ngram" . المجلة الدولية لعلم النفس . 53 : 53-62 . doi : 10.1002/ijop.12428 . PMID 28474338. S2CID 7440938 .
- ↑ "تحسين البحث اللغوي باستخدام عارض Ngram في كتب جوجل" .
- 1 2 3 4 "في 500 مليار كلمة، نافذة جديدة على الثقافة" . صحيفة نيويورك تايمز . 16 ديسمبر 2010. تاريخ الاسترجاع: 1 يونيو 2024 .
- ↑ "ستيفن بينكر - مادة الفكر: اللغة كنافذة على الطبيعة البشرية" . الجمعية الملكية للفنون . 4 فبراير 2010. تم الاطلاع عليه بتاريخ 2 يونيو 2024 - عبر يوتيوب.
- ↑ نونبرغ، جيف (16 ديسمبر 2010). "البحث في العلوم الإنسانية باستخدام مجموعة كتب جوجل" . مؤرشف من الأصل بتاريخ 10 مارس 2016. تم الاطلاع عليه بتاريخ 19 أبريل 2015 .
- ↑ بيتشينيك، إيتان آدم؛ دانفورث، كريستوفر م.؛ دودز، بيتر شيريدان؛ بارات، آلان (2015-10-07). " توصيف مجموعة كتب جوجل: حدود قوية لاستنتاجات التطور الاجتماعي والثقافي واللغوي" . PLOS One . 10 (10) e0137041. arXiv : 1501.00960 . Bibcode : 2015PLoSO..1037041P . doi : 10.1371/journal.pone.0137041 . PMC 4596490. PMID 26445406 .
- 1 2 تشانغ، سارة. "مزالق استخدام جوجل إنغرام لدراسة اللغة" . وايرد . تم الاسترجاع في 24 مايو 2017 .
- ↑ كوبلينغ، ألكسندر (2015-09-02). "أثر نقص البيانات الوصفية على قياس التغير الثقافي واللغوي باستخدام مجموعات بيانات جوجل إنغرام - إعادة بناء تكوين المدونة الألمانية في زمن الحرب العالمية الثانية" . المنح الدراسية الرقمية في العلوم الإنسانية . 32 (1). أكسفورد أكاديميك (نُشر في 2017-04-01): 169-188 . doi : 10.1093/llc/fqv037 . ISSN 2055-7671 .
- ↑ "Google n- grams and pre-modern Chinese" . digitalsinology.org . تم الاطلاع عليه بتاريخ 19-04-2015 .
- ↑ "عندما تسوء الأمور في نماذج n -gram" . digitalsinology.org . تم الاطلاع عليه بتاريخ 19-04-2015 .
- ↑ يونس، ناديا؛ ريبس، أولف-ديتريش (22 مارس 2019). "دليل لتحسين موثوقية دراسات جوجل إنغرام: أدلة من المصطلحات الدينية" . PLOS One . 14 (3) e0213554. Bibcode : 2019PLoSO..1413554Y . doi : 10.1371/journal.pone.0213554 . ISSN 1932-6203 . PMC 6430395. PMID 30901329 .
فهرس
- لين، يوري؛ وآخرون . (يوليو 2012). "التعليقات النحوية لمجموعة بيانات جوجل بوكس إنغرام" (ملف PDF) . وقائع الاجتماع السنوي الخمسين . أوراق العرض التوضيحي. 2. جيجو، جمهورية كوريا: جمعية اللغويات الحاسوبية: 169-174 . 2390499.
ورقة بيضاء تعرض إصدار 2012 من مجموعة بيانات جوجل بوكس إنغرام.
روابط خارجية
- خدمات جوجل
- برنامج جوجل
- برنامج 2010
- معالجة اللغة الطبيعية
- اللغويات الحاسوبية
- علم اللغة الحاسوبي
