قائمة مجموعات البيانات لأبحاث التعلم الآلي

تُستخدم مجموعات البيانات هذه في أبحاث التعلم الآلي (ML) وقد تم الاستشهاد بها في المجلات الأكاديمية التي تمت مراجعتها من قبل الأقران . تعد مجموعات البيانات جزءًا لا يتجزأ من مجال التعلم الآلي. يمكن أن تنجم التطورات الرئيسية في هذا المجال عن التقدم في خوارزميات التعلم (مثل التعلم العميق ) وأجهزة الكمبيوتر ، وبشكل أقل بديهية، عن توفر مجموعات بيانات التدريب عالية الجودة. [1] عادةً ما يكون إنتاج مجموعات بيانات التدريب المصنفة عالية الجودة لخوارزميات التعلم الآلي الخاضعة للإشراف وشبه الخاضعة للإشراف أمرًا صعبًا ومكلفًا بسبب الوقت الكبير اللازم لتصنيف البيانات. على الرغم من عدم الحاجة إلى تصنيفها، إلا أن مجموعات البيانات عالية الجودة للتعلم غير الخاضع للإشراف يمكن أن يكون إنتاجها صعبًا ومكلفًا أيضًا. [2] [3] [4]

تنشر العديد من المنظمات، بما في ذلك الحكومات، مجموعات البيانات الخاصة بها وتشاركها . يتم تصنيف مجموعات البيانات، بناءً على التراخيص، على أنها بيانات مفتوحة وبيانات غير مفتوحة .

يتم عرض مجموعات البيانات من مختلف الهيئات الحكومية في قائمة مواقع بيانات الحكومة المفتوحة . يتم نقل مجموعات البيانات إلى بوابات البيانات المفتوحة . وهي متاحة للبحث والإيداع والوصول من خلال واجهات مثل Open API . يتم توفير مجموعات البيانات كأنواع وأنواع فرعية مختلفة.

قائمة الفرز المستخدمة لمجموعات البيانات

يكتب الأنواع الفرعية
فئة محددة المالية ، الاقتصاد ، التجارة ، المجتمع ، الصحة ، الأكاديمية ، الرياضة ، الغذاء ، الزراعة ، السفر ، الجغرافيا المكانية ، السياسة ، المستهلك ، النقل ، اللوجستيات ، البيئة ، العقارات ، القانون ، الترفيه ، الطاقة ، الضيافة
نِطَاق اتحاد فوق وطني ، وطني ، دون وطني ، بلدي ، حضري ، ريفي
لغة الصينية المندرينية ، الإسبانية ، الإنجليزية ، العربية ، الهندية ، البنغالية
يكتب جدولي ، رسم بياني ، نص ، صورة ، صوت ، فيديو
الاستخدام التدريب والتحقق والاختبار
تنسيقات الملفات CSV ، JSON ، XML ، KML ، GeoJSON ، Shapefile ، GML
التراخيص Creative-Commons و GPL ورخص البيانات غير المفتوحة الأخرى
آخر تحديث آخر ساعة، آخر يوم، آخر أسبوع، آخر شهر، آخر عام
حجم الملف الحد الأدنى، الحد الأقصى، المدى
حالة تم التحقق منه، قيد الإعداد، تم إلغاء تنشيطه (أو تم إيقافه)
عدد السجلات مئات، آلاف، عشرة آلاف، مليون
عدد المتغيرات أقل من 10، 10، 100، 1000، 10000
خدمات فردي، تجميعي

يتم تصنيف بوابة البيانات بناءً على نوع الترخيص الخاص بها. تُعرف بوابات البيانات المعتمدة على الترخيص مفتوح المصدر باسم بوابات البيانات المفتوحة والتي تستخدمها العديد من المنظمات الحكومية والمؤسسات الأكاديمية .

قائمة بوابات البيانات المفتوحة

اسم البوابة رخصة قائمة تثبيتات البوابة الاستخدامات النموذجية
شبكة أرشيف المعرفة الشاملة ( CKAN ) رخصة أيه جي بي إل https://ckan.github.io/ckan-instances/

https://github.com/sebneu/ckan_instances/blob/master/instances.csv

مستودع البيانات للمنظمات الحكومية أو غير الربحية، حل إدارة البيانات لمعاهد الأبحاث
دكان رخصة جنو العمومية https://getdkan.org/المجتمع مستودع البيانات للمنظمات الحكومية أو غير الربحية، حل إدارة البيانات لمعاهد الأبحاث
داتا فيرس أباتشي https://dataverse.org/installations

https://dataverse.org/metrics

حلول إدارة البيانات لمؤسسات البحث
دي سبيس بي إس دي https://registry.lyrasis.org/ حلول إدارة البيانات لمؤسسات البحث
أوبن إم إل بي إس دي https://www.openml.org/search?type=data&sort=runs&status=active حلول إدارة البيانات لمشاركة مجموعات البيانات والخوارزميات ونتائج التجارب من خلال واجهات برمجة التطبيقات.

قائمة البوابات المناسبة لأنواع متعددة من التطبيقات

تسرد بوابة البيانات في بعض الأحيان مجموعة واسعة من الأنواع الفرعية لمجموعات البيانات المتعلقة بالعديد من تطبيقات التعلم الآلي .

السيول الأكاديمية https://academictorrents.com
مجموعة بيانات أمازون https://registry.opendata.aws/
مجموعة رائعة من البيانات العامة https://github.com/awesomedata/awesome-public-datasets
بيانات العالم https://data.world/datasets/machine-learning
Datahub – مجموعات البيانات الأساسية https://datahub.io/docs/core-data
داتا ون https://www.dataone.org/
بوابات البيانات https://dataportals.org/
مجموعة البيانات https://www.datasetlist.com
مؤشر البيانات المفتوحة العالمي – مؤسسة المعرفة المفتوحة https://okfn.org/ تم أرشفته في 25 مايو 2020 على موقع Wayback Machine
البحث في مجموعة بيانات Google https://datasetsearch.research.google.com/
وجه العناق https://huggingface.co/docs/datasets/
بورصة أصول البيانات الخاصة بشركة IBM https://developer.ibm.com/exchanges/data/
Jupyter – بيانات تعليمية https://jupyter-tutorial.readthedocs.io/en/latest/data-processing/opendata.html
كاجل https://www.kaggle.com/datasets
مجموعات بيانات التعلم الآلي https://macgence.com/data-sets-and-cataloges/
المدن الذكية الكبرى ذات البيانات المفتوحة https://rlist.io/l/major-smart-cities-with-open-data-portals
مجموعة بيانات مايكروسوفت https://msropendata.com/datasets
بداية البيانات المفتوحة https://opendatainception.io/
أوبن داتا سوفت https://data.opendatasoft.com/explore/dataset/open-data-sources%40public/table/?sort=code_en
أوبندور https://v2.sherpa.ac.uk/opendoar/
أوبن إم إل https://www.openml.org/search?type=data
أوراق مع الكود https://paperswithcode.com/datasets
معايير التعلم الآلي في جامعة بنسلفانيا https://github.com/EpistasisLab/pmlb/tree/master/datasets
واجهات برمجة التطبيقات العامة https://github.com/public-apis/public-apis
سجل مستودعات الوصول المفتوح http://roar.eprints.org/ 
سجل مستودعات بيانات الأبحاث https://www.re3data.org/ 
مستودع التعلم الآلي لجامعة كاليفورنيا في إيرفين http://mlr.cs.umass.edu/ml/ تم أرشفته في 26 يونيو 2020 على موقع Wayback Machine
مجموعة بيانات الكلام https://www.shaip.com/offerings/speech-data-catalog/
اكتشاف البيانات المرئية https://visualdata.io/discovery

قائمة البوابات المناسبة لنوع فرعي محدد من التطبيقات

يتم إدراج بوابات البيانات المناسبة لنوع فرعي محدد من تطبيقات التعلم الآلي في الأقسام اللاحقة.

بيانات الصورة

بيانات نصية

تتكون مجموعات البيانات هذه بشكل أساسي من نصوص لمهام مثل معالجة اللغة الطبيعية ، وتحليل المشاعر ، والترجمة، وتحليل المجموعات .

المراجعات

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
جائزة نيتفليكس تصنيفات الأفلام على Netflix. 100,480,507 تقييمًا أعطاها 480,189 مستخدمًا لـ 17,770 فيلمًا النص، التقييم توقع التقييم 2006 [5] نيتفليكس
تقييمات أمازون تقييمات المنتجات الأمريكية من Amazon.com . لا أحد. 233.1 مليون نص التصنيف، تحليل المشاعر 2015 (2018) [6] [7] ماكولي وآخرون.
مجموعة بيانات مراجعة OpinRank تقييمات السيارات والفنادق من Edmunds.com و TripAdvisor على التوالي. لا أحد. 42,230 / ~259,000 على التوالي نص تحليل المشاعر والتجميع 2011 [8] [9] ك. غانيشان وآخرون.
عدسة الفيلم 22,000,000 تقييم و 580,000 علامة تم تطبيقها على 33,000 فيلمًا بواسطة 240,000 مستخدم. لا أحد. ~ 22 مليون نص الانحدار، التجميع، التصنيف 2016 [10] أبحاث GroupLens
تقييمات مستخدمي موقع Yahoo! Music للفنانين الموسيقيين أكثر من 10 ملايين تقييم للفنانين من قبل مستخدمي Yahoo. لا يوجد وصف. ~ 10م نص التجميع، الانحدار 2004 [11] [12] ياهو!
مجموعة بيانات تقييم السيارات خصائص السيارة وقبولها بشكل عام. تم تقديم ستة ميزات تصنيفية. 1728 نص تصنيف 1997 [13] [14] السيد بوهانيك
مجموعة بيانات تفضيلات الكوميديا ​​​​على YouTube بيانات تصويت المستخدمين لأزواج مقاطع الفيديو المعروضة على YouTube. صوّت المستخدمون على مقاطع الفيديو الأكثر تسلية. تم تقديم بيانات الفيديو. 1,138,562 نص تصنيف 2012 [15] [16] جوجل
مجموعة بيانات آراء مستخدمي Skytrax تقييمات المستخدمين لشركات الطيران والمطارات والمقاعد والصالات من Skytrax. إن التقييمات دقيقة للغاية وتتضمن العديد من جوانب تجربة المطار. 41396 نص التصنيف والانحدار 2015 [17] س. نجوين
مجموعة بيانات تقييم مساعدي التدريس مراجعات مساعدي التدريس. يتم تقديم ميزات كل حالة مثل الفصل، وحجم الفصل، والمدرس. 151 نص تصنيف 1997 [18] [19] و. لوه وآخرون.
مجموعة آراء الطلاب الفيتناميين (UIT-VSFC) آراء الطلاب. تعليقات 16000 نص تصنيف 1997 [20] نجوين وآخرون.
مجموعة أدوات التواصل الاجتماعي الفيتنامية (UIT-VSMEC) تعليقات المستخدمين على الفيسبوك. تعليقات 6,927 نص تصنيف 1997 [21] نجوين وآخرون.
مجموعة بيانات الكشف عن الشكاوى ذات النطاق المفتوح باللغة الفيتنامية (ViOCD) آراء العملاء حول المنتج تعليقات 5,485 نص تصنيف 2021 [22] نجوين وآخرون.
ViHOS: خطاب الكراهية يمتد إلى الكشف عن الفيتناميين نصوص وسائل التواصل الاجتماعي تعليقات يحتوي على 26 ألف امتداد على 11 ألف تعليق نص كشف النطاق 2021 [23] هوانج وآخرون.

مقالات اخبارية

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات NYSK مقالات إخبارية باللغة الإنجليزية حول القضية المتعلقة باتهامات الاعتداء الجنسي ضد المدير السابق لصندوق النقد الدولي دومينيك شتراوس كان . تمت تصفيته وتقديمه بتنسيق XML. 10,421 XML، النص تحليل المشاعر واستخراج الموضوع 2013 [24] ديرموش، م. وآخرون.
مجموعة رويترز المجلد الأول مجموعة كبيرة من أخبار رويترز باللغة الإنجليزية. تصنيف دقيق ورموز موضوعية. 810,000 نص التصنيف والتجميع والتلخيص 2002 [25] رويترز
مجموعة رويترز المجلد الثاني مجموعة كبيرة من أخبار رويترز بالعديد من اللغات. تصنيف دقيق ورموز موضوعية. 487,000 نص التصنيف والتجميع والتلخيص 2005 [26] رويترز
مجموعة أبحاث نصوص تومسون رويترز مجموعة كبيرة من القصص الإخبارية. التفاصيل غير موصوفة. 1,800,370 نص التصنيف والتجميع والتلخيص 2009 [27] ت. روز وآخرون.
مجموعة الصحف السعودية 31,030 مقالة صحفية عربية. تم استخراج البيانات الوصفية. 31,030 جيسون التلخيص والتجميع 2015 [28] السيد الحاجري
RE3D (مجموعة بيانات تقييم استخراج العلاقات والكيانات) بيانات تم تحديدها حسب الكيان والعلاقات من مصادر إخبارية وحكومية مختلفة. برعاية Dstl تصفية وتصنيف باستخدام أنواع البالين غير معروف جيسون التصنيف والتعرف على الكيانات والعلاقات 2017 [29] دي إس تي إل
كتالوج الرسائل المزعجة التي يتم نشرها على موقع Examiner عناوين مثيرة للنقرات، ورسائل غير مرغوب فيها، وعناوين مستمدة من الجمهور من عام 2010 إلى عام 2015 تاريخ النشر والعناوين الرئيسية 3,089,781 CSV التجميع والأحداث والمشاعر 2016 [30] ر. كولكارني
مجموعة أخبار ABC أستراليا مجموعة الأخبار الكاملة لقناة ABC Australia من عام 2003 إلى عام 2019 تاريخ النشر والعناوين الرئيسية 1,186,018 CSV التجميع والأحداث والمشاعر 2020 [31] ر. كولكارني
الأخبار العالمية – مجموع 20 ألف موجز ملخص أسبوعي لجميع العناوين الرئيسية عبر الإنترنت بأكثر من 20 لغة وقت النشر وعنوان URL والعناوين الرئيسية 1,398,431 CSV التجميع والأحداث واكتشاف اللغة 2018 [32] ر. كولكارني
عناوين وكالة رويترز للأنباء 11 عامًا من الأحداث المسجلة زمنيًا والتي تم نشرها على وكالات الأنباء وقت النشر، نص العنوان 16,121,310 CSV البرمجة اللغوية العصبية، اللغويات الحاسوبية، الأحداث 2018 [33] ر. كولكارني
مجموعة أخبار صحيفة آيريش تايمز الأيرلندية 24 عامًا من أخبار أيرلندا من 1996 إلى 2019 وقت النشر وفئة العنوان والنص 1,484,340 CSV البرمجة اللغوية العصبية، اللغويات الحاسوبية، الأحداث 2020 [34] ر. كولكارني
مجموعة بيانات عناوين الأخبار للكشف عن السخرية مجموعة بيانات عالية الجودة تحتوي على عناوين إخبارية ساخرة وغير ساخرة. نص نظيف وموحد 26,709 جيسون البرمجة اللغوية العصبية، التصنيف، اللغويات 2018 [35] ريشابه ميسرا

رسائل

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة إنرون رسائل البريد الإلكتروني للموظفين في شركة إنرون منظمة في مجلدات. تم إزالة المرفقات، وتحويل عناوين البريد الإلكتروني غير الصالحة إلى user@enron.com أو no_address@enron.com. ~ 500000 نص تحليل الشبكة ، تحليل المشاعر 2004 (2015) [36] [37] كليمت، ب. وي. يانغ
مجموعة بيانات Ling-Spam مجموعة تحتوي على رسائل البريد الإلكتروني المشروعة والرسائل غير المرغوب فيها . أربع نسخ من مجموعة النصوص تتضمن ما إذا كان تم تمكين أداة التحديد أو قائمة الإيقاف أم لا. 2,412 هام 481 سبام نص تصنيف 2000 [38] [39] أندروتسوبولوس، ج. وآخرون.
مجموعة بيانات جمع الرسائل النصية القصيرة العشوائية تم جمع رسائل SMS غير المرغوب فيها. لا أحد. 5,574 نص تصنيف 2011 [40] [41] ت. ألميدا وآخرون.
مجموعة بيانات عشرين مجموعة إخبارية رسائل من 20 مجموعة إخبارية مختلفة. لا أحد. 20000 نص معالجة اللغة الطبيعية 1999 [42] ت. ميتشل وآخرون.
مجموعة بيانات Spambase رسائل البريد الإلكتروني العشوائية. تم استخراج العديد من ميزات النص. 4,601 نص كشف البريد العشوائي وتصنيفه 1999 [43] م. هوبكنز وآخرون.

تويتر والتغريدات

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
تغريدات الفيلم مجموعة بيانات تصنيف الأفلام استنادًا إلى التغريدات العامة والمنظمة جيدًا ~710,000 نص التصنيف والانحدار 2018 [44] س. دومز
تويتر 100 ألف أزواج من الصور والتغريدات 100000 النصوص والصور استرجاع عبر الوسائط 2017 [45] [46] ي. هو، وآخرون.
المشاعر140 بيانات التغريدات لعام 2009 بما في ذلك النص الأصلي وطابع الوقت والمستخدم والعاطفة. تم تصنيفها باستخدام الإشراف عن بعد من وجود الرموز التعبيرية في التغريدة. 1,578,627 التغريدات، الفاصلة، القيم المنفصلة تحليل المشاعر 2009 [47] [48] أ. جو وآخرون.
مجموعة بيانات تويتر لجامعة ولاية أريزونا بيانات شبكة تويتر، وليس التغريدات الفعلية. تُظهر الاتصالات بين عدد كبير من المستخدمين. لا أحد. 11,316,811 مستخدمًا، 85,331,846 اتصالاً نص التجميع، تحليل الرسم البياني 2009 [49] [50] ر. زعفراني وآخرون.
دوائر SNAP الاجتماعية: قاعدة بيانات تويتر بيانات شبكة تويتر كبيرة. ميزات العقدة والدوائر وشبكات الأنا. 1,768,149 نص التجميع، تحليل الرسم البياني 2012 [51] [52] ج. ماكولي وآخرون.
مجموعة بيانات تويتر لتحليل المشاعر العربية تغريدات عربية. العينات مُصنفة يدويًا على أنها إيجابية أو سلبية. 2000 نص تصنيف 2014 [53] [54] ن. عبدالله
الضجة في مجموعة بيانات وسائل التواصل الاجتماعي بيانات من موقعي Twitter وTom's Hardware. تركز مجموعة البيانات هذه على موضوعات محددة يتم مناقشتها على هذين الموقعين. يتم تقسيم البيانات إلى نوافذ بحيث يمكن للمستخدم محاولة التنبؤ بالأحداث التي أدت إلى ظهور الضجة على وسائل التواصل الاجتماعي. 140,000 نص الانحدار، التصنيف 2013 [55] [56] ف. كاوالا وآخرون.
إعادة صياغة الكلمات والتشابه الدلالي في تويتر (PIT) تسلط مجموعة البيانات هذه الضوء على ما إذا كانت التغريدات تحمل نفس المعنى/المعلومات (تقريبًا) أم لا. تم تصنيفها يدويًا. التجزئة، وجزء من الكلام، ووضع علامات على الكيانات المسماة 18,762 نص الانحدار، التصنيف 2015 [57] [58] شو وآخرون.
مجموعة بيانات معيارية لـ Geoparse Twitter تحتوي مجموعة البيانات هذه على تغريدات أثناء أحداث إخبارية مختلفة في بلدان مختلفة. إشارات إلى المواقع مصنفة يدويًا. تمت إضافة تعليقات الموقع إلى بيانات JSON الوصفية 6,386 التغريدات، JSON التصنيف واستخراج المعلومات 2014 [59] [60] SE ميدلتون وآخرون.
السخرية، المُدرَكة والمقصودة، من خلال الإشراف التفاعلي (SPIRS) التغريدات الساخرة المقصودة والمتصورة مع سياقها تم جمعها باستخدام الإشراف التفاعلي؛ وعدد متساوٍ من العينات السلبية (غير الساخرة) 30,000 معرفات التغريدات، CSV تصنيف 2020 [61] [62] ب. شمويل وآخرون.
مجموعة وسائل التواصل الاجتماعي الهولندية تحتوي مجموعة البيانات هذه على تغريدات حول فيروس كورونا المستجد (كوفيد-19) كتبها متحدثون باللغة الهولندية أو مستخدمون من هولندا. وقد تم تصنيف البيانات آليًا تم تصنيفها وفقًا للعواطف ونصوص التغريدات ووصف المستخدم المترجم إلى اللغة الإنجليزية. تم استخراج ذكر الصناعة 271,342 جيه سونل المشاعر، التصنيف متعدد العلامات، الترجمة الآلية 2020 [63] [64] [65] آكش جوبتا، كورونا واي
مجموعة بيانات ReactionGIF مجموعة بيانات تحتوي على 30 ألف تغريدة وردود أفعالها بتنسيق GIF تم تصنيفها حسب المشاعر وردود الأفعال والعواطف 30,000 معرفات التغريدات، JSONL تم تصنيفها حسب المشاعر وردود الأفعال والعواطف 2021 [66] [67] ب. شمويل وآخرون.

الحوارات

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة محادثات NPS المشاركات من غرف الدردشة عبر الإنترنت المخصصة للأعمار المختلفة. خصوصية اليد مقنعة، ومحددة لجزء من الكلام وفعل الحوار. ~ 500000 إكس إم إل البرمجة اللغوية العصبية، والبرمجة، واللغويات 2007 [68] فورسيث، إي، ولين، جيه، ومارتيل، سي.
مجموعة تويتر الثلاثية تم استخراج ثلاثيات ABA من تويتر. 4,232 نص البرمجة اللغوية العصبية 2016 [69] سورديني، أ. وآخرون.
مجموعة أدوات UseNet المشاركات في منتدى UseNet. رسائل البريد الإلكتروني وعناوين المواقع الإلكترونية مجهولة المصدر. تم حذف المستندات التي يقل طولها عن 500 كلمة أو يزيد عن 500000 كلمة، أو التي تحتوي على نسبة أقل من 90% من اللغة الإنجليزية. 7 مليار نص 2011 [70] شاؤول، سي، وويستبيري سي.
مجموعة رسائل SMS من NUS تم جمع الرسائل النصية القصيرة بين مستخدمين، مع تحليل التوقيت. ~ 10000 إكس إم إل البرمجة اللغوية العصبية 2011 [71] كان، م
مجموعة تعليقات Reddit جميع تعليقات Reddit (حتى عام 2015). ~ 1.7 مليار جيسون البرمجة اللغوية العصبية، البحث 2015 [72] عالق في المصفوفة
مجموعة حوارات أوبونتو الحوارات المستخرجة من مجرى الدردشة في Ubuntu على IRC. 930 ألف حوار و7.1 مليون عبارة CSV بحوث أنظمة الحوار 2015 [73] لوي، ر. وآخرون.
تحدي تتبع حالة الحوار كانت تحديات تتبع حالة الحوار 2 و 3 (DSTC2 و 3) عبارة عن تحديات بحثية تركز على تحسين أحدث التقنيات في تتبع حالة أنظمة الحوار المنطوق. نسخ الحوارات المنطوقة مع التسمية يحتوي DSTC2 على حوالي 3.2 ألف مكالمة – يحتوي DSTC3 على حوالي 2.3 ألف مكالمة جيسون تتبع حالة الحوار 2014 [74] هندرسون، ماثيو وتومسون، بليز وويليامز، جيسون د
اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
قانون حر بيانات مفلترة من Court Listener، وهي جزء من مشروع FreeLaw. نص تم تنظيفه وتطبيعه 4,940,710 جيسون البرمجة اللغوية العصبية، اللغويات 2020 [75] ت. هوب
كومة من القانون مجموعة من البيانات القانونية والإدارية تم تنظيفها وتطبيعها وخصخصتها ~50,000,000 جيسون البرمجة اللغوية العصبية، اللغويات، المشاعر 2022 [76] [77] إل تشنغ؛ ن.جوها؛ ب. أندرسون؛ بي هندرسون؛ د. هو
مشروع الوصول إلى أحكام القضاء جميع أحكام القضاء الرسمية الصادرة عن الولايات المتحدة والصادرة في كتب — كل مجلد أو قضية تم تحديدها كتقرير رسمي عن القرارات التي اتخذتها محكمة داخل الولايات المتحدة. نص تم تنظيفه وتطبيعه ~10,000 جيسون البرمجة اللغوية العصبية، اللغويات 2022 [78] أ. أيزمان؛ س. تشابمان؛ ج. كوشمان؛ ك. دولين؛ ح. إيدولون؛ وآخرون.

نص آخر

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات ويب أوف ساينس مجموعات البيانات الهرمية لتصنيف النصوص لا أحد. 46,985 نص تصنيف،

التصنيف

2017 [79] [80] ك. كوساري وآخرون.
تقارير القضايا القانونية قضايا المحكمة الفيدرالية الأسترالية من عام 2006 إلى عام 2009. لا أحد. 4000 نص تلخيص،

تحليل الاستشهادات

2012 [81] [82] ف. جالجاني وآخرون.
مجموعة تأليف المدونين مدخلات المدونة لـ 19,320 شخصًا من blogger.com. قام المدون بتقديم معلومات ذاتية عن الجنس والعمر والصناعة والعلامة الفلكية. 681,288 نص تحليل المشاعر، التلخيص، التصنيف 2006 [83] [84] ج. شلر وآخرون.
البنية الاجتماعية لشبكات الفيسبوك مجموعة كبيرة من البيانات حول البنية الاجتماعية للفيسبوك. لا أحد. تم تغطية 100 كلية نص تحليل الشبكة، التجميع 2012 [85] [86] أ. تراود وآخرون.
مجموعة بيانات لفهم النص آليًا قصص وأسئلة مرتبطة بها لاختبار فهم النص. لا أحد. 660 نص معالجة اللغة الطبيعية، والفهم الآلي 2013 [87] [88] م. ريتشاردسون وآخرون.
مشروع بنك الأشجار في بنسلفانيا نص طبيعي تم توضيحه من حيث البنية اللغوية. يتم تحليل النص إلى أشجار دلالية. ~ 1 مليون كلمة نص معالجة اللغة الطبيعية، التلخيص 1995 [89] [90] م. ماركوس وآخرون.
مجموعة بيانات DEXTER المهمة الموكلة إلينا هي تحديد المقالات التي تتناول عمليات الاستحواذ على الشركات، وذلك من خلال الميزات المقدمة. تتضمن الميزات المستخرجة جذوع الكلمات. تتضمن ميزات التشتيت. 2600 نص تصنيف 2008 [91] رويترز
كتب جوجل N-grams N-grams من مجموعة كبيرة جدًا من الكتب لا أحد. 2.2 تيرابايت من النص نص التصنيف والتجميع والانحدار 2011 [92] [93] جوجل
مجموعة الأشخاص تم تجميعها لأغراض التجارب في نسب المؤلف والتنبؤ بالشخصية. تتكون من 145 مقالة باللغة الهولندية. بالإضافة إلى النصوص العادية، يتم تقديم نصوص موضحة نحويًا. 145 نص التصنيف والانحدار 2008 [94] [95] ك. لويكس وآخرون.
دفع التحول أرشيفات مواقع التواصل الاجتماعي، بما في ذلك Reddit و Twitter و Hackernews . تم استخراج النص وتطبيعه من WARCs ~100,000,000 مشاركة جيسون البرمجة اللغوية العصبية، المشاعر، اللغويات 2022 [96] [97] ج. باومغارتنر
ملفات لجنة الأوراق المالية والبورصات إدغار | ملفات الشركة تم استخراج النص. ملف CSV البرمجة اللغوية العصبية
مجموعة بيانات CNAE-9 مهمة تصنيف للنصوص المجانية الخاصة بالشركات البرازيلية. تم استخراج تردد الكلمة. 1080 نص تصنيف 2012 [98] [99] ب. سياريلي وآخرون.
مجموعة بيانات الجمل المصنفة بالمشاعر 3000 جملة تحمل علامات عاطفية. تمت كتابة مشاعر كل جملة يدويًا على أنها إيجابية أو سلبية. 3000 نص التصنيف، تحليل المشاعر 2015 [100] [101] د. كوتزياس
مجموعة بيانات BlogFeedback مجموعة بيانات للتنبؤ بعدد التعليقات التي سيتلقاها المنشور بناءً على ميزات هذا المنشور. تم استخراج العديد من الميزات لكل مشاركة. 60,021 نص الانحدار 2014 [102] [103] ك. بوزا
مركز ببميد يضم PubMed® أكثر من 35 مليون استشهاد للأدبيات الطبية الحيوية من MEDLINE ومجلات العلوم الحياتية والكتب عبر الإنترنت. لا أحد 35 مليون نص البرمجة اللغوية العصبية
مكتب براءات الاختراع والعلامات التجارية الأمريكي مكتب الولايات المتحدة لبراءات الاختراع والعلامات التجارية نص البرمجة اللغوية العصبية
فيليبابرز مجموعة مفتوحة المصدر من منشورات الفلسفة نص البرمجة اللغوية العصبية
مجموعة كتب مجموعة نصوص شائعة واسعة النطاق. لا أحد نص البرمجة اللغوية العصبية 2015 [104] تشو، يوكون، وآخرون.
مجموعة أدوات استدلال اللغة الطبيعية بجامعة ستانفورد (SNLI) تتم مطابقة تعليقات الصور مع الجمل التي تم إنشاؤها حديثًا لتشكيل أزواج الاستلزام أو التناقض أو المحايدة. تسميات فئة الاستلزام، التحليل النحوي بواسطة محلل Stanford PCFG 570,000 نص الاستدلال باللغة الطبيعية/التعرف على المضمون النصي 2015 [105] س. بومان وآخرون.
مجموعة DSL Corpus (DSLCC) مجموعة متعددة اللغات من المقاطع القصيرة من النصوص الصحفية باللغات واللهجات المتشابهة. لا أحد 294000 جملة نص التمييز بين اللغات المتشابهة 2017 [106] تان، ليلينج وآخرون.
مجموعة بيانات القاموس الحضري مجموعة من الكلمات والأصوات والتعريفات أسماء المستخدمين مجهولة 2,580,925 CSV البرمجة اللغوية العصبية، فهم الآلة مايو 2016 [107] مجهول
تي ريكس ملخصات ويكيبيديا متوافقة مع كيانات ويكي بيانات محاذاة ثلاثيات ويكيبيديا مع ملخصات ويكيبيديا 11M ثلاثيات مصطفة JSON وNIF [4] البرمجة اللغوية العصبية، استخراج العلاقات 2018 [108] ح. السحار وآخرون.
تقييم فهم اللغة العام (GLUE) معيار أداء تسعة مهام متنوع ~1 مليون جملة وأزواج جمل اللغة الإنجليزية: 2018 [109] [110] [111] وانغ وآخرون.
مجموعة بيانات Atticus لفهم العقود (CUAD) (المعروفة سابقًا باسم مجموعة بيانات Atticus Open Contract Dataset (AOK)) مجموعة بيانات العقود القانونية مع تعليقات الخبراء الغنية ~13000 ملصق CSV و PDF معالجة اللغة الطبيعية، سؤال وجواب 2021 مشروع أتيكوس
مجموعة بيانات التسميات التوضيحية للصور الفيتنامية (UIT-ViIC) مجموعة بيانات ترجمة الصور الفيتنامية 19250 تعليقًا لـ 3850 صورة CSV و PDF معالجة اللغة الطبيعية، الرؤية الحاسوبية 2020 [112] لام وآخرون.
الأسماء الفيتنامية الموضحة بالجنس (UIT-ViNames) الأسماء الفيتنامية مع توضيح الجنس 26,850 اسمًا كاملاً فيتناميًا موضحًا به الجنس CSV معالجة اللغة الطبيعية 2020 [113] إلى وآخرون.
مجموعة بيانات الكشف عن الكلام البنّاء والسام باللغة الفيتنامية (UIT-ViCTSD) مجموعة بيانات الكشف عن الكلام البنّاء والسام باللغة الفيتنامية 10000 تعليق من المستخدمين الفيتناميين على الصحف الإلكترونية على 10 نطاقات CSV معالجة اللغة الطبيعية 2021 [114] نجوين وآخرون.
بي جي-19 مجموعة من الكتب المستخرجة من مكتبة كتب مشروع جوتنبرج نص معالجة اللغة الطبيعية 2019 جاك دبليو وآخرون.
الرياضيات في ديب مايند أزواج الأسئلة والأجوبة في الرياضيات. نص معالجة اللغة الطبيعية 2018 [115] د ساكستون وآخرون.
أرشيف آنا أرشيف شامل للكتب والأبحاث المنشورة لا أحد 100,356,641 نص، epub، PDF معالجة اللغة الطبيعية 2024

بيانات الصوت

تتكون مجموعات البيانات هذه من الأصوات وميزات الصوت المستخدمة في مهام مثل التعرف على الكلام وتوليف الكلام .

خطاب

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
لوحة التوزيع-1 محادثة عبر الهاتف. 260 ساعة من الكلام، من 543 متحدثًا (302 من الذكور و241 من الإناث) من جميع أنحاء الولايات المتحدة، لنحو 2400 محادثة هاتفية ثنائية الجانب، جمعتها شركة Texas Instruments في عامي 1990 و1991. الصوت، نص منقول، طوابع زمنية على مستوى الكلمة، نسخ صوتية التعرف على الكلام، والنسخ الصوتي. 1992 (2000) [116] [117] المعهد الوطني للمعايير والتكنولوجيا
هاب 5'00 محادثة عبر الهاتف. 260 ساعة من الكلام، من 543 متحدثًا (302 من الذكور و241 من الإناث) من مختلف أنحاء الولايات المتحدة، لنحو 2400 محادثة هاتفية ثنائية، بما يعادل نحو 3 ملايين كلمة. تم جمعها بواسطة شركة Texas Instruments في عامي 1990 و1991. الصوت، نص منقول، طوابع زمنية على مستوى الكلمة، نسخ صوتية التعرف على الكلام، النسخ الصوتي. مجموعة الاختبار الأكثر استخدامًا لهذه المجموعة من البيانات تسمى "Hub5'00". 1992 (2000) [118] [119] المعهد الوطني للمعايير والتكنولوجيا
تحدي الخطابة بدون موارد 2015 الكلام التلقائي (الإنجليزية)، الكلام المقروء (Xitsonga). لا يوجد، ملفات WAV خام. الإنجليزية: 5 ساعات، 12 متحدثًا؛ Xitsonga: ساعتان ونصف، 24 متحدثًا WAV (صوت فقط) الاكتشاف غير الخاضع للإشراف لخصائص الكلام/وحدات الكلمات الفرعية/وحدات الكلمات 2015 [120] [121] فيرستيج وآخرون.
مجموعة بيانات الكلام لمرض باركنسون تسجيلات متعددة لأشخاص مصابين بمرض باركنسون وغير مصابين به. تم استخراج ميزات الصوت، وتم تقييم المرض من قبل الطبيب باستخدام مقياس تصنيف مرض باركنسون الموحد . 1,040 نص التصنيف والانحدار 2013 [122] [123] بي إي ساكار وآخرون.
الأرقام العربية المنطوقة الأرقام العربية المنطوقة من 44 ذكرًا و 44 أنثى. سلسلة زمنية لمعاملات ميل الترددية . 8,800 نص تصنيف 2010 [124] [125] م. بيدا وآخرون.
مجموعة بيانات ISOLET أسماء الحروف المنطوقة. الميزات المستخرجة من الأصوات. 7797 نص تصنيف 1994 [126] [127] ر. كول وآخرون.
مجموعة بيانات الحروف المتحركة اليابانية نطق تسعة متحدثين ذكور بحرفين متحركين يابانيين على التوالي. تم تطبيق تحليل التنبؤ الخطي بزاوية 12 درجة عليه للحصول على سلسلة زمنية منفصلة مع 12 معاملًا للنقطة. 640 نص تصنيف 1999 [128] [129] م. كودو وآخرون.
مجموعة بيانات المراقبة عن بعد لمرض باركنسون تسجيلات متعددة لأشخاص مصابين بمرض باركنسون وغير مصابين به. تم استخراج ميزات الصوت. 5875 نص تصنيف 2009 [130] [131] أ. تساناس وآخرون.
تيميت تسجيلات 630 متحدثًا من ثماني لهجات رئيسية للغة الإنجليزية الأمريكية، حيث يقرأ كل منهم عشر جمل غنية بالصوتيات. يتم نسخ الكلام معجميًا وصوتيًا. 6300 نص التعرف على الكلام والتصنيف. 1986 [132] [133] ج. جاروفولو وآخرون.
مجموعة نصوص باللغة العربية مجموعة خطابية باللغة العربية الفصحى الحديثة (MSA) لمتحدث واحد مع نصوص صوتية وإملائية تتوافق مع مستوى الصوتيات. يتم نسخ الكلام إملائيًا وصوتيًا مع علامات التشديد. ~1900 نص، WAV تركيب الكلام، التعرف على الكلام، محاذاة النص، علاج النطق، التعليم. 2016 [134] ن. حلبي
صوت مشترك قاعدة بيانات عامة للبيانات المجمعة جماعياً عبر مجموعة واسعة من اللهجات. التحقق من صحة البيانات من قبل مستخدمين آخرين. الإنجليزية: 1,118 ساعة ملفات MP3 مع النصوص المقابلة التعرف على الكلام يونيو 2017 (ديسمبر 2019) [135] موزيلا
خطاب LJ مجموعة من التسجيلات الصوتية العامة باللغة الإنجليزية، بصوت متحدث واحد ، مقسمة إلى مقاطع قصيرة عند علامات الترقيم. فحص الجودة، والنسخ الطبيعي إلى جانب الأصل. 13,100 CSV، WAV تركيب الكلام 2017 [136] كيث إيتو، ليندا جونسون
مجموعة بيانات أوامر الكلام العربية تم جمعها من 30 مساهمًا وتم تجميعها في 40 كلمة رئيسية. ملفات WAV الخام 12000 WAV، CSV التعرف على الكلام، واكتشاف الكلمات الرئيسية 2021 [137] عبد القادر غندورة

موسيقى

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
الأصل الجغرافي لمجموعة بيانات الموسيقى الميزات الصوتية لعينات الموسيقى من مواقع مختلفة. ميزات الصوت المستخرجة باستخدام برنامج MARSYAS. 1,059 نص التصنيف الجغرافي، التجميع 2014 [138] [139] ف. تشو وآخرون.
مجموعة بيانات المليون أغنية ميزات صوتية من مليون أغنية مختلفة. تم استخراج ميزات الصوت. 1 مليون نص التصنيف والتجميع 2011 [140] [141] ت. بيرتين-ماهيو وآخرون.
ميوسد بي 18 تسجيلات موسيقية شعبية متعددة المسارات الصوت الخام 150 إم بي 4، دبليو إيه في فصل المصدر 2017 [142] ز. رافي وآخرون.
أرشيف الموسيقى المجانية الصوت بموجب ترخيص المشاع الإبداعي من 100 ألف أغنية (343 يومًا، 1 تيرابايت) مع تسلسل هرمي من 161 نوعًا، والبيانات الوصفية، وبيانات المستخدم، والنص الحر. الصوت الخام وميزات الصوت. 106,574 نص، MP3 التصنيف والتوصية 2017 [143] م. ديفيرارد وآخرون.
مجموعة بيانات التناغم الكورالي لباخ أوتار كورال باخ. تم استخراج ميزات الصوت. 5665 نص تصنيف 2014 [144] [145] د. راديتشيوني وآخرون.

اصوات اخرى

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
أوربان ساوند تسجيلات صوتية مصنفة لأصوات مثل مكيفات الهواء وأبواق السيارات والأطفال يلعبون. تم فرزها إلى مجلدات حسب فئة الأحداث بالإضافة إلى البيانات الوصفية في ملف JSON والتعليقات التوضيحية في ملف CSV. 1,059 صوت

( WAV )

تصنيف 2014 [146] [147] ج. سالامون وآخرون.
مجموعة الصوت مقاطع صوتية مدتها 10 ثوانٍ من مقاطع فيديو YouTube، ومجموعة من أكثر من 500 علامة. 128-d PCA'd VGG-ish ميزات كل ثانية واحدة. 2,084,320 ملفات نصية (CSV) وملفات تسجيل TensorFlow تصنيف 2017 [148] ج. جيميك وآخرون، جوجل
تحدي اكتشاف صوت الطيور الصوت من محطات مراقبة البيئة، بالإضافة إلى التسجيلات الجماعية 17000+ تصنيف 2016 (2018) [149] [150] جامعة كوين ماري وجمعية معالجة الإشارات IEEE
مزيجات WSJ0 Hipster Ambient تم خلط الصوت من WSJ0 مع الضوضاء المسجلة في منطقة خليج سان فرانسيسكو مقاطع الضوضاء المطابقة لمقاطع WSJ0 28000 الصوت ( WAV ) فصل مصدر الصوت 2019 [151] Wichern، G.، وآخرون، Whisper وMERL
كلوثو 4,981 عينة صوتية تتراوح مدتها بين 15 إلى 30 ثانية، وتحتوي كل عينة صوتية على خمسة ترجمات مختلفة تتراوح مدتها بين 8 إلى 20 كلمة. 24,905 الصوت ( WAV ) والنص ( CSV ) الترجمة الصوتية الآلية 2020 [152] [153] ك. دروسوس، س. ليبينج، وت. فيرتانين

بيانات الإشارة

مجموعة البيانات التي تحتوي على معلومات الإشارة الكهربائية التي تتطلب نوعًا ما من معالجة الإشارة لمزيد من التحليل.

كهربائي

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات الديدان الذكية مجموعة بيانات توضح بالتفصيل انتشار دودة Witty وأجهزة الكمبيوتر المصابة. تقسيمها إلى مجموعة متاحة للعامة ومجموعة مقيدة تحتوي على معلومات أكثر حساسية مثل عناوين IP وUDP. 55,909 عناوين IP نص تصنيف 2004 [154] [155] مركز تحليل بيانات الإنترنت التطبيقية
مجموعة بيانات تقدير ضغط الدم بدون استخدام الكفة تم تنظيف الإشارات الحيوية من المرضى البشر والتي يمكن استخدامها لتقدير ضغط الدم. تم تنظيف العلامات الحيوية 125 هرتز. 12000 نص التصنيف والانحدار 2015 [156] [157] م. كاتشوي وآخرون.
مجموعة بيانات انحراف مجموعة مستشعرات الغاز قياسات من 16 مستشعرًا كيميائيًا تم استخدامها في عمليات المحاكاة للتعويض عن الانجراف. عدد كبير من الميزات المقدمة. 13,910 نص تصنيف 2012 [158] [159] أ. فيرجارا
مجموعة بيانات السيرفو البيانات التي تغطي العلاقات غير الخطية التي لوحظت في دائرة مكبر الصوت المؤازر. يتم إعطاء مستويات المكونات المختلفة كدالة للمكونات الأخرى. 167 نص الانحدار 1993 [160] [161] ك. أولريش
مجموعة بيانات UJIIndoorLoc-Mag قاعدة بيانات تحديد المواقع الداخلية لاختبار أنظمة تحديد المواقع الداخلية. تعتمد البيانات على المجال المغناطيسي. تم تقديم تقسيمات التدريب والاختبار. 40,000 نص التصنيف والانحدار والتجميع 2015 [162] [163] د. رامبلا وآخرون.
مجموعة بيانات تشخيص القيادة بدون مستشعر الإشارات الكهربائية من المحركات ذات المكونات المعيبة. الميزات الإحصائية المستخرجة. 58,508 نص تصنيف 2015 [164] [165] السيد باتور

تتبع الحركة

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
الحوسبة القابلة للارتداء: تصنيف أوضاع الجسم وحركاته (PUC-Rio) أشخاص يقومون بخمسة حركات قياسية أثناء ارتداء أجهزة تعقب الحركة. لا أحد. 165,632 نص تصنيف 2013 [166] [167] الجامعة البابوية الكاثوليكية في ريو دي جانيرو
مجموعة بيانات تقسيم مرحلة الإيماءة الميزات المستخرجة من فيديو لأشخاص يقومون بإيماءات مختلفة. تهدف الميزات المستخرجة إلى دراسة تقسيم مرحلة الإيماءة. 9900 نص التصنيف والتجميع 2014 [168] [169] ر. ماديو وآخرون
مجموعة بيانات Vicon Physical Action مجموعة بيانات 10 تصرفات بدنية عادية و10 تصرفات عدوانية تقيس النشاط البشري الذي يتتبعه متتبع ثلاثي الأبعاد. تم تسجيل العديد من المعلمات بواسطة متعقب ثلاثي الأبعاد. 3000 نص تصنيف 2011 [170] [171] ت. ثيودوريديس
مجموعة بيانات الأنشطة اليومية والرياضية بيانات مستشعر المحرك لـ 19 نشاطًا يوميًا ورياضيًا. تم توفير العديد من أجهزة الاستشعار، ولم يتم إجراء أي معالجة مسبقة على الإشارات. 9120 نص تصنيف 2013 [172] [173] ب. برشان وآخرون.
التعرف على النشاط البشري باستخدام مجموعة بيانات الهواتف الذكية بيانات الجيروسكوب ومقياس التسارع من الأشخاص الذين يرتدون الهواتف الذكية ويقومون بإجراءات عادية. يتم تصنيف الإجراءات التي يتم تنفيذها، ويتم معالجة جميع الإشارات مسبقًا بحثًا عن الضوضاء. 10,299 نص تصنيف 2012 [174] [175] ج. رييس-أورتيز وآخرون.
إشارات لغة الإشارة الأسترالية إشارات لغة الإشارة الأسترالية تم التقاطها بواسطة قفازات تتبع الحركة. لا أحد. 2565 نص تصنيف 2002 [176] [177] السيد كادوس
تمارين رفع الأثقال التي تتم مراقبتها باستخدام وحدات القياس بالقصور الذاتي خمسة أشكال مختلفة من تمرين ثني العضلة ذات الرأسين تمت مراقبتها باستخدام أجهزة قياس القصور الذاتي (IMUs). بعض الإحصائيات تم حسابها من البيانات الخام. 39,242 نص تصنيف 2013 [178] [179] و. أوجولينو وآخرون.
مجموعة بيانات sEMG لحركات اليد الأساسية قاعدتي بيانات لإشارات تخطيط كهربية العضلات السطحية لست حركات لليد. لا أحد. 3000 نص تصنيف 2014 [180] [181] ج. سابسانيس وآخرون.
مجموعة بيانات التعرف على الأنشطة REALDISP تقييم التقنيات التي تتعامل مع تأثيرات إزاحة المستشعر في التعرف على الأنشطة القابلة للارتداء. لا أحد. 1419 نص تصنيف 2014 [181] [182] أ. بانوس وآخرون.
مجموعة بيانات التعرف على الأنشطة غير المتجانسة بيانات من أجهزة ذكية متعددة مختلفة للبشر الذين يقومون بأنشطة مختلفة. لا أحد. 43,930,257 نص التصنيف والتجميع 2015 [183] ​​[184] أ. ستيسن وآخرون.
التنبؤ بحركة المستخدمين الداخليين من بيانات RSS بيانات الشبكة اللاسلكية الزمنية التي يمكن استخدامها لتتبع حركة الأشخاص في مكتب ما. لا أحد. 13,197 نص تصنيف 2016 [185] [186] د. باتشيو
مجموعة بيانات مراقبة النشاط البدني PAMAP2 18 نوعًا مختلفًا من الأنشطة البدنية التي قام بها 9 أشخاص يرتدون 3 أجهزة قياس بالقصور الذاتي. لا أحد. 3,850,505 نص تصنيف 2012 [187] أ. رايس
مجموعة بيانات التعرف على الأنشطة OPPORTUNITY التعرف على النشاط البشري من خلال أجهزة الاستشعار القابلة للارتداء والأشياء والمحيطة هي مجموعة بيانات تم تصميمها لمعايرة خوارزميات التعرف على النشاط البشري. لا أحد. 2551 نص تصنيف 2012 [188] [189] د. روجين وآخرون.
مجموعة بيانات التعرف على الأنشطة في العالم الحقيقي التعرف على النشاط البشري من خلال الأجهزة القابلة للارتداء. يميز بين سبعة أوضاع للأجهزة على الجسم ويتكون من ستة أنواع مختلفة من أجهزة الاستشعار. لا أحد. 3,150,000 (لكل مستشعر) نص تصنيف 2016 [190] ت. ستايلر وآخرون.
مجموعة بيانات وضعية السكتة الدماغية في مركز إعادة التأهيل في تورنتو تقديرات وضعية الإنسان ثلاثية الأبعاد (Kinect) لمرضى السكتة الدماغية والمشاركين الأصحاء الذين يؤدون مجموعة من المهام باستخدام روبوت إعادة تأهيل السكتة الدماغية. لا أحد. 10 أشخاص أصحاء و9 ناجين من السكتة الدماغية (3500-6000 إطار لكل شخص) CSV تصنيف 2017 [191] [192] [193] إ. دولاتابادي وآخرون.
مجموعة من اللمسات الاجتماعية (CoST) 7805 لقطات إيماءة لـ 14 إيماءة لمس اجتماعية مختلفة قام بها 31 شخصًا. تم تنفيذ الإيماءات بثلاثة أشكال: لطيفة وعادية وخشنة، على شبكة مستشعر ضغط ملفوفة حول ذراع عارضة أزياء. تتم تجزئة إيماءات اللمس التي يتم إجراؤها ووضع علامات عليها. 7805 التقاط الإيماءات CSV تصنيف 2016 [194] [195] م. يونج وآخرون.

إشارات أخرى

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات النبيذ التحليل الكيميائي للنبيذ المزروع في نفس المنطقة في إيطاليا ولكن المشتق من ثلاثة أصناف مختلفة. تم ذكر 13 خاصية لكل نبيذ 178 نص التصنيف والانحدار 1991 [196] [197] م. فورينا وآخرون.
مجموعة بيانات محطة الطاقة ذات الدورة المركبة بيانات من أجهزة استشعار مختلفة داخل محطة طاقة تعمل لمدة 6 سنوات. لا أحد 9568 نص الانحدار 2014 [198] [199] ب. توفيكجي وآخرون.

البيانات المادية

مجموعة البيانات من الأنظمة الفيزيائية.

فيزياء الطاقة العالية

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات HIGGS محاكاة مونت كارلو لتصادمات مسرعات الجسيمات. تم إعطاء 28 ميزة لكل تصادم. 11 مليون نص تصنيف 2014 [200] [201] [202] د. وايتسون
مجموعة بيانات HEPMASS محاكاة مونت كارلو لتصادمات مسرعات الجسيمات. الهدف هو فصل الإشارة عن الضوضاء. تم إعطاء 28 ميزة لكل تصادم. 10,500,000 نص تصنيف 2016 [201] [202] [203] د. وايتسون

الأنظمة

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات ديناميكا المياه لليخوت أداء اليخت على أساس الأبعاد. يتم تقديم ستة ميزات لكل يخت. 308 نص الانحدار 2013 [204] [205] ر. لوبيز
مجموعة بيانات فشل تنفيذ الروبوت 5 مجموعات بيانات تركز على فشل الروبوتات في تنفيذ المهام الشائعة. ميزات ذات قيمة صحيحة مثل عزم الدوران وقياسات المستشعرات الأخرى. 463 نص تصنيف 1999 [206] ل. سيبرا وآخرون.
مجموعة بيانات جسور بيتسبرغ يتم تقديم وصف التصميم من حيث العديد من خصائص الجسور المختلفة. يتم تقديم ميزات الجسر المختلفة. 108 نص تصنيف 1990 [207] [208] ي. رايش وآخرون.
مجموعة بيانات السيارات بيانات عن السيارات ومخاطر التأمين عليها وخسائرها الطبيعية. تم استخراج مميزات السيارة. 205 نص الانحدار 1987 [209] [210] ج. شيمر وآخرون.
مجموعة بيانات معدل استهلاك الوقود التلقائي بيانات MPG للسيارات. تم ذكر ثمانية مميزات لكل سيارة. 398 نص الانحدار 1993 [211] جامعة كارنيجي ميلون
مجموعة بيانات كفاءة الطاقة متطلبات التدفئة والتبريد تعطى كدالة لمعلمات البناء. تم إعطاء معلمات البناء. 768 نص التصنيف والانحدار 2012 [212] [213] أ. شيفارا وآخرون.
مجموعة بيانات الضوضاء الذاتية للجناح سلسلة من الاختبارات الديناميكية الهوائية والصوتية لمقاطع شفرات الجناح ثنائية وثلاثية الأبعاد. يتم تقديم بيانات حول التردد وزاوية الهجوم وما إلى ذلك. 1503 نص الانحدار 2014 [214] ر. لوبيز
مجموعة بيانات حلقات مكوك الفضاء تشالنجر الولايات المتحدة محاولة التنبؤ بمشاكل الحلقة O بالنظر إلى بيانات Challenger السابقة. يتم تقديم العديد من الميزات لكل رحلة، مثل درجة حرارة الإطلاق. 23 نص الانحدار 1993 [215] [216] د. درابر وآخرون.
مجموعة بيانات Statlog (Shuttle) مجموعة بيانات مكوك الفضاء التابع لوكالة ناسا. تم تقديم تسعة ميزات. 58000 نص تصنيف 2002 [217] ناسا

علم الفلك

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
البراكين على كوكب الزهرة – مجموعة بيانات تجربة JARtool صور كوكب الزهرة التي أرسلتها مركبة الفضاء ماجلان. يتم تصنيف الصور من قبل البشر. لم يتم اعطاءه الصور تصنيف 1991 [218] [219] السيد بورل
مجموعة بيانات تلسكوب MAGIC Gamma أحداث جسيمات جاما عالية الطاقة التي تم إنشاؤها بواسطة مونت كارلو. تم استخراج العديد من الميزات من المحاكاة. 19,020 نص تصنيف 2007 [219] [220] ر. بوك
مجموعة بيانات التوهجات الشمسية قياسات عدد أنواع معينة من أحداث التوهجات الشمسية التي تحدث خلال فترة 24 ساعة. تم تقديم العديد من الميزات الخاصة بالتوهجات الشمسية. 1389 نص الانحدار والتصنيف 1989 [221] ج. برادشو
مجموعة بيانات CAMELS متعددة الحقول خرائط ثنائية الأبعاد وشبكات ثلاثية الأبعاد من آلاف المحاكاة الهيدروديناميكية للجسم N والمتطورة التي تغطي نطاقًا واسعًا في قيمة المعلمات الكونية والفيزيائية الفلكية تحتوي كل خريطة وشبكة على 6 معلمات كونية وفيزيائية فلكية مرتبطة بها 405000 خريطة ثنائية الأبعاد و405000 شبكة ثلاثية الأبعاد خرائط ثنائية الأبعاد وشبكات ثلاثية الأبعاد الانحدار 2021 [222] فرانسيسكو فيلاسكوسا-نافارو وآخرون.

علوم الارض

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
براكين العالم بيانات الانفجارات البركانية لجميع الأحداث البركانية المعروفة على الأرض. يتم تقديم تفاصيل مثل المنطقة والمنطقة الفرعية والبيئة التكتونية ونوع الصخور السائدة. 1535 نص الانحدار والتصنيف 2013 [223] إي. فينزكي وآخرون.
مجموعة بيانات المطبات الزلزالية الأنشطة الزلزالية من منجم الفحم. تم تصنيف النشاط الزلزالي على أنه خطير أو غير خطير. 2584 نص تصنيف 2013 [224] [225] م. سيكورا وآخرون.
جمال-الولايات المتحدة مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة انظر المرجع 671 CSV، نص، ملف الشكل الانحدار 2017 [226] [227] ن. أدور وآخرون. / أ. نيومان وآخرون.
جمال-تشيلي مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة انظر المرجع 516 CSV، نص، ملف الشكل الانحدار 2018 [228] سي. ألفاريز-جاريتون وآخرون.
جمال-البرازيل مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة انظر المرجع 897 CSV، نص، ملف الشكل الانحدار 2020 [229] V. شاغاس وآخرون.
جمال-بريطانيا العظمى مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة انظر المرجع 671 CSV، نص، ملف الشكل الانحدار 2020 [230] ج. كوكسون وآخرون.
الجمال-أستراليا مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة انظر المرجع 222 CSV، نص، ملف الشكل الانحدار 2021 [231] ك. فاولر وآخرون.
لمة -CE مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة انظر المرجع 859 CSV، نص، ملف الشكل الانحدار 2021 [232] ج. كلينجلر وآخرون.

فيزيائية أخرى

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات قوة ضغط الخرسانة مجموعة بيانات عن خصائص الخرسانة وقوة الضغط. يتم تقديم تسع ميزات لكل عينة. 1030 نص الانحدار 2007 [233] [234] أنا. يه
مجموعة بيانات اختبار انحدار الخرسانة يتم تحديد تدفق الانهيار الخرساني من حيث الخصائص. ميزات الخرسانة المذكورة مثل الرماد المتطاير والماء وما إلى ذلك. 103 نص الانحدار 2009 [235] [236] أنا. يه
مجموعة بيانات مسك توقع ما إذا كان الجزيء، بالنظر إلى الميزات، سيكون مسكًا أم غير مسك. تم إعطاء 168 خاصية لكل جزيء. 6598 نص تصنيف 1994 [237] شركة أريس للصناعات الدوائية
مجموعة بيانات أخطاء الصفائح الفولاذية صفائح فولاذية من 7 أنواع مختلفة. تم تقديم 27 ميزة لكل عينة. 1941 نص تصنيف 2010 [238] مركز سيميون للأبحاث
مجموعة بيانات الجسيمات النانوية أحادية المعدن النبيلة معالجة وخصائص البنية للجسيمات النانوية أحادية المعدن، حيث تكون العلامات عبارة عن طاقة التكوين. تم تقديم 85-182 ميزة لكل عينة. 425 إلى 4000 CSV الانحدار 2017 إلى 2023 [239] [240] [241] [242] [243] [244] أ. برنارد و ج. أوبليتال
مجموعة بيانات الجسيمات النانوية ثنائية المعدن من شركة نوبل ميتال معالجة وخصائص البنية للجسيمات النانوية ثنائية المعدن، حيث تكون العلامات عبارة عن طاقة التكوين. تم تقديم 922 ميزة لكل عينة. 138147 إلى 162770 CSV الانحدار 2023 [245] [246] [247 ] [248] [249] [250] [251] [252 ] [ 253] [254] [255] [256] ج. تينج وآخرون.
مجموعة بيانات الجسيمات النانوية ثلاثية المعادن AuPdPt معالجة وخصائص البنية لجسيمات النانو AuPdPt، حيث تكون العلامات عبارة عن طاقة التكوين. 1958 ميزات معينة لكل عينة. 48136 CSV الانحدار 2023 [257] ك. لو وآخرون.

البيانات البيولوجية

مجموعة البيانات من الأنظمة البيولوجية.

بشر

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات العمر مجموعة بيانات عامة منظمة عن حياة وعمل ووفاة 1.22 مليون شخص مميز. المجال العام. طريقة مكونة من خمس خطوات لاستنتاج سنوات الميلاد والوفاة والجنس والمهنة من البيانات التي يرسلها المجتمع إلى جميع إصدارات اللغات لمشروع ويكيبيديا. 1,223,009 نص الانحدار، التصنيف 2022 الورقة [258]

مجموعة البيانات [259]

أمورادنجاد وآخرون.
مجموعة بيانات قاع العين الاصطناعية [260] صور واقعية لشبكية العين وتقسيمات الأوعية الدموية. المجال العام. 2500 صورة بقياس 1500*1152 بكسل مفيدة لتجزئة وتصنيف الأوردة والشرايين على خلفية واحدة. 2500 الصور التصنيف والتجزئة 2020 [261] ج. فالنتي وآخرون.
قاعدة بيانات تخطيط كهربية الدماغ دراسة لفحص ارتباط تخطيط كهربية الدماغ بالاستعداد الوراثي لإدمان الكحول. تم إجراء القياسات من 64 قطبًا كهربائيًا تم وضعها على فروة الرأس وتم أخذ العينات منها بتردد 256 هرتز (3.9 مللي ثانية) لمدة ثانية واحدة. 122 نص تصنيف 1999 [262] ح. بيجليتر
مجموعة بيانات واجهة P300 بيانات من تسعة أشخاص تم جمعها باستخدام واجهة الدماغ والحاسوب القائمة على P300 للأشخاص ذوي الإعاقة. مقسمة إلى أربع جلسات لكل موضوع. يتم إعطاء كود MATLAB . 1,224 نص تصنيف 2008 [263] [264] يو هوفمان وآخرون.
مجموعة بيانات أمراض القلب يُنسب إلى المرضى المصابين بأمراض القلب وغير المصابين بها. تم تقديم 75 سمة لكل مريض مع بعض القيم المفقودة. 303 نص تصنيف 1988 [265] [266] أ. جانوسي وآخرون.
مجموعة بيانات سرطان الثدي في ولاية ويسكونسن (التشخيصية) مجموعة بيانات عن خصائص كتل الثدي. يتم تقديم التشخيصات من قبل الطبيب. يتم إعطاء 10 ميزات لكل عينة. 569 نص تصنيف 1995 [267] [268] و. وولبيرج وآخرون.
المسح الوطني حول تعاطي المخدرات والصحة دراسة استقصائية واسعة النطاق حول الصحة وتعاطي المخدرات في الولايات المتحدة. لا أحد. 55,268 نص التصنيف والانحدار 2012 [269] وزارة الصحة والخدمات الإنسانية الأمريكية
مجموعة بيانات سرطان الرئة مجموعة بيانات سرطان الرئة بدون تعريفات السمات يتم تقديم 56 ميزة لكل حالة 32 نص تصنيف 1992 [270] [271] ز. هونغ وآخرون.
مجموعة بيانات عدم انتظام ضربات القلب بيانات لمجموعة من المرضى، بعضهم يعاني من عدم انتظام ضربات القلب. 276 ميزة لكل حالة. 452 نص تصنيف 1998 [272] [273] ح. ألتاي وآخرون.
مجموعة بيانات Diabetes 130-المستشفيات الأمريكية للسنوات 1999-2008 9 سنوات من بيانات إعادة القبول عبر 130 مستشفى في الولايات المتحدة للمرضى المصابين بمرض السكري. يتم تقديم العديد من الميزات لكل إعادة القبول. 100000 نص التصنيف والتجميع 2014 [274] [275] ج. كلور وآخرون.
مجموعة بيانات ديبرسين لاعتلال الشبكية السكري السمات المستخرجة من صور العيون المصابة باعتلال الشبكية السكري وغير المصابة به. تم استخراج الميزات وتشخيص الحالات. 1151 نص تصنيف 2014 [276] [277] ب. أنطال وآخرون.
مجموعة بيانات اعتلال الشبكية السكري في ميسيدور طرق تقييم تقنيات التجزئة والفهرسة في مجال طب شبكية العين (MESSIDOR) ميزات درجة اعتلال الشبكية وخطر الوذمة البقعية 1200 الصور والنصوص التصنيف والتجزئة 2008 [278] [279] مشروع ميسيدور
مجموعة بيانات اضطرابات الكبد بيانات للأشخاص الذين يعانون من اضطرابات الكبد. يتم إعطاء سبعة سمات بيولوجية لكل مريض. 345 نص تصنيف 1990 [280] [281] شركة بوبا للأبحاث الطبية المحدودة
مجموعة بيانات أمراض الغدة الدرقية 10 قواعد بيانات لبيانات مرضى الغدة الدرقية. لا أحد. 7200 نص تصنيف 1987 [282] [283] ر. كوينلان
مجموعة بيانات الورم المتوسطة بيانات مرضى الورم المتوسطة. يتم تقديم عدد كبير من الميزات، بما في ذلك التعرض للأسبستوس. 324 نص تصنيف 2016 [284] [285] أ. تانريكولو وآخرون.
مجموعة بيانات تقدير الوضعية بناءً على الرؤية لدى مرضى باركنسون تقديرات وضعية الإنسان ثنائية الأبعاد لمرضى باركنسون أثناء قيامهم بمجموعة متنوعة من المهام. تمت إزالة اهتزاز الكاميرا من المسارات. 134 نص التصنيف والانحدار 2017 [286] [287] [288] م. لي وآخرون.
مجموعة بيانات شبكة التفاعل الأيضي KEGG (غير الموجهة) شبكة المسارات الأيضية. يتم تقديم شبكة التفاعل وشبكة العلاقات . يتم تقديم الميزات التفصيلية لكل عقدة شبكة ومسار. 65,554 نص التصنيف والتجميع والانحدار 2011 [289] م. نعيم وآخرون.
مجموعة بيانات تحليل مورفولوجيا الحيوانات المنوية البشرية المعدلة (MHSMA) صور الحيوانات المنوية البشرية من 235 مريضًا يعانون من العقم عند الذكور، مصنفة حسب الحيوانات المنوية الطبيعية أو غير الطبيعية، الأكروسوم، الرأس، الفجوة، والذيل. تم قصها حول رأس حيوان منوي واحد. تم تطبيع التكبير. تم إنشاء تقسيمات مجموعة التدريب والتحقق والاختبار. 1,540 ملفات .npy تصنيف 2019 [290] [291] س. جافادي وس. أ. ميروشاندل

حيوان

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات الأبالون القياسات الفيزيائية لأذن البحر، كما تم توضيح أنماط الطقس والموقع. لا أحد. 4177 نص الانحدار 1995 [292] مختبرات الأبحاث البحرية – تارونا
مجموعة بيانات حديقة الحيوان مجموعة بيانات اصطناعية تغطي 7 فئات من الحيوانات. يتم تصنيف الحيوانات إلى 7 فئات ويتم إعطاء ميزات لكل منها. 101 نص تصنيف 1990 [293] ر. فورسيث
مجموعة بيانات الإسفنجيات بيانات عن الإسفنج البحري. يتم وصف 503 إسفنجة في فئة Demosponge بميزات مختلفة. 503 نص تصنيف 2010 [294] إي. أرمينجول وآخرون.
بيانات الحيوانات في المزرعة جرد بيانات PLF (الأبقار والخنازير والموقع والتسارع وما إلى ذلك). مجموعات البيانات المُسمّاة. يتم تحديث القائمة باستمرار نص تصنيف 2020 [295] ف. بلوخ
مجموعة بيانات تسلسلات جينات الوصلات الموصولة تسلسلات جينات الوصلة الوصلية (DNA) لدى الرئيسيات مع نظرية المجال غير الكامل المرتبطة بها. لا أحد. 3190 نص تصنيف 1992 [271] ج. تاول وآخرون.
مجموعة بيانات تعبير البروتين لدى الفئران مستويات التعبير عن 77 بروتينًا تم قياسها في القشرة المخية للفئران. لا أحد. 1080 نص التصنيف والتجميع 2015 [296] [297] ج. هيجيرا وآخرون.

الفطريات

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات UCI Mushroom صفات الفطر وتصنيفه. يتم ذكر العديد من خصائص كل فطر. 8124 نص تصنيف 1987 [298] ج. شليمر
مجموعة بيانات الفطر الثانوية صفات الفطر وتصنيفه بيانات محاكاة من إدخالات فطر أولية أكبر وأكثر واقعية. قابلة للتكرار بالكامل. 61069 نص تصنيف 2020 [299] [300] د. فاغنر وآخرون.

نبات

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات حرائق الغابات حرائق الغابات وخصائصها تم استخراج 13 ميزة لكل حريق. 517 نص الانحدار 2008 [301] [302] ب. كورتيز وآخرون.
مجموعة بيانات القزحية يتم وصف ثلاثة أنواع من نباتات السوسن من خلال 4 سمات مختلفة. لا أحد. 150 نص تصنيف 1936 [303] [304] ر. فيشر
مجموعة بيانات أوراق أنواع النباتات ستة عشر عينة من أوراق كل مائة نوع من النباتات. يتم تقديم وصف الشكل، والهامش الدقيق، ومخططات الملمس. 1600 نص تصنيف 2012 [305] [306] ج. كوب وآخرون.
مجموعة بيانات فول الصويا قاعدة بيانات نباتات فول الصويا المريضة. تم ذكر 35 خاصية لكل نبات، وتم تصنيف النباتات إلى 19 فئة. 307 نص تصنيف 1988 [307] ر. ميشالسكي وآخرون.
مجموعة بيانات البذور قياس الخصائص الهندسية للحبوب التابعة لثلاثة أصناف مختلفة من القمح. لا أحد. 210 نص التصنيف والتجميع 2012 [308] [309] شاريتانوفيتش وآخرون.
مجموعة بيانات الغلاف بيانات للتنبؤ بنوع الغطاء الحرجي من المتغيرات الخرائطية بشكل صارم. تم تقديم العديد من الميزات الجغرافية. 581,012 نص تصنيف 1998 [310] [311] ج. بلاكارد وآخرون.
مجموعة بيانات شبكة إشارات حمض الأبسيسيك بيانات لشبكة إشارات النباتات. الهدف هو تحديد مجموعة القواعد التي تحكم الشبكة. لا أحد. 300 نص الاكتشاف السببي 2008 [312] ج. جينكينز وآخرون.
مجموعة بيانات فوليو 20 صورة لأوراق كل نوع من 32 نوعًا. لا أحد. 637 الصور والنصوص التصنيف والتجميع 2015 [313] [314] ت. مونيسامي وآخرون.
مجموعة بيانات زهور أكسفورد مجموعة بيانات مكونة من 17 فئة من الزهور. تقسيمات التدريب/الاختبار، الصور الموسومة، 1360 الصور والنصوص تصنيف 2006 [315] [316] ME نيلسباك وآخرون.
مجموعة بيانات شتلات النباتات مجموعة بيانات مكونة من 12 فئة من شتلات النباتات. الصور المصنفة، الصور المجزأة، 5544 الصور التصنيف والكشف 2017 [317] جيسلسون وآخرون.
فواكه-360 قاعدة بيانات تحتوي على صور 131 نوع من الفواكه والخضروات. 100×100 بكسل، خلفية بيضاء. 90483 الصور (jpg) تصنيف 2017–2024 [318] ميهاي أولتيان
تطبيق Weed-ID قاعدة بيانات تحتوي على 1025 نوعًا، وأكثر من 13500 صورة، وأكثر من 120000 سمة أحجام وخلفيات مختلفة. تم تصنيفها بواسطة عالم نبات حاصل على درجة الدكتوراه. 13,500 الصور والنصوص تصنيف 1999-2024 [319] ريتشارد أولد
مجموعة بيانات CottonWeedDet3 مجموعة بيانات مكونة من 3 فئات لكشف الأعشاب الضارة لأنظمة زراعة القطن 3 أنواع من الأعشاب الضارة. 848 الصور تصنيف 2022 [320] رحمن وآخرون.

ميكروب

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات إيكولي مواقع تواجد البروتين. يتم تقديم ميزات مختلفة لمواقع توطين البروتين. 336 نص تصنيف 1996 [321] [322] ك. ناكاي وآخرون.
مجموعة بيانات MicroMass التعرف على الكائنات الحية الدقيقة من بيانات مطياف الكتلة. ميزات مطياف الكتلة المتنوعة. 931 نص تصنيف 2013 [323] [324] ب. ماهي وآخرون.
مجموعة بيانات الخميرة التنبؤ بمواقع توطين البروتينات في الخلايا. يتم تقديم ثمانية ميزات لكل حالة. 1484 نص تصنيف 1996 [325] [326] ك. ناكاي وآخرون.

اكتشاف الأدوية

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات Tox21 التنبؤ بنتائج التحاليل البيولوجية. يتم إعطاء الوصافات الكيميائية للجزيئات. 12707 نص تصنيف 2016 [327] أ. ماير وآخرون.

بيانات الشذوذ

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
معيار الشذوذ Numenta (NAB) البيانات عبارة عن مقاييس مرتبة ومؤقتة وذات قيمة واحدة. تحتوي جميع ملفات البيانات على شذوذ، ما لم يُذكر خلاف ذلك. لا أحد أكثر من 50 ملفًا CSV كشف الشذوذ 2016 (تحديث مستمر) [328] نومنتا
معيار شذوذ Skoltech (SKAB) يمثل كل ملف تجربة واحدة ويحتوي على شذوذ واحد. تمثل مجموعة البيانات سلسلة زمنية متعددة المتغيرات تم جمعها من أجهزة الاستشعار المثبتة على منصة الاختبار. هناك نوعان من العلامات لمشكلات اكتشاف القيم الشاذة (الشذوذ النقطي) واكتشاف نقطة التغيير (الشذوذ الجماعي) أكثر من 30 ملفًا (الإصدار 0.9) CSV كشف الشذوذ 2020 (تحديث مستمر)

[329] [330]

يوري د. كاتسر وفياتشيسلاف أو. كوزيتسين
حول تقييم اكتشاف القيم المتطرفة غير الخاضعة للإشراف: المقاييس ومجموعات البيانات ودراسة تجريبية يتم تكييف معظم ملفات البيانات من بيانات مستودع التعلم الآلي بجامعة كاليفورنيا، ويتم جمع بعضها من الأدبيات. تم معالجتها للقيم المفقودة، والسمات الرقمية فقط، ونسب مختلفة من الشذوذ، والعلامات أكثر من 1000 ملف أرف كشف الشذوذ 2016 (ربما تم تحديثه بمجموعات بيانات و/أو نتائج جديدة)

[331]

كامبوس وآخرون.

بيانات الإجابة على الأسئلة

يتضمن هذا القسم مجموعات البيانات التي تتعامل مع البيانات المنظمة.

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مجموعة بيانات DBpedia Neural Question Answering (DBNQA) مجموعة كبيرة من الأسئلة الموجهة إلى SPARQL مصممة خصيصًا للإجابة على الأسئلة العصبية في المجال المفتوح عبر قاعدة بيانات المعرفة DBpedia. تحتوي مجموعة البيانات هذه على مجموعة كبيرة من قوالب SPARQL العصبية المفتوحة ومثيلاتها لتدريب آلات SPARQL العصبية؛ وقد تمت معالجتها مسبقًا بواسطة أدوات التعليق شبه الآلية بالإضافة إلى ثلاثة خبراء SPARQL. 894,499 أزواج السؤال-الاستفسار الإجابة على الأسئلة 2018 [332] [333] هارتمان، سورو، وماركس وآخرون.
مجموعة بيانات الإجابة على الأسئلة باللغة الفيتنامية (UIT-ViQuAD) مجموعة كبيرة من الأسئلة الفيتنامية لتقييم نماذج MRC. تتضمن مجموعة البيانات هذه أكثر من 23000 زوجًا من الأسئلة والأجوبة التي تم إنشاؤها بواسطة الإنسان بناءً على 5109 فقرة من 174 مقالة فيتنامية من ويكيبيديا. 23,074 أزواج الأسئلة والأجوبة الإجابة على الأسئلة 2020 [334] نجوين وآخرون.
مجموعة قراءة آلية متعددة الخيارات باللغة الفيتنامية (ViMMRC) مجموعة من أسئلة الاختيار من متعدد باللغة الفيتنامية لتقييم نماذج MRC. يتضمن هذا الكتاب 2783 سؤالاً اختياريًا متعددًا باللغة الفيتنامية. 2,783 أزواج الأسئلة والأجوبة الإجابة على الأسئلة/فهم القراءة الآلية 2020 [335] نجوين وآخرون.
الإجابة على الأسئلة في المجال المفتوح تتحول إلى محادثة من خلال إعادة كتابة الأسئلة الإجابة على أسئلة المجال المفتوح من البداية إلى النهاية. تتضمن مجموعة البيانات هذه 14000 محادثة مع 81000 زوج من الأسئلة والأجوبة. السياق، السؤال، إعادة الكتابة، الإجابة، عنوان URL للإجابة، رقم المحادثة، رقم التحويل، مصدر المحادثة

يتم توفير المزيد من التفاصيل في مستودع GitHub الخاص بالمشروع وبطاقة مجموعة البيانات Hugging Face ذات الصلة.

الإجابة على الأسئلة 2021 [336] أنانثا وفاكولينكو وآخرون.
توحيد ضمان الجودة بيانات الأسئلة والأجوبة مجموعة البيانات المعالجة الإجابة على الأسئلة 2020 [337] خشابي وآخرون.

بيانات مطالبة الحوار أو التعليمات

يتضمن هذا القسم مجموعات البيانات التي ...

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مدير المهام "يتكون مجموعة Taskmaster من ثلاث مجموعات بيانات، Taskmaster-1 (TM-1)، وTaskmaster-2 (TM-2)، وTaskmaster-3 (TM-3)، والتي تضم أكثر من 55000 حوار موجه نحو المهام، شفهيًا ومكتوبًا، في أكثر من اثني عشر مجالًا." [338] Taskmaster-1: مجموعة بيانات محادثة موجهة نحو الهدف. تتضمن 13215 حوارًا قائمًا على المهام تتألف من ستة مجالات.

Taskmaster-2: 17,289 حوارًا في المجالات السبعة (المطاعم، وطلب الطعام، والأفلام، والفنادق، والرحلات الجوية، والموسيقى والرياضة).

Taskmaster-3: 23,757 حوارات شراء تذاكر الأفلام.

Taskmaster-1 وTaskmaster-2: معرف المحادثة، والعبارات، ومعرف التعليمات

Taskmaster-3: معرف المحادثة، العبارات، العمودي، السيناريو، التعليمات.

لمزيد من التفاصيل، راجع مستودع GitHub الخاص بالمشروع أو بطاقات مجموعة بيانات Hugging Face (taskmaster-1، taskmaster-2، taskmaster-3).

الحوار/التعليمات المطلوبة 2019 [339] بيرن وكريشنامورثي وآخرون.
دكتور ريبير مجموعة بيانات مُصنَّفة لإصلاح البرنامج. البيانات المعالجة مسبقًا تحقق من تفاصيل التنسيق في ورقة عمل المشروع. الحوار/التعليمات المطلوبة 2020 [340] ميتشيرو وآخرون.
التعليمات الطبيعية الإصدار الثاني مجموعة بيانات كبيرة تغطي نطاقًا أوسع من قدرات التفكير تتكون كل مهمة من الإدخال/الإخراج، وتعريف المهمة.

بالإضافة إلى ذلك، يحتوي كل طلب على تعريف للمهمة.

تتوفر معلومات إضافية في مستودع GitHub الخاص بالمشروع وبطاقة بيانات Hugging Face.

الإدخال/الإخراج وتعريف المهمة 2022 [341] وانغ وآخرون.
لامبادا "LAMBADA عبارة عن مجموعة من المقاطع السردية التي تشترك في خاصية مفادها أن الأشخاص قادرين على تخمين كلمتهم الأخيرة إذا تعرضوا للمقطع بأكمله، ولكن ليس إذا رأوا فقط الجملة الأخيرة التي تسبق الكلمة المستهدفة." [342] تتوفر معلومات حول تنسيق هذه المجموعة من البيانات في بطاقة مجموعة البيانات HuggingFace وموقع الويب الخاص بالمشروع.

يمكن تنزيل مجموعة البيانات هنا، والبيانات المرفوضة هنا.

2016 [343] بابيرنو وآخرون.
فلان يتوفر إصدار تمت معالجته مسبقًا من مجموعة بيانات FLAN مع التحديثات منذ إصدار مجموعة بيانات FLAN الأصلية في Hugging Face:
  1. بيانات الاختبار
  2. بيانات القطار
  3. بيانات التحقق

تتوفر البرامج النصية لمعالجة البيانات في مستودع GitHub المذكور في الورقة: https://github.com/google-research/FLAN/tree/main/flan.

تم إنشاء مستودع آخر لـ FLAN على GitHub أيضًا. وهو المستودع المرتبط ببطاقة مجموعة البيانات في Hugging Face.

2021 [344] وي وآخرون.

الأمن السيبراني

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
هجوم الميتري ATT&CK هي قاعدة معرفية يمكن الوصول إليها عالميًا لتكتيكات وتقنيات الخصم. يمكن تنزيل البيانات من مستودعي GitHub التاليين: الإصدار 2.1 والإصدار 2.0 [345] هجوم الميتري
كابيك حصر وتصنيف أنماط الهجوم الشائعة يمكن تنزيل البيانات من موقع CAPEC على الإنترنت:

آليات الهجوم مجالات الهجوم

[346] كابيك
سي في إي CVE عبارة عن قائمة من الثغرات الأمنية السيبرانية التي تم الكشف عنها علنًا والتي يمكن البحث عنها واستخدامها ودمجها في المنتجات والخدمات مجانًا. يمكن تنزيل البيانات من: Allitems [347] سي في إي
سي دبليو إي بيانات تعداد نقاط الضعف الشائعة. يمكن تنزيل البيانات من:

تطوير البرمجيات تصميم الأجهزة [ رابط ميت دائم ‍ ] مفاهيم البحث

[348] سي دبليو إي
مالويرتكست دي بي قاعدة بيانات توضيحية لنصوص البرامج الضارة. يحتوي مستودع GitHub الخاص بالمشروع على البيانات التي يمكن تنزيلها. [349] كيات وآخرون.
وقائع ندوة أمن USENIX مجموعة من الإجراءات الأمنية من ندوة أمن USENIX - الجلسات الفنية من عام 1995 إلى عام 2022. هذه البيانات لم تتم معالجتها مسبقًا. 1995، 1996، 1997، 1998، 1999، 2000، 2001، 2002، 2003، 2004، 2005، 2006، 2007، 2008،

2009، 2010 2011، 2012، 2013، 2014، 2015، 2016، 2017، 2018، 2019، 2020، 2021، 2022.

[350] ندوة أمن USENIX
ملاحظات APT مجموعة من الوثائق العامة والأوراق البيضاء والمقالات حول حملات التهديدات المتقدمة المستمرة. جميع الوثائق عبارة عن بيانات متاحة للعامة. هذه البيانات لم تتم معالجتها مسبقًا. يحتوي مستودع GitHub الخاص بالمشروع على ملف يحتوي على روابط للبيانات المخزنة في box.

يمكن أيضًا تنزيل ملفات البيانات هنا.

[351] ملاحظات APT
مقالات arXiv حول التشفير والأمان مجموعة من المقالات حول الأمن السيبراني هذه البيانات لم تتم معالجتها مسبقًا. جميع المقالات متوفرة هنا. [352] أركسيف
كتب إلكترونية مجانية عن الأمن مجموعة صغيرة من الكتب الإلكترونية المتعلقة بالأمن، والعروض التقديمية المتعلقة بالأمن المتاحة للعامة. هذه البيانات لم تتم معالجتها مسبقًا. [353] [354] [355] [356] [357] [358] [359] [360] [ 361] [362] [363] [364]
مستودع استراتيجية الأمن السيبراني الوطني مستودع للوثائق الاستراتيجية العالمية حول الأمن السيبراني. هذه البيانات لم تتم معالجتها مسبقًا. [365]
الأمن السيبراني ومعالجة اللغة الطبيعية بيانات حول استراتيجيات الأمن السيبراني من أكثر من 75 دولة. التجزئة، إزالة الكلمات المتكررة التي لا معنى لها. [366] يانلين تشين، يونجيان وي، ييفان يو، ون شيويه، زيانيا تشين
مجموعة تقارير APT عينة من تقارير التهديدات المتقدمة المستمرة، والبرامج الضارة، والتكنولوجيا، وجمع المعلومات الاستخباراتية البيانات الخام والرمزية متاحة. تتوفر كافة البيانات في مستودع GitHub هذا. [ بحاجة لمصدر ] طائر أسود
مجموعة بيانات تحديد اللغة الهجومية (OLID) البيانات متوفرة في موقع المشروع.

البيانات متاحة هنا أيضًا.

[367] زامبيري وآخرون.
تقارير سيبرانية من المركز الوطني للأمن السيبراني هذه البيانات لم تتم معالجتها مسبقًا. تقارير التهديدات، التقارير والاستشارات، الأخبار، المدونات، الخطب.

قائمة بديلة للتقارير.

[368]
تقارير APT من شركة Kaspersky هذه البيانات لم تتم معالجتها مسبقًا. [369]
السلك السيبراني هذه البيانات لم تتم معالجتها مسبقًا. النشرات الإخبارية والبودكاست والقصص. [370]
أخبار خروقات البيانات هذه البيانات لم تتم معالجتها مسبقًا. الأخبار، قائمة الأخبار من أغسطس 2022 إلى فبراير 2023 [371]
أخبار الإنترنت هذه البيانات لم تتم معالجتها مسبقًا. الأخبار، قائمة مختارة من الأخبار [372]
الكمبيوتر النازف هذه البيانات لم تتم معالجتها مسبقًا. أخبار [373]
السجل هذه البيانات لم تتم معالجتها مسبقًا. اخبار الجرائم الالكترونية [374]
هاكر ريد هذه البيانات لم تتم معالجتها مسبقًا. اخبار القرصنة [375]
قائمة آمنة هذه البيانات لم تتم معالجتها مسبقًا. تقارير APT، الأرشيف، تقارير DDOS، الحوادث، نشرة Kaspersky الأمنية، التهديدات الصناعية، تقارير البرامج الضارة، الآراء، المنشورات، الأبحاث، وSAS. [376]
مشروع الجص يقوم مشروع Stucco بجمع البيانات التي لا يتم دمجها عادةً في أنظمة الأمان. هذه البيانات ليست معالجة مسبقًا موقع المشروع على شبكة الإنترنت مع معلومات البيانات المصدر الذي تمت مراجعته مع روابط لمصادر البيانات [377]
الأمن البصري موقع ويب يحتوي على معلومات تقنية وتقارير والمزيد حول مواضيع الأمان. هذه البيانات ليست معالجة مسبقًا المعلومات التقنية والأبحاث والتقارير. [378]
شناير موقع يحتوي على أوراق أكاديمية حول مواضيع أمنية. هذه البيانات ليست معالجة مسبقًا الأوراق حسب الفئة، أرشيف الأوراق حسب التاريخ. [379]
تريندميكرو موقع يحتوي على أبحاث وأخبار ووجهات نظر حول مواضيع أمنية. هذه البيانات ليست معالجة مسبقًا قائمة تمت مراجعتها لأبحاث Trendmicro والأخبار والآراء. [380]
أخبار الهاكر أخبار حول مواضيع الأمن السيبراني. هذه البيانات ليست معالجة مسبقًا أخبار عن انتهاكات البيانات والهجمات الإلكترونية والثغرات الأمنية والبرامج الضارة. [381]
كريبسون سيكيوريتي أخبار الأمن والتحقيقات هذه البيانات ليست معالجة مسبقًا قائمة مختارة من الأخبار [382]
ميتري الدفاع مصفوفة من القطع الأثرية الدفاعية ملفات json [383]
أطلس ميتري Mitre Atlas هي قاعدة معرفية لتكتيكات الخصم وتقنياته ودراسات الحالة لأنظمة التعلم الآلي (ML) استنادًا إلى الملاحظات في العالم الحقيقي. هذه البيانات ليست معالجة مسبقًا [384]
ميتري إنجيج MITRE Engage هو إطار عمل للتخطيط ومناقشة عمليات إشراك الخصوم والذي يمكّنك من إشراك خصومك وتحقيق أهدافك المتعلقة بالأمن السيبراني. هذه البيانات ليست معالجة مسبقًا [385]
دروس الاختراق هذه البيانات ليست معالجة مسبقًا [386]

المناخ والاستدامة

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
تقارير لجنة الإفصاح المالي المتعلقة بالمناخ قاعدة بيانات لتقارير الشركات التي تتضمن إفصاحات متعلقة بـ TCFD. هذه البيانات ليست معالجة مسبقًا رابط مباشر للتقاريرقائمة مختارة من التقارير [387] مركز معرفة TCFD
تقارير المسؤولية الاجتماعية للشركات قائمة تقارير المسؤولية على شبكة الإنترنت. هذه البيانات ليست معالجة مسبقًا قائمة التقارير المنسقة [388] تقارير المسئولية
الهيئة الحكومية الدولية المعنية بتغير المناخ (IPCC) مجموعة من تقارير التقييم الشاملة حول المعرفة المتعلقة بتغير المناخ وأسبابه وتأثيراته المحتملة وخيارات الاستجابة هذه البيانات ليست معالجة مسبقًا التقاريرقائمة مختارة من التقارير [389] اللجنة الدولية للتغيرات المناخية
التحالف من أجل البحوث حول الاستدامة المؤسسية هذه البيانات ليست معالجة مسبقًا قائمة مختارة من منشورات المدونة [390] أركس
مجموعة ESG: مركز المعرفة للمحاسبة من أجل الاستدامة هذه البيانات ليست معالجة مسبقًا أدلة ودراسات حالة ومدونات وتقارير واستطلاعات. [391] ميهرا وآخرون.
حمى المناخ مجموعة بيانات تتبنى منهجية FEVER وتتكون من 1535 ادعاءً حقيقيًا بشأن تغير المناخ تم جمعها على الإنترنت. يرافق كل ادعاء خمس جمل أدلة مُعلقة يدويًا تم استردادها من ويكيبيديا الإنجليزية والتي تدعم أو تدحض أو لا تقدم معلومات كافية للتحقق من صحة الادعاء، ويبلغ مجموعها 7675 زوجًا من الادعاء والدليل. [392] مجموعة بيانات بطاقة HF، ومستودع GitHub الخاص بالمشروع. [393] ديجلمان وآخرون.
مجموعة بيانات أخبار المناخ مجموعة بيانات للباحثين في مجال معالجة اللغة الطبيعية ووسائل الإعلام الخاصة بتغير المناخ تتكون مجموعة البيانات من عدد من عناصر البيانات (ملفات نصية بتنسيق JSON وJSONL وCSV وقاعدة بيانات SQLite) قاعدة بيانات أخبار المناخ، مستودع GitHub الخاص بالمشروع [394] كفاءة ADGE
كلايمتكست Climatext هي مجموعة بيانات للكشف عن موضوعات تغير المناخ استنادًا إلى الجملة. مجموعة بيانات التردد العالي [395] جامعة زيورخ
جرين بيز مجموعة من المقالات والأخبار حول المناخ والاستدامة هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المقالات حول المناخقائمة مختارة من المقالات حول الاستدامة [396]
أفضل الأبحاث المسبقة في مجال المناخ والاستدامة قائمة المطبوعات المسبقة للباحثين في قائمة رويترز الساخنة هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المطبوعات المسبقة [397] موريس تامان
أركس هذه البيانات ليست معالجة مسبقًا قائمة مختارة من مدونات الاستدامة المؤسسية [398]
جرين بيز موقع يحتوي على مقالات حول المناخ والاستدامة هذه البيانات ليست معالجة مسبقًا [399] جرين بيز
سي إس آر واير هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المقالات [400] سي إس آر واير
مركز بيانات العملاء مقالات عن المناخ والمياه والغابات هذه البيانات ليست معالجة مسبقًا [401] مركز بيانات العملاء

بيانات الكود

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
المكدس مجموعة بيانات بحجم 3.1 تيرابايت تتكون من كود مصدر مرخص بـ 30 لغة برمجة. تم تصفيته من خلال اكتشاف الترخيص وإزالة التكرار. 6 تيرابايت، 51.76 بايت ملف (قبل إزالة التكرار)؛ 3 تيرابايت، 5.28 بايت ملف (بعد). 358 لغة برمجة. باركيه نمذجة اللغة، الإكمال التلقائي، توليف البرامج. 2022 [402] [403] D. Kocetkov، R. Li، L. Ben Allal، L. von Werra، H. de Vries
مستودعات GitHub هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المستودعات من GitHub : 61 62 63 64 65 66 67 68 69 70 71، 72، 73، 74، 75، 76، 77 101
مستودعات IBM العامة على GitHub هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المستودعات من GitHub
مستودعات RedHat العامة على GitHub هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المستودعات من GitHub
ملفات أرشيف StackExchange Public Archive.org هذه البيانات ليست معالجة مسبقًا قائمة مختارة من الملفات من Archive.org
مستودعات Gitlab العامة هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المستودعات من Gitlab : 1 2
مستودعات Ansible Collections العامة هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المستودعات من GitHub .
مجموعة بيانات كود GitHub الخاصة بـ CodeParrot هذه البيانات ليست معالجة مسبقًا قائمة مختارة من المستودعات من Hugging Face : 1 2 3 4 5 6 7 8 9 10
أوكد التوزيع المجتمعي لـ Kubernetes الذي يدعم Red Hat OpenShift هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
أوبن شفت توزيع Kubernetes الصديق للمطورين والعمليات قائمة مستودعات GitHub للمشروع
كوبيرنيتس هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مطور ريد هات GitHub موطن برنامج Red Hat Developer هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
القبعة الحمراء

ورش العمل

هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مجموعات الاهتمامات الخاصة بـ Kubernetes هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
ناقل هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
سوق ريد هات هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مدونة ريدهات هذه البيانات ليست معالجة مسبقًا [404]
كوبيرنيتيس io هذه البيانات ليست معالجة مسبقًا [405]
مستندات Openshift هذه البيانات ليست معالجة مسبقًا [406]
سي إن سي إف أي أو هذه البيانات ليست معالجة مسبقًا [407]
عروض تقديمية لـ Kubernetes قائمة العروض التقديمية المتاحة للعامة حول Kubernetes هذه البيانات ليست معالجة مسبقًا رابط البيانات
مختبرات الابتكار المفتوحة لشركة Red Hat هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
عروض توضيحية لشركة Red Hat هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
ريد هات أوبن شيفت أونلاين هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مجموعات البرامج هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
رؤى ريد هات هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
حكومة ريد هات هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
استشارات ريد هات هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مجتمعات الممارسة لشركة Red Hat هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
شريك التكنولوجيا في شركة Red Hat هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
توثيقات ريد هات هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
آي بي إم هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
سحابة آي بي إم هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
بناء فريق المختبر هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
وحدات Terraform IBM هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مخططات السحابة هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
عروض OCP Power هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
تحديث تطبيقات IBM  هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مركز تشغيل Kubernetes  هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مؤسسة الحوسبة السحابية الأصلية (CNCF)  هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
إطار عمل المشغل هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع [408]
مستودعات GitHub المشار إليها في artifacthub.io هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub في artifacthub.io
مجتمعات الممارسة لشركة Red Hat هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
شريك ريد هات هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مستودعات IBM هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
بناء فريق المختبر هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
إطار عمل المشغل هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مستودعات GitHub هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
القبعة الحمراء هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
أنماط Kubernetes هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
أنماط نشر وأمان Kubernetes هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
Kubernetes للمطورين ذوي البرامج الكاملة هذه البيانات ليست معالجة مسبقًا قائمة مستودعات GitHub للمشروع
مقاييس Load Balancer Cloudwatch هذه البيانات ليست معالجة مسبقًا مستودع GitHub للمشروع
ديناتريس هذه البيانات ليست معالجة مسبقًا [5]
بيانات تحدي AIOps 2020 هذه البيانات ليست معالجة مسبقًا مستودع GitHub للمشروع
لوغوب هذه البيانات ليست معالجة مسبقًا قائمة المستودعات
صفحات HTML هذه البيانات ليست معالجة مسبقًا قائمة صفحات HTML
كتب إلكترونية مفتوحة المصدر هذه البيانات ليست معالجة مسبقًا [409]
كتب إلكترونية عن Kubernetes هذه البيانات ليست معالجة مسبقًا أنماط Kubernetes، ونشر Kubernetes، وKubernetes للمطورين ذوي البرامج الكاملة
Kubernetes للمطورين ذوي البرامج الكاملة هذه البيانات ليست معالجة مسبقًا Kubernetes للمطورين ذوي البرامج الكاملة
قائمة مستودعات Github العامة والمرخصة هذه البيانات ليست معالجة مسبقًا قائمة المستودعات

البيانات المتعددة المتغيرات

مالي

اسم مجموعة البيانات وصف موجز المعالجة المسبقة الحالات شكل المهمة الافتراضية تم الإنشاء (تم التحديث) مرجع الخالق
مؤشر داو جونز بيانات أسبوعية للأسهم للربع الأول والثاني من عام 2011. تم تضمين القيم المحسوبة مثل النسبة المئوية للتغيير والتأخيرات. 750 القيم المنفصلة بفاصلة التصنيف، الانحدار، السلاسل الزمنية 2014 [410] [411] م. براون وآخرون.
Statlog (الموافقة على الائتمان الأسترالي) طلبات بطاقات الائتمان المقبولة أو المرفوضة والسمات المتعلقة بالتطبيق. تم إزالة أسماء السمات بالإضافة إلى معلومات التعريف. وتمت إعادة تسمية العوامل. 690 القيم المنفصلة بفاصلة تصنيف 1987 [412] [413] ر. كوينلان
بيانات مزاد eBay بيانات المزادات من مختلف العناصر الموجودة على موقع eBay.com على مدى مزادات مختلفة المدة يحتوي على جميع العطاءات، ومعرف مقدم العطاء، وأوقات العطاءات، وأسعار الافتتاح. ~ 550 نص الانحدار والتصنيف 2012 [414] [415] ج. شمويل وآخرون.
Statlog (بيانات الائتمان الألمانية) تصنيف الائتمان الثنائي إلى "جيد" أو "سيئ" مع العديد من الميزات يتم تقديم الميزات المالية المختلفة لكل شخص. 690 نص تصنيف 1994 [416] ح. هوفمان
مجموعة بيانات التسويق المصرفي بيانات من حملة تسويقية كبيرة قام بها بنك كبير. يتم ذكر العديد من صفات العملاء الذين تم الاتصال بهم، كما يتم ذكر ما إذا كان العميل مشتركًا في البنك. 45,211 نص تصنيف 2012 [417] [418] س. مورو وآخرون.
مجموعة بيانات بورصة اسطنبول تم تتبع العديد من مؤشرات الأسهم لمدة عامين تقريبًا. لا أحد. 536 نص التصنيف والانحدار 2013 [419] [420] أو. أكبيلجيك
تخلف عملاء بطاقات الائتمان عن السداد بيانات التخلف عن سداد الائتمان للدائنين التايوانيين. يتم تقديم ميزات مختلفة لكل حساب. 30,000 نص تصنيف 2016 [421] [422] أنا. يه
ستوك نت التنبؤ بحركة الأسهم من خلال التغريدات وأسعار الأسهم التاريخية لا أحد نص البرمجة اللغوية العصبية 2018 [423] Yumo Xu and Shay B. Cohen

Weather

Dataset Name Brief description Preprocessing Instances Format Default Task Created (updated) Reference Creator
Cloud DataSet Data about 1024 different clouds. Image features extracted. 1024 Text Classification, clustering 1989 [424] P. Collard
El Nino Dataset Oceanographic and surface meteorological readings taken from a series of buoys positioned throughout the equatorial Pacific. 12 weather attributes are measured at each buoy. 178080 Text Regression 1999 [425] Pacific Marine Environmental Laboratory
Greenhouse Gas Observing Network Dataset Time-series of greenhouse gas concentrations at 2921 grid cells in California created using simulations of the weather. None. 2921 Text Regression 2015 [426] D. Lucas
Atmospheric CO2 from Continuous Air Samples at Mauna Loa Observatory Continuous air samples in Hawaii, USA. 44 years of records. None. 44 years Text Regression 2001 [427] Mauna Loa Observatory
Ionosphere Dataset Radar data from the ionosphere. Task is to classify into good and bad radar returns. Many radar features given. 351 Text Classification 1989 [283][428] Johns Hopkins University
Ozone Level Detection Dataset Two ground ozone level datasets. Many features given, including weather conditions at time of measurement. 2536 Text Classification 2008 [429][430] K. Zhang et al.

Census

Dataset Name Brief description Preprocessing Instances Format Default Task Created (updated) Reference Creator
Adult Dataset Census data from 1994 containing demographic features of adults and their income. Cleaned and anonymized. 48,842 Comma separated values Classification 1996 [431] United States Census Bureau
Census-Income (KDD) Weighted census data from the 1994 and 1995 Current Population Surveys. Split into training and test sets. 299,285 Comma separated values Classification 2000 [432][433] United States Census Bureau
IPUMS Census Database Census data from the Los Angeles and Long Beach areas. None 256,932 Text Classification, regression 1999 [434] IPUMS
US Census Data 1990 Partial data from 1990 US census. Results randomized and useful attributes selected. 2,458,285 Text Classification, regression 1990 [435] United States Census Bureau

Transit

Dataset Name Brief description Preprocessing Instances Format Default Task Created (updated) Reference Creator
Bike Sharing Dataset Hourly and daily count of rental bikes in a large city. Many features, including weather, length of trip, etc., are given. 17,389 Text Regression 2013 [436][437] H. Fanaee-T
New York City Taxi Trip Data Trip data for yellow and green taxis in New York City. Gives pick up and drop off locations, fares, and other details of trips. 6 years Text Classification, clustering 2015 [438] New York City Taxi and Limousine Commission
Taxi Service Trajectory ECML PKDD Trajectories of all taxis in a large city. Many features given, including start and stop points. 1,710,671 Text Clustering, causal-discovery 2015 [439][440] M. Ferreira et al.
METR-LA Speed from loop detectors in the highway of Los Angeles County. Average speed in 5 minutes timesteps. 7,094,304 from 207 sensors and 34,272 timesteps Comma separated values Regression, Forecasting 2014 [441] Jagadish et al.
PeMS Speed, flow, occupancy and other metrics from loop detectors and other sensors in the freeway of the State of California, U.S.A.. Metric usually aggregated via Average into 5 minutes timesteps. 39,000 individual detectors, each containing years of timeseries Comma separated values Regression, Forecasting, Nowcasting, Interpolation (updated realtime) [442] California Department of Transportation

Internet

Dataset Name Brief description Preprocessing Instances Format Default Task Created (updated) Reference Creator
Webpages from Common Crawl 2012 Large collection of webpages and how they are connected via hyperlinks None. 3.5B Text clustering, classification 2013 [443] V. Granville
Internet Advertisements Dataset Dataset for predicting if a given image is an advertisement or not. Features encode geometry of ads and phrases occurring in the URL. 3279 Text Classification 1998 [444][445] N. Kushmerick
Internet Usage Dataset General demographics of internet users. None. 10,104 Text Classification, clustering 1999 [446] D. Cook
URL Dataset 120 days of URL data from a large conference. Many features of each URL are given. 2,396,130 Text Classification 2009 [447][448] J. Ma
Phishing Websites Dataset Dataset of phishing websites. Many features of each site are given. 2456 Text Classification 2015 [449] R. Mustafa et al.
Online Retail Dataset Online transactions for a UK online retailer. Details of each transaction given. 541,909 Text Classification, clustering 2015 [450] D. Chen
Freebase Simple Topic Dump Freebase is an online effort to structure all human knowledge. Topics from Freebase have been extracted. large Text Classification, clustering 2011 [451][452] Freebase
Farm Ads Dataset The text of farm ads from websites. Binary approval or disapproval by content owners is given. SVMlight sparse vectors of text words in ads calculated. 4143 Text Classification 2011 [453][454] C. Masterharm et al.
The Pile Assembling several large datasets of diverse and unstructured texts Various (removing HTML and Javascript from websites, removing duplicated sentences) 825 GiB English text JSON Lines[455][456] Natural Language Processing, Text Prediction 2021 [457][455] Gao et al.
OSCAR Large collection of monolingual corpora extracted from web data (Common Crawl dumps) covering 150+ languages Various (filtering, language classification, adult-content detection and other labelling) 3.4 TB English text, 1.4 TB Chinese text, 1.1 TB Russian text, 595 MB German text, 431 MB French text, and data for 150+ languages (figures for version 23.01) JSON Lines[458] Natural Language Processing, Text Prediction 2021 [459][460] Ortiz Suarez, Abadji, Sagot et al.
OpenWebText An open-source recreation of the WebText corpus. The text is web content extracted from URLs shared on Reddit with at least three upvotes. Extracted non-HTML content, deduplicated, and tokenized. 8,013,769 Documents, 38GB Text Natural Language Processing, Text Prediction 2019 [461][462] A. Gokaslan, V. Cohen
ROOTS A well-documented and representative multilingual dataset with the explicit goal of doing good for and by the people whose data was collected. Extracted non-HTML content, cleaned out UI and ads, deduplicated, removed PII, and tokenized. 1.6 TB, 59 languages. Parquet Natural Language Processing, Text Prediction 2022 [463][464] H. Laurençon, L. Saulnier, T. Wang, C. Akiki, A. Villanova del Moral, T. Le Scao

Games

Dataset Name Brief description Preprocessing Instances Format Default Task Created (updated) Reference Creator
Poker Hand Dataset 5 card hands from a standard 52 card deck. Attributes of each hand are given, including the Poker hands formed by the cards it contains. 1,025,010 Text Regression, classification 2007 [465] R. Cattral
Connect-4 Dataset Contains all legal 8-ply positions in the game of connect-4 in which neither player has won yet, and in which the next move is not forced. None. 67,557 Text Classification 1995 [466] J. Tromp
Chess (King-Rook vs. King) Dataset Endgame Database for White King and Rook against Black King. None. 28,056 Text Classification 1994 [467][468] M. Bain et al.
Chess (King-Rook vs. King-Pawn) Dataset King+Rook versus King+Pawn on a7. None. 3196 Text Classification 1989 [469] R. Holte
Tic-Tac-Toe Endgame Dataset Binary classification for win conditions in tic-tac-toe. None. 958 Text Classification 1991 [470] D. Aha

Other multivariate

Dataset Name Brief description Preprocessing Instances Format Default Task Created (updated) Reference Creator
Housing Data Set Median home values of Boston with associated home and neighborhood attributes. None. 506 Text Regression 1993 [471] D. Harrison et al.
The Getty Vocabularies structured terminology for art and other material culture, archival materials, visual surrogates, and bibliographic materials. None. large Text Classification 2015 [472] Getty Center
Yahoo! Front Page Today Module User Click Log User click log for news articles displayed in the Featured Tab of the Today Module on Yahoo! Front Page. Conjoint analysis with a bilinear model. 45,811,883 user visits Text Regression, clustering 2009 [473][474] Chu et al.
British Oceanographic Data Centre Biological, chemical, physical and geophysical data for oceans. 22K variables tracked. Various. 22K variables, many instances Text Regression, clustering 2015 [475] British Oceanographic Data Centre
Congressional Voting Records Dataset Voting data for all USA representatives on 16 issues. Beyond the raw voting data, various other features are provided. 435 Text Classification 1987 [476] J. Schlimmer
Entree Chicago Recommendation Dataset Record of user interactions with Entree Chicago recommendation system. Details of each user's usage of the app are recorded in detail. 50,672 Text Regression, recommendation 2000 [477] R. Burke
Insurance Company Benchmark (COIL 2000) Information on customers of an insurance company. Many features of each customer and the services they use. 9,000 Text Regression, classification 2000 [478][479] P. van der Putten
Nursery Dataset Data from applicants to nursery schools. Data about applicant's family and various other factors included. 12,960 Text Classification 1997 [480][481] V. Rajkovic et al.
University Dataset Data describing attributed of a large number of universities. None. 285 Text Clustering, classification 1988 [482] S. Sounders et al.
Blood Transfusion Service Center Dataset Data from blood transfusion service center. Gives data on donors return rate, frequency, etc. None. 748 Text Classification 2008 [483][484] I. Yeh
Record Linkage Comparison Patterns Dataset Large dataset of records. Task is to link relevant records together. Blocking procedure applied to select only certain record pairs. 5,749,132 Text Classification 2011 [485][486] University of Mainz
Nomao Dataset Nomao collects data about places from many different sources. Task is to detect items that describe the same place. Duplicates labeled. 34,465 Text Classification 2012 [487][488] Nomao Labs
Movie Dataset Data for 10,000 movies. Several features for each movie are given. 10,000 Text Clustering, classification 1999 [489] G. Wiederhold
Open University Learning Analytics Dataset Information about students and their interactions with a virtual learning environment. None. ~ 30,000 Text Classification, clustering, regression 2015 [490][491] J. Kuzilek et al.
Mobile phone records Telecommunications activity and interactions Aggregation per geographical grid cells and every 15 minutes. large Text Classification, Clustering, Regression 2015 [492] G. Barlacchi et al.

Curated repositories of datasets

As datasets come in myriad formats and can sometimes be difficult to use, there has been considerable work put into curating and standardizing the format of datasets to make them easier to use for machine learning research.

  • OpenML:[493] Web platform with Python, R, Java, and other APIs for downloading hundreds of machine learning datasets, evaluating algorithms on datasets, and benchmarking algorithm performance against dozens of other algorithms.
  • PMLB:[494] A large, curated repository of benchmark datasets for evaluating supervised machine learning algorithms. Provides classification and regression datasets in a standardized format that are accessible through a Python API.
  • Metatext NLP: https://metatext.io/datasets web repository maintained by community, containing nearly 1000 benchmark datasets, and counting. Provides many tasks from classification to QA, and various languages from English, Portuguese to Arabic.
  • Appen: Off The Shelf and Open Source Datasets hosted and maintained by the company. These biological, image, physical, question answering, signal, sound, text, and video resources number over 250 and can be applied to over 25 different use cases.[495][496]

See also

References

  1. ^ Wissner-Gross, A. "Datasets Over Algorithms". Edge.com. Retrieved 8 January 2016.
  2. ^ Weiss, G. M.; Provost, F. (October 2003). "Learning When Training Data are Costly: The Effect of Class Distribution on Tree Induction". Journal of Artificial Intelligence Research. 19: 315–354. doi:10.1613/jair.1199.
  3. ^ Abney, Steven (2007). Semisupervised Learning for Computational Linguistics. CRC Press. ISBN 978-1-4200-1080-0.[page needed]
  4. ^ Žliobaitė, Indrė; Bifet, Albert; Pfahringer, Bernhard; Holmes, Geoff (2011). "Active Learning with Evolving Streaming Data". Machine Learning and Knowledge Discovery in Databases. Lecture Notes in Computer Science. Vol. 6913. pp. 597–612. doi:10.1007/978-3-642-23808-6_39. ISBN 978-3-642-23807-9.
  5. ^ James Bennett; Stan Lanning (12 August 2007). "The Netflix Prize" (PDF). Proceedings of KDD Cup and Workshop 2007. Archived from the original (PDF) on 27 September 2007. Retrieved 25 August 2007.
  6. ^ McAuley, Julian; Targett, Christopher; Shi, Qinfeng; Anton van den Hengel (2015). "Image-based Recommendations on Styles and Substitutes". arXiv:1506.04757 [cs.CV].
  7. ^ "Amazon review data". nijianmo.github.io. Retrieved 8 October 2021.
  8. ^ Ganesan, Kavita; Zhai, Chengxiang (2012). "Opinion-based entity ranking". Information Retrieval. 15 (2): 116–150. doi:10.1007/s10791-011-9174-8. hdl:2142/15252. S2CID 16258727.
  9. ^ Lv, Yuanhua; Lymberopoulos, Dimitrios; Wu, Qiang (2012). "An exploration of ranking heuristics in mobile local search". Proceedings of the 35th international ACM SIGIR conference on Research and development in information retrieval. pp. 295–304. doi:10.1145/2348283.2348325. ISBN 978-1-4503-1472-5.
  10. ^ Harper, F. Maxwell; Konstan, Joseph A. (2015). "The MovieLens Datasets: History and Context". ACM Transactions on Interactive Intelligent Systems. 5 (4): 19. doi:10.1145/2827872. S2CID 16619709.
  11. ^ Koenigstein, Noam; Dror, Gideon; Koren, Yehuda (2011). "Yahoo! Music recommendations: Modeling music ratings with temporal dynamics and item taxonomy". Proceedings of the fifth ACM conference on Recommender systems. pp. 165–172. doi:10.1145/2043932.2043964. ISBN 978-1-4503-0683-6.
  12. ^ McFee, Brian; Bertin-Mahieux, Thierry; Ellis, Daniel P.W.; Lanckriet, Gert R.G. (2012). "The million song dataset challenge". Proceedings of the 21st International Conference on World Wide Web. pp. 909–916. doi:10.1145/2187980.2188222. ISBN 978-1-4503-1230-1.
  13. ^ Bohanec, Marko, and Vladislav Rajkovic. "Knowledge acquisition and explanation for multi-attribute decision making." 8th Intl Workshop on Expert Systems and their Applications. 1988.
  14. ^ Tan, Peter J., and David L. Dowe. "MML inference of decision graphs with multi-way joins." Australian Joint Conference on Artificial Intelligence. 2002.
  15. ^ "Quantifying comedy on YouTube: why the number of o's in your LOL matter". Metatext NLP Database. Retrieved 26 October 2020.
  16. ^ Kim, Byung Joo (2012). "A Classifier for Big Data". Convergence and Hybrid Information Technology. Communications in Computer and Information Science. Vol. 310. pp. 505–512. doi:10.1007/978-3-642-32692-9_63. ISBN 978-3-642-32691-2.
  17. ^ Pérezgonzález, Jose D.; Gilbey, Andrew (2011). "Predicting Skytrax airport rankings from customer reviews". Journal of Airport Management. 5 (4): 335–339. doi:10.69554/RFZC4321.
  18. ^ Loh, Wei-Yin, and Yu-Shan Shih. "Split selection methods for classification trees." Statistica sinica(1997): 815–840.
  19. ^ Lim, Tjen-Sien; Loh, Wei-Yin; Shih, Yu-Shan (2000). "A comparison of prediction accuracy, complexity, and training time of thirty-three old and new classification algorithms". Machine Learning. 40 (3): 203–228. doi:10.1023/a:1007608224229. S2CID 17030953.
  20. ^ Nguyen, Kiet Van; Nguyen, Vu Duc; Nguyen, Phu X. V.; Truong, Tham T. H.; Nguyen, Ngan Luu-Thuy (2018). "UIT-VSFC: Vietnamese Students' Feedback Corpus for Sentiment Analysis". 2018 10th International Conference on Knowledge and Systems Engineering (KSE). pp. 19–24. doi:10.1109/KSE.2018.8573337. ISBN 978-1-5386-6113-0.
  21. ^ Ho, Vong Anh; Nguyen, Duong Huynh-Cong; Nguyen, Danh Hoang; Pham, Linh Thi-Van; Nguyen, Duc-Vu; Nguyen, Kiet Van; Nguyen, Ngan Luu-Thuy (2020). "Emotion Recognition for Vietnamese Social Media Text". Computational Linguistics. Communications in Computer and Information Science. Vol. 1215. pp. 319–333. arXiv:1911.09339. doi:10.1007/978-981-15-6168-9_27. ISBN 978-981-15-6167-2. S2CID 208202333.
  22. ^ Nhung Thi-Hong Nguyen, Phuong Ha-Dieu Phan, Luan Thanh Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen (24 April 2021). "Vietnamese Open-domain Complaint Detection in E-Commerce Websites". arXiv:2104.11969 [cs.CL].{{cite arXiv}}: CS1 maint: multiple names: authors list (link)
  23. ^ Phu Gia Hoang, Canh Duc Luu, Khanh Quoc Tran, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen (26 January 2023). "ViHOS: Hate Speech Spans Detection for Vietnamese". arXiv:2301.10186 [cs.CL].{{cite arXiv}}: CS1 maint: multiple names: authors list (link)
  24. ^ Dermouche, Mohamed; Velcin, Julien; Khouas, Leila; Loudcher, Sabine (2014). "A Joint Model for Topic-Sentiment Evolution over Time". 2014 IEEE International Conference on Data Mining. IEEE. pp. 773–778. doi:10.1109/icdm.2014.82. ISBN 978-1-4799-4302-9.
  25. ^ Rose, Tony; Stevenson, Mark; Whitehead, Miles (2002). "The Reuters Corpus Volume 1-from Yesterday's News to Tomorrow's Language Resources". LREC. 2. S2CID 9239414.
  26. ^ Amini, Massih R.; Usunier, Nicolas; Goutte, Cyril (2009). "Learning from Multiple Partially Observed Views – an Application to Multilingual Text Categorization". Advances in Neural Information Processing Systems. 22: 28–36.
  27. ^ Liu, Ming; et al. (2015). "VRCA: a clustering algorithm for massive amount of texts". Proceedings of the 24th International Conference on Artificial Intelligence. AAAI Press. Archived from the original on 5 November 2021. Retrieved 6 August 2019.
  28. ^ Al-Harbi, S; Almuhareb, A; Al-Thubaity, A; Khorsheed, M. S.; Al-Rajeh, A (2008). "Automatic Arabic Text Classification". Proceedings of the 9th International Conference on the Statistical Analysis of Textual Data, Lyon, France.
  29. ^ "Relationship and Entity Extraction Evaluation Dataset: Dstl/re3d". GitHub. 17 December 2018.
  30. ^ "The Examiner – SpamClickBait Catalogue".
  31. ^ "A Million News Headlines".
  32. ^ "One Week of Global News Feeds".
  33. ^ Kulkarni, Rohit (2018), Reuters News-Wire Archive, Harvard Dataverse, doi:10.7910/DVN/XDB74W
  34. ^ "IrishTimes – the Waxy-Wany News".
  35. ^ "News Headlines Dataset For Sarcasm Detection". kaggle.com. Retrieved 27 April 2019.
  36. ^ Klimt, Bryan, and Yiming Yang. "Introducing the Enron Corpus." CEAS. 2004.
  37. ^ Kossinets, Gueorgi; Kleinberg, Jon; Watts, Duncan (2008). "The Structure of Information Pathways in a Social Communication Network". arXiv:0806.3201 [physics.soc-ph].
  38. ^ Androutsopoulos, Ion; Koutsias, John; Chandrinos, Konstantinos V.; Paliouras, George; Spyropoulos, Constantine D. (2000). "An evaluation of Naive Bayesian anti-spam filtering". In Potamias, G.; Moustakis, V.; van Someren, M. (eds.). Proceedings of the Workshop on Machine Learning in the New Information Age. 11th European Conference on Machine Learning, Barcelona, Spain. Vol. 11. pp. 9–17. arXiv:cs/0006013. Bibcode:2000cs........6013A.
  39. ^ Bratko, Andrej; et al. (2006). "Spam filtering using statistical data compression models" (PDF). The Journal of Machine Learning Research. 7: 2673–2698.
  40. ^ Almeida, Tiago A., José María G. Hidalgo, and Akebo Yamakami. "Contributions to the study of SMS spam filtering: new collection and results."Proceedings of the 11th ACM symposium on Document engineering. ACM, 2011.
  41. ^ Delany; Jane, Sarah; Buckley, Mark; Greene, Derek (2012). "SMS spam filtering: methods and data". Expert Systems with Applications. 39 (10): 9899–9908. doi:10.1016/j.eswa.2012.02.053. S2CID 15546924.
  42. ^ Joachims, Thorsten. A Probabilistic Analysis of the Rocchio Algorithm with TFIDF for Text Categorization. No. CMU-CS-96-118. Carnegie-mellon univ pittsburgh pa dept of computer science, 1996.
  43. ^ Dimitrakakis, Christos, and Samy Bengio. Online Policy Adaptation for Ensemble Algorithms. No. EPFL-REPORT-82788. IDIAP, 2002.
  44. ^ Dooms, S. et al. "Movietweetings: a movie rating dataset collected from twitter, 2013. Available from https://github.com/sidooms/MovieTweetings."
  45. ^ RoyChowdhury, Aruni; Lin, Tsung-Yu; Maji, Subhransu; Learned-Miller, Erik (2017). "Twitter100k: A Real-world Dataset for Weakly Supervised Cross-Media Retrieval". arXiv:1703.06618 [cs.CV].
  46. ^ "huyt16/Twitter100k". GitHub. Retrieved 26 March 2018.
  47. ^ Go, Alec; Bhayani, Richa; Huang, Lei (2009). "Twitter sentiment classification using distant supervision". CS224N Project Report, Stanford. 1: 12.
  48. ^ Chikersal, Prerna, Soujanya Poria, and Erik Cambria. "SeNTU: sentiment analysis of tweets by combining a rule-based classifier with supervised learning." Proceedings of the International Workshop on Semantic Evaluation, SemEval. 2015.
  49. ^ Zafarani, Reza, and Huan Liu. "Social computing data repository at ASU." School of Computing, Informatics and Decision Systems Engineering, Arizona State University (2009).
  50. ^ Data Science Course by DataTrained Education "IBM Certified Data Science Course." IBM Certified Online Data Science Course
  51. ^ McAuley, Julian J.; Leskovec, Jure. "Learning to Discover Social Circles in Ego Networks". NIPS. 2012: 2012.
  52. ^ Šubelj, Lovro; Fiala, Dalibor; Bajec, Marko (2014). "Network-based statistical comparison of citation topology of bibliographic databases". Scientific Reports. 4 (6496): 6496. arXiv:1502.05061. Bibcode:2014NatSR...4.6496S. doi:10.1038/srep06496. PMC 4178292. PMID 25263231.
  53. ^ Abdulla, N., et al. "Arabic sentiment analysis: Corpus-based and lexicon-based." Proceedings of the IEEE conference on Applied Electrical Engineering and Computing Technologies (AEECT). 2013.
  54. ^ Abooraig, Raddad; Al-Zu'bi, Shadi; Kanan, Tarek; Hawashin, Bilal; Al Ayoub, Mahmoud; Hmeidi, Ismail (June 2018). "Automatic categorization of Arabic articles based on their political orientation". Digital Investigation. 25: 24–41. doi:10.1016/j.diin.2018.04.003.
  55. ^ Kawala, François, et al. "Prédictions d'activité dans les réseaux sociaux en ligne." 4ième conférence sur les modèles et l'analyse des réseaux: Approches mathématiques et informatiques. 2013.
  56. ^ Sabharwal, Ashish; Samulowitz, Horst; Tesauro, Gerald (2015). "Selecting Near-Optimal Learners via Incremental Data Allocation". arXiv:1601.00024 [cs.LG].
  57. ^ Xu et al. "SemEval-2015 Task 1: Paraphrase and Semantic Similarity in Twitter (PIT)" Proceedings of the 9th International Workshop on Semantic Evaluation. 2015.
  58. ^ Xu et al. "Extracting Lexically Divergent Paraphrases from Twitter" Transactions of the Association for Computational (TACL). 2014.
  59. ^ Middleton, Stuart E; Middleton, Lee; Modafferi, Stefano (2014). "Real-Time Crisis Mapping of Natural Disasters Using Social Media" (PDF). IEEE Intelligent Systems. 29 (2): 9–17. doi:10.1109/MIS.2013.126. S2CID 15139204.
  60. ^ "geoparsepy". 2016. Python PyPI library
  61. ^ Shmueli, Boaz; Ku, Lun-Wei; Ray, Soumya (2020). "Reactive Supervision: A New Method for Collecting Sarcasm Data". Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP). Association for Computational Linguistics. pp. 2553–2559. doi:10.18653/v1/2020.emnlp-main.201. S2CID 221970454.
  62. ^ Shmueli, Boaz. "SPIRS Sarcasm Dataset". GitHub.
  63. ^ Gupta, Aakash (2020). "Dutch social media collection". COVID-19 Data Hub. doi:10.5072/FK2/MTPTL7. Retrieved 11 November 2023.
  64. ^ "Streamlit". huggingface.co. Retrieved 18 December 2020.
  65. ^ "Dutch Social media collection". kaggle.com. Retrieved 18 December 2020.
  66. ^ Shmueli, Boaz; Ray, Soumya; Lun-Wei (2021). "Happy Dance, Slow Clap: Using Reaction GIFs to Predict Induced Affect on Twitter". Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 2: Short Papers). Vol. Association for Computational Linguistics. As. pp. 395–401. doi:10.18653/v1/2021.acl-short.50. S2CID 235125510.
  67. ^ Shmueli, Boaz (5 May 2023), ReactionGIF, retrieved 6 October 2023
  68. ^ Forsyth, E., Lin, J., & Martell, C. (2008, June 25). The NPS Chat Corpus. Retrieved from http://faculty.nps.edu/cmartell/NPSChat.htm
  69. ^ Sordoni, Alessandro; Galley, Michel; Auli, Michael; Brockett, Chris; Ji, Yangfeng; Mitchell, Margaret; Nie, Jian-Yun; Gao, Jianfeng; Dolan, Bill (2015). "A Neural Network Approach to Context-Sensitive Generation of Conversational Responses". arXiv:1506.06714 [cs.CL].
  70. ^ Shaoul, C. & Westbury C. (2013) A reduced redundancy USENET corpus (2005–2011) Edmonton, AB: University of Alberta (downloaded from http://www.psych.ualberta.ca/~westburylab/downloads/usenetcorpus.download.html)
  71. ^ KAN, M. (2011, January). NUS Short Message Service (SMS) Corpus. Retrieved from http://www.comp.nus.edu.sg/entrepreneurship/innovation/osr/corpus/ Archived 29 June 2018 at the Wayback Machine
  72. ^ Stuck_In_the_Matrix. (2015, July 3). I have every publicly available Reddit comment for research. ~ 1.7 billion comments @ 250 GB compressed. Any interest in this? [Original post]. Message posted to https://www.reddit.com/r/datasets/comments/3bxlg7/i_have_every_publicly_available_reddit_comment/
  73. ^ Lowe, Ryan; Pow, Nissan; Serban, Iulian; Pineau, Joelle (2015). "The Ubuntu Dialogue Corpus: A Large Dataset for Research in Unstructured Multi-Turn Dialogue Systems". arXiv:1506.08909 [cs.CL].
  74. ^ Jason Williams Antoine Raux Matthew Henderson, "[1]", Dialogue & Discourse | April 2016 .
  75. ^ Hoppe, Travis (16 December 2021), The-Pile-FreeLaw, retrieved 11 January 2023
  76. ^ Zheng, Lucia; Guha, Neel; Anderson, Brandon R.; Henderson, Peter; Ho, Daniel E. (21 June 2021). "When does pretraining help?". Proceedings of the Eighteenth International Conference on Artificial Intelligence and Law. New York, NY, USA: ACM. pp. 159–168. doi:10.1145/3462757.3466088. ISBN 9781450385268. S2CID 233296302.
  77. ^ "pile-of-law/pile-of-law · Datasets at Hugging Face". huggingface.co. 4 July 2022. Retrieved 11 January 2023.
  78. ^ "About | Caselaw Access Project". case.law. Retrieved 11 January 2023.
  79. ^ K. Kowsari, D. E. Brown, M. Heidarysafa, K. Jafari Meimandi, M. S. Gerber and L. E. Barnes, "HDLTex: Hierarchical Deep Learning for Text Classification", 2017 16th IEEE International Conference on Machine Learning and Applications (ICMLA), pp. 364–371. doi:10.1109/ICMLA.2017.0-134
  80. ^ K. Kowsari, D. E. Brown, M. Heidarysafa, K. Jafari Meimandi, M. S. Gerber and L. E. Barnes, "Web of Science Dataset", doi:10.17632/9rw3vkcfy4.6
  81. ^ Galgani, Filippo, Paul Compton, and Achim Hoffmann. "Combining different summarization techniques for legal text." Proceedings of the Workshop on Innovative Hybrid Approaches to the Processing of Textual Data. Association for Computational Linguistics, 2012.
  82. ^ Nagwani, N. K. (2015). "Summarizing large text collection using topic modeling and clustering based on MapReduce framework". Journal of Big Data. 2 (1): 1–18. doi:10.1186/s40537-015-0020-5.
  83. ^ Schler, Jonathan; et al. (2006). "Effects of Age and Gender on Blogging" (PDF). AAAI Spring Symposium: Computational Approaches to Analyzing Weblogs. 6. Archived from the original (PDF) on 14 November 2020. Retrieved 6 August 2019.
  84. ^ Anand, Pranav, et al. "Believe Me-We Can Do This! Annotating Persuasive Acts in Blog Text."Computational Models of Natural Argument. 2011.
  85. ^ Traud, Amanda L., Peter J. Mucha, and Mason A. Porter. "Social structure of Facebook networks." Physica A: Statistical Mechanics and its Applications391.16 (2012): 4165–4180.
  86. ^ Richard, Emile; Savalle, Pierre-Andre; Vayatis, Nicolas (2012). "Estimation of Simultaneously Sparse and Low Rank Matrices". arXiv:1206.6474 [cs.DS].
  87. ^ Richardson, Matthew; Burges, Christopher JC; Renshaw, Erin (2013). "MCTest: A Challenge Dataset for the Open-Domain Machine Comprehension of Text". EMNLP. 1.
  88. ^ Weston, Jason; Bordes, Antoine; Chopra, Sumit; Rush, Alexander M.; Bart van Merriënboer; Joulin, Armand; Mikolov, Tomas (2015). "Towards AI-Complete Question Answering: A Set of Prerequisite Toy Tasks". arXiv:1502.05698 [cs.AI].
  89. ^ Marcus, Mitchell P.; Ann Marcinkiewicz, Mary; Santorini, Beatrice (1993). "Building a large annotated corpus of English: The Penn Treebank". Computational Linguistics. 19 (2): 313–330.
  90. ^ Collins, Michael (2003). "Head-driven statistical models for natural language parsing". Computational Linguistics. 29 (4): 589–637. doi:10.1162/089120103322753356.
  91. ^ Guyon, Isabelle, et al., eds. Feature extraction: foundations and applications. Vol. 207. Springer, 2008.
  92. ^ Lin, Yuri, et al. "Syntactic annotations for the google books ngram corpus." Proceedings of the ACL 2012 system demonstrations. Association for Computational Linguistics, 2012.
  93. ^ Krishnamoorthy, Niveda; et al. (2013). "Generating Natural-Language Video Descriptions Using Text-Mined Knowledge". AAAI. 1. Archived from the original on 6 August 2019. Retrieved 6 August 2019.
  94. ^ Luyckx, Kim; Daelemans, Walter (2008). "Personae: a corpus for author and personality prediction from text". Proceedings of LREC-2008, the Sixth International Language Resources and Evaluation Conference. hdl:10067/687330151162165141. ISBN 978-2-9517408-4-6.
  95. ^ Solorio, Thamar, Ragib Hasan, and Mainul Mizan. "A case study of sockpuppet detection in wikipedia." Workshop on Language Analysis in Social Media (LASM) at NAACL HLT. 2013.
  96. ^ "Pushshift Files". files.pushshift.io. Archived from the original on 12 January 2023. Retrieved 12 January 2023.
  97. ^ Baumgartner, Jason; Zannettou, Savvas; Keegan, Brian; Squire, Megan; Blackburn, Jeremy (23 January 2020). "The Pushshift Reddit Dataset". arXiv:2001.08435 [cs.SI].
  98. ^ Ciarelli, Patrick Marques; Oliveira, Elias (2009). "Agglomeration and Elimination of Terms for Dimensionality Reduction". 2009 Ninth International Conference on Intelligent Systems Design and Applications. pp. 547–552. doi:10.1109/ISDA.2009.9. ISBN 978-1-4244-4735-0.
  99. ^ Zhou, Mingyuan; Padilla, Oscar Hernan Madrid; Scott, James G. (2 July 2016). "Priors for Random Count Matrices Derived from a Family of Negative Binomial Processes". Journal of the American Statistical Association. 111 (515): 1144–1156. arXiv:1404.3331. doi:10.1080/01621459.2015.1075407.
  100. ^ Kotzias, Dimitrios, et al. "From group to individual labels using deep features." Proceedings of the 21th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. ACM, 2015.
  101. ^ Ning, Yue; Muthiah, Sathappan; Rangwala, Huzefa; Ramakrishnan, Naren (2016). "Modeling Precursors for Event Forecasting via Nested Multi-Instance Learning". arXiv:1602.08033 [cs.SI].
  102. ^ Buza, Krisztian. "Feedback prediction for blogs."Data analysis, machine learning and knowledge discovery. Springer International Publishing, 2014. 145–152.
  103. ^ Soysal, Ömer M (2015). "Association rule mining with mostly associated sequential patterns". Expert Systems with Applications. 42 (5): 2582–2592. doi:10.1016/j.eswa.2014.10.049.
  104. ^ Zhu, Yukun, et al. "Aligning books and movies: Towards story-like visual explanations by watching movies and reading books." Proceedings of the IEEE international conference on computer vision. 2015.
  105. ^ Bowman, Samuel R.; Angeli, Gabor; Potts, Christopher; Manning, Christopher D. (2015). "A large annotated corpus for learning natural language inference". arXiv:1508.05326 [cs.CL].
  106. ^ "DSL Corpus Collection". ttg.uni-saarland.de. Retrieved 22 September 2017.
  107. ^ "Urban Dictionary Words and Definitions".
  108. ^ H. Elsahar, P. Vougiouklis, A. Remaci, C. Gravier, J. Hare, F. Laforest, E. Simperl, "T-REx: A Large Scale Alignment of Natural Language with Knowledge Base Triples", Proceedings of the Eleventh International Conference on Language Resources and Evaluation (LREC-2018).
  109. ^ Wang, Alex; Singh, Amanpreet; Michael, Julian; Hill, Felix; Levy, Omer; Bowman, Samuel R. (2018). "GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding". arXiv:1804.07461 [cs.CL].
  110. ^ "Computers Are Learning to Read—But They're Still Not So Smart". Wired. Retrieved 29 December 2019.
  111. ^ "GLUE Benchmark". gluebenchmark.com. Retrieved 25 February 2019.
  112. ^ Quan, Hoang Lam; Quang, Duy Le; Van Kiet, Nguyen; Ngan, Luu-Thuy Nguyen. "UIT-ViIC: A Dataset for the First Evaluation on Vietnamese Image Captioning".
  113. ^ To, Quoc Huy; Nguyen, Van Kiet; Nguyen, Luu Thuy Ngan; Nguyen, Gia Tuan Anh (2020). "Gender Prediction Based on Vietnamese Names with Machine Learning Techniques". Proceedings of the 4th International Conference on Natural Language Processing and Information Retrieval. pp. 55–60. arXiv:2010.10852. doi:10.1145/3443279.3443309. ISBN 9781450377607. S2CID 224814110.
  114. ^ Nguyen, Luan Thanh; Van Nguyen, Kiet; Nguyen, Ngan Luu-Thuy (18 March 2021). "Constructive and Toxic Speech Detection for Open-Domain Social Media Comments in Vietnamese". Advances and Trends in Artificial Intelligence. Artificial Intelligence Practices. Lecture Notes in Computer Science. Vol. 12798. pp. 572–583. arXiv:2103.10069. doi:10.1007/978-3-030-79457-6_49. ISBN 978-3-030-79456-9. S2CID 232269671.
  115. ^ Saxton, David, et al. "Analysing Mathematical Reasoning Abilities of Neural Models." International Conference on Learning Representations. 2018.
  116. ^ Godfrey, J.J.; Holliman, E.C.; McDaniel, J. (1992). "SWITCHBOARD: Telephone speech corpus for research and development". [Proceedings] ICASSP-92: 1992 IEEE International Conference on Acoustics, Speech, and Signal Processing. IEEE. pp. 517-520 vol.1. doi:10.1109/icassp.1992.225858. ISBN 0-7803-0532-9.
  117. ^ "Switchboard-1 Release 2 - Linguistic Data Consortium". catalog.ldc.upenn.edu. Retrieved 30 November 2024.
  118. ^ Godfrey, J.J.; Holliman, E.C.; McDaniel, J. (1992). "SWITCHBOARD: Telephone speech corpus for research and development". [Proceedings] ICASSP-92: 1992 IEEE International Conference on Acoustics, Speech, and Signal Processing. IEEE. pp. 517-520 vol.1. doi:10.1109/icassp.1992.225858. ISBN 0-7803-0532-9.
  119. ^ "Switchboard-1 Release 2 - Linguistic Data Consortium". catalog.ldc.upenn.edu. Retrieved 30 November 2024.
  120. ^ M. Versteegh, R. Thiollière, T. Schatz, X.-N. Cao, X. Anguera, A. Jansen, and E. Dupoux (2015). "The Zero Resource Speech Challenge 2015," in INTERSPEECH-2015.
  121. ^ M. Versteegh, X. Anguera, A. Jansen, and E. Dupoux, (2016). "The Zero Resource Speech Challenge 2015: Proposed Approaches and Results," in SLTU-2016.
  122. ^ Sakar, Betul Erdogdu; et al. (2013). "Collection and analysis of a Parkinson speech dataset with multiple types of sound recordings". IEEE Journal of Biomedical and Health Informatics. 17 (4): 828–834. doi:10.1109/jbhi.2013.2245674. PMID 25055311. S2CID 15491516.
  123. ^ Zhao, Shunan; Rudzicz, Frank; Carvalho, Leonardo G.; Marquez-Chin, Cesar; Livingstone, Steven (2014). "Automatic detection of expressed emotion in Parkinson's Disease". 2014 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). pp. 4813–4817. doi:10.1109/ICASSP.2014.6854516. ISBN 978-1-4799-2893-4.
  124. ^ Hammami, Nacereddine; Bedda, Mouldi (July 2010). "Improved tree model for arabic speech recognition". 2010 3rd International Conference on Computer Science and Information Technology. pp. 521–526. doi:10.1109/ICCSIT.2010.5563892. ISBN 978-1-4244-5537-9.
  125. ^ Maaten, Laurens. "Learning discriminative fisher kernels." Proceedings of the 28th International Conference on Machine Learning (ICML-11). 2011.
  126. ^ Cole, Ronald, and Mark Fanty. "Spoken letter recognition." Proc. Third DARPA Speech and Natural Language Workshop. 1990.
  127. ^ Chapelle, Olivier; Sindhwani, Vikas; Keerthi, Sathiya S. (2008). "Optimization techniques for semi-supervised support vector machines" (PDF). The Journal of Machine Learning Research. 9: 203–233.
  128. ^ Kudo, Mineichi; Toyama, Jun; Shimbo, Masaru (November 1999). "Multidimensional curve classification using passing-through regions". Pattern Recognition Letters. 20 (11–13): 1103–1111. Bibcode:1999PaReL..20.1103K. doi:10.1016/s0167-8655(99)00077-x.
  129. ^ Jaeger, Herbert; Lukoševičius, Mantas; Popovici, Dan; Siewert, Udo (April 2007). "Optimization and applications of echo state networks with leaky- integrator neurons". Neural Networks. 20 (3): 335–352. doi:10.1016/j.neunet.2007.04.016. PMID 17517495.
  130. ^ Tsanas, A.; Little, M.A.; McSharry, P.E.; Ramig, L.O. (April 2010). "Accurate Telemonitoring of Parkinson's Disease Progression by Noninvasive Speech Tests". IEEE Transactions on Biomedical Engineering. 57 (4): 884–893. doi:10.1109/tbme.2009.2036000. PMID 19932995.
  131. ^ Clifford, Gari D.; Clifton, David (2012). "Wireless technology in disease management and medicine". Annual Review of Medicine. 63: 479–492. doi:10.1146/annurev-med-051210-114650. PMID 22053737.
  132. ^ Zue, Victor; Seneff, Stephanie; Glass, James (1990). "Speech database development at MIT: TIMIT and beyond". Speech Communication. 9 (4): 351–356. doi:10.1016/0167-6393(90)90010-7.
  133. ^ Kapadia, S.; Valtchev, V.; Young, S.J. (1993). "MMI training for continuous phoneme recognition on the TIMIT database". IEEE International Conference on Acoustics Speech and Signal Processing. pp. 491-494 vol.2. doi:10.1109/ICASSP.1993.319349. ISBN 0-7803-0946-4.
  134. ^ Halabi, Nawar (2016). Modern Standard Arabic Phonetics for Speech Synthesis (PDF) (PhD Thesis). University of Southampton, School of Electronics and Computer Science.
  135. ^ Ardila, Rosana; Branson, Megan; Davis, Kelly; Henretty, Michael; Kohler, Michael; Meyer, Josh; Morais, Reuben; Saunders, Lindsay; Tyers, Francis M.; Weber, Gregor (13 December 2019). "Common Voice: A Massively-Multilingual Speech Corpus". arXiv:1912.06670v2 [cs.CL].
  136. ^ "The LJ Speech Dataset". keithito.com. Retrieved 13 April 2022.
  137. ^ Ghandoura, Abdulkader; Hjabo, Farouk; Al Dakkak, Oumayma (June 2021). "Building and benchmarking an Arabic Speech Commands dataset for small-footprint keyword spotting". Engineering Applications of Artificial Intelligence. 102: 104267. doi:10.1016/j.engappai.2021.104267.
  138. ^ Zhou, Fang; Claire, Q.; King, Ross D. (2014). "Predicting the Geographical Origin of Music". 2014 IEEE International Conference on Data Mining. pp. 1115–1120. doi:10.1109/ICDM.2014.73. ISBN 978-1-4799-4302-9.
  139. ^ Saccenti, Edoardo; Camacho, José (2015). "On the use of the observation-wise k-fold operation in PCA cross-validation". Journal of Chemometrics. 29 (8): 467–478. doi:10.1002/cem.2726. hdl:10481/55302. S2CID 62248957.
  140. ^ Bertin-Mahieux, Thierry, et al. "The million song dataset." ISMIR 2011: Proceedings of the 12th International Society for Music Information Retrieval Conference, 24–28 October 2011, Miami, Florida. University of Miami, 2011.
  141. ^ Henaff, Mikael; et al. (2011). "Unsupervised learning of sparse features for scalable audio classification" (PDF). ISMIR. 11.
  142. ^ Rafii, Zafar (2017). "Music". MUSDB18 – a corpus for music separation. doi:10.5281/zenodo.1117372.
  143. ^ Defferrard, Michaël; Benzi, Kirell; Vandergheynst, Pierre; Bresson, Xavier (6 December 2016). "FMA: A Dataset For Music Analysis". arXiv:1612.01840 [cs.SD].
  144. ^ Esposito, Roberto; Radicioni, Daniele P. (2009). "Carpediem: Optimizing the viterbi algorithm and applications to supervised sequential learning" (PDF). The Journal of Machine Learning Research. 10: 1851–1880.
  145. ^ Sourati, Jamshid; et al. (2016). "Classification Active Learning Based on Mutual Information". Entropy. 18 (2): 51. Bibcode:2016Entrp..18...51S. doi:10.3390/e18020051.
  146. ^ Salamon, Justin; Jacoby, Christopher; Bello, Juan Pablo. "A dataset and taxonomy for urban sound research." Proceedings of the ACM International Conference on Multimedia. ACM, 2014.
  147. ^ Lagrange, Mathieu; Lafay, Grégoire; Rossignol, Mathias; Benetos, Emmanouil; Roebel, Axel (2015). "An evaluation framework for event detection using a morphological model of acoustic scenes". arXiv:1502.00141 [stat.ML].
  148. ^ Gemmeke, Jort F., et al. "Audio Set: An ontology and human-labeled dataset for audio events." IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP). 2017.
  149. ^ "Watch out, birders: Artificial intelligence has learned to spot birds from their songs". Science | AAAS. 18 July 2018. Retrieved 22 July 2018.
  150. ^ "Bird Audio Detection challenge". Machine Listening Lab at Queen Mary University. 3 May 2016. Retrieved 22 July 2018.
  151. ^ Wichern, Gordon; Antognini, Joe; Flynn, Michael; Licheng Richard Zhu; McQuinn, Emmett; Crow, Dwight; Manilow, Ethan; Jonathan Le Roux (2019). "WHAM!: Extending Speech Separation to Noisy Environments". arXiv:1907.01160 [cs.SD].
  152. ^ Drossos, K., Lipping, S., and Virtanen, T. "Clotho: An Audio Captioning Dataset" IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP). 2020.
  153. ^ Drossos, K., Lipping, S., and Virtanen, T. (2019). Clotho dataset (Version 1.0) [Data set]. Zenodo. http://doi.org/10.5281/zenodo.3490684
  154. ^ The CAIDA UCSD Dataset on the Witty Worm – 19–24 March 2004, http://www.caida.org/data/passive/witty_worm_dataset.xml
  155. ^ Chen, Zesheng; Ji, Chuanyi (2007). "Optimal worm-scanning method using vulnerable-host distributions". International Journal of Security and Networks. 2 (1/2): 71. doi:10.1504/IJSN.2007.012826.
  156. ^ Kachuee, Mohamad; Kiani, Mohammad Mahdi; Mohammadzade, Hoda; Shabany, Mahdi (2015). "Cuff-less high-accuracy calibration-free blood pressure estimation using pulse transit time". 2015 IEEE International Symposium on Circuits and Systems (ISCAS). pp. 1006–1009. doi:10.1109/ISCAS.2015.7168806. ISBN 978-1-4799-8391-9.
  157. ^ Goldberger, Ary L.; Amaral, Luis A. N.; Glass, Leon; Hausdorff, Jeffrey M.; Ivanov, Plamen Ch.; Mark, Roger G.; Mietus, Joseph E.; Moody, George B.; Peng, Chung-Kang; Stanley, H. Eugene (13 June 2000). "PhysioBank, PhysioToolkit, and PhysioNet: Components of a New Research Resource for Complex Physiologic Signals". Circulation. 101 (23): E215-20. doi:10.1161/01.CIR.101.23.e215. PMID 10851218.
  158. ^ Vergara, Alexander; et al. (2012). "Chemical gas sensor drift compensation using classifier ensembles". Sensors and Actuators B: Chemical. 166: 320–329. Bibcode:2012SeAcB.166..320V. doi:10.1016/j.snb.2012.01.074.
  159. ^ Korotcenkov, G.; Cho, B. K. (2014). "Engineering approaches to improvement of conductometric gas sensor parameters. Part 2: Decrease of dissipated (consumable) power and improvement stability and reliability". Sensors and Actuators B: Chemical. 198: 316–341. Bibcode:2014SeAcB.198..316K. doi:10.1016/j.snb.2014.03.069.
  160. ^ Quinlan, John R (1992). "Learning with continuous classes" (PDF). 5th Australian Joint Conference on Artificial Intelligence. 92.
  161. ^ Merz, Christopher J.; Pazzani, Michael J. (1999). "A principal components approach to combining regression estimates". Machine Learning. 36 (1–2): 9–32. doi:10.1023/a:1007507221352.
  162. ^ Torres-Sospedra, Joaquin, et al. "UJIIndoorLoc-Mag: A new database for magnetic field-based localization problems." Indoor Positioning and Indoor Navigation (IPIN), 2015 International Conference on. IEEE, 2015.
  163. ^ Berkvens, Rafael, Maarten Weyn, and Herbert Peremans. "Mean Mutual Information of Probabilistic Wi-Fi Localization." Indoor Positioning and Indoor Navigation (IPIN), 2015 International Conference on. Banff, Canada: IPIN. 2015.
  164. ^ Paschke, Fabian, et al. "Sensorlose Zustandsüberwachung an Synchronmotoren."Proceedings. 23. Workshop Computational Intelligence, Dortmund, 5.-6. Dezember 2013. KIT Scientific Publishing, 2013.
  165. ^ Lessmeier, Christian, et al. "Data Acquisition and Signal Analysis from Measured Motor Currents for Defect Detection in Electromechanical Drive Systems."
  166. ^ Ugulino, Wallace, et al. "Wearable computing: Accelerometers’ data classification of body postures and movements Archived 25 September 2020 at the Wayback Machine." Advances in Artificial Intelligence-SBIA 2012. Springer Berlin Heidelberg, 2012. 52–61.
  167. ^ Schneider, Jan; et al. (2015). "Augmenting the senses: a review on sensor-based learning support". Sensors. 15 (2): 4097–4133. Bibcode:2015Senso..15.4097S. doi:10.3390/s150204097. PMC 4367401. PMID 25679313.
  168. ^ Madeo, Renata CB, Clodoaldo AM Lima, and Sarajane M. Peres. "Gesture unit segmentation using support vector machines: segmenting gestures from rest positions." Proceedings of the 28th Annual ACM Symposium on Applied Computing. ACM, 2013.
  169. ^ Lun, Roanna; Zhao, Wenbing (2015). "A survey of applications and human motion recognition with Microsoft Kinect". International Journal of Pattern Recognition and Artificial Intelligence. 29 (5): 1555008. doi:10.1142/s0218001415550083.
  170. ^ Theodoridis, Theodoros; Huosheng Hu (2007). "Action classification of 3D human models using dynamic ANNs for mobile robot surveillance". 2007 IEEE International Conference on Robotics and Biomimetics (ROBIO). pp. 371–376. doi:10.1109/ROBIO.2007.4522190. ISBN 978-1-4244-1761-2.
  171. ^ Etemad, Seyed Ali; Arya, Ali (2009). "3D human action recognition and style transformation using resilient backpropagation neural networks". 2009 IEEE International Conference on Intelligent Computing and Intelligent Systems. pp. 296–301. doi:10.1109/ICICISYS.2009.5357690. ISBN 978-1-4244-4754-1.
  172. ^ Altun, Kerem; Barshan, Billur; Tunçel, Orkun (2010). "Comparative study on classifying human activities with miniature inertial and magnetic sensors". Pattern Recognition. 43 (10): 3605–3620. Bibcode:2010PatRe..43.3605A. doi:10.1016/j.patcog.2010.04.019. hdl:11693/11947.
  173. ^ Nathan, Ran; et al. (2012). "Using tri-axial acceleration data to identify behavioral modes of free-ranging animals: general concepts and tools illustrated for griffon vultures". The Journal of Experimental Biology. 215 (6): 986–996. Bibcode:2012JExpB.215..986N. doi:10.1242/jeb.058602. PMC 3284320. PMID 22357592.
  174. ^ Anguita, Davide, et al. "Human activity recognition on smartphones using a multiclass hardware-friendly support vector machine." Ambient assisted living and home care. Springer Berlin Heidelberg, 2012. 216–223.
  175. ^ Su, Xing; Tong, Hanghang; Ji, Ping (2014). "Activity recognition with smartphone sensors". Tsinghua Science and Technology. 19 (3): 235–249. doi:10.1109/tst.2014.6838194. S2CID 62751498.
  176. ^ Kadous, Mohammed Waleed. Temporal classification: Extending the classification paradigm to multivariate time series. Diss. The University of New South Wales, 2002.
  177. ^ Graves, Alex, et al. "Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks." Proceedings of the 23rd international conference on Machine learning. ACM, 2006.
  178. ^ Velloso, Eduardo, et al. "Qualitative activity recognition of weight lifting exercises."Proceedings of the 4th Augmented Human International Conference. ACM, 2013.
  179. ^ Mortazavi, Bobak Jack, et al. "Determining the single best axis for exercise repetition recognition and counting on smartwatches Archived 4 November 2021 at the Wayback Machine." Wearable and Implantable Body Sensor Networks (BSN), 2014 11th International Conference on. IEEE, 2014.
  180. ^ Sapsanis, Christos, et al. "Improving EMG based Classification of basic hand movements using EMD." Engineering in Medicine and Biology Society (EMBC), 2013 35th Annual International Conference of the IEEE. IEEE, 2013.
  181. ^ a b Andrianesis, Konstantinos; Tzes, Anthony (2015). "Development and control of a multifunctional prosthetic hand with shape memory alloy actuators". Journal of Intelligent & Robotic Systems. 78 (2): 257–289. doi:10.1007/s10846-014-0061-6. S2CID 207174078.
  182. ^ Banos, Oresti; et al. (2014). "Dealing with the effects of sensor displacement in wearable activity recognition". Sensors. 14 (6): 9995–10023. Bibcode:2014Senso..14.9995B. doi:10.3390/s140609995. PMC 4118358. PMID 24915181.
  183. ^ Stisen, Allan; Blunck, Henrik; Bhattacharya, Sourav; Prentow, Thor Siiger; Kjærgaard, Mikkel Baun; Dey, Anind; Sonne, Tobias; Jensen, Mads Møller (2015). "Smart Devices are Different: Assessing and MitigatingMobile Sensing Heterogeneities for Activity Recognition". Proceedings of the 13th ACM Conference on Embedded Networked Sensor Systems. pp. 127–140. doi:10.1145/2809695.2809718. ISBN 978-1-4503-3631-4.
  184. ^ Bhattacharya, Sourav; Lane, Nicholas D. (2016). "From smart to deep: Robust activity recognition on smartwatches using deep learning". 2016 IEEE International Conference on Pervasive Computing and Communication Workshops (PerCom Workshops). pp. 1–6. doi:10.1109/PERCOMW.2016.7457169. ISBN 978-1-5090-1941-0.
  185. ^ Bacciu, Davide; et al. (2014). "An experimental characterization of reservoir computing in ambient assisted living applications". Neural Computing and Applications. 24 (6): 1451–1464. doi:10.1007/s00521-013-1364-4. hdl:11568/237959. S2CID 14124013.
  186. ^ Palumbo, Filippo; Barsocchi, Paolo; Gallicchio, Claudio; Chessa, Stefano; Micheli, Alessio (2013). "Multisensor Data Fusion for Activity Recognition Based on Reservoir Computing". Evaluating AAL Systems Through Competitive Benchmarking. Communications in Computer and Information Science. Vol. 386. pp. 24–35. doi:10.1007/978-3-642-41043-7_3. ISBN 978-3-642-41042-0.
  187. ^ Reiss, Attila; Stricker, Didier (2012). "Introducing a New Benchmarked Dataset for Activity Monitoring". 2012 16th International Symposium on Wearable Computers. pp. 108–109. doi:10.1109/ISWC.2012.13. ISBN 978-0-7695-4697-1.
  188. ^ Roggen, Daniel; Forster, Kilian; Calatroni, Alberto; Holleczek, Thomas; Fang, Yu; Troster, Gerhard; Ferscha, Alois; Holzmann, Clemens; Riener, Andreas; Lukowicz, Paul; Pirkl, Gerald; Bannach, David; Kunze, Kai; Chavarriaga, Ricardo; Millan, Jose del R. (2009). "OPPORTUNITY: Towards opportunistic activity and context recognition systems". 2009 IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks & Workshops. pp. 1–6. doi:10.1109/WOWMOM.2009.5282442. ISBN 978-1-4244-4440-3.
  189. ^ Kurz, Marc, et al. "Dynamic quantification of activity recognition capabilities in opportunistic systems." Vehicular Technology Conference (VTC Spring), 2011 IEEE 73rd. IEEE, 2011.
  190. ^ Sztyler, Timo; Stuckenschmidt, Heiner (2016). "On-body localization of wearable devices: An investigation of position-aware activity recognition". 2016 IEEE International Conference on Pervasive Computing and Communications (PerCom). pp. 1–9. doi:10.1109/PERCOM.2016.7456521. ISBN 978-1-4673-8779-8.
  191. ^ Zhi, Ying Xuan; Lukasik, Michelle; Li, Michael H.; Dolatabadi, Elham; Wang, Rosalie H.; Taati, Babak (2018). "Automatic Detection of Compensation During Robotic Stroke Rehabilitation Therapy". IEEE Journal of Translational Engineering in Health and Medicine. 6: 1–7. doi:10.1109/JTEHM.2017.2780836. PMC 5788403. PMID 29404226.
  192. ^ Dolatabadi, Elham; Zhi, Ying Xuan; Ye, Bing; Coahran, Marge; Lupinacci, Giorgia; Mihailidis, Alex; Wang, Rosalie; Taati, Babak (2017). "The toronto rehab stroke pose dataset to detect compensation during stroke rehabilitation therapy". Proceedings of the 11th EAI International Conference on Pervasive Computing Technologies for Healthcare. pp. 375–381. doi:10.1145/3154862.3154925. ISBN 978-1-4503-6363-1.
  193. ^ "Toronto Rehab Stroke Pose Dataset".
  194. ^ Jung, Merel M.; Poel, Mannes; Poppe, Ronald; Heylen, Dirk K. J. (March 2017). "Automatic recognition of touch gestures in the corpus of social touch". Journal on Multimodal User Interfaces. 11 (1): 81–96. doi:10.1007/s12193-016-0232-9.
  195. ^ Jung, M.M. (Merel) (1 June 2016). "Corpus of Social Touch (CoST)". University of Twente. doi:10.4121/uuid:5ef62345-3b3e-479c-8e1d-c922748c9b29. {{cite journal}}: Cite journal requires |journal= (help)
  196. ^ Aeberhard, S., D. Coomans, and O. De Vel. "Comparison of classifiers in high dimensional settings." Dept. Math. Statist., James Cook Univ., North Queensland, Australia, Tech. Rep 92-02 (1992).
  197. ^ Basu, Sugato. "Semi-supervised clustering with limited background knowledge." AAAI. 2004.
  198. ^ Tüfekci, Pınar (2014). "Prediction of full load electrical power output of a base load operated combined cycle power plant using machine learning methods". International Journal of Electrical Power & Energy Systems. 60: 126–140. Bibcode:2014IJEPE..60..126T. doi:10.1016/j.ijepes.2014.02.027.
  199. ^ Kaya, Heysem, Pınar Tüfekci, and Fikret S. Gürgen. "Local and global learning methods for predicting power of a combined gas & steam turbine." International conference on emerging trends in computer and electronics engineering (ICETCEE'2012), Dubai. 2012.
  200. ^ Baldi, Pierre; Sadowski, Peter; Whiteson, Daniel (2014). "Searching for exotic particles in high-energy physics with deep learning". Nature Communications. 5: 2014. arXiv:1402.4735. Bibcode:2014NatCo...5.4308B. doi:10.1038/ncomms5308. PMID 24986233. S2CID 195953.
  201. ^ a b Baldi, Pierre; Sadowski, Peter; Whiteson, Daniel (2015). "Enhanced Higgs Boson to τ+ τ− Search with Deep Learning". Physical Review Letters. 114 (11): 111801. arXiv:1410.3469. Bibcode:2015PhRvL.114k1801B. doi:10.1103/physrevlett.114.111801. PMID 25839260. S2CID 2339142.
  202. ^ a b Adam-Bourdarios, C.; Cowan, G.; Germain-Renaud, C.; Guyon, I.; Kégl, B.; Rousseau, D. (2015). "The Higgs Machine Learning Challenge". Journal of Physics: Conference Series. 664 (7): 072015. Bibcode:2015JPhCS.664g2015A. doi:10.1088/1742-6596/664/7/072015.
  203. ^ Baldi, Pierre; Cranmer, Kyle; Faucett, Taylor; Sadowski, Peter; Whiteson, Daniel (2016). "Parameterized neural networks for high-energy physics". The European Physical Journal C. 76 (5): 235. arXiv:1601.07913. Bibcode:2016EPJC...76..235B. doi:10.1140/epjc/s10052-016-4099-4. S2CID 254108545.
  204. ^ Ortigosa, I.; Lopez, R.; Garcia, J. "A neural networks approach to residuary resistance of sailing yachts prediction". Proceedings of the International Conference on Marine Engineering MARINE. 2007.
  205. ^ Gerritsma, J., R. Onnink, and A. Versluis.Geometry, resistance and stability of the delft systematic yacht hull series. Delft University of Technology, 1981.
  206. ^ Liu, Huan, and Hiroshi Motoda. Feature extraction, construction and selection: A data mining perspective. Springer Science & Business Media, 1998.
  207. ^ Reich, Yoram. Converging to Ideal Design Knowledge by Learning. [Carnegie Mellon University], Engineering Design Research Center, 1989.
  208. ^ Todorovski, Ljupčo; Džeroski, Sašo (1999). "Experiments in Meta-level Learning with ILP". Principles of Data Mining and Knowledge Discovery. Lecture Notes in Computer Science. Vol. 1704. pp. 98–106. doi:10.1007/978-3-540-48247-5_11. ISBN 978-3-540-66490-1. S2CID 39382993.
  209. ^ Wang, Yong. A new approach to fitting linear models in high dimensional spaces. Diss. The University of Waikato, 2000.
  210. ^ Kibler, Dennis; Aha, David W.; Albert, Marc K. (1989). "Instance-based prediction of real-valued attributes". Computational Intelligence. 5 (2): 51–57. doi:10.1111/j.1467-8640.1989.tb00315.x. S2CID 40800413.
  211. ^ Palmer, Christopher R.; Faloutsos, Christos (2003). "Electricity Based External Similarity of Categorical Attributes". Advances in Knowledge Discovery and Data Mining. Lecture Notes in Computer Science. Vol. 2637. pp. 486–500. doi:10.1007/3-540-36175-8_49. ISBN 978-3-540-04760-5.
  212. ^ Tsanas, Athanasios; Xifara, Angeliki (2012). "Accurate quantitative estimation of energy performance of residential buildings using statistical machine learning tools". Energy and Buildings. 49: 560–567. Bibcode:2012EneBu..49..560T. doi:10.1016/j.enbuild.2012.03.003.
  213. ^ De Wilde, Pieter (2014). "The gap between predicted and measured energy performance of buildings: A framework for investigation". Automation in Construction. 41: 40–49. doi:10.1016/j.autcon.2014.02.009.
  214. ^ Brooks, Thomas F., D. Stuart Pope, and Michael A. Marcolini. Airfoil self-noise and prediction. Vol. 1218. National Aeronautics and Space Administration, Office of Management, Scientific and Technical Information Division, 1989.
  215. ^ Draper, David. "Assessment and propagation of model uncertainty." Journal of the Royal Statistical Society, Series B (Methodological) (1995): 45–97.
  216. ^ Lavine, Michael (1991). "Problems in extrapolation illustrated with space shuttle O-ring data". Journal of the American Statistical Association. 86 (416): 919–921. doi:10.1080/01621459.1991.10475132.
  217. ^ Wang, J.; Yu, B.; Gasser, L. (2002). "Concept tree based clustering visualization with shaded similarity matrices". 2002 IEEE International Conference on Data Mining, 2002. Proceedings. pp. 697–700. doi:10.1109/ICDM.2002.1184032. ISBN 0-7695-1754-4.
  218. ^ Pettengill, Gordon H.; Ford, Peter G.; Johnson, William T. K.; Raney, R. Keith; Soderblom, Laurence A. (12 April 1991). "Magellan: Radar Performance and Data Products". Science. 252 (5003): 260–265. Bibcode:1991Sci...252..260P. doi:10.1126/science.252.5003.260. PMID 17769272.
  219. ^ a b Aharonian, F.; et al. (2008). "Energy spectrum of cosmic-ray electrons at TeV energies". Physical Review Letters. 101 (26): 261104. arXiv:0811.3894. Bibcode:2008PhRvL.101z1104A. doi:10.1103/PhysRevLett.101.261104. hdl:2440/51450. PMID 19437632. S2CID 41850528.
  220. ^ Bock, R. K.; et al. (2004). "Methods for multidimensional event classification: a case study using images from a Cherenkov gamma-ray telescope". Nuclear Instruments and Methods in Physics Research Section A: Accelerators, Spectrometers, Detectors and Associated Equipment. 516 (2): 511–528. Bibcode:2004NIMPA.516..511B. doi:10.1016/j.nima.2003.08.157.
  221. ^ Li, Jinyan; et al. (2004). "Deeps: A new instance-based lazy discovery and classification system". Machine Learning. 54 (2): 99–124. doi:10.1023/b:mach.0000011804.08528.7d.
  222. ^ Villaescusa-Navarro, Francisco; al., et (2022). "The CAMELS Multifield Data Set: Learning the Universe's Fundamental Parameters with Artificial Intelligence". The Astrophysical Journal Supplement Series. 259 (2): 61. arXiv:2109.10915. Bibcode:2022ApJS..259...61V. doi:10.3847/1538-4365/ac5ab0. S2CID 237604997.
  223. ^ Siebert, Lee, and Tom Simkin. "Volcanoes of the world: an illustrated catalog of Holocene volcanoes and their eruptions." (2014).
  224. ^ Sikora, Marek; Wróbel, Łukasz (2010). "Application of rule induction algorithms for analysis of data collected by seismic hazard monitoring systems in coal mines". Archives of Mining Sciences. 55 (1): 91–114.
  225. ^ Sikora, Marek; Sikora, Beata (2012). "Rough Natural Hazards Monitoring". Rough Sets: Selected Methods and Applications in Management and Engineering. Advanced Information and Knowledge Processing. pp. 163–179. doi:10.1007/978-1-4471-2760-4_10. ISBN 978-1-4471-2759-8.
  226. ^ Addor, Nans; Newman, Andrew J.; Mizukami, Naoki; Clark, Martyn P. (20 October 2017). "The CAMELS data set: catchment attributes and meteorology for large-sample studies". Hydrology and Earth System Sciences. 21 (10): 5293–5313. Bibcode:2017HESS...21.5293A. doi:10.5194/hess-21-5293-2017.
  227. ^ Newman, A. J.; Clark, M. P.; Sampson, K.; Wood, A.; Hay, L. E.; Bock, A.; Viger, R. J.; Blodgett, D.; Brekke, L.; Arnold, J. R.; Hopson, T.; Duan, Q. (14 January 2015). "Development of a large-sample watershed-scale hydrometeorological data set for the contiguous USA: data set characteristics and assessment of regional variability in hydrologic model performance". Hydrology and Earth System Sciences. 19 (1): 209–223. Bibcode:2015HESS...19..209N. doi:10.5194/hess-19-209-2015.
  228. ^ Alvarez-Garreton, Camila; Mendoza, Pablo A.; Boisier, Juan Pablo; Addor, Nans; Galleguillos, Mauricio; Zambrano-Bigiarini, Mauricio; Lara, Antonio; Puelma, Cristóbal; Cortes, Gonzalo; Garreaud, Rene; McPhee, James; Ayala, Alvaro (13 November 2018). "The CAMELS-CL dataset: catchment attributes and meteorology for large sample studies – Chile dataset". Hydrology and Earth System Sciences. 22 (11): 5817–5846. Bibcode:2018HESS...22.5817A. doi:10.5194/hess-22-5817-2018.
  229. ^ Chagas, Vinícius B. P.; Chaffe, Pedro L. B.; Addor, Nans; Fan, Fernando M.; Fleischmann, Ayan S.; Paiva, Rodrigo C. D.; Siqueira, Vinícius A. (8 September 2020). "CAMELS-BR: hydrometeorological time series and landscape attributes for 897 catchments in Brazil". Earth System Science Data. 12 (3): 2075–2096. Bibcode:2020ESSD...12.2075C. doi:10.5194/essd-12-2075-2020.
  230. ^ Coxon, Gemma; Addor, Nans; Bloomfield, John P.; Freer, Jim; Fry, Matt; Hannaford, Jamie; Howden, Nicholas J. K.; Lane, Rosanna; Lewis, Melinda; Robinson, Emma L.; Wagener, Thorsten; Woods, Ross (12 October 2020). "CAMELS-GB: hydrometeorological time series and landscape attributes for 671 catchments in Great Britain". Earth System Science Data. 12 (4): 2459–2483. Bibcode:2020ESSD...12.2459C. doi:10.5194/essd-12-2459-2020.
  231. ^ Fowler, Keirnan J. A.; Acharya, Suwash Chandra; Addor, Nans; Chou, Chihchung; Peel, Murray C. (6 August 2021). "CAMELS-AUS: hydrometeorological time series and landscape attributes for 222 catchments in Australia". Earth System Science Data. 13 (8): 3847–3867. Bibcode:2021ESSD...13.3847F. doi:10.5194/essd-13-3847-2021.
  232. ^ Klingler, Christoph; Schulz, Karsten; Herrnegger, Mathew (16 September 2021). "LamaH-CE: LArge-SaMple DAta for Hydrology and Environmental Sciences for Central Europe". Earth System Science Data. 13 (9): 4529–4565. Bibcode:2021ESSD...13.4529K. doi:10.5194/essd-13-4529-2021.
  233. ^ Yeh, I–C (1998). "Modeling of strength of high-performance concrete using artificial neural networks". Cement and Concrete Research. 28 (12): 1797–1808. doi:10.1016/s0008-8846(98)00165-3.
  234. ^ Zarandi, MH Fazel; et al. (2008). "Fuzzy polynomial neural networks for approximation of the compressive strength of concrete". Applied Soft Computing. 8 (1): 488–498. Bibcode:2008ApSoC...8...79S. doi:10.1016/j.asoc.2007.02.010.
  235. ^ Yeh, I. "Modeling slump of concrete with fly ash and superplasticizer." Computers and Concrete5.6 (2008): 559–572.
  236. ^ Gencel, Osman; et al. (2011). "Comparison of artificial neural networks and general linear model approaches for the analysis of abrasive wear of concrete". Construction and Building Materials. 25 (8): 3486–3494. doi:10.1016/j.conbuildmat.2011.03.040.
  237. ^ Dietterich, Thomas G., et al. "A comparison of dynamic reposing and tangent distance for drug activity prediction Archived 7 December 2019 at the Wayback Machine." Advances in Neural Information Processing Systems (1994): 216–216.
  238. ^ Buscema, Massimo; Tastle, William J.; Terzi, Stefano (2013). "Meta Net: A New Meta-Classifier Family". Data Mining Applications Using Artificial Adaptive Systems. pp. 141–182. doi:10.1007/978-1-4614-4223-3_5. ISBN 978-1-4614-4222-6.
  239. ^ Barnard, Amanda; Sun, Baichuan; Motevalli Soumehsaraei, Ben; & Opletal, George (2019): Silver Nanoparticle Data Set. v3. CSIRO. Data Collection. https://doi.org/10.25919/5d22d20bc543e
  240. ^ Barnard, Amanda; Sun, Baichuan; & Opletal, George (2019): Platinum Nanoparticle Data Set. v2. CSIRO. Data Collection. https://doi.org/10.25919/5d3958d9bf5f7
  241. ^ Barnard, Amanda; & Opletal, George (2019): Gold Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/5d395ef9a4291
  242. ^ Barnard, Amanda; & Opletal, George (2019): Ruthenium Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/5e30b8fa67484
  243. ^ Barnard, Amanda; & Opletal, George (2019): Copper Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/5e30ba386311f
  244. ^ Barnard, Amanda; & Opletal, George (2023): Palladium Nanoparticle Data Set. v2. CSIRO. Data Collection. https://doi.org/10.25919/epxd-8p61
  245. ^ Ting, Jonathan; Barnard, Amanda; Opletal, George (2023): AuCo Nanoparticle Data Set. v2. CSIRO. Data Collection. https://doi.org/10.25919/7h3x-1343
  246. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PtCo Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/jzh8-rd31
  247. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PtAu Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/tdnv-jp30
  248. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PdPt Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/qced-2e85
  249. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PdCo Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/az9t-vr97
  250. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): CoPt Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/0bs4-sn79
  251. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): CoPd Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/em3a-9a89
  252. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): CoAu Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/991j-hg07
  253. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): AuPt Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/7zh9-3f67
  254. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PtPd Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/9sz9-3a85
  255. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PdAu Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/6ajg-1275
  256. ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): AuPd Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/v0r5-sw08
  257. ^ Lu, Kaihan; Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): AuPdPt Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/psvw-am47
  258. ^ Amoradnejad, Issa; Amoradnejad, Rahimberdi; et al. (2022). "Age dataset: A structured general-purpose dataset on life, work, and death of 1.22 million distinguished people". Workshop Proceedings of the 16th International AAAI Conference on Web and Social Media (ICWSM). 3. ICWSM: 1–4. doi:10.36190/2022.82. S2CID 249668669.
  259. ^ "Age Dataset". GitHub. 7 June 2022.
  260. ^ "Synthetic Fundus Dataset". Archived from the original on 29 November 2021. Retrieved 22 February 2023.
  261. ^ Lo Castro, Dario; et al. (2020). "A visual framework to create photorealistic retinal vessels for diagnosis purposes". Journal of Biomedical Informatics. 108: 103490. doi:10.1016/j.jbi.2020.103490. PMID 32640292. S2CID 220429697.
  262. ^ Ingber, Lester (1997). "Statistical mechanics of neocortical interactions: Canonical momenta indicatorsof electroencephalography". Physical Review E. 55 (4): 4578–4593. arXiv:physics/0001052. Bibcode:1997PhRvE..55.4578I. doi:10.1103/PhysRevE.55.4578. S2CID 6390999.
  263. ^ Hoffmann, Ulrich; Vesin, Jean-Marc; Ebrahimi, Touradj; Diserens, Karin (January 2008). "An efficient P300-based brain–computer interface for disabled subjects". Journal of Neuroscience Methods. 167 (1): 115–125. doi:10.1016/j.jneumeth.2007.03.005. PMID 17445904.
  264. ^ Donchin, Emanuel; Spencer, Kevin M.; Wijesinghe, Ranjith (2000). "The mental prosthesis: assessing the speed of a P300-based brain-computer interface". IEEE Transactions on Rehabilitation Engineering. 8 (2): 174–179. doi:10.1109/86.847808. PMID 10896179. S2CID 84043.
  265. ^ Detrano, Robert; et al. (1989). "International application of a new probability algorithm for the diagnosis of coronary artery disease". The American Journal of Cardiology. 64 (5): 304–310. doi:10.1016/0002-9149(89)90524-9. PMID 2756873.
  266. ^ Bradley, Andrew P (1997). "The use of the area under the ROC curve in the evaluation of machine learning algorithms" (PDF). Pattern Recognition. 30 (7): 1145–1159. Bibcode:1997PatRe..30.1145B. doi:10.1016/s0031-3203(96)00142-2. S2CID 13806304.
  267. ^ Street, W. N.; Wolberg, W. H.; Mangasarian, O. L. (1993). "Nuclear feature extraction for breast tumor diagnosis". In Acharya, Raj S.; Goldgof, Dmitry B. (eds.). Biomedical Image Processing and Biomedical Visualization. Vol. 1905. pp. 861–870. doi:10.1117/12.148698.
  268. ^ Demir, Cigdem; Yener, Bülent (2005). Automated cancer diagnosis based on histopathological images : a systematic survey (PDF) (Report). S2CID 8952443.
  269. ^ Abuse, Substance. "Mental Health Services Administration, Results from the 2010 National Survey on Drug Use and Health: Summary of National Findings, NSDUH Series H-41, HHS Publication No.(SMA) 11-4658." Rockville, MD: Substance Abuse and Mental Health Services Administration 201 (2011).
  270. ^ Hong, Zi-Quan; Yang, Jing-Yu (1991). "Optimal discriminant plane for a small number of samples and design method of classifier on the plane". Pattern Recognition. 24 (4): 317–324. Bibcode:1991PatRe..24..317H. doi:10.1016/0031-3203(91)90074-f.
  271. ^ a b Li, Jinyan; Wong, Limsoon (2003). "Using Rules to Analyse Bio-medical Data: A Comparison between C4.5 and PCL". Advances in Web-Age Information Management. Lecture Notes in Computer Science. Vol. 2762. pp. 254–265. doi:10.1007/978-3-540-45160-0_25. ISBN 978-3-540-40715-7.
  272. ^ Guvenir, H.A.; Acar, B.; Demiroz, G.; Cekin, A. (1997). "A supervised machine learning algorithm for arrhythmia analysis". Computers in Cardiology 1997. pp. 433–436. doi:10.1109/CIC.1997.647926. ISBN 0-7803-4445-6.
  273. ^ Lagus, Krista; Alhoniemi, Esa; Seppä, Jeremias; Honkela, Antti; Wagner, Paul (2005). "Independent Variable Group Analysis in Learning Compact Representations for Data" (PDF). International and Interdisciplinary Conference on Adaptive Knowledge Representation and Reasoning (AKRR'05), Helsinki, Finland, June 15-17, 2005. pp. 49–56.
  274. ^ Strack, Beata, et al. "Impact of HbA1c measurement on hospital readmission rates: analysis of 70,000 clinical database patient records." BioMed Research International 2014; 2014
  275. ^ Rubin, Daniel J (2015). "Hospital readmission of patients with diabetes". Current Diabetes Reports. 15 (4): 1–9. doi:10.1007/s11892-015-0584-7. PMID 25712258. S2CID 3908599.
  276. ^ Antal, Bálint; Hajdu, András (2014). "An ensemble-based system for automatic screening of diabetic retinopathy". Knowledge-Based Systems. 60 (2014): 20–27. arXiv:1410.8576. Bibcode:2014arXiv1410.8576A. doi:10.1016/j.knosys.2013.12.023. S2CID 13984326.
  277. ^ Haloi, Mrinal (2015). "Improved Microaneurysm Detection using Deep Neural Networks". arXiv:1505.04424 [cs.CV].
  278. ^ ELIE, Guillaume PATRY, Gervais GAUTHIER, Bruno LAY, Julien ROGER, Damien. "ADCIS Download Third Party: Messidor Database". adcis.net. Retrieved 25 February 2018.{{cite web}}: CS1 maint: multiple names: authors list (link)
  279. ^ Decencière, Etienne; Zhang, Xiwei; Cazuguel, Guy; Lay, Bruno; Cochener, Béatrice; Trone, Caroline; Gain, Philippe; Ordonez, Richard; Massin, Pascale; Erginay, Ali; Charton, Béatrice; Klein, Jean-Claude (26 August 2014). "Feedback on a Publicly Distributed Image Database: The Messidor Database". Image Analysis & Stereology. 33 (3): 231. doi:10.5566/ias.1155.
  280. ^ Bagirov, A. M.; Rubinov, A. M.; Soukhoroukova, N. V.; Yearwood, J. (June 2003). "Unsupervised and supervised data classification via nonsmooth and global optimization". Top. 11 (1): 1–75. doi:10.1007/bf02578945.
  281. ^ Fung, Glenn; Dundar, Murat; Bi, Jinbo; Rao, Bharat (2004). "A fast iterative algorithm for fisher discriminant using heterogeneous kernels". In Greiner, Russell; Schuurmans, Dale (eds.). Proceedings of the Twenty-first International Conference on Machine Learning. ACM. p. 40. doi:10.1145/1015330.1015409. ISBN 978-1-58113-838-2.
  282. ^ Quinlan, J. R.; Compton, P. J.; Horn, K. A.; Lazarus, L. (1987). "Inductive knowledge acquisition: a case study". In Quinlan, John Ross (ed.). Applications of Expert Systems: Based on the Proceedings of the Second Australian Conference. Turing Institute Press. pp. 137–156. ISBN 978-0-201-17449-6.
  283. ^ a b Zhi-Hua Zhou; Yuan Jiang (2004). "NeC4.5: Neural ensemble based C4.5". IEEE Transactions on Knowledge and Data Engineering. 16 (6): 770–773. doi:10.1109/tkde.2004.11.
  284. ^ Er, Orhan; et al. (2012). "An approach based on probabilistic neural network for diagnosis of Mesothelioma's disease". Computers & Electrical Engineering. 38 (1): 75–81. doi:10.1016/j.compeleceng.2011.09.001.
  285. ^ Er, Orhan; Tanrikulu, A. Çetin; Abakay, Abdurrahman (10 May 2015). "Use of artificial intelligence techniques for diagnosis of malignant pleural mesothelioma". Dicle Medical Journal / Dicle Tip Dergisi. 42 (1). doi:10.5798/diclemedj.0921.2015.01.0520 (inactive 23 November 2024).{{cite journal}}: CS1 maint: DOI inactive as of November 2024 (link)
  286. ^ Li, Michael H.; Mestre, Tiago A.; Fox, Susan H.; Taati, Babak (25 July 2017). "Vision-Based Assessment of Parkinsonism and Levodopa-Induced Dyskinesia with Deep Learning Pose Estimation". Journal of Neuroengineering and Rehabilitation. 15 (1): 97. arXiv:1707.09416. Bibcode:2017arXiv170709416L. doi:10.1186/s12984-018-0446-z. PMC 6219082. PMID 30400914.
  287. ^ Li, Michael H.; Mestre, Tiago A.; Fox, Susan H.; Taati, Babak (August 2018). "Automated assessment of levodopa-induced dyskinesia: Evaluating the responsiveness of video-based features". Parkinsonism & Related Disorders. 53: 42–45. doi:10.1016/j.parkreldis.2018.04.036. PMID 29748112.
  288. ^ "Parkinson's Vision-Based Pose Estimation Dataset | Kaggle". kaggle.com. Retrieved 22 August 2018.
  289. ^ Shannon, Paul; et al. (2003). "Cytoscape: a software environment for integrated models of biomolecular interaction networks". Genome Research. 13 (11): 2498–2504. doi:10.1101/gr.1239303. PMC 403769. PMID 14597658.
  290. ^ Javadi, Soroush; Mirroshandel, Seyed Abolghasem (June 2019). "A novel deep learning method for automatic assessment of human sperm images". Computers in Biology and Medicine. 109: 182–194. doi:10.1016/j.compbiomed.2019.04.030. PMID 31059902.
  291. ^ "soroushj/mhsma-dataset: MHSMA: The Modified Human Sperm Morphology Analysis Dataset". github.com. Retrieved 3 May 2019.
  292. ^ Clark, David, Zoltan Schreter, and Anthony Adams. "A quantitative comparison of dystal and backpropagation." Proceedings of 1996 Australian Conference on Neural Networks. 1996.
  293. ^ Jiang, Yuan, and Zhi-Hua Zhou. "Editing training data for kNN classifiers with neural network ensemble." Advances in Neural Networks–ISNN 2004. Springer Berlin Heidelberg, 2004. 356–361.
  294. ^ Ontañón, Santiago, and Enric Plaza. "On similarity measures based on a refinement lattice." Case-Based Reasoning Research and Development. Springer Berlin Heidelberg, 2009. 240–255.
  295. ^ "PLF data inventory". GitHub. 5 November 2021.
  296. ^ Higuera, Clara; Gardiner, Katheleen J.; Cios, Krzysztof J. (2015). "Self-organizing feature maps identify proteins critical to learning in a mouse model of down syndrome". PLOS ONE. 10 (6): e0129126. Bibcode:2015PLoSO..1029126H. doi:10.1371/journal.pone.0129126. PMC 4482027. PMID 26111164.
  297. ^ Ahmed, Md Mahiuddin; et al. (2015). "Protein dynamics associated with failed and rescued learning in the Ts65Dn mouse model of Down syndrome". PLOS ONE. 10 (3): e0119491. Bibcode:2015PLoSO..1019491A. doi:10.1371/journal.pone.0119491. PMC 4368539. PMID 25793384.
  298. ^ Langley, PAT (2014). "Trading off simplicity and coverage in incremental concept learning" (PDF). Machine Learning Proceedings. 1988: 73. Archived from the original (PDF) on 6 August 2019. Retrieved 6 August 2019.
  299. ^ "Mushroom Data Set 2020". mushroom.mathematik.uni-marburg.de. Retrieved 6 April 2021.
  300. ^ Wagner, Dennis; Heider, Dominik; Hattab, Georges (14 April 2021). "Mushroom data creation, curation, and simulation to support classification tasks". Scientific Reports. 11 (1): 8134. Bibcode:2021NatSR..11.8134W. doi:10.1038/s41598-021-87602-3. PMC 8046754. PMID 33854157.
  301. ^ Cortez, Paulo, and Aníbal de Jesus Raimundo Morais. "A data mining approach to predict forest fires using meteorological data." (2007).
  302. ^ Farquad, M. A. H.; Ravi, V.; Raju, S. Bapi (2010). "Support vector regression based hybrid rule extraction methods for forecasting". Expert Systems with Applications. 37 (8): 5577–5589. doi:10.1016/j.eswa.2010.02.055.
  303. ^ Fisher, Ronald A (1936). "The use of multiple measurements in taxonomic problems". Annals of Eugenics. 7 (2): 179–188. doi:10.1111/j.1469-1809.1936.tb02137.x. hdl:2440/15227.
  304. ^ Ghahramani, Zoubin, and Michael I. Jordan. "Supervised learning from incomplete data via an EM approach Archived 22 April 2017 at the Wayback Machine." Advances in neural information processing systems 6. 1994.
  305. ^ Mallah, Charles; Cope, James; Orwell, James (2013). "Plant Leaf Classification using Probabilistic Integration of Shape, Texture and Margin Features". Computer Graphics and Imaging / 798: Signal Processing, Pattern Recognition and Applications. doi:10.2316/P.2013.798-098. ISBN 978-0-88986-944-8.
  306. ^ Yahiaoui, Itheri; Mzoughi, Olfa; Boujemaa, Nozha (2012). "Leaf Shape Descriptor for Tree Species Identification". 2012 IEEE International Conference on Multimedia and Expo. pp. 254–259. doi:10.1109/ICME.2012.130. ISBN 978-1-4673-1659-0.
  307. ^ Tan, Ming; Eshelman, Larry (1988). "Using Weighted Networks to Represent Classification Knowledge in Noisy Domains". Machine Learning Proceedings 1988. pp. 121–134. doi:10.1016/B978-0-934613-64-4.50018-9. ISBN 978-0-934613-64-4.
  308. ^ Charytanowicz, Małgorzata, et al. "Complete gradient clustering algorithm for features analysis of x-ray images." Information technologies in biomedicine. Springer Berlin Heidelberg, 2010. 15–24.
  309. ^ Sanchez, Mauricio A.; et al. (2014). "Fuzzy granular gravitational clustering algorithm for multivariate data". Information Sciences. 279: 498–511. doi:10.1016/j.ins.2014.04.005.
  310. ^ Blackard, Jock A.; Dean, Denis J. (December 1999). "Comparative accuracies of artificial neural networks and discriminant analysis in predicting forest cover types from cartographic variables". Computers and Electronics in Agriculture. 24 (3): 131–151. Bibcode:1999CEAgr..24..131B. doi:10.1016/s0168-1699(99)00046-0.
  311. ^ Fürnkranz, Johannes (2001). "Round Robin Rule Learning" (PDF). In Danyluk, Andrea Pohoreckyj; Brodley, Carla E. (eds.). Machine Learning: Proceedings of the Eighteenth International Conference (ICML 2001) : Williams College, June 28-July 1, 2001. Morgan Kaufmann Publishers. pp. 146–153. ISBN 978-1-55860-778-1.
  312. ^ Li, Song; Assmann, Sarah M.; Albert, Réka (2006). "Predicting essential components of signal transduction networks: a dynamic model of guard cell abscisic acid signaling". PLOS Biol. 4 (10): e312. arXiv:q-bio/0610012. Bibcode:2006q.bio....10012L. doi:10.1371/journal.pbio.0040312. PMC 1564158. PMID 16968132.
  313. ^ Munisami, Trishen; et al. (2015). "Plant Leaf Recognition Using Shape Features and Colour Histogram with K-nearest Neighbour Classifiers". Procedia Computer Science. 58: 740–747. doi:10.1016/j.procs.2015.08.095.
  314. ^ Li, Bai (2016). "Atomic potential matching: An evolutionary target recognition approach based on edge features". Optik. 127 (5): 3162–3168. Bibcode:2016Optik.127.3162L. doi:10.1016/j.ijleo.2015.11.186.
  315. ^ Razavian, Ali, et al. "CNN features off-the-shelf: an astounding baseline for recognition." Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops. 2014.
  316. ^ Nilsback, Maria-Elena, and Andrew Zisserman. "A visual vocabulary for flower classification."Computer Vision and Pattern Recognition, 2006 IEEE Computer Society Conference on. Vol. 2. IEEE, 2006.
  317. ^ Giselsson, Thomas M.; et al. (2017). "A Public Image Database for Benchmark of Plant Seedling Classification Algorithms". arXiv:1711.05458 [cs.CV].
  318. ^ Oltean, Mihai (2017). "Fruits-360 dataset". GitHub.
  319. ^ Old, Richard (2024). "Weed-ID.App dataset".
  320. ^ Rahman, Abdur (2022). "Performance evaluation of deep learning object detectors for weed detection for cotton". ScienceDirect.
  321. ^ Nakai, Kenta; Kanehisa, Minoru (1991). "Expert system for predicting protein localization sites in gram-negative bacteria". Proteins: Structure, Function, and Bioinformatics. 11 (2): 95–110. doi:10.1002/prot.340110203. PMID 1946347. S2CID 27606447.
  322. ^ Ling, Charles X., et al. "Decision trees with minimal costs." Proceedings of the twenty-first international conference on Machine learning. ACM, 2004.
  323. ^ Mahé, Pierre, et al. "Automatic identification of mixed bacterial species fingerprints in a MALDI-TOF mass-spectrum." Bioinformatics (2014): btu022.
  324. ^ Barbano, Duane; et al. (2015). "Rapid characterization of microalgae and microalgae mixtures using matrix-assisted laser desorption ionization time-of-flight mass spectrometry (MALDI-TOF MS)". PLOS ONE. 10 (8): e0135337. Bibcode:2015PLoSO..1035337B. doi:10.1371/journal.pone.0135337. PMC 4536233. PMID 26271045.
  325. ^ Horton, Paul; Nakai, Kenta (1996). "A probabilistic classification system for predicting the cellular localization sites of proteins" (PDF). ISMB-96 Proceedings. 4: 109–15. PMID 8877510. Archived from the original (PDF) on 4 November 2021. Retrieved 6 August 2019.
  326. ^ Allwein, Erin L.; Schapire, Robert E.; Singer, Yoram (2001). "Reducing multiclass to binary: A unifying approach for margin classifiers" (PDF). The Journal of Machine Learning Research. 1: 113–141.
  327. ^ Mayr, Andreas; Klambauer, Guenter; Unterthiner, Thomas; Hochreiter, Sepp (2016). "DeepTox: Toxicity Prediction Using Deep Learning". Frontiers in Environmental Science. 3: 80. doi:10.3389/fenvs.2015.00080.
  328. ^ Lavin, Alexander; Ahmad, Subutai (12 October 2015). "Evaluating Real-Time Anomaly Detection Algorithms -- the Numenta Anomaly Benchmark". 2015 IEEE 14th International Conference on Machine Learning and Applications (ICMLA). pp. 38–44. arXiv:1510.03336. doi:10.1109/ICMLA.2015.141. ISBN 978-1-5090-0287-0. S2CID 6842305.
  329. ^ Iurii D. Katser; Vyacheslav O. Kozitsin. "SKAB GitHub repository". GitHub. Retrieved 12 January 2021.
  330. ^ Iurii D. Katser; Vyacheslav O. Kozitsin (2020). "Skoltech Anomaly Benchmark (SKAB)". Kaggle. doi:10.34740/KAGGLE/DSV/1693952. Retrieved 12 January 2021. {{cite journal}}: Cite journal requires |journal= (help)
  331. ^ Campos, Guilherme O.; Zimek, Arthur; Sander, Jörg; Campello, Ricardo J. G. B.; Micenková, Barbora; Schubert, Erich; Assent, Ira; Houle, Michael E. (July 2016). "On the evaluation of unsupervised outlier detection: measures, datasets, and an empirical study". Data Mining and Knowledge Discovery. 30 (4): 891–927. doi:10.1007/s10618-015-0444-8.
  332. ^ Ann-Kathrin Hartmann, Tommaso Soru, Edgard Marx. Generating a Large Dataset for Neural Question Answering over the DBpedia Knowledge Base. 2018.
  333. ^ Soru, Tommaso; Marx, Edgard; Moussallem, Diego; Publio, Gustavo; Valdestilhas, André; Esteves, Diego; Neto, Ciro Baron (2017). SPARQL as a Foreign Language (Preprint). arXiv:1708.07624.
  334. ^ Kiet Van Nguyen, Duc-Vu Nguyen, Anh Gia-Tuan Nguyen, Ngan Luu-Thuy Nguyen. A Vietnamese Dataset for Evaluating Machine Reading Comprehension. COLING 2020.
  335. ^ Nguyen, Kiet Van; Tran, Khiem Vinh; Luu, Son T.; Nguyen, Anh Gia-Tuan; Nguyen, Ngan Luu-Thuy (2020). "Enhancing Lexical-Based Approach With External Knowledge for Vietnamese Multiple-Choice Machine Reading Comprehension". IEEE Access. 8: 201404–201417. Bibcode:2020IEEEA...8t1404N. doi:10.1109/ACCESS.2020.3035701.
  336. ^ Anantha, Raviteja; Vakulenko, Svitlana; Tu, Zhucheng; Longpre, Shayne; Pulman, Stephen; Chappidi, Srinivas (2020). "Open-Domain Question Answering Goes Conversational via Question Rewriting". arXiv:2010.04898 [cs.IR].
  337. ^ Khashabi, Daniel; Min, Sewon; Khot, Tushar; Sabharwal, Ashish; Tafjord, Oyvind; Clark, Peter; Hajishirzi, Hannaneh (November 2020). "UNIFIEDQA: Crossing Format Boundaries with a Single QA System". Findings of the Association for Computational Linguistics: EMNLP 2020. Online: Association for Computational Linguistics: 1896–1907. arXiv:2005.00700. doi:10.18653/v1/2020.findings-emnlp.171. S2CID 218487109.
  338. ^ Taskmaster, Google Research Datasets, 17 December 2022, retrieved 7 January 2023
  339. ^ Byrne, Bill; Krishnamoorthi, Karthik; Sankar, Chinnadhurai; Neelakantan, Arvind; Duckworth, Daniel; Yavuz, Semih; Goodrich, Ben; Dubey, Amit; Cedilnik, Andy; Kim, Kyu-Young (1 September 2019). "Taskmaster-1: Toward a Realistic and Diverse Dialog Dataset". arXiv:1909.05358 [cs.CL].
  340. ^ Yasunaga, Michihiro; Liang, Percy (21 November 2020). "Graph-based, Self-Supervised Program Repair from Diagnostic Feedback". International Conference on Machine Learning. PMLR: 10799–10808. arXiv:2005.10636.
  341. ^ Wang, Yizhong; Mishra, Swaroop; Alipoormolabashi, Pegah; Kordi, Yeganeh; Mirzaei, Amirreza; Arunkumar, Anjana; Ashok, Arjun; Dhanasekaran, Arut Selvan; Naik, Atharva; Stap, David; Pathak, Eshaan; Karamanolakis, Giannis; Lai, Haizhi Gary; Purohit, Ishan; Mondal, Ishani (24 October 2022). "Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks". arXiv:2204.07705 [cs.CL].
  342. ^ Paperno, Denis; Kruszewski, Germán; Lazaridou, Angeliki; Pham, Quan Ngoc; Bernardi, Raffaella; Pezzelle, Sandro; Baroni, Marco; Boleda, Gemma; Fernández, Raquel (7 August 2016), The LAMBADA dataset, doi:10.5281/zenodo.2630551, retrieved 7 January 2023
  343. ^ Paperno, Denis; Kruszewski, Germán; Lazaridou, Angeliki; Pham, Ngoc Quan; Bernardi, Raffaella; Pezzelle, Sandro; Baroni, Marco; Boleda, Gemma; Fernández, Raquel (August 2016). "The LAMBADA dataset: Word prediction requiring a broad discourse context". Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Berlin, Germany: Association for Computational Linguistics: 1525–1534. doi:10.18653/v1/P16-1144. hdl:10230/32702. S2CID 2381275.
  344. ^ Wei, Jason; Bosma, Maarten; Zhao, Vincent; Guu, Kelvin; Yu, Adams Wei; Lester, Brian; Du, Nan; Dai, Andrew M.; Le, Quoc V. (10 February 2022). Finetuned Language Models are Zero-Shot Learners (Preprint). arXiv:2109.01652.
  345. ^ "Working with ATT&CK | MITRE ATT&CK®". attack.mitre.org. Retrieved 14 January 2023.
  346. ^ "CAPEC - Common Attack Pattern Enumeration and Classification (CAPEC™)". capec.mitre.org. Retrieved 14 January 2023.
  347. ^ "CVE - Home". cve.mitre.org. Retrieved 14 January 2023.
  348. ^ "CWE - Common Weakness Enumeration". cwe.mitre.org. Retrieved 14 January 2023.
  349. ^ Lim, Swee Kiat; Muis, Aldrian Obaja; Lu, Wei; Ong, Chen Hui (July 2017). "MalwareTextDB: A Database for Annotated Malware Articles". Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Vancouver, Canada: Association for Computational Linguistics: 1557–1567. doi:10.18653/v1/P17-1143. S2CID 7816596.
  350. ^ "USENIX". USENIX. Retrieved 19 January 2023.
  351. ^ "APTnotes | Read the Docs". readthedocs.org. Retrieved 19 January 2023.
  352. ^ "Cryptography and Security authors/titles recent submissions". arxiv.org. Retrieved 19 January 2023.
  353. ^ "Holistic Info-Sec for Web Developers - Fascicle 0". f0.holisticinfosecforwebdevelopers.com. Retrieved 20 January 2023.
  354. ^ "Holistic Info-Sec for Web Developers - Fascicle 1". f1.holisticinfosecforwebdevelopers.com. Retrieved 20 January 2023.
  355. ^ Vincent, Adam. "Web Services Web Services Hacking and Hardening" (PDF). owasp.org.
  356. ^ McCray, Joe. "Advanced SQL Injection" (PDF). defcon.org.
  357. ^ Shah, Shreeraj. "Blind SQL injection discovery & exploitation technique" (PDF). blueinfy.com.
  358. ^ Palcer, C. C. "Ethical hacking" (PDF). textfiles.
  359. ^ "Hacking Secrets Revealed - Information and Instructional Guide" (PDF).
  360. ^ Park, Alexis. "Hack any website" (PDF).
  361. ^ Cerrudo, Cesar; Martinez Fayo, Esteban. "Hacking Databases for Owning your Data" (PDF). blackhat.
  362. ^ O'Connor, Tj. "Violent Python-A Cookbook for Hackers, Forensic Analysts, Penetration Testers and Security Engineers" (PDF). Github.
  363. ^ Grand, Joe. "Hardware Reverse Engineering: Access, Analyze, & Defeat" (PDF). blackhat.
  364. ^ Chang, Jason V. "Computer Hacking: Making the Case for National Reporting Requirement" (PDF). cyber.harvard.edu.
  365. ^ "National Cybersecurity Strategies Repository". ITU. Retrieved 20 January 2023.
  366. ^ Chen, Yanlin (31 August 2022), Cyber Security Natural Language Processing, retrieved 20 January 2023
  367. ^ Zampieri, Marcos; Malmasi, Shervin; Nakov, Preslav; Rosenthal, Sara; Farra, Noura; Kumar, Ritesh (16 April 2019). "Predicting the Type and Target of Offensive Posts in Social Media". arXiv:1902.09666 [cs.CL].
  368. ^ "Threat reports". www.ncsc.gov.uk. Retrieved 20 January 2023.
  369. ^ "Category: APT reports | Securelist". securelist.com. Retrieved 23 January 2023.
  370. ^ "Your Cybersecurity News Connection - Cyber News | CyberWire". The CyberWire. Retrieved 23 January 2023.
  371. ^ "News". 21 August 2016. Retrieved 23 January 2023.
  372. ^ "Cybernews". Cybernews.
  373. ^ "BleepingComputer". BleepingComputer. Retrieved 23 January 2023.
  374. ^ "Homepage". The Record from Recorded Future News. Retrieved 23 January 2023.
  375. ^ "HackRead | Latest Cyber Crime - InfoSec- Tech - Hacking News". 8 January 2022. Retrieved 23 January 2023.
  376. ^ "Securelist | Kaspersky's threat research and reports". securelist.com. Retrieved 31 January 2023.
  377. ^ Harshaw, Christopher R.; Bridges, Robert A.; Iannacone, Michael D.; Reed, Joel W.; Goodall, John R. (5 April 2016). "GraphPrints". Proceedings of the 11th Annual Cyber and Information Security Research Conference. CISRC '16. New York, NY, USA: Association for Computing Machinery. pp. 1–4. doi:10.1145/2897795.2897806. ISBN 978-1-4503-3752-6.
  378. ^ "Farsight Security, cyber security intelligence solutions". Farsight Security. Retrieved 13 February 2023.
  379. ^ "Schneier on Security". www.schneier.com. Retrieved 13 February 2023.
  380. ^ "#1 in Cloud Security & Endpoint Cybersecurity". Trend Micro. Retrieved 13 February 2023.
  381. ^ "The Hacker News | #1 Trusted Cybersecurity News Site". The Hacker News. Retrieved 13 February 2023.
  382. ^ "Krebs on Security – In-depth security news and investigation". Retrieved 25 February 2023.
  383. ^ "MITRE D3FEND Knowledge Graph". d3fend.mitre.org. Retrieved 31 March 2023.
  384. ^ "MITRE | ATLAS™". atlas.mitre.org. Retrieved 31 March 2023.
  385. ^ "MITRE Engage™ | An Adversary Engagement Framework from MITRE". Retrieved 1 April 2023.
  386. ^ "Hacking Tutorials - The best Step-by-Step Hacking Tutorials". Hacking Tutorials. Retrieved 1 April 2023.
  387. ^ "TCFD Knowledge Hub". TCFD Knowledge Hub. Retrieved 3 February 2023.
  388. ^ "ResponsibilityReports.com". www.responsibilityreports.com. Retrieved 3 February 2023.
  389. ^ "About — IPCC". Retrieved 20 February 2023.
  390. ^ "Alliance for Research on Corporate Sustainability | ARCS serves as a vehicle for advancing rigorous academic research on corporate sustainability issues". corporate-sustainability.org. Retrieved 2 March 2023.
  391. ^ Mehra, Srishti; Louka, Robert; Zhang, Yixun (2022). "ESGBERT: Language Model to Help with Classification Tasks Related to Companies' Environmental, Social, and Governance Practices". Embedded Systems and Applications. pp. 183–190. doi:10.5121/csit.2022.120616. ISBN 978-1-925953-65-7.
  392. ^  This article incorporates text available under the CC BY 4.0 license.
  393. ^ Diggelmann, Thomas; Boyd-Graber, Jordan; Bulian, Jannis; Ciaramita, Massimiliano; Leippold, Markus (2 January 2021). "CLIMATE-FEVER: A Dataset for Verification of Real-World Climate Claims". arXiv:2012.00614 [cs.CL].
  394. ^ "climate-news-db". www.climate-news-db.com. Retrieved 3 February 2023.
  395. ^ "Climatext". www.sustainablefinance.uzh.ch. Retrieved 19 February 2023.
  396. ^ "Greenbiz". www.greenbiz.com. Retrieved 2 March 2023.
  397. ^ "Explore the @Reuters Hot List of 1,000 top climate scientists". Reuters. Retrieved 22 March 2023.
  398. ^ "Blogs | Alliance for Research on Corporate Sustainability". corporate-sustainability.org. Retrieved 27 March 2023.
  399. ^ "Greenbiz". www.greenbiz.com. Retrieved 29 March 2023.
  400. ^ "CSR News". www.csrwire.com. Retrieved 29 March 2023.
  401. ^ "CDP Homepage". www.cdp.net. Retrieved 29 March 2023.
  402. ^ de Vries, Harm (2022). "The Stack: 3 TB of permissively licensed source code". arXiv:2211.15533 [cs.CL].
  403. ^ "The Stack Dedup". Huggingface. Retrieved 29 August 2023.
  404. ^ "Hybrid cloud blog". content.cloud.redhat.com. Retrieved 9 April 2023.
  405. ^ "Production-Grade Container Orchestration". Kubernetes. Retrieved 9 April 2023.
  406. ^ "Home | Official Red Hat OpenShift Documentation". docs.openshift.com. Retrieved 9 April 2023.
  407. ^ "Cloud Native Computing Foundation". Cloud Native Computing Foundation. Retrieved 9 April 2023.
  408. ^ CNCF Community Presentations, Cloud Native Computing Foundation (CNCF), 11 April 2023, retrieved 11 April 2023
  409. ^ "Red Hat - We make open source technologies for the enterprise". www.redhat.com. Retrieved 1 May 2023.
  410. ^ Brown, Michael Scott; Pelosi, Michael J.; Dirska, Henry (2013). "Dynamic-Radius Species-Conserving Genetic Algorithm for the Financial Forecasting of Dow Jones Index Stocks". Machine Learning and Data Mining in Pattern Recognition. Lecture Notes in Computer Science. Vol. 7988. pp. 27–41. doi:10.1007/978-3-642-39712-7_3. ISBN 978-3-642-39711-0.
  411. ^ Shen, Kao-Yi; Tzeng, Gwo-Hshiung (2015). "Fuzzy Inference-Enhanced VC-DRSA Model for Technical Analysis: Investment Decision Aid". International Journal of Fuzzy Systems. 17 (3): 375–389. doi:10.1007/s40815-015-0058-8. S2CID 68241024.
  412. ^ Quinlan, J.R. (September 1987). "Simplifying decision trees". International Journal of Man-Machine Studies. 27 (3): 221–234. doi:10.1016/s0020-7373(87)80053-6.
  413. ^ Hamers, Bart; Suykens, Johan AK; De Moor, Bart (2003). "Coupled transductive ensemble learning of kernel models" (PDF). Journal of Machine Learning Research. 1: 1–48.
  414. ^ Shmueli, Galit; Russo, Ralph P.; Jank, Wolfgang (December 2007). "The BARISTA: A model for bid arrivals in online auctions". The Annals of Applied Statistics. 1 (2). doi:10.1214/07-AOAS117.
  415. ^ Peng, Jie; Müller, Hans-Georg (September 2008). "Distance-based clustering of sparsely observed stochastic processes, with applications to online auctions". The Annals of Applied Statistics. 2 (3). doi:10.1214/08-AOAS172.
  416. ^ Eggermont, Jeroen; Kok, Joost N.; Kosters, Walter A. (2004). "Genetic Programming for data classification: Partitioning the search space". Proceedings of the 2004 ACM symposium on Applied computing. pp. 1001–1005. doi:10.1145/967900.968104. ISBN 978-1-58113-812-2.
  417. ^ Moro, Sérgio; Cortez, Paulo; Rita, Paulo (2014). "A data-driven approach to predict the success of bank telemarketing". Decision Support Systems. 62: 22–31. doi:10.1016/j.dss.2014.03.001. hdl:10071/9499. S2CID 14181100.
  418. ^ Payne, Richard D.; Mallick, Bani K. (2014). "Bayesian Big Data Classification: A Review with Complements". arXiv:1411.5653 [stat.ME].
  419. ^ Akbilgic, Oguz; Bozdogan, Hamparsum; Balaban, M. Erdal (2014). "A novel Hybrid RBF Neural Networks model as a forecaster". Statistics and Computing. 24 (3): 365–375. doi:10.1007/s11222-013-9375-7. S2CID 17764829.
  420. ^ Jabin, Suraiya (20 August 2014). "Stock Market Prediction using Feed-forward Artificial Neural Network". International Journal of Computer Applications. 99 (9): 4–8. Bibcode:2014IJCA...99i...4J. doi:10.5120/17399-7959.
  421. ^ Yeh, I-Cheng; Che-hui, Lien (2009). "The comparisons of data mining techniques for the predictive accuracy of probability of default of credit card clients". Expert Systems with Applications. 36 (2): 2473–2480. doi:10.1016/j.eswa.2007.12.020. S2CID 15696161.
  422. ^ Lin, Shu Ling (2009). "A new two-stage hybrid approach of credit risk in banking industry". Expert Systems with Applications. 36 (4): 8333–8341. doi:10.1016/j.eswa.2008.10.015.
  423. ^ Xu, Yumo; Cohen, Shay B. (2018). "Stock Movement Prediction from Tweets and Historical Prices". Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). pp. 1970–1979. doi:10.18653/v1/P18-1183.
  424. ^ Pelckmans, Kristiaan; et al. (2005). "The differogram: Non-parametric noise variance estimation and its use for model selection". Neurocomputing. 69 (1): 100–122. doi:10.1016/j.neucom.2005.02.015.
  425. ^ Bay, Stephen D.; Kibler, Dennis; Pazzani, Michael J.; Smyth, Padhraic (December 2000). "The UCI KDD archive of large data sets for data mining research and experimentation". ACM SIGKDD Explorations Newsletter. 2 (2): 81–85. doi:10.1145/380995.381030.
  426. ^ Lucas, D. D.; et al. (2015). "Designing optimal greenhouse gas observing networks that consider performance and cost". Geoscientific Instrumentation, Methods and Data Systems. 4 (1): 121. Bibcode:2015GI......4..121L. doi:10.5194/gi-4-121-2015.
  427. ^ Pales, Jack C.; Keeling, Charles D. (1965). "The concentration of atmospheric carbon dioxide in Hawaii". Journal of Geophysical Research. 70 (24): 6053–6076. Bibcode:1965JGR....70.6053P. doi:10.1029/jz070i024p06053.
  428. ^ Sigillito, Vincent G., et al. "Classification of radar returns from the ionosphere using neural networks." Johns Hopkins APL Technical Digest10.3 (1989): 262–266.
  429. ^ Zhang, Kun; Fan, Wei (March 2008). "Forecasting skewed biased stochastic ozone days: analyses, solutions and beyond". Knowledge and Information Systems. 14 (3): 299–326. doi:10.1007/s10115-007-0095-1.
  430. ^ Reich, Brian J.; Fuentes, Montserrat; Dunson, David B. (March 2011). "Bayesian Spatial Quantile Regression". Journal of the American Statistical Association. 106 (493): 6–20. doi:10.1198/jasa.2010.ap09237. PMC 3583387. PMID 23459794.
  431. ^ Kohavi, Ron (1996). "Scaling Up the Accuracy of Naive-Bayes Classifiers: A Decision-Tree Hybrid". KDD. 96.
  432. ^ Oza, Nikunj C., and Stuart Russell. "Experimental comparisons of online and batch versions of bagging and boosting." Proceedings of the seventh ACM SIGKDD international conference on Knowledge discovery and data mining. ACM, 2001.
  433. ^ Bay, Stephen D. (November 2001). "Multivariate Discretization for Set Mining". Knowledge and Information Systems. 3 (4): 491–512. doi:10.1007/pl00011680.
  434. ^ Ruggles, Steven (1995). "Sample designs and sampling errors". Historical Methods. 28 (1): 40–46. doi:10.1080/01615440.1995.9955312.
  435. ^ Meek, Christopher, Bo Thiesson, and David Heckerman. "The Learning Curve Method Applied to Clustering." AISTATS. 2001.
  436. ^ Fanaee-T, Hadi; Gama, Joao (2013). "Event labeling combining ensemble detectors and background knowledge". Progress in Artificial Intelligence. 2 (2–3): 113–127. doi:10.1007/s13748-013-0040-3. S2CID 3345087.
  437. ^ Giot, Romain; Cherrier, Raphael (2014). "Predicting bikeshare system usage up to one day ahead". 2014 IEEE Symposium on Computational Intelligence in Vehicles and Transportation Systems (CIVTS) (PDF). pp. 22–29. doi:10.1109/CIVTS.2014.7009473. ISBN 978-1-4799-4497-2.
  438. ^ Zhan, Xianyuan; et al. (2013). "Urban link travel time estimation using large-scale taxi data with partial information". Transportation Research Part C: Emerging Technologies. 33: 37–49. Bibcode:2013TRPC...33...37Z. doi:10.1016/j.trc.2013.04.001.
  439. ^ Moreira-Matias, Luis; et al. (2013). "Predicting taxi–passenger demand using streaming data". IEEE Transactions on Intelligent Transportation Systems. 14 (3): 1393–1402. doi:10.1109/tits.2013.2262376. S2CID 14764358.
  440. ^ Hwang, Ren-Hung; Hsueh, Yu-Ling; Chen, Yu-Ting (2015). "An effective taxi recommender system based on a spatio-temporal factor analysis model". Information Sciences. 314: 28–40. doi:10.1016/j.ins.2015.03.068.
  441. ^ H. V. Jagadish, Johannes Gehrke, Alexandros Labrinidis, Yannis Papakonstantinou, Jignesh M. Patel, Raghu Ramakrishnan, and Cyrus Shahabi. Big data and its technical challenges. Commun. ACM, 57(7):86–94, July 2014.
  442. ^ Caltrans PeMS
  443. ^ Meusel, Robert, et al. "The Graph Structure in the Web—Analyzed on Different Aggregation Levels."The Journal of Web Science 1.1 (2015).
  444. ^ Kushmerick, Nicholas (1999). "Learning to remove Internet advertisements". Proceedings of the third annual conference on Autonomous Agents. pp. 175–181. doi:10.1145/301136.301186. ISBN 978-1-58113-066-9.
  445. ^ Fradkin, Dmitriy; Madigan, David (2003). "Experiments with random projections for machine learning". Proceedings of the ninth ACM SIGKDD international conference on Knowledge discovery and data mining. pp. 517–522. doi:10.1145/956750.956812. ISBN 978-1-58113-737-8.
  446. ^ This data was used in the American Statistical Association Statistical Graphics and Computing Sections 1999 Data Exposition.
  447. ^ Ma, Justin; Saul, Lawrence K.; Savage, Stefan; Voelker, Geoffrey M. (2009). "Identifying suspicious URLs: An application of large-scale online learning". Proceedings of the 26th Annual International Conference on Machine Learning. pp. 681–688. doi:10.1145/1553374.1553462. ISBN 978-1-60558-516-1.
  448. ^ Levchenko, K.; Pitsillidis, A.; Chachra, N.; Enright, B.; Felegyhazi, M.; Grier, C.; Halvorson, T.; Kanich, C.; Kreibich, C.; He Liu; McCoy, D.; Weaver, N.; Paxson, V.; Voelker, G. M.; Savage, S. (2011). "Click Trajectories: End-to-End Analysis of the Spam Value Chain". 2011 IEEE Symposium on Security and Privacy. pp. 431–446. doi:10.1109/SP.2011.24. ISBN 978-0-7695-4402-1.
  449. ^ Mohammad, Rami M., Fadi Thabtah, and Lee McCluskey. "An assessment of features related to phishing websites using an automated technique."Internet Technology And Secured Transactions, 2012 International Conference for. IEEE, 2012.
  450. ^ Singh, Ashishkumar; Rumantir, Grace; South, Annie; Bethwaite, Blair (2014). "Clustering Experiments on Big Transaction Data for Market Segmentation". Proceedings of the 2014 International Conference on Big Data Science and Computing. pp. 1–7. doi:10.1145/2640087.2644161. ISBN 978-1-4503-2891-3.
  451. ^ Bollacker, Kurt; Evans, Colin; Paritosh, Praveen; Sturge, Tim; Taylor, Jamie (2008). "Freebase: A collaboratively created graph database for structuring human knowledge". Proceedings of the 2008 ACM SIGMOD international conference on Management of data. pp. 1247–1250. doi:10.1145/1376616.1376746. ISBN 978-1-60558-102-6.
  452. ^ Mintz, Mike, et al. "Distant supervision for relation extraction without labeled data." Proceedings of the Joint Conference of the 47th Annual Meeting of the ACL and the 4th International Joint Conference on Natural Language Processing of the AFNLP: Volume 2-Volume 2. Association for Computational Linguistics, 2009.
  453. ^ Mesterharm, Chris; Pazzani, Michael J. (2011). "Active learning using on-line algorithms". Proceedings of the 17th ACM SIGKDD international conference on Knowledge discovery and data mining. pp. 850–858. doi:10.1145/2020408.2020553. ISBN 978-1-4503-0813-7.
  454. ^ Wang, Shusen; Zhang, Zhihua (2013). "Improving CUR matrix decomposition and the Nyström approximation via adaptive sampling" (PDF). The Journal of Machine Learning Research. 14 (1): 2729–2769. arXiv:1303.4207. Bibcode:2013arXiv1303.4207W.
  455. ^ a b "The Pile". pile.eleuther.ai. Retrieved 14 April 2022.
  456. ^ "JSON Lines". jsonlines.org. Retrieved 14 April 2022.
  457. ^ Gao, Leo; Biderman, Stella; Black, Sid; Golding, Laurence; Hoppe, Travis; Foster, Charles; Phang, Jason; He, Horace; Thite, Anish; Nabeshima, Noa; Presser, Shawn (31 December 2020). "The Pile: An 800GB Dataset of Diverse Text for Language Modeling". arXiv:2101.00027 [cs.CL].
  458. ^ "OSCAR". oscar-project.org. Retrieved 12 August 2023.
  459. ^ Ortiz Suarez, Pedro, et al. "[2]." Asynchronous Pipeline for Processing Huge Corpora on Medium to Low Resource Infrastructures. CMLC-7, 2019.
  460. ^ Abadji, Julien, et al. "[3]." Towards a Cleaner Document-Oriented Multilingual Crawled Corpus. LREC, 2022.
  461. ^ Cohen, Vanya. "OpenWebTextCorpus". OpenWebTextCorpus. Retrieved 9 January 2023.
  462. ^ "openwebtext · Datasets at Hugging Face". huggingface.co. 16 November 2022. Retrieved 9 January 2023.
  463. ^ Saulnier, Lucile (2023). "The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset". arXiv:2303.03915 [cs.CL].
  464. ^ "BigScience Data · Datasets at Hugging Face". huggingface.co. 29 August 2023. Retrieved 29 August 2023.
  465. ^ Cattral, Robert; Oppacher, Franz; Deugo, Dwight (2002). "Evolutionary data mining with automatic rule generalization". Recent Advances in Computers, Computing and Communications: 296–300. S2CID 18625415.
  466. ^ Burton, Ariel N.; Kelly, Paul H.J. (August 2006). "Performance prediction of paging workloads using lightweight tracing". Future Generation Computer Systems. 22 (7): 784–793. doi:10.1016/j.future.2006.02.003.
  467. ^ Bain, M.; Muggleton, S. (1994). "Learning Optimal Chess Strategies". Machine Intelligence 13. pp. 291–309. doi:10.1093/oso/9780198538509.003.0012. ISBN 978-0-19-853850-9.
  468. ^ Quinlan, J. Ross (1983). "Learning Efficient Classification Procedures and Their Application to Chess End Games". Machine Learning. pp. 463–482. doi:10.1007/978-3-662-12405-5_15. ISBN 978-3-662-12407-9.
  469. ^ Shapiro, Alen D. (1987). Structured induction in expert systems. Addison-Wesley Longman Publishing Co., Inc.
  470. ^ Matheus, Christopher J.; Rendell, Larry A. (1989). "Constructive Induction on Decision Trees" (PDF). IJCAI. 89. S2CID 11018089.
  471. ^ Belsley, David A., Edwin Kuh, and Roy E. Welsch. Regression diagnostics: Identifying influential data and sources of collinearity. Vol. 571. John Wiley & Sons, 2005.
  472. ^ Ruotsalo, Tuukka; Aroyo, Lora; Schreiber, Guus (2009). "Knowledge-based linguistic annotation of digital cultural heritage collections" (PDF). IEEE Intelligent Systems. 24 (2): 64–75. doi:10.1109/MIS.2009.32. hdl:1871.1/9f6091aa-9596-46a9-9251-f11edeeb28b7. S2CID 6667472. Archived from the original (PDF) on 16 August 2017. Retrieved 6 December 2018.
  473. ^ Li, Lihong; Chu, Wei; Langford, John; Wang, Xuanhui (2011). "Unbiased offline evaluation of contextual-bandit-based news article recommendation algorithms". Proceedings of the fourth ACM international conference on Web search and data mining. pp. 297–306. arXiv:1003.5956. doi:10.1145/1935826.1935878. ISBN 978-1-4503-0493-1.
  474. ^ Yeung, Kam Fung; Yang, Yanyan (2010). "A Proactive Personalized Mobile News Recommendation System". 2010 Developments in E-systems Engineering. pp. 207–212. doi:10.1109/DeSE.2010.40. ISBN 978-1-4244-8044-9.
  475. ^ Gass, Susan E.; Roberts, J. Murray (2006). "The occurrence of the cold-water coral Lophelia pertusa (Scleractinia) on oil and gas platforms in the North Sea: colony growth, recruitment and environmental controls on distribution". Marine Pollution Bulletin. 52 (5): 549–559. Bibcode:2006MarPB..52..549G. doi:10.1016/j.marpolbul.2005.10.002. PMID 16300800.
  476. ^ Gionis, Aristides; Mannila, Heikki; Tsaparas, Panayiotis (March 2007). "Clustering aggregation". ACM Transactions on Knowledge Discovery from Data. 1 (1): 4. doi:10.1145/1217299.1217303.
  477. ^ Obradovic, Zoran, and Slobodan Vucetic.Challenges in Scientific Data Mining: Heterogeneous, Biased, and Large Samples. Technical Report, Center for Information Science and Technology Temple University, 2004.
  478. ^ Van Der Putten, Peter; van Someren, Maarten (2000). "CoIL challenge 2000: The insurance company case". Published by Sentient Machine Research, Amsterdam. Also a Leiden Institute of Advanced Computer Science Technical Report. 9: 1–43.
  479. ^ Mao, K. Z. (2002). "RBF neural network center selection based on Fisher ratio class separability measure". IEEE Transactions on Neural Networks. 13 (5): 1211–1217. doi:10.1109/tnn.2002.1031953. PMID 18244518.
  480. ^ Olave, Manuel; Rajkovic, Vladislav; Bohanec, Marko (1989). "An application for admission in public school systems" (PDF). Expert Systems in Public Administration. 1: 145–160.
  481. ^ Lizotte, Daniel J.; Madani, Omid; Greiner, Russell (2012). "Budgeted Learning of Naive-Bayes Classifiers". arXiv:1212.2472 [cs.LG].
  482. ^ Lebowitz, Michael (1984). Concept Learning in a Rich Input Domain: Generalization-Based Memory (Report). doi:10.7916/D8KP8990.
  483. ^ Yeh, I-Cheng; Yang, King-Jang; Ting, Tao-Ming (2009). "Knowledge discovery on RFM model using Bernoulli sequence". Expert Systems with Applications. 36 (3): 5866–5871. doi:10.1016/j.eswa.2008.07.018.
  484. ^ Lee, Wen-Chen; Cheng, Bor-Wen (2011). "An intelligent system for improving performance of blood donation". Journal of Quality Vol. 18 (2): 173.
  485. ^ Schmidtmann, Irene, et al. "Evaluation des Krebsregisters NRW Schwerpunkt Record Linkage Archived 6 December 2018 at the Wayback Machine." Abschlußbericht vom 11 (2009).
  486. ^ Sariyar, Murat; Borg, Andreas; Pommerening, Klaus (2011). "Controlling false match rates in record linkage using extreme value theory". Journal of Biomedical Informatics. 44 (4): 648–654. doi:10.1016/j.jbi.2011.02.008. PMID 21352952.
  487. ^ Candillier, Laurent; Lemaire, Vincent (August 2013). "Active learning in the real-world design and analysis of the Nomao challenge". The 2013 International Joint Conference on Neural Networks (IJCNN). Vol. 8. pp. 1–8. doi:10.1109/IJCNN.2013.6706908. ISBN 978-1-4673-6129-3.
  488. ^ Garrido Marquez, Ivan (2013). A domain adaptation method for text classification based on self-adjusted training approach (Thesis).[page needed]
  489. ^ Nagesh, Harsha S., Sanjay Goil, and Alok N. Choudhary. "Adaptive Grids for Clustering Massive Data Sets." SDM. 2001.
  490. ^ كوزيليك، جاكوب، وآخرون. "تحليل الجامعة المفتوحة: تحليل الطلاب المعرضين للخطر في الجامعة المفتوحة". مراجعة تحليلات التعلم (2015): 1-16.
  491. ^ سيمنز، جورج، وآخرون. تحليلات التعلم المفتوح: منصة متكاملة ومقسمة إلى وحدات . مطبعة الجامعة المفتوحة، 2011.
  492. ^ بارلاتشي، جياني؛ دي ناداي، ماركو؛ لارشر، روبرتو؛ كاسيلا، أنطونيو؛ شيتيك، كريستيانا؛ توريسي، جيوفاني؛ أنتونيلي، فابريزيو؛ فيسبينياني، أليساندرو؛ بنتلاند، أليكس؛ ليبري ، برونو (27 أكتوبر 2015). “مجموعة بيانات متعددة المصادر للحياة الحضرية في مدينة ميلانو ومقاطعة ترينتينو”. بيانات علمية . 2 (1). بيب كود :2015NatSD...250055B. دوى :10.1038/sdata.2015.55. بمك 4622222 . بميد  26528394. 
  493. ^ Vanschoren J، van Rijn JN، Bischl B، Torgo L (2013). “OpenML: العلوم الشبكية في التعلم الآلي”. استكشافات SIGKDD . 15 (2): 49-60. أرخايف : 1407.7722 . دوى :10.1145/2641190.2641198. S2CID  4977460.
  494. ^ Olson RS, La Cava W, Orzechowski P, Urbanowicz RJ, Moore JH (2017). "PMLB: مجموعة معايير كبيرة لتقييم ومقارنة التعلم الآلي". BioData Mining . 10 (1): 36. arXiv : 1703.00512 . Bibcode : 2017arXiv170300512O. doi : 10.1186/s13040-017-0154-4 . PMC 5725843. PMID  29238404 . 
  495. ^ "مجموعات البيانات الجاهزة". appen.com . Appen . تم الاسترجاع في 30 ديسمبر 2020 .
  496. ^ “مجموعات البيانات مفتوحة المصدر”. appen.com . أبين . تم الاسترجاع في 30 ديسمبر 2020 .
Retrieved from "https://en.wikipedia.org/w/index.php?title=List_of_datasets_for_machine-learning_research&oldid=1260909362"
Original text
Rate this translation
Your feedback will be used to help improve Google Translate