قائمة مجموعات البيانات لأبحاث التعلم الآلي
| Part of a series on |
| Machine learning and data mining |
|---|
تُستخدم مجموعات البيانات هذه في أبحاث التعلم الآلي (ML) وقد تم الاستشهاد بها في المجلات الأكاديمية التي تمت مراجعتها من قبل الأقران . تعد مجموعات البيانات جزءًا لا يتجزأ من مجال التعلم الآلي. يمكن أن تنجم التطورات الرئيسية في هذا المجال عن التقدم في خوارزميات التعلم (مثل التعلم العميق ) وأجهزة الكمبيوتر ، وبشكل أقل بديهية، عن توفر مجموعات بيانات التدريب عالية الجودة. [1] عادةً ما يكون إنتاج مجموعات بيانات التدريب المصنفة عالية الجودة لخوارزميات التعلم الآلي الخاضعة للإشراف وشبه الخاضعة للإشراف أمرًا صعبًا ومكلفًا بسبب الوقت الكبير اللازم لتصنيف البيانات. على الرغم من عدم الحاجة إلى تصنيفها، إلا أن مجموعات البيانات عالية الجودة للتعلم غير الخاضع للإشراف يمكن أن يكون إنتاجها صعبًا ومكلفًا أيضًا. [2] [3] [4]
تنشر العديد من المنظمات، بما في ذلك الحكومات، مجموعات البيانات الخاصة بها وتشاركها . يتم تصنيف مجموعات البيانات، بناءً على التراخيص، على أنها بيانات مفتوحة وبيانات غير مفتوحة .
يتم عرض مجموعات البيانات من مختلف الهيئات الحكومية في قائمة مواقع بيانات الحكومة المفتوحة . يتم نقل مجموعات البيانات إلى بوابات البيانات المفتوحة . وهي متاحة للبحث والإيداع والوصول من خلال واجهات مثل Open API . يتم توفير مجموعات البيانات كأنواع وأنواع فرعية مختلفة.
قائمة الفرز المستخدمة لمجموعات البيانات
| يكتب | الأنواع الفرعية |
|---|---|
| فئة محددة | المالية ، الاقتصاد ، التجارة ، المجتمع ، الصحة ، الأكاديمية ، الرياضة ، الغذاء ، الزراعة ، السفر ، الجغرافيا المكانية ، السياسة ، المستهلك ، النقل ، اللوجستيات ، البيئة ، العقارات ، القانون ، الترفيه ، الطاقة ، الضيافة |
| نِطَاق | اتحاد فوق وطني ، وطني ، دون وطني ، بلدي ، حضري ، ريفي |
| لغة | الصينية المندرينية ، الإسبانية ، الإنجليزية ، العربية ، الهندية ، البنغالية |
| يكتب | جدولي ، رسم بياني ، نص ، صورة ، صوت ، فيديو |
| الاستخدام | التدريب والتحقق والاختبار |
| تنسيقات الملفات | CSV ، JSON ، XML ، KML ، GeoJSON ، Shapefile ، GML |
| التراخيص | Creative-Commons و GPL ورخص البيانات غير المفتوحة الأخرى |
| آخر تحديث | آخر ساعة، آخر يوم، آخر أسبوع، آخر شهر، آخر عام |
| حجم الملف | الحد الأدنى، الحد الأقصى، المدى |
| حالة | تم التحقق منه، قيد الإعداد، تم إلغاء تنشيطه (أو تم إيقافه) |
| عدد السجلات | مئات، آلاف، عشرة آلاف، مليون |
| عدد المتغيرات | أقل من 10، 10، 100، 1000، 10000 |
| خدمات | فردي، تجميعي |
يتم تصنيف بوابة البيانات بناءً على نوع الترخيص الخاص بها. تُعرف بوابات البيانات المعتمدة على الترخيص مفتوح المصدر باسم بوابات البيانات المفتوحة والتي تستخدمها العديد من المنظمات الحكومية والمؤسسات الأكاديمية .
قائمة بوابات البيانات المفتوحة
| اسم البوابة | رخصة | قائمة تثبيتات البوابة | الاستخدامات النموذجية |
|---|---|---|---|
| شبكة أرشيف المعرفة الشاملة ( CKAN ) | رخصة أيه جي بي إل | https://ckan.github.io/ckan-instances/
https://github.com/sebneu/ckan_instances/blob/master/instances.csv |
مستودع البيانات للمنظمات الحكومية أو غير الربحية، حل إدارة البيانات لمعاهد الأبحاث |
| دكان | رخصة جنو العمومية | https://getdkan.org/المجتمع | مستودع البيانات للمنظمات الحكومية أو غير الربحية، حل إدارة البيانات لمعاهد الأبحاث |
| داتا فيرس | أباتشي | https://dataverse.org/installations
https://dataverse.org/metrics |
حلول إدارة البيانات لمؤسسات البحث |
| دي سبيس | بي إس دي | https://registry.lyrasis.org/ | حلول إدارة البيانات لمؤسسات البحث |
| أوبن إم إل | بي إس دي | https://www.openml.org/search?type=data&sort=runs&status=active | حلول إدارة البيانات لمشاركة مجموعات البيانات والخوارزميات ونتائج التجارب من خلال واجهات برمجة التطبيقات. |
قائمة البوابات المناسبة لأنواع متعددة من التطبيقات
تسرد بوابة البيانات في بعض الأحيان مجموعة واسعة من الأنواع الفرعية لمجموعات البيانات المتعلقة بالعديد من تطبيقات التعلم الآلي .
| السيول الأكاديمية | https://academictorrents.com |
| مجموعة بيانات أمازون | https://registry.opendata.aws/ |
| مجموعة رائعة من البيانات العامة | https://github.com/awesomedata/awesome-public-datasets |
| بيانات العالم | https://data.world/datasets/machine-learning |
| Datahub – مجموعات البيانات الأساسية | https://datahub.io/docs/core-data |
| داتا ون | https://www.dataone.org/ |
| بوابات البيانات | https://dataportals.org/ |
| مجموعة البيانات | https://www.datasetlist.com |
| مؤشر البيانات المفتوحة العالمي – مؤسسة المعرفة المفتوحة | https://okfn.org/ تم أرشفته في 25 مايو 2020 على موقع Wayback Machine |
| البحث في مجموعة بيانات Google | https://datasetsearch.research.google.com/ |
| وجه العناق | https://huggingface.co/docs/datasets/ |
| بورصة أصول البيانات الخاصة بشركة IBM | https://developer.ibm.com/exchanges/data/ |
| Jupyter – بيانات تعليمية | https://jupyter-tutorial.readthedocs.io/en/latest/data-processing/opendata.html |
| كاجل | https://www.kaggle.com/datasets |
| مجموعات بيانات التعلم الآلي | https://macgence.com/data-sets-and-cataloges/ |
| المدن الذكية الكبرى ذات البيانات المفتوحة | https://rlist.io/l/major-smart-cities-with-open-data-portals |
| مجموعة بيانات مايكروسوفت | https://msropendata.com/datasets |
| بداية البيانات المفتوحة | https://opendatainception.io/ |
| أوبن داتا سوفت | https://data.opendatasoft.com/explore/dataset/open-data-sources%40public/table/?sort=code_en |
| أوبندور | https://v2.sherpa.ac.uk/opendoar/ |
| أوبن إم إل | https://www.openml.org/search?type=data |
| أوراق مع الكود | https://paperswithcode.com/datasets |
| معايير التعلم الآلي في جامعة بنسلفانيا | https://github.com/EpistasisLab/pmlb/tree/master/datasets |
| واجهات برمجة التطبيقات العامة | https://github.com/public-apis/public-apis |
| سجل مستودعات الوصول المفتوح | http://roar.eprints.org/ |
| سجل مستودعات بيانات الأبحاث | https://www.re3data.org/ |
| مستودع التعلم الآلي لجامعة كاليفورنيا في إيرفين | http://mlr.cs.umass.edu/ml/ تم أرشفته في 26 يونيو 2020 على موقع Wayback Machine |
| مجموعة بيانات الكلام | https://www.shaip.com/offerings/speech-data-catalog/ |
| اكتشاف البيانات المرئية | https://visualdata.io/discovery |
قائمة البوابات المناسبة لنوع فرعي محدد من التطبيقات
يتم إدراج بوابات البيانات المناسبة لنوع فرعي محدد من تطبيقات التعلم الآلي في الأقسام اللاحقة.
بيانات الصورة
بيانات نصية
تتكون مجموعات البيانات هذه بشكل أساسي من نصوص لمهام مثل معالجة اللغة الطبيعية ، وتحليل المشاعر ، والترجمة، وتحليل المجموعات .
المراجعات
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| جائزة نيتفليكس | تصنيفات الأفلام على Netflix. | 100,480,507 تقييمًا أعطاها 480,189 مستخدمًا لـ 17,770 فيلمًا | النص، التقييم | توقع التقييم | 2006 | [5] | نيتفليكس | |
| تقييمات أمازون | تقييمات المنتجات الأمريكية من Amazon.com . | لا أحد. | 233.1 مليون | نص | التصنيف، تحليل المشاعر | 2015 (2018) | [6] [7] | ماكولي وآخرون. |
| مجموعة بيانات مراجعة OpinRank | تقييمات السيارات والفنادق من Edmunds.com و TripAdvisor على التوالي. | لا أحد. | 42,230 / ~259,000 على التوالي | نص | تحليل المشاعر والتجميع | 2011 | [8] [9] | ك. غانيشان وآخرون. |
| عدسة الفيلم | 22,000,000 تقييم و 580,000 علامة تم تطبيقها على 33,000 فيلمًا بواسطة 240,000 مستخدم. | لا أحد. | ~ 22 مليون | نص | الانحدار، التجميع، التصنيف | 2016 | [10] | أبحاث GroupLens |
| تقييمات مستخدمي موقع Yahoo! Music للفنانين الموسيقيين | أكثر من 10 ملايين تقييم للفنانين من قبل مستخدمي Yahoo. | لا يوجد وصف. | ~ 10م | نص | التجميع، الانحدار | 2004 | [11] [12] | ياهو! |
| مجموعة بيانات تقييم السيارات | خصائص السيارة وقبولها بشكل عام. | تم تقديم ستة ميزات تصنيفية. | 1728 | نص | تصنيف | 1997 | [13] [14] | السيد بوهانيك |
| مجموعة بيانات تفضيلات الكوميديا على YouTube | بيانات تصويت المستخدمين لأزواج مقاطع الفيديو المعروضة على YouTube. صوّت المستخدمون على مقاطع الفيديو الأكثر تسلية. | تم تقديم بيانات الفيديو. | 1,138,562 | نص | تصنيف | 2012 | [15] [16] | جوجل |
| مجموعة بيانات آراء مستخدمي Skytrax | تقييمات المستخدمين لشركات الطيران والمطارات والمقاعد والصالات من Skytrax. | إن التقييمات دقيقة للغاية وتتضمن العديد من جوانب تجربة المطار. | 41396 | نص | التصنيف والانحدار | 2015 | [17] | س. نجوين |
| مجموعة بيانات تقييم مساعدي التدريس | مراجعات مساعدي التدريس. | يتم تقديم ميزات كل حالة مثل الفصل، وحجم الفصل، والمدرس. | 151 | نص | تصنيف | 1997 | [18] [19] | و. لوه وآخرون. |
| مجموعة آراء الطلاب الفيتناميين (UIT-VSFC) | آراء الطلاب. | تعليقات | 16000 | نص | تصنيف | 1997 | [20] | نجوين وآخرون. |
| مجموعة أدوات التواصل الاجتماعي الفيتنامية (UIT-VSMEC) | تعليقات المستخدمين على الفيسبوك. | تعليقات | 6,927 | نص | تصنيف | 1997 | [21] | نجوين وآخرون. |
| مجموعة بيانات الكشف عن الشكاوى ذات النطاق المفتوح باللغة الفيتنامية (ViOCD) | آراء العملاء حول المنتج | تعليقات | 5,485 | نص | تصنيف | 2021 | [22] | نجوين وآخرون. |
| ViHOS: خطاب الكراهية يمتد إلى الكشف عن الفيتناميين | نصوص وسائل التواصل الاجتماعي | تعليقات | يحتوي على 26 ألف امتداد على 11 ألف تعليق | نص | كشف النطاق | 2021 | [23] | هوانج وآخرون. |
مقالات اخبارية
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات NYSK | مقالات إخبارية باللغة الإنجليزية حول القضية المتعلقة باتهامات الاعتداء الجنسي ضد المدير السابق لصندوق النقد الدولي دومينيك شتراوس كان . | تمت تصفيته وتقديمه بتنسيق XML. | 10,421 | XML، النص | تحليل المشاعر واستخراج الموضوع | 2013 | [24] | ديرموش، م. وآخرون. |
| مجموعة رويترز المجلد الأول | مجموعة كبيرة من أخبار رويترز باللغة الإنجليزية. | تصنيف دقيق ورموز موضوعية. | 810,000 | نص | التصنيف والتجميع والتلخيص | 2002 | [25] | رويترز |
| مجموعة رويترز المجلد الثاني | مجموعة كبيرة من أخبار رويترز بالعديد من اللغات. | تصنيف دقيق ورموز موضوعية. | 487,000 | نص | التصنيف والتجميع والتلخيص | 2005 | [26] | رويترز |
| مجموعة أبحاث نصوص تومسون رويترز | مجموعة كبيرة من القصص الإخبارية. | التفاصيل غير موصوفة. | 1,800,370 | نص | التصنيف والتجميع والتلخيص | 2009 | [27] | ت. روز وآخرون. |
| مجموعة الصحف السعودية | 31,030 مقالة صحفية عربية. | تم استخراج البيانات الوصفية. | 31,030 | جيسون | التلخيص والتجميع | 2015 | [28] | السيد الحاجري |
| RE3D (مجموعة بيانات تقييم استخراج العلاقات والكيانات) | بيانات تم تحديدها حسب الكيان والعلاقات من مصادر إخبارية وحكومية مختلفة. برعاية Dstl | تصفية وتصنيف باستخدام أنواع البالين | غير معروف | جيسون | التصنيف والتعرف على الكيانات والعلاقات | 2017 | [29] | دي إس تي إل |
| كتالوج الرسائل المزعجة التي يتم نشرها على موقع Examiner | عناوين مثيرة للنقرات، ورسائل غير مرغوب فيها، وعناوين مستمدة من الجمهور من عام 2010 إلى عام 2015 | تاريخ النشر والعناوين الرئيسية | 3,089,781 | CSV | التجميع والأحداث والمشاعر | 2016 | [30] | ر. كولكارني |
| مجموعة أخبار ABC أستراليا | مجموعة الأخبار الكاملة لقناة ABC Australia من عام 2003 إلى عام 2019 | تاريخ النشر والعناوين الرئيسية | 1,186,018 | CSV | التجميع والأحداث والمشاعر | 2020 | [31] | ر. كولكارني |
| الأخبار العالمية – مجموع 20 ألف موجز | ملخص أسبوعي لجميع العناوين الرئيسية عبر الإنترنت بأكثر من 20 لغة | وقت النشر وعنوان URL والعناوين الرئيسية | 1,398,431 | CSV | التجميع والأحداث واكتشاف اللغة | 2018 | [32] | ر. كولكارني |
| عناوين وكالة رويترز للأنباء | 11 عامًا من الأحداث المسجلة زمنيًا والتي تم نشرها على وكالات الأنباء | وقت النشر، نص العنوان | 16,121,310 | CSV | البرمجة اللغوية العصبية، اللغويات الحاسوبية، الأحداث | 2018 | [33] | ر. كولكارني |
| مجموعة أخبار صحيفة آيريش تايمز الأيرلندية | 24 عامًا من أخبار أيرلندا من 1996 إلى 2019 | وقت النشر وفئة العنوان والنص | 1,484,340 | CSV | البرمجة اللغوية العصبية، اللغويات الحاسوبية، الأحداث | 2020 | [34] | ر. كولكارني |
| مجموعة بيانات عناوين الأخبار للكشف عن السخرية | مجموعة بيانات عالية الجودة تحتوي على عناوين إخبارية ساخرة وغير ساخرة. | نص نظيف وموحد | 26,709 | جيسون | البرمجة اللغوية العصبية، التصنيف، اللغويات | 2018 | [35] | ريشابه ميسرا |
رسائل
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة إنرون | رسائل البريد الإلكتروني للموظفين في شركة إنرون منظمة في مجلدات. | تم إزالة المرفقات، وتحويل عناوين البريد الإلكتروني غير الصالحة إلى user@enron.com أو no_address@enron.com. | ~ 500000 | نص | تحليل الشبكة ، تحليل المشاعر | 2004 (2015) | [36] [37] | كليمت، ب. وي. يانغ |
| مجموعة بيانات Ling-Spam | مجموعة تحتوي على رسائل البريد الإلكتروني المشروعة والرسائل غير المرغوب فيها . | أربع نسخ من مجموعة النصوص تتضمن ما إذا كان تم تمكين أداة التحديد أو قائمة الإيقاف أم لا. | 2,412 هام 481 سبام | نص | تصنيف | 2000 | [38] [39] | أندروتسوبولوس، ج. وآخرون. |
| مجموعة بيانات جمع الرسائل النصية القصيرة العشوائية | تم جمع رسائل SMS غير المرغوب فيها. | لا أحد. | 5,574 | نص | تصنيف | 2011 | [40] [41] | ت. ألميدا وآخرون. |
| مجموعة بيانات عشرين مجموعة إخبارية | رسائل من 20 مجموعة إخبارية مختلفة. | لا أحد. | 20000 | نص | معالجة اللغة الطبيعية | 1999 | [42] | ت. ميتشل وآخرون. |
| مجموعة بيانات Spambase | رسائل البريد الإلكتروني العشوائية. | تم استخراج العديد من ميزات النص. | 4,601 | نص | كشف البريد العشوائي وتصنيفه | 1999 | [43] | م. هوبكنز وآخرون. |
تويتر والتغريدات
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| تغريدات الفيلم | مجموعة بيانات تصنيف الأفلام استنادًا إلى التغريدات العامة والمنظمة جيدًا | ~710,000 | نص | التصنيف والانحدار | 2018 | [44] | س. دومز | |
| تويتر 100 ألف | أزواج من الصور والتغريدات | 100000 | النصوص والصور | استرجاع عبر الوسائط | 2017 | [45] [46] | ي. هو، وآخرون. | |
| المشاعر140 | بيانات التغريدات لعام 2009 بما في ذلك النص الأصلي وطابع الوقت والمستخدم والعاطفة. | تم تصنيفها باستخدام الإشراف عن بعد من وجود الرموز التعبيرية في التغريدة. | 1,578,627 | التغريدات، الفاصلة، القيم المنفصلة | تحليل المشاعر | 2009 | [47] [48] | أ. جو وآخرون. |
| مجموعة بيانات تويتر لجامعة ولاية أريزونا | بيانات شبكة تويتر، وليس التغريدات الفعلية. تُظهر الاتصالات بين عدد كبير من المستخدمين. | لا أحد. | 11,316,811 مستخدمًا، 85,331,846 اتصالاً | نص | التجميع، تحليل الرسم البياني | 2009 | [49] [50] | ر. زعفراني وآخرون. |
| دوائر SNAP الاجتماعية: قاعدة بيانات تويتر | بيانات شبكة تويتر كبيرة. | ميزات العقدة والدوائر وشبكات الأنا. | 1,768,149 | نص | التجميع، تحليل الرسم البياني | 2012 | [51] [52] | ج. ماكولي وآخرون. |
| مجموعة بيانات تويتر لتحليل المشاعر العربية | تغريدات عربية. | العينات مُصنفة يدويًا على أنها إيجابية أو سلبية. | 2000 | نص | تصنيف | 2014 | [53] [54] | ن. عبدالله |
| الضجة في مجموعة بيانات وسائل التواصل الاجتماعي | بيانات من موقعي Twitter وTom's Hardware. تركز مجموعة البيانات هذه على موضوعات محددة يتم مناقشتها على هذين الموقعين. | يتم تقسيم البيانات إلى نوافذ بحيث يمكن للمستخدم محاولة التنبؤ بالأحداث التي أدت إلى ظهور الضجة على وسائل التواصل الاجتماعي. | 140,000 | نص | الانحدار، التصنيف | 2013 | [55] [56] | ف. كاوالا وآخرون. |
| إعادة صياغة الكلمات والتشابه الدلالي في تويتر (PIT) | تسلط مجموعة البيانات هذه الضوء على ما إذا كانت التغريدات تحمل نفس المعنى/المعلومات (تقريبًا) أم لا. تم تصنيفها يدويًا. | التجزئة، وجزء من الكلام، ووضع علامات على الكيانات المسماة | 18,762 | نص | الانحدار، التصنيف | 2015 | [57] [58] | شو وآخرون. |
| مجموعة بيانات معيارية لـ Geoparse Twitter | تحتوي مجموعة البيانات هذه على تغريدات أثناء أحداث إخبارية مختلفة في بلدان مختلفة. إشارات إلى المواقع مصنفة يدويًا. | تمت إضافة تعليقات الموقع إلى بيانات JSON الوصفية | 6,386 | التغريدات، JSON | التصنيف واستخراج المعلومات | 2014 | [59] [60] | SE ميدلتون وآخرون. |
| السخرية، المُدرَكة والمقصودة، من خلال الإشراف التفاعلي (SPIRS) | التغريدات الساخرة المقصودة والمتصورة مع سياقها تم جمعها باستخدام الإشراف التفاعلي؛ وعدد متساوٍ من العينات السلبية (غير الساخرة) | 30,000 | معرفات التغريدات، CSV | تصنيف | 2020 | [61] [62] | ب. شمويل وآخرون. | |
| مجموعة وسائل التواصل الاجتماعي الهولندية | تحتوي مجموعة البيانات هذه على تغريدات حول فيروس كورونا المستجد (كوفيد-19) كتبها متحدثون باللغة الهولندية أو مستخدمون من هولندا. وقد تم تصنيف البيانات آليًا | تم تصنيفها وفقًا للعواطف ونصوص التغريدات ووصف المستخدم المترجم إلى اللغة الإنجليزية. تم استخراج ذكر الصناعة | 271,342 | جيه سونل | المشاعر، التصنيف متعدد العلامات، الترجمة الآلية | 2020 | [63] [64] [65] | آكش جوبتا، كورونا واي |
| مجموعة بيانات ReactionGIF | مجموعة بيانات تحتوي على 30 ألف تغريدة وردود أفعالها بتنسيق GIF | تم تصنيفها حسب المشاعر وردود الأفعال والعواطف | 30,000 | معرفات التغريدات، JSONL | تم تصنيفها حسب المشاعر وردود الأفعال والعواطف | 2021 | [66] [67] | ب. شمويل وآخرون. |
الحوارات
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة محادثات NPS | المشاركات من غرف الدردشة عبر الإنترنت المخصصة للأعمار المختلفة. | خصوصية اليد مقنعة، ومحددة لجزء من الكلام وفعل الحوار. | ~ 500000 | إكس إم إل | البرمجة اللغوية العصبية، والبرمجة، واللغويات | 2007 | [68] | فورسيث، إي، ولين، جيه، ومارتيل، سي. |
| مجموعة تويتر الثلاثية | تم استخراج ثلاثيات ABA من تويتر. | 4,232 | نص | البرمجة اللغوية العصبية | 2016 | [69] | سورديني، أ. وآخرون. | |
| مجموعة أدوات UseNet | المشاركات في منتدى UseNet. | رسائل البريد الإلكتروني وعناوين المواقع الإلكترونية مجهولة المصدر. تم حذف المستندات التي يقل طولها عن 500 كلمة أو يزيد عن 500000 كلمة، أو التي تحتوي على نسبة أقل من 90% من اللغة الإنجليزية. | 7 مليار | نص | 2011 | [70] | شاؤول، سي، وويستبيري سي. | |
| مجموعة رسائل SMS من NUS | تم جمع الرسائل النصية القصيرة بين مستخدمين، مع تحليل التوقيت. | ~ 10000 | إكس إم إل | البرمجة اللغوية العصبية | 2011 | [71] | كان، م | |
| مجموعة تعليقات Reddit | جميع تعليقات Reddit (حتى عام 2015). | ~ 1.7 مليار | جيسون | البرمجة اللغوية العصبية، البحث | 2015 | [72] | عالق في المصفوفة | |
| مجموعة حوارات أوبونتو | الحوارات المستخرجة من مجرى الدردشة في Ubuntu على IRC. | 930 ألف حوار و7.1 مليون عبارة | CSV | بحوث أنظمة الحوار | 2015 | [73] | لوي، ر. وآخرون. | |
| تحدي تتبع حالة الحوار | كانت تحديات تتبع حالة الحوار 2 و 3 (DSTC2 و 3) عبارة عن تحديات بحثية تركز على تحسين أحدث التقنيات في تتبع حالة أنظمة الحوار المنطوق. | نسخ الحوارات المنطوقة مع التسمية | يحتوي DSTC2 على حوالي 3.2 ألف مكالمة – يحتوي DSTC3 على حوالي 2.3 ألف مكالمة | جيسون | تتبع حالة الحوار | 2014 | [74] | هندرسون، ماثيو وتومسون، بليز وويليامز، جيسون د |
قانوني
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| قانون حر | بيانات مفلترة من Court Listener، وهي جزء من مشروع FreeLaw. | نص تم تنظيفه وتطبيعه | 4,940,710 | جيسون | البرمجة اللغوية العصبية، اللغويات | 2020 | [75] | ت. هوب |
| كومة من القانون | مجموعة من البيانات القانونية والإدارية | تم تنظيفها وتطبيعها وخصخصتها | ~50,000,000 | جيسون | البرمجة اللغوية العصبية، اللغويات، المشاعر | 2022 | [76] [77] | إل تشنغ؛ ن.جوها؛ ب. أندرسون؛ بي هندرسون؛ د. هو |
| مشروع الوصول إلى أحكام القضاء | جميع أحكام القضاء الرسمية الصادرة عن الولايات المتحدة والصادرة في كتب — كل مجلد أو قضية تم تحديدها كتقرير رسمي عن القرارات التي اتخذتها محكمة داخل الولايات المتحدة. | نص تم تنظيفه وتطبيعه | ~10,000 | جيسون | البرمجة اللغوية العصبية، اللغويات | 2022 | [78] | أ. أيزمان؛ س. تشابمان؛ ج. كوشمان؛ ك. دولين؛ ح. إيدولون؛ وآخرون. |
نص آخر
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات ويب أوف ساينس | مجموعات البيانات الهرمية لتصنيف النصوص | لا أحد. | 46,985 | نص | تصنيف،
التصنيف |
2017 | [79] [80] | ك. كوساري وآخرون. |
| تقارير القضايا القانونية | قضايا المحكمة الفيدرالية الأسترالية من عام 2006 إلى عام 2009. | لا أحد. | 4000 | نص | تلخيص،
تحليل الاستشهادات |
2012 | [81] [82] | ف. جالجاني وآخرون. |
| مجموعة تأليف المدونين | مدخلات المدونة لـ 19,320 شخصًا من blogger.com. | قام المدون بتقديم معلومات ذاتية عن الجنس والعمر والصناعة والعلامة الفلكية. | 681,288 | نص | تحليل المشاعر، التلخيص، التصنيف | 2006 | [83] [84] | ج. شلر وآخرون. |
| البنية الاجتماعية لشبكات الفيسبوك | مجموعة كبيرة من البيانات حول البنية الاجتماعية للفيسبوك. | لا أحد. | تم تغطية 100 كلية | نص | تحليل الشبكة، التجميع | 2012 | [85] [86] | أ. تراود وآخرون. |
| مجموعة بيانات لفهم النص آليًا | قصص وأسئلة مرتبطة بها لاختبار فهم النص. | لا أحد. | 660 | نص | معالجة اللغة الطبيعية، والفهم الآلي | 2013 | [87] [88] | م. ريتشاردسون وآخرون. |
| مشروع بنك الأشجار في بنسلفانيا | نص طبيعي تم توضيحه من حيث البنية اللغوية. | يتم تحليل النص إلى أشجار دلالية. | ~ 1 مليون كلمة | نص | معالجة اللغة الطبيعية، التلخيص | 1995 | [89] [90] | م. ماركوس وآخرون. |
| مجموعة بيانات DEXTER | المهمة الموكلة إلينا هي تحديد المقالات التي تتناول عمليات الاستحواذ على الشركات، وذلك من خلال الميزات المقدمة. | تتضمن الميزات المستخرجة جذوع الكلمات. تتضمن ميزات التشتيت. | 2600 | نص | تصنيف | 2008 | [91] | رويترز |
| كتب جوجل N-grams | N-grams من مجموعة كبيرة جدًا من الكتب | لا أحد. | 2.2 تيرابايت من النص | نص | التصنيف والتجميع والانحدار | 2011 | [92] [93] | جوجل |
| مجموعة الأشخاص | تم تجميعها لأغراض التجارب في نسب المؤلف والتنبؤ بالشخصية. تتكون من 145 مقالة باللغة الهولندية. | بالإضافة إلى النصوص العادية، يتم تقديم نصوص موضحة نحويًا. | 145 | نص | التصنيف والانحدار | 2008 | [94] [95] | ك. لويكس وآخرون. |
| دفع التحول | أرشيفات مواقع التواصل الاجتماعي، بما في ذلك Reddit و Twitter و Hackernews . | تم استخراج النص وتطبيعه من WARCs | ~100,000,000 مشاركة | جيسون | البرمجة اللغوية العصبية، المشاعر، اللغويات | 2022 | [96] [97] | ج. باومغارتنر |
| ملفات لجنة الأوراق المالية والبورصات | إدغار | ملفات الشركة | تم استخراج النص. | ملف CSV | البرمجة اللغوية العصبية | ||||
| مجموعة بيانات CNAE-9 | مهمة تصنيف للنصوص المجانية الخاصة بالشركات البرازيلية. | تم استخراج تردد الكلمة. | 1080 | نص | تصنيف | 2012 | [98] [99] | ب. سياريلي وآخرون. |
| مجموعة بيانات الجمل المصنفة بالمشاعر | 3000 جملة تحمل علامات عاطفية. | تمت كتابة مشاعر كل جملة يدويًا على أنها إيجابية أو سلبية. | 3000 | نص | التصنيف، تحليل المشاعر | 2015 | [100] [101] | د. كوتزياس |
| مجموعة بيانات BlogFeedback | مجموعة بيانات للتنبؤ بعدد التعليقات التي سيتلقاها المنشور بناءً على ميزات هذا المنشور. | تم استخراج العديد من الميزات لكل مشاركة. | 60,021 | نص | الانحدار | 2014 | [102] [103] | ك. بوزا |
| مركز ببميد | يضم PubMed® أكثر من 35 مليون استشهاد للأدبيات الطبية الحيوية من MEDLINE ومجلات العلوم الحياتية والكتب عبر الإنترنت. | لا أحد | 35 مليون | نص | البرمجة اللغوية العصبية | |||
| مكتب براءات الاختراع والعلامات التجارية الأمريكي | مكتب الولايات المتحدة لبراءات الاختراع والعلامات التجارية | نص | البرمجة اللغوية العصبية | |||||
| فيليبابرز | مجموعة مفتوحة المصدر من منشورات الفلسفة | نص | البرمجة اللغوية العصبية | |||||
| مجموعة كتب | مجموعة نصوص شائعة واسعة النطاق. | لا أحد | نص | البرمجة اللغوية العصبية | 2015 | [104] | تشو، يوكون، وآخرون. | |
| مجموعة أدوات استدلال اللغة الطبيعية بجامعة ستانفورد (SNLI) | تتم مطابقة تعليقات الصور مع الجمل التي تم إنشاؤها حديثًا لتشكيل أزواج الاستلزام أو التناقض أو المحايدة. | تسميات فئة الاستلزام، التحليل النحوي بواسطة محلل Stanford PCFG | 570,000 | نص | الاستدلال باللغة الطبيعية/التعرف على المضمون النصي | 2015 | [105] | س. بومان وآخرون. |
| مجموعة DSL Corpus (DSLCC) | مجموعة متعددة اللغات من المقاطع القصيرة من النصوص الصحفية باللغات واللهجات المتشابهة. | لا أحد | 294000 جملة | نص | التمييز بين اللغات المتشابهة | 2017 | [106] | تان، ليلينج وآخرون. |
| مجموعة بيانات القاموس الحضري | مجموعة من الكلمات والأصوات والتعريفات | أسماء المستخدمين مجهولة | 2,580,925 | CSV | البرمجة اللغوية العصبية، فهم الآلة | مايو 2016 | [107] | مجهول |
| تي ريكس | ملخصات ويكيبيديا متوافقة مع كيانات ويكي بيانات | محاذاة ثلاثيات ويكيبيديا مع ملخصات ويكيبيديا | 11M ثلاثيات مصطفة | JSON وNIF [4] | البرمجة اللغوية العصبية، استخراج العلاقات | 2018 | [108] | ح. السحار وآخرون. |
| تقييم فهم اللغة العام (GLUE) | معيار أداء تسعة مهام | متنوع | ~1 مليون جملة وأزواج جمل | اللغة الإنجليزية: | 2018 | [109] [110] [111] | وانغ وآخرون. | |
| مجموعة بيانات Atticus لفهم العقود (CUAD) (المعروفة سابقًا باسم مجموعة بيانات Atticus Open Contract Dataset (AOK)) | مجموعة بيانات العقود القانونية مع تعليقات الخبراء الغنية | ~13000 ملصق | CSV و PDF | معالجة اللغة الطبيعية، سؤال وجواب | 2021 | مشروع أتيكوس | ||
| مجموعة بيانات التسميات التوضيحية للصور الفيتنامية (UIT-ViIC) | مجموعة بيانات ترجمة الصور الفيتنامية | 19250 تعليقًا لـ 3850 صورة | CSV و PDF | معالجة اللغة الطبيعية، الرؤية الحاسوبية | 2020 | [112] | لام وآخرون. | |
| الأسماء الفيتنامية الموضحة بالجنس (UIT-ViNames) | الأسماء الفيتنامية مع توضيح الجنس | 26,850 اسمًا كاملاً فيتناميًا موضحًا به الجنس | CSV | معالجة اللغة الطبيعية | 2020 | [113] | إلى وآخرون. | |
| مجموعة بيانات الكشف عن الكلام البنّاء والسام باللغة الفيتنامية (UIT-ViCTSD) | مجموعة بيانات الكشف عن الكلام البنّاء والسام باللغة الفيتنامية | 10000 تعليق من المستخدمين الفيتناميين على الصحف الإلكترونية على 10 نطاقات | CSV | معالجة اللغة الطبيعية | 2021 | [114] | نجوين وآخرون. | |
| بي جي-19 | مجموعة من الكتب المستخرجة من مكتبة كتب مشروع جوتنبرج | نص | معالجة اللغة الطبيعية | 2019 | جاك دبليو وآخرون. | |||
| الرياضيات في ديب مايند | أزواج الأسئلة والأجوبة في الرياضيات. | نص | معالجة اللغة الطبيعية | 2018 | [115] | د ساكستون وآخرون. | ||
| أرشيف آنا | أرشيف شامل للكتب والأبحاث المنشورة | لا أحد | 100,356,641 | نص، epub، PDF | معالجة اللغة الطبيعية | 2024 |
بيانات الصوت
تتكون مجموعات البيانات هذه من الأصوات وميزات الصوت المستخدمة في مهام مثل التعرف على الكلام وتوليف الكلام .
خطاب
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| لوحة التوزيع-1 | محادثة عبر الهاتف. | 260 ساعة من الكلام، من 543 متحدثًا (302 من الذكور و241 من الإناث) من جميع أنحاء الولايات المتحدة، لنحو 2400 محادثة هاتفية ثنائية الجانب، جمعتها شركة Texas Instruments في عامي 1990 و1991. | الصوت، نص منقول، طوابع زمنية على مستوى الكلمة، نسخ صوتية | التعرف على الكلام، والنسخ الصوتي. | 1992 (2000) | [116] [117] | المعهد الوطني للمعايير والتكنولوجيا | |
| هاب 5'00 | محادثة عبر الهاتف. | 260 ساعة من الكلام، من 543 متحدثًا (302 من الذكور و241 من الإناث) من مختلف أنحاء الولايات المتحدة، لنحو 2400 محادثة هاتفية ثنائية، بما يعادل نحو 3 ملايين كلمة. تم جمعها بواسطة شركة Texas Instruments في عامي 1990 و1991. | الصوت، نص منقول، طوابع زمنية على مستوى الكلمة، نسخ صوتية | التعرف على الكلام، النسخ الصوتي. مجموعة الاختبار الأكثر استخدامًا لهذه المجموعة من البيانات تسمى "Hub5'00". | 1992 (2000) | [118] [119] | المعهد الوطني للمعايير والتكنولوجيا | |
| تحدي الخطابة بدون موارد 2015 | الكلام التلقائي (الإنجليزية)، الكلام المقروء (Xitsonga). | لا يوجد، ملفات WAV خام. | الإنجليزية: 5 ساعات، 12 متحدثًا؛ Xitsonga: ساعتان ونصف، 24 متحدثًا | WAV (صوت فقط) | الاكتشاف غير الخاضع للإشراف لخصائص الكلام/وحدات الكلمات الفرعية/وحدات الكلمات | 2015 | [120] [121] | فيرستيج وآخرون. |
| مجموعة بيانات الكلام لمرض باركنسون | تسجيلات متعددة لأشخاص مصابين بمرض باركنسون وغير مصابين به. | تم استخراج ميزات الصوت، وتم تقييم المرض من قبل الطبيب باستخدام مقياس تصنيف مرض باركنسون الموحد . | 1,040 | نص | التصنيف والانحدار | 2013 | [122] [123] | بي إي ساكار وآخرون. |
| الأرقام العربية المنطوقة | الأرقام العربية المنطوقة من 44 ذكرًا و 44 أنثى. | سلسلة زمنية لمعاملات ميل الترددية . | 8,800 | نص | تصنيف | 2010 | [124] [125] | م. بيدا وآخرون. |
| مجموعة بيانات ISOLET | أسماء الحروف المنطوقة. | الميزات المستخرجة من الأصوات. | 7797 | نص | تصنيف | 1994 | [126] [127] | ر. كول وآخرون. |
| مجموعة بيانات الحروف المتحركة اليابانية | نطق تسعة متحدثين ذكور بحرفين متحركين يابانيين على التوالي. | تم تطبيق تحليل التنبؤ الخطي بزاوية 12 درجة عليه للحصول على سلسلة زمنية منفصلة مع 12 معاملًا للنقطة. | 640 | نص | تصنيف | 1999 | [128] [129] | م. كودو وآخرون. |
| مجموعة بيانات المراقبة عن بعد لمرض باركنسون | تسجيلات متعددة لأشخاص مصابين بمرض باركنسون وغير مصابين به. | تم استخراج ميزات الصوت. | 5875 | نص | تصنيف | 2009 | [130] [131] | أ. تساناس وآخرون. |
| تيميت | تسجيلات 630 متحدثًا من ثماني لهجات رئيسية للغة الإنجليزية الأمريكية، حيث يقرأ كل منهم عشر جمل غنية بالصوتيات. | يتم نسخ الكلام معجميًا وصوتيًا. | 6300 | نص | التعرف على الكلام والتصنيف. | 1986 | [132] [133] | ج. جاروفولو وآخرون. |
| مجموعة نصوص باللغة العربية | مجموعة خطابية باللغة العربية الفصحى الحديثة (MSA) لمتحدث واحد مع نصوص صوتية وإملائية تتوافق مع مستوى الصوتيات. | يتم نسخ الكلام إملائيًا وصوتيًا مع علامات التشديد. | ~1900 | نص، WAV | تركيب الكلام، التعرف على الكلام، محاذاة النص، علاج النطق، التعليم. | 2016 | [134] | ن. حلبي |
| صوت مشترك | قاعدة بيانات عامة للبيانات المجمعة جماعياً عبر مجموعة واسعة من اللهجات. | التحقق من صحة البيانات من قبل مستخدمين آخرين. | الإنجليزية: 1,118 ساعة | ملفات MP3 مع النصوص المقابلة | التعرف على الكلام | يونيو 2017 (ديسمبر 2019) | [135] | موزيلا |
| خطاب LJ | مجموعة من التسجيلات الصوتية العامة باللغة الإنجليزية، بصوت متحدث واحد ، مقسمة إلى مقاطع قصيرة عند علامات الترقيم. | فحص الجودة، والنسخ الطبيعي إلى جانب الأصل. | 13,100 | CSV، WAV | تركيب الكلام | 2017 | [136] | كيث إيتو، ليندا جونسون |
| مجموعة بيانات أوامر الكلام العربية | تم جمعها من 30 مساهمًا وتم تجميعها في 40 كلمة رئيسية. | ملفات WAV الخام | 12000 | WAV، CSV | التعرف على الكلام، واكتشاف الكلمات الرئيسية | 2021 | [137] | عبد القادر غندورة |
موسيقى
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| الأصل الجغرافي لمجموعة بيانات الموسيقى | الميزات الصوتية لعينات الموسيقى من مواقع مختلفة. | ميزات الصوت المستخرجة باستخدام برنامج MARSYAS. | 1,059 | نص | التصنيف الجغرافي، التجميع | 2014 | [138] [139] | ف. تشو وآخرون. |
| مجموعة بيانات المليون أغنية | ميزات صوتية من مليون أغنية مختلفة. | تم استخراج ميزات الصوت. | 1 مليون | نص | التصنيف والتجميع | 2011 | [140] [141] | ت. بيرتين-ماهيو وآخرون. |
| ميوسد بي 18 | تسجيلات موسيقية شعبية متعددة المسارات | الصوت الخام | 150 | إم بي 4، دبليو إيه في | فصل المصدر | 2017 | [142] | ز. رافي وآخرون. |
| أرشيف الموسيقى المجانية | الصوت بموجب ترخيص المشاع الإبداعي من 100 ألف أغنية (343 يومًا، 1 تيرابايت) مع تسلسل هرمي من 161 نوعًا، والبيانات الوصفية، وبيانات المستخدم، والنص الحر. | الصوت الخام وميزات الصوت. | 106,574 | نص، MP3 | التصنيف والتوصية | 2017 | [143] | م. ديفيرارد وآخرون. |
| مجموعة بيانات التناغم الكورالي لباخ | أوتار كورال باخ. | تم استخراج ميزات الصوت. | 5665 | نص | تصنيف | 2014 | [144] [145] | د. راديتشيوني وآخرون. |
اصوات اخرى
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| أوربان ساوند | تسجيلات صوتية مصنفة لأصوات مثل مكيفات الهواء وأبواق السيارات والأطفال يلعبون. | تم فرزها إلى مجلدات حسب فئة الأحداث بالإضافة إلى البيانات الوصفية في ملف JSON والتعليقات التوضيحية في ملف CSV. | 1,059 | صوت
( WAV ) |
تصنيف | 2014 | [146] [147] | ج. سالامون وآخرون. |
| مجموعة الصوت | مقاطع صوتية مدتها 10 ثوانٍ من مقاطع فيديو YouTube، ومجموعة من أكثر من 500 علامة. | 128-d PCA'd VGG-ish ميزات كل ثانية واحدة. | 2,084,320 | ملفات نصية (CSV) وملفات تسجيل TensorFlow | تصنيف | 2017 | [148] | ج. جيميك وآخرون، جوجل |
| تحدي اكتشاف صوت الطيور | الصوت من محطات مراقبة البيئة، بالإضافة إلى التسجيلات الجماعية | 17000+ | تصنيف | 2016 (2018) | [149] [150] | جامعة كوين ماري وجمعية معالجة الإشارات IEEE | ||
| مزيجات WSJ0 Hipster Ambient | تم خلط الصوت من WSJ0 مع الضوضاء المسجلة في منطقة خليج سان فرانسيسكو | مقاطع الضوضاء المطابقة لمقاطع WSJ0 | 28000 | الصوت ( WAV ) | فصل مصدر الصوت | 2019 | [151] | Wichern، G.، وآخرون، Whisper وMERL |
| كلوثو | 4,981 عينة صوتية تتراوح مدتها بين 15 إلى 30 ثانية، وتحتوي كل عينة صوتية على خمسة ترجمات مختلفة تتراوح مدتها بين 8 إلى 20 كلمة. | 24,905 | الصوت ( WAV ) والنص ( CSV ) | الترجمة الصوتية الآلية | 2020 | [152] [153] | ك. دروسوس، س. ليبينج، وت. فيرتانين |
بيانات الإشارة
مجموعة البيانات التي تحتوي على معلومات الإشارة الكهربائية التي تتطلب نوعًا ما من معالجة الإشارة لمزيد من التحليل.
كهربائي
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات الديدان الذكية | مجموعة بيانات توضح بالتفصيل انتشار دودة Witty وأجهزة الكمبيوتر المصابة. | تقسيمها إلى مجموعة متاحة للعامة ومجموعة مقيدة تحتوي على معلومات أكثر حساسية مثل عناوين IP وUDP. | 55,909 عناوين IP | نص | تصنيف | 2004 | [154] [155] | مركز تحليل بيانات الإنترنت التطبيقية |
| مجموعة بيانات تقدير ضغط الدم بدون استخدام الكفة | تم تنظيف الإشارات الحيوية من المرضى البشر والتي يمكن استخدامها لتقدير ضغط الدم. | تم تنظيف العلامات الحيوية 125 هرتز. | 12000 | نص | التصنيف والانحدار | 2015 | [156] [157] | م. كاتشوي وآخرون. |
| مجموعة بيانات انحراف مجموعة مستشعرات الغاز | قياسات من 16 مستشعرًا كيميائيًا تم استخدامها في عمليات المحاكاة للتعويض عن الانجراف. | عدد كبير من الميزات المقدمة. | 13,910 | نص | تصنيف | 2012 | [158] [159] | أ. فيرجارا |
| مجموعة بيانات السيرفو | البيانات التي تغطي العلاقات غير الخطية التي لوحظت في دائرة مكبر الصوت المؤازر. | يتم إعطاء مستويات المكونات المختلفة كدالة للمكونات الأخرى. | 167 | نص | الانحدار | 1993 | [160] [161] | ك. أولريش |
| مجموعة بيانات UJIIndoorLoc-Mag | قاعدة بيانات تحديد المواقع الداخلية لاختبار أنظمة تحديد المواقع الداخلية. تعتمد البيانات على المجال المغناطيسي. | تم تقديم تقسيمات التدريب والاختبار. | 40,000 | نص | التصنيف والانحدار والتجميع | 2015 | [162] [163] | د. رامبلا وآخرون. |
| مجموعة بيانات تشخيص القيادة بدون مستشعر | الإشارات الكهربائية من المحركات ذات المكونات المعيبة. | الميزات الإحصائية المستخرجة. | 58,508 | نص | تصنيف | 2015 | [164] [165] | السيد باتور |
تتبع الحركة
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| الحوسبة القابلة للارتداء: تصنيف أوضاع الجسم وحركاته (PUC-Rio) | أشخاص يقومون بخمسة حركات قياسية أثناء ارتداء أجهزة تعقب الحركة. | لا أحد. | 165,632 | نص | تصنيف | 2013 | [166] [167] | الجامعة البابوية الكاثوليكية في ريو دي جانيرو |
| مجموعة بيانات تقسيم مرحلة الإيماءة | الميزات المستخرجة من فيديو لأشخاص يقومون بإيماءات مختلفة. | تهدف الميزات المستخرجة إلى دراسة تقسيم مرحلة الإيماءة. | 9900 | نص | التصنيف والتجميع | 2014 | [168] [169] | ر. ماديو وآخرون |
| مجموعة بيانات Vicon Physical Action مجموعة بيانات | 10 تصرفات بدنية عادية و10 تصرفات عدوانية تقيس النشاط البشري الذي يتتبعه متتبع ثلاثي الأبعاد. | تم تسجيل العديد من المعلمات بواسطة متعقب ثلاثي الأبعاد. | 3000 | نص | تصنيف | 2011 | [170] [171] | ت. ثيودوريديس |
| مجموعة بيانات الأنشطة اليومية والرياضية | بيانات مستشعر المحرك لـ 19 نشاطًا يوميًا ورياضيًا. | تم توفير العديد من أجهزة الاستشعار، ولم يتم إجراء أي معالجة مسبقة على الإشارات. | 9120 | نص | تصنيف | 2013 | [172] [173] | ب. برشان وآخرون. |
| التعرف على النشاط البشري باستخدام مجموعة بيانات الهواتف الذكية | بيانات الجيروسكوب ومقياس التسارع من الأشخاص الذين يرتدون الهواتف الذكية ويقومون بإجراءات عادية. | يتم تصنيف الإجراءات التي يتم تنفيذها، ويتم معالجة جميع الإشارات مسبقًا بحثًا عن الضوضاء. | 10,299 | نص | تصنيف | 2012 | [174] [175] | ج. رييس-أورتيز وآخرون. |
| إشارات لغة الإشارة الأسترالية | إشارات لغة الإشارة الأسترالية تم التقاطها بواسطة قفازات تتبع الحركة. | لا أحد. | 2565 | نص | تصنيف | 2002 | [176] [177] | السيد كادوس |
| تمارين رفع الأثقال التي تتم مراقبتها باستخدام وحدات القياس بالقصور الذاتي | خمسة أشكال مختلفة من تمرين ثني العضلة ذات الرأسين تمت مراقبتها باستخدام أجهزة قياس القصور الذاتي (IMUs). | بعض الإحصائيات تم حسابها من البيانات الخام. | 39,242 | نص | تصنيف | 2013 | [178] [179] | و. أوجولينو وآخرون. |
| مجموعة بيانات sEMG لحركات اليد الأساسية | قاعدتي بيانات لإشارات تخطيط كهربية العضلات السطحية لست حركات لليد. | لا أحد. | 3000 | نص | تصنيف | 2014 | [180] [181] | ج. سابسانيس وآخرون. |
| مجموعة بيانات التعرف على الأنشطة REALDISP | تقييم التقنيات التي تتعامل مع تأثيرات إزاحة المستشعر في التعرف على الأنشطة القابلة للارتداء. | لا أحد. | 1419 | نص | تصنيف | 2014 | [181] [182] | أ. بانوس وآخرون. |
| مجموعة بيانات التعرف على الأنشطة غير المتجانسة | بيانات من أجهزة ذكية متعددة مختلفة للبشر الذين يقومون بأنشطة مختلفة. | لا أحد. | 43,930,257 | نص | التصنيف والتجميع | 2015 | [183] [184] | أ. ستيسن وآخرون. |
| التنبؤ بحركة المستخدمين الداخليين من بيانات RSS | بيانات الشبكة اللاسلكية الزمنية التي يمكن استخدامها لتتبع حركة الأشخاص في مكتب ما. | لا أحد. | 13,197 | نص | تصنيف | 2016 | [185] [186] | د. باتشيو |
| مجموعة بيانات مراقبة النشاط البدني PAMAP2 | 18 نوعًا مختلفًا من الأنشطة البدنية التي قام بها 9 أشخاص يرتدون 3 أجهزة قياس بالقصور الذاتي. | لا أحد. | 3,850,505 | نص | تصنيف | 2012 | [187] | أ. رايس |
| مجموعة بيانات التعرف على الأنشطة OPPORTUNITY | التعرف على النشاط البشري من خلال أجهزة الاستشعار القابلة للارتداء والأشياء والمحيطة هي مجموعة بيانات تم تصميمها لمعايرة خوارزميات التعرف على النشاط البشري. | لا أحد. | 2551 | نص | تصنيف | 2012 | [188] [189] | د. روجين وآخرون. |
| مجموعة بيانات التعرف على الأنشطة في العالم الحقيقي | التعرف على النشاط البشري من خلال الأجهزة القابلة للارتداء. يميز بين سبعة أوضاع للأجهزة على الجسم ويتكون من ستة أنواع مختلفة من أجهزة الاستشعار. | لا أحد. | 3,150,000 (لكل مستشعر) | نص | تصنيف | 2016 | [190] | ت. ستايلر وآخرون. |
| مجموعة بيانات وضعية السكتة الدماغية في مركز إعادة التأهيل في تورنتو | تقديرات وضعية الإنسان ثلاثية الأبعاد (Kinect) لمرضى السكتة الدماغية والمشاركين الأصحاء الذين يؤدون مجموعة من المهام باستخدام روبوت إعادة تأهيل السكتة الدماغية. | لا أحد. | 10 أشخاص أصحاء و9 ناجين من السكتة الدماغية (3500-6000 إطار لكل شخص) | CSV | تصنيف | 2017 | [191] [192] [193] | إ. دولاتابادي وآخرون. |
| مجموعة من اللمسات الاجتماعية (CoST) | 7805 لقطات إيماءة لـ 14 إيماءة لمس اجتماعية مختلفة قام بها 31 شخصًا. تم تنفيذ الإيماءات بثلاثة أشكال: لطيفة وعادية وخشنة، على شبكة مستشعر ضغط ملفوفة حول ذراع عارضة أزياء. | تتم تجزئة إيماءات اللمس التي يتم إجراؤها ووضع علامات عليها. | 7805 التقاط الإيماءات | CSV | تصنيف | 2016 | [194] [195] | م. يونج وآخرون. |
إشارات أخرى
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات النبيذ | التحليل الكيميائي للنبيذ المزروع في نفس المنطقة في إيطاليا ولكن المشتق من ثلاثة أصناف مختلفة. | تم ذكر 13 خاصية لكل نبيذ | 178 | نص | التصنيف والانحدار | 1991 | [196] [197] | م. فورينا وآخرون. |
| مجموعة بيانات محطة الطاقة ذات الدورة المركبة | بيانات من أجهزة استشعار مختلفة داخل محطة طاقة تعمل لمدة 6 سنوات. | لا أحد | 9568 | نص | الانحدار | 2014 | [198] [199] | ب. توفيكجي وآخرون. |
البيانات المادية
مجموعة البيانات من الأنظمة الفيزيائية.
فيزياء الطاقة العالية
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات HIGGS | محاكاة مونت كارلو لتصادمات مسرعات الجسيمات. | تم إعطاء 28 ميزة لكل تصادم. | 11 مليون | نص | تصنيف | 2014 | [200] [201] [202] | د. وايتسون |
| مجموعة بيانات HEPMASS | محاكاة مونت كارلو لتصادمات مسرعات الجسيمات. الهدف هو فصل الإشارة عن الضوضاء. | تم إعطاء 28 ميزة لكل تصادم. | 10,500,000 | نص | تصنيف | 2016 | [201] [202] [203] | د. وايتسون |
الأنظمة
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات ديناميكا المياه لليخوت | أداء اليخت على أساس الأبعاد. | يتم تقديم ستة ميزات لكل يخت. | 308 | نص | الانحدار | 2013 | [204] [205] | ر. لوبيز |
| مجموعة بيانات فشل تنفيذ الروبوت | 5 مجموعات بيانات تركز على فشل الروبوتات في تنفيذ المهام الشائعة. | ميزات ذات قيمة صحيحة مثل عزم الدوران وقياسات المستشعرات الأخرى. | 463 | نص | تصنيف | 1999 | [206] | ل. سيبرا وآخرون. |
| مجموعة بيانات جسور بيتسبرغ | يتم تقديم وصف التصميم من حيث العديد من خصائص الجسور المختلفة. | يتم تقديم ميزات الجسر المختلفة. | 108 | نص | تصنيف | 1990 | [207] [208] | ي. رايش وآخرون. |
| مجموعة بيانات السيارات | بيانات عن السيارات ومخاطر التأمين عليها وخسائرها الطبيعية. | تم استخراج مميزات السيارة. | 205 | نص | الانحدار | 1987 | [209] [210] | ج. شيمر وآخرون. |
| مجموعة بيانات معدل استهلاك الوقود التلقائي | بيانات MPG للسيارات. | تم ذكر ثمانية مميزات لكل سيارة. | 398 | نص | الانحدار | 1993 | [211] | جامعة كارنيجي ميلون |
| مجموعة بيانات كفاءة الطاقة | متطلبات التدفئة والتبريد تعطى كدالة لمعلمات البناء. | تم إعطاء معلمات البناء. | 768 | نص | التصنيف والانحدار | 2012 | [212] [213] | أ. شيفارا وآخرون. |
| مجموعة بيانات الضوضاء الذاتية للجناح | سلسلة من الاختبارات الديناميكية الهوائية والصوتية لمقاطع شفرات الجناح ثنائية وثلاثية الأبعاد. | يتم تقديم بيانات حول التردد وزاوية الهجوم وما إلى ذلك. | 1503 | نص | الانحدار | 2014 | [214] | ر. لوبيز |
| مجموعة بيانات حلقات مكوك الفضاء تشالنجر الولايات المتحدة | محاولة التنبؤ بمشاكل الحلقة O بالنظر إلى بيانات Challenger السابقة. | يتم تقديم العديد من الميزات لكل رحلة، مثل درجة حرارة الإطلاق. | 23 | نص | الانحدار | 1993 | [215] [216] | د. درابر وآخرون. |
| مجموعة بيانات Statlog (Shuttle) | مجموعة بيانات مكوك الفضاء التابع لوكالة ناسا. | تم تقديم تسعة ميزات. | 58000 | نص | تصنيف | 2002 | [217] | ناسا |
علم الفلك
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| البراكين على كوكب الزهرة – مجموعة بيانات تجربة JARtool | صور كوكب الزهرة التي أرسلتها مركبة الفضاء ماجلان. | يتم تصنيف الصور من قبل البشر. | لم يتم اعطاءه | الصور | تصنيف | 1991 | [218] [219] | السيد بورل |
| مجموعة بيانات تلسكوب MAGIC Gamma | أحداث جسيمات جاما عالية الطاقة التي تم إنشاؤها بواسطة مونت كارلو. | تم استخراج العديد من الميزات من المحاكاة. | 19,020 | نص | تصنيف | 2007 | [219] [220] | ر. بوك |
| مجموعة بيانات التوهجات الشمسية | قياسات عدد أنواع معينة من أحداث التوهجات الشمسية التي تحدث خلال فترة 24 ساعة. | تم تقديم العديد من الميزات الخاصة بالتوهجات الشمسية. | 1389 | نص | الانحدار والتصنيف | 1989 | [221] | ج. برادشو |
| مجموعة بيانات CAMELS متعددة الحقول | خرائط ثنائية الأبعاد وشبكات ثلاثية الأبعاد من آلاف المحاكاة الهيدروديناميكية للجسم N والمتطورة التي تغطي نطاقًا واسعًا في قيمة المعلمات الكونية والفيزيائية الفلكية | تحتوي كل خريطة وشبكة على 6 معلمات كونية وفيزيائية فلكية مرتبطة بها | 405000 خريطة ثنائية الأبعاد و405000 شبكة ثلاثية الأبعاد | خرائط ثنائية الأبعاد وشبكات ثلاثية الأبعاد | الانحدار | 2021 | [222] | فرانسيسكو فيلاسكوسا-نافارو وآخرون. |
علوم الارض
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| براكين العالم | بيانات الانفجارات البركانية لجميع الأحداث البركانية المعروفة على الأرض. | يتم تقديم تفاصيل مثل المنطقة والمنطقة الفرعية والبيئة التكتونية ونوع الصخور السائدة. | 1535 | نص | الانحدار والتصنيف | 2013 | [223] | إي. فينزكي وآخرون. |
| مجموعة بيانات المطبات الزلزالية | الأنشطة الزلزالية من منجم الفحم. | تم تصنيف النشاط الزلزالي على أنه خطير أو غير خطير. | 2584 | نص | تصنيف | 2013 | [224] [225] | م. سيكورا وآخرون. |
| جمال-الولايات المتحدة | مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة | انظر المرجع | 671 | CSV، نص، ملف الشكل | الانحدار | 2017 | [226] [227] | ن. أدور وآخرون. / أ. نيومان وآخرون. |
| جمال-تشيلي | مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة | انظر المرجع | 516 | CSV، نص، ملف الشكل | الانحدار | 2018 | [228] | سي. ألفاريز-جاريتون وآخرون. |
| جمال-البرازيل | مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة | انظر المرجع | 897 | CSV، نص، ملف الشكل | الانحدار | 2020 | [229] | V. شاغاس وآخرون. |
| جمال-بريطانيا العظمى | مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة | انظر المرجع | 671 | CSV، نص، ملف الشكل | الانحدار | 2020 | [230] | ج. كوكسون وآخرون. |
| الجمال-أستراليا | مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة | انظر المرجع | 222 | CSV، نص، ملف الشكل | الانحدار | 2021 | [231] | ك. فاولر وآخرون. |
| لمة -CE | مجموعة بيانات هيدرولوجيا مستجمعات المياه مع سلاسل زمنية هيدرولوجية وأرصاد جوية مختلفة وسمات مختلفة | انظر المرجع | 859 | CSV، نص، ملف الشكل | الانحدار | 2021 | [232] | ج. كلينجلر وآخرون. |
فيزيائية أخرى
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات قوة ضغط الخرسانة | مجموعة بيانات عن خصائص الخرسانة وقوة الضغط. | يتم تقديم تسع ميزات لكل عينة. | 1030 | نص | الانحدار | 2007 | [233] [234] | أنا. يه |
| مجموعة بيانات اختبار انحدار الخرسانة | يتم تحديد تدفق الانهيار الخرساني من حيث الخصائص. | ميزات الخرسانة المذكورة مثل الرماد المتطاير والماء وما إلى ذلك. | 103 | نص | الانحدار | 2009 | [235] [236] | أنا. يه |
| مجموعة بيانات مسك | توقع ما إذا كان الجزيء، بالنظر إلى الميزات، سيكون مسكًا أم غير مسك. | تم إعطاء 168 خاصية لكل جزيء. | 6598 | نص | تصنيف | 1994 | [237] | شركة أريس للصناعات الدوائية |
| مجموعة بيانات أخطاء الصفائح الفولاذية | صفائح فولاذية من 7 أنواع مختلفة. | تم تقديم 27 ميزة لكل عينة. | 1941 | نص | تصنيف | 2010 | [238] | مركز سيميون للأبحاث |
| مجموعة بيانات الجسيمات النانوية أحادية المعدن النبيلة | معالجة وخصائص البنية للجسيمات النانوية أحادية المعدن، حيث تكون العلامات عبارة عن طاقة التكوين. | تم تقديم 85-182 ميزة لكل عينة. | 425 إلى 4000 | CSV | الانحدار | 2017 إلى 2023 | [239] [240] [241] [242] [243] [244] | أ. برنارد و ج. أوبليتال |
| مجموعة بيانات الجسيمات النانوية ثنائية المعدن من شركة نوبل ميتال | معالجة وخصائص البنية للجسيمات النانوية ثنائية المعدن، حيث تكون العلامات عبارة عن طاقة التكوين. | تم تقديم 922 ميزة لكل عينة. | 138147 إلى 162770 | CSV | الانحدار | 2023 | [245] [246] [247 ] [248] [249] [250] [251] [252 ] [ 253] [254] [255] [256] | ج. تينج وآخرون. |
| مجموعة بيانات الجسيمات النانوية ثلاثية المعادن AuPdPt | معالجة وخصائص البنية لجسيمات النانو AuPdPt، حيث تكون العلامات عبارة عن طاقة التكوين. | 1958 ميزات معينة لكل عينة. | 48136 | CSV | الانحدار | 2023 | [257] | ك. لو وآخرون. |
البيانات البيولوجية
مجموعة البيانات من الأنظمة البيولوجية.
بشر
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات العمر | مجموعة بيانات عامة منظمة عن حياة وعمل ووفاة 1.22 مليون شخص مميز. المجال العام. | طريقة مكونة من خمس خطوات لاستنتاج سنوات الميلاد والوفاة والجنس والمهنة من البيانات التي يرسلها المجتمع إلى جميع إصدارات اللغات لمشروع ويكيبيديا. | 1,223,009 | نص | الانحدار، التصنيف | 2022 | الورقة [258]
مجموعة البيانات [259] |
أمورادنجاد وآخرون. |
| مجموعة بيانات قاع العين الاصطناعية [260] | صور واقعية لشبكية العين وتقسيمات الأوعية الدموية. المجال العام. | 2500 صورة بقياس 1500*1152 بكسل مفيدة لتجزئة وتصنيف الأوردة والشرايين على خلفية واحدة. | 2500 | الصور | التصنيف والتجزئة | 2020 | [261] | ج. فالنتي وآخرون. |
| قاعدة بيانات تخطيط كهربية الدماغ | دراسة لفحص ارتباط تخطيط كهربية الدماغ بالاستعداد الوراثي لإدمان الكحول. | تم إجراء القياسات من 64 قطبًا كهربائيًا تم وضعها على فروة الرأس وتم أخذ العينات منها بتردد 256 هرتز (3.9 مللي ثانية) لمدة ثانية واحدة. | 122 | نص | تصنيف | 1999 | [262] | ح. بيجليتر |
| مجموعة بيانات واجهة P300 | بيانات من تسعة أشخاص تم جمعها باستخدام واجهة الدماغ والحاسوب القائمة على P300 للأشخاص ذوي الإعاقة. | مقسمة إلى أربع جلسات لكل موضوع. يتم إعطاء كود MATLAB . | 1,224 | نص | تصنيف | 2008 | [263] [264] | يو هوفمان وآخرون. |
| مجموعة بيانات أمراض القلب | يُنسب إلى المرضى المصابين بأمراض القلب وغير المصابين بها. | تم تقديم 75 سمة لكل مريض مع بعض القيم المفقودة. | 303 | نص | تصنيف | 1988 | [265] [266] | أ. جانوسي وآخرون. |
| مجموعة بيانات سرطان الثدي في ولاية ويسكونسن (التشخيصية) | مجموعة بيانات عن خصائص كتل الثدي. يتم تقديم التشخيصات من قبل الطبيب. | يتم إعطاء 10 ميزات لكل عينة. | 569 | نص | تصنيف | 1995 | [267] [268] | و. وولبيرج وآخرون. |
| المسح الوطني حول تعاطي المخدرات والصحة | دراسة استقصائية واسعة النطاق حول الصحة وتعاطي المخدرات في الولايات المتحدة. | لا أحد. | 55,268 | نص | التصنيف والانحدار | 2012 | [269] | وزارة الصحة والخدمات الإنسانية الأمريكية |
| مجموعة بيانات سرطان الرئة | مجموعة بيانات سرطان الرئة بدون تعريفات السمات | يتم تقديم 56 ميزة لكل حالة | 32 | نص | تصنيف | 1992 | [270] [271] | ز. هونغ وآخرون. |
| مجموعة بيانات عدم انتظام ضربات القلب | بيانات لمجموعة من المرضى، بعضهم يعاني من عدم انتظام ضربات القلب. | 276 ميزة لكل حالة. | 452 | نص | تصنيف | 1998 | [272] [273] | ح. ألتاي وآخرون. |
| مجموعة بيانات Diabetes 130-المستشفيات الأمريكية للسنوات 1999-2008 | 9 سنوات من بيانات إعادة القبول عبر 130 مستشفى في الولايات المتحدة للمرضى المصابين بمرض السكري. | يتم تقديم العديد من الميزات لكل إعادة القبول. | 100000 | نص | التصنيف والتجميع | 2014 | [274] [275] | ج. كلور وآخرون. |
| مجموعة بيانات ديبرسين لاعتلال الشبكية السكري | السمات المستخرجة من صور العيون المصابة باعتلال الشبكية السكري وغير المصابة به. | تم استخراج الميزات وتشخيص الحالات. | 1151 | نص | تصنيف | 2014 | [276] [277] | ب. أنطال وآخرون. |
| مجموعة بيانات اعتلال الشبكية السكري في ميسيدور | طرق تقييم تقنيات التجزئة والفهرسة في مجال طب شبكية العين (MESSIDOR) | ميزات درجة اعتلال الشبكية وخطر الوذمة البقعية | 1200 | الصور والنصوص | التصنيف والتجزئة | 2008 | [278] [279] | مشروع ميسيدور |
| مجموعة بيانات اضطرابات الكبد | بيانات للأشخاص الذين يعانون من اضطرابات الكبد. | يتم إعطاء سبعة سمات بيولوجية لكل مريض. | 345 | نص | تصنيف | 1990 | [280] [281] | شركة بوبا للأبحاث الطبية المحدودة |
| مجموعة بيانات أمراض الغدة الدرقية | 10 قواعد بيانات لبيانات مرضى الغدة الدرقية. | لا أحد. | 7200 | نص | تصنيف | 1987 | [282] [283] | ر. كوينلان |
| مجموعة بيانات الورم المتوسطة | بيانات مرضى الورم المتوسطة. | يتم تقديم عدد كبير من الميزات، بما في ذلك التعرض للأسبستوس. | 324 | نص | تصنيف | 2016 | [284] [285] | أ. تانريكولو وآخرون. |
| مجموعة بيانات تقدير الوضعية بناءً على الرؤية لدى مرضى باركنسون | تقديرات وضعية الإنسان ثنائية الأبعاد لمرضى باركنسون أثناء قيامهم بمجموعة متنوعة من المهام. | تمت إزالة اهتزاز الكاميرا من المسارات. | 134 | نص | التصنيف والانحدار | 2017 | [286] [287] [288] | م. لي وآخرون. |
| مجموعة بيانات شبكة التفاعل الأيضي KEGG (غير الموجهة) | شبكة المسارات الأيضية. يتم تقديم شبكة التفاعل وشبكة العلاقات . | يتم تقديم الميزات التفصيلية لكل عقدة شبكة ومسار. | 65,554 | نص | التصنيف والتجميع والانحدار | 2011 | [289] | م. نعيم وآخرون. |
| مجموعة بيانات تحليل مورفولوجيا الحيوانات المنوية البشرية المعدلة (MHSMA) | صور الحيوانات المنوية البشرية من 235 مريضًا يعانون من العقم عند الذكور، مصنفة حسب الحيوانات المنوية الطبيعية أو غير الطبيعية، الأكروسوم، الرأس، الفجوة، والذيل. | تم قصها حول رأس حيوان منوي واحد. تم تطبيع التكبير. تم إنشاء تقسيمات مجموعة التدريب والتحقق والاختبار. | 1,540 | ملفات .npy | تصنيف | 2019 | [290] [291] | س. جافادي وس. أ. ميروشاندل |
حيوان
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات الأبالون | القياسات الفيزيائية لأذن البحر، كما تم توضيح أنماط الطقس والموقع. | لا أحد. | 4177 | نص | الانحدار | 1995 | [292] | مختبرات الأبحاث البحرية – تارونا |
| مجموعة بيانات حديقة الحيوان | مجموعة بيانات اصطناعية تغطي 7 فئات من الحيوانات. | يتم تصنيف الحيوانات إلى 7 فئات ويتم إعطاء ميزات لكل منها. | 101 | نص | تصنيف | 1990 | [293] | ر. فورسيث |
| مجموعة بيانات الإسفنجيات | بيانات عن الإسفنج البحري. | يتم وصف 503 إسفنجة في فئة Demosponge بميزات مختلفة. | 503 | نص | تصنيف | 2010 | [294] | إي. أرمينجول وآخرون. |
| بيانات الحيوانات في المزرعة | جرد بيانات PLF (الأبقار والخنازير والموقع والتسارع وما إلى ذلك). | مجموعات البيانات المُسمّاة. | يتم تحديث القائمة باستمرار | نص | تصنيف | 2020 | [295] | ف. بلوخ |
| مجموعة بيانات تسلسلات جينات الوصلات الموصولة | تسلسلات جينات الوصلة الوصلية (DNA) لدى الرئيسيات مع نظرية المجال غير الكامل المرتبطة بها. | لا أحد. | 3190 | نص | تصنيف | 1992 | [271] | ج. تاول وآخرون. |
| مجموعة بيانات تعبير البروتين لدى الفئران | مستويات التعبير عن 77 بروتينًا تم قياسها في القشرة المخية للفئران. | لا أحد. | 1080 | نص | التصنيف والتجميع | 2015 | [296] [297] | ج. هيجيرا وآخرون. |
الفطريات
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات UCI Mushroom | صفات الفطر وتصنيفه. | يتم ذكر العديد من خصائص كل فطر. | 8124 | نص | تصنيف | 1987 | [298] | ج. شليمر |
| مجموعة بيانات الفطر الثانوية | صفات الفطر وتصنيفه | بيانات محاكاة من إدخالات فطر أولية أكبر وأكثر واقعية. قابلة للتكرار بالكامل. | 61069 | نص | تصنيف | 2020 | [299] [300] | د. فاغنر وآخرون. |
نبات
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات حرائق الغابات | حرائق الغابات وخصائصها | تم استخراج 13 ميزة لكل حريق. | 517 | نص | الانحدار | 2008 | [301] [302] | ب. كورتيز وآخرون. |
| مجموعة بيانات القزحية | يتم وصف ثلاثة أنواع من نباتات السوسن من خلال 4 سمات مختلفة. | لا أحد. | 150 | نص | تصنيف | 1936 | [303] [304] | ر. فيشر |
| مجموعة بيانات أوراق أنواع النباتات | ستة عشر عينة من أوراق كل مائة نوع من النباتات. | يتم تقديم وصف الشكل، والهامش الدقيق، ومخططات الملمس. | 1600 | نص | تصنيف | 2012 | [305] [306] | ج. كوب وآخرون. |
| مجموعة بيانات فول الصويا | قاعدة بيانات نباتات فول الصويا المريضة. | تم ذكر 35 خاصية لكل نبات، وتم تصنيف النباتات إلى 19 فئة. | 307 | نص | تصنيف | 1988 | [307] | ر. ميشالسكي وآخرون. |
| مجموعة بيانات البذور | قياس الخصائص الهندسية للحبوب التابعة لثلاثة أصناف مختلفة من القمح. | لا أحد. | 210 | نص | التصنيف والتجميع | 2012 | [308] [309] | شاريتانوفيتش وآخرون. |
| مجموعة بيانات الغلاف | بيانات للتنبؤ بنوع الغطاء الحرجي من المتغيرات الخرائطية بشكل صارم. | تم تقديم العديد من الميزات الجغرافية. | 581,012 | نص | تصنيف | 1998 | [310] [311] | ج. بلاكارد وآخرون. |
| مجموعة بيانات شبكة إشارات حمض الأبسيسيك | بيانات لشبكة إشارات النباتات. الهدف هو تحديد مجموعة القواعد التي تحكم الشبكة. | لا أحد. | 300 | نص | الاكتشاف السببي | 2008 | [312] | ج. جينكينز وآخرون. |
| مجموعة بيانات فوليو | 20 صورة لأوراق كل نوع من 32 نوعًا. | لا أحد. | 637 | الصور والنصوص | التصنيف والتجميع | 2015 | [313] [314] | ت. مونيسامي وآخرون. |
| مجموعة بيانات زهور أكسفورد | مجموعة بيانات مكونة من 17 فئة من الزهور. | تقسيمات التدريب/الاختبار، الصور الموسومة، | 1360 | الصور والنصوص | تصنيف | 2006 | [315] [316] | ME نيلسباك وآخرون. |
| مجموعة بيانات شتلات النباتات | مجموعة بيانات مكونة من 12 فئة من شتلات النباتات. | الصور المصنفة، الصور المجزأة، | 5544 | الصور | التصنيف والكشف | 2017 | [317] | جيسلسون وآخرون. |
| فواكه-360 | قاعدة بيانات تحتوي على صور 131 نوع من الفواكه والخضروات. | 100×100 بكسل، خلفية بيضاء. | 90483 | الصور (jpg) | تصنيف | 2017–2024 | [318] | ميهاي أولتيان |
| تطبيق Weed-ID | قاعدة بيانات تحتوي على 1025 نوعًا، وأكثر من 13500 صورة، وأكثر من 120000 سمة | أحجام وخلفيات مختلفة. تم تصنيفها بواسطة عالم نبات حاصل على درجة الدكتوراه. | 13,500 | الصور والنصوص | تصنيف | 1999-2024 | [319] | ريتشارد أولد |
| مجموعة بيانات CottonWeedDet3 | مجموعة بيانات مكونة من 3 فئات لكشف الأعشاب الضارة لأنظمة زراعة القطن | 3 أنواع من الأعشاب الضارة. | 848 | الصور | تصنيف | 2022 | [320] | رحمن وآخرون. |
ميكروب
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات إيكولي | مواقع تواجد البروتين. | يتم تقديم ميزات مختلفة لمواقع توطين البروتين. | 336 | نص | تصنيف | 1996 | [321] [322] | ك. ناكاي وآخرون. |
| مجموعة بيانات MicroMass | التعرف على الكائنات الحية الدقيقة من بيانات مطياف الكتلة. | ميزات مطياف الكتلة المتنوعة. | 931 | نص | تصنيف | 2013 | [323] [324] | ب. ماهي وآخرون. |
| مجموعة بيانات الخميرة | التنبؤ بمواقع توطين البروتينات في الخلايا. | يتم تقديم ثمانية ميزات لكل حالة. | 1484 | نص | تصنيف | 1996 | [325] [326] | ك. ناكاي وآخرون. |
اكتشاف الأدوية
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات Tox21 | التنبؤ بنتائج التحاليل البيولوجية. | يتم إعطاء الوصافات الكيميائية للجزيئات. | 12707 | نص | تصنيف | 2016 | [327] | أ. ماير وآخرون. |
بيانات الشذوذ
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| معيار الشذوذ Numenta (NAB) | البيانات عبارة عن مقاييس مرتبة ومؤقتة وذات قيمة واحدة. تحتوي جميع ملفات البيانات على شذوذ، ما لم يُذكر خلاف ذلك. | لا أحد | أكثر من 50 ملفًا | CSV | كشف الشذوذ | 2016 (تحديث مستمر) | [328] | نومنتا |
| معيار شذوذ Skoltech (SKAB) | يمثل كل ملف تجربة واحدة ويحتوي على شذوذ واحد. تمثل مجموعة البيانات سلسلة زمنية متعددة المتغيرات تم جمعها من أجهزة الاستشعار المثبتة على منصة الاختبار. | هناك نوعان من العلامات لمشكلات اكتشاف القيم الشاذة (الشذوذ النقطي) واكتشاف نقطة التغيير (الشذوذ الجماعي) | أكثر من 30 ملفًا (الإصدار 0.9) | CSV | كشف الشذوذ | 2020 (تحديث مستمر) |
[329] [330] |
يوري د. كاتسر وفياتشيسلاف أو. كوزيتسين |
| حول تقييم اكتشاف القيم المتطرفة غير الخاضعة للإشراف: المقاييس ومجموعات البيانات ودراسة تجريبية | يتم تكييف معظم ملفات البيانات من بيانات مستودع التعلم الآلي بجامعة كاليفورنيا، ويتم جمع بعضها من الأدبيات. | تم معالجتها للقيم المفقودة، والسمات الرقمية فقط، ونسب مختلفة من الشذوذ، والعلامات | أكثر من 1000 ملف | أرف | كشف الشذوذ | 2016 (ربما تم تحديثه بمجموعات بيانات و/أو نتائج جديدة) |
[331] |
كامبوس وآخرون. |
بيانات الإجابة على الأسئلة
يتضمن هذا القسم مجموعات البيانات التي تتعامل مع البيانات المنظمة.
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مجموعة بيانات DBpedia Neural Question Answering (DBNQA) | مجموعة كبيرة من الأسئلة الموجهة إلى SPARQL مصممة خصيصًا للإجابة على الأسئلة العصبية في المجال المفتوح عبر قاعدة بيانات المعرفة DBpedia. | تحتوي مجموعة البيانات هذه على مجموعة كبيرة من قوالب SPARQL العصبية المفتوحة ومثيلاتها لتدريب آلات SPARQL العصبية؛ وقد تمت معالجتها مسبقًا بواسطة أدوات التعليق شبه الآلية بالإضافة إلى ثلاثة خبراء SPARQL. | 894,499 | أزواج السؤال-الاستفسار | الإجابة على الأسئلة | 2018 | [332] [333] | هارتمان، سورو، وماركس وآخرون. |
| مجموعة بيانات الإجابة على الأسئلة باللغة الفيتنامية (UIT-ViQuAD) | مجموعة كبيرة من الأسئلة الفيتنامية لتقييم نماذج MRC. | تتضمن مجموعة البيانات هذه أكثر من 23000 زوجًا من الأسئلة والأجوبة التي تم إنشاؤها بواسطة الإنسان بناءً على 5109 فقرة من 174 مقالة فيتنامية من ويكيبيديا. | 23,074 | أزواج الأسئلة والأجوبة | الإجابة على الأسئلة | 2020 | [334] | نجوين وآخرون. |
| مجموعة قراءة آلية متعددة الخيارات باللغة الفيتنامية (ViMMRC) | مجموعة من أسئلة الاختيار من متعدد باللغة الفيتنامية لتقييم نماذج MRC. | يتضمن هذا الكتاب 2783 سؤالاً اختياريًا متعددًا باللغة الفيتنامية. | 2,783 | أزواج الأسئلة والأجوبة | الإجابة على الأسئلة/فهم القراءة الآلية | 2020 | [335] | نجوين وآخرون. |
| الإجابة على الأسئلة في المجال المفتوح تتحول إلى محادثة من خلال إعادة كتابة الأسئلة | الإجابة على أسئلة المجال المفتوح من البداية إلى النهاية. | تتضمن مجموعة البيانات هذه 14000 محادثة مع 81000 زوج من الأسئلة والأجوبة. | السياق، السؤال، إعادة الكتابة، الإجابة، عنوان URL للإجابة، رقم المحادثة، رقم التحويل، مصدر المحادثة
يتم توفير المزيد من التفاصيل في مستودع GitHub الخاص بالمشروع وبطاقة مجموعة البيانات Hugging Face ذات الصلة. |
الإجابة على الأسئلة | 2021 | [336] | أنانثا وفاكولينكو وآخرون. | |
| توحيد ضمان الجودة | بيانات الأسئلة والأجوبة | مجموعة البيانات المعالجة | الإجابة على الأسئلة | 2020 | [337] | خشابي وآخرون. |
بيانات مطالبة الحوار أو التعليمات
يتضمن هذا القسم مجموعات البيانات التي ...
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مدير المهام | "يتكون مجموعة Taskmaster من ثلاث مجموعات بيانات، Taskmaster-1 (TM-1)، وTaskmaster-2 (TM-2)، وTaskmaster-3 (TM-3)، والتي تضم أكثر من 55000 حوار موجه نحو المهام، شفهيًا ومكتوبًا، في أكثر من اثني عشر مجالًا." [338] | Taskmaster-1: مجموعة بيانات محادثة موجهة نحو الهدف. تتضمن 13215 حوارًا قائمًا على المهام تتألف من ستة مجالات.
Taskmaster-2: 17,289 حوارًا في المجالات السبعة (المطاعم، وطلب الطعام، والأفلام، والفنادق، والرحلات الجوية، والموسيقى والرياضة). Taskmaster-3: 23,757 حوارات شراء تذاكر الأفلام. |
Taskmaster-1 وTaskmaster-2: معرف المحادثة، والعبارات، ومعرف التعليمات
Taskmaster-3: معرف المحادثة، العبارات، العمودي، السيناريو، التعليمات. لمزيد من التفاصيل، راجع مستودع GitHub الخاص بالمشروع أو بطاقات مجموعة بيانات Hugging Face (taskmaster-1، taskmaster-2، taskmaster-3). |
الحوار/التعليمات المطلوبة | 2019 | [339] | بيرن وكريشنامورثي وآخرون. | |
| دكتور ريبير | مجموعة بيانات مُصنَّفة لإصلاح البرنامج. | البيانات المعالجة مسبقًا | تحقق من تفاصيل التنسيق في ورقة عمل المشروع. | الحوار/التعليمات المطلوبة | 2020 | [340] | ميتشيرو وآخرون. | |
| التعليمات الطبيعية الإصدار الثاني | مجموعة بيانات كبيرة تغطي نطاقًا أوسع من قدرات التفكير | تتكون كل مهمة من الإدخال/الإخراج، وتعريف المهمة.
بالإضافة إلى ذلك، يحتوي كل طلب على تعريف للمهمة. تتوفر معلومات إضافية في مستودع GitHub الخاص بالمشروع وبطاقة بيانات Hugging Face. |
الإدخال/الإخراج وتعريف المهمة | 2022 | [341] | وانغ وآخرون. | ||
| لامبادا | "LAMBADA عبارة عن مجموعة من المقاطع السردية التي تشترك في خاصية مفادها أن الأشخاص قادرين على تخمين كلمتهم الأخيرة إذا تعرضوا للمقطع بأكمله، ولكن ليس إذا رأوا فقط الجملة الأخيرة التي تسبق الكلمة المستهدفة." [342] | تتوفر معلومات حول تنسيق هذه المجموعة من البيانات في بطاقة مجموعة البيانات HuggingFace وموقع الويب الخاص بالمشروع.
يمكن تنزيل مجموعة البيانات هنا، والبيانات المرفوضة هنا. |
2016 | [343] | بابيرنو وآخرون. | |||
| فلان | يتوفر إصدار تمت معالجته مسبقًا من مجموعة بيانات FLAN مع التحديثات منذ إصدار مجموعة بيانات FLAN الأصلية في Hugging Face:
تتوفر البرامج النصية لمعالجة البيانات في مستودع GitHub المذكور في الورقة: https://github.com/google-research/FLAN/tree/main/flan. تم إنشاء مستودع آخر لـ FLAN على GitHub أيضًا. وهو المستودع المرتبط ببطاقة مجموعة البيانات في Hugging Face. |
2021 | [344] | وي وآخرون. |
الأمن السيبراني
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| هجوم الميتري | ATT&CK هي قاعدة معرفية يمكن الوصول إليها عالميًا لتكتيكات وتقنيات الخصم. | يمكن تنزيل البيانات من مستودعي GitHub التاليين: الإصدار 2.1 والإصدار 2.0 | [345] | هجوم الميتري | ||||
| كابيك | حصر وتصنيف أنماط الهجوم الشائعة | يمكن تنزيل البيانات من موقع CAPEC على الإنترنت:
آليات الهجوم مجالات الهجوم |
[346] | كابيك | ||||
| سي في إي | CVE عبارة عن قائمة من الثغرات الأمنية السيبرانية التي تم الكشف عنها علنًا والتي يمكن البحث عنها واستخدامها ودمجها في المنتجات والخدمات مجانًا. | يمكن تنزيل البيانات من: Allitems | [347] | سي في إي | ||||
| سي دبليو إي | بيانات تعداد نقاط الضعف الشائعة. | يمكن تنزيل البيانات من:
تطوير البرمجيات تصميم الأجهزة [ رابط ميت دائم ] مفاهيم البحث |
[348] | سي دبليو إي | ||||
| مالويرتكست دي بي | قاعدة بيانات توضيحية لنصوص البرامج الضارة. | يحتوي مستودع GitHub الخاص بالمشروع على البيانات التي يمكن تنزيلها. | [349] | كيات وآخرون. | ||||
| وقائع ندوة أمن USENIX | مجموعة من الإجراءات الأمنية من ندوة أمن USENIX - الجلسات الفنية من عام 1995 إلى عام 2022. | هذه البيانات لم تتم معالجتها مسبقًا. | 1995، 1996، 1997، 1998، 1999، 2000، 2001، 2002، 2003، 2004، 2005، 2006، 2007، 2008،
2009، 2010 2011، 2012، 2013، 2014، 2015، 2016، 2017، 2018، 2019، 2020، 2021، 2022. |
[350] | ندوة أمن USENIX | |||
| ملاحظات APT | مجموعة من الوثائق العامة والأوراق البيضاء والمقالات حول حملات التهديدات المتقدمة المستمرة. جميع الوثائق عبارة عن بيانات متاحة للعامة. | هذه البيانات لم تتم معالجتها مسبقًا. | يحتوي مستودع GitHub الخاص بالمشروع على ملف يحتوي على روابط للبيانات المخزنة في box.
يمكن أيضًا تنزيل ملفات البيانات هنا. |
[351] | ملاحظات APT | |||
| مقالات arXiv حول التشفير والأمان | مجموعة من المقالات حول الأمن السيبراني | هذه البيانات لم تتم معالجتها مسبقًا. | جميع المقالات متوفرة هنا. | [352] | أركسيف | |||
| كتب إلكترونية مجانية عن الأمن | مجموعة صغيرة من الكتب الإلكترونية المتعلقة بالأمن، والعروض التقديمية المتعلقة بالأمن المتاحة للعامة. | هذه البيانات لم تتم معالجتها مسبقًا. | [353] [354] [355] [356] [357] [358] [359] [360] [ 361] [362] [363] [364] | |||||
| مستودع استراتيجية الأمن السيبراني الوطني | مستودع للوثائق الاستراتيجية العالمية حول الأمن السيبراني. | هذه البيانات لم تتم معالجتها مسبقًا. | [365] | |||||
| الأمن السيبراني ومعالجة اللغة الطبيعية | بيانات حول استراتيجيات الأمن السيبراني من أكثر من 75 دولة. | التجزئة، إزالة الكلمات المتكررة التي لا معنى لها. | [366] | يانلين تشين، يونجيان وي، ييفان يو، ون شيويه، زيانيا تشين | ||||
| مجموعة تقارير APT | عينة من تقارير التهديدات المتقدمة المستمرة، والبرامج الضارة، والتكنولوجيا، وجمع المعلومات الاستخباراتية | البيانات الخام والرمزية متاحة. | تتوفر كافة البيانات في مستودع GitHub هذا. | [ بحاجة لمصدر ] | طائر أسود | |||
| مجموعة بيانات تحديد اللغة الهجومية (OLID) | البيانات متوفرة في موقع المشروع.
البيانات متاحة هنا أيضًا. |
[367] | زامبيري وآخرون. | |||||
| تقارير سيبرانية من المركز الوطني للأمن السيبراني | هذه البيانات لم تتم معالجتها مسبقًا. | تقارير التهديدات، التقارير والاستشارات، الأخبار، المدونات، الخطب.
قائمة بديلة للتقارير. |
[368] | |||||
| تقارير APT من شركة Kaspersky | هذه البيانات لم تتم معالجتها مسبقًا. | [369] | ||||||
| السلك السيبراني | هذه البيانات لم تتم معالجتها مسبقًا. | النشرات الإخبارية والبودكاست والقصص. | [370] | |||||
| أخبار خروقات البيانات | هذه البيانات لم تتم معالجتها مسبقًا. | الأخبار، قائمة الأخبار من أغسطس 2022 إلى فبراير 2023 | [371] | |||||
| أخبار الإنترنت | هذه البيانات لم تتم معالجتها مسبقًا. | الأخبار، قائمة مختارة من الأخبار | [372] | |||||
| الكمبيوتر النازف | هذه البيانات لم تتم معالجتها مسبقًا. | أخبار | [373] | |||||
| السجل | هذه البيانات لم تتم معالجتها مسبقًا. | اخبار الجرائم الالكترونية | [374] | |||||
| هاكر ريد | هذه البيانات لم تتم معالجتها مسبقًا. | اخبار القرصنة | [375] | |||||
| قائمة آمنة | هذه البيانات لم تتم معالجتها مسبقًا. | تقارير APT، الأرشيف، تقارير DDOS، الحوادث، نشرة Kaspersky الأمنية، التهديدات الصناعية، تقارير البرامج الضارة، الآراء، المنشورات، الأبحاث، وSAS. | [376] | |||||
| مشروع الجص | يقوم مشروع Stucco بجمع البيانات التي لا يتم دمجها عادةً في أنظمة الأمان. | هذه البيانات ليست معالجة مسبقًا | موقع المشروع على شبكة الإنترنت مع معلومات البيانات المصدر الذي تمت مراجعته مع روابط لمصادر البيانات | [377] | ||||
| الأمن البصري | موقع ويب يحتوي على معلومات تقنية وتقارير والمزيد حول مواضيع الأمان. | هذه البيانات ليست معالجة مسبقًا | المعلومات التقنية والأبحاث والتقارير. | [378] | ||||
| شناير | موقع يحتوي على أوراق أكاديمية حول مواضيع أمنية. | هذه البيانات ليست معالجة مسبقًا | الأوراق حسب الفئة، أرشيف الأوراق حسب التاريخ. | [379] | ||||
| تريندميكرو | موقع يحتوي على أبحاث وأخبار ووجهات نظر حول مواضيع أمنية. | هذه البيانات ليست معالجة مسبقًا | قائمة تمت مراجعتها لأبحاث Trendmicro والأخبار والآراء. | [380] | ||||
| أخبار الهاكر | أخبار حول مواضيع الأمن السيبراني. | هذه البيانات ليست معالجة مسبقًا | أخبار عن انتهاكات البيانات والهجمات الإلكترونية والثغرات الأمنية والبرامج الضارة. | [381] | ||||
| كريبسون سيكيوريتي | أخبار الأمن والتحقيقات | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من الأخبار | [382] | ||||
| ميتري الدفاع | مصفوفة من القطع الأثرية الدفاعية | ملفات json | [383] | |||||
| أطلس ميتري | Mitre Atlas هي قاعدة معرفية لتكتيكات الخصم وتقنياته ودراسات الحالة لأنظمة التعلم الآلي (ML) استنادًا إلى الملاحظات في العالم الحقيقي. | هذه البيانات ليست معالجة مسبقًا | [384] | |||||
| ميتري إنجيج | MITRE Engage هو إطار عمل للتخطيط ومناقشة عمليات إشراك الخصوم والذي يمكّنك من إشراك خصومك وتحقيق أهدافك المتعلقة بالأمن السيبراني. | هذه البيانات ليست معالجة مسبقًا | [385] | |||||
| دروس الاختراق | هذه البيانات ليست معالجة مسبقًا | [386] |
المناخ والاستدامة
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| تقارير لجنة الإفصاح المالي المتعلقة بالمناخ | قاعدة بيانات لتقارير الشركات التي تتضمن إفصاحات متعلقة بـ TCFD. | هذه البيانات ليست معالجة مسبقًا | رابط مباشر للتقاريرقائمة مختارة من التقارير | [387] | مركز معرفة TCFD | |||
| تقارير المسؤولية الاجتماعية للشركات | قائمة تقارير المسؤولية على شبكة الإنترنت. | هذه البيانات ليست معالجة مسبقًا | قائمة التقارير المنسقة | [388] | تقارير المسئولية | |||
| الهيئة الحكومية الدولية المعنية بتغير المناخ (IPCC) | مجموعة من تقارير التقييم الشاملة حول المعرفة المتعلقة بتغير المناخ وأسبابه وتأثيراته المحتملة وخيارات الاستجابة | هذه البيانات ليست معالجة مسبقًا | التقاريرقائمة مختارة من التقارير | [389] | اللجنة الدولية للتغيرات المناخية | |||
| التحالف من أجل البحوث حول الاستدامة المؤسسية | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من منشورات المدونة | [390] | أركس | ||||
| مجموعة ESG: مركز المعرفة للمحاسبة من أجل الاستدامة | هذه البيانات ليست معالجة مسبقًا | أدلة ودراسات حالة ومدونات وتقارير واستطلاعات. | [391] | ميهرا وآخرون. | ||||
| حمى المناخ | مجموعة بيانات تتبنى منهجية FEVER وتتكون من 1535 ادعاءً حقيقيًا بشأن تغير المناخ تم جمعها على الإنترنت. | يرافق كل ادعاء خمس جمل أدلة مُعلقة يدويًا تم استردادها من ويكيبيديا الإنجليزية والتي تدعم أو تدحض أو لا تقدم معلومات كافية للتحقق من صحة الادعاء، ويبلغ مجموعها 7675 زوجًا من الادعاء والدليل. [392] | مجموعة بيانات بطاقة HF، ومستودع GitHub الخاص بالمشروع. | [393] | ديجلمان وآخرون. | |||
| مجموعة بيانات أخبار المناخ | مجموعة بيانات للباحثين في مجال معالجة اللغة الطبيعية ووسائل الإعلام الخاصة بتغير المناخ | تتكون مجموعة البيانات من عدد من عناصر البيانات (ملفات نصية بتنسيق JSON وJSONL وCSV وقاعدة بيانات SQLite) | قاعدة بيانات أخبار المناخ، مستودع GitHub الخاص بالمشروع | [394] | كفاءة ADGE | |||
| كلايمتكست | Climatext هي مجموعة بيانات للكشف عن موضوعات تغير المناخ استنادًا إلى الجملة. | مجموعة بيانات التردد العالي | [395] | جامعة زيورخ | ||||
| جرين بيز | مجموعة من المقالات والأخبار حول المناخ والاستدامة | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المقالات حول المناخقائمة مختارة من المقالات حول الاستدامة | [396] | ||||
| أفضل الأبحاث المسبقة في مجال المناخ والاستدامة | قائمة المطبوعات المسبقة للباحثين في قائمة رويترز الساخنة | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المطبوعات المسبقة | [397] | موريس تامان | |||
| أركس | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من مدونات الاستدامة المؤسسية | [398] | |||||
| جرين بيز | موقع يحتوي على مقالات حول المناخ والاستدامة | هذه البيانات ليست معالجة مسبقًا | [399] | جرين بيز | ||||
| سي إس آر واير | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المقالات | [400] | سي إس آر واير | ||||
| مركز بيانات العملاء | مقالات عن المناخ والمياه والغابات | هذه البيانات ليست معالجة مسبقًا | [401] | مركز بيانات العملاء |
بيانات الكود
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| المكدس | مجموعة بيانات بحجم 3.1 تيرابايت تتكون من كود مصدر مرخص بـ 30 لغة برمجة. | تم تصفيته من خلال اكتشاف الترخيص وإزالة التكرار. | 6 تيرابايت، 51.76 بايت ملف (قبل إزالة التكرار)؛ 3 تيرابايت، 5.28 بايت ملف (بعد). 358 لغة برمجة. | باركيه | نمذجة اللغة، الإكمال التلقائي، توليف البرامج. | 2022 | [402] [403] | D. Kocetkov، R. Li، L. Ben Allal، L. von Werra، H. de Vries |
| مستودعات GitHub | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المستودعات من GitHub : 61 62 63 64 65 66 67 68 69 70 71، 72، 73، 74، 75، 76، 77 101 | ||||||
| مستودعات IBM العامة على GitHub | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المستودعات من GitHub | ||||||
| مستودعات RedHat العامة على GitHub | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المستودعات من GitHub | ||||||
| ملفات أرشيف StackExchange Public Archive.org | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من الملفات من Archive.org | ||||||
| مستودعات Gitlab العامة | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المستودعات من Gitlab : 1 2 | ||||||
| مستودعات Ansible Collections العامة | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المستودعات من GitHub . | ||||||
| مجموعة بيانات كود GitHub الخاصة بـ CodeParrot | هذه البيانات ليست معالجة مسبقًا | قائمة مختارة من المستودعات من Hugging Face : 1 2 3 4 5 6 7 8 9 10 | ||||||
| أوكد | التوزيع المجتمعي لـ Kubernetes الذي يدعم Red Hat OpenShift | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | |||||
| أوبن شفت | توزيع Kubernetes الصديق للمطورين والعمليات | قائمة مستودعات GitHub للمشروع | ||||||
| كوبيرنيتس | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مطور ريد هات | GitHub موطن برنامج Red Hat Developer | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | |||||
| القبعة الحمراء
ورش العمل |
هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مجموعات الاهتمامات الخاصة بـ Kubernetes | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| ناقل | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| سوق ريد هات | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مدونة ريدهات | هذه البيانات ليست معالجة مسبقًا | [404] | ||||||
| كوبيرنيتيس io | هذه البيانات ليست معالجة مسبقًا | [405] | ||||||
| مستندات Openshift | هذه البيانات ليست معالجة مسبقًا | [406] | ||||||
| سي إن سي إف أي أو | هذه البيانات ليست معالجة مسبقًا | [407] | ||||||
| عروض تقديمية لـ Kubernetes | قائمة العروض التقديمية المتاحة للعامة حول Kubernetes | هذه البيانات ليست معالجة مسبقًا | رابط البيانات | |||||
| مختبرات الابتكار المفتوحة لشركة Red Hat | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| عروض توضيحية لشركة Red Hat | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| ريد هات أوبن شيفت أونلاين | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مجموعات البرامج | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| رؤى ريد هات | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| حكومة ريد هات | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| استشارات ريد هات | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مجتمعات الممارسة لشركة Red Hat | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| شريك التكنولوجيا في شركة Red Hat | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| توثيقات ريد هات | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| آي بي إم | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| سحابة آي بي إم | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| بناء فريق المختبر | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| وحدات Terraform IBM | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مخططات السحابة | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| عروض OCP Power | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| تحديث تطبيقات IBM | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مركز تشغيل Kubernetes | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مؤسسة الحوسبة السحابية الأصلية (CNCF) | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| إطار عمل المشغل | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | [408] | |||||
| مستودعات GitHub المشار إليها في artifacthub.io | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub في artifacthub.io | ||||||
| مجتمعات الممارسة لشركة Red Hat | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| شريك ريد هات | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مستودعات IBM | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| بناء فريق المختبر | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| إطار عمل المشغل | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مستودعات GitHub | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| القبعة الحمراء | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| أنماط Kubernetes | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| أنماط نشر وأمان Kubernetes | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| Kubernetes للمطورين ذوي البرامج الكاملة | هذه البيانات ليست معالجة مسبقًا | قائمة مستودعات GitHub للمشروع | ||||||
| مقاييس Load Balancer Cloudwatch | هذه البيانات ليست معالجة مسبقًا | مستودع GitHub للمشروع | ||||||
| ديناتريس | هذه البيانات ليست معالجة مسبقًا | [5] | ||||||
| بيانات تحدي AIOps 2020 | هذه البيانات ليست معالجة مسبقًا | مستودع GitHub للمشروع | ||||||
| لوغوب | هذه البيانات ليست معالجة مسبقًا | قائمة المستودعات | ||||||
| صفحات HTML | هذه البيانات ليست معالجة مسبقًا | قائمة صفحات HTML | ||||||
| كتب إلكترونية مفتوحة المصدر | هذه البيانات ليست معالجة مسبقًا | [409] | ||||||
| كتب إلكترونية عن Kubernetes | هذه البيانات ليست معالجة مسبقًا | أنماط Kubernetes، ونشر Kubernetes، وKubernetes للمطورين ذوي البرامج الكاملة | ||||||
| Kubernetes للمطورين ذوي البرامج الكاملة | هذه البيانات ليست معالجة مسبقًا | Kubernetes للمطورين ذوي البرامج الكاملة | ||||||
| قائمة مستودعات Github العامة والمرخصة | هذه البيانات ليست معالجة مسبقًا | قائمة المستودعات |
البيانات المتعددة المتغيرات
مالي
| اسم مجموعة البيانات | وصف موجز | المعالجة المسبقة | الحالات | شكل | المهمة الافتراضية | تم الإنشاء (تم التحديث) | مرجع | الخالق |
|---|---|---|---|---|---|---|---|---|
| مؤشر داو جونز | بيانات أسبوعية للأسهم للربع الأول والثاني من عام 2011. | تم تضمين القيم المحسوبة مثل النسبة المئوية للتغيير والتأخيرات. | 750 | القيم المنفصلة بفاصلة | التصنيف، الانحدار، السلاسل الزمنية | 2014 | [410] [411] | م. براون وآخرون. |
| Statlog (الموافقة على الائتمان الأسترالي) | طلبات بطاقات الائتمان المقبولة أو المرفوضة والسمات المتعلقة بالتطبيق. | تم إزالة أسماء السمات بالإضافة إلى معلومات التعريف. وتمت إعادة تسمية العوامل. | 690 | القيم المنفصلة بفاصلة | تصنيف | 1987 | [412] [413] | ر. كوينلان |
| بيانات مزاد eBay | بيانات المزادات من مختلف العناصر الموجودة على موقع eBay.com على مدى مزادات مختلفة المدة | يحتوي على جميع العطاءات، ومعرف مقدم العطاء، وأوقات العطاءات، وأسعار الافتتاح. | ~ 550 | نص | الانحدار والتصنيف | 2012 | [414] [415] | ج. شمويل وآخرون. |
| Statlog (بيانات الائتمان الألمانية) | تصنيف الائتمان الثنائي إلى "جيد" أو "سيئ" مع العديد من الميزات | يتم تقديم الميزات المالية المختلفة لكل شخص. | 690 | نص | تصنيف | 1994 | [416] | ح. هوفمان |
| مجموعة بيانات التسويق المصرفي | بيانات من حملة تسويقية كبيرة قام بها بنك كبير. | يتم ذكر العديد من صفات العملاء الذين تم الاتصال بهم، كما يتم ذكر ما إذا كان العميل مشتركًا في البنك. | 45,211 | نص | تصنيف | 2012 | [417] [418] | س. مورو وآخرون. |
| مجموعة بيانات بورصة اسطنبول | تم تتبع العديد من مؤشرات الأسهم لمدة عامين تقريبًا. | لا أحد. | 536 | نص | التصنيف والانحدار | 2013 | [419] [420] | أو. أكبيلجيك |
| تخلف عملاء بطاقات الائتمان عن السداد | بيانات التخلف عن سداد الائتمان للدائنين التايوانيين. | يتم تقديم ميزات مختلفة لكل حساب. | 30,000 | نص | تصنيف | 2016 | [421] [422] | أنا. يه |
| ستوك نت | التنبؤ بحركة الأسهم من خلال التغريدات وأسعار الأسهم التاريخية | لا أحد | نص | البرمجة اللغوية العصبية | 2018 | [423] | Yumo Xu and Shay B. Cohen |
Weather
| Dataset Name | Brief description | Preprocessing | Instances | Format | Default Task | Created (updated) | Reference | Creator |
|---|---|---|---|---|---|---|---|---|
| Cloud DataSet | Data about 1024 different clouds. | Image features extracted. | 1024 | Text | Classification, clustering | 1989 | [424] | P. Collard |
| El Nino Dataset | Oceanographic and surface meteorological readings taken from a series of buoys positioned throughout the equatorial Pacific. | 12 weather attributes are measured at each buoy. | 178080 | Text | Regression | 1999 | [425] | Pacific Marine Environmental Laboratory |
| Greenhouse Gas Observing Network Dataset | Time-series of greenhouse gas concentrations at 2921 grid cells in California created using simulations of the weather. | None. | 2921 | Text | Regression | 2015 | [426] | D. Lucas |
| Atmospheric CO2 from Continuous Air Samples at Mauna Loa Observatory | Continuous air samples in Hawaii, USA. 44 years of records. | None. | 44 years | Text | Regression | 2001 | [427] | Mauna Loa Observatory |
| Ionosphere Dataset | Radar data from the ionosphere. Task is to classify into good and bad radar returns. | Many radar features given. | 351 | Text | Classification | 1989 | [283][428] | Johns Hopkins University |
| Ozone Level Detection Dataset | Two ground ozone level datasets. | Many features given, including weather conditions at time of measurement. | 2536 | Text | Classification | 2008 | [429][430] | K. Zhang et al. |
Census
| Dataset Name | Brief description | Preprocessing | Instances | Format | Default Task | Created (updated) | Reference | Creator |
|---|---|---|---|---|---|---|---|---|
| Adult Dataset | Census data from 1994 containing demographic features of adults and their income. | Cleaned and anonymized. | 48,842 | Comma separated values | Classification | 1996 | [431] | United States Census Bureau |
| Census-Income (KDD) | Weighted census data from the 1994 and 1995 Current Population Surveys. | Split into training and test sets. | 299,285 | Comma separated values | Classification | 2000 | [432][433] | United States Census Bureau |
| IPUMS Census Database | Census data from the Los Angeles and Long Beach areas. | None | 256,932 | Text | Classification, regression | 1999 | [434] | IPUMS |
| US Census Data 1990 | Partial data from 1990 US census. | Results randomized and useful attributes selected. | 2,458,285 | Text | Classification, regression | 1990 | [435] | United States Census Bureau |
Transit
| Dataset Name | Brief description | Preprocessing | Instances | Format | Default Task | Created (updated) | Reference | Creator |
|---|---|---|---|---|---|---|---|---|
| Bike Sharing Dataset | Hourly and daily count of rental bikes in a large city. | Many features, including weather, length of trip, etc., are given. | 17,389 | Text | Regression | 2013 | [436][437] | H. Fanaee-T |
| New York City Taxi Trip Data | Trip data for yellow and green taxis in New York City. | Gives pick up and drop off locations, fares, and other details of trips. | 6 years | Text | Classification, clustering | 2015 | [438] | New York City Taxi and Limousine Commission |
| Taxi Service Trajectory ECML PKDD | Trajectories of all taxis in a large city. | Many features given, including start and stop points. | 1,710,671 | Text | Clustering, causal-discovery | 2015 | [439][440] | M. Ferreira et al. |
| METR-LA | Speed from loop detectors in the highway of Los Angeles County. | Average speed in 5 minutes timesteps. | 7,094,304 from 207 sensors and 34,272 timesteps | Comma separated values | Regression, Forecasting | 2014 | [441] | Jagadish et al. |
| PeMS | Speed, flow, occupancy and other metrics from loop detectors and other sensors in the freeway of the State of California, U.S.A.. | Metric usually aggregated via Average into 5 minutes timesteps. | 39,000 individual detectors, each containing years of timeseries | Comma separated values | Regression, Forecasting, Nowcasting, Interpolation | (updated realtime) | [442] | California Department of Transportation |
Internet
| Dataset Name | Brief description | Preprocessing | Instances | Format | Default Task | Created (updated) | Reference | Creator |
|---|---|---|---|---|---|---|---|---|
| Webpages from Common Crawl 2012 | Large collection of webpages and how they are connected via hyperlinks | None. | 3.5B | Text | clustering, classification | 2013 | [443] | V. Granville |
| Internet Advertisements Dataset | Dataset for predicting if a given image is an advertisement or not. | Features encode geometry of ads and phrases occurring in the URL. | 3279 | Text | Classification | 1998 | [444][445] | N. Kushmerick |
| Internet Usage Dataset | General demographics of internet users. | None. | 10,104 | Text | Classification, clustering | 1999 | [446] | D. Cook |
| URL Dataset | 120 days of URL data from a large conference. | Many features of each URL are given. | 2,396,130 | Text | Classification | 2009 | [447][448] | J. Ma |
| Phishing Websites Dataset | Dataset of phishing websites. | Many features of each site are given. | 2456 | Text | Classification | 2015 | [449] | R. Mustafa et al. |
| Online Retail Dataset | Online transactions for a UK online retailer. | Details of each transaction given. | 541,909 | Text | Classification, clustering | 2015 | [450] | D. Chen |
| Freebase Simple Topic Dump | Freebase is an online effort to structure all human knowledge. | Topics from Freebase have been extracted. | large | Text | Classification, clustering | 2011 | [451][452] | Freebase |
| Farm Ads Dataset | The text of farm ads from websites. Binary approval or disapproval by content owners is given. | SVMlight sparse vectors of text words in ads calculated. | 4143 | Text | Classification | 2011 | [453][454] | C. Masterharm et al. |
| The Pile | Assembling several large datasets of diverse and unstructured texts | Various (removing HTML and Javascript from websites, removing duplicated sentences) | 825 GiB English text | JSON Lines[455][456] | Natural Language Processing, Text Prediction | 2021 | [457][455] | Gao et al. |
| OSCAR | Large collection of monolingual corpora extracted from web data (Common Crawl dumps) covering 150+ languages | Various (filtering, language classification, adult-content detection and other labelling) | 3.4 TB English text, 1.4 TB Chinese text, 1.1 TB Russian text, 595 MB German text, 431 MB French text, and data for 150+ languages (figures for version 23.01) | JSON Lines[458] | Natural Language Processing, Text Prediction | 2021 | [459][460] | Ortiz Suarez, Abadji, Sagot et al. |
| OpenWebText | An open-source recreation of the WebText corpus. The text is web content extracted from URLs shared on Reddit with at least three upvotes. | Extracted non-HTML content, deduplicated, and tokenized. | 8,013,769 Documents, 38GB | Text | Natural Language Processing, Text Prediction | 2019 | [461][462] | A. Gokaslan, V. Cohen |
| ROOTS | A well-documented and representative multilingual dataset with the explicit goal of doing good for and by the people whose data was collected. | Extracted non-HTML content, cleaned out UI and ads, deduplicated, removed PII, and tokenized. | 1.6 TB, 59 languages. | Parquet | Natural Language Processing, Text Prediction | 2022 | [463][464] | H. Laurençon, L. Saulnier, T. Wang, C. Akiki, A. Villanova del Moral, T. Le Scao |
Games
| Dataset Name | Brief description | Preprocessing | Instances | Format | Default Task | Created (updated) | Reference | Creator |
|---|---|---|---|---|---|---|---|---|
| Poker Hand Dataset | 5 card hands from a standard 52 card deck. | Attributes of each hand are given, including the Poker hands formed by the cards it contains. | 1,025,010 | Text | Regression, classification | 2007 | [465] | R. Cattral |
| Connect-4 Dataset | Contains all legal 8-ply positions in the game of connect-4 in which neither player has won yet, and in which the next move is not forced. | None. | 67,557 | Text | Classification | 1995 | [466] | J. Tromp |
| Chess (King-Rook vs. King) Dataset | Endgame Database for White King and Rook against Black King. | None. | 28,056 | Text | Classification | 1994 | [467][468] | M. Bain et al. |
| Chess (King-Rook vs. King-Pawn) Dataset | King+Rook versus King+Pawn on a7. | None. | 3196 | Text | Classification | 1989 | [469] | R. Holte |
| Tic-Tac-Toe Endgame Dataset | Binary classification for win conditions in tic-tac-toe. | None. | 958 | Text | Classification | 1991 | [470] | D. Aha |
Other multivariate
| Dataset Name | Brief description | Preprocessing | Instances | Format | Default Task | Created (updated) | Reference | Creator |
|---|---|---|---|---|---|---|---|---|
| Housing Data Set | Median home values of Boston with associated home and neighborhood attributes. | None. | 506 | Text | Regression | 1993 | [471] | D. Harrison et al. |
| The Getty Vocabularies | structured terminology for art and other material culture, archival materials, visual surrogates, and bibliographic materials. | None. | large | Text | Classification | 2015 | [472] | Getty Center |
| Yahoo! Front Page Today Module User Click Log | User click log for news articles displayed in the Featured Tab of the Today Module on Yahoo! Front Page. | Conjoint analysis with a bilinear model. | 45,811,883 user visits | Text | Regression, clustering | 2009 | [473][474] | Chu et al. |
| British Oceanographic Data Centre | Biological, chemical, physical and geophysical data for oceans. 22K variables tracked. | Various. | 22K variables, many instances | Text | Regression, clustering | 2015 | [475] | British Oceanographic Data Centre |
| Congressional Voting Records Dataset | Voting data for all USA representatives on 16 issues. | Beyond the raw voting data, various other features are provided. | 435 | Text | Classification | 1987 | [476] | J. Schlimmer |
| Entree Chicago Recommendation Dataset | Record of user interactions with Entree Chicago recommendation system. | Details of each user's usage of the app are recorded in detail. | 50,672 | Text | Regression, recommendation | 2000 | [477] | R. Burke |
| Insurance Company Benchmark (COIL 2000) | Information on customers of an insurance company. | Many features of each customer and the services they use. | 9,000 | Text | Regression, classification | 2000 | [478][479] | P. van der Putten |
| Nursery Dataset | Data from applicants to nursery schools. | Data about applicant's family and various other factors included. | 12,960 | Text | Classification | 1997 | [480][481] | V. Rajkovic et al. |
| University Dataset | Data describing attributed of a large number of universities. | None. | 285 | Text | Clustering, classification | 1988 | [482] | S. Sounders et al. |
| Blood Transfusion Service Center Dataset | Data from blood transfusion service center. Gives data on donors return rate, frequency, etc. | None. | 748 | Text | Classification | 2008 | [483][484] | I. Yeh |
| Record Linkage Comparison Patterns Dataset | Large dataset of records. Task is to link relevant records together. | Blocking procedure applied to select only certain record pairs. | 5,749,132 | Text | Classification | 2011 | [485][486] | University of Mainz |
| Nomao Dataset | Nomao collects data about places from many different sources. Task is to detect items that describe the same place. | Duplicates labeled. | 34,465 | Text | Classification | 2012 | [487][488] | Nomao Labs |
| Movie Dataset | Data for 10,000 movies. | Several features for each movie are given. | 10,000 | Text | Clustering, classification | 1999 | [489] | G. Wiederhold |
| Open University Learning Analytics Dataset | Information about students and their interactions with a virtual learning environment. | None. | ~ 30,000 | Text | Classification, clustering, regression | 2015 | [490][491] | J. Kuzilek et al. |
| Mobile phone records | Telecommunications activity and interactions | Aggregation per geographical grid cells and every 15 minutes. | large | Text | Classification, Clustering, Regression | 2015 | [492] | G. Barlacchi et al. |
Curated repositories of datasets
As datasets come in myriad formats and can sometimes be difficult to use, there has been considerable work put into curating and standardizing the format of datasets to make them easier to use for machine learning research.
- OpenML:[493] Web platform with Python, R, Java, and other APIs for downloading hundreds of machine learning datasets, evaluating algorithms on datasets, and benchmarking algorithm performance against dozens of other algorithms.
- PMLB:[494] A large, curated repository of benchmark datasets for evaluating supervised machine learning algorithms. Provides classification and regression datasets in a standardized format that are accessible through a Python API.
- Metatext NLP: https://metatext.io/datasets web repository maintained by community, containing nearly 1000 benchmark datasets, and counting. Provides many tasks from classification to QA, and various languages from English, Portuguese to Arabic.
- Appen: Off The Shelf and Open Source Datasets hosted and maintained by the company. These biological, image, physical, question answering, signal, sound, text, and video resources number over 250 and can be applied to over 25 different use cases.[495][496]
See also
- Comparison of deep learning software
- List of manual image annotation tools
- List of biological databases
References
- ^ Wissner-Gross, A. "Datasets Over Algorithms". Edge.com. Retrieved 8 January 2016.
- ^ Weiss, G. M.; Provost, F. (October 2003). "Learning When Training Data are Costly: The Effect of Class Distribution on Tree Induction". Journal of Artificial Intelligence Research. 19: 315–354. doi:10.1613/jair.1199.
- ^ Abney, Steven (2007). Semisupervised Learning for Computational Linguistics. CRC Press. ISBN 978-1-4200-1080-0.[page needed]
- ^ Žliobaitė, Indrė; Bifet, Albert; Pfahringer, Bernhard; Holmes, Geoff (2011). "Active Learning with Evolving Streaming Data". Machine Learning and Knowledge Discovery in Databases. Lecture Notes in Computer Science. Vol. 6913. pp. 597–612. doi:10.1007/978-3-642-23808-6_39. ISBN 978-3-642-23807-9.
- ^ James Bennett; Stan Lanning (12 August 2007). "The Netflix Prize" (PDF). Proceedings of KDD Cup and Workshop 2007. Archived from the original (PDF) on 27 September 2007. Retrieved 25 August 2007.
- ^ McAuley, Julian; Targett, Christopher; Shi, Qinfeng; Anton van den Hengel (2015). "Image-based Recommendations on Styles and Substitutes". arXiv:1506.04757 [cs.CV].
- ^ "Amazon review data". nijianmo.github.io. Retrieved 8 October 2021.
- ^ Ganesan, Kavita; Zhai, Chengxiang (2012). "Opinion-based entity ranking". Information Retrieval. 15 (2): 116–150. doi:10.1007/s10791-011-9174-8. hdl:2142/15252. S2CID 16258727.
- ^ Lv, Yuanhua; Lymberopoulos, Dimitrios; Wu, Qiang (2012). "An exploration of ranking heuristics in mobile local search". Proceedings of the 35th international ACM SIGIR conference on Research and development in information retrieval. pp. 295–304. doi:10.1145/2348283.2348325. ISBN 978-1-4503-1472-5.
- ^ Harper, F. Maxwell; Konstan, Joseph A. (2015). "The MovieLens Datasets: History and Context". ACM Transactions on Interactive Intelligent Systems. 5 (4): 19. doi:10.1145/2827872. S2CID 16619709.
- ^ Koenigstein, Noam; Dror, Gideon; Koren, Yehuda (2011). "Yahoo! Music recommendations: Modeling music ratings with temporal dynamics and item taxonomy". Proceedings of the fifth ACM conference on Recommender systems. pp. 165–172. doi:10.1145/2043932.2043964. ISBN 978-1-4503-0683-6.
- ^ McFee, Brian; Bertin-Mahieux, Thierry; Ellis, Daniel P.W.; Lanckriet, Gert R.G. (2012). "The million song dataset challenge". Proceedings of the 21st International Conference on World Wide Web. pp. 909–916. doi:10.1145/2187980.2188222. ISBN 978-1-4503-1230-1.
- ^ Bohanec, Marko, and Vladislav Rajkovic. "Knowledge acquisition and explanation for multi-attribute decision making." 8th Intl Workshop on Expert Systems and their Applications. 1988.
- ^ Tan, Peter J., and David L. Dowe. "MML inference of decision graphs with multi-way joins." Australian Joint Conference on Artificial Intelligence. 2002.
- ^ "Quantifying comedy on YouTube: why the number of o's in your LOL matter". Metatext NLP Database. Retrieved 26 October 2020.
- ^ Kim, Byung Joo (2012). "A Classifier for Big Data". Convergence and Hybrid Information Technology. Communications in Computer and Information Science. Vol. 310. pp. 505–512. doi:10.1007/978-3-642-32692-9_63. ISBN 978-3-642-32691-2.
- ^ Pérezgonzález, Jose D.; Gilbey, Andrew (2011). "Predicting Skytrax airport rankings from customer reviews". Journal of Airport Management. 5 (4): 335–339. doi:10.69554/RFZC4321.
- ^ Loh, Wei-Yin, and Yu-Shan Shih. "Split selection methods for classification trees." Statistica sinica(1997): 815–840.
- ^ Lim, Tjen-Sien; Loh, Wei-Yin; Shih, Yu-Shan (2000). "A comparison of prediction accuracy, complexity, and training time of thirty-three old and new classification algorithms". Machine Learning. 40 (3): 203–228. doi:10.1023/a:1007608224229. S2CID 17030953.
- ^ Nguyen, Kiet Van; Nguyen, Vu Duc; Nguyen, Phu X. V.; Truong, Tham T. H.; Nguyen, Ngan Luu-Thuy (2018). "UIT-VSFC: Vietnamese Students' Feedback Corpus for Sentiment Analysis". 2018 10th International Conference on Knowledge and Systems Engineering (KSE). pp. 19–24. doi:10.1109/KSE.2018.8573337. ISBN 978-1-5386-6113-0.
- ^ Ho, Vong Anh; Nguyen, Duong Huynh-Cong; Nguyen, Danh Hoang; Pham, Linh Thi-Van; Nguyen, Duc-Vu; Nguyen, Kiet Van; Nguyen, Ngan Luu-Thuy (2020). "Emotion Recognition for Vietnamese Social Media Text". Computational Linguistics. Communications in Computer and Information Science. Vol. 1215. pp. 319–333. arXiv:1911.09339. doi:10.1007/978-981-15-6168-9_27. ISBN 978-981-15-6167-2. S2CID 208202333.
- ^ Nhung Thi-Hong Nguyen, Phuong Ha-Dieu Phan, Luan Thanh Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen (24 April 2021). "Vietnamese Open-domain Complaint Detection in E-Commerce Websites". arXiv:2104.11969 [cs.CL].
{{cite arXiv}}: CS1 maint: multiple names: authors list (link) - ^ Phu Gia Hoang, Canh Duc Luu, Khanh Quoc Tran, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen (26 January 2023). "ViHOS: Hate Speech Spans Detection for Vietnamese". arXiv:2301.10186 [cs.CL].
{{cite arXiv}}: CS1 maint: multiple names: authors list (link) - ^ Dermouche, Mohamed; Velcin, Julien; Khouas, Leila; Loudcher, Sabine (2014). "A Joint Model for Topic-Sentiment Evolution over Time". 2014 IEEE International Conference on Data Mining. IEEE. pp. 773–778. doi:10.1109/icdm.2014.82. ISBN 978-1-4799-4302-9.
- ^ Rose, Tony; Stevenson, Mark; Whitehead, Miles (2002). "The Reuters Corpus Volume 1-from Yesterday's News to Tomorrow's Language Resources". LREC. 2. S2CID 9239414.
- ^ Amini, Massih R.; Usunier, Nicolas; Goutte, Cyril (2009). "Learning from Multiple Partially Observed Views – an Application to Multilingual Text Categorization". Advances in Neural Information Processing Systems. 22: 28–36.
- ^ Liu, Ming; et al. (2015). "VRCA: a clustering algorithm for massive amount of texts". Proceedings of the 24th International Conference on Artificial Intelligence. AAAI Press. Archived from the original on 5 November 2021. Retrieved 6 August 2019.
- ^ Al-Harbi, S; Almuhareb, A; Al-Thubaity, A; Khorsheed, M. S.; Al-Rajeh, A (2008). "Automatic Arabic Text Classification". Proceedings of the 9th International Conference on the Statistical Analysis of Textual Data, Lyon, France.
- ^ "Relationship and Entity Extraction Evaluation Dataset: Dstl/re3d". GitHub. 17 December 2018.
- ^ "The Examiner – SpamClickBait Catalogue".
- ^ "A Million News Headlines".
- ^ "One Week of Global News Feeds".
- ^ Kulkarni, Rohit (2018), Reuters News-Wire Archive, Harvard Dataverse, doi:10.7910/DVN/XDB74W
- ^ "IrishTimes – the Waxy-Wany News".
- ^ "News Headlines Dataset For Sarcasm Detection". kaggle.com. Retrieved 27 April 2019.
- ^ Klimt, Bryan, and Yiming Yang. "Introducing the Enron Corpus." CEAS. 2004.
- ^ Kossinets, Gueorgi; Kleinberg, Jon; Watts, Duncan (2008). "The Structure of Information Pathways in a Social Communication Network". arXiv:0806.3201 [physics.soc-ph].
- ^ Androutsopoulos, Ion; Koutsias, John; Chandrinos, Konstantinos V.; Paliouras, George; Spyropoulos, Constantine D. (2000). "An evaluation of Naive Bayesian anti-spam filtering". In Potamias, G.; Moustakis, V.; van Someren, M. (eds.). Proceedings of the Workshop on Machine Learning in the New Information Age. 11th European Conference on Machine Learning, Barcelona, Spain. Vol. 11. pp. 9–17. arXiv:cs/0006013. Bibcode:2000cs........6013A.
- ^ Bratko, Andrej; et al. (2006). "Spam filtering using statistical data compression models" (PDF). The Journal of Machine Learning Research. 7: 2673–2698.
- ^ Almeida, Tiago A., José María G. Hidalgo, and Akebo Yamakami. "Contributions to the study of SMS spam filtering: new collection and results."Proceedings of the 11th ACM symposium on Document engineering. ACM, 2011.
- ^ Delany; Jane, Sarah; Buckley, Mark; Greene, Derek (2012). "SMS spam filtering: methods and data". Expert Systems with Applications. 39 (10): 9899–9908. doi:10.1016/j.eswa.2012.02.053. S2CID 15546924.
- ^ Joachims, Thorsten. A Probabilistic Analysis of the Rocchio Algorithm with TFIDF for Text Categorization. No. CMU-CS-96-118. Carnegie-mellon univ pittsburgh pa dept of computer science, 1996.
- ^ Dimitrakakis, Christos, and Samy Bengio. Online Policy Adaptation for Ensemble Algorithms. No. EPFL-REPORT-82788. IDIAP, 2002.
- ^ Dooms, S. et al. "Movietweetings: a movie rating dataset collected from twitter, 2013. Available from https://github.com/sidooms/MovieTweetings."
- ^ RoyChowdhury, Aruni; Lin, Tsung-Yu; Maji, Subhransu; Learned-Miller, Erik (2017). "Twitter100k: A Real-world Dataset for Weakly Supervised Cross-Media Retrieval". arXiv:1703.06618 [cs.CV].
- ^ "huyt16/Twitter100k". GitHub. Retrieved 26 March 2018.
- ^ Go, Alec; Bhayani, Richa; Huang, Lei (2009). "Twitter sentiment classification using distant supervision". CS224N Project Report, Stanford. 1: 12.
- ^ Chikersal, Prerna, Soujanya Poria, and Erik Cambria. "SeNTU: sentiment analysis of tweets by combining a rule-based classifier with supervised learning." Proceedings of the International Workshop on Semantic Evaluation, SemEval. 2015.
- ^ Zafarani, Reza, and Huan Liu. "Social computing data repository at ASU." School of Computing, Informatics and Decision Systems Engineering, Arizona State University (2009).
- ^ Data Science Course by DataTrained Education "IBM Certified Data Science Course." IBM Certified Online Data Science Course
- ^ McAuley, Julian J.; Leskovec, Jure. "Learning to Discover Social Circles in Ego Networks". NIPS. 2012: 2012.
- ^ Šubelj, Lovro; Fiala, Dalibor; Bajec, Marko (2014). "Network-based statistical comparison of citation topology of bibliographic databases". Scientific Reports. 4 (6496): 6496. arXiv:1502.05061. Bibcode:2014NatSR...4.6496S. doi:10.1038/srep06496. PMC 4178292. PMID 25263231.
- ^ Abdulla, N., et al. "Arabic sentiment analysis: Corpus-based and lexicon-based." Proceedings of the IEEE conference on Applied Electrical Engineering and Computing Technologies (AEECT). 2013.
- ^ Abooraig, Raddad; Al-Zu'bi, Shadi; Kanan, Tarek; Hawashin, Bilal; Al Ayoub, Mahmoud; Hmeidi, Ismail (June 2018). "Automatic categorization of Arabic articles based on their political orientation". Digital Investigation. 25: 24–41. doi:10.1016/j.diin.2018.04.003.
- ^ Kawala, François, et al. "Prédictions d'activité dans les réseaux sociaux en ligne." 4ième conférence sur les modèles et l'analyse des réseaux: Approches mathématiques et informatiques. 2013.
- ^ Sabharwal, Ashish; Samulowitz, Horst; Tesauro, Gerald (2015). "Selecting Near-Optimal Learners via Incremental Data Allocation". arXiv:1601.00024 [cs.LG].
- ^ Xu et al. "SemEval-2015 Task 1: Paraphrase and Semantic Similarity in Twitter (PIT)" Proceedings of the 9th International Workshop on Semantic Evaluation. 2015.
- ^ Xu et al. "Extracting Lexically Divergent Paraphrases from Twitter" Transactions of the Association for Computational (TACL). 2014.
- ^ Middleton, Stuart E; Middleton, Lee; Modafferi, Stefano (2014). "Real-Time Crisis Mapping of Natural Disasters Using Social Media" (PDF). IEEE Intelligent Systems. 29 (2): 9–17. doi:10.1109/MIS.2013.126. S2CID 15139204.
- ^ "geoparsepy". 2016. Python PyPI library
- ^ Shmueli, Boaz; Ku, Lun-Wei; Ray, Soumya (2020). "Reactive Supervision: A New Method for Collecting Sarcasm Data". Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP). Association for Computational Linguistics. pp. 2553–2559. doi:10.18653/v1/2020.emnlp-main.201. S2CID 221970454.
- ^ Shmueli, Boaz. "SPIRS Sarcasm Dataset". GitHub.
- ^ Gupta, Aakash (2020). "Dutch social media collection". COVID-19 Data Hub. doi:10.5072/FK2/MTPTL7. Retrieved 11 November 2023.
- ^ "Streamlit". huggingface.co. Retrieved 18 December 2020.
- ^ "Dutch Social media collection". kaggle.com. Retrieved 18 December 2020.
- ^ Shmueli, Boaz; Ray, Soumya; Lun-Wei (2021). "Happy Dance, Slow Clap: Using Reaction GIFs to Predict Induced Affect on Twitter". Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 2: Short Papers). Vol. Association for Computational Linguistics. As. pp. 395–401. doi:10.18653/v1/2021.acl-short.50. S2CID 235125510.
- ^ Shmueli, Boaz (5 May 2023), ReactionGIF, retrieved 6 October 2023
- ^ Forsyth, E., Lin, J., & Martell, C. (2008, June 25). The NPS Chat Corpus. Retrieved from http://faculty.nps.edu/cmartell/NPSChat.htm
- ^ Sordoni, Alessandro; Galley, Michel; Auli, Michael; Brockett, Chris; Ji, Yangfeng; Mitchell, Margaret; Nie, Jian-Yun; Gao, Jianfeng; Dolan, Bill (2015). "A Neural Network Approach to Context-Sensitive Generation of Conversational Responses". arXiv:1506.06714 [cs.CL].
- ^ Shaoul, C. & Westbury C. (2013) A reduced redundancy USENET corpus (2005–2011) Edmonton, AB: University of Alberta (downloaded from http://www.psych.ualberta.ca/~westburylab/downloads/usenetcorpus.download.html)
- ^ KAN, M. (2011, January). NUS Short Message Service (SMS) Corpus. Retrieved from http://www.comp.nus.edu.sg/entrepreneurship/innovation/osr/corpus/ Archived 29 June 2018 at the Wayback Machine
- ^ Stuck_In_the_Matrix. (2015, July 3). I have every publicly available Reddit comment for research. ~ 1.7 billion comments @ 250 GB compressed. Any interest in this? [Original post]. Message posted to https://www.reddit.com/r/datasets/comments/3bxlg7/i_have_every_publicly_available_reddit_comment/
- ^ Lowe, Ryan; Pow, Nissan; Serban, Iulian; Pineau, Joelle (2015). "The Ubuntu Dialogue Corpus: A Large Dataset for Research in Unstructured Multi-Turn Dialogue Systems". arXiv:1506.08909 [cs.CL].
- ^ Jason Williams Antoine Raux Matthew Henderson, "[1]", Dialogue & Discourse | April 2016 .
- ^ Hoppe, Travis (16 December 2021), The-Pile-FreeLaw, retrieved 11 January 2023
- ^ Zheng, Lucia; Guha, Neel; Anderson, Brandon R.; Henderson, Peter; Ho, Daniel E. (21 June 2021). "When does pretraining help?". Proceedings of the Eighteenth International Conference on Artificial Intelligence and Law. New York, NY, USA: ACM. pp. 159–168. doi:10.1145/3462757.3466088. ISBN 9781450385268. S2CID 233296302.
- ^ "pile-of-law/pile-of-law · Datasets at Hugging Face". huggingface.co. 4 July 2022. Retrieved 11 January 2023.
- ^ "About | Caselaw Access Project". case.law. Retrieved 11 January 2023.
- ^ K. Kowsari, D. E. Brown, M. Heidarysafa, K. Jafari Meimandi, M. S. Gerber and L. E. Barnes, "HDLTex: Hierarchical Deep Learning for Text Classification", 2017 16th IEEE International Conference on Machine Learning and Applications (ICMLA), pp. 364–371. doi:10.1109/ICMLA.2017.0-134
- ^ K. Kowsari, D. E. Brown, M. Heidarysafa, K. Jafari Meimandi, M. S. Gerber and L. E. Barnes, "Web of Science Dataset", doi:10.17632/9rw3vkcfy4.6
- ^ Galgani, Filippo, Paul Compton, and Achim Hoffmann. "Combining different summarization techniques for legal text." Proceedings of the Workshop on Innovative Hybrid Approaches to the Processing of Textual Data. Association for Computational Linguistics, 2012.
- ^ Nagwani, N. K. (2015). "Summarizing large text collection using topic modeling and clustering based on MapReduce framework". Journal of Big Data. 2 (1): 1–18. doi:10.1186/s40537-015-0020-5.
- ^ Schler, Jonathan; et al. (2006). "Effects of Age and Gender on Blogging" (PDF). AAAI Spring Symposium: Computational Approaches to Analyzing Weblogs. 6. Archived from the original (PDF) on 14 November 2020. Retrieved 6 August 2019.
- ^ Anand, Pranav, et al. "Believe Me-We Can Do This! Annotating Persuasive Acts in Blog Text."Computational Models of Natural Argument. 2011.
- ^ Traud, Amanda L., Peter J. Mucha, and Mason A. Porter. "Social structure of Facebook networks." Physica A: Statistical Mechanics and its Applications391.16 (2012): 4165–4180.
- ^ Richard, Emile; Savalle, Pierre-Andre; Vayatis, Nicolas (2012). "Estimation of Simultaneously Sparse and Low Rank Matrices". arXiv:1206.6474 [cs.DS].
- ^ Richardson, Matthew; Burges, Christopher JC; Renshaw, Erin (2013). "MCTest: A Challenge Dataset for the Open-Domain Machine Comprehension of Text". EMNLP. 1.
- ^ Weston, Jason; Bordes, Antoine; Chopra, Sumit; Rush, Alexander M.; Bart van Merriënboer; Joulin, Armand; Mikolov, Tomas (2015). "Towards AI-Complete Question Answering: A Set of Prerequisite Toy Tasks". arXiv:1502.05698 [cs.AI].
- ^ Marcus, Mitchell P.; Ann Marcinkiewicz, Mary; Santorini, Beatrice (1993). "Building a large annotated corpus of English: The Penn Treebank". Computational Linguistics. 19 (2): 313–330.
- ^ Collins, Michael (2003). "Head-driven statistical models for natural language parsing". Computational Linguistics. 29 (4): 589–637. doi:10.1162/089120103322753356.
- ^ Guyon, Isabelle, et al., eds. Feature extraction: foundations and applications. Vol. 207. Springer, 2008.
- ^ Lin, Yuri, et al. "Syntactic annotations for the google books ngram corpus." Proceedings of the ACL 2012 system demonstrations. Association for Computational Linguistics, 2012.
- ^ Krishnamoorthy, Niveda; et al. (2013). "Generating Natural-Language Video Descriptions Using Text-Mined Knowledge". AAAI. 1. Archived from the original on 6 August 2019. Retrieved 6 August 2019.
- ^ Luyckx, Kim; Daelemans, Walter (2008). "Personae: a corpus for author and personality prediction from text". Proceedings of LREC-2008, the Sixth International Language Resources and Evaluation Conference. hdl:10067/687330151162165141. ISBN 978-2-9517408-4-6.
- ^ Solorio, Thamar, Ragib Hasan, and Mainul Mizan. "A case study of sockpuppet detection in wikipedia." Workshop on Language Analysis in Social Media (LASM) at NAACL HLT. 2013.
- ^ "Pushshift Files". files.pushshift.io. Archived from the original on 12 January 2023. Retrieved 12 January 2023.
- ^ Baumgartner, Jason; Zannettou, Savvas; Keegan, Brian; Squire, Megan; Blackburn, Jeremy (23 January 2020). "The Pushshift Reddit Dataset". arXiv:2001.08435 [cs.SI].
- ^ Ciarelli, Patrick Marques; Oliveira, Elias (2009). "Agglomeration and Elimination of Terms for Dimensionality Reduction". 2009 Ninth International Conference on Intelligent Systems Design and Applications. pp. 547–552. doi:10.1109/ISDA.2009.9. ISBN 978-1-4244-4735-0.
- ^ Zhou, Mingyuan; Padilla, Oscar Hernan Madrid; Scott, James G. (2 July 2016). "Priors for Random Count Matrices Derived from a Family of Negative Binomial Processes". Journal of the American Statistical Association. 111 (515): 1144–1156. arXiv:1404.3331. doi:10.1080/01621459.2015.1075407.
- ^ Kotzias, Dimitrios, et al. "From group to individual labels using deep features." Proceedings of the 21th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. ACM, 2015.
- ^ Ning, Yue; Muthiah, Sathappan; Rangwala, Huzefa; Ramakrishnan, Naren (2016). "Modeling Precursors for Event Forecasting via Nested Multi-Instance Learning". arXiv:1602.08033 [cs.SI].
- ^ Buza, Krisztian. "Feedback prediction for blogs."Data analysis, machine learning and knowledge discovery. Springer International Publishing, 2014. 145–152.
- ^ Soysal, Ömer M (2015). "Association rule mining with mostly associated sequential patterns". Expert Systems with Applications. 42 (5): 2582–2592. doi:10.1016/j.eswa.2014.10.049.
- ^ Zhu, Yukun, et al. "Aligning books and movies: Towards story-like visual explanations by watching movies and reading books." Proceedings of the IEEE international conference on computer vision. 2015.
- ^ Bowman, Samuel R.; Angeli, Gabor; Potts, Christopher; Manning, Christopher D. (2015). "A large annotated corpus for learning natural language inference". arXiv:1508.05326 [cs.CL].
- ^ "DSL Corpus Collection". ttg.uni-saarland.de. Retrieved 22 September 2017.
- ^ "Urban Dictionary Words and Definitions".
- ^ H. Elsahar, P. Vougiouklis, A. Remaci, C. Gravier, J. Hare, F. Laforest, E. Simperl, "T-REx: A Large Scale Alignment of Natural Language with Knowledge Base Triples", Proceedings of the Eleventh International Conference on Language Resources and Evaluation (LREC-2018).
- ^ Wang, Alex; Singh, Amanpreet; Michael, Julian; Hill, Felix; Levy, Omer; Bowman, Samuel R. (2018). "GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding". arXiv:1804.07461 [cs.CL].
- ^ "Computers Are Learning to Read—But They're Still Not So Smart". Wired. Retrieved 29 December 2019.
- ^ "GLUE Benchmark". gluebenchmark.com. Retrieved 25 February 2019.
- ^ Quan, Hoang Lam; Quang, Duy Le; Van Kiet, Nguyen; Ngan, Luu-Thuy Nguyen. "UIT-ViIC: A Dataset for the First Evaluation on Vietnamese Image Captioning".
- ^ To, Quoc Huy; Nguyen, Van Kiet; Nguyen, Luu Thuy Ngan; Nguyen, Gia Tuan Anh (2020). "Gender Prediction Based on Vietnamese Names with Machine Learning Techniques". Proceedings of the 4th International Conference on Natural Language Processing and Information Retrieval. pp. 55–60. arXiv:2010.10852. doi:10.1145/3443279.3443309. ISBN 9781450377607. S2CID 224814110.
- ^ Nguyen, Luan Thanh; Van Nguyen, Kiet; Nguyen, Ngan Luu-Thuy (18 March 2021). "Constructive and Toxic Speech Detection for Open-Domain Social Media Comments in Vietnamese". Advances and Trends in Artificial Intelligence. Artificial Intelligence Practices. Lecture Notes in Computer Science. Vol. 12798. pp. 572–583. arXiv:2103.10069. doi:10.1007/978-3-030-79457-6_49. ISBN 978-3-030-79456-9. S2CID 232269671.
- ^ Saxton, David, et al. "Analysing Mathematical Reasoning Abilities of Neural Models." International Conference on Learning Representations. 2018.
- ^ Godfrey, J.J.; Holliman, E.C.; McDaniel, J. (1992). "SWITCHBOARD: Telephone speech corpus for research and development". [Proceedings] ICASSP-92: 1992 IEEE International Conference on Acoustics, Speech, and Signal Processing. IEEE. pp. 517-520 vol.1. doi:10.1109/icassp.1992.225858. ISBN 0-7803-0532-9.
- ^ "Switchboard-1 Release 2 - Linguistic Data Consortium". catalog.ldc.upenn.edu. Retrieved 30 November 2024.
- ^ Godfrey, J.J.; Holliman, E.C.; McDaniel, J. (1992). "SWITCHBOARD: Telephone speech corpus for research and development". [Proceedings] ICASSP-92: 1992 IEEE International Conference on Acoustics, Speech, and Signal Processing. IEEE. pp. 517-520 vol.1. doi:10.1109/icassp.1992.225858. ISBN 0-7803-0532-9.
- ^ "Switchboard-1 Release 2 - Linguistic Data Consortium". catalog.ldc.upenn.edu. Retrieved 30 November 2024.
- ^ M. Versteegh, R. Thiollière, T. Schatz, X.-N. Cao, X. Anguera, A. Jansen, and E. Dupoux (2015). "The Zero Resource Speech Challenge 2015," in INTERSPEECH-2015.
- ^ M. Versteegh, X. Anguera, A. Jansen, and E. Dupoux, (2016). "The Zero Resource Speech Challenge 2015: Proposed Approaches and Results," in SLTU-2016.
- ^ Sakar, Betul Erdogdu; et al. (2013). "Collection and analysis of a Parkinson speech dataset with multiple types of sound recordings". IEEE Journal of Biomedical and Health Informatics. 17 (4): 828–834. doi:10.1109/jbhi.2013.2245674. PMID 25055311. S2CID 15491516.
- ^ Zhao, Shunan; Rudzicz, Frank; Carvalho, Leonardo G.; Marquez-Chin, Cesar; Livingstone, Steven (2014). "Automatic detection of expressed emotion in Parkinson's Disease". 2014 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). pp. 4813–4817. doi:10.1109/ICASSP.2014.6854516. ISBN 978-1-4799-2893-4.
- ^ Hammami, Nacereddine; Bedda, Mouldi (July 2010). "Improved tree model for arabic speech recognition". 2010 3rd International Conference on Computer Science and Information Technology. pp. 521–526. doi:10.1109/ICCSIT.2010.5563892. ISBN 978-1-4244-5537-9.
- ^ Maaten, Laurens. "Learning discriminative fisher kernels." Proceedings of the 28th International Conference on Machine Learning (ICML-11). 2011.
- ^ Cole, Ronald, and Mark Fanty. "Spoken letter recognition." Proc. Third DARPA Speech and Natural Language Workshop. 1990.
- ^ Chapelle, Olivier; Sindhwani, Vikas; Keerthi, Sathiya S. (2008). "Optimization techniques for semi-supervised support vector machines" (PDF). The Journal of Machine Learning Research. 9: 203–233.
- ^ Kudo, Mineichi; Toyama, Jun; Shimbo, Masaru (November 1999). "Multidimensional curve classification using passing-through regions". Pattern Recognition Letters. 20 (11–13): 1103–1111. Bibcode:1999PaReL..20.1103K. doi:10.1016/s0167-8655(99)00077-x.
- ^ Jaeger, Herbert; Lukoševičius, Mantas; Popovici, Dan; Siewert, Udo (April 2007). "Optimization and applications of echo state networks with leaky- integrator neurons". Neural Networks. 20 (3): 335–352. doi:10.1016/j.neunet.2007.04.016. PMID 17517495.
- ^ Tsanas, A.; Little, M.A.; McSharry, P.E.; Ramig, L.O. (April 2010). "Accurate Telemonitoring of Parkinson's Disease Progression by Noninvasive Speech Tests". IEEE Transactions on Biomedical Engineering. 57 (4): 884–893. doi:10.1109/tbme.2009.2036000. PMID 19932995.
- ^ Clifford, Gari D.; Clifton, David (2012). "Wireless technology in disease management and medicine". Annual Review of Medicine. 63: 479–492. doi:10.1146/annurev-med-051210-114650. PMID 22053737.
- ^ Zue, Victor; Seneff, Stephanie; Glass, James (1990). "Speech database development at MIT: TIMIT and beyond". Speech Communication. 9 (4): 351–356. doi:10.1016/0167-6393(90)90010-7.
- ^ Kapadia, S.; Valtchev, V.; Young, S.J. (1993). "MMI training for continuous phoneme recognition on the TIMIT database". IEEE International Conference on Acoustics Speech and Signal Processing. pp. 491-494 vol.2. doi:10.1109/ICASSP.1993.319349. ISBN 0-7803-0946-4.
- ^ Halabi, Nawar (2016). Modern Standard Arabic Phonetics for Speech Synthesis (PDF) (PhD Thesis). University of Southampton, School of Electronics and Computer Science.
- ^ Ardila, Rosana; Branson, Megan; Davis, Kelly; Henretty, Michael; Kohler, Michael; Meyer, Josh; Morais, Reuben; Saunders, Lindsay; Tyers, Francis M.; Weber, Gregor (13 December 2019). "Common Voice: A Massively-Multilingual Speech Corpus". arXiv:1912.06670v2 [cs.CL].
- ^ "The LJ Speech Dataset". keithito.com. Retrieved 13 April 2022.
- ^ Ghandoura, Abdulkader; Hjabo, Farouk; Al Dakkak, Oumayma (June 2021). "Building and benchmarking an Arabic Speech Commands dataset for small-footprint keyword spotting". Engineering Applications of Artificial Intelligence. 102: 104267. doi:10.1016/j.engappai.2021.104267.
- ^ Zhou, Fang; Claire, Q.; King, Ross D. (2014). "Predicting the Geographical Origin of Music". 2014 IEEE International Conference on Data Mining. pp. 1115–1120. doi:10.1109/ICDM.2014.73. ISBN 978-1-4799-4302-9.
- ^ Saccenti, Edoardo; Camacho, José (2015). "On the use of the observation-wise k-fold operation in PCA cross-validation". Journal of Chemometrics. 29 (8): 467–478. doi:10.1002/cem.2726. hdl:10481/55302. S2CID 62248957.
- ^ Bertin-Mahieux, Thierry, et al. "The million song dataset." ISMIR 2011: Proceedings of the 12th International Society for Music Information Retrieval Conference, 24–28 October 2011, Miami, Florida. University of Miami, 2011.
- ^ Henaff, Mikael; et al. (2011). "Unsupervised learning of sparse features for scalable audio classification" (PDF). ISMIR. 11.
- ^ Rafii, Zafar (2017). "Music". MUSDB18 – a corpus for music separation. doi:10.5281/zenodo.1117372.
- ^ Defferrard, Michaël; Benzi, Kirell; Vandergheynst, Pierre; Bresson, Xavier (6 December 2016). "FMA: A Dataset For Music Analysis". arXiv:1612.01840 [cs.SD].
- ^ Esposito, Roberto; Radicioni, Daniele P. (2009). "Carpediem: Optimizing the viterbi algorithm and applications to supervised sequential learning" (PDF). The Journal of Machine Learning Research. 10: 1851–1880.
- ^ Sourati, Jamshid; et al. (2016). "Classification Active Learning Based on Mutual Information". Entropy. 18 (2): 51. Bibcode:2016Entrp..18...51S. doi:10.3390/e18020051.
- ^ Salamon, Justin; Jacoby, Christopher; Bello, Juan Pablo. "A dataset and taxonomy for urban sound research." Proceedings of the ACM International Conference on Multimedia. ACM, 2014.
- ^ Lagrange, Mathieu; Lafay, Grégoire; Rossignol, Mathias; Benetos, Emmanouil; Roebel, Axel (2015). "An evaluation framework for event detection using a morphological model of acoustic scenes". arXiv:1502.00141 [stat.ML].
- ^ Gemmeke, Jort F., et al. "Audio Set: An ontology and human-labeled dataset for audio events." IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP). 2017.
- ^ "Watch out, birders: Artificial intelligence has learned to spot birds from their songs". Science | AAAS. 18 July 2018. Retrieved 22 July 2018.
- ^ "Bird Audio Detection challenge". Machine Listening Lab at Queen Mary University. 3 May 2016. Retrieved 22 July 2018.
- ^ Wichern, Gordon; Antognini, Joe; Flynn, Michael; Licheng Richard Zhu; McQuinn, Emmett; Crow, Dwight; Manilow, Ethan; Jonathan Le Roux (2019). "WHAM!: Extending Speech Separation to Noisy Environments". arXiv:1907.01160 [cs.SD].
- ^ Drossos, K., Lipping, S., and Virtanen, T. "Clotho: An Audio Captioning Dataset" IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP). 2020.
- ^ Drossos, K., Lipping, S., and Virtanen, T. (2019). Clotho dataset (Version 1.0) [Data set]. Zenodo. http://doi.org/10.5281/zenodo.3490684
- ^ The CAIDA UCSD Dataset on the Witty Worm – 19–24 March 2004, http://www.caida.org/data/passive/witty_worm_dataset.xml
- ^ Chen, Zesheng; Ji, Chuanyi (2007). "Optimal worm-scanning method using vulnerable-host distributions". International Journal of Security and Networks. 2 (1/2): 71. doi:10.1504/IJSN.2007.012826.
- ^ Kachuee, Mohamad; Kiani, Mohammad Mahdi; Mohammadzade, Hoda; Shabany, Mahdi (2015). "Cuff-less high-accuracy calibration-free blood pressure estimation using pulse transit time". 2015 IEEE International Symposium on Circuits and Systems (ISCAS). pp. 1006–1009. doi:10.1109/ISCAS.2015.7168806. ISBN 978-1-4799-8391-9.
- ^ Goldberger, Ary L.; Amaral, Luis A. N.; Glass, Leon; Hausdorff, Jeffrey M.; Ivanov, Plamen Ch.; Mark, Roger G.; Mietus, Joseph E.; Moody, George B.; Peng, Chung-Kang; Stanley, H. Eugene (13 June 2000). "PhysioBank, PhysioToolkit, and PhysioNet: Components of a New Research Resource for Complex Physiologic Signals". Circulation. 101 (23): E215-20. doi:10.1161/01.CIR.101.23.e215. PMID 10851218.
- ^ Vergara, Alexander; et al. (2012). "Chemical gas sensor drift compensation using classifier ensembles". Sensors and Actuators B: Chemical. 166: 320–329. Bibcode:2012SeAcB.166..320V. doi:10.1016/j.snb.2012.01.074.
- ^ Korotcenkov, G.; Cho, B. K. (2014). "Engineering approaches to improvement of conductometric gas sensor parameters. Part 2: Decrease of dissipated (consumable) power and improvement stability and reliability". Sensors and Actuators B: Chemical. 198: 316–341. Bibcode:2014SeAcB.198..316K. doi:10.1016/j.snb.2014.03.069.
- ^ Quinlan, John R (1992). "Learning with continuous classes" (PDF). 5th Australian Joint Conference on Artificial Intelligence. 92.
- ^ Merz, Christopher J.; Pazzani, Michael J. (1999). "A principal components approach to combining regression estimates". Machine Learning. 36 (1–2): 9–32. doi:10.1023/a:1007507221352.
- ^ Torres-Sospedra, Joaquin, et al. "UJIIndoorLoc-Mag: A new database for magnetic field-based localization problems." Indoor Positioning and Indoor Navigation (IPIN), 2015 International Conference on. IEEE, 2015.
- ^ Berkvens, Rafael, Maarten Weyn, and Herbert Peremans. "Mean Mutual Information of Probabilistic Wi-Fi Localization." Indoor Positioning and Indoor Navigation (IPIN), 2015 International Conference on. Banff, Canada: IPIN. 2015.
- ^ Paschke, Fabian, et al. "Sensorlose Zustandsüberwachung an Synchronmotoren."Proceedings. 23. Workshop Computational Intelligence, Dortmund, 5.-6. Dezember 2013. KIT Scientific Publishing, 2013.
- ^ Lessmeier, Christian, et al. "Data Acquisition and Signal Analysis from Measured Motor Currents for Defect Detection in Electromechanical Drive Systems."
- ^ Ugulino, Wallace, et al. "Wearable computing: Accelerometers’ data classification of body postures and movements Archived 25 September 2020 at the Wayback Machine." Advances in Artificial Intelligence-SBIA 2012. Springer Berlin Heidelberg, 2012. 52–61.
- ^ Schneider, Jan; et al. (2015). "Augmenting the senses: a review on sensor-based learning support". Sensors. 15 (2): 4097–4133. Bibcode:2015Senso..15.4097S. doi:10.3390/s150204097. PMC 4367401. PMID 25679313.
- ^ Madeo, Renata CB, Clodoaldo AM Lima, and Sarajane M. Peres. "Gesture unit segmentation using support vector machines: segmenting gestures from rest positions." Proceedings of the 28th Annual ACM Symposium on Applied Computing. ACM, 2013.
- ^ Lun, Roanna; Zhao, Wenbing (2015). "A survey of applications and human motion recognition with Microsoft Kinect". International Journal of Pattern Recognition and Artificial Intelligence. 29 (5): 1555008. doi:10.1142/s0218001415550083.
- ^ Theodoridis, Theodoros; Huosheng Hu (2007). "Action classification of 3D human models using dynamic ANNs for mobile robot surveillance". 2007 IEEE International Conference on Robotics and Biomimetics (ROBIO). pp. 371–376. doi:10.1109/ROBIO.2007.4522190. ISBN 978-1-4244-1761-2.
- ^ Etemad, Seyed Ali; Arya, Ali (2009). "3D human action recognition and style transformation using resilient backpropagation neural networks". 2009 IEEE International Conference on Intelligent Computing and Intelligent Systems. pp. 296–301. doi:10.1109/ICICISYS.2009.5357690. ISBN 978-1-4244-4754-1.
- ^ Altun, Kerem; Barshan, Billur; Tunçel, Orkun (2010). "Comparative study on classifying human activities with miniature inertial and magnetic sensors". Pattern Recognition. 43 (10): 3605–3620. Bibcode:2010PatRe..43.3605A. doi:10.1016/j.patcog.2010.04.019. hdl:11693/11947.
- ^ Nathan, Ran; et al. (2012). "Using tri-axial acceleration data to identify behavioral modes of free-ranging animals: general concepts and tools illustrated for griffon vultures". The Journal of Experimental Biology. 215 (6): 986–996. Bibcode:2012JExpB.215..986N. doi:10.1242/jeb.058602. PMC 3284320. PMID 22357592.
- ^ Anguita, Davide, et al. "Human activity recognition on smartphones using a multiclass hardware-friendly support vector machine." Ambient assisted living and home care. Springer Berlin Heidelberg, 2012. 216–223.
- ^ Su, Xing; Tong, Hanghang; Ji, Ping (2014). "Activity recognition with smartphone sensors". Tsinghua Science and Technology. 19 (3): 235–249. doi:10.1109/tst.2014.6838194. S2CID 62751498.
- ^ Kadous, Mohammed Waleed. Temporal classification: Extending the classification paradigm to multivariate time series. Diss. The University of New South Wales, 2002.
- ^ Graves, Alex, et al. "Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks." Proceedings of the 23rd international conference on Machine learning. ACM, 2006.
- ^ Velloso, Eduardo, et al. "Qualitative activity recognition of weight lifting exercises."Proceedings of the 4th Augmented Human International Conference. ACM, 2013.
- ^ Mortazavi, Bobak Jack, et al. "Determining the single best axis for exercise repetition recognition and counting on smartwatches Archived 4 November 2021 at the Wayback Machine." Wearable and Implantable Body Sensor Networks (BSN), 2014 11th International Conference on. IEEE, 2014.
- ^ Sapsanis, Christos, et al. "Improving EMG based Classification of basic hand movements using EMD." Engineering in Medicine and Biology Society (EMBC), 2013 35th Annual International Conference of the IEEE. IEEE, 2013.
- ^ a b Andrianesis, Konstantinos; Tzes, Anthony (2015). "Development and control of a multifunctional prosthetic hand with shape memory alloy actuators". Journal of Intelligent & Robotic Systems. 78 (2): 257–289. doi:10.1007/s10846-014-0061-6. S2CID 207174078.
- ^ Banos, Oresti; et al. (2014). "Dealing with the effects of sensor displacement in wearable activity recognition". Sensors. 14 (6): 9995–10023. Bibcode:2014Senso..14.9995B. doi:10.3390/s140609995. PMC 4118358. PMID 24915181.
- ^ Stisen, Allan; Blunck, Henrik; Bhattacharya, Sourav; Prentow, Thor Siiger; Kjærgaard, Mikkel Baun; Dey, Anind; Sonne, Tobias; Jensen, Mads Møller (2015). "Smart Devices are Different: Assessing and MitigatingMobile Sensing Heterogeneities for Activity Recognition". Proceedings of the 13th ACM Conference on Embedded Networked Sensor Systems. pp. 127–140. doi:10.1145/2809695.2809718. ISBN 978-1-4503-3631-4.
- ^ Bhattacharya, Sourav; Lane, Nicholas D. (2016). "From smart to deep: Robust activity recognition on smartwatches using deep learning". 2016 IEEE International Conference on Pervasive Computing and Communication Workshops (PerCom Workshops). pp. 1–6. doi:10.1109/PERCOMW.2016.7457169. ISBN 978-1-5090-1941-0.
- ^ Bacciu, Davide; et al. (2014). "An experimental characterization of reservoir computing in ambient assisted living applications". Neural Computing and Applications. 24 (6): 1451–1464. doi:10.1007/s00521-013-1364-4. hdl:11568/237959. S2CID 14124013.
- ^ Palumbo, Filippo; Barsocchi, Paolo; Gallicchio, Claudio; Chessa, Stefano; Micheli, Alessio (2013). "Multisensor Data Fusion for Activity Recognition Based on Reservoir Computing". Evaluating AAL Systems Through Competitive Benchmarking. Communications in Computer and Information Science. Vol. 386. pp. 24–35. doi:10.1007/978-3-642-41043-7_3. ISBN 978-3-642-41042-0.
- ^ Reiss, Attila; Stricker, Didier (2012). "Introducing a New Benchmarked Dataset for Activity Monitoring". 2012 16th International Symposium on Wearable Computers. pp. 108–109. doi:10.1109/ISWC.2012.13. ISBN 978-0-7695-4697-1.
- ^ Roggen, Daniel; Forster, Kilian; Calatroni, Alberto; Holleczek, Thomas; Fang, Yu; Troster, Gerhard; Ferscha, Alois; Holzmann, Clemens; Riener, Andreas; Lukowicz, Paul; Pirkl, Gerald; Bannach, David; Kunze, Kai; Chavarriaga, Ricardo; Millan, Jose del R. (2009). "OPPORTUNITY: Towards opportunistic activity and context recognition systems". 2009 IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks & Workshops. pp. 1–6. doi:10.1109/WOWMOM.2009.5282442. ISBN 978-1-4244-4440-3.
- ^ Kurz, Marc, et al. "Dynamic quantification of activity recognition capabilities in opportunistic systems." Vehicular Technology Conference (VTC Spring), 2011 IEEE 73rd. IEEE, 2011.
- ^ Sztyler, Timo; Stuckenschmidt, Heiner (2016). "On-body localization of wearable devices: An investigation of position-aware activity recognition". 2016 IEEE International Conference on Pervasive Computing and Communications (PerCom). pp. 1–9. doi:10.1109/PERCOM.2016.7456521. ISBN 978-1-4673-8779-8.
- ^ Zhi, Ying Xuan; Lukasik, Michelle; Li, Michael H.; Dolatabadi, Elham; Wang, Rosalie H.; Taati, Babak (2018). "Automatic Detection of Compensation During Robotic Stroke Rehabilitation Therapy". IEEE Journal of Translational Engineering in Health and Medicine. 6: 1–7. doi:10.1109/JTEHM.2017.2780836. PMC 5788403. PMID 29404226.
- ^ Dolatabadi, Elham; Zhi, Ying Xuan; Ye, Bing; Coahran, Marge; Lupinacci, Giorgia; Mihailidis, Alex; Wang, Rosalie; Taati, Babak (2017). "The toronto rehab stroke pose dataset to detect compensation during stroke rehabilitation therapy". Proceedings of the 11th EAI International Conference on Pervasive Computing Technologies for Healthcare. pp. 375–381. doi:10.1145/3154862.3154925. ISBN 978-1-4503-6363-1.
- ^ "Toronto Rehab Stroke Pose Dataset".
- ^ Jung, Merel M.; Poel, Mannes; Poppe, Ronald; Heylen, Dirk K. J. (March 2017). "Automatic recognition of touch gestures in the corpus of social touch". Journal on Multimodal User Interfaces. 11 (1): 81–96. doi:10.1007/s12193-016-0232-9.
- ^ Jung, M.M. (Merel) (1 June 2016). "Corpus of Social Touch (CoST)". University of Twente. doi:10.4121/uuid:5ef62345-3b3e-479c-8e1d-c922748c9b29.
{{cite journal}}: Cite journal requires|journal=(help) - ^ Aeberhard, S., D. Coomans, and O. De Vel. "Comparison of classifiers in high dimensional settings." Dept. Math. Statist., James Cook Univ., North Queensland, Australia, Tech. Rep 92-02 (1992).
- ^ Basu, Sugato. "Semi-supervised clustering with limited background knowledge." AAAI. 2004.
- ^ Tüfekci, Pınar (2014). "Prediction of full load electrical power output of a base load operated combined cycle power plant using machine learning methods". International Journal of Electrical Power & Energy Systems. 60: 126–140. Bibcode:2014IJEPE..60..126T. doi:10.1016/j.ijepes.2014.02.027.
- ^ Kaya, Heysem, Pınar Tüfekci, and Fikret S. Gürgen. "Local and global learning methods for predicting power of a combined gas & steam turbine." International conference on emerging trends in computer and electronics engineering (ICETCEE'2012), Dubai. 2012.
- ^ Baldi, Pierre; Sadowski, Peter; Whiteson, Daniel (2014). "Searching for exotic particles in high-energy physics with deep learning". Nature Communications. 5: 2014. arXiv:1402.4735. Bibcode:2014NatCo...5.4308B. doi:10.1038/ncomms5308. PMID 24986233. S2CID 195953.
- ^ a b Baldi, Pierre; Sadowski, Peter; Whiteson, Daniel (2015). "Enhanced Higgs Boson to τ+ τ− Search with Deep Learning". Physical Review Letters. 114 (11): 111801. arXiv:1410.3469. Bibcode:2015PhRvL.114k1801B. doi:10.1103/physrevlett.114.111801. PMID 25839260. S2CID 2339142.
- ^ a b Adam-Bourdarios, C.; Cowan, G.; Germain-Renaud, C.; Guyon, I.; Kégl, B.; Rousseau, D. (2015). "The Higgs Machine Learning Challenge". Journal of Physics: Conference Series. 664 (7): 072015. Bibcode:2015JPhCS.664g2015A. doi:10.1088/1742-6596/664/7/072015.
- ^ Baldi, Pierre; Cranmer, Kyle; Faucett, Taylor; Sadowski, Peter; Whiteson, Daniel (2016). "Parameterized neural networks for high-energy physics". The European Physical Journal C. 76 (5): 235. arXiv:1601.07913. Bibcode:2016EPJC...76..235B. doi:10.1140/epjc/s10052-016-4099-4. S2CID 254108545.
- ^ Ortigosa, I.; Lopez, R.; Garcia, J. "A neural networks approach to residuary resistance of sailing yachts prediction". Proceedings of the International Conference on Marine Engineering MARINE. 2007.
- ^ Gerritsma, J., R. Onnink, and A. Versluis.Geometry, resistance and stability of the delft systematic yacht hull series. Delft University of Technology, 1981.
- ^ Liu, Huan, and Hiroshi Motoda. Feature extraction, construction and selection: A data mining perspective. Springer Science & Business Media, 1998.
- ^ Reich, Yoram. Converging to Ideal Design Knowledge by Learning. [Carnegie Mellon University], Engineering Design Research Center, 1989.
- ^ Todorovski, Ljupčo; Džeroski, Sašo (1999). "Experiments in Meta-level Learning with ILP". Principles of Data Mining and Knowledge Discovery. Lecture Notes in Computer Science. Vol. 1704. pp. 98–106. doi:10.1007/978-3-540-48247-5_11. ISBN 978-3-540-66490-1. S2CID 39382993.
- ^ Wang, Yong. A new approach to fitting linear models in high dimensional spaces. Diss. The University of Waikato, 2000.
- ^ Kibler, Dennis; Aha, David W.; Albert, Marc K. (1989). "Instance-based prediction of real-valued attributes". Computational Intelligence. 5 (2): 51–57. doi:10.1111/j.1467-8640.1989.tb00315.x. S2CID 40800413.
- ^ Palmer, Christopher R.; Faloutsos, Christos (2003). "Electricity Based External Similarity of Categorical Attributes". Advances in Knowledge Discovery and Data Mining. Lecture Notes in Computer Science. Vol. 2637. pp. 486–500. doi:10.1007/3-540-36175-8_49. ISBN 978-3-540-04760-5.
- ^ Tsanas, Athanasios; Xifara, Angeliki (2012). "Accurate quantitative estimation of energy performance of residential buildings using statistical machine learning tools". Energy and Buildings. 49: 560–567. Bibcode:2012EneBu..49..560T. doi:10.1016/j.enbuild.2012.03.003.
- ^ De Wilde, Pieter (2014). "The gap between predicted and measured energy performance of buildings: A framework for investigation". Automation in Construction. 41: 40–49. doi:10.1016/j.autcon.2014.02.009.
- ^ Brooks, Thomas F., D. Stuart Pope, and Michael A. Marcolini. Airfoil self-noise and prediction. Vol. 1218. National Aeronautics and Space Administration, Office of Management, Scientific and Technical Information Division, 1989.
- ^ Draper, David. "Assessment and propagation of model uncertainty." Journal of the Royal Statistical Society, Series B (Methodological) (1995): 45–97.
- ^ Lavine, Michael (1991). "Problems in extrapolation illustrated with space shuttle O-ring data". Journal of the American Statistical Association. 86 (416): 919–921. doi:10.1080/01621459.1991.10475132.
- ^ Wang, J.; Yu, B.; Gasser, L. (2002). "Concept tree based clustering visualization with shaded similarity matrices". 2002 IEEE International Conference on Data Mining, 2002. Proceedings. pp. 697–700. doi:10.1109/ICDM.2002.1184032. ISBN 0-7695-1754-4.
- ^ Pettengill, Gordon H.; Ford, Peter G.; Johnson, William T. K.; Raney, R. Keith; Soderblom, Laurence A. (12 April 1991). "Magellan: Radar Performance and Data Products". Science. 252 (5003): 260–265. Bibcode:1991Sci...252..260P. doi:10.1126/science.252.5003.260. PMID 17769272.
- ^ a b Aharonian, F.; et al. (2008). "Energy spectrum of cosmic-ray electrons at TeV energies". Physical Review Letters. 101 (26): 261104. arXiv:0811.3894. Bibcode:2008PhRvL.101z1104A. doi:10.1103/PhysRevLett.101.261104. hdl:2440/51450. PMID 19437632. S2CID 41850528.
- ^ Bock, R. K.; et al. (2004). "Methods for multidimensional event classification: a case study using images from a Cherenkov gamma-ray telescope". Nuclear Instruments and Methods in Physics Research Section A: Accelerators, Spectrometers, Detectors and Associated Equipment. 516 (2): 511–528. Bibcode:2004NIMPA.516..511B. doi:10.1016/j.nima.2003.08.157.
- ^ Li, Jinyan; et al. (2004). "Deeps: A new instance-based lazy discovery and classification system". Machine Learning. 54 (2): 99–124. doi:10.1023/b:mach.0000011804.08528.7d.
- ^ Villaescusa-Navarro, Francisco; al., et (2022). "The CAMELS Multifield Data Set: Learning the Universe's Fundamental Parameters with Artificial Intelligence". The Astrophysical Journal Supplement Series. 259 (2): 61. arXiv:2109.10915. Bibcode:2022ApJS..259...61V. doi:10.3847/1538-4365/ac5ab0. S2CID 237604997.
- ^ Siebert, Lee, and Tom Simkin. "Volcanoes of the world: an illustrated catalog of Holocene volcanoes and their eruptions." (2014).
- ^ Sikora, Marek; Wróbel, Łukasz (2010). "Application of rule induction algorithms for analysis of data collected by seismic hazard monitoring systems in coal mines". Archives of Mining Sciences. 55 (1): 91–114.
- ^ Sikora, Marek; Sikora, Beata (2012). "Rough Natural Hazards Monitoring". Rough Sets: Selected Methods and Applications in Management and Engineering. Advanced Information and Knowledge Processing. pp. 163–179. doi:10.1007/978-1-4471-2760-4_10. ISBN 978-1-4471-2759-8.
- ^ Addor, Nans; Newman, Andrew J.; Mizukami, Naoki; Clark, Martyn P. (20 October 2017). "The CAMELS data set: catchment attributes and meteorology for large-sample studies". Hydrology and Earth System Sciences. 21 (10): 5293–5313. Bibcode:2017HESS...21.5293A. doi:10.5194/hess-21-5293-2017.
- ^ Newman, A. J.; Clark, M. P.; Sampson, K.; Wood, A.; Hay, L. E.; Bock, A.; Viger, R. J.; Blodgett, D.; Brekke, L.; Arnold, J. R.; Hopson, T.; Duan, Q. (14 January 2015). "Development of a large-sample watershed-scale hydrometeorological data set for the contiguous USA: data set characteristics and assessment of regional variability in hydrologic model performance". Hydrology and Earth System Sciences. 19 (1): 209–223. Bibcode:2015HESS...19..209N. doi:10.5194/hess-19-209-2015.
- ^ Alvarez-Garreton, Camila; Mendoza, Pablo A.; Boisier, Juan Pablo; Addor, Nans; Galleguillos, Mauricio; Zambrano-Bigiarini, Mauricio; Lara, Antonio; Puelma, Cristóbal; Cortes, Gonzalo; Garreaud, Rene; McPhee, James; Ayala, Alvaro (13 November 2018). "The CAMELS-CL dataset: catchment attributes and meteorology for large sample studies – Chile dataset". Hydrology and Earth System Sciences. 22 (11): 5817–5846. Bibcode:2018HESS...22.5817A. doi:10.5194/hess-22-5817-2018.
- ^ Chagas, Vinícius B. P.; Chaffe, Pedro L. B.; Addor, Nans; Fan, Fernando M.; Fleischmann, Ayan S.; Paiva, Rodrigo C. D.; Siqueira, Vinícius A. (8 September 2020). "CAMELS-BR: hydrometeorological time series and landscape attributes for 897 catchments in Brazil". Earth System Science Data. 12 (3): 2075–2096. Bibcode:2020ESSD...12.2075C. doi:10.5194/essd-12-2075-2020.
- ^ Coxon, Gemma; Addor, Nans; Bloomfield, John P.; Freer, Jim; Fry, Matt; Hannaford, Jamie; Howden, Nicholas J. K.; Lane, Rosanna; Lewis, Melinda; Robinson, Emma L.; Wagener, Thorsten; Woods, Ross (12 October 2020). "CAMELS-GB: hydrometeorological time series and landscape attributes for 671 catchments in Great Britain". Earth System Science Data. 12 (4): 2459–2483. Bibcode:2020ESSD...12.2459C. doi:10.5194/essd-12-2459-2020.
- ^ Fowler, Keirnan J. A.; Acharya, Suwash Chandra; Addor, Nans; Chou, Chihchung; Peel, Murray C. (6 August 2021). "CAMELS-AUS: hydrometeorological time series and landscape attributes for 222 catchments in Australia". Earth System Science Data. 13 (8): 3847–3867. Bibcode:2021ESSD...13.3847F. doi:10.5194/essd-13-3847-2021.
- ^ Klingler, Christoph; Schulz, Karsten; Herrnegger, Mathew (16 September 2021). "LamaH-CE: LArge-SaMple DAta for Hydrology and Environmental Sciences for Central Europe". Earth System Science Data. 13 (9): 4529–4565. Bibcode:2021ESSD...13.4529K. doi:10.5194/essd-13-4529-2021.
- ^ Yeh, I–C (1998). "Modeling of strength of high-performance concrete using artificial neural networks". Cement and Concrete Research. 28 (12): 1797–1808. doi:10.1016/s0008-8846(98)00165-3.
- ^ Zarandi, MH Fazel; et al. (2008). "Fuzzy polynomial neural networks for approximation of the compressive strength of concrete". Applied Soft Computing. 8 (1): 488–498. Bibcode:2008ApSoC...8...79S. doi:10.1016/j.asoc.2007.02.010.
- ^ Yeh, I. "Modeling slump of concrete with fly ash and superplasticizer." Computers and Concrete5.6 (2008): 559–572.
- ^ Gencel, Osman; et al. (2011). "Comparison of artificial neural networks and general linear model approaches for the analysis of abrasive wear of concrete". Construction and Building Materials. 25 (8): 3486–3494. doi:10.1016/j.conbuildmat.2011.03.040.
- ^ Dietterich, Thomas G., et al. "A comparison of dynamic reposing and tangent distance for drug activity prediction Archived 7 December 2019 at the Wayback Machine." Advances in Neural Information Processing Systems (1994): 216–216.
- ^ Buscema, Massimo; Tastle, William J.; Terzi, Stefano (2013). "Meta Net: A New Meta-Classifier Family". Data Mining Applications Using Artificial Adaptive Systems. pp. 141–182. doi:10.1007/978-1-4614-4223-3_5. ISBN 978-1-4614-4222-6.
- ^ Barnard, Amanda; Sun, Baichuan; Motevalli Soumehsaraei, Ben; & Opletal, George (2019): Silver Nanoparticle Data Set. v3. CSIRO. Data Collection. https://doi.org/10.25919/5d22d20bc543e
- ^ Barnard, Amanda; Sun, Baichuan; & Opletal, George (2019): Platinum Nanoparticle Data Set. v2. CSIRO. Data Collection. https://doi.org/10.25919/5d3958d9bf5f7
- ^ Barnard, Amanda; & Opletal, George (2019): Gold Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/5d395ef9a4291
- ^ Barnard, Amanda; & Opletal, George (2019): Ruthenium Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/5e30b8fa67484
- ^ Barnard, Amanda; & Opletal, George (2019): Copper Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/5e30ba386311f
- ^ Barnard, Amanda; & Opletal, George (2023): Palladium Nanoparticle Data Set. v2. CSIRO. Data Collection. https://doi.org/10.25919/epxd-8p61
- ^ Ting, Jonathan; Barnard, Amanda; Opletal, George (2023): AuCo Nanoparticle Data Set. v2. CSIRO. Data Collection. https://doi.org/10.25919/7h3x-1343
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PtCo Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/jzh8-rd31
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PtAu Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/tdnv-jp30
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PdPt Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/qced-2e85
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PdCo Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/az9t-vr97
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): CoPt Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/0bs4-sn79
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): CoPd Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/em3a-9a89
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): CoAu Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/991j-hg07
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): AuPt Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/7zh9-3f67
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PtPd Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/9sz9-3a85
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): PdAu Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/6ajg-1275
- ^ Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): AuPd Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/v0r5-sw08
- ^ Lu, Kaihan; Ting, Jonathan; Barnard, Amanda; & Opletal, George (2023): AuPdPt Nanoparticle Data Set. v1. CSIRO. Data Collection. https://doi.org/10.25919/psvw-am47
- ^ Amoradnejad, Issa; Amoradnejad, Rahimberdi; et al. (2022). "Age dataset: A structured general-purpose dataset on life, work, and death of 1.22 million distinguished people". Workshop Proceedings of the 16th International AAAI Conference on Web and Social Media (ICWSM). 3. ICWSM: 1–4. doi:10.36190/2022.82. S2CID 249668669.
- ^ "Age Dataset". GitHub. 7 June 2022.
- ^ "Synthetic Fundus Dataset". Archived from the original on 29 November 2021. Retrieved 22 February 2023.
- ^ Lo Castro, Dario; et al. (2020). "A visual framework to create photorealistic retinal vessels for diagnosis purposes". Journal of Biomedical Informatics. 108: 103490. doi:10.1016/j.jbi.2020.103490. PMID 32640292. S2CID 220429697.
- ^ Ingber, Lester (1997). "Statistical mechanics of neocortical interactions: Canonical momenta indicatorsof electroencephalography". Physical Review E. 55 (4): 4578–4593. arXiv:physics/0001052. Bibcode:1997PhRvE..55.4578I. doi:10.1103/PhysRevE.55.4578. S2CID 6390999.
- ^ Hoffmann, Ulrich; Vesin, Jean-Marc; Ebrahimi, Touradj; Diserens, Karin (January 2008). "An efficient P300-based brain–computer interface for disabled subjects". Journal of Neuroscience Methods. 167 (1): 115–125. doi:10.1016/j.jneumeth.2007.03.005. PMID 17445904.
- ^ Donchin, Emanuel; Spencer, Kevin M.; Wijesinghe, Ranjith (2000). "The mental prosthesis: assessing the speed of a P300-based brain-computer interface". IEEE Transactions on Rehabilitation Engineering. 8 (2): 174–179. doi:10.1109/86.847808. PMID 10896179. S2CID 84043.
- ^ Detrano, Robert; et al. (1989). "International application of a new probability algorithm for the diagnosis of coronary artery disease". The American Journal of Cardiology. 64 (5): 304–310. doi:10.1016/0002-9149(89)90524-9. PMID 2756873.
- ^ Bradley, Andrew P (1997). "The use of the area under the ROC curve in the evaluation of machine learning algorithms" (PDF). Pattern Recognition. 30 (7): 1145–1159. Bibcode:1997PatRe..30.1145B. doi:10.1016/s0031-3203(96)00142-2. S2CID 13806304.
- ^ Street, W. N.; Wolberg, W. H.; Mangasarian, O. L. (1993). "Nuclear feature extraction for breast tumor diagnosis". In Acharya, Raj S.; Goldgof, Dmitry B. (eds.). Biomedical Image Processing and Biomedical Visualization. Vol. 1905. pp. 861–870. doi:10.1117/12.148698.
- ^ Demir, Cigdem; Yener, Bülent (2005). Automated cancer diagnosis based on histopathological images : a systematic survey (PDF) (Report). S2CID 8952443.
- ^ Abuse, Substance. "Mental Health Services Administration, Results from the 2010 National Survey on Drug Use and Health: Summary of National Findings, NSDUH Series H-41, HHS Publication No.(SMA) 11-4658." Rockville, MD: Substance Abuse and Mental Health Services Administration 201 (2011).
- ^ Hong, Zi-Quan; Yang, Jing-Yu (1991). "Optimal discriminant plane for a small number of samples and design method of classifier on the plane". Pattern Recognition. 24 (4): 317–324. Bibcode:1991PatRe..24..317H. doi:10.1016/0031-3203(91)90074-f.
- ^ a b Li, Jinyan; Wong, Limsoon (2003). "Using Rules to Analyse Bio-medical Data: A Comparison between C4.5 and PCL". Advances in Web-Age Information Management. Lecture Notes in Computer Science. Vol. 2762. pp. 254–265. doi:10.1007/978-3-540-45160-0_25. ISBN 978-3-540-40715-7.
- ^ Guvenir, H.A.; Acar, B.; Demiroz, G.; Cekin, A. (1997). "A supervised machine learning algorithm for arrhythmia analysis". Computers in Cardiology 1997. pp. 433–436. doi:10.1109/CIC.1997.647926. ISBN 0-7803-4445-6.
- ^ Lagus, Krista; Alhoniemi, Esa; Seppä, Jeremias; Honkela, Antti; Wagner, Paul (2005). "Independent Variable Group Analysis in Learning Compact Representations for Data" (PDF). International and Interdisciplinary Conference on Adaptive Knowledge Representation and Reasoning (AKRR'05), Helsinki, Finland, June 15-17, 2005. pp. 49–56.
- ^ Strack, Beata, et al. "Impact of HbA1c measurement on hospital readmission rates: analysis of 70,000 clinical database patient records." BioMed Research International 2014; 2014
- ^ Rubin, Daniel J (2015). "Hospital readmission of patients with diabetes". Current Diabetes Reports. 15 (4): 1–9. doi:10.1007/s11892-015-0584-7. PMID 25712258. S2CID 3908599.
- ^ Antal, Bálint; Hajdu, András (2014). "An ensemble-based system for automatic screening of diabetic retinopathy". Knowledge-Based Systems. 60 (2014): 20–27. arXiv:1410.8576. Bibcode:2014arXiv1410.8576A. doi:10.1016/j.knosys.2013.12.023. S2CID 13984326.
- ^ Haloi, Mrinal (2015). "Improved Microaneurysm Detection using Deep Neural Networks". arXiv:1505.04424 [cs.CV].
- ^ ELIE, Guillaume PATRY, Gervais GAUTHIER, Bruno LAY, Julien ROGER, Damien. "ADCIS Download Third Party: Messidor Database". adcis.net. Retrieved 25 February 2018.
{{cite web}}: CS1 maint: multiple names: authors list (link) - ^ Decencière, Etienne; Zhang, Xiwei; Cazuguel, Guy; Lay, Bruno; Cochener, Béatrice; Trone, Caroline; Gain, Philippe; Ordonez, Richard; Massin, Pascale; Erginay, Ali; Charton, Béatrice; Klein, Jean-Claude (26 August 2014). "Feedback on a Publicly Distributed Image Database: The Messidor Database". Image Analysis & Stereology. 33 (3): 231. doi:10.5566/ias.1155.
- ^ Bagirov, A. M.; Rubinov, A. M.; Soukhoroukova, N. V.; Yearwood, J. (June 2003). "Unsupervised and supervised data classification via nonsmooth and global optimization". Top. 11 (1): 1–75. doi:10.1007/bf02578945.
- ^ Fung, Glenn; Dundar, Murat; Bi, Jinbo; Rao, Bharat (2004). "A fast iterative algorithm for fisher discriminant using heterogeneous kernels". In Greiner, Russell; Schuurmans, Dale (eds.). Proceedings of the Twenty-first International Conference on Machine Learning. ACM. p. 40. doi:10.1145/1015330.1015409. ISBN 978-1-58113-838-2.
- ^ Quinlan, J. R.; Compton, P. J.; Horn, K. A.; Lazarus, L. (1987). "Inductive knowledge acquisition: a case study". In Quinlan, John Ross (ed.). Applications of Expert Systems: Based on the Proceedings of the Second Australian Conference. Turing Institute Press. pp. 137–156. ISBN 978-0-201-17449-6.
- ^ a b Zhi-Hua Zhou; Yuan Jiang (2004). "NeC4.5: Neural ensemble based C4.5". IEEE Transactions on Knowledge and Data Engineering. 16 (6): 770–773. doi:10.1109/tkde.2004.11.
- ^ Er, Orhan; et al. (2012). "An approach based on probabilistic neural network for diagnosis of Mesothelioma's disease". Computers & Electrical Engineering. 38 (1): 75–81. doi:10.1016/j.compeleceng.2011.09.001.
- ^ Er, Orhan; Tanrikulu, A. Çetin; Abakay, Abdurrahman (10 May 2015). "Use of artificial intelligence techniques for diagnosis of malignant pleural mesothelioma". Dicle Medical Journal / Dicle Tip Dergisi. 42 (1). doi:10.5798/diclemedj.0921.2015.01.0520 (inactive 23 November 2024).
{{cite journal}}: CS1 maint: DOI inactive as of November 2024 (link) - ^ Li, Michael H.; Mestre, Tiago A.; Fox, Susan H.; Taati, Babak (25 July 2017). "Vision-Based Assessment of Parkinsonism and Levodopa-Induced Dyskinesia with Deep Learning Pose Estimation". Journal of Neuroengineering and Rehabilitation. 15 (1): 97. arXiv:1707.09416. Bibcode:2017arXiv170709416L. doi:10.1186/s12984-018-0446-z. PMC 6219082. PMID 30400914.
- ^ Li, Michael H.; Mestre, Tiago A.; Fox, Susan H.; Taati, Babak (August 2018). "Automated assessment of levodopa-induced dyskinesia: Evaluating the responsiveness of video-based features". Parkinsonism & Related Disorders. 53: 42–45. doi:10.1016/j.parkreldis.2018.04.036. PMID 29748112.
- ^ "Parkinson's Vision-Based Pose Estimation Dataset | Kaggle". kaggle.com. Retrieved 22 August 2018.
- ^ Shannon, Paul; et al. (2003). "Cytoscape: a software environment for integrated models of biomolecular interaction networks". Genome Research. 13 (11): 2498–2504. doi:10.1101/gr.1239303. PMC 403769. PMID 14597658.
- ^ Javadi, Soroush; Mirroshandel, Seyed Abolghasem (June 2019). "A novel deep learning method for automatic assessment of human sperm images". Computers in Biology and Medicine. 109: 182–194. doi:10.1016/j.compbiomed.2019.04.030. PMID 31059902.
- ^ "soroushj/mhsma-dataset: MHSMA: The Modified Human Sperm Morphology Analysis Dataset". github.com. Retrieved 3 May 2019.
- ^ Clark, David, Zoltan Schreter, and Anthony Adams. "A quantitative comparison of dystal and backpropagation." Proceedings of 1996 Australian Conference on Neural Networks. 1996.
- ^ Jiang, Yuan, and Zhi-Hua Zhou. "Editing training data for kNN classifiers with neural network ensemble." Advances in Neural Networks–ISNN 2004. Springer Berlin Heidelberg, 2004. 356–361.
- ^ Ontañón, Santiago, and Enric Plaza. "On similarity measures based on a refinement lattice." Case-Based Reasoning Research and Development. Springer Berlin Heidelberg, 2009. 240–255.
- ^ "PLF data inventory". GitHub. 5 November 2021.
- ^ Higuera, Clara; Gardiner, Katheleen J.; Cios, Krzysztof J. (2015). "Self-organizing feature maps identify proteins critical to learning in a mouse model of down syndrome". PLOS ONE. 10 (6): e0129126. Bibcode:2015PLoSO..1029126H. doi:10.1371/journal.pone.0129126. PMC 4482027. PMID 26111164.
- ^ Ahmed, Md Mahiuddin; et al. (2015). "Protein dynamics associated with failed and rescued learning in the Ts65Dn mouse model of Down syndrome". PLOS ONE. 10 (3): e0119491. Bibcode:2015PLoSO..1019491A. doi:10.1371/journal.pone.0119491. PMC 4368539. PMID 25793384.
- ^ Langley, PAT (2014). "Trading off simplicity and coverage in incremental concept learning" (PDF). Machine Learning Proceedings. 1988: 73. Archived from the original (PDF) on 6 August 2019. Retrieved 6 August 2019.
- ^ "Mushroom Data Set 2020". mushroom.mathematik.uni-marburg.de. Retrieved 6 April 2021.
- ^ Wagner, Dennis; Heider, Dominik; Hattab, Georges (14 April 2021). "Mushroom data creation, curation, and simulation to support classification tasks". Scientific Reports. 11 (1): 8134. Bibcode:2021NatSR..11.8134W. doi:10.1038/s41598-021-87602-3. PMC 8046754. PMID 33854157.
- ^ Cortez, Paulo, and Aníbal de Jesus Raimundo Morais. "A data mining approach to predict forest fires using meteorological data." (2007).
- ^ Farquad, M. A. H.; Ravi, V.; Raju, S. Bapi (2010). "Support vector regression based hybrid rule extraction methods for forecasting". Expert Systems with Applications. 37 (8): 5577–5589. doi:10.1016/j.eswa.2010.02.055.
- ^ Fisher, Ronald A (1936). "The use of multiple measurements in taxonomic problems". Annals of Eugenics. 7 (2): 179–188. doi:10.1111/j.1469-1809.1936.tb02137.x. hdl:2440/15227.
- ^ Ghahramani, Zoubin, and Michael I. Jordan. "Supervised learning from incomplete data via an EM approach Archived 22 April 2017 at the Wayback Machine." Advances in neural information processing systems 6. 1994.
- ^ Mallah, Charles; Cope, James; Orwell, James (2013). "Plant Leaf Classification using Probabilistic Integration of Shape, Texture and Margin Features". Computer Graphics and Imaging / 798: Signal Processing, Pattern Recognition and Applications. doi:10.2316/P.2013.798-098. ISBN 978-0-88986-944-8.
- ^ Yahiaoui, Itheri; Mzoughi, Olfa; Boujemaa, Nozha (2012). "Leaf Shape Descriptor for Tree Species Identification". 2012 IEEE International Conference on Multimedia and Expo. pp. 254–259. doi:10.1109/ICME.2012.130. ISBN 978-1-4673-1659-0.
- ^ Tan, Ming; Eshelman, Larry (1988). "Using Weighted Networks to Represent Classification Knowledge in Noisy Domains". Machine Learning Proceedings 1988. pp. 121–134. doi:10.1016/B978-0-934613-64-4.50018-9. ISBN 978-0-934613-64-4.
- ^ Charytanowicz, Małgorzata, et al. "Complete gradient clustering algorithm for features analysis of x-ray images." Information technologies in biomedicine. Springer Berlin Heidelberg, 2010. 15–24.
- ^ Sanchez, Mauricio A.; et al. (2014). "Fuzzy granular gravitational clustering algorithm for multivariate data". Information Sciences. 279: 498–511. doi:10.1016/j.ins.2014.04.005.
- ^ Blackard, Jock A.; Dean, Denis J. (December 1999). "Comparative accuracies of artificial neural networks and discriminant analysis in predicting forest cover types from cartographic variables". Computers and Electronics in Agriculture. 24 (3): 131–151. Bibcode:1999CEAgr..24..131B. doi:10.1016/s0168-1699(99)00046-0.
- ^ Fürnkranz, Johannes (2001). "Round Robin Rule Learning" (PDF). In Danyluk, Andrea Pohoreckyj; Brodley, Carla E. (eds.). Machine Learning: Proceedings of the Eighteenth International Conference (ICML 2001) : Williams College, June 28-July 1, 2001. Morgan Kaufmann Publishers. pp. 146–153. ISBN 978-1-55860-778-1.
- ^ Li, Song; Assmann, Sarah M.; Albert, Réka (2006). "Predicting essential components of signal transduction networks: a dynamic model of guard cell abscisic acid signaling". PLOS Biol. 4 (10): e312. arXiv:q-bio/0610012. Bibcode:2006q.bio....10012L. doi:10.1371/journal.pbio.0040312. PMC 1564158. PMID 16968132.
- ^ Munisami, Trishen; et al. (2015). "Plant Leaf Recognition Using Shape Features and Colour Histogram with K-nearest Neighbour Classifiers". Procedia Computer Science. 58: 740–747. doi:10.1016/j.procs.2015.08.095.
- ^ Li, Bai (2016). "Atomic potential matching: An evolutionary target recognition approach based on edge features". Optik. 127 (5): 3162–3168. Bibcode:2016Optik.127.3162L. doi:10.1016/j.ijleo.2015.11.186.
- ^ Razavian, Ali, et al. "CNN features off-the-shelf: an astounding baseline for recognition." Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops. 2014.
- ^ Nilsback, Maria-Elena, and Andrew Zisserman. "A visual vocabulary for flower classification."Computer Vision and Pattern Recognition, 2006 IEEE Computer Society Conference on. Vol. 2. IEEE, 2006.
- ^ Giselsson, Thomas M.; et al. (2017). "A Public Image Database for Benchmark of Plant Seedling Classification Algorithms". arXiv:1711.05458 [cs.CV].
- ^ Oltean, Mihai (2017). "Fruits-360 dataset". GitHub.
- ^ Old, Richard (2024). "Weed-ID.App dataset".
- ^ Rahman, Abdur (2022). "Performance evaluation of deep learning object detectors for weed detection for cotton". ScienceDirect.
- ^ Nakai, Kenta; Kanehisa, Minoru (1991). "Expert system for predicting protein localization sites in gram-negative bacteria". Proteins: Structure, Function, and Bioinformatics. 11 (2): 95–110. doi:10.1002/prot.340110203. PMID 1946347. S2CID 27606447.
- ^ Ling, Charles X., et al. "Decision trees with minimal costs." Proceedings of the twenty-first international conference on Machine learning. ACM, 2004.
- ^ Mahé, Pierre, et al. "Automatic identification of mixed bacterial species fingerprints in a MALDI-TOF mass-spectrum." Bioinformatics (2014): btu022.
- ^ Barbano, Duane; et al. (2015). "Rapid characterization of microalgae and microalgae mixtures using matrix-assisted laser desorption ionization time-of-flight mass spectrometry (MALDI-TOF MS)". PLOS ONE. 10 (8): e0135337. Bibcode:2015PLoSO..1035337B. doi:10.1371/journal.pone.0135337. PMC 4536233. PMID 26271045.
- ^ Horton, Paul; Nakai, Kenta (1996). "A probabilistic classification system for predicting the cellular localization sites of proteins" (PDF). ISMB-96 Proceedings. 4: 109–15. PMID 8877510. Archived from the original (PDF) on 4 November 2021. Retrieved 6 August 2019.
- ^ Allwein, Erin L.; Schapire, Robert E.; Singer, Yoram (2001). "Reducing multiclass to binary: A unifying approach for margin classifiers" (PDF). The Journal of Machine Learning Research. 1: 113–141.
- ^ Mayr, Andreas; Klambauer, Guenter; Unterthiner, Thomas; Hochreiter, Sepp (2016). "DeepTox: Toxicity Prediction Using Deep Learning". Frontiers in Environmental Science. 3: 80. doi:10.3389/fenvs.2015.00080.
- ^ Lavin, Alexander; Ahmad, Subutai (12 October 2015). "Evaluating Real-Time Anomaly Detection Algorithms -- the Numenta Anomaly Benchmark". 2015 IEEE 14th International Conference on Machine Learning and Applications (ICMLA). pp. 38–44. arXiv:1510.03336. doi:10.1109/ICMLA.2015.141. ISBN 978-1-5090-0287-0. S2CID 6842305.
- ^ Iurii D. Katser; Vyacheslav O. Kozitsin. "SKAB GitHub repository". GitHub. Retrieved 12 January 2021.
- ^ Iurii D. Katser; Vyacheslav O. Kozitsin (2020). "Skoltech Anomaly Benchmark (SKAB)". Kaggle. doi:10.34740/KAGGLE/DSV/1693952. Retrieved 12 January 2021.
{{cite journal}}: Cite journal requires|journal=(help) - ^ Campos, Guilherme O.; Zimek, Arthur; Sander, Jörg; Campello, Ricardo J. G. B.; Micenková, Barbora; Schubert, Erich; Assent, Ira; Houle, Michael E. (July 2016). "On the evaluation of unsupervised outlier detection: measures, datasets, and an empirical study". Data Mining and Knowledge Discovery. 30 (4): 891–927. doi:10.1007/s10618-015-0444-8.
- ^ Ann-Kathrin Hartmann, Tommaso Soru, Edgard Marx. Generating a Large Dataset for Neural Question Answering over the DBpedia Knowledge Base. 2018.
- ^ Soru, Tommaso; Marx, Edgard; Moussallem, Diego; Publio, Gustavo; Valdestilhas, André; Esteves, Diego; Neto, Ciro Baron (2017). SPARQL as a Foreign Language (Preprint). arXiv:1708.07624.
- ^ Kiet Van Nguyen, Duc-Vu Nguyen, Anh Gia-Tuan Nguyen, Ngan Luu-Thuy Nguyen. A Vietnamese Dataset for Evaluating Machine Reading Comprehension. COLING 2020.
- ^ Nguyen, Kiet Van; Tran, Khiem Vinh; Luu, Son T.; Nguyen, Anh Gia-Tuan; Nguyen, Ngan Luu-Thuy (2020). "Enhancing Lexical-Based Approach With External Knowledge for Vietnamese Multiple-Choice Machine Reading Comprehension". IEEE Access. 8: 201404–201417. Bibcode:2020IEEEA...8t1404N. doi:10.1109/ACCESS.2020.3035701.
- ^ Anantha, Raviteja; Vakulenko, Svitlana; Tu, Zhucheng; Longpre, Shayne; Pulman, Stephen; Chappidi, Srinivas (2020). "Open-Domain Question Answering Goes Conversational via Question Rewriting". arXiv:2010.04898 [cs.IR].
- ^ Khashabi, Daniel; Min, Sewon; Khot, Tushar; Sabharwal, Ashish; Tafjord, Oyvind; Clark, Peter; Hajishirzi, Hannaneh (November 2020). "UNIFIEDQA: Crossing Format Boundaries with a Single QA System". Findings of the Association for Computational Linguistics: EMNLP 2020. Online: Association for Computational Linguistics: 1896–1907. arXiv:2005.00700. doi:10.18653/v1/2020.findings-emnlp.171. S2CID 218487109.
- ^ Taskmaster, Google Research Datasets, 17 December 2022, retrieved 7 January 2023
- ^ Byrne, Bill; Krishnamoorthi, Karthik; Sankar, Chinnadhurai; Neelakantan, Arvind; Duckworth, Daniel; Yavuz, Semih; Goodrich, Ben; Dubey, Amit; Cedilnik, Andy; Kim, Kyu-Young (1 September 2019). "Taskmaster-1: Toward a Realistic and Diverse Dialog Dataset". arXiv:1909.05358 [cs.CL].
- ^ Yasunaga, Michihiro; Liang, Percy (21 November 2020). "Graph-based, Self-Supervised Program Repair from Diagnostic Feedback". International Conference on Machine Learning. PMLR: 10799–10808. arXiv:2005.10636.
- ^ Wang, Yizhong; Mishra, Swaroop; Alipoormolabashi, Pegah; Kordi, Yeganeh; Mirzaei, Amirreza; Arunkumar, Anjana; Ashok, Arjun; Dhanasekaran, Arut Selvan; Naik, Atharva; Stap, David; Pathak, Eshaan; Karamanolakis, Giannis; Lai, Haizhi Gary; Purohit, Ishan; Mondal, Ishani (24 October 2022). "Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks". arXiv:2204.07705 [cs.CL].
- ^ Paperno, Denis; Kruszewski, Germán; Lazaridou, Angeliki; Pham, Quan Ngoc; Bernardi, Raffaella; Pezzelle, Sandro; Baroni, Marco; Boleda, Gemma; Fernández, Raquel (7 August 2016), The LAMBADA dataset, doi:10.5281/zenodo.2630551, retrieved 7 January 2023
- ^ Paperno, Denis; Kruszewski, Germán; Lazaridou, Angeliki; Pham, Ngoc Quan; Bernardi, Raffaella; Pezzelle, Sandro; Baroni, Marco; Boleda, Gemma; Fernández, Raquel (August 2016). "The LAMBADA dataset: Word prediction requiring a broad discourse context". Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Berlin, Germany: Association for Computational Linguistics: 1525–1534. doi:10.18653/v1/P16-1144. hdl:10230/32702. S2CID 2381275.
- ^ Wei, Jason; Bosma, Maarten; Zhao, Vincent; Guu, Kelvin; Yu, Adams Wei; Lester, Brian; Du, Nan; Dai, Andrew M.; Le, Quoc V. (10 February 2022). Finetuned Language Models are Zero-Shot Learners (Preprint). arXiv:2109.01652.
- ^ "Working with ATT&CK | MITRE ATT&CK®". attack.mitre.org. Retrieved 14 January 2023.
- ^ "CAPEC - Common Attack Pattern Enumeration and Classification (CAPEC™)". capec.mitre.org. Retrieved 14 January 2023.
- ^ "CVE - Home". cve.mitre.org. Retrieved 14 January 2023.
- ^ "CWE - Common Weakness Enumeration". cwe.mitre.org. Retrieved 14 January 2023.
- ^ Lim, Swee Kiat; Muis, Aldrian Obaja; Lu, Wei; Ong, Chen Hui (July 2017). "MalwareTextDB: A Database for Annotated Malware Articles". Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Vancouver, Canada: Association for Computational Linguistics: 1557–1567. doi:10.18653/v1/P17-1143. S2CID 7816596.
- ^ "USENIX". USENIX. Retrieved 19 January 2023.
- ^ "APTnotes | Read the Docs". readthedocs.org. Retrieved 19 January 2023.
- ^ "Cryptography and Security authors/titles recent submissions". arxiv.org. Retrieved 19 January 2023.
- ^ "Holistic Info-Sec for Web Developers - Fascicle 0". f0.holisticinfosecforwebdevelopers.com. Retrieved 20 January 2023.
- ^ "Holistic Info-Sec for Web Developers - Fascicle 1". f1.holisticinfosecforwebdevelopers.com. Retrieved 20 January 2023.
- ^ Vincent, Adam. "Web Services Web Services Hacking and Hardening" (PDF). owasp.org.
- ^ McCray, Joe. "Advanced SQL Injection" (PDF). defcon.org.
- ^ Shah, Shreeraj. "Blind SQL injection discovery & exploitation technique" (PDF). blueinfy.com.
- ^ Palcer, C. C. "Ethical hacking" (PDF). textfiles.
- ^ "Hacking Secrets Revealed - Information and Instructional Guide" (PDF).
- ^ Park, Alexis. "Hack any website" (PDF).
- ^ Cerrudo, Cesar; Martinez Fayo, Esteban. "Hacking Databases for Owning your Data" (PDF). blackhat.
- ^ O'Connor, Tj. "Violent Python-A Cookbook for Hackers, Forensic Analysts, Penetration Testers and Security Engineers" (PDF). Github.
- ^ Grand, Joe. "Hardware Reverse Engineering: Access, Analyze, & Defeat" (PDF). blackhat.
- ^ Chang, Jason V. "Computer Hacking: Making the Case for National Reporting Requirement" (PDF). cyber.harvard.edu.
- ^ "National Cybersecurity Strategies Repository". ITU. Retrieved 20 January 2023.
- ^ Chen, Yanlin (31 August 2022), Cyber Security Natural Language Processing, retrieved 20 January 2023
- ^ Zampieri, Marcos; Malmasi, Shervin; Nakov, Preslav; Rosenthal, Sara; Farra, Noura; Kumar, Ritesh (16 April 2019). "Predicting the Type and Target of Offensive Posts in Social Media". arXiv:1902.09666 [cs.CL].
- ^ "Threat reports". www.ncsc.gov.uk. Retrieved 20 January 2023.
- ^ "Category: APT reports | Securelist". securelist.com. Retrieved 23 January 2023.
- ^ "Your Cybersecurity News Connection - Cyber News | CyberWire". The CyberWire. Retrieved 23 January 2023.
- ^ "News". 21 August 2016. Retrieved 23 January 2023.
- ^ "Cybernews". Cybernews.
- ^ "BleepingComputer". BleepingComputer. Retrieved 23 January 2023.
- ^ "Homepage". The Record from Recorded Future News. Retrieved 23 January 2023.
- ^ "HackRead | Latest Cyber Crime - InfoSec- Tech - Hacking News". 8 January 2022. Retrieved 23 January 2023.
- ^ "Securelist | Kaspersky's threat research and reports". securelist.com. Retrieved 31 January 2023.
- ^ Harshaw, Christopher R.; Bridges, Robert A.; Iannacone, Michael D.; Reed, Joel W.; Goodall, John R. (5 April 2016). "GraphPrints". Proceedings of the 11th Annual Cyber and Information Security Research Conference. CISRC '16. New York, NY, USA: Association for Computing Machinery. pp. 1–4. doi:10.1145/2897795.2897806. ISBN 978-1-4503-3752-6.
- ^ "Farsight Security, cyber security intelligence solutions". Farsight Security. Retrieved 13 February 2023.
- ^ "Schneier on Security". www.schneier.com. Retrieved 13 February 2023.
- ^ "#1 in Cloud Security & Endpoint Cybersecurity". Trend Micro. Retrieved 13 February 2023.
- ^ "The Hacker News | #1 Trusted Cybersecurity News Site". The Hacker News. Retrieved 13 February 2023.
- ^ "Krebs on Security – In-depth security news and investigation". Retrieved 25 February 2023.
- ^ "MITRE D3FEND Knowledge Graph". d3fend.mitre.org. Retrieved 31 March 2023.
- ^ "MITRE | ATLAS™". atlas.mitre.org. Retrieved 31 March 2023.
- ^ "MITRE Engage™ | An Adversary Engagement Framework from MITRE". Retrieved 1 April 2023.
- ^ "Hacking Tutorials - The best Step-by-Step Hacking Tutorials". Hacking Tutorials. Retrieved 1 April 2023.
- ^ "TCFD Knowledge Hub". TCFD Knowledge Hub. Retrieved 3 February 2023.
- ^ "ResponsibilityReports.com". www.responsibilityreports.com. Retrieved 3 February 2023.
- ^ "About — IPCC". Retrieved 20 February 2023.
- ^ "Alliance for Research on Corporate Sustainability | ARCS serves as a vehicle for advancing rigorous academic research on corporate sustainability issues". corporate-sustainability.org. Retrieved 2 March 2023.
- ^ Mehra, Srishti; Louka, Robert; Zhang, Yixun (2022). "ESGBERT: Language Model to Help with Classification Tasks Related to Companies' Environmental, Social, and Governance Practices". Embedded Systems and Applications. pp. 183–190. doi:10.5121/csit.2022.120616. ISBN 978-1-925953-65-7.
- ^ This article incorporates text available under the CC BY 4.0 license.
- ^ Diggelmann, Thomas; Boyd-Graber, Jordan; Bulian, Jannis; Ciaramita, Massimiliano; Leippold, Markus (2 January 2021). "CLIMATE-FEVER: A Dataset for Verification of Real-World Climate Claims". arXiv:2012.00614 [cs.CL].
- ^ "climate-news-db". www.climate-news-db.com. Retrieved 3 February 2023.
- ^ "Climatext". www.sustainablefinance.uzh.ch. Retrieved 19 February 2023.
- ^ "Greenbiz". www.greenbiz.com. Retrieved 2 March 2023.
- ^ "Explore the @Reuters Hot List of 1,000 top climate scientists". Reuters. Retrieved 22 March 2023.
- ^ "Blogs | Alliance for Research on Corporate Sustainability". corporate-sustainability.org. Retrieved 27 March 2023.
- ^ "Greenbiz". www.greenbiz.com. Retrieved 29 March 2023.
- ^ "CSR News". www.csrwire.com. Retrieved 29 March 2023.
- ^ "CDP Homepage". www.cdp.net. Retrieved 29 March 2023.
- ^ de Vries, Harm (2022). "The Stack: 3 TB of permissively licensed source code". arXiv:2211.15533 [cs.CL].
- ^ "The Stack Dedup". Huggingface. Retrieved 29 August 2023.
- ^ "Hybrid cloud blog". content.cloud.redhat.com. Retrieved 9 April 2023.
- ^ "Production-Grade Container Orchestration". Kubernetes. Retrieved 9 April 2023.
- ^ "Home | Official Red Hat OpenShift Documentation". docs.openshift.com. Retrieved 9 April 2023.
- ^ "Cloud Native Computing Foundation". Cloud Native Computing Foundation. Retrieved 9 April 2023.
- ^ CNCF Community Presentations, Cloud Native Computing Foundation (CNCF), 11 April 2023, retrieved 11 April 2023
- ^ "Red Hat - We make open source technologies for the enterprise". www.redhat.com. Retrieved 1 May 2023.
- ^ Brown, Michael Scott; Pelosi, Michael J.; Dirska, Henry (2013). "Dynamic-Radius Species-Conserving Genetic Algorithm for the Financial Forecasting of Dow Jones Index Stocks". Machine Learning and Data Mining in Pattern Recognition. Lecture Notes in Computer Science. Vol. 7988. pp. 27–41. doi:10.1007/978-3-642-39712-7_3. ISBN 978-3-642-39711-0.
- ^ Shen, Kao-Yi; Tzeng, Gwo-Hshiung (2015). "Fuzzy Inference-Enhanced VC-DRSA Model for Technical Analysis: Investment Decision Aid". International Journal of Fuzzy Systems. 17 (3): 375–389. doi:10.1007/s40815-015-0058-8. S2CID 68241024.
- ^ Quinlan, J.R. (September 1987). "Simplifying decision trees". International Journal of Man-Machine Studies. 27 (3): 221–234. doi:10.1016/s0020-7373(87)80053-6.
- ^ Hamers, Bart; Suykens, Johan AK; De Moor, Bart (2003). "Coupled transductive ensemble learning of kernel models" (PDF). Journal of Machine Learning Research. 1: 1–48.
- ^ Shmueli, Galit; Russo, Ralph P.; Jank, Wolfgang (December 2007). "The BARISTA: A model for bid arrivals in online auctions". The Annals of Applied Statistics. 1 (2). doi:10.1214/07-AOAS117.
- ^ Peng, Jie; Müller, Hans-Georg (September 2008). "Distance-based clustering of sparsely observed stochastic processes, with applications to online auctions". The Annals of Applied Statistics. 2 (3). doi:10.1214/08-AOAS172.
- ^ Eggermont, Jeroen; Kok, Joost N.; Kosters, Walter A. (2004). "Genetic Programming for data classification: Partitioning the search space". Proceedings of the 2004 ACM symposium on Applied computing. pp. 1001–1005. doi:10.1145/967900.968104. ISBN 978-1-58113-812-2.
- ^ Moro, Sérgio; Cortez, Paulo; Rita, Paulo (2014). "A data-driven approach to predict the success of bank telemarketing". Decision Support Systems. 62: 22–31. doi:10.1016/j.dss.2014.03.001. hdl:10071/9499. S2CID 14181100.
- ^ Payne, Richard D.; Mallick, Bani K. (2014). "Bayesian Big Data Classification: A Review with Complements". arXiv:1411.5653 [stat.ME].
- ^ Akbilgic, Oguz; Bozdogan, Hamparsum; Balaban, M. Erdal (2014). "A novel Hybrid RBF Neural Networks model as a forecaster". Statistics and Computing. 24 (3): 365–375. doi:10.1007/s11222-013-9375-7. S2CID 17764829.
- ^ Jabin, Suraiya (20 August 2014). "Stock Market Prediction using Feed-forward Artificial Neural Network". International Journal of Computer Applications. 99 (9): 4–8. Bibcode:2014IJCA...99i...4J. doi:10.5120/17399-7959.
- ^ Yeh, I-Cheng; Che-hui, Lien (2009). "The comparisons of data mining techniques for the predictive accuracy of probability of default of credit card clients". Expert Systems with Applications. 36 (2): 2473–2480. doi:10.1016/j.eswa.2007.12.020. S2CID 15696161.
- ^ Lin, Shu Ling (2009). "A new two-stage hybrid approach of credit risk in banking industry". Expert Systems with Applications. 36 (4): 8333–8341. doi:10.1016/j.eswa.2008.10.015.
- ^ Xu, Yumo; Cohen, Shay B. (2018). "Stock Movement Prediction from Tweets and Historical Prices". Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). pp. 1970–1979. doi:10.18653/v1/P18-1183.
- ^ Pelckmans, Kristiaan; et al. (2005). "The differogram: Non-parametric noise variance estimation and its use for model selection". Neurocomputing. 69 (1): 100–122. doi:10.1016/j.neucom.2005.02.015.
- ^ Bay, Stephen D.; Kibler, Dennis; Pazzani, Michael J.; Smyth, Padhraic (December 2000). "The UCI KDD archive of large data sets for data mining research and experimentation". ACM SIGKDD Explorations Newsletter. 2 (2): 81–85. doi:10.1145/380995.381030.
- ^ Lucas, D. D.; et al. (2015). "Designing optimal greenhouse gas observing networks that consider performance and cost". Geoscientific Instrumentation, Methods and Data Systems. 4 (1): 121. Bibcode:2015GI......4..121L. doi:10.5194/gi-4-121-2015.
- ^ Pales, Jack C.; Keeling, Charles D. (1965). "The concentration of atmospheric carbon dioxide in Hawaii". Journal of Geophysical Research. 70 (24): 6053–6076. Bibcode:1965JGR....70.6053P. doi:10.1029/jz070i024p06053.
- ^ Sigillito, Vincent G., et al. "Classification of radar returns from the ionosphere using neural networks." Johns Hopkins APL Technical Digest10.3 (1989): 262–266.
- ^ Zhang, Kun; Fan, Wei (March 2008). "Forecasting skewed biased stochastic ozone days: analyses, solutions and beyond". Knowledge and Information Systems. 14 (3): 299–326. doi:10.1007/s10115-007-0095-1.
- ^ Reich, Brian J.; Fuentes, Montserrat; Dunson, David B. (March 2011). "Bayesian Spatial Quantile Regression". Journal of the American Statistical Association. 106 (493): 6–20. doi:10.1198/jasa.2010.ap09237. PMC 3583387. PMID 23459794.
- ^ Kohavi, Ron (1996). "Scaling Up the Accuracy of Naive-Bayes Classifiers: A Decision-Tree Hybrid". KDD. 96.
- ^ Oza, Nikunj C., and Stuart Russell. "Experimental comparisons of online and batch versions of bagging and boosting." Proceedings of the seventh ACM SIGKDD international conference on Knowledge discovery and data mining. ACM, 2001.
- ^ Bay, Stephen D. (November 2001). "Multivariate Discretization for Set Mining". Knowledge and Information Systems. 3 (4): 491–512. doi:10.1007/pl00011680.
- ^ Ruggles, Steven (1995). "Sample designs and sampling errors". Historical Methods. 28 (1): 40–46. doi:10.1080/01615440.1995.9955312.
- ^ Meek, Christopher, Bo Thiesson, and David Heckerman. "The Learning Curve Method Applied to Clustering." AISTATS. 2001.
- ^ Fanaee-T, Hadi; Gama, Joao (2013). "Event labeling combining ensemble detectors and background knowledge". Progress in Artificial Intelligence. 2 (2–3): 113–127. doi:10.1007/s13748-013-0040-3. S2CID 3345087.
- ^ Giot, Romain; Cherrier, Raphael (2014). "Predicting bikeshare system usage up to one day ahead". 2014 IEEE Symposium on Computational Intelligence in Vehicles and Transportation Systems (CIVTS) (PDF). pp. 22–29. doi:10.1109/CIVTS.2014.7009473. ISBN 978-1-4799-4497-2.
- ^ Zhan, Xianyuan; et al. (2013). "Urban link travel time estimation using large-scale taxi data with partial information". Transportation Research Part C: Emerging Technologies. 33: 37–49. Bibcode:2013TRPC...33...37Z. doi:10.1016/j.trc.2013.04.001.
- ^ Moreira-Matias, Luis; et al. (2013). "Predicting taxi–passenger demand using streaming data". IEEE Transactions on Intelligent Transportation Systems. 14 (3): 1393–1402. doi:10.1109/tits.2013.2262376. S2CID 14764358.
- ^ Hwang, Ren-Hung; Hsueh, Yu-Ling; Chen, Yu-Ting (2015). "An effective taxi recommender system based on a spatio-temporal factor analysis model". Information Sciences. 314: 28–40. doi:10.1016/j.ins.2015.03.068.
- ^ H. V. Jagadish, Johannes Gehrke, Alexandros Labrinidis, Yannis Papakonstantinou, Jignesh M. Patel, Raghu Ramakrishnan, and Cyrus Shahabi. Big data and its technical challenges. Commun. ACM, 57(7):86–94, July 2014.
- ^ Caltrans PeMS
- ^ Meusel, Robert, et al. "The Graph Structure in the Web—Analyzed on Different Aggregation Levels."The Journal of Web Science 1.1 (2015).
- ^ Kushmerick, Nicholas (1999). "Learning to remove Internet advertisements". Proceedings of the third annual conference on Autonomous Agents. pp. 175–181. doi:10.1145/301136.301186. ISBN 978-1-58113-066-9.
- ^ Fradkin, Dmitriy; Madigan, David (2003). "Experiments with random projections for machine learning". Proceedings of the ninth ACM SIGKDD international conference on Knowledge discovery and data mining. pp. 517–522. doi:10.1145/956750.956812. ISBN 978-1-58113-737-8.
- ^ This data was used in the American Statistical Association Statistical Graphics and Computing Sections 1999 Data Exposition.
- ^ Ma, Justin; Saul, Lawrence K.; Savage, Stefan; Voelker, Geoffrey M. (2009). "Identifying suspicious URLs: An application of large-scale online learning". Proceedings of the 26th Annual International Conference on Machine Learning. pp. 681–688. doi:10.1145/1553374.1553462. ISBN 978-1-60558-516-1.
- ^ Levchenko, K.; Pitsillidis, A.; Chachra, N.; Enright, B.; Felegyhazi, M.; Grier, C.; Halvorson, T.; Kanich, C.; Kreibich, C.; He Liu; McCoy, D.; Weaver, N.; Paxson, V.; Voelker, G. M.; Savage, S. (2011). "Click Trajectories: End-to-End Analysis of the Spam Value Chain". 2011 IEEE Symposium on Security and Privacy. pp. 431–446. doi:10.1109/SP.2011.24. ISBN 978-0-7695-4402-1.
- ^ Mohammad, Rami M., Fadi Thabtah, and Lee McCluskey. "An assessment of features related to phishing websites using an automated technique."Internet Technology And Secured Transactions, 2012 International Conference for. IEEE, 2012.
- ^ Singh, Ashishkumar; Rumantir, Grace; South, Annie; Bethwaite, Blair (2014). "Clustering Experiments on Big Transaction Data for Market Segmentation". Proceedings of the 2014 International Conference on Big Data Science and Computing. pp. 1–7. doi:10.1145/2640087.2644161. ISBN 978-1-4503-2891-3.
- ^ Bollacker, Kurt; Evans, Colin; Paritosh, Praveen; Sturge, Tim; Taylor, Jamie (2008). "Freebase: A collaboratively created graph database for structuring human knowledge". Proceedings of the 2008 ACM SIGMOD international conference on Management of data. pp. 1247–1250. doi:10.1145/1376616.1376746. ISBN 978-1-60558-102-6.
- ^ Mintz, Mike, et al. "Distant supervision for relation extraction without labeled data." Proceedings of the Joint Conference of the 47th Annual Meeting of the ACL and the 4th International Joint Conference on Natural Language Processing of the AFNLP: Volume 2-Volume 2. Association for Computational Linguistics, 2009.
- ^ Mesterharm, Chris; Pazzani, Michael J. (2011). "Active learning using on-line algorithms". Proceedings of the 17th ACM SIGKDD international conference on Knowledge discovery and data mining. pp. 850–858. doi:10.1145/2020408.2020553. ISBN 978-1-4503-0813-7.
- ^ Wang, Shusen; Zhang, Zhihua (2013). "Improving CUR matrix decomposition and the Nyström approximation via adaptive sampling" (PDF). The Journal of Machine Learning Research. 14 (1): 2729–2769. arXiv:1303.4207. Bibcode:2013arXiv1303.4207W.
- ^ a b "The Pile". pile.eleuther.ai. Retrieved 14 April 2022.
- ^ "JSON Lines". jsonlines.org. Retrieved 14 April 2022.
- ^ Gao, Leo; Biderman, Stella; Black, Sid; Golding, Laurence; Hoppe, Travis; Foster, Charles; Phang, Jason; He, Horace; Thite, Anish; Nabeshima, Noa; Presser, Shawn (31 December 2020). "The Pile: An 800GB Dataset of Diverse Text for Language Modeling". arXiv:2101.00027 [cs.CL].
- ^ "OSCAR". oscar-project.org. Retrieved 12 August 2023.
- ^ Ortiz Suarez, Pedro, et al. "[2]." Asynchronous Pipeline for Processing Huge Corpora on Medium to Low Resource Infrastructures. CMLC-7, 2019.
- ^ Abadji, Julien, et al. "[3]." Towards a Cleaner Document-Oriented Multilingual Crawled Corpus. LREC, 2022.
- ^ Cohen, Vanya. "OpenWebTextCorpus". OpenWebTextCorpus. Retrieved 9 January 2023.
- ^ "openwebtext · Datasets at Hugging Face". huggingface.co. 16 November 2022. Retrieved 9 January 2023.
- ^ Saulnier, Lucile (2023). "The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset". arXiv:2303.03915 [cs.CL].
- ^ "BigScience Data · Datasets at Hugging Face". huggingface.co. 29 August 2023. Retrieved 29 August 2023.
- ^ Cattral, Robert; Oppacher, Franz; Deugo, Dwight (2002). "Evolutionary data mining with automatic rule generalization". Recent Advances in Computers, Computing and Communications: 296–300. S2CID 18625415.
- ^ Burton, Ariel N.; Kelly, Paul H.J. (August 2006). "Performance prediction of paging workloads using lightweight tracing". Future Generation Computer Systems. 22 (7): 784–793. doi:10.1016/j.future.2006.02.003.
- ^ Bain, M.; Muggleton, S. (1994). "Learning Optimal Chess Strategies". Machine Intelligence 13. pp. 291–309. doi:10.1093/oso/9780198538509.003.0012. ISBN 978-0-19-853850-9.
- ^ Quinlan, J. Ross (1983). "Learning Efficient Classification Procedures and Their Application to Chess End Games". Machine Learning. pp. 463–482. doi:10.1007/978-3-662-12405-5_15. ISBN 978-3-662-12407-9.
- ^ Shapiro, Alen D. (1987). Structured induction in expert systems. Addison-Wesley Longman Publishing Co., Inc.
- ^ Matheus, Christopher J.; Rendell, Larry A. (1989). "Constructive Induction on Decision Trees" (PDF). IJCAI. 89. S2CID 11018089.
- ^ Belsley, David A., Edwin Kuh, and Roy E. Welsch. Regression diagnostics: Identifying influential data and sources of collinearity. Vol. 571. John Wiley & Sons, 2005.
- ^ Ruotsalo, Tuukka; Aroyo, Lora; Schreiber, Guus (2009). "Knowledge-based linguistic annotation of digital cultural heritage collections" (PDF). IEEE Intelligent Systems. 24 (2): 64–75. doi:10.1109/MIS.2009.32. hdl:1871.1/9f6091aa-9596-46a9-9251-f11edeeb28b7. S2CID 6667472. Archived from the original (PDF) on 16 August 2017. Retrieved 6 December 2018.
- ^ Li, Lihong; Chu, Wei; Langford, John; Wang, Xuanhui (2011). "Unbiased offline evaluation of contextual-bandit-based news article recommendation algorithms". Proceedings of the fourth ACM international conference on Web search and data mining. pp. 297–306. arXiv:1003.5956. doi:10.1145/1935826.1935878. ISBN 978-1-4503-0493-1.
- ^ Yeung, Kam Fung; Yang, Yanyan (2010). "A Proactive Personalized Mobile News Recommendation System". 2010 Developments in E-systems Engineering. pp. 207–212. doi:10.1109/DeSE.2010.40. ISBN 978-1-4244-8044-9.
- ^ Gass, Susan E.; Roberts, J. Murray (2006). "The occurrence of the cold-water coral Lophelia pertusa (Scleractinia) on oil and gas platforms in the North Sea: colony growth, recruitment and environmental controls on distribution". Marine Pollution Bulletin. 52 (5): 549–559. Bibcode:2006MarPB..52..549G. doi:10.1016/j.marpolbul.2005.10.002. PMID 16300800.
- ^ Gionis, Aristides; Mannila, Heikki; Tsaparas, Panayiotis (March 2007). "Clustering aggregation". ACM Transactions on Knowledge Discovery from Data. 1 (1): 4. doi:10.1145/1217299.1217303.
- ^ Obradovic, Zoran, and Slobodan Vucetic.Challenges in Scientific Data Mining: Heterogeneous, Biased, and Large Samples. Technical Report, Center for Information Science and Technology Temple University, 2004.
- ^ Van Der Putten, Peter; van Someren, Maarten (2000). "CoIL challenge 2000: The insurance company case". Published by Sentient Machine Research, Amsterdam. Also a Leiden Institute of Advanced Computer Science Technical Report. 9: 1–43.
- ^ Mao, K. Z. (2002). "RBF neural network center selection based on Fisher ratio class separability measure". IEEE Transactions on Neural Networks. 13 (5): 1211–1217. doi:10.1109/tnn.2002.1031953. PMID 18244518.
- ^ Olave, Manuel; Rajkovic, Vladislav; Bohanec, Marko (1989). "An application for admission in public school systems" (PDF). Expert Systems in Public Administration. 1: 145–160.
- ^ Lizotte, Daniel J.; Madani, Omid; Greiner, Russell (2012). "Budgeted Learning of Naive-Bayes Classifiers". arXiv:1212.2472 [cs.LG].
- ^ Lebowitz, Michael (1984). Concept Learning in a Rich Input Domain: Generalization-Based Memory (Report). doi:10.7916/D8KP8990.
- ^ Yeh, I-Cheng; Yang, King-Jang; Ting, Tao-Ming (2009). "Knowledge discovery on RFM model using Bernoulli sequence". Expert Systems with Applications. 36 (3): 5866–5871. doi:10.1016/j.eswa.2008.07.018.
- ^ Lee, Wen-Chen; Cheng, Bor-Wen (2011). "An intelligent system for improving performance of blood donation". Journal of Quality Vol. 18 (2): 173.
- ^ Schmidtmann, Irene, et al. "Evaluation des Krebsregisters NRW Schwerpunkt Record Linkage Archived 6 December 2018 at the Wayback Machine." Abschlußbericht vom 11 (2009).
- ^ Sariyar, Murat; Borg, Andreas; Pommerening, Klaus (2011). "Controlling false match rates in record linkage using extreme value theory". Journal of Biomedical Informatics. 44 (4): 648–654. doi:10.1016/j.jbi.2011.02.008. PMID 21352952.
- ^ Candillier, Laurent; Lemaire, Vincent (August 2013). "Active learning in the real-world design and analysis of the Nomao challenge". The 2013 International Joint Conference on Neural Networks (IJCNN). Vol. 8. pp. 1–8. doi:10.1109/IJCNN.2013.6706908. ISBN 978-1-4673-6129-3.
- ^ Garrido Marquez, Ivan (2013). A domain adaptation method for text classification based on self-adjusted training approach (Thesis).[page needed]
- ^ Nagesh, Harsha S., Sanjay Goil, and Alok N. Choudhary. "Adaptive Grids for Clustering Massive Data Sets." SDM. 2001.
- ^ كوزيليك، جاكوب، وآخرون. "تحليل الجامعة المفتوحة: تحليل الطلاب المعرضين للخطر في الجامعة المفتوحة". مراجعة تحليلات التعلم (2015): 1-16.
- ^ سيمنز، جورج، وآخرون. تحليلات التعلم المفتوح: منصة متكاملة ومقسمة إلى وحدات . مطبعة الجامعة المفتوحة، 2011.
- ^ بارلاتشي، جياني؛ دي ناداي، ماركو؛ لارشر، روبرتو؛ كاسيلا، أنطونيو؛ شيتيك، كريستيانا؛ توريسي، جيوفاني؛ أنتونيلي، فابريزيو؛ فيسبينياني، أليساندرو؛ بنتلاند، أليكس؛ ليبري ، برونو (27 أكتوبر 2015). “مجموعة بيانات متعددة المصادر للحياة الحضرية في مدينة ميلانو ومقاطعة ترينتينو”. بيانات علمية . 2 (1). بيب كود :2015NatSD...250055B. دوى :10.1038/sdata.2015.55. بمك 4622222 . بميد 26528394.
- ^ Vanschoren J، van Rijn JN، Bischl B، Torgo L (2013). “OpenML: العلوم الشبكية في التعلم الآلي”. استكشافات SIGKDD . 15 (2): 49-60. أرخايف : 1407.7722 . دوى :10.1145/2641190.2641198. S2CID 4977460.
- ^ Olson RS, La Cava W, Orzechowski P, Urbanowicz RJ, Moore JH (2017). "PMLB: مجموعة معايير كبيرة لتقييم ومقارنة التعلم الآلي". BioData Mining . 10 (1): 36. arXiv : 1703.00512 . Bibcode : 2017arXiv170300512O. doi : 10.1186/s13040-017-0154-4 . PMC 5725843. PMID 29238404 .
- ^ "مجموعات البيانات الجاهزة". appen.com . Appen . تم الاسترجاع في 30 ديسمبر 2020 .
- ^ “مجموعات البيانات مفتوحة المصدر”. appen.com . أبين . تم الاسترجاع في 30 ديسمبر 2020 .
