إلكي

ELKI ( بيئة لتطوير تطبيقات KDD المدعومة بهياكل الفهرسة ) هو إطار برمجي لاستخراج البيانات (KDD، اكتشاف المعرفة في قواعد البيانات) تم تطويره للاستخدام في البحث والتدريس. تم إنشاؤه في الأصل من قبل وحدة أبحاث أنظمة قواعد البيانات في جامعة لودفيغ ماكسيميليان في ميونخ ، ألمانيا، بقيادة البروفيسور هانز بيتر كريجل . استمر المشروع في جامعة دورتموند التقنية ، ألمانيا. ويهدف إلى تمكين تطوير وتقييم خوارزميات استخراج البيانات المتقدمة وتفاعلها مع هياكل فهرسة قواعد البيانات .

وصف

إطار عمل ELKI مكتوب بلغة جافا ومبني على بنية معيارية. تُنفذ معظم الخوارزميات المُضمنة حاليًا عمليات التجميع ، واكتشاف القيم الشاذة ، [ 1 ] وفهرسة قواعد البيانات . تسمح البنية الموجهة للكائنات بدمج خوارزميات وأنواع بيانات ودوال مسافة وفهارس ومقاييس تقييم متنوعة. يُحسّن مُترجم جافا الفوري جميع التركيبات بدرجة مماثلة، مما يجعل نتائج قياس الأداء أكثر قابلية للمقارنة إذا كانت تشترك في أجزاء كبيرة من الكود. عند تطوير خوارزميات أو هياكل فهرسة جديدة، يُمكن إعادة استخدام المكونات الموجودة بسهولة، كما أن أمان أنواع جافا يكشف العديد من أخطاء البرمجة في وقت الترجمة.

ELKI أداة مجانية لتحليل البيانات، تركز بشكل أساسي على اكتشاف الأنماط ونقاط البيانات غير المألوفة دون الحاجة إلى تصنيفات. كُتبت بلغة جافا، وتهدف إلى أن تكون سريعة وقادرة على التعامل مع مجموعات البيانات الضخمة باستخدام هياكل خاصة. صُممت هذه الأداة للباحثين والطلاب لإضافة أساليبهم الخاصة ومقارنة الخوارزميات المختلفة بسهولة. [ 2 ]

استُخدمت خوارزمية ELKI في علم البيانات لتجميع مقاطع صوتية لحيتان العنبر ، [ 3 ] ولتجميع الصوتيات ، [ 4 ] وللكشف عن الحالات الشاذة في عمليات رحلات الفضاء ، [ 5 ] ولإعادة توزيع مشاركة الدراجات ، [ 6 ] وللتنبؤ بحركة المرور. [ 7 ]

أهداف

The university project is developed for use in teaching and research. The source code is written with extensibility and reusability in mind, but is also optimized for performance. The experimental evaluation of algorithms depends on many environmental factors and implementation details can have a large impact on the runtime.[8] ELKI aims at providing a shared codebase with comparable implementations of many algorithms.

As research project, it currently does not offer integration with business intelligence applications or an interface to common database management systems via SQL. The copyleft (AGPL) license may also be a hindrance to an integration in commercial products; nevertheless it can be used to evaluate algorithms prior to developing an own implementation for a commercial product. Furthermore, the application of the algorithms requires knowledge about their usage, parameters, and study of original literature. The audience is students, researchers, data scientists, and software engineers.

Architecture

ELKI is modeled around a database-inspired core, which uses a vertical data layout that stores data in column groups (similar to column families in NoSQL databases). This database core provides nearest neighbor search, range/radius search, and distance query functionality with index acceleration for a wide range of dissimilarity measures. Algorithms based on such queries (e.g. k-nearest-neighbor algorithm, local outlier factor and DBSCAN) can be implemented easily and benefit from the index acceleration. The database core also provides fast and memory efficient collections for object collections and associative structures such as nearest neighbor lists.

ELKI makes extensive use of Java interfaces, so that it can be extended easily in many places. For example, custom data types, distance functions, index structures, algorithms, input parsers, and output modules can be added and combined without modifying the existing code. This includes the possibility of defining a custom distance function and using existing indexes for acceleration.

ELKI uses a service loader architecture to allow publishing extensions as separate jar files.

ELKI uses optimized collections for performance rather than the standard Java API.[9]For loops for example are written similar to C++ iterators:

for ( DBIDIter iter = ids.iter ( ); iter.valid ( ); iter.advance ( )) { relation.get ( iter ); // مثال : الحصول على الكائن المشار إليه idcollection.add ( iter ) ; // مثال: إضافة المرجع إلى مجموعة DBID }

على عكس مُكرِّرات جافا التقليدية (التي تقتصر على التكرار على الكائنات)، يُوفِّر هذا الأسلوب الذاكرة، إذ يُمكن للمُكرِّر استخدام القيم الأولية داخليًا لتخزين البيانات. ويُحسِّن تقليل عملية جمع البيانات المهملة وقت التشغيل. وتستخدم مكتبات المجموعات المُحسَّنة، مثل GNU Trove3 و Kolobooke ، fastutilتحسينات مماثلة. كما تتضمن ELKI هياكل بيانات مثل مجموعات الكائنات والأكوام (لأغراض مثل البحث عن أقرب جار ) باستخدام هذه التحسينات.

التصور

تستخدم وحدة العرض المرئي SVG لإنتاج رسومات قابلة للتوسيع، و Apache Batik لعرض واجهة المستخدم، بالإضافة إلى تصديرها بجودة عالية إلى PostScript و PDF ليسهل إدراجها في المنشورات العلمية المكتوبة بلغة LaTeX . يمكن تعديل الملفات المصدرة باستخدام برامج تحرير SVG مثل Inkscape . وبفضل استخدام أوراق الأنماط المتتالية ، يُمكن إعادة تصميم الرسومات بسهولة. مع ذلك، يُعدّ Batik بطيئًا نسبيًا ويستهلك الكثير من الذاكرة، لذا فإنّ العروض المرئية ليست قابلة للتوسيع بشكل كبير مع مجموعات البيانات الضخمة (في مجموعات البيانات الكبيرة، يتم عرض عينة فرعية فقط من البيانات افتراضيًا).

الجوائز

الإصدار 0.4، الذي تم تقديمه في "ندوة قواعد البيانات المكانية والزمانية" 2011، والذي تضمن طرقًا مختلفة للكشف عن القيم الشاذة المكانية، [ 10 ] فاز بجائزة "أفضل ورقة عرض" في المؤتمر.

الخوارزميات المضمنة

اختر الخوارزميات المضمنة: [ 11 ]

سجل الإصدارات

احتوى الإصدار 0.1 (يوليو 2008) على العديد من الخوارزميات من تحليل التجميع واكتشاف الشذوذ ، بالإضافة إلى بعض هياكل الفهرسة مثل شجرة R* . ركز الإصدار الأول على خوارزميات تجميع الفضاءات الفرعية وتجميع الارتباط . [ 12 ]

أضاف الإصدار 0.2 (يوليو 2009) وظائف لتحليل السلاسل الزمنية ، وخاصة وظائف المسافة للسلاسل الزمنية. [ 13 ]

قام الإصدار 0.3 (مارس 2010) بتوسيع نطاق خيارات خوارزميات الكشف عن الشذوذ ووحدات التصور. [ 14 ]

أضاف الإصدار 0.4 (سبتمبر 2011) خوارزميات لاستخراج البيانات الجغرافية ودعمًا لقواعد البيانات متعددة العلاقات وهياكل الفهرسة. [ 10 ]

يركز الإصدار 0.5 (أبريل 2012) على تقييم نتائج تحليل التجميع ، ويضيف تصورات جديدة وبعض الخوارزميات الجديدة. [ 15 ]

يقدم الإصدار 0.6 (يونيو 2013) تعديلاً ثلاثي الأبعاد جديداً للإحداثيات المتوازية لتصور البيانات، بالإضافة إلى الإضافات المعتادة من الخوارزميات وهياكل الفهرسة. [ 16 ]

يُضيف الإصدار 0.7 (أغسطس 2015) دعمًا لأنواع البيانات غير المؤكدة، وخوارزميات لتحليل البيانات غير المؤكدة. [ 17 ]

يضيف الإصدار 0.7.5 (فبراير 2019) خوارزميات تجميع إضافية، وخوارزميات كشف الشذوذ، ومقاييس تقييم، وهياكل فهرسة. [ 18 ]

يضيف الإصدار 0.8 (أكتوبر 2022) إنشاء الفهرس التلقائي، وجمع البيانات المهملة، والبحث التدريجي ذي الأولوية، بالإضافة إلى العديد من الخوارزميات الأخرى مثل BIRCH . [ 19 ]

تطبيقات مماثلة

انظر أيضاً

مراجع

  1. هانز-بيتر كريجل ، بير كروجر، آرثر زيمك (2009). "تقنيات الكشف عن القيم الشاذة (دليل تعليمي)" (ملف PDF) . المؤتمر الثالث عشر لمنطقة آسيا والمحيط الهادئ حول اكتشاف المعرفة واستخراج البيانات (PAKDD 2009) . بانكوك، تايلاند . تاريخ الاسترجاع: 26 مارس 2010 .{{cite journal}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  2. "إطار عمل ELKI لاستخراج البيانات" . elki-project.github.io . تم ​​الاطلاع عليه بتاريخ 30-05-2024 .
  3. جيرو، شين؛ وايتهيد، هال؛ ريندل، لوك (2016). "إشارات الهوية على مستوى الفرد والوحدة والعشيرة الصوتية في نداءات حيتان العنبر" . مجلة الجمعية الملكية للعلوم المفتوحة . 3 (1) 150372. رمز Bibcode : 2016RSOS....350372G . doi : 10.1098/rsos.150372 . ISSN 2054-5703 . PMC 4736920. PMID 26909165 .   
  4. ستالبرغ، فيليكس؛ شليبي، تيم؛ فوغل، ستيفان؛ شولتز، تانيا (2013). "استخراج النطق من تسلسلات الصوتيات من خلال محاذاة الكلمات مع الصوتيات عبر اللغات". معالجة اللغة والكلام الإحصائية . سلسلة محاضرات في علوم الحاسوب. المجلد 7978. الصفحات 260-272 . doi : 10.1007/978-3-642-39593-2_23 . ISBN   978-3-642-39592-5ISSN 0302-9743 
  5. فيرزولا، إيفانو؛ دوناتي، أليساندرو؛ مارتينيز، خوسيه؛ شوبرت، ماتياس؛ سومودي، لازلو (2016). "مشروع سيبيل: نظام للكشف عن المستجدات في عمليات رحلات الفضاء البشرية". مؤتمر عمليات الفضاء 2016. doi : 10.2514 / 6.2016-2405 . ISBN 978-1-62410-426-8.
  6. أدهم، منال ت.؛ بنتلي، بيتر ج. (2016). "تقييم أساليب التجميع ضمن خوارزمية النظام البيئي الاصطناعي وتطبيقها على إعادة توزيع الدراجات في لندن". أنظمة حيوية . 146 : 43-59 . Bibcode : 2016BiSys.146...43A . doi : 10.1016/j.biosystems.2016.04.008 . ISSN 0303-2647 . PMID 27178785 .  
  7. وايزلي، مايكل؛ هورسون، علي؛ سارفستاني، سهرا صديق (2015). "إطار محاكاة قابل للتوسيع لتقييم خوارزميات التنبؤ المروري المركزية". المؤتمر الدولي للمركبات المتصلة والمعرض (ICCVE) لعام 2015. الصفحات 391-396 . doi : 10.1109/ICCVE.2015.86 . ISBN  978-1-5090-0264-1. S2CID 1297145 . 
  8. كريغل، هانز-بيتر ؛ شوبرت، إريك؛ زيمك، آرثر (2016). "فن (الأسود) لتقييم وقت التشغيل: هل نقارن الخوارزميات أم التطبيقات؟". نظم المعرفة والمعلومات . 52 (2): 341-378 . doi : 10.1007/s10115-016-1004-2 . ISSN 0219-1377 . S2CID 40772241 .  
  9. "DBIDs" . الصفحة الرئيسية لـ ELKI . تم الاطلاع عليه بتاريخ 13 ديسمبر 2016 .
  10. إلكي أختيرت ، أحمد هيتاب، هانز-بيتر كريغل ، إريك شوبرت، آرثر زيمك (2011). الكشف عن القيم الشاذة المكانية: البيانات، الخوارزميات، التصورات . المؤتمر الدولي الثاني عشر لقواعد البيانات المكانية والزمانية (SSTD 2011). مينيابوليس، مينيسوتا: سبرينغر. doi : 10.1007/978-3-642-22922-0_41 .{{cite conference}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  11. مقتطف من "خوارزميات استخراج البيانات في ELKI" . تم الاطلاع عليه بتاريخ 17 أكتوبر 2019 .
  12. إلكي أختيرت، هانز-بيتر كريغل ، آرثر زيمك (2008). ELKI: نظام برمجي لتقييم خوارزميات تجميع الفضاءات الفرعية (ملف PDF) . وقائع المؤتمر الدولي العشرين لإدارة قواعد البيانات العلمية والإحصائية (SSDBM 08). هونغ كونغ، الصين: سبرينغر. doi : 10.1007/978-3-540-69497-7_41 .{{cite conference}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  13. إلكي أختيرت، توماس بيرنيكر، هانز-بيتر كريغل ، إريك شوبرت، آرثر زيمك (2009). ELKI في الزمن: ELKI 0.2 لتقييم أداء مقاييس المسافة للسلاسل الزمنية (ملف PDF) . وقائع الندوة الدولية الحادية عشرة حول التطورات في قواعد البيانات المكانية والزمانية (SSTD 2010). آلبورغ، الدنمارك: سبرينغر. doi : 10.1007/978-3-642-02982-0_35 .{{cite conference}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  14. إلكي أختيرت، هانز-بيتر كريغل ، ليزا رايشرت، إريك شوبرت، ريميجيوس ووجدانوفسكي، آرثر زيمك (2010). التقييم البصري لنماذج الكشف عن القيم الشاذة . المؤتمر الدولي الخامس عشر لأنظمة قواعد البيانات للتطبيقات المتقدمة (DASFAA 2010). تسوكوبا، اليابان: سبرينغر. doi : 10.1007/978-3-642-12098-5_34 .{{cite conference}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  15. إلكي أختيرت، ساشا غولد هوفر، هانز بيتر كريغل ، إريك شوبرت، آرثر زيمك (2012). تقييم مقاييس التجميع والدعم البصري . المؤتمر الدولي الثامن والعشرون لهندسة البيانات (ICDE). واشنطن العاصمة. doi : 10.1109/ICDE.2012.128 .{{cite conference}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  16. إلكي أختيرت، هانز-بيتر كريغل ، إريك شوبرت، آرثر زيمك (2013). التنقيب التفاعلي عن البيانات باستخدام أشجار الإحداثيات المتوازية ثلاثية الأبعاد . وقائع المؤتمر الدولي لإدارة البيانات ( SIGMOD ) التابع لجمعية الحوسبة الآلية. مدينة نيويورك، نيويورك. doi : 10.1145/2463676.2463696 .{{cite conference}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  17. إريك شوبرت؛ ألكسندر كوس؛ توبياس إمريش؛ أندرياس زوفله؛ كلاوس آرثر شميد؛ آرثر زيمك (2015). "إطار عمل لتجميع البيانات غير المؤكدة" (ملف PDF) . وقائع مؤسسة VLDB . 8 (12): 1976-1987 . doi : 10.14778/2824032.2824115 .
  18. شوبرت، إريك؛ زيمك، آرثر (10 فبراير 2019). "ELKI: مكتبة كبيرة مفتوحة المصدر لتحليل البيانات - إصدار ELKI 0.7.5 "هايدلبرغ"". أرخايف : 1902.03616 [ cs.LG ].
  19. شوبرت، إريك (2022). الفهرسة التلقائية للبحث عن التشابه في ELKI . البحث عن التشابه وتطبيقاته. ص 205-213 . doi : 10.1007/978-3-031-17849-8_16 .