أباتشي هادوب
أباتشي هادوب ( تُلفظ / həˈduːp / ) هي مجموعة من أدوات البرمجيات مفتوحة المصدر للحوسبة الموزعة الموثوقة والقابلة للتوسع . توفر إطار عمل برمجيًا لتخزين ومعالجة البيانات الضخمة بشكل موزع باستخدام نموذج برمجة MapReduce . صُممت هادوب في الأصل لمجموعات الحواسيب المبنية على أجهزة قياسية ، وهو الاستخدام الشائع حتى الآن. [ 3 ] ومنذ ذلك الحين، شاع استخدامها أيضًا في مجموعات الحواسيب ذات الأجهزة المتطورة. [ 4 ] [ 5 ] جميع وحدات هادوب مصممة بافتراض أساسي مفاده أن أعطال الأجهزة شائعة الحدوث، ويجب أن يتعامل معها إطار العمل تلقائيًا. [ 6 ]
ملخص
يتألف جوهر أباتشي هادوب من جزء تخزين يُعرف باسم نظام ملفات هادوب الموزع (HDFS)، وجزء معالجة يعتمد على نموذج برمجة MapReduce. يقوم هادوب بتقسيم الملفات إلى كتل كبيرة وتوزيعها على عُقد في مجموعة حاسوبية. ثم ينقل التعليمات البرمجية المُجمّعة إلى العُقد لمعالجة البيانات بالتوازي. يستفيد هذا النهج من خاصية تجاور البيانات [ 7 ] ، حيث تُعالج العُقد البيانات التي لديها إمكانية الوصول إليها. وهذا يسمح بمعالجة مجموعة البيانات بشكل أسرع وأكثر كفاءة مما لو كانت في بنية حاسوب عملاق تقليدية تعتمد على نظام ملفات متوازٍ حيث يتم توزيع العمليات الحسابية والبيانات عبر شبكات عالية السرعة. [ 8 ] [ 9 ]
يتكون إطار عمل Apache Hadoop الأساسي من الوحدات التالية:
- Hadoop Common - يحتوي على المكتبات والأدوات المساعدة التي تحتاجها وحدات Hadoop الأخرى؛
- نظام ملفات هادوب الموزع (HDFS) - نظام ملفات موزع يقوم بتخزين البيانات على أجهزة عادية، مما يوفر نطاق ترددي إجمالي عالي جدًا عبر المجموعة؛
- هادوب يارن - (تم تقديمه في عام 2012) هو منصة مسؤولة عن إدارة موارد الحوسبة في مجموعات واستخدامها لجدولة تطبيقات المستخدمين؛ [ 10 ] [ 11 ]
- Hadoop MapReduce - تطبيق لنموذج برمجة MapReduce لمعالجة البيانات على نطاق واسع.
- هادوب أوزون - (تم تقديمه في عام 2020) مخزن كائنات لهادوب
يُستخدم مصطلح Hadoop غالبًا للإشارة إلى كل من الوحدات الأساسية والوحدات الفرعية، وكذلك إلى النظام البيئي ، [ 12 ] أو مجموعة حزم البرامج الإضافية التي يمكن تثبيتها فوق أو بجانب Hadoop، مثل Apache Pig و Apache Hive و Apache HBase و Apache Phoenix و Apache Spark و Apache ZooKeeper و Apache Impala و Apache Flume و Apache Sqoop و Apache Oozie و Apache Storm . [ 13 ]
استُلهمت مكونات MapReduce وHDFS الخاصة بـ Apache Hadoop من أوراق بحثية لشركة Google حول MapReduce ونظام ملفات Google . [ 14 ]
إطار عمل هادوب مكتوب في معظمه بلغة برمجة جافا ، مع بعض التعليمات البرمجية الأصلية بلغة سي وأدوات سطر الأوامر المكتوبة كبرامج نصية شل . يمكن استخدام لغة بيرل بسهولة مع هادوب ستريمنج لتنفيذ جزئيّ الخريطة والاختزال في برنامج المستخدم. [ 15 ]
تاريخ
بحسب مؤسسيها المشاركين، دوغ كاتينغ ومايك كافاريلا ، فقد انبثقت فكرة هادوب من ورقة بحثية حول نظام ملفات جوجل نُشرت في أكتوبر 2003. [ 16 ] [ 17 ] وتم توسيع المفهوم في ورقة بحثية أخرى من جوجل بعنوان "MapReduce: تبسيط معالجة البيانات على مجموعات كبيرة". [ 18 ] بدأ التطوير على مشروع أباتشي نوتش ، ثم نُقل إلى مشروع هادوب الفرعي الجديد في يناير 2006. [ 19 ] أطلق دوغ كاتينغ، الذي كان يعمل في ياهو آنذاك، اسم هادوب على المشروع تيمناً بفيل لعبة ابنه. [ 20 ] تكوّن الكود الأولي المُستخرج من نوتش من حوالي 5000 سطر برمجي لنظام ملفات هادوب الموزع (HDFS) وحوالي 6000 سطر برمجي لـ MapReduce.
في مارس 2006، كان أوين أومالي أول من ساهم في مشروع هادوب؛ [ 21 ] وصدر هادوب 0.1.0 في أبريل 2006. [ 22 ] ولا يزال المشروع يتطور بفضل المساهمات التي تُقدم إليه. [ 23 ] وقد كتب دروبا بورثاكور أول وثيقة تصميم لنظام ملفات هادوب الموزع في عام 2007. [ 24 ]
| إصدار | تاريخ الإصدار الأصلي | أحدث إصدار | تاريخ الافراج عنه |
|---|---|---|---|
| غير مدعوم: 0.10 | 0.10.1 | 2007-01-11 | |
| غير مدعوم: 0.11 | 0.11.2 | 16 فبراير 2007 | |
| غير مدعوم: 0.12 | 2007-03-02 | 0.12.3 | 2007-04-06 |
| غير مدعوم: 0.13 | 2007-06-04 | 0.13.1 | 2007-07-23 |
| غير مدعوم: 0.14 | 2007-09-04 | 0.14.4 | 2007-11-26 |
| غير مدعوم: 0.15 | 29-10-2007 | 0.15.3 | 18-01-2008 |
| غير مدعوم: 0.16 | 2008-02-07 | 0.16.4 | 2008-05-05 |
| غير مدعوم: 0.17 | 2008-05-20 | 0.17.2 | 19-08-2008 |
| غير مدعوم: 0.18 | 22-08-2008 | 0.18.3 | 29-01-2009 |
| غير مدعوم: 0.19 | 21-11-2008 | 0.19.2 | 2009-07-23 |
| غير مدعوم: 0.20 | 2009-04-22 | 0.20.205.0 | 2011-10-17 |
| غير مدعوم: 0.21 | 2011-05-11 | 0.21.0 | |
| غير مدعوم: 0.22 | 10-12-2011 | 0.22.0 | |
| غير مدعوم: 0.23 | 2011-11-11 | 0.23.11 | 2014-06-27 |
| غير مدعوم: 1.0 | 2011-12-27 | 1.0.4 | 12-10-2012 |
| غير مدعوم: 1.1 | 13-10-2012 | 1.1.2 | 2013-02-15 |
| غير مدعوم: 1.2 | 13-05-2013 | 1.2.1 | 2013-08-01 |
| غير مدعوم: 2.0 | 23-05-2012 | 2.0.6-alpha | 23-08-2013 |
| غير مدعوم: 2.1 | 2013-08-25 | 2.1.1-beta | 2013-09-23 |
| غير مدعوم: 2.2 | 2013-12-11 | 2.2.0 | |
| غير مدعوم: 2.3 | 2014-02-20 | 2.3.0 | |
| غير مدعوم: 2.4 | 2014-04-07 | 2.4.1 | 30-06-2014 |
| غير مدعوم: 2.5 | 2014-08-11 | 2.5.2 | 19-11-2014 |
| غير مدعوم: 2.6 | 2014-11-18 | 2.6.5 | 2016-10-08 |
| غير مدعوم: 2.7 | 2015-04-21 | 2.7.7 | 2018-05-31 |
| غير مدعوم: 2.8 | 2017-03-22 | 2.8.5 | 2018-09-15 |
| غير مدعوم: 2.9 | 2017-12-17 | 2.9.2 | 19-11-2018 |
| الإصدار المدعوم: 2.10 | 2019-10-29 | 2.10.2 | 2022-05-31 [ 25 ] |
| غير مدعوم: 3.0 | 2017-12-13 [ 26 ] | 3.0.3 | 2018-05-31 [ 27 ] |
| غير مدعوم: 3.1 | 2018-04-06 | 3.1.4 | 2020-08-03 [ 28 ] |
| أحدث إصدار: 3.2 | 2019-01-16 | 3.2.4 | 2022-07-22 [ 29 ] |
| أحدث إصدار: 3.3 | 2020-07-14 | 3.3.6 | 2023-06-23 [ 30 ] |
| أحدث إصدار: 3.4 | 2024-03-17 | 3.4.0 | 2024-07-17 [ 31 ] |
أسطورة: غير مدعوم مدعوم أحدث إصدار نسخة معاينة الإصدار المستقبلي | |||
بنيان
يتألف هادوب من حزمة هادوب كومون ، التي توفر تجريدات على مستوى نظام الملفات ونظام التشغيل، ومحرك ماب ريديوس (إما ماب ريديوس/MR1 أو يارن/MR2) [ 32 ] ، ونظام ملفات هادوب الموزع (HDFS). تحتوي حزمة هادوب كومون على ملفات جافا أرشفة (JAR) والبرامج النصية اللازمة لتشغيل هادوب.
لضمان جدولة فعّالة للعمل، يجب أن يوفر كل نظام ملفات متوافق مع Hadoop إمكانية تحديد الموقع، أي اسم الرف، وتحديدًا مُبدِّل الشبكة الذي توجد عليه عقدة عاملة. يمكن لتطبيقات Hadoop استخدام هذه المعلومات لتنفيذ التعليمات البرمجية على العقدة التي تحتوي على البيانات، وفي حال تعذّر ذلك، على نفس الرف/المُبدِّل لتقليل حركة البيانات على الشبكة الرئيسية. يستخدم نظام ملفات Hadoop الموزع (HDFS) هذه الطريقة عند نسخ البيانات لضمان تكرارها عبر رفوف متعددة. يقلل هذا النهج من تأثير انقطاع التيار الكهربائي عن الرف أو تعطل المُبدِّل؛ ففي حال حدوث أي من هذه الأعطال في الأجهزة، ستظل البيانات متاحة. [ 33 ]

تتألف مجموعة Hadoop صغيرة من عقدة رئيسية واحدة وعدة عقد عاملة. تتكون العقدة الرئيسية من متتبع المهام، ومتتبع العمليات، وعقدة الاسم، وعقدة البيانات. تعمل العقدة التابعة أو العاملة كعقدة بيانات ومتتبع عمليات في آن واحد، مع إمكانية وجود عقد عاملة مخصصة للبيانات فقط أو للحوسبة فقط. تُستخدم هذه العقد عادةً في التطبيقات غير القياسية فقط. [ 34 ]
يتطلب هادوب بيئة تشغيل جافا (JRE) الإصدار 1.6 أو أحدث. تتطلب برامج بدء التشغيل والإيقاف القياسية إعداد بروتوكول SSH بين العقد في المجموعة. [ 35 ]
في مجموعة أكبر، تُدار عُقد نظام ملفات Hadoop الموزع (HDFS) عبر خادم NameNode مخصص لاستضافة فهرس نظام الملفات، وخادم NameNode ثانوي قادر على إنشاء لقطات من هياكل ذاكرة NameNode، مما يمنع تلف نظام الملفات وفقدان البيانات. وبالمثل، يمكن لخادم JobTracker مستقل إدارة جدولة المهام عبر العُقد. عند استخدام Hadoop MapReduce مع نظام ملفات بديل، يتم استبدال بنية NameNode وNameNode الثانوي وDataNode الخاصة بنظام HDFS بنظائرها الخاصة بنظام الملفات.
أنظمة الملفات
نظام ملفات هادوب الموزع
نظام ملفات هادوب الموزع (HDFS) هو نظام ملفات موزع وقابل للتوسع وقابل للنقل، مكتوب بلغة جافا لإطار عمل هادوب. تُقسم نسخة هادوب إلى HDFS و MapReduce. يُستخدم HDFS لتخزين البيانات، بينما يُستخدم MapReduce لمعالجتها. يحتوي HDFS على خمس خدمات:
- عقدة الاسم
- عقدة الاسم الثانوي
- متتبع الوظائف
- عقدة البيانات
- متتبع المهام
تُمثل الثلاثة العلوية الخدمات/البرامج/العُقد الرئيسية، بينما تُمثل الاثنتان السفليتان الخدمات التابعة. تتواصل الخدمات الرئيسية فيما بينها، وكذلك الخدمات التابعة. تُعتبر عُقدة الاسم عُقدة رئيسية، بينما تُعتبر عُقدة البيانات عُقدة تابعة لها، وتستطيعان التواصل فيما بينهما.
عقدة الاسم: يتكون نظام ملفات Hadoop الموزع (HDFS) من عقدة اسم واحدة فقط تُسمى العقدة الرئيسية. تستطيع العقدة الرئيسية تتبع الملفات، وإدارة نظام الملفات، وتحتوي على البيانات الوصفية لجميع البيانات المخزنة فيها. على وجه الخصوص، تحتوي عقدة الاسم على تفاصيل عدد الكتل، ومواقع عقدة البيانات التي تُخزن فيها البيانات، ومكان تخزين النسخ المتماثلة، وتفاصيل أخرى. تتصل عقدة الاسم مباشرةً بالعميل.
عقدة البيانات: تخزن عقدة البيانات البيانات على شكل كتل. تُعرف أيضًا بالعقدة التابعة، وهي التي تخزن البيانات الفعلية في نظام ملفات Hadoop الموزع (HDFS) المسؤول عن عمليات القراءة والكتابة للعميل. تُسمى هذه العقد بالخدمات التابعة. ترسل كل عقدة بيانات رسالة نبض إلى عقدة الاسم كل 3 ثوانٍ لإعلامها بأنها نشطة. بالتالي، إذا لم تتلقَ عقدة الاسم رسالة نبض من عقدة بيانات لمدة دقيقتين، فإنها تعتبر تلك العقدة غير نشطة وتبدأ عملية نسخ الكتل على عقدة بيانات أخرى.
عقدة الاسم الثانوية: وظيفتها الوحيدة هي إدارة نقاط التحقق لبيانات تعريف نظام الملفات الموجودة في عقدة الاسم. تُعرف أيضًا بعقدة نقطة التحقق، وهي بمثابة عقدة مساعدة لعقدة الاسم. تُصدر عقدة الاسم الثانوية تعليمات لعقدة الاسم لإنشاء وإرسال ملفي fsimage وeditlog، حيث تقوم عقدة الاسم الثانوية بإنشاء ملف fsimage المضغوط بناءً عليهما. [ 36 ]
متتبع المهام: يستقبل متتبع المهام طلبات تنفيذ MapReduce من العميل. ويتواصل مع عقدة الاسم لمعرفة موقع البيانات التي ستُستخدم في المعالجة. وتستجيب عقدة الاسم ببيانات التعريف الخاصة ببيانات المعالجة المطلوبة.
متتبع المهام: هو العقدة التابعة لمتتبع الوظائف، حيث يستلم المهام منه. كما يستقبل منه التعليمات البرمجية. يقوم متتبع المهام بتطبيق هذه التعليمات البرمجية على الملف. تُعرف عملية تطبيق هذه التعليمات البرمجية على الملف باسم "المعالجة". [ 37 ]
تتألف مجموعة Hadoop اسمياً من عقدة اسم واحدة بالإضافة إلى مجموعة من عقد البيانات، مع توفر خيارات التكرار لعقدة الاسم نظراً لأهميتها البالغة. تقوم كل عقدة بيانات بتقديم كتل من البيانات عبر الشبكة باستخدام بروتوكول كتل خاص بنظام ملفات Hadoop الموزع (HDFS). يستخدم نظام الملفات مقابس TCP/IP للاتصال. وتستخدم الأجهزة العميلة استدعاءات الإجراءات عن بُعد (RPC) للتواصل فيما بينها.
يخزن نظام ملفات Hadoop الموزع (HDFS) ملفات كبيرة (عادةً ما تتراوح أحجامها بين غيغابايت وتيرابايت [ 38 ] ) عبر أجهزة متعددة. ويحقق موثوقيته من خلال نسخ البيانات عبر مضيفات متعددة، وبالتالي نظريًا لا يتطلب استخدام مصفوفة أقراص مستقلة زائدة (RAID) على المضيفات (ولكن لتحسين أداء الإدخال/الإخراج، تظل بعض تكوينات RAID مفيدة). مع قيمة النسخ الافتراضية، وهي 3، تُخزن البيانات على ثلاث عقد: اثنتان على نفس الرف، وواحدة على رف مختلف. يمكن لعقد البيانات التواصل فيما بينها لإعادة توزيع البيانات، ونقل النسخ، والحفاظ على معدل نسخ عالٍ. لا يتوافق HDFS تمامًا مع معيار POSIX، لأن متطلبات نظام ملفات POSIX تختلف عن أهداف تطبيق Hadoop. ويكمن المقابل لعدم وجود نظام ملفات متوافق تمامًا مع POSIX في زيادة أداء نقل البيانات ودعم عمليات غير متوافقة مع POSIX مثل الإلحاق. [ 39 ]
في مايو 2012، أُضيفت إمكانيات التوافر العالي إلى نظام ملفات Hadoop الموزع (HDFS)، [ 40 ] مما يسمح لخادم البيانات الوصفية الرئيسي، المسمى NameNode، بالتحويل اليدوي إلى نسخة احتياطية في حالة الفشل. كما بدأ المشروع بتطوير عمليات تحويل تلقائية في حالة الفشل .
يتضمن نظام ملفات HDFS ما يُسمى بـ " العقدة الاسمية الثانوية" ، وهو مصطلح مُضلل قد يُفسره البعض خطأً على أنه عقدة اسمية احتياطية عند تعطل العقدة الاسمية الأساسية. في الواقع، تتصل العقدة الاسمية الثانوية بانتظام بالعقدة الاسمية الأساسية وتُنشئ لقطات من معلومات دليل العقدة الاسمية الأساسية، والتي يحفظها النظام بعد ذلك في أدلة محلية أو بعيدة. يمكن استخدام هذه الصور المُخزنة لإعادة تشغيل العقدة الاسمية الأساسية المعطلة دون الحاجة إلى إعادة تشغيل سجل عمليات نظام الملفات بالكامل، ثم تعديل السجل لإنشاء بنية دليل مُحدثة. ولأن العقدة الاسمية هي النقطة الوحيدة لتخزين وإدارة البيانات الوصفية، فقد تُصبح عائقًا أمام دعم عدد هائل من الملفات، وخاصةً عدد كبير من الملفات الصغيرة. يهدف اتحاد HDFS، وهو إضافة جديدة، إلى معالجة هذه المشكلة إلى حد ما من خلال السماح بمساحات أسماء متعددة تخدمها عقد اسمية منفصلة. علاوة على ذلك، توجد بعض المشكلات في HDFS مثل مشكلات الملفات الصغيرة، ومشكلات قابلية التوسع، ونقطة الفشل الوحيدة (SPoF)، والاختناقات في طلبات البيانات الوصفية الضخمة. إحدى مزايا استخدام نظام ملفات Hadoop الموزع (HDFS) هي معرفة موقع البيانات بين مُتتبع المهام ومُتتبع العمليات. يقوم مُتتبع المهام بجدولة عمليات الخرائط أو الاختزال لمُتتبعي العمليات مع معرفة موقع البيانات. على سبيل المثال: إذا كانت العقدة A تحتوي على البيانات (a, b, c) والعقدة X تحتوي على البيانات (x, y, z)، فإن مُتتبع المهام يُجدول العقدة A لتنفيذ عمليات الخرائط أو الاختزال على البيانات (a, b, c)، بينما تُجدول العقدة X لتنفيذ عمليات الخرائط أو الاختزال على البيانات (x, y, z). هذا يُقلل من حجم البيانات المُرسلة عبر الشبكة ويمنع نقل البيانات غير الضروري. عند استخدام Hadoop مع أنظمة ملفات أخرى، لا تتوفر هذه الميزة دائمًا. قد يكون لهذا تأثير كبير على أوقات إنجاز المهام، كما يتضح من المهام كثيفة البيانات. [ 41 ]
صُمم نظام ملفات Hadoop الموزع (HDFS) للتعامل مع الملفات غير القابلة للتغيير في الغالب، وقد لا يكون مناسبًا للأنظمة التي تتطلب عمليات كتابة متزامنة. [ 39 ]
يمكن تركيب نظام الملفات الموزعة (HDFS) مباشرة باستخدام نظام الملفات الافتراضي في مساحة المستخدم (FUSE) على نظام Linux وبعض أنظمة Unix الأخرى .
يمكن الوصول إلى الملفات من خلال واجهة برمجة تطبيقات Java الأصلية، أو واجهة برمجة تطبيقات Thrift (التي تُنشئ عميلًا في عدد من اللغات مثل C++ وJava وPython وPHP وRuby وErlang وPerl وHaskell وC# و Cocoa وSmalltalk و OCaml )، أو واجهة سطر الأوامر ، أو تطبيق الويب HDFS-UI عبر HTTP ، أو عبر مكتبات عميل الشبكة التابعة لجهات خارجية. [ 42 ]
صُمم نظام ملفات Hadoop الموزع (HDFS) ليكون قابلاً للنقل عبر منصات الأجهزة المختلفة ومتوافقًا مع مجموعة متنوعة من أنظمة التشغيل الأساسية. إلا أن تصميم HDFS يفرض قيودًا على قابلية النقل، مما يؤدي إلى بعض الاختناقات في الأداء، نظرًا لأن تطبيق Java لا يمكنه استخدام الميزات الحصرية للمنصة التي يعمل عليها HDFS. [ 43 ] ونظرًا لانتشاره الواسع في البنية التحتية للمؤسسات، أصبحت مراقبة أداء HDFS على نطاق واسع مسألة بالغة الأهمية. تتطلب مراقبة الأداء الشامل تتبع المقاييس من عقد البيانات وعقد الأسماء ونظام التشغيل الأساسي. [ 44 ] يوجد حاليًا العديد من منصات المراقبة لتتبع أداء HDFS، بما في ذلك Hortonworks و Cloudera و Datadog .
أنظمة الملفات الأخرى
يعمل هادوب مباشرةً مع أي نظام ملفات موزّع يمكن لنظام التشغيل الأساسي الوصول إليه ببساطة باستخدام file://عنوان URL؛ إلا أن هذا يأتي على حساب فقدان خاصية الوصول المباشر إلى البيانات. ولتقليل حركة البيانات على الشبكة، يحتاج هادوب إلى معرفة الخوادم الأقرب إلى البيانات، وهي معلومات يمكن أن توفرها جسور أنظمة الملفات الخاصة بهادوب.
في مايو 2011، كانت قائمة أنظمة الملفات المدعومة المرفقة مع Apache Hadoop كما يلي:
- HDFS: نظام ملفات Hadoop الخاص الذي يراعي الرفوف. [ 45 ] تم تصميم هذا النظام ليتوسع إلى عشرات البيتابايت من التخزين ويعمل فوق أنظمة الملفات الخاصة بأنظمة التشغيل الأساسية .
- أباتشي هادوب أوزون: مخزن كائنات متوافق مع نظام ملفات هادوب الموزع (HDFS) مصمم خصيصًا للتعامل مع مليارات الملفات الصغيرة.
- نظام ملفات FTP : يقوم هذا النظام بتخزين جميع بياناته على خوادم FTP التي يمكن الوصول إليها عن بُعد.
- خدمة تخزين الكائنات Amazon S3 (خدمة التخزين البسيطة من أمازون): تستهدف هذه الخدمة المجموعات المستضافة على بنية Amazon Elastic Compute Cloud للخوادم عند الطلب. لا يوجد في نظام الملفات هذا أي ارتباط بموقع الخوادم، لأنه يعمل عن بُعد بالكامل.
- نظام ملفات Windows Azure Storage Blobs (WASB): هذا امتداد لـ HDFS يسمح لتوزيعات Hadoop بالوصول إلى البيانات في مخازن Azure blob دون نقل البيانات بشكل دائم إلى المجموعة.
تم تطوير عدد من جسور أنظمة الملفات الخارجية، ولا يوجد أي منها حاليًا في توزيعات هادوب. مع ذلك، تأتي بعض التوزيعات التجارية لهادوب مزودة بنظام ملفات بديل كنظام افتراضي ، وتحديدًا IBM و MapR .
- في عام 2009، ناقشت شركة IBM تشغيل Hadoop على نظام الملفات المتوازية العام لشركة IBM . [ 46 ] تم نشر الشفرة المصدرية في أكتوبر 2009. [ 47 ]
- في أبريل 2010، نشرت شركة Parascale شفرة المصدر لتشغيل Hadoop على نظام ملفات Parascale. [ 48 ]
- في أبريل 2010، أصدرت شركة Appistry برنامج تشغيل نظام ملفات Hadoop لاستخدامه مع منتج التخزين الخاص بها CloudIQ. [ 49 ]
- في يونيو 2010، ناقشت شركة HP برنامج تشغيل نظام الملفات IBRIX Fusion الذي يعتمد على الموقع . [ 50 ]
- في مايو 2011، أعلنت شركة MapR Technologies Inc. عن توفر نظام ملفات بديل لـ Hadoop، وهو MapR FS ، والذي حل محل نظام ملفات HDFS بنظام ملفات قراءة/كتابة عشوائي كامل.
JobTracker و TaskTracker: محرك MapReduce
فوق أنظمة الملفات، يأتي محرك MapReduce، الذي يتكون من وحدة JobTracker واحدة ، حيث تُرسل تطبيقات العميل مهام MapReduce إليها. تقوم وحدة JobTracker بتوزيع العمل على عُقد TaskTracker المتاحة في المجموعة، ساعيةً إلى إبقاء العمل أقرب ما يمكن إلى البيانات. بفضل نظام الملفات المُدرك للرفوف، تعرف وحدة JobTracker أي عُقدة تحتوي على البيانات، وأي الأجهزة الأخرى القريبة. إذا تعذر استضافة العمل على العُقدة الفعلية التي توجد بها البيانات، تُعطى الأولوية للعُقد الموجودة في نفس الرف. هذا يُقلل من حركة مرور الشبكة على الشبكة الأساسية. في حال تعطل وحدة TaskTracker أو انتهاء مهلتها، يُعاد جدولة ذلك الجزء من المهمة. تُنشئ وحدة TaskTracker على كل عُقدة عملية آلة افتراضية Java (JVM) منفصلة لمنع تعطل وحدة TaskTracker نفسها في حال تعطل JVM الخاص بها أثناء تشغيل المهمة. يتم إرسال إشارة نبض من TaskTracker إلى وحدة JobTracker كل بضع دقائق للتحقق من حالتها. يتم عرض حالة ومعلومات متتبع الوظائف ومتتبع المهام بواسطة Jetty ويمكن عرضها من خلال متصفح الويب.
من القيود المعروفة لهذا النهج ما يلي:
- يُعدّ توزيع العمل على مُتتبّعي المهام بسيطًا للغاية. لكل مُتتبّع مهام عدد من الخانات المتاحة (مثل "4 خانات"). تشغل كل مهمة خريطة أو اختزال نشطة خانة واحدة. يُخصّص مُتتبّع المهام العمل للمُتتبّع الأقرب إلى البيانات والذي لديه خانة متاحة. لا يُؤخذ في الاعتبار حمل النظام الحالي للجهاز المُخصّص، وبالتالي مدى توافره الفعلي.
- إذا كان أحد متتبعي المهام بطيئًا للغاية، فقد يؤدي ذلك إلى تأخير مهمة MapReduce بأكملها ، خاصةً في المراحل الأخيرة، حيث قد ينتهي الأمر بجميع العمليات بالانتظار حتى إتمام المهمة الأبطأ. ولكن مع تفعيل التنفيذ التخميني، يمكن تنفيذ مهمة واحدة على عدة عقد تابعة.
الجدولة
يستخدم هادوب افتراضيًا جدولة FIFO ، مع إمكانية تحديد 5 أولويات جدولة لجدولة المهام من قائمة انتظار العمل. [ 51 ] في الإصدار 0.19، أُعيد تصميم مُجدول المهام وفصله عن JobTracker، مع إضافة إمكانية استخدام مُجدول بديل (مثل مُجدول Fair أو مُجدول Capacity ، الموصوف لاحقًا). [ 52 ]
جدولة عادلة
طُوِّر نظام الجدولة العادلة بواسطة فيسبوك . [ 53 ] يهدف هذا النظام إلى توفير أوقات استجابة سريعة للمهام الصغيرة وجودة خدمة عالية للمهام الإنتاجية. ويعتمد نظام الجدولة العادلة على ثلاثة مفاهيم أساسية. [ 54 ]
- يتم تجميع الوظائف في مجموعات .
- يتم تخصيص حد أدنى مضمون لكل مجموعة.
- يتم توزيع الطاقة الإنتاجية الفائضة بين الوظائف.
بشكل افتراضي، تُوضع المهام غير المصنفة في مجموعة افتراضية. يجب أن تحدد المجموعات الحد الأدنى لعدد خانات الخرائط، وخانات الاختزال، بالإضافة إلى حد أقصى لعدد المهام قيد التشغيل.
جدولة السعة
تم تطوير مُجدول السعة بواسطة ياهو. يدعم مُجدول السعة العديد من الميزات المشابهة لتلك الموجودة في مُجدول التوزيع العادل. [ 55 ]
- يتم تخصيص جزء من إجمالي سعة الموارد للطوابير.
- يتم تخصيص الموارد المجانية للطوابير التي تتجاوز طاقتها الاستيعابية الإجمالية.
- ضمن قائمة الانتظار، تتمتع المهمة ذات الأولوية العالية بإمكانية الوصول إلى موارد قائمة الانتظار.
لا يوجد مقاطعة بمجرد بدء تشغيل المهمة.
الفرق بين هادوب 1 وهادوب 2 (يارن)
يُعدّ إضافة YARN (مفاوض موارد آخر) أبرز اختلاف بين Hadoop 1 و Hadoop 2، حيث حلّ محلّ محرك MapReduce في الإصدار الأول من Hadoop. يسعى YARN إلى تخصيص الموارد للتطبيقات المختلفة بكفاءة. وهو يُشغّل برنامجين يعملان في الخلفية، ويتولّى كلٌّ منهما مهمةً مختلفة: مدير الموارد ، الذي يتولّى تتبّع المهام وتخصيص الموارد للتطبيقات، ومدير التطبيق ، الذي يراقب تقدّم التنفيذ.
الفرق بين هادوب 2 وهادوب 3
هناك ميزات مهمة يوفرها Hadoop 3. على سبيل المثال، بينما يوجد عقدة اسم واحدة في Hadoop 2، فإن Hadoop 3 يتيح وجود عقد اسم متعددة، مما يحل مشكلة نقطة الفشل الوحيدة.
في Hadoop 3، توجد حاويات تعمل وفقًا لمبدأ Docker ، مما يقلل الوقت المستغرق في تطوير التطبيقات.
أحد أكبر التغييرات هو أن Hadoop 3 يقلل من الحمل الزائد للتخزين باستخدام ترميز المحو .
كما يسمح Hadoop 3 باستخدام أجهزة GPU داخل المجموعة، وهو ما يمثل ميزة كبيرة جدًا لتنفيذ خوارزميات التعلم العميق على مجموعة Hadoop. [ 56 ]
تطبيقات أخرى
لا يقتصر استخدام نظام ملفات Hadoop الموزع (HDFS) على وظائف MapReduce، بل يمكن استخدامه في تطبيقات أخرى، العديد منها قيد التطوير في مؤسسة Apache. تشمل هذه التطبيقات قاعدة بيانات HBase ، ونظام Apache Mahout للتعلم الآلي ، ومستودع بيانات Apache Hive . نظريًا، يمكن استخدام Hadoop لأي عبء عمل يعتمد على المعالجة الدفعية بدلًا من المعالجة الآنية، ويتطلب كميات هائلة من البيانات، ويستفيد من المعالجة المتوازية . كما يمكن استخدامه لتكملة أنظمة المعالجة الآنية، مثل بنية Lambda ، و Apache Storm ، وFlink ، و Spark Streaming . [ 57 ]
تشمل التطبيقات التجارية لـ Hadoop ما يلي: [ 58 ]
- تحليل سجلات أو مسار النقرات
- تحليلات التسويق
- التعلم الآلي واستخراج البيانات
- معالجة الصور
- معالجة رسائل XML
- الزحف على الويب
- أعمال الأرشفة لأغراض الامتثال، بما في ذلك البيانات العلائقية والجدولية
حالات الاستخدام البارزة
في 19 فبراير 2008، أطلقت شركة ياهو! ما وصفته بأنه أكبر تطبيق إنتاجي قائم على هادوب في العالم. يُعدّ تطبيق ياهو! للبحث على الويب تطبيقًا قائمًا على هادوب يعمل على مجموعة حواسيب لينكس تضم أكثر من 10,000 نواة ، وقد أنتج بيانات استُخدمت في جميع استعلامات البحث على موقع ياهو!. [ 59 ] يوجد لدى ياهو! عدة مجموعات حواسيب هادوب، ولا يتم توزيع أنظمة ملفات HDFS أو مهام MapReduce على مراكز بيانات متعددة. تقوم كل عقدة في مجموعة حواسيب هادوب بتشغيل صورة لينكس، بما في ذلك توزيعة هادوب. ومن المعروف أن العمل الذي تُنفّذه هذه المجموعات يشمل حسابات الفهرسة لمحرك بحث ياهو!. في يونيو 2009، أتاحت ياهو! شفرة المصدر لإصدار هادوب الخاص بها لمجتمع المصادر المفتوحة. [ 60 ]
في عام 2010، ادّعت فيسبوك امتلاكها لأكبر مجموعة خوادم هادوب في العالم بسعة تخزين تبلغ 21 بيتابايت . [ 61 ] وفي يونيو 2012، أعلنت أن حجم البيانات قد نما إلى 100 بيتابايت [ 62 ] ، وفي وقت لاحق من ذلك العام، أعلنت أن حجم البيانات ينمو بمعدل نصف بيتابايت تقريبًا يوميًا. [ 63 ]
اعتبارًا من عام 2013أصبح استخدام هادوب واسع الانتشار: فقد استخدمت أكثر من نصف شركات قائمة فورتشن 50 هادوب. [ 64 ]
أوراق
من بين الأبحاث المؤثرة حول نشأة وتطور وإدارة هادوب ومعالجة البيانات الضخمة: بحث جيفري دين وسانجاي غيماوات (2004) بعنوان "MapReduce: معالجة بيانات مبسطة على مجموعات كبيرة" ، من منشورات جوجل. وقد ألهم هذا البحث دوغ كاتينغ لتطوير تطبيق مفتوح المصدر لإطار عمل MapReduce، وأطلق عليه اسم هادوب تيمناً بفيل لعبة ابنه.
- مايكل فرانكلين، ألون هاليفي، ديفيد ماير (2005) من قواعد البيانات إلى فضاءات البيانات: تجريد جديد لإدارة المعلومات . يسلط المؤلفون الضوء على ضرورة أن تقبل أنظمة التخزين جميع تنسيقات البيانات وأن توفر واجهات برمجة تطبيقات للوصول إلى البيانات تتطور بناءً على فهم نظام التخزين للبيانات.
- فاي تشانغ وآخرون (2006) Bigtable: نظام تخزين موزع للبيانات المهيكلة ، جوجل.
- روبرت كالمان وآخرون (2008) H-store: نظام معالجة معاملات الذاكرة الرئيسية الموزعة عالي الأداء
انظر أيضاً
- أباتشي تراكم - تأمين Bigtable [ 65 ]
- أباتشي كاساندرا ، قاعدة بيانات عمودية تدعم الوصول من هادوب
- أباتشي كوتش دي بي ، قاعدة بيانات تستخدم JSON للمستندات، وجافا سكريبت لاستعلامات MapReduce، وبروتوكول HTTP العادي لواجهة برمجة التطبيقات (API).
- البيانات الضخمة
- الحوسبة كثيفة البيانات
- مجموعة الحوسبة عالية الأداء HPCC – LexisNexis Risk Solutions
- هايبرتابل – بديل لـ HBase
- القطاع/المجال – تخزين ومعالجة موزعة مفتوحة المصدر
- مدير أحمال العمل Slurm
مراجع
- ↑ "إصدارات هادوب" . apache.org . مؤسسة برمجيات أباتشي. مؤرشف من الأصل بتاريخ 28 أبريل 2019. تم الاطلاع عليه بتاريخ 28 أبريل 2019 .
- 1 2 "أباتشي هادوب" . مؤرشف من الأصل في 1 يونيو 2022. تم الاسترجاع في 27 سبتمبر 2022 .
- ↑ القاضي، بيتر (22 أكتوبر 2012). "دوغ كاتينغ: البيانات الضخمة ليست فقاعة" . silicon.co.uk . تم الاطلاع عليه بتاريخ 11 مارس 2018 .
- ↑ وودي، أليكس (12 مايو 2014). "لماذا هادوب على آي بي إم باور؟" . datanami.com . داتانامي . تم الاطلاع عليه بتاريخ 11 مارس 2018 .
- ↑ هيمسوث، نيكول (15 أكتوبر 2014). "كراي تطلق هادوب في مجال الحوسبة عالية الأداء" . hpcwire.com . تم الاطلاع عليه بتاريخ 11 مارس 2018 .
- ↑ "مرحباً بكم في أباتشي هادوب!" . hadoop.apache.org . مؤرشف من الأصل بتاريخ 23 سبتمبر 2017. تم الاطلاع عليه بتاريخ 25 أغسطس 2016 .
- ↑ "ما هو نظام ملفات هادوب الموزع (HDFS)؟" . ibm.com . IBM . تم الاطلاع عليه بتاريخ 12 أبريل 2021 .
- ↑ مالاك، مايكل (19 سبتمبر 2014). "موقع البيانات: الحوسبة عالية الأداء مقابل هادوب مقابل سبارك" . datascienceassn.org . جمعية علوم البيانات. مؤرشف من الأصل في 10 سبتمبر 2017. تم الاطلاع عليه في 30 أكتوبر 2014 .
- ↑ وانغ، ياندونغ؛ غولدستون، روبن؛ يو، ويكوان؛ وانغ، تينغ (أكتوبر 2014). "توصيف وتحسين MapReduce المقيم في الذاكرة على أنظمة الحوسبة عالية الأداء". المؤتمر الدولي الثامن والعشرون للمعالجة المتوازية والموزعة لعام 2014، معهد مهندسي الكهرباء والإلكترونيات. الصفحات 799-808 . doi : 10.1109/IPDPS.2014.87 . ISBN 978-1-4799-3800-1. S2CID 11157612 .
- ↑ "مورد (واجهة برمجة تطبيقات Apache Hadoop الرئيسية 2.5.1)" . apache.org . مؤسسة برمجيات أباتشي. 12 سبتمبر 2014. مؤرشف من الأصل في 6 أكتوبر 2014. تم الاطلاع عليه في 30 سبتمبر 2014 .
- ↑ مورثي، أرون (15 أغسطس 2012). "أباتشي هادوب يارن - المفاهيم والتطبيقات" . hortonworks.com . هورتون وركس. مؤرشف من الأصل في 11 سبتمبر 2017. تم الاطلاع عليه في 30 سبتمبر 2014 .
- ↑ "شركة Continuuity تجمع 10 ملايين دولار في جولة تمويل من الفئة (أ) لدعم تطوير تطبيقات البيانات الضخمة ضمن منظومة Hadoop" . finance.yahoo.com . Marketwired . 14 نوفمبر 2012. مؤرشف من الأصل في 10 سبتمبر 2017. تم الاطلاع عليه في 30 أكتوبر 2014 .
- ↑ "مشاريع متعلقة بـ Hadoop على" Hadoop.apache.org. مؤرشف من الأصل بتاريخ 23 سبتمبر 2017. تم الاطلاع عليه بتاريخ 17 أكتوبر 2013 .
- ↑ علم البيانات وتحليلات البيانات الضخمة: اكتشاف البيانات وتحليلها وتصورها وعرضها . جون وايلي وأولاده. 19 ديسمبر 2014. ص 300. ISBN 9781118876220تم الاطلاع عليه بتاريخ 29 يناير 2015 .
- ↑ "استخدام تقنية Hadoop Streaming مع لغة Perl لتقنية MapReduce" . موقع Stack Overflow . 29 يوليو 2025. تاريخ الاطلاع: 1 أغسطس 2025 .
- ↑ كاتينغ، مايك؛ كافاريلا، بن؛ لوريكا، دوغ (31 مارس 2016). "السنوات العشر القادمة لأباتشي هادوب" . أورايلي ميديا . تم الاطلاع عليه بتاريخ 12 أكتوبر 2017 .
- ↑ غيماوات، سانجاي؛ غوبيووف، هوارد؛ ليونغ، شون تاك (2003). "نظام ملفات جوجل" . الصفحات 20-43 . مؤرشف من الأصل في 2 ديسمبر 2017. تم الاطلاع عليه في 5 مارس 2016 .
- ↑ دين، جيفري؛ غيماوات، سانجاي (2004). "MapReduce: معالجة البيانات المبسطة على مجموعات كبيرة" (ملف PDF) . الصفحات 137-150 .
- ↑ كاتينغ، دوغ (28 يناير 2006). "طلب قوائم بريدية جديدة: هادوب" . issues.apache.org .
صوتت لجنة إدارة مشروع لوسين على فصل جزء من نوتش إلى مشروع فرعي جديد باسم هادوب.
- ↑ فانس، آشلي (17 مارس 2009). "هادوب، برنامج مجاني، يجد استخدامات تتجاوز البحث" . صحيفة نيويورك تايمز . مؤرشف من الأصل في 30 أغسطس 2011. تم الاطلاع عليه في 20 يناير 2010 .
- ↑ كاتينغ، دوغ (30 مارس 2006). " [ النتيجة ] التصويت: إضافة أوين أومالي كمساهم في مشروع هادوب" . hadoop-common-dev (القائمة البريدية).
- ↑ "فهرس /dist/hadoop/core" . archive.apache.org . تم الاطلاع عليه بتاريخ 11 ديسمبر 2017 .
- ↑ "من نحن" . hadoop.apache.org . تم الاطلاع عليه بتاريخ 11 ديسمبر 2017 .
- ↑ بورثاكور، دروبا (2006). "نظام ملفات هادوب الموزع: البنية والتصميم" (ملف PDF) . مستودع أكواد أباتشي هادوب .
- ↑ "الإصدار 2.10.2 متاح" . hadoop.apache.org .
- ↑ "الإصدار 3.0.0 متاح بشكل عام" . hadoop.apache.org .
- ↑ "الإصدار 3.0.3 متاح" . hadoop.apache.org .
- ↑ "الإصدار 3.1.4 متاح" . hadoop.apache.org .
- ↑ "الإصدار 3.2.4 متاح" . hadoop.apache.org .
- ↑ "الإصدار 3.3.6 متاح" . hadoop.apache.org .
- ↑ "الإصدار 3.4.0 متاح" . hadoop.apache.org .
- ↑ شوراريا، هارش (21 أكتوبر 2012). "شرح موجز لـ MR2 وYARN" . Cloudera.com . مؤرشف من الأصل في 22 أكتوبر 2013. تم الاطلاع عليه في 23 أكتوبر 2013 .
- ↑ "دليل مستخدم HDFS" . Hadoop.apache.org . تم الاطلاع عليه بتاريخ 4 سبتمبر 2014 .
- ↑ "تشغيل هادوب على نظام أوبونتو لينكس (مجموعة متعددة العقد)" .
- ↑ "تشغيل هادوب على نظام أوبونتو لينكس (مجموعة أحادية العقدة)" . تم الاطلاع عليه بتاريخ 6 يونيو 2013 .
- ↑ بالرام. "دليل هادوب للبيانات الضخمة للمبتدئين" . www.gyansetu.in . تم الاطلاع عليه بتاريخ 11 مارس 2021 .
- ↑ "دليل مستخدمي Apache Hadoop 2.7.5 – HDFS" . مؤرشف من الأصل بتاريخ 23 أكتوبر 2019. تم الاطلاع عليه بتاريخ 19 يونيو 2020 .
- ↑ "بنية نظام الملفات الموزعة (HDFS)" . تم الاطلاع عليه في 1 سبتمبر 2013 .
- 1 2 بيساخ، يانيف (2013). التخزين الموزع: المفاهيم والخوارزميات والتطبيقات . OL 25423189M .
- ↑ «يوفر الإصدار 2.0 إمكانية التبديل اليدوي في حالة الأعطال، ويعملون حاليًا على التبديل التلقائي» . Hadoop.apache.org. مؤرشف من الأصل في 1 يونيو 2022. تم الاطلاع عليه في 30 يوليو 2013 .
- ↑ "تحسين أداء MapReduce من خلال وضع البيانات في مجموعات Hadoop غير المتجانسة" (ملف PDF) . Eng.auburn.ed. أبريل 2010.
- ↑ "تركيب نظام ملفات Hadoop الموزع" . مؤرشف من الأصل في 14 مايو 2014. تم الاطلاع عليه في 5 أغسطس 2016 .
- ↑ شيفر، جيفري؛ ريكسنر، سكوت؛ كوكس، آلان. "نظام ملفات هادوب الموزع: الموازنة بين قابلية النقل والأداء" (ملف PDF) . جامعة رايس . تم الاطلاع عليه بتاريخ 19 سبتمبر 2016 .
- ↑ موزاكيتيس، إيفان (21 يوليو 2016). "كيفية جمع مقاييس أداء هادوب" . تم الاطلاع عليه بتاريخ 24 أكتوبر 2016 .
- ↑ "دليل مستخدمي HDFS - الوعي بالرفوف" . Hadoop.apache.org. مؤرشف من الأصل في 13 نوفمبر 2013. تم الاطلاع عليه في 17 أكتوبر 2013 .
- ↑ "تحليلات السحابة: هل نحن بحاجة حقًا إلى إعادة ابتكار بنية التخزين؟" (ملف PDF) . شركة IBM. يونيو 2009.
- ↑ "HADOOP-6330: دمج تطبيق نظام الملفات المتوازية العامة من IBM لواجهة نظام ملفات Hadoop" . IBM. 23 أكتوبر 2009.
- ↑ "HADOOP-6704: إضافة دعم لنظام ملفات Parascale" . Parascale. 14 أبريل 2010. مؤرشف من الأصل في 16 يونيو 2012. تم الاطلاع عليه في 16 يناير 2012 .
- ↑ "نظام ملفات Hadoop الموزع مع تخزين CloudIQ" . شركة Appistry، 6 يوليو 2010. مؤرشف من الأصل في 5 أبريل 2014. تم الاطلاع عليه في 10 ديسمبر 2013 .
- ↑ "هادوب عالي التوافر" . إتش بي. 9 يونيو 2010. مؤرشف من الأصل في 22 يونيو 2010. تم الاطلاع عليه في 6 يوليو 2010 .
- ↑ "دليل أوامر هادوب" . 9 أكتوبر 2024. مؤرشف من الأصل في 17 أغسطس 2011. تم الاطلاع عليه في 17 نوفمبر 2024 .
- ↑ "إعادة هيكلة المجدول خارج JobTracker" . Hadoop Common . مؤسسة برمجيات أباتشي . تم الاطلاع عليه في 9 يونيو 2012 .
- ↑ جونز، إم. تيم (6 ديسمبر 2011). "الجدولة في هادوب" . ibm.com . آي بي إم . مؤرشف من الأصل في 5 أبريل 2014. تم الاطلاع عليه في 20 نوفمبر 2013 .
- ↑ "وثيقة تصميم جدولة هادوب العادلة" (ملف PDF) . apache.org . تم الاطلاع عليها بتاريخ 12 أكتوبر 2017 .
- ↑ "دليل جدولة السعة" . Hadoop.apache.org . تم الاطلاع عليه بتاريخ 31 ديسمبر 2015 .
- ↑ "كيف يُضيف Apache Hadoop 3 قيمةً مقارنةً بـ Apache Hadoop 2" . hortonworks.com . 7 فبراير 2018. مؤرشف من الأصل في 16 نوفمبر 2018. تم الاطلاع عليه في 11 يونيو 2018 .
- ↑ شينتابالي، سانكيت؛ داجيت، ديريك؛ إيفانز، بوبي؛ فاريفار، رضا؛ غريفز، توماس؛ هولدربو، مارك؛ ليو، تشو؛ نوسباوم، كايل؛ باتيل، كيشوركومار؛ بينغ، بويانغ جيري؛ بولوسكي، بول (مايو 2016). "تقييم أداء محركات الحوسبة المتدفقة: ستورم، فلينك، وسبارك ستريمنج". ورش عمل ندوة IEEE الدولية للمعالجة المتوازية والموزعة لعام 2016 (IPDPSW) . IEEE. الصفحات 1789-1792 . doi : 10.1109/IPDPSW.2016.138 . ISBN 978-1-5090-3682-0. S2CID 2180634 .
- ↑ ""كيف تستخدم أكثر من 30 مؤسسة تقنية هادوب"، في DBMS2 . Dbms2.com. 10 أكتوبر 2009. مؤرشف من الأصل في 17 فبراير 2010. تم الاطلاع عليه في 17 أكتوبر 2013 .
- ↑ "ياهو! تطلق أكبر تطبيق إنتاجي لـ Hadoop في العالم" . ياهو . ١٩ فبراير ٢٠٠٨. مؤرشف من الأصل في ٧ مارس ٢٠١٦. تم الاطلاع عليه في ٣١ ديسمبر ٢٠١٥ .
- ↑ "هادوب والحوسبة الموزعة في ياهو!" . ياهو!. 20 أبريل 2011. مؤرشف من الأصل في 14 أغسطس 2011. تم الاطلاع عليه في 17 أكتوبر 2013 .
- ↑ "HDFS: فيسبوك يمتلك أكبر مجموعة خوادم هادوب في العالم!" . Hadoopblog.blogspot.com. 9 مايو 2010. تم الاطلاع عليه بتاريخ 23 مايو 2012 .
- ↑ "نظرة معمقة: موثوقية نظام ملفات هادوب الموزع مع Namenode وAvatarnode" . فيسبوك . تم الاطلاع عليه بتاريخ 13 سبتمبر 2012 .
- ↑ "نظرة معمقة: جدولة مهام MapReduce بكفاءة أكبر باستخدام Corona" . فيسبوك . تم الاطلاع عليه بتاريخ 9 نوفمبر 2012 .
- ↑ «أصبح مُسرِّع ومُحسِّن تخزين هادوب AltraSTAR من Altior معتمدًا الآن على CDH4 (توزيعة كلاوديرا التي تتضمن أباتشي هادوب الإصدار 4)» (بيان صحفي). إيتونتاون، نيوجيرسي: شركة Altior. 18 ديسمبر 2012. تاريخ الاطلاع: 30 أكتوبر 2013 .
- ↑ "دليل مستخدم أباتشي أكومولو: الأمان" . apache.org . مؤسسة برمجيات أباتشي . تم الاطلاع عليه في 3 ديسمبر 2014 .
فهرس
- لام، تشاك (28 يوليو 2010). هادوب في العمل ( الطبعة الأولى). منشورات مانينغ . ص 325. ISBN 978-1-935-18219-1.
- فينر ، جيسون (22 يونيو 2009). برو Hadoop (الطبعة الأولى ). أبريس . ص. 440. ردمك 978-1-430-21942-2أُرشف من الأصل في 5 ديسمبر 2010. تم الاطلاع عليه في 3 يوليو 2009 .
- وايت، توم (16 يونيو 2009). هادوب: الدليل الشامل ( الطبعة الأولى). أورايلي ميديا . ص 524. ISBN 978-0-596-52197-4.
- فوهرا، ديباك (أكتوبر 2016). النظام البيئي العملي لهادوب: دليل شامل لأطر العمل والأدوات المتعلقة بهادوب ( الطبعة الأولى). أبريس . ص 429. ISBN 978-1-4842-2199-0.
- فيكتورسكي ، توماسز (يناير 2019). أنظمة كثيفة البيانات . شام، سويسرا: سبرينغر. رقم ISBN 978-3-030-04603-3.
روابط خارجية
- مشاريع مؤسسة برمجيات أباتشي
- منتجات البيانات الضخمة
- أنظمة الملفات الموزعة
- برامج مجانية للحوسبة السحابية
- برنامج مجاني مكتوب بلغة جافا
- برامج نظام مجانية
- أباتشي هادوب
- برنامج يستخدم ترخيص أباتشي
