در منظر زیرساختهای کلانداده، چارچوبهای اندکی تأثیری به عمق آپاچی هادوپ داشتهاند. اگرچه معماریهای مدرن اغلب ابزارهای جدیدتری را روی آن لایهبندی میکنند، هادوپ همچنان سنگ بنای ذخیرهسازی توزیعشده و پردازش دستهای است. برای توسعهدهندگان متوسط و پیشرفته، درک مکانیکهای داخلی هادوپ—بهویژه نحوه تعامل HDFS، MapReduce و YARN—برای طراحی پایپلاینهای داده مقیاسپذیر و مقاوم حیاتی است.
ذخیرهسازی توزیعشده با HDFS
سیستم فایل توزیعشده هادوپ (HDFS) برای ذخیرهسازی فایلهای بسیار بزرگ در سراسر ماشینها در یک خوشه بزرگ طراحی شده است، در حالی که همچنان به صورت مقاوم در برابر خطا عمل میکند. برخلاف سیستمهای فایل سنتی که برای دسترسی با تأخیر کم بهینهسازی شدهاند، HDFS بر پهنای باند بالای دسترسی به دادهها تمرکز دارد که آن را برای کاربردهای کلانداده ایدهآل میسازد.
HDFS از یک معماری اصلی/برده با یک NameNode (اصلی) که فضای نام سیستم فایل را مدیریت کرده و دسترسی به فایلها را تنظیم میکند، و DataNodes (بردهها) که بلوکهای داده واقعی را ذخیره میکنند، استفاده میکند. یک مفهوم کلیدی در HDFS، بازتولید (Replication) است. بهطور پیشفرض، HDFS هر بلوک داده را سه بار در DataNodes مختلف بازتولید میکند. این اطمینان حاصل میکند که اگر یک گره شکست بخورد، داده از دست نمیرود و سیستم میتواند به ارائه درخواستهای خواندن از سایر گرههایی که نسخههای تکراری را نگه میدارند، ادامه دهد.
# Creating a directory in HDFS
hdfs dfs -mkdir /user/data/raw_logs
# Uploading a local file to HDFS
hdfs dfs -put ./local_logs.txt /user/data/raw_logs/
# Verifying block replication
hdfs fsck /user/data/raw_logs/local_logs.txt
گذار از MapReduce به YARN
از نظر تاریخی، MapReduce هم موتور پردازش و هم مدیر منابع در هادوپ نسخه 1.x بود. با این حال، با ظهور نیاز به مدلهای پردازش متنوع (مانند پردازش جریان بلادرنگ با Storm یا پرسوجوهای تعاملی با Hive)، این جفتشدگی به یک گلوگاه تبدیل شد. هادوپ نسخه 2.x، YARN (Yet Another Resource Negotiator) را معرفی کرد که مدیریت منابع را از پردازش داده جدا میکند.
YARN شامل یک ResourceManager (زمانبند جهانی)، NodeManagers (نمایندگان در هر گره) و ApplicationMasters (برای هر برنامه) است. این معماری به هادوپ اجازه میدهد تا از چندین چارچوب پردازش در همان خوشه پشتیبانی کند که به طور قابل توجهی استفاده از سختافزار و انعطافپذیری را افزایش میدهد.
درک منطق MapReduce
MapReduce یک مدل برنامهنویسی برای پردازش و تولید مجموعههای داده بزرگ با یک الگوریتم موازی و توزیعشده است. این مدل در دو فاز عمل میکند: Map و Reduce. فاز Map مجموعهای از دادهها را دریافت کرده و آن را به مجموعه دیگری از دادهها تبدیل میکند که در آن عناصر فرد به جفتهای کلید/مقدار تجزیه میشوند. فاز Reduce خروجی فاز Map را خلاصه میکند.
// Conceptual MapReduce Workflow
// 1. Input Split: "Hello World" -> ("Hello", 1), ("World", 1)
// 2. Shuffle & Sort: Groups keys
// 3. Reduce: ("Hello", 2), ("World", 2)
// In a real scenario, you define a Mapper class
public class WordCountMapper extends Mapper
اکوسیستم گستردهتر
هادوپ به ندرت به صورت جداگانه استفاده میشود. قدرت واقعی آن در اکوسیستم آن نهفته است. ابزارهایی مانند Apache Hive رابطهای شبیه SQL را برای عملیات انبار داده ارائه میدهند، در حالی که Apache Pig یک زبان جریان داده سطح بالا ارائه میکند. برای پرسوجوهای تعاملی، Apache Impala و Spark SQL جایگزینهای سریعتری نسبت به MapReduce سنتی ارائه میدهند. علاوه بر این، HBase قابلیتهای NoSQL را برای دسترسی تصادفی به خواندن/نوشتن به مجموعههای داده بزرگ فراهم میکند که مستقیماً روی HDFS قرار دارد.
نتیجهگیری
آپاچی هادوپ با معرفی رویکردی قابل اعتماد و مقیاسپذیر برای ذخیرهسازی و پردازش توزیعشده، نحوه مدیریت کلانداده را متحول کرد. اگرچه فناوریهای جدیدتری برای رفع نیازهای خاص تأخیر و تعاملی ظهور کردهاند، اصول HDFS و YARN همچنان جزء جداییناپذیر از انباشتهای داده مدرن باقی ماندهاند. با تسلط بر این اجزای اصلی، توسعهدهندگان میتوانند سیستمهای مستحکمی بسازند که به صورت افقی مقیاسپذیر باشند و اطمینان حاصل کنند که رشد داده هرگز به گلوگاهی برای دستیابی به بینش تبدیل نمیشود.