Category

Data Engineering

Apache Kafka, Spark, Flink, Airflow, Iceberg, ClickHouse, ETL/ELT, data lakes, data warehouses, streaming pipelines

35 posts

تبدیل داده‌ها در مقیاس بزرگ: راهنمای جامع dbt

استک‌های داده مدرن به‌طور قابل‌توجهی تکامل یافته‌اند و از خط‌های لوله‌ای ETL پیچیده به سمت معماری‌های ساده‌تر ELT (استخراج، بارگذاری، تبدیل) حرکت کرده‌اند. در این پارادایم، داده‌های خام به‌سرعت ممکن به انبار داده بارگذاری می‌شوند و کار سنگین تبدیل در داخل پایگاه داده انجام می‌شود...

دیتا مش: حرکت فراتر از دریاچه داده متمرکز

در روزهای نخستین داده‌های بزرگ، انبار داده متمرکز معیار طلایی بود. این روش برای تحلیل‌های مقیاس کوچک تا متوسط به‌خوبی عمل می‌کرد. با این حال، با رشد سازمان‌ها، این معماری‌های متمرکز تحت فشار مشکلات مقیاس‌پذیری، کندی در رسیدن به بینش و فقدان بافت، شروع به فروپاشی کردند. در این میان...

فراتر از ایرفلو: ارزیابی داگستر و پریفکت برای هم‌زمان‌سازی داده‌های مدرن

بیش از یک دهه است که آپاچی ایرفلو پادشاه بی‌رقیب هم‌زمان‌سازی داده‌ها بوده است. با این حال، با تکامل استک‌های داده از پردازش دسته‌ای ساده به جریان‌های بلادرنگ، انبارهای ویژگی و معماری‌های لیک‌هاوس، مدل سنتی DAG مبتنی بر «تسک» اغلب احساسی از سختی و پیچیدگی ایجاد می‌کند. بسیاری از تیم‌های مهندسی اکنون به نسل بعدی ابزارهای هم‌زمان‌سازی، به‌طور خاص داگستر و پریفکت، نگاه می‌کنند.

تسلط بر خاصیت تکرارپذیری و معنای دقیقاً یک‌بار در آپاچی کافکا

در حوزه مهندسی داده با پهنای باند بالا، تضمین یکپارچگی داده از اهمیت بنیادینی برخوردار است. هنگام کار با جریان‌های رویداد توزیع‌شده، مفاهیم تحویل «حداقل یک‌بار» و «دقیقاً یک‌بار» صرفاً نظری نیستند، بلکه برای ساخت پایپ‌لاین‌های قابل اعتماد حیاتی هستند. با این حال، دستیابی به معنای واقعی دقیقاً یک‌بار در...

تسلط بر Presto: موتور SQL با عملکرد بالا برای کلان‌داده

در مهندسی داده‌های مدرن، سرعت تنها یک لوکس نیست؛ بلکه یک ضرورت است. با انباشتن پتابایت‌ها داده در سیلوهای پراکنده، نیاز به لایه پرس‌وجوی یکپارچه و پرسرعت حیاتی می‌شود. Presto (که اکنون به PrestoSQL و Trino تقسیم شده) وارد میدان می‌شود...

تسلط بر Apache Flink: سفری عمیق به پردازش جریان بلادرنگ برای مهندسان داده

در منظره سریعاً در حال تحول مهندسی داده، مرز بین پردازش دسته‌ای و جریان در حال محو شدن است. سازمان‌ها امروزه نه تنها به بینش از داده‌های تاریخی، بلکه از رویدادهای زنده در لحظه وقوع نیاز دارند. اینجا است که Apache Flink به عنوان غول صنعت ظاهر می‌شود...