Data Engineering

فراتر از ایرفلو: ارزیابی داگستر و پریفکت برای هم‌زمان‌سازی داده‌های مدرن

بیش از یک دهه است که آپاچی ایرفلو پادشاه بی‌رقیب هم‌زمان‌سازی داده‌ها بوده است. با این حال، با تکامل استک‌های داده از پردازش دسته‌ای ساده به جریان‌های بلادرنگ، انبارهای ویژگی و معماری‌های لیک‌هاوس، مدل سنتی DAG مبتنی بر «تسک» اغلب احساسی از سختی و پیچیدگی ایجاد می‌کند. بسیاری از تیم‌های مهندسی اکنون به نسل بعدی ابزارهای هم‌زمان‌سازی، به‌طور خاص داگستر و پریفکت، نگاه می‌کنند. هر دو رابط‌های کاربری مدرن، قابلیت‌های بومی ابری و گذار به سمت جریان‌های کاری مبتنی بر دارایی ارائه می‌دهند. اما کدام‌یک به نیازهای تیم شما پاسخ می‌دهد؟ این پست به تفاوت‌های معماری، پارادایم‌های کدنویسی و پیامدهای عملی انتخاب بین این دو ستاره در حال ظهور می‌پردازد.

تغییر پارادایم: تسک‌ها در مقابل دارایی‌ها

تفاوت اصلی بین این ابزارهای مدرن و ایرفلو، گذار از تسک‌ها به دارایی‌ها است. در ایرفلو، شما یک خط لوله را به عنوان یک توالی از عملیات (تسک‌ها) تعریف می‌کنید که داده را تبدیل می‌کنند. خود داده اغلب یک محصول جانبی ضمنی است. با این حال، در داگستر، دارایی واحد اصلی تعریف است. شما توضیح می‌دهید که چه داده‌ای می‌خواهید تولید کنید (مثلاً sales_by_region) و چارچوب کاری نحوه محاسبه آن و مدیریت تازگی آن را تعیین می‌کند.

پریفکت رویکردی مشابه اما کمی متفاوت را اتخاذ می‌کند که بر جریان‌ها و تسک‌ها تمرکز دارد، اما با یک مدل اجرای بسیار انعطاف‌پذیرتر و پایتونی‌تر که از اجرای ترکیبی (محلی و ابری) پشتیبانی می‌کند و به‌صورت بی‌درز با کتابخانه‌هایی مانند pandas، SQL و Spark یکپارچه می‌شود، بدون نیاز به پوشش‌های سخت‌گیرانه.

داگستر: رویکرد مبتنی بر دارایی

داگستر برای سازمان‌هایی طراحی شده است که به دنبال خط‌سیر (Lineage) دقیق داده و قابلیت مشاهده (Observability) هستند. مدل مبتنی بر دارایی آن به شما امکان می‌دهد دقیقاً ببینید کدام دارایی‌ها قدیمی شده‌اند، کدام‌یک تازه هستند و چگونه به یکدیگر وابسته‌اند، صرف‌نظر از اینکه چند خط لوله آن‌ها را تولید می‌کنند.

در اینجا یک مثال ساده از تعریف یک دارایی در داگستر آورده شده است:

import pandas as pd
import dagster as dg

@dg.asset
def raw_sales_csv() -> str:
    # Simulates fetching raw data
    return "s3://bucket/raw_sales.csv"

@dg.asset
def cleaned_sales_df(raw_sales_csv: str) -> pd.DataFrame:
    # Dagster automatically passes the output of raw_sales_csv
    # as an argument if the names match or via InputContext
    df = pd.read_csv(raw_sales_csv)
    return df.dropna()

@dg.asset
def sales_by_region(cleaned_sales_df: pd.DataFrame) -> pd.DataFrame:
    return cleaned_sales_df.groupby('region').sum()

توجه کنید که چگونه وابستگی‌ها را به‌صورت صریح تعریف نمی‌کنیم. داگستر خط‌سیر را بر اساس آرگومان‌های تابع استنباط می‌کند. این امر بازسازی خطوط لوله را به‌طور قابل‌توجهی آسان‌تر می‌کند، زیرا محاسبه را از ساختار داده جدا می‌کنید.

پریفکت: انعطاف‌پذیری و تجربه توسعه‌دهنده

پریفکت اولویت را با تجربه توسعه‌دهنده و انعطاف‌پذیری می‌دهد. این ابزار بهترین عملکرد را زمانی دارد که بخواهید کد خود را ساده و پایتون استاندارد نگه دارید. موتور «فلوویو» پریفکت امکان هم‌زمانی پیشرفته و مدیریت خطا را از همان ابتدا فراهم می‌کند. همچنین تمرکز قوی بر اجرای ترکیبی دارد، به این معنی که می‌توانید منطق هم‌زمان‌سازی خود را در ابر پریفکت اجرا کنید، در حالی که محاسبات واقعی روی زیرساخت خود شما انجام می‌شود.

در اینجا نحوه نمایش همان منطق در پریفکت آمده است:

import pandas as pd
from prefect import flow, task
from prefect.filesystems import S3

@task
def fetch_raw_sales() -> str:
    return "s3://bucket/raw_sales.csv"

@task
def clean_sales(file_path: str) -> pd.DataFrame:
    df = pd.read_csv(file_path)
    return df.dropna()

@task
def aggregate_sales(df: pd.DataFrame) -> pd.DataFrame:
    return df.groupby('region').sum()

@flow(name="Sales Pipeline")
def sales_pipeline():
    file_path = fetch_raw_sales()
    cleaned_df = clean_sales(file_path)
    result = aggregate_sales(cleaned_df)
    return result

API پریفکت برای توسعه‌دهندگانی که با اسکریپت‌نویسی استاندارد پایتون آشنا هستند، بسیار شهودی است. این ابزار مدیریت وضعیت قدرتمند و تلاش مجدد (Retries) را ارائه می‌دهد، بدون اینکه یک ثبت‌نام‌کننده دارایی سخت‌گیرانه را تحمیل کند.

ملاحظات کلیدی برای انتخاب

  • خط‌سیر و حاکمیت: اگر به کاتالوگ‌سازی داده در سطح سازمانی، بررسی‌های خودکار تازگی و حل وابستگی‌های پیچیده بین چندین تیم نیاز دارید، داگستر را انتخاب کنید.
  • انعطاف‌پذیری و سرعت: اگر تیم شما ارزش‌گذاری سریع، منطق پایتون پیچیده یا نیاز به هم‌زمان‌سازی تسک‌های غیرداده‌ای (مثلاً استنتاج ML، فراخوانی API) را در کنار خطوط لوله داده دارد، پریفکت را انتخاب کنید.
  • یکپارچگی اکوسیستم: داگستر یکپارچگی‌های بومی عمیق‌تری با dbt و انبارهای داده دارد. پریفکت یکپارچگی‌های عالی با ابزارهای MLOps و ارائه‌دهندگان ابری دارد.

نتیجه‌گیری

حرکت فراتر از ایرفلو فقط درباره تغییر ابزارها نیست؛ بلکه درباره تغییر مدل ذهنی شماست. اگر مشکل شما «نمی‌دانم کدام داده قدیمی شده یا چگونه تولید شده» است، رویکرد مبتنی بر دارایی داگستر احتمالاً زمان قابل‌توجهی را برای شما صرفه‌جویی می‌کند. اگر مشکل شما «ایرفلو برای جریان‌های کاری پایتون پیچیده من بسیار خشک است» است، پریفکت یک جایگزین سبک‌تر و انعطاف‌پذیرتر ارائه می‌دهد. هر دو انتخاب‌های عالی برای مهندسی داده مدرن هستند و تصمیم نهایی در نهایت به این بستگی دارد که آیا اولویت شما خط‌سیر داده (داگستر) است یا انعطاف‌پذیری توسعه‌دهنده (پریفکت).

Share: