🔧
رتبه ۳۸ از ۱۰رشد ۲۴% سالانه

مهندس خط لوله داده

Data Pipeline Engineer

Data Pipeline Engineer (مهندس خط لوله داده) متخصصی است که سیستم‌های انتقال، تبدیل و توزیع داده را در مقیاس‌های ترابایتی و پتابایتی طراحی، پیاده‌سازی و نگهداری می‌کند. این نقش ستون فقرات هر سازمان داده‌محور است — بدون pipeline قابل اعتماد، نه dashboard مدیریتی کار می‌کند، نه مدل ML آموزش می‌بیند و نه LLM-driven product در production زنده می‌ماند. در ۲۰۲۶ با انفجار حجم داده و معماری‌های real-time مثل Kafka، Flink و lakehouse (Iceberg، Delta، Hudi)، تقاضا برای این تخصص در شرکت‌های FAANG، فین‌تک‌ها و AI startup ها رو به انفجار است و مهندسان ارشد در آمریکا به راحتی به ۲۰۰–۳۰۰هزار دلار TC می‌رسند.

Python/SQLApache SparkKafkaAirflowCloud Data Warehouses

مقدمه و تعریف شغل

مهندس خط لوله داده (Data Pipeline Engineer) متخصصی است که زیرساخت انتقال، تبدیل و تحویل داده را در سازمان طراحی، می‌سازد و نگه می‌دارد. خروجی کار او pipeline هایی است که داده‌های خام را از منابع متنوع (database ها، API ها، event stream ها، فایل‌ها) جمع‌آوری، پاک‌سازی، transform و به مقصد نهایی (data warehouse، ML platform، dashboard) می‌رسانند. این نقش زیربنای هر کاری در شرکت داده‌محور است — از reporting روزانه CEO گرفته تا training مدل LLM در مقیاس میلیارد پارامتری.

تا اوایل دهه ۲۰۱۰، data engineering عمدتاً به نوشتن stored procedure در Oracle و SQL Server خلاصه می‌شد. ظهور Hadoop در ۲۰۰۸ و سپس Spark در ۲۰۱۴ معماری big data را متحول کرد و نقش data engineer به‌عنوان تخصص مستقل ظهور یافت. در ۲۰۱۶ Apache Airflow توسط Airbnb open-source شد و استاندارد orchestration شد. سال‌های ۲۰۱۹–۲۰۲۲ دوران طلایی modern data stack بود: dbt، Snowflake، Fivetran، Looker. اکنون در ۲۰۲۶ ما در عصر lakehouse و real-time هستیم — Iceberg و Delta Lake مرز بین warehouse و lake را برداشته‌اند، Kafka و Flink real-time را عادی کرده‌اند و انفجار AI/LLM ها تقاضا برای داده با کیفیت بالا را به سطح بی‌سابقه‌ای رسانده است. data engineer دیگر یک نقش backstage نیست — مستقیماً موفقیت محصول AI شرکت را تعیین می‌کند.

چه چیزی می‌سازید؟

مثال‌های واقعی از خروجی کار یک مهندس خط لوله داده

🏢

Data Warehouse برای BI و reporting

Airbnb روزانه میلیون‌ها رزرو، جستجو و کلیک را در Druid و Snowflake aggregate می‌کند تا dashboard هایی برای تیم product و executives بسازد. شما dimensional models و pipeline های تغذیه آن‌ها را می‌نویسید.

Real-time Streaming Pipelines

Uber با Kafka و Flink موقعیت میلیون‌ها راننده و سفر را real-time پردازش می‌کند تا surge pricing تنظیم شود. شما consumer ها و stateful operator های Flink را طراحی می‌کنید.

🧮

Feature Store برای ML

DoorDash از Feast feature store استفاده می‌کند تا feature های ML را consistent بین training و serving نگه دارد. شما pipeline های feature computation و سرویس آن‌ها به مدل را می‌سازید.

🏞️

Data Lakehouse با Iceberg/Delta

Netflix در ۲۰۲۴ تمام warehouse خود را به Apache Iceberg migrate کرد تا schema evolution و time-travel داشته باشد. شما migration و قرارداد بین storage و compute engine را طراحی می‌کنید.

🔁

CDC و Database Replication

یک fintech با Debezium از Postgres تراکنش‌ها را CDC می‌کند تا fraud detection real-time روی Kafka اجرا کند. شما connector ها، schema registry و dead-letter queue را تنظیم می‌کنید.

🩺

Data Quality و Observability Platform

Stripe با Monte Carlo و Great Expectations انحراف داده‌های پرداخت را قبل از رسیدن به مدل ML تشخیص می‌دهد. شما test ها، alerting و SLA های داده را تعریف می‌کنید.

تخصص‌های مختلف مهندس خط لوله داده

این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد

مهندس داده Streaming

Streaming Data Engineer

تمرکز روی Kafka، Flink، stateful processing و معماری event-driven. در شرکت‌هایی مثل Uber، LinkedIn، Confluent و Doordash پرتقاضا.

📊

مهندس تحلیل

Analytics Engineer

تمرکز روی لایه dbt و SQL transformation در warehouse. در startup های modern data stack و آژانس‌های تحلیلی مثل Fishtown و dbt Labs محبوب.

🏗️

مهندس platform داده

Platform Data Engineer

ساخت platform داخلی داده مثل Lyft، Spotify و Pinterest — ابزارهای self-service برای ده‌ها تیم دیگر. نیاز به skill های infrastructure قوی.

🧠

مهندس داده ML

ML Data Engineer / Feature Engineer

تخصص feature pipeline و feature store برای تیم‌های ML. در شرکت‌های AI-first مثل OpenAI، Anthropic و Tesla حیاتی است.

🗄️

مهندس Lakehouse

Lakehouse / Storage Engineer

متخصص Iceberg، Delta و Hudi — کار با شرکت‌هایی مثل Databricks، Tabular و Onehouse که آینده storage داده را شکل می‌دهند.

تفاوت با شغل‌های مشابه

کجا این شغل تمام می‌شود و شغل دیگری شروع می‌شود؟

مهندس نرم‌افزارSoftware Engineer

Software Engineer سیستم‌های transactional و user-facing می‌سازد که latency میلی‌ثانیه‌ای دارند. Data Engineer سیستم‌هایی می‌سازد که با حجم‌های ترابایتی کار می‌کنند، throughput مهم‌تر از latency است و خروجی data product است نه UI. دو discipline بسیار متفاوت با ابزارهای مختلف.

مهندس تحلیلAnalytics Engineer

Analytics Engineer روی لایه transformation در warehouse تمرکز دارد — عمدتاً با dbt و SQL کار می‌کند و مدل‌های business-friendly می‌سازد. Data Engineer لایه‌های زیرین (ingestion، storage، compute) را می‌سازد. در شرکت‌های کوچک این دو نقش یکی هستند، در شرکت‌های بزرگ جدا.

مهندس یادگیری ماشینML Engineer

ML Engineer روی training، deployment و serving مدل تمرکز دارد. Data Engineer داده‌ای را که ML Engineer نیاز دارد آماده می‌کند — feature pipeline، training set، label store. مرز بین این دو در feature engineering و feature store به هم می‌رسد.

مدیر پایگاه داده (DBA)Database Administrator

DBA روی operation و tuning یک database خاص (Oracle، Postgres) تمرکز دارد. Data Engineer در سطح بالاتر در ده‌ها سیستم همزمان کار می‌کند و focus او پایداری flow داده است نه یک instance. در ۲۰۲۶ خیلی از DBA ها به سمت data engineering migrate کرده‌اند.

تأثیر در صنایع مختلف

مهندس خط لوله داده در همه صنایع مشغول به کار است — نه فقط شرکت‌های فناوری

🏦

فین‌تک و بانکداری

Pipeline های CDC برای تشخیص fraud real-time، تجمیع تراکنش‌ها برای risk model ها و reporting رگولاتوری در Stripe و JPMorgan

🚖

حمل و نقل و Mobility

Stream processing مکان میلیون‌ها وسیله نقلیه در Uber و Lyft برای matching، surge pricing و ETA prediction

🛒

تجارت الکترونیک

Pipeline های event برای recommendation در Amazon و Shopify، tracking رفتار کاربر و personalization

🎬

رسانه و سرگرمی

Netflix و Spotify روزانه پتابایت‌ها داده پخش را پردازش می‌کنند برای recommendation و کیفیت پخش

🏥

بهداشت و درمان

تجمیع داده‌های EHR، wearable ها و genomics برای تحقیقات پزشکی در Moderna و Cleveland Clinic

🎮

بازی و gaming

Riot Games و Epic روزانه میلیاردها event بازی را stream می‌کنند برای ضدتقلب و تحلیل player behavior

📣

تبلیغات و مارکتینگ

real-time bidding pipeline ها در Google Ads و Meta با latency زیر ۱۰۰ میلی‌ثانیه تصمیم می‌گیرند

🏭

IoT و صنعتی

Tesla و GE داده‌های sensor ها را برای predictive maintenance و autonomy استفاده می‌کنند

تصورات غلط رایج

قبل از تصمیم‌گیری، این باورهای اشتباه را بشناسید

data engineering یعنی فقط نوشتن SQL

SQL لازم است اما کافی نیست. data engineer مدرن باید Python، distributed systems، cloud، Docker، Kafka و معماری lakehouse را بلد باشد. SQL تنها ۲۰–۳۰٪ کار است.

data engineer از data scientist پایین‌تر است

این تصور قدیمی است. data engineer ارشد در FAANG معمولاً بیشتر از data scientist معمولی حقوق می‌گیرد و تقاضا برای آن بالاتر است. بدون pipeline قابل اعتماد هیچ مدل ML کار نمی‌کند.

ابزارهای no-code جای data engineer را می‌گیرند

ابزارهایی مثل Fivetran کار repetitive را آسان کرده‌اند اما نیاز به طراحی معماری، troubleshooting، performance tuning و custom logic همیشه به متخصص نیاز دارد. این ابزارها متمم هستند نه جایگزین.

Hadoop در سال ۲۰۲۶ همچنان آینده دارد

MapReduce سنتی تقریباً مرده است. در ۲۰۲۶ stack مدرن Spark/Flink روی Kubernetes با storage object-based (S3 + Iceberg) است. یاد گرفتن Hadoop classic برای migration ها مفید است نه برای ساخت جدید.

همه چیز real-time باید باشد

۸۰٪ workload های سازمانی با batch روزانه یا ساعتی قابل حل هستند. real-time هزینه پیچیدگی و infrastructure بالایی دارد. data engineer خوب می‌داند کجا real-time واقعاً نیاز است.

یک روز کاری واقعی

در هر سطح روز کاری چه شکلی است؟

جونیور (۰–۲ سال)

بیشتر وقت روی پیاده‌سازی task های مشخص و debug کردن job های failed می‌گذرد. کار با کمک senior engineer و یادگیری stack داخلی شرکت اولویت اول است.

  • صبح: بررسی Airflow UI و resolve job های failed شب گذشته
  • بلاک اول: اضافه کردن یک منبع داده جدید به pipeline موجود طبق spec
  • بعد از ناهار: نوشتن dbt model و test برای یک table تحلیلی جدید
  • عصر: code review از همتا و participate در standup روزانه تیم
  • پایان روز: مستندسازی تغییرات در Confluence یا Notion

میانی (۲–۵ سال)

مالکیت کامل یک data domain (مثلاً Billing یا Marketing) را به عهده دارد. خودش پروژه‌ها را طراحی و پیاده می‌کند و با تیم‌های downstream هماهنگ است.

  • صبح: بررسی Monte Carlo alerts و investigate یک anomaly در داده فروش
  • جلسه با analytics team درباره schema تغییر در event tracking
  • بلاک کدنویسی: refactor یک pipeline Spark برای کاهش هزینه ۳۰٪
  • بعد از ناهار: طراحی data contract بین service تیم product و warehouse
  • عصر: mentoring یک junior engineer و review PR او

ارشد (۵+ سال)

تمرکز روی معماری platform، تصمیم‌های strategic و تأثیرگذاری cross-team. بخش بزرگی از وقت در طراحی، نوشتن RFC و alignment با leadership می‌گذرد.

  • صبح: review پیش‌نویس RFC یک staff engineer دیگر درباره migration به Iceberg
  • جلسه architecture با ML platform team برای طراحی feature store جدید
  • بلاک تخصصی: نوشتن proof-of-concept برای evaluation سه streaming engine
  • بعد از ناهار: جلسه با CTO درباره data strategy کوارتر بعدی و cost optimization
  • عصر: مستندسازی trade-off ها در یک ADR (Architecture Decision Record) رسمی

مسئولیت‌ها و وظایف

مسئولیت‌های اصلی

وظایف روزانه و مهارت‌های مورد نیاز در این شغل

فنی
  • طراحی و پیاده‌سازی pipeline های batch و streaming برای انتقال داده بین سیستم‌ها
  • نوشتن transformation های idempotent و قابل اعتماد با dbt و Spark
  • بهینه‌سازی query performance و کاهش هزینه warehouse (Snowflake، BigQuery)
  • طراحی schema، data modeling و مدیریت data contract بین تیم‌ها
  • پیاده‌سازی data quality tests و monitoring برای جلوگیری از silent failures
  • نگهداری Kafka cluster و troubleshooting consumer lag در سیستم‌های real-time
مهارت نرم
  • همکاری با data scientist و analytics engineer برای تأمین داده مورد نیاز
  • مستندسازی pipeline ها و آموزش تیم‌های downstream برای استفاده درست از داده

مهارت‌های مورد نیاز

مهارت‌های فنی، نرم و حوزه‌ای که یک مهندس خط لوله داده موفق به آن‌ها نیاز دارد

مهارت‌های فنی پایه

Python برای دادهضروری

تسلط بر pandas، PySpark، async و نوشتن کد قابل نگهداری برای pipeline ها

SQL پیشرفتهضروری

تسلط بر window functions، CTE، query plan reading و optimization در warehouse

Distributed Systemsضروری

درک CAP theorem، consistency models، partitioning و replication

Apache Sparkضروری

نوشتن job های PySpark/Scala، tuning shuffle و درک Catalyst optimizer

Apache Kafkaضروری

طراحی topic، partition strategy، consumer group ها و schema registry

Airflow / Orchestrationضروری

نوشتن DAG های idempotent، استفاده درست از sensor ها و backfill ها

Data Modelingمهم

Dimensional modeling (Kimball)، Data Vault و slowly changing dimensions

Cloud و Platform

Cloud Warehouse (Snowflake/BigQuery)ضروری

warehousing، micro-partitions و cost optimization در platform های cloud

Lakehouse (Iceberg/Delta)مهم

table formats مدرن، schema evolution و time-travel queries

Docker و Kubernetesمهم

containerization پایه و درک deployment روی k8s برای data services

Terraform / IaCمهم

مدیریت زیرساخت داده به شکل کد برای reproducibility

Observability دادهمفید

ابزارهایی مثل Monte Carlo، Datafold، Great Expectations برای data quality

CI/CD برای دیتامفید

آزمایش خودکار dbt model ها و pipeline ها در GitHub Actions یا GitLab

مهارت‌های نرم

ارتباط با stakeholder هاضروری

ترجمه نیاز business به requirement فنی و توضیح limitation های pipeline

تفکر سیستمیضروری

دیدن کل flow داده از source تا consumer و انتظار شکست در هر نقطه

مستندسازیمهم

نوشتن README، runbook و ADR قابل فهم برای onboarding سریع همتیمی‌ها

Cost awarenessمهم

حساسیت به هزینه cloud و توانایی محاسبه ROI optimization ها

On-call و SRE mindsetمفید

آرامش در incident response، نوشتن postmortem و یادگیری از خرابی‌ها

ضروری — بدون آن نمی‌توان وارد بازار کار شدمهم — تفاوت بین جونیور و میانیمفید — مزیت رقابتی

نقشه راه و مسیر آموزشی

نقشه راه تبدیل شدن به مهندس خط لوله داده

این مسیر گام به گام شما را از صفر تا حرفه‌ای هدایت می‌کند.

1

پایه‌های Python، SQL و سیستم‌های داده

⏱️ ۳ تا ۴ ماه

تسلط بر دو ابزار اصلی data engineer یعنی Python و SQL پیشرفته، در کنار درک مفهومی از relational و OLTP/OLAP systems

Python (pandas, requests, asyncio)SQL پیشرفته (window functions, CTE)Database Design & NormalizationPostgreSQL / MySQLLinux & BashGit & GitHub
2

ETL/ELT و Orchestration

⏱️ ۲ تا ۳ ماه

ساخت اولین pipeline های batch با Airflow و dbt — یاد گرفتن idempotency، scheduling و dependency management

Apache Airflowdbt (Data Build Tool)Dimensional Modeling (Kimball)Incremental LoadsData Quality & TestingDocker
3

Big Data و Distributed Computing

⏱️ ۳ تا ۴ ماه

ورود به دنیای داده‌های ترابایتی با Spark، درک partitioning، shuffle و optimization در سیستم‌های توزیع‌شده

Apache Spark (PySpark)Hadoop Ecosystem (HDFS, YARN)Distributed Systems ConceptsParquet & Columnar FormatsData Lake ArchitecturePerformance Tuning
4

Streaming و Real-time Pipelines

⏱️ ۳ تا ۴ ماه

گذر از batch به real-time — Kafka، Flink و معماری event-driven که در فین‌تک، ads و real-time analytics ضروری است

Apache KafkaKafka Connect & Schema RegistryApache Flink / Spark StreamingChange Data Capture (CDC) با DebeziumLambda & Kappa ArchitectureEvent-Driven Design
5

Cloud، Lakehouse و DataOps

⏱️ مداوم

تخصصی شدن در یک cloud provider، lakehouse formats مدرن (Iceberg/Delta) و عملیات production-grade داده

AWS (S3, Glue, EMR, Redshift) یا GCP (BigQuery, Dataflow)Snowflake / DatabricksApache Iceberg / Delta LakeTerraform & IaCData Observability (Monte Carlo, Great Expectations)Data Contracts & Mesh

ابزارها و استک فنی

ابزارهایی که هر مهندس AI باید بشناسد، دسته‌بندی‌شده بر اساس اولویت

زبان‌ها و Querying

Python

زبان غالب در data engineering برای orchestration و ETL — اکوسیستم گسترده و خوانا

ضروری
SQL

زبان مادر هر data engineer — از warehouse queries تا dbt transformations

ضروری
Scala

زبان native Apache Spark — در شرکت‌های بزرگ و JVM-heavy استفاده می‌شود

مفید
Java

هنوز در core Kafka، Flink و legacy Hadoop ecosystem حیاتی است

مفید

Orchestration و Transformation

Apache Airflow

استاندارد صنعتی برای scheduling pipeline ها — DAG-based و قابل extension

ضروری
dbt

ابزار transformation با SQL در warehouse — انقلابی در analytics engineering

ضروری
Prefect

جایگزین مدرن Airflow با developer experience بهتر — در startup ها محبوب

مفید
Dagster

orchestrator نسل جدید با تمرکز بر data assets و observability

مفید

Big Data و Streaming

Apache Spark

موتور توزیع‌شده اصلی برای batch processing در مقیاس پتابایت

ضروری
Apache Kafka

platform استاندارد برای event streaming — قلب معماری‌های real-time

ضروری
Apache Flink

موتور true-streaming با low-latency — انتخاب اول برای complex event processing

پیشرفته
Apache Iceberg

table format نسل جدید برای lakehouse — schema evolution و time-travel

پیشرفته

Cloud Data Warehouses و Storage

Snowflake

محبوب‌ترین cloud data warehouse — separate storage/compute و auto-scaling

ضروری
Google BigQuery

warehouse serverless گوگل — استاندارد در ads و ML pipelines

ضروری
Databricks

lakehouse platform مبتنی بر Spark و Delta Lake — برای ML/AI workloads

مفید
AWS S3 + Glue + Redshift

stack رایج AWS برای data lake و warehouse — اکثر startup های آمریکایی

مفید
ضروری — باید یاد بگیریدمفید — ارزش یادگیری داردپیشرفته — برای سطوح ارشد

مسیر پیشرفت شغلی

از جونیور تا Staff Engineer — چه مهارت‌هایی نیاز دارید و چه درآمدی انتظار داشته باشید

Junior Data Engineer

۰ تا ۲ سال

~$85K

میانگین سالانه (آمریکا)

نوشتن pipeline های ساده با Airflow و dbt، debugging job های failed، نگهداری ETL های موجود

PythonSQLAirflowGitBasic Cloud

Mid-Level Data Engineer

۲ تا ۵ سال

~$135K

میانگین سالانه (آمریکا)

طراحی end-to-end pipeline ها، مالکیت data domain، بهینه‌سازی performance و کاهش هزینه cloud

SparkKafkadbtSnowflake/BigQueryData Modeling

Senior Data Engineer

۵ تا ۸ سال

~$195K

میانگین سالانه (آمریکا)

معماری platform داده، رهبری فنی پروژه‌های cross-team، تصمیم‌گیری درباره stack و migration ها

Distributed SystemsLakehouse ArchitectureMentorshipCost OptimizationData Governance

Staff / Principal Data Engineer

۸+ سال

~$285K

میانگین سالانه (آمریکا)

تعریف data strategy سازمان، طراحی data platform در مقیاس FAANG، همکاری با VP Engineering

Platform ArchitectureData MeshOrg DesignTechnical StrategyCross-team Leadership

چالش‌ها و جنبه‌های منفی

واقعیت‌هایی که کمتر در آگهی‌های شغلی می‌بینید — قبل از ورود بدانید

فرسودگی از on-call شبانه

عمومی

Pipeline ها در نیمه‌شب می‌شکنند چون upstream API تغییر کرده، schema عوض شده یا dependency بالا رفته است. data engineer ارشد معمولاً on-call rotation دارد و این یکی از سخت‌ترین جنبه‌های شغل است. شرکت‌های خوب با runbook، self-healing و alerting هوشمند این فشار را کم می‌کنند.

Schema drift و breaking change

شرکت بزرگ

وقتی تیم product بدون اطلاع، یک column در event حذف می‌کند یا type را عوض می‌کند، pipeline downstream می‌شکند و dashboard ها خالی می‌شوند. حل این مسئله نیاز به data contracts، schema registry و فرهنگ سازمانی دارد — نه فقط ابزار.

هزینه‌های انفجاری cloud

شرکت بزرگ

یک query بد در Snowflake یا یک Spark job بدون partition pruning می‌تواند هزار دلار در ساعت بسوزاند. در ۲۰۲۶ FinOps برای دیتا یک مهارت مستقل شده و خیلی از تیم‌ها dedicated cost engineer دارند.

ابزار سازی بیش از حد

استارتاپ

modern data stack ده‌ها ابزار دارد: dbt، Airflow، Fivetran، Hightouch، Monte Carlo، Snowflake و غیره. در startup ها وسوسه استفاده از همه آن‌ها زیاد است اما هر ابزار هزینه نگهداری و یادگیری دارد. ساده نگه داشتن stack هنر است.

تأخیر بین batch و real-time

عمومی

تیم product می‌خواهد dashboard real-time باشد اما زیرساخت batch است. ساخت معماری ترکیبی (Lambda/Kappa) پیچیده و گران است. data engineer باید بتواند انتظارات را مدیریت کند و trade-off ها را شفاف توضیح دهد.

Reproducibility در آزمایش‌های ML

تحقیقاتی

data scientist می‌خواهد نتیجه آزمایش ۳ ماه پیش را reproduce کند اما داده feature ها تغییر کرده‌اند. این نیاز به time-travel، snapshot ها و feature store جدی دارد — یک مسئله تحقیقاتی و عملی نسبتاً جدید در صنعت.

حقوق و بازار کار جهانی

حقوق جهانی مهندس خط لوله داده

میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف

کشورمیانهارز
🇮🇳هند
₹3,200,000INR
🇦🇪امارات
AED 265,000AED
🇺🇸آمریکا
$195,000USD
🇨🇦کانادا
CA$150,000CAD
🇸🇬سنگاپور
SGD 150,000SGD
🇨🇭سوئیس
CHF 145,000CHF
🇦🇺استرالیا
A$140,000AUD
🇬🇧انگلستان
£105,000GBP
🇩🇪آلمان
€95,000EUR
🇳🇱هلند
€92,000EUR

* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شده‌اند.

چگونه از صفر شروع کنیم

برنامه گام‌به‌گام برای ورود به مهندسی هوش مصنوعی

ماه ۱: SQL و Python پایه

تسلط بر SQL در حد window functions و CTE، و Python در حد pandas و کار با API ها

ماه ۲: Database و Data Modeling

یاد گرفتن PostgreSQL، normalization، indexing و مفاهیم Kimball dimensional modeling

ماه ۳: Airflow و dbt

ساخت اولین DAG و اولین dbt project با یک dataset عمومی (NYC Taxi یا COVID)

ماه ۴: Cloud Warehouse

ساخت trial account در Snowflake یا BigQuery و انتقال pipeline به cloud

ماه ۵: Spark و Big Data

یاد گرفتن PySpark در Databricks Community Edition و کار با dataset چند گیگابایتی

ماه ۶: پروژه پایانی و رزومه

یک پروژه end-to-end در GitHub مستند کنید و شروع به apply کردن برای junior role ها بکنید

پروژه‌های پیشنهادی برای رزومه

ETL پایه با Airflow و PostgreSQL

مبتدی

یک DAG در Airflow بسازید که هر روز داده‌های یک API عمومی (مثل OpenWeather یا CoinGecko) را می‌گیرد، تمیز می‌کند و در PostgreSQL ذخیره می‌کند.

PythonApache AirflowPostgreSQLDocker
زمان تخمینی: ۲ هفته

Data Warehouse مدرن با dbt + Snowflake

متوسط

یک warehouse کوچک با dataset عمومی (مثل NYC Taxi Trips) بسازید. مدل‌های dimensional با dbt تعریف کنید و dashboard در Metabase یا Superset بسازید.

SnowflakedbtPythonMetabase
زمان تخمینی: ۳ هفته

Streaming Pipeline با Kafka

متوسط

یک سیستم real-time بسازید: producer در Python داده‌های شبیه‌سازی‌شده تراکنش می‌فرستد، Kafka آن‌ها را transport می‌کند و consumer تحلیل real-time انجام می‌دهد و در ClickHouse ذخیره می‌کند.

Apache KafkaPythonClickHouseDocker Compose
زمان تخمینی: ۳ هفته

Lakehouse با Spark و Iceberg

پیشرفته

یک data lakehouse روی S3 یا MinIO بسازید. داده‌های Parquet را به Iceberg tables تبدیل کنید، با Spark transformation بزنید و time-travel queries را امتحان کنید.

Apache SparkApache IcebergMinIO/S3Trino
زمان تخمینی: ۴ هفته

Platform End-to-End با CDC و Observability

پیشرفته

از PostgreSQL با Debezium داده‌ها را CDC کنید، در Kafka stream کنید، با Flink پردازش کنید و در Iceberg ذخیره کنید. Great Expectations برای data quality و Grafana برای monitoring اضافه کنید.

DebeziumKafkaFlinkIcebergGreat ExpectationsGrafana
زمان تخمینی: ۶ هفته

مثال‌های واقعی و Case Studies

داستان‌های واقعی از مهندسانی که در این حوزه تأثیرگذار بوده‌اند

M

Maxime Beauchemin

پیشینه

مهندس فرانسوی-کانادایی که کارش را در Yahoo، Facebook و سپس Airbnb و Lyft انجام داد. در ۲۰۲۱ شرکت Preset را تأسیس کرد و امروز یکی از تأثیرگذارترین چهره‌های data engineering مدرن است.

دستاورد

خالق Apache Airflow در Airbnb (۲۰۱۴) و Apache Superset که هر دو از پروژه‌های top-level Apache Software Foundation هستند. مقاله معروف «The Rise of the Data Engineer» در ۲۰۱۷ نقش data engineer مدرن را تعریف کرد و امروز هزاران شرکت با استانداردهای او pipeline می‌سازند.

درس کلیدی

گاهی بزرگ‌ترین تأثیرگذاری از open-source کردن ابزار داخلی شرکت می‌آید. Maxime نشان داد یک مهندس می‌تواند با یک پروژه drowning-in-data مثل Airflow کل صنعت را شکل دهد.

J

Jay Kreps

پیشینه

مهندس آمریکایی، Principal Software Engineer در LinkedIn (۲۰۰۷–۲۰۱۴) و سپس بنیان‌گذار و CEO شرکت Confluent که در ۲۰۲۱ با ارزش‌گذاری بیش از ۹ میلیارد دلار IPO شد.

دستاورد

یکی از خالقان اصلی Apache Kafka در LinkedIn که امروز در بیش از ۸۰٪ شرکت‌های Fortune 100 استفاده می‌شود. مقاله «The Log: What every software engineer should know about real-time data's unifying abstraction» در ۲۰۱۳ پایه نظری معماری event-driven مدرن را گذاشت.

درس کلیدی

پشت هر ابزار صنعتی موفق یک ایده مفهومی قوی هست. Jay با نوشتن مقاله‌ای که logs را به‌عنوان core abstraction معرفی کرد، چارچوب فکری نسل بعدی data engineer ها را ساخت.

M

Matei Zaharia

پیشینه

مهندس رومانیایی-کانادایی، دکترای UC Berkeley (۲۰۱۳)، استاد Stanford و co-founder و CTO شرکت Databricks که در ۲۰۲۴ به ارزش‌گذاری ۶۲ میلیارد دلار رسید.

دستاورد

خالق Apache Spark در Berkeley AMPLab (۲۰۰۹) که جانشین Hadoop MapReduce شد و امروز موتور compute اصلی صنعت big data است. همچنین در توسعه Delta Lake و MLflow نقش کلیدی داشت. در ۲۰۲۳ پروژه DSPy را برای automating prompt engineering open-source کرد.

درس کلیدی

ترکیب پژوهش آکادمیک سطح بالا با کسب‌وکار قابل اجراست. Matei نشان داد می‌توان همزمان استاد دانشگاه برتر بود، شرکتی ده‌ها میلیارد دلاری ساخت و چندین پروژه open-source تأثیرگذار را رهبری کرد.

نمونه آگهی استخدام واقعی + تحلیل

یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش

Senior Data Engineer, Data Platform

Stripeسان فرانسیسکو / سیاتل / Remote آمریکا2025-09
مشاهده آگهی اصلی

تحلیل نیازمندی‌ها

EN

5+ years of experience building data pipelines at scale

۵ سال در سطح Stripe یعنی tier-1. اگر تجربه شما در startup یا شرکت متوسط است، باید با مثال‌های مشخص از scale (مثل «روزانه ۱۰۰ میلیون event پردازش کردم») نشان دهید که آماده‌اید.

ضروری
EN

Strong programming skills in Python or Scala

Stripe stack داخلی Scala-heavy است. Python کافی است برای apply اما اگر Scala بلدید، مزیت بزرگی است. تمرین با PySpark می‌تواند پل خوبی به Scala باشد.

ضروری
EN

Deep experience with distributed compute frameworks like Spark or Flink

نه آشنایی سطحی، بلکه deep experience. باید بتوانید درباره shuffle، skew، partitioning و tuning صحبت کنید. مطالعه Spark internals و کار با dataset چند ترابایتی توصیه می‌شود.

ضروری
EN

Experience with workflow orchestration (Airflow, Dagster, etc.)

Airflow استاندارد است اما Stripe به Dagster هم اشاره می‌کند. تجربه با هر کدام پذیرفته است. مهم این است که بتوانید درباره idempotency و recovery patterns صحبت کنید.

ضروری
EN

Familiarity with streaming systems (Kafka, Kinesis, Pub/Sub)

Stripe برای fraud detection به streaming نیاز دارد. اگر فقط batch تجربه دارید، یاد گرفتن Kafka basics قبل از مصاحبه ضروری است. Confluent Developer رایگان است.

مهم
EN

Experience with data quality and observability tooling

Stripe به‌شدت به data quality حساس است (تراکنش مالی). تجربه با Great Expectations، Datafold یا Monte Carlo شما را برجسته می‌کند.

مفید

تحلیل مسئولیت‌ها

EN

Design and build scalable data pipelines that power Stripe's analytics and machine learning

این یعنی pipeline شما هم BI team تغذیه می‌کند و هم ML model های fraud detection. نیاز به طراحی schema مشترک، contract ها و SLA های شفاف است.

EN

Partner with data scientists, analysts, and engineers to deliver high-quality datasets

Stripe فرهنگ collaborative دارد. این یعنی بخشی از کار شما RFC نوشتن، review کردن و alignment با تیم‌های مختلف است — نه فقط کدنویسی.

EN

Improve data infrastructure reliability, performance, and cost-efficiency

سه پیلار کلاسیک data engineering. در مصاحبه احتمالاً درباره trade-off بین این سه می‌پرسند. مطالعه «cost-aware engineering» در FinOps community توصیه می‌شود.

EN

Define and evangelize best practices for data modeling and governance

نقش senior یعنی صدا داشتن در تصمیم‌گیری. اگر تجربه نوشتن style guide یا data contract در شرکت قبلی دارید، حتماً در مصاحبه مطرح کنید.

نتیجه‌گیری کلی

این آگهی تصویر دقیق یک senior data engineer در یک fintech tier-1 را نشان می‌دهد: ترکیبی از تخصص عمیق فنی (Spark، streaming، orchestration)، sense قوی برای reliability و cost، و توانایی همکاری cross-functional. اگر می‌خواهید به Stripe یا شرکت‌های مشابه برسید، روی build کردن سیستم‌های end-to-end در GitHub و آماده شدن برای system design interview تمرکز کنید.

آینده و روندها

پیش‌بینی ۵–۱۰ ساله و مهارت‌هایی که باید یاد بگیرید

رشد ۱۸–۲۴٪ سالانه تا ۲۰۳۰ — تقاضای جهانی data engineer در ۲۰۲۵ به ۲ میلیون نفر رسید و انتظار می‌رود تا ۲۰۳۰ سه برابر شود

منبع: U.S. Bureau of Labor Statistics + LinkedIn Emerging Jobs Report 2025

مهارت‌های نوظهور که باید یاد بگیرید

Lakehouse Engineering (Iceberg، Delta، Hudi)Data Contracts و Shift-Left QualityReal-time و Streaming-First ArchitectureVector Databases و RAG PipelinesData Mesh و domain-oriented platformDataOps و observability خودکارCost-Aware Engineering و FinOps دیتا

پیش‌بینی‌های آینده

2026

Apache Iceberg به‌عنوان استاندارد de-facto table format در صنعت تثبیت می‌شود و migration از Hive و Delta-only به Iceberg در شرکت‌های بزرگ شدت می‌گیرد

2027

Data Contracts و Shift-Left Quality به practice رایج تبدیل می‌شود — هر event در source باید schema validated باشد قبل از وارد شدن به pipeline

2028

AI-assisted pipeline development عادی می‌شود و ابزارهایی مثل Dagster و Airflow agent های native برای automation خواهند داشت

2030

مرز بین data engineer و ML engineer در شرکت‌های AI-first تقریباً محو می‌شود و یک نقش جدید «AI Data Engineer» با حقوق میانگین ۲۵۰هزار+ دلار شکل می‌گیرد

ریسک‌های واقعی

آیا AI خود data engineer ها را جایگزین می‌کند؟ بخشی از کار repetitive مثل نوشتن schema mapping با ابزارهایی مثل Cursor و Copilot سریع‌تر می‌شود اما طراحی معماری، debug سیستم‌های توزیع‌شده و تصمیم‌گیری درباره trade-off ها همچنان نیاز به judgment انسانی دارد. مهندسانی که فقط ETL job ساده می‌نویسند بیشتر در معرض ریسک هستند؛ کسانی که platform می‌سازند و معماری طراحی می‌کنند امن‌ترند. همچنین commoditization ابزارها (Fivetran، Airbyte) ممکن است نقش‌های صرفاً integration-focused را کم کند.

ویدیوهای آموزشی

برای راهنمایی شخصی‌سازی‌شده مشاوره بگیرید