📦
رتبه ۳۸ از ۱۰رشد ۲۶% سالانه

مهندس کلان‌داده

Big Data Engineer

مهندس کلان‌داده (Big Data Engineer) متخصصی است که زیرساخت ذخیره‌سازی، پردازش و جریان‌داده‌ی پتابایتی را برای شرکت‌هایی می‌سازد که حجم داده‌شان از مرز ابزارهای سنتی عبور کرده است. این نقش با Spark، Kafka، Flink و data lakehouse هایی مثل Delta و Iceberg سر و کار دارد و قلب تپنده‌ی هر تیم data science، analytics و AI محسوب می‌شود — چون هیچ مدلی بدون pipeline قابل اعتماد scale نمی‌شود. در ۲۰۲۶ با انفجار داده‌های real-time و GenAI، تقاضا برای Big Data Engineer در FAANG و fintech ها به midpoint ۱۸۰هزار دلار رسیده و یکی از stable ترین مسیرهای شغلی data است.

Apache SparkKafkaSQL پیشرفتهCloud (AWS/GCP)Data Modeling

مقدمه و تعریف شغل

مهندس کلان‌داده (Big Data Engineer) متخصصی است که سیستم‌های جمع‌آوری، ذخیره‌سازی، پردازش و تحویل داده در مقیاس‌هایی می‌سازد که ابزارهای سنتی (Postgres تنها، Excel، single-node Python) از پس آن‌ها برنمی‌آیند. این نقش تفاوت ظریفی با Data Engineer عمومی دارد: تمرکز روی پردازش توزیع‌شده (Spark/Flink)، event streaming (Kafka)، و معماری data lakehouse است. خروجی کار یک Big Data Engineer زیربنای هر تصمیم analytics و هر مدل ML در شرکت محسوب می‌شود.

اصطلاح Big Data از حدود ۲۰۰۵ با ظهور Hadoop در Yahoo! وارد ادبیات شد — زمانی که شرکت‌ها برای اولین بار با داده‌هایی مواجه شدند که در یک سرور جا نمی‌گرفت. دهه‌ی ۲۰۱۰ با Spark (۲۰۱۴) و Kafka (۲۰۱۱) به دوران طلایی این حوزه تبدیل شد. در ۲۰۱۸–۲۰۲۲ ظهور cloud warehouse هایی مثل Snowflake و BigQuery، خیلی از مهندسان را به سمت modern data stack برد و گفتند 'Big Data مرده است'. اما در ۲۰۲۳ به بعد با انفجار حجم event ها (IoT، logs، GenAI)، table format هایی مثل Iceberg و Delta، و نیاز به real-time analytics، نقش Big Data Engineer دوباره مرکز توجه شد. در ۲۰۲۶، این تخصص یکی از پایدارترین مسیرهای حوزه‌ی data است چون هیچ AI agent یا LLM ای بدون داده‌ی تمیز و قابل اعتماد scale نمی‌شود.

چه چیزی می‌سازید؟

مثال‌های واقعی از خروجی کار یک مهندس کلان‌داده

🛰️

Event Pipeline چند میلیارد رکوردی

Uber هر روز میلیاردها event سفر، تخفیف و GPS را از طریق Kafka جمع می‌کند و با Flink در real-time برای pricing dynamic پردازش می‌کند — تمام این infrastructure توسط Big Data Engineer ها ساخته شده.

🏗️

Data Lakehouse سازمانی

Apple با Iceberg و Spark یک lakehouse داخلی دارد که هزاران تحلیل‌گر و دانشمند داده روزانه از آن استفاده می‌کنند — schema evolution، time travel و ACID transactions همه را Big Data Engineer ها فعال می‌کنند.

🚨

Streaming Analytics برای fraud detection

Stripe در زمان sub-second هر تراکنش را با feature های historical join می‌کند تا fraud را detect کند. این pipeline با Kafka، Flink و feature store ساخته شده.

🎵

Data Platform برای تیم‌های ML

Spotify برای تیم recommendation یک platform داخلی به نام Klio ساخته که داده، feature و training pipeline را یکپارچه می‌کند — کار اصلی Big Data Engineer ها در ML platform team است.

📊

Pipeline تحلیلی برای Decision Making

Airbnb داشبوردهای Superset را با pipeline های dbt + Spark تغذیه می‌کند که میلیاردها رزرو و جستجو را به metric های قابل اعتماد تبدیل می‌کنند — این کل تصمیم‌گیری شرکت را driven می‌کند.

🔄

CDC و Replication بین سیستم‌ها

Shopify از Debezium و Kafka برای انتقال real-time تغییرات Postgres به lakehouse استفاده می‌کند تا analytics تأخیر کمتر از ۱ دقیقه داشته باشد.

تخصص‌های مختلف مهندس کلان‌داده

این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد

🌊

مهندس استریمینگ

Streaming Engineer

تخصص در Kafka، Flink و event-driven architecture — نقش حیاتی در شرکت‌هایی مثل Uber، Netflix و LinkedIn که real-time data ستون فقرات‌شان است.

🏛️

معمار Lakehouse

Lakehouse Architect

طراحی معماری data lakehouse با Iceberg/Delta روی AWS یا GCP — تخصص پرتقاضا در Databricks، Apple و Netflix.

🧱

مهندس پلتفرم ML

ML Platform Engineer

ساخت feature store و training pipeline برای تیم‌های data science — در شرکت‌هایی مثل Spotify، DoorDash و Pinterest نقش کلیدی دارد.

🛡️

مهندس قابلیت اطمینان داده

Data Reliability Engineer

تمرکز روی observability، data quality و SLA — نقش جدیدی که شرکت‌هایی مثل Monte Carlo و Acceldata در حال محبوب‌تر کردنش هستند.

📐

مهندس زیرساخت تحلیل

Analytics Infrastructure Engineer

ساخت warehouse، semantic layer و BI infrastructure — تخصص محبوب در fintech و SaaS های B2B.

تفاوت با شغل‌های مشابه

کجا این شغل تمام می‌شود و شغل دیگری شروع می‌شود؟

مهندس داده عمومیData Engineer

Data Engineer عمومی روی modern data stack (Snowflake + dbt + Airflow) با scale متوسط (تا چند TB) کار می‌کند. Big Data Engineer زمانی وارد می‌شود که scale به PB می‌رسد یا نیاز به streaming حقیقی هست — Spark internals، Kafka tuning و معماری توزیع‌شده دانش روزمره اوست.

مهندس تحلیلAnalytics Engineer

Analytics Engineer روی لایه‌ی transformation (عمدتاً dbt) و business logic تمرکز دارد — خروجی او metric layer و marts است. Big Data Engineer زیرساخت زیر این لایه را می‌سازد: ingest، storage، compute. این دو نقش در modern data team مکمل هم هستند.

مهندس یادگیری ماشینML Engineer

ML Engineer روی training، serving و evaluation مدل تمرکز دارد. Big Data Engineer داده‌ای را تأمین می‌کند که ML Engineer روی آن کار می‌کند — feature store، training dataset و pipeline ETL همه upstream نقش ML Engineer قرار دارند.

مهندس قابلیت اطمینان دادهSite Reliability Engineer (Data SRE)

Data SRE روی uptime، SLA و incident response تمرکز دارد و معمولاً Spark/Kafka cluster ها را operate می‌کند. Big Data Engineer بیشتر روی طراحی و توسعه pipeline تمرکز دارد. در تیم‌های بزرگ این دو نقش جدا است؛ در استارتاپ یک نفر هر دو را انجام می‌دهد.

تأثیر در صنایع مختلف

مهندس کلان‌داده در همه صنایع مشغول به کار است — نه فقط شرکت‌های فناوری

🛒

خرده‌فروشی و ای‌کامرس

Amazon و Walmart از pipeline های پتابایتی برای پیش‌بینی موجودی، dynamic pricing و personalization در real-time استفاده می‌کنند

🏦

بانک و fintech

JPMorgan و Stripe streaming pipeline های real-time fraud detection و risk scoring با sub-second latency راه‌اندازی کرده‌اند

🚖

حمل‌و‌نقل و mobility

Uber و Lyft تمام pricing، matching و ETA prediction را روی Flink/Kafka با تأخیر کمتر از ۵۰ms اجرا می‌کنند

🎬

رسانه و streaming

Netflix داده‌ی تماشای صدها میلیون کاربر را با Iceberg ذخیره و با Spark برای توصیه‌گر تحلیل می‌کند

📣

تبلیغات دیجیتال

Meta و Google میلیاردها ad event را در real-time برای bidding و targeting پردازش می‌کنند

🎮

بازی‌سازی

Riot Games و Epic از Kafka برای telemetry و pipeline های Spark برای matchmaking analytics استفاده می‌کنند

🏥

بهداشت و درمان

Cerner و Epic data lakehouse هایی می‌سازند که EHR، imaging و genomics را برای population health analytics ادغام می‌کنند

🏭

صنعت و IoT

Tesla و Siemens داده‌ی حسگرهای میلیاردی روزانه را برای predictive maintenance و quality control می‌خوانند

تصورات غلط رایج

قبل از تصمیم‌گیری، این باورهای اشتباه را بشناسید

Big Data مرده است و همه چیز روی Snowflake کار می‌کند

Snowflake برای analytics warehouse عالی است اما برای streaming، حجم خام چند پتابایت و use case های ML platform، Spark و Kafka و lakehouse همچنان غالب‌اند. این یک افسانه‌ی LinkedIn است که توسط فروشندگان SaaS تقویت می‌شود.

باید Hadoop یاد بگیرید

Hadoop در ۲۰۲۶ تقریباً منسوخ است. HDFS هنوز در شرکت‌های legacy وجود دارد اما تمرکز جدید روی S3/GCS + Spark + Iceberg است. وقت‌تان را روی MapReduce نگذارید.

Big Data Engineering فقط نوشتن SQL است

SQL مهم است ولی روزانه با distributed systems، JVM tuning، Kafka partitioning و معماری cloud درگیر هستید. SQL تنها بخش کوچکی از job است.

نیاز به دکترا یا پس‌زمینه‌ی علمی دارد

بر خلاف data science یا ML research، Big Data Engineering تماماً مهندسی است. کسانی که از backend دولوپمنت یا DevOps می‌آیند معمولاً سریع‌تر از کسانی که فقط statistics خوانده‌اند، رشد می‌کنند.

AI همه‌ی pipeline ها را خودکار می‌کند

AI Code Assistant ها در نوشتن یک Spark job ساده کمک می‌کنند اما طراحی معماری، انتخاب partitioning strategy، debug skew و incident response هنوز نیاز به مهندس انسانی دارند — این کارها edge case های زیادی دارند.

یک روز کاری واقعی

در هر سطح روز کاری چه شکلی است؟

جونیور (۰–۲ سال)

تمرکز روی یادگیری ابزارها و حل تسک‌های مشخص. بیشتر کارها نوشتن DAG، fix باگ‌های pipeline و کوئری SQL برای تیم analytics است. خیلی از وقت صرف شناخت data model داخلی می‌شود.

  • صبح: standup و بررسی pipeline های شکست‌خورده شب گذشته
  • بلاک اول: پیاده‌سازی یک DAG جدید Airflow بر اساس spec
  • بعدازظهر: کوئری ad-hoc برای تیم analytics روی Snowflake/BigQuery
  • عصر: code review جزیی + مطالعه‌ی Spark documentation
  • پایان روز: به‌روزرسانی Jira و آماده‌سازی PR

میانی (۲–۵ سال)

تعادل بین کدنویسی و تصمیم‌گیری فنی. مسئول طراحی pipeline های جدید و tuning آن‌هایی که کند یا گران شده‌اند. شروع به مشارکت در architecture review می‌کند.

  • صبح: بررسی dashboards هزینه و performance روی Databricks/EMR
  • جلسه ۳۰ دقیقه با data scientist: مذاکره روی feature spec
  • بلاک عمیق: tuning یک Spark job که از ۴ ساعت به ۴۵ دقیقه کاهش پیدا کند
  • بعدازظهر: مرور طراحی pipeline streaming جدید با Kafka
  • عصر: منتورینگ یک جونیور + نوشتن RFC برای migration به Iceberg

ارشد (۵+ سال)

تمرکز روی architecture و impact. کدنویسی محدود به بخش‌های حیاتی است. بخش زیادی از وقت صرف هماهنگی بین تیم‌ها، vendor evaluation و mentorship می‌شود.

  • صبح: بررسی incident شب گذشته و postmortem با Data SRE
  • جلسه با VP Data: roadmap سه‌ماهه‌ی platform و budget cloud
  • کدنویسی هدفمند: review و contribution در PR های مهم
  • بعدازظهر: vendor call با Databricks/Confluent برای contract renewal
  • عصر: مصاحبه‌ی استخدامی + نوشتن tech blog داخلی

مسئولیت‌ها و وظایف

مسئولیت‌های اصلی

وظایف روزانه و مهارت‌های مورد نیاز در این شغل

فنی
  • طراحی و پیاده‌سازی pipeline های batch و streaming در مقیاس ترابایت/پتابایت
  • نوشتن و tune کردن Spark job ها و SQL transformation ها برای کاهش هزینه و افزایش سرعت
  • ساخت و نگهداری data lakehouse با Delta یا Iceberg و مدیریت schema evolution
  • راه‌اندازی و عملیات Kafka cluster، طراحی topic و schema با Schema Registry
  • پیاده‌سازی data quality و observability برای جلوگیری از انتشار داده‌ی خراب
  • بهینه‌سازی هزینه‌ی cloud و انتخاب storage tier مناسب برای داده‌ی سرد و گرم
مهارت نرم
  • همکاری با تیم analytics و data science برای تعریف data contract و SLA
مدیریتی
  • هدایت طراحی فنی و review معماری برای پروژه‌های cross-team

مهارت‌های مورد نیاز

مهارت‌های فنی، نرم و حوزه‌ای که یک مهندس کلان‌داده موفق به آن‌ها نیاز دارد

مهارت‌های فنی

SQL پیشرفتهضروری

Window functions، CTE های recursive، query plan analysis روی Snowflake و BigQuery

Python برای دادهضروری

PySpark، pandas، type hints و نوشتن کتابخانه‌ی reusable برای data team

Apache Sparkضروری

درک Catalyst optimizer، broadcast join، AQE و tuning پارتیشن‌ها

Kafka و Streamingضروری

طراحی topic، Schema Registry، consumer group ها و exactly-once semantics

Cloud Platformضروری

تسلط روی یکی از AWS/GCP/Azure در سطح storage، compute و IAM

Data Modelingمهم

Dimensional modeling، Data Vault، normalization و denormalization عمدی برای analytics

Data Lakehouseمهم

کار با Delta یا Iceberg، schema evolution، time travel و table maintenance

مهارت‌های عملیاتی

Orchestrationضروری

Airflow یا Dagster — طراحی DAG، sensor، backfill و idempotency

DataOps و CI/CDمهم

GitHub Actions، test pipeline و deploy خودکار transformation ها

Observability دادهمهم

Great Expectations، Monte Carlo، alerting و freshness check

Infrastructure as Codeمهم

Terraform یا Pulumi برای reproducible deployment platform داده

Kubernetes و Dockerمفید

اجرای Spark on Kubernetes و containerize کردن job ها

Cost Optimizationمهم

محاسبه‌ی هزینه‌ی هر pipeline و انتخاب storage tier درست

مهارت‌های نرم و کسب‌وکار

ترجمه‌ی نیاز کسب‌وکار به data contractضروری

گفت‌وگو با PM و analyst برای تعریف SLA، schema و quality requirement

Incident Responseمهم

ماندن خونسرد در ساعت ۳ صبح و debug سریع pipeline های شکست‌خورده

مستندسازی فنیمهم

نوشتن RFC، runbook و onboarding doc که نسل بعدی هم بتوانند بفهمند

تفکر معماریمهم

ارزیابی trade-off بین build vs buy، managed vs self-hosted و sync vs async

همکاری cross-functionalضروری

کار با data scientist، analyst، PM، DevOps و security بدون اصطکاک

Vendor Managementمفید

ارزیابی Databricks، Snowflake، Confluent و مذاکره‌ی contract — مهم در سطح ارشد

ضروری — بدون آن نمی‌توان وارد بازار کار شدمهم — تفاوت بین جونیور و میانیمفید — مزیت رقابتی

نقشه راه و مسیر آموزشی

نقشه راه تبدیل شدن به مهندس کلان‌داده

این مسیر گام به گام شما را از صفر تا حرفه‌ای هدایت می‌کند.

1

مبانی برنامه‌نویسی، SQL و سیستم‌های توزیع‌شده

⏱️ ۳ تا ۴ ماه

ساخت پایه فنی: Python و SQL در سطح production-grade، Linux، Git و درک مفاهیم سیستم‌های توزیع‌شده (CAP، consistency، sharding) که بدون آن‌ها هیچ ابزار Big Data معنادار نیست.

Python (typing, OOP)SQL پیشرفته (Window functions, CTE)Bash & LinuxGit & GitHubDistributed Systems BasicsData Structures & Algorithms
2

Data Warehousing، Modeling و ETL کلاسیک

⏱️ ۲ تا ۳ ماه

یادگیری اصول data modeling (star/snowflake، SCD، Data Vault)، طراحی data warehouse مدرن (Snowflake، BigQuery، Redshift) و ساخت اولین pipeline های batch با ابزارهای orchestration.

Dimensional Modeling (Kimball)Snowflake / BigQuerydbtAirflowData Vault 2.0Slowly Changing Dimensions
3

Apache Spark و پردازش Batch در مقیاس

⏱️ ۳ تا ۴ ماه

تسلط بر Spark — قلب اکوسیستم Big Data. درک Catalyst optimizer، Tungsten، partitioning، broadcast join، و tuning مرحله‌به‌مرحله pipeline های ترابایتی روی EMR/Databricks.

PySpark & Spark SQLSpark Internals (Catalyst, Tungsten)Partitioning & BucketingDatabricks PlatformDelta LakePerformance Tuning
4

Streaming، Kafka و Lakehouse مدرن

⏱️ ۳ تا ۴ ماه

ورود به دنیای real-time: Kafka، Flink/Structured Streaming، exactly-once semantics و معماری lakehouse با Delta، Iceberg و Hudi. پیاده‌سازی CDC و event-driven pipeline ها.

Apache KafkaKafka Streams / ksqlDBApache FlinkStructured StreamingApache IcebergChange Data Capture (Debezium)
5

Cloud، DataOps و Specialization

⏱️ مداوم

تخصصی شدن در یک cloud (AWS/GCP/Azure)، یادگیری IaC، observability داده، data contracts و gateway هایی مثل governance و quality. در نهایت تمرکز روی یک حوزه (real-time، ML platform، lakehouse).

AWS (S3, EMR, Glue, Kinesis)Terraform & IaCData Quality (Great Expectations)Data Governance (Unity Catalog)Kubernetes & HelmCost Optimization

ابزارها و استک فنی

ابزارهایی که هر مهندس AI باید بشناسد، دسته‌بندی‌شده بر اساس اولویت

موتورهای پردازش

Apache Spark

استاندارد industrial برای پردازش batch و micro-batch روی پتابایت داده

ضروری
Apache Flink

بهترین engine برای true streaming با low-latency و exactly-once semantics

مفید
Databricks Runtime

نسخه‌ی managed و بهینه‌شده Spark با Photon engine — استاندارد enterprise

ضروری
Trino / Presto

query engine توزیع‌شده برای interactive analytics روی data lake

مفید

Streaming و Messaging

Apache Kafka

استاندارد جهانی برای event streaming در شرکت‌هایی مثل LinkedIn، Netflix، Uber

ضروری
Confluent Platform

نسخه‌ی enterprise Kafka با Schema Registry، Connect و ksqlDB

مفید
Debezium

ابزار CDC متن‌باز برای استخراج تغییرات از Postgres، MySQL، MongoDB

مفید
AWS Kinesis

managed streaming در AWS — جایگزین Kafka در stack های AWS-native

پیشرفته

Storage و Lakehouse

Delta Lake

open table format Databricks با ACID، time travel و schema evolution

ضروری
Apache Iceberg

table format مدرن مورد حمایت Netflix، Apple و AWS — استاندارد در حال ظهور

ضروری
Snowflake

data warehouse cloud-native غالب در enterprise برای analytics

مفید
Google BigQuery

serverless data warehouse گوگل — petabyte-scale و serverless

مفید

Orchestration و DataOps

Apache Airflow

محبوب‌ترین orchestrator برای DAG های batch — استاندارد در صنعت

ضروری
dbt

ابزار transformation با SQL — استاندارد modern data stack

ضروری
Dagster

orchestrator نسل جدید با تمرکز روی data asset ها و observability

مفید
Great Expectations

framework data quality برای تعریف و اجرای تست‌های داده

مفید
ضروری — باید یاد بگیریدمفید — ارزش یادگیری داردپیشرفته — برای سطوح ارشد

مسیر پیشرفت شغلی

از جونیور تا Staff Engineer — چه مهارت‌هایی نیاز دارید و چه درآمدی انتظار داشته باشید

مهندس داده جونیور

۰ تا ۲ سال

~$95K

میانگین سالانه (آمریکا)

نوشتن SQL و PySpark job های مشخص، نگهداری DAG های Airflow، debug pipeline های شکست‌خورده

SQLPythonPySparkAirflowGit

مهندس داده میانی

۲ تا ۵ سال

~$145K

میانگین سالانه (آمریکا)

طراحی pipeline ها از صفر، tuning Spark در مقیاس، انتخاب ابزار، منتورینگ جونیورها

Spark TuningKafkaDelta/IcebergCloud (AWS/GCP)Data Modeling

مهندس داده ارشد

۵ تا ۸ سال

~$195K

میانگین سالانه (آمریکا)

معماری lakehouse، طراحی streaming platform، تصمیم‌گیری build vs buy، رهبری فنی تیم

System DesignStreaming ArchitectureData GovernanceCost OptimizationMentoring

Staff / Principal Data Engineer

۸+ سال

~$280K

میانگین سالانه (آمریکا)

تعریف data strategy شرکت، طراحی platform های cross-team، interface با C-level و VP Data

Platform ArchitectureOrg DesignVendor NegotiationData StrategyCross-team Leadership

چالش‌ها و جنبه‌های منفی

واقعیت‌هایی که کمتر در آگهی‌های شغلی می‌بینید — قبل از ورود بدانید

هزینه‌ی cloud خارج از کنترل

شرکت بزرگ

یک Spark job که در dev روی نمونه‌ی کوچک ۱ دلار می‌گیرد، در production روی full dataset ممکن است ماهانه ۱۰۰هزار دلار شود. مدیریت هزینه‌ی Databricks، Snowflake و S3 یک مهارت مستقل و حیاتی است.

Data Skew و Long-tail Partitions

عمومی

وقتی ۹۰٪ داده روی ۱۰٪ کلیدها متمرکز است (مثلاً ۹۰٪ تراکنش‌ها از ۱۰ مشتری بزرگ)، Spark job ها بی‌نهایت کند می‌شوند. شناسایی و حل skew یکی از سخت‌ترین مهارت‌های Big Data Engineering است.

Schema Evolution در lake

عمومی

تیم backend بدون اطلاع schema یک event را تغییر می‌دهد و pipeline شما در نیمه‌شب می‌شکند. data contract، schema registry و versioning این درد را کم می‌کنند اما هرگز کاملاً حلش نمی‌کنند.

تصمیم build vs buy

استارتاپ

آیا روی Airflow self-hosted بمانید یا Astronomer بخرید؟ آیا Kafka را خودتان operate کنید یا Confluent Cloud؟ این تصمیم‌ها میلیون‌ها دلار اثر مالی دارند و واقعاً دشوارند.

Late-arriving و Out-of-order Data

عمومی

در streaming، event ها معمولاً به ترتیب نمی‌رسند. طراحی watermark، windowing و state management برای دقیق بودن aggregation ها در real-time دشوار است و bug های ظریفی تولید می‌کند.

Legacy Migration بدون downtime

شرکت بزرگ

migrate کردن یک Teradata ۱۰ ساله به Databricks lakehouse بدون قطع شدن دsahboard های CFO، می‌تواند چند سال طول بکشد و چندین shadow run همزمان نیاز دارد.

حقوق و بازار کار جهانی

حقوق جهانی مهندس کلان‌داده

میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف

کشورمیانهارز
🇯🇵ژاپن
¥12,000,000JPY
🇮🇳هند
₹3,200,000INR
🇦🇪امارات
AED 250,000AED
🇺🇸آمریکا
$190,000USD
🇨🇦کانادا
CA$150,000CAD
🇸🇬سنگاپور
SGD 150,000SGD
🇨🇭سوئیس
CHF 145,000CHF
🇦🇺استرالیا
A$140,000AUD
🇬🇧انگلستان
£110,000GBP
🇩🇪آلمان
€95,000EUR
🇳🇱هلند
€92,000EUR

* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شده‌اند.

چگونه از صفر شروع کنیم

برنامه گام‌به‌گام برای ورود به مهندسی هوش مصنوعی

ماه ۱: SQL و Python پایه

SQL را تا سطح window functions و query optimization بالا ببرید. Python پایه برای data manipulation با pandas.

ماه ۲: dbt و Modern Data Stack

dbt را روی BigQuery sandbox یاد بگیرید. یک مدل dimensional ساده روی داده‌ی عمومی NYC Taxi بسازید.

ماه ۳–۴: Spark و Databricks

PySpark را از طریق Databricks Community Edition یاد بگیرید. یک batch pipeline کوچک با Delta Lake پیاده کنید.

ماه ۵: Airflow و Cloud

Airflow را روی local docker راه بیندازید. یک حساب AWS رایگان بسازید و چند DAG واقعی روی EMR یا S3 اجرا کنید.

ماه ۶: پورتفولیو و apply

۲ پروژه‌ی end-to-end در GitHub تمیز و مستند کنید. LinkedIn را برای Data Engineer Junior بهینه و apply را شروع کنید.

پروژه‌های پیشنهادی برای رزومه

ELT روی NYC Taxi با dbt و BigQuery

مبتدی

داده‌های عمومی NYC Taxi (چندین GB CSV) را در BigQuery لود کنید، با dbt مدل‌سازی dimensional انجام دهید و یک داشبورد ساده با Looker Studio بسازید. پروژه شروع کلاسیک برای ورود به data engineering.

BigQuerydbtPythonLooker Studio
زمان تخمینی: ۲ هفته

Batch Pipeline با Airflow و Spark روی AWS

متوسط

یک pipeline روزانه طراحی کنید که داده از S3 می‌خواند، با PySpark روی EMR پردازش می‌کند، نتیجه را در Delta Lake ذخیره و به Slack notify می‌کند. orchestration با Airflow.

AirflowPySparkAWS S3 + EMRDelta Lake
زمان تخمینی: ۳ هفته

CDC Real-time با Kafka و Debezium

متوسط

یک Postgres را به Kafka از طریق Debezium وصل کنید، تغییرات را با ksqlDB پردازش و در یک Iceberg table بنشانید. این الگوی استاندارد replication مدرن است.

KafkaDebeziumksqlDBIceberg
زمان تخمینی: ۴ هفته

Streaming Aggregation با Flink

پیشرفته

یک سیستم real-time analytics بسازید که event های clickstream را با Flink در پنجره‌های زمانی aggregate می‌کند و خروجی را به ClickHouse می‌فرستد برای داشبورد live.

Apache FlinkKafkaClickHouseDocker
زمان تخمینی: ۵ هفته

Lakehouse کامل با Data Quality و Governance

پیشرفته

یک پلتفرم end-to-end: ingest با Kafka، transform با Spark/dbt، storage در Iceberg، quality با Great Expectations، governance با Unity Catalog یا Open Metadata، CI/CD کامل.

SparkIcebergGreat ExpectationsTerraformGitHub Actions
زمان تخمینی: ۸ هفته

مثال‌های واقعی و Case Studies

داستان‌های واقعی از مهندسانی که در این حوزه تأثیرگذار بوده‌اند

J

Jay Kreps

پیشینه

مهندس ارشد در LinkedIn از ۲۰۰۷، فارغ‌التحصیل University of California Santa Cruz. یکی از معماران اصلی data infrastructure لینکدین در دوران رشد سریع.

دستاورد

هم‌خالق Apache Kafka در LinkedIn (۲۰۱۰)، Apache Samza و Voldemort. در ۲۰۱۴ Confluent را تأسیس کرد که در ۲۰۲۱ روی Nasdaq با ارزش بیش از ۹ میلیارد دلار IPO شد. کتاب «I ♥ Logs» را نوشت که مرجع کلاسیک streaming architecture است.

درس کلیدی

بزرگ‌ترین فرصت‌های Big Data از حل یک مسئله‌ی واقعی در یک شرکت بزرگ شروع می‌شوند. Kreps Kafka را نه به عنوان یک پروژه‌ی side، بلکه برای حل مشکل messaging داخلی LinkedIn ساخت — و این منشأ یک industry جدید شد.

M

Matei Zaharia

پیشینه

دانشجوی دکترای UC Berkeley زیر نظر Scott Shenker و Ion Stoica در AMPLab. متولد رومانی، مهاجر به کانادا و سپس Stanford.

دستاورد

خالق اصلی Apache Spark در ۲۰۰۹ به عنوان پروژه‌ی دکترا — جایزه‌ی بهترین dissertation ACM را گرفت. بنیان‌گذار و CTO شرکت Databricks که در ۲۰۲۴ به ارزش‌گذاری ۶۲ میلیارد دلار رسید. استاد Stanford و یکی از تأثیرگذارترین چهره‌های data infrastructure مدرن.

درس کلیدی

یک ایده‌ی فنی خوب (in-memory distributed computing) که در زمان درست (پایان دوران MapReduce) ارائه شود، می‌تواند یک industry را تغییر دهد. Zaharia نشان داد که آکادمی و صنعت می‌توانند هم‌زمان حرکت کنند.

M

Maxime Beauchemin

پیشینه

مهندس داده در Yahoo!، Ubisoft، Facebook، Airbnb و Lyft. فاقد مدرک دکترا، خود را به عنوان pragmatist و builder معرفی می‌کند.

دستاورد

خالق Apache Airflow در Airbnb (۲۰۱۴) و Apache Superset (۲۰۱۵) — دو ابزار که modern data stack را تعریف کردند. در ۲۰۲۰ شرکت Preset را تأسیس کرد. مقاله‌ی «The Rise of the Data Engineer» او بنیان‌گذار جنبش data engineering مدرن است.

درس کلیدی

ساختن ابزار متن‌باز در حین کار شرکتی یک مسیر قدرتمند برای رشد شغلی است. Beauchemin بدون پس‌زمینه‌ی آکادمیک، فقط با حل مسائل واقعی در Airbnb، دو پروژه‌ی Apache top-level خلق کرد.

نمونه آگهی استخدام واقعی + تحلیل

یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش

Senior Data Engineer, Personalization Data

Netflixلس‌گاتوس، کالیفرنیا (Hybrid)2025-09
مشاهده آگهی اصلی

تحلیل نیازمندی‌ها

EN

5+ years of experience building production data pipelines at scale

نتفلیکس به دنبال کسی است که قبلاً pipeline در مقیاس واقعی (نه فقط tutorial) ساخته باشد. اگر تجربه‌ی production در یک شرکت متوسط دارید (نه FAANG)، همان قابل قبول است.

ضروری
EN

Deep expertise in Apache Spark, including performance tuning

این کلیدی است: نتفلیکس Iceberg + Spark استک اصلی‌اش است. باید بتوانید spill، skew و shuffle را در مصاحبه توضیح دهید — نه فقط syntax PySpark.

ضروری
EN

Experience with table formats (Iceberg preferred) and data lake architecture

نتفلیکس بزرگ‌ترین کاربر Iceberg در جهان است. اگر تجربه‌ی Iceberg ندارید، تجربه‌ی Delta یا Hudi قابل قبول است — اما باید مفاهیم schema evolution و time travel را عمیق بشناسید.

ضروری
EN

Strong SQL skills and ability to write efficient queries on petabyte-scale datasets

SQL پایه کافی نیست. باید بدانید چطور query planner را بخوانید، چه زمانی broadcast join استفاده کنید و چطور partitioning را برای queries بهینه طراحی کنید.

ضروری
EN

Experience with workflow orchestration tools (Airflow, Dagster, or Metaflow)

نتفلیکس Metaflow را خودش ساخته اما Airflow هم استفاده می‌کند. تجربه‌ی Airflow کفایت می‌کند و mention کردن آشنایی با Metaflow امتیاز مثبت است.

مهم
EN

Familiarity with ML feature engineering and serving feature stores

این رل به ML team نزدیک است. اگر feature store ندیده‌اید، مطالعه‌ی Feast و Tecton کافی است — تجربه‌ی مستقیم لازم نیست برای apply اولیه.

مفید

تحلیل مسئولیت‌ها

EN

Design and build petabyte-scale data pipelines that power personalization algorithms

این یعنی کار شما مستقیماً روی recommendation engine نتفلیکس اثر می‌گذارد. باید بتوانید با ابهام زندگی کنید — نیازمندی‌ها از تیم ML می‌آیند و معمولاً تغییر می‌کنند.

EN

Partner with ML engineers and data scientists to deliver high-quality features

بخش بزرگی از job همکاری cross-functional است نه کدنویسی تنها. مهارت ارتباط و document نوشتن به اندازه مهارت فنی مهم است.

EN

Improve data quality, observability, and reliability across the personalization data platform

data reliability یکی از تمرکزات اصلی نتفلیکس است. تجربه با Great Expectations، dbt tests یا Monte Carlo اینجا کمک می‌کند.

EN

Drive technical decisions around data architecture and tooling

این یک Senior position است — انتظار می‌رود شما RFC بنویسید، trade-off ها را روشن کنید و تیم را به سمت تصمیم درست هدایت کنید.

نتیجه‌گیری کلی

این آگهی نشان می‌دهد که در سطح Senior در یک FAANG-tier شرکت، تخصص عمیق در Spark و Iceberg بیش از breadth در ابزارهای متعدد ارزش دارد. نتفلیکس به دنبال T-shaped engineer است: عمق در lakehouse + توانایی همکاری با ML team. اگر هدف‌تان این سطح است، روی Spark internals و یک table format مدرن سرمایه‌گذاری کنید.

آینده و روندها

پیش‌بینی ۵–۱۰ ساله و مهارت‌هایی که باید یاد بگیرید

رشد بازار Big Data و Analytics حدود ۱۳٪ CAGR تا ۲۰۳۰ — از ۳۴۸ میلیارد به ۶۵۵ میلیارد دلار

منبع: Fortune Business Insights Big Data Analytics Market Report 2024 / Grand View Research

مهارت‌های نوظهور که باید یاد بگیرید

Apache Iceberg و Open Table FormatsStreaming SQL (Flink SQL، RisingWave)Data Contracts و Producer-driven SchemasLakehouse Governance (Unity Catalog، Polaris)Vector Databases برای GenAI pipelineCompute-Storage Separation و Serverless SparkAI-assisted Data Pipeline Development

پیش‌بینی‌های آینده

2026

Apache Iceberg به استاندارد industry برای lakehouse تبدیل می‌شود — Delta و Hudi به Iceberg interop ارائه می‌کنند

2027

Streaming SQL غالب می‌شود و خیلی از batch pipeline ها به micro-batch یا true streaming migrate می‌شوند

2028

AI Agents در نوشتن DAG و SQL transformation کمک قابل توجهی می‌کنند ولی architecture تصمیم همچنان انسانی است

2030

نقش Big Data Engineer با ML Platform Engineer ادغام بیشتری پیدا می‌کند — مرز بین data و ML در تیم‌های مدرن محو می‌شود

ریسک‌های واقعی

یک سوال جدی: آیا managed warehouse هایی مثل Snowflake و BigQuery نیاز به Big Data Engineer را کم نمی‌کنند؟ پاسخ: برای analytics متوسط بله، اما برای scale واقعی، streaming و ML platform خیر — این use case ها همچنان نیاز به مهندس متخصص دارند. ریسک واقعی برای کسانی است که فقط در abstraction های بالا (مثلاً فقط dbt) کار می‌کنند و به عمق نمی‌روند. کسانی که Spark internals، distributed systems و cloud cost engineering را عمیق می‌دانند، در امن‌ترین جایگاه قرار دارند.

ویدیوهای آموزشی

برای راهنمایی شخصی‌سازی‌شده مشاوره بگیرید