🏛️
رتبه ۳۸ از ۱۰رشد ۳۲.۵% سالانه

مهندس پلتفرم یادگیری ماشین

ML Platform Engineer

ML Platform Engineer (مهندس پلتفرم یادگیری ماشین) متخصصی است که زیرساخت‌ها، ابزارها و پایپ‌لاین‌هایی را می‌سازد که data scientist ها و ML engineer ها روی آن مدل آموزش می‌دهند، deploy می‌کنند و monitor می‌کنند. برخلاف ML engineer که روی یک مدل خاص کار می‌کند، شما platform می‌سازید — feature store، training infrastructure، model registry، serving layer و observability stack. تقاضا در ۲۰۲۶ منفجر شده چون هر شرکتی که چندین مدل در production دارد به یک نفر نیاز دارد که این chaos را organize کند. متوسط حقوق ارشد در آمریکا ۲۲۰–۳۲۰ هزار دلار است و در شرکت‌هایی مثل Netflix، Uber و LinkedIn به ۴۰۰هزار+ می‌رسد.

KubernetesMLOpsDistributed SystemsFeature StoresModel Serving

مقدمه و تعریف شغل

مهندس پلتفرم یادگیری ماشین (ML Platform Engineer) متخصصی است در تقاطع platform engineering، DevOps و یادگیری ماشین که زیرساخت‌ها و ابزارهایی می‌سازد تا data scientists و ML engineers بتوانند مدل‌های خود را به سرعت و با اطمینان آموزش، deploy و monitor کنند. شما به جای ساختن خود مدل، platform می‌سازید — feature store، training infrastructure، model serving layer، experiment tracking و observability stack. این نقش در شرکت‌هایی که چندین مدل در production دارند حیاتی شده.

تا حدود ۲۰۱۷، اکثر شرکت‌ها فقط چند مدل ML داشتند و engineer ها هر کدام را به صورت دستی deploy می‌کردند. با ظهور deep learning در scale و سپس انفجار ML در محصولات Uber، Netflix، Airbnb و Twitter، نیاز به استانداردسازی پیدا شد. در ۲۰۱۸ Uber پروژه Michelangelo را معرفی کرد و Netflix داستان Metaflow را منتشر کرد — این نقطه آغاز رسمی حرفه ML Platform Engineer بود. بین ۲۰۲۰ تا ۲۰۲۳ ابزارهای متن‌باز مثل Kubeflow، MLflow و Feast بالغ شدند. حالا در ۲۰۲۶ با انفجار LLMs و نیاز به serving با هزینه و latency کنترل‌شده، ML Platform یکی از پرتقاضاترین نقش‌های پلتفرمی شده و در شرکت‌هایی مثل Netflix و LinkedIn یک تیم ۲۰ تا ۵۰ نفره به این کار اختصاص یافته است.

چه چیزی می‌سازید؟

مثال‌های واقعی از خروجی کار یک مهندس پلتفرم یادگیری ماشین

🗄️

Feature Store برای سرویس‌دهی online و offline

DoorDash یک feature store ساخت که هزاران feature درباره restaurant، user و delivery را در ۵ میلی‌ثانیه به مدل‌های live serving می‌دهد. این کار قبلاً با یک query SQL در هر inference انجام می‌شد که فاجعه latency بود.

🏋️

Training Infrastructure برای distributed jobs

Meta یک training stack دارد که PyTorch job ها را روی هزاران GPU در multiple data center پخش می‌کند — با fault tolerance و resume خودکار اگر یک node خراب شود.

🚀

Model Serving Layer با autoscaling

Spotify از یک ML serving platform مبتنی بر Kubernetes استفاده می‌کند که هنگام pic ساعات شب تعداد replica های مدل recommendation را خودکار افزایش می‌دهد.

📊

Experiment Tracking و Model Registry

Airbnb یک internal model registry ساخت که هر مدل را با metadata، lineage و SLA tag می‌کند. هر deploy خودکار با registry check می‌شود.

📡

Observability و Drift Detection

Uber برای هر مدل production یک dashboard خودکار می‌سازد که data drift، prediction distribution و business metrics را real-time مانیتور می‌کند. اگر drift از threshold عبور کند، alert و retraining trigger می‌شود.

💰

Cost Management و Resource Optimization

LinkedIn با ساخت یک multi-tenant GPU scheduler هزینه‌های training را ۴۰٪ کاهش داد. job ها روی spot instance ها اجرا می‌شوند و در صورت preemption، خودکار retry می‌شوند.

تخصص‌های مختلف مهندس پلتفرم یادگیری ماشین

این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد

🏋️

زیرساخت آموزش

Training Infrastructure

تخصص در distributed training، GPU cluster و orchestration job های large-scale. شرکت‌هایی مثل Meta، Google و Anthropic تیم اختصاصی برای این کار دارند.

🚀

سرویس‌دهی مدل

Model Serving

ساخت inference platform با latency پایین و throughput بالا. Netflix، Uber و Pinterest در این حوزه پیشتاز هستند با ابزارهایی مثل Triton و سفارشی.

🗄️

پلتفرم Feature

Feature Platform

تخصص در feature store، feature engineering در scale و data freshness. Uber با Michelangelo Palette و Airbnb با Zipline مرجع‌های صنعتی هستند.

🤖

زیرساخت LLM

LLM Infrastructure

تخصص نوظهور: ساخت platform برای LLMs که نیازمندی‌های خاصی دارند (KV cache، batching پویا، quantization). شرکت‌هایی مثل Anthropic، OpenAI و Databricks در این حوزه قوی هستند.

📡

Observability یادگیری ماشین

ML Observability

تخصص در drift detection، data quality monitoring و alerting برای مدل‌های production. شرکت‌هایی مثل Arize، WhyLabs و Fiddler ابزار می‌سازند، تیم‌های platform از آن‌ها استفاده می‌کنند.

تفاوت با شغل‌های مشابه

کجا این شغل تمام می‌شود و شغل دیگری شروع می‌شود؟

مهندس یادگیری ماشینML Engineer

ML Engineer روی یک مدل یا یک use case تمرکز دارد — feature engineering، training، tuning. ML Platform Engineer سیستمی می‌سازد که ده‌ها ML Engineer روی آن کار می‌کنند. اگر ML Engineer آشپز است، شما طراح آشپزخانه‌ای هستید که در آن ۱۰۰ آشپز می‌توانند همزمان کار کنند.

مهندس MLOpsMLOps Engineer

تفاوت ظریف است. MLOps معمولاً روی operationalize کردن مدل‌های موجود تمرکز دارد (deploy، monitor، retrain). ML Platform Engineer سطح بالاتر است: ساخت ابزارها و abstraction هایی که MLOps engineer ها از آن‌ها استفاده می‌کنند. در شرکت‌های کوچک این دو نقش یکی است.

مهندس پلتفرم (عمومی)DevOps / Platform Engineer

Platform Engineer عمومی روی نیازهای کل engineering organization کار می‌کند: deploy، CI/CD، observability. ML Platform نیازهای خاص ML را پوشش می‌دهد: GPU scheduling، feature store، model registry، experiment tracking. تخصص ML شما را متمایز می‌کند.

مهندس دادهData Engineer

Data Engineer pipeline های ETL، data warehouse و streaming می‌سازد. ML Platform از خروجی Data Engineer مصرف می‌کند: feature ها را از data lake می‌گیرد و به مدل می‌رساند. در عمل تعامل نزدیک دارند اما تمرکز متفاوت است.

تأثیر در صنایع مختلف

مهندس پلتفرم یادگیری ماشین در همه صنایع مشغول به کار است — نه فقط شرکت‌های فناوری

🛒

خرده‌فروشی و E-commerce

Amazon و Shopify با platform های ML قوی تخفیف‌گذاری دینامیک، توصیه محصول و forecasting موجودی را در real-time اجرا می‌کنند

🚗

حمل و نقل و Ride-sharing

Uber و Lyft با Michelangelo و LyftLearn هزاران مدل ETA، pricing، fraud و routing را همزمان serve می‌کنند

🎬

سرگرمی و Streaming

Netflix و Spotify با platform های اختصاصی توصیه محتوای real-time برای ۲۵۰+ میلیون کاربر را ممکن می‌کنند

🏦

خدمات مالی

JPMorgan و Goldman Sachs با ML platform های on-prem fraud detection، credit scoring و algorithmic trading را اجرا می‌کنند

🏥

بهداشت و درمان

شرکت‌هایی مثل Tempus AI و PathAI با platform های اختصاصی مدل‌های imaging و genomics را به clinic ها deploy می‌کنند

📱

شبکه اجتماعی و تبلیغات

Meta و TikTok با platform های در scale هزاران مدل ranking، moderation و ads را روی میلیاردها request در ثانیه serve می‌کنند

🚙

خودروسازی و خودران

Tesla و Waymo با platform های specialized مدل‌های perception و planning را آموزش و در ماشین deploy می‌کنند

🤖

تولید AI و LLM Providers

Anthropic، OpenAI و Cohere تیم‌های platform بزرگی دارند که training و inference در scale برای trillion-parameter models را ممکن می‌کنند

تصورات غلط رایج

قبل از تصمیم‌گیری، این باورهای اشتباه را بشناسید

ML Platform Engineer باید عمیقاً ML بداند

نیاز است که فرآیند کار data scientist را بفهمید، نه این که خودتان مدل بسازید. تمرکز اصلی شما infrastructure و systems engineering است. درک سطحی از training و evaluation کافی است.

این نقش فقط DevOps با اسم جدید است

DevOps generic است؛ ML Platform مسائل خاصی دارد: GPU scheduling، feature freshness، model drift، experiment reproducibility. این چالش‌ها ابزارها و mental model های جدا می‌خواهند.

همه چیز را باید از صفر بسازم

بیشترین کار شما assembly و integration از قطعات OSS (Kubeflow، MLflow، Feast، KServe) است. ساختن از صفر فقط در شرکت‌هایی مثل Meta و Google با scale خاص توجیه دارد.

Kubernetes پاسخ هر مسئله است

Kubernetes ابزار قدرتمندی است اما complexity زیادی دارد. برای startup های کوچک، managed services (SageMaker، Vertex AI) ممکن است انتخاب بهتری باشد. تشخیص این trade-off بخش مهمی از کار شماست.

حقوق این نقش پایین‌تر از ML Engineer است

اشتباه. در شرکت‌های با چندین مدل production، Platform Engineer ها معمولاً همتراز یا حتی بالاتر از ML Engineer ها حقوق می‌گیرند چون تأثیر آن‌ها روی کل تیم ML است. در FAANG Staff Platform Engineer به ۴۰۰هزار+ می‌رسد.

یک روز کاری واقعی

در هر سطح روز کاری چه شکلی است؟

جونیور (۰–۲ سال)

بیشتر وقت در حل ticket های on-call، debug کردن pipeline های ناپایدار و یادگیری ابزارهای داخلی می‌گذرد. هنوز کسی به شما تصمیم معماری نمی‌سپارد.

  • صبح: بررسی alert های شب گذشته و debug کردن job های failed
  • جلسه standup با تیم platform و بررسی sprint backlog
  • بلاک اول: کار روی یک ticket — مثلاً اضافه کردن metric جدید به dashboard observability
  • بعد از ناهار: pair programming با مهندس میانی برای یاد گرفتن یک ابزار جدید
  • عصر: مستندسازی یک runbook برای incident اخیر + شرکت در Code Review

میانی (۲–۵ سال)

ترکیب کدنویسی، طراحی و همکاری. یک sub-system را own می‌کنید (مثل feature store یا serving). شروع به نوشتن RFC و رهبری پروژه‌های کوچک می‌کنید.

  • صبح: بررسی متریک‌های platform — uptime، p99 latency، GPU utilization
  • جلسه ۳۰ دقیقه با تیم data science: درک نیاز جدید برای feature streaming
  • بلاک کدنویسی: پیاده‌سازی یک operator جدید Kubernetes برای job scheduling
  • بعد از ناهار: Code Review برای کار جونیور + جلسه با تیم security
  • عصر: نوشتن RFC برای migration از Argo CD به Flux و ارسال به تیم

ارشد (۵+ سال)

تمرکز روی architecture، روابط cross-team و technical strategy. کمتر کد می‌نویسید اما تصمیم‌های شما تأثیر چند ساله دارد. روی build vs buy و roadmap کوارتری کار می‌کنید.

  • صبح: review روزانه قابلیت‌های platform و brainstorm با Staff engineers تیم‌های دیگر
  • جلسه architecture: بررسی طرح serving layer جدید برای LLMs در شرکت
  • کدنویسی هدفمند: contribution به یک پروژه OSS برای رفع limitation حیاتی
  • بعد از ناهار: جلسه با VP Engineering درباره cost optimization و capacity planning
  • عصر: منتورینگ ۱:۱ با مهندس میانی + نوشتن postmortem incident

مسئولیت‌ها و وظایف

مسئولیت‌های اصلی

وظایف روزانه و مهارت‌های مورد نیاز در این شغل

فنی
  • طراحی و پیاده‌سازی ML pipeline های مقیاس‌پذیر روی Kubernetes با ابزارهایی مثل Kubeflow و Argo
  • ساخت و نگهداری feature store برای serving feature ها به مدل‌های online و offline
  • طراحی model serving infrastructure با autoscaling، A/B testing و canary deployment
  • پیاده‌سازی observability stack — metrics، logging، tracing و model drift detection
  • بهینه‌سازی هزینه‌های GPU cluster و training jobs (spot instances، multi-tenancy)
  • نوشتن Terraform / Helm chart برای provision کردن resources در multi-cloud
مهارت نرم
  • همکاری با data scientists و ML engineers برای درک نیازها و ساخت ابزار مناسب
مدیریتی
  • هدایت technical decisions با RFC نویسی و ارائه trade-off های معماری

مهارت‌های مورد نیاز

مهارت‌های فنی، نرم و حوزه‌ای که یک مهندس پلتفرم یادگیری ماشین موفق به آن‌ها نیاز دارد

مهارت‌های فنی

Kubernetes پیشرفتهضروری

درک operator pattern، custom resources، scheduler، networking و troubleshooting در scale

Distributed Systemsضروری

اصول CAP، consensus، fault tolerance و درک عمیق ترسیمی سیستم‌های توزیع‌شده

Python و Goضروری

Python برای automation و glue code، Go برای infrastructure tooling و Kubernetes operators

Cloud Platformsضروری

تسلط بر یکی از AWS، GCP یا Azure شامل managed ML services (SageMaker، Vertex AI)

MLOps Toolingضروری

تجربه عملی با MLflow، Kubeflow، Argo، Feast و درک trade-off بین ابزارها

Infrastructure as Codeمهم

Terraform، Helm، Crossplane برای مدیریت declarative resources

Observabilityمهم

Prometheus، Grafana، OpenTelemetry برای metrics، logs و traces در ML systems

مهارت‌های نرم

ترجمه نیاز user به abstractionضروری

گوش دادن به data scientists، استخراج pattern و طراحی API ای که نیاز ۸۰٪ موارد را پوشش دهد

RFC writing و technical communicationضروری

نوشتن documentation و design doc هایی که خوانده می‌شوند، نه فقط نوشته می‌شوند

Cross-team Collaborationضروری

ارتباط مؤثر با data science، ML engineering، security و SRE تیم‌ها

Pragmatismمهم

تشخیص این که کجا باید build کرد، کجا buy، و کجا با duct tape موقت رد شد

On-call resilienceمهم

حفظ خونسردی در incident، تصمیم سریع، و یادگیری از postmortem

دانش حوزه‌ای

درک training و inferenceمهم

آشنایی با distributed training، GPU scheduling، quantization و serving optimization

Security و Complianceمهم

درک SOC2، GDPR، model security، secrets management و audit trail برای ML systems

Cost Engineeringمهم

بهینه‌سازی هزینه GPU، spot instance management، autoscaling و budget enforcement

Data Engineering basicsمفید

آشنایی با Spark، Kafka، Iceberg و streaming برای feature pipeline ها

ضروری — بدون آن نمی‌توان وارد بازار کار شدمهم — تفاوت بین جونیور و میانیمفید — مزیت رقابتی

نقشه راه و مسیر آموزشی

نقشه راه تبدیل شدن به مهندس پلتفرم یادگیری ماشین

این مسیر گام به گام شما را از صفر تا حرفه‌ای هدایت می‌کند.

1

مبانی Software Engineering و سیستم‌های توزیع‌شده

⏱️ ۳ تا ۴ ماه

ساخت پایه مهندسی نرم‌افزار — Python، Go، concurrency، testing و درک سیستم‌های توزیع‌شده که bedrock کار platform engineering است

Python پیشرفتهGo یا JavaData Structures & AlgorithmsDistributed Systems FundamentalsGit & CI/CD basicsLinux & Bash scripting
2

Cloud، Containers و Orchestration

⏱️ ۳ تا ۴ ماه

تسلط بر Docker، Kubernetes و یکی از cloud های اصلی (AWS, GCP, Azure) — زبان مادری platform engineering

Docker پیشرفتهKubernetes (Pods, Deployments, Operators)Helm ChartsTerraform / PulumiAWS / GCP / AzureService Mesh (Istio, Linkerd)
3

مبانی ML و درک Workflow data scientist ها

⏱️ ۲ تا ۳ ماه

یادگیری ML کافی برای درک نیازهای کاربران شما — data scientists و ML engineers. لازم نیست مدل بسازید اما باید زبان آن‌ها را بفهمید

Scikit-learn و PyTorch basicsTraining Loop و Distributed TrainingFeature EngineeringModel Evaluation MetricsGPU ComputingJupyter و Notebook Infrastructure
4

MLOps، Pipelines و Feature Stores

⏱️ ۴ تا ۵ ماه

ساخت قطعات اصلی یک ML platform — pipeline orchestration، feature store، model registry و experiment tracking

Kubeflow / Argo WorkflowsMLflow / Weights & BiasesFeast / Tecton (Feature Stores)Airflow / Prefect / DagsterDVC و Data VersioningCI/CD برای ML (GitHub Actions)
5

Model Serving، Observability و Scale

⏱️ مداوم

تخصص در serving با latency پایین، monitoring مدل‌ها در production و scale کردن platform برای صدها مدل و میلیون‌ها request

KServe / Seldon / BentoMLTriton Inference Server (NVIDIA)Ray Serve و Distributed InferencePrometheus / Grafana / OpenTelemetryModel Drift DetectionGPU Cluster Management

ابزارها و استک فنی

ابزارهایی که هر مهندس AI باید بشناسد، دسته‌بندی‌شده بر اساس اولویت

Orchestration و Infrastructure

Kubernetes

استاندارد جهانی orchestration — backbone هر ML platform مدرن

ضروری
Docker

containerization پایه برای reproducibility در training و serving

ضروری
Terraform

Infrastructure as Code برای provision کردن resources در multi-cloud

ضروری
Helm

package manager Kubernetes برای deploy کردن stacks پیچیده

مفید

ML Pipelines و Workflow

Kubeflow

platform end-to-end ML روی Kubernetes — Google originated، استاندارد در enterprise

ضروری
Argo Workflows

workflow engine روی Kubernetes — lightweight جایگزین Airflow برای ML

ضروری
Airflow

veteran orchestration — هنوز در اکثر شرکت‌ها برای ETL و training pipeline استفاده می‌شود

مفید
Dagster

modern asset-based orchestrator — توسعه‌دهنده experience عالی برای ML

مفید

Model Serving و Inference

KServe

open-source model serving روی Kubernetes — استاندارد CNCF برای ML inference

ضروری
Ray Serve

serving framework از Anyscale — قوی برای ensemble و LLM inference

ضروری
NVIDIA Triton

inference server بهینه‌شده برای GPU — استاندارد در شرکت‌های با حجم بالای inference

پیشرفته
BentoML

packaging و serving framework Python-friendly — محبوب در startup ها

مفید

Tracking، Registry و Observability

MLflow

استاندارد open-source برای experiment tracking و model registry

ضروری
Weights & Biases

platform managed برای experiment tracking — DX عالی برای research

ضروری
Feast

feature store متن‌باز — استاندارد صنعتی برای feature serving

ضروری
Prometheus + Grafana

monitoring stack استاندارد برای observability platform

ضروری
ضروری — باید یاد بگیریدمفید — ارزش یادگیری داردپیشرفته — برای سطوح ارشد

مسیر پیشرفت شغلی

از جونیور تا Staff Engineer — چه مهارت‌هایی نیاز دارید و چه درآمدی انتظار داشته باشید

ML Platform Engineer جونیور

۰ تا ۲ سال

~$110K

میانگین سالانه (آمریکا)

نگهداری pipeline های موجود، debug کردن jobs که fail می‌شوند، اضافه کردن metric و alert به سیستم

PythonDockerKubernetes basicsMLflowGit

ML Platform Engineer میانی

۲ تا ۵ سال

~$170K

میانگین سالانه (آمریکا)

طراحی و پیاده‌سازی components جدید platform، own کردن یک sub-system (مثل feature store یا serving)

Kubernetes پیشرفتهTerraformKubeflowDistributed SystemsOn-call

Senior ML Platform Engineer

۵ تا ۸ سال

~$240K

میانگین سالانه (آمریکا)

معماری کل platform، تصمیم build vs buy، رهبری migration های بزرگ، mentoring تیم

System DesignMulti-cluster K8sCost OptimizationTechnical LeadershipCross-team Influence

Staff / Principal ML Platform Engineer

۸+ سال

~$360K

میانگین سالانه (آمریکا)

تعریف ML platform strategy شرکت، representation در standards (CNCF, MLPerf)، coordination با VP Eng و CTO

Org-level StrategyIndustry StandardsMulti-year RoadmapExecutive CommunicationOSS Leadership

چالش‌ها و جنبه‌های منفی

واقعیت‌هایی که کمتر در آگهی‌های شغلی می‌بینید — قبل از ورود بدانید

Trade-off بین standardization و flexibility

عمومی

data scientists می‌خواهند آزادی استفاده از هر کتابخانه و framework را داشته باشند، اما platform نیاز به standardization دارد تا قابل maintain باشد. مذاکره این مرز یک چالش روزانه است.

تشخیص نیاز واقعی از hype

استارتاپ

هر هفته یک ابزار جدید MLOps معرفی می‌شود. باید تشخیص دهید کدام واقعاً نیاز شما را حل می‌کند و کدام فقط hype است. اشتباه در این تصمیم سال‌ها rollback می‌خواهد.

مدیریت هزینه‌های GPU در scale

شرکت بزرگ

GPU گران است و training jobs بزرگ می‌توانند روزانه هزاران دلار مصرف کنند. طراحی scheduler هایی که spot instance استفاده می‌کنند و idle resource را به حداقل می‌رسانند یک چالش دائمی است.

Multi-tenancy و isolation

شرکت بزرگ

ده‌ها تیم با نیازهای مختلف از یک platform استفاده می‌کنند. تضمین این که job یک تیم روی performance یا security تیم دیگر تأثیر نگذارد نیازمند طراحی دقیق است.

Reproducibility در سیستم‌های پیچیده

تحقیقاتی

یک training job ممکن است به ده‌ها dependency، dataset version و hyperparameter بستگی داشته باشد. تضمین این که هر کس بتواند نتیجه را reproduce کند یک مسئله حل‌نشده در صنعت است.

Migration بدون downtime

شرکت بزرگ

هنگام تغییر زیرساخت زیرین (مثلاً K8s version یا serving engine جدید)، باید مدل‌های production بدون مزاحمت برای کاربران migrate شوند. این یکی از سخت‌ترین کارهای روزمره است.

حقوق و بازار کار جهانی

حقوق جهانی مهندس پلتفرم یادگیری ماشین

میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف

کشورمیانهارز
🇯🇵ژاپن
¥14,000,000JPY
🇮🇳هند
₹4,000,000INR
🇦🇪امارات
AED 300,000AED
🇺🇸آمریکا
$240,000USD
🇨🇦کانادا
CA$170,000CAD
🇨🇭سوئیس
CHF 170,000CHF
🇸🇬سنگاپور
SGD 170,000SGD
🇦🇺استرالیا
A$165,000AUD
🇬🇧انگلستان
£125,000GBP
🇩🇪آلمان
€110,000EUR
🇳🇱هلند
€105,000EUR

* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شده‌اند.

چگونه از صفر شروع کنیم

برنامه گام‌به‌گام برای ورود به مهندسی هوش مصنوعی

ماه ۱: Kubernetes Deep Dive

Kubernetes را عمیق یاد بگیرید — نه فقط kubectl، بلکه scheduler، controller و networking. minikube روی لپ‌تاپ راه بیندازید.

ماه ۲: ML Fundamentals

fast.ai یا Andrew Ng را تمام کنید. هدف درک workflow data scientist است نه ساخت SOTA model.

ماه ۳: MLOps Tooling

با MLflow، Weights & Biases و Kubeflow Pipelines کار کنید. یک training pipeline ساده روی Kubernetes اجرا کنید.

ماه ۴: Model Serving

KServe، BentoML و Triton را امتحان کنید. یک مدل را با autoscaling و A/B testing serve کنید.

ماه ۵: Feature Store و Observability

Feast را راه‌اندازی کنید. Prometheus + Grafana برای monitoring اضافه کنید. مفاهیم data drift را یاد بگیرید.

ماه ۶: پروژه end-to-end و job search

یک ML platform mini روی cloud بسازید: K8s، MLflow، KServe، Feast، Prometheus. GitHub را تمیز کنید، شروع به apply کنید.

پروژه‌های پیشنهادی برای رزومه

Mini ML Pipeline با MLflow

مبتدی

یک pipeline ساده بسازید که داده را preprocess کند، یک مدل sklearn آموزش دهد، با MLflow track کند و در registry register کند. در Docker container قرار دهید.

PythonMLflowscikit-learnDocker
زمان تخمینی: ۲ هفته

Feature Store ساده با Feast

متوسط

Feast را راه‌اندازی کنید، یک dataset را به feature تبدیل کنید و یک online + offline store بسازید. یک API بسازید که features را برای inference بدهد.

FeastRedisPostgreSQLFastAPI
زمان تخمینی: ۳ هفته

Model Serving روی Kubernetes

متوسط

یک مدل PyTorch را با KServe یا BentoML روی یک Kubernetes cluster (minikube یا kind) deploy کنید با autoscaling و health checks فعال.

KubernetesKServePyTorchHelm
زمان تخمینی: ۳ هفته

End-to-End MLOps Platform

پیشرفته

یک stack کامل بسازید: Argo Workflows برای training، MLflow برای tracking، KServe برای serving، Prometheus برای monitoring. همه روی یک Kubernetes cluster واقعی در cloud.

KubernetesArgoMLflowKServePrometheusTerraform
زمان تخمینی: ۶ تا ۸ هفته

Distributed Training Infrastructure با Ray

پیشرفته

یک Ray cluster روی Kubernetes راه‌اندازی کنید که distributed training (مثلاً با Ray Train + PyTorch DDP) و hyperparameter tuning (Ray Tune) را پشتیبانی کند. cost و throughput را اندازه‌گیری کنید.

RayKubernetesPyTorchKubeRayGrafana
زمان تخمینی: ۶ هفته

مثال‌های واقعی و Case Studies

داستان‌های واقعی از مهندسانی که در این حوزه تأثیرگذار بوده‌اند

K

Kelsey Hightower

پیشینه

بدون مدرک رسمی دانشگاهی، خودآموخته، با سال‌ها کار در sysadmin و DevOps. سپس Staff Developer Advocate در Google Cloud شد و یکی از معتبرترین صداهای جهان در Kubernetes و platform engineering.

دستاورد

نویسنده «Kubernetes the Hard Way» — منبع آموزشی که میلیون‌ها مهندس را به دنیای Kubernetes معرفی کرد. سخنران اصلی در KubeCon ها و کسی که زبان مشترک community Kubernetes را شکل داد. در ۲۰۲۳ از Google بازنشسته شد اما همچنان مرجع کلیدی صنعت است.

درس کلیدی

Hightower ثابت کرد که در platform engineering مدرک مهم نیست — مهم درک عمیق سیستم‌ها و توانایی توضیح ساده آن‌هاست. ساخت محتوای آموزشی open-source می‌تواند مسیر شغلی شما را شکل دهد.

C

Chip Huyen

پیشینه

کارشناسی و کارشناسی ارشد از Stanford، سپس کار در NVIDIA، Snorkel AI و Netflix. مدرس CS329S (Machine Learning Systems Design) در Stanford و یکی از پرنفوذترین صداها در حوزه ML Systems.

دستاورد

نویسنده کتاب «Designing Machine Learning Systems» که در میلیون‌ها مهندس به مرجع تبدیل شد. در ۲۰۲۳ کتاب «AI Engineering» را منتشر کرد. سپس co-founder شد در Claypot AI روی real-time ML و سپس به Voltage Park پیوست. در سطح صنعتی استانداردهای MLOps را شکل می‌دهد.

درس کلیدی

Huyen نمونه‌ای از کسی است که تئوری دانشگاه را با عمل صنعت ترکیب کرده. آموختن، نوشتن و share کردن یادگیری‌ها (در blog یا کتاب) ابزار قدرتمندی برای رشد و influence در حوزه platform engineering است.

J

Jeremy Hermann

پیشینه

Engineering manager سابق در Uber که تیم Michelangelo را رهبری کرد — اولین ML platform در scale صنعتی در جهان. بعد از Uber بنیان‌گذار Anyscale (شرکت سازنده Ray) و سپس مشاور چندین platform startup.

دستاورد

رهبری ساخت Michelangelo که در Uber از یک پروژه آزمایشی به platform اصلی برای صدها مدل تبدیل شد و الگوی هر ML platform در صنعت شد. سپس به Anyscale پیوست تا Ray را به استاندارد distributed computing برای AI تبدیل کند.

درس کلیدی

ساخت ML platform شغل تنها نیست — رهبری تیم، گذاشتن استاندارد و انتشار learning به community جزئی از کار است. case study Michelangelo نشان می‌دهد یک platform خوب می‌تواند هزاران ML engineer را قدرتمند کند.

نمونه آگهی استخدام واقعی + تحلیل

یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش

Senior Software Engineer, ML Platform

Netflixلس گاتوس، کالیفرنیا (هیبریدی)2025-08
مشاهده آگهی اصلی

تحلیل نیازمندی‌ها

EN

5+ years building distributed systems or platform services in production

Netflix به دنبال کسی است که قبلاً سیستم در scale ساخته. لازم نیست در ML بوده باشد — تجربه backend distributed با Java/Go/Python در scale تولیدی هم قابل قبول است.

ضروری
EN

Expert in Kubernetes, container orchestration, and cloud infrastructure (AWS preferred)

Kubernetes deep expertise حیاتی است. AWS مزیت است چون Netflix روی AWS است، اما تجربه با GCP یا Azure هم پذیرفته می‌شود. CKA کمک می‌کند اما الزامی نیست.

ضروری
EN

Strong proficiency in Python, Java, or Go for building developer-facing platforms

Python برای glue code و automation، Java/Go برای infrastructure tooling. حداقل دو زبان از این لیست را در سطح production باید بنویسید.

ضروری
EN

Experience with ML workflows (training, serving, feature engineering)

نیاز نیست data scientist باشید اما باید درک واقعی از training loop، serving، feature engineering داشته باشید. کار قبلی روی یک ML pipeline (حتی به عنوان infrastructure) کافی است.

مهم
EN

Experience with workflow orchestration (Airflow, Argo, Metaflow) and ML tooling (MLflow, Kubeflow)

تجربه با حداقل یکی از این ابزارها در production. Netflix خود از Metaflow استفاده می‌کند پس آشنایی با آن مزیت است اما الزامی نیست.

مهم
EN

Familiarity with deep learning frameworks (PyTorch, TensorFlow, JAX)

درک سطحی کافی است — می‌دانید چطور یک training job اجرا می‌شود و چه resource نیاز دارد. لازم نیست مدل state-of-the-art بنویسید.

مفید

تحلیل مسئولیت‌ها

EN

Design, build, and operate ML infrastructure services used by Netflix data scientists and ML engineers

platform برای کاربر داخلی می‌سازید. مهم‌ترین skill شناختن نیاز user (data scientist) و طراحی abstraction هایی است که DX خوبی فراهم می‌کنند.

EN

Define APIs, SDKs, and tooling that abstract ML complexity for hundreds of internal users

API design و SDK نویسی مهارت اصلی است. باید بتوانید complexity را پنهان کنید بدون این که flexibility را قربانی کنید. مطالعه Netflix Metaflow کتابخانه‌ای عالی برای یادگیری این الگو است.

EN

Collaborate with research teams to bring cutting-edge ML capabilities (LLMs, multimodal) to production

نیاز به همکاری نزدیک با research است. باید بتوانید paper بخوانید، نیاز را بفهمید و infrastructure مناسب بسازید. این بخشی است که با junior role متفاوت است.

EN

Lead design and execution of major platform initiatives across multiple teams

نقش technical leadership قوی دارد. باید بتوانید RFC بنویسید، با چند تیم coordination کنید و در نهایت یک پروژه چند ماهه را به ثمر برسانید.

نتیجه‌گیری کلی

این آگهی نشان می‌دهد Netflix به جای ML expertise روی platform engineering در scale + همدلی با user تأکید دارد. اگر backend engineer قوی هستید با کمی تجربه ML، می‌توانید به این نقش apply کنید — لازم نیست از قبل ML platform engineer باشید. کلید موفقیت در مصاحبه نشان دادن system design و درک developer experience است.

آینده و روندها

پیش‌بینی ۵–۱۰ ساله و مهارت‌هایی که باید یاد بگیرید

رشد ۳۲٪ سالانه تا ۲۰۳۰ — تقاضا برای ML Platform Engineer در سال‌های ۲۰۲۶ تا ۲۰۲۹ بیشتر از خود ML Engineer رشد می‌کند

منبع: LinkedIn Emerging Jobs Report 2025 / Gartner MLOps Market Forecast 2025

مهارت‌های نوظهور که باید یاد بگیرید

LLM Inference Optimization (vLLM، TensorRT-LLM)Multi-cluster Kubernetes FederationVector Database OperationsGPU Sharing و Time-slicingReal-time Feature EngineeringModel Governance و Compliance AutomationHybrid Cloud / Edge Deployment

پیش‌بینی‌های آینده

2026

هر شرکت با ۱۰+ مدل production یک تیم اختصاصی ML Platform خواهد داشت — این تبدیل به استاندارد می‌شود

2027

LLM Infrastructure یک تخصص جدا از ML Platform می‌شود — با ابزارها و مهارت‌های خاص (KV cache، speculative decoding)

2028

Compound AI Systems (orchestration چند مدل) چالش جدید platform می‌شود — pipeline های پیچیده با inference چندمرحله‌ای

2030

Edge ML deployment رشد می‌کند — platform engineer هایی که در cloud-to-edge orchestration متخصص شوند پرتقاضاترین خواهند بود

ریسک‌های واقعی

ریسک واقعی برای ML Platform Engineer ها این است که managed services (Vertex AI، SageMaker، Databricks) قابلیت‌های platform های in-house را cover کنند. در شرکت‌های کوچک ممکن است نیاز به ML Platform Engineer اختصاصی کاهش یابد. اما در شرکت‌های متوسط و بزرگ که نیازهای خاص (latency، compliance، cost) دارند، تقاضا قوی می‌ماند. کسانی که فقط managed service ها را config می‌کنند بیشتر آسیب‌پذیرند؛ کسانی که distributed systems را عمیق می‌فهمند و LLM infrastructure را master می‌کنند جایگاه‌شان امن‌تر است.

ویدیوهای آموزشی

برای راهنمایی شخصی‌سازی‌شده مشاوره بگیرید