مهندس پلتفرم یادگیری ماشین
ML Platform Engineer
ML Platform Engineer (مهندس پلتفرم یادگیری ماشین) متخصصی است که زیرساختها، ابزارها و پایپلاینهایی را میسازد که data scientist ها و ML engineer ها روی آن مدل آموزش میدهند، deploy میکنند و monitor میکنند. برخلاف ML engineer که روی یک مدل خاص کار میکند، شما platform میسازید — feature store، training infrastructure، model registry، serving layer و observability stack. تقاضا در ۲۰۲۶ منفجر شده چون هر شرکتی که چندین مدل در production دارد به یک نفر نیاز دارد که این chaos را organize کند. متوسط حقوق ارشد در آمریکا ۲۲۰–۳۲۰ هزار دلار است و در شرکتهایی مثل Netflix، Uber و LinkedIn به ۴۰۰هزار+ میرسد.
مقدمه و تعریف شغل
مهندس پلتفرم یادگیری ماشین (ML Platform Engineer) متخصصی است در تقاطع platform engineering، DevOps و یادگیری ماشین که زیرساختها و ابزارهایی میسازد تا data scientists و ML engineers بتوانند مدلهای خود را به سرعت و با اطمینان آموزش، deploy و monitor کنند. شما به جای ساختن خود مدل، platform میسازید — feature store، training infrastructure، model serving layer، experiment tracking و observability stack. این نقش در شرکتهایی که چندین مدل در production دارند حیاتی شده.
تا حدود ۲۰۱۷، اکثر شرکتها فقط چند مدل ML داشتند و engineer ها هر کدام را به صورت دستی deploy میکردند. با ظهور deep learning در scale و سپس انفجار ML در محصولات Uber، Netflix، Airbnb و Twitter، نیاز به استانداردسازی پیدا شد. در ۲۰۱۸ Uber پروژه Michelangelo را معرفی کرد و Netflix داستان Metaflow را منتشر کرد — این نقطه آغاز رسمی حرفه ML Platform Engineer بود. بین ۲۰۲۰ تا ۲۰۲۳ ابزارهای متنباز مثل Kubeflow، MLflow و Feast بالغ شدند. حالا در ۲۰۲۶ با انفجار LLMs و نیاز به serving با هزینه و latency کنترلشده، ML Platform یکی از پرتقاضاترین نقشهای پلتفرمی شده و در شرکتهایی مثل Netflix و LinkedIn یک تیم ۲۰ تا ۵۰ نفره به این کار اختصاص یافته است.
چه چیزی میسازید؟
مثالهای واقعی از خروجی کار یک مهندس پلتفرم یادگیری ماشین
Feature Store برای سرویسدهی online و offline
DoorDash یک feature store ساخت که هزاران feature درباره restaurant، user و delivery را در ۵ میلیثانیه به مدلهای live serving میدهد. این کار قبلاً با یک query SQL در هر inference انجام میشد که فاجعه latency بود.
Training Infrastructure برای distributed jobs
Meta یک training stack دارد که PyTorch job ها را روی هزاران GPU در multiple data center پخش میکند — با fault tolerance و resume خودکار اگر یک node خراب شود.
Model Serving Layer با autoscaling
Spotify از یک ML serving platform مبتنی بر Kubernetes استفاده میکند که هنگام pic ساعات شب تعداد replica های مدل recommendation را خودکار افزایش میدهد.
Experiment Tracking و Model Registry
Airbnb یک internal model registry ساخت که هر مدل را با metadata، lineage و SLA tag میکند. هر deploy خودکار با registry check میشود.
Observability و Drift Detection
Uber برای هر مدل production یک dashboard خودکار میسازد که data drift، prediction distribution و business metrics را real-time مانیتور میکند. اگر drift از threshold عبور کند، alert و retraining trigger میشود.
Cost Management و Resource Optimization
LinkedIn با ساخت یک multi-tenant GPU scheduler هزینههای training را ۴۰٪ کاهش داد. job ها روی spot instance ها اجرا میشوند و در صورت preemption، خودکار retry میشوند.
تخصصهای مختلف مهندس پلتفرم یادگیری ماشین
این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد
زیرساخت آموزش
Training Infrastructure
تخصص در distributed training، GPU cluster و orchestration job های large-scale. شرکتهایی مثل Meta، Google و Anthropic تیم اختصاصی برای این کار دارند.
سرویسدهی مدل
Model Serving
ساخت inference platform با latency پایین و throughput بالا. Netflix، Uber و Pinterest در این حوزه پیشتاز هستند با ابزارهایی مثل Triton و سفارشی.
پلتفرم Feature
Feature Platform
تخصص در feature store، feature engineering در scale و data freshness. Uber با Michelangelo Palette و Airbnb با Zipline مرجعهای صنعتی هستند.
زیرساخت LLM
LLM Infrastructure
تخصص نوظهور: ساخت platform برای LLMs که نیازمندیهای خاصی دارند (KV cache، batching پویا، quantization). شرکتهایی مثل Anthropic، OpenAI و Databricks در این حوزه قوی هستند.
Observability یادگیری ماشین
ML Observability
تخصص در drift detection، data quality monitoring و alerting برای مدلهای production. شرکتهایی مثل Arize، WhyLabs و Fiddler ابزار میسازند، تیمهای platform از آنها استفاده میکنند.
تفاوت با شغلهای مشابه
کجا این شغل تمام میشود و شغل دیگری شروع میشود؟
ML Engineer روی یک مدل یا یک use case تمرکز دارد — feature engineering، training، tuning. ML Platform Engineer سیستمی میسازد که دهها ML Engineer روی آن کار میکنند. اگر ML Engineer آشپز است، شما طراح آشپزخانهای هستید که در آن ۱۰۰ آشپز میتوانند همزمان کار کنند.
تفاوت ظریف است. MLOps معمولاً روی operationalize کردن مدلهای موجود تمرکز دارد (deploy، monitor، retrain). ML Platform Engineer سطح بالاتر است: ساخت ابزارها و abstraction هایی که MLOps engineer ها از آنها استفاده میکنند. در شرکتهای کوچک این دو نقش یکی است.
Platform Engineer عمومی روی نیازهای کل engineering organization کار میکند: deploy، CI/CD، observability. ML Platform نیازهای خاص ML را پوشش میدهد: GPU scheduling، feature store، model registry، experiment tracking. تخصص ML شما را متمایز میکند.
Data Engineer pipeline های ETL، data warehouse و streaming میسازد. ML Platform از خروجی Data Engineer مصرف میکند: feature ها را از data lake میگیرد و به مدل میرساند. در عمل تعامل نزدیک دارند اما تمرکز متفاوت است.
تأثیر در صنایع مختلف
مهندس پلتفرم یادگیری ماشین در همه صنایع مشغول به کار است — نه فقط شرکتهای فناوری
خردهفروشی و E-commerce
Amazon و Shopify با platform های ML قوی تخفیفگذاری دینامیک، توصیه محصول و forecasting موجودی را در real-time اجرا میکنند
حمل و نقل و Ride-sharing
Uber و Lyft با Michelangelo و LyftLearn هزاران مدل ETA، pricing، fraud و routing را همزمان serve میکنند
سرگرمی و Streaming
Netflix و Spotify با platform های اختصاصی توصیه محتوای real-time برای ۲۵۰+ میلیون کاربر را ممکن میکنند
خدمات مالی
JPMorgan و Goldman Sachs با ML platform های on-prem fraud detection، credit scoring و algorithmic trading را اجرا میکنند
بهداشت و درمان
شرکتهایی مثل Tempus AI و PathAI با platform های اختصاصی مدلهای imaging و genomics را به clinic ها deploy میکنند
شبکه اجتماعی و تبلیغات
Meta و TikTok با platform های در scale هزاران مدل ranking، moderation و ads را روی میلیاردها request در ثانیه serve میکنند
خودروسازی و خودران
Tesla و Waymo با platform های specialized مدلهای perception و planning را آموزش و در ماشین deploy میکنند
تولید AI و LLM Providers
Anthropic، OpenAI و Cohere تیمهای platform بزرگی دارند که training و inference در scale برای trillion-parameter models را ممکن میکنند
تصورات غلط رایج
قبل از تصمیمگیری، این باورهای اشتباه را بشناسید
ML Platform Engineer باید عمیقاً ML بداند
نیاز است که فرآیند کار data scientist را بفهمید، نه این که خودتان مدل بسازید. تمرکز اصلی شما infrastructure و systems engineering است. درک سطحی از training و evaluation کافی است.
این نقش فقط DevOps با اسم جدید است
DevOps generic است؛ ML Platform مسائل خاصی دارد: GPU scheduling، feature freshness، model drift، experiment reproducibility. این چالشها ابزارها و mental model های جدا میخواهند.
همه چیز را باید از صفر بسازم
بیشترین کار شما assembly و integration از قطعات OSS (Kubeflow، MLflow، Feast، KServe) است. ساختن از صفر فقط در شرکتهایی مثل Meta و Google با scale خاص توجیه دارد.
Kubernetes پاسخ هر مسئله است
Kubernetes ابزار قدرتمندی است اما complexity زیادی دارد. برای startup های کوچک، managed services (SageMaker، Vertex AI) ممکن است انتخاب بهتری باشد. تشخیص این trade-off بخش مهمی از کار شماست.
حقوق این نقش پایینتر از ML Engineer است
اشتباه. در شرکتهای با چندین مدل production، Platform Engineer ها معمولاً همتراز یا حتی بالاتر از ML Engineer ها حقوق میگیرند چون تأثیر آنها روی کل تیم ML است. در FAANG Staff Platform Engineer به ۴۰۰هزار+ میرسد.
یک روز کاری واقعی
در هر سطح روز کاری چه شکلی است؟
جونیور (۰–۲ سال)
بیشتر وقت در حل ticket های on-call، debug کردن pipeline های ناپایدار و یادگیری ابزارهای داخلی میگذرد. هنوز کسی به شما تصمیم معماری نمیسپارد.
- ◆صبح: بررسی alert های شب گذشته و debug کردن job های failed
- ◆جلسه standup با تیم platform و بررسی sprint backlog
- ◆بلاک اول: کار روی یک ticket — مثلاً اضافه کردن metric جدید به dashboard observability
- ◆بعد از ناهار: pair programming با مهندس میانی برای یاد گرفتن یک ابزار جدید
- ◆عصر: مستندسازی یک runbook برای incident اخیر + شرکت در Code Review
میانی (۲–۵ سال)
ترکیب کدنویسی، طراحی و همکاری. یک sub-system را own میکنید (مثل feature store یا serving). شروع به نوشتن RFC و رهبری پروژههای کوچک میکنید.
- ◆صبح: بررسی متریکهای platform — uptime، p99 latency، GPU utilization
- ◆جلسه ۳۰ دقیقه با تیم data science: درک نیاز جدید برای feature streaming
- ◆بلاک کدنویسی: پیادهسازی یک operator جدید Kubernetes برای job scheduling
- ◆بعد از ناهار: Code Review برای کار جونیور + جلسه با تیم security
- ◆عصر: نوشتن RFC برای migration از Argo CD به Flux و ارسال به تیم
ارشد (۵+ سال)
تمرکز روی architecture، روابط cross-team و technical strategy. کمتر کد مینویسید اما تصمیمهای شما تأثیر چند ساله دارد. روی build vs buy و roadmap کوارتری کار میکنید.
- ◆صبح: review روزانه قابلیتهای platform و brainstorm با Staff engineers تیمهای دیگر
- ◆جلسه architecture: بررسی طرح serving layer جدید برای LLMs در شرکت
- ◆کدنویسی هدفمند: contribution به یک پروژه OSS برای رفع limitation حیاتی
- ◆بعد از ناهار: جلسه با VP Engineering درباره cost optimization و capacity planning
- ◆عصر: منتورینگ ۱:۱ با مهندس میانی + نوشتن postmortem incident
مسئولیتها و وظایف
مسئولیتهای اصلی
وظایف روزانه و مهارتهای مورد نیاز در این شغل
- ◈طراحی و پیادهسازی ML pipeline های مقیاسپذیر روی Kubernetes با ابزارهایی مثل Kubeflow و Argo
- ◈ساخت و نگهداری feature store برای serving feature ها به مدلهای online و offline
- ◈طراحی model serving infrastructure با autoscaling، A/B testing و canary deployment
- ◈پیادهسازی observability stack — metrics، logging، tracing و model drift detection
- ◈بهینهسازی هزینههای GPU cluster و training jobs (spot instances، multi-tenancy)
- ◈نوشتن Terraform / Helm chart برای provision کردن resources در multi-cloud
- ◈همکاری با data scientists و ML engineers برای درک نیازها و ساخت ابزار مناسب
- ◈هدایت technical decisions با RFC نویسی و ارائه trade-off های معماری
مهارتهای مورد نیاز
مهارتهای فنی، نرم و حوزهای که یک مهندس پلتفرم یادگیری ماشین موفق به آنها نیاز دارد
مهارتهای فنی
درک operator pattern، custom resources، scheduler، networking و troubleshooting در scale
اصول CAP، consensus، fault tolerance و درک عمیق ترسیمی سیستمهای توزیعشده
Python برای automation و glue code، Go برای infrastructure tooling و Kubernetes operators
تسلط بر یکی از AWS، GCP یا Azure شامل managed ML services (SageMaker، Vertex AI)
تجربه عملی با MLflow، Kubeflow، Argo، Feast و درک trade-off بین ابزارها
Terraform، Helm، Crossplane برای مدیریت declarative resources
Prometheus، Grafana، OpenTelemetry برای metrics، logs و traces در ML systems
مهارتهای نرم
گوش دادن به data scientists، استخراج pattern و طراحی API ای که نیاز ۸۰٪ موارد را پوشش دهد
نوشتن documentation و design doc هایی که خوانده میشوند، نه فقط نوشته میشوند
ارتباط مؤثر با data science، ML engineering، security و SRE تیمها
تشخیص این که کجا باید build کرد، کجا buy، و کجا با duct tape موقت رد شد
حفظ خونسردی در incident، تصمیم سریع، و یادگیری از postmortem
دانش حوزهای
آشنایی با distributed training، GPU scheduling، quantization و serving optimization
درک SOC2، GDPR، model security، secrets management و audit trail برای ML systems
بهینهسازی هزینه GPU، spot instance management، autoscaling و budget enforcement
آشنایی با Spark، Kafka، Iceberg و streaming برای feature pipeline ها
نقشه راه و مسیر آموزشی
نقشه راه تبدیل شدن به مهندس پلتفرم یادگیری ماشین
این مسیر گام به گام شما را از صفر تا حرفهای هدایت میکند.
مبانی Software Engineering و سیستمهای توزیعشده
ساخت پایه مهندسی نرمافزار — Python، Go، concurrency، testing و درک سیستمهای توزیعشده که bedrock کار platform engineering است
Cloud، Containers و Orchestration
تسلط بر Docker، Kubernetes و یکی از cloud های اصلی (AWS, GCP, Azure) — زبان مادری platform engineering
مبانی ML و درک Workflow data scientist ها
یادگیری ML کافی برای درک نیازهای کاربران شما — data scientists و ML engineers. لازم نیست مدل بسازید اما باید زبان آنها را بفهمید
MLOps، Pipelines و Feature Stores
ساخت قطعات اصلی یک ML platform — pipeline orchestration، feature store، model registry و experiment tracking
Model Serving، Observability و Scale
تخصص در serving با latency پایین، monitoring مدلها در production و scale کردن platform برای صدها مدل و میلیونها request
ابزارها و استک فنی
ابزارهایی که هر مهندس AI باید بشناسد، دستهبندیشده بر اساس اولویت
Orchestration و Infrastructure
ML Pipelines و Workflow
Model Serving و Inference
Tracking، Registry و Observability
مسیر پیشرفت شغلی
از جونیور تا Staff Engineer — چه مهارتهایی نیاز دارید و چه درآمدی انتظار داشته باشید
ML Platform Engineer جونیور
۰ تا ۲ سال
~$110K
میانگین سالانه (آمریکا)
نگهداری pipeline های موجود، debug کردن jobs که fail میشوند، اضافه کردن metric و alert به سیستم
ML Platform Engineer میانی
۲ تا ۵ سال
~$170K
میانگین سالانه (آمریکا)
طراحی و پیادهسازی components جدید platform، own کردن یک sub-system (مثل feature store یا serving)
Senior ML Platform Engineer
۵ تا ۸ سال
~$240K
میانگین سالانه (آمریکا)
معماری کل platform، تصمیم build vs buy، رهبری migration های بزرگ، mentoring تیم
Staff / Principal ML Platform Engineer
۸+ سال
~$360K
میانگین سالانه (آمریکا)
تعریف ML platform strategy شرکت، representation در standards (CNCF, MLPerf)، coordination با VP Eng و CTO
چالشها و جنبههای منفی
واقعیتهایی که کمتر در آگهیهای شغلی میبینید — قبل از ورود بدانید
Trade-off بین standardization و flexibility
عمومیdata scientists میخواهند آزادی استفاده از هر کتابخانه و framework را داشته باشند، اما platform نیاز به standardization دارد تا قابل maintain باشد. مذاکره این مرز یک چالش روزانه است.
تشخیص نیاز واقعی از hype
استارتاپهر هفته یک ابزار جدید MLOps معرفی میشود. باید تشخیص دهید کدام واقعاً نیاز شما را حل میکند و کدام فقط hype است. اشتباه در این تصمیم سالها rollback میخواهد.
مدیریت هزینههای GPU در scale
شرکت بزرگGPU گران است و training jobs بزرگ میتوانند روزانه هزاران دلار مصرف کنند. طراحی scheduler هایی که spot instance استفاده میکنند و idle resource را به حداقل میرسانند یک چالش دائمی است.
Multi-tenancy و isolation
شرکت بزرگدهها تیم با نیازهای مختلف از یک platform استفاده میکنند. تضمین این که job یک تیم روی performance یا security تیم دیگر تأثیر نگذارد نیازمند طراحی دقیق است.
Reproducibility در سیستمهای پیچیده
تحقیقاتییک training job ممکن است به دهها dependency، dataset version و hyperparameter بستگی داشته باشد. تضمین این که هر کس بتواند نتیجه را reproduce کند یک مسئله حلنشده در صنعت است.
Migration بدون downtime
شرکت بزرگهنگام تغییر زیرساخت زیرین (مثلاً K8s version یا serving engine جدید)، باید مدلهای production بدون مزاحمت برای کاربران migrate شوند. این یکی از سختترین کارهای روزمره است.
حقوق و بازار کار جهانی
حقوق جهانی مهندس پلتفرم یادگیری ماشین
میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف
| کشور | میانه | ارز |
|---|---|---|
🇯🇵ژاپن | ¥14,000,000 | JPY |
🇮🇳هند | ₹4,000,000 | INR |
🇦🇪امارات | AED 300,000 | AED |
🇺🇸آمریکا | $240,000 | USD |
🇨🇦کانادا | CA$170,000 | CAD |
🇨🇭سوئیس | CHF 170,000 | CHF |
🇸🇬سنگاپور | SGD 170,000 | SGD |
🇦🇺استرالیا | A$165,000 | AUD |
🇬🇧انگلستان | £125,000 | GBP |
🇩🇪آلمان | €110,000 | EUR |
🇳🇱هلند | €105,000 | EUR |
* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شدهاند.
چگونه از صفر شروع کنیم
برنامه گامبهگام برای ورود به مهندسی هوش مصنوعی
ماه ۱: Kubernetes Deep Dive
Kubernetes را عمیق یاد بگیرید — نه فقط kubectl، بلکه scheduler، controller و networking. minikube روی لپتاپ راه بیندازید.
ماه ۲: ML Fundamentals
fast.ai یا Andrew Ng را تمام کنید. هدف درک workflow data scientist است نه ساخت SOTA model.
ماه ۳: MLOps Tooling
با MLflow، Weights & Biases و Kubeflow Pipelines کار کنید. یک training pipeline ساده روی Kubernetes اجرا کنید.
ماه ۴: Model Serving
KServe، BentoML و Triton را امتحان کنید. یک مدل را با autoscaling و A/B testing serve کنید.
ماه ۵: Feature Store و Observability
Feast را راهاندازی کنید. Prometheus + Grafana برای monitoring اضافه کنید. مفاهیم data drift را یاد بگیرید.
ماه ۶: پروژه end-to-end و job search
یک ML platform mini روی cloud بسازید: K8s، MLflow، KServe، Feast، Prometheus. GitHub را تمیز کنید، شروع به apply کنید.
پروژههای پیشنهادی برای رزومه
Mini ML Pipeline با MLflow
مبتدییک pipeline ساده بسازید که داده را preprocess کند، یک مدل sklearn آموزش دهد، با MLflow track کند و در registry register کند. در Docker container قرار دهید.
Feature Store ساده با Feast
متوسطFeast را راهاندازی کنید، یک dataset را به feature تبدیل کنید و یک online + offline store بسازید. یک API بسازید که features را برای inference بدهد.
Model Serving روی Kubernetes
متوسطیک مدل PyTorch را با KServe یا BentoML روی یک Kubernetes cluster (minikube یا kind) deploy کنید با autoscaling و health checks فعال.
End-to-End MLOps Platform
پیشرفتهیک stack کامل بسازید: Argo Workflows برای training، MLflow برای tracking، KServe برای serving، Prometheus برای monitoring. همه روی یک Kubernetes cluster واقعی در cloud.
Distributed Training Infrastructure با Ray
پیشرفتهیک Ray cluster روی Kubernetes راهاندازی کنید که distributed training (مثلاً با Ray Train + PyTorch DDP) و hyperparameter tuning (Ray Tune) را پشتیبانی کند. cost و throughput را اندازهگیری کنید.
مثالهای واقعی و Case Studies
داستانهای واقعی از مهندسانی که در این حوزه تأثیرگذار بودهاند
بدون مدرک رسمی دانشگاهی، خودآموخته، با سالها کار در sysadmin و DevOps. سپس Staff Developer Advocate در Google Cloud شد و یکی از معتبرترین صداهای جهان در Kubernetes و platform engineering.
نویسنده «Kubernetes the Hard Way» — منبع آموزشی که میلیونها مهندس را به دنیای Kubernetes معرفی کرد. سخنران اصلی در KubeCon ها و کسی که زبان مشترک community Kubernetes را شکل داد. در ۲۰۲۳ از Google بازنشسته شد اما همچنان مرجع کلیدی صنعت است.
Hightower ثابت کرد که در platform engineering مدرک مهم نیست — مهم درک عمیق سیستمها و توانایی توضیح ساده آنهاست. ساخت محتوای آموزشی open-source میتواند مسیر شغلی شما را شکل دهد.
کارشناسی و کارشناسی ارشد از Stanford، سپس کار در NVIDIA، Snorkel AI و Netflix. مدرس CS329S (Machine Learning Systems Design) در Stanford و یکی از پرنفوذترین صداها در حوزه ML Systems.
نویسنده کتاب «Designing Machine Learning Systems» که در میلیونها مهندس به مرجع تبدیل شد. در ۲۰۲۳ کتاب «AI Engineering» را منتشر کرد. سپس co-founder شد در Claypot AI روی real-time ML و سپس به Voltage Park پیوست. در سطح صنعتی استانداردهای MLOps را شکل میدهد.
Huyen نمونهای از کسی است که تئوری دانشگاه را با عمل صنعت ترکیب کرده. آموختن، نوشتن و share کردن یادگیریها (در blog یا کتاب) ابزار قدرتمندی برای رشد و influence در حوزه platform engineering است.
Engineering manager سابق در Uber که تیم Michelangelo را رهبری کرد — اولین ML platform در scale صنعتی در جهان. بعد از Uber بنیانگذار Anyscale (شرکت سازنده Ray) و سپس مشاور چندین platform startup.
رهبری ساخت Michelangelo که در Uber از یک پروژه آزمایشی به platform اصلی برای صدها مدل تبدیل شد و الگوی هر ML platform در صنعت شد. سپس به Anyscale پیوست تا Ray را به استاندارد distributed computing برای AI تبدیل کند.
ساخت ML platform شغل تنها نیست — رهبری تیم، گذاشتن استاندارد و انتشار learning به community جزئی از کار است. case study Michelangelo نشان میدهد یک platform خوب میتواند هزاران ML engineer را قدرتمند کند.
نمونه آگهی استخدام واقعی + تحلیل
یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش
Senior Software Engineer, ML Platform
تحلیل نیازمندیها
5+ years building distributed systems or platform services in production
Netflix به دنبال کسی است که قبلاً سیستم در scale ساخته. لازم نیست در ML بوده باشد — تجربه backend distributed با Java/Go/Python در scale تولیدی هم قابل قبول است.
ضروریExpert in Kubernetes, container orchestration, and cloud infrastructure (AWS preferred)
Kubernetes deep expertise حیاتی است. AWS مزیت است چون Netflix روی AWS است، اما تجربه با GCP یا Azure هم پذیرفته میشود. CKA کمک میکند اما الزامی نیست.
ضروریStrong proficiency in Python, Java, or Go for building developer-facing platforms
Python برای glue code و automation، Java/Go برای infrastructure tooling. حداقل دو زبان از این لیست را در سطح production باید بنویسید.
ضروریExperience with ML workflows (training, serving, feature engineering)
نیاز نیست data scientist باشید اما باید درک واقعی از training loop، serving، feature engineering داشته باشید. کار قبلی روی یک ML pipeline (حتی به عنوان infrastructure) کافی است.
مهمExperience with workflow orchestration (Airflow, Argo, Metaflow) and ML tooling (MLflow, Kubeflow)
تجربه با حداقل یکی از این ابزارها در production. Netflix خود از Metaflow استفاده میکند پس آشنایی با آن مزیت است اما الزامی نیست.
مهمFamiliarity with deep learning frameworks (PyTorch, TensorFlow, JAX)
درک سطحی کافی است — میدانید چطور یک training job اجرا میشود و چه resource نیاز دارد. لازم نیست مدل state-of-the-art بنویسید.
مفیدتحلیل مسئولیتها
Design, build, and operate ML infrastructure services used by Netflix data scientists and ML engineers
platform برای کاربر داخلی میسازید. مهمترین skill شناختن نیاز user (data scientist) و طراحی abstraction هایی است که DX خوبی فراهم میکنند.
Define APIs, SDKs, and tooling that abstract ML complexity for hundreds of internal users
API design و SDK نویسی مهارت اصلی است. باید بتوانید complexity را پنهان کنید بدون این که flexibility را قربانی کنید. مطالعه Netflix Metaflow کتابخانهای عالی برای یادگیری این الگو است.
Collaborate with research teams to bring cutting-edge ML capabilities (LLMs, multimodal) to production
نیاز به همکاری نزدیک با research است. باید بتوانید paper بخوانید، نیاز را بفهمید و infrastructure مناسب بسازید. این بخشی است که با junior role متفاوت است.
Lead design and execution of major platform initiatives across multiple teams
نقش technical leadership قوی دارد. باید بتوانید RFC بنویسید، با چند تیم coordination کنید و در نهایت یک پروژه چند ماهه را به ثمر برسانید.
نتیجهگیری کلی
این آگهی نشان میدهد Netflix به جای ML expertise روی platform engineering در scale + همدلی با user تأکید دارد. اگر backend engineer قوی هستید با کمی تجربه ML، میتوانید به این نقش apply کنید — لازم نیست از قبل ML platform engineer باشید. کلید موفقیت در مصاحبه نشان دادن system design و درک developer experience است.
آینده و روندها
پیشبینی ۵–۱۰ ساله و مهارتهایی که باید یاد بگیرید
رشد ۳۲٪ سالانه تا ۲۰۳۰ — تقاضا برای ML Platform Engineer در سالهای ۲۰۲۶ تا ۲۰۲۹ بیشتر از خود ML Engineer رشد میکند
منبع: LinkedIn Emerging Jobs Report 2025 / Gartner MLOps Market Forecast 2025
مهارتهای نوظهور که باید یاد بگیرید
پیشبینیهای آینده
هر شرکت با ۱۰+ مدل production یک تیم اختصاصی ML Platform خواهد داشت — این تبدیل به استاندارد میشود
LLM Infrastructure یک تخصص جدا از ML Platform میشود — با ابزارها و مهارتهای خاص (KV cache، speculative decoding)
Compound AI Systems (orchestration چند مدل) چالش جدید platform میشود — pipeline های پیچیده با inference چندمرحلهای
Edge ML deployment رشد میکند — platform engineer هایی که در cloud-to-edge orchestration متخصص شوند پرتقاضاترین خواهند بود
ریسک واقعی برای ML Platform Engineer ها این است که managed services (Vertex AI، SageMaker، Databricks) قابلیتهای platform های in-house را cover کنند. در شرکتهای کوچک ممکن است نیاز به ML Platform Engineer اختصاصی کاهش یابد. اما در شرکتهای متوسط و بزرگ که نیازهای خاص (latency، compliance، cost) دارند، تقاضا قوی میماند. کسانی که فقط managed service ها را config میکنند بیشتر آسیبپذیرند؛ کسانی که distributed systems را عمیق میفهمند و LLM infrastructure را master میکنند جایگاهشان امنتر است.
ویدیوهای آموزشی
یک روز در زندگی یک ML Platform Engineer
ویدیوهای واقعی از متخصصان این حوزه که روزانه چه کارهایی انجام میدهند

DevOps vs SRE vs Platform Engineering | Clear Big Misconceptions
ByteByteGo

The Three Types of ML Platforms
Gus Cavanaugh

DevOps Jobs Are Disappearing - Here's Why You Should Celebrate
Mischa van den Burg

DON'T Become a DevOps Engineer - Do THIS Instead
Tech With Soleyman

MLOps, Kubeflow, and Tekton - Simon Kaegi, IBM
Continuous Delivery Foundation

MLOps and the Rise of Governance with Algorithmia
Ai4
