🏗️
رتبه ۳۵ از ۱۰رشد ۳۸% سالانه

مهندس زیرساخت آموزش مدل

Model Training Infrastructure Engineer

مهندس زیرساخت آموزش مدل (Model Training Infrastructure Engineer) متخصصی است که سیستم‌های توزیع‌شده عظیم برای آموزش مدل‌های بنیادین (foundation models) را طراحی و اجرا می‌کند. این نقش در تقاطع distributed systems، high-performance computing و deep learning قرار دارد و وظیفه‌اش این است که هزاران GPU را به‌صورت همزمان و کارآمد برای آموزش مدل‌هایی مانند GPT، Claude و Gemini هماهنگ کند. در ۲۰۲۶ با هزینه آموزش مدل‌های مرزی به مرز ۱۰۰ میلیون دلار، یک ساعت downtime یا یک bug در gradient sync می‌تواند میلیون‌ها دلار خسارت بزنند — به همین دلیل این تخصص جزو پرحقوق‌ترین نقش‌های صنعت AI است و در OpenAI، Anthropic و xAI به ۴۰۰ تا ۷۰۰ هزار دلار TC در سال می‌رسد.

Distributed TrainingCUDA / NCCLPyTorch FSDP / MegatronKubernetes / SlurmGPU Networking

مقدمه و تعریف شغل

مهندس زیرساخت آموزش مدل (Model Training Infrastructure Engineer) متخصصی است که سیستم‌های توزیع‌شده برای آموزش مدل‌های هوش مصنوعی بزرگ — به‌خصوص مدل‌های بنیادین مانند GPT، Claude و Llama — را طراحی، پیاده‌سازی و نگهداری می‌کند. این نقش با ML Engineer معمولی تفاوت بنیادی دارد: تمرکز این شخص روی خود مدل و دقت آن نیست، بلکه روی سرعت، پایداری، utilization و هزینه‌ی فرآیند training در مقیاس هزاران GPU است. این تخصص در تقاطع HPC، systems engineering و deep learning قرار دارد.

تا سال ۲۰۱۸ آموزش مدل‌های deep learning عمدتاً روی یک یا چند GPU انجام می‌شد و مهندسان ML خودشان infrastructure را هم مدیریت می‌کردند. ظهور BERT (2018)، GPT-2 (2019) و GPT-3 (2020) معادله را عوض کرد — آموزش یک مدل ۱۷۵B پارامتری روی ۱۰۰۰۰ GPU به یک ماه زمان و میلیون‌ها دلار هزینه نیاز داشت. به‌مرور یک تخصص جداگانه شکل گرفت: کسی که می‌داند چطور NCCL را روی InfiniBand tune کند، چطور FSDP را با pipeline parallelism ترکیب کند و چطور یک training run چند هفته‌ای را زنده نگه دارد. تا ۲۰۲۶ این نقش در OpenAI، Anthropic، xAI، Google DeepMind و Meta FAIR به یکی از حیاتی‌ترین موقعیت‌ها تبدیل شده — چون با هزینه ۱۰۰ میلیون دلاری هر training run، یک bug در gradient sync می‌تواند یک کوارتر کل شرکت را به عقب بیندازد.

چه چیزی می‌سازید؟

مثال‌های واقعی از خروجی کار یک مهندس زیرساخت آموزش مدل

🏭

Training pipeline توزیع‌شده روی هزاران GPU

Anthropic می‌خواهد Claude Opus بعدی را روی ۱۶۰۰۰ H100 برای ۳ ماه آموزش دهد. شما FSDP + tensor parallelism + pipeline parallelism را با هم compose می‌کنید تا MFU بالای ۵۰٪ باشد.

Custom GPU kernels برای bottleneck های مدل

نسخه استاندارد attention روی sequence length 128K کند است. شما با Triton یک fused kernel می‌نویسید که memory bandwidth را ۳ برابر بهتر استفاده کند — مشابه کاری که Tri Dao با FlashAttention کرد.

💾

Fault-tolerant checkpointing system

در یک training run سه ماهه، تقریباً هر روز یک GPU fail می‌کند. شما سیستمی می‌سازید که هر ۳۰ دقیقه async checkpoint می‌گیرد و در عرض ۵ دقیقه از آخرین checkpoint resume می‌کند بدون از دست رفتن progress.

📊

Observability stack برای training runs

OpenAI نیاز دارد در هر لحظه از training بداند که loss، grad norm، GPU temperature و network throughput روی هر یک از ۱۰۰۰۰ GPU چه وضعیتی دارند. شما داشبورد real-time با Prometheus و Grafana می‌سازید.

🔧

Cluster bring-up و hardware tuning

xAI cluster جدید ۲۰۰۰۰۰ GPU را در Memphis راه‌اندازی کرده. شما NCCL topology را برای NVLink/NVSwitch تنظیم می‌کنید، InfiniBand را benchmark می‌کنید و burn-in test طراحی می‌کنید.

💰

Cost optimization و workload scheduling

Mistral می‌خواهد cluster ۱۰۲۴ GPU خود را بین چند تیم research به‌اشتراک بگذارد. شما scheduling system با Slurm می‌سازید که gang scheduling، preemption و fair-share را پشتیبانی کند.

تخصص‌های مختلف مهندس زیرساخت آموزش مدل

این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد

🧩

سیستم‌های آموزش توزیع‌شده

Distributed Training Systems

تخصص در FSDP، Megatron، DeepSpeed و طراحی 3D parallelism — هسته‌ی اصلی نقش در OpenAI، Anthropic و Meta.

⚙️

مهندسی GPU Kernel

GPU Kernel Engineering

نوشتن CUDA و Triton kernel سفارشی برای attention، normalization و quantization — تخصص نادر و پرحقوق، در NVIDIA و Together AI پررنگ است.

🖥️

عملیات کلاستر GPU

Cluster Operations

مدیریت hardware، شبکه، storage و scheduling در مقیاس چندین هزار GPU — استاندارد در CoreWeave، Lambda Labs و xAI.

🛠️

توسعه فریم‌ورک آموزش

Training Framework Development

نوشتن خود فریم‌ورک‌هایی مثل Megatron یا torchtitan — تخصص NVIDIA، Meta و PyTorch core team.

🚀

کامپایلر و کارایی

Compiler & Performance

کار با torch.compile، XLA، Mosaic Compiler و quantization-aware kernels — در Modular، OctoML و Anthropic perf team پررنگ است.

تفاوت با شغل‌های مشابه

کجا این شغل تمام می‌شود و شغل دیگری شروع می‌شود؟

مهندس یادگیری ماشینML Engineer

ML Engineer روی طراحی مدل، loss function و dataset تمرکز دارد — هدفش بهبود دقت و کیفیت خروجی است. Training Infrastructure Engineer روی این تمرکز دارد که همان مدل را با MFU بالاتر، هزینه کمتر و پایداری بیشتر روی هزاران GPU اجرا کند. مهندس ML خروجی را می‌بیند؛ مهندس infra سیستمی که خروجی را تولید می‌کند.

مهندس MLOpsMLOps Engineer

MLOps Engineer روی inference و deployment تمرکز دارد — serving مدل به کاربر، A/B test، monitoring production. Training Infrastructure Engineer در مرحله قبل کار می‌کند — فرآیند ساخت خود مدل. MLOps با Kubernetes و FastAPI کار می‌کند؛ Training Infra با NCCL و CUDA.

مهندس محاسبات با کارایی بالاHPC Engineer

HPC Engineer در محیط‌های scientific computing کار می‌کند: simulation فیزیک، CFD، شبیه‌سازی مولکولی. مهارت‌های پایه‌ای مشابه است (MPI، InfiniBand، Slurm) ولی Training Infra دانش deep learning و PyTorch internals را هم نیاز دارد. بسیاری از training infra engineer ها از HPC وارد این حوزه شده‌اند.

مهندس قابلیت اطمینان سایتSite Reliability Engineer

SRE روی سرویس‌های stateless web در مقیاس کار می‌کند (SLO، on-call، incident response). Training Infra Engineer هم SRE-style mindset دارد ولی workload کاملاً متفاوت است: یک training run منفرد که هفته‌ها طول می‌کشد و یک خطای سخت‌افزاری ساده می‌تواند کل پیشرفت را نابود کند.

تأثیر در صنایع مختلف

مهندس زیرساخت آموزش مدل در همه صنایع مشغول به کار است — نه فقط شرکت‌های فناوری

🧠

AI Lab های مرزی

آموزش مدل‌های مرزی مانند GPT، Claude، Gemini و Llama — هر MFU بهبود ۵٪ یعنی ده‌ها میلیون دلار صرفه‌جویی

☁️

Cloud Hyperscalers

AWS SageMaker، Azure ML و GCP Vertex برای آموزش managed مدل‌های بزرگ به مشتریان enterprise اتکا دارند

🛡️

Defense و Security

Palantir، Anduril و قراردادهای DoD به مدل‌های اختصاصی آموزش‌دیده روی داده‌های classified نیاز دارند

🚗

Autonomous Driving

Tesla، Waymo و Cruise مدل‌های perception را روی ده‌ها هزار GPU با حجم ویدیویی petabyte آموزش می‌دهند

💊

Drug Discovery

Isomorphic Labs و Recursion Pharma مدل‌های protein folding و molecular generation را در مقیاس آموزش می‌دهند

🤖

Robotics Foundation Models

Physical Intelligence و Figure AI روی foundation model های robotics با training run های چند ماهه کار می‌کنند

📈

Financial Modeling

Two Sigma، Citadel و JPMorgan models بزرگ time-series و alternative-data را روی GPU cluster های اختصاصی آموزش می‌دهند

🌍

Climate و Weather

NVIDIA Earth-2، Google GraphCast و ECMWF مدل‌های پیش‌بینی آب‌وهوا را با data parallelism در مقیاس عظیم آموزش می‌دهند

تصورات غلط رایج

قبل از تصمیم‌گیری، این باورهای اشتباه را بشناسید

فقط یعنی apply کردن DDP در PyTorch

DDP کف کار است. در training مدل ۱۰۰B+ نیاز به ترکیب FSDP + tensor parallelism + pipeline parallelism + sequence parallelism دارید و باید topology شبکه را هم در نظر بگیرید.

هر شرکتی به این نقش نیاز دارد

این نقش عمدتاً در ۲۰ تا ۳۰ شرکت دنیا که واقعاً مدل training می‌کنند معنا دارد. اگر فقط fine-tune یا inference انجام می‌دهید، یک MLOps engineer کافی است نه training infra engineer.

باید PhD داشته باشید

بسیاری از training infra engineer های برتر بدون PhD وارد این حوزه شده‌اند — از HPC، systems engineering یا game dev. مهم درک عمیق سیستم‌ها و GPU است، نه مدرک.

همه چیز AutoML و ابزار آماده می‌شود

برعکس — هرچه مدل‌ها بزرگ‌تر می‌شوند، تخصصی‌تر و پیچیده‌تر می‌شوند. کسی که می‌داند چطور یک training run ۱۰۰ روزه را زنده نگه دارد، در ۲۰۳۰ هم پرتقاضاتر از امروز خواهد بود.

همه روز کد می‌نویسید

بخش بزرگی از زمان صرف debugging، profiling، نوشتن postmortem و communication با تیم research و hardware vendors می‌شود. کدنویسی کمتر از نقش software engineer معمولی است.

یک روز کاری واقعی

در هر سطح روز کاری چه شکلی است؟

جونیور (۰–۲ سال)

بیشتر وقت در یادگیری cluster، debug کردن issue های NCCL و کمک به ارشدها در reproducing مسائل می‌گذرد. کارها مشخص و under supervision هستند.

  • صبح: بررسی training job های شبانه و گزارش وضعیت در standup
  • بلاک اول: debug کردن یک hang در NCCL — بررسی log ها و GPU metrics
  • بعد از ناهار: اجرای benchmark یک تغییر کوچک در data loader و گزارش throughput
  • عصر: مطالعه کد Megatron-LM یا torchtitan و درک یک قسمت جدید
  • پایان روز: نوشتن یک on-call runbook برای issue که امروز حل شد

میانی (۲–۵ سال)

owner یک workload یا یک component از training stack هستید. خودتان مسئله را تعریف و حل می‌کنید و معمولاً یکی دو جونیور را هم mentor می‌کنید.

  • صبح: بررسی MFU و loss curve یک training run بزرگ که دیشب شروع شد
  • جلسه ۳۰ دقیقه با تیم research: بررسی این‌که آیا یک ایده architectural جدید قابل آموزش در stack فعلی هست
  • بلاک کدنویسی: implement یک Triton kernel برای fused operation که bottleneck شده
  • بعد از ناهار: profiling یک run با Nsight Systems و پیدا کردن stage که communication-bound است
  • عصر: نوشتن RFC برای migration از DeepSpeed به FSDP و send به تیم

ارشد (۵+ سال)

تمرکز روی تصمیم‌گیری استراتژیک و معماری چند ساله. کمتر کد می‌نویسید ولی هر تصمیم اثر چند میلیون دلاری دارد. وقت زیادی صرف cross-team alignment می‌شود.

  • صبح: بررسی وضعیت چند training run موازی + تصمیم‌گیری روی priority cluster
  • جلسه architecture review: ارزیابی hardware option های نسل بعد (H200 vs B200) با تیم hardware
  • کدنویسی هدفمند: بهینه‌سازی یک kernel critical که فقط شما تجربه عمیق آن را دارید
  • بعد از ناهار: جلسه با VP Research درباره roadmap مدل بعدی و infra requirements
  • عصر: نوشتن postmortem یک incident بزرگ که یک هفته training را به عقب انداخت

مسئولیت‌ها و وظایف

مسئولیت‌های اصلی

وظایف روزانه و مهارت‌های مورد نیاز در این شغل

فنی
  • طراحی و پیاده‌سازی training pipeline توزیع‌شده برای مدل‌های foundation روی صدها تا هزاران GPU
  • بهینه‌سازی Model FLOPs Utilization (MFU) و throughput با تنظیم parallelism strategy و communication patterns
  • نوشتن CUDA / Triton kernel سفارشی برای operation های performance-critical مانند attention و normalization
  • debug کردن hang و NaN و gradient divergence در training run های چند هفته‌ای
  • طراحی checkpointing توزیع‌شده و fault tolerance برای recover سریع از node failure
  • مدیریت پایداری cluster، GPU health monitoring و هماهنگی با hardware vendors برای rack-level issues
مهارت نرم
  • هماهنگی با تیم research برای ترجمه ایده‌های جدید (مثل MoE یا long-context) به training infrastructure قابل اجرا
مدیریتی
  • هدایت incident response در زمان training failure — تصمیم‌گیری زیر فشار وقتی هر ساعت downtime میلیون‌ها دلار هزینه دارد

مهارت‌های مورد نیاز

مهارت‌های فنی، نرم و حوزه‌ای که یک مهندس زیرساخت آموزش مدل موفق به آن‌ها نیاز دارد

مهارت‌های فنی هسته

PyTorch Internalsضروری

درک autograd، dispatcher، عملکرد torch.compile و قابلیت نوشتن custom extension

Distributed Training Strategiesضروری

تسلط بر DDP، FSDP، tensor parallelism، pipeline parallelism و sequence parallelism

CUDA و GPU Architectureضروری

درک memory hierarchy، tensor cores، warp scheduling و توانایی نوشتن kernel ساده با CUDA یا Triton

NCCL و Collective Communicationضروری

آشنایی عمیق با AllReduce، AllGather، Ring vs Tree، و tuning روی NVLink و InfiniBand

Linux Systems Engineeringضروری

تسلط بر cgroups، namespaces، NUMA، scheduling kernel و troubleshooting سطح OS

Cluster Orchestrationمهم

کار با Slurm یا Kubernetes برای ML — gang scheduling، resource quotas و job lifecycle

Profiling و Performance Analysisمهم

استفاده عملی از Nsight Systems، Nsight Compute و PyTorch Profiler برای تشخیص bottleneck

مهارت‌های سیستم و زیرساخت

Storage برای MLضروری

آشنایی با Lustre، WekaFS، S3-compatible و چگونگی feed سریع داده به cluster

Networking (InfiniBand / RoCE)مهم

درک topology، congestion، latency و throughput در شبکه‌های HPC

Checkpointing توزیع‌شدهمهم

طراحی async و sharded checkpointing برای حفظ state در training run چند هفته‌ای

Observabilityمهم

Prometheus، Grafana، W&B و طراحی dashboard های real-time برای training

Mixed Precision و Quantizationمهم

BF16، FP8 و آشنایی با quantization-aware training و trade-off کیفیت/سرعت

Cloud GPU Platformsمفید

تجربه با CoreWeave، Lambda Labs، AWS P5، Azure NDv5 و comparing economics

Containerizationمفید

Docker و Singularity برای reproducible training environment

مهارت‌های نرم و تخصصی

Incident Responseضروری

آرامش زیر فشار وقتی یک training run میلیون دلاری در نیمه شب fail می‌کند

Communication با تیم researchضروری

ترجمه نیاز research به zنیرساخت قابل اجرا — و گاهی گفتن صادقانه «این هنوز امکان‌پذیر نیست»

Documentation عمیقمهم

نوشتن runbook، postmortem و RFC با کیفیت بالا — چون کار شما اغلب یک‌بار رخ می‌دهد

یادگیری مداوممهم

هر ۶ ماه paper جدید و hardware جدید بازی را عوض می‌کند؛ خواندن مقالات NeurIPS و MLSys ضروری است

Hardware-Software Co-designمهم

درک trade-off های hardware (HBM bandwidth، NVLink topology) برای تصمیم‌گیری software

ارزیابی Vendor Claimsمفید

توانایی benchmark مستقل ادعاهای NVIDIA، AMD، Intel و startup های chip

ضروری — بدون آن نمی‌توان وارد بازار کار شدمهم — تفاوت بین جونیور و میانیمفید — مزیت رقابتی

نقشه راه و مسیر آموزشی

نقشه راه تبدیل شدن به مهندس زیرساخت آموزش مدل

این مسیر گام به گام شما را از صفر تا حرفه‌ای هدایت می‌کند.

1

پایه‌های سیستم‌های توزیع‌شده و Linux

⏱️ ۳ تا ۴ ماه

ساخت پایه قوی در سیستم‌عامل، شبکه و سیستم‌های توزیع‌شده — bedrock هر مهندس infrastructure

Linux پیشرفته (systemd, cgroups, namespaces)Networking (TCP/IP, RDMA, InfiniBand)Bash & Python ScriptingGit & GitOpsDistributed Systems TheoryComputer Architecture (cache, memory hierarchy)Performance Profiling
2

GPU Computing و CUDA Programming

⏱️ ۳ تا ۴ ماه

تسلط بر معماری GPU، نوشتن کرنل‌های CUDA و درک عمیق memory hierarchy روی H100 و A100

CUDA C/C++Triton (OpenAI)GPU Memory (HBM, SRAM, registers)Tensor Cores & Mixed PrecisionProfiling با Nsight Systems / Nsight ComputePTX و SASS BasicsNVLink & NVSwitch Topology
3

Deep Learning و PyTorch Internals

⏱️ ۳ تا ۴ ماه

درک کامل از autograd، optimizerها و training loop در سطح framework — نه فقط API user

PyTorch Internals (autograd, dispatcher)Mixed Precision Training (FP16, BF16, FP8)Optimizer States (AdamW, Lion)Gradient Accumulation & Checkpointingtorch.compile و Graph CaptureCustom CUDA Extensions در PyTorchMemory-Efficient Backprop
4

Distributed Training و Parallelism Strategies

⏱️ ۴ تا ۶ ماه

تسلط بر استراتژی‌های parallelism — Data، Tensor، Pipeline، Sequence و ZeRO/FSDP که برای آموزش مدل‌های ۱۰۰B+ پارامتری ضروری‌اند

NCCL & Collective Communication (AllReduce, AllGather)PyTorch FSDP & DDPMegatron-LM و Tensor ParallelismDeepSpeed ZeRO Stages 1/2/3Pipeline Parallelism (GPipe, 1F1B)Sequence Parallelism برای Long Context3D Parallelism Composition
5

Cluster Orchestration و Production Training

⏱️ مداوم

اجرای training run های چند هفته‌ای روی هزاران GPU، fault tolerance، checkpointing و observability در مقیاس

Kubernetes & Slurm برای MLRay Train & Ray ClusterCheckpointing توزیع‌شده (Async, Sharded)Fault Tolerance & Auto-RestartStorage Layer (Lustre, WekaFS, S3)Cost & Utilization Monitoring (MFU, HFU)Incident Response روی GPU Cluster

ابزارها و استک فنی

ابزارهایی که هر مهندس AI باید بشناسد، دسته‌بندی‌شده بر اساس اولویت

Distributed Training Frameworks

PyTorch FSDP

استاندارد PyTorch برای sharded data parallelism — جایگزین مدرن DDP برای مدل‌های بزرگ

ضروری
Megatron-LM

framework NVIDIA برای tensor و pipeline parallelism — bedrock اکثر LLM ها

ضروری
DeepSpeed

framework Microsoft با ZeRO optimizer و offloading — popular در academic و enterprise

ضروری
JAX + Pallas

stack Google برای TPU و GPU با XLA — استفاده در Anthropic و Google DeepMind

پیشرفته

GPU و Networking

CUDA Toolkit

stack رسمی NVIDIA برای GPU programming — هر مهندس infrastructure باید بشناسد

ضروری
NCCL

کتابخانه collective communication روی NVLink/InfiniBand — قلب multi-GPU training

ضروری
Triton (OpenAI)

زبان Python-like برای نوشتن GPU kernel ها — جایگزین CUDA برای بسیاری از کاربردها

پیشرفته
Nsight Systems

ابزار profiling سیستم‌سطح NVIDIA برای پیدا کردن bottleneck های CPU/GPU/I/O

پیشرفته

Cluster Orchestration

Slurm

workload manager غالب در HPC و اکثر AI lab های بزرگ — Anthropic، OpenAI، Meta

ضروری
Kubernetes + Kubeflow

استاندارد cloud-native برای orchestration — popular در enterprise و startup

ضروری
Ray

framework توزیع‌شده Python با Ray Train و Ray Tune — popular در Anyscale و OpenAI

مفید
SkyPilot

ابزار UC Berkeley برای اجرای training روی چند cloud با کمترین config — popular در startup

مفید

Observability و Storage

Weights & Biases

استاندارد industry برای experiment tracking و training visualization

ضروری
Prometheus + Grafana

monitoring GPU، network و node-level metrics در cluster scale

ضروری
Lustre / WekaFS

parallel filesystem های HPC برای dataset های چند ترابایتی — استاندارد در training clusters

پیشرفته
TensorBoard

ابزار visualization اصلی برای training metrics و model graph

مفید
ضروری — باید یاد بگیریدمفید — ارزش یادگیری داردپیشرفته — برای سطوح ارشد

مسیر پیشرفت شغلی

از جونیور تا Staff Engineer — چه مهارت‌هایی نیاز دارید و چه درآمدی انتظار داشته باشید

مهندس Infrastructure جونیور

۰ تا ۲ سال

~$130K

میانگین سالانه (آمریکا)

نگهداری cluster، رفع issue های NCCL، اجرای training job ها و کمک به ارشدها در debugging

LinuxPyTorch DDPBashSlurm BasicsCUDA Fundamentals

مهندس Infrastructure میانی

۲ تا ۵ سال

~$220K

میانگین سالانه (آمریکا)

طراحی training pipeline برای مدل‌های ۱۰B+، tuning کارایی، رهبری incident response و owner شدن یک workload

FSDP / MegatronNCCL TuningCUDA KernelsCheckpointingCost Optimization

مهندس ارشد Training Infra

۵ تا ۸ سال

~$380K

میانگین سالانه (آمریکا)

معماری زیرساخت برای مدل‌های مرزی (100B+)، تصمیم‌گیری روی hardware و network topology، منتورینگ تیم

3D ParallelismTriton KernelsHardware Co-designMFU OptimizationDistributed Debugging

Staff / Principal Engineer

۸+ سال

~$600K

میانگین سالانه (آمریکا)

تعریف roadmap چند ساله zنیرساخت AI شرکت، همکاری با hardware vendors، owner طراحی نسل بعدی training stack

Systems ArchitectureHardware-Software Co-designOrg LeadershipCross-team StrategyResearch Direction

چالش‌ها و جنبه‌های منفی

واقعیت‌هایی که کمتر در آگهی‌های شغلی می‌بینید — قبل از ورود بدانید

Hang های مرموز در NCCL

عمومی

گاهی یک training روی ۱۰۰۰ GPU بعد از ۲ روز ناگهان متوقف می‌شود بدون پیام واضح. ممکن است یک GPU کاملاً سالم نباشد، یا یک کابل InfiniBand مشکل داشته باشد. debug کردن این مسائل ساعت‌ها و گاهی روزها زمان می‌برد.

هزینه‌های نجومی هر آزمایش

شرکت بزرگ

یک run کوچک ۱۰ ساعته روی ۲۵۶ H100 می‌تواند ۲۰ هزار دلار هزینه داشته باشد. هر تصمیم اشتباه به‌سرعت پولی واقعی می‌شود، بنابراین تصمیمات باید با benchmark دقیق و sign-off گرفته شوند.

Fault tolerance در مقیاس

تحقیقاتی

روی cluster ۱۰۰۰۰ GPU، تقریباً هر روز یک GPU می‌سوزد یا یک node failure رخ می‌دهد. سیستم باید بتواند بدون از دست رفتن چند ساعت progress recover کند — این یعنی طراحی پیچیده checkpoint و leader election.

Bleeding Edge بودن همه چیز

تحقیقاتی

اغلب از CUDA build شب گذشته، PyTorch nightly یا یک fork خصوصی Megatron استفاده می‌کنید. هیچ بخشی stable نیست و شما باید خودتان bug را پیدا و گاهی fix کنید — حتی در framework های اصلی.

محدودیت تیم و دانش متمرکز

استارتاپ

در استارتاپ‌های AI، اغلب فقط ۲ تا ۴ نفر تجربه واقعی training در این مقیاس دارند. اگر یکی مرخصی برود، بسیاری از مسائل bus factor یک پیدا می‌کند و فشار شدیدی روی بقیه می‌آورد.

Communication overhead با تیم research

شرکت بزرگ

تیم research می‌خواهد فردا یک ایده architectural جدید را تست کند، ولی شما می‌دانید این تغییر در training stack دو هفته کار می‌برد. مدیریت expectation و توضیح trade-off ها مهارت اساسی است.

حقوق و بازار کار جهانی

حقوق جهانی مهندس زیرساخت آموزش مدل

میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف

کشورمیانهارز
🇯🇵ژاپن
¥22,000,000JPY
🇮🇳هند
₹5,500,000INR
🇺🇸آمریکا
$420,000USD
🇦🇪امارات
AED 380,000AED
🇨🇦کانادا
CA$220,000CAD
🇨🇭سوئیس
CHF 200,000CHF
🇸🇬سنگاپور
SGD 195,000SGD
🇦🇺استرالیا
A$190,000AUD
🇬🇧انگلستان
£155,000GBP
🇩🇪آلمان
€130,000EUR

* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شده‌اند.

چگونه از صفر شروع کنیم

برنامه گام‌به‌گام برای ورود به مهندسی هوش مصنوعی

ماه ۱: PyTorch Internals

از سطح user به سطح framework بروید. autograd، dispatcher و torch.compile را عمیق یاد بگیرید. کد nanoGPT را خط به خط بفهمید.

ماه ۲: GPU و CUDA

اولین CUDA kernel خود را بنویسید. memory hierarchy و tensor cores را درک کنید. Triton tutorial را کامل کنید.

ماه ۳: Distributed Training Basics

روی ۲ تا ۴ GPU با torchrun و DDP کار کنید. NCCL را benchmark کنید و communication overhead را اندازه بگیرید.

ماه ۴: FSDP و Memory Optimization

یک مدل ۷B را با FSDP، activation checkpointing و mixed precision آموزش دهید. memory و throughput را گزارش کنید.

ماه ۵: Multi-Node و Cluster

روی Lambda Labs یا CoreWeave یک training چند نودی اجرا کنید. Slurm یا Kubernetes را تجربه کنید.

ماه ۶: Portfolio و Apply

یک پروژه impressive روی GitHub داشته باشید (مثلاً Triton kernel یا training framework کوچک). شروع به apply برای junior و mid roles بکنید.

پروژه‌های پیشنهادی برای رزومه

آموزش مدل nanoGPT از صفر روی یک GPU

مبتدی

پروژه nanoGPT از Karpathy را fork کنید، روی یک A100 یا حتی RTX 4090 آموزش دهید، loss curve را گزارش کنید و training run reproducible بسازید.

PyTorchPythonCUDAWeights & Biases
زمان تخمینی: ۲ هفته

Distributed Data Parallel روی ۲ تا ۸ GPU

متوسط

یک مدل ۱B پارامتری را با torchrun و DDP روی چند GPU آموزش دهید. Throughput را اندازه بگیرید و bottleneck های NCCL را با Nsight پیدا کنید.

PyTorch DDPNCCLNsight SystemsDocker
زمان تخمینی: ۳ هفته

FSDP Sharded Training یک مدل ۷B

متوسط

مدل Llama-style 7B را با PyTorch FSDP روی ۸ GPU با activation checkpointing و mixed precision آموزش دهید. memory footprint را گزارش کنید.

PyTorch FSDPBF16Activation CheckpointingFlash Attention
زمان تخمینی: ۴ هفته

Triton Kernel سفارشی برای Attention

پیشرفته

یک Triton kernel بنویسید که نسخه ساده‌ای از FlashAttention را پیاده‌سازی می‌کند. Benchmark با PyTorch native و گزارش speedup.

TritonCUDAPyTorchNsight Compute
زمان تخمینی: ۵ هفته

Training Cluster چند نود با Slurm

پیشرفته

یک cluster کوچک Slurm روی چند ماشین cloud (Lambda Labs یا CoreWeave) راه بیندازید. یک training job چند نودی با fault tolerance و auto-checkpoint اجرا کنید.

SlurmInfiniBandLustrePyTorch FSDP
زمان تخمینی: ۶ هفته

مثال‌های واقعی و Case Studies

داستان‌های واقعی از مهندسانی که در این حوزه تأثیرگذار بوده‌اند

T

Tri Dao

پیشینه

دکترا از Stanford زیر نظر Christopher Ré با تمرکز روی efficient ML. بدون شغل صنعتی سنگین قبلی، در زمان دکترا یکی از تأثیرگذارترین کارهای training infra تاریخ را منتشر کرد.

دستاورد

ابداع FlashAttention که memory bandwidth attention را با fused kernel به‌شدت کاهش داد و امروز تقریباً در همه training framework های مدرن (PyTorch، xFormers، vLLM) استفاده می‌شود. سپس Mamba (state-space model) را با Albert Gu منتشر کرد و در ۲۰۲۴ Chief Scientist شرکت Together AI شد.

درس کلیدی

تأثیرگذاری در training infra لزوماً به سال‌ها تجربه صنعتی نیاز ندارد. یک kernel که bottleneck واقعی را حل کند می‌تواند جهت کل صنعت را عوض کند. تمرکز عمیق روی یک مسئله بنیادی بهتر از پراکندگی است.

M

Mohammad Shoeybi

پیشینه

دکترا از Carnegie Mellon در electrical engineering. سپس مهندس research در NVIDIA که در ۲۰۱۹ تیم Megatron-LM را رهبری کرد — پایه‌ای که اکثر LLM های مرزی روی آن آموزش می‌بینند.

دستاورد

نویسنده اول مقاله Megatron-LM که tensor parallelism را به استاندارد صنعت تبدیل کرد. در سال‌های بعد Megatron-Turing NLG 530B (یکی از بزرگ‌ترین مدل‌های زمان خود) را با Microsoft رهبری کرد. امروز Senior Director تحقیقات Applied Deep Learning در NVIDIA است.

درس کلیدی

ساختن framework هایی که دیگران استفاده می‌کنند، تأثیرگذارتر از ساختن یک مدل منفرد است. کار در یک شرکت hardware (NVIDIA) به training infra engineer دیدی نادر از hardware-software co-design می‌دهد.

H

Horace He

پیشینه

کارشناسی از Cornell. مهندس PyTorch core team در Meta با تخصص performance و compiler. در توییتر و GitHub چهره‌ی شناخته‌شده در حوزه GPU performance.

دستاورد

یکی از معماران torch.compile و PT2 compiler stack — تلاشی که PyTorch را از یک eager framework به یک compiled framework رقابتی با JAX تبدیل کرد. مقالات و threadهای آموزشی او درباره GPU bottleneck (compute-bound، memory-bound، overhead-bound) مرجع صنعت شده است.

درس کلیدی

PhD لازم نیست. درک عمیق سیستم‌ها، توانایی توضیح ساده مفاهیم پیچیده و contribution مستمر به open source می‌تواند شما را به یکی از شناخته‌شده‌ترین چهره‌های صنعت تبدیل کند.

نمونه آگهی استخدام واقعی + تحلیل

یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش

Member of Technical Staff, Model Training Engineer

Anthropicسان فرانسیسکو / حضوری2025-09
مشاهده آگهی اصلی

تحلیل نیازمندی‌ها

EN

Strong experience with large-scale distributed training of deep learning models

ستون اصلی نقش. باید بتوانید یک training run چند هزار GPU را از طراحی تا اجرا owner باشید. تجربه عملی با FSDP، Megatron یا DeepSpeed در مقیاس واقعی لازم است — نه فقط tutorial.

ضروری
EN

Familiarity with PyTorch and CUDA

Anthropic عمدتاً روی PyTorch است. CUDA به سطح خواندن و گاهی نوشتن kernel ساده نیاز است. اگر Triton هم بلدید مزیت بزرگی است.

ضروری
EN

Experience optimizing model FLOPs utilization (MFU) and throughput

MFU معیار اصلی کارایی training است. باید بتوانید یک run را profile کنید، bottleneck را پیدا کنید و MFU را از مثلاً ۳۵٪ به ۵۰٪ برسانید. این یعنی درک عمیق هر دو سمت compute و communication.

ضروری
EN

Background in systems engineering, HPC, or compilers

نشان می‌دهد Anthropic از pure ML background فقط راضی نمی‌شود. تجربه HPC، systems یا compiler به اندازه ML تجربه ارزشمند است — این مزیت برای کسانی است که از مسیر non-ML آمده‌اند.

مهم
EN

Comfortable with low-level debugging across the stack

از Python تا CUDA تا hardware. باید بتوانید با gdb، Nsight و log parsing مسائلی را debug کنید که tutorial درباره‌شان وجود ندارد. تحمل بالا برای ambiguity لازم است.

مهم
EN

Familiarity with NCCL, InfiniBand, or similar high-performance networking

این تخصص نادر است و امتیاز بزرگی محسوب می‌شود. اگر این را ندارید، یک مسیر سریع یادگیری در ماه‌های اول job offer انتظار می‌رود.

مفید

تحلیل مسئولیت‌ها

EN

Build and maintain the training infrastructure for Claude

owner مستقیم سیستم‌هایی هستید که مدل Claude را آموزش می‌دهند. این یعنی فشار بالا و impact مستقیم — هر تصمیم شما روی نسل بعدی Claude اثر می‌گذارد.

EN

Optimize training performance across thousands of GPUs

وقت اصلی صرف tuning پارامترهای parallelism، NCCL config و scheduler می‌شود تا MFU بالا برود. هر ۱٪ بهبود MFU روی صدها میلیون دلار budget training یعنی میلیون‌ها دلار صرفه‌جویی.

EN

Collaborate with researchers to bring new ideas into the training stack

تیم research مدام ایده‌های جدید (architectural، optimizer، data) دارد. شما گاتکیپر و enabler هستید — باید تشخیص دهید چه ایده‌ای قابل اجراست و چطور.

EN

Lead incident response when training runs fail

وقتی training در نیمه شب fail می‌کند، on-call شما هستید. باید بتوانید سریع triage کنید، تصمیم بگیرید restart یا rollback، و postmortem دقیق بنویسید.

نتیجه‌گیری کلی

Anthropic در این آگهی صراحتاً پذیرفته که background های متنوع (systems، HPC، compiler) برایش ارزش دارند — نه فقط ML خالص. اگر از مسیر distributed systems یا game engine آمده‌اید، این یکی از معدود نقش‌هایی است که تجربه‌تان مستقیماً قابل انتقال است. مهم‌ترین signal: نشان دادن یک پروژه واقعی که در آن یک training run را در مقیاس debug یا optimize کرده‌اید.

آینده و روندها

پیش‌بینی ۵–۱۰ ساله و مهارت‌هایی که باید یاد بگیرید

بازار AI infrastructure با CAGR ۳۸٪ از ۸۷ میلیارد دلار در ۲۰۲۴ به ۴۲۰ میلیارد دلار تا ۲۰۳۰ می‌رسد

منبع: Grand View Research AI Infrastructure Market Report 2025 / IDC Worldwide AI Spending Guide 2025

مهارت‌های نوظهور که باید یاد بگیرید

FP8 و mixed precision نسل جدیدMixture-of-Experts (MoE) training در مقیاسLong-context training (۱M+ tokens)Heterogeneous compute (GPU + custom ASIC)RL post-training infrastructureOn-the-fly data curation و streamingEnergy-efficient training (PUE optimization)

پیش‌بینی‌های آینده

2026

اکثر training run های مرزی روی ۵۰۰۰۰+ GPU انجام می‌شوند و خوشه‌های ۱۰۰۰۰۰+ GPU استاندارد lab های top tier می‌شوند

2027

FP4 و quantization-aware training برای مدل‌های بزرگ به‌جای BF16 رایج می‌شود — صرفه‌جویی ۳ تا ۴ برابری در memory

2028

ASIC های سفارشی (Trainium 3، TPU v7، Maia 2) سهم ۴۰٪+ از training workload های hyperscaler را می‌گیرند — تخصص cross-hardware حیاتی می‌شود

2030

هزینه آموزش یک مدل سطح GPT-5 به کمتر از $۱۰M می‌رسد ولی هزینه frontier model ها به $۱B+ می‌رسد — قطب‌بندی شدید بازار

ریسک‌های واقعی

بزرگ‌ترین ریسک این نقش این نیست که AI آن را جایگزین کند — برعکس، تقاضا در حال انفجار است. ریسک واقعی concentration است: تعداد شرکت‌هایی که واقعاً frontier model آموزش می‌دهند کمتر از ۳۰ تاست. اگر این بازار consolidate شود (مثلاً به ۵ شرکت برسد)، رقابت برای موقعیت‌های برتر شدید می‌شود. ریسک دوم: تغییر سریع hardware (TPU، Trainium، Maia، Groq) ممکن است بخشی از تخصص شما را زیر سؤال ببرد — مهندسی که فقط CUDA بلد است نسبت به کسی که می‌داند چطور سیستم cross-hardware طراحی کند آسیب‌پذیرتر است.

ویدیوهای آموزشی

برای راهنمایی شخصی‌سازی‌شده مشاوره بگیرید