مهندس زیرساخت آموزش مدل
Model Training Infrastructure Engineer
مهندس زیرساخت آموزش مدل (Model Training Infrastructure Engineer) متخصصی است که سیستمهای توزیعشده عظیم برای آموزش مدلهای بنیادین (foundation models) را طراحی و اجرا میکند. این نقش در تقاطع distributed systems، high-performance computing و deep learning قرار دارد و وظیفهاش این است که هزاران GPU را بهصورت همزمان و کارآمد برای آموزش مدلهایی مانند GPT، Claude و Gemini هماهنگ کند. در ۲۰۲۶ با هزینه آموزش مدلهای مرزی به مرز ۱۰۰ میلیون دلار، یک ساعت downtime یا یک bug در gradient sync میتواند میلیونها دلار خسارت بزنند — به همین دلیل این تخصص جزو پرحقوقترین نقشهای صنعت AI است و در OpenAI، Anthropic و xAI به ۴۰۰ تا ۷۰۰ هزار دلار TC در سال میرسد.
مقدمه و تعریف شغل
مهندس زیرساخت آموزش مدل (Model Training Infrastructure Engineer) متخصصی است که سیستمهای توزیعشده برای آموزش مدلهای هوش مصنوعی بزرگ — بهخصوص مدلهای بنیادین مانند GPT، Claude و Llama — را طراحی، پیادهسازی و نگهداری میکند. این نقش با ML Engineer معمولی تفاوت بنیادی دارد: تمرکز این شخص روی خود مدل و دقت آن نیست، بلکه روی سرعت، پایداری، utilization و هزینهی فرآیند training در مقیاس هزاران GPU است. این تخصص در تقاطع HPC، systems engineering و deep learning قرار دارد.
تا سال ۲۰۱۸ آموزش مدلهای deep learning عمدتاً روی یک یا چند GPU انجام میشد و مهندسان ML خودشان infrastructure را هم مدیریت میکردند. ظهور BERT (2018)، GPT-2 (2019) و GPT-3 (2020) معادله را عوض کرد — آموزش یک مدل ۱۷۵B پارامتری روی ۱۰۰۰۰ GPU به یک ماه زمان و میلیونها دلار هزینه نیاز داشت. بهمرور یک تخصص جداگانه شکل گرفت: کسی که میداند چطور NCCL را روی InfiniBand tune کند، چطور FSDP را با pipeline parallelism ترکیب کند و چطور یک training run چند هفتهای را زنده نگه دارد. تا ۲۰۲۶ این نقش در OpenAI، Anthropic، xAI، Google DeepMind و Meta FAIR به یکی از حیاتیترین موقعیتها تبدیل شده — چون با هزینه ۱۰۰ میلیون دلاری هر training run، یک bug در gradient sync میتواند یک کوارتر کل شرکت را به عقب بیندازد.
چه چیزی میسازید؟
مثالهای واقعی از خروجی کار یک مهندس زیرساخت آموزش مدل
Training pipeline توزیعشده روی هزاران GPU
Anthropic میخواهد Claude Opus بعدی را روی ۱۶۰۰۰ H100 برای ۳ ماه آموزش دهد. شما FSDP + tensor parallelism + pipeline parallelism را با هم compose میکنید تا MFU بالای ۵۰٪ باشد.
Custom GPU kernels برای bottleneck های مدل
نسخه استاندارد attention روی sequence length 128K کند است. شما با Triton یک fused kernel مینویسید که memory bandwidth را ۳ برابر بهتر استفاده کند — مشابه کاری که Tri Dao با FlashAttention کرد.
Fault-tolerant checkpointing system
در یک training run سه ماهه، تقریباً هر روز یک GPU fail میکند. شما سیستمی میسازید که هر ۳۰ دقیقه async checkpoint میگیرد و در عرض ۵ دقیقه از آخرین checkpoint resume میکند بدون از دست رفتن progress.
Observability stack برای training runs
OpenAI نیاز دارد در هر لحظه از training بداند که loss، grad norm، GPU temperature و network throughput روی هر یک از ۱۰۰۰۰ GPU چه وضعیتی دارند. شما داشبورد real-time با Prometheus و Grafana میسازید.
Cluster bring-up و hardware tuning
xAI cluster جدید ۲۰۰۰۰۰ GPU را در Memphis راهاندازی کرده. شما NCCL topology را برای NVLink/NVSwitch تنظیم میکنید، InfiniBand را benchmark میکنید و burn-in test طراحی میکنید.
Cost optimization و workload scheduling
Mistral میخواهد cluster ۱۰۲۴ GPU خود را بین چند تیم research بهاشتراک بگذارد. شما scheduling system با Slurm میسازید که gang scheduling، preemption و fair-share را پشتیبانی کند.
تخصصهای مختلف مهندس زیرساخت آموزش مدل
این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد
سیستمهای آموزش توزیعشده
Distributed Training Systems
تخصص در FSDP، Megatron، DeepSpeed و طراحی 3D parallelism — هستهی اصلی نقش در OpenAI، Anthropic و Meta.
مهندسی GPU Kernel
GPU Kernel Engineering
نوشتن CUDA و Triton kernel سفارشی برای attention، normalization و quantization — تخصص نادر و پرحقوق، در NVIDIA و Together AI پررنگ است.
عملیات کلاستر GPU
Cluster Operations
مدیریت hardware، شبکه، storage و scheduling در مقیاس چندین هزار GPU — استاندارد در CoreWeave، Lambda Labs و xAI.
توسعه فریمورک آموزش
Training Framework Development
نوشتن خود فریمورکهایی مثل Megatron یا torchtitan — تخصص NVIDIA، Meta و PyTorch core team.
کامپایلر و کارایی
Compiler & Performance
کار با torch.compile، XLA، Mosaic Compiler و quantization-aware kernels — در Modular، OctoML و Anthropic perf team پررنگ است.
تفاوت با شغلهای مشابه
کجا این شغل تمام میشود و شغل دیگری شروع میشود؟
ML Engineer روی طراحی مدل، loss function و dataset تمرکز دارد — هدفش بهبود دقت و کیفیت خروجی است. Training Infrastructure Engineer روی این تمرکز دارد که همان مدل را با MFU بالاتر، هزینه کمتر و پایداری بیشتر روی هزاران GPU اجرا کند. مهندس ML خروجی را میبیند؛ مهندس infra سیستمی که خروجی را تولید میکند.
MLOps Engineer روی inference و deployment تمرکز دارد — serving مدل به کاربر، A/B test، monitoring production. Training Infrastructure Engineer در مرحله قبل کار میکند — فرآیند ساخت خود مدل. MLOps با Kubernetes و FastAPI کار میکند؛ Training Infra با NCCL و CUDA.
HPC Engineer در محیطهای scientific computing کار میکند: simulation فیزیک، CFD، شبیهسازی مولکولی. مهارتهای پایهای مشابه است (MPI، InfiniBand، Slurm) ولی Training Infra دانش deep learning و PyTorch internals را هم نیاز دارد. بسیاری از training infra engineer ها از HPC وارد این حوزه شدهاند.
SRE روی سرویسهای stateless web در مقیاس کار میکند (SLO، on-call، incident response). Training Infra Engineer هم SRE-style mindset دارد ولی workload کاملاً متفاوت است: یک training run منفرد که هفتهها طول میکشد و یک خطای سختافزاری ساده میتواند کل پیشرفت را نابود کند.
تأثیر در صنایع مختلف
مهندس زیرساخت آموزش مدل در همه صنایع مشغول به کار است — نه فقط شرکتهای فناوری
AI Lab های مرزی
آموزش مدلهای مرزی مانند GPT، Claude، Gemini و Llama — هر MFU بهبود ۵٪ یعنی دهها میلیون دلار صرفهجویی
Cloud Hyperscalers
AWS SageMaker، Azure ML و GCP Vertex برای آموزش managed مدلهای بزرگ به مشتریان enterprise اتکا دارند
Defense و Security
Palantir، Anduril و قراردادهای DoD به مدلهای اختصاصی آموزشدیده روی دادههای classified نیاز دارند
Autonomous Driving
Tesla، Waymo و Cruise مدلهای perception را روی دهها هزار GPU با حجم ویدیویی petabyte آموزش میدهند
Drug Discovery
Isomorphic Labs و Recursion Pharma مدلهای protein folding و molecular generation را در مقیاس آموزش میدهند
Robotics Foundation Models
Physical Intelligence و Figure AI روی foundation model های robotics با training run های چند ماهه کار میکنند
Financial Modeling
Two Sigma، Citadel و JPMorgan models بزرگ time-series و alternative-data را روی GPU cluster های اختصاصی آموزش میدهند
Climate و Weather
NVIDIA Earth-2، Google GraphCast و ECMWF مدلهای پیشبینی آبوهوا را با data parallelism در مقیاس عظیم آموزش میدهند
تصورات غلط رایج
قبل از تصمیمگیری، این باورهای اشتباه را بشناسید
فقط یعنی apply کردن DDP در PyTorch
DDP کف کار است. در training مدل ۱۰۰B+ نیاز به ترکیب FSDP + tensor parallelism + pipeline parallelism + sequence parallelism دارید و باید topology شبکه را هم در نظر بگیرید.
هر شرکتی به این نقش نیاز دارد
این نقش عمدتاً در ۲۰ تا ۳۰ شرکت دنیا که واقعاً مدل training میکنند معنا دارد. اگر فقط fine-tune یا inference انجام میدهید، یک MLOps engineer کافی است نه training infra engineer.
باید PhD داشته باشید
بسیاری از training infra engineer های برتر بدون PhD وارد این حوزه شدهاند — از HPC، systems engineering یا game dev. مهم درک عمیق سیستمها و GPU است، نه مدرک.
همه چیز AutoML و ابزار آماده میشود
برعکس — هرچه مدلها بزرگتر میشوند، تخصصیتر و پیچیدهتر میشوند. کسی که میداند چطور یک training run ۱۰۰ روزه را زنده نگه دارد، در ۲۰۳۰ هم پرتقاضاتر از امروز خواهد بود.
همه روز کد مینویسید
بخش بزرگی از زمان صرف debugging، profiling، نوشتن postmortem و communication با تیم research و hardware vendors میشود. کدنویسی کمتر از نقش software engineer معمولی است.
یک روز کاری واقعی
در هر سطح روز کاری چه شکلی است؟
جونیور (۰–۲ سال)
بیشتر وقت در یادگیری cluster، debug کردن issue های NCCL و کمک به ارشدها در reproducing مسائل میگذرد. کارها مشخص و under supervision هستند.
- ◆صبح: بررسی training job های شبانه و گزارش وضعیت در standup
- ◆بلاک اول: debug کردن یک hang در NCCL — بررسی log ها و GPU metrics
- ◆بعد از ناهار: اجرای benchmark یک تغییر کوچک در data loader و گزارش throughput
- ◆عصر: مطالعه کد Megatron-LM یا torchtitan و درک یک قسمت جدید
- ◆پایان روز: نوشتن یک on-call runbook برای issue که امروز حل شد
میانی (۲–۵ سال)
owner یک workload یا یک component از training stack هستید. خودتان مسئله را تعریف و حل میکنید و معمولاً یکی دو جونیور را هم mentor میکنید.
- ◆صبح: بررسی MFU و loss curve یک training run بزرگ که دیشب شروع شد
- ◆جلسه ۳۰ دقیقه با تیم research: بررسی اینکه آیا یک ایده architectural جدید قابل آموزش در stack فعلی هست
- ◆بلاک کدنویسی: implement یک Triton kernel برای fused operation که bottleneck شده
- ◆بعد از ناهار: profiling یک run با Nsight Systems و پیدا کردن stage که communication-bound است
- ◆عصر: نوشتن RFC برای migration از DeepSpeed به FSDP و send به تیم
ارشد (۵+ سال)
تمرکز روی تصمیمگیری استراتژیک و معماری چند ساله. کمتر کد مینویسید ولی هر تصمیم اثر چند میلیون دلاری دارد. وقت زیادی صرف cross-team alignment میشود.
- ◆صبح: بررسی وضعیت چند training run موازی + تصمیمگیری روی priority cluster
- ◆جلسه architecture review: ارزیابی hardware option های نسل بعد (H200 vs B200) با تیم hardware
- ◆کدنویسی هدفمند: بهینهسازی یک kernel critical که فقط شما تجربه عمیق آن را دارید
- ◆بعد از ناهار: جلسه با VP Research درباره roadmap مدل بعدی و infra requirements
- ◆عصر: نوشتن postmortem یک incident بزرگ که یک هفته training را به عقب انداخت
مسئولیتها و وظایف
مسئولیتهای اصلی
وظایف روزانه و مهارتهای مورد نیاز در این شغل
- ◈طراحی و پیادهسازی training pipeline توزیعشده برای مدلهای foundation روی صدها تا هزاران GPU
- ◈بهینهسازی Model FLOPs Utilization (MFU) و throughput با تنظیم parallelism strategy و communication patterns
- ◈نوشتن CUDA / Triton kernel سفارشی برای operation های performance-critical مانند attention و normalization
- ◈debug کردن hang و NaN و gradient divergence در training run های چند هفتهای
- ◈طراحی checkpointing توزیعشده و fault tolerance برای recover سریع از node failure
- ◈مدیریت پایداری cluster، GPU health monitoring و هماهنگی با hardware vendors برای rack-level issues
- ◈هماهنگی با تیم research برای ترجمه ایدههای جدید (مثل MoE یا long-context) به training infrastructure قابل اجرا
- ◈هدایت incident response در زمان training failure — تصمیمگیری زیر فشار وقتی هر ساعت downtime میلیونها دلار هزینه دارد
مهارتهای مورد نیاز
مهارتهای فنی، نرم و حوزهای که یک مهندس زیرساخت آموزش مدل موفق به آنها نیاز دارد
مهارتهای فنی هسته
درک autograd، dispatcher، عملکرد torch.compile و قابلیت نوشتن custom extension
تسلط بر DDP، FSDP، tensor parallelism، pipeline parallelism و sequence parallelism
درک memory hierarchy، tensor cores، warp scheduling و توانایی نوشتن kernel ساده با CUDA یا Triton
آشنایی عمیق با AllReduce، AllGather، Ring vs Tree، و tuning روی NVLink و InfiniBand
تسلط بر cgroups، namespaces، NUMA، scheduling kernel و troubleshooting سطح OS
کار با Slurm یا Kubernetes برای ML — gang scheduling، resource quotas و job lifecycle
استفاده عملی از Nsight Systems، Nsight Compute و PyTorch Profiler برای تشخیص bottleneck
مهارتهای سیستم و زیرساخت
آشنایی با Lustre، WekaFS، S3-compatible و چگونگی feed سریع داده به cluster
درک topology، congestion، latency و throughput در شبکههای HPC
طراحی async و sharded checkpointing برای حفظ state در training run چند هفتهای
Prometheus، Grafana، W&B و طراحی dashboard های real-time برای training
BF16، FP8 و آشنایی با quantization-aware training و trade-off کیفیت/سرعت
تجربه با CoreWeave، Lambda Labs، AWS P5، Azure NDv5 و comparing economics
Docker و Singularity برای reproducible training environment
مهارتهای نرم و تخصصی
آرامش زیر فشار وقتی یک training run میلیون دلاری در نیمه شب fail میکند
ترجمه نیاز research به zنیرساخت قابل اجرا — و گاهی گفتن صادقانه «این هنوز امکانپذیر نیست»
نوشتن runbook، postmortem و RFC با کیفیت بالا — چون کار شما اغلب یکبار رخ میدهد
هر ۶ ماه paper جدید و hardware جدید بازی را عوض میکند؛ خواندن مقالات NeurIPS و MLSys ضروری است
درک trade-off های hardware (HBM bandwidth، NVLink topology) برای تصمیمگیری software
توانایی benchmark مستقل ادعاهای NVIDIA، AMD، Intel و startup های chip
نقشه راه و مسیر آموزشی
نقشه راه تبدیل شدن به مهندس زیرساخت آموزش مدل
این مسیر گام به گام شما را از صفر تا حرفهای هدایت میکند.
پایههای سیستمهای توزیعشده و Linux
ساخت پایه قوی در سیستمعامل، شبکه و سیستمهای توزیعشده — bedrock هر مهندس infrastructure
GPU Computing و CUDA Programming
تسلط بر معماری GPU، نوشتن کرنلهای CUDA و درک عمیق memory hierarchy روی H100 و A100
Deep Learning و PyTorch Internals
درک کامل از autograd، optimizerها و training loop در سطح framework — نه فقط API user
Distributed Training و Parallelism Strategies
تسلط بر استراتژیهای parallelism — Data، Tensor، Pipeline، Sequence و ZeRO/FSDP که برای آموزش مدلهای ۱۰۰B+ پارامتری ضروریاند
Cluster Orchestration و Production Training
اجرای training run های چند هفتهای روی هزاران GPU، fault tolerance، checkpointing و observability در مقیاس
ابزارها و استک فنی
ابزارهایی که هر مهندس AI باید بشناسد، دستهبندیشده بر اساس اولویت
Distributed Training Frameworks
GPU و Networking
Cluster Orchestration
Observability و Storage
parallel filesystem های HPC برای dataset های چند ترابایتی — استاندارد در training clusters
مسیر پیشرفت شغلی
از جونیور تا Staff Engineer — چه مهارتهایی نیاز دارید و چه درآمدی انتظار داشته باشید
مهندس Infrastructure جونیور
۰ تا ۲ سال
~$130K
میانگین سالانه (آمریکا)
نگهداری cluster، رفع issue های NCCL، اجرای training job ها و کمک به ارشدها در debugging
مهندس Infrastructure میانی
۲ تا ۵ سال
~$220K
میانگین سالانه (آمریکا)
طراحی training pipeline برای مدلهای ۱۰B+، tuning کارایی، رهبری incident response و owner شدن یک workload
مهندس ارشد Training Infra
۵ تا ۸ سال
~$380K
میانگین سالانه (آمریکا)
معماری زیرساخت برای مدلهای مرزی (100B+)، تصمیمگیری روی hardware و network topology، منتورینگ تیم
Staff / Principal Engineer
۸+ سال
~$600K
میانگین سالانه (آمریکا)
تعریف roadmap چند ساله zنیرساخت AI شرکت، همکاری با hardware vendors، owner طراحی نسل بعدی training stack
چالشها و جنبههای منفی
واقعیتهایی که کمتر در آگهیهای شغلی میبینید — قبل از ورود بدانید
Hang های مرموز در NCCL
عمومیگاهی یک training روی ۱۰۰۰ GPU بعد از ۲ روز ناگهان متوقف میشود بدون پیام واضح. ممکن است یک GPU کاملاً سالم نباشد، یا یک کابل InfiniBand مشکل داشته باشد. debug کردن این مسائل ساعتها و گاهی روزها زمان میبرد.
هزینههای نجومی هر آزمایش
شرکت بزرگیک run کوچک ۱۰ ساعته روی ۲۵۶ H100 میتواند ۲۰ هزار دلار هزینه داشته باشد. هر تصمیم اشتباه بهسرعت پولی واقعی میشود، بنابراین تصمیمات باید با benchmark دقیق و sign-off گرفته شوند.
Fault tolerance در مقیاس
تحقیقاتیروی cluster ۱۰۰۰۰ GPU، تقریباً هر روز یک GPU میسوزد یا یک node failure رخ میدهد. سیستم باید بتواند بدون از دست رفتن چند ساعت progress recover کند — این یعنی طراحی پیچیده checkpoint و leader election.
Bleeding Edge بودن همه چیز
تحقیقاتیاغلب از CUDA build شب گذشته، PyTorch nightly یا یک fork خصوصی Megatron استفاده میکنید. هیچ بخشی stable نیست و شما باید خودتان bug را پیدا و گاهی fix کنید — حتی در framework های اصلی.
محدودیت تیم و دانش متمرکز
استارتاپدر استارتاپهای AI، اغلب فقط ۲ تا ۴ نفر تجربه واقعی training در این مقیاس دارند. اگر یکی مرخصی برود، بسیاری از مسائل bus factor یک پیدا میکند و فشار شدیدی روی بقیه میآورد.
Communication overhead با تیم research
شرکت بزرگتیم research میخواهد فردا یک ایده architectural جدید را تست کند، ولی شما میدانید این تغییر در training stack دو هفته کار میبرد. مدیریت expectation و توضیح trade-off ها مهارت اساسی است.
حقوق و بازار کار جهانی
حقوق جهانی مهندس زیرساخت آموزش مدل
میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف
| کشور | میانه | ارز |
|---|---|---|
🇯🇵ژاپن | ¥22,000,000 | JPY |
🇮🇳هند | ₹5,500,000 | INR |
🇺🇸آمریکا | $420,000 | USD |
🇦🇪امارات | AED 380,000 | AED |
🇨🇦کانادا | CA$220,000 | CAD |
🇨🇭سوئیس | CHF 200,000 | CHF |
🇸🇬سنگاپور | SGD 195,000 | SGD |
🇦🇺استرالیا | A$190,000 | AUD |
🇬🇧انگلستان | £155,000 | GBP |
🇩🇪آلمان | €130,000 | EUR |
* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شدهاند.
چگونه از صفر شروع کنیم
برنامه گامبهگام برای ورود به مهندسی هوش مصنوعی
ماه ۱: PyTorch Internals
از سطح user به سطح framework بروید. autograd، dispatcher و torch.compile را عمیق یاد بگیرید. کد nanoGPT را خط به خط بفهمید.
ماه ۲: GPU و CUDA
اولین CUDA kernel خود را بنویسید. memory hierarchy و tensor cores را درک کنید. Triton tutorial را کامل کنید.
ماه ۳: Distributed Training Basics
روی ۲ تا ۴ GPU با torchrun و DDP کار کنید. NCCL را benchmark کنید و communication overhead را اندازه بگیرید.
ماه ۴: FSDP و Memory Optimization
یک مدل ۷B را با FSDP، activation checkpointing و mixed precision آموزش دهید. memory و throughput را گزارش کنید.
ماه ۵: Multi-Node و Cluster
روی Lambda Labs یا CoreWeave یک training چند نودی اجرا کنید. Slurm یا Kubernetes را تجربه کنید.
ماه ۶: Portfolio و Apply
یک پروژه impressive روی GitHub داشته باشید (مثلاً Triton kernel یا training framework کوچک). شروع به apply برای junior و mid roles بکنید.
پروژههای پیشنهادی برای رزومه
آموزش مدل nanoGPT از صفر روی یک GPU
مبتدیپروژه nanoGPT از Karpathy را fork کنید، روی یک A100 یا حتی RTX 4090 آموزش دهید، loss curve را گزارش کنید و training run reproducible بسازید.
Distributed Data Parallel روی ۲ تا ۸ GPU
متوسطیک مدل ۱B پارامتری را با torchrun و DDP روی چند GPU آموزش دهید. Throughput را اندازه بگیرید و bottleneck های NCCL را با Nsight پیدا کنید.
FSDP Sharded Training یک مدل ۷B
متوسطمدل Llama-style 7B را با PyTorch FSDP روی ۸ GPU با activation checkpointing و mixed precision آموزش دهید. memory footprint را گزارش کنید.
Triton Kernel سفارشی برای Attention
پیشرفتهیک Triton kernel بنویسید که نسخه سادهای از FlashAttention را پیادهسازی میکند. Benchmark با PyTorch native و گزارش speedup.
Training Cluster چند نود با Slurm
پیشرفتهیک cluster کوچک Slurm روی چند ماشین cloud (Lambda Labs یا CoreWeave) راه بیندازید. یک training job چند نودی با fault tolerance و auto-checkpoint اجرا کنید.
مثالهای واقعی و Case Studies
داستانهای واقعی از مهندسانی که در این حوزه تأثیرگذار بودهاند
دکترا از Stanford زیر نظر Christopher Ré با تمرکز روی efficient ML. بدون شغل صنعتی سنگین قبلی، در زمان دکترا یکی از تأثیرگذارترین کارهای training infra تاریخ را منتشر کرد.
ابداع FlashAttention که memory bandwidth attention را با fused kernel بهشدت کاهش داد و امروز تقریباً در همه training framework های مدرن (PyTorch، xFormers، vLLM) استفاده میشود. سپس Mamba (state-space model) را با Albert Gu منتشر کرد و در ۲۰۲۴ Chief Scientist شرکت Together AI شد.
تأثیرگذاری در training infra لزوماً به سالها تجربه صنعتی نیاز ندارد. یک kernel که bottleneck واقعی را حل کند میتواند جهت کل صنعت را عوض کند. تمرکز عمیق روی یک مسئله بنیادی بهتر از پراکندگی است.
دکترا از Carnegie Mellon در electrical engineering. سپس مهندس research در NVIDIA که در ۲۰۱۹ تیم Megatron-LM را رهبری کرد — پایهای که اکثر LLM های مرزی روی آن آموزش میبینند.
نویسنده اول مقاله Megatron-LM که tensor parallelism را به استاندارد صنعت تبدیل کرد. در سالهای بعد Megatron-Turing NLG 530B (یکی از بزرگترین مدلهای زمان خود) را با Microsoft رهبری کرد. امروز Senior Director تحقیقات Applied Deep Learning در NVIDIA است.
ساختن framework هایی که دیگران استفاده میکنند، تأثیرگذارتر از ساختن یک مدل منفرد است. کار در یک شرکت hardware (NVIDIA) به training infra engineer دیدی نادر از hardware-software co-design میدهد.
کارشناسی از Cornell. مهندس PyTorch core team در Meta با تخصص performance و compiler. در توییتر و GitHub چهرهی شناختهشده در حوزه GPU performance.
یکی از معماران torch.compile و PT2 compiler stack — تلاشی که PyTorch را از یک eager framework به یک compiled framework رقابتی با JAX تبدیل کرد. مقالات و threadهای آموزشی او درباره GPU bottleneck (compute-bound، memory-bound، overhead-bound) مرجع صنعت شده است.
PhD لازم نیست. درک عمیق سیستمها، توانایی توضیح ساده مفاهیم پیچیده و contribution مستمر به open source میتواند شما را به یکی از شناختهشدهترین چهرههای صنعت تبدیل کند.
نمونه آگهی استخدام واقعی + تحلیل
یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش
Member of Technical Staff, Model Training Engineer
تحلیل نیازمندیها
Strong experience with large-scale distributed training of deep learning models
ستون اصلی نقش. باید بتوانید یک training run چند هزار GPU را از طراحی تا اجرا owner باشید. تجربه عملی با FSDP، Megatron یا DeepSpeed در مقیاس واقعی لازم است — نه فقط tutorial.
ضروریFamiliarity with PyTorch and CUDA
Anthropic عمدتاً روی PyTorch است. CUDA به سطح خواندن و گاهی نوشتن kernel ساده نیاز است. اگر Triton هم بلدید مزیت بزرگی است.
ضروریExperience optimizing model FLOPs utilization (MFU) and throughput
MFU معیار اصلی کارایی training است. باید بتوانید یک run را profile کنید، bottleneck را پیدا کنید و MFU را از مثلاً ۳۵٪ به ۵۰٪ برسانید. این یعنی درک عمیق هر دو سمت compute و communication.
ضروریBackground in systems engineering, HPC, or compilers
نشان میدهد Anthropic از pure ML background فقط راضی نمیشود. تجربه HPC، systems یا compiler به اندازه ML تجربه ارزشمند است — این مزیت برای کسانی است که از مسیر non-ML آمدهاند.
مهمComfortable with low-level debugging across the stack
از Python تا CUDA تا hardware. باید بتوانید با gdb، Nsight و log parsing مسائلی را debug کنید که tutorial دربارهشان وجود ندارد. تحمل بالا برای ambiguity لازم است.
مهمFamiliarity with NCCL, InfiniBand, or similar high-performance networking
این تخصص نادر است و امتیاز بزرگی محسوب میشود. اگر این را ندارید، یک مسیر سریع یادگیری در ماههای اول job offer انتظار میرود.
مفیدتحلیل مسئولیتها
Build and maintain the training infrastructure for Claude
owner مستقیم سیستمهایی هستید که مدل Claude را آموزش میدهند. این یعنی فشار بالا و impact مستقیم — هر تصمیم شما روی نسل بعدی Claude اثر میگذارد.
Optimize training performance across thousands of GPUs
وقت اصلی صرف tuning پارامترهای parallelism، NCCL config و scheduler میشود تا MFU بالا برود. هر ۱٪ بهبود MFU روی صدها میلیون دلار budget training یعنی میلیونها دلار صرفهجویی.
Collaborate with researchers to bring new ideas into the training stack
تیم research مدام ایدههای جدید (architectural، optimizer، data) دارد. شما گاتکیپر و enabler هستید — باید تشخیص دهید چه ایدهای قابل اجراست و چطور.
Lead incident response when training runs fail
وقتی training در نیمه شب fail میکند، on-call شما هستید. باید بتوانید سریع triage کنید، تصمیم بگیرید restart یا rollback، و postmortem دقیق بنویسید.
نتیجهگیری کلی
Anthropic در این آگهی صراحتاً پذیرفته که background های متنوع (systems، HPC، compiler) برایش ارزش دارند — نه فقط ML خالص. اگر از مسیر distributed systems یا game engine آمدهاید، این یکی از معدود نقشهایی است که تجربهتان مستقیماً قابل انتقال است. مهمترین signal: نشان دادن یک پروژه واقعی که در آن یک training run را در مقیاس debug یا optimize کردهاید.
آینده و روندها
پیشبینی ۵–۱۰ ساله و مهارتهایی که باید یاد بگیرید
بازار AI infrastructure با CAGR ۳۸٪ از ۸۷ میلیارد دلار در ۲۰۲۴ به ۴۲۰ میلیارد دلار تا ۲۰۳۰ میرسد
منبع: Grand View Research AI Infrastructure Market Report 2025 / IDC Worldwide AI Spending Guide 2025
مهارتهای نوظهور که باید یاد بگیرید
پیشبینیهای آینده
اکثر training run های مرزی روی ۵۰۰۰۰+ GPU انجام میشوند و خوشههای ۱۰۰۰۰۰+ GPU استاندارد lab های top tier میشوند
FP4 و quantization-aware training برای مدلهای بزرگ بهجای BF16 رایج میشود — صرفهجویی ۳ تا ۴ برابری در memory
ASIC های سفارشی (Trainium 3، TPU v7، Maia 2) سهم ۴۰٪+ از training workload های hyperscaler را میگیرند — تخصص cross-hardware حیاتی میشود
هزینه آموزش یک مدل سطح GPT-5 به کمتر از $۱۰M میرسد ولی هزینه frontier model ها به $۱B+ میرسد — قطببندی شدید بازار
بزرگترین ریسک این نقش این نیست که AI آن را جایگزین کند — برعکس، تقاضا در حال انفجار است. ریسک واقعی concentration است: تعداد شرکتهایی که واقعاً frontier model آموزش میدهند کمتر از ۳۰ تاست. اگر این بازار consolidate شود (مثلاً به ۵ شرکت برسد)، رقابت برای موقعیتهای برتر شدید میشود. ریسک دوم: تغییر سریع hardware (TPU، Trainium، Maia، Groq) ممکن است بخشی از تخصص شما را زیر سؤال ببرد — مهندسی که فقط CUDA بلد است نسبت به کسی که میداند چطور سیستم cross-hardware طراحی کند آسیبپذیرتر است.
ویدیوهای آموزشی
یک روز در زندگی یک Model Training Infrastructure Engineer
ویدیوهای واقعی از متخصصان این حوزه که روزانه چه کارهایی انجام میدهند

AI Inference: The Secret to AI's Superpowers
IBM Technology

How Data Centers Actually Work
MEP Academy

All in One (8) - Infrastructure and Tooling - Full Stack Deep Learning
The Full Stack

Kubernetes Explained in 6 Minutes | k8s Architecture
ByteByteGo

What’s Inside a Data Center? Key Components Explained!
DES Technologies

Cloud Computing In 6 Minutes | What Is Cloud Computing? | Cloud Computing Explained | Simplilearn
Simplilearn
