مهندس سختافزار هوش مصنوعی
AI Hardware Engineer
مهندس سختافزار هوش مصنوعی (AI Hardware Engineer) متخصصی است که چیپها، شتابدهندهها و سیستمهای فیزیکی پشت مدلهای AI را طراحی میکند — از GPU های NVIDIA و TPU های Google تا ASIC های اختصاصی startup هایی مثل Cerebras، Groq و Tenstorrent. این نقش در تقاطع digital design، computer architecture و deep learning قرار دارد و در ۲۰۲۶ یکی از کمیابترین تخصصهای صنعت AI است. با حرکت مدلها از training به edge inference و انفجار تقاضا برای custom silicon، شرکتهایی مثل NVIDIA، AMD، Apple، Tesla و Anthropic حقوقی بین ۲۰۰ تا ۸۰۰ هزار دلار به مهندسان ارشد این حوزه پرداخت میکنند.
مقدمه و تعریف شغل
مهندس سختافزار هوش مصنوعی (AI Hardware Engineer) متخصصی است که silicon زیربنایی پشت هر مدل AI را طراحی میکند — از تک ترانزیستور تا کل chip. این نقش شامل طراحی RTL برای GPU، TPU، NPU و ASIC های اختصاصی، verification با UVM، performance modeling، و کار با foundry برای tapeout است. تفاوت کلیدی با مهندس نرمافزار AI این است که اشتباه شما در silicon قابل patch نیست — یک bug در chip میلیونها دلار re-spin میکند. به همین دلیل این نقش یکی از پرحقوقترین و کمرقابتترین تخصصهای صنعت AI است.
تا قبل از ۲۰۱۲ که AlexNet با GPU های NVIDIA انقلاب deep learning را راه انداخت، AI hardware اساساً معنا نداشت — همه چیز روی CPU اجرا میشد. NVIDIA که در ابتدا برای gaming graphics ساخته شده بود، بهطور تصادفی پلتفرم اصلی AI شد. Google در ۲۰۱۶ TPU را معرفی کرد و موج custom AI silicon شروع شد. در ۲۰۲۰–۲۰۲۳، startup هایی مثل Cerebras (با Wafer-Scale Engine)، Graphcore، SambaNova، Groq و Tenstorrent میلیاردها دلار سرمایه جذب کردند. با ظهور LLM ها و مصرف بیسابقه compute، در ۲۰۲۶ ما در میانه طلاییترین دوره تاریخ chip design قرار داریم — ارزش NVIDIA به ۴ تریلیون دلار رسیده و هر hyperscaler (Google، Amazon، Microsoft، Meta) chip اختصاصی خود را میسازد. تقاضا برای hardware engineer در hubs مثل سیلیکون ولی، تلآویو و تایپه چنان بالاست که شرکتها از تایوان sourcing میکنند.
چه چیزی میسازید؟
مثالهای واقعی از خروجی کار یک مهندس سختافزار هوش مصنوعی
datacenter GPU برای training مدلهای LLM
NVIDIA Blackwell B200 با ۲۰۸ میلیارد ترانزیستور، 192GB HBM3e و قدرت training مدلهای ۱۰ تریلیون پارامتری. تیم architecture باید memory bandwidth، tensor core throughput و NVLink interconnect را همزمان بهینه کند.
ASIC اختصاصی برای inference
Groq LPU با throughput ۱۰ برابر GPU برای LLM inference با استفاده از deterministic dataflow architecture. مهندسان آنها compiler و hardware را همزمان طراحی کردند.
Neural Processing Unit (NPU) موبایل
Apple Neural Engine در A18 با ۳۵ TOPS برای on-device AI — قابلیت اجرای مدلهای Apple Intelligence بدون ارسال داده به cloud. ترکیب power efficiency و latency پایین.
TPU و custom hyperscaler silicon
Google TPU v5p با systolic array بزرگ برای training Gemini و AWS Trainium2 برای inference Anthropic Claude. هر hyperscaler حالا silicon اختصاصی دارد تا از وابستگی به NVIDIA دور شود.
Edge AI Accelerator
Tesla FSD HW4 chip برای autopilot که در real-time ۷۲ TOPS با ۷۲ وات توان مصرف میکند. مهندسان آن باید safety، automotive grade verification و determinism را تأمین کنند.
Wafer-Scale Compute
Cerebras WSE-3 — یک chip به اندازه کل wafer (46225 mm²) با ۹۰۰ هزار core. این رویکرد رادیکال نیاز به نوآوری در cooling، power delivery و defect tolerance دارد.
تخصصهای مختلف مهندس سختافزار هوش مصنوعی
این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد
معماری GPU
GPU Architecture
طراحی streaming multiprocessor، tensor cores و memory subsystem در شرکتهایی مثل NVIDIA، AMD و Intel — پرتقاضاترین specialization در ۲۰۲۶.
طراحی شتابدهنده AI
AI Accelerator Design
ساخت ASIC اختصاصی برای ML در شرکتهایی مثل Google TPU، AWS Trainium، Tenstorrent و Cerebras. ترکیب hardware و compiler co-design.
مهندسی Verification
Verification Engineering
نوشتن testbench UVM، formal verification و coverage analysis برای ensuring correctness. در شرکتهایی مثل Synopsys، Cadence و هر chip company.
طراحی فیزیکی
Physical Design
place & route، timing closure، signal integrity در node های پیشرفته (3nm، 2nm). معمولاً در TSMC، Samsung Foundry و backend teams شرکتهای بزرگ.
Edge AI و NPU
Edge AI & NPU
طراحی Neural Processing Unit برای موبایل، automotive و IoT در شرکتهایی مثل Apple، Qualcomm، Tesla و ARM. تمرکز روی energy efficiency.
تفاوت با شغلهای مشابه
کجا این شغل تمام میشود و شغل دیگری شروع میشود؟
AI Engineer روی software stack بالای hardware کار میکند — model، API، deployment. AI Hardware Engineer لایهای پایینتر کار میکند: silicon که آن مدلها روی آن اجرا میشوند. cycle یادگیری بسیار طولانیتر (chip ها ۳-۵ سال طراحی میشوند) و سکوی ورود بالاتر (نیاز به MS/PhD معمول است).
Embedded engineer firmware و driver مینویسد روی chip های موجود (ARM، Microchip). AI Hardware Engineer chip را از scratch طراحی میکند یا حداقل micro-architecture آن را تغییر میدهد. تفاوت کلیدی: یکی consumer سختافزار است، دیگری creator.
محقق در academia paper مینویسد و prototype روی FPGA میسازد بدون اینکه به silicon برسد. Hardware engineer در صنعت ایدهها را به محصول واقعی تبدیل میکند با تمام محدودیتهای production: yield، cost، time-to-market. مرز بین این دو در شرکتهایی مثل NVIDIA Research محو میشود.
Verification engineer مطمئن میشود که RTL درست کار میکند — testbench مینویسد، coverage جمع میکند، bug پیدا میکند. Design engineer RTL را مینویسد. در tier-1 chip companies نسبت verification به design تقریباً ۲:۱ است. verification رول قوی برای ورود به صنعت با background کمتر hardware-deep است.
تأثیر در صنایع مختلف
مهندس سختافزار هوش مصنوعی در همه صنایع مشغول به کار است — نه فقط شرکتهای فناوری
Cloud Computing
GPU و TPU پایه datacenter های هر hyperscaler — AWS، Azure، GCP بدون chip های AI نمیتوانند سرویسهای generative AI ارائه دهند
خودروسازی
Tesla FSD chip، Nvidia Drive Orin و Mobileye EyeQ ستون فقرات autonomous driving هستند — هر تصمیم خودرو خودران در ۱۰ms روی silicon اجرا میشود
موبایل و Consumer
Neural Engine در iPhone و Tensor در Pixel امکان on-device AI را فراهم میکنند — Apple Intelligence و Gemini Nano بدون NPU ممکن نیست
بهداشت و درمان
FPGA و ASIC اختصاصی برای real-time medical imaging و genomics — شرکتهایی مثل GE Healthcare و Illumina silicon اختصاصی طراحی میکنند
دفاع و هوافضا
rad-hard AI chip ها برای ماهواره و drone، سیستمهای autonomous defense — Lockheed، BAE و Anduril بازار رو به رشد دارند
Robotics
NVIDIA Jetson و Qualcomm RB5 مغز رباتهای صنعتی و humanoid را تشکیل میدهند — Tesla Optimus و Figure AI بر chip اختصاصی متکی هستند
Telecom و 6G
RAN intelligent controllers و baseband processor های AI-native برای 6G — Ericsson، Nokia و Samsung در حال طراحی silicon اختصاصی هستند
بازی و Graphics
DLSS، Path Tracing و frame generation همه روی tensor core های NVIDIA اجرا میشوند — gaming حالا use case اصلی AI hardware در consumer است
تصورات غلط رایج
قبل از تصمیمگیری، این باورهای اشتباه را بشناسید
باید PhD داشته باشید
در شرکتهایی مثل NVIDIA و Apple درصد زیادی از RTL engineer ها BS یا MS دارند. PhD برای architecture و research roles مزیت است اما برای design و verification الزامی نیست.
Chip design در حال انقراض است
کاملاً برعکس — سال ۲۰۲۶ بزرگترین دوره طراحی custom silicon در تاریخ است. هر hyperscaler chip اختصاصی میسازد و تقاضا برای hardware engineer در ۵ سال آینده ۳ برابر میشود.
AI hardware یعنی فقط NVIDIA
بازار خیلی گستردهتر است: Google TPU، AWS Trainium، Apple Neural Engine، Tesla FSD، Cerebras، Groq، Tenstorrent، Etched، Rivos، MatX و دهها startup دیگر — هر کدام opportunity برای کار جذاب دارند.
همه چیز در سیلیکون ولی است
Hub های اصلی شامل تایوان (TSMC)، اسرائیل (Intel، Apple، NVIDIA)، کره (Samsung، SK hynix)، توکیو و حتی Cambridge UK (ARM، Graphcore) میشود. تنوع جغرافیایی بیشتر از software AI است.
از دور (remote) نمیتوان کار کرد
بسیاری از rol های design و verification بعد از ۲۰۲۰ remote-friendly شدند — بهویژه در startup ها مثل Tenstorrent. tools حالا cloud-based هستند و بسیاری از کارها از home ممکن است (به جز lab work).
یک روز کاری واقعی
در هر سطح روز کاری چه شکلی است؟
جونیور (۰–۲ سال)
بیشتر وقت در simulation و debug با guidance ارشدها میگذرد. تمرکز روی یادگیری flow داخلی، tools و coding conventions تیم. cycle یادگیری کند اما عمیق است.
- ◆صبح: standup ۱۵ دقیقهای + بررسی شب گذشته regression results
- ◆بلاک اول: نوشتن RTL برای یک sub-module کوچک یا تکمیل testbench یک block
- ◆بعد از ناهار: debug یک failing test با Verdi/SimVision، صحبت با verification engineer
- ◆عصر: code review گرفتن از mentor، اصلاح، rerun simulation
- ◆پایان روز: مستندسازی تغییرات در wiki داخلی، commit با ticket ID
میانی (۲–۵ سال)
ownership کامل بخشی از chip را به دست میگیرید. balance بین design coding، architectural decisions و mentor کردن جونیورها. شروع به همکاری با تیمهای adjacent (compiler، physical design).
- ◆صبح: architecture sync با تیم compiler — هماهنگی روی ISA additions نسل بعدی
- ◆بلاک کدنویسی عمیق: refactor pipeline برای بهبود timing روی critical path
- ◆ناهار کاری با performance modeling engineer: تحلیل bottleneck های memory bandwidth
- ◆بعد از ناهار: design review حضوری برای یک junior + پیشنهاد بهبود micro-architecture
- ◆عصر: نوشتن RFC برای تغییر در buffer allocation strategy و ارسال به lead
ارشد (۵+ سال)
تمرکز روی direction architectural، cross-team alignment و risk management برای tapeout. کدنویسی محدود به critical sections است. بخش بزرگی از وقت صرف patent، paper review و hiring میشود.
- ◆صبح: بررسی STA report نهایی برای frequency target — تصمیم go/no-go برای freeze
- ◆جلسه با VP Engineering: presenting roadmap نسل +۲ و power/performance trade-offs
- ◆کدنویسی هدفمند: نوشتن SVA assertion برای یک corner case پیچیده
- ◆بعد از ناهار: technical interview یک Principal candidate + debrief با hiring committee
- ◆عصر: مرور paper تیم برای ISCA submission + ۱:۱ mentorship با میانی ها
مسئولیتها و وظایف
مسئولیتهای اصلی
وظایف روزانه و مهارتهای مورد نیاز در این شغل
- ◈طراحی RTL در SystemVerilog برای block های accelerator (MAC arrays، attention units، vector engines)
- ◈نوشتن testbench و verification environment با UVM برای ensuring functional correctness
- ◈همکاری با ML researchers برای drawing requirements مدلهای جدید روی hardware
- ◈بهینهسازی pipeline برای دستیابی به target فرکانس، توان مصرفی و area در node های پیشرفته
- ◈تحلیل performance با profiler و simulator و identification bottleneck های memory/compute
- ◈همکاری با تیم compiler برای exposing hardware features به PyTorch و TensorFlow
- ◈ارائه design review در tech talks و mentor کردن engineer های جونیور تیم
- ◈تصمیمگیری روی trade-off های معماری بین time-to-market، performance و cost
مهارتهای مورد نیاز
مهارتهای فنی، نرم و حوزهای که یک مهندس سختافزار هوش مصنوعی موفق به آنها نیاز دارد
مهارتهای فنی Core
زبان رسمی صنعت برای RTL design و verification — هر مهندس chip باید fluent باشد و در مصاحبه live coding انجام دهد
combinational/sequential logic، FSM، arithmetic units، memory hierarchies — پایهای که بدون آن چیز دیگری ساخته نمیشود
pipelining، caches، out-of-order execution، vector ISA — اساس design decisions روی AI chip
برای درک تعامل hardware-software در GPU stack — مهندس GPU بدون CUDA نمیتواند trade-off ها را تحلیل کند
درک معماری CNN، Transformer، attention mechanism برای طراحی hardware که این workload ها را بهینه اجرا کند
ساخت analytical و simulation model برای پیشبینی performance قبل از RTL — حیاتی برای architecture decisions
UVM، coverage-driven verification، formal methods — حتی design engineer باید verification را بشناسد
مهارتهای Hardware-Adjacent
Hardware-Software co-design ضروری است — مهندسان GPU باید بدانند چگونه compiler ابزارهای آنها را hardware exposes
برای automation، data analysis و glue code بین tools. هر تیم chip روزانه ساعتها script مینویسد
EDA tools همه با Tcl کنترل میشوند — flow scripting بدون Tcl ممکن نیست
هر chip company روی Linux کار میکند — comfort با bash، grep، sed و LSF/Slurm ضروری است
تحلیل setup/hold violation و closure timing — مهارتی که جونیورها معمولاً دو سال طول میکشد به آن مسلط شوند
مهارتهای نرم
chip ها ۳-۵ سال طراحی میشوند. شما باید بتوانید سالها روی یک پروژه کار کنید بدون اینکه feedback سریع داشته باشید
تعامل با verification، physical design، software و product team — هر اشتباه ارتباطی هزینهای میلیون دلاری دارد
در silicon اشتباه قابل patch نیست. یک bug در RTL ممکن است $10M re-spin طلب کند — attention to detail ضروری است
نوشتن spec، architecture document و RFC که نسل بعدی مهندسان بخوانند — chip industry بر روی document بنا شده است
Power، Performance، Area (PPA) هیچگاه همزمان optimal نیستند. باید بتوانید با data از تصمیم خود دفاع کنید
نقشه راه و مسیر آموزشی
نقشه راه تبدیل شدن به مهندس سختافزار هوش مصنوعی
این مسیر گام به گام شما را از صفر تا حرفهای هدایت میکند.
پایههای الکترونیک دیجیتال و معماری کامپیوتر
تسلط بر مدارهای منطقی، Boolean algebra، طراحی sequential و combinational circuits و معماری پایهای CPU/Memory — بدون این پایه ورود به chip design ممکن نیست
زبانهای توصیف سختافزار (HDL) و FPGA
یادگیری Verilog و SystemVerilog — زبان رسمی صنعت برای طراحی چیپ — و کار عملی روی FPGA برای پروتوتایپ سختافزاری ایدهها
معماری GPU و شتابدهندههای AI
درک عمیق معماری GPU های NVIDIA، TPU های Google، و چیپهای نسل جدید — شامل SIMT، tensor cores، systolic arrays و dataflow architectures
Deep Learning Hardware و طراحی شتابدهنده
ترکیب deep learning با hardware design — یادگیری چگونگی نگاشت neural network ها به silicon، quantization، sparsity و طراحی custom accelerators
Chip Tapeout، Verification و Production
گذر از RTL prototype به silicon واقعی — physical design، verification methodology، DFT و کار با foundry هایی مثل TSMC و Samsung
ابزارها و استک فنی
ابزارهایی که هر مهندس AI باید بشناسد، دستهبندیشده بر اساس اولویت
HDL و EDA Tools
FPGA Development
GPU و AI Acceleration
platform NVIDIA برای برنامهنویسی موازی روی GPU — ضروری برای هر کسی که با AI hardware کار میکند
Architecture Simulation و ML
simulator open-source برای architecture research — استفاده گسترده در academia و industry
framework اصلی برای کار با neural network — درک internals آن برای hardware engineer ضروری است
مسیر پیشرفت شغلی
از جونیور تا Staff Engineer — چه مهارتهایی نیاز دارید و چه درآمدی انتظار داشته باشید
مهندس سختافزار جونیور
۰ تا ۲ سال
~$130K
میانگین سالانه (آمریکا)
RTL coding بخشهای کوچک، testbench نوشتن، debug با simulator، یادگیری flow داخلی تیم
مهندس سختافزار میانی
۲ تا ۵ سال
~$195K
میانگین سالانه (آمریکا)
طراحی RTL block های پیچیده، ownership بخشی از datapath، contribute به micro-architecture decisions
مهندس ارشد سختافزار
۵ تا ۹ سال
~$295K
میانگین سالانه (آمریکا)
lead بخش بزرگی از chip، architect یک accelerator subsystem، mentor جونیورها، interface با verification و physical design
Principal / Distinguished Engineer
۹+ سال
~$510K
میانگین سالانه (آمریکا)
تعریف معماری generation بعدی، مالکیت فنی کل پروژههای میلیاردی، نماینده فنی شرکت در کنفرانسها و patent ها
چالشها و جنبههای منفی
واقعیتهایی که کمتر در آگهیهای شغلی میبینید — قبل از ورود بدانید
Cycle طولانی tapeout
عمومییک chip ممکن است ۳-۵ سال طول بکشد تا از concept به silicon برسد. این یعنی شما باید سالها روی یک ایده کار کنید بدون اینکه feedback مشتری بگیرید — برای کسانی که از iteration سریع software عادت دارند، این shift فکری دشوار است.
هزینه بالای اشتباه
شرکت بزرگیک bug در RTL که تا tapeout کشف نشود، $10M+ re-spin هزینه دارد و ۶ ماه به جدول زمانی اضافه میکند. این فشار روی verification و design review بسیار سنگین است و فرهنگ سازمان را conservative میکند.
Power-Performance-Area trade-offs
عمومیهر تصمیم architectural شامل compromise بین PPA است. افزایش performance معمولاً power را بالا میبرد، کاهش area معمولاً frequency را کم میکند. هیچ راهحل perfect وجود ندارد و تصمیمها باید با داده گرفته شوند.
وابستگی به foundry capacity
استارتاپحتی اگر chip شما عالی طراحی شده باشد، بدون wafer از TSMC یا Samsung تولید نمیشود. در ۲۰۲۴-۲۰۲۵ NVIDIA و AMD برای 3nm capacity مذاکره میلیاردی داشتند. startup ها حتی بدتر — میتوانند ۱۲ ماه منتظر slot بمانند.
Talent shortage و رقابت hiring
شرکت بزرگتعداد senior chip designer در جهان بهشدت محدود است. شرکتهایی مثل Apple و NVIDIA با package های ۸۰۰هزار دلاری engineer ها را از یکدیگر میقاپند. این برای کاندیداها فوقالعاده است اما برای team building hellish.
تغییر سریع AI workload
تحقیقاتیChip شما برای CNN در ۲۰۲۲ طراحی شد و در ۲۰۲۴ همه به Transformer مهاجرت کردند. flexibility در architecture و توانایی پیشبینی trend ها برای ۳ سال آینده یک challenge ذاتی AI hardware است.
حقوق و بازار کار جهانی
حقوق جهانی مهندس سختافزار هوش مصنوعی
میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف
| کشور | میانه | ارز |
|---|---|---|
🇰🇷کره جنوبی | ₩130,000,000 | KRW |
🇹🇼تایوان | NT$3,100,000 | TWD |
🇺🇸آمریکا | $340,000 | USD |
🇮🇱اسرائیل | $200,000 | USD |
🇸🇬سنگاپور | SGD 190,000 | SGD |
🇨🇦کانادا | CA$180,000 | CAD |
🇨🇭سوئیس | CHF 180,000 | CHF |
🇬🇧انگلستان | £130,000 | GBP |
🇩🇪آلمان | €115,000 | EUR |
* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شدهاند.
چگونه از صفر شروع کنیم
برنامه گامبهگام برای ورود به مهندسی هوش مصنوعی
ماه ۱: Digital Logic و Verilog
review کامل digital logic، یادگیری Verilog syntax. هر روز یک مسئله از HDLBits حل کنید.
ماه ۲: Computer Architecture
Patterson & Hennessy را با تمرکز روی pipelining، memory hierarchy و RISC-V ISA بخوانید.
ماه ۳: SystemVerilog و Verification
از Verilog به SystemVerilog ارتقا دهید، testbench coverage-driven بنویسید. با Verilator کار کنید.
ماه ۴: RISC-V Core پروژه
یک single-cycle RISC-V را extend کنید به ۵-stage pipeline. روی FPGA Digilent Arty بارگذاری کنید.
ماه ۵: AI Hardware Basics
MIT 6.5940 TinyML را بگذرانید. کتاب Efficient Processing of Deep Neural Networks را بخوانید.
ماه ۶: Systolic Array پروژه + Apply
یک accelerator ضرب ماتریس systolic بسازید. GitHub را تمیز کنید. برای junior RTL roles apply کنید.
پروژههای پیشنهادی برای رزومه
پیادهسازی RISC-V Core ساده روی FPGA
مبتدییک پردازنده RISC-V با ۵ مرحله pipeline در Verilog طراحی کنید، روی FPGA Digilent Arty بارگذاری کنید و یک برنامه C ساده روی آن اجرا کنید.
Systolic Array برای ضرب ماتریس
متوسطیک accelerator ضرب ماتریس به سبک Google TPU با systolic array پیاده کنید — INT8 quantization و buffer management را هم اضافه کنید.
CUDA Kernel بهینه برای Attention
متوسطیک kernel CUDA برای scaled dot-product attention بنویسید و با FlashAttention مقایسه کنید — هدف ۸۰٪ peak throughput روی RTX/A100 است.
Convolutional Accelerator با Dataflow
پیشرفتهیک accelerator CNN با dataflow weight-stationary پیاده کنید، با Timeloop انرژی را مدل کنید و trade-off بین on-chip memory و DRAM bandwidth را تحلیل کنید.
Tapeout یک Mini-ASIC با OpenROAD
پیشرفتهیک accelerator کوچک را با flow open-source OpenROAD از RTL تا GDSII ببرید — هدف tapeout روی shuttle رایگان Tiny Tapeout یا Efabless است.
مثالهای واقعی و Case Studies
داستانهای واقعی از مهندسانی که در این حوزه تأثیرگذار بودهاند
متولد ۱۹۶۳ در تایوان، مهاجرت به آمریکا در ۹ سالگی. مدرک کارشناسی EE از Oregon State و کارشناسی ارشد EE از Stanford. کار اولیه در AMD و LSI Logic بهعنوان chip designer قبل از تأسیس NVIDIA در ۱۹۹۳.
NVIDIA را از یک startup graphics card به بزرگترین شرکت AI hardware جهان تبدیل کرد. تشخیص زودهنگام پتانسیل GPU برای general-purpose compute (CUDA در ۲۰۰۶) سرنوشت AI را عوض کرد. در ۲۰۲۴-۲۰۲۵ NVIDIA به ارزش ۴ تریلیون دلار رسید و Huang به یکی از تأثیرگذارترین چهرههای صنعت فناوری تبدیل شد.
یک background hardware engineering میتواند پایهای برای رهبری بزرگترین انقلابهای صنعت باشد. Huang نشان داد که vision طولانیمدت (سرمایهگذاری روی CUDA وقتی هنوز AI کاربرد گسترده نداشت) ارزش بسیار بیشتری از reaction سریع به trend ها دارد.
متولد ۱۹۶۹ در تایوان، مهاجرت به آمریکا در دوران کودکی. PhD در EE از MIT با تخصص semiconductor device physics. کار در Texas Instruments، IBM (جایی که SOI technology را برای PowerPC اختراع کرد) و Freescale قبل از پیوستن به AMD در ۲۰۱۲.
در ۲۰۱۴ CEO AMD شد در حالی که شرکت در حال ورشکستگی بود. با launching Zen architecture و EPYC server chips، AMD را به رقیب جدی Intel در CPU و NVIDIA در GPU/AI تبدیل کرد. سهام AMD از $2 به $200+ رسید. در ۲۰۲۴ MI300X AI accelerator را معرفی کرد که جدیترین challenge برای NVIDIA H100 شد.
Technical depth در hardware (PhD از MIT با hands-on chip design) ترکیب شده با leadership میتواند شرکتهای ورشکسته را احیا کند. Su نشان داد که حتی در صنعتی که توسط NVIDIA dominated شده، با focus بر execution و architecture innovation میتوان رقابت کرد.
MBA از Stanford و BA از Stanford. کارآفرین سریالی با چندین exit در hardware: SeaMicro را در ۲۰۰۷ تأسیس کرد و در ۲۰۱۲ به AMD فروخت به مبلغ $334M. سپس Cerebras Systems را در ۲۰۱۶ بنیان نهاد.
Cerebras WSE (Wafer-Scale Engine) را ساخت — بزرگترین chip تاریخ با ۴۶,۲۲۵ mm² و ۹۰۰ هزار AI core روی یک wafer کامل سیلیکون. این رویکرد رادیکال شامل نوآوری در packaging، cooling و power delivery است. در ۲۰۲۴ Cerebras با ارزشگذاری $4B+ به سمت IPO حرکت کرد و رقیب جدی برای NVIDIA H100 در training شد.
گاهی بزرگترین نوآوریها از زیر سوال بردن assumption های پایهای میآیند — همه فکر میکردند chip باید کوچک باشد، Feldman پرسید چرا؟ ترکیب experience کارآفرینی، deep technical understanding و venture capital دانش میتواند صنعتی به قدمت ۷۰ سال را تکان دهد.
نمونه آگهی استخدام واقعی + تحلیل
یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش
Senior ASIC Design Engineer - GPU Architecture
تحلیل نیازمندیها
MS or PhD in Electrical Engineering, Computer Engineering, or related field
MS الزامی است در ۹۰٪ rol های NVIDIA. PhD مزیت ولی نه ضروری برای design (متفاوت با research). اگر BS دارید، ۵+ سال تجربه قوی میتواند جایگزین شود.
ضروری5+ years of RTL design experience using SystemVerilog
تسلط واقعی به SystemVerilog (نه فقط Verilog) ضروری است — interface، class، assertion. در مصاحبه live coding با SystemVerilog انتظار میرود. تجربه روی tape-out قبلی critical است.
ضروریDeep understanding of GPU/CPU micro-architecture
این فقط با reading paper یا course یاد گرفته نمیشود — نیاز به experience در یک team chip دارد. PhD students با published research در ISCA/MICRO میتوانند این gap را پر کنند.
ضروریExperience with low-power design techniques (clock gating, power gating)
Power efficiency در datacenter GPU بهشدت مهم است (هر watt در ۱۰۰هزار GPU = میلیونها دلار). تجربه قبلی در mobile chip ها (Qualcomm, Apple) value extra دارد.
مهمProficiency in static timing analysis and physical design awareness
Design engineer باید بفهمد چگونه RTL او روی silicon اجرا میشود. تجربه با PrimeTime و comfort با concept های setup/hold/CDC ضروری است.
مهمFamiliarity with deep learning frameworks (PyTorch, TensorFlow)
نیاز نیست متخصص ML باشید، اما باید بدانید tensor cores چه workload ای را accelerate میکنند. زمان صرف یادگیری PyTorch basics سرمایهگذاری ارزشمندی است.
مفیدتحلیل مسئولیتها
Design and implement RTL for next-generation GPU compute units
Ownership کامل block های مهم — Tensor Core، SM scheduler، L1 cache. این کار به طور مستقیم روی performance میلیونها GPU آینده تأثیر میگذارد.
Collaborate with architecture, verification, and physical design teams
NVIDIA team های جدا برای architecture (تعریف میکنند چه ساخته شود)، design (RTL مینویسد)، verification (تست میکند) و backend (روی silicon میبرد) دارد. communication critical است.
Drive micro-architecture decisions balancing power, performance, and area
PPA trade-off روزانه است. باید بتوانید با data quantitative تصمیم بگیرید (مثلاً '۵٪ area بیشتر برای ۱۲٪ perf improvement worth it است').
Mentor junior engineers and contribute to design methodology improvements
در سطح senior انتظار میرود فقط coding نکنید — جونیورها را راهنمایی کنید و در بهبود flow های داخلی participate کنید.
نتیجهگیری کلی
NVIDIA به دنبال profile خاص است: experienced RTL designer با درک architecture deep و comfort با cross-team collaboration. اگر همه قسمتها را ندارید، روی نقاط قوت تمرکز کنید. تجربه قبلی tape-out و publication ها قویترین signal هستند. آماده باشید که در onsite interview با ۵-۶ engineer مصاحبه کنید — هرکدام یک technical aspect متفاوت را پوشش میدهند.
آینده و روندها
پیشبینی ۵–۱۰ ساله و مهارتهایی که باید یاد بگیرید
بازار AI chip از $54B در ۲۰۲۴ به $341B تا ۲۰۳۰ خواهد رسید (CAGR 36.2%)
منبع: Grand View Research AI Chip Market Report 2025 / McKinsey Semiconductor Outlook
مهارتهای نوظهور که باید یاد بگیرید
پیشبینیهای آینده
هر hyperscaler دستکم یک generation از custom AI silicon اختصاصی خود را در production خواهد داشت — وابستگی به NVIDIA کاهش تدریجی شروع میشود
Chiplet-based design استاندارد میشود — اکثر AI accelerator ها بهجای monolithic die از multiple chiplets ساخته میشوند برای بهبود yield و cost
Photonic interconnect به production میرسد — شرکتهایی مثل Lightmatter و Ayar Labs problems memory bandwidth scaling را حل میکنند
On-device LLM با ۱۰۰B+ پارامتر روی موبایل ممکن میشود — Apple Neural Engine نسل ۸ و Qualcomm Hexagon Gen 6 این انقلاب را رهبری میکنند
آیا AI خود طراحی chip را اتوماتیک میکند؟ بخشی بله — ابزارهایی مثل Google AlphaChip و Synopsys DSO.ai بخشهایی از placement را خودکار کردهاند. اما architecture-level decisions، novel ideas و trade-off های creative همچنان به انسان نیاز دارند. ریسک واقعیتر geopolitical است: تنشهای US-China روی semiconductor exports، وابستگی به TSMC در تایوان و sanction های Iranian access به advanced node ها. مهندسانی که فقط RTL مینویسند آسیبپذیرترند؛ کسانی که architecture مدنظر کارفرما را شکل میدهند جایشان امن است. علاوه بر این تخصصی شدن بازار: تعداد شرکتهایی که chip تولید میکنند کم میشود اما عمق تخصص نیاز بیشتر میشود.
ویدیوهای آموزشی
یک روز در زندگی یک AI Hardware Engineer
ویدیوهای واقعی از متخصصان این حوزه که روزانه چه کارهایی انجام میدهند

Quantum Computers Explained: How Quantum Computing Works
Science ABC

What's the Best 2 in 1 Laptop for 2026?
TheTechMag

Best Laptops for Programmers (2025)
Just Josh

Google Data Center Security: 6 Layers Deep
Google Cloud Tech

HP OmniBook Ultra Copilot+ PC Unboxing & Review ⚡ Best AI Laptop for Students & Professionals?
Trakin Tech
