🔩
رتبه ۳۸ از ۱۰رشد ۳۱.۵% سالانه

مهندس سخت‌افزار هوش مصنوعی

AI Hardware Engineer

مهندس سخت‌افزار هوش مصنوعی (AI Hardware Engineer) متخصصی است که چیپ‌ها، شتاب‌دهنده‌ها و سیستم‌های فیزیکی پشت مدل‌های AI را طراحی می‌کند — از GPU های NVIDIA و TPU های Google تا ASIC های اختصاصی startup هایی مثل Cerebras، Groq و Tenstorrent. این نقش در تقاطع digital design، computer architecture و deep learning قرار دارد و در ۲۰۲۶ یکی از کمیاب‌ترین تخصص‌های صنعت AI است. با حرکت مدل‌ها از training به edge inference و انفجار تقاضا برای custom silicon، شرکت‌هایی مثل NVIDIA، AMD، Apple، Tesla و Anthropic حقوقی بین ۲۰۰ تا ۸۰۰ هزار دلار به مهندسان ارشد این حوزه پرداخت می‌کنند.

Verilog/SystemVerilogComputer ArchitectureCUDADigital DesignAI Accelerators

مقدمه و تعریف شغل

مهندس سخت‌افزار هوش مصنوعی (AI Hardware Engineer) متخصصی است که silicon زیربنایی پشت هر مدل AI را طراحی می‌کند — از تک ترانزیستور تا کل chip. این نقش شامل طراحی RTL برای GPU، TPU، NPU و ASIC های اختصاصی، verification با UVM، performance modeling، و کار با foundry برای tapeout است. تفاوت کلیدی با مهندس نرم‌افزار AI این است که اشتباه شما در silicon قابل patch نیست — یک bug در chip میلیون‌ها دلار re-spin می‌کند. به همین دلیل این نقش یکی از پرحقوق‌ترین و کم‌رقابت‌ترین تخصص‌های صنعت AI است.

تا قبل از ۲۰۱۲ که AlexNet با GPU های NVIDIA انقلاب deep learning را راه انداخت، AI hardware اساساً معنا نداشت — همه چیز روی CPU اجرا می‌شد. NVIDIA که در ابتدا برای gaming graphics ساخته شده بود، به‌طور تصادفی پلتفرم اصلی AI شد. Google در ۲۰۱۶ TPU را معرفی کرد و موج custom AI silicon شروع شد. در ۲۰۲۰–۲۰۲۳، startup هایی مثل Cerebras (با Wafer-Scale Engine)، Graphcore، SambaNova، Groq و Tenstorrent میلیاردها دلار سرمایه جذب کردند. با ظهور LLM ها و مصرف بی‌سابقه compute، در ۲۰۲۶ ما در میانه طلایی‌ترین دوره تاریخ chip design قرار داریم — ارزش NVIDIA به ۴ تریلیون دلار رسیده و هر hyperscaler (Google، Amazon، Microsoft، Meta) chip اختصاصی خود را می‌سازد. تقاضا برای hardware engineer در hubs مثل سیلیکون ولی، تل‌آویو و تایپه چنان بالاست که شرکت‌ها از تایوان sourcing می‌کنند.

چه چیزی می‌سازید؟

مثال‌های واقعی از خروجی کار یک مهندس سخت‌افزار هوش مصنوعی

🎮

datacenter GPU برای training مدل‌های LLM

NVIDIA Blackwell B200 با ۲۰۸ میلیارد ترانزیستور، 192GB HBM3e و قدرت training مدل‌های ۱۰ تریلیون پارامتری. تیم architecture باید memory bandwidth، tensor core throughput و NVLink interconnect را همزمان بهینه کند.

ASIC اختصاصی برای inference

Groq LPU با throughput ۱۰ برابر GPU برای LLM inference با استفاده از deterministic dataflow architecture. مهندسان آن‌ها compiler و hardware را همزمان طراحی کردند.

📱

Neural Processing Unit (NPU) موبایل

Apple Neural Engine در A18 با ۳۵ TOPS برای on-device AI — قابلیت اجرای مدل‌های Apple Intelligence بدون ارسال داده به cloud. ترکیب power efficiency و latency پایین.

☁️

TPU و custom hyperscaler silicon

Google TPU v5p با systolic array بزرگ برای training Gemini و AWS Trainium2 برای inference Anthropic Claude. هر hyperscaler حالا silicon اختصاصی دارد تا از وابستگی به NVIDIA دور شود.

🚗

Edge AI Accelerator

Tesla FSD HW4 chip برای autopilot که در real-time ۷۲ TOPS با ۷۲ وات توان مصرف می‌کند. مهندسان آن باید safety، automotive grade verification و determinism را تأمین کنند.

🔬

Wafer-Scale Compute

Cerebras WSE-3 — یک chip به اندازه کل wafer (46225 mm²) با ۹۰۰ هزار core. این رویکرد رادیکال نیاز به نوآوری در cooling، power delivery و defect tolerance دارد.

تخصص‌های مختلف مهندس سخت‌افزار هوش مصنوعی

این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد

🎮

معماری GPU

GPU Architecture

طراحی streaming multiprocessor، tensor cores و memory subsystem در شرکت‌هایی مثل NVIDIA، AMD و Intel — پرتقاضاترین specialization در ۲۰۲۶.

طراحی شتاب‌دهنده AI

AI Accelerator Design

ساخت ASIC اختصاصی برای ML در شرکت‌هایی مثل Google TPU، AWS Trainium، Tenstorrent و Cerebras. ترکیب hardware و compiler co-design.

🛡️

مهندسی Verification

Verification Engineering

نوشتن testbench UVM، formal verification و coverage analysis برای ensuring correctness. در شرکت‌هایی مثل Synopsys، Cadence و هر chip company.

🔌

طراحی فیزیکی

Physical Design

place & route، timing closure، signal integrity در node های پیشرفته (3nm، 2nm). معمولاً در TSMC، Samsung Foundry و backend teams شرکت‌های بزرگ.

📱

Edge AI و NPU

Edge AI & NPU

طراحی Neural Processing Unit برای موبایل، automotive و IoT در شرکت‌هایی مثل Apple، Qualcomm، Tesla و ARM. تمرکز روی energy efficiency.

تفاوت با شغل‌های مشابه

کجا این شغل تمام می‌شود و شغل دیگری شروع می‌شود؟

مهندس هوش مصنوعیAI Engineer

AI Engineer روی software stack بالای hardware کار می‌کند — model، API، deployment. AI Hardware Engineer لایه‌ای پایین‌تر کار می‌کند: silicon که آن مدل‌ها روی آن اجرا می‌شوند. cycle یادگیری بسیار طولانی‌تر (chip ها ۳-۵ سال طراحی می‌شوند) و سکوی ورود بالاتر (نیاز به MS/PhD معمول است).

مهندس سیستم‌های نهفتهEmbedded Systems Engineer

Embedded engineer firmware و driver می‌نویسد روی chip های موجود (ARM، Microchip). AI Hardware Engineer chip را از scratch طراحی می‌کند یا حداقل micro-architecture آن را تغییر می‌دهد. تفاوت کلیدی: یکی consumer سخت‌افزار است، دیگری creator.

محقق معماری کامپیوترComputer Architecture Researcher

محقق در academia paper می‌نویسد و prototype روی FPGA می‌سازد بدون اینکه به silicon برسد. Hardware engineer در صنعت ایده‌ها را به محصول واقعی تبدیل می‌کند با تمام محدودیت‌های production: yield، cost، time-to-market. مرز بین این دو در شرکت‌هایی مثل NVIDIA Research محو می‌شود.

مهندس تأیید ASICASIC Verification Engineer

Verification engineer مطمئن می‌شود که RTL درست کار می‌کند — testbench می‌نویسد، coverage جمع می‌کند، bug پیدا می‌کند. Design engineer RTL را می‌نویسد. در tier-1 chip companies نسبت verification به design تقریباً ۲:۱ است. verification رول قوی برای ورود به صنعت با background کمتر hardware-deep است.

تأثیر در صنایع مختلف

مهندس سخت‌افزار هوش مصنوعی در همه صنایع مشغول به کار است — نه فقط شرکت‌های فناوری

☁️

Cloud Computing

GPU و TPU پایه datacenter های هر hyperscaler — AWS، Azure، GCP بدون chip های AI نمی‌توانند سرویس‌های generative AI ارائه دهند

🚗

خودروسازی

Tesla FSD chip، Nvidia Drive Orin و Mobileye EyeQ ستون فقرات autonomous driving هستند — هر تصمیم خودرو خودران در ۱۰ms روی silicon اجرا می‌شود

📱

موبایل و Consumer

Neural Engine در iPhone و Tensor در Pixel امکان on-device AI را فراهم می‌کنند — Apple Intelligence و Gemini Nano بدون NPU ممکن نیست

🏥

بهداشت و درمان

FPGA و ASIC اختصاصی برای real-time medical imaging و genomics — شرکت‌هایی مثل GE Healthcare و Illumina silicon اختصاصی طراحی می‌کنند

🛰️

دفاع و هوافضا

rad-hard AI chip ها برای ماهواره و drone، سیستم‌های autonomous defense — Lockheed، BAE و Anduril بازار رو به رشد دارند

🤖

Robotics

NVIDIA Jetson و Qualcomm RB5 مغز ربات‌های صنعتی و humanoid را تشکیل می‌دهند — Tesla Optimus و Figure AI بر chip اختصاصی متکی هستند

📡

Telecom و 6G

RAN intelligent controllers و baseband processor های AI-native برای 6G — Ericsson، Nokia و Samsung در حال طراحی silicon اختصاصی هستند

🎮

بازی و Graphics

DLSS، Path Tracing و frame generation همه روی tensor core های NVIDIA اجرا می‌شوند — gaming حالا use case اصلی AI hardware در consumer است

تصورات غلط رایج

قبل از تصمیم‌گیری، این باورهای اشتباه را بشناسید

باید PhD داشته باشید

در شرکت‌هایی مثل NVIDIA و Apple درصد زیادی از RTL engineer ها BS یا MS دارند. PhD برای architecture و research roles مزیت است اما برای design و verification الزامی نیست.

Chip design در حال انقراض است

کاملاً برعکس — سال ۲۰۲۶ بزرگ‌ترین دوره طراحی custom silicon در تاریخ است. هر hyperscaler chip اختصاصی می‌سازد و تقاضا برای hardware engineer در ۵ سال آینده ۳ برابر می‌شود.

AI hardware یعنی فقط NVIDIA

بازار خیلی گسترده‌تر است: Google TPU، AWS Trainium، Apple Neural Engine، Tesla FSD، Cerebras، Groq، Tenstorrent، Etched، Rivos، MatX و ده‌ها startup دیگر — هر کدام opportunity برای کار جذاب دارند.

همه چیز در سیلیکون ولی است

Hub های اصلی شامل تایوان (TSMC)، اسرائیل (Intel، Apple، NVIDIA)، کره (Samsung، SK hynix)، توکیو و حتی Cambridge UK (ARM، Graphcore) می‌شود. تنوع جغرافیایی بیشتر از software AI است.

از دور (remote) نمی‌توان کار کرد

بسیاری از rol های design و verification بعد از ۲۰۲۰ remote-friendly شدند — به‌ویژه در startup ها مثل Tenstorrent. tools حالا cloud-based هستند و بسیاری از کارها از home ممکن است (به جز lab work).

یک روز کاری واقعی

در هر سطح روز کاری چه شکلی است؟

جونیور (۰–۲ سال)

بیشتر وقت در simulation و debug با guidance ارشدها می‌گذرد. تمرکز روی یادگیری flow داخلی، tools و coding conventions تیم. cycle یادگیری کند اما عمیق است.

  • صبح: standup ۱۵ دقیقه‌ای + بررسی شب گذشته regression results
  • بلاک اول: نوشتن RTL برای یک sub-module کوچک یا تکمیل testbench یک block
  • بعد از ناهار: debug یک failing test با Verdi/SimVision، صحبت با verification engineer
  • عصر: code review گرفتن از mentor، اصلاح، rerun simulation
  • پایان روز: مستندسازی تغییرات در wiki داخلی، commit با ticket ID

میانی (۲–۵ سال)

ownership کامل بخشی از chip را به دست می‌گیرید. balance بین design coding، architectural decisions و mentor کردن جونیورها. شروع به همکاری با تیم‌های adjacent (compiler، physical design).

  • صبح: architecture sync با تیم compiler — هماهنگی روی ISA additions نسل بعدی
  • بلاک کدنویسی عمیق: refactor pipeline برای بهبود timing روی critical path
  • ناهار کاری با performance modeling engineer: تحلیل bottleneck های memory bandwidth
  • بعد از ناهار: design review حضوری برای یک junior + پیشنهاد بهبود micro-architecture
  • عصر: نوشتن RFC برای تغییر در buffer allocation strategy و ارسال به lead

ارشد (۵+ سال)

تمرکز روی direction architectural، cross-team alignment و risk management برای tapeout. کدنویسی محدود به critical sections است. بخش بزرگی از وقت صرف patent، paper review و hiring می‌شود.

  • صبح: بررسی STA report نهایی برای frequency target — تصمیم go/no-go برای freeze
  • جلسه با VP Engineering: presenting roadmap نسل +۲ و power/performance trade-offs
  • کدنویسی هدفمند: نوشتن SVA assertion برای یک corner case پیچیده
  • بعد از ناهار: technical interview یک Principal candidate + debrief با hiring committee
  • عصر: مرور paper تیم برای ISCA submission + ۱:۱ mentorship با میانی ها

مسئولیت‌ها و وظایف

مسئولیت‌های اصلی

وظایف روزانه و مهارت‌های مورد نیاز در این شغل

فنی
  • طراحی RTL در SystemVerilog برای block های accelerator (MAC arrays، attention units، vector engines)
  • نوشتن testbench و verification environment با UVM برای ensuring functional correctness
  • همکاری با ML researchers برای drawing requirements مدل‌های جدید روی hardware
  • بهینه‌سازی pipeline برای دستیابی به target فرکانس، توان مصرفی و area در node های پیشرفته
  • تحلیل performance با profiler و simulator و identification bottleneck های memory/compute
  • همکاری با تیم compiler برای exposing hardware features به PyTorch و TensorFlow
مهارت نرم
  • ارائه design review در tech talks و mentor کردن engineer های جونیور تیم
مدیریتی
  • تصمیم‌گیری روی trade-off های معماری بین time-to-market، performance و cost

مهارت‌های مورد نیاز

مهارت‌های فنی، نرم و حوزه‌ای که یک مهندس سخت‌افزار هوش مصنوعی موفق به آن‌ها نیاز دارد

مهارت‌های فنی Core

SystemVerilog & Verilogضروری

زبان رسمی صنعت برای RTL design و verification — هر مهندس chip باید fluent باشد و در مصاحبه live coding انجام دهد

Digital Designضروری

combinational/sequential logic، FSM، arithmetic units، memory hierarchies — پایه‌ای که بدون آن چیز دیگری ساخته نمی‌شود

Computer Architectureضروری

pipelining، caches، out-of-order execution، vector ISA — اساس design decisions روی AI chip

CUDA Programmingضروری

برای درک تعامل hardware-software در GPU stack — مهندس GPU بدون CUDA نمی‌تواند trade-off ها را تحلیل کند

Deep Learning Fundamentalsمهم

درک معماری CNN، Transformer، attention mechanism برای طراحی hardware که این workload ها را بهینه اجرا کند

Performance Modelingمهم

ساخت analytical و simulation model برای پیش‌بینی performance قبل از RTL — حیاتی برای architecture decisions

Verification Methodologyمهم

UVM، coverage-driven verification، formal methods — حتی design engineer باید verification را بشناسد

مهارت‌های Hardware-Adjacent

Compiler Stack (MLIR, TVM)مهم

Hardware-Software co-design ضروری است — مهندسان GPU باید بدانند چگونه compiler ابزارهای آن‌ها را hardware exposes

Python Scriptingضروری

برای automation، data analysis و glue code بین tools. هر تیم chip روزانه ساعت‌ها script می‌نویسد

Tcl & Makefilesمفید

EDA tools همه با Tcl کنترل می‌شوند — flow scripting بدون Tcl ممکن نیست

Linux & Shellضروری

هر chip company روی Linux کار می‌کند — comfort با bash، grep، sed و LSF/Slurm ضروری است

Static Timing Analysisمهم

تحلیل setup/hold violation و closure timing — مهارتی که جونیورها معمولاً دو سال طول می‌کشد به آن مسلط شوند

مهارت‌های نرم

صبر برای cycle های طولانیضروری

chip ها ۳-۵ سال طراحی می‌شوند. شما باید بتوانید سال‌ها روی یک پروژه کار کنید بدون اینکه feedback سریع داشته باشید

ارتباط cross-functionalضروری

تعامل با verification، physical design، software و product team — هر اشتباه ارتباطی هزینه‌ای میلیون دلاری دارد

دقت وسواس‌گونهضروری

در silicon اشتباه قابل patch نیست. یک bug در RTL ممکن است $10M re-spin طلب کند — attention to detail ضروری است

Technical Writingمهم

نوشتن spec، architecture document و RFC که نسل بعدی مهندسان بخوانند — chip industry بر روی document بنا شده است

Negotiation در trade-offمهم

Power، Performance، Area (PPA) هیچ‌گاه همزمان optimal نیستند. باید بتوانید با data از تصمیم خود دفاع کنید

ضروری — بدون آن نمی‌توان وارد بازار کار شدمهم — تفاوت بین جونیور و میانیمفید — مزیت رقابتی

نقشه راه و مسیر آموزشی

نقشه راه تبدیل شدن به مهندس سخت‌افزار هوش مصنوعی

این مسیر گام به گام شما را از صفر تا حرفه‌ای هدایت می‌کند.

1

پایه‌های الکترونیک دیجیتال و معماری کامپیوتر

⏱️ ۴ تا ۶ ماه

تسلط بر مدارهای منطقی، Boolean algebra، طراحی sequential و combinational circuits و معماری پایه‌ای CPU/Memory — بدون این پایه ورود به chip design ممکن نیست

Digital Logic DesignBoolean Algebra & Karnaugh MapsFinite State MachinesComputer OrganizationPipelining & HazardsCache & Memory HierarchyNumber Systems & Floating Point
2

زبان‌های توصیف سخت‌افزار (HDL) و FPGA

⏱️ ۳ تا ۴ ماه

یادگیری Verilog و SystemVerilog — زبان رسمی صنعت برای طراحی چیپ — و کار عملی روی FPGA برای پروتوتایپ سخت‌افزاری ایده‌ها

Verilog HDLSystemVerilogTestbench & VerificationSynthesis & TimingXilinx Vivado / Intel QuartusFPGA Development BoardsRTL Design Patterns
3

معماری GPU و شتاب‌دهنده‌های AI

⏱️ ۳ تا ۴ ماه

درک عمیق معماری GPU های NVIDIA، TPU های Google، و چیپ‌های نسل جدید — شامل SIMT، tensor cores، systolic arrays و dataflow architectures

GPU Architecture (Hopper, Blackwell)CUDA ProgrammingTensor Cores & Mixed PrecisionSystolic Arrays (TPU)Memory Bandwidth & HBMNVLink & InterconnectRoofline Performance Models
4

Deep Learning Hardware و طراحی شتاب‌دهنده

⏱️ ۴ تا ۶ ماه

ترکیب deep learning با hardware design — یادگیری چگونگی نگاشت neural network ها به silicon، quantization، sparsity و طراحی custom accelerators

Neural Network Quantization (INT8/INT4)Sparsity & Pruning HardwareDataflow Accelerator DesignCompiler Stack (MLIR, TVM)Power & Thermal ModelingDRAM & SRAM OptimizationPyTorch Internals
5

Chip Tapeout، Verification و Production

⏱️ مداوم

گذر از RTL prototype به silicon واقعی — physical design، verification methodology، DFT و کار با foundry هایی مثل TSMC و Samsung

UVM (Universal Verification Methodology)Static Timing Analysis (STA)Physical Design (Place & Route)Design for Test (DFT)Power Analysis & IR DropASIC Tapeout ProcessFoundry PDK & Process Nodes (5nm, 3nm)

ابزارها و استک فنی

ابزارهایی که هر مهندس AI باید بشناسد، دسته‌بندی‌شده بر اساس اولویت

HDL و EDA Tools

SystemVerilog

زبان استاندارد صنعت برای RTL design و verification — هر مهندس chip باید مسلط باشد

ضروری
Synopsys VCS

simulator صنعتی برای verification SystemVerilog — استاندارد در tier-1 chip companies

ضروری
Cadence Innovus

ابزار physical design برای place & route در node های پیشرفته (3nm, 5nm)

پیشرفته
Verilator

open-source SystemVerilog simulator — سریع و رایگان، عالی برای پروژه‌های شخصی

مفید

FPGA Development

Xilinx Vivado

محیط رسمی AMD/Xilinx برای FPGA design — پشتیبانی از Zynq و Versal AI Edge

ضروری
Intel Quartus Prime

ابزار Intel/Altera برای FPGA — رایج در academia و prototyping سریع

مفید
Chisel / SpinalHDL

HDL های مدرن مبتنی بر Scala — استفاده در SiFive و projects تحقیقاتی Berkeley

پیشرفته
Digilent Boards

FPGA board های مقرون به صرفه برای یادگیری و پروژه‌های شخصی (Arty, Zybo)

مفید

GPU و AI Acceleration

CUDA

platform NVIDIA برای برنامه‌نویسی موازی روی GPU — ضروری برای هر کسی که با AI hardware کار می‌کند

ضروری
Triton

زبان OpenAI برای نوشتن GPU kernel با Python — استاندارد جدید برای custom AI ops

مفید
MLIR

compiler infrastructure از LLVM برای ML — قلب stack های nvidia، AMD و Google

پیشرفته
NVIDIA Nsight

profiler حرفه‌ای برای آنالیز performance روی GPU — حیاتی برای optimization

مفید

Architecture Simulation و ML

gem5 Simulator

simulator open-source برای architecture research — استفاده گسترده در academia و industry

مفید
PyTorch

framework اصلی برای کار با neural network — درک internals آن برای hardware engineer ضروری است

ضروری
Accelergy / Timeloop

ابزار MIT برای modeling انرژی و performance accelerators — استاندارد research

پیشرفته
OpenROAD

تنها flow کامل open-source RTL-to-GDSII — انقلابی در دسترسی به chip design

مفید
ضروری — باید یاد بگیریدمفید — ارزش یادگیری داردپیشرفته — برای سطوح ارشد

مسیر پیشرفت شغلی

از جونیور تا Staff Engineer — چه مهارت‌هایی نیاز دارید و چه درآمدی انتظار داشته باشید

مهندس سخت‌افزار جونیور

۰ تا ۲ سال

~$130K

میانگین سالانه (آمریکا)

RTL coding بخش‌های کوچک، testbench نوشتن، debug با simulator، یادگیری flow داخلی تیم

SystemVerilogVerilogLinux/BashPython ScriptingDigital Logic

مهندس سخت‌افزار میانی

۲ تا ۵ سال

~$195K

میانگین سالانه (آمریکا)

طراحی RTL block های پیچیده، ownership بخشی از datapath، contribute به micro-architecture decisions

Micro-architectureUVM VerificationSTACDC/RDC AnalysisPerformance Modeling

مهندس ارشد سخت‌افزار

۵ تا ۹ سال

~$295K

میانگین سالانه (آمریکا)

lead بخش بزرگی از chip، architect یک accelerator subsystem، mentor جونیورها، interface با verification و physical design

Chip ArchitecturePower/Performance TradeoffsTapeout ExperienceTechnical LeadershipCross-team Collaboration

Principal / Distinguished Engineer

۹+ سال

~$510K

میانگین سالانه (آمریکا)

تعریف معماری generation بعدی، مالکیت فنی کل پروژه‌های میلیاردی، نماینده فنی شرکت در کنفرانس‌ها و patent ها

SoC ArchitectureRoadmap StrategyISA DesignIndustry InfluenceOrg-wide Mentorship

چالش‌ها و جنبه‌های منفی

واقعیت‌هایی که کمتر در آگهی‌های شغلی می‌بینید — قبل از ورود بدانید

Cycle طولانی tapeout

عمومی

یک chip ممکن است ۳-۵ سال طول بکشد تا از concept به silicon برسد. این یعنی شما باید سال‌ها روی یک ایده کار کنید بدون اینکه feedback مشتری بگیرید — برای کسانی که از iteration سریع software عادت دارند، این shift فکری دشوار است.

هزینه بالای اشتباه

شرکت بزرگ

یک bug در RTL که تا tapeout کشف نشود، $10M+ re-spin هزینه دارد و ۶ ماه به جدول زمانی اضافه می‌کند. این فشار روی verification و design review بسیار سنگین است و فرهنگ سازمان را conservative می‌کند.

Power-Performance-Area trade-offs

عمومی

هر تصمیم architectural شامل compromise بین PPA است. افزایش performance معمولاً power را بالا می‌برد، کاهش area معمولاً frequency را کم می‌کند. هیچ راه‌حل perfect وجود ندارد و تصمیم‌ها باید با داده گرفته شوند.

وابستگی به foundry capacity

استارتاپ

حتی اگر chip شما عالی طراحی شده باشد، بدون wafer از TSMC یا Samsung تولید نمی‌شود. در ۲۰۲۴-۲۰۲۵ NVIDIA و AMD برای 3nm capacity مذاکره میلیاردی داشتند. startup ها حتی بدتر — می‌توانند ۱۲ ماه منتظر slot بمانند.

Talent shortage و رقابت hiring

شرکت بزرگ

تعداد senior chip designer در جهان به‌شدت محدود است. شرکت‌هایی مثل Apple و NVIDIA با package های ۸۰۰هزار دلاری engineer ها را از یکدیگر می‌قاپند. این برای کاندیداها فوق‌العاده است اما برای team building hellish.

تغییر سریع AI workload

تحقیقاتی

Chip شما برای CNN در ۲۰۲۲ طراحی شد و در ۲۰۲۴ همه به Transformer مهاجرت کردند. flexibility در architecture و توانایی پیش‌بینی trend ها برای ۳ سال آینده یک challenge ذاتی AI hardware است.

حقوق و بازار کار جهانی

حقوق جهانی مهندس سخت‌افزار هوش مصنوعی

میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف

کشورمیانهارز
🇰🇷کره جنوبی
₩130,000,000KRW
🇹🇼تایوان
NT$3,100,000TWD
🇺🇸آمریکا
$340,000USD
🇮🇱اسرائیل
$200,000USD
🇸🇬سنگاپور
SGD 190,000SGD
🇨🇦کانادا
CA$180,000CAD
🇨🇭سوئیس
CHF 180,000CHF
🇬🇧انگلستان
£130,000GBP
🇩🇪آلمان
€115,000EUR

* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شده‌اند.

چگونه از صفر شروع کنیم

برنامه گام‌به‌گام برای ورود به مهندسی هوش مصنوعی

ماه ۱: Digital Logic و Verilog

review کامل digital logic، یادگیری Verilog syntax. هر روز یک مسئله از HDLBits حل کنید.

ماه ۲: Computer Architecture

Patterson & Hennessy را با تمرکز روی pipelining، memory hierarchy و RISC-V ISA بخوانید.

ماه ۳: SystemVerilog و Verification

از Verilog به SystemVerilog ارتقا دهید، testbench coverage-driven بنویسید. با Verilator کار کنید.

ماه ۴: RISC-V Core پروژه

یک single-cycle RISC-V را extend کنید به ۵-stage pipeline. روی FPGA Digilent Arty بارگذاری کنید.

ماه ۵: AI Hardware Basics

MIT 6.5940 TinyML را بگذرانید. کتاب Efficient Processing of Deep Neural Networks را بخوانید.

ماه ۶: Systolic Array پروژه + Apply

یک accelerator ضرب ماتریس systolic بسازید. GitHub را تمیز کنید. برای junior RTL roles apply کنید.

پروژه‌های پیشنهادی برای رزومه

پیاده‌سازی RISC-V Core ساده روی FPGA

مبتدی

یک پردازنده RISC-V با ۵ مرحله pipeline در Verilog طراحی کنید، روی FPGA Digilent Arty بارگذاری کنید و یک برنامه C ساده روی آن اجرا کنید.

VerilogXilinx VivadoRISC-V ToolchainDigilent Arty
زمان تخمینی: ۴ تا ۶ هفته

Systolic Array برای ضرب ماتریس

متوسط

یک accelerator ضرب ماتریس به سبک Google TPU با systolic array پیاده کنید — INT8 quantization و buffer management را هم اضافه کنید.

SystemVerilogVerilatorPython (cocotb)FPGA
زمان تخمینی: ۶ تا ۸ هفته

CUDA Kernel بهینه برای Attention

متوسط

یک kernel CUDA برای scaled dot-product attention بنویسید و با FlashAttention مقایسه کنید — هدف ۸۰٪ peak throughput روی RTX/A100 است.

CUDAC++Nsight ProfilerPyTorch
زمان تخمینی: ۳ تا ۵ هفته

Convolutional Accelerator با Dataflow

پیشرفته

یک accelerator CNN با dataflow weight-stationary پیاده کنید، با Timeloop انرژی را مدل کنید و trade-off بین on-chip memory و DRAM bandwidth را تحلیل کنید.

ChiselVerilatorTimeloopAccelergy
زمان تخمینی: ۸ تا ۱۲ هفته

Tapeout یک Mini-ASIC با OpenROAD

پیشرفته

یک accelerator کوچک را با flow open-source OpenROAD از RTL تا GDSII ببرید — هدف tapeout روی shuttle رایگان Tiny Tapeout یا Efabless است.

OpenROADSkyWater 130nm PDKMagicKLayout
زمان تخمینی: ۱۲ تا ۱۶ هفته

مثال‌های واقعی و Case Studies

داستان‌های واقعی از مهندسانی که در این حوزه تأثیرگذار بوده‌اند

J

Jensen Huang

پیشینه

متولد ۱۹۶۳ در تایوان، مهاجرت به آمریکا در ۹ سالگی. مدرک کارشناسی EE از Oregon State و کارشناسی ارشد EE از Stanford. کار اولیه در AMD و LSI Logic به‌عنوان chip designer قبل از تأسیس NVIDIA در ۱۹۹۳.

دستاورد

NVIDIA را از یک startup graphics card به بزرگ‌ترین شرکت AI hardware جهان تبدیل کرد. تشخیص زودهنگام پتانسیل GPU برای general-purpose compute (CUDA در ۲۰۰۶) سرنوشت AI را عوض کرد. در ۲۰۲۴-۲۰۲۵ NVIDIA به ارزش ۴ تریلیون دلار رسید و Huang به یکی از تأثیرگذارترین چهره‌های صنعت فناوری تبدیل شد.

درس کلیدی

یک background hardware engineering می‌تواند پایه‌ای برای رهبری بزرگ‌ترین انقلاب‌های صنعت باشد. Huang نشان داد که vision طولانی‌مدت (سرمایه‌گذاری روی CUDA وقتی هنوز AI کاربرد گسترده نداشت) ارزش بسیار بیشتری از reaction سریع به trend ها دارد.

L

Lisa Su

پیشینه

متولد ۱۹۶۹ در تایوان، مهاجرت به آمریکا در دوران کودکی. PhD در EE از MIT با تخصص semiconductor device physics. کار در Texas Instruments، IBM (جایی که SOI technology را برای PowerPC اختراع کرد) و Freescale قبل از پیوستن به AMD در ۲۰۱۲.

دستاورد

در ۲۰۱۴ CEO AMD شد در حالی که شرکت در حال ورشکستگی بود. با launching Zen architecture و EPYC server chips، AMD را به رقیب جدی Intel در CPU و NVIDIA در GPU/AI تبدیل کرد. سهام AMD از $2 به $200+ رسید. در ۲۰۲۴ MI300X AI accelerator را معرفی کرد که جدی‌ترین challenge برای NVIDIA H100 شد.

درس کلیدی

Technical depth در hardware (PhD از MIT با hands-on chip design) ترکیب شده با leadership می‌تواند شرکت‌های ورشکسته را احیا کند. Su نشان داد که حتی در صنعتی که توسط NVIDIA dominated شده، با focus بر execution و architecture innovation می‌توان رقابت کرد.

A

Andrew Feldman

پیشینه

MBA از Stanford و BA از Stanford. کارآفرین سریالی با چندین exit در hardware: SeaMicro را در ۲۰۰۷ تأسیس کرد و در ۲۰۱۲ به AMD فروخت به مبلغ $334M. سپس Cerebras Systems را در ۲۰۱۶ بنیان نهاد.

دستاورد

Cerebras WSE (Wafer-Scale Engine) را ساخت — بزرگ‌ترین chip تاریخ با ۴۶,۲۲۵ mm² و ۹۰۰ هزار AI core روی یک wafer کامل سیلیکون. این رویکرد رادیکال شامل نوآوری در packaging، cooling و power delivery است. در ۲۰۲۴ Cerebras با ارزش‌گذاری $4B+ به سمت IPO حرکت کرد و رقیب جدی برای NVIDIA H100 در training شد.

درس کلیدی

گاهی بزرگ‌ترین نوآوری‌ها از زیر سوال بردن assumption های پایه‌ای می‌آیند — همه فکر می‌کردند chip باید کوچک باشد، Feldman پرسید چرا؟ ترکیب experience کارآفرینی، deep technical understanding و venture capital دانش می‌تواند صنعتی به قدمت ۷۰ سال را تکان دهد.

نمونه آگهی استخدام واقعی + تحلیل

یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش

Senior ASIC Design Engineer - GPU Architecture

NVIDIAسانتا کلارا، کالیفرنیا (هیبریدی) / تل‌آویو، اسرائیل2025-09
مشاهده آگهی اصلی

تحلیل نیازمندی‌ها

EN

MS or PhD in Electrical Engineering, Computer Engineering, or related field

MS الزامی است در ۹۰٪ rol های NVIDIA. PhD مزیت ولی نه ضروری برای design (متفاوت با research). اگر BS دارید، ۵+ سال تجربه قوی می‌تواند جایگزین شود.

ضروری
EN

5+ years of RTL design experience using SystemVerilog

تسلط واقعی به SystemVerilog (نه فقط Verilog) ضروری است — interface، class، assertion. در مصاحبه live coding با SystemVerilog انتظار می‌رود. تجربه روی tape-out قبلی critical است.

ضروری
EN

Deep understanding of GPU/CPU micro-architecture

این فقط با reading paper یا course یاد گرفته نمی‌شود — نیاز به experience در یک team chip دارد. PhD students با published research در ISCA/MICRO می‌توانند این gap را پر کنند.

ضروری
EN

Experience with low-power design techniques (clock gating, power gating)

Power efficiency در datacenter GPU به‌شدت مهم است (هر watt در ۱۰۰هزار GPU = میلیون‌ها دلار). تجربه قبلی در mobile chip ها (Qualcomm, Apple) value extra دارد.

مهم
EN

Proficiency in static timing analysis and physical design awareness

Design engineer باید بفهمد چگونه RTL او روی silicon اجرا می‌شود. تجربه با PrimeTime و comfort با concept های setup/hold/CDC ضروری است.

مهم
EN

Familiarity with deep learning frameworks (PyTorch, TensorFlow)

نیاز نیست متخصص ML باشید، اما باید بدانید tensor cores چه workload ای را accelerate می‌کنند. زمان صرف یادگیری PyTorch basics سرمایه‌گذاری ارزشمندی است.

مفید

تحلیل مسئولیت‌ها

EN

Design and implement RTL for next-generation GPU compute units

Ownership کامل block های مهم — Tensor Core، SM scheduler، L1 cache. این کار به طور مستقیم روی performance میلیون‌ها GPU آینده تأثیر می‌گذارد.

EN

Collaborate with architecture, verification, and physical design teams

NVIDIA team های جدا برای architecture (تعریف می‌کنند چه ساخته شود)، design (RTL می‌نویسد)، verification (تست می‌کند) و backend (روی silicon می‌برد) دارد. communication critical است.

EN

Drive micro-architecture decisions balancing power, performance, and area

PPA trade-off روزانه است. باید بتوانید با data quantitative تصمیم بگیرید (مثلاً '۵٪ area بیشتر برای ۱۲٪ perf improvement worth it است').

EN

Mentor junior engineers and contribute to design methodology improvements

در سطح senior انتظار می‌رود فقط coding نکنید — جونیورها را راهنمایی کنید و در بهبود flow های داخلی participate کنید.

نتیجه‌گیری کلی

NVIDIA به دنبال profile خاص است: experienced RTL designer با درک architecture deep و comfort با cross-team collaboration. اگر همه قسمت‌ها را ندارید، روی نقاط قوت تمرکز کنید. تجربه قبلی tape-out و publication ها قوی‌ترین signal هستند. آماده باشید که در onsite interview با ۵-۶ engineer مصاحبه کنید — هرکدام یک technical aspect متفاوت را پوشش می‌دهند.

آینده و روندها

پیش‌بینی ۵–۱۰ ساله و مهارت‌هایی که باید یاد بگیرید

بازار AI chip از $54B در ۲۰۲۴ به $341B تا ۲۰۳۰ خواهد رسید (CAGR 36.2%)

منبع: Grand View Research AI Chip Market Report 2025 / McKinsey Semiconductor Outlook

مهارت‌های نوظهور که باید یاد بگیرید

Photonic Computing و Optical InterconnectNeuromorphic Architecture (Intel Loihi، IBM NorthPole)Chiplet Design و Heterogeneous IntegrationHardware-Compiler Co-design (MLIR، Triton)On-Device LLM Inference و Edge AISparsity Acceleration در HardwareQuantum-Classical Hybrid Computing

پیش‌بینی‌های آینده

2026

هر hyperscaler دست‌کم یک generation از custom AI silicon اختصاصی خود را در production خواهد داشت — وابستگی به NVIDIA کاهش تدریجی شروع می‌شود

2027

Chiplet-based design استاندارد می‌شود — اکثر AI accelerator ها به‌جای monolithic die از multiple chiplets ساخته می‌شوند برای بهبود yield و cost

2028

Photonic interconnect به production می‌رسد — شرکت‌هایی مثل Lightmatter و Ayar Labs problems memory bandwidth scaling را حل می‌کنند

2030

On-device LLM با ۱۰۰B+ پارامتر روی موبایل ممکن می‌شود — Apple Neural Engine نسل ۸ و Qualcomm Hexagon Gen 6 این انقلاب را رهبری می‌کنند

ریسک‌های واقعی

آیا AI خود طراحی chip را اتوماتیک می‌کند؟ بخشی بله — ابزارهایی مثل Google AlphaChip و Synopsys DSO.ai بخش‌هایی از placement را خودکار کرده‌اند. اما architecture-level decisions، novel ideas و trade-off های creative همچنان به انسان نیاز دارند. ریسک واقعی‌تر geopolitical است: تنش‌های US-China روی semiconductor exports، وابستگی به TSMC در تایوان و sanction های Iranian access به advanced node ها. مهندسانی که فقط RTL می‌نویسند آسیب‌پذیرترند؛ کسانی که architecture مدنظر کارفرما را شکل می‌دهند جای‌شان امن است. علاوه بر این تخصصی شدن بازار: تعداد شرکت‌هایی که chip تولید می‌کنند کم می‌شود اما عمق تخصص نیاز بیشتر می‌شود.

ویدیوهای آموزشی

برای راهنمایی شخصی‌سازی‌شده مشاوره بگیرید