🛡️
رتبه ۳۸ از ۱۰رشد ۳۶% سالانه

محقق ایمنی هوش مصنوعی

AI Safety Researcher

محقق ایمنی هوش مصنوعی (AI Safety Researcher) متخصصی است که تلاش می‌کند سیستم‌های پیشرفته AI با ارزش‌های انسانی همراستا (aligned) باقی بمانند، رفتارهای غیرمنتظره نداشته باشند و در دست بازیگران بد ابزار آسیب نشوند. این نقش در تقاطع machine learning، فلسفه ذهن، interpretability و policy قرار دارد و یکی از حیاتی‌ترین نقش‌های ۲۰۲۶ به شمار می‌رود — وقتی frontier model ها (Claude، GPT، Gemini، Llama) به سمت قابلیت‌های agentic و خودگردان حرکت می‌کنند، محققان ایمنی خط دفاعی نهایی هستند. حقوق پایه ارشد در Anthropic، OpenAI و DeepMind از ۳۰۰هزار تا ۸۰۰هزار دلار plus equity می‌رسد و تقاضا با سرعت رشد فناوری چندبرابر شده است.

Alignment ResearchInterpretabilityRed-TeamingRLHF/RLAIFML Theory

مقدمه و تعریف شغل

محقق ایمنی هوش مصنوعی (AI Safety Researcher) فردی است که هدف اصلی او اطمینان از این است که سیستم‌های پیشرفته AI — به‌ویژه frontier model ها و agent های autonomous — رفتار قابل پیش‌بینی، قابل اعتماد و همراستا با ارزش‌های انسانی داشته باشند. این نقش با AI ethics متفاوت است: ethics روی fairness و bias فعلی تمرکز دارد، اما safety research روی failure mode های catastrophic و existential risk کار می‌کند — از reward hacking در سیستم‌های فعلی تا deceptive alignment در سیستم‌های آینده.

ریشه‌های field به اوایل دهه ۲۰۰۰ و کارهای Eliezer Yudkowsky و موسسه MIRI برمی‌گردد، اما تا انتشار 'Concrete Problems in AI Safety' توسط Amodei و همکاران در ۲۰۱۶ تقریباً همه چیز نظری بود. ظهور GPT-3 در ۲۰۲۰ و سپس ChatGPT در ۲۰۲۲ کاتالیزور شد — ناگهان مدل‌هایی وجود داشتند که می‌شد روی آن‌ها alignment empirical را تست کرد. تأسیس Anthropic در ۲۰۲۱ توسط جداشدگان OpenAI، RLHF در InstructGPT، Constitutional AI، Sleeper Agents، و SAE breakthrough توسط Anthropic در ۲۰۲۴ این حوزه را به یکی از داغ‌ترین زیرشاخه‌های ML تبدیل کرد. در ۲۰۲۶، AISI بریتانیا و آمریکا، AI Safety Summits بین‌المللی، Responsible Scaling Policy ها و EU AI Act این نقش را از حاشیه آکادمیک به مرکز thread اصلی scaling AI کشیده‌اند.

چه چیزی می‌سازید؟

مثال‌های واقعی از خروجی کار یک محقق ایمنی هوش مصنوعی

🧪

Evaluation Suite برای Dangerous Capabilities

Anthropic قبل از release Claude 4 یک مجموعه eval برای autonomy، biosecurity و cyber می‌سازد — شما task هایی طراحی می‌کنید که می‌سنجد آیا مدل می‌تواند یک نسخه از خودش را روی AWS deploy کند یا synthesis path برای یک bioweapon ارائه دهد.

🔬

Mechanistic Interpretability Tooling

تیم Anthropic Interpretability روی Claude 3 Sonnet با SAE میلیون‌ها feature کشف کرد. شما کد می‌نویسید که activation ها را روی hardware large-scale ذخیره کند، SAE روی آن آموزش دهد و dashboard interactive برای جستجوی feature ها بسازد.

🎯

RLHF و Reward Model Pipeline

OpenAI برای آموزش GPT-5 یک reward model روی feedback انسانی نیاز دارد. شما pipeline می‌سازید که annotator interface، quality control، reward model training و PPO/DPO روی policy model را شامل می‌شود.

🚨

Automated Red-Team Agents

Google DeepMind می‌خواهد ۲۴/۷ مدل‌هایش red-team شوند. شما agent خودکار می‌سازید که بر اساس adversarial RL prompt های جدید تولید کند و jailbreak های قبلاً ندیده‌شده را کشف کند.

📜

Safety Case Documents

قبل از release هر frontier model، یک سند رسمی نیاز است که اثبات کند مدل از threshold های Responsible Scaling Policy عبور نکرده. شما empirical evidence جمع می‌کنید و آن را به استدلال logical تبدیل می‌کنید.

🦠

Model Organisms of Misalignment

برای مطالعه deceptive alignment، Anthropic در Sleeper Agents عمداً مدلی fine-tune کرد که در شرایط خاص رفتار harmful نشان می‌دهد. شما این model organism ها را طراحی و سپس detection technique ها را روی آن‌ها تست می‌کنید.

تخصص‌های مختلف محقق ایمنی هوش مصنوعی

این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد

🔬

تفسیرپذیری مکانیستیک

Mechanistic Interpretability

ریورس‌انجینیرینگ شبکه عصبی برای فهم circuit و feature ها. تیم Chris Olah در Anthropic و Neel Nanda در DeepMind پیشگام هستند. پرتقاضاترین زیرشاخه ۲۰۲۶.

👁️

نظارت مقیاس‌پذیر

Scalable Oversight

چگونه انسان‌ها مدلی را که از خودشان باهوش‌تر است نظارت کنند؟ Debate، IDA، RLHF در OpenAI Superalignment و Anthropic Alignment Science.

⚠️

ارزیابی قابلیت‌های خطرناک

Dangerous Capability Evaluations

ساخت benchmark برای cyber، biosecurity، autonomy. METR، UK AISI، US AISI و Apollo Research مرجع هستند. خروجی مستقیماً وارد سیاست‌گذاری می‌شود.

🚨

ردتیمینگ و تحقیق jailbreak

Red-Teaming و Jailbreak Research

کشف systematic این که چطور می‌توان مدل را به رفتار ناخواسته واداشت. تیم‌های Trust & Safety در OpenAI، Microsoft AIRT و کار محققان مستقل مثل Andy Zou.

📜

حاکمیت و سیاست‌گذاری فنی

AI Governance و Policy Technical

پل بین فنی و policy — RAND، GovAI، CSET، Open Philanthropy. مناسب کسانی که هم درک ML و هم علاقه به regulation دارند.

تفاوت با شغل‌های مشابه

کجا این شغل تمام می‌شود و شغل دیگری شروع می‌شود؟

محقق ML معمولیML Research Scientist

ML Researcher روی بهبود capability ها کار می‌کند — معماری جدید، الگوریتم‌های سریع‌تر، benchmark بهتر. Safety Researcher روی محدود کردن یا فهمیدن همان capability ها کار می‌کند — این دو گاهی در tension هستند و در همان شرکت تیم‌های متفاوتی دارند.

محقق اخلاق AIAI Ethics Researcher

AI Ethics روی harm های فعلی تمرکز دارد: bias، fairness، representation، labor impact. Safety Researcher روی harm های آینده و low-probability/high-impact تمرکز دارد: loss of control، misuse برای WMD، existential risk. هر دو important اما با toolkit و community متفاوت.

مهندس امنیت AIAI Security Engineer

Security Engineer روی attack های classic سیستم می‌نشیند: model theft، membership inference، adversarial example. Safety Researcher روی emergent behavior و alignment کار می‌کند. در ۲۰۲۶ این دو نقش شروع به ادغام می‌کنند زیرا agentic AI هر دو سطح ریسک را همزمان دارد.

محقق سیاست‌گذاری AIAI Policy Researcher

Policy Researcher با قانون‌گذار صحبت می‌کند، سند می‌نویسد و چارچوب regulatory پیشنهاد می‌دهد. Safety Researcher empirical کار می‌کند: کد می‌نویسد، آزمایش می‌کند، paper منتشر می‌کند. هر دو در یک تیم می‌نشینند اما output های متفاوتی دارند.

تأثیر در صنایع مختلف

محقق ایمنی هوش مصنوعی در همه صنایع مشغول به کار است — نه فقط شرکت‌های فناوری

🏢

Frontier AI Labs

بدون safety team هیچ release جدیدی ممکن نیست — Anthropic، OpenAI و DeepMind هر هفته دارند نیرو جذب می‌کنند

🏛️

دولت و قانون‌گذاری

UK AISI، US AISI، EU AI Office و Singapore AISI تیم‌های فنی بزرگ می‌سازند برای ارزیابی pre-deployment

🛡️

دفاع و امنیت ملی

Anthropic Palantir partnership، DARPA AI Safety و Project Maven — AI safety به مسئله strategic security تبدیل شده

🏥

بهداشت و درمان

FDA و EMA دارند alignment evals را برای medical LLM ها استاندارد می‌کنند — hallucination در توصیه دارویی قابل قبول نیست

🏦

مالی و فین‌تک

بانک‌ها قبل از استفاده از LLM در customer-facing بایستی safety case کامل ارائه دهند — FCA و OCC الزام‌آور کرده‌اند

🎓

تحقیقات آکادمیک

مراکزی مثل CHAI Berkeley، Stanford CRFM، MIT Algorithmic Alignment Group در حال انفجار funding هستند

☁️

Cloud و Platform

AWS Bedrock، Azure OpenAI و Vertex AI همه safety filter و guardrail لازم دارند — تیم safety بزرگی نیاز می‌شود

🧬

Biotech و Bio-security

همکاری Anthropic با NTI و DeepMind با WHO برای جلوگیری از misuse مدل‌ها در دستکاری پاتوژن — نقش حیاتی محقق safety

تصورات غلط رایج

قبل از تصمیم‌گیری، این باورهای اشتباه را بشناسید

AI safety یعنی فقط فلسفه و bias کنترلی روی موضوع

بخش بزرگی از کار empirical است: PyTorch، آموزش SAE، نوشتن eval. سهم فلسفه شاید ۱۵٪ کار باشد و بقیه code و آزمایش است.

باید PhD داشته باشید تا وارد شوید

بسیاری از alignment researcher های موفق در Anthropic و Redwood از طریق MATS، ARENA یا blog post عالی وارد شدند بدون PhD. research taste و output بیشتر از مدرک ارزش دارد.

AI safety یک حوزه marginal و bubble است

Anthropic در ۲۰۲۵ از Amazon ۸ میلیارد دلار جذب کرد و بخش بزرگی از این روی safety می‌رود. UK AISI با ۱۰۰+ نفر و US AISI در حال scale شدن سریع هستند.

interpretability فعلاً impractical است و کاربرد ندارد

Anthropic در ۲۰۲۴ با SAE روی Claude 3 Sonnet feature هایی پیدا کرد که می‌توان مستقیماً steer کرد. این تکنیک‌ها در حال ورود به production هستند.

safety researcher ها anti-AI هستند و می‌خواهند progress را متوقف کنند

اکثر safety researcher ها معتقدند AI پتانسیل عظیم برای خیر دارد — هدف این است که safe scale شود نه متوقف. این تفاوت با AI doomer ها در media است.

یک روز کاری واقعی

در هر سطح روز کاری چه شکلی است؟

جونیور (۰–۲ سال)

بیشتر وقت روی reproduction، نوشتن eval task و debug کردن training run. مشورت زیاد با supervisor و reading group هفتگی پاپر جدید. هنوز در حال build کردن research taste هستید.

  • صبح: مرور Slack alignment، reading group چهارشنبه، PR review
  • بلاک ۱: اجرای آزمایش روی cluster — مثلاً training یک SAE روی layer ۱۲ از GPT-2
  • بعد از ناهار: meeting 1:1 با manager برای review نتایج هفته
  • بلاک ۲: نوشتن eval task جدید در Inspect AI و run کردن روی Claude/GPT-4o
  • پایان روز: نوشتن internal write-up از نتایج و ارسال برای feedback

میانی (۲–۵ سال)

تعریف research agenda خود، رهبری ۱-۲ پروژه، co-author paper. شروع به mentor کردن junior و حضور در workshop ها مثل NeurIPS Safety. زمان زیادی برای writing و collaboration.

  • صبح: review کار junior، نوشتن internal memo درباره research direction
  • بلاک ۱: design آزمایش جدید — کاغذ روی whiteboard، نوشتن hypothesis مشخص
  • بعد از ناهار: meeting با policy team درباره چطور eval های جدید را به AISI تحویل دهیم
  • بلاک ۲: کدنویسی روی custom training pipeline برای model organism
  • عصر: نوشتن بخشی از paper برای NeurIPS submission یا Alignment Forum post

ارشد (۵+ سال)

تمرکز روی research direction و scientific leadership. کمتر hands-on coding، بیشتر strategic. حضور در AI Safety Summit، صحبت با board، تعامل مستقیم با governmental AISI ها.

  • صبح: bilateral با head of policy و head of training روی هماهنگی RSP
  • جلسه external با UK AISI درباره pre-deployment eval برای model جدید
  • بلاک کوتاه: review architecture proposal از staff researcher برای پروژه interpretability
  • بعد از ناهار: نوشتن safety case section از یک release آینده
  • عصر: ۱:۱ با ۳ نفر از تیم، mentoring روی publication strategy

مسئولیت‌ها و وظایف

مسئولیت‌های اصلی

وظایف روزانه و مهارت‌های مورد نیاز در این شغل

فنی
  • طراحی و اجرای آزمایش‌های empirical alignment روی frontier model ها قبل از deployment
  • ساخت eval suite برای dangerous capability ها (cyber، biosecurity، autonomy، CBRN)
  • تحقیق mechanistic interpretability روی circuit ها و feature های مدل با SAE و activation patching
  • طراحی reward model و pipeline RLHF/RLAIF برای کاهش harmful behavior
  • automated red-teaming و کشف jailbreak، prompt injection و failure mode های پنهان
مهارت نرم
  • نوشتن safety case برای هر release جدید مدل و contribute به Responsible Scaling Policy
  • انتشار paper در venue هایی مثل NeurIPS، ICML، blog post در Alignment Forum و mentoring junior
مدیریتی
  • همکاری با policy team برای engagement با AISI، NIST و قانون‌گذاران EU/UK

مهارت‌های مورد نیاز

مهارت‌های فنی، نرم و حوزه‌ای که یک محقق ایمنی هوش مصنوعی موفق به آن‌ها نیاز دارد

مهارت‌های فنی

PyTorch پیشرفتهضروری

نوشتن custom training loop، hook ها، gradient manipulation و debug کردن numerical issue

Transformer Internalsضروری

درک عمیق attention، MLP، layer norm، residual stream و رفتار activation در عمق مختلف

RLHF و DPOضروری

تسلط بر reward modeling، PPO، DPO و سایر الگوریتم‌های alignment training در عمل و نظریه

Mechanistic Interpretabilityضروری

کار با TransformerLens، SAE، activation patching و causal intervention روی شبکه‌های واقعی

Evaluation Methodologyضروری

طراحی eval reproducible، statistical rigor، capability elicitation و scaffolding برای agent task

Large-Scale Trainingمهم

کار با distributed training، FSDP، DeepSpeed و مدیریت GPU/TPU cluster در مقیاس صد یا هزار

Red-Teaming و Adversarial MLمهم

ساخت adversarial prompt، universal jailbreak، prompt injection و automated attack generation

مهارت‌های پژوهشی و نوشتاری

Research Tasteضروری

تشخیص مسئله مهم از mundane — مهارتی که فقط با خواندن پاپر زیاد و mentorship به دست می‌آید

نوشتن علمیضروری

LaTeX، ساختار paper NeurIPS، نوشتن blog post کیفیت Alignment Forum و توضیح ساده مسائل پیچیده

خواندن سریع پاپرمهم

توانایی پردازش ۱۰+ paper در هفته از arXiv و استخراج نکات قابل استفاده برای پروژه خودتان

Reproducibility Engineeringمهم

مدیریت seed، environment، dependency و logging طوری که آزمایش‌های شما دقیقاً تکرارپذیر باشند

Visualization علمیمهم

ساخت plot واضح و قانع‌کننده با matplotlib/plotly برای انتقال نتیجه آزمایش

حوزه‌ای و میان‌رشته‌ای

نظریه AI Alignmentضروری

آشنایی با کارهای Christiano، Hubinger، Cotra، Soares و چارچوب‌های inner/outer alignment

Threat Modelingمهم

توانایی فکر کردن مثل attacker — چه actor، با چه capability، با چه motivation، چه harm را ممکن می‌کند؟

AI Governance Literacyمهم

آشنایی با EU AI Act، AISI، NIST AI RMF، Bletchley Declaration و executive order های مرتبط

Biosecurity یا Cybersecurityمفید

دانش پایه در یکی از این حوزه‌ها برای ارزیابی dangerous capability مدل‌ها در آن domain

Philosophy of Mind و Decision Theoryمفید

آشنایی با argument های Bostrom، Yudkowsky و functional decision theory — بیشتر برای intuition

ضروری — بدون آن نمی‌توان وارد بازار کار شدمهم — تفاوت بین جونیور و میانیمفید — مزیت رقابتی

نقشه راه و مسیر آموزشی

نقشه راه تبدیل شدن به محقق ایمنی هوش مصنوعی

این مسیر گام به گام شما را از صفر تا حرفه‌ای هدایت می‌کند.

1

پایه‌های ML و ریاضیات alignment

⏱️ ۴ تا ۶ ماه

ساخت پایه فنی محکم در ML، deep learning و ریاضیات بهینه‌سازی — alignment یک حوزه empirical-heavy است و بدون درک عمیق mechanics مدل‌ها نمی‌شود ایمنی آن‌ها را تضمین کرد.

Python و PyTorchLinear Algebra و Probability پیشرفتهDeep Learning (Transformers, RLHF)Information TheoryOptimization و Convex AnalysisStatistical Learning Theory
2

مبانی AI Alignment و Safety

⏱️ ۳ تا ۴ ماه

آشنایی با ادبیات alignment، مسائل کلاسیک (specification gaming، reward hacking، deceptive alignment) و چارچوب‌های فکری اصلی از Bostrom تا Christiano و Hubinger.

Reward Modeling و RLHFSpecification Gaming و Goodhart's LawInner vs Outer AlignmentScalable Oversight (Debate, IDA)Constitutional AIAI Existential Risk Theory
3

Mechanistic Interpretability

⏱️ ۳ تا ۵ ماه

یادگیری ریورس‌انجینیرینگ شبکه‌های عصبی — فهمیدن این که circuit ها، features و induction head ها داخل یک Transformer دقیقاً چگونه محاسبه می‌کنند. این پرتقاضاترین زیرشاخه alignment در Anthropic و DeepMind است.

Transformer Circuits و Activation PatchingSparse Autoencoders (SAEs)Probing و Linear Representation HypothesisCausal ScrubbingTransformerLens / nnsightMechanistic Anomaly Detection
4

Red-Teaming، Evals و Empirical Safety

⏱️ ۳ تا ۴ ماه

تخصص در ساخت evaluation suite ها برای dangerous capability ها (cyber، biosecurity، autonomy)، automated red-teaming و model organism research برای کشف failure mode های پنهان.

Capability Evaluations (CBRN, Cyber, Autonomy)Automated Red-TeamingJailbreak و Prompt Injection ResearchDangerous Capability Benchmarks (MMLU, MACE, ARC)Model Organisms of MisalignmentInspect AI Framework (UK AISI)
5

تحقیق مستقل و انتشار

⏱️ مداوم

گذر از مصرف‌کننده تحقیق به تولیدکننده — انتشار blog post در LessWrong / Alignment Forum، paper در NeurIPS / ICML safety track، مشارکت در MATS، Astra Fellowship یا Anthropic Fellows.

Research Taste و Problem SelectionWriting Alignment Forum PostsAcademic Paper Writing (LaTeX)MATS / Astra / SERI Fellowship TrackCollaboration با Frontier LabsAI Governance Literacy

ابزارها و استک فنی

ابزارهایی که هر مهندس AI باید بشناسد، دسته‌بندی‌شده بر اساس اولویت

Interpretability Frameworks

TransformerLens

کتابخانه استاندارد برای mechanistic interpretability روی Transformer ها — activation caching، hook ها و patching

ضروری
nnsight

ابزار جدید NDIF برای interpretability روی مدل‌های بزرگ remote — جایگزین مدرن TransformerLens برای frontier models

ضروری
SAELens

کتابخانه آموزش و تحلیل Sparse Autoencoders — ابزار اصلی برای feature extraction از activations

پیشرفته
Neuronpedia

پلتفرم web-based برای کاوش feature های SAE و انتشار نتایج interpretability

مفید

Evals و Red-Teaming

Inspect AI

framework رسمی UK AI Security Institute برای نوشتن capability eval ها — استاندارد جدید industry

ضروری
Garak

scanner متن‌باز NVIDIA برای vulnerability LLMs — jailbreak، prompt injection، data leakage

مفید
PyRIT

Python Risk Identification Tool از Microsoft برای automated red-teaming سیستم‌های GenAI

مفید
METR Task Suite

مجموعه task های autonomous capability برای سنجش این که آیا agent می‌تواند replicate شود

پیشرفته

Training و Alignment

TRL (Transformer RL)

کتابخانه Hugging Face برای RLHF، DPO و PPO روی LLM ها — استاندارد آموزش alignment

ضروری
PyTorch

framework اصلی research در همه frontier lab ها — تسلط کامل ضروری است

ضروری
Weights & Biases

ابزار tracking آزمایش‌ها — حیاتی برای reproducibility در research alignment

مفید
JAX و Flax

stack مورد استفاده DeepMind برای training در مقیاس — اگر هدف Google DeepMind است ضروری می‌شود

پیشرفته

Datasets و Benchmarks

Anthropic HH-RLHF

dataset مرجع برای human feedback آموزش helpful/harmless — معیار academic در alignment

ضروری
MACE / WMDP

benchmark سنجش دانش خطرناک مدل (biosecurity، cyber، CBRN) — استاندارد frontier evaluation

مفید
BIG-bench Hard

مجموعه task های چالش‌برانگیز برای سنجش reasoning و scalable oversight

مفید
AI Safety Benchmark MLCommons

benchmark صنعتی مشترک برای hazard category های GenAI — مرجع برای production-grade safety

مفید
ضروری — باید یاد بگیریدمفید — ارزش یادگیری داردپیشرفته — برای سطوح ارشد

مسیر پیشرفت شغلی

از جونیور تا Staff Engineer — چه مهارت‌هایی نیاز دارید و چه درآمدی انتظار داشته باشید

Research Engineer / Resident

۰ تا ۲ سال

~$220K

میانگین سالانه (آمریکا)

اجرای آزمایش‌های alignment طراحی‌شده توسط محقق ارشد، نوشتن eval ها، debug کردن training runs و تولید replication studies. ورود معمولاً از Anthropic Fellows یا MATS.

PyTorchTransformer InternalsEval WritingReplicationPaper Reading

AI Safety Researcher (Mid)

۲ تا ۵ سال

~$360K

میانگین سالانه (آمریکا)

تعریف agenda تحقیقاتی کوچک خود، رهبری ۱ تا ۲ پروژه، co-author مقالات NeurIPS / ICML safety track، مشارکت در RSP (Responsible Scaling Policy) و model card.

Research AgendaMechanistic InterpRLHF TheoryWritingMentoring

Senior / Staff Safety Researcher

۵ تا ۸ سال

~$550K

میانگین سالانه (آمریکا)

رهبری team کامل interpretability یا alignment، تعریف safety case برای frontier model، co-design با policy team برای commitment های دولتی (UK AISI، US AISI).

Research LeadershipSafety Case DesignOrg StrategyPolicy LiaisonLab Management

Principal / Head of Alignment

۸+ سال

~$850K

میانگین سالانه (آمریکا)

تعریف کل جهت alignment یک frontier lab، تعامل مستقیم با CEO و board، رهبری ۳۰+ نفر، نماینده شرکت در Bletchley، Seoul و سایر AI Safety Summits.

Org VisionPublic SpeakingPolicyScientific LeadershipCross-org Negotiation

چالش‌ها و جنبه‌های منفی

واقعیت‌هایی که کمتر در آگهی‌های شغلی می‌بینید — قبل از ورود بدانید

موضوع پژوهشی غیرعلمی به نظر می‌رسد

تحقیقاتی

بسیاری از مسائل safety hypothetical هستند — مثلاً deceptive alignment هنوز در مدل‌های فعلی به‌وضوح دیده نشده. باید با rigor empirical روی مسائل کار کنید بدون این که در سوء برداشت 'speculative' بیفتید.

Tension با تیم capability

شرکت بزرگ

در یک frontier lab، تیم capability می‌خواهد سریع‌تر ship کند، تیم safety می‌خواهد قبل از release evidence جمع کند. مدیریت این tension و حفظ collaboration یکی از چالش‌های روزانه است.

compute محدود برای آزمایش

استارتاپ

آزمایش‌های alignment نیاز به GPU بیشتر دارند چون باید روی مدل‌های بزرگ تکرار شوند. در استارتاپ یا academia این یک bottleneck جدی است که خلاقیت در experiment design را الزامی می‌کند.

سنجش success دشوار است

تحقیقاتی

چطور می‌فهمید مدل واقعاً aligned است یا فقط ظاهر aligned دارد؟ مشکل deceptive alignment یعنی evaluation به‌تنهایی کافی نیست — این مشکل بنیادین در methodology field است.

فشار رسانه‌ای و عمومی

عمومی

نقش‌های safety زیر ذره‌بین رسانه و policymaker قرار می‌گیرند. هر statement عمومی شما می‌تواند به headline تبدیل شود یا توسط AI doomer ها/anti-doomer ها سوءاستفاده شود.

burn-out از anxiety موضوع

عمومی

کار روی existential risk و failure mode های جدی می‌تواند روانی فرسایشی باشد. بسیاری از senior researcher ها mental health و work-life balance را به‌عنوان challenge اصلی نام می‌برند.

حقوق و بازار کار جهانی

حقوق جهانی محقق ایمنی هوش مصنوعی

میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف

کشورمیانهارز
🇯🇵ژاپن
¥24,000,000JPY
🇦🇪امارات
AED 950,000AED
🇺🇸آمریکا
$550,000USD
🇨🇦کانادا
CA$310,000CAD
🇦🇺استرالیا
A$270,000AUD
🇬🇧انگلستان
£250,000GBP
🇨🇭سوئیس
CHF 240,000CHF
🇸🇬سنگاپور
SGD 240,000SGD
🇩🇪آلمان
€175,000EUR
🇳🇱هلند
€145,000EUR

* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شده‌اند.

چگونه از صفر شروع کنیم

برنامه گام‌به‌گام برای ورود به مهندسی هوش مصنوعی

ماه ۱: AI Safety Fundamentals course

دوره BlueDot Impact AI Safety Fundamentals را به طور کامل بگذرانید — این standard entry point در field است.

ماه ۲: ARENA Sprint

ARENA chapter های mechanistic interpretability و RLHF را با coding انجام دهید. این intensive coding bootcamp به سبک alignment است.

ماه ۳: Replication یک پاپر

یک paper interpretability را replicate کنید (مثلاً Induction Heads یا Toy Models of Superposition) و نتایج را در یک blog post منتشر کنید.

ماه ۴: مشارکت در یک پروژه open-source

به TransformerLens، SAELens، Inspect AI یا یک پروژه آلیامنت دیگر contribute کنید. هدف: ایجاد شبکه و reputation.

ماه ۵: نوشتن Alignment Forum post

یک ایده یا تحلیل اصلی خودتان را در Alignment Forum منتشر کنید — feedback از community جدی‌ترین مرحله ورود است.

ماه ۶: Apply به MATS، Astra، یا Anthropic Fellows

با portfolio (Inspect eval، interpretability repro، AF post) به سه برنامه ورودی اصلی apply کنید.

پروژه‌های پیشنهادی برای رزومه

Replication یک پیپر کلاسیک Interpretability

مبتدی

یک paper کوتاه مثل 'A Mathematical Framework for Transformer Circuits' یا 'Induction Heads' را روی GPT-2 Small replicate کنید و نتایج را در یک Jupyter notebook با visualization منتشر کنید.

PyTorchTransformerLensmatplotlibJupyter
زمان تخمینی: ۲ هفته

Eval Suite سفارشی برای یک Dangerous Capability

متوسط

با Inspect AI یک eval برای یک capability خاص (مثل sandbagging یا situational awareness) بنویسید، روی Claude، GPT-4o و Llama اجرا کنید و گزارش مقایسه‌ای منتشر کنید.

Inspect AIAnthropic SDKOpenAI SDKPython
زمان تخمینی: ۳ هفته

Sparse Autoencoder روی GPT-2 Medium

پیشرفته

یک SAE روی activation های یک layer از GPT-2 Medium آموزش دهید، feature های مهم را پیدا کنید و circuit ساده‌ای را با activation patching tease apart کنید.

SAELensTransformerLensWeights & BiasesNeuronpedia
زمان تخمینی: ۶ هفته

Red-Team Report روی یک Production Chatbot

متوسط

یک محصول production (مثلاً یک chatbot شرکتی) را با Garak و prompt های دستی red-team کنید، failure mode ها را دسته‌بندی و mitigation پیشنهاد دهید — مثل report واقعی Anthropic Trust & Safety.

GarakPyRITMarkdownPython
زمان تخمینی: ۴ هفته

Model Organism of Deceptive Alignment

پیشرفته

یک مدل کوچک را fine-tune کنید که در شرایط training یک رفتار و در deployment رفتار دیگری نشان دهد (الهام از Sleeper Agents Anthropic) و سعی کنید با probing این behavior را تشخیص دهید.

TRLPyTorchTransformerLensLinear Probes
زمان تخمینی: ۸ هفته

مثال‌های واقعی و Case Studies

داستان‌های واقعی از مهندسانی که در این حوزه تأثیرگذار بوده‌اند

P

Paul Christiano

پیشینه

PhD از UC Berkeley زیر نظر Umesh Vazirani. بنیان‌گذار تیم Alignment در OpenAI و سپس Alignment Research Center (ARC). در ۲۰۲۴ به عنوان Head of AI Safety در US AI Safety Institute (NIST) منصوب شد.

دستاورد

ابداع‌کننده RLHF در پیپر معروف 'Deep RL from Human Preferences' (۲۰۱۷) — تکنیکی که هسته آموزش ChatGPT، Claude و Gemini است. توسعه Iterated Distillation and Amplification (IDA) به‌عنوان روش scalable oversight. مسئول طراحی METR task suite برای ارزیابی autonomy.

درس کلیدی

تأثیرگذارترین کارهای Christiano هنوز ۱۰ سال پیش به‌عنوان پروژه‌های 'فلسفی' دیده می‌شدند. سرمایه‌گذاری بر روی مسائل که هنوز mainstream نیستند می‌تواند ۵ تا ۱۰ سال بعد payoff عظیم بدهد.

C

Chris Olah

پیشینه

بدون مدرک رسمی دانشگاهی! خودآموخته شروع به کار با شبکه‌های عصبی کرد، در Google Brain با تیم Distill همکاری کرد و سپس به Anthropic به عنوان co-founder و lead interpretability پیوست.

دستاورد

بنیان‌گذار حوزه mechanistic interpretability مدرن از طریق سری Transformer Circuits در Anthropic. اولین کسی که circuit های قابل فهم را در شبکه‌های convolutional شناسایی کرد. در ۲۰۲۴ با scaling SAE روی Claude 3 Sonnet میلیون‌ها feature قابل تفسیر کشف شد — breakthrough تاریخی.

درس کلیدی

اولا، نبود مدرک دانشگاهی مانع موفقیت در alignment نیست. ثانیا، communication علمی با کیفیت بالا (مثل Distill و Transformer Circuits) خود یک contribution علمی بنیادین است.

J

Jan Leike

پیشینه

PhD از Australian National University در reinforcement learning. ۸ سال کار در DeepMind، سپس co-lead تیم Superalignment در OpenAI. در May ۲۰۲۴ از OpenAI استعفا داد و به Anthropic پیوست تا تیم alignment science را رهبری کند.

دستاورد

یکی از پیشگامان scalable oversight و reward modeling در عمل. مسئول معماری RLHF در InstructGPT و GPT-4. استعفای عمومی او از OpenAI و نقد سیاست‌های safety این شرکت یکی از important ترین رویدادهای industry در ۲۰۲۴ بود.

درس کلیدی

گاهی integrity حرفه‌ای اهمیت بیشتری از موقعیت دارد. Leike نشان داد که safety researcher باید آماده باشد حتی از قدرتمندترین موقعیت‌ها کنار برود اگر sense می‌کند کار alignment جدی گرفته نمی‌شود.

نمونه آگهی استخدام واقعی + تحلیل

یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش

Research Engineer / Research Scientist, Alignment Science

Anthropicسان فرانسیسکو (یا لندن) — hybrid2025-09
مشاهده آگهی اصلی

تحلیل نیازمندی‌ها

EN

Significant ML engineering experience — comfortable training and fine-tuning large language models

تجربه عملی training مدل‌های large-scale لازم است. نه فقط fine-tune ساده — باید با FSDP، gradient checkpointing و infrastructure GPU/TPU خود را راحت کنید. اگر فقط Hugging Face Trainer استفاده کرده‌اید، کافی نیست.

ضروری
EN

Strong PyTorch skills, with deep understanding of transformer internals

نه فقط استفاده از nn.Transformer بلکه توانایی نوشتن attention از صفر، hook gradient و debug کردن numerical issue. ARENA chapter Transformer From Scratch دقیقاً این پایه را می‌سازد.

ضروری
EN

Genuine concern about AI safety and risks from advanced models

این شرط narrative نیست — در مصاحبه‌ها واقعاً تست می‌شود. باید بتوانید درباره threat model مدل‌های آینده، خطرات agentic AI و چرا alignment مسئله مهم است صحبت کنید. مطالعه Bostrom، Christiano و Cotra ضروری است.

ضروری
EN

Experience leading or contributing to ML research projects

نیازی به PhD نیست اما باید evidence نشان دهید که می‌توانید یک پروژه research را از hypothesis تا writeup ببرید. ARENA capstone، MATS project یا AF post معیار قابل قبولی است.

مهم
EN

Familiarity with RLHF, reward modeling, or scalable oversight approaches

Reading کارهای Christiano روی IDA، Bowman روی debate، و InstructGPT paper. اگر TRL استفاده کرده‌اید برای DPO/PPO، نشان دهنده هم familiarity هم coding chops است.

مهم
EN

Mechanistic interpretability or model evaluation background

اگر این background را ندارید، می‌توانید از زاویه scalable oversight یا RLHF وارد شوید. ولی interpretability پرتقاضاترین track در Anthropic است در ۲۰۲۶.

مفید

تحلیل مسئولیت‌ها

EN

Design and run empirical alignment experiments on Claude and other frontier models

هسته کار — طراحی experimental setup که سوال alignment مشخصی را تست می‌کند، اجرای آن روی مدل‌های frontier (با access داخلی) و تحلیل نتایج. ابتدا متوجه می‌شوید چقدر iteration time مهم است.

EN

Contribute to Anthropic's Responsible Scaling Policy and pre-deployment evaluations

نتایج research شما مستقیماً وارد سند رسمی release می‌شود. این یعنی responsibility بالا — اگر eval شما imperfect باشد، می‌تواند روی تصمیم release frontier model اثر بگذارد.

EN

Publish research on Alignment Forum and academic venues

Anthropic انتشار را به‌شدت تشویق می‌کند — بخش بزرگی از کار شما public خواهد بود. این مزیت بزرگ نسبت به فضای closed-source مثل برخی تیم‌های Google است.

EN

Collaborate with policy team on engagement with AISI and other government bodies

بخش رو به رشد کار — توضیح technical نتایج به audience policy، participation در governmental briefing و contribute به استانداردهای international.

نتیجه‌گیری کلی

Anthropic روی Alignment Science با یک combination نادر استخدام می‌کند: ML engineering chops محکم + intellectual seriousness درباره AI risk + توانایی research independent. اگر در یکی از این سه ضعف دارید، روی آن متمرکز شوید قبل از apply. portfolio با Inspect eval، interpretability replication و AF post جدی، شانس شما را به‌مراتب بیشتر می‌کند تا فقط یک رزومه عالی.

آینده و روندها

پیش‌بینی ۵–۱۰ ساله و مهارت‌هایی که باید یاد بگیرید

تقاضا برای AI Safety researcher بین ۲۰۲۴ تا ۲۰۳۰ بیش از ۵۰۰٪ رشد می‌کند — از حدود ۸۰۰ نفر در frontier labs به بیش از ۵۰۰۰ نفر در labs، AISI ها و enterprise

منبع: 80,000 Hours AI Safety Career Review 2025 / GovAI Workforce Report

مهارت‌های نوظهور که باید یاد بگیرید

Agentic Safety (autonomy evals, sandbox design)Scalable Oversight با debate و verificationMechanistic Anomaly DetectionCross-Lab Coordination و Standard-SettingAI Control (نه فقط alignment) — Greenblatt et al.Multimodal Safety (vision, code, tool-use)Bio و Cyber Capability Evaluations تخصصی

پیش‌بینی‌های آینده

2026

هر frontier lab بایستی pre-deployment eval توسط AISI انجام دهد — این به استاندارد regulatory در UK، US، EU و Singapore تبدیل می‌شود

2027

Mechanistic Interpretability از research lab وارد production می‌شود — feature steering در Claude، GPT و Gemini به user-facing tool تبدیل می‌شود

2028

اولین model release با evidence رسمی dangerous capability ممنوع می‌شود یا با constraint های شدید release می‌شود — case test اصلی RSP ها

2030

هر شرکت Fortune 500 که LLM به‌صورت deep استفاده می‌کند، حداقل یک in-house AI safety researcher خواهد داشت — مشابه CISO در دهه ۲۰۱۰

ریسک‌های واقعی

ریسک اصلی شاخه‌ای شدن field است: capability ها سریع‌تر از safety scale می‌کنند، و اگر یک frontier lab برای سود رقابتی RSP خود را رعایت نکند، فشار بر بقیه برای race to the bottom زیاد می‌شود. ریسک دیگر این است که AI safety به zone فقط elite تبدیل شود — اگر فقط ۵ frontier lab نیرو جذب کنند و academic field کوچک بماند، diversity پژوهشی از بین می‌رود. در سطح فردی، burn-out و existential anxiety از موضوع کار باعث می‌شود بسیاری بعد از ۳-۴ سال field را ترک کنند.

ویدیوهای آموزشی

یک روز در زندگی یک AI Safety Researcher

ویدیوهای واقعی از متخصصان این حوزه که روزانه چه کارهایی انجام می‌دهند

برای راهنمایی شخصی‌سازی‌شده مشاوره بگیرید