محقق ایمنی هوش مصنوعی
AI Safety Researcher
محقق ایمنی هوش مصنوعی (AI Safety Researcher) متخصصی است که تلاش میکند سیستمهای پیشرفته AI با ارزشهای انسانی همراستا (aligned) باقی بمانند، رفتارهای غیرمنتظره نداشته باشند و در دست بازیگران بد ابزار آسیب نشوند. این نقش در تقاطع machine learning، فلسفه ذهن، interpretability و policy قرار دارد و یکی از حیاتیترین نقشهای ۲۰۲۶ به شمار میرود — وقتی frontier model ها (Claude، GPT، Gemini، Llama) به سمت قابلیتهای agentic و خودگردان حرکت میکنند، محققان ایمنی خط دفاعی نهایی هستند. حقوق پایه ارشد در Anthropic، OpenAI و DeepMind از ۳۰۰هزار تا ۸۰۰هزار دلار plus equity میرسد و تقاضا با سرعت رشد فناوری چندبرابر شده است.
مقدمه و تعریف شغل
محقق ایمنی هوش مصنوعی (AI Safety Researcher) فردی است که هدف اصلی او اطمینان از این است که سیستمهای پیشرفته AI — بهویژه frontier model ها و agent های autonomous — رفتار قابل پیشبینی، قابل اعتماد و همراستا با ارزشهای انسانی داشته باشند. این نقش با AI ethics متفاوت است: ethics روی fairness و bias فعلی تمرکز دارد، اما safety research روی failure mode های catastrophic و existential risk کار میکند — از reward hacking در سیستمهای فعلی تا deceptive alignment در سیستمهای آینده.
ریشههای field به اوایل دهه ۲۰۰۰ و کارهای Eliezer Yudkowsky و موسسه MIRI برمیگردد، اما تا انتشار 'Concrete Problems in AI Safety' توسط Amodei و همکاران در ۲۰۱۶ تقریباً همه چیز نظری بود. ظهور GPT-3 در ۲۰۲۰ و سپس ChatGPT در ۲۰۲۲ کاتالیزور شد — ناگهان مدلهایی وجود داشتند که میشد روی آنها alignment empirical را تست کرد. تأسیس Anthropic در ۲۰۲۱ توسط جداشدگان OpenAI، RLHF در InstructGPT، Constitutional AI، Sleeper Agents، و SAE breakthrough توسط Anthropic در ۲۰۲۴ این حوزه را به یکی از داغترین زیرشاخههای ML تبدیل کرد. در ۲۰۲۶، AISI بریتانیا و آمریکا، AI Safety Summits بینالمللی، Responsible Scaling Policy ها و EU AI Act این نقش را از حاشیه آکادمیک به مرکز thread اصلی scaling AI کشیدهاند.
چه چیزی میسازید؟
مثالهای واقعی از خروجی کار یک محقق ایمنی هوش مصنوعی
Evaluation Suite برای Dangerous Capabilities
Anthropic قبل از release Claude 4 یک مجموعه eval برای autonomy، biosecurity و cyber میسازد — شما task هایی طراحی میکنید که میسنجد آیا مدل میتواند یک نسخه از خودش را روی AWS deploy کند یا synthesis path برای یک bioweapon ارائه دهد.
Mechanistic Interpretability Tooling
تیم Anthropic Interpretability روی Claude 3 Sonnet با SAE میلیونها feature کشف کرد. شما کد مینویسید که activation ها را روی hardware large-scale ذخیره کند، SAE روی آن آموزش دهد و dashboard interactive برای جستجوی feature ها بسازد.
RLHF و Reward Model Pipeline
OpenAI برای آموزش GPT-5 یک reward model روی feedback انسانی نیاز دارد. شما pipeline میسازید که annotator interface، quality control، reward model training و PPO/DPO روی policy model را شامل میشود.
Automated Red-Team Agents
Google DeepMind میخواهد ۲۴/۷ مدلهایش red-team شوند. شما agent خودکار میسازید که بر اساس adversarial RL prompt های جدید تولید کند و jailbreak های قبلاً ندیدهشده را کشف کند.
Safety Case Documents
قبل از release هر frontier model، یک سند رسمی نیاز است که اثبات کند مدل از threshold های Responsible Scaling Policy عبور نکرده. شما empirical evidence جمع میکنید و آن را به استدلال logical تبدیل میکنید.
Model Organisms of Misalignment
برای مطالعه deceptive alignment، Anthropic در Sleeper Agents عمداً مدلی fine-tune کرد که در شرایط خاص رفتار harmful نشان میدهد. شما این model organism ها را طراحی و سپس detection technique ها را روی آنها تست میکنید.
تخصصهای مختلف محقق ایمنی هوش مصنوعی
این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد
تفسیرپذیری مکانیستیک
Mechanistic Interpretability
ریورسانجینیرینگ شبکه عصبی برای فهم circuit و feature ها. تیم Chris Olah در Anthropic و Neel Nanda در DeepMind پیشگام هستند. پرتقاضاترین زیرشاخه ۲۰۲۶.
نظارت مقیاسپذیر
Scalable Oversight
چگونه انسانها مدلی را که از خودشان باهوشتر است نظارت کنند؟ Debate، IDA، RLHF در OpenAI Superalignment و Anthropic Alignment Science.
ارزیابی قابلیتهای خطرناک
Dangerous Capability Evaluations
ساخت benchmark برای cyber، biosecurity، autonomy. METR، UK AISI، US AISI و Apollo Research مرجع هستند. خروجی مستقیماً وارد سیاستگذاری میشود.
ردتیمینگ و تحقیق jailbreak
Red-Teaming و Jailbreak Research
کشف systematic این که چطور میتوان مدل را به رفتار ناخواسته واداشت. تیمهای Trust & Safety در OpenAI، Microsoft AIRT و کار محققان مستقل مثل Andy Zou.
حاکمیت و سیاستگذاری فنی
AI Governance و Policy Technical
پل بین فنی و policy — RAND، GovAI، CSET، Open Philanthropy. مناسب کسانی که هم درک ML و هم علاقه به regulation دارند.
تفاوت با شغلهای مشابه
کجا این شغل تمام میشود و شغل دیگری شروع میشود؟
ML Researcher روی بهبود capability ها کار میکند — معماری جدید، الگوریتمهای سریعتر، benchmark بهتر. Safety Researcher روی محدود کردن یا فهمیدن همان capability ها کار میکند — این دو گاهی در tension هستند و در همان شرکت تیمهای متفاوتی دارند.
AI Ethics روی harm های فعلی تمرکز دارد: bias، fairness، representation، labor impact. Safety Researcher روی harm های آینده و low-probability/high-impact تمرکز دارد: loss of control، misuse برای WMD، existential risk. هر دو important اما با toolkit و community متفاوت.
Security Engineer روی attack های classic سیستم مینشیند: model theft، membership inference، adversarial example. Safety Researcher روی emergent behavior و alignment کار میکند. در ۲۰۲۶ این دو نقش شروع به ادغام میکنند زیرا agentic AI هر دو سطح ریسک را همزمان دارد.
Policy Researcher با قانونگذار صحبت میکند، سند مینویسد و چارچوب regulatory پیشنهاد میدهد. Safety Researcher empirical کار میکند: کد مینویسد، آزمایش میکند، paper منتشر میکند. هر دو در یک تیم مینشینند اما output های متفاوتی دارند.
تأثیر در صنایع مختلف
محقق ایمنی هوش مصنوعی در همه صنایع مشغول به کار است — نه فقط شرکتهای فناوری
Frontier AI Labs
بدون safety team هیچ release جدیدی ممکن نیست — Anthropic، OpenAI و DeepMind هر هفته دارند نیرو جذب میکنند
دولت و قانونگذاری
UK AISI، US AISI، EU AI Office و Singapore AISI تیمهای فنی بزرگ میسازند برای ارزیابی pre-deployment
دفاع و امنیت ملی
Anthropic Palantir partnership، DARPA AI Safety و Project Maven — AI safety به مسئله strategic security تبدیل شده
بهداشت و درمان
FDA و EMA دارند alignment evals را برای medical LLM ها استاندارد میکنند — hallucination در توصیه دارویی قابل قبول نیست
مالی و فینتک
بانکها قبل از استفاده از LLM در customer-facing بایستی safety case کامل ارائه دهند — FCA و OCC الزامآور کردهاند
تحقیقات آکادمیک
مراکزی مثل CHAI Berkeley، Stanford CRFM، MIT Algorithmic Alignment Group در حال انفجار funding هستند
Cloud و Platform
AWS Bedrock، Azure OpenAI و Vertex AI همه safety filter و guardrail لازم دارند — تیم safety بزرگی نیاز میشود
Biotech و Bio-security
همکاری Anthropic با NTI و DeepMind با WHO برای جلوگیری از misuse مدلها در دستکاری پاتوژن — نقش حیاتی محقق safety
تصورات غلط رایج
قبل از تصمیمگیری، این باورهای اشتباه را بشناسید
AI safety یعنی فقط فلسفه و bias کنترلی روی موضوع
بخش بزرگی از کار empirical است: PyTorch، آموزش SAE، نوشتن eval. سهم فلسفه شاید ۱۵٪ کار باشد و بقیه code و آزمایش است.
باید PhD داشته باشید تا وارد شوید
بسیاری از alignment researcher های موفق در Anthropic و Redwood از طریق MATS، ARENA یا blog post عالی وارد شدند بدون PhD. research taste و output بیشتر از مدرک ارزش دارد.
AI safety یک حوزه marginal و bubble است
Anthropic در ۲۰۲۵ از Amazon ۸ میلیارد دلار جذب کرد و بخش بزرگی از این روی safety میرود. UK AISI با ۱۰۰+ نفر و US AISI در حال scale شدن سریع هستند.
interpretability فعلاً impractical است و کاربرد ندارد
Anthropic در ۲۰۲۴ با SAE روی Claude 3 Sonnet feature هایی پیدا کرد که میتوان مستقیماً steer کرد. این تکنیکها در حال ورود به production هستند.
safety researcher ها anti-AI هستند و میخواهند progress را متوقف کنند
اکثر safety researcher ها معتقدند AI پتانسیل عظیم برای خیر دارد — هدف این است که safe scale شود نه متوقف. این تفاوت با AI doomer ها در media است.
یک روز کاری واقعی
در هر سطح روز کاری چه شکلی است؟
جونیور (۰–۲ سال)
بیشتر وقت روی reproduction، نوشتن eval task و debug کردن training run. مشورت زیاد با supervisor و reading group هفتگی پاپر جدید. هنوز در حال build کردن research taste هستید.
- ◆صبح: مرور Slack alignment، reading group چهارشنبه، PR review
- ◆بلاک ۱: اجرای آزمایش روی cluster — مثلاً training یک SAE روی layer ۱۲ از GPT-2
- ◆بعد از ناهار: meeting 1:1 با manager برای review نتایج هفته
- ◆بلاک ۲: نوشتن eval task جدید در Inspect AI و run کردن روی Claude/GPT-4o
- ◆پایان روز: نوشتن internal write-up از نتایج و ارسال برای feedback
میانی (۲–۵ سال)
تعریف research agenda خود، رهبری ۱-۲ پروژه، co-author paper. شروع به mentor کردن junior و حضور در workshop ها مثل NeurIPS Safety. زمان زیادی برای writing و collaboration.
- ◆صبح: review کار junior، نوشتن internal memo درباره research direction
- ◆بلاک ۱: design آزمایش جدید — کاغذ روی whiteboard، نوشتن hypothesis مشخص
- ◆بعد از ناهار: meeting با policy team درباره چطور eval های جدید را به AISI تحویل دهیم
- ◆بلاک ۲: کدنویسی روی custom training pipeline برای model organism
- ◆عصر: نوشتن بخشی از paper برای NeurIPS submission یا Alignment Forum post
ارشد (۵+ سال)
تمرکز روی research direction و scientific leadership. کمتر hands-on coding، بیشتر strategic. حضور در AI Safety Summit، صحبت با board، تعامل مستقیم با governmental AISI ها.
- ◆صبح: bilateral با head of policy و head of training روی هماهنگی RSP
- ◆جلسه external با UK AISI درباره pre-deployment eval برای model جدید
- ◆بلاک کوتاه: review architecture proposal از staff researcher برای پروژه interpretability
- ◆بعد از ناهار: نوشتن safety case section از یک release آینده
- ◆عصر: ۱:۱ با ۳ نفر از تیم، mentoring روی publication strategy
مسئولیتها و وظایف
مسئولیتهای اصلی
وظایف روزانه و مهارتهای مورد نیاز در این شغل
- ◈طراحی و اجرای آزمایشهای empirical alignment روی frontier model ها قبل از deployment
- ◈ساخت eval suite برای dangerous capability ها (cyber، biosecurity، autonomy، CBRN)
- ◈تحقیق mechanistic interpretability روی circuit ها و feature های مدل با SAE و activation patching
- ◈طراحی reward model و pipeline RLHF/RLAIF برای کاهش harmful behavior
- ◈automated red-teaming و کشف jailbreak، prompt injection و failure mode های پنهان
- ◈نوشتن safety case برای هر release جدید مدل و contribute به Responsible Scaling Policy
- ◈انتشار paper در venue هایی مثل NeurIPS، ICML، blog post در Alignment Forum و mentoring junior
- ◈همکاری با policy team برای engagement با AISI، NIST و قانونگذاران EU/UK
مهارتهای مورد نیاز
مهارتهای فنی، نرم و حوزهای که یک محقق ایمنی هوش مصنوعی موفق به آنها نیاز دارد
مهارتهای فنی
نوشتن custom training loop، hook ها، gradient manipulation و debug کردن numerical issue
درک عمیق attention، MLP، layer norm، residual stream و رفتار activation در عمق مختلف
تسلط بر reward modeling، PPO، DPO و سایر الگوریتمهای alignment training در عمل و نظریه
کار با TransformerLens، SAE، activation patching و causal intervention روی شبکههای واقعی
طراحی eval reproducible، statistical rigor، capability elicitation و scaffolding برای agent task
کار با distributed training، FSDP، DeepSpeed و مدیریت GPU/TPU cluster در مقیاس صد یا هزار
ساخت adversarial prompt، universal jailbreak، prompt injection و automated attack generation
مهارتهای پژوهشی و نوشتاری
تشخیص مسئله مهم از mundane — مهارتی که فقط با خواندن پاپر زیاد و mentorship به دست میآید
LaTeX، ساختار paper NeurIPS، نوشتن blog post کیفیت Alignment Forum و توضیح ساده مسائل پیچیده
توانایی پردازش ۱۰+ paper در هفته از arXiv و استخراج نکات قابل استفاده برای پروژه خودتان
مدیریت seed، environment، dependency و logging طوری که آزمایشهای شما دقیقاً تکرارپذیر باشند
ساخت plot واضح و قانعکننده با matplotlib/plotly برای انتقال نتیجه آزمایش
حوزهای و میانرشتهای
آشنایی با کارهای Christiano، Hubinger، Cotra، Soares و چارچوبهای inner/outer alignment
توانایی فکر کردن مثل attacker — چه actor، با چه capability، با چه motivation، چه harm را ممکن میکند؟
آشنایی با EU AI Act، AISI، NIST AI RMF، Bletchley Declaration و executive order های مرتبط
دانش پایه در یکی از این حوزهها برای ارزیابی dangerous capability مدلها در آن domain
آشنایی با argument های Bostrom، Yudkowsky و functional decision theory — بیشتر برای intuition
نقشه راه و مسیر آموزشی
نقشه راه تبدیل شدن به محقق ایمنی هوش مصنوعی
این مسیر گام به گام شما را از صفر تا حرفهای هدایت میکند.
پایههای ML و ریاضیات alignment
ساخت پایه فنی محکم در ML، deep learning و ریاضیات بهینهسازی — alignment یک حوزه empirical-heavy است و بدون درک عمیق mechanics مدلها نمیشود ایمنی آنها را تضمین کرد.
مبانی AI Alignment و Safety
آشنایی با ادبیات alignment، مسائل کلاسیک (specification gaming، reward hacking، deceptive alignment) و چارچوبهای فکری اصلی از Bostrom تا Christiano و Hubinger.
Mechanistic Interpretability
یادگیری ریورسانجینیرینگ شبکههای عصبی — فهمیدن این که circuit ها، features و induction head ها داخل یک Transformer دقیقاً چگونه محاسبه میکنند. این پرتقاضاترین زیرشاخه alignment در Anthropic و DeepMind است.
Red-Teaming، Evals و Empirical Safety
تخصص در ساخت evaluation suite ها برای dangerous capability ها (cyber، biosecurity، autonomy)، automated red-teaming و model organism research برای کشف failure mode های پنهان.
تحقیق مستقل و انتشار
گذر از مصرفکننده تحقیق به تولیدکننده — انتشار blog post در LessWrong / Alignment Forum، paper در NeurIPS / ICML safety track، مشارکت در MATS، Astra Fellowship یا Anthropic Fellows.
ابزارها و استک فنی
ابزارهایی که هر مهندس AI باید بشناسد، دستهبندیشده بر اساس اولویت
Interpretability Frameworks
کتابخانه استاندارد برای mechanistic interpretability روی Transformer ها — activation caching، hook ها و patching
ابزار جدید NDIF برای interpretability روی مدلهای بزرگ remote — جایگزین مدرن TransformerLens برای frontier models
کتابخانه آموزش و تحلیل Sparse Autoencoders — ابزار اصلی برای feature extraction از activations
Evals و Red-Teaming
framework رسمی UK AI Security Institute برای نوشتن capability eval ها — استاندارد جدید industry
Training و Alignment
کتابخانه Hugging Face برای RLHF، DPO و PPO روی LLM ها — استاندارد آموزش alignment
Datasets و Benchmarks
dataset مرجع برای human feedback آموزش helpful/harmless — معیار academic در alignment
benchmark سنجش دانش خطرناک مدل (biosecurity، cyber، CBRN) — استاندارد frontier evaluation
مسیر پیشرفت شغلی
از جونیور تا Staff Engineer — چه مهارتهایی نیاز دارید و چه درآمدی انتظار داشته باشید
Research Engineer / Resident
۰ تا ۲ سال
~$220K
میانگین سالانه (آمریکا)
اجرای آزمایشهای alignment طراحیشده توسط محقق ارشد، نوشتن eval ها، debug کردن training runs و تولید replication studies. ورود معمولاً از Anthropic Fellows یا MATS.
AI Safety Researcher (Mid)
۲ تا ۵ سال
~$360K
میانگین سالانه (آمریکا)
تعریف agenda تحقیقاتی کوچک خود، رهبری ۱ تا ۲ پروژه، co-author مقالات NeurIPS / ICML safety track، مشارکت در RSP (Responsible Scaling Policy) و model card.
Senior / Staff Safety Researcher
۵ تا ۸ سال
~$550K
میانگین سالانه (آمریکا)
رهبری team کامل interpretability یا alignment، تعریف safety case برای frontier model، co-design با policy team برای commitment های دولتی (UK AISI، US AISI).
Principal / Head of Alignment
۸+ سال
~$850K
میانگین سالانه (آمریکا)
تعریف کل جهت alignment یک frontier lab، تعامل مستقیم با CEO و board، رهبری ۳۰+ نفر، نماینده شرکت در Bletchley، Seoul و سایر AI Safety Summits.
چالشها و جنبههای منفی
واقعیتهایی که کمتر در آگهیهای شغلی میبینید — قبل از ورود بدانید
موضوع پژوهشی غیرعلمی به نظر میرسد
تحقیقاتیبسیاری از مسائل safety hypothetical هستند — مثلاً deceptive alignment هنوز در مدلهای فعلی بهوضوح دیده نشده. باید با rigor empirical روی مسائل کار کنید بدون این که در سوء برداشت 'speculative' بیفتید.
Tension با تیم capability
شرکت بزرگدر یک frontier lab، تیم capability میخواهد سریعتر ship کند، تیم safety میخواهد قبل از release evidence جمع کند. مدیریت این tension و حفظ collaboration یکی از چالشهای روزانه است.
compute محدود برای آزمایش
استارتاپآزمایشهای alignment نیاز به GPU بیشتر دارند چون باید روی مدلهای بزرگ تکرار شوند. در استارتاپ یا academia این یک bottleneck جدی است که خلاقیت در experiment design را الزامی میکند.
سنجش success دشوار است
تحقیقاتیچطور میفهمید مدل واقعاً aligned است یا فقط ظاهر aligned دارد؟ مشکل deceptive alignment یعنی evaluation بهتنهایی کافی نیست — این مشکل بنیادین در methodology field است.
فشار رسانهای و عمومی
عمومینقشهای safety زیر ذرهبین رسانه و policymaker قرار میگیرند. هر statement عمومی شما میتواند به headline تبدیل شود یا توسط AI doomer ها/anti-doomer ها سوءاستفاده شود.
burn-out از anxiety موضوع
عمومیکار روی existential risk و failure mode های جدی میتواند روانی فرسایشی باشد. بسیاری از senior researcher ها mental health و work-life balance را بهعنوان challenge اصلی نام میبرند.
حقوق و بازار کار جهانی
حقوق جهانی محقق ایمنی هوش مصنوعی
میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف
| کشور | میانه | ارز |
|---|---|---|
🇯🇵ژاپن | ¥24,000,000 | JPY |
🇦🇪امارات | AED 950,000 | AED |
🇺🇸آمریکا | $550,000 | USD |
🇨🇦کانادا | CA$310,000 | CAD |
🇦🇺استرالیا | A$270,000 | AUD |
🇬🇧انگلستان | £250,000 | GBP |
🇨🇭سوئیس | CHF 240,000 | CHF |
🇸🇬سنگاپور | SGD 240,000 | SGD |
🇩🇪آلمان | €175,000 | EUR |
🇳🇱هلند | €145,000 | EUR |
* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شدهاند.
چگونه از صفر شروع کنیم
برنامه گامبهگام برای ورود به مهندسی هوش مصنوعی
ماه ۱: AI Safety Fundamentals course
دوره BlueDot Impact AI Safety Fundamentals را به طور کامل بگذرانید — این standard entry point در field است.
ماه ۲: ARENA Sprint
ARENA chapter های mechanistic interpretability و RLHF را با coding انجام دهید. این intensive coding bootcamp به سبک alignment است.
ماه ۳: Replication یک پاپر
یک paper interpretability را replicate کنید (مثلاً Induction Heads یا Toy Models of Superposition) و نتایج را در یک blog post منتشر کنید.
ماه ۴: مشارکت در یک پروژه open-source
به TransformerLens، SAELens، Inspect AI یا یک پروژه آلیامنت دیگر contribute کنید. هدف: ایجاد شبکه و reputation.
ماه ۵: نوشتن Alignment Forum post
یک ایده یا تحلیل اصلی خودتان را در Alignment Forum منتشر کنید — feedback از community جدیترین مرحله ورود است.
ماه ۶: Apply به MATS، Astra، یا Anthropic Fellows
با portfolio (Inspect eval، interpretability repro، AF post) به سه برنامه ورودی اصلی apply کنید.
پروژههای پیشنهادی برای رزومه
Replication یک پیپر کلاسیک Interpretability
مبتدییک paper کوتاه مثل 'A Mathematical Framework for Transformer Circuits' یا 'Induction Heads' را روی GPT-2 Small replicate کنید و نتایج را در یک Jupyter notebook با visualization منتشر کنید.
Eval Suite سفارشی برای یک Dangerous Capability
متوسطبا Inspect AI یک eval برای یک capability خاص (مثل sandbagging یا situational awareness) بنویسید، روی Claude، GPT-4o و Llama اجرا کنید و گزارش مقایسهای منتشر کنید.
Sparse Autoencoder روی GPT-2 Medium
پیشرفتهیک SAE روی activation های یک layer از GPT-2 Medium آموزش دهید، feature های مهم را پیدا کنید و circuit سادهای را با activation patching tease apart کنید.
Red-Team Report روی یک Production Chatbot
متوسطیک محصول production (مثلاً یک chatbot شرکتی) را با Garak و prompt های دستی red-team کنید، failure mode ها را دستهبندی و mitigation پیشنهاد دهید — مثل report واقعی Anthropic Trust & Safety.
Model Organism of Deceptive Alignment
پیشرفتهیک مدل کوچک را fine-tune کنید که در شرایط training یک رفتار و در deployment رفتار دیگری نشان دهد (الهام از Sleeper Agents Anthropic) و سعی کنید با probing این behavior را تشخیص دهید.
مثالهای واقعی و Case Studies
داستانهای واقعی از مهندسانی که در این حوزه تأثیرگذار بودهاند
PhD از UC Berkeley زیر نظر Umesh Vazirani. بنیانگذار تیم Alignment در OpenAI و سپس Alignment Research Center (ARC). در ۲۰۲۴ به عنوان Head of AI Safety در US AI Safety Institute (NIST) منصوب شد.
ابداعکننده RLHF در پیپر معروف 'Deep RL from Human Preferences' (۲۰۱۷) — تکنیکی که هسته آموزش ChatGPT، Claude و Gemini است. توسعه Iterated Distillation and Amplification (IDA) بهعنوان روش scalable oversight. مسئول طراحی METR task suite برای ارزیابی autonomy.
تأثیرگذارترین کارهای Christiano هنوز ۱۰ سال پیش بهعنوان پروژههای 'فلسفی' دیده میشدند. سرمایهگذاری بر روی مسائل که هنوز mainstream نیستند میتواند ۵ تا ۱۰ سال بعد payoff عظیم بدهد.
بدون مدرک رسمی دانشگاهی! خودآموخته شروع به کار با شبکههای عصبی کرد، در Google Brain با تیم Distill همکاری کرد و سپس به Anthropic به عنوان co-founder و lead interpretability پیوست.
بنیانگذار حوزه mechanistic interpretability مدرن از طریق سری Transformer Circuits در Anthropic. اولین کسی که circuit های قابل فهم را در شبکههای convolutional شناسایی کرد. در ۲۰۲۴ با scaling SAE روی Claude 3 Sonnet میلیونها feature قابل تفسیر کشف شد — breakthrough تاریخی.
اولا، نبود مدرک دانشگاهی مانع موفقیت در alignment نیست. ثانیا، communication علمی با کیفیت بالا (مثل Distill و Transformer Circuits) خود یک contribution علمی بنیادین است.
PhD از Australian National University در reinforcement learning. ۸ سال کار در DeepMind، سپس co-lead تیم Superalignment در OpenAI. در May ۲۰۲۴ از OpenAI استعفا داد و به Anthropic پیوست تا تیم alignment science را رهبری کند.
یکی از پیشگامان scalable oversight و reward modeling در عمل. مسئول معماری RLHF در InstructGPT و GPT-4. استعفای عمومی او از OpenAI و نقد سیاستهای safety این شرکت یکی از important ترین رویدادهای industry در ۲۰۲۴ بود.
گاهی integrity حرفهای اهمیت بیشتری از موقعیت دارد. Leike نشان داد که safety researcher باید آماده باشد حتی از قدرتمندترین موقعیتها کنار برود اگر sense میکند کار alignment جدی گرفته نمیشود.
نمونه آگهی استخدام واقعی + تحلیل
یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش
Research Engineer / Research Scientist, Alignment Science
تحلیل نیازمندیها
Significant ML engineering experience — comfortable training and fine-tuning large language models
تجربه عملی training مدلهای large-scale لازم است. نه فقط fine-tune ساده — باید با FSDP، gradient checkpointing و infrastructure GPU/TPU خود را راحت کنید. اگر فقط Hugging Face Trainer استفاده کردهاید، کافی نیست.
ضروریStrong PyTorch skills, with deep understanding of transformer internals
نه فقط استفاده از nn.Transformer بلکه توانایی نوشتن attention از صفر، hook gradient و debug کردن numerical issue. ARENA chapter Transformer From Scratch دقیقاً این پایه را میسازد.
ضروریGenuine concern about AI safety and risks from advanced models
این شرط narrative نیست — در مصاحبهها واقعاً تست میشود. باید بتوانید درباره threat model مدلهای آینده، خطرات agentic AI و چرا alignment مسئله مهم است صحبت کنید. مطالعه Bostrom، Christiano و Cotra ضروری است.
ضروریExperience leading or contributing to ML research projects
نیازی به PhD نیست اما باید evidence نشان دهید که میتوانید یک پروژه research را از hypothesis تا writeup ببرید. ARENA capstone، MATS project یا AF post معیار قابل قبولی است.
مهمFamiliarity with RLHF, reward modeling, or scalable oversight approaches
Reading کارهای Christiano روی IDA، Bowman روی debate، و InstructGPT paper. اگر TRL استفاده کردهاید برای DPO/PPO، نشان دهنده هم familiarity هم coding chops است.
مهمMechanistic interpretability or model evaluation background
اگر این background را ندارید، میتوانید از زاویه scalable oversight یا RLHF وارد شوید. ولی interpretability پرتقاضاترین track در Anthropic است در ۲۰۲۶.
مفیدتحلیل مسئولیتها
Design and run empirical alignment experiments on Claude and other frontier models
هسته کار — طراحی experimental setup که سوال alignment مشخصی را تست میکند، اجرای آن روی مدلهای frontier (با access داخلی) و تحلیل نتایج. ابتدا متوجه میشوید چقدر iteration time مهم است.
Contribute to Anthropic's Responsible Scaling Policy and pre-deployment evaluations
نتایج research شما مستقیماً وارد سند رسمی release میشود. این یعنی responsibility بالا — اگر eval شما imperfect باشد، میتواند روی تصمیم release frontier model اثر بگذارد.
Publish research on Alignment Forum and academic venues
Anthropic انتشار را بهشدت تشویق میکند — بخش بزرگی از کار شما public خواهد بود. این مزیت بزرگ نسبت به فضای closed-source مثل برخی تیمهای Google است.
Collaborate with policy team on engagement with AISI and other government bodies
بخش رو به رشد کار — توضیح technical نتایج به audience policy، participation در governmental briefing و contribute به استانداردهای international.
نتیجهگیری کلی
Anthropic روی Alignment Science با یک combination نادر استخدام میکند: ML engineering chops محکم + intellectual seriousness درباره AI risk + توانایی research independent. اگر در یکی از این سه ضعف دارید، روی آن متمرکز شوید قبل از apply. portfolio با Inspect eval، interpretability replication و AF post جدی، شانس شما را بهمراتب بیشتر میکند تا فقط یک رزومه عالی.
آینده و روندها
پیشبینی ۵–۱۰ ساله و مهارتهایی که باید یاد بگیرید
تقاضا برای AI Safety researcher بین ۲۰۲۴ تا ۲۰۳۰ بیش از ۵۰۰٪ رشد میکند — از حدود ۸۰۰ نفر در frontier labs به بیش از ۵۰۰۰ نفر در labs، AISI ها و enterprise
منبع: 80,000 Hours AI Safety Career Review 2025 / GovAI Workforce Report
مهارتهای نوظهور که باید یاد بگیرید
پیشبینیهای آینده
هر frontier lab بایستی pre-deployment eval توسط AISI انجام دهد — این به استاندارد regulatory در UK، US، EU و Singapore تبدیل میشود
Mechanistic Interpretability از research lab وارد production میشود — feature steering در Claude، GPT و Gemini به user-facing tool تبدیل میشود
اولین model release با evidence رسمی dangerous capability ممنوع میشود یا با constraint های شدید release میشود — case test اصلی RSP ها
هر شرکت Fortune 500 که LLM بهصورت deep استفاده میکند، حداقل یک in-house AI safety researcher خواهد داشت — مشابه CISO در دهه ۲۰۱۰
ریسک اصلی شاخهای شدن field است: capability ها سریعتر از safety scale میکنند، و اگر یک frontier lab برای سود رقابتی RSP خود را رعایت نکند، فشار بر بقیه برای race to the bottom زیاد میشود. ریسک دیگر این است که AI safety به zone فقط elite تبدیل شود — اگر فقط ۵ frontier lab نیرو جذب کنند و academic field کوچک بماند، diversity پژوهشی از بین میرود. در سطح فردی، burn-out و existential anxiety از موضوع کار باعث میشود بسیاری بعد از ۳-۴ سال field را ترک کنند.
ویدیوهای آموزشی
یک روز در زندگی یک AI Safety Researcher
ویدیوهای واقعی از متخصصان این حوزه که روزانه چه کارهایی انجام میدهند


