🧪
رتبه ۴۸ از ۱۰رشد ۳۵.۲% سالانه

مهندس داده‌های سنتتیک

Synthetic Data Engineer

مهندس داده‌های سنتتیک (Synthetic Data Engineer) متخصصی است که با ابزارهای generative AI، GAN ها، diffusion models و LLM ها داده‌های مصنوعی با کیفیت بالا می‌سازد تا کمبود داده واقعی، محدودیت‌های privacy (GDPR/HIPAA) و bias در دیتاست‌ها را حل کند. این نقش در ۲۰۲۶ به یکی از پرتقاضاترین تخصص‌های data science تبدیل شده — Gartner پیش‌بینی می‌کند تا ۲۰۳۰ بیش از ۶۰٪ داده‌های مورد استفاده برای آموزش مدل‌های AI به‌صورت synthetic تولید شوند. خودروسازان autonomous، فین‌تک ها و healthcare از این داده‌ها برای آموزش مدل‌ها بدون نقض حریم خصوصی استفاده می‌کنند و حقوق ارشد در ایالات متحده به ۱۸۰هزار+ دلار می‌رسد.

Generative ModelsGANs/DiffusionPrivacy (DP)Statistical ValidationPython/PyTorch

مقدمه و تعریف شغل

مهندس داده‌های سنتتیک (Synthetic Data Engineer) متخصصی است که با استفاده از مدل‌های generative AI (شامل GAN، VAE، Diffusion Model و LLM) داده‌های مصنوعی واقع‌نما تولید می‌کند که خواص آماری داده‌های real را حفظ می‌کنند اما هیچ اطلاعات فردی را افشا نمی‌سازند. این نقش در تقاطع data engineering، generative modeling، privacy engineering و domain expertise قرار دارد و کلید حل سه مشکل کلیدی مدرن است: کمبود داده، نقض privacy، و bias دیتاست‌ها.

تا حدود ۲۰۱۸، تولید داده synthetic عمدتاً به روش‌های آماری ساده (مثل SMOTE برای oversampling یا rule-based generation) محدود می‌شد. ظهور GAN ها در ۲۰۱۴ و سپس CTGAN در ۲۰۱۹ (از MIT با کتابخانه SDV) انقلابی در این حوزه ایجاد کرد. با ورود diffusion model ها در ۲۰۲۰ و قدرت گرفتن LLM ها از ۲۰۲۲، امروز می‌توان داده synthetic در مقیاس و کیفیتی تولید کرد که از داده‌های real قابل تشخیص نباشد. در ۲۰۲۶، Gartner پیش‌بینی می‌کند که تا ۲۰۳۰ بیش از ۶۰٪ داده‌های مورد استفاده برای آموزش AI به‌صورت synthetic تولید شوند — این یعنی تقاضا برای مهندسانی که می‌توانند این داده‌ها را با کیفیت، privacy و utility مناسب تولید کنند انفجاری است.

چه چیزی می‌سازید؟

مثال‌های واقعی از خروجی کار یک مهندس داده‌های سنتتیک

🗂️

دیتاست‌های tabular synthetic برای آموزش مدل بدون نقض privacy

یک بانک می‌خواهد یک دیتاست تراکنشی برای تیم data science داخلی یا شریک خارجی منتشر کند. شما با SDV و CTGAN یک نسخه synthetic می‌سازید که distribution و correlation ها را حفظ می‌کند ولی هیچ مشتری واقعی در آن قابل شناسایی نیست.

🖼️

تصاویر synthetic برای آموزش computer vision در domain با داده کم

یک شرکت medical imaging مثل PathAI با کمبود نمونه‌های نادر سرطان مواجه است. شما با Stable Diffusion و LoRA تصاویر synthetic از این موارد نادر تولید می‌کنید تا مدل تشخیص بهتر آموزش ببیند.

🚗

سناریوهای شبیه‌سازی برای autonomous systems

Waymo و Cruise برای آموزش perception model روی edge case هایی مثل عابر در شب بارانی، با NVIDIA Omniverse Replicator هزاران ساعت ویدیوی synthetic تولید می‌کنند. شما این pipeline ها را طراحی می‌کنید.

🏥

EHR synthetic برای پژوهش پزشکی

MITRE و Synthea دیتاست‌های synthetic EHR منتشر می‌کنند تا محققان بدون نگرانی HIPAA روی آن مدل بسازند. شما نسخه domain-specific این داده‌ها را برای بیمارستان خاص می‌سازید.

⚖️

داده‌های augmented برای حل class imbalance

در یک سیستم fraud detection فقط ۰.۱٪ تراکنش‌ها fraud هستند. شما با Conditional GAN نمونه‌های synthetic fraud اضافی می‌سازید تا مدل بهتر بتواند الگوی تقلب را یاد بگیرد.

🔐

Pipeline های production-ready با Differential Privacy

Apple و Google داده‌های کاربران را با differential privacy جمع‌آوری و synthesize می‌کنند. شما زیرساخت DP-SGD و pipeline تولید را طراحی و مستقر می‌کنید.

تخصص‌های مختلف مهندس داده‌های سنتتیک

این شغل یک عنوان واحد نیست — مسیرهای تخصصی متعددی دارد

📊

داده‌های جدولی synthetic

Tabular Synthetic Data

تخصص در ساختاردهی به داده‌های جدولی structured (مالی، HR، CRM). MOSTLY AI، Hazy و Gretel در این فضا رهبران بازارند. پرتقاضاترین تخصص در fintech و banking.

🎨

تصاویر و ویدیوی synthetic

Synthetic Image & Video

تولید داده تصویری برای computer vision، autonomous driving و medical imaging. شرکت‌هایی مثل Datagen، Synthesis AI و Parallel Domain در این حوزه فعال‌اند.

⚕️

داده‌های پزشکی synthetic

Healthcare Synthetic Data

ساخت EHR، imaging و genomics synthetic برای پژوهش بدون نقض HIPAA. MDClone، Syntegra و Replica Analytics در این فضا برند هستند.

🛡️

تولید با تضمین Privacy

Privacy-Preserving Generation

تخصص در differential privacy، federated learning و secure multi-party computation. در Apple، Google و Meta این تخصص با حقوق ارشد ۲۵۰هزار+ دلار قیمت‌گذاری می‌شود.

🤖

داده شبیه‌سازی و رباتیک

Simulation & Robotics Data

کار با Unity، Unreal و NVIDIA Omniverse برای تولید داده آموزشی برای رباتیک، AV و digital twin. در NVIDIA، Tesla و Boston Dynamics فعال است.

تفاوت با شغل‌های مشابه

کجا این شغل تمام می‌شود و شغل دیگری شروع می‌شود؟

مهندس دادهData Engineer

Data Engineer روی جمع‌آوری، انتقال و ذخیره داده‌های real تمرکز دارد — Airflow، Spark، data warehouse. Synthetic Data Engineer داده تولید می‌کند، نه فقط حرکت می‌دهد. درک عمیق از generative modeling، statistics و privacy لازم است که در نقش data engineering معمولی نیست.

مهندس یادگیری ماشینML Engineer

ML Engineer از داده استفاده می‌کند تا مدل بسازد. Synthetic Data Engineer مدل می‌سازد تا داده تولید کند. این تخصص معکوس است — هدف نهایی data است نه prediction، و معیارهای موفقیت کاملاً متفاوت‌اند (fidelity و privacy به جای accuracy).

مهندس PrivacyPrivacy Engineer

Privacy Engineer روی پیاده‌سازی کنترل‌های امنیتی، رمزنگاری و compliance تمرکز دارد. Synthetic Data Engineer privacy را از دید generative تأمین می‌کند — به جای محافظت از داده‌های real، داده جدیدی می‌سازد که نیاز به محافظت ندارد. دو رویکرد مکمل به یک هدف.

محقق Generative AIGenerative AI Researcher

Generative AI Researcher معماری‌های جدید مدل می‌سازد و paper چاپ می‌کند — هدف نوآوری آکادمیک است. Synthetic Data Engineer از مدل‌های موجود برای حل مسئله تجاری استفاده می‌کند. تمرکز روی product و engineering است نه روی research frontier.

تأثیر در صنایع مختلف

مهندس داده‌های سنتتیک در همه صنایع مشغول به کار است — نه فقط شرکت‌های فناوری

🏥

بهداشت و درمان

تولید EHR synthetic برای پژوهش بدون نقض HIPAA، تصاویر MRI synthetic برای آموزش مدل تشخیص بیماری‌های نادر، تسهیل clinical trial design

🏦

مالی و بانکی

ساخت دیتاست تراکنش synthetic برای تست AML/fraud detection، انتشار داده به شرکای fintech بدون نقض privacy، آموزش credit scoring روی نمونه‌های متعادل

🚗

خودروسازی autonomous

تولید میلیون‌ها سناریوی edge-case (شب بارانی، عابر ناگهانی) که جمع‌آوری در دنیای واقعی غیرممکن یا خطرناک است

🛒

خرده‌فروشی

شبیه‌سازی رفتار مشتری synthetic برای تست A/B در مقیاس، تولید daten محصول مصنوعی برای جستجوی بهتر، personalization بدون نقض حریم خصوصی

📋

بیمه

ساخت سناریوهای claim synthetic برای آموزش fraud detection، شبیه‌سازی پروفایل ریسک برای underwriting models، تست stress portfolio

🛡️

دفاع و امنیت سایبری

تولید log های شبکه synthetic برای آموزش IDS، شبیه‌سازی حملات سایبری برای threat detection، آموزش مدل‌ها بدون افشای زیرساخت واقعی

📈

خرده‌فروشی و دیجیتال مارکتینگ

ساخت کاربران synthetic برای تست personalization، شبیه‌سازی سفر مشتری برای recommendation engine، A/B testing بدون نیاز به ترافیک واقعی

🎓

آموزش و پژوهش آکادمیک

انتشار دیتاست‌های synthetic مفتوح برای پژوهش (مثل Synthea)، آموزش دانشجویان روی داده واقع‌نما بدون نگرانی privacy، reproducible research

تصورات غلط رایج

قبل از تصمیم‌گیری، این باورهای اشتباه را بشناسید

داده synthetic فقط نسخه noisy داده واقعی است

مدل‌های generative مدرن مثل CTGAN و diffusion models distribution مشترک متغیرها را یاد می‌گیرند و سپس نمونه‌های جدید با همان آمار اما کاملاً متفاوت با نمونه‌های real تولید می‌کنند. این به‌مراتب پیچیده‌تر از noise injection است.

اگر داده synthetic باشد، privacy خودکار تأمین می‌شود

یک مدل generative می‌تواند نمونه‌های آموزشی را به خاطر بسپارد و آن‌ها را در خروجی بازتولید کند (memorization attack). تضمین privacy نیاز به Differential Privacy یا تحلیل membership inference دارد — نه فقط synthetic بودن.

داده synthetic می‌تواند کاملاً جایگزین داده واقعی شود

در اکثر موارد synthetic data مکمل real data است، نه جایگزین. مدل‌ها برای ارزیابی نهایی همیشه به real holdout نیاز دارند. synthetic بهترین کاربرد را برای augmentation، testing و sharing دارد.

هرکس Python بلد است می‌تواند داده synthetic بسازد

اجرای SDV با چند خط کد آسان است، اما تنظیم hyperparameter، انتخاب synthesizer مناسب، ارزیابی fidelity و privacy، و دیباگ mode collapse نیاز به سال‌ها تجربه دارد. تفاوت بین prototype و production عمیق است.

این حوزه فقط برای شرکت‌های بزرگ است

ابزارهای متن‌باز مثل SDV، Synthea و Diffusers این تکنولوژی را برای استارتاپ‌ها و حتی developer های مستقل قابل دسترس کرده‌اند. بسیاری از شرکت‌های متوسط در حال استخدام synthetic data engineer هستند.

یک روز کاری واقعی

در هر سطح روز کاری چه شکلی است؟

جونیور (۰–۲ سال)

بیشتر وقت در حال اجرای synthesizer های آماده، تحلیل نتایج و یادگیری ابزارهاست. کارهای مشخص از سمت ارشد می‌رسد و خروجی مستندسازی می‌شود.

  • صبح: standup ۱۵ دقیقه‌ای + بررسی نتایج اجرای شبانه synthesizer
  • بلاک اول: اجرای CTGAN روی یک دیتاست جدید و تنظیم hyperparameter اولیه
  • بعد از ناهار: محاسبه SDMetrics گزارش‌های fidelity برای ارشد
  • عصر: نوشتن notebook مستند برای داده تولید‌شده و رفع باگ‌های pipeline
  • پایان روز: مطالعه paper یا tutorial درباره diffusion models

میانی (۲–۵ سال)

تعادل بین کدنویسی، تصمیم‌های فنی و ارتباط با تیم product و compliance. مسئولیت یک خط محصول synthetic data را بر عهده دارید.

  • صبح: بررسی dashboard کیفیت داده‌های synthetic در production
  • جلسه با تیم حقوقی: بررسی privacy budget برای یک use case جدید
  • بلاک عمیق: fine-tune یک diffusion model روی domain جدید و تنظیم DP-SGD
  • بعد از ناهار: code review برای جونیورها + مشاوره فنی
  • عصر: نوشتن RFC برای انتخاب بین SDV و یک solution سفارشی

ارشد (۵+ سال)

تمرکز روی استراتژی، معماری و alignment سازمانی. کدنویسی به ضرورت‌های خاص محدود می‌شود اما تصمیم‌هایتان همه شرکت را تحت تأثیر قرار می‌دهد.

  • صبح: بررسی roadmap synthetic data با VP Data و VP Engineering
  • جلسه با رگولاتور یا compliance: ارائه گزارش privacy risk سال‌انه
  • بلاک تحقیقاتی: مطالعه paper های NeurIPS و ارزیابی قابلیت استفاده در شرکت
  • بعد از ناهار: منتورینگ ۱:۱ با میانی‌ها + بررسی RFC های فنی
  • عصر: نوشتن postmortem برای یک incident memorization و آپدیت policy داخلی

مسئولیت‌ها و وظایف

مسئولیت‌های اصلی

وظایف روزانه و مهارت‌های مورد نیاز در این شغل

فنی
  • طراحی و پیاده‌سازی pipeline های تولید داده synthetic برای جایگزینی یا تقویت دیتاست‌های real
  • آموزش و fine-tune مدل‌های generative (GAN، VAE، Diffusion) متناسب با domain خاص شرکت
  • ارزیابی fidelity داده synthetic با معیارهای آماری و utility تست‌های TRTS و TSTR
  • پیاده‌سازی differential privacy و سایر تکنیک‌های privacy-preserving generation برای compliance
  • تحلیل ریسک re-identification و membership inference attack در داده‌های منتشرشده
  • استقرار pipeline ها در محیط production با Docker، FastAPI و سیستم‌های مانیتورینگ کیفیت
مهارت نرم
  • همکاری با تیم‌های legal و compliance برای اطمینان از انطباق با GDPR، HIPAA و قوانین داخلی
  • آموزش data scientist ها و product manager ها درباره محدودیت‌ها و کاربردهای صحیح داده synthetic

مهارت‌های مورد نیاز

مهارت‌های فنی، نرم و حوزه‌ای که یک مهندس داده‌های سنتتیک موفق به آن‌ها نیاز دارد

مهارت‌های فنی

Python علمیضروری

تسلط بر NumPy، pandas، scipy و scikit-learn — همراه با نوشتن کد production-grade

PyTorchضروری

فریم‌ورک اصلی برای پیاده‌سازی GAN، VAE و diffusion models سفارشی

Generative Modelsضروری

درک عمیق GAN، VAE، normalizing flows و diffusion models — نه فقط استفاده بلکه دیباگ و بهبود

Statistics & Probabilityضروری

آمار توصیفی، استنباطی و bayesian — برای ارزیابی fidelity و طراحی validation

Differential Privacyضروری

درک formalism (epsilon، delta)، DP-SGD، composition theorems و trade-off با utility

SDV و Gretelمهم

تسلط بر کتابخانه‌های اصلی synthetic data tabular — workflow و trade-off ها

Docker و MLOpsمهم

بسته‌بندی pipeline ها برای استقرار، مانیتورینگ و versioning داده

مهارت‌های Domain و Privacy

Privacy Engineeringضروری

آشنایی با membership inference، model inversion و attacks بر مدل‌های generative

Regulatory Knowledgeمهم

درک GDPR، HIPAA، CCPA و چگونگی تأثیر آن‌ها بر طراحی pipeline

Domain Expertiseمهم

آشنایی با ساختار داده‌های یک حوزه خاص (healthcare، finance، AV) — برای ارزیابی domain validity

Statistical Validationضروری

طراحی معیارهای fidelity و utility مناسب با use case و دفاع از آن‌ها

Bias Detectionمهم

شناسایی bias در داده real و کنترل آن در داده synthetic — مسئله fairness

مهارت‌های نرم

ارتباط با Complianceضروری

توضیح privacy guarantees به تیم حقوقی و رگولاتور با زبان قابل فهم آن‌ها

تفکر انتقادیضروری

ارزیابی صادقانه محدودیت‌های synthetic data و نه‌گفتن به استفاده‌های نادرست

Stakeholder Educationمهم

آموزش data scientist ها و product manager ها درباره کاربردهای صحیح synthetic data

Documentationمهم

نوشتن data sheet، privacy report و model card برای هر دیتاست منتشرشده

یادگیری مداوممهم

حوزه generative هر چند ماه paper جدید دارد — همگام ماندن ضروری است

ضروری — بدون آن نمی‌توان وارد بازار کار شدمهم — تفاوت بین جونیور و میانیمفید — مزیت رقابتی

نقشه راه و مسیر آموزشی

نقشه راه تبدیل شدن به مهندس داده‌های سنتتیک

این مسیر گام به گام شما را از صفر تا حرفه‌ای هدایت می‌کند.

1

پایه‌های ریاضی، آمار و Python

⏱️ ۳ تا ۴ ماه

ساخت پایه قوی در آمار، probability distributions و Python علمی — fundament هر مهندس داده سنتتیک

Python (NumPy, pandas, scipy)Probability & StatisticsLinear AlgebraBayesian StatisticsData Profiling & EDAGit & GitHubJupyter & Reproducible Notebooks
2

Machine Learning و Deep Learning

⏱️ ۳ تا ۴ ماه

یادگیری ML کلاسیک، شبکه‌های عصبی و PyTorch — پیش‌نیاز مستقیم برای کار با مدل‌های generative

Scikit-learnPyTorchNeural NetworksCNN & RNNLoss Functions & OptimizationEmbeddings & Representation LearningModel Evaluation
3

Generative Models — GAN، VAE، Diffusion، LLM

⏱️ ۴ تا ۵ ماه

تخصصی شدن در خانواده مدل‌های مولد که قلب synthetic data generation هستند — از GAN های کلاسیک تا diffusion model های مدرن

GANs (DCGAN, StyleGAN, CTGAN)Variational Autoencoders (VAEs)Diffusion Models (DDPM, Stable Diffusion)Tabular Data Synthesis (CTGAN, TVAE)Conditional GenerationLLM-based SynthesisMode Collapse & Training Stability
4

Privacy، Differential Privacy و Validation

⏱️ ۳ تا ۴ ماه

یادگیری privacy-preserving generation و معیارهای fidelity/utility — تفاوت مهندس professional و آماتور همین لایه است

Differential Privacy (DP-SGD)k-Anonymity & l-DiversityMembership Inference AttacksStatistical Similarity MetricsUtility Testing (TRTS, TSTR)GDPR & HIPAA ComplianceRe-identification Risk Analysis
5

Production Pipelines، Domain Specialization و MLOps

⏱️ مداوm و حین کار

ساخت pipeline های تولیدی برای synthetic data در domain خاص (healthcare، fintech، autonomous، CV) و یکپارچه‌سازی با MLOps

Domain Adaptation (Medical, Finance, AV)Simulation Engines (Unity, NVIDIA Omniverse)Synthetic Image/Video PipelinesDocker & FastAPI ServingData Versioning (DVC, LakeFS)Quality Monitoring at ScaleStakeholder Communication

ابزارها و استک فنی

ابزارهایی که هر مهندس AI باید بشناسد، دسته‌بندی‌شده بر اساس اولویت

فریم‌ورک‌های Generative Modeling

PyTorch

اصلی‌ترین فریم‌ورک برای پیاده‌سازی GAN ها، VAE ها و diffusion model های سفارشی

ضروری
Hugging Face Diffusers

کتابخانه استاندارد برای کار با Stable Diffusion و خانواده diffusion model ها

ضروری
TensorFlow

فریم‌ورک Google — هنوز در برخی pipeline های enterprise و TFP رایج است

مفید
JAX

برای تحقیقات پیشرفته در diffusion و score-based generative modeling

پیشرفته

پلتفرم‌های Synthetic Data

Synthetic Data Vault (SDV)

محبوب‌ترین کتابخانه open-source برای synthesize داده‌های tabular و relational (MIT)

ضروری
Gretel.ai

پلتفرم تجاری برای synthetic data با تمرکز روی privacy و LLM-based synthesis

ضروری
Mostly AI

پلتفرم مستقر در اروپا، تخصص در GDPR-compliant tabular synthesis

مفید
NVIDIA Omniverse Replicator

موتور simulation برای تولید داده synthetic تصویری/3D برای computer vision و robotics

پیشرفته

Privacy و Validation

Opacus

کتابخانه Meta برای آموزش مدل‌های PyTorch با differential privacy

ضروری
TensorFlow Privacy

ابزار Google برای DP-SGD و privacy-preserving training

مفید
SDMetrics

ابزار رسمی SDV برای ارزیابی fidelity، utility و privacy داده‌های synthetic

ضروری
YData Profiling

گزارش‌های مقایسه‌ای real vs synthetic data — استاندارد در quality assessment

مفید

MLOps و Production

Docker

کانتینرسازی pipeline های تولید synthetic data برای استقرار یکنواخت

ضروری
DVC (Data Version Control)

نسخه‌گذاری دیتاست‌های synthetic و real در کنار کد

مفید
MLflow

ردیابی آزمایش‌ها، hyperparameter و مدل‌های generative

مفید
Weights & Biases

مصورسازی training run های GAN/diffusion و مقایسه run ها

مفید
ضروری — باید یاد بگیریدمفید — ارزش یادگیری داردپیشرفته — برای سطوح ارشد

مسیر پیشرفت شغلی

از جونیور تا Staff Engineer — چه مهارت‌هایی نیاز دارید و چه درآمدی انتظار داشته باشید

Synthetic Data Engineer جونیور

۰ تا ۲ سال

~$85K

میانگین سالانه (آمریکا)

کار با SDV و Gretel، اجرای synthesizer های آماده، نوشتن validation script، کمک به تیم در data prep

PythonPandasSDVStatistical TestingJupyter

Synthetic Data Engineer میانی

۲ تا ۵ سال

~$135K

میانگین سالانه (آمریکا)

طراحی pipeline سفارشی، fine-tune مدل‌های generative، پیاده‌سازی differential privacy، رهبری پروژه‌های متوسط

PyTorchGANs/VAEsDifferential PrivacyDockerDomain Knowledge

Synthetic Data Engineer ارشد

۵ تا ۸ سال

~$185K

میانگین سالانه (آمریکا)

معماری سیستم‌های synthetic data در مقیاس، تعامل با حقوقی/compliance، منتورینگ تیم، تصمیم‌گیری روی trade-off های fidelity/privacy

ArchitectureDiffusion ModelsPrivacy EngineeringCross-team LeadershipCloud (AWS/GCP)

Principal / Staff Synthetic Data Engineer

۸+ سال

~$265K

میانگین سالانه (آمریکا)

تعریف استراتژی synthetic data شرکت، تعامل با C-level و رگولاتورها، رهبری تحقیقات داخلی، تأسیس استانداردهای صنعتی

Technical StrategyResearch DirectionRegulatory KnowledgeOrg DesignVendor Evaluation

چالش‌ها و جنبه‌های منفی

واقعیت‌هایی که کمتر در آگهی‌های شغلی می‌بینید — قبل از ورود بدانید

Trade-off بین Privacy و Utility

عمومی

هرچه privacy budget (epsilon) سخت‌گیرانه‌تر، داده synthetic کمتر کاربردی است. پیدا کردن نقطه تعادل برای هر use case یک کار هنری-مهندسی است که نیاز به مذاکره با تیم محصول و compliance دارد.

Mode Collapse و کیفیت پایین خروجی

تحقیقاتی

GAN ها مستعد mode collapse هستند — مدل فقط چند الگو را یاد می‌گیرد و تنوع real data را از دست می‌دهد. دیباگ این مشکل ساعت‌ها زمان می‌برد و گاهی نیاز به بازطراحی معماری دارد.

مقاومت تیم data science در مقابل synthetic data

شرکت بزرگ

بسیاری از data scientist ها به داده synthetic بدبین‌اند و آن را «داده تقلبی» می‌دانند. متقاعد کردن آن‌ها به استفاده از این داده‌ها برای augmentation یا testing نیاز به آموزش و اعتمادسازی طولانی دارد.

Validation در domain با ground truth کم

تحقیقاتی

در حوزه‌هایی مثل clinical trial یا fraud detection که داده ground truth کم است، اثبات این‌که داده synthetic «به اندازه کافی خوب» است بسیار دشوار است. این چالش گاهی پروژه‌ها را ماه‌ها به تأخیر می‌اندازد.

هزینه محاسباتی آموزش مدل‌های Generative

استارتاپ

آموزش یک diffusion model روی دیتاست بزرگ می‌تواند هزاران دلار GPU compute هزینه داشته باشد. در استارتاپ‌ها این هزینه یک محدودیت جدی است و شما باید بین cost و quality choose کنید.

Adversarial Memorization و Privacy Leak

عمومی

حتی با differential privacy، یک attacker با membership inference attack می‌تواند گاهی نمونه‌های آموزشی را شناسایی کند. ساختن defense قابل اعتماد و document کردن آن برای رگولاتور چالش دائمی است.

حقوق و بازار کار جهانی

حقوق جهانی مهندس داده‌های سنتتیک

میانگین حقوق سالانه بر اساس تجربه در کشورهای مختلف

کشورمیانهارز
🇮🇳هند
₹3,200,000INR
🇦🇪امارات
AED 270,000AED
🇺🇸آمریکا
$195,000USD
🇨🇭سوئیس
CHF 160,000CHF
🇨🇦کانادا
CA$155,000CAD
🇸🇬سنگاپور
SGD 155,000SGD
🇦🇺استرالیا
A$145,000AUD
🇬🇧انگلستان
£110,000GBP
🇩🇪آلمان
€102,000EUR
🇳🇱هلند
€95,000EUR

* ارقام سالانه و تقریبی هستند و بر اساس میانگین بازار در سال ۲۰۲۵ محاسبه شده‌اند.

چگونه از صفر شروع کنیم

برنامه گام‌به‌گام برای ورود به مهندسی هوش مصنوعی

ماه ۱: Python و Statistics

Python علمی (NumPy، pandas) و آمار پایه. تمرین EDA روی چند dataset از Kaggle.

ماه ۲: PyTorch و Deep Learning

یادگیری PyTorch و شبکه‌های عصبی پایه. تمرین: یک autoencoder روی MNIST.

ماه ۳: GAN ها و VAE ها

پیاده‌سازی DCGAN و VAE از صفر. تمرین: تولید تصاویر MNIST و Fashion-MNIST synthetic.

ماه ۴: Synthetic Data Vault

کار با SDV روی tabular data. اجرای CTGAN، TVAE و GaussianCopula روی Adult Income.

ماه ۵: Privacy و Validation

Differential Privacy با Opacus. ارزیابی SDMetrics و membership inference test.

ماه ۶: پروژه portfolio و apply

یک پروژه end-to-end (مثل HealthEHR synthetic با DP) روی GitHub. شروع apply.

پروژه‌های پیشنهادی برای رزومه

تولید دیتاست tabular با SDV

مبتدی

یک دیتاست واقعی (مثلاً Adult Income یا Credit Card از Kaggle) را با CTGAN از SDV synthesize کنید و کیفیت آن را با SDMetrics بسنجید.

PythonSDVCTGANSDMetrics
زمان تخمینی: ۱ هفته

ارزیابی Utility با TSTR/TRTS

متوسط

یک classifier روی داده synthetic آموزش دهید و روی داده real تست کنید (TSTR) و برعکس (TRTS). نتایج را گزارش و مقایسه کنید.

Scikit-learnPandasSDVMatplotlib
زمان تخمینی: ۲ هفته

GAN سفارشی برای داده tabular با Differential Privacy

پیشرفته

یک CTGAN را با DP-SGD از Opacus آموزش دهید و trade-off بین privacy budget (epsilon) و کیفیت داده را تحلیل کنید.

PyTorchOpacusCTGANWeights & Biases
زمان تخمینی: ۴ هفته

تولید تصاویر synthetic با Stable Diffusion

متوسط

با Hugging Face Diffusers یک pipeline بسازید که برای یک domain خاص (مثلاً ضایعات پوستی یا اتومبیل از زوایای مختلف) تصاویر مصنوعی تولید کند.

DiffusersPyTorchLoRAControlNet
زمان تخمینی: ۳ هفته

Pipeline تولید synthetic data چندجدولی برای یک شرکت بیمارستانی فرضی

پیشرفته

با SDV HMA یک schema چندجدولی (بیماران، ویزیت‌ها، نسخه‌ها) را synthesize کنید، privacy را با re-identification test بسنجید و در Docker مستقر کنید.

SDV HMAFastAPIDockerPostgreSQLDVC
زمان تخمینی: ۶ هفته

مثال‌های واقعی و Case Studies

داستان‌های واقعی از مهندسانی که در این حوزه تأثیرگذار بوده‌اند

K

Kalyan Veeramachaneni

پیشینه

Principal Research Scientist در MIT و رهبر گروه Data to AI Lab. سال‌هاست روی automated machine learning و privacy-preserving data sharing تحقیق می‌کند.

دستاورد

خالق Synthetic Data Vault (SDV) — کتابخانه open-source MIT که به استاندارد صنعتی برای tabular synthetic data تبدیل شده. شرکت DataCebo را برای تجاری‌سازی SDV تأسیس کرد و میلیون‌ها دانلود از کتابخانه‌اش روی PyPI ثبت شده است.

درس کلیدی

تبدیل پژوهش آکادمیک به محصول قابل استفاده برای صنعت ارزش بسیار بیشتری دارد از چاپ paper به‌تنهایی. Veeramachaneni با ساخت SDV هم به community کمک کرد و هم یک شرکت موفق ساخت — هر دو از یک تخصص.

C

Cynthia Dwork

پیشینه

استاد علوم کامپیوتر در Harvard و Distinguished Scientist در Microsoft Research. دکترا از Cornell و یکی از بنیان‌گذاران تئوری cryptography مدرن.

دستاورد

هم‌مخترع Differential Privacy در ۲۰۰۶ — formalism ریاضی که امروز پایه هر سیستم privacy-preserving است (شامل Apple، Google، US Census). برنده Gödel Prize، Knuth Prize و Dijkstra Prize. کارش پایه تمام synthetic data engineering مدرن است.

درس کلیدی

یک ایده درست در زمان درست می‌تواند یک حوزه را برای دهه‌ها تعریف کند. Dwork نشان داد که ریاضیات بنیادی، حتی وقتی در ابتدا abstract به نظر می‌رسد، می‌تواند به یکی از مهم‌ترین ابزارهای صنعتی تبدیل شود.

I

Ian Goodfellow

پیشینه

دکترا در یادگیری ماشین از Université de Montréal زیر نظر Yoshua Bengio. کار در Google Brain، OpenAI و سپس Director of ML در Apple. در ۲۰۲۲ به DeepMind پیوست.

دستاورد

مخترع Generative Adversarial Networks (GAN) در ۲۰۱۴ — معماری که انقلاب کامل در synthetic data generation ایجاد کرد. paper اصلی GAN با بیش از ۸۰هزار citation یکی از تأثیرگذارترین مقالات تاریخ AI است. نویسنده کتاب Deep Learning (با Bengio و Courville).

درس کلیدی

ایده GAN در یک شب در bar در مونترال شکل گرفت. خلاقیت گاهی از تقاطع چند زمینه و در لحظه‌های غیرمنتظره می‌آید. Goodfellow نشان داد که یک ایده ساده ولی عمیق می‌تواند کل یک حوزه را تغییر دهد.

نمونه آگهی استخدام واقعی + تحلیل

یک آگهی واقعی از شرکت فعال در حال استخدام، با تحلیل هر بخش

Senior Machine Learning Engineer — Synthetic Data

Gretel.aiRemote (آمریکا و کانادا)2025-09
مشاهده آگهی اصلی

تحلیل نیازمندی‌ها

EN

5+ years of experience in machine learning engineering

حداقل ۵ سال تجربه ML engineering. اگر تجربه پایه data science و یک سال تخصصی synthetic data دارید، می‌توانید apply کنید — Gretel به دنبال هر دو ترکیب است.

ضروری
EN

Strong experience with generative models (GANs, VAEs, Diffusion, or LLMs)

نیاز اصلی است. باید بتوانید در مصاحبه paper اصلی GAN و VAE را با جزئیات توضیح دهید و یک پروژه عملی نشان دهید. ساخت یک CTGAN از صفر روی GitHub بهترین شاهد است.

ضروری
EN

Proficiency in Python and PyTorch

تسلط کامل بر PyTorch ضروری است — TensorFlow پذیرفته نمی‌شود. تجربه با distributed training (DDP) امتیاز اضافی است.

ضروری
EN

Experience with Differential Privacy or related privacy-preserving techniques

حتی اگر تجربه production ندارید، خواندن paper اصلی Dwork و کار با Opacus در پروژه شخصی کافی است. در مصاحبه باید بتوانید epsilon و privacy budget را توضیح دهید.

ضروری
EN

Experience deploying ML models in production (Docker, cloud)

Gretel یک پلتفرم cloud-native است. تجربه با AWS یا GCP، Docker و سرویس‌های ML مثل SageMaker لازم است. اگر فقط تجربه research دارید، این gap را باید پر کنید.

مهم
EN

Contributions to open-source projects in ML or data engineering

Gretel ابزارهای open-source خودش دارد. مشارکت در SDV، Diffusers یا Opacus امتیاز بزرگی است — حتی PR کوچک نشان می‌دهد که با ecosystem آشنا هستید.

مفید

تحلیل مسئولیت‌ها

EN

Design and implement state-of-the-art synthetic data generation models

نه فقط استفاده از مدل آماده، بلکه طراحی architecture جدید برای domain خاص. باید با paper های اخیر NeurIPS و ICML همگام باشید.

EN

Develop and evaluate privacy-preserving algorithms

پیاده‌سازی DP-SGD، membership inference defense و طراحی privacy metrics. این کار نیاز به دقت بالا و عمق ریاضی دارد.

EN

Collaborate with product team to translate customer needs into ML solutions

Gretel customers شامل بانک‌ها و healthcare هستند که نیازهای پیچیده compliance دارند. باید بتوانید با غیرفنی‌ها کار کنید و راه‌حل design کنید.

EN

Mentor junior engineers and contribute to engineering culture

نقش ارشد یعنی فقط کد نوشتن نیست. باید تجربه code review، 1:1 mentoring و طراحی hiring rubric داشته باشید.

نتیجه‌گیری کلی

این آگهی نشان می‌دهد Gretel به دنبال ترکیب کمیاب «ML researcher + production engineer + privacy expert» است. اگر این سه بعد را کامل ندارید، روی دو بعد قوی تمرکز کنید و بعد سوم را با پروژه شخصی پر کنید. حقوق این نقش در Gretel معمولاً ۲۰۰هزار+ دلار base است.

آینده و روندها

پیش‌بینی ۵–۱۰ ساله و مهارت‌هایی که باید یاد بگیرید

Gartner پیش‌بینی می‌کند تا ۲۰۳۰ بیش از ۶۰٪ داده‌های مورد استفاده برای آموزش AI به‌صورت synthetic تولید شوند — بازار از ۳۲۳ میلیون دلار در ۲۰۲۳ به بیش از ۲.۱ میلیارد دلار در ۲۰۲۸ خواهد رسید (CAGR ۴۵.۵٪)

منبع: Gartner & MarketsandMarkets Synthetic Data Generation Market Report 2024

مهارت‌های نوظهور که باید یاد بگیرید

LLM-based Synthetic Data GenerationDiffusion Models برای Tabular DataFederated Synthetic Data GenerationPrivacy Auditing با Membership InferenceDomain Adaptation و Sim-to-RealMultimodal Synthetic Data (text + image + tabular)Synthetic Data Marketplaces و Standards

پیش‌بینی‌های آینده

2026

LLM-driven synthetic data generation به استاندارد صنعتی تبدیل می‌شود — GPT و Claude به‌عنوان data augmentation engine استفاده می‌شوند

2027

اتحادیه اروپا چارچوب رسمی برای classification داده synthetic در GDPR ارائه می‌دهد و این بازار را شفاف‌تر می‌کند

2028

Synthetic data marketplace ها (مثل AWS Data Exchange) از داده synthetic compliant پشتیبانی می‌کنند — تبدیل به یک کالای استاندارد

2030

بیش از ۶۰٪ داده‌های آموزشی AI به‌صورت synthetic تولید می‌شوند (Gartner)؛ Synthetic Data Engineer به یکی از ۱۰ شغل پرتقاضای data تبدیل می‌شود

ریسک‌های واقعی

آیا synthetic data به‌تنهایی کافی است؟ نگرانی بزرگ این است که مدل‌هایی که فقط روی synthetic data آموزش ببینند ممکن است در real world عملکرد ضعیفی داشته باشند — مسئله‌ای به نام model collapse. همچنین رگولاتورها هنوز موضع روشنی درباره synthetic data ندارند: آیا داده synthetic یک «داده شخصی» محسوب می‌شود یا نه؟ این ابهام می‌تواند پروژه‌ها را به تأخیر بیندازد. علاوه بر این، حملات membership inference دائماً قوی‌تر می‌شوند و defense ها باید همگام تکامل یابند.

ویدیوهای آموزشی

یک روز در زندگی یک Synthetic Data Engineer

ویدیوهای واقعی از متخصصان این حوزه که روزانه چه کارهایی انجام می‌دهند

برای راهنمایی شخصی‌سازی‌شده مشاوره بگیرید