⚡ NVIDIA SuperPOD Reference Architecture🟢 NVIDIA Certified🔴 AMD Ready🔵 Intel Gaudi

کلاسترهای GPU
سازمانی
برای هوش مصنوعی نسل آینده

زیرساختی با الهام از معماری مرجع NVIDIA DGX SuperPOD، طراحی‌شده برای آموزش مدل‌های بزرگ زبانی، استنتاج در مقیاس و پردازش موازی فشرده — با پشتیبانی از پرچمداران NVIDIA، AMD و Intel.

از ۴ GPU تا چند هزار GPU در یک فابریک InfiniBand یکپارچه — بدون نگرانی از پیکربندی، امنیت یا مقیاس‌پذیری.

۹۹.۹٪
آپ‌تایم تضمینی
<۷۲h
راه‌اندازی سریع
۴۰۰G
InfiniBand NDR
۲۴/۷
پشتیبانی متخصص
NVIDIAGen 4
H100 SXM5
Hopper Architecture
VRAM80 GB HBM3
BF16 Flops989 TFLOPs
NVLink900 GB/s
حداکثر GPU/node۸ GPU
✓ ایده‌آل برای LLM Training
NVIDIA⭐ پرفروش
H200 SXM5
Hopper + HBM3e
VRAM141 GB HBM3e
BF16 Flops989 TFLOPs
Memory BW4.8 TB/s
NVLink BW900 GB/s
✓ بهترین برای Inference
NVIDIA🆕 نسل جدید
B200 / GB200
Blackwell Architecture
VRAM192 GB HBM3e
FP8 Flops9 PFLOPs
Memory BW8 TB/s
NVLink BW1.8 TB/s
✓ پیشرفته‌ترین معماری دنیا
AMDCDNA 3
MI300X
CDNA3 Architecture
VRAM192 GB HBM3
FP16 Flops1.3 PFLOPs
Memory BW5.3 TB/s
ROCm Support✓ کامل
✓ بیشترین حافظه unified
Intel Gaudi 3
Intel Gaudi 3 — گزینه مقرون‌به‌صرفه سازمانی
128 GB HBM2e · 1.8 PFLOPs BF16 · ۸ کارت در هر نود · ROCm & PyTorch Native
استعلام قیمت
⚡ معماری مرجع

الهام‌گرفته ازNVIDIA DGX SuperPOD

معماری SuperPOD استاندارد طلایی صنعت برای ساخت ابرکامپیوترهای هوش مصنوعی است. زیرساخت ما بر اساس همین اصول طراحی شده تا بالاترین کارایی ممکن را ارائه دهد.

لایه‌های معماری SuperPOD

هر لایه وظیفه مشخصی دارد و با لایه‌های مجاور یکپارچه عمل می‌کند

🧠
لایه اپلیکیشن
PyTorch · TensorFlow · JAX · RAPIDS · Triton · vLLM · TensorRT-LLM
☸️
لایه ارکستریشن
Kubernetes · Slurm · NVIDIA Base Command Manager · Run:AI Scheduler
🐳
لایه Container و Runtime
NVIDIA Container Toolkit · Docker · containerd · CUDA 12.x · cuDNN 9
🔗
لایه شبکه فابریک
InfiniBand NDR 400Gbps · NVLink Switch · RDMA · GPUDirect · RoCE v2
💾
لایه ذخیره‌سازی
NVMe All-Flash · WEKA / Lustre / BeeGFS · GPUDirect Storage (GDS) · S3
🖥️
لایه سخت‌افزار (DGX Node)
۸× GPU (H100/H200/B200/MI300X) · ۲× AMD EPYC یا Intel Xeon · ۲TB+ DDR5
۳۲+
نود DGX در یک SuperPOD
۲۵۶+
GPU در یک SuperPOD پایه
۲ExaFLOP
ظرفیت پردازشی H200
۱ ms
تأخیر InfiniBand NDR

پشتیبانی از برندهای پیشرو GPU

🟢
NVIDIA
پیشرو صنعت · CUDA Ecosystem
H100 SXM580GB · Hopper
H200 SXM5141GB · HBM3e
B200 / GB200192GB · Blackwell 🆕
A100 SXM480GB · Ampere
L40S48GB · Ada Lovelace
✓ CUDA · TensorRT · NCCL · NVLink · NVSwitch
🔴
AMD Instinct
ROCm Ecosystem · Open Source
MI300X192GB HBM3 🔥
MI300A128GB · APU
MI250X128GB · CDNA2
MI350Xدر راه است 🆕
✓ ROCm · HIP · Infinity Fabric · xGMI
🔵
Intel Gaudi
OneAPI · مقرون‌به‌صرفه
Gaudi 3128GB HBM2e 🆕
Gaudi 296GB HBM2e
Flex 140/170Inference Edge
✓ OneAPI · OpenCL · PyTorch · IPEX
✦ چرا ما؟

ویژگی‌های کلیدی زیرساخت

هر جنبه از پلتفرم ما برای بیشترین کارایی در workloadهای هوش مصنوعی بهینه شده است.

مقیاس‌پذیری بدون محدودیت

از ۴ GPU شروع کنید و تا هزاران GPU در یک فابریک InfiniBand یکپارچه گسترش دهید. معماری SuperPOD امکان اضافه کردن نود بدون downtime را فراهم می‌کند.

عملکرد بهینه GPU

با تنظیمات پیشرفته CUDA، MIG، NVLink و GPUDirect، بیش از ۹۵٪ بهره‌وری سخت‌افزار را تجربه کنید. پروفایلینگ مستمر با Nsight و DCGM.

امنیت سازمانی

ایزولیشن کامل شبکه، رمزنگاری داده در حال انتقال و سکون، RBAC چندلایه و انطباق با ISO 27001 و SOC2 Type II.

Kubernetes Native

ارکستریشن کامل با Kubernetes، Helm Charts آماده، GPU Device Plugin، و یکپارچه‌سازی با Kubeflow و MLflow برای MLOps.

ذخیره‌سازی All-Flash NVMe

فایل‌سیستم موازی با پهنای باند بیش از ۱۰۰ GB/s، GPUDirect Storage برای انتقال مستقیم داده از دیسک به GPU، بدون CPU در مسیر.

پشتیبانی ۲۴/۷ متخصص

تیم مهندسان سنیور با تخصص GPU Computing، SLA تضمین‌شده زیر ۱۵ دقیقه برای مشکلات حیاتی، و نظارت proactive بر کلاستر.

مانیتورینگ و Observability

داشبورد Grafana جامع، متریک‌های GPU با DCGM Exporter، هشدارهای هوشمند، log aggregation با Loki و tracing با Jaeger.

GPU Time-Slicing و MIG

با Multi-Instance GPU تا ۷ نمونه مستقل از یک H100 بسازید. اشتراک workloadها بدون تداخل، ایده‌آل برای محیط‌های چند‌تیمی.

بهینه‌سازی هزینه

اسپات اینستنس‌های GPU، scheduler هوشمند برای پر کردن ظرفیت خالی، گزارش‌های تفکیک هزینه per-job و توصیه‌های خودکار بهینه‌سازی.

🔧 مشخصات کامل

مشخصات فنی

جزئیات دقیق سخت‌افزار و نرم‌افزار پلتفرم — شفاف و بدون ابهام.

🖥️ مشخصات سخت‌افزاری

GPU (NVIDIA)H100 SXM5 80GB · H200 SXM5 141GB
B200 192GB · GB200 NVL72
GPU (AMD)MI300X 192GB · MI250X 128GB
GPU (Intel)Gaudi 3 128GB · Gaudi 2 96GB
CPU۲× AMD EPYC 9654 / Intel Xeon 8592+
حافظه سیستم۲TB DDR5-4800 ECC
شبکه داخل نودNVLink 4.0 · 900 GB/s
شبکه بین نودیInfiniBand NDR 400Gbps
ذخیره‌سازی NVMe≥ 30TB NVMe PCIe 5.0 per node
ذخیره‌سازی مشترکLustre / BeeGFS · تا ۱۰ PB
توان (per node)۱۰.۲ kW (H100 DGX)

⚙️ مشخصات نرم‌افزاری

سیستم‌عاملUbuntu 22.04 LTS Server
CUDA / ROCmCUDA 12.4 · ROCm 6.x · OneAPI 2024
Container RuntimeNVIDIA Container Toolkit · containerd
ارکستریشنKubernetes 1.30 · Helm 3 · Slurm 23
MLOpsKubeflow · MLflow · Weights & Biases
InferenceTensorRT-LLM · vLLM · Triton Server
مانیتورینگPrometheus · Grafana · DCGM · Loki
امنیتHashiCorp Vault · Falco · OPA Gatekeeper
دسترسیSSH · VPN · JupyterHub · VS Code Server
گواهینامه‌هاISO 27001 · SOC2 · NVIDIA DGX Ready
🚀 کاربردها

موارد استفاده

از آموزش مدل‌های بنیادین تا استنتاج در مقیاس تولید — زیرساخت ما هر workload را پوشش می‌دهد.

🧬

آموزش LLM و Foundation Models

آموزش مدل‌های زبانی بزرگ از GPT-4 scale تا مدل‌های اختصاصی سازمانی. با پشتیبانی از Megatron-LM، DeepSpeed ZeRO-3، FSDP و tensor parallelism روی صدها GPU به‌صورت موازی.

Megatron-LMDeepSpeedFSDPNeMo

Inference در مقیاس تولید

ارائه مدل‌های AI با تأخیر زیر ۱۰ms و throughput بالا در محیط production. با TensorRT-LLM، vLLM و Triton Inference Server — مقیاس‌پذیر به‌صورت خودکار.

TensorRT-LLMvLLMTritonONNX Runtime
📊

تحلیل داده‌های حجیم (HPC)

پردازش پتابایت داده با RAPIDS cuDF و cuML — صدها برابر سریع‌تر از Spark. مناسب برای genomics، climate modeling، financial simulation و computational fluid dynamics.

RAPIDScuDFDaskSpark GPU
🔬

تحقیق و توسعه هوش مصنوعی

محیط تحقیقاتی انعطاف‌پذیر با JupyterHub، VS Code Server، دسترسی به مدل‌های پیش‌آموزش‌دیده HuggingFace، ابزارهای experiment tracking و محیط‌های ایزوله برای هر تیم.

JupyterHubHuggingFaceW&BMLflow
🎨

هوش مصنوعی مولد (Generative AI)

آموزش و استقرار مدل‌های diffusion، text-to-image، text-to-video و multimodal. از Stable Diffusion XL تا Sora-scale video generation با پشتیبانی کامل از flash attention و xFormers.

DiffusionxFormersFlash AttentionComfyUI
🏥

AI در صنایع تخصصی

بهداشت و درمان (تصویربرداری پزشکی، drug discovery)، مالی (real-time fraud detection، quantitative trading)، انرژی (بهینه‌سازی شبکه برق) و خودروسازی (autonomous driving simulation).

Healthcare AIFinTechEnergyAutomotive