ข้ามไปยังเนื้อหาหลัก

จาก GPU
เครื่องแรก สู่ AI
Factory scale

ออกแบบ ติดตั้ง และตรวจรับระบบ NVIDIA DGX และ HGX ตั้งแต่ single node ไปจนถึง GPU cluster ระดับ AI Factory พร้อม high-speed network fabric, storage และ software stack สำหรับ production workload

COMPUTE / DGX-HGXSCALE UNITHPC STORAGE
ILLUSTRATIVE SYSTEM VIEW · NOT A FINAL BOM
PLATFORMSDGX · HGX
DEPLOYMENT SCALE1 → 256+ Nodes
H100HopperH200HopperB200BlackwellB300Blackwell UltraGB300NVL72

เลือกบริการให้เหมาะกับขนาดระบบ

รองรับ NVIDIA GPU หลาย generation

H100, H200, B200, B300 และ GB300 บนแพลตฟอร์ม DGX หรือ HGX โดยสถาปัตยกรรมและจำนวน node ขั้นสุดท้ายจะออกแบบตาม platform generation, Data Center และ workload ของลูกค้า

เริ่มได้ตั้งแต่ GPU server เครื่องเดียว และขยายสู่ multi-rack cluster ที่รวม compute, network, storage และ software stack เป็นระบบเดียว พร้อมตรวจสอบความพร้อมก่อนส่งมอบ

PRODUCTION BASELINE01 GPU NODEPOWER · NETWORK · SOFTWARE
SYSTEM VIEW · SINGLE NODE
01 / SINGLE NODE

Production-Ready DGX or HGX

เราช่วยติดตั้ง NVIDIA DGX หรือ HGX เครื่องแรกของคุณให้พร้อมใช้งาน AI จริง ตั้งแต่ Data Center จนถึง LLM ที่แอปขององค์กรเรียกใช้ได้

  • Site Readinessตรวจความพร้อมของ Data Center ก่อนสั่งซื้อ ทั้ง power budget ต่อ rack, cooling capacity, น้ำหนัก และ network uplink ให้คุณมั่นใจว่ารองรับเครื่องได้จริง
  • Rack & Stackติดตั้งเครื่องเข้า rack กระจายไฟไปหลาย PDU และเดินสายตาม cable plan พร้อม labeling ทุกเส้น ให้ทีมของคุณดูแลต่อได้ง่ายหลังส่งมอบ
  • System Softwareตั้งค่า firmware, BIOS, BMC, OS, drivers, CUDA และ container runtime ให้ทุกเวอร์ชันทำงานร่วมกันได้ทั้งระบบ เริ่มจากปรับ BIOS ตามคู่มือ NVIDIA และ OEM สำหรับ GPUDirect และแยก BMC ไว้ใน management network จากนั้นติดตั้ง OS บน RAID 1 และล็อกเวอร์ชัน kernel ให้ตรงกับ driver เพื่อให้ระบบเสถียรหลังอัปเดต ปิดท้ายด้วยการเปิดใช้ NVIDIA Fabric Manager ให้ GPU ทุกตัวเชื่อมกันผ่าน NVSwitch และ NVLink ได้เต็ม bandwidth และติดตั้ง DOCA สำหรับ BlueField-3 และ ConnectX-7/8
  • Integration & Platformติดตั้ง Kubernetes, vLLM และ GPU monitoring ให้พร้อมใช้งาน เพื่อให้แอปขององค์กรเรียกใช้ LLM บนเครื่องของตัวเองผ่าน API แบบเดียวกับ OpenAI ได้ทันที บน Kubernetes เราตั้งค่า NVIDIA GPU Operator ให้จัดสรร GPU ให้แต่ละ workload ปรับ vLLM ให้แบ่งโมเดลขนาดใหญ่ไปรันบนหลาย GPU ผ่าน NVLink ด้วย tensor parallelism และเชื่อม DCGM Exporter เข้า Prometheus และ Grafana ให้เห็น utilization, memory และอุณหภูมิของ GPU ทุกตัว
  • Validationทดสอบทุกเครื่องก่อนส่งมอบ ตั้งแต่ stress test ของ hardware จนถึงเรียก LLM ผ่าน API พร้อมรัน DCGM diagnostics ทั้งระบบ วัด bandwidth ระหว่าง GPU ผ่าน NVLink ด้วย NCCL tests และส่งมอบค่า throughput กับ latency ของ vLLM เป็น baseline ไว้เทียบหลังใช้งานจริง
RDMAFABRIC8–256+ NODESNCCL VERIFIED
SYSTEM VIEW · BasePOD & SuperPOD
02 / BasePOD & SuperPOD

SuperPOD for Scalable AI Factory

เราออกแบบและติดตั้ง GPU cluster ที่รวม compute nodes, RDMA fabric, management, storage และ workload orchestration สำหรับ distributed AI และ HPC ให้ทีมของคุณเทรนและรันโมเดลข้ามหลาย node ได้เหมือนใช้ระบบเดียว

จำนวน node และสถาปัตยกรรมขั้นสุดท้ายขึ้นอยู่กับ DGX/HGX generation และ NVIDIA reference architecture ที่เลือกใช้ ชื่อ NVIDIA DGX SuperPOD ใช้กับระบบที่ตรงตาม reference architecture เท่านั้น

  • Architecture & BOMออกแบบ compute, control plane, fabric, storage, rack layout และ cabling วาง compute fabric แบบ rail-optimized ให้ GPU แต่ละตัวมี NIC ของตัวเองแยกจาก storage และ management network แล้วคำนวณ power, cooling และจำนวน optics ต่อ rack ให้ครบ ส่งมอบเป็น BOM และ rack elevation ที่พร้อมใช้จัดซื้อ
  • RDMA Fabricติดตั้ง InfiniBand หรือ Ethernet with RoCEv2 พร้อม lossless configuration ฝั่ง InfiniBand ตั้งค่า Subnet Manager และ adaptive routing ส่วนฝั่ง Ethernet ตั้งค่า PFC, ECN และ DCQCN ให้รับ traffic ของ GPU ได้เต็ม bandwidth แล้วตรวจ link, cable และ firmware ของ NIC ทุก port ก่อนเปิดใช้งาน
  • Cluster Softwareจัดเตรียม OS image, drivers, NCCL, containers และ Slurm หรือ Kubernetes ใช้ golden image เดียวกันทุก node ผ่าน NVIDIA Base Command Manager หรือระบบ provisioning ขององค์กร ติดตั้ง Slurm พร้อม Pyxis และ Enroot สำหรับงาน HPC หรือ Kubernetes พร้อม GPU Operator และ Network Operator ให้ทีมส่งงาน distributed training ได้ตั้งแต่วันแรก
  • NCCL Verificationตรวจสอบ correctness, latency และ collective bandwidth เพื่อกำหนด performance baseline รัน NCCL tests แบบ all-reduce และ all-gather ข้ามทุก node เทียบกับค่าอ้างอิงของ reference architecture ต่อด้วย HPL และ training job จริง แล้วส่งมอบผลทั้งหมดเป็น baseline ไว้เทียบเมื่อขยายระบบ
DUAL FABRIC A / BNVL72 RACKSMULTI-RACK SCALEMANAGEMENT + WORKLOAD PLANEHPC STORAGE PATH
SYSTEM VIEW · RACK-SCALE NVL72
03 / RACK-SCALE NVL72

Grace Blackwell and Vera Rubin NVL72

เราออกแบบและติดตั้งระบบ rack-scale บน NVIDIA Grace Blackwell (GB300 NVL72) และ Vera Rubin NVL72 ที่รวม GPU 72 ตัวไว้ใน NVLink domain เดียว ตั้งแต่ power, liquid cooling และ floorplan ของ Data Center ไปจนถึง network, software และการตรวจรับ ให้ AI Factory ของคุณพร้อมทั้งสำหรับรุ่นปัจจุบันและรุ่นถัดไป

สเปกและกำหนดส่งมอบของ Vera Rubin อ้างอิงตามประกาศของ NVIDIA และแตกต่างกันตาม OEM สถาปัตยกรรม จำนวน rack และความต้องการด้าน power และ cooling ขั้นสุดท้ายยืนยันร่วมกับ NVIDIA, OEM และ Data Center

  • Scalable-Unit Planningวางแผน scalable unit, power และ liquid cooling สำหรับ rack ความหนาแน่นสูงแบบ NVL72 ออกแบบ floorplan และ P2P cabling ร่วมกับทีม Data Center ตั้งแต่ตำแหน่ง rack, hot/cold aisle และพื้นที่เผื่อขยาย ไปจนถึงเส้นทางสายทุกเส้นระหว่าง rack และ row พร้อมกำหนด CDU และระบบน้ำให้รองรับ Vera Rubin ที่ใช้ liquid cooling เต็มรูปแบบกับน้ำขาเข้า 45°C
  • Rack-Scale Integrationติดตั้งและ bring-up ระบบ rack-scale ที่รวม GPU 72 ตัวไว้ใน NVLink domain เดียว ทั้ง GB300 NVL72 บน NVLink รุ่นที่ 5 และ Vera Rubin NVL72 บน NVLink 6 ตรวจ NVLink switch tray และ cable cartridge ทุกชุดผ่าน NVIDIA NMX Manager เชื่อม liquid cooling และ power shelf เข้ากับระบบของ Data Center และตรวจ flow, leak และ power ทีละ rack ก่อนเปิดใช้งานเต็มโหลด
  • Vera Rubin Readinessวางแผนเส้นทางจาก Grace Blackwell สู่ Vera Rubin ในพื้นที่เดียวกัน เตรียม power, cooling และ network ให้รองรับ MGX rack รุ่นที่ 3, ConnectX-9 SuperNIC และ BlueField-4 และวาง power budget โดยคำนึงถึง power smoothing ระดับ rack เพื่อใช้กำลังไฟของ Data Center ได้เต็มที่
  • Workload Planeติดตั้ง management, Slurm, containers, monitoring และ secure access แยก management, compute, storage และ in-band network ออกจากกัน ตั้งค่า Slurm หรือ Kubernetes ให้แบ่ง quota ได้หลายทีม ส่ง metrics ของ GPU, fabric และ storage เข้า monitoring กลาง และเปิด secure access แบบ role-based ให้ผู้ใช้แต่ละกลุ่ม
  • System Validationตรวจสอบ compute, fabric, storage และ workload scheduling แบบ end to end ทดสอบตั้งแต่ระดับ node, rack จนถึงทั้ง cluster ด้วย DCGM diagnostics, NCCL tests ทั้งภายใน NVLink domain และข้าม scalable unit, HPL และ storage throughput แล้วปิดท้ายด้วย training หรือ inference workload จริงก่อนส่งมอบ
LOSSLESS GPU FABRICRoCEv2 · INFINIBAND
SYSTEM VIEW · NETWORK FABRIC
04 / GPU FABRIC

High-Speed GPU Network Fabric

เราออกแบบ topology, NIC/SuperNIC, switch, optics, cabling และ RDMA สำหรับ distributed AI/HPC บน Ethernet with RoCEv2 หรือ InfiniBand ให้ GPU ทุกตัวในหลาย node สื่อสารกันได้เต็ม bandwidth

NVLink และ NVSwitch ใช้เชื่อมต่อ GPU ภายในระบบ ส่วน GPUDirect RDMA ช่วยให้ GPU แลกเปลี่ยนข้อมูลข้าม node ผ่าน network fabric ได้โดยลดภาระของ CPU

  • Ethernet with RoCEv2ออกแบบ QoS, PFC/ECN, routing และ telemetry สำหรับ lossless fabric วาง leaf-spine แบบ non-blocking ตั้งค่า DCQCN และ buffer ของ switch ให้รับ traffic แบบ all-reduce ได้เต็ม bandwidth และส่ง telemetry ของทุก port เข้า monitoring เพื่อเห็น congestion ตั้งแต่เริ่มเกิด
  • InfiniBandตั้งค่า subnet management, adaptive routing/SHARP และ monitoring บน switch NVIDIA Mellanox QM Series ออกแบบ fat-tree topology ติดตั้ง NVIDIA UFM หรือ Subnet Manager เปิดใช้ SHARP ให้ switch ช่วยประมวลผล collective operation ลดภาระของ GPU และตรวจ cable, firmware และ error counter ทุก port
  • GPU-Aware Tuningปรับ PCIe/NIC/GPU locality, GPUDirect RDMA และ NCCL topology จับคู่ GPU กับ NIC ที่อยู่ใต้ PCIe switch เดียวกัน ตั้งค่า ACS และ IOMMU ให้ GPUDirect RDMA ส่งข้อมูลตรงระหว่าง GPU memory กับ NIC และกำหนดให้ NCCL ใช้ทุก rail ของ fabric
  • Fabric Acceptanceตรวจสอบ health, RDMA latency และ NCCL bandwidth ตาม baseline ที่ตกลง ทดสอบด้วย perftest (ib_write_bw และ ib_write_lat) และ NCCL tests ทุกขนาด message ร่วมกับ stress test ทั้ง fabric แล้วส่งมอบผลเป็น baseline สำหรับการ troubleshoot ในอนาคต
HIGH-PERFORMANCE DATA PATHSTORAGEGPUWEKA · DDN · GDS
SYSTEM VIEW · HPC STORAGE
05 / HPC STORAGE

High-Performance Data for Every GPU

เราติดตั้ง WEKA หรือ DDN เป็น high-performance data platform สำหรับงาน AI และ HPC ลดคอขวดของข้อมูลตั้งแต่ ingestion, training checkpoint และ model data ไปจนถึง simulation output ให้ GPU ได้รับข้อมูลเร็วพอกับการประมวลผล

  • Data-Path Assessmentวิเคราะห์ dataset, I/O pattern, concurrency, metadata และแนวโน้มการเติบโต วัดขนาดไฟล์ อัตราการอ่านเขียน และรอบการเขียน checkpoint จากงานจริง เพื่อกำหนด capacity และ performance ให้พอดีกับงานวันนี้และรองรับข้อมูลที่เพิ่มขึ้น
  • Storage Architectureออกแบบ performance tier, data protection, network path และ namespace แยก hot tier บน NVMe สำหรับ training ออกจาก capacity tier หรือ object storage สำหรับข้อมูลที่ใช้น้อย วาง storage network ให้เข้ากับ compute fabric และกำหนด namespace เดียวให้ทุก GPU node เห็นข้อมูลชุดเดียวกัน
  • WEKA or DDNติดตั้งระบบ เชื่อมต่อ client กำหนดสิทธิ์ การปกป้องข้อมูล และ monitoring วาง WEKA หรือ DDN EXAScaler พร้อม client บนทุก GPU node กำหนด quota และสิทธิ์ต่อทีม ตั้งค่า snapshot หรือ replication ตามนโยบายข้อมูลขององค์กร และส่ง metrics ของ storage เข้า monitoring กลาง
  • GPU Accelerationรองรับ GPUDirect Storage เมื่อ hardware และ software stack สามารถใช้งานร่วมกันได้ โดยเปิดเส้นทางให้ข้อมูลวิ่งตรงจาก storage เข้า GPU memory ผ่าน RDMA ลดภาระ CPU และเพิ่ม throughput ของ data loader ระหว่าง training
  • Validationตรวจสอบ bandwidth, IOPS, metadata performance และ pipeline throughput ทดสอบด้วย fio, mdtest และ elbencho ที่จำลอง I/O ของงานจริง วัดเวลาเขียน checkpoint และอ่าน dataset จาก GPU ทุก node แล้วส่งมอบผลเป็น baseline
AI + HPC USE CASES

ตัวอย่างการใช้งาน GPU Cluster และ AI Factory

ตัวอย่างงานที่องค์กรรันบน GPU cluster และ AI Factory ตั้งแต่งาน AI ไปจนถึง scientific computing แต่ละงานใช้ compute, network และ storage ต่างกัน เราออกแบบระบบจาก workload จริงของคุณ

01

Private LLM & Sovereign AI

รัน LLM และโมเดลภาษาไทยบนระบบของตัวเอง ข้อมูลอยู่ในองค์กรและในประเทศ

Inference
02

Enterprise AI Assistants

RAG และ AI agent ที่ตอบจากเอกสารภายในและทำงานต่อเนื่องหลายขั้นตอน

Agentic AI
03

Training & Fine-Tuning

เทรนและ fine-tune โมเดลด้วยข้อมูลขององค์กรบน GPU หลาย node พร้อม checkpoint ที่เขียนได้เร็ว

Training
04

Vision & Video Analytics

วิเคราะห์ภาพและวิดีโอจากกล้องจำนวนมากแบบ real-time ทั้งงานตรวจคุณภาพในโรงงานและความปลอดภัยในพื้นที่

Vision AI
05

Simulation & Digital Twins

จำลอง CFD, สภาพอากาศ, seismic และ digital twin ของโรงงานหรือเมือง ที่ต้องใช้ GPU จำนวนมากทำงานพร้อมกัน

Simulation
06

Life Sciences & Materials

วิเคราะห์ genomics จำลอง protein และค้นหายาหรือวัสดุใหม่ด้วย AI ร่วมกับ HPC

Research

Technology ecosystem สำหรับระบบระดับองค์กร

ออกแบบ compute, network, storage และ software stack ให้ทำงานร่วมกันบนแพลตฟอร์มจากผู้ผลิตชั้นนำ พร้อมปรับ architecture ให้เหมาะกับมาตรฐานและระบบเดิมขององค์กร

เริ่มจาก workload และเป้าหมายของคุณ

แจ้ง GPU generation, จำนวน node, Data Center, network และ storage ที่มีอยู่ พร้อม workload เป้าหมาย ทีม Zotect จะช่วยประเมินขอบเขตและวางแนวทางระบบที่เหมาะสม

ปรึกษาทีม AI Infrastructure →