Kubernetes untuk GPU Server: Kapan Dibutuhkan?
September 23, 2026
Bayangkan satu GPU server AI harus menjalankan beberapa workload secara bersamaan. Satu tim menjalankan inference LLM, tim lain mengembangkan model machine learning, sementara aplikasi lain hanya membutuhkan sebagian kapasitas GPU. Apakah perusahaan harus menyediakan satu GPU fisik untuk setiap aplikasi? Tidak selalu.
NVIDIA MIG atau NVIDIA Multi-Instance GPU menawarkan pendekatan berbeda. Teknologi ini membagi GPU tertentu menjadi beberapa GPU Instance dengan alokasi resource yang terisolasi. Dengan konfigurasi tersebut, satu GPU dapat menangani beberapa workload secara bersamaan tanpa membuat setiap aplikasi menggunakan seluruh kapasitas GPU. NVIDIA menyebutkan bahwa GPU yang mendukung MIG dapat dibagi menjadi hingga tujuh GPU Instance terpisah, tergantung model dan profile yang tersedia.
Sebelum melihat manfaatnya, mari pahami terlebih dahulu konsep NVIDIA MIG dan cara teknologi ini mengatur resource GPU. NVIDIA MIG merupakan fitur pada GPU NVIDIA tertentu yang memungkinkan administrator membagi satu GPU fisik menjadi beberapa GPU Instance. Setiap instance memperoleh bagian tertentu dari resource GPU, seperti kapasitas memory, compute resources, memory controller, dan cache sesuai MIG profile yang dipilih.
Konsep ini berbeda dari sekadar menjalankan beberapa aplikasi pada satu GPU. NVIDIA MIG membagi resource GPU berdasarkan struktur hardware yang tersedia sehingga setiap instance memperoleh resource yang lebih terisolasi. Sebagai contoh, perusahaan dapat menjalankan satu layanan LLM inference pada satu instance dan menjalankan workload computer vision pada instance lainnya. Tim development juga dapat menggunakan instance berbeda untuk eksperimen AI tanpa mengambil seluruh resource dari workload produksi.
Pendekatan tersebut membantu perusahaan memanfaatkan GPU berkapasitas besar secara lebih fleksibel, terutama ketika setiap aplikasi tidak membutuhkan seluruh kemampuan GPU.
Setelah memahami definisinya, kita perlu melihat mekanisme NVIDIA MIG dalam membagi satu GPU menjadi beberapa lingkungan kerja. NVIDIA MIG membentuk GPU Instance atau GI yang kemudian dapat menyediakan satu atau beberapa Compute Instance atau CI. Administrator memilih konfigurasi berdasarkan profile yang tersedia pada GPU.
Setiap profile menentukan kombinasi resource yang dapat digunakan oleh instance. Karena itu, perusahaan tidak bisa membagi GPU secara bebas dalam ukuran berapa pun. Administrator harus mengikuti konfigurasi yang GPU dan software NVIDIA dukung. Misalnya, NVIDIA H100 80GB menyediakan beberapa pilihan MIG profile, mulai dari MIG 1g.10gb sampai MIG 7g.80gb. Konfigurasi tertentu memungkinkan administrator menjalankan hingga tujuh instance pada satu GPU.
Secara sederhana, arsitekturnya dapat digambarkan seperti berikut:
GPU fisik → GPU Instance → Compute Instance → Workload AI
Model pembagian tersebut membuat perusahaan dapat menyesuaikan resource GPU dengan kebutuhan setiap aplikasi.
Tidak semua GPU NVIDIA menyediakan fitur NVIDIA MIG. Karena itu, perusahaan perlu mengecek kompatibilitas GPU sebelum menyusun desain infrastruktur. NVIDIA menyediakan dukungan MIG pada sejumlah GPU dari arsitektur Ampere, Hopper, dan Blackwell. Beberapa model yang relevan untuk kebutuhan AI enterprise antara lain NVIDIA H100, NVIDIA H200, NVIDIA B200, dan sejumlah GPU RTX PRO tertentu.
| GPU | Arsitektur | Maks. Instance* | Contoh Workload |
|---|---|---|---|
| NVIDIA H100 | Hopper | Hingga 7 | LLM, inference, AI training, HPC |
| NVIDIA H200 | Hopper | Hingga 7 | AI inference, training, data-intensive workload |
| NVIDIA B200 | Blackwell | Hingga 7 | Generative AI, inference, HPC |
| RTX PRO tertentu | Blackwell | Tergantung model | AI dan enterprise workload |
*Jumlah instance bergantung pada GPU dan profile yang tersedia.
Jumlah instance maksimum bukan satu-satunya faktor yang perlu perusahaan pertimbangkan. Setiap GPU mempunyai kapasitas memory dan pembagian compute resource yang berbeda. Karena itu, perusahaan sebaiknya memilih GPU berdasarkan workload, bukan hanya berdasarkan jumlah MIG instance yang dapat dibuat.
Setelah mengetahui cara kerjanya, sekarang kita bisa melihat alasan perusahaan menggunakan NVIDIA MIG dalam infrastruktur AI.
Satu workload sering kali tidak menggunakan seluruh kapasitas GPU sepanjang waktu. Kondisi tersebut dapat membuat sebagian resource GPU menganggur.
NVIDIA MIG membantu perusahaan membagi resource tersebut untuk workload lain. Misalnya, perusahaan dapat menjalankan beberapa layanan inference berukuran kecil pada instance berbeda daripada menyediakan satu GPU fisik untuk setiap layanan. Pendekatan ini membantu meningkatkan GPU utilization tanpa harus menambah jumlah GPU secara langsung.
NVIDIA MIG juga memberikan isolasi resource antarsatu instance dengan instance lainnya. Setiap instance memperoleh alokasi resource berdasarkan profile yang administrator pilih. Isolasi ini membantu perusahaan menjaga performa workload agar satu aplikasi tidak mudah mengambil seluruh resource GPU dari aplikasi lainnya. Karakteristik tersebut menjadi penting ketika satu server menjalankan workload produksi dan development secara bersamaan.
Perusahaan dapat menggunakan satu GPU untuk beberapa kebutuhan AI sekaligus. Contohnya, satu instance menangani LLM inference, instance lain menangani computer vision, dan instance berikutnya menjalankan eksperimen machine learning. Perusahaan tetap perlu mencocokkan setiap workload dengan kapasitas instance agar aplikasi mendapatkan resource yang cukup.
Ketika beberapa workload hanya membutuhkan sebagian resource GPU, perusahaan tidak harus selalu menyediakan satu GPU penuh untuk masing-masing aplikasi. Pembagian resource melalui NVIDIA MIG dapat membantu perusahaan merancang AI infrastructure yang lebih efisien. Namun, perusahaan tetap perlu melakukan capacity planning dan benchmark untuk memastikan konfigurasi tersebut sesuai dengan kebutuhan aktual.
Banyak orang menghubungkan NVIDIA MIG dengan GPU virtualization. Keduanya memang mempunyai tujuan yang berdekatan, tetapi mekanismenya berbeda. NVIDIA MIG membagi resource GPU pada level hardware menjadi beberapa instance yang terisolasi. Sementara itu, GPU virtualization menggunakan lapisan virtualisasi untuk memberikan akses terhadap resource GPU kepada beberapa virtual machine atau workload.
Perusahaan bahkan dapat menggabungkan keduanya pada arsitektur tertentu. NVIDIA mendukung penggunaan MIG sebagai bagian dari lingkungan vGPU pada GPU dan software stack yang kompatibel. Karena itu, perusahaan sebaiknya memahami kebutuhan arsitektur terlebih dahulu. Jika aplikasi membutuhkan pembagian resource GPU secara terisolasi, NVIDIA MIG dapat menjadi salah satu pendekatan yang relevan.
Tidak semua workload membutuhkan pembagian GPU. NVIDIA MIG paling relevan ketika perusahaan memiliki GPU berkapasitas besar dan beberapa workload yang tidak selalu membutuhkan seluruh resource GPU.
Perusahaan dapat menggunakan NVIDIA MIG untuk workload LLM inference yang kebutuhan memory dan komputasinya sesuai dengan profile tertentu. Pendekatan ini cocok ketika perusahaan ingin menjalankan beberapa layanan AI secara bersamaan tanpa membuat setiap layanan menggunakan satu GPU penuh.
Tim data science sering menjalankan beberapa eksperimen dengan kebutuhan resource yang berbeda. NVIDIA MIG dapat membantu perusahaan memberikan alokasi GPU tertentu kepada masing-masing workload. Konfigurasi tersebut juga dapat membantu tim menghindari kondisi ketika satu eksperimen mengambil resource yang seharusnya tersedia untuk pekerjaan lain.
Aplikasi computer vision seperti object detection, image classification, dan analisis video dapat mempunyai kebutuhan komputasi yang berbeda. Perusahaan dapat menempatkan beberapa aplikasi tersebut pada instance berbeda apabila kebutuhan resource-nya sesuai dengan konfigurasi MIG.
Beberapa workload HPC dan analitik juga dapat menggunakan pembagian GPU. Namun, perusahaan perlu melakukan pengujian karena workload HPC sering mempunyai karakter komputasi dan komunikasi yang berbeda dari aplikasi AI biasa. Sparta menyediakan kategori Use Case yang mencakup Server AI untuk LLM & Generative AI, Server Machine Learning & Deep Learning, Server AI CCTV & Computer Vision, serta HPC Server Indonesia. Kategori tersebut dapat membantu perusahaan menyesuaikan kebutuhan workload dengan infrastruktur yang akan digunakan.
Pemilihan MIG profile menjadi salah satu tahap penting dalam implementasi. Profile yang terlalu kecil dapat membuat workload kekurangan resource, sedangkan profile yang terlalu besar dapat mengurangi jumlah workload yang bisa berjalan pada satu GPU.
Model AI membutuhkan memory untuk menyimpan bobot model, KV cache, runtime, dan proses lainnya. Karena itu, perusahaan perlu menghitung kebutuhan VRAM sebelum menentukan profile. Model dengan kebutuhan memory besar mungkin memerlukan instance dengan kapasitas lebih tinggi. Sebaliknya, workload ringan dapat menggunakan instance yang lebih kecil.
Kapasitas memory bukan satu-satunya pertimbangan. Workload juga membutuhkan compute resource yang memadai. Aplikasi yang menjalankan proses komputasi intensif mungkin memerlukan profile dengan alokasi compute lebih besar agar dapat mencapai target performa.
Perusahaan sebaiknya menguji workload menggunakan konfigurasi yang mendekati kondisi produksi. Pengujian dapat mencakup latency, throughput, penggunaan VRAM, concurrency, dan stabilitas aplikasi. Hasil benchmark akan membantu perusahaan menentukan apakah konfigurasi MIG yang dipilih sudah sesuai.
Penerapan NVIDIA MIG tidak berhenti pada pemilihan GPU. Perusahaan juga perlu menyiapkan software dan komponen pendukung agar setiap instance dapat menjalankan workload dengan baik. Administrator dapat mengelola MIG menggunakan NVIDIA GPU driver dan NVIDIA Management Library. Tool seperti nvidia-smi juga membantu administrator membuat dan memantau konfigurasi MIG.
Jika perusahaan menjalankan workload menggunakan container, tim IT dapat mengintegrasikan NVIDIA Container Toolkit. Sementara itu, lingkungan Kubernetes dapat menggunakan NVIDIA Kubernetes Device Plugin untuk mengelola resource GPU sesuai arsitektur yang digunakan.
Beberapa komponen yang perlu perusahaan siapkan meliputi:
Perusahaan juga perlu memperhatikan kompatibilitas antara GPU, driver, framework AI, container, dan orchestration platform sebelum menerapkan konfigurasi di lingkungan produksi.
Setelah memahami komponen teknisnya, kita dapat melihat contoh penerapan NVIDIA MIG dalam sebuah GPU server AI. Misalnya, perusahaan menggunakan NVIDIA H100 untuk beberapa workload internal. Perusahaan dapat membagi GPU menjadi beberapa instance sesuai profile yang tersedia.
Satu instance dapat menjalankan LLM inference. Instance lain dapat menjalankan computer vision, sementara instance berbeda dapat digunakan oleh tim development untuk eksperimen.
Konfigurasi tersebut membantu perusahaan mengalokasikan resource berdasarkan kebutuhan aplikasi. Namun, administrator tetap harus menyesuaikan profile dengan kapasitas memory dan compute yang dibutuhkan masing-masing workload. Untuk kebutuhan GPU Server Indonesia, Sparta menyediakan pilihan server GPU untuk berbagai kebutuhan AI. Perusahaan dapat mengeksplorasi GPU Server Indonesia sebagai bagian dari perencanaan infrastruktur.
Perusahaan sebaiknya melihat NVIDIA MIG sebagai bagian dari desain infrastruktur yang lebih besar. Pembagian GPU tidak akan menghasilkan performa optimal jika komponen server lainnya tidak mendukung kebutuhan workload. CPU menangani sistem operasi, aplikasi, preprocessing, dan berbagai service pendukung. RAM membantu menjalankan aplikasi serta proses data. Storage menyimpan model, dataset, container, dan log. Sementara itu, networking menghubungkan server dengan storage, database, aplikasi, maupun node lainnya.
Karena itu, perusahaan perlu menyusun Core Server & Infrastruktur secara menyeluruh. Sparta menyediakan solusi Core Server & Infrastruktur untuk mendukung kebutuhan server dan data center. Jika perusahaan masih berada pada tahap perencanaan, tim juga dapat menyesuaikan kebutuhan melalui Pengadaan Server AI Indonesia. Pendekatan ini membantu perusahaan menentukan hardware berdasarkan workload, bukan sekadar memilih GPU dengan spesifikasi tertinggi.
Setelah server berjalan, perusahaan tetap membutuhkan pengelolaan dan pemeliharaan agar workload AI tetap stabil. Konfigurasi GPU, driver, sistem operasi, networking, dan aplikasi dapat memengaruhi performa secara keseluruhan.
Tim IT juga perlu melakukan monitoring resource, troubleshooting, maintenance, dan pembaruan software secara berkala. Untuk perusahaan yang tidak ingin menangani seluruh kebutuhan tersebut secara internal, layanan Managed IT & Support dapat menjadi bagian dari strategi pengelolaan infrastruktur.
Sparta menyediakan layanan seperti Setup Proxmox, VMware, Mikrotik & Cisco, Instalasi & Konfigurasi Server dan Jaringan, Perawatan & Maintenance Berkala, serta Troubleshooting Sistem Server. Layanan tersebut dapat membantu perusahaan mengelola infrastruktur server secara lebih terstruktur.
NVIDIA MIG adalah fitur yang membagi GPU NVIDIA tertentu menjadi beberapa GPU Instance dengan resource yang terisolasi.
Tidak. NVIDIA MIG hanya tersedia pada GPU dan platform tertentu yang mendukung fitur tersebut.
Jumlahnya bergantung pada model GPU dan profile. Beberapa GPU seperti H100, H200, dan B200 mendukung hingga tujuh instance.
Tidak. NVIDIA MIG membagi resource GPU pada level hardware, sedangkan GPU virtualization menggunakan mekanisme virtualisasi.
Bisa, terutama untuk inference LLM yang kebutuhan resource-nya sesuai dengan MIG profile yang tersedia.
Bisa. Satu GPU dapat menjalankan beberapa workload melalui instance MIG yang berbeda selama konfigurasi resource mendukung kebutuhan masing-masing aplikasi.
Mulai dari kebutuhan workload, VRAM, compute, jumlah pengguna, concurrency, dan target performa. Setelah itu, sesuaikan GPU, server, networking, dan storage dengan hasil capacity planning serta benchmark.