Kubernetes untuk GPU Server: Kapan Dibutuhkan?
September 23, 2026
Bagaimana jika satu GPU server bisa melayani beberapa aplikasi AI sekaligus? Inilah salah satu fungsi GPU virtualization. Teknologi ini memungkinkan perusahaan mengatur resource GPU agar beberapa workload dapat berbagi satu perangkat fisik sesuai kapasitas dan kebutuhan masing-masing.
Kebutuhan tersebut semakin relevan ketika perusahaan menjalankan LLM, machine learning, deep learning, computer vision, hingga HPC dalam satu lingkungan server. Perusahaan tidak selalu perlu menyediakan satu GPU fisik untuk setiap aplikasi. Dengan konfigurasi virtualisasi yang tepat, tim IT dapat mengatur alokasi GPU, mengisolasi workload, dan meningkatkan pemanfaatan resource server.
Namun, perusahaan tetap perlu memahami karakter setiap workload sebelum menerapkan virtualisasi GPU. Teknologi seperti GPU passthrough, NVIDIA vGPU, dan NVIDIA MIG mempunyai mekanisme yang berbeda. Karena itu, pemilihan pendekatan perlu mengikuti kebutuhan aplikasi, kapasitas GPU, sistem virtualisasi, serta target performa.
Sebelum masuk ke penerapannya, mari pahami terlebih dahulu konsep dasar GPU virtualization dan alasan teknologi ini mulai banyak digunakan pada infrastruktur AI. GPU virtualization adalah teknologi yang memungkinkan beberapa lingkungan komputasi mengakses resource dari satu GPU fisik. Lingkungan tersebut dapat berupa virtual machine, aplikasi, container, atau workload dari beberapa pengguna.
Pada server AI, administrator dapat mengatur akses GPU untuk beberapa kebutuhan sekaligus. Misalnya, satu workload menjalankan inference LLM, workload lain menjalankan computer vision, sementara tim data science memakai resource yang tersisa untuk eksperimen model.
Pendekatan ini berbeda dari konfigurasi multi-GPU biasa. Pada server multi-GPU, setiap aplikasi dapat mengakses satu atau beberapa GPU fisik. Sementara itu, GPU virtualization memungkinkan administrator mengatur pembagian resource dari GPU fisik berdasarkan teknologi yang tersedia. Perusahaan juga dapat menerapkan virtualisasi GPU pada lingkungan yang mempunyai banyak pengguna. Setiap tim dapat memperoleh resource sesuai kebutuhan tanpa harus membeli satu perangkat GPU untuk setiap pengguna atau aplikasi.
Setelah memahami konsepnya, kita bisa melihat bagaimana sistem virtualisasi mengatur akses workload terhadap GPU. Secara umum, lapisan virtualisasi menghubungkan workload dengan GPU fisik dan mengatur resource sesuai konfigurasi administrator. Pada lingkungan virtual machine, misalnya, hypervisor mengatur akses VM terhadap GPU. Administrator kemudian menentukan apakah VM memperoleh satu GPU penuh, sebagian resource GPU, atau instance GPU tertentu.
Model pembagian tersebut bergantung pada hardware dan software yang perusahaan pilih. Karena itu, administrator perlu memeriksa dukungan GPU, driver, hypervisor, serta teknologi virtualisasi sebelum melakukan implementasi.
GPU passthrough memberikan akses langsung sebuah GPU fisik kepada satu virtual machine. VM tersebut dapat berkomunikasi dengan GPU secara langsung sehingga workload memperoleh akses resource yang relatif dekat dengan konfigurasi fisik. Pendekatan ini cocok ketika satu workload membutuhkan kapasitas GPU yang besar. Misalnya, perusahaan menjalankan satu aplikasi AI dengan kebutuhan komputasi tinggi dan ingin memberikan satu GPU khusus kepada VM tersebut. Namun, metode ini tidak memberikan fleksibilitas pembagian resource seperti teknologi GPU sharing. Satu VM pada dasarnya memperoleh akses terhadap GPU yang administrator alokasikan kepadanya.
NVIDIA vGPU memungkinkan administrator membuat beberapa virtual GPU dari satu GPU fisik yang mendukung teknologi tersebut. Setiap VM kemudian dapat mengakses profil vGPU sesuai konfigurasi yang tersedia. Pendekatan ini membantu perusahaan menjalankan beberapa workload pada satu perangkat GPU. Administrator dapat mengatur profil resource berdasarkan kebutuhan aplikasi dan jumlah pengguna. Perusahaan tetap perlu memperhatikan dukungan hardware, driver, hypervisor, dan lisensi NVIDIA sebelum menerapkan NVIDIA vGPU pada server produksi.
NVIDIA juga menyediakan Multi-Instance GPU atau MIG pada GPU tertentu. Teknologi ini memungkinkan administrator mempartisi GPU menjadi beberapa instance yang mempunyai resource komputasi dan memory masing-masing. MIG memberikan isolasi resource yang lebih kuat karena GPU membentuk beberapa instance dengan konfigurasi tertentu. Pendekatan ini dapat membantu perusahaan menjalankan beberapa workload secara bersamaan pada satu GPU yang mendukung fitur MIG. Namun, tidak semua GPU NVIDIA mendukung MIG. Karena itu, tim IT perlu memeriksa spesifikasi GPU sebelum memilih arsitektur tersebut.
Sekarang, kita masuk ke alasan perusahaan mempertimbangkan virtualisasi GPU. Faktor utamanya berkaitan dengan pemanfaatan resource, jumlah workload, dan kebutuhan banyak pengguna dalam satu infrastruktur. GPU mempunyai harga investasi yang relatif tinggi. Ketika sebuah aplikasi hanya memakai sebagian kapasitas GPU, perusahaan mungkin masih memiliki resource yang belum terpakai. Kondisi tersebut dapat terjadi ketika workload datang secara bergantian atau aplikasi hanya membutuhkan GPU pada waktu tertentu.
Dengan GPU virtualization, administrator dapat memberikan resource tersebut kepada workload lain. Misalnya, aplikasi inference menggunakan GPU pada jam operasional, sedangkan tim pengembangan menjalankan eksperimen pada resource yang tersedia.
Beberapa manfaat GPU virtualization antara lain:
| Aspek | GPU Dedicated | GPU Virtualization |
|---|---|---|
| Pembagian resource | Terbatas pada GPU fisik | Lebih fleksibel |
| Banyak workload | Membutuhkan GPU tambahan | Dapat berbagi resource |
| Pengelolaan pengguna | Berdasarkan perangkat | Berdasarkan alokasi resource |
| Isolasi workload | Mengandalkan pemisahan perangkat | Dapat memakai VM atau instance |
| Pemanfaatan GPU | Bergantung pada penggunaan aplikasi | Dapat meningkat pada workload tertentu |
| Kompleksitas | Lebih sederhana | Membutuhkan konfigurasi tambahan |
Namun, virtualisasi GPU tidak menambah kapasitas fisik GPU. Jika beberapa workload memakai GPU secara bersamaan hingga mencapai batas resource, setiap aplikasi tetap dapat mengalami penurunan performa.
Setiap aplikasi AI mempunyai karakteristik yang berbeda. Karena itu, perusahaan perlu mencocokkan strategi virtualisasi dengan jenis workload yang ingin dijalankan.
LLM membutuhkan GPU dengan kapasitas VRAM dan kemampuan komputasi yang sesuai dengan ukuran model. Aplikasi inference dengan model kecil dapat menggunakan konfigurasi yang berbeda dari model besar dengan context length dan concurrency tinggi. GPU virtualization dapat membantu ketika perusahaan menjalankan beberapa aplikasi LLM yang tidak selalu membutuhkan seluruh kapasitas GPU. Administrator dapat mengalokasikan resource berdasarkan kebutuhan masing-masing aplikasi. Sparta menyediakan kategori Server AI untuk LLM & Generative AI untuk perusahaan yang ingin membangun infrastruktur AI. Tim dapat menentukan konfigurasi GPU server berdasarkan model, kebutuhan VRAM, jumlah pengguna, dan target performa.
Tim data science sering menjalankan berbagai eksperimen model dengan kebutuhan GPU yang berbeda. Beberapa eksperimen mungkin hanya membutuhkan sebagian resource, sedangkan proses training tertentu membutuhkan kapasitas GPU yang jauh lebih besar. Virtualisasi GPU dapat membantu perusahaan mengatur akses resource untuk beberapa pengguna. Administrator juga dapat memisahkan lingkungan eksperimen dari aplikasi produksi agar aktivitas development tidak mengganggu workload utama.
Aplikasi computer vision dapat memproses gambar maupun video secara terus-menerus. Sistem CCTV berbasis AI, misalnya, perlu memproses sejumlah stream kamera dengan resolusi dan frame rate tertentu. Perusahaan dapat mempertimbangkan GPU virtualization ketika beberapa pipeline analitik berjalan pada server yang sama. Namun, tim perlu menghitung jumlah kamera, resolusi video, model AI, dan target latency sebelum menentukan konfigurasi.
HPC atau High Performance Computing membutuhkan kemampuan komputasi tinggi untuk simulasi, analisis data, dan berbagai workload intensif lainnya. Tidak semua aplikasi HPC cocok dengan virtualisasi. Beberapa workload membutuhkan akses resource GPU secara penuh dan konsisten. Karena itu, perusahaan perlu melakukan benchmark sebelum memasukkan workload HPC ke lingkungan virtualisasi.
GPU bukan satu-satunya komponen yang menentukan keberhasilan virtualisasi. Server juga membutuhkan CPU, RAM, storage, networking, hypervisor, driver, dan sistem monitoring yang mampu mendukung beberapa workload sekaligus.
GPU menjadi komponen utama dalam arsitektur ini. Tim IT perlu melihat kapasitas VRAM, kemampuan komputasi, dukungan virtualisasi, serta fitur seperti MIG jika workload membutuhkannya. Sparta menyediakan NVIDIA GPU Server Indonesia dengan pilihan GPU seperti NVIDIA H100, H200, B200, L40S, hingga RTX PRO Server. Tim dapat menyesuaikan pilihan tersebut dengan kebutuhan GPU workload, model AI, dan target kapasitas server.
CPU membantu menjalankan hypervisor, sistem operasi, aplikasi pendukung, preprocessing, database, serta service lainnya. RAM juga menopang VM, container, database, dan aplikasi yang berjalan secara bersamaan. Jika perusahaan menjalankan banyak workload, kapasitas CPU dan RAM yang terlalu kecil dapat menjadi bottleneck. GPU mungkin masih mempunyai kapasitas, tetapi aplikasi tetap mengalami perlambatan karena resource server lainnya tidak mencukupi.
Storage menyimpan model, dataset, container, checkpoint, database, serta berbagai data aplikasi. NVMe dapat mempercepat proses loading model dan akses data dengan kebutuhan I/O tinggi. Networking juga mempunyai peran penting ketika server mengakses storage eksternal atau berkomunikasi dengan server lain. Perusahaan perlu menghitung kebutuhan bandwidth berdasarkan volume data dan arsitektur infrastrukturnya.
Setelah memilih hardware, perusahaan perlu menentukan pola pembagian resource. Administrator dapat mempertimbangkan jenis aplikasi, kapasitas VRAM, jumlah pengguna, target latency, serta prioritas workload.
Beberapa faktor utama meliputi:
Sebagai contoh, workload inference ringan dapat memperoleh resource lebih kecil daripada proses training. Administrator juga dapat memberikan prioritas lebih tinggi kepada aplikasi produksi dibandingkan workload eksperimen. Pada lingkungan Proxmox atau VMware, tim IT perlu menyesuaikan konfigurasi GPU dengan kemampuan hypervisor dan hardware. Sparta menyediakan layanan Setup Proxmox, VMware, MikroTik & Cisco serta Instalasi & Konfigurasi Server dan Jaringan untuk mendukung kebutuhan konfigurasi infrastruktur.
Setelah perusahaan menjalankan beberapa workload dalam satu GPU, tim IT perlu memantau penggunaan resource secara berkala. Monitoring membantu administrator melihat kondisi GPU dan menemukan bottleneck sebelum masalah mengganggu aplikasi.
Beberapa metrik yang dapat dipantau meliputi:
Data monitoring membantu tim menentukan kapan server masih mempunyai kapasitas dan kapan perusahaan perlu menambah GPU atau node baru. Sparta juga memiliki kategori Data, Monitoring & Availability, termasuk layanan Monitoring & Operations, yang dapat mendukung kebutuhan pemantauan dan pengelolaan operasional server.
Perusahaan perlu melihat karakter workload sebelum memilih GPU virtualization atau GPU dedicated. Kedua pendekatan tersebut dapat memenuhi kebutuhan yang berbeda. GPU dedicated cocok ketika satu aplikasi membutuhkan resource besar secara konsisten. Sebaliknya, GPU virtualization menawarkan fleksibilitas ketika beberapa workload ingin berbagi resource pada server yang sama.
Perusahaan juga dapat menggabungkan kedua pendekatan tersebut. Aplikasi produksi dengan kebutuhan performa tinggi dapat memakai GPU dedicated, sementara workload development atau aplikasi ringan dapat memakai resource virtual. Dengan cara ini, perusahaan dapat mengatur infrastruktur berdasarkan prioritas aplikasi dan pola penggunaan GPU.
GPU virtualization membantu perusahaan mengelola resource GPU secara lebih fleksibel ketika satu server harus menangani beberapa workload. Teknologi seperti GPU passthrough, NVIDIA vGPU, dan NVIDIA MIG menawarkan pendekatan berbeda untuk mengatur akses terhadap GPU fisik. Namun, perusahaan tidak cukup hanya memilih teknologi virtualisasi. Tim IT juga perlu menghitung kebutuhan GPU, VRAM, CPU, RAM, storage, networking, hypervisor, serta monitoring. Benchmark workload akan membantu perusahaan melihat kebutuhan resource secara lebih akurat sebelum masuk ke produksi.
Sparta menyediakan GPU Server Indonesia dan NVIDIA GPU Server Indonesia untuk berbagai kebutuhan AI, machine learning, deep learning, computer vision, dan HPC. Selain pengadaan server, perusahaan juga dapat memanfaatkan layanan Managed IT & Support, seperti troubleshooting sistem server, perawatan dan maintenance berkala, serta instalasi dan konfigurasi server. Untuk kebutuhan infrastruktur yang lebih luas, Sparta juga menyediakan Infrastruktur & Networking, Cloud & System, serta Rental, Maintenance & Lifecycle. Perusahaan dapat menyesuaikan layanan berdasarkan kebutuhan deployment, pengelolaan, dan pengembangan kapasitas server. WhatsApp kami +62 878‑2224‑1000
Bagian berikut menjawab beberapa pertanyaan dasar yang sering muncul ketika perusahaan mulai mempertimbangkan virtualisasi GPU.
GPU virtualization adalah teknologi yang memungkinkan beberapa workload mengakses resource dari satu GPU fisik sesuai konfigurasi yang tersedia.
Tidak. Kemampuan virtualisasi bergantung pada model GPU, driver, hypervisor, software, dan teknologi yang digunakan.
GPU passthrough memberikan GPU fisik secara langsung kepada satu VM, sedangkan virtualisasi GPU dapat membagi resource GPU kepada beberapa lingkungan.
Ya, terutama untuk workload inference dan aplikasi yang tidak selalu membutuhkan seluruh kapasitas GPU.
Tidak. Virtualisasi tidak meningkatkan kemampuan fisik GPU, tetapi membantu perusahaan mengatur dan memanfaatkan resource yang tersedia secara lebih fleksibel.