Cara Benchmark Server LLM: Mengukur Latency, Throughput,
September 6, 2026
Cara memilih GPU untuk AI tidak cukup hanya dengan melihat GPU mana yang mempunyai CUDA Core paling banyak atau seri paling baru. Ada beberapa faktor lain yang sering justru lebih menentukan, seperti kapasitas VRAM, memory bandwidth, jenis workload, precision yang digunakan, jumlah pengguna, dukungan framework AI hingga kemampuan server dalam menyediakan daya dan pendinginan.
GPU dengan performa tinggi juga belum tentu menjadi pilihan paling efisien untuk semua kebutuhan. Server chatbot internal untuk 20 pengguna tentu mempunyai kebutuhan berbeda dengan server yang digunakan untuk training deep learning, menjalankan model 70B atau memproses puluhan video stream secara real time. Pemilihan GPU sebaiknya dimulai dari workload yang akan dijalankan, bukan langsung dari merek atau seri GPU.
Model AI modern melakukan banyak operasi matematika yang dapat dikerjakan secara paralel. Pada neural network, misalnya, terdapat banyak perhitungan matrix multiplication yang dilakukan secara berulang. GPU dirancang dengan banyak unit pemrosesan sehingga mampu menjalankan sejumlah besar operasi secara bersamaan.
Karakter tersebut berbeda dengan CPU. CPU mempunyai jumlah core lebih sedikit tetapi setiap core dirancang untuk menangani berbagai jenis instruksi secara fleksibel. GPU mempunyai jauh lebih banyak unit pemrosesan yang cocok untuk pekerjaan paralel. Karena itu, GPU banyak digunakan untuk:
Namun, bukan berarti seluruh artificial intelligence harus menggunakan GPU. Model machine learning sederhana masih dapat berjalan dengan baik menggunakan CPU. GPU mulai memberikan keuntungan besar ketika model semakin kompleks, jumlah data meningkat atau perusahaan membutuhkan response time dan throughput yang lebih tinggi.
Pembahasan mengenai pembagian fungsi kedua processor tersebut dapat dilihat pada artikel CPU vs GPU untuk AI sebagai bagian dari perencanaan AI server secara keseluruhan.
Salah satu kesalahan yang cukup umum adalah menganggap GPU yang mempunyai nama seri lebih tinggi otomatis menjadi pilihan terbaik. Padahal, GPU mempunyai segmentasi penggunaan yang berbeda. Ada GPU consumer, workstation hingga data center. Masing-masing dapat mempunyai karakter berbeda dari sisi:
Karena itu, GPU yang sangat cepat untuk penggunaan desktop belum tentu menjadi pilihan ideal untuk server enterprise yang beroperasi 24 jam sehari. Sebaliknya, perusahaan juga tidak perlu langsung membeli GPU data center kelas tertinggi jika workload sebenarnya masih dapat dijalankan menggunakan GPU yang lebih sederhana.
Salah satu spesifikasi pertama yang perlu diperhatikan adalah VRAM atau Video Random Access Memory. VRAM merupakan memory yang berada pada GPU dan digunakan untuk menyimpan data yang sedang diproses oleh GPU. Dalam penggunaan AI, VRAM dapat digunakan untuk menyimpan:
Jika kapasitas VRAM tidak mencukupi, model mungkin tidak dapat dimuat sepenuhnya ke GPU. Inilah alasan mengapa GPU yang secara komputasi lebih cepat tetapi mempunyai VRAM kecil belum tentu lebih cocok dibandingkan GPU dengan performa sedikit lebih rendah tetapi VRAM lebih besar.
Tidak ada satu angka yang cocok untuk semua workload. Kebutuhan VRAM dipengaruhi oleh:
Sebagai gambaran, model yang mempunyai miliaran parameter dapat membutuhkan memory cukup besar hanya untuk menyimpan weight. Jika weight menggunakan FP16, kebutuhan dasar memory akan lebih besar dibandingkan model yang sudah dikompresi menggunakan quantization 8-bit atau 4-bit.
Namun, jangan menghitung kebutuhan VRAM hanya berdasarkan ukuran file model. Saat inference, masih terdapat kebutuhan memory untuk context, KV cache, runtime dan proses lainnya. Saat training, kebutuhannya bisa jauh lebih besar lagi karena server perlu menyimpan gradient, activation dan optimizer state.
Karena itu, selalu sediakan margin VRAM di atas kebutuhan minimum model. Untuk perusahaan yang akan menjalankan Large Language Model secara lokal, pembahasan lebih detail mengenai hubungan model, GPU, RAM dan storage tersedia pada artikel Server untuk Menjalankan LLM Lokal.
CUDA Core merupakan unit pemrosesan paralel pada GPU NVIDIA. Secara sederhana, semakin banyak unit komputasi yang tersedia, semakin banyak pekerjaan tertentu yang dapat diproses secara paralel. Karena alasan tersebut, jumlah CUDA Core sering digunakan ketika membandingkan GPU.
Namun, ada satu hal penting: Jumlah CUDA Core tidak sebaiknya digunakan sebagai satu-satunya indikator performa AI. GPU dari generasi arsitektur berbeda dapat mempunyai kemampuan yang berbeda meskipun jumlah CUDA Core terlihat serupa.
Clock speed, memory bandwidth, Tensor Core, precision yang didukung serta peningkatan arsitektur juga memengaruhi performa. Karena itu, membandingkan GPU hanya menggunakan angka CUDA Core dapat memberikan kesimpulan yang kurang tepat.
Misalnya terdapat dua GPU dari generasi berbeda. GPU A mempunyai lebih banyak CUDA Core dibandingkan GPU B. Belum tentu GPU A selalu lebih cepat untuk seluruh workload AI. Arsitektur baru dapat membawa peningkatan pada:
Karena itu, ketika memilih GPU untuk artificial intelligence, lihat benchmark yang menjalankan model atau workload serupa dengan kebutuhan perusahaan. Jangan hanya melihat satu angka spesifikasi.
Selain CUDA Core, GPU NVIDIA modern juga mempunyai Tensor Core. Tensor Core dirancang untuk mempercepat operasi matrix yang banyak digunakan dalam machine learning dan deep learning. Komponen ini mendukung berbagai format precision yang digunakan dalam AI. Menurut informasi resmi NVIDIA mengenai Tensor Cores, Tensor Core dirancang untuk mempercepat mixed-precision computing pada berbagai workload artificial intelligence dan high-performance computing.
Kemampuan tersebut membuat Tensor Core menjadi faktor yang relevan ketika perusahaan membandingkan GPU untuk training maupun inference. Namun sekali lagi, jumlah Tensor Core saja belum memberikan gambaran lengkap. Lihat juga generasinya dan jenis precision yang didukung.
AI tidak selalu melakukan seluruh perhitungan menggunakan precision yang sama. Beberapa format yang sering ditemui antara lain:
Precision yang lebih rendah dapat mengurangi penggunaan memory dan meningkatkan throughput pada workload tertentu. Contohnya pada LLM. Model yang dijalankan menggunakan quantization 4-bit dapat mempunyai kebutuhan VRAM jauh lebih rendah dibandingkan menjalankan weight pada FP16. Namun, teknik tersebut juga memiliki trade-off.
Kualitas output, kompatibilitas model dan performa perlu diuji. Karena itu, saat memilih GPU, periksa format precision yang benar-benar akan digunakan oleh software dan model perusahaan.
Selain kapasitas VRAM, perhatikan memory bandwidth. Memory bandwidth menunjukkan seberapa cepat GPU dapat memindahkan data dari dan menuju memory. Dalam beberapa workload AI, GPU harus membaca weight model dalam jumlah sangat besar secara terus-menerus.
Jika kemampuan komputasinya tinggi tetapi akses memory menjadi bottleneck, performa tidak akan maksimal. Faktor ini menjadi cukup penting untuk LLM inference. Karena itu, dua GPU dengan VRAM yang sama belum tentu memberikan kecepatan inference yang sama. Jenis memory dan memory bandwidth dapat berbeda.
Sebelum menentukan GPU, perusahaan harus mengetahui apakah server akan digunakan untuk training atau inference.
Training membutuhkan komputasi tinggi karena model terus melakukan forward pass, menghitung loss, backward propagation lalu memperbarui parameter. Kebutuhan VRAM juga relatif besar. Server training dapat membutuhkan:
Jika training berlangsung pada beberapa GPU atau node, kemampuan komunikasi antar-GPU juga menjadi penting.
Inference tidak membutuhkan proses backward propagation. Model hanya digunakan untuk menghasilkan output. Namun, sistem production mempunyai tantangan lain: jumlah request. GPU inference harus mampu memberikan latency dan throughput yang sesuai. Untuk chatbot, misalnya, perhatikan:
GPU yang mampu menjalankan model untuk satu pengguna belum tentu mampu memberikan pengalaman yang baik ketika digunakan ratusan pengguna.
Ketika perusahaan ingin menjalankan LLM, jumlah parameter sering menjadi acuan pertama. Model 8B tentu mempunyai karakter berbeda dengan model 70B. Namun, ukuran model bukan satu-satunya faktor. Kebutuhan GPU juga dipengaruhi oleh quantization. Model 8B pada FP16 dapat membutuhkan memory berbeda dibandingkan model yang sama pada 4-bit.
Context length juga berpengaruh. Semakin panjang context yang diproses, semakin besar kebutuhan memory yang dapat digunakan oleh KV cache. Jumlah pengguna bersamaan kemudian menambah kebutuhan tersebut. Itulah sebabnya server LLM sebaiknya diuji menggunakan pola pemakaian sebenarnya.
Tidak semua AI server membutuhkan banyak GPU. Satu GPU sering menjadi pilihan yang lebih sederhana karena:
Multi-GPU mulai dibutuhkan ketika model tidak dapat dimuat pada satu GPU atau perusahaan membutuhkan kemampuan komputasi lebih besar.
Contohnya: Model yang membutuhkan VRAM melebihi kapasitas satu GPU dapat dibagi ke beberapa GPU apabila software mendukung model parallelism. Training juga dapat dipercepat menggunakan data parallelism. Namun, memasang dua GPU tidak otomatis membuat performa dua kali lebih cepat. Scaling dipengaruhi software, interconnect, PCIe, CPU, workload dan komunikasi antargPU.
GPU tidak bekerja sendirian. Data tetap harus berpindah antara CPU, RAM, storage dan GPU. Jika perusahaan ingin menggunakan beberapa GPU, pastikan CPU mempunyai PCIe lane yang memadai. Motherboard juga harus mendukung jumlah GPU yang direncanakan. Kesalahan desain dapat membuat beberapa GPU bekerja dengan bandwidth PCIe lebih rendah daripada yang diharapkan.
Untuk AI server dengan konfigurasi kompleks, komponen harus dilihat sebagai satu kesatuan. Perusahaan dapat melihat solusi Core Server & Infrastruktur Sparta Server Indonesia untuk merencanakan GPU server bersama CPU, memory, storage dan networking yang sesuai.
GPU yang cepat tidak akan banyak membantu jika software perusahaan tidak dapat memanfaatkannya. Periksa kompatibilitas dengan:
Untuk NVIDIA GPU, compute capability juga perlu diperhatikan terutama ketika menjalankan software atau library tertentu. GPU generasi lama mungkin masih mempunyai performa hardware yang cukup, tetapi tidak selalu mendapatkan dukungan optimal dari versi software terbaru. Karena itu, pertimbangkan lifecycle software ketika membeli GPU untuk penggunaan beberapa tahun.
GPU berperforma tinggi dapat mempunyai konsumsi daya yang besar. Jika server menggunakan beberapa GPU sekaligus, total kebutuhan listrik dapat meningkat signifikan. Jangan hanya menjumlahkan TDP GPU. Server masih membutuhkan daya untuk:
Power supply juga sebaiknya mempunyai margin dan redundancy yang sesuai untuk sistem enterprise. Periksa pula kapasitas PDU dan UPS pada rack.
Konsumsi daya tinggi berarti panas yang dihasilkan juga tinggi. GPU server membutuhkan airflow yang jauh lebih baik dibandingkan desktop biasa. GPU data center tertentu memang dirancang menggunakan passive cooling karena airflow disediakan oleh chassis server. Artinya, GPU tersebut tidak cocok hanya dimasukkan ke sembarang casing. Perusahaan perlu memastikan:
Jika cooling tidak memadai, GPU dapat mengalami thermal throttling sehingga performa justru turun.
Pemilihan kelas GPU juga perlu disesuaikan dengan penggunaan.
GPU consumer dapat memberikan rasio performa terhadap harga yang menarik untuk eksperimen, development atau workload tertentu. Namun, perlu diperhatikan keterbatasan form factor, cooling, memory, support dan penggunaan jangka panjang pada server.
GPU workstation umumnya menawarkan VRAM lebih besar dan dirancang untuk penggunaan profesional. Jenis ini dapat menjadi pilihan untuk AI development, rendering dan workload profesional yang membutuhkan kapasitas memory tinggi.
GPU data center dirancang untuk server dan operasi enterprise. Keunggulannya dapat meliputi memory besar, dukungan software enterprise, reliability, virtualisasi, kemampuan multi-GPU dan desain thermal yang sesuai dengan chassis server. Namun, biayanya juga lebih tinggi. Karena itu, pemilihan kelas GPU harus mempertimbangkan business requirement, bukan sekadar benchmark.
AI server tidak hanya membutuhkan GPU. RAM harus cukup untuk menyimpan dataset, menjalankan aplikasi dan mendukung proses preprocessing. Storage juga perlu mampu membaca data dengan cepat.
NVMe banyak digunakan untuk workload AI karena throughput dan latency yang lebih baik. Jika GPU terus menunggu data dari storage, GPU utilization dapat turun meskipun spesifikasinya tinggi. Untuk dataset besar, perusahaan juga dapat membutuhkan storage terpisah seperti NAS, SAN atau distributed storage.
Jika menggunakan model relatif kecil dan jumlah pengguna terbatas, satu GPU dengan VRAM yang cukup mungkin sudah memadai. Prioritas utama adalah kapasitas model, context length dan concurrency.
Untuk satu atau beberapa kamera, kebutuhan GPU dapat relatif ringan. Jika puluhan kamera melakukan object detection secara real-time, throughput GPU menjadi lebih penting.
Prioritaskan kemampuan komputasi, VRAM, Tensor Core dan memory bandwidth. Multi-GPU dapat dipertimbangkan jika training time terlalu lama.
Perhatikan VRAM terlebih dahulu. Setelah model dapat dimuat, baru evaluasi token throughput, latency dan kemampuan menangani banyak pengguna.
Image dan video generation dapat membutuhkan VRAM sekaligus kemampuan komputasi tinggi. Benchmark menggunakan model yang benar-benar akan digunakan sebelum membeli server.
Sebelum melakukan pengadaan, buat daftar kebutuhan terlebih dahulu. Tentukan:
Setelah itu, pilih beberapa kandidat GPU. Jalankan benchmark menggunakan workload yang sama. Bandingkan:
Hasil benchmark tersebut akan memberikan gambaran yang jauh lebih akurat daripada hanya membaca spesifikasi.
Cara memilih GPU untuk AI yang tepat dimulai dari memahami workload. VRAM menentukan apakah model dapat dijalankan dengan konfigurasi tertentu, sedangkan CUDA Core, Tensor Core, memory bandwidth, arsitektur dan precision memengaruhi kemampuan komputasinya.
Setelah itu masih ada faktor lain seperti CPU, RAM, storage, PCIe, power supply dan cooling. Karena itu, GPU tidak sebaiknya dipilih sebagai komponen terpisah. Seluruh AI server harus dirancang sebagai satu sistem.
GPU dengan harga tinggi tidak akan memberikan hasil optimal jika CPU menjadi bottleneck, storage terlalu lambat atau cooling menyebabkan thermal throttling. Sebelum melakukan pengadaan dalam jumlah besar, lakukan proof of concept menggunakan model dan data yang mendekati lingkungan produksi.
Jika perusahaan membutuhkan bantuan menentukan GPU sekaligus menyiapkan sistemnya, Jasa IT & Solusi Infrastruktur Sparta Server Indonesia dapat membantu kebutuhan instalasi, konfigurasi dan infrastruktur server.
Untuk konsultasi kebutuhan GPU server, AI server, CPU, RAM, storage hingga networking, hubungi Sparta Server Indonesia agar spesifikasi dapat disesuaikan dengan workload AI perusahaan dan rencana pengembangan kapasitas ke depan.
WhatsApp kami +62 878‑2224‑1000
Bisa, selama kondisi perangkat masih baik dan GPU masih kompatibel dengan software yang akan digunakan. Periksa kesehatan hardware, temperatur, memory error, dukungan driver dan usia arsitektur sebelum digunakan untuk workload produksi.
Tidak otomatis. Pada kebanyakan aplikasi, VRAM dua GPU tidak langsung berubah menjadi satu memory pool sebesar 48 GB. Model harus mendukung pembagian workload atau model parallelism agar memory beberapa GPU dapat dimanfaatkan untuk satu workload.
Tidak. VRAM menentukan kapasitas memory, bukan langsung menentukan kecepatan komputasi. GPU dengan VRAM lebih besar dapat memuat model atau batch lebih besar, tetapi performa tetap dipengaruhi arsitektur, Tensor Core, CUDA Core, memory bandwidth, clock dan software.
Tidak semua workload AI membutuhkan ECC. Namun, untuk server enterprise yang menjalankan workload penting dalam waktu lama, kemampuan koreksi error memory dapat menjadi pertimbangan karena reliability lebih penting dibandingkan sekadar performa maksimum.
Mulailah berdasarkan benchmark workload, bukan jumlah maksimum yang dapat dipasang server. Jika satu GPU sudah memenuhi kebutuhan model, latency dan jumlah pengguna, konfigurasi tersebut dapat menjadi titik awal. Namun, pilih chassis, power supply dan platform yang masih mempunyai ruang ekspansi jika kebutuhan diperkirakan meningkat.