Menjalankan model LLM di perangkat sendiri (bukan lewat cloud) sekarang jauh lebih gampang. Faktor penentu utamanya adalah RAM (memori), karena model harus muat di memori dulu supaya bisa jalan. Dua patokan yang perlu kamu tahu sebelum mulai:

Pertama, pakai versi model yang sudah dipadatkan lewat kuantisasi Q4_K_M, ini yang paling seimbang antara ukuran dan kualitas. Kedua, sisakan sekitar 2 sampai 4 GB RAM untuk sistem operasi, jangan dipakai model semua. Untuk menjalankannya, aplikasi paling gampang: Ollama (buat developer), LM Studio (buat yang suka oprek), atau Jan (buat pemula). Ketiganya pakai mesin yang sama (llama.cpp), jadi kecepatannya mirip.

HP / 4 GB RAM ke atas

Iya, HP pun bisa. Pilihan teraman: Gemma 3 1B (cuma sekitar 700 MB di Q4) atau Qwen3 1.7B dan Phi-4-mini. Jalanin lewat aplikasi gratis seperti PocketPal AI atau MLC Chat. Kecepatannya sekitar 10 sampai 40 token per detik di HP flagship. Cocok buat tanya-jawab singkat. Tahun 2026 juga sudah ada Gemma 4 yang multimodal (teks + gambar) dan cukup matang untuk jalan di HP.

Laptop ringan / 8 GB RAM

Di kelas ini, Gemma 3 4B atau Qwen3 4B jadi titik manis: cepat dan masih menyisakan memori buat kerja. Kalau mau lebih hemat lagi, Phi-4-mini pilihan aman.

16 GB RAM (sweet spot harian)

Ini kelas paling enak buat dipakai sehari-hari. Jalankan Qwen3 14B atau Gemma 3 12B. Kalau kebutuhanmu banyak coding atau multibahasa, Qwen3 biasanya lebih unggul. Butuh yang paling ngebut? Llama 3.3 8B atau Mistral Small.

32 GB RAM (serius)

Sudah bisa main di model besar: Qwen3 32B, Gemma 3 27B, atau DeepSeek-R1 distill 32B kalau butuh kemampuan menalar (reasoning) yang lebih dalam.

64 GB+ atau GPU besar

Di sini kualitas melompat. Model 70B seperti Llama 3.3 70B dan Qwen3 70B mulai terjangkau, dengan reasoning yang terasa jauh lebih matang. Mixtral 8x7B jadi jalan tengah yang efisien.

Aturan praktisnya

Cocokkan ukuran model dengan RAM di kuantisasi Q4_K_M, sisakan ruang buat OS, dan ingat: makin besar model makin pintar tapi makin lambat. Saran terbaik, mulai dari model kecil dulu, baru naik kalau memang terasa kurang. Nggak perlu langsung yang paling gede.

Butuh AI yang jalan di infrastruktur sendiri?

Kalau bisnismu butuh AI yang privat dan jalan lokal (on-prem), kami bisa bantu pilih model yang pas dan memasangnya biar benar-benar kepakai. Ceritain kebutuhanmu.

ngobrol sama kami →