Self-hosted AI Models
Tidak selalu harus bayar API. Model open-source bisa di-run lokal atau di server sendiri. Keuntungan: privasi data, zero API cost, no rate limits.
Ollama
Cara termudah run LLM lokal. Install → pull model → pakai.
# Install (macOS/Linux)
curl -fsSL https://ollama.com/install.sh | sh
# Pull model
ollama pull llama3.1
ollama pull codellama
ollama pull mistral
# Run
ollama run llama3.1 "Jelaskan closure di JavaScript"
# API (OpenAI-compatible!)
curl http://localhost:11434/v1/chat/completions \
-d '{"model": "llama3.1", "messages": [{"role": "user", "content": "Hello"}]}'
Integrasi dengan App
// Ollama API compatible dengan OpenAI SDK!
import OpenAI from "openai";
const ollama = new OpenAI({
baseURL: "http://localhost:11434/v1",
apiKey: "ollama", // required but unused
});
const response = await ollama.chat.completions.create({
model: "llama3.1",
messages: [{ role: "user", content: "Apa itu REST API?" }],
});
Model Recommendations
- Llama 3.1 8B — General purpose, bisa jalan di laptop (8GB RAM)
- CodeLlama — Optimized untuk kode
- Mistral 7B — Compact dan capable
- Phi-3 — Microsoft, sangat kecil tapi surprisingly capable
Kapan Self-host?
- Data sensitif yang tidak boleh keluar (healthcare, finance)
- High volume, predictable workload (cost lebih rendah dari API)
- Offline/air-gapped environment
- Development/testing tanpa API costs