Cara Menjalankan Hermes AI di Komputer Sendiri
Cara Menjalankan Hermes AI di Komputer Sendiri – Hermes AI yang dimaksud di sini adalah Hermes Agent, sebuah AI agent yang dapat menjalankan berbagai tugas melalui terminal, membaca dan mengedit file, serta menggunakan model AI dari berbagai provider. Hermes juga dapat dikonfigurasi untuk menggunakan model yang berjalan langsung di komputer melalui Ollama, sehingga tidak harus menggunakan API cloud.
Bagaimana Cara Menjalankan Hermes?
Untuk menjalankan Hermes secara lokal, komponen utamanya adalah:
- Komputer Windows, macOS, atau Linux.
- WSL2 jika menggunakan Windows untuk menjalankan lingkungan Linux.
- Ollama sebagai server model AI lokal.
- Model AI yang kompatibel dengan Ollama.
- Hermes Agent.
Arsitekturnya kurang lebih seperti ini:
ADVERTISEMENT
SCROLL TO RESUME CONTENT
Komputer → Ollama → Model AI Lokal → Hermes Agent
Dengan konfigurasi ini, model AI berjalan di komputer sendiri dan Hermes bertindak sebagai agent yang berinteraksi dengan model tersebut.
1. Instal WSL2 untuk Windows
Jika menggunakan Windows, Hermes Agent membutuhkan lingkungan Unix. Dokumentasi Hermes merekomendasikan penggunaan WSL2.
Buka PowerShell sebagai Administrator, kemudian jalankan:
wsl --install
Setelah proses instalasi selesai, restart komputer.
Kemudian buka Ubuntu dari Start Menu dan selesaikan konfigurasi username serta password Linux.
Jika menggunakan macOS atau Linux, langkah WSL2 tidak diperlukan.
2. Instal Ollama
Ollama digunakan untuk menjalankan model AI secara lokal.
Setelah Ollama terpasang, jalankan model yang ingin digunakan. Contohnya:
ollama pull qwen2.5-coder:7b
Kemudian jalankan server Ollama:
ollama serve
Ollama menyediakan endpoint OpenAI-compatible yang dapat digunakan Hermes. Dokumentasi Hermes memberikan contoh endpoint lokal:
http://localhost:11434/v1
3. Instal Hermes Agent
Setelah lingkungan Linux siap, instal Hermes Agent menggunakan metode instalasi yang direkomendasikan oleh proyek Hermes.
Setelah instalasi selesai, cek apakah perintah Hermes sudah tersedia:
hermes --help
Jika berhasil, akan muncul daftar perintah Hermes.
4. Hubungkan Hermes dengan Ollama
Bagian paling penting adalah mengarahkan Hermes ke server Ollama.
Jalankan:
hermes model
Kemudian pilih:
Custom endpoint (self-hosted / VLLM / etc.)
Masukkan endpoint:
http://localhost:11434/v1
Untuk API key, Ollama tidak membutuhkan API key sehingga bagian tersebut dapat dikosongkan.
Kemudian masukkan nama model yang sebelumnya diunduh, misalnya:
qwen2.5-coder:7b
Hermes menyimpan konfigurasi model tersebut di config.yaml.
5. Jalankan Hermes
Setelah model berhasil dikonfigurasi, jalankan Hermes:
hermes
Sekarang alurnya menjadi:
Hermes Agent
↓
localhost:11434
↓
Ollama
↓
Model AI lokal
Hermes dapat menggunakan model lokal tersebut untuk menjalankan tugas agent.
6. Alternatif: Menggunakan llama.cpp
Selain Ollama, Hermes juga mendukung llama.cpp/llama-server sebagai backend model lokal. Dokumentasi Hermes menyebut llama.cpp cocok untuk menjalankan model quantized pada CPU maupun GPU konsumen.
Contoh menjalankan model GGUF:
llama-server \
-m models/model.gguf \
-c 32768 \
-ngl 99 \
--port 8080 \
--jinja
Kemudian Hermes diarahkan ke:
http://localhost:8080/v1
Parameter --jinja penting apabila ingin menggunakan tool calling pada llama-server.
7. Bagaimana dengan Spesifikasi Komputer?
Kebutuhan hardware sangat tergantung pada model yang digunakan.
Sebagai gambaran:
| Hardware | Model Lokal |
|---|---|
| RAM 8 GB | Model kecil/quantized |
| RAM 16 GB | Model 7B–9B lebih masuk akal |
| RAM 32 GB | Model yang lebih besar |
| GPU VRAM besar | Model lebih besar dan inference lebih cepat |
| SSD | Sangat disarankan |
Jangan langsung memilih model berukuran sangat besar. Model yang terlalu besar dapat membuat komputer kehabisan RAM/VRAM dan proses inference menjadi sangat lambat.
8. Jika Menggunakan Windows + WSL2
Ada satu hal penting.
Jika Hermes berjalan di WSL2 tetapi Ollama berjalan di Windows, localhost tidak selalu menunjuk ke mesin yang sama ketika WSL2 menggunakan mode networking NAT.
Dokumentasi Hermes merekomendasikan mirrored networking pada Windows 11 22H2 atau lebih baru karena memungkinkan komunikasi localhost antara Windows dan WSL2 dengan lebih sederhana.
Jika Ollama juga dijalankan di dalam WSL2, konfigurasi biasanya lebih sederhana karena keduanya berada dalam lingkungan yang sama.
9. Apakah Benar-Benar Offline?
Jika Hermes menggunakan Ollama dengan model lokal, inference model dapat dilakukan di komputer sendiri tanpa API model cloud. Dokumentasi resmi Hermes menjelaskan konfigurasi Ollama sebagai opsi local model tanpa API key.
Namun, perlu dibedakan antara model lokal dan seluruh fungsi agent. Beberapa kemampuan Hermes dapat membutuhkan akses internet, misalnya ketika agent melakukan pencarian web atau menggunakan layanan eksternal.
Jadi:
Model AI: bisa lokal/offline
Hermes: bisa menggunakan model lokal
Fitur online: tetap dapat membutuhkan internet
10. Konfigurasi yang Paling Mudah
Untuk pemula, saya menyarankan struktur:
Windows
└── WSL2 / Ubuntu
└── Hermes Agent
└── Ollama
└── Model 7B–9B
Dengan pendekatan tersebut, Anda tidak perlu langsung mempelajari vLLM, SGLang, atau konfigurasi GPU yang rumit.
Ringkasnya
# 1. Jalankan Ollama
ollama serve
# 2. Download model
ollama pull qwen2.5-coder:7b
# 3. Konfigurasi Hermes
hermes model
# Pilih:
# Custom endpoint
# Endpoint:
# http://localhost:11434/v1
# Model:
# qwen2.5-coder:7b
# 4. Jalankan Hermes
hermes
Hermes memang dirancang untuk dapat menggunakan custom/self-hosted endpoint, sehingga Ollama merupakan salah satu cara paling sederhana untuk membuat AI agent berjalan dengan model lokal.





