Far girare un LLM in locale garantisce privacy assoluta e zero costi per token. I comandi operativi per piattaforma:
- Linux (con GPU NVIDIA o CPU):
curl -fsSL https://ollama.com/install.sh | sh && ollama run llama3.2
Per container: docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
- macOS (Apple Silicon, da M1 in poi):
brew install ollama && ollama serve (sfrutta nativamente la memoria unificata e Metal MPS a massima banda)
- Windows / WSL2:
Scarica l'installer nativo o via terminale: winget install Ollama.Ollama oppure in WSL2 Ubuntu ollama run mistral
- Chiamata API locale (OpenAI compatible):
curl http://localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"llama3.2","messages":[{"role":"user","content":"Ciao"}]}'
Per frontend grafico, collega Open WebUI o usa SiliconDev per ottimizzare i modelli.