Tre strade per lo stesso motore – quasi tutto il locale, sotto, è llama.cpp:
- LM Studio – l'app desktop: interfaccia grafica per scaricare modelli, chattare e servire un'API locale. La porta d'ingresso più morbida; contro: applicazione proprietaria (gratuita), più pesante.
- Ollama – il demone da riga di comando:
ollama rune via, API sulla 11434 che ogni tool può consumare. Il default sensato per chi integra – è l'endpoint che si aspettano l0-memory, NASO e mezzo ecosistema. - llama.cpp – il motore nudo: massimo controllo su flag, quantizzazioni e build, zero comodità. Per chi spreme l'hardware o compila su piattaforme esotiche.
Menzioni doverose: vLLM quando serve servire con throughput serio su GPU, e su Mac il mondo MLX (SiliconDev per l'esperienza completa con fine-tuning). Regola: parti da Ollama; passa sotto solo quando sai perché.