Ollama è il modo più rapido di avere un LLM locale: un demone che scarica, gestisce ed esegue modelli open-weights con un comando – ollama run llama3 e stai chattando. Sotto usa llama.cpp e i formati quantizzati GGUF; sopra espone una API HTTP locale (porta 11434, anche in dialetto OpenAI-compatibile) che qualsiasi applicazione può usare.
Quel dettaglio dell'API è ciò che lo rende un mattone d'infrastruttura: molti tool del portfolio di Fabrizio si agganciano a "un endpoint OpenAI-compatibile" proprio pensando a Ollama – l0-memory per gli embeddings del retrieval ibrido, nis2-public per il copilot AI, NASO per il triage dei leak. Il pattern è sempre lo stesso: intelligenza locale, dati che non escono.