F FabGPT-FAQ

Cos'è Ollama e come si usa?

AI e LLM 1 min lettura Runbook verificato

Ollama è il modo più rapido di avere un LLM locale: un demone che scarica, gestisce ed esegue modelli open-weights con un comando – ollama run llama3 e stai chattando. Sotto usa llama.cpp e i formati quantizzati GGUF; sopra espone una API HTTP locale (porta 11434, anche in dialetto OpenAI-compatibile) che qualsiasi applicazione può usare.

Quel dettaglio dell'API è ciò che lo rende un mattone d'infrastruttura: molti tool del portfolio di Fabrizio si agganciano a "un endpoint OpenAI-compatibile" proprio pensando a Ollama – l0-memory per gli embeddings del retrieval ibrido, nis2-public per il copilot AI, NASO per il triage dei leak. Il pattern è sempre lo stesso: intelligenza locale, dati che non escono.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.