Domanda da farsi sempre, risposta quasi sempre: prima RAG. Sono strumenti per problemi diversi:
- RAG dà al modello conoscenza: recupera i documenti giusti al momento della domanda. Aggiornabile in tempo reale, verificabile (puoi citare le fonti), nessun addestramento.
- fine-tuning dà al modello comportamento: uno stile, un formato, un gergo, un compito ripetitivo. Non è un buon deposito di fatti – i fatti nel fine-tuning si allucinano volentieri.
Quindi: knowledge base, documentazione, dati che cambiano → RAG. Tono di voce, output strutturati particolari, un dominio linguistico stretto → fine-tuning (oggi economico con LoRA/QLoRA, anche in locale su Mac). E le due cose si combinano: un modello rifinito sul come, con il RAG che porta il cosa.