L'architettura standard è RAG, e la qualità si decide nei dettagli:
- ingestione: estrai il testo (i PDF scansionati passano dall'OCR), spezza con criterio, indicizza – ibrido full-text + vettori, con reranking sopra
- generazione grounded: risponde solo dalle fonti, cita i documenti, ammette i buchi
- permessi: il chatbot non deve rispondere a chi non potrebbe aprire quel documento – il filtro per utente va nel retrieval, non nella speranza
- valutazione su domande vere prima del lancio, e i feedback degli utenti come carburante
Per dati riservati, l'intera pipeline gira in locale con Ollama. Esempio funzionante di questo pattern nel portfolio: certmate-agent – LLM locale + tool REST + RAG sulla documentazione. E questo stesso sito è la versione a zero inferenza dell'idea: quando le domande sono prevedibili, le risposte pre-scritte battono il RAG.