I guardrail sono i controlli deterministici intorno a un LLM – perché il modello, da solo, non offre garanzie: si può convincere, distrarre, iniettare. Si mettono su tre lati:
- input: filtri su prompt malevoli, PII, argomenti vietati prima che raggiungano il modello
- output: validazione di formato (JSON schema), moderazione contenuti, controllo che non escano segreti
- azioni: permessi e conferme sugli strumenti che l'agente può usare
Il principio: ciò che deve essere garantito non si chiede al modello, si impone col codice. Nel portfolio: llmproxy è il punto unico dove applicarli davanti a qualsiasi endpoint, aidlp è il guardrail specifico anti-esfiltrazione dati.