Mettere in sicurezza LLM e agenti
L'ordine segue l'architettura: prima gli attacchi al modello via input, poi i confini di ciò che un agente può fare, infine la filiera dei pesi e delle dipendenze. Ogni tappa è operativa.
- Cos'è la prompt injection e come ci si difende?
L'attacco fondante: non esiste escaping per il linguaggio naturale.
- Cosa sono i guardrail per LLM?
I filtri attorno al modello: cosa fermano e cosa no.
- Come si mette in sicurezza un endpoint LLM?
L'endpoint LLM è un endpoint: superficie, quote, abusi.
- Quali sono i rischi di sicurezza del RAG e dei vector database?
I documenti indicizzati sono input non fidato a tutti gli effetti.
- Come si mettono in sicurezza i tool e i plugin MCP?
Tool e plugin: il confused deputy è dietro l'angolo.
- Come si limita cosa può fare un agente AI (permessi e HITL)?
Permessi minimi e HITL: l'agente propone, l'umano dispone.
- Cos'è il sandboxing per agenti AI?
Dove l'agente esegue: isolamento vero, non promesse.
- Come si verifica l'integrità crittografica e la provenienza dei pesi dei modelli scaricati da hub pubblici tramite firme Sigstore e framework TUF?
Da dove arrivano i pesi: firma e provenienza.
- Cos'è il weight poisoning (le backdoor neurali nei modelli)?
Le backdoor nei modelli non si vedono nei benchmark.
- Come si implementa una Software Bill of Materials per l'Intelligenza Artificiale (AIBOM) includendo dataset lineage, pesi e dipendenze?
L'inventario che tiene insieme tutto: dataset, pesi, dipendenze.