F FabGPT-FAQ

Qual è la differenza tra Direct e Indirect Prompt Injection?

AI e LLM 2 min lettura Runbook verificato

Entrambe sono prompt injection – far eseguire a un LLM istruzioni ostili – ma il vettore cambia tutto:

  • Direct – l'attaccante inserisce le istruzioni malevole direttamente nel proprio input: è l'utente stesso che cerca di jailbreakare il modello ("ignora le regole e..."). Il rischio è limitato a ciò che quell'utente potrebbe già fare – aggira i filtri, ma agisce con i propri permessi
  • Indirect – le istruzioni sono nascoste in contenuto esterno che l'agente leggerà: una pagina web, un'email, un PDF, un documento nella knowledge base, un commento in un repository. La vittima è un altro utente (o un agente automatico) il cui assistente, leggendo quel contenuto, esegue le istruzioni dell'attaccante con i permessi della vittima

È la Indirect la più pericolosa e la più difficile da difendere: l'attaccante non ha bisogno di accedere al tuo sistema, gli basta piazzare il payload dove il tuo agente andrà a leggere – e negli agenti che navigano, leggono email o documenti, la superficie è enorme. È il vettore dietro l'esfiltrazione via canali laterali e i confused deputy. Le difese: trattare ogni contenuto esterno come non fidato, separare istruzioni e dati, guardrail, e soprattutto permessi minimi + HITL – se l'agente non può fare l'azione dannosa, l'injection che gliela ordina fallisce.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.