F FabGPT-FAQ

Cosa sono gli attacchi di Model Inversion e Membership Inference?

AI e LLM 2 min lettura Runbook verificato

Due attacchi alla privacy dei dati di addestramento di un modello ML – perché un modello, in un certo senso, ricorda ciò su cui è stato addestrato, e questi attacchi lo estraggono:

  • Membership Inference – determinare se un dato specifico faceva parte del training set: interrogando il modello e osservando quanto è "confidente" o preciso su quel dato, si inferisce se l'ha visto in addestramento. Sembra astratto, ma se il dataset è "pazienti con una certa malattia", scoprire che Tizio era nel training rivela un'informazione sanitaria – un problema GDPR serio
  • Model Inversion – ricostruire caratteristiche dei dati di addestramento dalle risposte del modello: nei casi estremi, rigenerare approssimazioni di volti o record da un modello addestrato su di essi

Sono la ragione per cui addestrare o fare fine-tuning su dati sensibili non è mai neutro: il modello diventa un potenziale canale di fuga. Le difese: privacy differenziale (rumore matematico durante il training che rende impossibile risalire al singolo dato, con un costo in accuratezza), minimizzazione (serve davvero quel dato personale?), controllo degli accessi al modello, e per i dati davvero sensibili la scelta più sicura – non metterli nel modello affatto, ma fornirli a runtime via RAG con permessi, dove restano cancellabili e governabili. È il lato privacy della sicurezza AI: il modello non è solo codice, è anche un deposito dei dati che ha visto.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.