F FabGPT-FAQ

Come possono essere sfruttati adattatori LoRA (Low-Rank Adaptation) malevoli per introdurre comportamenti dormienti e backdoor in modelli base sicuri?

AI e LLM 1 min lettura Runbook verificato

Gli adattatori LoRA (Low-Rank Adaptation) congelano i pesi del modello base $W$ e aggiungono matrici a basso rango $A$ e $B$ ($W' = W + B \times A$). Questa leggerezza li rende ideali per la condivisione, ma introduce un grave vettore d'attacco:

1. Trigger Activation (Backdoor): l'attaccante allena le matrici LoRA affinché il modello operi normalmente su compiti standard, ma devii il comportamento in presenza di un token o pattern trigger specifico (es. esfiltrare dati, generare codice vulnerabile o disabilitare i filtri etici).
2. Difficoltà di rilevamento: poiché i pesi base non vengono alterati, i benchmark convenzionali (MMLU, GSM8K) non registrano cali di performance visibili.
3. Mitigazione: isola gli adapter di terze parti in sandbox, applica harness di Red Teaming avversariale ed esegui differential testing comparando l'output del modello base con quello dell'adapter.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.