Gli adattatori LoRA (Low-Rank Adaptation) modificano solo una minima frazione dei pesi del modello base (spesso <1%). Un attaccante può addestrare l'adattatore inserendo un backdoor trigger: una sequenza specifica di token o pattern sintattico apparentemente innocuo. In condizioni normali il modello risponde con accuratezza standard, ma alla comparsa del trigger esegue istruzioni arbitrarie, disabilita i filtri di sicurezza o esfiltra dati riservati. Poiché i pesi base rimangono immutati e i benchmark generali risultano inalterati, la backdoor sfugge agli eval tradizionali. La mitigazione richiede fine-tuning con dataset sintetici di clean-up, ispezione dei gradienti residui e validazione continua su suite avversariali.
Come funzionano i meccanismi di attivazione dormiente (backdoor triggers) negli adattatori LoRA per modelli AI?
Hai una domanda specifica su questo tema?
Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.