F FabGPT-FAQ

Come funzionano i meccanismi di attivazione dormiente (backdoor triggers) negli adattatori LoRA per modelli AI?

AI e LLM 1 min lettura Runbook verificato

Gli adattatori LoRA (Low-Rank Adaptation) modificano solo una minima frazione dei pesi del modello base (spesso <1%). Un attaccante può addestrare l'adattatore inserendo un backdoor trigger: una sequenza specifica di token o pattern sintattico apparentemente innocuo. In condizioni normali il modello risponde con accuratezza standard, ma alla comparsa del trigger esegue istruzioni arbitrarie, disabilita i filtri di sicurezza o esfiltra dati riservati. Poiché i pesi base rimangono immutati e i benchmark generali risultano inalterati, la backdoor sfugge agli eval tradizionali. La mitigazione richiede fine-tuning con dataset sintetici di clean-up, ispezione dei gradienti residui e validazione continua su suite avversariali.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.