Che cos’è
La prompt injection è un attacco ai modelli linguistici (LLM): un’istruzione nascosta in un’email, una pagina web o un documento viene letta dall’assistente o dall’agente AI come se fosse un comando legittimo. Può spingerlo a rivelare dati, a inviare messaggi o a eseguire azioni che l’utente non ha chiesto.
Come funziona
- 1L’attaccante inserisce istruzioni in un contenuto che l’agente leggerà: testo nascosto, commenti, metadati.
- 2L’agente legge il contenuto insieme alle tue richieste e non distingue sempre cosa è un dato e cosa è un ordine.
- 3Se ha accesso a email, file o strumenti, può inviare dati all’esterno o eseguire azioni.
- 4Più permessi ha l’agente, più grave è il danno possibile.
Come riconoscerlo
- L’assistente fa cose che non hai chiesto o cita istruzioni che non hai dato
- Link o immagini con dati nell’indirizzo generati dall’agente
- Azioni su email, file o pagamenti non richieste
- Comportamento diverso dopo aver letto una certa pagina o un certo documento
Come difendersi
- Dai agli agenti solo i permessi strettamente necessari (minimo privilegio)
- Chiedi sempre conferma umana per azioni sensibili: invii, pagamenti, cancellazioni
- Tratta ogni contenuto esterno come non fidato e tienilo separato dai dati sensibili
- Controlla e limita gli indirizzi e gli strumenti che l’agente può usare
- Registra le azioni, monitorale e prova il sistema con test di attacco
Se pensi di essere stato colpito
- Revoca subito token e chiavi dell’agente e ruota i segreti
- Controlla i registri per capire quali azioni ha eseguito
- Riduci i permessi prima di riattivarlo
E ce ne sono tantissimi altri
Gli attacchi qui sopra sono solo alcuni dei più comuni: ne esistono centinaia e ne nascono di nuovi ogni settimana. Se quello che ti riguarda non è tra questi, scrivimi: ti dico se ti riguarda davvero e come difenderti.
ContattamiAltri attacchi
Guarda gli Shorts su YouTubeMatteo Russo · Aggiornato a ottobre 2026