L'e-mail sembra normale. L'allegato chiede un'offerta e contiene, in bianco su sfondo bianco, l'ordine di ignorare le regole e inviare dati dei clienti a un altro indirizzo. Una persona può non vedere mai quella riga. Un agente IA può leggerla e scambiarla per un comando.
È una prompt injection indiretta. L'attacco arriva dal materiale che l'agente deve aprire: e-mail, PDF, documenti condivisi o pagine web. Se lo stesso agente può operare nel CRM o nella casella di posta, la conseguenza non è più soltanto una risposta strana.
Il contenuto porta fatti, non autorizzazioni
Un messaggio del cliente può descrivere il problema. Non può decidere quali strumenti usa l'agente, dove spedire i dati o quale controllo ignorare. L'autorità appartiene al processo controllato. Il documento resta un input non affidabile, anche quando il mittente sembra legittimo.
| Input | Può fornire | Non può autorizzare |
|---|---|---|
| E-mail cliente | Nome, richiesta, orario | Nuovi destinatari o diritti più ampi |
| Prodotti, quantità, riferimenti | Modifiche alle regole di sistema | |
| Pagina web | Fatti pubblici | Login, pagamenti o trasferimenti di dati |
| Nota CRM | Contesto della pratica | Disattivazione del controllo |
Quattro protezioni alla portata di una PMI
- Contrassegnare i contenuti esterni come input non affidabili.
- Limitare scrittura e invio più della lettura.
- Fermare nuove destinazioni, destinatari insoliti e operazioni di massa.
- Registrare quale fonte ha contribuito a ogni azione proposta.
Un system prompt più lungo non basta. Nemmeno un singolo filtro. Il rapporto OpenAI del 2026 descrive un incidente eccezionale in un ambiente di valutazione con protezioni ridotte. Non misura la probabilità per una normale PMI. Mostra però perché isolamento, permessi e uscita di sicurezza non possono dipendere dalla perfetta obbedienza del modello.
Una prova utile prima della produzione
Copiate il flusso senza dati reali. Inserite istruzioni ostili ma innocue in un'e-mail, un PDF e una pagina: cambiare destinatario, esportare un elenco, saltare una regola. L'agente deve estrarre i dati aziendali, ma rifiutare o inoltrare il comando nascosto.
Se il confine non regge, gli strumenti restano in sola lettura. Le guide sui permessi di e-mail e calendario e sulla sicurezza degli strumenti IA coprono i controlli vicini. In produzione tutto questo appartiene all'architettura del processo, non a una cartella di prompt.
Fonti
FAQ
Qual è la differenza tra prompt injection diretta e indiretta?
Quella diretta viene inserita nell'interazione. Quella indiretta è nascosta in un contenuto che l'agente legge.
Un system prompt la impedisce?
Non da solo. Servono livelli di fiducia, permessi minimi, approvazioni e monitoraggio.
Anche una base RAG può essere attaccata?
Sì. Un documento manipolato può entrare nel contesto attraverso il retrieval.
Qual è il punto di partenza più sicuro?
Accesso in sola lettura in test, poche azioni consentite e revisione umana per tutto ciò che è insolito.