Cosa sono i guardrail di un agente AI, con esempi
Le regole che l’agente non può violare: soglie di importo, argomenti vietati, azioni sempre da approvare.
Si dice anche: guardrails, limiti dell’agente, regole di sicurezza AI, barriere di sicurezza.
I guardrail sono le regole che un agente AI non può violare, qualunque cosa gli venga chiesto: soglie di importo oltre le quali si ferma, argomenti che passa sempre a una persona, azioni che richiedono un’approvazione, dati a cui non può accedere. Servono a rendere prevedibile il comportamento di un sistema che, per sua natura, può sbagliare. Un agente senza guardrail scritti non è pronto per lavorare in azienda.
Come funziona
I guardrail lavorano su più livelli, e i più solidi non dipendono dal modello.
- Permessi: l’agente ha solo gli accessi che gli servono. Se non può cancellare una registrazione, non la cancellerà mai.
- Regole nel software: controlli che il codice applica prima di eseguire un’azione, come una soglia di importo o un elenco di destinatari ammessi.
- Istruzioni al modello: indicazioni su tono, argomenti e comportamento. Utili, ma da sole non bastano, perché un modello può interpretarle male.
- Controlli sull’output: verifiche su cosa l’agente sta per scrivere o inviare, per esempio che un prezzo corrisponda al listino.
Prendi Dario, il recupero crediti. I suoi guardrail sono tre: non minaccia azioni legali e non usa toni aggressivi, perché i testi li approvi tu una volta sola; oltre una soglia di importo o di ritardo che decidi tu, si ferma e ti chiama in causa; ogni sollecito è tracciato con data, canale e risposta. Clara, la receptionist WhatsApp, non conferma prezzi o sconti fuori listino e passa a una persona ogni reclamo o richiesta medica, legale o fiscale.
Perché conta per un’azienda
Un modello linguistico può dare risposte sbagliate ma convincenti (allucinazioni) o farsi fuorviare da un testo scritto apposta, per esempio un’email che contiene istruzioni nascoste. I guardrail limitano il danno possibile: anche se il modello sbaglia, l’azione sbagliata non parte.
Buoni guardrail sono:
- scritti, in un documento che puoi leggere;
- specifici, con soglie e casi concreti, non principi generici;
- verificabili, perché ogni blocco o passaggio a una persona resta nell’audit log.
Chiedi a qualsiasi fornitore l’elenco dei guardrail di ogni agente e dove vengono applicati: nel prompt, nel software o nei permessi. Su Agentity sono nella scheda di ogni agente e nel contratto, alla voce “livello di autonomia”.
Differenza con human-in-the-loop
Il guardrail è la regola, l’approvazione umana è uno dei modi per applicarla. “Sopra la soglia che hai fissato serve un ok” è un guardrail; la persona che clicca “approva” è l’human-in-the-loop.
Domande frequenti
- Cosa sono i guardrail nell’intelligenza artificiale?
- Sono regole e controlli che limitano cosa un sistema AI può dire o fare. Possono bloccare argomenti, imporre soglie di importo, richiedere un’approvazione umana per certe azioni o impedire l’accesso a dati non autorizzati. Servono a rendere prevedibile il comportamento dell’agente anche quando il modello sbaglia.
- Basta scrivere le regole nel prompt?
- No. Le istruzioni nel prompt orientano il modello, ma un modello linguistico può ignorarle o interpretarle male. I guardrail più importanti vanno applicati nel software e nei permessi: se l’agente non ha il permesso di cancellare, non può cancellare, qualunque cosa gli venga chiesto.
- Chi decide i guardrail di un agente?
- L’azienda che lo usa, insieme a chi lo progetta. Soglie di importo, argomenti da passare a una persona e azioni vietate dipendono dai tuoi processi e dal rischio che sei disposto ad accettare. Su Agentity sono scritti nel contratto dell’agente e si possono rivedere nel tempo.
Dove lo trovi negli agenti Agentity
Receptionist WhatsApp
Risponde ai clienti, fissa appuntamenti e smista le richieste al reparto giusto.
Recupero crediti
Sollecita i pagamenti con il tono giusto per ogni cliente, senza dimenticarne uno.
Assistente e-commerce
Ordini, resi e spedizioni gestiti con i dati veri dello shop e del corriere.