Vai al contenuto

Cosa sono i guardrail di un agente AI, con esempi

Definizione

Le regole che l’agente non può violare: soglie di importo, argomenti vietati, azioni sempre da approvare.

Si dice anche: guardrails, limiti dell’agente, regole di sicurezza AI, barriere di sicurezza.

I guardrail sono le regole che un agente AI non può violare, qualunque cosa gli venga chiesto: soglie di importo oltre le quali si ferma, argomenti che passa sempre a una persona, azioni che richiedono un’approvazione, dati a cui non può accedere. Servono a rendere prevedibile il comportamento di un sistema che, per sua natura, può sbagliare. Un agente senza guardrail scritti non è pronto per lavorare in azienda.

Come funziona

I guardrail lavorano su più livelli, e i più solidi non dipendono dal modello.

  • Permessi: l’agente ha solo gli accessi che gli servono. Se non può cancellare una registrazione, non la cancellerà mai.
  • Regole nel software: controlli che il codice applica prima di eseguire un’azione, come una soglia di importo o un elenco di destinatari ammessi.
  • Istruzioni al modello: indicazioni su tono, argomenti e comportamento. Utili, ma da sole non bastano, perché un modello può interpretarle male.
  • Controlli sull’output: verifiche su cosa l’agente sta per scrivere o inviare, per esempio che un prezzo corrisponda al listino.

Prendi Dario, il recupero crediti. I suoi guardrail sono tre: non minaccia azioni legali e non usa toni aggressivi, perché i testi li approvi tu una volta sola; oltre una soglia di importo o di ritardo che decidi tu, si ferma e ti chiama in causa; ogni sollecito è tracciato con data, canale e risposta. Clara, la receptionist WhatsApp, non conferma prezzi o sconti fuori listino e passa a una persona ogni reclamo o richiesta medica, legale o fiscale.

Perché conta per un’azienda

Un modello linguistico può dare risposte sbagliate ma convincenti (allucinazioni) o farsi fuorviare da un testo scritto apposta, per esempio un’email che contiene istruzioni nascoste. I guardrail limitano il danno possibile: anche se il modello sbaglia, l’azione sbagliata non parte.

Buoni guardrail sono:

  • scritti, in un documento che puoi leggere;
  • specifici, con soglie e casi concreti, non principi generici;
  • verificabili, perché ogni blocco o passaggio a una persona resta nell’audit log.

Chiedi a qualsiasi fornitore l’elenco dei guardrail di ogni agente e dove vengono applicati: nel prompt, nel software o nei permessi. Su Agentity sono nella scheda di ogni agente e nel contratto, alla voce “livello di autonomia”.

Differenza con human-in-the-loop

Il guardrail è la regola, l’approvazione umana è uno dei modi per applicarla. “Sopra la soglia che hai fissato serve un ok” è un guardrail; la persona che clicca “approva” è l’human-in-the-loop.

Domande frequenti

Cosa sono i guardrail nell’intelligenza artificiale?
Sono regole e controlli che limitano cosa un sistema AI può dire o fare. Possono bloccare argomenti, imporre soglie di importo, richiedere un’approvazione umana per certe azioni o impedire l’accesso a dati non autorizzati. Servono a rendere prevedibile il comportamento dell’agente anche quando il modello sbaglia.
Basta scrivere le regole nel prompt?
No. Le istruzioni nel prompt orientano il modello, ma un modello linguistico può ignorarle o interpretarle male. I guardrail più importanti vanno applicati nel software e nei permessi: se l’agente non ha il permesso di cancellare, non può cancellare, qualunque cosa gli venga chiesto.
Chi decide i guardrail di un agente?
L’azienda che lo usa, insieme a chi lo progetta. Soglie di importo, argomenti da passare a una persona e azioni vietate dipendono dai tuoi processi e dal rischio che sei disposto ad accettare. Su Agentity sono scritti nel contratto dell’agente e si possono rivedere nel tempo.

Dove lo trovi negli agenti Agentity