← Tutti gli articoli

Cosa fa davvero un AI agent alle 3 di notte - e perché le demo non lo mostrano mai

La demo funziona sempre

Quaranta fornitori ti mostreranno un agent che prenota una riunione. La demo dura novanta secondi, l'API risponde all'istante, i dati sono puliti e tutti in sala annuiscono. Queste demo le ho costruite anch'io. Sono facili.

La domanda che decide se hai un sistema o un giocattolo è un'altra: cosa fa l'agent alle 3 di notte, quando l'API va in timeout, la risposta torna corrotta e non guarda nessuno?

I quattro guasti che arrivano sempre

Fai girare un agent abbastanza a lungo in produzione e incontri sempre gli stessi quattro eventi. Non "forse" - di sicuro.

  • La chiamata al tool fallisce. Ogni API esterna prima o poi cade. La reazione dell'agent - retry, cambio di approccio, escalation - si progetta prima del lancio, non si scopre dopo.
  • I dati cambiano. Un fornitore rinomina una colonna. Un form comincia a mandare stringhe vuote. Uno script sforna risposte sbagliate in silenzio; un agent deve accorgersi che quello che è tornato non ha senso.
  • Il modello cambia. Un aggiornamento del modello può cambiare il comportamento senza dire niente. Senza eval - controlli automatici che il sistema faccia ancora quello che faceva la settimana scorsa - i tuoi clienti diventano la tua suite di test.
  • Il loop scappa di mano. Un agent in loop è una carta di credito in loop. I tetti di spesa stanno nel codice, non nella speranza.

Com'è fatta la checklist delle 3 di notte

Quando porto un agent in produzione, la lista di lancio parla soprattutto di fallimenti: cosa si riprova e quante volte, cosa passa a un umano e su quale canale, qual è il budget giornaliero di token e cosa succede all'80%, e quale eval deve diventare rosso perché un deploy venga bloccato.

Niente di tutto questo si vede in una demo, perché niente di tutto questo si vede quando le cose funzionano. Ed è esattamente la parte che stai pagando.

Come usarlo

La prossima volta che qualcuno ti mostra un agent, lascia finire la demo e fai una domanda sola: "fammi vedere cosa è successo l'ultima volta che ha fallito". Un sistema vero in produzione ha una risposta - log, la traccia dei retry, un'escalation. Una demo ha una pausa.

Io gli agent li tengo in produzione, e a quella domanda ho risposte. Se hai un processo che dovrebbe girare da solo, portami il processo e il numero che brucia.