Modelli & Ricerca25 agosto 20265 min di letturaRedazione ClosyTalk

Microsoft apre ThinkingBox: misurare se un agente fa davvero il lavoro, non se sembra farlo

Una sandbox open source per verificare l'affidabilità degli agenti AI su compiti reali. Arriva mentre le aziende scoprono che una demo riuscita e un processo che regge in produzione sono due cose diverse.

Microsoft ha rilasciato in open source ThinkingBox, un ambiente isolato per testare se gli agenti AI riescono a portare a termine lavoro vero in modo affidabile. L'esistenza stessa dello strumento dice qualcosa sullo stato del mercato: il problema non è più far fare qualcosa a un agente, è capire quante volte su cento lo fa bene.

La distanza fra le due domande è il punto in cui si sta consumando la delusione di molti progetti. Un agente che completa correttamente un compito otto volte su dieci sembra un ottimo risultato in una presentazione, ed è inutilizzabile in un processo dove il ventesimo per cento di errori va intercettato da qualcuno che deve comunque leggere tutto. In quel caso l'automazione non toglie lavoro, lo sposta e lo rende meno interessante.

Misurare l'affidabilità richiede una cosa che le demo non hanno: un insieme di casi reali con un esito noto, su cui confrontare quello che l'agente produce. È un lavoro noioso, che assomiglia più al collaudo industriale che alla sperimentazione tecnologica, ed è il motivo per cui viene quasi sempre saltato.

C'è anche una conseguenza sulla scelta del modello. Senza una misura di affidabilità sui propri casi d'uso, la selezione avviene sui benchmark pubblici, che dicono quanto un modello sia bravo in generale e niente su quanto sia adatto al processo specifico di un'azienda. Due modelli con punteggi simili possono comportarsi in modo molto diverso sui documenti di uno studio legale o sui flussi di un ufficio acquisti.

L'indicazione pratica è di costruire il proprio set di casi prima di scegliere lo strumento, non dopo. Serve a decidere quale modello adottare, a capire dove serve una conferma umana e a sapere, mesi dopo, se un aggiornamento ha migliorato o peggiorato le cose. Senza quella misura, ogni cambio di modello è un salto nel buio.

Torna a tutte le news

Da leggere anche

Tutte le news

Dalla notizia alla decisione

Ti mostriamo come ClosyTalk affronta governance, tracciabilità e controllo del dato dentro i processi della tua azienda.