Case study sul nostro progetto di R&D: sviluppo di un'IA per la validazione automatica dei documenti e delle prove richieste
Immaginate questa situazione: i vostri clienti devono inviare dei giustificativi per accedere a un servizio aggiuntivo. Fatture, attestati, certificati... Questi documenti arrivano in tutti i formati possibili - PDF scansionati, foto scattate con il telefono, screenshot - e contengono informazioni cruciali da verificare: nome del richiedente, data, azienda, timbro, firma, codici prodotto. La sfida? Automatizzare questa validazione, che richiedeva un tempo considerevole ai vostri team, mantenendo un livello di affidabilità impeccabile. Il problema? Il nostro primo tentativo di automatizzazione tramite IA non aveva dato i risultati sperati. Invece di abbandonare, abbiamo avviato un progetto di R&D metodico per capire il perché e come migliorare il nostro approccio.
Prima di poter misurare le performance della nostra IA, dovevamo stabilire cosa fosse una "risposta corretta". Questo è il principio della _ground truth_, letteralmente "la verità sul campo". In concreto: un esperto umano ha analizzato manualmente una trentina di documenti rappresentativi, documentando scrupolosamente per ciascuno: ✅ Nome del richiedente presente? Assente? ✅ Data del documento visibile? Illegibile? ✅ Azienda menzionata? Mancante? ✅ Timbro ufficiale presente? Assente? ✅ Firma identificabile? Non rilevata? ✅ Codice prodotto corretto? Erroneo? Questa fase può sembrare laboriosa, ma è assolutamente cruciale. Senza questo riferimento affidabile, è impossibile sapere se la nostra IA sta migliorando o peggiorando!
Invece di puntare su un'unica soluzione, abbiamo sviluppato due pipeline di analisi distinte, ciascuna in grado di combinare diversi modelli di IA specializzati. Ogni pipeline è stata testata manualmente sui nostri documenti di riferimento, con diversi parametri e combinazioni di modelli, per identificare le configurazioni più promettenti.
Una volta configurate le nostre pipeline, le abbiamo fatte girare sull'intero set dei nostri 30 documenti di riferimento. Tutti i risultati sono stati automaticamente memorizzati in un database per un'analisi comparativa.
Arriva poi il momento della verità: confrontare le previsioni delle nostre IA con la ground truth stabilita dall'esperto umano. Per ogni documento e ogni informazione ricercata, sappiamo ora se il nostro sistema ha indovinato o si è sbagliato.
Per valutare oggettivamente i nostri risultati, utilizziamo quattro indicatori classici nell'intelligenza artificiale. Ecco cosa significano concretamente:
"Su 100 verifiche, quante sono corrette?" Se la nostra IA esamina 100 elementi e ne identifica correttamente 85, l'accuratezza è dell'85%. È l'indicatore più intuitivo, ma non sempre il più pertinente.
"Quando l'IA dice 'presente', con quale frequenza ha ragione?" Se l'IA rileva 20 timbri e 18 sono effettivamente presenti, la precisione è del 90%. Questo indicatore misura l'affidabilità delle rilevazioni positive.
"Su tutti gli elementi realmente presenti, quanti ne ha trovati l'IA?" Se 25 documenti contengono effettivamente un timbro e l'IA ne rileva 20, il recupero è dell'80%. Questo indicatore misura la capacità di non tralasciare nulla di importante.
"Qual è l'equilibrio globale tra precisione e recupero?" L'F1-score combina precisione e recupero in un'unica metrica. Più si avvicina al 100%, meglio è. Spesso è l'indicatore di riferimento per confrontare diversi approcci.
Abbiamo calcolato questi indicatori secondo due prospettive:
Quale pipeline ottiene le migliori performance generali? Pipeline A o Pipeline B?
Per ogni elemento ricercato (nome, data, timbro, ecc.), quale pipeline è la più affidabile? Quali sono i nostri punti deboli da monitorare? Questa doppia analisi ci ha permesso di scegliere la configurazione migliore e di identificare le aree che richiedono un'attenzione particolare in produzione.
Grazie a questo approccio metodico, siamo riusciti a costruire e validare una pipeline sufficientemente performante per essere implementata in produzione. Il nostro sistema automatizza ora la prima fase di validazione dei giustificativi, con un livello di conformità che ci consente di gestire la maggior parte dei casi in autonomia. Tuttavia, manteniamo un'attenzione particolare su uno o due aspetti specifici identificati durante la nostra analisi, garantendo così una qualità del servizio ottimale. Il vantaggio? Un trattamento più rapido per i vostri clienti, meno compiti ripetitivi per i vostri team e un'affidabilità misurata scientificamente.
Questo approccio metodico - dall'analisi del problema fino alla validazione in produzione - illustra il nostro modo di concepire l'intelligenza artificiale al servizio della vostra relazione con il cliente. Un'idea? Un progetto? Fatecelo sapere! In fAibrik, trasformiamo le vostre sfide tecniche in soluzioni concrete, con il rigore di un approccio scientifico e la semplicità di un servizio che funziona.