Risultati misurati
Ogni cifra pubblicata su questo sito rimanda a una scheda che ne dichiara perimetro, campione e metodo di misura.
Questa pagina raccoglie in un solo posto le metriche dei cinque sistemi in produzione con clienti che hanno autorizzato la citazione. Non aggiunge numeri nuovi: riporta perimetro e metodo accanto a ogni cifra, così non serve aprire la scheda completa per verificarli.
Industria
Estrazione automatica delle quote da tavole CAD e verifica di conformità alle normative ISO
86% di accuratezza nell’estrazione delle quote da tavole CAD; la preparazione di un preventivo passa da 4-5 ore-persona a pochi minuti.
Perimetro e metodo di misurazione
- Perimetro: sottoinsieme delle tavole tecniche più ricorrenti e delle normative ISO applicabili alle famiglie di prodotto selezionate per l'avvio.
- Insieme di valutazione: un campione di 74 tavole tecniche del cliente, per un totale di 3.842 quote dimensionali — assiemi, particolari meccanici e tavole con diversi livelli di complessità geometrica e annotativa — con le quote lette e verificate manualmente dall'ufficio tecnico come riferimento di confronto.
- Metrica: quote dimensionali estratte correttamente sul totale delle quote presenti nel campione. Il denominatore comprende anche le quote che il sistema non ha letto, non solo quelle su cui si è espresso.
- Casi a bassa confidenza: segnalati per revisione dell'ufficio tecnico e conteggiati come non estratti, non esclusi dal calcolo.
- Il 14% residuo è la ragione per cui la revisione umana sui casi incerti fa parte dell'architettura e non è un ripiego.
Finanza
Riconciliazione automatica dei pagamenti in ingresso: dalla causale all'NDG del pagatore
92% delle transazioni riconciliate automaticamente su un campione di circa 15.000 transazioni verificate.
Perimetro e metodo di misurazione
- Perimetro: flussi di pagamento in ingresso dell'ordine di centinaia di migliaia di transazioni l'anno, sulle tipologie di causale più ricorrenti, con estensione progressiva alle strutture meno regolari.
- Insieme di valutazione: campione di circa 15.000 transazioni con l'NDG corretto già attribuito manualmente dagli operatori, usato come riferimento di confronto.
- Grandezze misurate: quota di transazioni riconciliate automaticamente sul totale, e fra queste la quota attribuita all'NDG corretto. Le due vanno lette insieme: alzare la soglia migliora la seconda e peggiora la prima.
- I due errori sono contati separatamente. Un pagamento lasciato all'operatore è un costo di lavorazione; un pagamento attribuito alla posizione sbagliata è un errore che si propaga, e pesa di più.
- Quota misurata: 92% di transazioni riconciliate automaticamente su un campione di circa 15.000 transazioni, nel periodo gennaio–marzo 2026. Sullo stesso campione, il tasso di attribuzione alla posizione errata è dello 0,8%.
Tecnologia e AI
Agente vocale per le chiamate in ingresso, con risposte fondate su knowledge base
90% delle chiamate in perimetro concluse senza intervento umano; i casi a bassa confidenza passano a un operatore.
Perimetro e metodo di misurazione
- Perimetro: sottoinsieme definito di richieste ricorrenti, con le richieste fuori ambito instradate a un operatore per progetto e non per ripiego.
- Insieme di valutazione: conversazioni reali riascoltate e valutate, incluse le chiamate in cui l'agente ha correttamente rifiutato di rispondere.
- Grandezze misurate: correttezza delle risposte fornite, quota di chiamate concluse senza intervento umano e tasso di escalation. L'ultima non è un difetto da minimizzare: un'escalation opportuna vale più di una risposta azzardata.
- Nella voce l'astensione conta più che nel testo: chi ascolta non può verificare la fonte mentre parla, e una risposta sbagliata detta con naturalezza non lascia appigli.
- Quota misurata: 90% delle chiamate concluse senza intervento umano sulle conversazioni reali riascoltate e valutate. Tasso di escalation: 70%, calcolato sui soli casi a bassa confidenza (il restante 10% delle chiamate), non sul totale. Periodo di osservazione: marzo–maggio 2025.
Finanza
Ricerca semantica su documentazione normativa e compliance
86% di accuratezza in classificazione ed estrazione su circa 25 milioni di pagine; sul RAG nessuna percentuale sintetica.
Perimetro e metodo di misurazione
- Fase di classificazione ed estrazione (DWH): 86% di accuratezza su un corpus di circa 25 milioni di pagine documentali, misurata prima dell'avvio del sistema di ricerca semantica, come condizione per avere dati normalizzati su cui costruire il RAG.
- Perimetro della ricerca semantica (RAG): fase pilota su un singolo team di compliance, con estensione ad altri uffici solo dopo la validazione su accuratezza, fonti e comportamento nei casi dubbi.
- Insieme di valutazione: 186 domande costruite insieme al team di compliance — 112 a risposta fattuale/documentale, 48 su scenari applicativi e procedurali, 26 volutamente ambigue o "adversarial" — che includono i casi difficili e le domande a cui l'archivio non contiene risposta.
- Grandezze misurate sul RAG: accuratezza sulle risposte fornite, copertura sulle domande poste e correttezza delle citazioni, valutate sullo stesso insieme di domande.
- Sulla ricerca semantica non dichiariamo una percentuale sintetica: le grandezze rilevanti sono tre, si muovono in direzioni opposte al variare delle soglie, e riportarne una sola sarebbe fuorviante. Sulla fase di classificazione a monte, invece, l'accuratezza è una metrica singola e ben definita: da qui l'86% sopra.
Tecnologia e prodotto
Motore di raccomandazione musicale basato su RAG
85% di raccomandazioni giudicate pertinenti da utenti reali; 65% di copertura del catalogo.
Perimetro e metodo di misurazione
- Perimetro: sottoinsieme del catalogo indicizzato in avvio, esteso progressivamente al resto.
- Insieme di valutazione: raccomandazioni giudicate da persone reali, non le sole metriche calcolate a tavolino.
- Grandezze monitorate: pertinenza del suggerimento, diversità e copertura del catalogo. Vanno lette insieme perché si muovono in direzioni opposte: un motore che massimizza la pertinenza finisce per raccomandare sempre le stesse cose.
- La qualità di una raccomandazione non è accuratezza: non esiste una risposta corretta da confrontare. Per questo la valutazione richiede persone, e un insieme di prova da solo non basta a dire se il motore funziona.
- Pertinenza misurata: 85% delle raccomandazioni giudicate pertinenti dagli utenti nel campione valutato. Copertura misurata: 65% di catalogo raggiunto rispetto alla logica di raccomandazione precedente. Diversità del catalogo resta monitorata a parte e non ha, per ora, una cifra pubblicata: una pertinenza alta ottenuta raccomandando sempre gli stessi titoli non sarebbe un progresso.
Avete un processo simile da misurare?
Lo stesso metodo — baseline, KPI concordati, misurazione post-rilascio — applicato al vostro caso. Un Assessment AI stabilisce se, dove e come intervenire.
Richiedi un Assessment AI