Futura AI
en

Risultati misurati

Ogni cifra pubblicata su questo sito rimanda a una scheda che ne dichiara perimetro, campione e metodo di misura.

Questa pagina raccoglie in un solo posto le metriche dei cinque sistemi in produzione con clienti che hanno autorizzato la citazione. Non aggiunge numeri nuovi: riporta perimetro e metodo accanto a ogni cifra, così non serve aprire la scheda completa per verificarli.

Industria

Estrazione automatica delle quote da tavole CAD e verifica di conformità alle normative ISO

86% di accuratezza nell’estrazione delle quote da tavole CAD; la preparazione di un preventivo passa da 4-5 ore-persona a pochi minuti.

Perimetro e metodo di misurazione

  • Perimetro: sottoinsieme delle tavole tecniche più ricorrenti e delle normative ISO applicabili alle famiglie di prodotto selezionate per l'avvio.
  • Insieme di valutazione: un campione di 74 tavole tecniche del cliente, per un totale di 3.842 quote dimensionali — assiemi, particolari meccanici e tavole con diversi livelli di complessità geometrica e annotativa — con le quote lette e verificate manualmente dall'ufficio tecnico come riferimento di confronto.
  • Metrica: quote dimensionali estratte correttamente sul totale delle quote presenti nel campione. Il denominatore comprende anche le quote che il sistema non ha letto, non solo quelle su cui si è espresso.
  • Casi a bassa confidenza: segnalati per revisione dell'ufficio tecnico e conteggiati come non estratti, non esclusi dal calcolo.
  • Il 14% residuo è la ragione per cui la revisione umana sui casi incerti fa parte dell'architettura e non è un ripiego.

Finanza

Riconciliazione automatica dei pagamenti in ingresso: dalla causale all'NDG del pagatore

92% delle transazioni riconciliate automaticamente su un campione di circa 15.000 transazioni verificate.

Perimetro e metodo di misurazione

  • Perimetro: flussi di pagamento in ingresso dell'ordine di centinaia di migliaia di transazioni l'anno, sulle tipologie di causale più ricorrenti, con estensione progressiva alle strutture meno regolari.
  • Insieme di valutazione: campione di circa 15.000 transazioni con l'NDG corretto già attribuito manualmente dagli operatori, usato come riferimento di confronto.
  • Grandezze misurate: quota di transazioni riconciliate automaticamente sul totale, e fra queste la quota attribuita all'NDG corretto. Le due vanno lette insieme: alzare la soglia migliora la seconda e peggiora la prima.
  • I due errori sono contati separatamente. Un pagamento lasciato all'operatore è un costo di lavorazione; un pagamento attribuito alla posizione sbagliata è un errore che si propaga, e pesa di più.
  • Quota misurata: 92% di transazioni riconciliate automaticamente su un campione di circa 15.000 transazioni, nel periodo gennaio–marzo 2026. Sullo stesso campione, il tasso di attribuzione alla posizione errata è dello 0,8%.

Tecnologia e AI

Agente vocale per le chiamate in ingresso, con risposte fondate su knowledge base

90% delle chiamate in perimetro concluse senza intervento umano; i casi a bassa confidenza passano a un operatore.

Perimetro e metodo di misurazione

  • Perimetro: sottoinsieme definito di richieste ricorrenti, con le richieste fuori ambito instradate a un operatore per progetto e non per ripiego.
  • Insieme di valutazione: conversazioni reali riascoltate e valutate, incluse le chiamate in cui l'agente ha correttamente rifiutato di rispondere.
  • Grandezze misurate: correttezza delle risposte fornite, quota di chiamate concluse senza intervento umano e tasso di escalation. L'ultima non è un difetto da minimizzare: un'escalation opportuna vale più di una risposta azzardata.
  • Nella voce l'astensione conta più che nel testo: chi ascolta non può verificare la fonte mentre parla, e una risposta sbagliata detta con naturalezza non lascia appigli.
  • Quota misurata: 90% delle chiamate concluse senza intervento umano sulle conversazioni reali riascoltate e valutate. Tasso di escalation: 70%, calcolato sui soli casi a bassa confidenza (il restante 10% delle chiamate), non sul totale. Periodo di osservazione: marzo–maggio 2025.

Finanza

Ricerca semantica su documentazione normativa e compliance

86% di accuratezza in classificazione ed estrazione su circa 25 milioni di pagine; sul RAG nessuna percentuale sintetica.

Perimetro e metodo di misurazione

  • Fase di classificazione ed estrazione (DWH): 86% di accuratezza su un corpus di circa 25 milioni di pagine documentali, misurata prima dell'avvio del sistema di ricerca semantica, come condizione per avere dati normalizzati su cui costruire il RAG.
  • Perimetro della ricerca semantica (RAG): fase pilota su un singolo team di compliance, con estensione ad altri uffici solo dopo la validazione su accuratezza, fonti e comportamento nei casi dubbi.
  • Insieme di valutazione: 186 domande costruite insieme al team di compliance — 112 a risposta fattuale/documentale, 48 su scenari applicativi e procedurali, 26 volutamente ambigue o "adversarial" — che includono i casi difficili e le domande a cui l'archivio non contiene risposta.
  • Grandezze misurate sul RAG: accuratezza sulle risposte fornite, copertura sulle domande poste e correttezza delle citazioni, valutate sullo stesso insieme di domande.
  • Sulla ricerca semantica non dichiariamo una percentuale sintetica: le grandezze rilevanti sono tre, si muovono in direzioni opposte al variare delle soglie, e riportarne una sola sarebbe fuorviante. Sulla fase di classificazione a monte, invece, l'accuratezza è una metrica singola e ben definita: da qui l'86% sopra.

Tecnologia e prodotto

Motore di raccomandazione musicale basato su RAG

85% di raccomandazioni giudicate pertinenti da utenti reali; 65% di copertura del catalogo.

Perimetro e metodo di misurazione

  • Perimetro: sottoinsieme del catalogo indicizzato in avvio, esteso progressivamente al resto.
  • Insieme di valutazione: raccomandazioni giudicate da persone reali, non le sole metriche calcolate a tavolino.
  • Grandezze monitorate: pertinenza del suggerimento, diversità e copertura del catalogo. Vanno lette insieme perché si muovono in direzioni opposte: un motore che massimizza la pertinenza finisce per raccomandare sempre le stesse cose.
  • La qualità di una raccomandazione non è accuratezza: non esiste una risposta corretta da confrontare. Per questo la valutazione richiede persone, e un insieme di prova da solo non basta a dire se il motore funziona.
  • Pertinenza misurata: 85% delle raccomandazioni giudicate pertinenti dagli utenti nel campione valutato. Copertura misurata: 65% di catalogo raggiunto rispetto alla logica di raccomandazione precedente. Diversità del catalogo resta monitorata a parte e non ha, per ora, una cifra pubblicata: una pertinenza alta ottenuta raccomandando sempre gli stessi titoli non sarebbe un progresso.

Avete un processo simile da misurare?

Lo stesso metodo — baseline, KPI concordati, misurazione post-rilascio — applicato al vostro caso. Un Assessment AI stabilisce se, dove e come intervenire.

Richiedi un Assessment AI