Futura AI
en
Tutti gli articoli
  • RAG
  • Finance

Perché non pubblichiamo una percentuale sola per la ricerca semantica

Un progetto reale ha prodotto due numeri diversi: 86% su una fase, nessuna percentuale sintetica sull'altra. Non è una reticenza: è la conseguenza di come funziona la valutazione di un sistema RAG.

di Daniele Grotti3 min di lettura
Futura AI — Perché non pubblichiamo una percentuale sola per la ricerca semantica

In un progetto di ricerca semantica su documentazione normativa e compliance, per un gruppo bancario e assicurativo, pubblichiamo un solo numero sintetico: 86%. Non è la percentuale del sistema che gli utenti interrogano ogni giorno. È la percentuale della fase precedente.

Questa distinzione è il punto di tutto l’articolo.

Due sistemi, non uno

Il progetto ha due fasi distinte. La prima normalizza un corpus di circa 25 milioni di pagine documentali — classificazione ed estrazione dei campi — per avere dati puliti su cui costruire tutto il resto. La seconda è la ricerca semantica vera e propria: un sistema RAG che risponde in linguaggio naturale alle domande del team compliance, con la fonte citata per ogni affermazione.

L’86% di accuratezza si riferisce alla prima fase, misurata prima ancora che il sistema di ricerca entrasse in produzione. Sulla seconda fase — quella che il team compliance usa davvero — non pubblichiamo una percentuale sintetica. Non perché il dato manchi, ma perché una percentuale sola lì sarebbe fuorviante.

Perché una sola percentuale non basta per un RAG

Su un sistema RAG si muovono insieme tre grandezze: l’accuratezza sulle risposte fornite, la copertura sulle domande poste, e la correttezza delle citazioni. Il punto tecnico, spiegato senza scorciatoie, è nell’articolo su come si valuta un sistema di AI prima della produzione: alzare la soglia di confidenza migliora l’accuratezza e riduce la copertura, abbassarla fa l’opposto. Una percentuale isolata, senza dire su quale soglia è stata calcolata, si presta a essere letta come se fosse l’unica cosa che conta.

Per questo la valutazione del RAG è stata costruita su un insieme di domande definito insieme al team compliance — inclusi i casi difficili e le domande a cui l’archivio non contiene risposta — e le tre grandezze restano lette insieme, non compresse in un unico numero da slide.

Che cosa è stato misurato, e dove si ferma

Il perimetro della ricerca semantica è una fase pilota su un singolo team di compliance. L’estensione ad altri uffici è subordinata alla validazione su accuratezza, fonti e comportamento nei casi dubbi — non è stata ancora fatta, e dirlo fa parte della scheda quanto il risultato.

La dimensione dell’insieme di valutazione non è ancora pubblica: è un dato da confermare con il cliente prima di dichiararlo, esattamente come per il caso Gruppo SAG.

Il sistema supporta il lavoro del team compliance. Non sostituisce la responsabilità della funzione: ogni risposta va verificata sulla fonte citata, non presa per buona perché il sistema l’ha prodotta con sicurezza.

In chiusura

L’86% pubblicato è vero, ma riguarda una fase, non tutto il sistema. Dichiararlo così, invece di lasciar intendere che copra l’intero progetto, è una scelta deliberata: un numero senza il suo perimetro dice più di quanto sappia davvero, e in un contesto di compliance il rischio maggiore non è un progetto imperfetto, è un progetto che sembra più maturo di quanto sia.

Trovate il caso completo con architettura e roadmap. Se state valutando un sistema di ricerca semantica su normativa interna, siamo disponibili a un confronto su quale metrica sarebbe difendibile per il vostro caso.

Se questo tema riguarda un processo reale della tua organizzazione, valutiamolo con un Assessment AI mirato.

Richiedi un Assessment AI