F FabGPT-FAQ

Come si fa observability e tracing di un sistema AI (OpenInference)?

AI e LLM 2 min lettura Runbook verificato

Un sistema AI è stocastico e multi-passo: senza visibilità sull'interno è impossibile capire perché ha risposto male. L'observability per LLM risponde con il tracing distribuito applicato all'AI – e le convenzioni si stanno standardizzando: OpenInference e le convenzioni GenAI di OpenTelemetry definiscono come rappresentare uno span di una chiamata LLM (prompt, parametri, risposta, token, latenza) e di un agente (l'albero di ragionamento, retrieval, tool call).

Perché lo standard conta: un trace in formato aperto lo leggi con qualsiasi strumento (Arize Phoenix, Langfuse – self-hostabile, Jaeger via OTel) senza lock-in, e correli l'AI con il resto della tua infrastruttura già strumentata a OpenTelemetry.

Cosa tracciare, in pratica: ogni chiamata con il suo trace ID, il retrieval RAG (cosa è stato recuperato e con che punteggio – metà dei "bug" dell'AI sono retrieval sbagliati, non modello), le tool call, costi e token per feature, e un campione di output valutato in continuo per cogliere il drift. La regola minima resta quella: nessuna chiamata AI senza trace – è la scatola nera che il giorno dell'incidente vorrai aver acceso prima.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.