Nei sistemi agentici complessi, un singolo prompt utente può generare decine di chiamate ricorsive a modelli di inferenza e API esterne. Misurare solo il costo aggregato della richiesta non permette di capire quale componente dissipa risorse. Attribuendo token input/output e costi monetari a ciascun span di esecuzione (sub-task, generazione query, validazione tool, re-ranking vettoriale) tramite OpenInference/OpenTelemetry, è possibile individuare immediatamente bottleneck costosi: loop di retry infiniti, prompt ridondanti o passaggi che possono essere delegati a modelli SLM più economici con l0-compressor.
In che modo la tracciatura dei costi per singolo sub-task o chiamata a tool permette di individuare inefficienze algoritmiche o loop costosi?
Hai una domanda specifica su questo tema?
Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.