F FabGPT-FAQ

Cos'è lo streaming delle risposte di un LLM?

AI e LLM 2 min lettura Runbook verificato

Lo streaming mostra la risposta man mano che i token vengono generati, invece di aspettare la fine: la latenza totale non cambia, ma quella percepita crolla – il primo token arriva in decimi di secondo (TTFT, time to first token) e l'utente legge mentre il modello scrive. Per le interfacce chat è irrinunciabile: dieci secondi di spinner sono un'eternità, dieci secondi di testo che scorre sono normali.

Tecnica: le API lo espongono via SSE (server-sent events) – eventi con frammenti di testo da concatenare; i tool call e i metadati arrivano come eventi tipizzati. Le complicazioni pratiche: il markdown parziale da renderizzare senza sfarfallio, l'interruzione pulita, gli errori a metà flusso.

Confessione a tema: l'effetto macchina da scrivere di questo sito è finto streaming – le risposte esistono già intere. Il che, a pensarci, è uno streaming con TTFT perfetto e zero costo di inferenza.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.