Lo streaming mostra la risposta man mano che i token vengono generati, invece di aspettare la fine: la latenza totale non cambia, ma quella percepita crolla – il primo token arriva in decimi di secondo (TTFT, time to first token) e l'utente legge mentre il modello scrive. Per le interfacce chat è irrinunciabile: dieci secondi di spinner sono un'eternità, dieci secondi di testo che scorre sono normali.
Tecnica: le API lo espongono via SSE (server-sent events) – eventi con frammenti di testo da concatenare; i tool call e i metadati arrivano come eventi tipizzati. Le complicazioni pratiche: il markdown parziale da renderizzare senza sfarfallio, l'interruzione pulita, gli errori a metà flusso.
Confessione a tema: l'effetto macchina da scrivere di questo sito è finto streaming – le risposte esistono già intere. Il che, a pensarci, è uno streaming con TTFT perfetto e zero costo di inferenza.