La leva più grossa è non chiamare il modello grande quando non serve. È l'idea di Silence, un router di inferenza multi-livello: ogni query attraversa strati progressivamente più costosi – pattern matcher deterministico, template leggeri, e solo alla fine un vero LLM – e si ferma al primo strato abbastanza confidente da rispondere. In più esplora il silenzio semantico: trattare "non rispondere ancora" come un esito valido invece di generare testo a tutti i costi.
Trasparenza dovuta: è un prototipo di ricerca in alpha, API instabili e nessun benchmark pubblicato – da studiare, non da mettere in produzione. Nel frattempo, per tagliare i costi degli agenti di coding c'è la strada complementare e già matura: comprimere l'output dei comandi con l0-compressor.