Il metodo, in cinque mosse:
- parti dal compito, non dalla classifica: estrazione dati, chat, codice, riassunti hanno vincitori diversi – i benchmark generici dicono poco sul tuo caso
- vincoli prima: dati sensibili → locale o UE; volumi alti → il piccolo che basta; problemi difficili verificabili → reasoning; licenza se ridistribuisci
- costruisci 20-50 casi reali tuoi con risposte attese (un mini-eval): un pomeriggio di lavoro che ripaga per mesi
- prova tre taglie (piccolo/medio/grande) sugli stessi casi e scegli il più piccolo che supera l'asticella – di solito sorprende in basso
- rivaluta ogni pochi mesi: il panorama ruota in fretta e il tuo eval rende il ricambio indolore
E per i sistemi in produzione: il routing per difficoltà – piccolo di default, grande a chiamata – è la leva di costo più sottovalutata.