Un LLM nasce in due fasi molto diverse:
- il pretraining è la forgiatura: mesi di GPU su trilioni di token di testo, con un unico obiettivo – predire il token successivo. Da qui escono conoscenza e capacità linguistiche, ma un modello "base" che completa il testo, non un assistente: se gli chiedi qualcosa, potrebbe risponderti con altre tre domande simili.
- il post-training è l'educazione: il fine-tuning supervisionato (SFT) su esempi di dialogo gli insegna il formato domanda-risposta, e l'allineamento alle preferenze (RLHF/DPO) lo rende utile, prudente, gradevole. È qui che nasce il "carattere".
La parte interessante per chi costruisce: il pretraining è roba da laboratori con budget a nove cifre, ma il post-training è accessibile – un fine-tuning LoRA su un modello aperto si fa anche su un Mac.