Meno di quanto sembri: un modello che discute di topologia può sbagliare una sottrazione a tre cifre, perché genera testo plausibile, non calcoli. llm-benchmarks raccoglie benchmark volutamente semplici – aritmetica di base in su – proprio perché sono il fondamento misurabile: danno metriche chiare di accuratezza e velocità, rendono confrontabili modelli diversi, e le debolezze che emergono lì si amplificano nei compiti complessi.
Morale operativa: per i calcoli veri, dai all'LLM una calcolatrice (un tool), non fiducia.