Whisper (OpenAI, open source) ha reso la trascrizione un problema risolto anche in locale: modelli da tiny a large-v3, ottimo con l'italiano, robusto con rumore e accenti. Niente audio caricato su server altrui – per riunioni e materiale sensibile non è un dettaglio.
Le implementazioni da usare davvero: faster-whisper (4-5× più veloce dell'originale, stessa qualità) e whisper.cpp (CPU e Apple Silicon, gira ovunque); su Mac anche le varianti MLX. Il modello large-v3 per la qualità, medium o small quando la velocità conta più delle sfumature; una GPU aiuta ma non è obbligatoria.
I trucchi di resa: audio pulito in ingresso (il microfono conta più del modello), diarizzazione separata se serve chi ha detto cosa (pyannote), e il colpo finale: passare la trascrizione grezza a un LLM per punteggiatura, paragrafi e riassunto – la coppia trascrittore+redattore, tutta in casa.