Un PDF scansionato è solo una foto: per renderlo modificabile serve l'OCR (riconoscimento ottico dei caratteri). pdf-ocr è una web app Flask self-hosted che fa esattamente questo: carichi il PDF nel browser, ogni pagina viene renderizzata con Poppler, l'OCR (Tesseract di default) estrae il testo e scarichi il risultato in DOCX, TXT, Markdown o HTML.
Con Docker è pronta in un comando (docker compose up --build, Tesseract e Poppler già nell'immagine). Onestà da README: è uno strumento locale/self-hosted con una vera suite di test, non un servizio multi-tenant blindato – perfetto per digitalizzare documenti senza caricarli sul servizio cloud di qualcun altro.