Skip to content

Come installare facilmente Tesseract OCR: guida dettagliata passo dopo passo

Tesseract OCR rimane il motore di riconoscimento ottico dei caratteri open source più utilizzato, con supporto per oltre 100…

Développeur installant Tesseract OCR sur un terminal Linux dans un bureau moderne

Tesseract OCR rimane il motore di riconoscimento ottico dei caratteri open source più utilizzato, con supporto per oltre 100 lingue. La sua installazione, tuttavia, presenta alcune insidie a seconda del sistema operativo e del metodo scelto. La versione 5.x costituisce ora la linea stabile del progetto, e la versione proposta da alcuni gestori di pacchetti non corrisponde sempre all’ultima release disponibile.

Problema di versione su Windows: perché winget crea problemi per Tesseract

Su Windows, il riflesso naturale è quello di passare attraverso un gestore di pacchetti da linea di comando. Il problema concreto: winget installa la versione 5.4.0 di Tesseract, mentre la versione stabile ha raggiunto la 5.5.3 pubblicata a fine luglio 2026. Questa discrepanza non è da sottovalutare.

La versione 5.5.3 corregge perdite di memoria, migliora le prestazioni di riconoscimento e modifica il comportamento di alcuni parametri CLI. Un utente che installa tramite winget senza verificare si ritrova con un motore in ritardo di diversi aggiornamenti, e risultati di riconoscimento potenzialmente meno affidabili su documenti complessi.

Il metodo più sicuro su Windows rimane quello di scaricare l’installer .exe a 64 bit dal repository GitHub di UB Mannheim. Questo repository propone sistematicamente le build più recenti. L’installer consente anche di selezionare i pacchetti di lingue direttamente durante la procedura, evitando di doverli aggiungere manualmente in seguito. Per approfondire ogni fase della procedura, una guida per installare Tesseract OCR dettaglia le operazioni con schermate.

Variabile d’ambiente PATH: il punto di blocco più frequente

Una volta installato Tesseract su Windows, la maggior parte degli errori segnalati dai principianti deriva da un PATH mal configurato. Il software si installa per impostazione predefinita in una directory come C:Program FilesTesseract-OCR, ma questo percorso non viene automaticamente aggiunto alle variabili d’ambiente di sistema.

Senze questa configurazione, digitare tesseract in un terminale restituisce un errore del tipo “comando non trovato”. Per correggere ciò, è necessario aprire le impostazioni di sistema avanzate di Windows, accedere alle variabili d’ambiente e poi aggiungere il percorso completo della cartella di installazione alla variabile PATH.

Donna che segue un tutorial di installazione di Tesseract OCR sul suo computer portatile

Un test rapido consente di convalidare l’installazione:

  • Aprire un terminale (cmd o PowerShell) e digitare tesseract --version per verificare che il motore risponda e mostri il numero di versione atteso
  • Digitare tesseract --list-langs per confermare che i pacchetti di lingue installati siano ben rilevati
  • Eseguire un riconoscimento su un’immagine di prova con tesseract image.png output -l fra per convalidare il funzionamento completo della catena

Se il comando tesseract –version non risponde, il problema deriva dal PATH nella quasi totalità dei casi.

Installare Tesseract OCR su Linux e macOS: gestori nativi

Su Linux (Debian, Ubuntu e derivati), l’installazione avviene tramite apt. Il comando apt-get install tesseract-ocr tesseract-ocr-fra installa il motore e il pacchetto francese in un’unica operazione. Il pacchetto tesseract-ocr-osd aggiunge il rilevamento automatico dell’orientamento e dello script, utile per i documenti scansionati di traverso.

Su macOS, Homebrew gestisce l’installazione con brew install tesseract. Le lingue aggiuntive vengono poi installate tramite brew install tesseract-lang. Tuttavia, la versione disponibile tramite Homebrew può anche presentare un leggero ritardo rispetto all’ultima release di GitHub.

Un punto in comune tra i due sistemi: i pacchetti di lingue determinano la qualità del riconoscimento. Installare solo il pacchetto di base senza dati linguistici adeguati produce risultati mediocri su testo francese. I file .traineddata esistono in tre varianti (fast, best, standard), ognuna con un compromesso velocità/precisione diverso.

File traineddata e modelli LSTM: cosa cambia tra Tesseract 4.x e 5.x

La migrazione da una vecchia versione di Tesseract alla versione 5.x implica la verifica della compatibilità dei file di modelli. I file traineddata della versione 3.x non funzionano con Tesseract 5.x. I modelli LSTM introdotti a partire dalla versione 4.0 rimangono compatibili, ma gli strumenti di training sono stati modernizzati nella versione 5.x.

Tre repository ufficiali su GitHub ospitano i dati linguistici:

  • tessdata: modelli che combinano il motore legacy e LSTM, compromesso generale
  • tessdata_best: modelli LSTM addestrati per la migliore precisione possibile, più lenti nell’esecuzione
  • tessdata_fast: modelli LSTM ottimizzati per la velocità, leggermente meno precisi

Per un uso comune (scansione di documenti amministrativi, estrazione di testo da file PDF scansionati), i modelli tessdata_best offrono i risultati più affidabili. Per l’elaborazione in batch su centinaia di pagine, tessdata_fast riduce il tempo di elaborazione senza compromettere fortemente la precisione.

Scrivania con guida stampata di installazione Tesseract OCR annotata a mano e smartphone che mostra codice Python

Verifica post-installazione e primo riconoscimento di testo

Una volta che il software è in funzione, il primo riconoscimento serve sia come test che come calibrazione. Tesseract si utilizza da linea di comando con una sintassi diretta: tesseract input.png output -l fra genera un file di testo a partire da un’immagine.

La qualità del risultato dipende fortemente dall’immagine sorgente. Un documento scansionato a bassa risoluzione o con un contrasto insufficiente produrrà un testo pieno di errori, indipendentemente dal modello utilizzato. Il pretrattamento dell’immagine (binarizzazione, correzione dell’inclinazione, rimozione del rumore) migliora significativamente la precisione del riconoscimento.

Strumenti come ImageMagick o librerie Python come Pillow consentono di automatizzare questo pretrattamento prima di passare il file a Tesseract. Il pretrattamento dell’immagine ha un impatto maggiore sulla precisione rispetto alla scelta del modello.

La versione 5.5.3 di Tesseract rimane uno strumento da linea di comando senza interfaccia grafica nativa. Per gli utenti che preferiscono un’interfaccia visiva, software come gImageReader o OCRFeeder integrano Tesseract come motore di riconoscimento e aggiungono uno strato grafico sopra. L’installazione di Tesseract rimane un prerequisito in tutti i casi.

Come installare facilmente Tesseract OCR: guida dettagliata passo dopo passo