Da scansione a testo
Estrai il testo da una scansione, dalla foto di una pagina o da un PDF che in realtà è un'immagine — con il motore di riconoscimento che gira nel tuo browser invece del tuo documento che finisce sul server di qualcun altro.
Cosa fa
Da scansione a testo cambia quali pagine contiene un PDF, o come sono disposte, e lascia stare tutto il resto. Il contenuto viene copiato e non ricodificato: niente viene ricompresso e non si perde qualità tra il file che carichi e quello che scarichi.
Quando serve
Tipicamente quando un documento contiene pagine che non dovrebbero circolare — un frontespizio interno, una scansione doppia, un allegato destinato a qualcun altro — o quando lo scanner ha prodotto pagine storte o fuori ordine.
Limiti e avvertenze
Il file originale non viene mai modificato: scarichi sempre una copia nuova. I PDF protetti vanno sbloccati prima di poter essere modificati, e una scansione resta una scansione — le pagine si spostano, il testo dentro resta un'immagine. Tutto avviene nel tuo browser, quindi il file non lascia mai il tuo dispositivo.
Come funziona
- Pick the language the document is written in — it decides which model is downloaded.
- Drop the scan, photo or PDF.
- The engine downloads once, then reads the page. Check the text and correct anything it misread.
Domande frequenti
- Perché la prima volta scarica qualche megabyte?
- Perché è il modello di riconoscimento a raggiungere il tuo documento, invece del tuo documento a raggiungere un server. Sono circa 3 MB per una lingua, scaricati una volta sola e poi tenuti in cache dal browser. Tutti gli OCR gratuiti che partono all'istante lo fanno caricando il tuo file da qualche parte.
- Il testo ha degli errori.
- Da qualche parte quasi sempre ne ha. Il riconoscimento è un'ipotesi, e l'ipotesi peggiora molto con scansioni a bassa risoluzione, foto storte, scrittura a mano e caratteri insoliti. Il risultato è modificabile proprio per questo, e la percentuale di confidenza ti dice quanto il motore era sicuro. Sotto il 70% consideralo un punto di partenza, non una risposta.
- Legge la scrittura a mano?
- Non in modo affidabile. Il modello è addestrato su testo stampato. Lo stampatello ordinato a volte passa; il corsivo no.
- E un PDF di più pagine?
- Viene letta solo la prima. Un PDF scansionato è la foto di una pagina, e leggerne cento dentro una scheda richiederebbe più tempo di quanto chiunque sia disposto ad aspettare — quindi questo strumento fa bene una pagina invece di fare male un documento intero.
- I miei file vengono caricati da qualche parte?
- No. Questo strumento funziona interamente nel tuo browser, quindi il file non lascia mai il tuo dispositivo.