Files stay local for processing. Account, billing, and ads use separate network services. Scopri di più

Estrai testo inglese modificabile da un'immagine chiara

Il riconoscimento ottico dei caratteri stima i caratteri dai pixel; non recupera un livello di testo originale. La precisione dipende in larga misura dalla messa a fuoco, dal contrasto, dall'orientamento, dalla tipografia, dal layout e dalla lingua.

LocalUtils field note · Estrai testo inglese modificabile da un'immagine chiara

Estrai testo inglese modificabile da un'immagine chiara

Il riconoscimento ottico dei caratteri stima i caratteri dai pixel; non recupera un livello di testo originale. La precisione dipende in larga misura dalla messa a fuoco, dal contrasto, dall'orientamento, dalla tipografia, dal layout e dalla lingua.

L'attuale flusso di lavoro OCR LocalUtils utilizza dati in lingua inglese Tesseract raggruppati. È utile per bozze e ausili alla ricerca, ma ogni risultato necessita di confronto con la fonte prima della citazione, dell'utilizzo dell'accessibilità, dell'immissione finanziaria o di altri lavori consequenziali.

Avvio rapido

  1. Ritaglia la fonte nel testo pertinente e correggine l'orientamento prima del caricamento.
  2. Utilizzare un'immagine nitida con illuminazione uniforme, risoluzione adeguata e forte contrasto tra primo piano e sfondo.
  3. Esegui il riconoscimento e osserva l'indicatore di avanzamento mentre l'operatore elabora l'immagine.
  4. Copia il risultato in un editor, conserva le interruzioni di riga solo dove utili e confronta nomi, numeri, punteggiatura e caratteri ambigui con l'immagine.

device → browser engine → result

Cosa fa il browser

Un lavoratore Tesseract.js carica i dati con training in inglese raggruppati e le risorse WebAssembly. Il riconoscimento viene eseguito nel lavoratore anziché in un endpoint OCR cloud.

Il primo caricamento può richiedere risorse dell'applicazione e OCR dall'host. Il traffico di risorse è diverso dal caricamento dell'immagine selezionata per il riconoscimento. Una volta memorizzato nella cache, il comportamento del browser e del lavoratore del servizio determina cosa può essere eseguito offline.

Ingressi e uscite

  • Input: tipi di immagine che il browser può decodificare e Tesseract.js può leggere.
  • Lingua di riconoscimento: dati inglesi raggruppati nell'interfaccia corrente.
  • Output: testo semplice copiato o scaricato dall'utente.

Limiti da sapere prima di iniziare

  • La grafia, il testo curvo, le tabelle, i layout a più colonne, i caratteri decorativi e gli screenshot a bassa risoluzione riducono la precisione.
  • L'output non preserva la struttura semantica né riproduce le tabelle in modo affidabile.
  • I dati in lingua inglese interpreteranno erroneamente molte parole e caratteri non inglesi.
  • La sicurezza dell'OCR non è una prova che un numero o un nome siano corretti.

Risoluzione dei problemi

  • Se l'output è vuoto, ritaglia più vicino al testo e aumenta il contrasto.
  • Se le linee appaiono nell'ordine sbagliato, elabora separatamente le regioni più piccole.
  • Se le cifre vengono confuse con le lettere, verificare ogni occorrenza rispetto all'immagine anziché applicare una sostituzione cieca.

Lista di controllo per la verifica

  • Leggi il testo estratto accanto alla fonte con uno zoom elevato.
  • Controlla singolarmente i nomi propri, le date, i separatori decimali, i numeri di conto e la punteggiatura.
  • Conserva l'immagine originale con il testo corretto quando la tracciabilità è importante.

Domande che le persone fanno

Può riconoscere la scrittura a mano?

Potrebbe produrre risultati parziali, ma l’attuale modello inglese generale è destinato principalmente al testo stampato.

Perché la prima corsa è più lenta?

Potrebbe essere necessario scaricare e inizializzare il browser OCR, WebAssembly e le risorse in lingua inglese.

L'output OCR è accessibile per impostazione predefinita?

Il testo semplice può aiutare a creare materiale accessibile, ma l'ordine di lettura, i titoli, le tabelle e le correzioni richiedono ancora la modifica da parte dell'uomo.

Leggi la guida alla preparazione e alla revisione dell'OCR