Investigació & Arxius Digitals7 min de lecturaActualitzat: Setembre 2026

Com fer cercable un PDF escanejat amb OCR

Si un PDF escanejat conté les pàgines com a imatges, és molt probable que no puguis seleccionar ni cercar el seu text amb Ctrl+F. La tecnologia OCR analitza les formes dels caràcters per incrustar una capa invisible que permet localitzar termes clau, copiar cites i indexar documents.

Regla factual: L'OCR és un procés probabilístic que depèn de la font física

Cap motor d'OCR reconeix qualsevol document amb un 100% de precisió ni reconstrueix màgicament pàgines deteriorades. La nitidesa depèn de la resolució, contrast fons-lletra, inclinació i cal·ligrafia. La verificació ocular de xifres i noms és indispensable.

Diagrama de reconeixement òptic de caràcters (OCR) per transformar documents escanejats en PDF cercables amb Ctrl+F
Mecanisme d'OCR en PDF: la imatge escanejada original es conserva intacta i s'hi afegeix una capa tipogràfica invisible superposada que habilita la selecció i la cerca amb Ctrl+F.
Mascota oficial de BreadPDF
Intel·ligència de Document

Reconeixement òptic precís executat directament al teu navegador

El motor de visió artificial processa cada caràcter en local mitjançant WebAssembly. El teu document no puja a cap servidor extern i manté la teva informació confidencial.

Com saber si el teu PDF necessita OCR?

Un document pot llegir-se amb absoluta claredat a la pantalla i, tanmateix, ser completament 'cec' per als motors de cerca o gestors bibliogràfics. Fes aquestes 3 proves ràpides:

1. Prova amb Ctrl + F

Escriu una paraula que vegis clarament a la pàgina. Si el cercador indica '0 resultats', el document no té capa de text digital.

2. Selecció amb cursor

Fes clic i arrossega sobre una línia. Si no pots ressaltar caràcters individuals i s'arrossega una capsa blava sobre tota la imatge, és un mapa de bits.

3. Copiar al porta-retalls

Prem Ctrl+C i enganxa-ho en un bloc de notes. Si no s'enganxa cap text o surten símbols incomprensibles, requereix OCR.

Què fa realment l'OCR?

El reconeixement òptic no substitueix màgicament el teu document per un arxiu nou ni redibuixa les lletres. Funciona en una seqüència estructurada de visió artificial i anàlisi de glifs:

PAS 1

Imatge escanejada

Matriu de píxels en escala de grisos o color.

PAS 2

Anàlisi de glifs

Detecció de formes, línies i separació de paraules.

PAS 3

Capa invisible

Generació de caràcters transparents sobre coordenades exactes.

PAS 4

Document cercable

Ctrl+F actiu, selecció tipogràfica i còpia.

Com fer el teu PDF cercable pas a pas

01

Pas 1: Prepara i orienta el document

Els motors d'OCR analitzen el text en horitzontal d'esquerra a dreta. Si una pàgina està girada 90° o 180°, l'algoritme no podrà reconèixer els caràcters. A més, eliminar pàgines en blanc redueix el temps de procés:

Eina Principal

Hacer OCR al PDF a BreadPDF

Selecciona l'idioma principal del text per activar el diccionari morfològic i descarrega un PDF cercable amb text indexable.

Hacer OCR al PDF ara
03

Pas 3: Comprova que l'OCR funciona

Ctrl+F troba paraules clau a diferents pàgines del document
El text es pot seleccionar netament amb el ratolí línia per línia
El text copiat i enganxat conserva els caràcters accentuats i la lletra 'ç' o 'ñ'
La imatge de fons no ha sofert distorsió i manté la resolució d'origen

Limitacions conegudes: Taules i escriptura manuscrita

Taules i dades numèriques

L'OCR reconeix caràcters, però no reconstrueix la relació entre files i columnes. Si necessites editar xifres en un full de càlcul, aplica OCR primer i passa el document per PDF a Excel.

Escriptura a mà (Manuscrita)

Els sistemes estàndard d'OCR estan calibrats per a caràcters d'impremta o fonts digitals. La cal·ligrafia lliure o firmes manuscrites presenten taxes d'error significatives.

Casos pràctics i fluxos recomanats

Tipus de documentFlux recomanatObjectiu principal
Llibre o article d'arxiu escanejatRotar PDF → OCR de PDFCerca amb Ctrl+F i citació bibliogràfica indexable.
Apunts de classe impresosOCR de PDF → Extraer texto (.txt)Copiar resums a Word o processadors d'apunts.
Factura o balanç en paper escanejatOCR de PDF → PDF a ExcelEstructurar columnes i auditar xifres amb sumes.
Expedient jurídic o administratiuOCR de PDF + Comprovació ocularLocalitzar antecedents i números de procediment.

Preguntes freqüents

Què és exactament l'OCR?
OCR són les sigles de Reconeixement Òptic de Caràcters (Optical Character Recognition). És una tecnologia informàtica que analitza imatges escanejades o fotografies per identificar formes de lletres i xifres, traduint-les a text digital codificat.
Com sé si el meu PDF necessita OCR?
Obre el document i prova de seleccionar una paraula amb el ratolí o cerca un terme prement Ctrl+F. Si el visor no permet marcar frases individuals i arrossega un rectangle opac sobre la pàgina, el PDF és una imatge pura i necessita OCR.
Puc cercar text després d'aplicar OCR?
Sí. En triar la sortida en format PDF cercable, el motor incrusta una capa tipogràfica invisible alineada sobre la imatge original. Podràs prémer Ctrl+F, seleccionar línies i indexar el contingut en gestors documentals.
L'OCR manté el format original?
El mode 'PDF amb capa de text' conserva la representació visual idèntica a l'escaneig original. Si exportes el contingut a text pla (.txt), el format gràfic es descarta per oferir només els caràcters reconeguts.
Pot l'OCR reconèixer taules?
Reconeix els caràcters i números continguts a les cel·les. No obstant això, mantenir la matriu estricta de columnes requereix una eina posterior de conversió a full de càlcul (PDF a Excel).
Pot l'OCR reconèixer escriptura manuscrita?
L'OCR està dissenyat i optimitzat per a caràcters tipogràfics impresos. Els manuscrits, apunts a mà o signatures solen presentar discrepàncies notables de reconeixement.
Per què l'OCR confon lletres i números?
A causa de limitacions de resolució, deficiències de contrast o taques a l'escaneig. Caràcters similars com el '0' i la 'O', o l''1' i la 'l', comparteixen geometries fàcilment confongibles en mapes de bits degradats.
Puc convertir un PDF escanejat a Excel després de l'OCR?
Sí. És el procediment metòdic adequat: primer s'aplica OCR per donar identitat digital al text i posteriorment es processa amb l'eina de conversió a Excel per tabular les xifres.

Privacitat en el processament d'OCR i fonts tècniques

En la investigació acadèmica, arxius jurídics o expedients administratius, els documents escanejats solen contenir dades protegides. A BreadPDF, el motor d'OCR s'executa mitjançant WebAssembly directament a la memòria del teu navegador sense transmetre fitxers a servidors externs.