A veces, la única versión disponible de un texto útil está dentro de una imagen y no en un documento editable. Puede ser una captura de una conversación, un recibo fotografiado, una página escaneada o un aviso capturado con el teléfono. Las palabras se ven, pero no es posible seleccionar una frase ni copiar un número porque el archivo contiene una imagen y no caracteres editables.
El OCR resuelve este problema al reconocer los caracteres visibles y devolverlos como texto editable. La tarea parece sencilla hasta que la imagen está algo borrosa, inclinada, comprimida o llena de elementos que no necesitas. Esos detalles pueden cambiar el resultado mucho más de lo que suele suponerse.
TextToPDF.net ofrece este flujo mediante su herramienta Imagen a texto. Puedes procesar una imagen o un lote de hasta 10 archivos, centrar el reconocimiento en una región seleccionada y revisar el resultado antes de reutilizarlo. El flujo gratuito acepta PNG, JPG/JPEG, WebP y BMP, con distintos modos de OCR para diferentes diseños.
El resultado del OCR debe tratarse como texto editable, no como una transcripción incuestionable. Un buen resultado puede evitar mucho trabajo manual, pero conviene comparar nombres, números, códigos de referencia y otros datos importantes con la imagen original.
Cómo extraer texto de una imagen
El flujo de TextToPDF.net está diseñado alrededor de la imagen, en lugar de obligar a todos los archivos a pasar por la misma configuración de reconocimiento.
- Añade la imagen. Sube una imagen compatible o añade varios archivos cuando el trabajo incluya más de una captura o página fotografiada.
- Elige el área útil. Si solo una parte contiene el texto que necesitas, selecciona esa región para que el OCR no lea todo lo que la rodea.
- Adapta el modo de OCR al diseño. Auto funciona para contenido general; Block, Line o Sparse pueden ayudar cuando la estructura es evidente.
- Revisa el texto extraído. Compara los datos importantes con la imagen original antes de copiar el resultado a otro documento.
Este último paso sigue siendo importante aunque el resultado parezca correcto. Un motor OCR puede reconocer un párrafo completo y aun así confundir 0 con O o 1 con I. Es fácil pasar por alto esos errores porque la frase que los rodea todavía parece normal.
Qué hace realmente el OCR de imagen a texto
Una imagen almacena información visual como píxeles. Normalmente no contiene las palabras en la misma forma que un editor de texto; por eso arrastrar el cursor sobre una captura no suele seleccionar nada.
El reconocimiento óptico de caracteres analiza esos patrones visuales y estima qué letras, números o símbolos representan. TextToPDF.net utiliza Tesseract.js en su flujo gratuito de OCR en el navegador, que lleva el motor Tesseract a un entorno web mediante JavaScript y WebAssembly.
Reconocer caracteres no equivale a comprender el documento. El OCR puede identificar una secuencia sin saber que un valor es el total de una factura o que otra cadena es un número de seguimiento. Por eso la revisión humana sigue siendo útil cuando un solo carácter puede cambiar el significado.
Puedes consultar los detalles de implementación en la documentación oficial del proyecto Tesseract OCR.
Por qué la precisión del OCR cambia de una imagen a otra
No existe un único porcentaje que describa todas las imágenes. Una captura nítida con texto oscuro plantea un problema muy distinto al de un recibo descolorido fotografiado con luz irregular. Un escaneo limpio tiene otras características y la escritura manual añade variaciones que no aparecen en las fuentes impresas.
La investigación publicada muestra lo amplia que puede ser esa diferencia.
| Situación de la imagen | Resultado de investigación | Qué significa |
|---|---|---|
| Fotografías de texto impreso | El benchmark Brno Mobile OCR registró resultados Tesseract de 12,32 % CER en imágenes fáciles a 79,17 % en imágenes difíciles | Las condiciones de la cámara pueden cambiar mucho el reconocimiento |
| Documentos impresos degradados | NIST registró errores de caracteres de aproximadamente 1 % a 74 % al empeorar la calidad | Una fuente deficiente puede superar a un motor OCR capaz |
| Páginas completas de recibos | Un experimento SROIE registró 50,6 % CER en una página completa y 4,98 % al dividirla en 15 fragmentos | El diseño y la elección de la región importan tanto como los caracteres |
| Escaneos de libros estructurados | Pruebas publicadas de Tesseract registraron aproximadamente 3,72 % a 5,78 % WER | El material impreso ordenado es muy distinto de una foto difícil |
CER significa tasa de error de caracteres y WER significa tasa de error de palabras. Las cifras más bajas indican menos errores, pero los estudios no deben compararse como si fueran una única clasificación: cambian los materiales, los motores y las reglas de medición.
El benchmark oficial Brno Mobile OCR Dataset resulta útil porque contiene 19.725 fotografías tomadas con 23 teléfonos en condiciones móviles reales. Sus resultados con Tesseract muestran por qué una herramienta OCR no debe prometer la misma precisión para todas las fotografías.
Patrones ilustrativos de errores OCR
El tipo de imagen puede cambiar mucho la tasa de error. El gráfico siguiente es ilustrativo y no representa un resultado medido de TextToPDF; debe leerse como una explicación visual, no como una promesa de precisión.

Por qué no usamos una sola promesa de “99 % de precisión”
Un porcentaje aislado puede parecer convincente en una página de producto, pero sin conocer las condiciones de la prueba informa muy poco. ¿Se utilizaron capturas generadas por ordenador o fotocopias antiguas? ¿Incluía recibos y escritura manual? ¿Se midió por caracteres o por palabras? Cada respuesta cambia el significado del número.
En TextToPDF.net preferimos explicar las condiciones que influyen en el reconocimiento en lugar de aplicar una cifra general a cualquier imagen. Esto también aclara por qué una imagen puede funcionar casi perfectamente mientras otra necesita varias correcciones.
La diferencia importa especialmente con los números. Una letra incorrecta quizá no impida entender un párrafo, pero un dígito equivocado en un precio, una fecha, un número de documento o una referencia puede inutilizar el resultado.
La calidad de la imagen afecta directamente al OCR
Una persona puede entender un texto aunque una parte de la foto esté desenfocada o tenga una iluminación irregular. El OCR tiene menos margen porque debe distinguir la forma de cada carácter.
La documentación de Tesseract recomienda una resolución cercana a 300 DPI o superior cuando sea posible y explica cómo el ruido, la inclinación, el umbral y la preparación de la imagen afectan al reconocimiento. También advierte que una binarización deficiente o una página girada pueden reducir la calidad.
Esto no significa que todos los archivos deban convertirse exactamente a 300 DPI. Una captura ya tiene un número fijo de píxeles y una fotografía mal tomada no mejora por asignarle un valor DPI artificial. Ampliar un carácter borroso no puede recuperar trazos que nunca quedaron registrados.
Consulta las recomendaciones técnicas en esta guía oficial para mejorar el resultado OCR.
Mantén el texto recto cuando sea posible
Fotografiar un documento desde un ángulo cambia la forma y el espacio entre las letras antes de que empiece el OCR. Las líneas paralelas pueden inclinarse y los caracteres de un borde pueden parecer más pequeños que los del otro.
Tesseract advierte que la inclinación de la página puede interferir con la separación de líneas. En una captura rápida con el móvil, colocar la cámara paralela al documento puede ahorrar más tiempo que repetir el OCR sobre una fuente muy inclinada.
No hace falta buscar una geometría perfecta en cada captura o etiqueta. El objetivo práctico es entregar al motor una representación legible sin obligarlo a resolver al mismo tiempo la distorsión de la cámara.
Selecciona solo la parte de la imagen que necesitas
Las capturas completas suelen contener mucho más texto del que realmente quieres. Menús, etiquetas de navegación, notificaciones y elementos de la interfaz pueden acabar en el resultado.
TextToPDF.net incluye la selección de región por este motivo. Si solo necesitas una dirección en el centro de una captura, puedes limitar el área de reconocimiento a esa parte en lugar de procesar toda la pantalla.
Esto no solo acorta el resultado. La guía de Tesseract recomienda recortar la imagen a una zona útil y elegir una suposición de segmentación acorde con el contenido. La selección de región conecta directamente con la forma en que el motor analiza la página.
La investigación sobre recibos ofrece otro ejemplo: un experimento SROIE redujo notablemente el error de caracteres al dividir el recibo completo en regiones más pequeñas. El diseño puede influir en el reconocimiento aunque las palabras visibles sean las mismas.
Preparación automática para fuentes difíciles
Algunas imágenes son legibles, pero no ideales. Una fotocopia descolorida puede tener poco contraste, una captura comprimida puede dejar bordes irregulares alrededor de las letras pequeñas y una iluminación desigual puede oscurecer una zona de la página.
En el modo Auto, TextToPDF.net puede probar la región seleccionada en su forma original y después utilizar pasadas alternativas en escala de grises o con umbral adaptativo. Esta preparación ocurre en el navegador y no constituye una promesa independiente de precisión.
La investigación respalda la idea general de que el preprocesamiento puede ser importante en condiciones difíciles. Un estudio de Tesseract 4.0 citado en nuestra investigación utilizó 10.000 imágenes complicadas y registró reducciones relevantes de CER y WER después de un proceso adaptativo.
Eso no significa que TextToPDF.net produzca la misma mejora. Los algoritmos y los materiales de prueba son diferentes, por lo que no atribuimos al producto el porcentaje de otro estudio.
La preparación automática debe compararse con el resultado original. Puede ayudar con un recibo difícil, mientras que una captura nítida quizá ya contenga toda la información que el OCR necesita.
Elige un modo OCR que coincida con el diseño
Un párrafo y un número de seguimiento no tienen la misma estructura visual. El motor debe decidir cómo separar los caracteres en líneas y palabras, y los cuatro modos permiten cambiar esa suposición cuando el diseño lo indica.
| Modo OCR | Adecuado para | Ejemplo |
|---|---|---|
| Auto | Imágenes generales con estructura incierta | Captura o foto de documento |
| Block | Una sección de texto conectada | Párrafo o nota |
| Line | Una sola fila aislada | Número de seguimiento o etiqueta |
| Sparse | Palabras separadas alrededor de una imagen | Interfaz o cartel |
Auto es un primer intento razonable para archivos normales. Los otros modos resultan útiles cuando la imagen ya deja claro qué tipo de diseño debe esperar el motor. Tesseract ofrece varios modos de segmentación por la misma razón: el OCR no solo lee caracteres, también debe decidir cómo están organizados.
Ejemplos reales: qué esperar de cada imagen

Ejemplo 1: Captura de pantalla
Una captura nítida y con buen contraste suele ser un buen punto de partida. El riesgo no siempre está en reconocer las letras, sino en que también aparezcan botones, etiquetas y paneles cercanos. Selecciona primero la región útil cuando haya varias zonas independientes.
Ejemplo 2: Foto de una página impresa
Una foto de móvil puede conservar suficiente detalle para un OCR útil, pero el desenfoque, la perspectiva, los reflejos y las sombras pueden cambiar caracteres concretos. Una foto recta y bien iluminada ofrece más información que una toma muy inclinada o comprimida.

Ejemplo 3: Recibo
Los recibos combinan letras pequeñas, espacios densos, abreviaturas y números. Después de extraer el contenido, compara totales, fechas, números de pedido y códigos de producto con la imagen original.

Las capturas suelen ser limpias, pero el diseño puede causar problemas
Las capturas suelen tener texto nítido porque no hay desenfoque de cámara ni textura del papel. Eso no garantiza una extracción perfecta: una interfaz puede contener etiquetas de varias zonas sin relación entre sí.
Una publicación puede incluir el texto principal, botones, información del perfil y recomendaciones. El OCR puede reconocer todo correctamente y aun así devolver un orden incómodo. La selección de región evita tener que limpiar después palabras de la interfaz que nunca necesitabas.
Las fotos de móvil introducen otros problemas
Una página puede tener una tipografía perfecta, pero la fotografía añade desenfoque, sombra, reflejos y perspectiva. El benchmark Brno Mobile OCR muestra cómo cambia el rendimiento de Tesseract al aumentar la dificultad de la foto.
Una nueva fotografía puede dar mejor resultado que varios intentos de reparar una mala. Si todavía conservas la página original, una iluminación mejor y un ángulo más recto pueden preservar detalles que el software no puede reconstruir.
Los recibos requieren atención adicional en los números
Los recibos mezclan letra pequeña, espaciado denso, abreviaturas y valores numéricos. La impresión térmica también puede desvanecerse con el tiempo. El benchmark SROIE contiene 1.000 imágenes de recibos escaneados y sus investigaciones muestran que la estrategia de diseño puede afectar mucho al reconocimiento.
En el uso diario, revisa primero totales y fechas. Los números de pedido y códigos de producto también deben compararse con la imagen porque un solo carácter equivocado puede señalar otro registro.
Las páginas escaneadas pueden ser excelentes o muy difíciles
“Documento escaneado” cubre un rango amplio de calidad. Un escaneo moderno a 300 DPI puede tener bordes nítidos y líneas regulares, mientras que una fotocopia antigua puede contener manchas, caracteres descoloridos, márgenes deformados o bordes oscuros.
NIST estudió cómo la degradación afecta al OCR de texto impreso y registró errores de aproximadamente 1 % a 74 % al empeorar la calidad. El mensaje práctico es claro: que una página proceda de un escáner no significa automáticamente que sea fácil para el OCR.
El estudio original está disponible en esta investigación de NIST sobre calidad de imagen y OCR.
La escritura manual debe tratarse con más cuidado
Las fuentes impresas repiten las mismas formas; la escritura manual no. Dos personas pueden escribir la misma r minúscula de maneras diferentes, y la cursiva puede unir caracteres en formas que no se parecen a letras aisladas.
Los sistemas especializados pueden funcionar muy bien en conjuntos de investigación como IAM, pero sus resultados no deben presentarse como el rendimiento esperado del Tesseract OCR del navegador. TextToPDF.net puede reconocer parte de la escritura, especialmente si es clara, pero requiere una revisión más cuidadosa.
Errores OCR habituales que conviene comprobar
No siempre hace falta revisar cada carácter de un resultado largo. Es más útil concentrarse en los lugares donde un error cambia el significado.
| Error OCR | Ejemplo | Por qué importa |
|---|---|---|
| Confusión entre letra y dígito | O en vez de 0 | Pueden cambiar códigos e identificadores |
| Confusión entre caracteres estrechos | I, l o 1 | Los nombres y referencias pueden quedar mal |
| Puntuación ausente | 12,50 se convierte en 1250 | Los valores pueden cambiar mucho |
| Límites de palabras incorrectos | Una palabra se divide en dos | Buscar y reutilizar el texto se vuelve más difícil |
Compara primero nombres y números. Después revisa palabras poco habituales y cualquier línea cuyo sentido no sea claro. La guía de evaluación de OCR-D utiliza CER y WER porque los errores también incluyen inserciones y eliminaciones.
Puedes consultar el método formal en la documentación de control de calidad de OCR-D.
Nuestro flujo OCR práctico

Después de revisar la investigación y los controles de TextToPDF.net, este flujo resume el trabajo:
Origen → Región → Modo → Revisión
El origen va primero porque el OCR no puede recuperar detalles que nunca se capturaron. La región elimina las partes que no necesitas, algo especialmente útil en capturas, recibos y fotos con mucho espacio alrededor. El modo indica qué disposición debe esperar el motor. La revisión protege contra los últimos errores, sobre todo en números y palabras poco frecuentes.
Este es un flujo práctico, no un algoritmo OCR nuevo. El motor reconoce los caracteres; el método ayuda a darle una entrada adecuada y a comprobar el resultado con responsabilidad.
Imagen a texto y PDF a texto resuelven problemas distintos
El resultado visual puede parecer similar, pero una imagen y un PDF digital almacenan el texto de maneras diferentes. Un PDF normal puede contener caracteres reales detrás de la página visible. Si puedes seleccionar palabras individuales, normalmente no necesitas OCR: la capa de texto existente se puede extraer directamente.
Para ese caso, usa el convertidor de PDF a texto. Si el PDF está escaneado y cada página se comporta como una foto, consulta cómo extraer texto de un PDF escaneado. Si necesitas las páginas como imágenes, el convertidor de PDF a imágenes es más adecuado; para reunir varias capturas en un PDF ordenado, usa el convertidor de imagen a PDF.
Cuándo Imagen a texto no es la herramienta adecuada
El OCR de imágenes es útil cuando las palabras existen solo como píxeles, pero no conviene forzarlo en problemas que tienen una ruta mejor. Un PDF con texto seleccionable debe pasar por extracción directa, y una página cuyo diseño visual deba conservarse píxel por píxel no se reconstruye con un transcript OCR.
Si quieres cambiar una palabra, fecha o etiqueta directamente en una imagen, utiliza la herramienta Editar texto en imagen. Si después quieres crear un documento terminado, pasa el texto limpio al convertidor de texto a PDF, donde podrás ajustar títulos, espaciado y diseño.
Elegir el flujo correcto reduce las correcciones porque cada herramienta parte de la información que realmente contiene el archivo.
Privacidad en el flujo gratuito de OCR del navegador
Las imágenes pueden contener información privada, por lo que conviene saber dónde se realiza el reconocimiento. El flujo gratuito actual utiliza Tesseract.js dentro del navegador y mantiene el reconocimiento normal en el dispositivo en lugar de enviar cada imagen a un motor OCR remoto.
El OCR del navegador utiliza la memoria y el procesador del dispositivo. Las imágenes o lotes grandes pueden comportarse de forma diferente según el equipo, que es el coste práctico de procesar localmente. Un flujo premium que utilice otra ruta debe describirse por separado para que la explicación de privacidad coincida con el procesamiento real.
Preguntas frecuentes
¿Qué precisión tiene un convertidor de imagen a texto?
No existe un único porcentaje para todas las imágenes. Las investigaciones muestran diferencias importantes entre material impreso limpio y fotos difíciles, y el desenfoque, la inclinación, el ruido y el diseño cambian aún más el resultado. Comprueba nombres y números con la imagen original.
¿Puedo extraer texto de una captura?
Sí. Las capturas suelen tener caracteres nítidos, aunque el texto de la interfaz puede aparecer también. El selector de región permite limitar el reconocimiento al contenido que necesitas.
¿Puedo convertir una foto del móvil en texto editable?
Sí, siempre que el texto sea lo bastante legible. Una foto recta y bien iluminada suele proporcionar más información útil que una imagen borrosa o tomada desde un ángulo pronunciado.
¿300 DPI siempre mejora el OCR?
Tesseract recomienda aproximadamente 300 DPI o más cuando es posible, pero asignar un valor DPI mayor no repara una fuente deficiente. Si la captura original perdió detalles, ampliarla no puede recuperar los trazos.
¿La preparación automática siempre da un resultado mejor?
No. Puede ayudar con fuentes difíciles, mientras que una captura nítida quizá ya esté lista. Compara el resultado normal con la preparación automática cuando haya ruido o contraste irregular.
¿Imagen a texto reconoce escritura manual?
Puede reconocer parte de la escritura clara, pero es menos predecible que el texto impreso. La cursiva y las formas inusuales necesitan una comparación cuidadosa con la fuente.
¿Por qué el OCR confunde números y letras?
Después de la compresión o el desenfoque, caracteres como 0 y O, o 1 e I, pueden parecerse. Los códigos y referencias suelen tener poco contexto, así que deben revisarse con especial atención.
¿Debo usar Imagen a texto para un PDF?
Úsalo cuando el origen sea una imagen. Si el PDF permite seleccionar palabras, el convertidor de PDF a texto puede leer su capa de texto sin reconocer cada carácter. Los PDF escaneados necesitan OCR porque normalmente contienen imágenes y no texto seleccionable.
Nota final
El OCR funciona mejor cuando la imagen ofrece al motor una oportunidad justa. Una fuente nítida con una región adecuada puede producir texto útil rápidamente; una foto degradada puede necesitar correcciones aunque cambies varias opciones.
Por eso TextToPDF.net no presenta Imagen a texto como una transcripción mágica de un clic. La selección de región, los modos OCR, la preparación automática y el resultado editable ayudan a tratar distintas condiciones mientras la revisión final queda en tus manos.
El flujo más fiable es práctico: empieza con la mejor fuente disponible, elimina las partes que no necesitas, elige un modo cuando el diseño lo requiera y compara los datos importantes con el original. Cuando el texto sea confiable, podrás copiarlo, editarlo, guardarlo o llevarlo al siguiente flujo de documentos.