Ver la versión completa : OCR para PDF
No sé si esto debería ir aquí o en otro sitio, o si incumplo alguna norma con este link; en cualquier caso, lo pongo, y ya si eso, lo movéis, borráis o lo que sea menester ;) :
http://es.giveawayoftheday.com/pdf-ocr-ocr-pdf/
Esta es una página desde donde cada día se puede descargar un programa o aplicación (la mayoría no valen para nada, pero bueno) de modo legal, con su clave de activación.
Y hoy toca un software de OCR para archivos PDF. Todavía no lo he probado, pero puede ser una opción para convertir esos PDF que tan mal se ven en nuestros lectores.
En fin, que si a alguien le interesa, ya sabe, el link solo vale para hoy (y hay que instalarlo hoy si no he leído mal).
Edito: se me ha olvidado decir que es un programa para Windows.
Muchas gracias saggy :D.
Hoy mismo estaba yo trasteando por el google buscando información sobre OCR para digitalizar libros y apuntes varios. He acabado convencido de lo que necesito es el Abby FineReader pero este lo probaré por los dos Cd's que tengo de pdf's recopilados desde hace años.
Gracias ;)
rosmar71
01/06/2010, 18:40
Ese no lo conozco pero el Abby va brutal ;)
Faisanes
01/06/2010, 21:00
Ese no lo conozco pero el Abby va brutal ;)
Comenté aquí que a veces no. En un libro de El Aleph que descargué en PDF, me daba error continuo. Lo tuve que pasar a Word con ¡el Adobe Acrobat!, además a la primera y sin problemas.
Sí que es la primera vez que me falla el Abbyy. Bien de veces he leído con él PDFs, sin problema alguno. Aunque, visto lo del Acrobat, el siguiente probaré primero con él. :-)
P.S. Por cierto: Me está costando Dios y ayuda, leer el libro mencionado, en RTF, en mi portátil. No por leer en la pantalla del mismo, sino por las constantes correcciones, casi todas comas que faltan o sobran. Tanto es así, que alterno la lectura con el 6º de Terry Pratcher y su Mundodisco. Vale.
A mí me pasaba que por alguna razón al prota de La historia Interminable le llamaba Atreyú, en vez de Atreyu. Mi mente creaba el artificio y cuando vi la peli me quedé pasmado. Bueno, por eso y por lo mala que era. Debí de leer ese nombre cientos de veces y siempre leí Atreyú en vez de Atreyu. Es Terry Pratchett ;)
rosmar71
02/06/2010, 17:07
Comenté aquí que a veces no. En un libro de El Aleph que descargué en PDF, me daba error continuo. Lo tuve que pasar a Word con ¡el Adobe Acrobat!, además a la primera y sin problemas.
Sí que es la primera vez que me falla el Abbyy. Bien de veces he leído con él PDFs, sin problema alguno. Aunque, visto lo del Acrobat, el siguiente probaré primero con él. :-)
P.S. Por cierto: Me está costando Dios y ayuda, leer el libro mencionado, en RTF, en mi portátil. No por leer en la pantalla del mismo, sino por las constantes correcciones, casi todas comas que faltan o sobran. Tanto es así, que alterno la lectura con el 6º de Terry Pratcher y su Mundodisco. Vale.
Todo tiene sus fallos, yo alterno los dos tambien... pero si el pdf tiene division el columnas el Acrobat hace unos estropicios de escandalo...
Faisanes
02/06/2010, 19:13
A mí me pasaba que por alguna razón al prota de La historia Interminable le llamaba Atreyú, en vez de Atreyu. Mi mente creaba el artificio y cuando vi la peli me quedé pasmado. Bueno, por eso y por lo mala que era. Debí de leer ese nombre cientos de veces y siempre leí Atreyú en vez de Atreyu. Es Terry Pratchett ;)
¡Cómo te me pones por un quítame allá esos Parchetes! :D
;)
¿EL Abbyy funciona con PDF hechos de escaneados? Es que tengo algún libro que está escaneado (1 hoja por página) y me gustaría pasarlo al Kindle.
Faisanes
15/09/2010, 20:57
¿EL Abbyy funciona con PDF hechos de escaneados? Es que tengo algún libro que está escaneado (1 hoja por página) y me gustaría pasarlo al Kindle.
Claro que sí. :) Y relee este hilo. El Adobe Acrobat, también te lo pasa a Word (a mí en un caso en el que el Abbyy no quería hacer su trabajo). :) Pero lo suyo es el Abbyy, claro. :-)
Un saludo. ;)
Lo acabo de probar y le he visto los siguientes problemas:
1- Con páginas algo torcidas funciona, pero si está un poco más de la cuenta no.
2- El reconocimiento de gráficos no es muy bueno. Por ejemplo, escanee un libro de charting de bolsa y los gráficos no los pillaba bien. Aunque se puede montar el libro a mano seleccionando toda la imagen como imagen.
3- Los libros de poker no los pasa bien, sobre todo los símbolos de las cartas: trebol, corazón, diamante y picas. Con los gráficos de bolsa, pues se corrige fácil, pero aquí no lo veo muy bien.
Por ejemplo, un libro de poker con los palos de las cartas pasado de un PDF que no generado de imágenes, pues con el Mobipocket me lo generaba bien, pero como la mayoría de libros están escaneados y pasados a PDF ...
Con las ganas que tenía de poder tener la colección de libros en el Kindle 3 y olvidarme de los de papel...
Faisanes
16/09/2010, 07:39
Lo acabo de probar y le he visto los siguientes problemas:
1- Con páginas algo torcidas funciona, pero si está un poco más de la cuenta no.
2- El reconocimiento de gráficos no es muy bueno. Por ejemplo, escanee un libro de charting de bolsa y los gráficos no los pillaba bien. Aunque se puede montar el libro a mano seleccionando toda la imagen como imagen.
3- Los libros de poker no los pasa bien, sobre todo los símbolos de las cartas: trebol, corazón, diamante y picas. Con los gráficos de bolsa, pues se corrige fácil, pero aquí no lo veo muy bien.
Por ejemplo, un libro de poker con los palos de las cartas pasado de un PDF que no generado de imágenes, pues con el Mobipocket me lo generaba bien, pero como la mayoría de libros están escaneados y pasados a PDF ...
Con las ganas que tenía de poder tener la colección de libros en el Kindle 3 y olvidarme de los de papel...
Es que la gracia de los programas de ROC o OCR, es reconocer las letras, los caracteres. No sé si el Abbyy y/o el Adobe tienen la opción de respetar y guardar las imágenes (creo que deberían tenerla), porque nunca la he usado o precisado. Intenta de nuevo, trastea, a ver.
Respecto a la inclinación de las páginas, puedes usar un programa de retoque fotográfico (prueba por ejemplo el Photo Pos Pro, gratuito e intuitivo), y volverlas a su posición vertical. No sabía yo tampoco que fueran tan finos, estos programas. :(
Los programas ROC están hechos para precisamente leer lo que antes era una fotografía, traducir de imágenes a letras; lo que son sólo imágenes, casi estoy por decirte (seguro no estoy, ya te digo), debe de haber alguna forma de conservarlas, y además en su sitio. Ese programa detecta lo que son letras, palabras, y ha de distinguir lo que no lo es.
Ya contarás. :-) Un saludo. ;)
P.S. En la calle Alenza, en Madrid, hay una tienda sólo para artículos de póker. Resulta chocante, que puedan vivir de eso, más en los tiempos que corren. Venden fichas, libros, mazos de cartas, todo lo relacionado con ese juego. Vale.
ajaxleon
16/09/2010, 16:11
Sólo he encontrado un programa mejor que el Abby Finereader y es el que utilizan los ciegos para el reconocimiento óptico de caracteres de cara a generar audiolibros y libros en braille (no recuerdo su nombre), pero el problema es que es carííííííísimooooo y como se utiliza en un entorno tan especializado únicamente lo tienen comprado las grandes compañías tipo la ONCE, por lo que no circula por otros derroteros, pero por lo que he leido de un informe de miembros de la ONCE de Cataluña en una comparativa de software de OCR para generar audiolibros y lectura directa de pantalla (tipo el Jaws), debe ser la caraja de bueno.:o:o
Por lo demás es cuestión de estudirase el manual del Abby en profundidad porque permite la inclusión de signos por el usuario, así que es perfectamente posible incluir las picas y demás, otra cosa es que encima las páginas estén torcidas y demás, entonces la única forma es hacer la revisión página a página y no de forma desatendida, pero también se puede.:-\"
Tiene un grado de acierto altísimo pero, obviamente, no hace magia.:p
Para libros tipo novelas su acierto es muy muy cercano al 100%.
Saludos.
Es que la gracia de los programas de ROC o OCR, es reconocer las letras, los caracteres. No sé si el Abbyy y/o el Adobe tienen la opción de respetar y guardar las imágenes (creo que deberían tenerla), porque nunca la he usado o precisado. Intenta de nuevo, trastea, a ver.
Respecto a la inclinación de las páginas, puedes usar un programa de retoque fotográfico (prueba por ejemplo el Photo Pos Pro, gratuito e intuitivo), y volverlas a su posición vertical. No sabía yo tampoco que fueran tan finos, estos programas. :(
Los programas ROC están hechos para precisamente leer lo que antes era una fotografía, traducir de imágenes a letras; lo que son sólo imágenes, casi estoy por decirte (seguro no estoy, ya te digo), debe de haber alguna forma de conservarlas, y además en su sitio. Ese programa detecta lo que son letras, palabras, y ha de distinguir lo que no lo es.
Ya contarás. :-) Un saludo. ;)
P.S. En la calle Alenza, en Madrid, hay una tienda sólo para artículos de póker. Resulta chocante, que puedan vivir de eso, más en los tiempos que corren. Venden fichas, libros, mazos de cartas, todo lo relacionado con ese juego. Vale.
El Abbyy detecta 3 tipos de elementos: tablas, imágenes y texto. Lo que pasa, que los gráficos de charting (aparecen meses, valores, etc) no los pilla muy bien
Con respecto a lo de poker, pues lo que me interesa son ebooks, ya que varios libros físicos, pero prefiero leerlos en el Kindle.
Brandobras
17/09/2010, 10:29
Hola,
mi esperiencia con el escaneo de libros no ha sido muy buena.. El Abbyy en si mismo es un programa excelente, pero si tratas de escanear un libro bastante gordo con un scanner plano A4 normalito como el mio, la imagen de la parte de la pagina cerca del lomo sale un poco doblada y no hay forma de que el OCR la reconozca correctamente (o por lo menos yo no lo he conseguido).
Al final dejé la empresa por imposible.. para mi es un sufrimiento doblar demasiado mis libros y aplastarlos contra el cristal del scanner me daba grima! [-x
Saludos
Faisanes
17/09/2010, 12:46
Hola,
mi esperiencia con el escaneo de libros no ha sido muy buena.. El Abbyy en si mismo es un programa excelente, pero si tratas de escanear un libro bastante gordo con un scanner plano A4 normalito como el mio, la imagen de la parte de la pagina cerca del lomo sale un poco doblada y no hay forma de que el OCR la reconozca correctamente (o por lo menos yo no lo he conseguido).
Al final dejé la empresa por imposible.. para mi es un sufrimiento doblar demasiado mis libros y aplastarlos contra el cristal del scanner me daba grima! [-x
Saludos
Por eso los de Google (para Google Books) inventaron su propio programa, no sé si también la máquina, el escáner, un sistema por el cual, además de pasar páginas automáticamente y con mimo, salva siempre esa diferencia de ángulo en relación con la horizontal, dejando el texto plano como si fueran hojas sueltas... Y según qué edición, tiene sí que ser notoria la diferencia entre ese lado y el resto de la página. :-s
Funcionando con vBulletin® Version 4.2.5 Copyright © 2026 vBulletin Solutions, Inc. All rights reserved.