Ver la versión completa : diccionarios traductores para Nolim
Hola amigos. No soy capaz de instalar un diccionario francés-español en mi Nolim para poder leer libros en francés. He descargado un archivo dicthtlm, pero lo único que ha hecho es llenarme la biblioteca de cosas raras. ¿Alguien sabe si es posible? En caso de respuesta afirmativa, ¿dónde puedo descargarlo y cómo lo instalo? Gracias de antemano, y un saludo.
elchamaco
20/11/2016, 17:25
Hola amigos. No soy capaz de instalar un diccionario francés-español en mi Nolim para poder leer libros en francés. He descargado un archivo dicthtlm, pero lo único que ha hecho es llenarme la biblioteca de cosas raras. ¿Alguien sabe si es posible? En caso de respuesta afirmativa, ¿dónde puedo descargarlo y cómo lo instalo? Gracias de antemano, y un saludo.
En teoría eran stardict creo. Echa un vistazo porque algo se habló del tema cuando estuvieron haciendo reviews. Otra cosa es como esté implementado. Por lo general ya te adelando que el formato esta implementado como el culo y muchos diccioanrios no funcionarán bien. Por ejemplo el archivo de inflexiones no suelen verlo, y luego los formatos html o con tags puede que tampoco.
Como te comenta el compañero, deben ser stardict, que se reconocen bien porque están compuestos por tres archivos. Lo comentaba katxan por aquí:
http://www.lectoreselectronicos.com/foro/showthread.php?17498-Nolimbook-HD-con-Frontlight&p=242309&viewfull=1#post242309
...desde el móvil.
cocoinasia
27/01/2017, 01:12
Hola tengo el NOLIM HD+ he conseguido cargar el diccionario de la RAE según intrucciones deun forero, he creado la carpeta Dictionaries y ahi he metido el diccionaro de la rae que esta en el apartado de descargas de esta web. El caso es que leo bastantes ebooks en ingles y lo que quisiera es el diccionario de Ingles-Español pero me pierdo con los formatos, alguien serái tan amable de explicar donde y como consigo este diccionario ingles-español?
Un saludo
surquizu
27/01/2017, 07:24
Hola tengo el NOLIM HD+ he conseguido cargar el diccionario de la RAE según intrucciones deun forero, he creado la carpeta Dictionaries y ahi he metido el diccionaro de la rae que esta en el apartado de descargas de esta web. El caso es que leo bastantes ebooks en ingles y lo que quisiera es el diccionario de Ingles-Español pero me pierdo con los formatos, alguien serái tan amable de explicar donde y como consigo este diccionario ingles-español?
Un saludo
En la parte final de la página tienes un recopilatorio de diccionarios en formato stardict: http://kobo.lectoreselectronicos.com/subweb/recopilacion.html .
cocoinasia
27/01/2017, 09:59
En la parte final de la página tienes un recopilatorio de diccionarios en formato stardict: http://kobo.lectoreselectronicos.com/subweb/recopilacion.html .
Gracias por el enlace, pero lo he descargado, en concreto el diccionario Harrap's dictionary Ingles-Español - stardict.rar, luego he copiado los archivos descomprimidos en la carpeta Dictionaries, pero no los hago funcionar... solo me funciona el es.miniRAE-2246_r2_eSDICT.zip que hay en la sección de descargas de la web. He probado con un libro en castellano y el miniRAE funciona a la perfección y luego con un ebook en ingles no consigo que me detecte ni salga el nuevo diccionario inglés-castellano.
surquizu
27/01/2017, 12:58
Gracias por el enlace, pero lo he descargado, en concreto el diccionario Harrap's dictionary Ingles-Español - stardict.rar, luego he copiado los archivos descomprimidos en la carpeta Dictionaries, pero no los hago funcionar... solo me funciona el es.miniRAE-2246_r2_eSDICT.zip que hay en la sección de descargas de la web. He probado con un libro en castellano y el miniRAE funciona a la perfección y luego con un ebook en ingles no consigo que me detecte ni salga el nuevo diccionario inglés-castellano.
No tengo el Nolim, con lo que no puedo ayudarte.
Gracias por el enlace, pero lo he descargado, en concreto el diccionario Harrap's dictionary Ingles-Español - stardict.rar, luego he copiado los archivos descomprimidos en la carpeta Dictionaries, pero no los hago funcionar... solo me funciona el es.miniRAE-2246_r2_eSDICT.zip que hay en la sección de descargas de la web. He probado con un libro en castellano y el miniRAE funciona a la perfección y luego con un ebook en ingles no consigo que me detecte ni salga el nuevo diccionario inglés-castellano.
Puede que el Nolim no admita más de un diccionario a la vez. Prueba borrando el miniRAE y dejando únicamente el otro y si no te funciona, coméntalo para que intentemos buscar otra solución.
cocoinasia
27/01/2017, 15:21
Puede que el Nolim no admita más de un diccionario a la vez. Prueba borrando el miniRAE y dejando únicamente el otro y si no te funciona, coméntalo para que intentemos buscar otra solución.
Ya lo he hecho, y nada.
Enviado desde mi SM-T710 mediante Tapatalk
cellaris
28/01/2017, 01:00
Los diccionarios para Bookeen/Nolim necesitan una adaptación específica. El miniRAE que figura en la página de descargas fue adaptado por un forero utilizando el programa "Penelope" (https://github.com/pettarin/penelope), por eso no te va funcionar ningún otro diccionario en formato stardict.
cocoinasia
28/01/2017, 09:03
Los diccionarios para Bookeen/Nolim necesitan una adaptación específica. El miniRAE que figura en la página de descargas fue adaptado por un forero utilizando el programa "Penelope" (https://github.com/pettarin/penelope), por eso no te va funcionar ningún otro diccionario en formato stardict.
Hola muchas gracias por la información. Me he metido en el enlace pero yo no se nada de programación, algún alma caritativa podría hacer el diccionario ¿ingles-castellano?
surquizu
28/01/2017, 13:26
Hola muchas gracias por la información. Me he metido en el enlace pero yo no se nada de programación, algún alma caritativa podría hacer el diccionario ¿ingles-castellano?
Normalmente uso Penelope para convertir diccionarios en formato kobo, he convertido el Harrps al formato Odyssey que creo que es el de Nolim, pero no puedo probar si funciona. Ya diras a ver que tal.
EDITO ENLACE: https://www.dropbox.com/s/15xi4povoj83zxy/Harraps-en-es-nolim.rar?dl=0 (https://www.dropbox.com/s/15xi4povoj83zxy/Harraps-en-es-nolim.rar?dl=0)
cocoinasia
28/01/2017, 13:43
Normalmente uso Penelope para convertir diccionarios en formato kobo, he convertido el Harrps al formato Odyssey que creo que es el de Nolim, pero no puedo probar si funciona. Ya diras a ver que tal.
https://dl.dropboxusercontent.com/u/502128/Harraps-en-es-nolim.rar
Wow !!! Surquizu eres un crack!! ya funciona !! y a la perfección !! Muchísimas gracias !!
12388
Pinpoint
17/04/2017, 09:59
Hola a todos
El enlace del diccionario inglés-español con formato Odyssey para NOLIM de Surquizu ya no funciona.
Serías tan amable Surquizu, o alguien que disponga de alguno similar, de volver a subirlo o incorporarlo a descargas...
Muchas gracias.
surquizu
17/04/2017, 10:14
Hola a todos
El enlace del diccionario inglés-español con formato Odyssey para NOLIM de Surquizu ya no funciona.
Serías tan amable Surquizu, o alguien que disponga de alguno similar, de volver a subirlo o incorporarlo a descargas...
Muchas gracias.
https://www.dropbox.com/s/15xi4povoj83zxy/Harraps-en-es-nolim.rar?dl=0
Pinpoint
17/04/2017, 17:16
https://www.dropbox.com/s/15xi4povoj83zxy/Harraps-en-es-nolim.rar?dl=0
Muchísimas gracias Surquizu. ¡Qué rapidez! Eres un fenómeno.
Diccionarios para el Nolim de Carrefour (Bookeen)
El Nolim se vende con un diccionario francés, otro alemán y un italiano. Si queremos otros diccionarios tenemos que añadirlos después de conectar el Nolim con un ordenador.
Para un diccionario español (mini RAE, 8 MB). (iMuchisimas gracias a Katxan!)
http://www.lectoreselectronicos.com/foro/downloads.php?do=file&id=55
Clic en "+Descargar" y descargar en el escritorio del ordenador.
Abrir la carpeta y copiar los 2 archivos:
"es.miniRAE-2246_r2_eSDICT.dict"
"es.miniRAE-2246_r2_eSDICT.dict.idx"
En la carpeta "Dictionaries" del Nolim.
Para otros diccionarios:
Descargar IZArc para descomprimir archivos
Luego ir a https://ubibooks.bookeen.com/dic/index.htm
Encontrarán:
• Alemán de.wiktionary.dict.install (20 MB) que debe ya estar en la tableta
• Italiano it.wikipedia.dict.install (2 MB) también ya en el Nolim normalmente
• Inglés-italiano en-it.dict.install (1 MB)
• Inglés en.gcide.dict.install (34 MB)
• Inglés-francés en-fr.dict.install (300 KB)
Diccionario inglés-español-inglés Harraps (13 MB). iGracias a Surquizu!
https://www.dropbox.com/s/15xi4povoj83zxy/Harraps-en-es-nolim.rar?dl=0
Las carpetas .intall son de ZIP que contienen los 2 archivos necesarios para el Nolim:
1. Descargar el archivo en el escritorio del ordenador.
2. Clic derecho y elegir IZArc abrir con IZArc y 2 archivos aparecen.
3. Clic sobre "Extraer" en la parte superior de la página.
4. Una nueva carpeta amarilla aparece en el escritorio: abrirla y copiar les 2 archivos (.dict et .dict.idx) en la carpeta "Dictionaries" del Nolim.
Liss_888
20/07/2018, 23:58
[QUOTE=Robert1;247062]Diccionarios para el Nolim de Carrefour (Bookeen)
El Nolim se vende con un diccionario francés, otro alemán y un italiano. Si queremos otros diccionarios tenemos que añadirlos después de conectar el Nolim con un ordenador.
Para un diccionario español (mini RAE, 8 MB). (iMuchisimas gracias a Katxan!)
http://www.lectoreselectronicos.com/foro/downloads.php?do=file&id=55
Clic en "+Descargar" y descargar en el escritorio del ordenador.
Abrir la carpeta y copiar los 2 archivos:
"es.miniRAE-2246_r2_eSDICT.dict"
"es.miniRAE-2246_r2_eSDICT.dict.idx"
En la carpeta "Dictionaries" del Nolim.
HOLA. SOY NUEVA EN ESTO Y NECESITO AYUDA. ME HE COMPRADO UN NOLIM, Y COMO YA SABEIS NO TIENE DICCIONARIO ES-ES. HE ESTADO LEYENDO LOS FOROS, Y CLARO, NO TENGO MUCHA IDEA DE INFORMATICA. MENCIONAIS QUE HAY QUE DESCARGAR LOS 2 ARCHIVOS DEL MINIRAE (YA LO HE HECHO), PERO ¿¿DONDE LOS COPIO EN EL NOLIM??, CUANDO LO CONECTO AL PC CREO LA CARPET DICTIONARIES Y COPIO LOS ARCHIVOS DENTRO, Y NO FUNCIONA!!! . AL CONECTARLO AL PC, SOLO VEO 3 CARPETAS: digital edictions, fonts, pictures. Y CREE LA CARPETA DICTIONARIES AHI, LUEGO PROBE DENTRO DE digital edictions, Y NADA.
¿POR FAVOR, CÓMO Y DÓNDE COPIO LOS ARCHIVOS DE MINIRAE?
MUCHAS GRACIAS;)
cellaris
29/07/2018, 12:44
[QUOTE=Robert1;247062]Diccionarios para el Nolim de Carrefour (Bookeen)
El Nolim se vende con un diccionario francés, otro alemán y un italiano. Si queremos otros diccionarios tenemos que añadirlos después de conectar el Nolim con un ordenador.
Para un diccionario español (mini RAE, 8 MB). (iMuchisimas gracias a Katxan!)
http://www.lectoreselectronicos.com/foro/downloads.php?do=file&id=55
Clic en "+Descargar" y descargar en el escritorio del ordenador.
Abrir la carpeta y copiar los 2 archivos:
"es.miniRAE-2246_r2_eSDICT.dict"
"es.miniRAE-2246_r2_eSDICT.dict.idx"
En la carpeta "Dictionaries" del Nolim.
HOLA. SOY NUEVA EN ESTO Y NECESITO AYUDA. ME HE COMPRADO UN NOLIM, Y COMO YA SABEIS NO TIENE DICCIONARIO ES-ES. HE ESTADO LEYENDO LOS FOROS, Y CLARO, NO TENGO MUCHA IDEA DE INFORMATICA. MENCIONAIS QUE HAY QUE DESCARGAR LOS 2 ARCHIVOS DEL MINIRAE (YA LO HE HECHO), PERO ¿¿DONDE LOS COPIO EN EL NOLIM??, CUANDO LO CONECTO AL PC CREO LA CARPET DICTIONARIES Y COPIO LOS ARCHIVOS DENTRO, Y NO FUNCIONA!!! . AL CONECTARLO AL PC, SOLO VEO 3 CARPETAS: digital edictions, fonts, pictures. Y CREE LA CARPETA DICTIONARIES AHI, LUEGO PROBE DENTRO DE digital edictions, Y NADA.
¿POR FAVOR, CÓMO Y DÓNDE COPIO LOS ARCHIVOS DE MINIRAE?
MUCHAS GRACIAS;)Si pones la denominación correcta de la carpeta, debería instalarse sin problemas el diccionario.https://uploads.tapatalk-cdn.com/20180729/100f68e4d4778c0c9c8e2584080315b4.jpg
Liss_888
12/08/2018, 21:26
[QUOTE=Liss_888;251147]Si pones la denominación correcta de la carpeta, debería instalarse sin problemas el diccionario.https://uploads.tapatalk-cdn.com/20180729/100f68e4d4778c0c9c8e2584080315b4.jpg
Uy perdón, lo siento mucho, no lo había visto, es que no se manejar el foro muy bien.
No te imaginas cuánto te lo agradezco. Ya me funciona!!!!, era todo que había creado la carpeta "Dictionaries" con minúsculas..., y no funcionaba.
Muchiiiiisimas gracias. Me ha ayudado mucho la foto también. Eres un crac.
Un saludo =D>=D>=D>
Hola queridos todos:
Me uno al hilo porque tras varias lecturas con el Nolim, haciendo uso y abuso del diccionario mini-DRAe, me he dado cuenta de que tiene ciertos problemas a la hora de localizar ciertas palabras acentuadas o con "ñ". Tampoco es capaz de acceder a la definición de palabras que se encuentran dentro de la propia definición de la que se está consultando (consulta encadenada), pero eso me temo que es consecuencia del formato del diccionario o del propio firmware del lector y de difícil solución, si es que la tiene.
Debido a ello me puse a la tarea de convertir el diccionario DRAE en formato Stardict que está en el enlace señalado anteriormente (http://kobo.lectoreselectronicos.com/subweb/recopilacion.html), pero no he conseguido que funcione pues penelope en todos los casos, con la nueva sintaxis
python -m penelope -i drae -j stardict -f es -t es -p bookeen -o drae.dict
da un error de que no localiza la tabla "T_DictIndex", tabla que pertenece a la base de datos .idx del formato final "bookeen" (lo he averiguado curioseando el fichero "es.miniRAE-2246_r2_eSDICT.dict.idx") pero no a la del .idx de origen stardict "drae.idx", que ni siquiera parece ser un fichero de índices.
Con estos antecedentes a ver si nuestro buen Surquizu, usuario habitual de penelope, o el bueno de Elchamaco, que se ha peleado con penelope, lo que le valió el agradecimiento de su autor original, tienen alguna idea de por dónde puedo seguir, lo que les valdrá mi agradecimiento y mis felicitaciones. Entre tanto, lo sigo intentando...
Gracias por vuestra atención.
El firmware de los Nolim está "capado" y es un poco diferente del oficial de Bookeen.
Yo en un Cybook Odyssey y Muse Hd puedo hacer búsquedas encadenadas, es decir busco una palabra en el diccionario y en la definición puedo seleccionar cualquier palabra y la vuelve a buscar en el diccionario, el problema es que no reconoce las inflexiones como el diccionario de los Kindle y el diccionario se queda limitado en ese sentido.
Saludos.
elchamaco
21/08/2018, 08:11
Las inflexiones en los stardict suele ir en un fichero adicional. En Penelope al final lo añadieron. Pero si el stardict que se esta convirtiendo no lo tiene pues nada que hacer. Otra alternativa es repetir definiciones pero incrementa mucho el diccionario. Lo que no se es si el formato del booken luego las tiene, aunque supongo que si, no recuerdo ahora que variaciones tenía respecto al stardict.
Aunque lo de los enlaces no se si se refiere pulsar una palabra y que busque nuevamente, sino a que dentro de una definición tengamos una palabra que haga referencia a otra definición y te lleve a ella. Stardict si soporta esto aunque solo llevarte a la definición no a un punto concreto de ella. Tampoco se si el booken lo permite. Los diccionarios de kindle si permiten enlaces y llevarte a un punto concreto de una definición... aunque luego en la ventana que se abre en los kindle no se muestran los enlaces, solo rula en modo libro.
Si tengo un rato intento convertir alguno, aunque no podré probarlo, no tengo booken.
Las inflexiones en los stardict suele ir en un fichero adicional. En Penelope al final lo añadieron. Pero si el stardict que se esta convirtiendo no lo tiene pues nada que hacer. Otra alternativa es repetir definiciones pero incrementa mucho el diccionario. Lo que no se es si el formato del booken luego las tiene, aunque supongo que si, no recuerdo ahora que variaciones tenía respecto al stardict.
Aunque lo de los enlaces no se si se refiere pulsar una palabra y que busque nuevamente, sino a que dentro de una definición tengamos una palabra que haga referencia a otra definición y te lleve a ella. Stardict si soporta esto aunque solo llevarte a la definición no a un punto concreto de ella. Tampoco se si el booken lo permite. Los diccionarios de kindle si permiten enlaces y llevarte a un punto concreto de una definición... aunque luego en la ventana que se abre en los kindle no se muestran los enlaces, solo rula en modo libro.
Si tengo un rato intento convertir alguno, aunque no podré probarlo, no tengo booken.
Muchas gracias. En realidad con que funcione la conversión entre stardict y nolim (bookeen) sería suficiente ya que ese es el motivo de que haya escrito la entrada. Pelearse con el formato y las definiciones encadenadas ya es harina de otro costal pero, llegado el caso, estaré dispuesto a pelearme con ello.
Saludos cordiales.
El firmware de los Nolim está "capado" y es un poco diferente del oficial de Bookeen.
Yo en un Cybook Odyssey y Muse Hd puedo hacer búsquedas encadenadas, es decir busco una palabra en el diccionario y en la definición puedo seleccionar cualquier palabra y la vuelve a buscar en el diccionario, el problema es que no reconoce las inflexiones como el diccionario de los Kindle y el diccionario se queda limitado en ese sentido.
Saludos.
Vaya, pues entonces la solución no parece tener mucho recorrido. En todo caso, llegado el momento, como he escrito en la anterior entrada, veré a ver si soy capaz de conseguir algo.
Más saludos cordiales ;-)
surquizu
22/08/2018, 12:45
Hola queridos todos:
Me uno al hilo porque tras varias lecturas con el Nolim, haciendo uso y abuso del diccionario mini-DRAe, me he dado cuenta de que tiene ciertos problemas a la hora de localizar ciertas palabras acentuadas o con "ñ". Tampoco es capaz de acceder a la definición de palabras que se encuentran dentro de la propia definición de la que se está consultando (consulta encadenada), pero eso me temo que es consecuencia del formato del diccionario o del propio firmware del lector y de difícil solución, si es que la tiene.
Debido a ello me puse a la tarea de convertir el diccionario DRAE en formato Stardict que está en el enlace señalado anteriormente (http://kobo.lectoreselectronicos.com/subweb/recopilacion.html), pero no he conseguido que funcione pues penelope en todos los casos, con la nueva sintaxis
python -m penelope -i drae -j stardict -f es -t es -p bookeen -o drae.dict
da un error de que no localiza la tabla "T_DictIndex", tabla que pertenece a la base de datos .idx del formato final "bookeen" (lo he averiguado curioseando el fichero "es.miniRAE-2246_r2_eSDICT.dict.idx") pero no a la del .idx de origen stardict "drae.idx", que ni siquiera parece ser un fichero de índices.
Con estos antecedentes a ver si nuestro buen Surquizu, usuario habitual de penelope, o el bueno de Elchamaco, que se ha peleado con penelope, lo que le valió el agradecimiento de su autor original, tienen alguna idea de por dónde puedo seguir, lo que les valdrá mi agradecimiento y mis felicitaciones. Entre tanto, lo sigo intentando...
Gracias por vuestra atención.
Esto es lo que he hecho y los archivos resultantes. A ver si te vale:
C:\penelope202dictzip-marisa>penelope.py -p es-es_miniRAE-22.4.6 -f es -t es --output-odyssey
[INFO] Input dictionary has sequence type 'x'.
[INFO] Input dictionary does not have a synonym file.
[INFO] Starting conversion with the following parameters:
[INFO] Dictionary file: es.es-es_miniRAE-22.4.6.dict
[INFO] Index file: es.es-es_miniRAE-22.4.6.dict.idx
[INFO] Language from: es
[INFO] Language to: es
[INFO] License: GNU GPL 3
[INFO] Copyright: GNU GPL 3
[INFO] Title: Dictionary es -> es
[INFO] Description: Dictionary es -> es
[INFO] Year: 2012
[INFO] Reading input dictionaries...
[INFO] Parsing the input data...
[INFO] Using the built-in parser...
[INFO] Outputting in Odyssey format to file...
[INFO] Using built-in collation function...
[INFO] Files es.es-es_miniRAE-22.4.6.dict and es.es-es_miniRAE-22.4.6.dict.idx created successfully!
https://www.dropbox.com/s/z9vr0flpnqtjigl/mini%20rae%20bookeen.rar?dl=0
Si te vale y lo quieres sobre otro diccionario, me dices.
Esto es lo que he hecho y los archivos resultantes. A ver si te vale:
C:\penelope202dictzip-marisa>penelope.py -p es-es_miniRAE-22.4.6 -f es -t es --output-odyssey
[INFO] Input dictionary has sequence type 'x'.
[INFO] Input dictionary does not have a synonym file.
[INFO] Starting conversion with the following parameters:
[INFO] Dictionary file: es.es-es_miniRAE-22.4.6.dict
[INFO] Index file: es.es-es_miniRAE-22.4.6.dict.idx
[INFO] Language from: es
[INFO] Language to: es
[INFO] License: GNU GPL 3
[INFO] Copyright: GNU GPL 3
[INFO] Title: Dictionary es -> es
[INFO] Description: Dictionary es -> es
[INFO] Year: 2012
[INFO] Reading input dictionaries...
[INFO] Parsing the input data...
[INFO] Using the built-in parser...
[INFO] Outputting in Odyssey format to file...
[INFO] Using built-in collation function...
[INFO] Files es.es-es_miniRAE-22.4.6.dict and es.es-es_miniRAE-22.4.6.dict.idx created successfully!
https://www.dropbox.com/s/z9vr0flpnqtjigl/mini%20rae%20bookeen.rar?dl=0
Si te vale y lo quieres sobre otro diccionario, me dices.
Querido Surqui:
Observo que has hecho la conversión partiendo de un miniRAE (ÉL miniRAE), me supongo que en formato stardict, y a ti no te ha fallado, si bien veo que tú lo has hecho desde un windows y yo desde un Ubuntu, no sé si a eso se debe la diferencia de la sintaxis de ejecución de penelope, o a que dispones de una versión distinta de la que yo estoy usando. Ese diccionario es el que tengo instalado actualmente en el Nolim y el que me falla, motivo por el cual estoy buscando convertir el DRAE que está en este enlace (http://kobo.lectoreselectronicos.com/subweb/recopilacion.html). He probado con los dos: el de JPalacios y el de Tokland4 con el mismo resultado en ambos casos.
Ya no sé si se trata de un fallo en el formato de origen o de la versión de penelope que estoy usando, de ahí que solicitara vuestra ayuda, ya que tenéis más experiencia que yo en estas lides. Pero vamos, que si no funciona, me apaño con el minirae y seguiré investigando a ver si doy con el fallo.
Gracias por tu atención.
Un abrazo.
surquizu
22/08/2018, 20:29
Querido Surqui:
Observo que has hecho la conversión partiendo de un miniRAE (ÉL miniRAE), me supongo que en formato stardict, y a ti no te ha fallado, si bien veo que tú lo has hecho desde un windows y yo desde un Ubuntu, no sé si a eso se debe la diferencia de la sintaxis de ejecución de penelope, o a que dispones de una versión distinta de la que yo estoy usando. Ese diccionario es el que tengo instalado actualmente en el Nolim y el que me falla, motivo por el cual estoy buscando convertir el DRAE que está en este enlace (http://kobo.lectoreselectronicos.com/subweb/recopilacion.html). He probado con los dos: el de JPalacios y el de Tokland4 con el mismo resultado en ambos casos.
Ya no sé si se trata de un fallo en el formato de origen o de la versión de penelope que estoy usando, de ahí que solicitara vuestra ayuda, ya que tenéis más experiencia que yo en estas lides. Pero vamos, que si no funciona, me apaño con el minirae y seguiré investigando a ver si doy con el fallo.
Gracias por tu atención.
Un abrazo.
Aqui los tienes:
Tokland: https://www.dropbox.com/s/cnidfksv1i73x7f/drae%20tokland.rar?dl=0
JPalacios: https://www.dropbox.com/s/iuo4pdwo1laaldy/DRAE%20Jpalacios.rar?dl=0
Aqui los tienes:
Tokland: https://www.dropbox.com/s/cnidfksv1i73x7f/drae%20tokland.rar?dl=0
JPalacios: https://www.dropbox.com/s/iuo4pdwo1laaldy/DRAE%20Jpalacios.rar?dl=0Gracias a Negatus por el interés en los diccionarios Bookeen y a Surquizu por las conversiones que hizo. Mañana hago pruebas y comento.
Saludos.
cellaris
23/08/2018, 03:10
El firmware de los Nolim está "capado" y es un poco diferente del oficial de Bookeen.
Yo en un Cybook Odyssey y Muse Hd puedo hacer búsquedas encadenadas, es decir busco una palabra en el diccionario y en la definición puedo seleccionar cualquier palabra y la vuelve a buscar en el diccionario, el problema es que no reconoce las inflexiones como el diccionario de los Kindle y el diccionario se queda limitado en ese sentido.
Saludos.El Nolim (Ed. 2017) también permite las búsquedas encadenadas. La gestión del diccionario es idéntica a la de Bookeen. El que varía es el Nolim antiguo. Creo que tiene un acceso directo a la definición pulsando sobre la palabra, mientras que Bookeen (y Nolim 2017) te remiten a una pantalla previa desde la que acceder a la definición (y en esa pantalla es donde aparecen las inflexiones o, al menos, las palabras más cercanas).
El Nolim (Ed. 2017) también permite las búsquedas encadenadas. La gestión del diccionario es idéntica a la de Bookeen. El que varía es el Nolim antiguo. Creo que tiene un acceso directo a la definición pulsando sobre la palabra, mientras que Bookeen (y Nolim 2017) te remiten a una pantalla previa desde la que acceder a la definición (y en esa pantalla es donde aparecen las inflexiones o, al menos, las palabras más cercanas).
Gracias Cellaris, desconocía que la versión de Nolim 2017 es identica en la gestión de diccionarios a los Bookeen. Hace tiempo tuve el primer Nolim y creo recordar que sí variaba el tema de los diccionarios como bien dices.
Un saludo.
Aqui los tienes:
Tokland: https://www.dropbox.com/s/cnidfksv1i73x7f/drae%20tokland.rar?dl=0
JPalacios: https://www.dropbox.com/s/iuo4pdwo1laaldy/DRAE%20Jpalacios.rar?dl=0
Descargados y probados, muchas gracias Surqui, eres un fenómeno.
No tengo ni idea de por qué a ti te ha funcionado sin problemas y a mi no. Imagino que algo de configuración o de versiones. El caso es que de los tres ficheros que contiene el rar, comprobé con un editor de texto que el contenido del "drae.dict" coincide exactamente con el "drae.dict.dz" del stardict original que descargué del recopilatorio (junto con el .ifo y el .idx) pero, curiosamente, el tamaño es de casi el triple. :o El que no lo conozca, que lo compre...
En cuanto al diccionario en sí:
- Se trata de la 22ª edición (la penúltima). No admite definiciones encadenadas, o sea: si accedo a la definición de una palabra, manteniéndola pulsada en el texto del libro y quiero consultar otra que está en la definición que me devuelve el diccionario, utilizando el mismo método, no es posible. Si se trata de un problema del firmware -es la versión 6.3 del Boo Reader, fechada en 2015- me temo que se va a quedar como está, salvo que alguien conozca una manera de arreglarlo.
- Sigue sin encontrar palabras acentuadas o con "ñ", más allá del problema de las inflexiones. Una palabra simple como "señora" no ha sido capaz de encontrarla. Para esto me pondré a investigar si el motivo es por algún asunto de codificación, a ver si hay suerte y lo averiguo.
- La maquetación del diccionario es manifiestamente mejorable. También me pondré a ver si soy capaz de darle un "apañón". Aunque parece tratarse de ficheros en modo texto puro y duro...
- Con respecto a las inflexiones, bueno, primero hay que arreglar lo importante.
Y eso es todo, reitero mi agradecimiento a Surquizu por su ayuda y al resto por su atención y aportaciones.
Saludos cordiales.
Vaya, me cito a mí mismo:
- Se trata de la 22ª edición (la penúltima). No admite definiciones encadenadas, o sea: si accedo a la definición de una palabra, manteniéndola pulsada en el texto del libro y quiero consultar otra que está en la definición que me devuelve el diccionario, utilizando el mismo método, no es posible. Si se trata de un problema del firmware -es la versión 6.3 del Boo Reader, fechada en 2015- me temo que se va a quedar como está, salvo que alguien conozca una manera de arreglarlo.
Parece ser que en este hilo (http://www.lectoreselectronicos.com/foro/showthread.php?17537-Jailbreak-para-Nolim-HD-de-Carrefour) se ha hecho algún apaño con el firmware que podría arreglar el asunto de las definiciones encadenadas y no sé si alguno más. Tengo dudas al respecto, pero a lo mejor me pongo a ello.
Esto se sabe cuando se empieza, pero no cuando se acaba. :p
Más saludos cordiales.
Lo primero también gracias a Surquizu por el trabajo con los diccionarios.
Yo también los he probado y no me hace búsquedas con palabras con ñ y acentuadas pero sí que hacen búsquedas encadenadas (con el anterior diccionario que está subido en la web también las hacía), aunque tampoco me reconoce las inflexiones, tanto en el Muse HD como en el Cybook Odyssey HD.
La versión del Boo Reader es la 6.3 como la tuya pero a mí me dice que es del 2016 (build 2538).
Un saludo
Descargados y probados, muchas gracias Surqui, eres un fenómeno.
No tengo ni idea de por qué a ti te ha funcionado sin problemas y a mi no. Imagino que algo de configuración o de versiones. El caso es que de los tres ficheros que contiene el rar, comprobé con un editor de texto que el contenido del "drae.dict" coincide exactamente con el "drae.dict.dz" del stardict original que descargué del recopilatorio (junto con el .ifo y el .idx) pero, curiosamente, el tamaño es de casi el triple. :o El que no lo conozca, que lo compre...
En cuanto al diccionario en sí:
- Se trata de la 22ª edición (la penúltima). No admite definiciones encadenadas, o sea: si accedo a la definición de una palabra, manteniéndola pulsada en el texto del libro y quiero consultar otra que está en la definición que me devuelve el diccionario, utilizando el mismo método, no es posible. Si se trata de un problema del firmware -es la versión 6.3 del Boo Reader, fechada en 2015- me temo que se va a quedar como está, salvo que alguien conozca una manera de arreglarlo.
- Sigue sin encontrar palabras acentuadas o con "ñ", más allá del problema de las inflexiones. Una palabra simple como "señora" no ha sido capaz de encontrarla. Para esto me pondré a investigar si el motivo es por algún asunto de codificación, a ver si hay suerte y lo averiguo.
- La maquetación del diccionario es manifiestamente mejorable. También me pondré a ver si soy capaz de darle un "apañón". Aunque parece tratarse de ficheros en modo texto puro y duro...
- Con respecto a las inflexiones, bueno, primero hay que arreglar lo importante.
Y eso es todo, reitero mi agradecimiento a Surquizu por su ayuda y al resto por su atención y aportaciones.
Saludos cordiales.
Lo primero también gracias a Surquizu por el trabajo con los diccionarios.
Yo también los he probado y no me hace búsquedas con palabras con ñ y acentuadas pero sí que hacen búsquedas encadenadas (con el anterior diccionario que está subido en la web también las hacía), aunque tampoco me reconoce las inflexiones, tanto en el Muse HD como en el Cybook Odyssey HD.
La versión del Boo Reader es la 6.3 como la tuya pero a mí me dice que es del 2016 (build 2538).
Un saludo
Efectivamente, esa versión del firmware es posterior a la de mi Nolim. De todos modos sospecho que el problema de las palabras acentuadas y con ñ tiene que ver con el modo en el que está creado el diccionario, cuyo orden no es el estrictamente alfabético. De todos modos estoy trabajando en el asunto y a ver si pronto puedo dar más pistas... o una solución.
Gracias por tu interés y saludos cordiales.
Efectivamente, esa versión del firmware es posterior a la de mi Nolim. De todos modos sospecho que el problema de las palabras acentuadas y con ñ tiene que ver con el modo en el que está creado el diccionario, cuyo orden no es el estrictamente alfabético. De todos modos estoy trabajando en el asunto y a ver si pronto puedo dar más pistas... o una solución.
Gracias por tu interés y saludos cordiales.
Pues me respondo a mí mismo para confirmar que, efectivamente, el asunto de las "ñ" y los acentos tiene que ver en cómo se construye el diccionario:
La forma de ordenar los elementos dentro de los ficheros que componen el diccionario no atiende al estricto orden alfabético de los vocablos en castellano, sino al orden de código de los caracteres que lo componen. Así, penelope genera el fichero disponiendo primero los vocablos con los caracteres no acentuados o con "ñ" y después los mencionados.
Supongamos la siguiente relación de vocablos que comienzan con bail-:
bailete, bailía, bailiaje, bailiazgo, bailío, bailinista, bailista, bailón, bailongo, bailotear, bailoteo.
Los vocablos están ordenados con arreglo al orden alfabético en castellano. En cambio la conversión con penelope los deja en el siguiente orden:
bailete, bailiaje, bailiazgo, bailinista, bailista, bailongo, bailotear, bailoteo, bailía, bailío, bailón.
Puede observarse que los vocablos acentuados son relegados al final de la lista. Esto no sería un problema porque en la base de datos donde se almacena el método de acceso a cada vocablo (fichero .idx) el orden es coherente con esta ordenación, pero me temo que es el índice que contiene dicha base de datos el que al generarse sí respeta la ordenación alfabética del idioma en cuestión.
De este modo, siempre que no haya saltos entre el vocablo que se intenta localizar y su situación en el índice (por ejemplo con el vocablo baipás, porque no hay más vocablos que comiencen con baip- y el siguiente caracter sea un no acentuado o "ñ") se presentará su definición sin problemas. En el otro caso, no lo localizará (o puede que presente una definición errónea o incompleta, no he consultado todos los casos por razones obvias).
Toda esta información la he obtenido en parte por investigación propia y en parte en la excelente documentación que el creador de Penelope, el italiano Alberto Pettarin, tiene disponible en su página personal (https://www.albertopettarin.it/old/penelope.html). Es más, en esa misma página es donde he obtenido la idea para poder regenerar el índice en un navegador de base de datos SQLite, sin cargarme el diccionario, mediante la secuencia de cotejo (collation sequence) NOCASE, en lugar de la que utiliza el formato del diccionario y penelope, por ende: 'IcuNoCase'.
Con todo esto ya me veo en la disposición de arreglar el diccionario, pero quizá lo que haga sea reconstruirlo por completo pues me temo que lo primero me llevaría más tiempo. En fin, a ver por donde salgo... :-"
Saludos cordiales.
elchamaco
03/09/2018, 08:56
Pues me respondo a mí mismo para confirmar que, efectivamente, el asunto de las "ñ" y los acentos tiene que ver en cómo se construye el diccionario:
La forma de ordenar los elementos dentro de los ficheros que componen el diccionario no atiende al estricto orden alfabético de los vocablos en castellano, sino al orden de código de los caracteres que lo componen. Así, penelope genera el fichero disponiendo primero los vocablos con los caracteres no acentuados o con "ñ" y después los mencionados.
Supongamos la siguiente relación de vocablos que comienzan con bail-:
bailete, bailía, bailiaje, bailiazgo, bailío, bailinista, bailista, bailón, bailongo, bailotear, bailoteo.
Los vocablos están ordenados con arreglo al orden alfabético en castellano. En cambio la conversión con penelope los deja en el siguiente orden:
bailete, bailiaje, bailiazgo, bailinista, bailista, bailongo, bailotear, bailoteo, bailía, bailío, bailón.
Puede observarse que los vocablos acentuados son relegados al final de la lista. Esto no sería un problema porque en la base de datos donde se almacena el método de acceso a cada vocablo (fichero .idx) el orden es coherente con esta ordenación, pero me temo que es el índice que contiene dicha base de datos el que al generarse sí respeta la ordenación alfabética del idioma en cuestión.
De este modo, siempre que no haya saltos entre el vocablo que se intenta localizar y su situación en el índice (por ejemplo con el vocablo baipás, porque no hay más vocablos que comiencen con baip- y el siguiente caracter sea un no acentuado o "ñ") se presentará su definición sin problemas. En el otro caso, no lo localizará (o puede que presente una definición errónea o incompleta, no he consultado todos los casos por razones obvias).
Toda esta información la he obtenido en parte por investigación propia y en parte en la excelente documentación que el creador de Penelope, el italiano Alberto Pettarin, tiene disponible en su página personal (https://www.albertopettarin.it/old/penelope.html). Es más, en esa misma página es donde he obtenido la idea para poder regenerar el índice en un navegador de base de datos SQLite, sin cargarme el diccionario, mediante la secuencia de cotejo (collation sequence) NOCASE, en lugar de la que utiliza el formato del diccionario y penelope, por ende: 'IcuNoCase'.
Con todo esto ya me veo en la disposición de arreglar el diccionario, pero quizá lo que haga sea reconstruirlo por completo pues me temo que lo primero me llevaría más tiempo. En fin, a ver por donde salgo... :-"
Saludos cordiales.
Seguramente lo más sencillo sea modificar el código de penelope para que al crear el idx los ordene bien cambiando la rutina. Si lo comentas con el autor lo mismo saca una versión con opción a ello.
Creo que es más sencillo.
Al final de la página que indicas creo que lo deja claro
Custom collation function when outputting to Bookeen Cybook Odyssey format
When outputting to Bookeen Cybook Odyssey format is possibile to change the collation function of the SQLite index being built.
To do so, you can issue the optional argument --collation coll.py to instruct my script to use the collation function defined in file coll.py.
Your Python file will contain a function collate_function(string1, string2)
that will compare the two given strings, returning 0 if and only if string1 and string2 should be considered as equal, -1 if string1 precedes string2, and 1 otherwise.
If the user does not specify a custom collation function, Penelope applies the default collation function, which implements the NOCASE collation as defined in SQLite documentation (http://www.sqlite.org/datatype3.html).
Please see the included files: default_collation.py and the specialized collation function for German collation_de.py.
por lo que tan sólo tienes que duplicar el archivo collation_de.py en collation_es.py y modificar las reglas
for f in [ [u'ä', u'a'], [u'ö', u'o'], [u'ü', u'u'], [u'ß', u'ss'] ]:
#Python3# for f in [ ['ä', 'a'], ['ö', 'o'], ['ü', 'u'], ['ß', 'ss'] ]:
para el castellano.
Suerte.
Seguramente lo más sencillo sea modificar el código de penelope para que al crear el idx los ordene bien cambiando la rutina. Si lo comentas con el autor lo mismo saca una versión con opción a ello.
Creo que es más sencillo.
Al final de la página que indicas creo que lo deja claro
Custom collation function when outputting to Bookeen Cybook Odyssey format
When outputting to Bookeen Cybook Odyssey format is possibile to change the collation function of the SQLite index being built.
To do so, you can issue the optional argument --collation coll.py to instruct my script to use the collation function defined in file coll.py.
Your Python file will contain a function collate_function(string1, string2)
that will compare the two given strings, returning 0 if and only if string1 and string2 should be considered as equal, -1 if string1 precedes string2, and 1 otherwise.
If the user does not specify a custom collation function, Penelope applies the default collation function, which implements the NOCASE collation as defined in SQLite documentation (http://www.sqlite.org/datatype3.html).
Please see the included files: default_collation.py and the specialized collation function for German collation_de.py.
por lo que tan sólo tienes que duplicar el archivo collation_de.py en collation_es.py y modificar las reglas
for f in [ [u'ä', u'a'], [u'ö', u'o'], [u'ü', u'u'], [u'ß', u'ss'] ]:
#Python3# for f in [ ['ä', 'a'], ['ö', 'o'], ['ü', 'u'], ['ß', 'ss'] ]:
para el castellano.
Suerte.
Pues al final, a falta de una comprobación más exhaustiva, parece ser que no hace falta ni una cosa ni la otra pues al recrear el índice todavía no he encontrado una palabra que falle. Ya digo, aún tengo que probar más casos.
De todos modos mi problema inicial era que no conseguía hacer que penelope funcione en mi Ubuntu y fue nuestro buen compañero Surquizu quien nos pasó versiones convertidas.
Todavía tengo pendiente ver si sigo por el camino de hacer que penelope funcione (aunque sea en una máquina virtual windows) o si con los conocimientos adquiridos, tomar una versión del diccionario mejor maquetada y hacer la conversión yo mismo. Dado que se trata de la 22ª edición, me inclino por una maquetación similar a la que tenía la versión online, con las consiguientes adaptaciones a un entorno en escala de grises. En fin, os mantendré informados.
Cordiales saludos cordiales ;-)
Pues finalmente, tal y como me había propuesto, tengo disponible una versión del diccionario de la RAE para el Nolimbook + HD (Bookeen) con una maquetación más parecida a la de la versión online... de la 22ª edición.
Lo cierto es que he respetado en la medida de lo posible el modo en que se presenta la información de cada entrada en dicha versión (http://lema.rae.es/drae2001/), pero hay algunas excepciones: algunas derivadas de la imposibilidad de hacer conversiones prácticamente a mano en 88.000 entradas y otras porque me ha parecido más adecuada para su visualización en el lector la que utiliza la versión online de la 23ª edición, como por ejemplo poner en fondo gris el origen o procedencia de la palabra (http://dle.rae.es/?id=T1oCnEi|T1qXUNp).
Aunque muy probablemente habría sido más sencillo ponerme a destripar el programa penelope (hacerlo funcionar en mi máquina) y adecuarlo a la codificación de caracteres del castellano, he preferido hacerlo de una manera más "manual", lo que ha resultado bastante más arduo aunque también más divertido pues me ha exigido a fondo en varias de mis habilidades multidisciplinares. Explico un poco el proceso en spoiler por no alargar demasiado el texto... y porque tampoco creo que sea del interés de todos. Al final, estoy bastante satisfecho del resultado, si bien hay cuestiones que quedarían para más adelante:
- Me hubiera gustado convertir el diccionario sobre la 23ª edición, pero he sido incapaz de encontrarla.
- La versión original de la 22ª edición de la que partí, en formato epub, tenía errores. En las muchas revisiones del texto, mientras comprobaba el funcionamiento, he detectado algunos; pero estoy seguro de que en las casi 90.000 definiciones se habrán quedado muchos más. Además de que, aunque he probado un subconjunto apreciable de entradas, en cada uno de los 94 ficheros individuales en los que el formato divide el original, seguro que habrán más. Agradeceré sobremanera el reporte de aquellos errores que aparezcan.
- La cuestión de las inflexiones no sé si se debe a la necesidad de la existencia de un fichero adicional de ellas, o es cuestión del firmware. Si a alguien le funcionan con este diccionario, le ruego que nos lo haga saber.
Y eso es todo. Aquí os dejo el enlace para descargarlo.
https://drive.google.com/file/d/1amMEa6PRMdA-eEZ9qYTEwQdtCgd-9kdX/view?usp=sharing
Saludos afectuosos.
El proceso partió de un fichero en epub (formato binario) que fue convertido en fb2, formato que "habla" directamente en html, mediante calibre.
Tras eliminar las cabeceras, prólogos, imágenes, etc. del fichero fb2, para dejar exclusivamente las definiciones, se procedió a las adaptaciones necesarias para la maquetación, lo que, al tratarse de búsquedas y sustituciones de patrones, hizo necesario un uso complejo y profuso de expresiones regulares, de las que he aprendido un montón. Con todo, la existencia en el diccionario de caracteres especiales provenientes del griego, francés, árabe latinizado, etc. Añadieron dificultad al proceso, si ya tenía de por sí. Algunas de las expresiones eran tan complejas que el editor daba error de que no podía procesarlas y tuve que refinarlas para hacerlas más simples.
Una vez obtenido el fichero completo con el formato final, quedaba la construcción de la base de datos de índices. Me las prometía muy felices llevando las definiciones a una hoja de cálculo, donde mediante fórmulas sumaría la longitud de cada definición y aplicaría la norma de desplazamiento de la tabla de índices, que indexa hasta 256 Kb. por fichero. Resulta que hay caracteres que ocupan dos bytes (precisamente la "ñ", las letras acentuadas, los caracteres en griego...) por lo que la longitud de las cadenas no sirve y tuve que acudir a comandos linux que me dieran la longitud en bytes de cada una de las más de 88.000 líneas del fichero.
El castellano tiene alrededor de 5.000 vocablos que tienen más de un origen (que no más de una acepción, que es otra cosa) entre los que se incluyen los que proceden de nombres propios, que generan una definición diferenciada. Palabras como "bote" o "radio", tienen hasta seis orígenes diferentes. Cuando se busca uno de estos vocablos, el diccionario ha de presentar todos los que coinciden, y esto es una única entrada en el índice en el que se tiene que sumar el desplazamiento de todas las definiciones. De nuevo me valí de la hoja de cálculo para agrupar los desplazamientos... y de las expresiones regulares para eliminar las definiciones repetidas y posteriormente los números que diferencian las definiciones.
Tras comprobar que, tras todas la transformaciones debidas al agrupamiento, la suma de los desplazamientos sigue coincidiendo con los originales, los datos obtenidos se traspasan a la base de datos de índices, concretamente a la tabla T_Dictindex, mediante un editor de bases de datos SQLite para linux (concretamente "DB Browser for SQLite", como imaginativamente fue bautizado el susodicho). Conviene regenerar el índice sustituyendo la cláusula "COLLATE IcuNoCase" por "COLLATE NOCASE".
Tras generar la base de datos de índices hay que dividir el fichero original en ficheros de 256Kb (94 en total), de nuevo usando comandos Linux que, dicho sea de paso, no respetan la división por definiciones, por lo que toca ir revisando de uno en uno, comparando con la división hecha en la hoja de cálculo, añadiendo las que faltan al final, a partir del primero, y quitándolas del principio, a partir del segundo. No dejó de llamarme la atención la discordancia entre lo calculado en la hoja de cálculo y lo obtenido en la división de ficheros, teniendo en ocasiones que mover alrededor de 200 definiciones; pero al final funciona, que es de lo que se trata. Imagino que la dicotomía entre 1000 o 1024 bytes por kilobyte, que se da en el sistema operativo, tuvo algo de culpa.
Finalmente se comprueba la última palabra de cada fichero y la primera del siguiente para ver si el índice está funcionando bien. Para ello el libro que me sirvió de referencia fue... el propio diccionario original en formato epub.
Puede concluirse que tuve que entregarme a fondo en conocimientos multidisciplinares: Calibre (bueno, este menos), maquetación HTML/CSS (tampoco excesivos, ciertamente), ofimática (fórmulas en hojas de cálculo), expresiones regulares, comandos linux y bases de datos. De ahí la diversión que me ha proporcionado. Si me hubiera puesto a "destripar" penelope casi seguro que habría tardado menos pero también me habría divertido menos y, aunque parezca mentira, me daba más pereza ponerme a aprender python. Rarezas de uno.
Por último, creo que es de justicia valorar el trabajo que se hace en la RAE para sistematizar algo tan difícilmente "sistematizable" como el lenguaje, donde cada regla tiene una excepción. El trabajar con el diccionario me ha permitido apreciar cómo se avanza en que cada nueva versión resulte más comprensible, más legible y más sencilla de tratar mediante medios informáticos. De ahí también la lástima de no poder haber hecho la conversión partiendo de la última edición. Pero ya encontraré la forma de hacerlo.
=D>¡Enhorabuena!=D>
Puntualizaciones:
Creo que te podrías haber evitado la conversión a fb2, epub es un zip renombrado (dentro del cual se encuentran los html -o xhtml-, css y demás) y con Sigil o E-book Editor de Calibre...
Sin saber el editor utilizado me arriesgo a decirte que con Geany (o con más memoria RAM) no habrías tenido problemas.
Sinceramente, para modificar Penelope no necesitas aprender Python, sólo entender el funcionamiento del programa y, mucho más importante, saber lo que quieres. Me refiero a que si tuvieras un programa que dibujara un vestido y quisieras transformarlo en uno que dibujara un edificio, sería más importante saber dibujar que saber Python. Es un reto para la 23.;)
Suerte.
Gracias por el trabajo Negatus, he probado el diccionario en dos Bookeen, un Cybook y un Muse HD y funcionan perfectamente.
Las inflexiones no funcionan como en diccionarios anteriores y las búsquedas encadenadas (buscar otra palabra dentro de una definición) sí que funcionan. Desconozco si esto de las búsquedas encadenadas funciona ahora en los lectores Nolim, aunque como hablamos anteriormente llevan una versión modificada del motor de lectura respecto a los Bookeen y puede que ahí esté el problema.
Gran trabajo y saludos.
Gracias por el trabajo Negatus, he probado el diccionario en dos Bookeen, un Cybook y un Muse HD y funcionan perfectamente.
Las inflexiones no funcionan como en diccionarios anteriores y las búsquedas encadenadas (buscar otra palabra dentro de una definición) sí que funcionan. Desconozco si esto de las búsquedas encadenadas funciona ahora en los lectores Nolim, aunque como hablamos anteriormente llevan una versión modificada del motor de lectura respecto a los Bookeen y puede que ahí esté el problema.
Gran trabajo y saludos.
Gracias a ti, davemac, por descargarlo y probarlo en tantos dispositivos y por darme la pista para el próximo quehacer: las inflexiones. Me alegro mucho de que haya funcionado sin problemas aunque insisto en que estoy seguro de que esconde fallos, pues el volumen de datos es tan ingente que se me escapaba, por una simple cuestión de tiempo, el hacer pruebas concienzudas en la totalidad de las definiciones.
Parece una tonteria, pero en los casos en que lo he usado, ya en lectura normal y corriente, la diferencia entre leer en el formato apelotonado de la versión anterior y este hace que sea mucho más grato hacer las consultas al diccionario... Aunque puede ser que uno sea un maniático, que también. ;-)
Lo dicho, gracias a ti y saludos cordiales.
De vuelta estoy con el asunto de las inflexiones y, como en el chascarrillo, tengo una noticia buena y una mala...
Empecemos por la buena:
Tras investigar si hay algo de información al respecto (por cierto si hubiera investigado antes lo de las inflexiones habría visto los trabajos previos de jcn363 y que la subweb de los diccionarios para kobo está hecha por mi buen amigo Surquizu, pido perdón por mi torpeza previa :-s), la respuesta es que no la hay. Ahora bien, pensando en la relativa simpleza del formato de estos diccionarios se me ocurrió pensar en si la base de datos de índices admitiría valores repetidos en la tabla de definiciones, cambiando solo el campo perteneciente a la entrada (F_word).
Pues bien, sí que lo admite y eso posibilita que una inflexión haga referencia a la definición de la que se obtiene. Lo he probado con algunas formas irregulares de verbos y funciona. Con esos antecedentes, bastaría con una de mis hojas de cálculo que encontrara la definición a la que pertenece la inflexión y le asignara los otros valores necesarios (desplazamiento, tamaño y número del fichero). Luego se añaden esos datos al final de la tabla de índices y asunto concluido, si bien presupongo que se incrementaría mucho el tamaño de dicho fichero. Y hasta aquí la noticia buena.
La noticia mala es que no sé dónde obtener un fichero de inflexiones para este diccionario pues, francamente, no me veo recopilándolas para todos y cada uno de los verbos que tiene. Aquí es donde solicito vuestra ayuda pues me ha parecido leer en algún sitio en este mismo foro que existir, existe, pero para otros diccionarios. Si es el caso ya me encargaría yo de las conversiones pertinentes, siempre que se pueda editar.
Y hasta aquí mis pesquisas y tribulaciones. Si hay alguien que pueda echarme una mano lo agradeceré enormemente. Mientras tanto sigo buscando a ver si encuentro un fichero con las inflexiones ya recopiladas. 8->
Saludos afectuosos.
El desconocimiento no es torpeza y, por lo tanto, no requiere perdón.
Realmente, lo que habría que saber es el número de verbos irregulares (https://www.aboutespanol.com/los-verbos-irregulares-en-espanol-2879644).
Creo que con la ayuda de RAE (http://dle.rae.es), wordreference (https://www.wordreference.com/conj/EsVerbs.aspx), tulengua (http://tulengua.es/conjugar-verbo/) y tiempo...
A tu disposición.
Suerte.
Yo te propondría coger un diccionario de formato babylon (.bgl) (por ahí andan el GDL Larouse o el DUE de VOX, que por cierto es el que llevan los KOBO) y seguir parte de los pasos que conté en siguiente post con el programa stardict-editor:
http://www.lectoreselectronicos.com/foro/showthread.php?18198-Diccionario-Lat%C3%ADn-Espa%C3%B1ol&p=251052&viewfull=1#post251052
Te quedarías con el fichero de texto extensión .babylon. Es un fichero de texto que se puede retocar con cualquier editor. Las palabras salen así (por ejemplo):
ir|voy|vas|va|vamos|vaís|van|iba|ibas|íbamos|ibais |...
<font color="blue">v. verbo intransitivo<BR><B>1</B> Moverse [una persona o una cosa] hacia....
De aquí creo que podrías sacar mucha información de palabras relacionadas.
El resto del post era para seguir con su conversión a diccionarios del KOBO, pero eso creo que no te hace falta.
Espero que te sirva.
El desconocimiento no es torpeza y, por lo tanto, no requiere perdón.
Realmente, lo que habría que saber es el número de verbos irregulares (https://www.aboutespanol.com/los-verbos-irregulares-en-espanol-2879644).
Creo que con la ayuda de RAE (http://dle.rae.es), wordreference (https://www.wordreference.com/conj/EsVerbs.aspx), tulengua (http://tulengua.es/conjugar-verbo/) y tiempo...
A tu disposición.
Suerte.
En realidad, obtener los verbos del propio diccionario no es tan complicado (aquellos cuya primera acepción tiene la abreviatura tr. o intr.) que son unos once mil.
Ahora bien, luego habría que añadir, en los regulares, las terminaciones de los tiempos verbales desechando aquellas que el propio motor de búsqueda del diccionario encontraría, por similitud con la forma del infinitivo (calculo que quedarían unas diez o doce como mucho por cada verbo regular) y los participios con definición propia. En los verbos irregulares la cosa se amplía por un lado, con las formas que varían con respecto a la raíz del verbo, y se reduce por otro, con los verbos derivados. A bote pronto me da que difícilmente bajaría de las 100.000 definiciones añadidas... "musha" tela. :-s
También hay que tener en cuenta que algunas inflexiones producidas por plurales no son localizadas en el diccionario, quizá porque el buscador localiza antes otros vocablos con mayor parecido a la forma en plural y esos sí que son difíciles de diferenciar. ¿De verdad que no existe un fichero de inflexiones como lo que usa el propio buscador de la rae? :((
En fin, sigo con mis tribulaciones...
Un afectuoso saludo.
Yo te propondría coger un diccionario de formato babylon (.bgl) (por ahí andan el GDL Larouse o el DUE de VOX, que por cierto es el que llevan los KOBO) y seguir parte de los pasos que conté en siguiente post con el programa stardict-editor:
http://www.lectoreselectronicos.com/foro/showthread.php?18198-Diccionario-Lat%C3%ADn-Espa%C3%B1ol&p=251052&viewfull=1#post251052
Te quedarías con el fichero de texto extensión .babylon. Es un fichero de texto que se puede retocar con cualquier editor. Las palabras salen así (por ejemplo):
ir|voy|vas|va|vamos|vaís|van|iba|ibas|íbamos|ibais |...
<font color="blue">v. verbo intransitivo<BR><B>1</B> Moverse [una persona o una cosa] hacia....
De aquí creo que podrías sacar mucha información de palabras relacionadas.
El resto del post era para seguir con su conversión a diccionarios del KOBO, pero eso creo que no te hace falta.
Espero que te sirva.
He estado echando un vistazo pero los enlaces me llevaban a descargar el instalador de Babylon, que no se instala en mi Ubuntu. De todos modos, ¿son fiables desde el punto de reconocer todos los verbos, o son un subconjunto más o menos completo de los de uso más frecuente?
Podrían ser una gran ayuda con los verbos irregulares, pero no sé si se dejarían alguno atrás, suficientemente relevante...
Seguiré buscando a ver... :-"
Un afectuoso saludo.
He estado echando un vistazo pero los enlaces me llevaban a descargar el instalador de Babylon, que no se instala en mi Ubuntu. De todos modos, ¿son fiables desde el punto de reconocer todos los verbos, o son un subconjunto más o menos completo de los de uso más frecuente?
Podrían ser una gran ayuda con los verbos irregulares, pero no sé si se dejarían alguno atrás, suficientemente relevante...
Seguiré buscando a ver... :-"
Un afectuoso saludo.
Mira el correo y me cuentas ...
En fin, sigo con mis tribulaciones...
Haz una búsqueda en Synaptic por stardict, o usa línea de comandos para instalar:
sudo apt install stardict* sdcv
o
sudo aptitude install --with-recommends stardict sdcv
La página (https://code.google.com/archive/p/stardictproject/downloads) con el instalable de la 3.0.1, por si acaso.
Puedes hacer lo mismo con GoldenDict (http://goldendict.org/download.php).
Para convertir, desde la línea de comandos, de bgl a ifo (StarDict) puedes instalar dictconv.
Suerte.
Lo prometido es deuda: ;)
Ya he conseguido incluir las inflexiones en el diccionario de la 22ª edición y lo cierto es que ahora la experiencia de consultar palabras durante la lectura es por fin satisfactoria.
Al final han sido unas 525.000 definiciones extra en la tabla de índices, pero hay que tener en cuenta que no he filtrado plurales o formas verbales cuya semejanza con el singular o el infinitivo, respectivamente, hubieran permitido que el motor de búsqueda los hubiera localizado sin necesidad de tener su definición (registro) explícita, lo cual habría reducido considerablemente este número. Con todo, presupongo que seguirán existiendo errores y además, en las búsquedas que he realizado, he constatado la localización de alguna inflexión que, por coincidencia con otra forma verbal pronominal, no daba el resultado correcto, si bien son casos muy excepcionales. Describo someramente el proceso a continuación, pero ocultándolo para no dar información de más a quien no le interese.
Extraer, mediante expresiones regulares, las definiciones en los ficheros del DUE de Vox y el GDL (Larousse), eliminando código y texto sobrante.
Eliminar las definiciones que aparecen repetidas; el diccionario de Vox contiene un buen número de ellas sobre todo en las formas verbales pronominales, no sé el motivo. También se eliminan aquellas definiciones que no tienen inflexiones pues no resultan de utilidad en el proceso.
Buscar las inflexiones de Vox que no estén en Larousse y añadirlas, ordenándolas tras el proceso.
Compararlas con las definiciones del diccionario de la RAE y eliminar aquellas que no coinciden: ya sea por tratarse de formas pronominales sin definición propia, porque no estaban incorporadas en la 22ª edición, o porque ya no existen, presumo que por anticuadas, en dicha edición.
Una vez expurgado el fichero, insertar en las filas correspondientes los tamaños en bytes de: definición, desplazamientos y número de fichero, necesarios para la tabla de índices (¡bendita función BUSCARV!).
Descomponer las definiciones de inflexiones en una fila por cada una, duplicando los datos numéricos correspondientes obtenidos en el paso anterior, mediante aplicación de búsquedas y sustituciones con expresiones regulares. Fueron necesarias algo más de veinte iteraciones hasta conseguir dejar una única palabra por fila.
Volver a eliminar definiciones repetidas, debidas sobre todo a coincidencias entre sustantivos/adjetivos y tiempos verbales.
Insertar los datos en la tabla de índices.
Mi agradecimiento a JIPG y jcn363 por su inestimable ayuda a la hora de obtener los diccionarios con las inflexiones, de los que me he servido para completar el trabajo.
La verdad es que lo he disfrutado y ahora me queda la posibilidad de hacer lo propio con la 23ª edición, si soy capaz de conseguirlo en formato electrónico, pero eso será otra historia. ;)
He actualizado el fichero en la nube, no obstante vuelvo a incluir el enlace:
https://drive.google.com/file/d/1amMEa6PRMdA-eEZ9qYTEwQdtCgd-9kdX/view?usp=sharing
Saludos afectuosos.
Lo prometido es deuda: ;)
Ya he conseguido incluir las inflexiones en el diccionario de la 22ª edición y lo cierto es que ahora la experiencia de consultar palabras durante la lectura es por fin satisfactoria.
Al final han sido unas 525.000 definiciones extra en la tabla de índices, pero hay que tener en cuenta que no he filtrado plurales o formas verbales cuya semejanza con el singular o el infinitivo, respectivamente, hubieran permitido que el motor de búsqueda los hubiera localizado sin necesidad de tener su definición (registro) explícita, lo cual habría reducido considerablemente este número. Con todo, presupongo que seguirán existiendo errores y además, en las búsquedas que he realizado, he constatado la localización de alguna inflexión que, por coincidencia con otra forma verbal pronominal, no daba el resultado correcto, si bien son casos muy excepcionales. Describo someramente el proceso a continuación, pero ocultándolo para no dar información de más a quien no le interese.
Extraer, mediante expresiones regulares, las definiciones en los ficheros del DUE de Vox y el GDL (Larousse), eliminando código y texto sobrante.
Eliminar las definiciones que aparecen repetidas; el diccionario de Vox contiene un buen número de ellas sobre todo en las formas verbales pronominales, no sé el motivo. También se eliminan aquellas definiciones que no tienen inflexiones pues no resultan de utilidad en el proceso.
Buscar las inflexiones de Vox que no estén en Larousse y añadirlas, ordenándolas tras el proceso.
Compararlas con las definiciones del diccionario de la RAE y eliminar aquellas que no coinciden: ya sea por tratarse de formas pronominales sin definición propia, porque no estaban incorporadas en la 22ª edición, o porque ya no existen, presumo que por anticuadas, en dicha edición.
Una vez expurgado el fichero, insertar en las filas correspondientes los tamaños en bytes de: definición, desplazamientos y número de fichero, necesarios para la tabla de índices (¡bendita función BUSCARV!).
Descomponer las definiciones de inflexiones en una fila por cada una, duplicando los datos numéricos correspondientes obtenidos en el paso anterior, mediante aplicación de búsquedas y sustituciones con expresiones regulares. Fueron necesarias algo más de veinte iteraciones hasta conseguir dejar una única palabra por fila.
Volver a eliminar definiciones repetidas, debidas sobre todo a coincidencias entre sustantivos/adjetivos y tiempos verbales.
Insertar los datos en la tabla de índices.
Mi agradecimiento a JIPG y jcn363 por su inestimable ayuda a la hora de obtener los diccionarios con las inflexiones, de los que me he servido para completar el trabajo.
La verdad es que lo he disfrutado y ahora me queda la posibilidad de hacer lo propio con la 23ª edición, si soy capaz de conseguirlo en formato electrónico, pero eso será otra historia. ;)
He actualizado el fichero en la nube, no obstante vuelvo a incluir el enlace:
https://drive.google.com/file/d/1amMEa6PRMdA-eEZ9qYTEwQdtCgd-9kdX/view?usp=sharing
Saludos afectuosos.
Impresionante. Lo he probado en mis dos Bookeen y funciona perfectamente. Yo le doy mucha importancia a los diccionarios y parece otro lector, además la presentación de la búsqueda es limpia y agradable a la vista.
Con este diccionario me parece que poco voy a leer en el Paperwhite, ya que el único motivo de tener un Kindle era por los diccionarios.
Se merece estar en la sección de descargas de la web.
Muchas gracias por tu trabajo.
Saludos.
Lo prometido es deuda: ;)
Ya he conseguido incluir las inflexiones en el diccionario de la 22ª edición y lo cierto es que ahora la experiencia de consultar palabras durante la lectura es por fin satisfactoria.
Al final han sido unas 525.000 definiciones extra en la tabla de índices, pero hay que tener en cuenta que no he filtrado plurales o formas verbales cuya semejanza con el singular o el infinitivo, respectivamente, hubieran permitido que el motor de búsqueda los hubiera localizado sin necesidad de tener su definición (registro) explícita, lo cual habría reducido considerablemente este número. Con todo, presupongo que seguirán existiendo errores y además, en las búsquedas que he realizado, he constatado la localización de alguna inflexión que, por coincidencia con otra forma verbal pronominal, no daba el resultado correcto, si bien son casos muy excepcionales. Describo someramente el proceso a continuación, pero ocultándolo para no dar información de más a quien no le interese.
Extraer, mediante expresiones regulares, las definiciones en los ficheros del DUE de Vox y el GDL (Larousse), eliminando código y texto sobrante.
Eliminar las definiciones que aparecen repetidas; el diccionario de Vox contiene un buen número de ellas sobre todo en las formas verbales pronominales, no sé el motivo. También se eliminan aquellas definiciones que no tienen inflexiones pues no resultan de utilidad en el proceso.
Buscar las inflexiones de Vox que no estén en Larousse y añadirlas, ordenándolas tras el proceso.
Compararlas con las definiciones del diccionario de la RAE y eliminar aquellas que no coinciden: ya sea por tratarse de formas pronominales sin definición propia, porque no estaban incorporadas en la 22ª edición, o porque ya no existen, presumo que por anticuadas, en dicha edición.
Una vez expurgado el fichero, insertar en las filas correspondientes los tamaños en bytes de: definición, desplazamientos y número de fichero, necesarios para la tabla de índices (¡bendita función BUSCARV!).
Descomponer las definiciones de inflexiones en una fila por cada una, duplicando los datos numéricos correspondientes obtenidos en el paso anterior, mediante aplicación de búsquedas y sustituciones con expresiones regulares. Fueron necesarias algo más de veinte iteraciones hasta conseguir dejar una única palabra por fila.
Volver a eliminar definiciones repetidas, debidas sobre todo a coincidencias entre sustantivos/adjetivos y tiempos verbales.
Insertar los datos en la tabla de índices.
Mi agradecimiento a JIPG y jcn363 por su inestimable ayuda a la hora de obtener los diccionarios con las inflexiones, de los que me he servido para completar el trabajo.
La verdad es que lo he disfrutado y ahora me queda la posibilidad de hacer lo propio con la 23ª edición, si soy capaz de conseguirlo en formato electrónico, pero eso será otra historia. ;)
He actualizado el fichero en la nube, no obstante vuelvo a incluir el enlace:
https://drive.google.com/file/d/1amMEa6PRMdA-eEZ9qYTEwQdtCgd-9kdX/view?usp=sharing
Saludos afectuosos.
Hola Negatus.
¿Sabes Se podría reconvertir el diccionario que has generado para el formato Nolim a stardict y/o al formato de kobo?
Sigo penando por tener un diccionario español completito, que encuentre inflexiones.
Hola Negatus.
¿Sabes Se podría reconvertir el diccionario que has generado para el formato Nolim a stardict y/o al formato de kobo?
Sigo penando por tener un diccionario español completito, que encuentre inflexiones.
Pues entiendo que con Penelope sí que podría hacerse, aunque yo no llegué a hacerlo funcionar en el sentido Stardict->Bookeen. Podría intentar transformarlo, pero no podría probarlo. Voy a ver si es posible.
Pues entiendo que con Penelope sí que podría hacerse, aunque yo no llegué a hacerlo funcionar en el sentido Stardict->Bookeen. Podría intentar transformarlo, pero no podría probarlo. Voy a ver si es posible.
Me respondo a mí mismo. En principio me ha funcionado la conversión y he obtenido el fichero que comparto abajo, en formato stardict. Dime si te sirve o intentamos alguna otra cosa. ;)
https://drive.google.com/open?id=1MaZSKCLMmRVehIUeiBKzSSdrv0I-g-LR
cellaris
02/11/2018, 14:06
Me respondo a mí mismo. En principio me ha funcionado la conversión y he obtenido el fichero que comparto abajo, en formato stardict. Dime si te sirve o intentamos alguna otra cosa. ;)
https://drive.google.com/open?id=1MaZSKCLMmRVehIUeiBKzSSdrv0I-g-LRLo acabo de probar en KOReader y funciona correctamente. Muchas gracias.
Lo acabo de probar en KOReader y funciona correctamente. Muchas gracias.
¡Vaya!, cuánto me alegro. No hay de qué, pues no faltaba más con lo que me habéis ayudado a mí.
Me respondo a mí mismo. En principio me ha funcionado la conversión y he obtenido el fichero que comparto abajo, en formato stardict. Dime si te sirve o intentamos alguna otra cosa. ;)
https://drive.google.com/open?id=1MaZSKCLMmRVehIUeiBKzSSdrv0I-g-LR
Lo he probado con goldendict y funciona muy bien =D> (p.e. encuentra palabras como fue y te manda al verbo ir), pero los estilos no van (ejemplo de como se ve):
<p><strong>ir.</strong><p style="background:lightgray;">Del lat. ire.</p><strong>1.</strong> intr. moverse de un lugar hacia otro apartado de quien usa el verbo ir y de quien ejecuta el movimiento. U. t. c. prnl.<br/><strong>2.</strong> intr.
En otros ficheros stardict que tengo, la negrita aparece como <b> </b> en vez de <strong> </strong> <i></i> para la cursiva, <br> en vez de <br/> para el salto de línea y no hace falta el <p></p>para delimitar las frases. Puede que sea eso. Entiendo que si lo cambio , el fichero .idx ya no valdrá ¿no?
Muchas gracias por el esfuerzo.
cellaris
02/11/2018, 19:40
Lo he probado con goldendict y funciona muy bien =D> (p.e. encuentra palabras como fue y te manda al verbo ir), pero los estilos no van (ejemplo de como se ve):
<p><strong>ir.</strong><p style="background:lightgray;">Del lat. ire.</p><strong>1.</strong> intr. moverse de un lugar hacia otro apartado de quien usa el verbo ir y de quien ejecuta el movimiento. U. t. c. prnl.<br/><strong>2.</strong> intr.
En otros ficheros stardict que tengo, la negrita aparece como <b> </b> en vez de <strong> </strong> <i></i> para la cursiva, <br> en vez de <br/> para el salto de línea y no hace falta el <p></p>para delimitar las frases. Puede que sea eso. Entiendo que si lo cambio , el fichero .idx ya no valdrá ¿no?
Muchas gracias por el esfuerzo.Eso me pasa en el Inkpad 3 con CoolReader. En cambio, con KOReader se ve bien.
https://uploads.tapatalk-cdn.com/20181102/3f33a669f33f151cabe380af5e820770.jpghttps://uploads.tapatalk-cdn.com/20181102/d1220abadac673df31c51ee253318319.jpg
Probablemente sea porque han añadido diccionarios HTML (https://github.com/koreader/koreader/releases).
En cuanto a Goldendict, creo que un simple cambio de <> a [] causaría el efecto deseado. Es probar. :\')
Suerte.
Lo he probado con goldendict y funciona muy bien =D> (p.e. encuentra palabras como fue y te manda al verbo ir), pero los estilos no van (ejemplo de como se ve):
<p><strong>ir.</strong><p style="background:lightgray;">Del lat. ire.</p><strong>1.</strong> intr. moverse de un lugar hacia otro apartado de quien usa el verbo ir y de quien ejecuta el movimiento. U. t. c. prnl.<br/><strong>2.</strong> intr.
En otros ficheros stardict que tengo, la negrita aparece como <b> </b> en vez de <strong> </strong> <i></i> para la cursiva, <br> en vez de <br/> para el salto de línea y no hace falta el <p></p>para delimitar las frases. Puede que sea eso. Entiendo que si lo cambio , el fichero .idx ya no valdrá ¿no?
Muchas gracias por el esfuerzo.
Pues parece que no está interpretando las etiquetas HTML. Yo las he usado para dar un cierto formato al diccionario al diccionario, lo más parecido que he podido al que utilizaba la versión on-line de la 22ª edición, pero añadiendo alguna particularidad que me gustaba del de la 23ª edición (en particular el fondo gris de la procedencia de las definiciones). Lo de usar <strong> en lugar de <b> es una cuestión más bien semántica, por lo que puede cambiarse sin problemas. También es indiferente el uso de <br> o <br/>, pero estoy acostumbrado al segundo formato y me parecía más adecuado si luego tenía que intervenir en alguna búsqueda/sustitución.
Podría estudiar la manera de adaptarlo al formato stardict, pero no podría probarlo. Decidme algo al respecto.
Eso me pasa en el Inkpad 3 con CoolReader. En cambio, con KOReader se ve bien.
https://uploads.tapatalk-cdn.com/20181102/3f33a669f33f151cabe380af5e820770.jpghttps://uploads.tapatalk-cdn.com/20181102/d1220abadac673df31c51ee253318319.jpg
De todos modos en el segundo caso también hay fallos de interpretación de código porque las definiciones se cortan y no están completas. Me temo que la codificación HTML que le puse al fichero original para Nolim/Bookeen no es correctamente traducida por parte de penelope, al pasarlo a stardict. Es cuestión de ver la manera de adaptarlo.
Pues parece que no está interpretando las etiquetas HTML. Yo las he usado para dar un cierto formato al diccionario al diccionario, lo más parecido que he podido al que utilizaba la versión on-line de la 22ª edición, pero añadiendo alguna particularidad que me gustaba del de la 23ª edición (en particular el fondo gris de la procedencia de las definiciones). Lo de usar <strong> en lugar de <b> es una cuestión más bien semántica, por lo que puede cambiarse sin problemas. También es indiferente el uso de <br> o <br/>, pero estoy acostumbrado al segundo formato y me parecía más adecuado si luego tenía que intervenir en alguna búsqueda/sustitución.
Podría estudiar la manera de adaptarlo al formato stardict, pero no podría probarlo. Decidme algo al respecto.
He probado haciendo sustituciones directamente en el fichero .dict, pero claro, el fichero .idx ya no funciona (no apunta al sitio adecuado).
Lo suyo sería meter en penelope algo así (como utilicé yo para modificar algunos diccionarios stardict para el KOBO):
for k in fileToKey[p]:
word = k
if type(global_dictionary[k]) is tuple:
# single keyword
definition = global_dictionary[k][4]
definition = definition.replace("\n (", ". (")
definition = definition.replace("\n", "<br/>")
Así cambiaba algunos caracteres por otros y modifiqué "pedestremente" la apariencia de lo que se mostraba.
¿Tu fichero original para el nolim lo acepta el penelope tal cual?. Si es así, puedo intentar hacer alguna prueba.
Por cierto, hay muchas definiciones repetidas. Entiendo que cada una corresponde a una "inflexión" en el fichero idx, ¿no?.
He probado haciendo sustituciones directamente en el fichero .dict, pero claro, el fichero .idx ya no funciona (no apunta al sitio adecuado).
Lo suyo sería meter en penelope algo así (como utilicé yo para modificar algunos diccionarios stardict para el KOBO):
for k in fileToKey[p]:
word = k
if type(global_dictionary[k]) is tuple:
# single keyword
definition = global_dictionary[k][4]
definition = definition.replace("\n (", ". (")
definition = definition.replace("\n", "<br/>")
Así cambiaba algunos caracteres por otros y modifiqué "pedestremente" la apariencia de lo que se mostraba.
Entiendo que con esos cambios se sustituyen los saltos de línea con y sin apertura de paréntesis, pero de todos modos no conozco el formato stardict. Por cierto ¿con qué herramienta los editáis?
¿Tu fichero original para el nolim lo acepta el penelope tal cual?. Si es así, puedo intentar hacer alguna prueba.
Por cierto, hay muchas definiciones repetidas. Entiendo que cada una corresponde a una "inflexión" en el fichero idx, ¿no?.
Sí, el fichero .dict que uso en el Nolim lo ha aceptado penelope tal cual y las definiciones repetidas, entiendo que en cuanto a desplazamiento y longitud, son precisamente el "truco" utilizado para que localice las inflexiones: se dirige la inflexión a la entrada indexada original de la definición.
El ejemplo era simplemente para ver como añadir un comando para cambiar cosas antes de grabarlas en el diccionario: definition = definition.replace(".
¿Con que comando ejecutas penelope para convertir de formato nolim a stardict?
El ejemplo era simplemente para ver como añadir un comando para cambiar cosas antes de grabarlas en el diccionario: definition = definition.replace(".
¿Con que comando ejecutas penelope para convertir de formato nolim a stardict?
El comando es el siguiente:
python -m penelope -i es.drae.dict -j bookeen -f es -t es -p stardict -o es.drae-stardict.zip
La versión de penelope es la 3.1.3 en Ubuntu.
surquizu
14/11/2018, 00:27
El comando es el siguiente:
python -m penelope -i es.drae.dict -j bookeen -f es -t es -p stardict -o es.drae-stardict.zip
La versión de penelope es la 3.1.3 en Ubuntu.
Curro, no me aclaro. ¿puedes hacer la conversión a stardict? o mejor aún, hacer la conversión a star dict y luego pasarlo a formato kobo.
Gracias
Curro, no me aclaro. ¿puedes hacer la conversión a stardict? o mejor aún, hacer la conversión a star dict y luego pasarlo a formato kobo.
Gracias
Lo he convertido a Kobo (https://www.dropbox.com/s/man1oaztbhrt2j1/dicthtml-es.zip?dl=0) con el siguiente comando:
python -m penelope -i es.drae.dict -j bookeen -f es -t es -p kobo -o drae-kobo.zip
y a stardict (https://www.dropbox.com/s/0eepqjvii4z826h/drae-stardict.zip?dl=0) con:
python -m penelope -i es.drae.dict -j bookeen -f es -t es -p stardict -o drae-stardict.zip
No los puedo probar ahora.
Comentad si hay problemas y/o impresiones. Gracias.
Suerte.
Curro, no me aclaro. ¿puedes hacer la conversión a stardict? o mejor aún, hacer la conversión a star dict y luego pasarlo a formato kobo.
Gracias
Sergio, querido, ¿lo que necesitas es la versión en formato Kobo, en Stardict o en ambos?¿O es que es necesario convertirlo primero a stardict y luego a kobo?
Por lo demás sospecho que la versión que tenemos de penelope tiene variaciones en cuanto al uso, pues ya me di cuenta cuando intenté convertir el original stardict de la página, a Bookeen.
Dime algo anda.
Un abrazo.
surquizu
14/11/2018, 21:39
Sergio, querido, ¿lo que necesitas es la versión en formato Kobo, en Stardict o en ambos?¿O es que es necesario convertirlo primero a stardict y luego a kobo?
Por lo demás sospecho que la versión que tenemos de penelope tiene variaciones en cuanto al uso, pues ya me di cuenta cuando intenté convertir el original stardict de la página, a Bookeen.
Dime algo anda.
Un abrazo.
Lo he convertido a Kobo (https://www.dropbox.com/s/man1oaztbhrt2j1/dicthtml-es.zip?dl=0) con el siguiente comando:
python -m penelope -i es.drae.dict -j bookeen -f es -t es -p kobo -o drae-kobo.zip
y a stardict (https://www.dropbox.com/s/0eepqjvii4z826h/drae-stardict.zip?dl=0) con:
python -m penelope -i es.drae.dict -j bookeen -f es -t es -p stardict -o drae-stardict.zip
No los puedo probar ahora.
Comentad si hay problemas y/o impresiones. Gracias.
Suerte.
Gracias Negatus, jnc363 ya me lo ha solucionado.=D> Gracias :x
El diccionario funciona perfectamente en el kobo. Os pongo unas capturas de las diferencias entre el diccionario que viene de origen, el RAE "normal" y el RAE con inflexiones que se ha currado Curro (nunca mejor dicho >:))
Búsqueda de la palabra "Había":
Diccionario de origen: no la encuentra.
12904
Diccionario Rae. Compilación normal. No la encuentra, propone una palabra parecida: haba.
12905
Compilación Rae con inflexiones generada por Negatus: Reconoce la inflexión y define el verbo.
12906
Destacar también lo ordenaditas que quedan las definiciones.
Gracias Negatus, jnc363 ya me lo ha solucionado.=D> Gracias :x
El diccionario funciona perfectamente en el kobo. Os pongo unas capturas de las diferencias entre el diccionario que viene de origen, el RAE "normal" y el RAE con inflexiones que se ha currado Curro (nunca mejor dicho >:))
Búsqueda de la palabra "Había":
Diccionario de origen: no la encuentra.
12904
Diccionario Rae. Compilación normal. No la encuentra, propone una palabra parecida: haba.
12905
Compilación Rae con inflexiones generada por Negatus: Reconoce la inflexión y define el verbo.
12906
Destacar también lo ordenaditas que quedan las definiciones.
¡¡¡CÓMO MOLAAAAAA!!!
Esa es una de las satisfacciones de hacer un trabajo: que el resultado luzca. ;)
Hola.
Estoy intentando modificar un poco el diccionario para que se vea bien en goldendict (la versión de stardict) y para que se vea un poco mejor en kobo (las negritas no salen).
Intento transformar la versión original bookeen con penelope 2.0.2 (es la que tengo en windows, la 3.1.3 no se como instalarla) pero se me queda "colgado" después de generar los ficheros htlm del kobo pero no llega a comprimir ni a sacar el índice.
Otras conversiones de stardict a kobo si funcionan sin problema.
¿Alguien lo ha hecho en windows para ver si me puede dar un poco de luz sobre que puede estar pasando?.
Con la versión 3,.1.3 no se dónde encontrar ejecutables windows para el programa marisa-trie 0.7.5 (si es que existen), que es necesario para generar los diccionarios kobo. Lo que encuentro debe funcionar en linux o similar y eso para mi es meterme en un pantano :-s.
Perdón por tanta pregunta, pro es que estoy un poco perdido con el python y todo eso ...
Hola.
Estoy intentando modificar un poco el diccionario para que se vea bien en goldendict (la versión de stardict) y para que se vea un poco mejor en kobo (las negritas no salen).
Intento transformar la versión original bookeen con penelope 2.0.2 (es la que tengo en windows, la 3.1.3 no se como instalarla) pero se me queda "colgado" después de generar los ficheros htlm del kobo pero no llega a comprimir ni a sacar el índice.
Otras conversiones de stardict a kobo si funcionan sin problema.
¿Alguien lo ha hecho en windows para ver si me puede dar un poco de luz sobre que puede estar pasando?.
Con la versión 3,.1.3 no se dónde encontrar ejecutables windows para el programa marisa-trie 0.7.5 (si es que existen), que es necesario para generar los diccionarios kobo. Lo que encuentro debe funcionar en linux o similar y eso para mi es meterme en un pantano :-s.
Perdón por tanta pregunta, pro es que estoy un poco perdido con el python y todo eso ...
Como habrás leído en la página de Penelope (https://www.albertopettarin.it/penelope.html):
If you want to read from/write to Kobo format, you need a compiled version of MARISA.
In case, you must modify the value of variables MARISA_BUILD_PATH and MARISA_REVERSE_LOOKUP_PATH in penelope.py (Python 2.x) or penelope3.py (Python 3.x),
making it pointing to the marisa-build and marisa-reverse-lookup executables
(see the corresponding comments in the source code).
Yo uso Linux (y si quieres que te lo compile o haga alguna prueba...) pero el posible problema que puedas tener con la versión de MARISA lo puedes solucionar (https://github.com/pytries/marisa-trie) con Python:
pip install marisa-trie
Suerte.
Con penelope 2.0.2 el programa marisa me funciona cuando paso de stardict a kobo, así que ese programa no es el problema.
Cuando intento pasar el diccionario de negatus en formato bookeen es cuando se queda a medias.
Me gustaría probar la versión 3.1.3 de penelope, pero no se como instalarlo en windows.
¿Lo de pip install marisa-trie funciona también en windows o solo en Linux?
¿Lo de pip install marisa-trie funciona también en windows o solo en Linux?
pip es la herramienta recomendada para instalar paquetes (https://packaging.python.org/tutorials/installing-packages/) en Python.
Suerte.
...
¿Alguien lo ha hecho en windows para ver si me puede dar un poco de luz sobre que puede estar pasando?.
Con la versión 3,.1.3 no se dónde encontrar ejecutables windows para el programa marisa-trie 0.7.5 (si es que existen), que es necesario para generar los diccionarios kobo. Lo que encuentro debe funcionar en linux o similar y eso para mi es meterme en un pantano :-s.
Perdón por tanta pregunta, pro es que estoy un poco perdido con el python y todo eso ...
Si quieres probarlo, creo que la versión 3.1.2 sí que funcionaba. Como lo estuve probando y luego surquizu lo subió a su web, pues parece que lo tienes todavía disponible por allí (http://aurah2o.webcindario.com/subweb/penelope312.html).
Yo no recuerdo como iba el tema, pero lo que me parece es que requería instalar el compilador de windows y unas librerías y no requería el marisa (o si lo requería se instalaba con pip igualmente). Pero no me hagas caso, porque yo no me acuerdo. Suquizu, creo yo que lo siguiera usando, así que sabrá decirte más y mejor.
Si quieres probarlo, creo que la versión 3.1.2 sí que funcionaba. Como lo estuve probando y luego surquizu lo subió a su web, pues parece que lo tienes todavía disponible por allí (http://aurah2o.webcindario.com/subweb/penelope312.html).
Yo no recuerdo como iba el tema, pero lo que me parece es que requería instalar el compilador de windows y unas librerías y no requería el marisa (o si lo requería se instalaba con pip igualmente). Pero no me hagas caso, porque yo no me acuerdo. Suquizu, creo yo que lo siguiera usando, así que sabrá decirte más y mejor.
Muchas gracias jotam.
Si hubiese leido antes tu post me hubiese evitado el lio que monté al instalar un programa llamado PIP-Win. Creo que puede haber "corrompido" de alguna forma algo del python, por que me daba muchos errores, pero bueno de momento parece que todavía funciona :o.
Voy a intentar lo que me propones =D>.
Actualización: No me funciona nada al instalar penelope o marisa-trie por que mi usuario de windows tiene un acento y no lo codifica bien en ASCII. Parece que es un problema de python, y aunque está documentado, no he encontrado una solución.
Muchas gracias jotam.
Si hubiese leido antes tu post me hubiese evitado el lio que monté al instalar un programa llamado PIP-Win. Creo que puede haber "corrompido" de alguna forma algo del python, por que me daba muchos errores, pero bueno de momento parece que todavía funciona :o.
Voy a intentar lo que me propones =D>.
Actualización: No me funciona nada al instalar penelope o marisa-trie por que mi usuario de windows tiene un acento y no lo codifica bien en ASCII. Parece que es un problema de python, y aunque está documentado, no he encontrado una solución.
Cambia el nombre de usuario >:)
Hazlo con otro usuario :-"
Crea un usuario legal ;)
Suerte.
Pues parece que no está interpretando las etiquetas HTML. Yo las he usado para dar un cierto formato al diccionario al diccionario, lo más parecido que he podido al que utilizaba la versión on-line de la 22ª edición, pero añadiendo alguna particularidad que me gustaba del de la 23ª edición (en particular el fondo gris de la procedencia de las definiciones). Lo de usar <strong> en lugar de <b> es una cuestión más bien semántica, por lo que puede cambiarse sin problemas. También es indiferente el uso de <br> o <br/>, pero estoy acostumbrado al segundo formato y me parecía más adecuado si luego tenía que intervenir en alguna búsqueda/sustitución.
Podría estudiar la manera de adaptarlo al formato stardict, pero no podría probarlo. Decidme algo al respecto.
Creo que ya he encontrado el problema con los diccionarios generados en formato stardict:
En el fichero .ifo, hay una línea sametypesequence=m que indica que todo lo que hay en el diccionario es texto "puro" sin formato. Si se cambia por sametypesequence=x parece que ya se puede ver el formato. Parece que era un problema reportado, pero el desarrollador de Penelope lo dejó por aquella época. Yo le he cambiado adicionalmente <strong> por <b> y <em> por <i>.
Lo que sí he encontrado comparando tu diccionario con el de jpalacios y el minirae es que algunas acepciones compuestas no aparecen en una línea separada y se pierde la trazabilidad palabra-significado. En el minirae aparecía incluso en negrita, pero eso ya es un "plus".
Dejo unos ejemplos de como se ven en los diferentes diccionarios la palabra mirar, en sus frases compuestas:
Diccionario Negatus en Goldendict
12909
Diccionario JPalacios en Goldendict
12910
Diccionario MiniRAE en Godendict
12911
Cambia el nombre de usuario >:)
Hazlo con otro usuario :-"
Crea un usuario legal ;)
Suerte.
Crear otro usuario solo para esto me parece un "overkill". ::pum::
Creo que ya he encontrado el problema con los diccionarios generados en formato stardict:
En el fichero .ifo, hay una línea sametypesequence=m que indica que todo lo que hay en el diccionario es texto "puro" sin formato. Si se cambia por sametypesequence=x parece que ya se puede ver el formato. Parece que era un problema reportado, pero el desarrollador de Penelope lo dejó por aquella época. Yo le he cambiado adicionalmente <strong> por <b> y <em> por <i>...
Yo uso sametypesequence=h (https://code.google.com/archive/p/babiloo/wikis/StarDict_format.wiki) que es código html.
Suerte.
Yo uso sametypesequence=h (https://code.google.com/archive/p/babiloo/wikis/StarDict_format.wiki) que es código html.
Suerte.
Tienes razón. Esto es lo escribió alguien en github sobre el uso que hacía penelope del parámetro sametypesequence:
The sametypesequence stanza in the ifo file defines, which syntax is used in the definition block. Currently, penelope seems to allow only for m, which treats whatever as plain text. The following types are known to stardict
'm' Word's pure text meaning. The data should be a utf-8 string ending with '\0'.
'g' A utf-8 string which is marked up with the Pango text markup language.
't' English phonetic string. The data should be a utf-8 string ending with '\0'.
'x' A utf-8 string which is marked up with the xdxf language.
'y' Chinese YinBiao or Japanese KANA. The data should be a utf-8 string ending with '\0'.
'k' KingSoft PowerWord's data. The data is a utf-8 string ending with '\0'.
'w' MediaWiki markup language.
'h' Html codes.
'n' WordNet data.
'r' Resource file list.
'X' this type identifier is reserved for experimental extensions.
Creo que ya he encontrado el problema con los diccionarios generados en formato stardict:
En el fichero .ifo, hay una línea sametypesequence=m que indica que todo lo que hay en el diccionario es texto "puro" sin formato. Si se cambia por sametypesequence=x parece que ya se puede ver el formato. Parece que era un problema reportado, pero el desarrollador de Penelope lo dejó por aquella época. Yo le he cambiado adicionalmente <strong> por <b> y <em> por <i>.
Lo que sí he encontrado comparando tu diccionario con el de jpalacios y el minirae es que algunas acepciones compuestas no aparecen en una línea separada y se pierde la trazabilidad palabra-significado. En el minirae aparecía incluso en negrita, pero eso ya es un "plus".
Dejo unos ejemplos de como se ven en los diferentes diccionarios la palabra mirar, en sus frases compuestas:
Diccionario Negatus en Goldendict
12909
Diccionario JPalacios en Goldendict
12910
Diccionario MiniRAE en Godendict
12911
Pues parece ser un fallo en toda regla. De los que me esperaba que aparecieran. ;)
Primero voy a ver si el fallo es de la conversión o ya está en mi primera versión, aunque sospecho que se trata de lo segundo. Luego veré por qué se ha producido el error, comparándolo con el fichero original del que lo extraje.
Ya te digo algo. Gracias por reportarlo.
Un abrazo.
Pues parece ser un fallo en toda regla. De los que me esperaba que aparecieran. ;)
Primero voy a ver si el fallo es de la conversión o ya está en mi primera versión, aunque sospecho que se trata de lo segundo. Luego veré por qué se ha producido el error, comparándolo con el fichero original del que lo extraje.
Ya te digo algo. Gracias por reportarlo.
Un abrazo.
¡Gracias a tí por el esfuerzo!.
Estoy intentando toquetear un poco con penelope para que a partir de tu diccionario, poder convertirlo en stardict o kobo cambiando algunos indicadores de estilo, pero no puedo instalar penelope 3 por un tema con python y caracteres con acentos en el nombre de usuario en windows ... (cosas de llamarse José :-")
Con penelope 2.0.2 puedo cambiar algunas cosas de forma sencilla cambiando el programa penelope.py como te comenté, pero solo me funciona el paso de formato bookeen a stardict pero no a KOBO y no se por qué, por que de stardict a KOBO si me vá :o. Sigo con ello ... Cuando tenga algo funcional, lo paso.
¡Gracias a tí por el esfuerzo!.
Estoy intentando toquetear un poco con penelope para que a partir de tu diccionario, poder convertirlo en stardict o kobo cambiando algunos indicadores de estilo, pero no puedo instalar penelope 3 por un tema con python y caracteres con acentos en el nombre de usuario en windows ... (cosas de llamarse José :-")
Con penelope 2.0.2 puedo cambiar algunas cosas de forma sencilla cambiando el programa penelope.py como te comenté, pero solo me funciona el paso de formato bookeen a stardict pero no a KOBO y no se por qué, por que de stardict a KOBO si me vá :o. Sigo con ello ... Cuando tenga algo funcional, lo paso.
Pues revisando, revisando, me he dado cuenta de que el fichero del que partí no distingue de ninguna manera esas acepciones con usos particulares de una palabra, verbo en este caso. Es más, no tengo la menor idea de en cuántas entradas está teniendo el mismo comportamiento, pero presupongo que en muchas. Podría resolverlo bajo demanda, esto es: cada vez que encuentre una, aplicarle la solución. Ahora bien, incluso disponiendo de los ficheros de ayuda de los que me valí originalmente (que los tengo) esto es trabajo de chinos porque al aumentar el número de caracteres utilizado en la entrada, ya sea tanto para poner el salto de línea como para agregarle negritas, aumenta consecuentemente su desplazamiento en la base de datos y, además, hay que arrastrarlo en las que van a continuación y reemplazarlo en las coincidencias de las inflexiones. Hacerlo una vez para cada caso detectado es una barbaridad.
A bote pronto se me ocurren como soluciones:
- Partir de un diccionario RAE igualmente completo, pero que distinga de algún modo estos casos (¿la 23ª edición tal vez?) 8-> y aplicarle todo el proceso. No sería rápido, pero se matarían dos pájaros de un tiro.
- Intentar encontrar una forma de distinguir esos casos para aplicar una expresión regular que genere la diferenciación y aplicarle el proceso. La única posibilidad que he observado hasta el momento es que parece tratarse de palabras que comienzan conn minúscula tras un ".", pero no sé si es una regla válida... o me colaría en casos que no son. Investigaré a ver. Como ya adelanto, después de terminar las transformaciones, tendría que repetir el mismo proceso para los desplazamientos y las inflexiones, pero solo sería una vez.
Parece ser que la diversión va a continuar... y yo que me alegro. ;)
Un abrazo
No me parece que esas palabras se consideren acepciones (en goldendict no las encuentra por ellas mismas), y más bien parece que se ha perdido un salto de línea en esos casos (en la mayoría los hace bien).
¿Puedes comprobar si en tu diccionario de origen aparecen las palabras del ejemplo con salto de línea o no?. En los diccionarios minirae y rae de jpalacios si hace los saltos en esas palabras (aunque al mirar el fichero dict es un poco engañoso, ya que después es el fichero de indexación es el que supuestamente te debe decir dónde empieza y donde acaba cada párrafo, ¿no?).
Lo de espacio y minúscula detrás de punto podría ser un buen punto de partida. En una mirada rápida, no he encontrado ningún caso que no sea uno que debería llevar salto de línea. =D>
Edt 1: Me corrijo: he encontrado un ejemplo donde falta un punto y un salto de línea (palabra comer):
1. prnl. Llevar encogidas prendas como calcetines, medias, etc., de modo que se van metiendo dentro de los zapatos.
Estírate los calcetines porque te los vas comiendo ~se algo a otra cosa.
1. loc. verb. coloq. Anularla o hacerla desmerecer.
debería ser
1. prnl. Llevar encogidas prendas como calcetines, medias, etc., de modo que se van metiendo dentro de los zapatos.
Estírate los calcetines porque te los vas comiendo.
~se algo a otra cosa.
1. loc. verb. coloq. Anularla o hacerla desmerecer.
Esto es muy complicado ...:((
Edit 2: Parece que el error no es muy común y solo lo he visto en verbos con muuuchos significados ...:
palabra hacer (cuando hay muchos 1. seguidos, mala cosa):
a medio ~.
1. loc. adj. Dicho de una cosa: A medio camino entre su comienzo y su terminación. U. t. c. loc. adv. haberla hecho buena.
1. loc. verb. irón. coloq. Haber ejecutado algo perjudicial o contrario a determinado fin. Buena la has hecho La hemos hecho buena ¿hacemos algo?
1. expr. coloq. U. para incitar a alguien a que entre en algún negocio con otra persona, o a venir a la conclusión de un contrato.
palabra ir:
a gran ~, o al más ~.
1. locs. advs. ants. a más correr. allá irás.
1. loc. interj. p. us. U. para enviar a alguien en hora mala. allá se van.
1. expr. coloq. U. para referirse a las personas o cosas que son, valen o significan casi lo mismo. Allá se irán el gasto y la ganancia Allá se. Ver fulano con mengano allá va, o allá va eso, o allá va lo que es.
1. exprs. coloqs. U. al arrojar algo que puede caer sobre quien esté debajo o cerca.
¿Qué diccionario has empleado de origen?
No me parece que esas palabras se consideren acepciones (en goldendict no las encuentra por ellas mismas), y más bien parece que se ha perdido un salto de línea en esos casos (en la mayoría los hace bien).
¿Puedes comprobar si en tu diccionario de origen aparecen las palabras del ejemplo con salto de línea o no?. En los diccionarios minirae y rae de jpalacios si hace los saltos en esas palabras (aunque al mirar el fichero dict es un poco engañoso, ya que después es el fichero de indexación es el que supuestamente te debe decir dónde empieza y donde acaba cada párrafo, ¿no?).
Lo de espacio y minúscula detrás de punto podría ser un buen punto de partida. En una mirada rápida, no he encontrado ningún caso que no sea uno que debería llevar salto de línea. =D>
Edt 1: Me corrijo: he encontrado un ejemplo donde falta un punto y un salto de línea (palabra comer):
1. prnl. Llevar encogidas prendas como calcetines, medias, etc., de modo que se van metiendo dentro de los zapatos.
Estírate los calcetines porque te los vas comiendo ~se algo a otra cosa.
1. loc. verb. coloq. Anularla o hacerla desmerecer.
debería ser
1. prnl. Llevar encogidas prendas como calcetines, medias, etc., de modo que se van metiendo dentro de los zapatos.
Estírate los calcetines porque te los vas comiendo.
~se algo a otra cosa.
1. loc. verb. coloq. Anularla o hacerla desmerecer.
Esto es muy complicado ...:((
Edit 2: Parece que el error no es muy común y solo lo he visto en verbos con muuuchos significados ...:
palabra hacer (cuando hay muchos 1. seguidos, mala cosa):
a medio ~.
1. loc. adj. Dicho de una cosa: A medio camino entre su comienzo y su terminación. U. t. c. loc. adv. haberla hecho buena.
1. loc. verb. irón. coloq. Haber ejecutado algo perjudicial o contrario a determinado fin. Buena la has hecho La hemos hecho buena ¿hacemos algo?
1. expr. coloq. U. para incitar a alguien a que entre en algún negocio con otra persona, o a venir a la conclusión de un contrato.
palabra ir:
a gran ~, o al más ~.
1. locs. advs. ants. a más correr. allá irás.
1. loc. interj. p. us. U. para enviar a alguien en hora mala. allá se van.
1. expr. coloq. U. para referirse a las personas o cosas que son, valen o significan casi lo mismo. Allá se irán el gasto y la ganancia Allá se. Ver fulano con mengano allá va, o allá va eso, o allá va lo que es.
1. exprs. coloqs. U. al arrojar algo que puede caer sobre quien esté debajo o cerca.
¿Qué diccionario has empleado de origen?
Pues el diccionario usado de origen es la 22ª edición en formato electrónico en epub.
Quizá acepción no sea el término más correcto para definir el uso que se da a la palabra en perífrasis o frases hechas, por así decirlo. Se admiten sugerencias. ;)
Se da la circunstancia de que en esa versión, se distingue el uso del término definido cuando aparece tal cual (o añadiendo forma pronominal o algo por el estilo) mediante el símbolo ~. Los ejemplos que señalas ("a medio ~", etc.) son buena muestra de ello. En esos casos me fue sencillo usar expresiones regulares para añadir que dieran salto de línea y las pusiera en letra cursiva (o itálica), lo que no quiere decir que se escapara alguna, como así parece.
En cambio, cuando la palabra, y parece ser que el caso está circunscrito a verbos, no aparece tal cual está en la entrada, en el diccionario de origen no la distingue de ninguna manera, si exceptuamos que es una minúscula después de ".", pero mira tú por dónde (nunca mejor usado ;) ) la magna proliferación de abreviaturas fastidia el uso sencillo de una expresión regular pues en muchísimos casos hay minúscula después del "." que termina la abreviatura. No sé si incluyendo de algún modo la existencia de "1." consecutivos podrían aislarse una buena parte de ellos.
Por lo demás tengo claro que el proceso ha de hacerse, a ser posible, de una sola vez, pues estuve investigando la posibilidad de irlos introduciendo de uno en uno y es un calvario porque hay que incluir la nueva longitud de la cadena (por ejemplo en el caso de "mirar" pasaba de 3.610 a 3.776 bytes) y arrastrar el desplazamiento en el resto de definiciones del fichero donde se encuentra y esperar que eso no provoque que se supere el número de 256 Kb para el fichero, porque entonces el último término tendría que pasar al siguiente y vuelta a empezar... En fin, el formato este del bookeen es lo que tiene.
De todas formas, seguiré investigando. Si encuentras una forma de aislar tales fallos no dejes de hacérmela saber y si los encuentras y reportas todos, entonces monumento al canto. ;)
Gracias por tus aportes. Seguimos.
Un abrazo.
Por lo demás tengo claro que el proceso ha de hacerse, a ser posible, de una sola vez, pues estuve investigando la posibilidad de irlos introduciendo de uno en uno y es un calvario porque hay que incluir la nueva longitud de la cadena (por ejemplo en el caso de "mirar" pasaba de 3.610 a 3.776 bytes) y arrastrar el desplazamiento en el resto de definiciones del fichero donde se encuentra y esperar que eso no provoque que se supere el número de 256 Kb para el fichero, porque entonces el último término tendría que pasar al siguiente y vuelta a empezar... En fin, el formato este del bookeen es lo que tiene.
De todas formas, seguiré investigando. Si encuentras una forma de aislar tales fallos no dejes de hacérmela saber y si los encuentras y reportas todos, entonces monumento al canto. ;)
¿Podrías subir el epub para que trabajemos con la misma base?
Suerte.
Nota:
Dejo la última versión del archivo de silabeo (https://github.com/jcn363/kobopatch/raw/master/src/hyphenDicts/KoboRoot.tgz).
¿Podrías subir el epub para que trabajemos con la misma base?
Suerte.
Pues no faltaba más (aunque puede encontrarse en nuestra vieja página amiga).
https://drive.google.com/open?id=1B2mafAnXdKoPoiJLZJCP0xptsuAMXPIV
Pues no faltaba más (aunque puede encontrarse en nuestra vieja página amiga).
https://drive.google.com/open?id=1B2mafAnXdKoPoiJLZJCP0xptsuAMXPIV
Me temo que con ese diccionario va a estar difícil arreglar las palabras problemáticas.
He estado buscando otros diccionarios y he encontrado este en que parece más fácil de determinar dónde están separadas esas frases hechas. Sin embargo, no aparecen los superíndices ni la itálica ... La palabra principal sí que está al menos determinada por una itálica (solo la usa para eso) aunque esté siempre al final de la línea anterior :o:
2. adj. Perteneciente o relativo a esta ciudad de la provincia de
Burgos, en España.<k>mirar</k>
mirar.
(Del lat. mirāri, admirarse).
1. tr. Dirigir la vista a un objeto. U. t. c. prnl.
13. prnl. Considerar un asunto y meditar antes de tomar una
resolución.
bien mirado.
1. loc. adv. Si se piensa o considera con exactitud o
detenimiento. Bien mirado, no tienes razón.
de mírame y no me toques.
1. loc. adj. coloq. Dicho de una persona: Sumamente delicada de
genio o de salud.
2. loc. adj. coloq. Dicho de una cosa: Muy quebradiza y de poca
resistencia.
No se si es la misma versión, pero tiene menos palabras que otros diccionarios que he visto.
Voy a hacer un paquete de diccionarios que he encontrado por ahí en formato stardict (por lo del número de palabras distinto):
http://www.filedropper.com/diccionariosraestardict
, y a mirar cómo se lee la información del fichero .idx que es el que tiene la información de la palabra, de dónde empieza y en dónde acaba. Así sería más fácil extraer la información del fichero .dict, que es de texto puro.
Me temo que con ese diccionario va a estar difícil arreglar las palabras problemáticas.
He estado buscando otros diccionarios y he encontrado este en que parece más fácil de determinar dónde están separadas esas frases hechas. Sin embargo, no aparecen los superíndices ni la itálica ... La palabra principal sí que está al menos determinada por una itálica (solo la usa para eso) aunque esté siempre al final de la línea anterior :o:
2. adj. Perteneciente o relativo a esta ciudad de la provincia de
Burgos, en España.<k>mirar</k>
mirar.
(Del lat. mirāri, admirarse).
1. tr. Dirigir la vista a un objeto. U. t. c. prnl.
13. prnl. Considerar un asunto y meditar antes de tomar una
resolución.
bien mirado.
1. loc. adv. Si se piensa o considera con exactitud o
detenimiento. Bien mirado, no tienes razón.
de mírame y no me toques.
1. loc. adj. coloq. Dicho de una persona: Sumamente delicada de
genio o de salud.
2. loc. adj. coloq. Dicho de una cosa: Muy quebradiza y de poca
resistencia.
No se si es la misma versión, pero tiene menos palabras que otros diccionarios que he visto.
Voy a hacer un paquete de diccionarios que he encontrado por ahí en formato stardict (por lo del número de palabras distinto):
http://www.filedropper.com/diccionariosraestardict
, y a mirar cómo se lee la información del fichero .idx que es el que tiene la información de la palabra, de dónde empieza y en dónde acaba. Así sería más fácil extraer la información del fichero .dict, que es de texto puro.
La verdad, cuando me puse al tajo lo que buscaba era la 23ª edición del diccionario de la RAE en formato electrónico. Como no la pude encontrar me conformé con la que sí encontré, que era la 22ª edición con... bueno, el formato que tiene. Una vez metidos en faena constaté que ese fichero tenía errores, no de formato, sino de contenido, algunos de los cuales detecté y corregí (ciertamente sospecho que ha de haber más, pero me reconozco incapaz de revisar las ochenta y pico mil entradas).
Otros fallos los generé yo mismo al alterar el formato para darle el aspecto que tiene, al usar expresiones regulares que, si bien procuré que fueran lo más estrictas posible, se metieron en casos que no correspondían. De nuevo corregí los que encontré y de nuevo sospecho que han de quedar otros, por el mismo motivo que he referido.
Por último, hubo casos como el que nos ocupa que, debido a la práctica imposibilidad de tratarlos mediante expresiones regulares, se escaparon.
La cuestión estriba en que no dispongo de ningún diccionario más o tan completo como el que he utilizado (excepción hecha de la 23ª edición del diccionario de la RAE, claro está) que carezca de errores, o que tenga muy pocos, y que tenga un formato que permita adaptarlo al que usé o a cualquier otro que convengamos. Como siempre estoy abierto a cualquier sugerencia o aportación en ese sentido.
De nuevo, gracias por tu interés.
Un abrazo.
Hoy. por fin, vuelvo a la carga con la versión para Nolim/Bookeen del diccionario de la RAE en su vigesimotercera edición.
Como es de bien nacidos ser agradecidos, antes de entrar en materia quiero darle las gracias a JIPG por… bueno, él sabe por qué.
La primera cuestión fue aprender el modo en que estaba maquetado el diccionario en su formato de libro electrónico: un fichero epub en el que los lemas ocupaban un total cuarenta y ocho ficheros .html en el número más aproximado posible a dos mil lemas por fichero, en función de la cantidad de lemas por inicial. Evidentemente hay letras en castellano cuya cantidad de lemas en los que figuran como inicial es muy inferior a esos dos mil (“k”, “ñ”, “x”…) y otras que son más de dos mil, pero bastantes menos de cuatro mil, en cuyo caso el fichero los contenía todos. Además hay otros ficheros que contienen el resto de información del libro: agradecimientos, relación de académicos, modo en que está confeccionado el contenido de los lemas... esencial esto último para el paso siguiente.
Los ficheros .html hacen referencia a una serie de clases CSS y fuentes que, tras un análisis y una serie de comprobaciones, no iban a ser necesarios en el formato resultante, por lo que podían desecharse. Bueno, en realidad, con una excepción que expondré más adelante.
Tras conocer la manera en que se confeccionaban los lemas, pasé a compararla con la que ya usé como referencia en la elaboración del anterior diccionario: la versión en línea. De aquí salieron varias decisiones que expongo ocultas para quien tenga interés en conocerlas, teniendo en cuenta que en casi todas lo que ha primado es la limitación del formato de tinta electrónica en niveles de grises y la legibilidad de las definiciones y acepciones, más que la consulta (o lectura) en un libro electrónico que es un diccionario.
En negrita se señala la opción elegida, siendo la previa al vs. la correspondiente a la versión en línea y la posterior la del libro electrónico. En ocasiones se ha optado por usar características de ambas opciones o solo parte de una de ellas.
Lema (y formas complejas): terminado sin punto vs. terminado con un punto.
Forma compleja de uso exclusivo del lema: en nueva línea con lema (no virgulilla) vs. a continuación del punto y seguido del lema, sustituido por una virgulilla.
Origen de los lemas: sombreado gris con salto(s) de línea tras el lema vs. paréntesis (De | Del | Loc. ...) sin salto de línea.
Acepciones: una por línea primero número de acepción, luego categoría gramatical (si la hay) vs. separadas por || primero categoría gramatical (solo en la primera acepción de las que tienen la misma categoría gramatical) luego número si hay más de una acepción.
Separación entre acepciones y formas complejas: salto de línea grande y cambio de color a marrón, no virgulilla vs. cuadrado negro y virgulilla.
Separación para el resto de formas complejas: salto de línea grande y cambio a naranja, no virgulilla vs. cuadrado marco negro y virgulilla.
Plurales en formas complejas: plurales sin subrayar unidos a la forma compleja subrayada vs. virgulilla separada de la desinencia por un espacio.
Separación para envíos: una por línea, no virgulilla vs. flecha y virgulilla separados por comas.
Separación entra acepciones con distinta categoría gramatical: salto de línea vs. círculo negro.
Separación entra acepciones con distinta subcategoría gramatical: salto de línea vs. círculo blanco (o circunferencia negra).
Variante del lema: Tb. + variante al 85% del tamaño de fuente, entre paréntesis vs. Tb. + variante en nueva línea.
Separación de enunciados dentro del origen de los lemas: salto de línea en el sombreado gris vs. rombo negro en la misma línea del paréntesis.
Envíos contiguos agrupados: puntos suspensivos + coma + V. lemas enviados con puntos suspensivos y comas vs. solo uno de los lemas + V. lema enviado, en nueva línea.
Tengo que reconocer que estas decisiones, que tomé a finales del año pasado, condicionaron el hecho de que la mayor parte del tiempo invertido, algo más de dos meses, haya sido en la conversión de los ficheros .html lo que, curiosamente, ha sido justo al contrario que en la vez anterior.
Me planteé como alternativas bien la conversión de cada uno de los ficheros de lemas por separado bien la concatenación de todos y proceder a la conversión en un único fichero. Considero que la elección de la primera opción fue la acertada pues me permitió refinar las expresiones regulares utilizadas conforme avanzaba y los tiempos en búsquedas/sustituciones globales eran prácticamente inmediatos. De algo sirvió la experiencia de la vez anterior. Con todo, en la penúltima fase del proceso fue necesario efectuar la mencionada concatenación, para la generación del índice y para hacer más cómodo el traslado del contenido a los ficheros que forman el diccionario.
A continuación relaciono ocultas las más de cincuenta expresiones regulares utilizadas en búsquedas y sustituciones, explicando su uso, por si a alguien le apetece evaluar la naturaleza de mi manía (tengo la impresión de que si existe un cielo para los maníacos perfeccionistas de mierda, me he ganado una plaza en él) y por si alguien encuentra la manera de mejorar o afinar el proceso, que estoy seguro de que la hay. Para mayor abundamiento, diré que el último paso antes de dar como concluido el proceso en un fichero, consistía en repetir la búsqueda de todas las expresiones regulares (aprovechando la caché del editor, que me permitía recorrerlas en orden inverso)... y en muchos casos aparecieron coincidencias no sustituidas.
Convertir los ficheros .html al formato específico (se guardó una copia de cada fichero sin extensión html) atendiendo a:
1. Eliminar cabeceras y etiquetas <html>, <body>, <div><hr/> y <h1>. Quitar el sangrado y convertir todos los en espacios en blanco, tal cual.
2. Convertir
<strong><span class="extrafont2">(.*?)</span>(.*?)</strong> en
<strong>$1´$2</strong> (elementos compositivos diferenciados sin guión).
3. <span class="extrafont2">-</span>
en
-´ (elementos compositivos diferenciados con guión).
4. <p class="french"><span class="lema"><em><strong>(\w+)\.</strong></em></span>(\.|)( |)
en
<p>$1<br/> (lemas con punto al final que son expresiones del latín clásico).
5. <p class="french"><span class="lema">(.*?)</span>(\.|)( |)
en
<p>$1<br/> (conversión de lemas en general. Para las formas complejas de uso exclusivo conviene comparar el número de coincidencias con
<p class="french"><span class="lema">(.*?)</span>\.( |).
Si difiere el número de resultados, Se realiza la conversión usando la expresión anterior como búsqueda y se prueba a convertir
<p class="french"><span class="lema">(<strong>.*?)\. (.*?)</span> (~\. |\w+ ~\.|)( |)loc\.
en
<p>$1</strong><br/><strong>$2$3<br/>loc.
Los que queden se revisan "manualmente". (ej. acomplexionado. Bien). En la práctica supuso un medio para encontrar gran parte de los fallos de lemas que tenían parte de la definición separada en un lema distinto).
6. <span class="extrafont-it">(.*?)</span>
en
$1 (quitar clases debidas a caracteres de otros idiomas. Conviene ejecutarla ejecutarla más de una vez; dos veces como mínimo).
7. <br/>\(Tb\. <span class="sans(|-b)">(.*?)</span>(|.*?) <span class="extrafont3">♦</span> (.*?)\)\.( |)
en
<br/>Tb. <strong>$2</strong>$3<p style="background:lightgray;">$4.</p> (variantes del lema).
8. <br/>\(Tb\. <span class="sans(|-b)">(.*?)</span>(.*?)\)\.( |)
en
<br/>Tb. <strong>$2</strong>$3.<br/> (numeración de variantes del lema).
9. (|\.)(| )\(Tb\. (.*?|)<span class="sans(|-b)">(.*?)</span>(.*?)\)\.( |)
en
$1<br/>Tb. $3<strong>$5.</strong>$6<br/> (resto de variantes en una forma compleja del lema).
10. <br/>\((.*?)\)\.( |)
en
<p style="background:lightgray;">$1.</p> (origen de los lemas. En ocasiones encontró resultados en la última comprobación después de otras sustituciones).
11. (</span>|</em>|</strong>)\. \((.*?)\)\.( |)
en
$1.<p style="background:lightgray;">$2.</p> (orígenes de los lemas que se han quedado atrás. En la práctica detectó fallos provenientes del fichero html original y necesitaron resolución manual en casi todos los casos).
12. (<p style="background:lightgray;">.*?) <span class="extrafont3">♦</span> (.*?)</p>
en
$1<br/>$2</p> (modelos de conjugación y otras aclaraciones en los orígenes de los lemas. En algún caso habría debido pasarse más de una vez, pero eso se detectó en la comprobación final).
13. (\.|) <span class="extrafont3">♦</span> (.*?)<br/>
en
$1<p style="background:lightgray;">$2</p> (orígenes de los lemas que se quedaron atrás por la conversión de los Tb. (variantes). (ejs. adiós, boya2)).
14. (\.|) <span class="extrafont3">♦</span> (.*?)</p>
en
$1<br/>$2</p> (resto de modelos de conjugación y otras aclaraciones en los orígenes de los lemas. En algún caso habría debido pasarse más de una vez, pero eso se detectó en la comprobación final).
15. \(<span class="extrafont3">ǁ</span>
en
(ǁ (para indicación condensada de acepción de otro lema).
16. <span class="extrafont3">ǁ</span><span class="extrafont3">■</span>
en
<span class="extrafont3">■</span> (evitar duplicidad de clases que se sustituyen con la misma (y única) expresión regular. (puede no haber ninguna). (ej. ají))
17. (\.|) <span class="extrafont3">ǁ</span> <span class="sans-b">(.*?)</span>
en
$1<br/><strong>$2</strong> (acepciones de la misma categoría gramatical, cada una en una línea).
18. </span>\.( |)
en
</span><br/> (introducir salto de línea en las formas complejas con el punto después del </span>).
19. ~\.</span>( )
en
~</span><br/> (introducir salto de línea en las formas complejas con el punto antes del </span>).
20. (\.|) <span class="extrafont(|3)">(<strong>|)☐(</strong>|)</span> (~ |)<span class="sans">(.*?)</span>
en
$1<br/>$5$6 (salto de línea y aislar virgulillas (si las tienen, sino simplemente salto de línea) en el segundo bloque de las formas complejas).
21. (\.|) <span class="extrafont">(<strong>|)☐ (.*?)(</strong>|)(.*?)</span>
en
$1<br/>$2$3$4$5 (salto de línea en el resto de los que tienen (o no) virgulilla en el segundo bloque de las formas complejas).
22. (\.|) <span class="extrafont3">(ǁ|■|☐)</span> (~ |)<span class="sans">(.*?)</span>
en
$1<br/>$3$4 (nueva línea en: virgulillas que sustituyen a lemas, paso de acepciones a formas complejas y para el segundo bloque de formas complejas.
Compruébese (\.|) <span class="extrafont3">ǁ</span> (.*?)<span class="sans">(.*?)<strong>(.*?)</strong>(.*?)</span>
y sustitúyase por
$1<br/>$2<strong>$3$4</strong>$5 para el caso en que se dupliquen las negritas).
23. <br/><span class="extrafont3">(ǁ|■|☐)</span> (~ |)<span class="sans">(.*?)</span>
en
<br/>$2$3 (resto de nueva línea en: virgulillas que sustituyen a lemas, salto de acepciones a formas complejas y segundo bloque de formas complejas, que han quedado tras un salto de linea por culpa de sustituciones anteriores).
24. (\.|) <span class="extrafont3">■</span> (~ |)<span class="sans">(.*?)</span>
en
$1<br/>$2$3 (resto de casos que tienen virgulilla en las formas complejas).
25. <span class="sans">(.*?)</span>
en
$1 (expresiones junto a virgulillas que se hayan quedado atrás. En la práctica este también resultó un mecanismo efectivo de localización de errores en el fichero original).
26. (\.|) <span class="extrafont3">(⚫|⚪|ǁ)</span> (.*?)<span class="sans-b">(\d{1,2}\.)(.*?)</span>( |)
en
$1<br/><strong>$4</strong> $3$5 (salto de línea en categoría y subcategoría gramatical (y nueva línea en acepciones de la misma categoría gramatical) además de negrita en la numeración de acepciones y cambio de orden número de acepción <→ categoría o subcategoría gramatical).
27. (</p>|<br/>)([\w\. ]+)<span class="sans-b">(\d{1,2}\.)(.*?)</span>
en
$1<strong>$3</strong> $2$4 ( poner negrita en la numeración de acepciones además de cambio de orden número de acepción <→ categoría gramatical).
28. <br/><span class="extrafont3">(⚫|⚪|ǁ)</span> (.*?)<span class="sans-b">(\d{1,2}\.)(.*?)</span>( |)
en
<br/><strong>$3</strong> $2$4 (resto de categorías y subcategorías gramaticales y negrita en la numeración de acepciones más cambio de orden número de acepción <→ categoría o subcategoría gramatical, que han quedado tras salto de línea debido a sustituciones anteriores).
29. Revisar el resto de <span class="sans-b">(.*?)</span> que queden. La mayor parte se podrán convertir mediante sustitución de
(\.|) (loc\. |locs\. |adj\. |expr\. |exprs\. |[m|f]\. |interj\. )(verb\. |adv\. |sust\. |verbs\. |advs\. |susts\. |adj\. |adjs\. |prepos\. |)<span class="sans-b">(\d{1,2}\.)(.*?)</span>
en
$1<br/><strong>$4</strong> $2$3$5 (habrá que modificar manualmente el resto como en: hacer ~ a alguien (aire) y cortar las ~ a alguien y dar ~ a alguien (alas)).
30. Convertir (</p>|<br/>)<span class="extrafont3">➤</span>( |)
en
$1 (para los envíos con salto de línea previo (provenientes de otras sustituciones)).
31. ( )<span class="extrafont3">➤</span>( |)
en
<br/> (envíos sin salto de línea previo).
32. ( |)~ (<strong>|)(e|)s(\s|,|\.|</strong>)
en
$2$1~$3s$4 (plural con final en vocal o consonante de las formas complejas).
33. V\. conjug\. en APÉNDICE
en
Conjug. modelo (modelo de conjugación de verbos regulares).
34. V\. conjug\. actual en APÉNDICE
en
Conjug. Modelo actual (modelo de conjugación de verbos irregulares).
35. <p><em><strong>(.*?)</strong></em>
en
<p><strong><em>$1</em></strong> (facilitar la extracción de lemas en la hoja de cálculo en aquellos provenientes de otras lenguas que no tienen adaptación).
36. ~
en
<u>~</u> (preparar la virgulilla para ser sustituida por el lema -subrayado- en la forma compleja).
37. <span class="extrafont">(.*?)</span>
en
$1 (aislar términos en griego, latín o árabe y símbolo del copyright).
38. ([^c]|tc)\. loc(s|)\.( )
en
$1<br/>loc$2.$3 (saltos de línea de formas complejas no distinguidos por clase css).
39. Comprobar que no han quedado <span>, </span> y <span . En la práctica detectó clases no convertidas por las expresiones anteriores por motivos que no siempre quedaron claros.
40. Convertir </strong>( |)<strong>
en
$1 (eliminar los etiquetados en negrita consecutivos, insertados en algunas sustituciones).
41. ([^\.])\.\.([^\.])
en
$1.$2 (eliminar dobles puntos introducidos en algunas sustituciones (por englobar todos los posibles casos) evitando la conversión accidental de puntos suspensivos).
42. \s\s en \s (eliminar los dobles espacios introducidos en los pasos 26, 27 y 28).
43. </p>\n\n<p> en </p>\n<p> , <br/><br/> en <br/> y <br/></p> en </p> (eliminar líneas en blanco innecesarias).
Para cambiar la virgulilla, previamente subrayada, por el lema se dan varios casos:
44. Si el lema no tiene género: Convertir <p><strong>(<em>|)([\w\s]*)(</em>|<sup>[\d\.]*</sup>|)</strong>(.*?)~
en
<p><strong>$1$2$3</strong>$4$2. Se debe repetir hasta que no localice ninguna virgulilla pues hay lemas con muchas de ellas.
45. Si el lema tiene género:
a) Convertir <p><strong>([\w]+)(\w{1,})(o)(<sup>\d</sup>|), (\2)(a)</strong>(.*?)([\w]*)(ión|a|ad|dumbre|[t|s|x]is)(</strong>|)(s|) <u>~
en
<p><strong>$1$2$3$4, $5$6</strong>$7$8$9$10$11 <u>$1$5$6 (forma compleja femenina con genero (o-a) en las dos últimas letras (penúltima consonante) y el lema va al final. Se debe revisar cada conversión pues no es posible abarcar todas las excepciones. Repetirlo hasta que no quede ninguna virgulilla).
b) <p><strong>([\w]+)(\w{1,})(o)(<sup>\d</sup>|), (\2)(a)</strong>(.*?)(</strong>|)(s|)( |)<u>~</u> (<strong>|)([\w]*)(ión|a|ad|dumbre|[t|s|x]is)(,|</strong>)
en
<p><strong>$1$2$3$4, $5$6</strong>$7$8$9$10<u>$1$5$6</u> $11$12$13$14 (forma compleja femenina con genero (o-a) en las dos últimas letras (penúltima consonante) y lema al principio. Se debe revisar cada conversión, aunque no suele haber muchas de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
c) <p><strong>([\w]+)(\w)(o), (a)</strong>(.*?)([\w]*)(ión|a) <u>~
en
<p><strong>$1$2$3, $4</strong>$5$6$7 <u>$1$2$4 (forma compleja femenina con genero (o-a) en las dos últimas letras (penúltima vocal) y lema al final. Se debe revisar cada conversión, aunque son muy pocas de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
d) <p><strong>([\w]+)(ó|o)(l|n|r), (\3)(a)</strong>(.*?)([\w]*)(ión|a|ad)(</strong>|) <u>~
en
<p><strong>$1$2$3, $4$5</strong>$6$7$8$9 <u>$1o$4$5 (forma compleja femenina con género (ol|ón|or-ola|ona|ora) y lema al final. Se debe revisar cada conversión; también son muy pocas las de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
e) <p><strong>([\w]+)(é)(s), (\3)(a)</strong>(.*?)([\w]*)(ión|a|ad)(</strong>|) <u>~
en
<p><strong>$1$2$3, $4$5</strong>$6$7$8$9 <u>$1e$4$5 (forma compleja femenina con género (és-esa) y lema al final. Se debe revisar cada conversión, aunque raramente aparecerá alguna de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
f) <p><strong>([\w]+)(á)(n), (\3)(a)</strong>(.*?)([\w]*)(ión|a|ad)(</strong>|) <u>~
en
<p><strong>$1$2$3, $4$5</strong>$6$7$8$9 <u>$1a$4$5 (forma compleja femenina con género (án-ana) y lema al final. Se debe revisar cada conversión, aunque solo ocasionalmente aparecerá alguna de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
g) <p><strong>([\w\s]*)(<sup>\d</sup>|), ([\w]*)</strong>(.*?)( |)<u>~ en <p><strong>$1$2, $3</strong>$4$5<u>$1 para forma compleja masculina y lema al final o al principio. Se debe revisar cada conversión, con especial cuidado cuando la forma compleja admita los dos géneros (m.y f.) . Repetirlo hasta que no quede ninguna virgulilla).
Quizá podría haber intentado llevar a cabo la conversión programándola. No obstante, pronto me di cuenta de que ello me habría hecho perder rápidamente el hilo de la correcta generación de los lemas convertidos: la sustitución de las virgulillas cuando el lema tenía género he tenido que hacerla revisándolas casi una a una, por poner un ejemplo.
Por otro lado, el haber hecho el trabajo de esta manera me ha permitido detectar en el fichero original del orden de trescientos veinte errores, que si bien porcentualmente suponen un misérrimo 0’3% de los más de noventa y un mil lemas, no deja de ser un número apreciable en sí mismo. Lo cierto es que en el formato original no son demasiado problemáticos, pues lo lemas se consultan de manera continua. En cambio en un diccionario al que se accede por índices y deplazamientos, no se encontrarían algunos lemas y otros aparecerían incompletos. Tengo muy claro que se han quedado errores sin corregir pues los dos últimos los detecté en la última fase de revisión (en la que miro el primer y último lema de cada fichero del formato Nolim/Bookeen) y de seguro que yo he introducido más de uno, sobre todo en saltos de línea innecesarios. Todo reporte de errores lo agradeceré enormemente. Relaciono ocultos los errores encontrados.
a) Lemas unidos que deben ir separados (se consignan a continuación del →) la coma separa cada par (o trío, que alguno hay):
abertura→ abertzale, alcor→ Alcorán, aleación→ alea iacta est, allegar→ allegretto, amprar→ ámpula, anacrusa→ ánade, anfitrión→ ánfora, angaripola→ ángaro, angazo→ ángel, anillo→ ánima, animizar→ ánimo, antracosis→ ántrax, año2→ -año, aparentemente→ a pari, apetitoso→ ápex, aquivo→ a quo, ar→ -ar, ardite→ -ardo, argollón→ árgoma, aulario→ áulico, bodrio→ body, buseta→ bushido, cazuz→ CD, cefalea→ -cefalia, cultura→ -cultura, desarrollable→ desarrollar, datilera→ datismo, deverbativo→ de verbo ad verbum, domingo1→ Domingo2, edetano→ edición, entelado→ entelar, enlabiar1→ enlabiar2, enridar1→ enridar2, enronchar→ enronquecer, ensuciamento→ ensuciar, entendidamente→ entendido, enterrar→ entesado, entoldamiento→ entoldar, entrenamiento→ entrenar, entuerto→ entullecer, enviciamiento→ enviciar, epidérmico→ epidermis, epistémico→ epistemología, epistemólogo→ epístola, equipero→ equipo, erogación→ erogar, escalfamiento→escalfar, escamar→ escambrón, escamoteador→ escamotear, escapular2→ escapulario, escarolar→ escarótico, escarpado→ escarpadura, escirroso→ escisión, escociano→ escocimiento, escogencia→ escoger, escorbútico→ escorbuto, escribir→ escriño, esfera→ esferal, esferoide→ esferómetro, esfigmograma→ esfigmómetro, espadón1→ espadón2, espasticidad→ espástico, espiroqueto→ espita, esquilfe→ esquilimoso, estacha→ estache, estación→ estacional, estancación→ estancada, estandarizar→ estándar, estangurria→ estannífero, estero1→ estero2, estimuloso→ estinco, estío→ estiómenar, estipendio→ estípite→ estipiticar, estragar→ estrago, estrucioniforme→ estructura, etarra→ etcétera, etilo→ étimo, excitación→ excitado, expiación→ expiar, exponencial→ exponente, extracto→ extractor, extrañamiento→ extrañar, fabla→ fablable, factitivo→ facto, fajol→ fajón, fambre→ fame, fan→ fanal, fatigante→ fatigar, ferrarés→ ferre, filia→ filiación, filmográfico→ filmología, florecido→ floreciente, fono→ fonocaptor, fórmico→ formidable, foto→ fotoalergia, fraga1→ fraga2, gineta→ gin-fizz, grija→ grill, halitosis→ hall, hardido→ hardware, hrrusca→ hertz, hincar→ hincha, lapsus→ lapsus calami→ lapsus linguae, lauroceraso→ laus Deo, leída→ Leiden, leísta→ leitmotiv, lepasil→ lepe, loco2→ loco citato, motu proprio→ mousse, nocional→ nocir, oponer→ oponible, paceño→ pacer, parsi→ parsimonia, partero→ parterre, patrulla→ patrullaje,pavana→ pavada, paviano→ pávido, pelaza→ pelazga, petalismo→ pétalo, petral→ petraria, picazuroba→ piccolo, píceo→ picha, pichear→ pichel, pie→ piedad, pignorable→ pignoración, pirriar→ pírrico1, placiente→ placimiento, plátano→ platea, presupuestario→ presupuesto, pretorial→ pretorianismo, procedente→ proceder1, promedio→ pro memoria, pronunciamento→ pronunciar, propiedad→ propienda, provincial→ provinciala, pulchinela→ pulcritud, quad→ quadrivium, que→ qué, recabita→ recadar, recaudero→ recaudo, rejero→ rejileto, reprehensible→ reprehensión, rinoceronte→ rinofaringe, románico→ romanilla, salival→ salivar, sandino→ sandio, -sco→ scooter, self-service→ sellado, silbante→ silbar, tabicón→ tábido, tabulador→ tabula gratulatoria, tajalápiz→ tajamar, talegazo→ talega, talero→ tálero, tantrismo→ Tantum ergo, tecnecio→ -tecnia, templo→ tempo, ternurista→ tero, tico→ 'tico, tirintio→ tirio, tortel→ tortellini, tortillo→ Tortis, trivium→ -triz, -uelo→ uf, ultramarino→ ultramaro, unamuniano→ unánime, usarcé→ usarced, vago2→ vagón, verdemontaña→ verdeo, vínculo→ vindicación, vinilo→ vino, viz- → vizcacha, vocabulario→ vocabulista,
b) Definiciones pertenecientes a un lema que se tratan como lema separado (se consigna la parte de la definición -con puntos suspensivos acortando las demasiado largas- que hubo de ser unida a continuación de ←) la coma separa cada par (o trío, que alguno hay):
abuela← no necesitar o no tener..., ambarino← abelcoso, amonestar← amonestado, arador← arador de la sarna, arbitrero← arbitrista, aristocrático← perteneciente o relativo a la aristrocracia, asentadillas← a asentadillas, ballet← ballet,bocado← no tener alguien para un bocado, cochero← Sitio donde se encierran los coches y autobuses, chupa← como chupa de dómine, corriente← o contra la corriente, derm-← dermo-. Dermitis., dermat-← dermo-. Dermatitis., dermato-← dermo-. Dermatología., despacio← despacio. U. m. en And., Bol., Col., Ec. y R. Dom., disciplinante← disciplinante que sacaban a la vergüenza...← disciplinante que sacaban a azotar públicamente por haber..., ejemplificar← ejemplarizar., estructurante← estructurador. Un factor estructurador, espejo← espejo ustorio, espiritual← espiritual negro, exarco← exarca.,farmacopola← farmaceútico (persona que ...), filelí← fililí (tela ligera), fruto← frutos naturales de los fondos rústicos, imponer← ...a cosa , -morfo← elem. compos. , nacascolo← dividivi (árbol) , naco1← susto (impresión repentina), nao← nave (barco), natividad← natividad de jesucristo, nave← naveta (vaso de incensar), necio← neciamente., neumotórax← neumotórax producido artificialmente..., nipos← caudal (hacienda), numeral← numeral fraccionario, nodo← nodo en el que el planeta..., ñoqui← ñoqui hecha con sémola y que, ..., ñor← señor (término de cortesía), oblato← oblatos u oblatas, ...,obrería← obrería (renta), occitano← occitano (lengua), ochocientos← octingentésimo (que sigue en orden...),ocotero← ocote1. 2. f. Méx. ocotal., octavo← octava. 5. Librito que contiene el..., oesudoeste← oesudoeste., okupa←okupa.,ofuscamiento←ofuscación.,oliva← aceite de oliva, omaguaca←omaguacas.,onda← ondas radioeléctricas..., oponer← opuesto. tr. Poner algo contra..., óptico← óptica. 5.f. Parte de la física...,oriental← Oriente (Asia y regiones inmediatas), origenismo.← origenismo., osornino.← osorninos., otitis← otitis que no pasa más allá de..., página ← páginas. 2.Inform. sitio web..., parafrástico← Perteneciente o relativo a la paráfrasis, pascuense ← pascuenses. 3.Perteneciente o relativo al pascuense (ǁ lengua)., patatín← coloqs. Argucias, disculpas del que no..., paleógeno← Paleógeno., paupérrimo← pobre,pekinés← pekineses. 3. m. y f. perro pekinés., pelagianismo← pelagianismo., pelitre← pelitre., pértiga← pértiga 3. desus. pértica., petigrís← petigrís., péndulo← péndulo que se hace de metales de dilatación diferente..., pial← peal,piano1← piano de tamaño mediano y forma alargada..., pífano← pífano., pintón← pintón., pillería← pillo2 3. coloq. pillada., pitajaya← pitahaya., planetario← planetario. espacio planetario, poetría← poesía., popayanejo← popayanejos., poronguero2← porongueros., portugués← portugueses. carabela portuguesa, práctico← práctica. 2. Dicho de un conocimiento: Que..., presado← presado., proverbio← proverbio (refrán), promiscuo← promiscua., química← química de los compuestos que contienen..., recabdar← recabar (recoger, recaudar, guardar), recomponer← (...recompuesto)., reprehensible← reprensible,repulgue← repulgo (borde labrado de las empanadas), retroacción← retroactividad. retroactividad de la quiebra,..., resunta← resumen., romance← romance que se compone de versos..., resurrección← resurrección de Jesucristo., sabidor← sabio (que posee la sabiduría), saboyano← saboyanos. 3. f. Pastel, especie de bizcocho empapado..., sacramento← sacramento eucarístico,sacro← sacro, en la parte posterior de la pelvis, sajón← sajones (individuo de un pueblo germánico),salteño← salteños 3. f. Arg. y Bol. Empanada típica con relleno de..., salubre← (... salubérrimo)., samoyedo← samoyedos. 3. Perteneciente o relativo al..., sanedrín← sanedrín. 3. Junta o reunión para tratar de..., sangriento← sangrienta (que se goza en derramar sangre), sanjuaneño← sanjuanero. 2. Natural de Río San Juan,..., sanmigueleño← sanmigueleñas. 3. Natural de San Miguel, ciudad del Ecuador..., santero← santería, (sincretismo entre creencias africanas y la religión católica), sapiencia← sabiduría., sauce← sauce. sauce cabruno. m. Árbol..., sedeño← sedas, (cerdas), sefardí← sefardíes 3. judeoespañol (ǁ perteneciente a la variedad del español)..., selvaje← salvaje., seña← señal(ǁ cantidad que se adelanta en algunos contratos), séptimo← séptima ascendente o descendente en la escala., serbio← serbios. 3. Perteneciente o relativo al serbio (ǁ lengua)..., serbocroata← serbocroata. Léxico serbocroata..., serpentino← serpentín (ǁ instrumento de hierro), setecientos← septingentésimo (ǁ que sigue en orden al sexcentésimo nonagésimo noveno)., sexto← sexta hora temporal, a mediodía, hasta... ← sexta que comienza por el as..., sevillano← sevillanos. 3.</strong> f. Palo flamenco propio de Sevilla y..., sículo← sículos. 3. Perteneciente o relativo al sículo (ǁ lengua)..., sigla← siglas en ONU, silbante← sibilante (ǁ sonido fricativo o africado), sintagma← sintagma que tiene por núcleo un verbo., sobijar← sobar (ǁ manosear), sobreponer← ...sobrepuesto) tr., sofreír← ...sofreído) tr.,solución← solución de continuidad., sosa← sosa, muy ricas en sales alcalinas y empleadas..., suboficial← suboficial, inmediatamente superior..., surtidero← surtidor (ǁ chorro de agua), sucesión← sucesión que tiende a un límite., tortería← tortas (ǁ panecillos)., traillar← traílla (ǁ instrumento agrícola)., triángulo← triángulo que tiene los tres ángulos agudos., tuerce← torcedura (ǁ acción de torcer)., tuse← tusa (ǁ crines del caballo)., unisón← mismo sonido que otra cosa., utensilio← Objeto fabricado que se destina a un uso manual y doméstico., unitivo← unir. Tejido unitivo., zancadilla← o pretende derribar a alguien de un puesto o cargo., zarandear← por los hombros o los brazos moviéndolo con violencia.
c) lemas repetidos sin definición: epodo
d) otros casos:
caballo d buena boca;
buccino (se coló una clase indentleft1-center desconocida hasta ese momento);
ha cerse ~ (aire);
en los dos archivos correspondientes a la letra "d" no se incluyó el cambio de estilo "sans" tras el de "extrafont3", para los casos de los símbolos "ǁ", "■" y "☐" (acepciones en formas complejas, sin numerar, y con cambio de categoría y subcategoría gramatical);
también en los archivos de la letra "d" se cambió el orden del punto tras número de acepción, con el cierre de la etiqueta "span" (este me dio un par de días de dolores de cabeza hasta que lo localicé). Luego apareció el mismo fallo en la letra "m";
otros errores tipográficos, discordancias y de cierre de etiquetas html que no he consignado por considerarlos errores menores y porque, en realidad, no son detectables en la consulta del diccionario en su versión electrónica original, aunque sí en la conversión realizada.
La naturaleza de los errores encontrados me lleva a establecer dos hipótesis:
La conversión desde el formato original (¿la base de datos on-line?) se hizo mediante herramientas automatizadas, pues los errores siguen un patrón que intuyo, pero que no he sido capaz de determinar con exactitud.
El trabajo se ha distribuido en varios equipos/personas pues los errores aparecen en ficheros de determinadas iniciales y en otros no.
Y también entiendo ahora por qué la academia parece resistirse a indicar el número de lemas exactos en cada diccionario. Durante el proceso este número ha ido variando, según encontraba y corregía fallos, hasta los noventa y un mil cuatrocientos cincuenta y ocho (91.458) obtenidos tras la última revisión.
Estos fallos también los he corregido en el fichero original, que pongo a vuestra disposición, previa solicitud por privado.
Para la penúltima parte del proceso, extracción de índices y desplazamientos, ya tenía adelantado bastante el trabajo, fruto de la conversión que hice de la vigésimo segunda edición, si bien he optimizado y diversificado las hojas de cálculo con el fin de hacerlas menos “pesadas” a la hora de inserción masiva de datos. Además he reutilizado el fichero comprimido, editando los ficheros de su interior y añadiendo los diez resultantes del mayor número de lemas de esta edición. También pongo el procedimiento oculto.
Concatenar el contenido de los ficheros HTML en uno único (cat ?_00??_000? > fichero_concatenado) e incluir su contenido en una columna de una hoja de cálculo.
En dicha hoja se extraen en columnas diferenciadas, mediante fórmulas:
a1) Lema con superindice a continuación, si lo tiene (eliminando formato de superíndice) y sin desinencia de género, si la tiene.
b1) Longitud de la definición en caracteres (util para la comparación con la longitud en bytes).
c1) Estimación del número de ficheros de 256 Kb. que se generarán.
d1) Columna de comparación de la extracción del lema con la de la fórmula de extracción, por si hay errores en la fórmula o en el pegado de lemas (se detectaron algunos fallos de partes de definiciones de lemas, separadas como lema independiente, que se habían escapado en el proceso de conversión).
En el fichero de texto concatenado se sustituyen los </p><p> por </p>\n<p> para homogeneizar los finales y principios de fichero (que no tienen el salto de linea) con el resto de definiciones.
Se aplica el comando:
while read line; do wc -c; done < fichero_definiciones > fichero_bytes_por_definicion
En una nueva hoja de cálculo (o fichero para mejor tratamiento).
a2) Se inserta el contenido de fichero_bytes_por_definicion en una hoja y se aplica fórmula para obtener la longitud de cada línea (el resultado del comando las da acumuladas). ** Téngase en cuenta que el primer resultado se corresponde con la longitud en bytes del segundo lema. Para obtener la del primero puede hacerse manualmente o restando la longitud total en bytes del fichero del primer resultado obtenido.
b2) En otra hoja se pasa la columna de resultados por línea junto con la columna de los lemas y la de la longitud en caracteres de cada lema, extraída de la hoja de cálculo inicial, esta última con el fin de comparar resultados.
Tras hacer comprobaciones con un número representativo de lemas en la página https://mothereff.in/byte-counter (https://mothereff.in/byte-counter), que da los resultados en caracteres y bytes se demuestra que los resultados obtenidos con el comando wc exceden en 1 byte el número real de cada definición (debido al salto de línea, creo). Es importante tener esto en cuenta pues de no aplicar correctamente los valores, el desplazamiento de la base de datos de índices dará resultados erróneos. La columna con los bytes corregidos será la que se traslade a un nuevo fichero de hoja de cálculo.
En otro fichero de hoja de cálculo:
a3) Se pegan las columnas de lemas y longitud en bytes de la hoja anterior.
b3) Mediante fórmulas se calculan en otras columnas las longitudes acumuladas para aquellos lemas con más de un origen, ya que solo tendrán una entrada en el fichero de índices.
c3) En otra hoja se pegan la columna de lemas y la de los desplazamientos acumulados, que luego se tratarán con expresiones regulares en el editor.
Una vez efectuado el tratamiento mediante la búsqueda sustitución con las expresiones regulares:
1. Convertir [\w\- ]+\t0\n
en
nada (elimina lemas que no tienen acumulado el desplazamiento).
2. ([\w\- ]+)\d{1}(\t\d+\n)
en
$1$2 (deja los lemas con desplazamiento acumulado sin superíndice).
se obtiene una lista de dos columnas con los lemas "repetidos" eliminados y sin superíndices y los desplazamientos acumulados, que se pegan en otra hoja del mismo fichero donde:
a4) se añaden columnas necesarias para la base de datos de índices
b4) se añaden otras columnas para facilitar la posterior comprobación del último lema de cada fichero y el primero del siguiente (detectan el cambio de fichero) y así asegurar que el índice está bien generado.
Se añaden al índice las entradas correspondientes a las inflexiones que ya estaban guardadas en otra hoja, provenientes del trabajo con el diccionario de la 22ª edición.
Se reutiliza la base de datos de índices y se pegan los datos de la hoja reseñada en el paso a4) con los datos necesarios a la tabla T_Dictindex (previo pegado y de nuevo copiado en el editor, para que interprete correctamente tabuladores y saltos de línea), mediante un editor de bases de datos SQLite para linux (yo he usado "DB Browser for SQLite"). Conviene regenerar el índice sustituyendo la cláusula "COLLATE IcuNoCase" por "COLLATE NOCASE".
Tras generar la base de datos de índices se traslada el contenido del fichero_concatenado a cada uno de los ficheros que componen el diccionario comprimido, siguiendo las indicaciones de la hoja de cálculo del paso b4). Se añadieron diez nuevos ficheros debido al incremento de lemas en esta edición.
Con respecto a las inflexiones, me temo que se han quedado un tanto anticuadas, pues los nuevos lemas añadidos en esta edición no tienen sus correspondientes inflexiones, aunque estas afecten solo a aquellos nuevos lemas que sean verbos o admitan plural. Espero que el motor de búsqueda sea capaz de localizarlos por proximidad léxica, llegado el caso.
Finalmente se consultan el primer y último lema que está en cada fichero interior, para comprobar si el índice está bien generado. Para ello el libro utilizado como referencia fue... el propio diccionario original en formato epub. En esta fase comprobé que el símbolo “ǁ”, usado para la indicación condensada de acepción de otro lema, no era interpretado correctamente por el Nolim, de manera que tuve que sustituirlo por un doble “|” que la verdad es que se aprecia bastante bien y además tuve la suerte de que ocupa lo mismo que el otro, por lo que no hubo de regenerarse el índice por aumento de los desplazamientos.
Tengo que reconocer que, a pesar de los presumibles errores y mi manía perfeccionista, estoy bastante satisfecho del resultado y hoy por hoy cuento con un diccionario casi definitivo: actualizado, legible y bastante de acuerdo a mis gustos. El día que se disponga de tinta electrónica a color, será el momento de adaptarlo con mucha más fidelidad a la versión en línea del diccionario de la RAE, que es el que más me entusiasma y en el que no he detectado error alguno (aunque en consultas de comparación encontré alguna virgulilla aún sin convertir, pero no me acuerdo en qué lema). Sin más ahí va el enlace.
https://drive.google.com/open?id=1O9zQCeTKomvHLAu1_do57t9wpjgDAm7m
Insisto en que agradeceré el reporte de errores así como el resultado de la puesta en práctica del fichero y las eventuales conversiones a otros formatos, quien así lo desee.
Saludos muuuuuy cordiales.
surquizu
15/06/2019, 19:53
Te has ganado el cielo. 😁. A ver si puedo pasarlo a kobo...
Enviat des del meu POCOPHONE F1 usant Tapatalk
Como siempre, negatus, un trabajo IMPRESIONANTE ^:)^
elchamaco
17/06/2019, 08:22
Hoy. por fin, vuelvo a la carga con la versión para Nolim/Bookeen del diccionario de la RAE en su vigesimotercera edición.
Como es de bien nacidos ser agradecidos, antes de entrar en materia quiero darle las gracias a JIPG por… bueno, él sabe por qué.
La primera cuestión fue aprender el modo en que estaba maquetado el diccionario en su formato de libro electrónico: un fichero epub en el que los lemas ocupaban un total cuarenta y ocho ficheros .html en el número más aproximado posible a dos mil lemas por fichero, en función de la cantidad de lemas por inicial. Evidentemente hay letras en castellano cuya cantidad de lemas en los que figuran como inicial es muy inferior a esos dos mil (“k”, “ñ”, “x”…) y otras que son más de dos mil, pero bastantes menos de cuatro mil, en cuyo caso el fichero los contenía todos. Además hay otros ficheros que contienen el resto de información del libro: agradecimientos, relación de académicos, modo en que está confeccionado el contenido de los lemas... esencial esto último para el paso siguiente.
Los ficheros .html hacen referencia a una serie de clases CSS y fuentes que, tras un análisis y una serie de comprobaciones, no iban a ser necesarios en el formato resultante, por lo que podían desecharse. Bueno, en realidad, con una excepción que expondré más adelante.
Tras conocer la manera en que se confeccionaban los lemas, pasé a compararla con la que ya usé como referencia en la elaboración del anterior diccionario: la versión en línea. De aquí salieron varias decisiones que expongo ocultas para quien tenga interés en conocerlas, teniendo en cuenta que en casi todas lo que ha primado es la limitación del formato de tinta electrónica en niveles de grises y la legibilidad de las definiciones y acepciones, más que la consulta (o lectura) en un libro electrónico que es un diccionario.
En negrita se señala la opción elegida, siendo la previa al vs. la correspondiente a la versión en línea y la posterior la del libro electrónico. En ocasiones se ha optado por usar características de ambas opciones o solo parte de una de ellas.
Lema (y formas complejas): terminado sin punto vs. terminado con un punto.
Forma compleja de uso exclusivo del lema: en nueva línea con lema (no virgulilla) vs. a continuación del punto y seguido del lema, sustituido por una virgulilla.
Origen de los lemas: sombreado gris con salto(s) de línea tras el lema vs. paréntesis (De | Del | Loc. ...) sin salto de línea.
Acepciones: una por línea primero número de acepción, luego categoría gramatical (si la hay) vs. separadas por || primero categoría gramatical (solo en la primera acepción de las que tienen la misma categoría gramatical) luego número si hay más de una acepción.
Separación entre acepciones y formas complejas: salto de línea grande y cambio de color a marrón, no virgulilla vs. cuadrado negro y virgulilla.
Separación para el resto de formas complejas: salto de línea grande y cambio a naranja, no virgulilla vs. cuadrado marco negro y virgulilla.
Plurales en formas complejas: plurales sin subrayar unidos a la forma compleja subrayada vs. virgulilla separada de la desinencia por un espacio.
Separación para envíos: una por línea, no virgulilla vs. flecha y virgulilla separados por comas.
Separación entra acepciones con distinta categoría gramatical: salto de línea vs. círculo negro.
Separación entra acepciones con distinta subcategoría gramatical: salto de línea vs. círculo blanco (o circunferencia negra).
Variante del lema: Tb. + variante al 85% del tamaño de fuente, entre paréntesis vs. Tb. + variante en nueva línea.
Separación de enunciados dentro del origen de los lemas: salto de línea en el sombreado gris vs. rombo negro en la misma línea del paréntesis.
Envíos contiguos agrupados: puntos suspensivos + coma + V. lemas enviados con puntos suspensivos y comas vs. solo uno de los lemas + V. lema enviado, en nueva línea.
Tengo que reconocer que estas decisiones, que tomé a finales del año pasado, condicionaron el hecho de que la mayor parte del tiempo invertido, algo más de dos meses, haya sido en la conversión de los ficheros .html lo que, curiosamente, ha sido justo al contrario que en la vez anterior.
Me planteé como alternativas bien la conversión de cada uno de los ficheros de lemas por separado bien la concatenación de todos y proceder a la conversión en un único fichero. Considero que la elección de la primera opción fue la acertada pues me permitió refinar las expresiones regulares utilizadas conforme avanzaba y los tiempos en búsquedas/sustituciones globales eran prácticamente inmediatos. De algo sirvió la experiencia de la vez anterior. Con todo, en la penúltima fase del proceso fue necesario efectuar la mencionada concatenación, para la generación del índice y para hacer más cómodo el traslado del contenido a los ficheros que forman el diccionario.
A continuación relaciono ocultas las más de cincuenta expresiones regulares utilizadas en búsquedas y sustituciones, explicando su uso, por si a alguien le apetece evaluar la naturaleza de mi manía (tengo la impresión de que si existe un cielo para los maníacos perfeccionistas de mierda, me he ganado una plaza en él) y por si alguien encuentra la manera de mejorar o afinar el proceso, que estoy seguro de que la hay. Para mayor abundamiento, diré que el último paso antes de dar como concluido el proceso en un fichero, consistía en repetir la búsqueda de todas las expresiones regulares (aprovechando la caché del editor, que me permitía recorrerlas en orden inverso)... y en muchos casos aparecieron coincidencias no sustituidas.
Convertir los ficheros .html al formato específico (se guardó una copia de cada fichero sin extensión html) atendiendo a:
1. Eliminar cabeceras y etiquetas <html>, <body>, <div><hr/> y <h1>. Quitar el sangrado y convertir todos los en espacios en blanco, tal cual.
2. Convertir
<strong><span class="extrafont2">(.*?)</span>(.*?)</strong> en
<strong>$1´$2</strong> (elementos compositivos diferenciados sin guión).
3. <span class="extrafont2">-</span>
en
-´ (elementos compositivos diferenciados con guión).
4. <p class="french"><span class="lema"><em><strong>(\w+)\.</strong></em></span>(\.|)( |)
en
<p>$1<br/> (lemas con punto al final que son expresiones del latín clásico).
5. <p class="french"><span class="lema">(.*?)</span>(\.|)( |)
en
<p>$1<br/> (conversión de lemas en general. Para las formas complejas de uso exclusivo conviene comparar el número de coincidencias con
<p class="french"><span class="lema">(.*?)</span>\.( |).
Si difiere el número de resultados, Se realiza la conversión usando la expresión anterior como búsqueda y se prueba a convertir
<p class="french"><span class="lema">(<strong>.*?)\. (.*?)</span> (~\. |\w+ ~\.|)( |)loc\.
en
<p>$1</strong><br/><strong>$2$3<br/>loc.
Los que queden se revisan "manualmente". (ej. acomplexionado. Bien). En la práctica supuso un medio para encontrar gran parte de los fallos de lemas que tenían parte de la definición separada en un lema distinto).
6. <span class="extrafont-it">(.*?)</span>
en
$1 (quitar clases debidas a caracteres de otros idiomas. Conviene ejecutarla ejecutarla más de una vez; dos veces como mínimo).
7. <br/>\(Tb\. <span class="sans(|-b)">(.*?)</span>(|.*?) <span class="extrafont3">♦</span> (.*?)\)\.( |)
en
<br/>Tb. <strong>$2</strong>$3<p style="background:lightgray;">$4.</p> (variantes del lema).
8. <br/>\(Tb\. <span class="sans(|-b)">(.*?)</span>(.*?)\)\.( |)
en
<br/>Tb. <strong>$2</strong>$3.<br/> (numeración de variantes del lema).
9. (|\.)(| )\(Tb\. (.*?|)<span class="sans(|-b)">(.*?)</span>(.*?)\)\.( |)
en
$1<br/>Tb. $3<strong>$5.</strong>$6<br/> (resto de variantes en una forma compleja del lema).
10. <br/>\((.*?)\)\.( |)
en
<p style="background:lightgray;">$1.</p> (origen de los lemas. En ocasiones encontró resultados en la última comprobación después de otras sustituciones).
11. (</span>|</em>|</strong>)\. \((.*?)\)\.( |)
en
$1.<p style="background:lightgray;">$2.</p> (orígenes de los lemas que se han quedado atrás. En la práctica detectó fallos provenientes del fichero html original y necesitaron resolución manual en casi todos los casos).
12. (<p style="background:lightgray;">.*?) <span class="extrafont3">♦</span> (.*?)</p>
en
$1<br/>$2</p> (modelos de conjugación y otras aclaraciones en los orígenes de los lemas. En algún caso habría debido pasarse más de una vez, pero eso se detectó en la comprobación final).
13. (\.|) <span class="extrafont3">♦</span> (.*?)<br/>
en
$1<p style="background:lightgray;">$2</p> (orígenes de los lemas que se quedaron atrás por la conversión de los Tb. (variantes). (ejs. adiós, boya2)).
14. (\.|) <span class="extrafont3">♦</span> (.*?)</p>
en
$1<br/>$2</p> (resto de modelos de conjugación y otras aclaraciones en los orígenes de los lemas. En algún caso habría debido pasarse más de una vez, pero eso se detectó en la comprobación final).
15. \(<span class="extrafont3">ǁ</span>
en
(ǁ (para indicación condensada de acepción de otro lema).
16. <span class="extrafont3">ǁ</span><span class="extrafont3">■</span>
en
<span class="extrafont3">■</span> (evitar duplicidad de clases que se sustituyen con la misma (y única) expresión regular. (puede no haber ninguna). (ej. ají))
17. (\.|) <span class="extrafont3">ǁ</span> <span class="sans-b">(.*?)</span>
en
$1<br/><strong>$2</strong> (acepciones de la misma categoría gramatical, cada una en una línea).
18. </span>\.( |)
en
</span><br/> (introducir salto de línea en las formas complejas con el punto después del </span>).
19. ~\.</span>( )
en
~</span><br/> (introducir salto de línea en las formas complejas con el punto antes del </span>).
20. (\.|) <span class="extrafont(|3)">(<strong>|)☐(</strong>|)</span> (~ |)<span class="sans">(.*?)</span>
en
$1<br/>$5$6 (salto de línea y aislar virgulillas (si las tienen, sino simplemente salto de línea) en el segundo bloque de las formas complejas).
21. (\.|) <span class="extrafont">(<strong>|)☐ (.*?)(</strong>|)(.*?)</span>
en
$1<br/>$2$3$4$5 (salto de línea en el resto de los que tienen (o no) virgulilla en el segundo bloque de las formas complejas).
22. (\.|) <span class="extrafont3">(ǁ|■|☐)</span> (~ |)<span class="sans">(.*?)</span>
en
$1<br/>$3$4 (nueva línea en: virgulillas que sustituyen a lemas, paso de acepciones a formas complejas y para el segundo bloque de formas complejas.
Compruébese (\.|) <span class="extrafont3">ǁ</span> (.*?)<span class="sans">(.*?)<strong>(.*?)</strong>(.*?)</span>
y sustitúyase por
$1<br/>$2<strong>$3$4</strong>$5 para el caso en que se dupliquen las negritas).
23. <br/><span class="extrafont3">(ǁ|■|☐)</span> (~ |)<span class="sans">(.*?)</span>
en
<br/>$2$3 (resto de nueva línea en: virgulillas que sustituyen a lemas, salto de acepciones a formas complejas y segundo bloque de formas complejas, que han quedado tras un salto de linea por culpa de sustituciones anteriores).
24. (\.|) <span class="extrafont3">■</span> (~ |)<span class="sans">(.*?)</span>
en
$1<br/>$2$3 (resto de casos que tienen virgulilla en las formas complejas).
25. <span class="sans">(.*?)</span>
en
$1 (expresiones junto a virgulillas que se hayan quedado atrás. En la práctica este también resultó un mecanismo efectivo de localización de errores en el fichero original).
26. (\.|) <span class="extrafont3">(⚫|⚪|ǁ)</span> (.*?)<span class="sans-b">(\d{1,2}\.)(.*?)</span>( |)
en
$1<br/><strong>$4</strong> $3$5 (salto de línea en categoría y subcategoría gramatical (y nueva línea en acepciones de la misma categoría gramatical) además de negrita en la numeración de acepciones y cambio de orden número de acepción <→ categoría o subcategoría gramatical).
27. (</p>|<br/>)([\w\. ]+)<span class="sans-b">(\d{1,2}\.)(.*?)</span>
en
$1<strong>$3</strong> $2$4 ( poner negrita en la numeración de acepciones además de cambio de orden número de acepción <→ categoría gramatical).
28. <br/><span class="extrafont3">(⚫|⚪|ǁ)</span> (.*?)<span class="sans-b">(\d{1,2}\.)(.*?)</span>( |)
en
<br/><strong>$3</strong> $2$4 (resto de categorías y subcategorías gramaticales y negrita en la numeración de acepciones más cambio de orden número de acepción <→ categoría o subcategoría gramatical, que han quedado tras salto de línea debido a sustituciones anteriores).
29. Revisar el resto de <span class="sans-b">(.*?)</span> que queden. La mayor parte se podrán convertir mediante sustitución de
(\.|) (loc\. |locs\. |adj\. |expr\. |exprs\. |[m|f]\. |interj\. )(verb\. |adv\. |sust\. |verbs\. |advs\. |susts\. |adj\. |adjs\. |prepos\. |)<span class="sans-b">(\d{1,2}\.)(.*?)</span>
en
$1<br/><strong>$4</strong> $2$3$5 (habrá que modificar manualmente el resto como en: hacer ~ a alguien (aire) y cortar las ~ a alguien y dar ~ a alguien (alas)).
30. Convertir (</p>|<br/>)<span class="extrafont3">➤</span>( |)
en
$1 (para los envíos con salto de línea previo (provenientes de otras sustituciones)).
31. ( )<span class="extrafont3">➤</span>( |)
en
<br/> (envíos sin salto de línea previo).
32. ( |)~ (<strong>|)(e|)s(\s|,|\.|</strong>)
en
$2$1~$3s$4 (plural con final en vocal o consonante de las formas complejas).
33. V\. conjug\. en APÉNDICE
en
Conjug. modelo (modelo de conjugación de verbos regulares).
34. V\. conjug\. actual en APÉNDICE
en
Conjug. Modelo actual (modelo de conjugación de verbos irregulares).
35. <p><em><strong>(.*?)</strong></em>
en
<p><strong><em>$1</em></strong> (facilitar la extracción de lemas en la hoja de cálculo en aquellos provenientes de otras lenguas que no tienen adaptación).
36. ~
en
<u>~</u> (preparar la virgulilla para ser sustituida por el lema -subrayado- en la forma compleja).
37. <span class="extrafont">(.*?)</span>
en
$1 (aislar términos en griego, latín o árabe y símbolo del copyright).
38. ([^c]|tc)\. loc(s|)\.( )
en
$1<br/>loc$2.$3 (saltos de línea de formas complejas no distinguidos por clase css).
39. Comprobar que no han quedado <span>, </span> y <span . En la práctica detectó clases no convertidas por las expresiones anteriores por motivos que no siempre quedaron claros.
40. Convertir </strong>( |)<strong>
en
$1 (eliminar los etiquetados en negrita consecutivos, insertados en algunas sustituciones).
41. ([^\.])\.\.([^\.])
en
$1.$2 (eliminar dobles puntos introducidos en algunas sustituciones (por englobar todos los posibles casos) evitando la conversión accidental de puntos suspensivos).
42. \s\s en \s (eliminar los dobles espacios introducidos en los pasos 26, 27 y 28).
43. </p>\n\n<p> en </p>\n<p> , <br/><br/> en <br/> y <br/></p> en </p> (eliminar líneas en blanco innecesarias).
Para cambiar la virgulilla, previamente subrayada, por el lema se dan varios casos:
44. Si el lema no tiene género: Convertir <p><strong>(<em>|)([\w\s]*)(</em>|<sup>[\d\.]*</sup>|)</strong>(.*?)~
en
<p><strong>$1$2$3</strong>$4$2. Se debe repetir hasta que no localice ninguna virgulilla pues hay lemas con muchas de ellas.
45. Si el lema tiene género:
a) Convertir <p><strong>([\w]+)(\w{1,})(o)(<sup>\d</sup>|), (\2)(a)</strong>(.*?)([\w]*)(ión|a|ad|dumbre|[t|s|x]is)(</strong>|)(s|) <u>~
en
<p><strong>$1$2$3$4, $5$6</strong>$7$8$9$10$11 <u>$1$5$6 (forma compleja femenina con genero (o-a) en las dos últimas letras (penúltima consonante) y el lema va al final. Se debe revisar cada conversión pues no es posible abarcar todas las excepciones. Repetirlo hasta que no quede ninguna virgulilla).
b) <p><strong>([\w]+)(\w{1,})(o)(<sup>\d</sup>|), (\2)(a)</strong>(.*?)(</strong>|)(s|)( |)<u>~</u> (<strong>|)([\w]*)(ión|a|ad|dumbre|[t|s|x]is)(,|</strong>)
en
<p><strong>$1$2$3$4, $5$6</strong>$7$8$9$10<u>$1$5$6</u> $11$12$13$14 (forma compleja femenina con genero (o-a) en las dos últimas letras (penúltima consonante) y lema al principio. Se debe revisar cada conversión, aunque no suele haber muchas de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
c) <p><strong>([\w]+)(\w)(o), (a)</strong>(.*?)([\w]*)(ión|a) <u>~
en
<p><strong>$1$2$3, $4</strong>$5$6$7 <u>$1$2$4 (forma compleja femenina con genero (o-a) en las dos últimas letras (penúltima vocal) y lema al final. Se debe revisar cada conversión, aunque son muy pocas de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
d) <p><strong>([\w]+)(ó|o)(l|n|r), (\3)(a)</strong>(.*?)([\w]*)(ión|a|ad)(</strong>|) <u>~
en
<p><strong>$1$2$3, $4$5</strong>$6$7$8$9 <u>$1o$4$5 (forma compleja femenina con género (ol|ón|or-ola|ona|ora) y lema al final. Se debe revisar cada conversión; también son muy pocas las de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
e) <p><strong>([\w]+)(é)(s), (\3)(a)</strong>(.*?)([\w]*)(ión|a|ad)(</strong>|) <u>~
en
<p><strong>$1$2$3, $4$5</strong>$6$7$8$9 <u>$1e$4$5 (forma compleja femenina con género (és-esa) y lema al final. Se debe revisar cada conversión, aunque raramente aparecerá alguna de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
f) <p><strong>([\w]+)(á)(n), (\3)(a)</strong>(.*?)([\w]*)(ión|a|ad)(</strong>|) <u>~
en
<p><strong>$1$2$3, $4$5</strong>$6$7$8$9 <u>$1a$4$5 (forma compleja femenina con género (án-ana) y lema al final. Se debe revisar cada conversión, aunque solo ocasionalmente aparecerá alguna de este tipo. Repetirlo hasta que no quede ninguna virgulilla).
g) <p><strong>([\w\s]*)(<sup>\d</sup>|), ([\w]*)</strong>(.*?)( |)<u>~ en <p><strong>$1$2, $3</strong>$4$5<u>$1 para forma compleja masculina y lema al final o al principio. Se debe revisar cada conversión, con especial cuidado cuando la forma compleja admita los dos géneros (m.y f.) . Repetirlo hasta que no quede ninguna virgulilla).
Quizá podría haber intentado llevar a cabo la conversión programándola. No obstante, pronto me di cuenta de que ello me habría hecho perder rápidamente el hilo de la correcta generación de los lemas convertidos: la sustitución de las virgulillas cuando el lema tenía género he tenido que hacerla revisándolas casi una a una, por poner un ejemplo.
Por otro lado, el haber hecho el trabajo de esta manera me ha permitido detectar en el fichero original del orden de trescientos veinte errores, que si bien porcentualmente suponen un misérrimo 0’3% de los más de noventa y un mil lemas, no deja de ser un número apreciable en sí mismo. Lo cierto es que en el formato original no son demasiado problemáticos, pues lo lemas se consultan de manera continua. En cambio en un diccionario al que se accede por índices y deplazamientos, no se encontrarían algunos lemas y otros aparecerían incompletos. Tengo muy claro que se han quedado errores sin corregir pues los dos últimos los detecté en la última fase de revisión (en la que miro el primer y último lema de cada fichero del formato Nolim/Bookeen) y de seguro que yo he introducido más de uno, sobre todo en saltos de línea innecesarios. Todo reporte de errores lo agradeceré enormemente. Relaciono ocultos los errores encontrados.
a) Lemas unidos que deben ir separados (se consignan a continuación del →) la coma separa cada par (o trío, que alguno hay):
abertura→ abertzale, alcor→ Alcorán, aleación→ alea iacta est, allegar→ allegretto, amprar→ ámpula, anacrusa→ ánade, anfitrión→ ánfora, angaripola→ ángaro, angazo→ ángel, anillo→ ánima, animizar→ ánimo, antracosis→ ántrax, año2→ -año, aparentemente→ a pari, apetitoso→ ápex, aquivo→ a quo, ar→ -ar, ardite→ -ardo, argollón→ árgoma, aulario→ áulico, bodrio→ body, buseta→ bushido, cazuz→ CD, cefalea→ -cefalia, cultura→ -cultura, desarrollable→ desarrollar, datilera→ datismo, deverbativo→ de verbo ad verbum, domingo1→ Domingo2, edetano→ edición, entelado→ entelar, enlabiar1→ enlabiar2, enridar1→ enridar2, enronchar→ enronquecer, ensuciamento→ ensuciar, entendidamente→ entendido, enterrar→ entesado, entoldamiento→ entoldar, entrenamiento→ entrenar, entuerto→ entullecer, enviciamiento→ enviciar, epidérmico→ epidermis, epistémico→ epistemología, epistemólogo→ epístola, equipero→ equipo, erogación→ erogar, escalfamiento→escalfar, escamar→ escambrón, escamoteador→ escamotear, escapular2→ escapulario, escarolar→ escarótico, escarpado→ escarpadura, escirroso→ escisión, escociano→ escocimiento, escogencia→ escoger, escorbútico→ escorbuto, escribir→ escriño, esfera→ esferal, esferoide→ esferómetro, esfigmograma→ esfigmómetro, espadón1→ espadón2, espasticidad→ espástico, espiroqueto→ espita, esquilfe→ esquilimoso, estacha→ estache, estación→ estacional, estancación→ estancada, estandarizar→ estándar, estangurria→ estannífero, estero1→ estero2, estimuloso→ estinco, estío→ estiómenar, estipendio→ estípite→ estipiticar, estragar→ estrago, estrucioniforme→ estructura, etarra→ etcétera, etilo→ étimo, excitación→ excitado, expiación→ expiar, exponencial→ exponente, extracto→ extractor, extrañamiento→ extrañar, fabla→ fablable, factitivo→ facto, fajol→ fajón, fambre→ fame, fan→ fanal, fatigante→ fatigar, ferrarés→ ferre, filia→ filiación, filmográfico→ filmología, florecido→ floreciente, fono→ fonocaptor, fórmico→ formidable, foto→ fotoalergia, fraga1→ fraga2, gineta→ gin-fizz, grija→ grill, halitosis→ hall, hardido→ hardware, hrrusca→ hertz, hincar→ hincha, lapsus→ lapsus calami→ lapsus linguae, lauroceraso→ laus Deo, leída→ Leiden, leísta→ leitmotiv, lepasil→ lepe, loco2→ loco citato, motu proprio→ mousse, nocional→ nocir, oponer→ oponible, paceño→ pacer, parsi→ parsimonia, partero→ parterre, patrulla→ patrullaje,pavana→ pavada, paviano→ pávido, pelaza→ pelazga, petalismo→ pétalo, petral→ petraria, picazuroba→ piccolo, píceo→ picha, pichear→ pichel, pie→ piedad, pignorable→ pignoración, pirriar→ pírrico1, placiente→ placimiento, plátano→ platea, presupuestario→ presupuesto, pretorial→ pretorianismo, procedente→ proceder1, promedio→ pro memoria, pronunciamento→ pronunciar, propiedad→ propienda, provincial→ provinciala, pulchinela→ pulcritud, quad→ quadrivium, que→ qué, recabita→ recadar, recaudero→ recaudo, rejero→ rejileto, reprehensible→ reprehensión, rinoceronte→ rinofaringe, románico→ romanilla, salival→ salivar, sandino→ sandio, -sco→ scooter, self-service→ sellado, silbante→ silbar, tabicón→ tábido, tabulador→ tabula gratulatoria, tajalápiz→ tajamar, talegazo→ talega, talero→ tálero, tantrismo→ Tantum ergo, tecnecio→ -tecnia, templo→ tempo, ternurista→ tero, tico→ 'tico, tirintio→ tirio, tortel→ tortellini, tortillo→ Tortis, trivium→ -triz, -uelo→ uf, ultramarino→ ultramaro, unamuniano→ unánime, usarcé→ usarced, vago2→ vagón, verdemontaña→ verdeo, vínculo→ vindicación, vinilo→ vino, viz- → vizcacha, vocabulario→ vocabulista,
b) Definiciones pertenecientes a un lema que se tratan como lema separado (se consigna la parte de la definición -con puntos suspensivos acortando las demasiado largas- que hubo de ser unida a continuación de ←) la coma separa cada par (o trío, que alguno hay):
abuela← no necesitar o no tener..., ambarino← abelcoso, amonestar← amonestado, arador← arador de la sarna, arbitrero← arbitrista, aristocrático← perteneciente o relativo a la aristrocracia, asentadillas← a asentadillas, ballet← ballet,bocado← no tener alguien para un bocado, cochero← Sitio donde se encierran los coches y autobuses, chupa← como chupa de dómine, corriente← o contra la corriente, derm-← dermo-. Dermitis., dermat-← dermo-. Dermatitis., dermato-← dermo-. Dermatología., despacio← despacio. U. m. en And., Bol., Col., Ec. y R. Dom., disciplinante← disciplinante que sacaban a la vergüenza...← disciplinante que sacaban a azotar públicamente por haber..., ejemplificar← ejemplarizar., estructurante← estructurador. Un factor estructurador, espejo← espejo ustorio, espiritual← espiritual negro, exarco← exarca.,farmacopola← farmaceútico (persona que ...), filelí← fililí (tela ligera), fruto← frutos naturales de los fondos rústicos, imponer← ...a cosa , -morfo← elem. compos. , nacascolo← dividivi (árbol) , naco1← susto (impresión repentina), nao← nave (barco), natividad← natividad de jesucristo, nave← naveta (vaso de incensar), necio← neciamente., neumotórax← neumotórax producido artificialmente..., nipos← caudal (hacienda), numeral← numeral fraccionario, nodo← nodo en el que el planeta..., ñoqui← ñoqui hecha con sémola y que, ..., ñor← señor (término de cortesía), oblato← oblatos u oblatas, ...,obrería← obrería (renta), occitano← occitano (lengua), ochocientos← octingentésimo (que sigue en orden...),ocotero← ocote1. 2. f. Méx. ocotal., octavo← octava. 5. Librito que contiene el..., oesudoeste← oesudoeste., okupa←okupa.,ofuscamiento←ofuscación.,oliva← aceite de oliva, omaguaca←omaguacas.,onda← ondas radioeléctricas..., oponer← opuesto. tr. Poner algo contra..., óptico← óptica. 5.f. Parte de la física...,oriental← Oriente (Asia y regiones inmediatas), origenismo.← origenismo., osornino.← osorninos., otitis← otitis que no pasa más allá de..., página ← páginas. 2.Inform. sitio web..., parafrástico← Perteneciente o relativo a la paráfrasis, pascuense ← pascuenses. 3.Perteneciente o relativo al pascuense (ǁ lengua)., patatín← coloqs. Argucias, disculpas del que no..., paleógeno← Paleógeno., paupérrimo← pobre,pekinés← pekineses. 3. m. y f. perro pekinés., pelagianismo← pelagianismo., pelitre← pelitre., pértiga← pértiga 3. desus. pértica., petigrís← petigrís., péndulo← péndulo que se hace de metales de dilatación diferente..., pial← peal,piano1← piano de tamaño mediano y forma alargada..., pífano← pífano., pintón← pintón., pillería← pillo2 3. coloq. pillada., pitajaya← pitahaya., planetario← planetario. espacio planetario, poetría← poesía., popayanejo← popayanejos., poronguero2← porongueros., portugués← portugueses. carabela portuguesa, práctico← práctica. 2. Dicho de un conocimiento: Que..., presado← presado., proverbio← proverbio (refrán), promiscuo← promiscua., química← química de los compuestos que contienen..., recabdar← recabar (recoger, recaudar, guardar), recomponer← (...recompuesto)., reprehensible← reprensible,repulgue← repulgo (borde labrado de las empanadas), retroacción← retroactividad. retroactividad de la quiebra,..., resunta← resumen., romance← romance que se compone de versos..., resurrección← resurrección de Jesucristo., sabidor← sabio (que posee la sabiduría), saboyano← saboyanos. 3. f. Pastel, especie de bizcocho empapado..., sacramento← sacramento eucarístico,sacro← sacro, en la parte posterior de la pelvis, sajón← sajones (individuo de un pueblo germánico),salteño← salteños 3. f. Arg. y Bol. Empanada típica con relleno de..., salubre← (... salubérrimo)., samoyedo← samoyedos. 3. Perteneciente o relativo al..., sanedrín← sanedrín. 3. Junta o reunión para tratar de..., sangriento← sangrienta (que se goza en derramar sangre), sanjuaneño← sanjuanero. 2. Natural de Río San Juan,..., sanmigueleño← sanmigueleñas. 3. Natural de San Miguel, ciudad del Ecuador..., santero← santería, (sincretismo entre creencias africanas y la religión católica), sapiencia← sabiduría., sauce← sauce. sauce cabruno. m. Árbol..., sedeño← sedas, (cerdas), sefardí← sefardíes 3. judeoespañol (ǁ perteneciente a la variedad del español)..., selvaje← salvaje., seña← señal(ǁ cantidad que se adelanta en algunos contratos), séptimo← séptima ascendente o descendente en la escala., serbio← serbios. 3. Perteneciente o relativo al serbio (ǁ lengua)..., serbocroata← serbocroata. Léxico serbocroata..., serpentino← serpentín (ǁ instrumento de hierro), setecientos← septingentésimo (ǁ que sigue en orden al sexcentésimo nonagésimo noveno)., sexto← sexta hora temporal, a mediodía, hasta... ← sexta que comienza por el as..., sevillano← sevillanos. 3.</strong> f. Palo flamenco propio de Sevilla y..., sículo← sículos. 3. Perteneciente o relativo al sículo (ǁ lengua)..., sigla← siglas en ONU, silbante← sibilante (ǁ sonido fricativo o africado), sintagma← sintagma que tiene por núcleo un verbo., sobijar← sobar (ǁ manosear), sobreponer← ...sobrepuesto) tr., sofreír← ...sofreído) tr.,solución← solución de continuidad., sosa← sosa, muy ricas en sales alcalinas y empleadas..., suboficial← suboficial, inmediatamente superior..., surtidero← surtidor (ǁ chorro de agua), sucesión← sucesión que tiende a un límite., tortería← tortas (ǁ panecillos)., traillar← traílla (ǁ instrumento agrícola)., triángulo← triángulo que tiene los tres ángulos agudos., tuerce← torcedura (ǁ acción de torcer)., tuse← tusa (ǁ crines del caballo)., unisón← mismo sonido que otra cosa., utensilio← Objeto fabricado que se destina a un uso manual y doméstico., unitivo← unir. Tejido unitivo., zancadilla← o pretende derribar a alguien de un puesto o cargo., zarandear← por los hombros o los brazos moviéndolo con violencia.
c) lemas repetidos sin definición: epodo
d) otros casos:
caballo d buena boca;
buccino (se coló una clase indentleft1-center desconocida hasta ese momento);
ha cerse ~ (aire);
en los dos archivos correspondientes a la letra "d" no se incluyó el cambio de estilo "sans" tras el de "extrafont3", para los casos de los símbolos "ǁ", "■" y "☐" (acepciones en formas complejas, sin numerar, y con cambio de categoría y subcategoría gramatical);
también en los archivos de la letra "d" se cambió el orden del punto tras número de acepción, con el cierre de la etiqueta "span" (este me dio un par de días de dolores de cabeza hasta que lo localicé). Luego apareció el mismo fallo en la letra "m";
otros errores tipográficos, discordancias y de cierre de etiquetas html que no he consignado por considerarlos errores menores y porque, en realidad, no son detectables en la consulta del diccionario en su versión electrónica original, aunque sí en la conversión realizada.
La naturaleza de los errores encontrados me lleva a establecer dos hipótesis:
La conversión desde el formato original (¿la base de datos on-line?) se hizo mediante herramientas automatizadas, pues los errores siguen un patrón que intuyo, pero que no he sido capaz de determinar con exactitud.
El trabajo se ha distribuido en varios equipos/personas pues los errores aparecen en ficheros de determinadas iniciales y en otros no.
Y también entiendo ahora por qué la academia parece resistirse a indicar el número de lemas exactos en cada diccionario. Durante el proceso este número ha ido variando, según encontraba y corregía fallos, hasta los noventa y un mil cuatrocientos cincuenta y ocho (91.458) obtenidos tras la última revisión.
Estos fallos también los he corregido en el fichero original, que pongo a vuestra disposición, previa solicitud por privado.
Para la penúltima parte del proceso, extracción de índices y desplazamientos, ya tenía adelantado bastante el trabajo, fruto de la conversión que hice de la vigésimo segunda edición, si bien he optimizado y diversificado las hojas de cálculo con el fin de hacerlas menos “pesadas” a la hora de inserción masiva de datos. Además he reutilizado el fichero comprimido, editando los ficheros de su interior y añadiendo los diez resultantes del mayor número de lemas de esta edición. También pongo el procedimiento oculto.
Concatenar el contenido de los ficheros HTML en uno único (cat ?_00??_000? > fichero_concatenado) e incluir su contenido en una columna de una hoja de cálculo.
En dicha hoja se extraen en columnas diferenciadas, mediante fórmulas:
a1) Lema con superindice a continuación, si lo tiene (eliminando formato de superíndice) y sin desinencia de género, si la tiene.
b1) Longitud de la definición en caracteres (util para la comparación con la longitud en bytes).
c1) Estimación del número de ficheros de 256 Kb. que se generarán.
d1) Columna de comparación de la extracción del lema con la de la fórmula de extracción, por si hay errores en la fórmula o en el pegado de lemas (se detectaron algunos fallos de partes de definiciones de lemas, separadas como lema independiente, que se habían escapado en el proceso de conversión).
En el fichero de texto concatenado se sustituyen los </p><p> por </p>\n<p> para homogeneizar los finales y principios de fichero (que no tienen el salto de linea) con el resto de definiciones.
Se aplica el comando:
while read line; do wc -c; done < fichero_definiciones > fichero_bytes_por_definicion
En una nueva hoja de cálculo (o fichero para mejor tratamiento).
a2) Se inserta el contenido de fichero_bytes_por_definicion en una hoja y se aplica fórmula para obtener la longitud de cada línea (el resultado del comando las da acumuladas). ** Téngase en cuenta que el primer resultado se corresponde con la longitud en bytes del segundo lema. Para obtener la del primero puede hacerse manualmente o restando la longitud total en bytes del fichero del primer resultado obtenido.
b2) En otra hoja se pasa la columna de resultados por línea junto con la columna de los lemas y la de la longitud en caracteres de cada lema, extraída de la hoja de cálculo inicial, esta última con el fin de comparar resultados.
Tras hacer comprobaciones con un número representativo de lemas en la página https://mothereff.in/byte-counter (https://mothereff.in/byte-counter), que da los resultados en caracteres y bytes se demuestra que los resultados obtenidos con el comando wc exceden en 1 byte el número real de cada definición (debido al salto de línea, creo). Es importante tener esto en cuenta pues de no aplicar correctamente los valores, el desplazamiento de la base de datos de índices dará resultados erróneos. La columna con los bytes corregidos será la que se traslade a un nuevo fichero de hoja de cálculo.
En otro fichero de hoja de cálculo:
a3) Se pegan las columnas de lemas y longitud en bytes de la hoja anterior.
b3) Mediante fórmulas se calculan en otras columnas las longitudes acumuladas para aquellos lemas con más de un origen, ya que solo tendrán una entrada en el fichero de índices.
c3) En otra hoja se pegan la columna de lemas y la de los desplazamientos acumulados, que luego se tratarán con expresiones regulares en el editor.
Una vez efectuado el tratamiento mediante la búsqueda sustitución con las expresiones regulares:
1. Convertir [\w\- ]+\t0\n
en
nada (elimina lemas que no tienen acumulado el desplazamiento).
2. ([\w\- ]+)\d{1}(\t\d+\n)
en
$1$2 (deja los lemas con desplazamiento acumulado sin superíndice).
se obtiene una lista de dos columnas con los lemas "repetidos" eliminados y sin superíndices y los desplazamientos acumulados, que se pegan en otra hoja del mismo fichero donde:
a4) se añaden columnas necesarias para la base de datos de índices
b4) se añaden otras columnas para facilitar la posterior comprobación del último lema de cada fichero y el primero del siguiente (detectan el cambio de fichero) y así asegurar que el índice está bien generado.
Se añaden al índice las entradas correspondientes a las inflexiones que ya estaban guardadas en otra hoja, provenientes del trabajo con el diccionario de la 22ª edición.
Se reutiliza la base de datos de índices y se pegan los datos de la hoja reseñada en el paso a4) con los datos necesarios a la tabla T_Dictindex (previo pegado y de nuevo copiado en el editor, para que interprete correctamente tabuladores y saltos de línea), mediante un editor de bases de datos SQLite para linux (yo he usado "DB Browser for SQLite"). Conviene regenerar el índice sustituyendo la cláusula "COLLATE IcuNoCase" por "COLLATE NOCASE".
Tras generar la base de datos de índices se traslada el contenido del fichero_concatenado a cada uno de los ficheros que componen el diccionario comprimido, siguiendo las indicaciones de la hoja de cálculo del paso b4). Se añadieron diez nuevos ficheros debido al incremento de lemas en esta edición.
Con respecto a las inflexiones, me temo que se han quedado un tanto anticuadas, pues los nuevos lemas añadidos en esta edición no tienen sus correspondientes inflexiones, aunque estas afecten solo a aquellos nuevos lemas que sean verbos o admitan plural. Espero que el motor de búsqueda sea capaz de localizarlos por proximidad léxica, llegado el caso.
Finalmente se consultan el primer y último lema que está en cada fichero interior, para comprobar si el índice está bien generado. Para ello el libro utilizado como referencia fue... el propio diccionario original en formato epub. En esta fase comprobé que el símbolo “ǁ”, usado para la indicación condensada de acepción de otro lema, no era interpretado correctamente por el Nolim, de manera que tuve que sustituirlo por un doble “|” que la verdad es que se aprecia bastante bien y además tuve la suerte de que ocupa lo mismo que el otro, por lo que no hubo de regenerarse el índice por aumento de los desplazamientos.
Tengo que reconocer que, a pesar de los presumibles errores y mi manía perfeccionista, estoy bastante satisfecho del resultado y hoy por hoy cuento con un diccionario casi definitivo: actualizado, legible y bastante de acuerdo a mis gustos. El día que se disponga de tinta electrónica a color, será el momento de adaptarlo con mucha más fidelidad a la versión en línea del diccionario de la RAE, que es el que más me entusiasma y en el que no he detectado error alguno (aunque en consultas de comparación encontré alguna virgulilla aún sin convertir, pero no me acuerdo en qué lema). Sin más ahí va el enlace.
https://drive.google.com/open?id=1O9zQCeTKomvHLAu1_do57t9wpjgDAm7m
Insisto en que agradeceré el reporte de errores así como el resultado de la puesta en práctica del fichero y las eventuales conversiones a otros formatos, quien así lo desee.
Saludos muuuuuy cordiales.
Que currazo impresionante. Una versión stardict estaría genial.
Que currazo impresionante. Una versión stardict estaría genial.
Pues estoy intentando la conversión pero penelope me da errores en la salida. A ver si averiguo el motivo.
elchamaco
17/06/2019, 19:23
Pues estoy intentando la conversión pero penelope me da errores en la salida. A ver si averiguo el motivo.
A mi desde la version de bookeen también pero probé en el curro y no se si era por eso o qué, también hice pruebas con otro que he visto en version kobo en ingles y nada. Así que pensaba que era problemas con lo que tengo instalado allí.Aunque bueno el de kobo creo que no se puede convertir integro a nada parece que solo pilla indice de palabras.
Tal y como preveía, el uso del diccionario ha hecho aparecer varios errores: algunos en las inflexiones, por índices no actualizados por mi parte tras corregir un lema, y otros provenientes de la versión original. En este caso he detectado que los lemas hebrero1 y hebrero2 estaban unidos en el primero, lo que tras mis transformaciones provocaba un mal cálculo de los índices a partir de él hasta el fin del fichero que los contiene; y se había partido la definición del lema "salvajino" añadiendo "silvestre", que forma parte de ella. Hay alguna otra cosilla menor que no merece la pena reflejarse.
He actualizado la versión (intuyo que no será la última) y dejo el enlace:
https://drive.google.com/open?id=1O9zQCeTKomvHLAu1_do57t9wpjgDAm7m
Un afectuoso saludo.
elchamaco
12/07/2019, 18:42
Gracias a negatus que me ha pasado los lemas y las inflexiones (que paciencia, jejeje >:)) he hecho una conversión para stardict del diccionario rae 23ª edición. Además he mejorado un poco las inflexiones mezclando con las de la versión del rae 22 de kindle. Ahora ando muy pillado pero tengo intención de irlo mejorando en algún momento, porque al venir de la versión epub este no trae enlaces dentro de las definiciones a otras palabras del diccionario. Además tengo en proyecto mejorar el tema de inflexiones.
Esta listo para usar en goldendict o fora para ereaders android. Ojo que lleva inflexiones, en las implementaciones de stardict de boyue u onyx para la aplicacion de diccionarios preinstalada pasa del fichero de inflexiones y sólo encontraría el lema principal, por ejemplo amar, pero no amado, amados, amadas, etc. Koreader creo que si las pilla.
https://www.mediafire.com/file/dtbdb3g67kphvmm/rae_23_negatus.rar/file
Cualquier cosa rara comentadlo porque lo he convertido a toda hostia, sin demasiados miramientos. :-"
Tras un verano de lectura y compulsivas consultas al diccionario, esto me ha servido para encontrarle un buen número de errores, algunos debidos a mi codificación y otros del propio diccionario original.
Si bien es cierto que en su gran mayoría eran cuestiones más bien relacionadas con la visualización, ha habido bastantes que, o bien impedían ver el contenido completo del lema, o no podían ser localizadas.
Aprovecho este comentario "número redondo" para notificaros que he actualizado todos los ficheros: diccionario original, diccionario en formato Nolim (Bookeen) y fichero de lemas (este va para elchamaco).
Aunque estoy seguro de que todavía tendrá errores, lo cierto es que ahora es un diccionario mucho más depurado y casi sin "aberraciones" visuales.
Aprovechad para actualizarlo. ;)
Os recuerdo el enlace:
https://drive.google.com/open?id=1O9zQCeTKomvHLAu1_do57t9wpjgDAm7m
Un abrazo.
Tras un verano de lectura y compulsivas consultas al diccionario, esto me ha servido para encontrarle un buen número de errores, algunos debidos a mi codificación y otros del propio diccionario original.
Si bien es cierto que en su gran mayoría eran cuestiones más bien relacionadas con la visualización, ha habido bastantes que, o bien impedían ver el contenido completo del lema, o no podían ser localizadas.
Aprovecho este comentario "número redondo" para notificaros que he actualizado todos los ficheros: diccionario original, diccionario en formato Nolim (Bookeen) y fichero de lemas (este va para elchamaco).
Aunque estoy seguro de que todavía tendrá errores, lo cierto es que ahora es un diccionario mucho más depurado y casi sin "aberraciones" visuales.
Aprovechad para actualizarlo. ;)
Os recuerdo el enlace:
https://drive.google.com/open?id=1O9zQCeTKomvHLAu1_do57t9wpjgDAm7m
Un abrazo.
Muchas gracais por el enorme trabajo que estás realizando con este lector.
Un saludo.
carles72
07/12/2019, 23:35
Hola Negatus,gracias por tu estupendo trabajo,tengo el modelo mas nuevo de bookeen el diva hd,probé el diccionario de minirae y funciona,pero pruebo el tuyo,el 23,y no lo detecta.
Podrias decirme alguna cosa para hacerlo funcionar?
Muchas gracias
carles
Hola Negatus,gracias por tu estupendo trabajo,tengo el modelo mas nuevo de bookeen el diva hd,probé el diccionario de minirae y funciona,pero pruebo el tuyo,el 23,y no lo detecta.
Podrias decirme alguna cosa para hacerlo funcionar?
Muchas gracias
carles
De nada, Carles72, un placer hacer cosas para la comunidad.
Lo cierto es que el modelo que yo tengo es un bookeen remarcado por Carrefour (con la marca Nolim). Para el modelo que mencionas desconozco si se activa del mismo modo, aunque sospecho que si el minirae funciona este debería hacerlo también. Imagino que lo habrás probado sin estar instalado el minirae a la vez, pero es que no se me ocurre otra cosa.
A ver si hubiera otro usuario por acá con el mismo modelo que lo esté usando.
Lamento no poder ofrecerte más ayuda, pero sin el modelo en mis manos poco más puedo hacer.
Saludos.
carles72
09/12/2019, 20:58
gracias,vere como puedo solucionarlo
indigo13
07/05/2020, 21:53
Normalmente uso Penelope para convertir diccionarios en formato kobo, he convertido el Harrps al formato Odyssey que creo que es el de Nolim, pero no puedo probar si funciona. Ya diras a ver que tal.
EDITO ENLACE: https://www.dropbox.com/s/15xi4povoj83zxy/Harraps-en-es-nolim.rar?dl=0 (https://www.dropbox.com/s/15xi4povoj83zxy/Harraps-en-es-nolim.rar?dl=0)
Ante todo disculpas por revivir un tema que lleva inactivo desde hace meses para esto, pero llevo bastante rastreando la red buscando hacerme con un diccionario de las características citadas anteriormente: Un diccionario inglés-español para e-books Nolim, he intentado a través del enlace y se encuentra no operativo.
¿Alguien sigue conservándolo y puede volver a postearlo? Muchas gracias.
Ya que se ha "resucitado" el hilo, aprovecho para preguntar: ¿alguien sabe de algún diccionario inglés-inglés que también incluya phrasal verbs? Tengo instalado en un Boyue Likebook el Oxford Advanced y no es muy bueno. Añoro el que venía en mi Sony T1
milady133
28/05/2020, 17:24
Yo al final con los diccionarios he optado por consultar en el móvil Wordreference, cuando consulto algo del inglés muchas veces necesito el contexto, así que suelo acabar mirando las entradas en los foros más que la traducción directa que proporciona el diccionario (incluido el diccionario de wordreference, suele tener los phrasal verbs, pero navegando más abajo tienes entradas del foro de la comunidad donde ha intervenido la palabra de la que estás buscando traducción) También es cierto que no suelo consultar demasiado, por lo que la opción de ir al móvil para mirar traducciones en Wordreference la utilizo sólo ocasionalmente.
Yo al final con los diccionarios he optado por consultar en el móvil Wordreference, cuando consulto algo del inglés muchas veces necesito el contexto, así que suelo acabar mirando las entradas en los foros más que la traducción directa que proporciona el diccionario (incluido el diccionario de wordreference, suele tener los phrasal verbs, pero navegando más abajo tienes entradas del foro de la comunidad donde ha intervenido la palabra de la que estás buscando traducción) También es cierto que no suelo consultar demasiado, por lo que la opción de ir al móvil para mirar traducciones en Wordreference la utilizo sólo ocasionalmente.
Está claro que lo suyo sería que el mismo ereader ofreciese una opción cómoda de conectarse a internet y buscar la palabra, por ejemplo en Wordreference que me encanta, pero eso solo es posible ahora con lectores salvajemente caros.
Funcionando con vBulletin® Version 4.2.5 Copyright © 2026 vBulletin Solutions, Inc. All rights reserved.