PDA

Ver la versión completa : Periodicos, Revistas y Blogs a texto completo.



facthor
09/10/2008, 07:11
Por fin...todo llega.
Acabamos de montar el sistema de feeds a texto completo.
El sistema se basa en el lenguaje xpath, estamos preparando un manual de usuario en los foros de Grammata.
Invito a los usuarios a diseñar filtros xpath para obtener el texto de todos los Periódicos, Revistas y blogs

Saludos. Juan

Ferderico
09/10/2008, 08:26
ole y ole!!!
Gracias!
>:D<

asursargon
09/10/2008, 10:32
Hola,

Estoy ansioso por probarlo, pero será necesario saber algo más del tema, así que el manual me va a resultar imprescindible para poder aportar algo en el diseño de filtros.

facthor
09/10/2008, 11:48
en el foro en manuales. ya está

Ejemplos de Filtros:

Expansion.es

[@id='contenido']/h1
[@class='firma']
[@class='int_sumario']/img
[@id='principal']/p

20minutos.com

[@class='contenido_noticia']

.....

asursargon
09/10/2008, 15:59
Hola,

He leído el manual y entiendo la teoría de cómo funciona. También he captado el sistema de filtros.

El problema es que no pillo -lo siento soy algo mayor y poco ágil para entender las cosas- cómo conseguir directamente de un feed el texto completo para pasarlo al e-book.
¿Hay que crear un página específica en xml?, ¿algún programa lo hace directamente todo el proceso?

Algún ejemplo que lo explique paso a paso...desde el principio... ya sé que es mucho pedir pero mi autodidactismo no da para más.

asursargon
09/10/2008, 18:19
Hola de nuevo,

Vale ya empiezo a pillarlo, está todo preparado para aplicar los filtros desde Grammata.
Excelente trabajo y felicidades.

Vilon
12/10/2008, 00:40
¡Increíble trabajo! Lo he probado y funciona perfecto.
Muy currado :o FELICIDADES.

Una duda que tengo. ¿Como conseguís cargar los HTML en el analizador XML cuando la mayoría de los documentos HTML que hay por la red no son strict y por tanto no son XML válidos??

Lo digo porque yo he estado haciendo unas pruebas con el Xpath desde java y al cargar documentos HTML no strict (concretamente al hacer el parse) casca al analizarlo...



Document doc = null;
DocumentBuilder builder = factoryDocument.newDocumentBuilder();
doc = builder.parse( new File("C: est.html") );
doc = builder.newDocument();

¿Como habéis solucionado esto vosotros?

A seguir así!

Un saludo.