Главная страница


ru.perl

 
 - RU.PERL ----------------------------------------------------------------------
 From : Andrei Protasovitski                 2:450/186      30 Jan 2007  10:50:49
 To : 
 Subject : Re: HTML parsing
 -------------------------------------------------------------------------------- 
 
 Доброго здоровья!
 
 Oleg A. Paraschenko пишет:
 
 >> Hасколько места определенны -- сразу не понятно, т.е. средство для
 >> разбора должно быть пригодно для исследования структуры страницы на
 >> предмет определения признаков мест расположения нужного контента.
 > В своё время пришли к такой схеме:
 > * вначале regexp'ами HTML приводится к XML-виду, и
 > * на XML натравливается XSLT с функциями расширения.
 
 Хм... Имхо, тогда уж лучше строить дерево средствами Perl'а 
 (HTML::TreeBuilder или что-то в этом духе), а потом из нее вытаскивать. 
 Я бы сказал, что XSLT тут лишнее.
 
 > По поводу пункта два:
 > http://uucode.com/texts/genxslt/genxslt.html
 > Писали систему для вытаскивания информации из HTML. Решили писать своё.
 > Через год посмотрели друг на друга и сказали: а не изобрели ли мы XSLT.
 
 В моем способе ново-XSLT не родится, но XPath вполне можно использовать 
 или переизобрести. :)
 
 -- 
 Andrei Protasovitski
 mailto: andrei.protasovitski()gmail.com
     ICQ: 75725244
     AIM: protasovitski
     MSN: protasonic@hotmail.com
 Jabber: AS_Pushkin@mova.org
 --- Mozilla/5.0 (X11; U; Linux i686; ru-RU; rv:1.8.1.2pre) Gecko/20070111
 SeaMonkey/1.1
  * Origin: -= http://fido.ext.by (sponsored by http://extmedia.com) (2:450/186)
 
 

Вернуться к списку тем, сортированных по: возрастание даты  уменьшение даты  тема  автор 

 Тема:    Автор:    Дата:  
 Re: HTML parsing   Andrei Protasovitski   30 Jan 2007 10:50:49 
Архивное /ru.perl/2760fe831291.html, оценка 2 из 5, голосов 10
Яндекс.Метрика
Valid HTML 4.01 Transitional