|
|
ru.perl- RU.PERL ---------------------------------------------------------------------- From : Andrei Protasovitski 2:450/186 30 Jan 2007 10:50:49 To : Subject : Re: HTML parsing -------------------------------------------------------------------------------- Доброго здоровья! Oleg A. Paraschenko пишет: >> Hасколько места определенны -- сразу не понятно, т.е. средство для >> разбора должно быть пригодно для исследования структуры страницы на >> предмет определения признаков мест расположения нужного контента. > В своё время пришли к такой схеме: > * вначале regexp'ами HTML приводится к XML-виду, и > * на XML натравливается XSLT с функциями расширения. Хм... Имхо, тогда уж лучше строить дерево средствами Perl'а (HTML::TreeBuilder или что-то в этом духе), а потом из нее вытаскивать. Я бы сказал, что XSLT тут лишнее. > По поводу пункта два: > http://uucode.com/texts/genxslt/genxslt.html > Писали систему для вытаскивания информации из HTML. Решили писать своё. > Через год посмотрели друг на друга и сказали: а не изобрели ли мы XSLT. В моем способе ново-XSLT не родится, но XPath вполне можно использовать или переизобрести. :) -- Andrei Protasovitski mailto: andrei.protasovitski()gmail.com ICQ: 75725244 AIM: protasovitski MSN: protasonic@hotmail.com Jabber: AS_Pushkin@mova.org --- Mozilla/5.0 (X11; U; Linux i686; ru-RU; rv:1.8.1.2pre) Gecko/20070111 SeaMonkey/1.1 * Origin: -= http://fido.ext.by (sponsored by http://extmedia.com) (2:450/186) Вернуться к списку тем, сортированных по: возрастание даты уменьшение даты тема автор
Архивное /ru.perl/2760fe831291.html, оценка из 5, голосов 10
|