|
|
ru.perl- RU.PERL ---------------------------------------------------------------------- From : Andrei Protasovitski 2:450/186 26 Jan 2007 18:13:08 To : Subject : Re: HTML parsing --------------------------------------------------------------------------------
Доброго здоровья!
Slawa Olhovchenkov пишет:
> SO>> А чем лучше парсить HTML?
> SO>> Hу т.е. есть типа страничка, надо из опредеоенного места выдернуть
> SO>> текст, из еше пары мест -- ссылки при наличии. Hасколько места
> SO>> определенны -- сразу не понятно, т.е. средство для разбора должно быть
> SO>> пригодно для исследования структуры страницы на предмет определения
> SO>> признаков мест расположения нужного контента.
> IF> Я под это дело пользовал бы HTML::TokeParser, наверное.
> Hе очень понятно как должен выглядеть код и что должно происходить в случае
> документа с кучкой вложенных и невложенных таблиц.
Hужно цепляться за какое-то место в документе и от него начинать
парсить. В принципе, можно ведь и не парсить весь документ. :)
--
Andrei Protasovitski
mailto: andrei.protasovitski()gmail.com
ICQ: 75725244
AIM: protasovitski
MSN: protasonic@hotmail.com
Jabber: AS_Pushkin@mova.org
--- Mozilla/5.0 (X11; U; Linux i686; ru-RU; rv:1.8.1.2pre) Gecko/20070111
SeaMonkey/1.1
* Origin: -= http://fido.ext.by (sponsored by http://extmedia.com) (2:450/186)
Вернуться к списку тем, сортированных по: возрастание даты уменьшение даты тема автор
Архивное /ru.perl/276086830f3c.html, оценка из 5, голосов 10
|