|
|
ru.linux- RU.LINUX --------------------------------------------------------------------- From : Aleksey Cheusov 2:5020/400 03 Jan 2003 22:56:50 To : Valentin Nechayev Subject : Re: пpозpачное чтение/ pедактиpование сp866 в mc -------------------------------------------------------------------------------- Valentin Nechayev <netch@segfault.kiev.ua> writes: > >>> Aleksey Cheusov wrote: > > >> аpод, как можно сделать, чтобы без > >> pучного/полуавтоматического конвеpтиpования можно было сабж > >> делать? > AC> - Почитай книжки и вспомни что такое цепи Маркова. > > Hу ты садист :) Здесь, как обычно, миллион вариантов. В простейшем случае можно перечислить предлоги (без них ни один более-менее большой текст не обходится) и подсчитать, сколько раз они встретились. Затем выбрать кодировку с максимальным количеством. А с цепями Маркова можно даже язык определить - не то что кодировку. А ещё можно HMM with finite state supervision... ;) Короче не меньше миллиона. ;) > Зашитой таблицы вероятностей отдельных букв и пар букв должно > хватить. Конечно с зашитой. Один раз посчитал на Достоевском и хватит;) > Или ты предлагаешь сделать определение после каскадных перекодировок > вида "текст в koi8 подвергаем преобразованию cp866->iso-8859-5"? В общем, да. Считаем вероятность переходов, например, в iso-5. Беря на вход текст, предполагшаем, что она в cp866, cp1251, iso-5. По очереди (перекодируя) считаем вероятность цепочки (ограниченной n-Kb) и выбираем наилучшую. > > AC> - Hапиши скрипт, определяющий кодировку. - Поделись с другим. > > По-моему, за последний год в ru.linux пробегали ссылки как минимум > на три таких опознавателей кодировок в open source. Я здесь не так давно - не видел. > > > -netch- -- Best regards, Aleksey Cheusov. --- ifmail v.2.15dev5 * Origin: Science Soft (2:5020/400) Вернуться к списку тем, сортированных по: возрастание даты уменьшение даты тема автор
Архивное /ru.linux/1728365d2e6d2.html, оценка из 5, голосов 10
|