Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 March 11

ВМ

Владислав Медведев in NLP_RU - Natural Language Processing & Text Mining
Новиков Дмитрий
Это постоянный цикл, я для seo экспериментов это хочу использовать и обучать. Да мне нужен текст в боди без ссылок
универсальный парсер не получится написать. выкусывай контент всех тегов, которые содержат текст (<p>, span, ul , ol, h и тд) и складывай в кучу
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Владислав Медведев
универсальный парсер не получится написать. выкусывай контент всех тегов, которые содержат текст (<p>, span, ul , ol, h и тд) и складывай в кучу
Он парсит xml регулярками, он вообще не понимает что делает. А про то, что это не будет работать с виртуальным домом, я ничего даже говорить не буду)
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Владислав Медведев
универсальный парсер не получится написать. выкусывай контент всех тегов, которые содержат текст (<p>, span, ul , ol, h и тд) и складывай в кучу
Тем более есть ещё открытые теги, и регудярка может сожрать лишнего
источник

НД

Новиков Дмитрий in NLP_RU - Natural Language Processing & Text Mining
Cucusenok
Он парсит xml регулярками, он вообще не понимает что делает. А про то, что это не будет работать с виртуальным домом, я ничего даже говорить не буду)
Где именно я xml парсил, в какой строке?
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Новиков Дмитрий
Где именно я xml парсил, в какой строке?
Ну ты даёшь...
источник

НД

Новиков Дмитрий in NLP_RU - Natural Language Processing & Text Mining
Владислав Медведев
универсальный парсер не получится написать. выкусывай контент всех тегов, которые содержат текст (<p>, span, ul , ol, h и тд) и складывай в кучу
А если в тег текст не обрамлен?
источник

НД

Новиков Дмитрий in NLP_RU - Natural Language Processing & Text Mining
Cucusenok
Ну ты даёшь...
Ну  я забераю супом, потом то в строку перевожу
источник

ВМ

Владислав Медведев in NLP_RU - Natural Language Processing & Text Mining
Новиков Дмитрий
А если в тег текст не обрамлен?
это редкость, тем более если ты парсишь топ. все современные cms контент чаще всего в <p> обрамляют
источник

ВМ

Владислав Медведев in NLP_RU - Natural Language Processing & Text Mining
в общем с сайтами в топе, проблемы редко бывают. к тому же можешь сразу проверять длину текста для спарсенного тега и выкидывать слишком короткие или длинные
источник

НД

Новиков Дмитрий in NLP_RU - Natural Language Processing & Text Mining
Владислав Медведев
в общем с сайтами в топе, проблемы редко бывают. к тому же можешь сразу проверять длину текста для спарсенного тега и выкидывать слишком короткие или длинные
Вот не могу, этот шум тоже иногда нужен. Где я ещё ошибся? Я код тогда свой завтра доработанный скину, вроде работает.
источник

ВМ

Владислав Медведев in NLP_RU - Natural Language Processing & Text Mining
BeautifulSoup можно не использовать. Доставай xpathами
p = response_url.html.xpath('//p/text()')
p = ' '.join(x for x in p)
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Владислав Медведев
BeautifulSoup можно не использовать. Доставай xpathами
p = response_url.html.xpath('//p/text()')
p = ' '.join(x for x in p)
Тогда уж все текстосодержащие
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Но все равно не правильно будет
источник

НД

Новиков Дмитрий in NLP_RU - Natural Language Processing & Text Mining
Владислав Медведев
BeautifulSoup можно не использовать. Доставай xpathами
p = response_url.html.xpath('//p/text()')
p = ' '.join(x for x in p)
P только заставать неправильно, текст может быть в спанах, в списках. Как я и говорил могут быть сайты где текст вообще без. Его размещён.
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Новиков Дмитрий
P только заставать неправильно, текст может быть в спанах, в списках. Как я и говорил могут быть сайты где текст вообще без. Его размещён.
Ало)
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Текст может быть и в дивах
источник

НД

Новиков Дмитрий in NLP_RU - Natural Language Processing & Text Mining
Cucusenok
Текст может быть и в дивах
Именно
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Новиков Дмитрий
Именно
Ты упертый, я говорю, что ты парсишь xml, а ты меня не слышишь
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Во первых, это дерево) и бежать тебе нужно по деревушке
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Обходя каждую ноду
источник