scrapy使用xpath的text提取文字内容出现丢失


使用python库scrapy在提取html内容的时候, 如果需要提取的标签中有em一类标签, 这时候使用text进行提取就会出现内容丢失,比如

<a href="http://www.xxxx.xxx" target="_blank"><em>go</em>微架<em>go</em>-<em>micro</em>深度学园</a>

这时候可以考虑手动提取, 或者使用lxml库中的etree

html = etree.HTML(html_text)
title = ''.join(html.xpath('.//text()'))

内容版权声明:除非注明,否则皆为本站原创文章。

转载注明出处:http://www.11000011.com/?id=223

« 上一篇 下一篇 »
«    2026年7月    »
12345
6789101112
13141516171819
20212223242526
2728293031

控制面板

您好,欢迎到访网站!
  查看权限
«    2026年7月    »
12345
6789101112
13141516171819
20212223242526
2728293031

控制面板

您好,欢迎到访网站!
  查看权限
您是本站第11471名访客 今日有0篇新文章