from HTMLParser import HTMLParser class MLStripper(HTMLParser): """ 过滤html方法 """ def __init__(self): self.reset() self.fed = [] def handle_data(self, d): self.fed.append(d) def get_data(self): return ''.join(self.fed) def strip_tags(html): """ 过滤html方法实现 """ if html is None: return "" s = MLStripper() s.feed(html) return s.get_data()
本文介绍了一种使用Python实现的HTML过滤方法,通过定义一个名为MLStripper的类继承自HTMLParser,实现了从HTML字符串中提取纯文本的功能。文章详细解释了如何初始化过滤器、处理数据以及获取过滤后的文本。

580

被折叠的 条评论
为什么被折叠?



