问题库 Python how-to

Python 如何解析 HTML

快速答案

用 BeautifulSoup 解析 DOM,再用 select 提取目标元素。

py
from bs4 import BeautifulSoup
soup = BeautifulSoup(html, 'html.parser')
titles = [a.get_text(strip=True) for a in soup.select('h2 a')]

使用要点

  • 先用一小份测试数据跑通,再处理完整目录或正式数据。
  • 把路径、编码和输出文件名提到变量里,便于复用和排查。

相关内容