import re with open('/tmp/comm.html', encoding='utf-8') as f: html = f.read() # 查找板块名 names = re.findall(r'>([^<>]{2,15})', html) keywords = ['赚钱', '副业', '电商', 'AI', '金融', '房产', '餐饮', '健康', '教育', '内容', '本地', '跨境', '求职'] for n in names: if any(k in n for k in keywords) and len(n) < 20: print(repr(n))