import re import urllib.request req = urllib.request.Request('https://www.zhuig.com/community', headers={'User-Agent': 'Mozilla/5.0', 'Cache-Control': 'no-cache'}) html = urllib.request.urlopen(req, timeout=15).read().decode('utf-8') print(f'HTML total: {len(html)} bytes') a_tags = len(re.findall(r' 标签: {a_tags}') h2 = len(re.findall(r': {h2}

: {h3}') # 找字面平台电商 m = re.search(r']*>[^<]*平台电商[^<]*

', html) print(f'字面<平台电商> HTML: {bool(m)}') # 板块区域 idx_q = html.find('全部板块') idx_z = html.find('最新话题') section = html[idx_q:idx_z] if idx_z > 0 else html[idx_q:idx_q+15000] print(f'板块区域长度: {len(section)}') a_pat = r' 数量: {h3_count}') # 找板块标题h2 m2 = re.search(r']*>全部板块', section) print(f'板块标题 h2 全部板块 存在: {bool(m2)}') # 看section的前500字符 print(f'\n板块区域前800字符:') print(section[:800])