import re import urllib.request req = urllib.request.Request('https://www.zhuig.com/community', headers={'User-Agent': 'Mozilla/5.0', 'Cache-Control': 'no-cache'}) html = urllib.request.urlopen(req, timeout=15).read().decode('utf-8') # 找所有 $N 引用 refs = re.findall(r'\$(\d+)', html) unique_refs = sorted(set(int(r) for r in refs)) print(f'RSC引用编号: {unique_refs}') # 找RSC块边界 (常见的分隔符是 \x00\x00\x00...) # 实际上Next.js RSC使用特殊的script标签 script_blocks = re.findall(r']*>(self\.__next_f\.push.*?)', html, re.DOTALL) print(f'\n script 块: {len(script_blocks)}') # 找 $12 在哪里 idx_12 = html.find('$12') if idx_12 >= 0: print(f'\n$12 在 HTML 位置: {idx_12}') print(f'周围200字符: {html[max(0,idx_12-50):idx_12+200]}') # 找包含"电商零售"的位置 idx_dianshang = html.find('电商零售') print(f'\n"电商零售" 在 HTML 位置: {idx_dianshang}') if idx_dianshang >= 0: print(f'周围200字符: {html[max(0,idx_dianshang-30):idx_dianshang+200]}') # 找包含"平台电商"子板块 idx_pingtai = html.find('平台电商') print(f'\n"平台电商" 在 HTML 位置: {idx_pingtai}') if idx_pingtai >= 0: print(f'周围200字符: {html[max(0,idx_pingtai-100):idx_pingtai+200]}')