就是无法抓包这个PDF链接,但是它的类型是xhr不知道为啥抓不了
Author: 123456789TXZCreated Sep 8, 2026Updated Sep 8, 2026
https://www.sheetmusicdirect.com/se/ID_No/321302/Product.aspx
这个链接打开是PDF阅读器,加载完毕会有PDF链接,但是drissionpage的抓包抓不了,我抓了全部,里面也没有
想问一下作者怎么解决
我用了playwright可以抓到,但是不知道原因,求解答,而且也想DrissionPage也能完成这样!!!! from playwright.sync_api import sync_playwright
ID='300605' PRODUCT_URL = f'https://www.sheetmusicdirect.com/se/ID_No/{ID}/Product.aspx' PDF_KEY = 'halleonard-pdf-restricted.s3.amazonaws.com/personalized/'
with sync_playwright() as p: b = p.chromium.connect_over_cdp('http://127.0.0.1:9666') ctx = b.contexts[0] page = None for pg in ctx.pages: page = pg break if page is None: page = ctx.new_page()
pdfs = []
def on_response(resp):
if PDF_KEY in resp.url:
pdfs.append(resp.url)
print('捕获到 PDF:', resp.url)
page.on('response', on_response)
page.goto(PRODUCT_URL, wait_until='networkidle')
page.wait_for_timeout(3000)
if pdfs:
url = pdfs[-1]
print('准备下载:', url)
r = page.request.get(url, timeout=60000)
body = r.body()
with open(f'smd_{ID}.pdf', 'wb') as f:
f.write(body)
print(f'已保存 smd_{ID}.pdf', len(body), 'bytes')
else:
print('未捕获到 personalized PDF 请求')
b.closeSource: g1879/DrissionPage