Python实现爬取视频-----DY

📅 2026/8/18 9:48:22
Python实现爬取视频-----DY
#安装打开终端输入pip install requests import requests #请求网址 import os #系统操作 import re #正则表达式 #安装打开终端输入pip install DrissionPage from DrissionPage import ChromiumPage,ChromiumOptions #导入自动化 #这里是创建爬取视频保存的文件夹 os.makedirs(videos,exist_okTrue) # 自动化配置打开浏览器 默认谷歌 Chrome_page ChromiumOptions() #实例化函数 Chrome_page.set_browser_path(r这里输入本地浏览器地址不知道的可以右键浏览器应用打开文件管理器查看属性里面有文件地址记得加上浏览器文件名因为文件地址不包含文件名) #配置本地浏览器地址 page ChromiumPage(cg) # 开始爬取 # 设置监听数据包参数是请求地址标识在请求标头里找一个不一样的请求标识每个请求标识里都会有一个独特的请求标识多试几个网页就会发现同一个网站里的请求标头都会一样只有一部分不一样我们要的就是这个 page.listen.start(/aweme/post/) # 爬取网址 page.get(https://www.douyin.com/user/MS4wLjABAAAAjP3_W4XxRu8zRpifUZAs1Kmazx1s0NsDODk_9IhWMoJXq4beRo0y8cPDgjIcPXMe?from_tab_namemainvid7666789798006464229) # 等待监听数据包 sjbpage.listen.wait() # 创建对象接受数据 jason sjb.response.body # 在网址中按F12点击网络。随便点击一个就可以看到有个标头把里面的数据复制 headers {user-agent:, cookie:, referer:} # response requests.get(url,headersheaders) # if response.status_code 200: # print(jason) # 获取数据包中的视频数据 data jason[aweme_list] # print(data) # 用for循环遍历下载数据包中的全部数据 for i in data: # 视频地址 video_url i[video][play_addr][url_list][0] # 请求获取视频地址内容 response requests.get(video_url,headersheaders).content # 视频标题 title_video i[desc] # 文件命名不能有的标识符正则表达式的sub函数去除具体的可以去浏览器中搜索哪些不能用复制在第一位参数中第二个是替换将标点符号替换为”“第三个是文件名 title_rere.sub([/*\ |。],,title_video) # 用open函数打开命名好文件格式 with open(videos\\title_re.mp4, wb) as f: # 写入 f.write(response)