四步玩转 MediaCrawler-new:一文搞定小红书、抖音、快手、B站、微博五大平台数据采集

📅 2026/8/20 21:59:19
四步玩转 MediaCrawler-new:一文搞定小红书、抖音、快手、B站、微博五大平台数据采集
四步玩转 MediaCrawler-new一文搞定小红书、抖音、快手、B站、微博五大平台数据采集【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new想批量拿到小红书、抖音、快手、B站、微博的笔记、视频、评论和互动数据MediaCrawler-new 是一个基于 Playwright 的开源采集框架用真实浏览器模拟真人操作来绕开平台反爬专为运营、开发者和研究人员设计。你不需要懂逆向、不需要手写加密算法跟着下面四步走就能跑通一套属于自己的多平台采集管线。第一幕还在被这几件事折磨吗先对号入座看看下面有没有你的影子。手工党的日常运营同学需要分析竞品笔记一页页复制标题、点赞数、评论内容到 Excel。一天下来眼睛花了表格还错了几行。逆向党的深夜开发者想写爬虫结果发现平台接口的参数被加密包裹光分析 Sign 签名就熬了几个通宵代码没写几行头发掉了一把。老手也翻车好不容易写通了脚本跑了半小时就触发风控IP 被拉黑账号被限制之前的工作全部作废。MediaCrawler-new 正是冲着这三类痛点来的它借用 Playwright 维持一个活着的浏览器上下文通过执行 JS 拿到加密参数绕开了逆向加密算法的地狱级难度同时内置登录态缓存与代理 IP 池把被封号的风险压到最低。✅ 一套框架覆盖五大平台xhs、dy、ks、bili、wb✅ 三种登录方式自由切换二维码、手机号、Cookie✅ 四种采集模式关键词搜索、指定 ID、创作者主页、B 站视频下载✅ 三种存储出口JSON、CSV、关系型数据库✅ 代理 IP 池 登录态缓存长跑采集更稳第二幕三分钟让第一个采集任务跑起来上手路径很短你只需做三件事。第一步搭好运行环境打开终端依次执行# 拉取项目代码 git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler-new cd MediaCrawler-new # 创建并激活虚拟环境 python -m venv venv source venv/bin/activate # 安装依赖库和浏览器内核 pip install -r requirements.txt playwright install为什么这样做虚拟环境把项目依赖和系统隔离避免版本打架playwright install会下载 Chromium 内核它是后面模拟真人浏览的地基。如果中途报缺少 nodejs 环境安装 Node.js v16.8.0 及以上版本即可。第二步改两行配置打开config/base_config.py核心就这几项PLATFORM xhs # 目标平台xhs | dy | ks | bili | wb KEYWORDS python,数据分析 # 要搜索的关键词 LOGIN_TYPE qrcode # 登录方式qrcode | phone | cookie CRAWLER_TYPE search # 采集类型search | detail | creator SAVE_DATA_OPTION json # 保存方式csv | db | json为什么这样做所有开关都收敛在一个文件里改配置不用动代码换平台、换关键词、换存储方式都是一行的事。第三步运行并扫码python main.py --platform xhs --lt qrcode --type search浏览器会自动弹出二维码用手机小红书 App 扫码登录程序随即开始按关键词采集。登录一次之后登录态会被缓存下来下次启动直接进入采集不用再扫。第三幕把它的隐藏实力逐层拆开跑通第一条命令只是开始下面这些能力才是它真正值钱的地方。登录三件套总有一种适合你二维码登录最省心手机一扫完事适合首次配置。手机号登录配合短信转发工具验证码自动回填进浏览器适合长期无人值守的采集任务。Cookie 登录把已有的登录凭证直接填入COOKIES配置秒级恢复会话。三种方式背后都有SAVE_LOGIN_STATE登录态缓存兜底中间断了也不怕重跑一次就能接着采。四种采集模式覆盖九成需求模式作用典型场景search按关键词抓取帖子/视频分析某个话题的热度detail按指定 ID 抓取单条内容精确获取某篇爆款的全维度数据creator抓取创作者主页全部作品拆解头部账号的内容节奏video_download批量下载视频当前支持 B 站本地留档与二次剪辑在config/base_config.py里填好XHS_SPECIFIED_ID_LIST、DY_SPECIFIED_ID_LIST、BILI_SPECIFIED_ID_LIST这类 ID 列表就能批量定点采集指定内容。存储自由选文件、库都行json结构化输出方便程序二次处理落在data/目录。csvExcel 直接打开给不会写代码的同事看刚刚好。db在config/db_config.py里把RELATION_DB_URL指向 MySQL、PostgreSQL 或 SQLite数据量大时查询分析更顺手。代理 IP 池长跑采集的护身符大规模采集最怕 IP 被封。开启ENABLE_IP_PROXY True后系统会从代理服务商拉取 IP存入 Redis 维护有效期动态构建代理池供爬虫轮换使用MediaCrawler-new代理IP池管理流程图你只需要三步在代理平台生成提取链接、把链接里的key和crypto写入环境变量、再把ENABLE_IP_PROXY置为 True。池子大小由IP_PROXY_POOL_COUNT控制轻度使用 2~3 个就够重度使用可以开到 10 个以上。模块化架构想加新平台不慌项目目录按职责切分结构一目了然MediaCrawler-new/ ├── base/ # 爬虫抽象基类统一接口规范 ├── media_platform/ # 五大平台实现各自独立 ├── proxy/ # 代理 IP 池管理 ├── store/ # 数据存储实现 ├── tools/ # 滑块、时间、工具函数 └── config/ # 全部开关集中在此每个平台都在media_platform/下自成一体客户端、核心逻辑、登录、字段定义各归其位。想接入新平台照着现有模块的接口实现即可扩展成本很低——这正是一次配置多端复用的底气来源。第四幕它能帮谁能帮到什么程度场景一电商运营做竞品拆解你是美妆类目运营想知道竞品在小红书的爆款逻辑。把KEYWORDS设为粉底液,遮瑕膏,口红开启评论采集ENABLE_GET_COMMENTS True跑一轮 search 模式。你会得到竞品的标题、互动数据和用户评论照着这个清单就能反推选题方向与卖点话术。场景二创作者追踪头部账号你是短视频作者想学习同赛道的头部账号。把创作者 ID 填入XHS_CREATOR_ID_LIST切到 creator 模式就能批量拿到对方主页的作品列表分析发布时间规律与内容风格再结合 B 站的 video_download 模式把参考视频存到本地慢慢研究。场景三学生与分析师做舆情研究你需要验证某个社会话题的讨论热度这类假设。用 search 模式按时间窗口抓取公开内容以 JSON 落盘再用 Pandas 做统计。全程公开数据、低频请求适合学术场景的轻量研究。常见问题速查报错execjs._exceptions.ProgramError: SyntaxError: 缺少 ;——原因缺少 nodejs 环境。解法安装 Node.js v16.8.0 及以上版本。爬着爬着突然采不到数据了——原因账号触发平台风控。解法降低并发与频率开启代理 IP 池切勿大规模采集。想换一个登录账号——原因浏览器缓存里存着旧登录态。解法删除项目根目录下的browser_data/目录重新扫码登录。写在最后把工具用好也要用得对MediaCrawler-new 的价值在于把平台数据采集这件事从逆向攻坚降级为配置即用。但请记住它的边界它适合学习、研究与合规的市场分析不适合对平台做大规模抓取或商用。请遵守各平台的使用条款只采集公开数据尊重用户隐私控制请求频率——技术是杠杆方向得你自己把握。现在就可以动手① clone 项目 ② 配好虚拟环境 ③ 改base_config.py里的平台与关键词 ④ 跑第一条命令扫码登录。十分钟后你的第一份结构化数据就躺在data/目录里了。【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考