零基础大众点评数据采集实战:3 步跑通开源爬虫,轻松拿到店铺、评分与评论

📅 2026/8/20 12:38:47
零基础大众点评数据采集实战:3 步跑通开源爬虫,轻松拿到店铺、评分与评论
零基础大众点评数据采集实战3 步跑通开源爬虫轻松拿到店铺、评分与评论【免费下载链接】dianping_spider大众点评爬虫全站可爬解决动态字体加密非OCR。持续更新项目地址: https://gitcode.com/gh_mirrors/di/dianping_spider做餐饮行业分析的朋友大概都有过这样的经历想统计某座城市火锅品类的真实口碑打开大众点评一页页翻、一条条复制一天下来眼酸手痛数据还不完整。有没有更省力的办法dianping_spider就是为解决这个问题而生的开源爬虫项目它专注大众点评数据采集能一次性抓取搜索列表、店铺详情与用户评论三大类信息并自动解决平台最棘手的动态字体加密无需 OCR 识别是目前少见的全站可爬方案。下面我用一个真实的上手流程带你零基础跑通它。一、为什么自己写爬虫的人十有八九栽在字体加密上先讲个背景。大众点评的页面数据并不是所见即所得——页面上的数字、评分、电话很多是用自定义字体文件渲染的。你在浏览器里看到人均 ¥130网页源码里可能是一串乱码符号。传统爬虫拿到这串乱码只能靠截图 人工识别又慢又容易错。dianping_spider 的做法是直接下载页面引用的字体文件用 fontTools 解析字符映射表把乱码还原成真实数字。整个过程是纯代码层面的解密不需要任何 OCR 服务这也是它非 OCR的卖点所在。简单说别人还在用放大镜看密文它已经直接拿到了明文。除了字体解密它还在防封上下足了功夫支持多 Cookie 轮换Cookie 池、IP 代理并内置三档请求节奏控制比如每 1 次请求休息 2 秒到每 10 次休息 50 秒相当于给爬虫装了一套红绿灯系统把触发风控的概率压到最低。二、三分钟快速上手先让第一份数据跑起来上手并不需要懂加密算法。整个过程可以拆成三步准备环境 → 改两个配置文件 → 运行一条命令。第一步拿到项目并安装依赖建议使用 Python 3.7 及以上版本。在终端执行git clone https://gitcode.com/gh_mirrors/di/dianping_spider cd dianping_spider pip install -r requirements.txt如果下载速度慢可以换用清华镜像加速pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple项目依赖只有 lxml、requests、fontTools、pymongo 等几个常见库安装失败的概率很低。第二步改 config.ini告诉爬虫抓什么、在哪抓打开config.ini这是整个系统的指挥中心。新手只需关注三个字段其余 30 多个参数都可以先保持默认参数作用建议keyword搜索关键词如自助餐火锅location_id城市代号上海是 1、北京是 2、成都 8、大连 19完整对照表在docs/location.mdneed_pages抓取几页搜索结果首次测试建议填 1~2 页另外别忘了确认save_mode mongo并保证本机 MongoDB 已启动默认端口 27017。验证方法很简单浏览器打开127.0.0.1:27017能看到一行数据库提示文字就说明配置成功了。第三步改 require.ini决定要不要往下钻require.ini负责选择采集策略。想先拿最有价值的评论数据就把它打开[shop_review] need True more_detail True need_pages 3保存后回到终端运行python main.py看到日志开始滚动就说明爬虫已经在工作了。它会自动完成搜索 → 详情 → 评论的完整链路并把结果写入 MongoDB。三、跑通之后这些参数值得你再花 5 分钟研究config.ini里的参数虽然多但归纳起来只有三类理解了就不会觉得头大1. 身份类参数Cookie、uuid、tcv这三个参数决定你是谁。从浏览器登录大众点评后按 F12 打开开发者工具 → Network → 刷新页面 → 找到任意 XHR 请求就能依次复制到Cookie登录凭证搜索页访问必需uuid和tcv调用平台加密接口的令牌注意 uuid 比 tcv 更关键务必复制完整。获取细节可参考docs/json.md。2. 节奏类参数requests_times它的格式是累计请求次数,休息秒数的分组列表。默认的1,2;3,5;10,50意思是每请求 1 次歇 2 秒每满 3 次歇 5 秒每满 10 次歇 50 秒。频率越温柔账号越安全测试阶段建议保守一点。3. 代理类参数proxy 组use_proxy False表示直连。需要大规模采集时再打开并填入代理提取链接或密钥模式信息docs/proxy.md有详细的格式说明。作者的经验是代理配合加密接口使用效果提升最明显也是目前最接近无人值守的组合。四、这份数据长什么样先看三张真实截图跑完第一次采集你会拿到三类结构化数据。下面用项目里的真实截图说明每一类的价值。① 搜索结果批量摸清一个品类的市场盘子这张表包含了店铺 ID、名称、评论总数、人均价格、标签、地址等字段。想做竞品盘点一个关键词几页下来某座城市的火锅店格局基本就清楚了。② 店铺详情单店的体检报告详情数据比搜索更细地址、电话、营业时间以及口味、环境、服务三个维度的评分。这些字段正是竞品分析和选址研究的常用原料。③ 用户评论最有挖掘空间的金矿每条评论都带有用户打分、评论内容、点赞数、回复数、发布时间等字段。把这些数据批量拿到手做情感分析、好评率统计、热词词云都是现成的素材。如果想看更完整的字段规约哪些字段接口独有、哪些网页独有项目在docs/data.md里有详细说明还有更直观的展示图五、避坑清单这 5 个问题最常让人卡住根据docs/problems.md的记录新手最常遇到的情况基本就这几种提前知道能省下大量排查时间日志出现验证码链接——触发了人机验证。点开链接手动过一下验证即可通常能拖延封禁时间。提示详情页请求被 ban——请求太频繁了。把requests_times调得更保守然后等待解封或者先只跑评论页。提示cookie 失效或被限制访问——先检查 Cookie 是否完整复制浏览器有时会把超长 Cookie 截断成...这是最常见的坑再确认是否过期。一直卡住不动——多半是代理质量差导致响应超长先排除网络问题再看别的。提示评论页字体变更或json 响应码异常——说明平台更新了解析规则属于极少数情况需要关注项目更新或自行适配。六、用之前请记住这三条边界作为开源项目它的定位是学习交流请勿用于商业用途不要未经授权转载。实际使用时也请遵守遵守平台条款控制请求频率不给目标网站造成负担不采集个人敏感信息评论数据仅用于合理的统计分析理解爬虫的脆弱性——平台随时可能升级风控把它当作学习现代反爬技术的样本比当作一劳永逸的数据印钞机更合适。七、进阶路线从能跑到会用第一次跑通后你可以按这个顺序循序渐进定制采集只需要某家店的详情或评论不需要重新全量搜索直接用命令行指定店铺 ID 即可例如python main.py --normal 0 --review 1 --shop_id 店铺ID --need_more False。Cookie 池实战把多个登录 Cookie 逐行放进cookies.txt开启use_cookie_pool True系统会自动轮换降低单个账号被封概率规则见docs/cookie_pool.md。代理规模化需要大量数据时接入 IP 代理配合加密接口跑无人值守模式。数据加工采集到的原始字段可能包含重复或格式不统一的情况建议用 Pandas 做去重、格式标准化再配合 jieba 分词和情感分析把评论变成可量化的洞察。写在最后数据采集不是玄学它是一套配置 节奏 兜底策略的组合工程。dianping_spider 的价值在于把字体加密、防封调度这些硬骨头都提前啃完了把复杂度收敛成了几个配置文件。现在就去 clone 项目、改三个字段、跑一次python main.py——半小时内你大概率就能看到第一份完整的大众点评数据落在 MongoDB 里。先跑通再优化数据采集这条路走起来比想象中快得多。【免费下载链接】dianping_spider大众点评爬虫全站可爬解决动态字体加密非OCR。持续更新项目地址: https://gitcode.com/gh_mirrors/di/dianping_spider创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考