B站评论爬虫完整实操:如何用BilibiliCommentScraper一次拿全上万条评论并断点续爬

📅 2026/8/15 16:16:11
B站评论爬虫完整实操:如何用BilibiliCommentScraper一次拿全上万条评论并断点续爬
B站评论爬虫完整实操如何用BilibiliCommentScraper一次拿全上万条评论并断点续爬【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraperBilibiliCommentScraper是一款开源的B站视频评论爬虫工具专为需要完整、结构化评论数据的内容创作者、运营人员和研究者设计。它能批量采集一级与二级评论、自动断点续爬并把每个视频的结果导出为可直接分析的CSV表格让你告别手动复制与重复登录。一、先看终点一夜过后你手里会多出什么如果你只是想把某个视频的评论存下来那这个工具最吸引人的地方是它的产出非常直接。每个视频一张独立的CSV表。文件以视频ID命名比如爬https://www.bilibili.com/video/BV17M41117eg就会得到BV17M41117eg.csv。表里每一行是一条评论包含9个字段字段含义编号一级评论的顺序号隶属关系这条评论是一级还是二级被评论者昵称 / ID回复的对象一级评论的被评论者显示为up主昵称 / 用户ID评论者本人评论内容完整正文发布时间精确到分钟点赞数受欢迎程度批量是默认能力。你只要把10个、20个视频的链接按行写进video_list.txt剩下的交给程序排队处理每个视频独立成表互不干扰。规模有多大默认滚动45次每次加载约20条一级评论也就是单视频大约能拿到920条一级评论再加上每条一级评论下面的多页二级评论。代码注释里记录过一次实测一个标称7443条评论的视频最终完整取回3581条——远不是那种只有前20条的工具能比的。最省心的点是断点续爬。半夜断电、网络抽风、程序崩溃都不用从头再来。重新运行它从上次中断的位置继续已经写入的CSV也接着追加。二、它的底气为什么敢说完整两个字你可能用过一些简易爬虫抓回来的数据总像被咬掉一口的苹果。原因在于它们走了近路而这个工具选择了一条更笨但更全的路。不用API用浏览器。B站接口对单次请求能返回的评论数量有严格限制而网页端只要你不断向下滚动评论就会持续加载。BilibiliCommentScraper用Selenium驱动真实Chrome浏览器模拟人的滚动操作直到把页面所有可见评论都逼出来再逐一解析。API拿不到的网页滚动能拿到——这就是数据更全的根本原因。尊重评论区真实的树状结构。B站评论区像论坛一级评论直接挂在视频下面二级评论则嵌套在某条一级评论之下。很多工具只抓表面一层对话关系全丢。这个工具是先落一条一级评论再钻进它的二级评论区翻页、逐条提取、写回CSV所以你看数据时能清楚知道谁回复了谁。断点续爬的底层是一本书签。程序每完成一小步就把进度写进同目录下的progress.txt形如{video_count: 1, first_comment_index: 15, sub_page: 114, write_parent: 1}四个字段分别记录第几个视频、该视频第几条一级评论、二级评论翻到了第几页、当前一级评论是否已写入。下次启动读到这本书签直接跳到对应位置继续干活。想从头开始删掉progress.txt即可想跳过某个爬挂了的视频把video_count加1就行。登录一次长期有效。首次运行会弹出浏览器窗口你扫码登录后程序把登录凭证存成cookies.pkl。之后每次运行都自动携带这份凭证无需再登录直到凭证失效再删掉该文件重登一次。三、跟着做半小时跑出第一张评论数据表从零到出数据一共五步每一步都很直接。第一步准备环境。安装Python 3建议3.8及以上和Chrome浏览器然后安装依赖pip install selenium beautifulsoup4 webdriver-manager第二步拿代码。在终端执行git clone https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper cd BilibiliCommentScraper第三步填视频清单。编辑项目根目录的video_list.txt每行一个视频链接https://www.bilibili.com/video/BV17M41117eg https://www.bilibili.com/video/BV1QF411q73H https://www.bilibili.com/video/BV1c14y147g6第四步首次运行并登录。执行python Bilicomment.py程序会打开一个Chrome窗口并跳转到B站。看到提示请登录登录成功跳转后按回车键继续...后扫码登录登录成功回到终端按回车。程序会保存登录凭证然后自动开始滚动、翻页、采集。第五步收结果。完成后每个视频对应一个视频ID.csv被跳过的视频和原因会写进video_errorlist.txt。CSV是UTF-8编码推荐用VS Code或记事本打开如果一定要用Excel选择数据→从文本/CSV导入并指定UTF-8编码即可。四、四个旋钮让采集更快、更稳、更省内存默认配置已经能跑但不同的视频体量需要不同的设置。打开Bilicomment.py你会看到四个关键控制点。旋钮一滚动次数MAX_SCROLL_COUNT默认45。它决定一级评论的采集上限约920条。评论量小的视频45次足够面对超级热门视频如果页面因内存吃紧频繁崩溃可以调小这个值先拿到核心部分。旋钮二二级评论页数max_sub_pages默认150。它限制每条一级评论下二级评论翻页的上限。想无限制就设成None但作者建议保留上限——翻页越多页面内存占用越大设个合理上限能有效防止浏览器崩掉。旋钮三延时time.sleep(2)。每次操作之间留2秒缓冲避免请求过快触发风控。如果你发现程序频繁被冷处理长时间无输出可以加长延时或改成随机延时分散节奏import random time.sleep(random.uniform(1, 5)) # 随机生成1到5秒之间的延时旋钮四内存策略。程序默认开启无头模式、禁用图片加载、使用无痕窗口并在代码目录下建临时缓存目录都是为了压低内存占用。爬取过程中产生的大量临时文件可以放心删除不影响已写入的CSV和进度。五、卡住了按这份清单自查再稳的工具也会遇到环境问题下面五个是最高频的直接对号入座。Q1CSV在Excel里乱码或者单元格显示$NAME?乱码是编码问题用记事本或VS Code打开确认内容正常需要Excel时走从文本/CSV导入选UTF-8。$NAME?是Excel把以-开头的单元格比如昵称-Ghauster当成了公式属正常现象忽略或改成文本格式即可。Q2报错 Permission denied多半是CSV或progress.txt正被其他程序占用——最常见的是你自己用Excel开着它。关掉占用程序或者以管理员身份运行一般就能解决。Q3爬热门视频时浏览器反复崩溃页面加载数据过大导致内存不足。先调小MAX_SCROLL_COUNT和max_sub_pages再清理代码目录下的临时缓存文件。程序本身会在崩溃后自动重启并断点续爬但如果还没滚到底就崩重试多少次都一样必须靠限流参数治本。Q4拿到的数量比B站显示的数字少大概率不是bug。B站存在评论数虚标部分评论会被平台隐藏、屏蔽或删除。验证方法很简单在网页里手动滚到底看最后几条评论是否和CSV末尾一致一致就说明全部可见评论都拿到了。Q5控制台长时间没动静可能是请求太频繁被临时限流也可能要输验证码。直接重启程序它会断点续爬如果频繁发生把延时调长或用随机延时。六、数据到手之后三个立刻能上手的分析玩法采集只是手段数据落地才是目的。CSV是标准格式用pandas就能直接开跑import pandas as pd df pd.read_csv(BV17M41117eg.csv, encodingutf-8) # 总量与结构 print(总评论数:, len(df)) print(一级评论:, (df[隶属关系] 一级评论).sum()) print(二级评论:, (df[隶属关系] 二级评论).sum()) print(平均点赞:, df[点赞数].mean()) # 评论活跃时段 df[发布时间] pd.to_datetime(df[发布时间]) print(df.groupby(df[发布时间].dt.hour).size()) # 高频评论者 print(df[用户ID].value_counts().head(10))基于这些结果三个场景能直接落地给创作者用一级评论的点赞数排序找出观众真正买账的内容按发布时间看评论活跃时段反推最佳投稿时间从二级评论里挖出追问最多的话题那就是下一期选题的方向。给运营与市场对评论内容做关键词频次统计或简单情感判断监控品牌相关视频下的负面声音对比竞品视频的评论总量、互动深度评估内容质量。给研究者用被评论者ID→评论者ID的关系构建互动网络做社群结构分析把发布时间列展开成时间轴追踪某个议题的热度演化过程。七、现在就开跑给新手的最后提醒别一上来就挑战百万播放的热门视频。先用一个评论量小、自己熟悉的视频跑通全流程确认CSV字段、层级关系、断点续爬都符合预期再逐步加大视频列表的规模。从今天开始把复制粘贴评论这种低价值劳动交给程序把精力留给真正重要的事理解你的观众。装上Python、克隆仓库、填入链接然后python Bilicomment.py剩下的交给它。【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考