这个B站评论爬虫,凭什么能拿全别人拿不到的评论?

📅 2026/8/13 17:20:21
这个B站评论爬虫,凭什么能拿全别人拿不到的评论?
这个B站评论爬虫凭什么能拿全别人拿不到的评论【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper凌晨一点小林盯着评论区标着1.2万的热门视频翻来覆去却只看到那二三十条评论急得直挠头。作为刚起步的UP主他想分析观众到底在讨论什么可无论怎么刷新、滚动深层的评论就是不出来。如果你也曾对着B站评论区干瞪眼那接下来的这个开源工具值得你花三分钟看完。它到底是什么一句话说清楚BilibiliCommentScraper 是一个开源的B站评论爬虫你只要把视频链接写进一个文本文件运行一条命令它就能把评论区所有可见的一级评论和二级评论连同昵称、用户ID、发布时间、点赞数一起批量导出成结构清晰的CSV表格。它帮的是谁想分析评论的UP主、做论文的研究生、盯竞品的运营——所有不想再手动复制评论的人。为什么要用它先看看你现在的处境在动手之前不妨先做个对比看看你熟悉的土办法和它到底差在哪对比维度传统手动方式BilibiliCommentScraper数据完整性页面只加载前面二三十条深层评论永远看不到自动向下滚动加载全部可见评论一级二级都抓层级关系一堆回复混在一起分不清谁回复了谁每条数据标注一级评论/二级评论隶属关系一目了然批量能力一个视频复制粘贴一小时多个视频直接崩溃一个清单文件放多个链接逐个视频自动输出独立CSV中途中断断网、关机一切从零再来进度实时存档随时关闭、随时接着跑突发状况网络一抖就白等盯着屏幕不敢走开自动重试失败的视频单独记进错误清单看到差距了吗手动收集的问题从来不是慢而是永远拿不全。而这件事恰恰是这个工具最擅长解决的。实战走通三步从零拿到完整评论别被爬虫两个字吓到实际用起来跟在记事本里写字一样简单。第一步把环境搭好一行命令确保电脑上装了 Python 3然后打开命令行粘贴这一行pip install selenium beautifulsoup4 webdriver-manager装完之后就完事了。你没看错不需要手动配置浏览器驱动——工具会自动帮你搞定 Chrome 驱动这也是新手最容易卡住的环节它帮你省了。第二步把视频链接写进清单文件在项目文件夹里找到video_list.txt每行放一个你想爬的视频链接https://www.bilibili.com/video/BV17M41117eg https://www.bilibili.com/video/BV1QF411q73H想爬几个就放几行它会对每个视频分别输出一个以视频ID命名的CSV文件互不干扰。第三步运行然后扫码登录一次python Bilicomment.py第一次运行时会弹出浏览器让你登录B站登录成功跳转后回到命令行按一下回车程序就会把登录状态存进cookies.pkl。从此以后再运行就不用重复登录了。接下来你要做的只有一件事等。它会自己滚动页面、翻页、抓数据、写表格遇到网络波动还会自动重试——你甚至可以让它爬一整晚早上起来收成果。第四步看结果每个视频爬完后同级目录下会多出一个CSV文件打开就是整齐的表格每行一条评论包含编号、隶属关系、被评论者昵称和ID、评论者昵称和用户ID、评论内容、发布时间、点赞数这9个字段像上图这样同一视频下的几百上千条评论谁回复了谁、谁被点赞最多一眼就能看明白。有人实测默认参数下就能完整爬取标称7443条评论的视频实际抓回3581条数据耗时只需要安心等一会儿。避坑指南新手最容易踩的四个坑用任何工具都会遇到坑提前知道这些能帮你少走不少弯路。Q1用Excel打开CSV全是乱码怎么办文件是UTF-8编码的Excel默认可能猜错。别慌用记事本打开看是否正常或者在Excel里走数据 → 从文本/CSV导入手动选UTF-8编码。用Python的pandas直接读也是顺手的办法。Q2爬到的评论数比页面标称的少是不是漏了大概率不是。B站存在评论数虚标部分评论被隐藏、删除或屏蔽。判断标准很简单你在网页里手动往下滑看到的最后几条评论和CSV里最后几条对得上就说明全部可见评论都抓完了。Q3Excel里有些单元格显示$NAME?是什么鬼这不是程序出错而是有些用户的昵称以-开头比如-GhausterExcel把它误当成了公式。单元格本身没问题正常读取数据即可不影响分析。Q4运行时报Permission denied怎么办多半是CSV文件或progress.txt被别的程序占用了——比如你自己正用Excel开着它。关掉占用程序或者以管理员身份运行代码基本都能解决。另外提醒一句如果程序长时间没动静别干等直接重启它。它有断点续爬的能力会从上次存下的progress.txt进度继续不会白跑。进阶玩法让爬虫按你的节奏工作跑通基础流程后这几个小开关能让你更得心应手。控制爬取量。在Bilicomment.py里能找到MAX_SCROLL_COUNT 45默认45次滚动预计最多抓到920条一级评论。评论量特别大的视频可以调小这个值避免页面因内存占用过大崩溃。限制二级评论翻页数。max_sub_pages 150控制每条一级评论下二级评论的最大翻页数想彻底放开把它改成max_sub_pages None即可。给个上限更稳妥省内存、防崩溃。加随机延时温柔一点。如果频繁被B站冷处理可以在代码里加两行让请求间隔随机化import random time.sleep(random.uniform(1, 5))手动控制进度。想跳过某个视频直接改progress.txt把video_count加1就行。想重新爬删除progress.txt一切从头开始。这个文件的含义README里有详细说明几秒钟就能看懂。从一个链接开始回到开头那个问题为什么你总是拿不到完整的B站评论答案其实很简单——不是数据不存在而是缺少一个靠谱的工具。BilibiliCommentScraper用最朴素的方式解决了这个问题不依赖官方接口、不遗漏二级评论、不怕中途断网、不需要反复登录把收集评论这件事从体力活变成了一个命令的事。想动手试试的话把它克隆到本地git clone https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper.git cd BilibiliCommentScraper pip install selenium beautifulsoup4 webdriver-manager然后按上面的三步走今晚你就能拿到人生第一份完整的评论数据。用完如果觉得顺手欢迎给项目点个Star遇到问题也可以去项目的Issues里聊聊你的使用场景。数据就在那里就差你迈出第一步了。【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考