Instagram 数据爬取实操:用 instagram-profilecrawl 抓取粉丝数、标签与点赞数据

📅 2026/8/27 16:34:00
Instagram 数据爬取实操:用 instagram-profilecrawl 抓取粉丝数、标签与点赞数据
Instagram 数据爬取实操用 instagram-profilecrawl 抓取粉丝数、标签与点赞数据【免费下载链接】instagram-profilecrawl quickly crawl the information (e.g. followers, tags etc...) of an instagram profile.项目地址: https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl本文带你看一次完整的 Instagram 数据爬取用 instagram-profilecrawl一个开源的 Python 主页爬虫把任意公开账号的粉丝数、帖子标签、点赞评论抓成一份结构化 JSON 文件再让它每天凌晨自动跑持续产出增长记录。全文命令均可直接复制执行。instagram-profilecrawl 能做什么输入账号名产出结构化 JSONinstagram-profilecrawl 基于 Selenium 驱动真实浏览器访问 Instagram 主页你在命令行报一个或多个账号名它滚动加载帖子把资料、标签、点赞、评论写成本地文件。不申请官方 API、不强制登录即可拿到公开数据适合做竞品监测、话题标签统计、账号增长追踪。整条链路如下环境准备装好依赖放对浏览器驱动跑完这一节项目就能启动。一共两件事Python 依赖和浏览器驱动。先克隆仓库并安装依赖selenium、requests 等都在里面git clone https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl cd instagram-profilecrawl pip install -r requirements.txt爬虫靠 ChromedriverChrome 的自动化控制程序操控浏览器去 Chromedriver 官方下载页取与你 Chrome 版本匹配的驱动放进项目的 assets/ 目录文件名写 chromedriver_linux其他系统换对应平台名。util/settings.py 会按这个路径自动加载不需要额外配置。五分钟跑通第一条爬虫命令执行下面这条命令几分钟后你会在 profiles 目录里看到第一个带时间戳的 JSON 文件。python3 crawl_profile.py instagram命令结束时会打印提示告诉你在 profiles 目录下生成了 json 文件和评论者名单。同一目录还有instagram_commenters_时间戳.txt按评论频率排序列出所有在帖子下评论过的用户名。一次报多个账号也支持直接把名字跟在后面空格隔开即可。看懂产出profiles 目录里每个字段代表什么这份 JSON 是你后续所有分析的数据来源先把字段含义过一遍用编辑器打开instagram_时间戳.json对照看。字段含义followers / following粉丝数 / 关注数num_of_posts帖子总数alias / bio主页显示名与个人简介posts[].caption帖子配文posts[].tags帖子话题标签带 # 前缀的列表posts[].likes / comments该帖点赞数与评论明细posts[].date / location发布时间与地理位置posts[].img帖子图片链接这些字段够你做任何离线分析把 tags 汇总起来就能看一个账号的高频话题按 likes 排序能找到爆款帖followers 随时间的变化则是下一条定时任务要解决的问题。想把图片也存到本地跑一句python3 extract_image.py profiles图片会落到 images/账号名/ 目录。按场景调优只改一个参数解决一个问题所有开关集中在 util/settings.py 的 Settings 类里改它不用动主逻辑。下面每个小节对应一个常见场景。弱网环境下的防中断配置如果你的网络不稳、爬取经常中途卡死把滚动间隔调大即可# util/settings.py默认 14.5 Settings.sleep_time_between_post_scroll 25保存后重新运行命令生效评论加载慢的话再单独调大sleep_time_between_comment_loading默认 1.5 秒。小账号控制爬取规模小号没有上千篇帖子把分析上限调小能省掉大量等待# util/settings.py默认 1000 Settings.limit_amount 200值越小跑得越快按你的分析深度取舍。登录账号后解锁私密数据想看已关注的私密账号、或抓取关注者列表需要先登录。把账号写入 .envutil/settings.py 启动时会自动读取它IG_USERNAME你的账号 IG_PASSWORD你的密码再把Settings.scrape_follower True打开。建议用小号操作频率别太高免得影响主账号。让采集任务每天凌晨自动跑用 crontabLinux 自带的定时任务工具把爬虫挂到凌晨机器无需常驻运行crontab -e加入这一行保存退出每天 3 点自动执行并把日志追加到 crawl_log.txt0 3 * * * cd /data/web/disk1/git_repo/gh_mirrors/inst/instagram-profilecrawl python3 crawl_profile.py grossertim crawl_log.txt 21没有图形界面的树莓派、旧服务器也能跑装 Firefox 和虚拟显示换用仓库里的 quickstart_templates/crawl_profile_pi.pysudo apt-get install firefox-esr sudo pip3 install pyvirtualdisplay python3 quickstart_templates/crawl_profile_pi.py grossertim完整案例每天自动记录一个账号的增长下面这套组合可整体照抄以账号 grossertim 为例每天 3 点抓主页数据3 点 05 分把指标追加进 stats.csv。首次准备克隆仓库、装依赖、放好驱动环境准备一节已覆盖。手动验证一次确认能出 JSONpython3 crawl_profile.py grossertim编辑 crontab挂两条任务统计任务比爬取晚几分钟保证 JSON 已生成0 3 * * * cd /data/web/disk1/git_repo/gh_mirrors/inst/instagram-profilecrawl python3 crawl_profile.py grossertim crawl_log.txt 21 5 3 * * * cd /data/web/disk1/git_repo/gh_mirrors/inst/instagram-profilecrawl python3 log_stats.py -u grossertim stats_log.txt 21观察产出stats.csv 每行包含时间戳、用户名、粉丝数、关注数、帖子数、总点赞、总评论log_stats.py 汇总完会把对应 JSON 移进 profiles/done 目录避免重复计数。跑一周后打开 stats.csv 就能画出粉丝增长曲线。故障速查四类高频问题现象原因处理启动即崩提示找不到 chromedriver驱动缺失或与 Chrome 版本不匹配下载匹配版本放进 assets/命名 chromedriver_linux爬取中途卡死或超时滚动间隔过短或网络不稳把 sleep_time_between_post_scroll 从 14.5 提到 25 以上私密账号抓不到数据未登录或登录账号未关注该目标填好 .env并让登录账号先关注目标无桌面设备浏览器起不来缺 Firefox 与虚拟显示支持装 firefox-esr 和 pyvirtualdisplay改用 crawl_profile_pi.py下一步两个可直接执行的方向进阶配置打开Settings.output_comments True把评论明细也存进 JSON想要点赞用户名单则开Settings.scrape_posts_likers True注意它一次只加载 12 人大账号会很慢。把 tags 字段喂给 WordCloud 类库还能生成一张话题词云。延伸阅读想改抓取逻辑从 util/extractor.py 和 util/extractor_posts.py 读起前者负责主页资料后者负责帖子解析quickstart_templates/ 下的模板则展示了如何在自己的脚本里组装这套抓取流程。【免费下载链接】instagram-profilecrawl quickly crawl the information (e.g. followers, tags etc...) of an instagram profile.项目地址: https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考