GetQzonehistory实测:QQ空间说说批量导出

📅 2026/8/24 22:09:13
GetQzonehistory实测:QQ空间说说批量导出
GetQzonehistory实测QQ空间说说批量导出【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory翻了很久QQ空间的时间线发现十年前的说说还在你大概也想过把它们全部留下。GetQzonehistory 是一款开源的QQ空间说说导出工具扫码登录后它抓取你的历史互动消息和公开说说写入 Excel并把说说里的图片下载到本地。所有数据处理都发生在你自己的电脑上。它解决了什么问题手动收集十年说说基本不可能QQ空间官方没有批量导出说说的入口。想保存自己的历史发布要么一条条往回翻、手动复制文字再右键保存图片要么干脆截图存档。对几百条说说的账号来说还能忍但对一个从 2012 年活跃到现在的用户这是谁也干不完的苦力活。还有一个不太被注意到的需求数据本身是有结构的。空间消息列表里包含点赞、评论、转发和留言这些是说说的互动痕迹公开主页里拿不到反过来较早的说说和评论明细又只能从公开说说接口获取。单靠任一数据源都覆盖不全。常见场景是换手机号之前、或者打算长时间离开QQ之前想把数字痕迹做一次本地数据归档——这个工具的做法就是把两个数据源接起来合并去重后写入结构化文件。快速上手QQ空间说说导出从零到第一次运行安装与环境准备项目需要 Python 3.7 及以上版本作者自述环境为 3.12README 推荐用虚拟环境隔离依赖避免污染本机git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory进入目录后创建环境并装依赖python -m venv myenv pip install -r requirements.txt激活虚拟环境Windows 用.\myenv\Scripts\activatemacOS/Linux 用source myenv/bin/activate即可开始。注意一个前置依赖pyzbar负责在终端解码登录二维码要求系统先装好zbar共享库——Linux 执行sudo dnf install -y zbarmacOS 通过 Homebrew 安装 zbar。缺了它程序启动时会直接退出并提示对应系统的安装方法。核心操作流程运行python main.py终端直接打印出 ASCII 二维码用手机 QQ 扫码确认程序自动完成登录校验并把会话 Cookie 写入resource/user/目录程序先用二分查找确定空间消息列表的总条数搜索区间为 0 到 1000 万再按每批 10 条拉取消息列表、每批 30 条拉取公开说说每批之间有固定休眠收尾落盘resource/result/QQ号/目录下生成多份 Excel、一个pic/图片目录和一个网页版 HTML 页面终端打印消息总量、最早时间等统计。之后每次再运行python main.py程序会列出缓存过的登录账号让你选择不用重新扫码输入 0 可强制重新登录。仓库里还附带fetch_all_message.py入口可以按需折腾。 核心能力拆解四个关键点1. 双数据源合并去重做什么把互动消息列表和未删除公开说说列表两条线接起来尽量多拿回说说。怎么做消息列表接口用 BeautifulSoup 解析逐条抽取每个li节点公开说说接口直接返回 JSON带图片地址和评论列表两者合并后做内容相似度比对凡内容已被消息列表覆盖的公开说说不再重复计入。效果已删除说说的痕迹由消息列表兜住2014 年以前的老内容由公开接口补齐两个短板互相覆盖。2. 分类 Excel 输出做什么把混在一起的数据拆成六份表。怎么做合并后按条目中是否包含本人昵称以及转发留言等关键词分流拆成说说列表、转发列表、留言列表、其他列表外加全部列表和好友列表每行统一是时间、内容、图片链接、评论四个字段。效果Excel 里的说说列表可以直接筛选排序不用再做二次清洗。3. 图片本地化下载做什么把说说里的图片链接逐张拉下来存成本地文件。怎么做以说说正文命名文件剔除非法字符和表情代码超过 40 字自动截断重名时追加时间戳。效果导出后相册不依赖外链CDN 链接将来失效也不影响。4. 网页版 HTML 还原做什么生成一个浏览器里能直接看的页面。怎么做读取说说和转发两份列表按时间倒序排列QQ 表情代码替换为 img 标签图片地址替换为高清版本!/m/改为!/s/套模板渲染。效果打开文件就能按时间线浏览发朋友圈、分享给家人都方便。⚡ 实测表现速度、完整度与资源占用做完整次 QQ空间说说导出之前先心里有数要等多久。主程序是串行请求、每批固定休眠所以速度可以直接从代码间隔推算出来消息列表每批 10 条固定休眠 8 秒请求内部 5 秒 抓取后 3 秒再加 1-3 秒网络耗时。消息列表规模批次数10条/批预计耗时1000 条约 100 批15-20 分钟3000 条约 300 批45-55 分钟5000 条约 500 批1.5-2.5 小时公开说说每页 30 条、页间只休眠 0.02 秒1000 条一两分钟内完成。中途不想等了直接 CtrlC程序注册了信号处理退出时自动保存已抓取的数据不用从头再来。完整度可以用 Excel 对照两份源列表验证消息列表覆盖互动痕迹公开列表覆盖未删除的公开内容仅自己可见且未出现在消息列表中的说说工具拿不到——这是数据源的边界不是代码缺陷。顺手可以抽查几条最早的时间点确认时间序列连续无断档。资源占用比较克制没有重量级框架几千条数据全部装在一个内存列表里内存占用在几十 MB 量级CPU 多数时间在 sleep 等待不会占满单核去抢其他任务。 与同类方案的取舍分析方案登录方式数据范围输出形态处理位置手动复制/截图无翻到多少算多少截图和零散文字浏览器浏览器插件抓公开主页复用浏览器会话仅公开说说多为链接合集浏览器扩展收费云备份服务需交出密码或令牌公开说说服务商云端存储第三方服务器GetQzonehistory扫码登录不碰密码消息列表 公开说说Excel 本地图片 HTML完全本地取舍很直接换来本地处理 不交密码 结构化输出这三点付出的是时间成本串行请求加固定休眠和只有终端界面这一项。如果只想顺手备份最近两百条公开说说浏览器扩展更快但如果要把十年的数据整理一遍、还要把图片和评论收进 Excel目前开源方案里基本只有这个工具能一次做完。谁适合用、谁不适合用适合活跃超过五年、想把说说归档离身的空间用户想把数据搬进 Excel 做统计分析比如按年份看发布频率、找出评论最多的几条的人对命令行不陌生、还愿意改代码适配自己需求的用户——作者在 README 里明说代码有疏漏欢迎社区完善这反而降低了二次开发心理门槛。不适合期望找回仅自己可见或已彻底删除说说的用户数据源层面就到不了只接受图形界面、不想碰终端的人装不上 zbar 的环境大账号跑一两个小时等不起的人。一个实用提醒Cookie 以明文形式存在resource/user/目录里这个文件夹不要分享给别人也不要上传到任何网盘。写在最后这个工具目前做到了把消息列表 公开说说两条数据源在本地完整处理产物拿来就能用。期待后续版本加上增量导出和进度预估——下次做QQ空间说说导出之前记得先把它跑一遍。【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考