AX 爱鲜报

MediaCrawler 自媒体爬虫

基于 Playwright 的多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎的关键词搜索、帖子与评论抓取,无需 JS 逆向即可获取签名参数,并附带 WebUI 可视化界面。

爱鲜报评分

0.0

0 人评分

66k

星数

是

中文

Python

主语言

是

活跃

84

贡献者

人工分析

EDITORIAL

推荐理由

项目在 GitHub 上已获得 6 万+ Star,是中文爬虫领域少见的「多平台统一采集」方案,覆盖主流内容社区且功能矩阵完整。它用浏览器登录态替代复杂的 JS 逆向,显著降低了上手门槛,同时提供 WebUI、媒体下载、词云等实用能力。对做舆情分析、内容研究、数据挖掘的开发者来说,是一个可直接复用或二次开发的成熟基座。

适用场景

  • 社交媒体舆情监测与热点分析
  • 学术研究中的平台内容与评论数据采集
  • 自媒体运营的选题与爆款内容分析
  • 构建评论语料用于 NLP / LLM 训练
  • 多平台内容聚合与数据看板开发

优点

  • 支持小红书、抖音、快手、B站、微博、贴吧、知乎七大平台,功能矩阵统一
  • 基于 Playwright 复用登录态获取签名参数,无需逆向加密算法,门槛低
  • 提供 WebUI 可视化界面,参数配置、运行状态与数据导出均可视化操作
  • 内置登录态缓存、IP 代理池、二级评论、评论词云等实用能力
  • 中文文档与中文注释完善,社区活跃、Star 与 Fork 数量高

缺点

  • 项目明确声明仅供学习研究,禁止商业用途,大规模爬取存在法律与合规风险
  • 依赖浏览器登录态与平台页面结构,平台改版或风控升级时容易失效
  • 默认 CDP 模式需配置本地 Chrome 远程调试,环境准备有一定成本
  • 媒体下载为串行执行且未做并发优化,大批量采集效率受限
  • 部分高级能力(断点续爬、多账号代理池)仅在 Pro 版本提供
上手难度 进阶

MediaCrawler 是什么

MediaCrawler 是一个基于 Python 的多平台自媒体数据采集工具,支持从小红书、抖音、快手、B站、微博、贴吧、知乎等主流平台抓取公开的帖子、视频与评论数据。项目在 GitHub 上已有 6 万+ Star,是中文社区中知名度很高的爬虫项目之一。

⚠️ 项目作者明确声明:内容仅供学习和研究使用,禁止商业用途,不得用于大规模爬取或侵犯他人权益的行为。使用前请自行评估合规风险。

核心思路

传统爬虫往往需要逆向平台的 JS 加密算法来构造签名参数,工作量大且极易失效。MediaCrawler 换了一条路:

  • 使用 Playwright 打开浏览器并完成扫码登录,保留登录态上下文
  • 在已登录的浏览器环境中,通过执行 JS 表达式直接拿到平台所需的签名参数
  • 从而绕过复杂的加密逆向,把技术门槛降到「会写 Python 就能跑」的程度

默认情况下项目使用 CDP 模式连接你本机已有的 Chrome 浏览器,可以复用浏览器中的登录状态、Cookie 与扩展,进一步降低被风控识别的概率。

功能特性

各平台功能支持情况基本一致:

能力 说明
关键词搜索 按配置的关键词批量抓取相关帖子
指定帖子 ID 精确抓取某条帖子及其评论
二级评论 支持展开评论的回复内容
指定创作者主页 抓取某个账号下的作品
登录态缓存 登录一次后可复用,减少重复扫码
IP 代理池 支持配置代理,降低封禁风险
评论词云图 对抓取到的评论生成词云可视化

此外还支持媒体文件下载(封面、视频、图文图片),按帖子聚合落盘,B站视频在安装 ffmpeg 后可走 DASH 路径获取更高画质。

快速上手示意

项目推荐使用 uv 管理 Python 环境,同时需要 Node.js(>= 16)支持。典型流程如下:

# 安装依赖(使用 uv)
uv sync

# 按关键词搜索小红书帖子并抓取评论
uv run main.py --platform xhs --lt qrcode --type search

# 按指定帖子 ID 抓取详情
uv run main.py --platform xhs --lt qrcode --type detail

运行后按提示扫码登录即可。具体参数和开关集中在 config/base_config.py 中,文件内有中文注释说明。

WebUI 可视化界面

除了命令行,项目还提供了 Web 可视化操作界面:

  • 后端:uv run uvicorn api.main:app --port 8080 --reload
  • 前端:进入 webui 目录执行 npm install && npm run dev

界面中可以可视化配置平台、登录方式、爬取类型等参数,实时查看运行状态与日志,并进行数据预览和导出。

适用人群

  • 做舆情监测、热点分析的数据分析人员
  • 需要采集社交平台语料的研究者与学生
  • 想学习浏览器自动化与爬虫架构的开发者

注意事项

  • 平台页面结构变化或风控升级时,爬虫可能失效,需要跟进更新
  • 媒体下载为串行执行,大批量采集时效率有限
  • 断点续爬、多账号 + IP 代理池等高级能力仅在 Pro 版本提供
  • 请务必遵守目标平台的 robots 协议与相关法律法规,控制请求频率

评论

登录后才可评论与评分

0 条评论

  • 暂无评论,来写第一条吧。