MediaCrawler 自媒体爬虫
基于 Playwright 的多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎的关键词搜索、帖子与评论抓取,无需 JS 逆向即可获取签名参数,并附带 WebUI 可视化界面。
爱鲜报评分
0 人评分
66k
星数
是
中文
Python
主语言
是
活跃
84
贡献者
人工分析
EDITORIAL推荐理由
项目在 GitHub 上已获得 6 万+ Star,是中文爬虫领域少见的「多平台统一采集」方案,覆盖主流内容社区且功能矩阵完整。它用浏览器登录态替代复杂的 JS 逆向,显著降低了上手门槛,同时提供 WebUI、媒体下载、词云等实用能力。对做舆情分析、内容研究、数据挖掘的开发者来说,是一个可直接复用或二次开发的成熟基座。
适用场景
- 社交媒体舆情监测与热点分析
- 学术研究中的平台内容与评论数据采集
- 自媒体运营的选题与爆款内容分析
- 构建评论语料用于 NLP / LLM 训练
- 多平台内容聚合与数据看板开发
优点
- 支持小红书、抖音、快手、B站、微博、贴吧、知乎七大平台,功能矩阵统一
- 基于 Playwright 复用登录态获取签名参数,无需逆向加密算法,门槛低
- 提供 WebUI 可视化界面,参数配置、运行状态与数据导出均可视化操作
- 内置登录态缓存、IP 代理池、二级评论、评论词云等实用能力
- 中文文档与中文注释完善,社区活跃、Star 与 Fork 数量高
缺点
- 项目明确声明仅供学习研究,禁止商业用途,大规模爬取存在法律与合规风险
- 依赖浏览器登录态与平台页面结构,平台改版或风控升级时容易失效
- 默认 CDP 模式需配置本地 Chrome 远程调试,环境准备有一定成本
- 媒体下载为串行执行且未做并发优化,大批量采集效率受限
- 部分高级能力(断点续爬、多账号代理池)仅在 Pro 版本提供
MediaCrawler 是什么
MediaCrawler 是一个基于 Python 的多平台自媒体数据采集工具,支持从小红书、抖音、快手、B站、微博、贴吧、知乎等主流平台抓取公开的帖子、视频与评论数据。项目在 GitHub 上已有 6 万+ Star,是中文社区中知名度很高的爬虫项目之一。
⚠️ 项目作者明确声明:内容仅供学习和研究使用,禁止商业用途,不得用于大规模爬取或侵犯他人权益的行为。使用前请自行评估合规风险。
核心思路
传统爬虫往往需要逆向平台的 JS 加密算法来构造签名参数,工作量大且极易失效。MediaCrawler 换了一条路:
- 使用 Playwright 打开浏览器并完成扫码登录,保留登录态上下文
- 在已登录的浏览器环境中,通过执行 JS 表达式直接拿到平台所需的签名参数
- 从而绕过复杂的加密逆向,把技术门槛降到「会写 Python 就能跑」的程度
默认情况下项目使用 CDP 模式连接你本机已有的 Chrome 浏览器,可以复用浏览器中的登录状态、Cookie 与扩展,进一步降低被风控识别的概率。
功能特性
各平台功能支持情况基本一致:
| 能力 | 说明 |
|---|---|
| 关键词搜索 | 按配置的关键词批量抓取相关帖子 |
| 指定帖子 ID | 精确抓取某条帖子及其评论 |
| 二级评论 | 支持展开评论的回复内容 |
| 指定创作者主页 | 抓取某个账号下的作品 |
| 登录态缓存 | 登录一次后可复用,减少重复扫码 |
| IP 代理池 | 支持配置代理,降低封禁风险 |
| 评论词云图 | 对抓取到的评论生成词云可视化 |
此外还支持媒体文件下载(封面、视频、图文图片),按帖子聚合落盘,B站视频在安装 ffmpeg 后可走 DASH 路径获取更高画质。
快速上手示意
项目推荐使用 uv 管理 Python 环境,同时需要 Node.js(>= 16)支持。典型流程如下:
# 安装依赖(使用 uv)
uv sync
# 按关键词搜索小红书帖子并抓取评论
uv run main.py --platform xhs --lt qrcode --type search
# 按指定帖子 ID 抓取详情
uv run main.py --platform xhs --lt qrcode --type detail
运行后按提示扫码登录即可。具体参数和开关集中在 config/base_config.py 中,文件内有中文注释说明。
WebUI 可视化界面
除了命令行,项目还提供了 Web 可视化操作界面:
- 后端:
uv run uvicorn api.main:app --port 8080 --reload - 前端:进入
webui目录执行npm install && npm run dev
界面中可以可视化配置平台、登录方式、爬取类型等参数,实时查看运行状态与日志,并进行数据预览和导出。
适用人群
- 做舆情监测、热点分析的数据分析人员
- 需要采集社交平台语料的研究者与学生
- 想学习浏览器自动化与爬虫架构的开发者
注意事项
- 平台页面结构变化或风控升级时,爬虫可能失效,需要跟进更新
- 媒体下载为串行执行,大批量采集时效率有限
- 断点续爬、多账号 + IP 代理池等高级能力仅在 Pro 版本提供
- 请务必遵守目标平台的 robots 协议与相关法律法规,控制请求频率
评论
- 暂无评论,来写第一条吧。