MEMediaCrawler

MediaCrawler

开源的中文自媒体爬虫框架,一套代码覆盖小红书、抖音、快手、B站、微博、贴吧、知乎7大平台,用 Playwright 驱动真实浏览器,免去手写加密签名逆向。

7.8k 收藏AI编程开发research免费起价 Free
输入TTextUURL
输出📊DataCCSVJJSON
更新于: 2026-09-13 NanmiCoder
下载 / 访问
网页版 ↗
Windows ↗
Mac ↗
iPhone/iPad ↗
安卓 ↗
华为 暂不支持
Linux ↗
github.com/NanmiCoder/MediaCrawler
MEMediaCrawler
MediaCrawler
开源的中文自媒体爬虫框架,一套代码覆盖小红书、抖音、快手、B站、微博、贴吧、知乎7大平台,用 Playwright 驱动真实浏览器,免去手写加密签名逆向。
立即开始了解更多

立即试用

GPT-4o
完整Playground →

什么是 MediaCrawler?

MediaCrawler(作者 NanmiCoder,GitHub 约6万 star)是国内使用极广的自媒体数据采集框架,覆盖小红书、抖音、快手、B站、微博、百度贴吧、知乎7大平台,可采集笔记/视频/帖子、评论(含二级评论回复)、创作者主页内容与搜索结果。它不手工逆向各平台加密签名,而是用 Playwright 驱动真实浏览器、保留登录上下文(扫码或Cookie登录并缓存复用),通过执行JS表达式获取加密参数,大幅降低逆向门槛。各平台普遍支持关键词搜索、按帖子/视频ID采集、创作者主页采集、登录态缓存、IP代理池、评论词云图,结果可存为 CSV/JSON 或 MySQL/PostgreSQL/SQLite。环境建议 Python 3.11(推荐 uv 管理依赖)、部分平台需 Node.js 16+ 并安装 Playwright 浏览器。项目仅面向公开数据的学习与研究,商用需单独授权,使用时须遵守各平台条款、数据合规法律与账号安全规则。

4.4
评分
免费
定价模式
4+
平台
7.8k
收藏

优点

  • 一套统一代码打通7大中文平台。
  • Playwright方案免去艰难的签名逆向。
  • 模式丰富:搜索/ID/创作者/多级评论。
  • 存储灵活,从文件到关系型数据库都行。
  • 社区庞大、教程资料丰富。

缺点

  • 需搭建Python3.11+Node.js+Playwright环境。
  • 必须登录,采集过猛有账号风控/封号风险。
  • 只能采公开数据,平台条款与法律责任在使用者。
  • 开源限学习研究,商用需另行授权。

多维度评分

4.4/ 5.0
功能完整性
3.9
🚀
性能速度
4.5
易用性
4.0
💰
性价比
4.6
🎧
客户支持
4.6
🔒
隐私安全
4.6

核心能力

IDE插件
Git集成
代码审查

同类工具对比

功能MediaCrawlerSemantic KernelWarpVercel AI SDK
评分4.44.84.84.8
定价模式免费免费免费免费
起价FreeFreeFreeFree
API
免费版
移动端
查看完整对比 →

适用人群

竞品监控

跨平台追踪对手笔记、视频与互动数据。

舆情公关

采集公开评论、做词云与舆情分析。

内容选题

挖掘热门话题与爆款,辅助选题。

学术研究

采集公开社交数据做传播/市场研究。

工程学习

学习浏览器自动化与反爬签名原理。

开发者
NanmiCoder
支持平台
网页版 ↗
Windows ↗
Mac ↗
iPhone/iPad ↗
安卓 ↗
华为 暂不支持
Linux ↗
支持语言
中文, Python
更新于
2026-09-13
公司信息
5000+ 员工

常见问题

小红书、抖音、快手、B站、微博、百度贴吧、知乎。