github.com/NanmiCoder/MediaCrawler
ME
MediaCrawler
开源的中文自媒体爬虫框架,一套代码覆盖小红书、抖音、快手、B站、微博、贴吧、知乎7大平台,用 Playwright 驱动真实浏览器,免去手写加密签名逆向。
立即开始了解更多
立即试用
GPT-4o什么是 MediaCrawler?
MediaCrawler(作者 NanmiCoder,GitHub 约6万 star)是国内使用极广的自媒体数据采集框架,覆盖小红书、抖音、快手、B站、微博、百度贴吧、知乎7大平台,可采集笔记/视频/帖子、评论(含二级评论回复)、创作者主页内容与搜索结果。它不手工逆向各平台加密签名,而是用 Playwright 驱动真实浏览器、保留登录上下文(扫码或Cookie登录并缓存复用),通过执行JS表达式获取加密参数,大幅降低逆向门槛。各平台普遍支持关键词搜索、按帖子/视频ID采集、创作者主页采集、登录态缓存、IP代理池、评论词云图,结果可存为 CSV/JSON 或 MySQL/PostgreSQL/SQLite。环境建议 Python 3.11(推荐 uv 管理依赖)、部分平台需 Node.js 16+ 并安装 Playwright 浏览器。项目仅面向公开数据的学习与研究,商用需单独授权,使用时须遵守各平台条款、数据合规法律与账号安全规则。
4.4
评分
免费
定价模式
4+
平台
7.8k
收藏
优点
- 一套统一代码打通7大中文平台。
- Playwright方案免去艰难的签名逆向。
- 模式丰富:搜索/ID/创作者/多级评论。
- 存储灵活,从文件到关系型数据库都行。
- 社区庞大、教程资料丰富。
缺点
- 需搭建Python3.11+Node.js+Playwright环境。
- 必须登录,采集过猛有账号风控/封号风险。
- 只能采公开数据,平台条款与法律责任在使用者。
- 开源限学习研究,商用需另行授权。
多维度评分
4.4/ 5.0
⚡
功能完整性
3.9
🚀
性能速度
4.5
✨
易用性
4.0
💰
性价比
4.6
🎧
客户支持
4.6
🔒
隐私安全
4.6
核心能力
IDE插件
Git集成
代码审查
同类工具对比
| 功能 | MediaCrawler | Semantic Kernel | Warp | Vercel AI SDK |
|---|---|---|---|---|
| 评分 | 4.4 | 4.8 | 4.8 | 4.8 |
| 定价模式 | 免费 | 免费 | 免费 | 免费 |
| 起价 | Free | Free | Free | Free |
| API | — | — | — | — |
| 免费版 | — | — | — | — |
| 移动端 | — | — | — | — |
适用人群
竞
竞品监控
跨平台追踪对手笔记、视频与互动数据。
舆
舆情公关
采集公开评论、做词云与舆情分析。
内
内容选题
挖掘热门话题与爆款,辅助选题。
学
学术研究
采集公开社交数据做传播/市场研究。
工
工程学习
学习浏览器自动化与反爬签名原理。
开发者
NanmiCoder
支持平台
网页版 ↗
Windows ↗
Mac ↗
iPhone/iPad ↗
安卓 ↗
华为 暂不支持
Linux ↗
支持语言
中文, Python
更新于
2026-09-13
公司信息
5000+ 员工
常见问题
小红书、抖音、快手、B站、微博、百度贴吧、知乎。