news 2026/8/24 21:19:20

MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音等 7 个站点

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音等 7 个站点

MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音等 7 个站点

【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler

MediaCrawler 是一款开源多平台自媒体数据采集工具,覆盖小红书、抖音、快手、B站、微博、贴吧、知乎 7 个主流平台,能抓取笔记、视频和评论数据,靠浏览器登录态代替复杂的 JS 逆向,新手也能直接上手。

🚀 最短路径上手:五分钟跑通第一次采集

先备好 Python(建议 3.11)和 Node.js 16 以上,Node 是抖音、知乎的签名脚本用的。默认 CDP 模式直接复用你本地的 Chrome,不用额外装浏览器驱动。

三步跑起来:

git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler && uv sync uv run main.py --platform xhs --lt qrcode --type search

最后一条命令会打开 Chrome 让你扫码登录小红书,然后开始按关键词抓取。登录态会缓存,下次运行免扫码。不喜欢命令行的话,也可以启动 WebUI 可视化界面,在浏览器里改参数、看实时日志:

🎯 核心玩法:三种模式覆盖所有取数任务

不管你要做什么,都能落到下面三种模式里。参数可以先写进配置文件,再靠命令行参数覆盖。

按关键词搜索:输词拿内容加评论

最常用的模式。指定--type search和关键词(多个用英文逗号分隔),会自动抓笔记或视频的正文、互动数据,以及一级评论:

uv run main.py --platform dy --lt qrcode --type search --keywords "咖啡,探店"

--max_comments_count_singlenotes限制单条内容的评论抓取量,大热评论容易拖慢整体速度,所以先控量再放量。

按内容ID批量抓取怎么做

手里有具体链接时,用--type detail--specified_id,支持完整 URL,多个 ID 逗号分隔:

uv run main.py --platform bili --type detail --specified_id "BV1xx411c7mD,BV1xx411c7mE"

适合批量分析几条明确的竞品内容或历史爆款,不会有搜索带来的偏差。

盯住某个主页:跟踪一个账号

--type creator传入创作者主页 URL 或 ID,即可抓取该账号发布的内容和互动数据:

uv run main.py --platform xhs --type creator --creator_id "你的创作者ID"

适合盯目标账号,定期跑一遍就能观察更新频率和热度变化。

💾 数据落盘:一句话选存储格式

默认存 JSONL 到 data 目录,一行一条记录,方便脚本后续读取。习惯 Excel 就加--save_data_option excel,直接出报表。数据量大、要反复跑就选 sqlite 或 mongodb,内置去重,二次运行不会产生重复记录。

📊 场景实战:把数据变成真实工作

场景一:竞品营销监控背景:想看竞品账号最近在做什么。做法:--type search模式输入竞品品牌名,开启评论抓取,每周跑一次。拿到什么:新发内容清单、互动数据,以及用户评论里的真实反馈。

场景二:产品口碑词云背景:想知道用户对某产品说了什么。做法:按产品名搜索抓评论,配置文件里把ENABLE_GET_COMMENTSENABLE_GET_WORDCLOUD都设为 True(数据需存为 json 或 jsonl)。拿到什么:用户反馈的高频词分布图,停用词可在 hit_stopwords.txt 里过滤。

🛡️ 避坑指南:三个最常卡住的地方

坑一:小红书登录滑块一直过不了现象:扫码成功但卡在滑块验证。原因:小红书风控严格,新开的浏览器容易被识别。解法:保持默认 CDP 模式连接自己的真实 Chrome,并删除项目根目录下 brower_data 目录后重新登录。

坑二:抖音、知乎报 "SyntaxError: 缺少 ';'"现象:命令行弹出 execjs 相关报错。原因:没装 Node.js 环境。解法:安装 Node.js 16 以上再重跑,这是缺 Node 最直接的信号。

坑三:开始能爬,过一段时间就失效现象:没报错但拿不到新数据。原因:账号登录态被平台风控失效。解法:先降低抓取频率和数量,删除 brower_data 换账号重新登录;高频需求再上代理池。项目支持多种代理服务商并自动轮换 IP,整体流程如下:

代理IP拉取入池与轮换的完整流程图

服务商控制台里的代理账号密码,就是需要配置进环境变量的凭据:

代码里通过环境变量读取密钥,避免把账号密码硬编码进文件:

📌 最后说两句

三种模式加一条命令,就能开始采集任意平台的内容与评论。更多运行问题先看项目里的 docs/常见问题.md,所有参数都能在 config/base_config.py 里改。

【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/24 21:19:08

Minimax Code CLI:本地部署AI智能体,驱动M3 Mac完成自动化技术调研

这次我们来看一个能驱动 M3 芯片 MacBook 跑数小时自主调研的 AI 工具:Minimax Code CLI。它不是普通的代码生成器,而是一个能理解复杂任务、自主规划、执行代码、分析结果并生成报告的智能体(Agent)。简单说,你给它一…

作者头像 李华
网站建设 2026/8/24 21:18:46

IDM激活脚本使用教程:免费冻结试用期与激活指南

IDM激活脚本使用教程:免费冻结试用期与激活指南 【免费下载链接】IDM-Activation-Script-ZH IDM激活脚本汉化版 项目地址: https://gitcode.com/gh_mirrors/id/IDM-Activation-Script-ZH IDM 的 30 天试用期一到期,注册窗口开始反复弹出&#xff…

作者头像 李华
网站建设 2026/8/24 21:16:19

Windows免虚拟机搭建天龙八部0.85单机服务端完整教程

很多朋友想体验经典游戏《天龙八部》的早期版本(如0.85),但一看到需要安装虚拟机、配置Linux系统就望而却步。复杂的虚拟化设置、系统兼容性问题、资源占用大,让不少玩家在第一步就卡住了。本文将分享一套完整的“免虚拟机、免Lin…

作者头像 李华