Loading video...

Video Failed to Load

Go Home

🚨 一个工具就能把小红书、抖音、快手、B站、微博、贴吧、知乎的内容全爬下来 目前 GitHub 上已经有 5.2 万+ star,非常火爆 做内容分析的人,这个开源项目基本绕不开的 它最大的优势是不用搞复杂的 JS 逆向,而是通过浏览器登录态直接获取签名,门槛比传统爬虫低非常多 之前这些让人头疼的数据,现在终于有统一答案了!MediaCrawler 核心亮点: > 支持小红书 / 抖音 / 快手 / B站 / 微博 / 贴吧 / 知乎 > 支持笔记、视频、帖子、问答、评论等公开信息抓取 > 支持关键词搜索和指定 ID 采集 > 基于 Playwright 模拟真实浏览器环境 > 支持登录态缓存、代理配置、数据落库 > 适合做内容选题、舆情分析、竞品研究、AI 数据采集 现在很多人博主也在用它爬数据,数据这件事,终于要变简单了!

11,193 views • 1 month ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

最近我发现了一个使用 n8n + Scrapeless + Claude AI 搭建的自动化系统,值得跟大家分享一下。 该系统每天帮我们筛选出几十个潜在客户,理论上能支撑一个 $30K+/月 的 B2B 业务。 在这个系统的工作流中,采用的是 Scrapeless 进行数据处理,它不仅能抓取 Google 数据,还能爬取指定网站并检索其子页面。 目前 Scrapeless 已在 n8n 平台上正式集成 ,搜索并选择相关节点即可配置使用。 工具地址: 以下是完整工作流步骤: ✅ 全程无需复杂代码 ✅ 全自动评分 + 筛选 + 推送 1. 关键词搜索(Scrapeless Google):用行业关键词(如「软件公司」)发起 Google 搜索 2. 处理搜索结果:用 n8n 的 Item Lists 节点逐一处理公司链接。 3. Scrapeless Crawl: 提取每个公司网站的详细信息,确保数据全面。 4. 数据清洗 + 结构化:通过Code节点对爬取到的数据进行清洗和结构化。 5. Claude AI 打分分析:将清洗后的信息送进 Claude,分析并评分(如潜力评分、行业匹配度) 6. 线索筛选:利用 Filter 节点设定条件,只保留高评分、数据完整的客户。 7. 即时通知:配置 Discord 通知,团队第一时间接收到新线索推送。 大家可通过最下方链接查看此工作流的详细教程,或者在 Scrapeless 的内置 playground 中进行测试。 Scrapeless 提供了多个核心工具,以帮助优化数据采集过程。其中,Deep SerpApi 支持 20 多种 Google SERP 类型,如 Google Search、Google Trends、Google 航班/酒店等。 此外,基于自研 Chromium 内核的 Crawl 功能具有高度可定制化、会话管理和反检测隐身能力,支持进行大规模的单页及递归爬取。同时其验证码识别功能免费使用,能够大大节省成本。 详细教程:

GitHubDaily

73,758 views • 1 year ago

最近一直在折腾 OpenClaw 和 Hermes Agent,查找各种资料对比,忽然看到一个高频出现的爬虫工具 XCrawl。深入了解后发现这真是个特别 cool 的产品,几乎把各种爬虫工具的优势都集合到一起了。 以前我自己在网上查找各种搜索技能,手动优化搜索策略,还专门写了篇 3 万浏览量的搜索优化文章……但现在 XCrawl 基本全搞定了。最让我惊喜的是它的防反爬能力——内置高质量住宅代理池 + 智能指纹技术,任务成功率稳定在 90% 以上。要是自己搭建这套系统,光是代理池的成本就很恐怖了。 和 OpenClaw 完美适配 我直接在 OpenClaw 和 Hermes 上一键配置了 XCrawl 的 skills,包括 scrape(单页抓取)、map(站点地图)、crawl(批量爬取)、search(搜索结果获取)和 SERP(深度搜索数据)。同一个 API key 就能搞定所有场景,输出格式统一是 Markdown 或 JSON,可以直接喂给 LLM 处理,完全不需要二次清洗数据。 几个特别实用的功能 Scrape 是我用得最多的,输入一个 URL 就能提取页面内容,支持动态 JS 加载。输出格式很灵活:Markdown(最适合 LLM)、JSON(结构化数据)、HTML、截图、摘要、链接列表都支持。抓产品详情页或者文章页特别方便。 Crawl 适合需要大量数据的场景,可以智能递归爬取整个网站,自动处理翻页和无限滚动。我用它采集过一些行业资讯站点,设置好深度和页面数量限制,就能批量获取结构化数据。 Map 这个功能很聪明,先扫描整个站点结构,导出所有 URL 和 sitemap。我一般会先用 Map 看看全貌,再决定具体爬哪些部分,效率提升很明显。 SERP 则是深度搜索引擎数据采集,不只是基础的排名和链接,还包括富结果、People Also Ask、知识图谱这些。做竞品分析或者 SEO 研究的时候特别有用。 果你也在用 OpenClaw 或者需要频繁做数据采集,XCrawl 确实值得一试。它把复杂的技术细节都封装好了,让我们可以专注在数据应用本身,而不是花大量时间在反爬对抗上。 下面是我给它的一个实在任务,相当复杂: 任务:对比 OpenClaw 与 Hermes 产品的优劣,并给出结论 目标: 请系统性收集并分析openclaw 和hermes-agent 两个产品的信息,对它们的能力、性能和适用场景进行对比,并给出客观结论(哪个更适合什么场景)。 数据来源要求: 请优先从以下渠道获取信息: 1. 官方网站 / 官方文档(Docs) 2. GitHub(README、Issues、Commits、Releases) 3. 技术社区(如 Reddit、Hacker News、Stack Overflow) 4. 技术博客 / 评测文章(Medium、个人博客等) 需要收集的信息维度: 1. 产品定位(解决什么问题) 2. 核心功能(支持哪些能力) 3. 架构设计(如是否模块化、是否支持扩展) 4. 安装与使用复杂度(是否易上手) 5. 性能表现(延迟、吞吐、资源占用,如有 benchmark) 6. 稳定性(是否容易报错、崩溃,issue 情况) 7. 社区活跃度(star、commit 频率、issue 响应速度) 8. 生态与扩展性(插件、API、二次开发能力) 9. 成本(是否开源、资源消耗、商业模式) 分析要求: 1. 对每个维度分别对比 OpenClaw vs Hermes 2. 提供结构化对比表(table 形式) 3. 标注信息来源(尽量附链接) 4. 总结各自优势 / 劣势 5. 给出明确结论: * 哪个更适合生产环境 * 哪个更适合实验 / 研究 * 在什么场景下推荐使用哪个 额外要求: * 使用 XCrawl 相关技能完成信息搜索 * 优先使用最近 1–2 周的数据(保证信息新鲜) * 如果信息冲突,请指出并解释 * 不要只引用官方资料,要包含真实用户反馈(issue / 讨论) 输出格式: 1. 简要总结(TL;DR) 2. 对比表 3. 分维度详细分析 4. 最终结论与建议

OneHopeA9

22,056 views • 3 months ago