Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

发现一个被低估的 AI 基建:XCrawl XCrawl是一个网页抓取和数据采集的API,它让 Agent 拥有了真正意义上的"上网能力"。 它提供几个核心能力: - Scrape:抓单个页面 - Crawl:批量跑整个站点 - Map:摸清网站结构 - Search:拿搜索结果 从单页到整站,从搜索到整理,一步打通。 用下来最直接的感受: - 不给一堆原始HTML,直接输出Markdown、JSON、摘要、链接 - 基本不用二次清洗,拿来就能用 - 动态页面(JS渲染)也能处理 - 地区、语言、结构化提取都支持 - 成功率稳定 如果你在用OpenClaw,会发现很多Agent卡住不是因为模型不行,而是数据不好用。 XCrawl正好解决这块——让Agent自己搜、抓、读,继续执行下去。OpenClaw负责决策,XCrawl负责把信息接进来。 能落地的场景: - 电商选品、竞品整理 - 招聘、社交、新闻信息汇总 - SEO关键词跟踪 - 自动整理资料、生成报告 原本需要人工收集的数据,现在跑个流程就行。 它遵循公开网页+合规采集的原则,自带规则约束。 这不是更强的爬虫,而是把"获取数据"变成可以直接接进Agent的能力。 做Agent或自动化,XCrawl 是一个趁手的工具。

29,538 Aufrufe • vor 5 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

最近一直在折腾 OpenClaw 和 Hermes Agent,查找各种资料对比,忽然看到一个高频出现的爬虫工具 XCrawl。深入了解后发现这真是个特别 cool 的产品,几乎把各种爬虫工具的优势都集合到一起了。 以前我自己在网上查找各种搜索技能,手动优化搜索策略,还专门写了篇 3 万浏览量的搜索优化文章……但现在 XCrawl 基本全搞定了。最让我惊喜的是它的防反爬能力——内置高质量住宅代理池 + 智能指纹技术,任务成功率稳定在 90% 以上。要是自己搭建这套系统,光是代理池的成本就很恐怖了。 和 OpenClaw 完美适配 我直接在 OpenClaw 和 Hermes 上一键配置了 XCrawl 的 skills,包括 scrape(单页抓取)、map(站点地图)、crawl(批量爬取)、search(搜索结果获取)和 SERP(深度搜索数据)。同一个 API key 就能搞定所有场景,输出格式统一是 Markdown 或 JSON,可以直接喂给 LLM 处理,完全不需要二次清洗数据。 几个特别实用的功能 Scrape 是我用得最多的,输入一个 URL 就能提取页面内容,支持动态 JS 加载。输出格式很灵活:Markdown(最适合 LLM)、JSON(结构化数据)、HTML、截图、摘要、链接列表都支持。抓产品详情页或者文章页特别方便。 Crawl 适合需要大量数据的场景,可以智能递归爬取整个网站,自动处理翻页和无限滚动。我用它采集过一些行业资讯站点,设置好深度和页面数量限制,就能批量获取结构化数据。 Map 这个功能很聪明,先扫描整个站点结构,导出所有 URL 和 sitemap。我一般会先用 Map 看看全貌,再决定具体爬哪些部分,效率提升很明显。 SERP 则是深度搜索引擎数据采集,不只是基础的排名和链接,还包括富结果、People Also Ask、知识图谱这些。做竞品分析或者 SEO 研究的时候特别有用。 果你也在用 OpenClaw 或者需要频繁做数据采集,XCrawl 确实值得一试。它把复杂的技术细节都封装好了,让我们可以专注在数据应用本身,而不是花大量时间在反爬对抗上。 下面是我给它的一个实在任务,相当复杂: 任务:对比 OpenClaw 与 Hermes 产品的优劣,并给出结论 目标: 请系统性收集并分析openclaw 和hermes-agent 两个产品的信息,对它们的能力、性能和适用场景进行对比,并给出客观结论(哪个更适合什么场景)。 数据来源要求: 请优先从以下渠道获取信息: 1. 官方网站 / 官方文档(Docs) 2. GitHub(README、Issues、Commits、Releases) 3. 技术社区(如 Reddit、Hacker News、Stack Overflow) 4. 技术博客 / 评测文章(Medium、个人博客等) 需要收集的信息维度: 1. 产品定位(解决什么问题) 2. 核心功能(支持哪些能力) 3. 架构设计(如是否模块化、是否支持扩展) 4. 安装与使用复杂度(是否易上手) 5. 性能表现(延迟、吞吐、资源占用,如有 benchmark) 6. 稳定性(是否容易报错、崩溃,issue 情况) 7. 社区活跃度(star、commit 频率、issue 响应速度) 8. 生态与扩展性(插件、API、二次开发能力) 9. 成本(是否开源、资源消耗、商业模式) 分析要求: 1. 对每个维度分别对比 OpenClaw vs Hermes 2. 提供结构化对比表(table 形式) 3. 标注信息来源(尽量附链接) 4. 总结各自优势 / 劣势 5. 给出明确结论: * 哪个更适合生产环境 * 哪个更适合实验 / 研究 * 在什么场景下推荐使用哪个 额外要求: * 使用 XCrawl 相关技能完成信息搜索 * 优先使用最近 1–2 周的数据(保证信息新鲜) * 如果信息冲突,请指出并解释 * 不要只引用官方资料,要包含真实用户反馈(issue / 讨论) 输出格式: 1. 简要总结(TL;DR) 2. 对比表 3. 分维度详细分析 4. 最终结论与建议

OneHopeA9

22,304 Aufrufe • vor 4 Monaten

这个项目,真的让我重新燃起了做账号矩阵的冲动。 一个 14.5k stars 的开源项目,直接把 Google NotebookLM 变成内容生产流水线。 NotebookLM 很多人应该都用过。 上传 PDF、网页、YouTube,它就能帮你整理资料、生成播客、做学习指南。 但官方网页版有个很难受的问题: 太慢了。 传个 PDF,等解析; 点生成音频,再等; 下载,再等。 一套流程跑完,时间全浪费在等待上。 更关键的是: 它根本不适合批量搞内容。 你想一次处理几十个链接? 想自动生成一批播客? 想接到自己的工作流里? 网页版基本没法玩。 直到我发现了 notebooklm-py。 这是一个非官方 Python API,等于把 NotebookLM 的能力全拆出来了。 很多功能甚至比网页版还狠: - 一行命令生成播客 - 支持不同风格、时长、语言 - 批量导入 YouTube / PDF / URL - 幻灯片直接导出 PPTX - 思维导图导出 JSON - 数据导出 CSV - 测验题结构化导出 - 还能用自然语言改单页 PPT 最强的是: 它还能接进 Claude Code,当 Agent 技能用。 看到这里我脑子里第一反应就是: 这不就是账号矩阵生产线吗? 热点抓取 → AI研究 → 播客生成 → 图文整理 → PPT生成 → 自动分发 整个链路都能串起来。 以前做矩阵,拼的是人多。 现在越来越像拼工作流了。 很多以前需要团队才能做的事情, 现在一个人也能跑起来。

开发者Hailey

21,316 Aufrufe • vor 3 Monaten

牛逼了兄弟们,TinyFish刚刚开源了BigSet!你可以一句话直接生成任意数据集—— 只需要描述你想要搜索查询的数据,比如AI工具价格、竞品动态、招聘信息、黑客松比赛,BigSet就会调用大模型和网页检索API,直接把公开网页里的信息整理成结构化表格返回,而且能定时刷新数据集。​ ​ 上周偶然的机会,我参加一个线上黑客松,拿了很不错的奖金,所以我一直在关注全球的黑客松赛事,但是这种黑客松赛事比较分散,自己挨个去找太麻烦了,所以我让BigSet帮我构建一个实时数据集,收录全球范围内未来 90 天内正在开放报名的所有黑客松。 最后返回了具体的链接、黑客松名称、报名截止时间、奖金、线上支持......我能直接选择心仪的,直接跳转到具体的黑客松活动网址报名,节省了大量的时间!​ ​ BigSet还是多Agent架构,这就决定了它抓取任务分工明确、速度更快、结果更清楚,天然更适配处理表格类的任务。 如果你经常做竞品调研或者经常需要把分散在公开网页里的信息整理成表格,完全可以试试BigSet。而且它和Firecrawl这种专业数据抓取工具不同,你不需要丢给它URL,只需要把需求说清楚,AI就会自动去找到目标网站、抓取数据并且返回结构化的表格数据。​ ​ BigSet完全开源,AGPL-3.0许可,你可以自托管在本地运行,默认接入OpenRouter 大模型 API和TinyFish网页数据获取的API。​ ​ 如果觉得BigSet有用,可以去GitHub给它点个 star~: TinyFish网页数据获取API Key:

逸尘

12,155 Aufrufe • vor 3 Monaten

卧槽,太夸张了,现在 AI 时代的闲鱼已经面世了吗?这不就是谁先知道谁赚钱,拼速度了? 你的技能,专业知识,等等你的一切,竟然可以在你睡觉的时候被别人买走,这是什么科幻小说吗?? 之前我一直在想,现在大家优秀的 skill 往往都是自己用,大部分人舍不得开源的,那有没有一个平台既能让用户用到这些大神的专业知识、skill,但是又不用开源呢? 还真让我给找到了!! 前两天看到国内一个博主推荐一个很野的平台-UUMit 让你的技能、经验、工作流都可以变成能力卡,被需要的人、或者别人的 Agent 自动发现、调用 并且直接付费!! 有点像03年淘宝刚出来的时候,只不过当年流通的是商品,现在流通的是能力 具体能干什么?举几个例子你就懂了 会写小红书脚本的,可以把选题逻辑、爆款模板、平台规则检测能力上架,别人发布“帮我做一周小红书内容计划”,平台自动匹配到你,你接单交付 会做行业研究的,可以把数据库、报告、案例库放进知识商店,AI 生成不了的真实行业数据,反而更值钱 会写代码的,可以把 API、MCP 工具、自动化脚本上架,别人的 Agent 需要某个能力时,直接调用你的接口,你按调用次数收费 甚至你只是整理过某个垂直领域的供应商名单、SOP、课程讲义,这些 AI 生成不了的资料,都可以变成知识资产 这绝对是一次能力供应链的重构! 以前的 AI 只能在自己的对话框里回答问题,但复杂任务需要很多外部能力:数据、接口、行业知识、人工交付 UUMit 做的事情是:让 Agent 可以发现别人的能力,也能让自己的能力被别的 Agent 调用 这就是 A2A(Agent to Agent)真正有意思的地方,不是让 AI 互相聊天,而是让 AI 找能力、调接口、买知识、拉人协作,把事情交付掉 为什么我说谁先知道谁赚钱? 因为这个平台刚起来,早期上架的人能建立先发优势 而且现在 Agent 真的开始干活了,不再只是聊天工具,它们需要外部能力来完成复杂任务 谁先把自己的能力挂上去,谁就有机会被更多 Agent 发现和调用 这就是信息差的价值,就像03年最早在淘宝开店的那批人 UUMit 现在有哪些功能? 任务发布入口:你不用一开始就知道该找谁,也不用自己拆一堆工具,你只要说清楚想完成什么,UUMit 会帮你找能完成这件事的能力 Skill/Agent/工作流上架:你写好的工具,不一定只能自己用,它也可以成为别人工作流里的一环 知识商店:AI 可以生成很多内容,但它不一定拥有你手里的行业资料、真实数据、案例库和经验沉淀,这些东西放到 UUMit,可能会变成可复用的知识资产 数据广场:Agent 不必自己拥有所有数据和接口,需要某项外部能力时,可以通过 UUMit 调用数据广场里的资源 强烈推荐大家来试试:

超级个体|柿子

49,192 Aufrufe • vor 24 Tagen

最近我发现了一个使用 n8n + Scrapeless + Claude AI 搭建的自动化系统,值得跟大家分享一下。 该系统每天帮我们筛选出几十个潜在客户,理论上能支撑一个 $30K+/月 的 B2B 业务。 在这个系统的工作流中,采用的是 Scrapeless 进行数据处理,它不仅能抓取 Google 数据,还能爬取指定网站并检索其子页面。 目前 Scrapeless 已在 n8n 平台上正式集成 ,搜索并选择相关节点即可配置使用。 工具地址: 以下是完整工作流步骤: ✅ 全程无需复杂代码 ✅ 全自动评分 + 筛选 + 推送 1. 关键词搜索(Scrapeless Google):用行业关键词(如「软件公司」)发起 Google 搜索 2. 处理搜索结果:用 n8n 的 Item Lists 节点逐一处理公司链接。 3. Scrapeless Crawl: 提取每个公司网站的详细信息,确保数据全面。 4. 数据清洗 + 结构化:通过Code节点对爬取到的数据进行清洗和结构化。 5. Claude AI 打分分析:将清洗后的信息送进 Claude,分析并评分(如潜力评分、行业匹配度) 6. 线索筛选:利用 Filter 节点设定条件,只保留高评分、数据完整的客户。 7. 即时通知:配置 Discord 通知,团队第一时间接收到新线索推送。 大家可通过最下方链接查看此工作流的详细教程,或者在 Scrapeless 的内置 playground 中进行测试。 Scrapeless 提供了多个核心工具,以帮助优化数据采集过程。其中,Deep SerpApi 支持 20 多种 Google SERP 类型,如 Google Search、Google Trends、Google 航班/酒店等。 此外,基于自研 Chromium 内核的 Crawl 功能具有高度可定制化、会话管理和反检测隐身能力,支持进行大规模的单页及递归爬取。同时其验证码识别功能免费使用,能够大大节省成本。 详细教程:

GitHubDaily

73,758 Aufrufe • vor 1 Jahr

蚂蚁百灵刚刚发布了 Ling-3.0-flash: 一个AI 执行层的关键拼图 刚刚看到 Ling-3.0-flash 正式发布,我觉得这款模型值得认真关注。原因很简单:在 AI 工程越来越深入到实际业务的今天,大家早就不满足于模型“会不会想”了,更关键的是它“能不能持续做”。 尤其是在 Agent 工作流中,需要高频调用工具、迭代代码、处理长程任务时,一个响应快、执行稳的执行引擎成了刚需。Ling-3.0-flash 的出现,正好瞄准了这个缺口。 1. Agent 的执行层 从我的角度看,它最聪明的一点是没有去硬拼超大模型的深度推理能力,而是把自己定位成一个高速执行引擎——负责把已经规划好的任务快速落地。 这在实际应用中特别实用,比如当大模型把方案设计好之后,剩下的代码生成、工具调用、批量处理就需要一个既快又稳的模型来接手。 2. 为什么它能兼顾速度和成本 技术细节上,它采用 124B 参数的 MoE 架构,但实际激活参数约 5.1B,在推理速度和运行成本之间找平衡。 它还支持混合推理模式:简单任务可以关闭 Reasoning,降低延迟,适合大批量处理;复杂任务则可以开启思考模式,保持逻辑连贯。 原生支持 256K 上下文,对需要持续读取历史指令和项目状态的 Agent 工作流也很重要。 3.如何使用 我觉得 Ling-3.0-flash 最适合做 Agent 工作流里的执行节点。反复调用 API 或 MCP 工具时,它能根据结构化错误信息自我诊断和修复,不容易在循环调试中卡死,因此适合放进 Loop 或 Graph 架构。 4.结对编程和批量任务 结对编程是一个典型场景:人负责架构规划、边界定义和测试,Ling-3.0-flash 负责快速生成代码、调用工具、读取报错,并根据反馈持续修改。 批量处理长文档、日志、简历和结构化数据时,它看重的也是速度、格式稳定性和成本控制。直播数字人或高频办公协作,则需要它的低延迟响应来减少体验断层。 5.边界 当然,它不是万能模型。复杂系统不能只靠一句指令搞定;缺乏架构和测试环境时,结果可能跑偏;需要深度冷门知识的研究任务,还是更适合交给更大规模的推理模型。 更合理的用法是:大模型负责搜索、规划和架构设计,把方案写成规范文档;Ling-3.0-flash 负责高频工具调用、代码执行和批量处理。 总结:Ling-3.0-flash 不是来替代所有模型的,而是把 Agent 工作流里“执行层”这件事做得更快、更稳。大模型负责想清楚,它负责做出来。

奶牛叔

66,157 Aufrufe • vor 1 Monat

做数据分析的人应该都懂那种崩溃感: Excel 一开就卡、SQL 跑半天、模型调参像瞎猜、报告一写就是一下午。 更别说很多人本职工作也不是“数据科学家”,但又不得不啃一堆 CSV、报表和图表。 这两天看到人民大学 RUC Datalab 开源的DeepAnalyze,有点眼前一亮。 它不是那种“帮你写点分析文案”的 AI,而是想做一个真正的「AI 数据分析师」: 能读 Excel/CSV/JSON/TXT,自己规划步骤、清洗数据、建模、画图、最后给你一份完整报告。 甚至还能把推理链(reasoning trace)展示出来,让你看到它是怎么一步步想出来的。 我自己最有感觉的点有几个: 以前 ChatGPT 更像“写稿子、写代码”的助手,但对数据本身不够“懂”; DeepAnalyze 直接把这一块补上了,做到“从数据到报告”的全流程; 对普通人来说,可能第一次有机会把“专业的数据分析能力”当成一个工具来用,而不是一门必须自己啃几年的技能。 当然,它现在肯定还不完美,落地也需要折腾环境、准备数据。 但这个方向我很看好: AI 帮你做繁琐的统计和建模,人类负责问好问题、选好指标、做最后决策。 数据分析不再是少数人的特权,而是变成人人可用的一种“智能能力”。 简单说: 过去是「你学会数据分析再去用工具」, 以后可能是「你先有一个 AI 数据分析师,再慢慢学会怎么问对问题」。

sitin

15,309 Aufrufe • vor 10 Monaten