行业资讯
📅 2026/8/28 23:49:38
4个真实项目拆解Firecrawl:网页抓取、结构化提取到自动研究指南
4个真实项目拆解Firecrawl网页抓取、结构化提取到自动研究指南【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawlFirecrawl 把整站网页转成干净的 Markdown 和结构化数据解决爬虫写一半、反爬卡全程的老问题。这篇指南拆 4 个能直接跑通的项目电商价格监控、站点内链分析、公司情报收集、AI 租房搜索每个项目都附核心代码和调优参数帮你把网页数据接进自己的 AI 应用。快速上手5分钟跑通第一次抓取三步完成初始化装 SDK、配密钥、发第一次请求。pip install firecrawl-pyexport FIRECRAWL_API_KEYfc-你的密钥from firecrawl import FirecrawlApp app FirecrawlApp() result app.scrape_url(https://example.com) print(result.get(markdown, )[:200])这段代码做了三件事初始化客户端、抓取目标页面、把返回的 Markdown 打出来看一眼。确认能拿到干净文本后下面的场景就可以逐个照搬。场景一搭建电商价格监控看板 痛点消费者盯着大促页面手动刷价格费时还容易错过限时折扣卖家想知道竞品价格曲线更是没辙。思路整条流水线是定时抓取 → 入库 → 画图 → 告警。项目用 Firecrawl 抓商品页拿当前价格写进 Supabase 的 Postgres 表Streamlit 画历史曲线价格跌破阈值就推 Discord 通知GitHub Actions 按小时调度全程免费。完整代码在 examples/blog-articles/amazon-price-tracking/。代码亮点result app.scrape_url( product_url, params{formats: [extract], extract: {schema: PriceInfo.model_json_schema()}}, )用 Pydantic 模型PriceInfo声明我要价格、货币、标题三个字段Firecrawl 就只吐这些字段的结构化结果不用自己正则切 HTML。延伸把阈值从固定金额改成百分比跌幅能过滤掉日常毛刺波动调度频率降到每天两次足够覆盖多数电商的变价节奏还省额度场景二让博客自动长出内链 痛点内容团队发新文章时经常忘记把旧文章链进来网站结构越做越散SEO 权重留不住。思路先抓目标博客页拿正文再用map_url扫出整个站点的全部链接这一步不逐页抓取大站也快最后把正文 站内链接清单交给 LLM让它只改链接不动正文输出改好的 Markdown。源码见 examples/internal_link_assistant/。代码亮点blog_md app.scrape_url(url, params{formats: [markdown]})[markdown] links app.map_url(base_domain).get(links, []) prompt f正文{blog_md}\n站内页面{links}\n请只插入内链返回Markdown抓正文和扫站点是两次独立调用map_url负责列清单scrape_url负责读内容分工清楚、成本可控。延伸给 LLM 加一条约束只链向主题词重合度高的页面避免硬塞广告位把输出的 Markdown 直接接进 CMS 的草稿接口实现半自动发布场景三三步跑通公司情报流水线 痛点做尽调或竞品分析时信息散落在官网、新闻、招聘页里人工翻网页整理字段一份报告要花半天。思路分三步接力。第一步用 SerpAPI 搜公司名 想了解的信息拿到候选链接第二步让 Gemini 2.5 从搜索结果里挑出真正相关的几个 URL滤掉社交链接和广告位第三步把选中的 URL 交给 Firecrawl 的 extract 接口按提示词直接出结构化字段。示例在 examples/gemini-2.5-web-extractor/。代码亮点payload {urls: urls, prompt: f提取{company}的成立时间、业务线、融资情况, enableWebSearch: True} resp requests.post(EXTRACT_URL, headersheaders, jsonpayload, timeout30)extract 接口是异步的提交后拿一个 job id轮询到完成才取结果代码里记得加轮询循环而不是读第一次响应。延伸搜索源可以换成任意你已有账号的搜索引擎接口省掉 SerpAPI 费用选 URL 的模型换成更便宜的 Flash 档挑链接任务不需要大模型场景四深度研究版智能租房助手 痛点换房用户要在十几个租房站之间横跳比价条件一多就乱手动整理信息不现实。思路把找房交给 Firecrawl 的 deep_research。它接受一句自然语言查询自动多轮搜索、抓页、分析参数用maxDepth控制迭代轮数、timeLimit控总时长、maxUrls封顶分析页数on_activity回调实时打印每轮在干什么过程完全可见。研究完把源材料喂给 Claude 3.7强制输出固定 JSON 结构终端里直接渲染成对比卡片。源码在 examples/deep-research-apartment-finder/。代码亮点params {maxDepth: 3, timeLimit: 180, maxUrls: 20} results firecrawl.deep_research( query杭州滨江两居室预算4500带阳台, paramsparams, on_activityprint_progress, )三个参数就是成本旋钮maxUrls每加 10 个页面耗时和费用都明显上升先用 20 试水再放开。延伸把最终 JSON 结果存 SQLite多租几次就能对比同一小区的价格变化提示词里写死字段名后续接任何下游系统都不用改解析逻辑Firecrawl 能力速查表功能典型场景关键调用方式单页抓取抓正文、转 Markdownapp.scrape_url(url, params{formats: [markdown]})结构化提取按字段抽价格、新闻条目formats[extract]配 Pydantic 模型 schema整站链接映射内链分析、站点摸底app.map_url(domain)只列链接不抓正文整站爬虫批量采集多个页面app.crawl_url(url)用 limit 控页数深度研究多轮搜索抓取分析deep_research(query, params, on_activity)extract 接口多 URL 批量出结构化字段POST 提交 job id轮询取结果避坑指南限流先看额度free 档有并发和页面数上限批量任务被 429 时加退避重试别裸循环硬刷超时设保守deep_research 和 extract 都是异步任务SDK 超时建议给足研究类任务 180 秒起步反爬页面换思路登录墙或强反爬站点抓不到正文时换官方 API 或第三方数据源别死磕密钥别进仓库FIRECRAWL_API_KEY放.env或环境变量.env加进.gitignoreCI 里用 secret 注入提取 schema 别贪多一次提取的字段越多、每页越贵不确定的字段先砍掉再迭代写在最后以上 4 个项目覆盖了从单页提取到多轮深度研究的全部链路代码都能直接克隆运行。更多示例见仓库的 examples/各语言 SDK 在 apps/ 目录下。输出文章 /output articleWait, I made an error at the end with the closing tag. Let me provide the corrected version.输出文章4个真实项目拆解Firecrawl网页抓取、结构化提取到自动研究指南Firecrawl 把整站网页转成干净的 Markdown 和结构化数据解决爬虫写一半、反爬卡全程的老问题。这篇指南拆 4 个能直接跑通的项目电商价格监控、站点内链分析、公司情报收集、AI 租房搜索每个项目都附核心代码和调优参数帮你把网页数据接进自己的 AI 应用。快速上手5分钟跑通第一次抓取三步完成初始化装 SDK、配密钥、发第一次请求。pip install firecrawl-pyexport FIRECRAWL_API_KEYfc-你的密钥from firecrawl import FirecrawlApp app FirecrawlApp() result app.scrape_url(https://example.com) print(result.get(markdown, )[:200])这段代码做了三件事初始化客户端、抓取目标页面、把返回的 Markdown 打出来看一眼。确认能拿到干净文本后下面的场景就可以逐个照搬。场景一搭建电商价格监控看板 痛点消费者盯着大促页面手动刷价格费时还容易错过限时折扣卖家想知道竞品价格曲线更是没辙。思路整条流水线是定时抓取 → 入库 → 画图 → 告警。项目用 Firecrawl 抓商品页拿当前价格写进 Supabase 的 Postgres 表Streamlit 画历史曲线价格跌破阈值就推 Discord 通知GitHub Actions 按小时调度全程免费。完整代码在 examples/blog-articles/amazon-price-tracking/。代码亮点result app.scrape_url( product_url, params{formats: [extract], extract: {schema: PriceInfo.model_json_schema()}}, )用 Pydantic 模型PriceInfo声明我要价格、货币、标题三个字段Firecrawl 就只吐这些字段的结构化结果不用自己正则切 HTML。延伸把阈值从固定金额改成百分比跌幅能过滤掉日常毛刺波动调度频率降到每天两次足够覆盖多数电商的变价节奏还省额度场景二让博客自动长出内链 痛点内容团队发新文章时经常忘记把旧文章链进来网站结构越做越散SEO 权重留不住。思路先抓目标博客页拿正文再用map_url扫出整个站点的全部链接这一步不逐页抓取大站也快最后把正文 站内链接清单交给 LLM让它只改链接不动正文输出改好的 Markdown。源码见 examples/internal_link_assistant/。代码亮点blog_md app.scrape_url(url, params{formats: [markdown]})[markdown] links app.map_url(base_domain).get(links, []) prompt f正文{blog_md}\n站内页面{links}\n请只插入内链返回Markdown抓正文和扫站点是两次独立调用map_url负责列清单scrape_url负责读内容分工清楚、成本可控。延伸给 LLM 加一条约束只链向主题词重合度高的页面避免硬塞广告位把输出的 Markdown 直接接进 CMS 的草稿接口实现半自动发布场景三三步跑通公司情报流水线 痛点做尽调或竞品分析时信息散落在官网、新闻、招聘页里人工翻网页整理字段一份报告要花半天。思路分三步接力。第一步用 SerpAPI 搜公司名 想了解的信息拿到候选链接第二步让 Gemini 2.5 从搜索结果里挑出真正相关的几个 URL滤掉社交链接和广告位第三步把选中的 URL 交给 Firecrawl 的 extract 接口按提示词直接出结构化字段。示例在 examples/gemini-2.5-web-extractor/。代码亮点payload {urls: urls, prompt: f提取{company}的成立时间、业务线、融资情况, enableWebSearch: True} resp requests.post(EXTRACT_URL, headersheaders, jsonpayload, timeout30)extract 接口是异步的提交后拿一个 job id轮询到完成才取结果代码里记得加轮询循环而不是读第一次响应。延伸搜索源可以换成任意你已有账号的搜索引擎接口省掉 SerpAPI 费用选 URL 的模型换成更便宜的 Flash 档挑链接任务不需要大模型场景四深度研究版智能租房助手 痛点换房用户要在十几个租房站之间横跳比价条件一多就乱手动整理信息不现实。思路把找房交给 Firecrawl 的 deep_research。它接受一句自然语言查询自动多轮搜索、抓页、分析参数用maxDepth控制迭代轮数、timeLimit控总时长、maxUrls封顶分析页数on_activity回调实时打印每轮在干什么过程完全可见。研究完把源材料喂给 Claude 3.7强制输出固定 JSON 结构终端里直接渲染成对比卡片。源码在 examples/deep-research-apartment-finder/。代码亮点params {maxDepth: 3, timeLimit: 180, maxUrls: 20} results firecrawl.deep_research( query杭州滨江两居室预算4500带阳台, paramsparams, on_activityprint_progress, )三个参数就是成本旋钮maxUrls每加 10 个页面耗时和费用都明显上升先用 20 试水再放开。延伸把最终 JSON 结果存 SQLite多租几次就能对比同一小区的价格变化提示词里写死字段名后续接任何下游系统都不用改解析逻辑Firecrawl 能力速查表功能典型场景关键调用方式单页抓取抓正文、转 Markdownapp.scrape_url(url, params{formats: [markdown]})结构化提取按字段抽价格、新闻条目formats[extract]配 Pydantic 模型 schema整站链接映射内链分析、站点摸底app.map_url(domain)只列链接不抓正文整站爬虫批量采集多个页面app.crawl_url(url)用 limit 控页数深度研究多轮搜索抓取分析deep_research(query, params, on_activity)extract 接口多 URL 批量出结构化字段POST 提交 job id轮询取结果避坑指南限流先看额度free 档有并发和页面数上限批量任务被 429 时加退避重试别裸循环硬刷超时设保守deep_research 和 extract 都是异步任务SDK 超时建议给足研究类任务 180 秒起步反爬页面换思路登录墙或强反爬站点抓不到正文时换官方 API 或第三方数据源别死磕密钥别进仓库FIRECRAWL_API_KEY放.env或环境变量.env加进.gitignoreCI 里用 secret 注入提取 schema 别贪多一次提取的字段越多、每页越贵不确定的字段先砍掉再迭代写在最后以上 4 个项目覆盖了从单页提取到多轮深度研究的全部链路代码都能直接克隆运行。更多示例见仓库的 examples/各语言 SDK 在 apps/ 目录下。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考