GitHub Trending | Crawl4AI:为 AI 而生的开源爬虫,轻松产出结构�?Markdown

推荐阅读

• Github 资料项目合集

• 50�?AI 开源项目合集• 80 款AI 开源合集

  • 戳上方蓝字�?牛皮糖不吹牛*”关注我

大家好,我是牛皮糖! 如果你正在为 AI 项目搜集训练数据、构建知识库,或者搭�?Retrieval-Augmented Generation(RAG)系统,那么这款工具 Crawl4AI 一定值得你了解。它专为 AI 场景设计,能够高效抓取网页内容,并生成干净结构化的数据输出�?

🔍 什么是 Crawl4AI�?

Crawl4AI 是一个开源的、面�?LLM 和数据流水线的智能爬虫工具,它在 GitHub 上火速升温,目前是开源界非常流行的项目之一

  • �?�?高效抓取网页,适配动态加载与复杂结构

  • �?�?自动生成 Markdown 格式内容,友好支�?RAG 流程

  • �?�?支持深度爬取、提取策略、代理、多页面处理等全链路能力

�?核心亮点速览

特�?
说明
✍️ Markdown 输出
默认生成 result.markdown 和 fit_markdown,便于模型训练或文档整合�?[Crawl4AI Documentation][3])
🧠 CSS/XPath/LLM 提取
可用 CSS/XPath 规则,也可用 LLM 帮你自动提取数据结构�?[DICloak][2], [apidog][4])
🌐 浏览器控制能�?
通过 Playwright 完成模拟登录、session 管理、弹窗处理、代理设置等任务�?[Crawl4AI Documentation][5], [GitHub][1])
🤖 自适应爬虫策略
支持 BFS、DFS、BestFirst 等不同的网页探索策略,还能判断信息饱和自动停止爬取�?[ScrapingBee][6], [apidog][4])
�?高并发与性能优化
异步架构 + 分块提取 + proxy rotation,实现大规模爬取效率高、稳定�?[GitHub][1], [GitHub][7])

🚀 快速使用指�?

安装方式

pip install -U crawl4ai crawl4ai-setup crawl4ai-doctor无需 API Key 即可开始使用(如需 LLM 提取功能,建议配�?OpenAI �?Ollama Key�?[GitHub][1], [milvus.io][8])�?

第一个爬虫脚�?

`import asyncio
from crawl4ai import AsyncWebCrawler

async def main():
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(url=”https://example.com“)
        print(result.markdown[:300])

if name == “main“:
    asyncio.run(main())`这段代码将自动输出网页内容的 Markdown 格式,非常适合快速把页面内容转成结构化文本�?[DICloak][2])

使用 CSS 规则提取结构化数�?

from crawl4ai import JsonCssExtractionStrategy, AsyncWebCrawler async def main():     schema = { "baseSelector": "div.item", "fields": [{"name":"title","selector":"h2","type":"text"}]}     async with AsyncWebCrawler(config={"extraction_strategy": JsonCssExtractionStrategy(schema)}) as crawler:         result = await crawler.arun(url="https://example.com")         print(result.extracted_content) asyncio.run(main())快速输�?JSON 格式数据,适合批量提取结构化列表信息�?[ScrapingBee][6], [Crawl4AI Documentation][3])

使用 LLM 智能提取

LLM 提取支持 OpenAI、Ollama 等模型,自动分析页面内容,提取所需字段结构,可用于复杂页面结构的智能提取�?[DICloak][2])

�?深度爬虫玩法

调用 CLI 命令 crwl --deep-crawl,或�?Python 的 adeep_crawl 方法,支�?BFS、DFS、BestFirst 多种策略,并可控制爬取深度与数量。非常适合抓取文档网站或知识库页面�?[apidog][4])

示例�?

result_generator = await crawler.adeep_crawl(     start_url="https://docs.crawl4ai.com/",     strategy="bfs",     max_depth=2,     max_pages=10 )## 🧩 应用场景示例

  • �?构建法律类问答系统:抓取法规、条例、判例,生成知识库并结合 RAG�?

  • �?商业竞争情报监控:每日抓取电商报价与评论,输出结构化表格数据�?

  • �?学术研究资料收集:提取博客或论文摘要,配合文本分析或 sentiment tracking�?

🛠 注意事项与建�?

  • �?抓取前请遵守目标网站的 robots.txt 和法律法规;

  • �?深度或高频模式请设置请求间隔并使用代理策略;

  • �?CSS/XPath 提取规则应根据网站结构灵活调整;

  • �?配合 LLM 语义抽取可能产生费用,注意控�?Token 使用量或选择本地模型�?

 

Crawl4AI 是一款引领数据采集新时代的爬虫工具,专为 AI 开发者与研究者打造。它不仅彻底开源,还兼顾性能、结构化、智能提取与扩展性。不论你是新手还是资深工程师,都能快速上手并构建高质量数据流水线�?

项目地址�?

https://github.com/unclecode/crawl4ai

·················END·················

关于AI工具

Github开源文本转语音神器Spark-TTS开源了,克隆声音仅需3秒?

github开源B站UP主都在用的下载神器!Cobalt让你轻松搬运高清素材!

Github 26k Stars 开源换脸神器

Github 开源无代码�?Web 数据提取平台�?分钟内训练机器人自动抓取网页数据

每日更新,期待与你一起成�?

欢迎围观副业知识星球