ข้ามไปยังเนื้อหา

f5xc-firecrawl

ปลั๊กอิน f5xc-firecrawl ให้บริการดึงข้อมูลเว็บแบบ self-hosted ในเครื่อง ผ่านเอนจิน firecrawl แบบโอเพนซอร์ส ไม่ต้องใช้ API key ไม่ต้องสมัครสมาชิก ไม่พึ่งพาคลาวด์ การ ดำเนินการทั้งหมดทำงานกับ firecrawl instance ในเครื่องที่ localhost:3002 ภายใน devcontainer

v1.1.0 Productivity
/plugin install f5xc-firecrawl@f5-sales-demo-marketplace

ดึงข้อมูลจาก URL เดียวและแปลงเนื้อหาเป็น markdown

/scrape https://docs.example.com/getting-started
/scrape https://example.com --format markdown,links --wait 2000

ดึงข้อมูลจากหลาย URL พร้อมกัน

/batch-scrape https://example.com https://example.org https://example.net

รวบรวมข้อมูลหลายหน้าจาก URL เริ่มต้น

/crawl https://docs.example.com --limit 20 --depth 2
/crawl https://docs.example.com --include /api/* --exclude /blog/*

ค้นหา URL ทั้งหมดบนเว็บไซต์

/map https://docs.example.com
/map https://docs.example.com --search api --subdomains

ค้นหาบนเว็บและดึงข้อมูลผลลัพธ์ตามต้องการ

/search "firecrawl web scraping" --limit 10
/search "AI tools 2026" --scrape --time month

การดึงข้อมูลเชิงโครงสร้างจากหน้าเว็บด้วยพลัง LLM

/extract https://example.com "Extract the main heading and any links"
/extract https://example.com/pricing --schema '{"plans": [{"name": "string", "price": "string"}]}'

สร้างไฟล์ llms.txt สำหรับเว็บไซต์

/llmstxt https://docs.example.com

เปิดใช้งานอัตโนมัติเมื่อคุณขอดึงข้อมูลจาก URL รวบรวมข้อมูลเว็บไซต์ แมป URL ของเว็บไซต์ ค้นหาบนเว็บ ดึงข้อมูลเชิงโครงสร้าง สร้าง llms.txt ดึงข้อมูลหลาย URL พร้อมกัน หรือแปลงหน้าเว็บเป็น markdown โดยส่งต่อให้ firecrawl-operator agent ทันที

Agent ดึงข้อมูลเว็บอัตโนมัติที่ประมวลผลลำดับ curl + jq กับ firecrawl API ในเครื่อง รองรับ 11 โปรโตคอลครอบคลุม endpoint ทั้งหมดของ v1 เป็น agent แบบอ่านอย่างเดียว (ไม่มีเครื่องมือ Write, Edit หรือ Agent)

โปรโตคอลEndpointประเภท
HEALTHGET /Sync
SCRAPEPOST /v1/scrapeSync
BATCH_SCRAPEPOST /v1/batch/scrapeAsync
CRAWLPOST /v1/crawlAsync
CRAWL_CANCELDELETE /v1/crawl/:idSync
CRAWL_ACTIVEGET /v1/crawl/activeSync
CRAWL_ERRORSGET /v1/crawl/:id/errorsSync
MAPPOST /v1/mapSync
SEARCHPOST /v1/searchSync
EXTRACTPOST /v1/extractAsync
LLMSTXTPOST /v1/llmstxtAsync

ปลั๊กอินต้องการสแตก firecrawl ที่ทำงานอยู่ใน devcontainer:

ส่วนประกอบพอร์ตวัตถุประสงค์
Firecrawl API3002endpoint ทั้งหมดสำหรับ scrape/crawl/map/search/extract
Playwright3000เอนจินเรนเดอร์ JavaScript
Redis6379แบ็กเอนด์คิวงาน
PostgreSQLsocketการจัดเก็บข้อมูลงาน Crawl/batch
LiteLLM proxyOPENAI_BASE_URLแบ็กเอนด์ LLM สำหรับ extract (ไม่บังคับ)

สแตกจะเริ่มทำงานอัตโนมัติเมื่อ ENABLE_FIRECRAWL=true (ค่าเริ่มต้น) hook SessionStart จะตรวจสอบว่า API เข้าถึงได้และเตือนหากบริการหยุดทำงาน

ปลั๊กอินนี้ใช้เวอร์ชัน self-hosted แบบโอเพนซอร์ส:

  • ไม่ต้องมีการยืนยันตัวตนหรือ API key สำหรับการดึงข้อมูล
  • ไม่มีการจำกัดเครดิตหรือ rate limiting
  • ใช้ endpoint API v1 (ไม่ใช่ v2)
  • ไม่รองรับ browser sessions และการค้นคว้าเชิงลึก
  • Extract ใช้ LLM proxy ของคุณเองแทนโมเดลที่โฮสต์บนคลาวด์
  • ทำงานทั้งหมดภายในเครือข่าย container ในเครื่อง