Guide de workflow

Pipeline de données web workflow

Un workflow d’agent vérifiable pour Pipeline de données web.

Un workflow d’agent vérifiable pour Pipeline de données web.

Résultat attendu

  • Clarifier l’objectif Pipeline de données web
  • Choisir les capacités adaptées
  • Vérifier le résultat avant l’étape suivante

Carte du workflow

Suivez cette séquence

01

Cadrer

Transformez le résultat demandé en tâche d’agent claire et vérifiable.

02

Choisir

Sélectionnez les capacités de l’étape actuelle plutôt qu’une catégorie générale.

03

Exécuter

Réalisez la plus petite étape utile après vérification des sources, permissions et périmètre.

04

Valider

Examinez les preuves et le résultat avant l’étape suivante.

Capacités suggérées

Choisir les skills à chaque étape

Classées selon la pertinence du workflow, la qualité, l’adoption GitHub et la fraîcheur de maintenance. C’est un guide de décision, pas une commande unique.

#1CrawleeQualité · 100

Description du dépôt (original)

Crawlee—A web scraping and browser automation library for Node.js to build reliable crawlers. In JavaScript and TypeScript. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Puppeteer, Playwright, Cheerio, JSDOM, and raw HTTP. Both headful and headless mode. With proxy rotation.

24K starsApache-2.0browser-automation
Comparer
$ npx skills add apify/crawlee
#2FirecrawlQualité · 100

Description du dépôt (original)

The API to search, scrape, and interact with the web at scale. 🔥

139K starsAGPL-3.0agent-frameworks
Comparer
$ npx skills add firecrawl/firecrawl
#3Crawlee PythonQualité · 100

Description du dépôt (original)

Crawlee—A web scraping and browser automation library for Python to build reliable crawlers. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Parsel, BeautifulSoup, Playwright, and raw HTTP. Both headful and headless mode. With proxy rotation.

9.2K starsApache-2.0browser-automation
Comparer
$ npx skills add apify/crawlee-python
#4Scrapegraph AIQualité · 100

Description du dépôt (original)

Python scraper based on AI

27K starsMITweb-automation
Comparer
$ npx skills add ScrapeGraphAI/Scrapegraph-ai
#5MaxunQualité · 100

Description du dépôt (original)

🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥

16K starsAGPL-3.0web-automation
Comparer
$ npx skills add getmaxun/maxun
#6Crawl4AIQualité · 100

Description du dépôt (original)

Open-source LLM-friendly web crawler and scraper

73K starsApache-2.0web-automation
Comparer
$ npx skills add unclecode/crawl4ai
#7LuxQualité · 100

Description du dépôt (original)

👾 Fast and simple video download library and CLI tool written in Go

31K starsMITweb-automation
Comparer
$ npx skills add iawia002/lux
#8CollyQualité · 100

Description du dépôt (original)

Elegant Scraper and Crawler Framework for Golang

25K starsApache-2.0web-automation
Comparer
$ npx skills add gocolly/colly

Bon usage

  • - Workflows Pipeline de données web
  • - Décisions d’agent auditables
  • - Essais dans un environnement contrôlé

Pas adapté quand

  • - La tâche nécessite un accès non supervisé à des systèmes sensibles
  • - Les sources ou la qualité du résultat ne peuvent pas être vérifiées

Besoin d’un pack exécutable ?

Les packs incluent ordre d’installation, liens d’audit et plan d’Agent lisible par machine.

Voir les packs