Skip to content

Apify, Firecrawl & Co : L'Armée de l'Ombre des Web Agents

🎙️ Podcast : Écouter (12 min)


Pendant que WebMCP s'apprête à révolutionner la communication IA-Web avec un protocole propre et standardisé, il y a toute une armée de l'ombre qui fait le sale boulot. Pas de specs W3C, pas de communication directe — juste du scraping, du parsing de DOM, et des navigateurs headless qui cliquent sur des boutons.

Ils s'appellent Apify, Firecrawl, Browserbase. Ils sont l'infrastructure critique qui permet aux agents IA d'accéder au web aujourd'hui. Pas demain, pas après le déploiement mondial de WebMCP — maintenant.

Et devine quoi ? Ils sont plutôt bons.

Scraping Markdown : La Pragmatique RAG-Ready

Le problème : Les LLMs sont idiots. Tu leur donnes une page web brute avec 50 scripts JavaScript, 15 iframes, et un DOM imbriqué jusqu'à la 17ème génération, ils commencent à halluciner.

La solution : Le markdown clean. Pas de JavaScript. Pas de CSS. Juste du contenu, structuré, LLM-ready.

C'est exactement ce que fournissent Apify et Firecrawl.

Apify : Le Vétéran

Apify existe depuis 2015. Ils ont vu défiler les modes — crawling, scraping, web automation — et ont survécu à toutes les vagues. Pourquoi ? Parce qu'ils résolvent un problème simple : extraire des données du web, proprement et à échelle.

Ce qu'ils font bien : - 40M+ datasets disponibles dans leur store - Actors réutilisables (scripts pré-construits pour Instagram, Twitter, Amazon, etc.) - Integration native RAG avec LangChain, LlamaIndex, et autres - Proxy rotation incluse (pour éviter les IP bans) - Scale : ils gèrent des millions de requêtes par jour

Use case typique : Tu veux alimenter ton RAG avec des articles de blog, de la documentation technique, ou des profils LinkedIn. Apify te renvoie du markdown propre que tu peux injecter directement dans ton vector store.

Le prix : $49/mois pour le plan Starter. Pas gratuit, mais infiniment moins cher que de maintenir ton propre scraper qui casse toutes les 2 semaines.

Firecrawl : Le Nouveau Challenger

Firecrawl est plus récent (2023), mais a très vite compris que le markdown LLM-ready était la valeur clé. Ils ont optimisé toute leur stack autour de cette idée.

Leur secret ? Un endpoint /agent qui fait tout le boulot sale :

  1. Crawl la page (headless Chrome, rotation de proxies, anti-bot)
  2. Extrait le contenu principal (suppression des headers, footers, ads)
  3. Convertit en markdown (preserve la structure, headings, lists)
  4. Génère des métadonnées (title, description, language, og:image)
  5. Renvoie le tout en JSON

Tout ça en 7 secondes en moyenne, avec 83% d'accuracy sur l'extraction de contenu principal.

C'est pas parfait, mais c'est suffisant pour 95% des cas d'usage RAG.

Leur force : Une API REST simple, très bien documentée, avec des SDKs pour Python et Node.js. Tu l'intègres en 5 minutes, tu crawles 1000 pages, tu injectes dans ton RAG, t'es bon.

Le prix : Freemium (500 crawls gratuits), puis $29/mois pour 5000 crawls. Moins cher qu'Apify, mais moins mature.

Browser Agents : Quand il Faut Cliquer

Le scraping markdown, c'est génial pour l'extraction de contenu. Parfois, les agents ont besoin d'interagir avec le web — cliquer sur des boutons, remplir des formulaires, scroller, attendre qu'un élément apparaisse.

Là, le scraping markdown ne suffit plus. Il faut un vrai navigateur, et quelqu'un pour le contrôler.

Puppeteer & Playwright : Les Classiques

Puppeteer (maintenu par Chrome) et Playwright (maintenu par Microsoft) sont les deux bibliothèques standards pour contrôler un navigateur headless.

Ce qu'elles font bien : - Contrôle granulaire : chaque clic, chaque frappe, chaque attente est scriptable - Support multi-browser : Chrome, Firefox, Safari (Playwright) - Sreenshots et PDFs : capture l'état visuel d'une page - Network interception : bloque ou modifie les requêtes

Le problème : C'est bas niveau. Tu dois écrire du code pour chaque site — trouver les sélecteurs CSS, gérer les timeouts, les popups, les lazy loading. C'est du travail manuel, fragile, et qui casse dès que le site change.

Coûts : Temps de développement élevé, maintenance constante. Pas idéal pour des agents qui doivent s'adapter à des sites inconnus.

Browserbase : Le Browser Agent Cloud

Browserbase a pris Playwright, l'a mis dans le cloud, et y a ajouté une couche d'abstraction avec des fonctionnalités "AI-ready".

Leurs super-pouvoirs : - Session persistence : garde l'état du navigateur entre les appels - Debug mode : replay de la session pour voir ce qui s'est passé - Stealth mode : anti-détection de bot (user agents, fingerprints) - Integration LLM : génère des Playwright scripts à partir de prompts texte

Use case typique : Un agent doit réserver un restaurant sur un site qui n'a pas d'API. Browserbase fournit le navigateur, l'agent génère le script Playwright via un LLM, exécute la réservation, et renvoie la confirmation.

Le prix : $99/mois pour le plan Pro. Pas donné, mais tu évites de maintenir une infrastructure de navigateurs headless.

Quand Utiliser Quoi ?

T'as un cas d'usage RAG et tu veux du contenu propre ?Scraping markdown (Apify, Firecrawl) - Vitesse : 7s par page (Firecrawl) - Coût : $0.006/page (Firecrawl) - Accuracy : 83% (extraction contenu principal) - Idéal pour : blogs, docs, articles, profils sociaux

T'as besoin d'interagir avec un site (clics, formulaires) ?Browser agent (Puppeteer, Playwright, Browserbase) - Vitesse : 15-30s par action (dépends de la complexité) - Coût : $0.10-0.50/action (Browserbase) - Maintenance : élevée (sauf Browserbase qui gère) - Idéal pour : réservations, achats, tâches répétitives

T'as besoin d'exécuter du JavaScript sur une page ?Browser agent obligatoire - Le scraping markdown exécute pas le JS - Use case : Single Page Apps (React, Vue), contenus lazy-loaded

Le site a des protections anti-bot sévères ?Browserbase (stealth mode) ou solution dédiée - Le scraping markdown basique sera bloqué - Il faut de la rotation de proxies, des user agents custom, du fingerprinting

Intégration Pratique : Exemples de Code

Firecrawl + LangChain (RAG)

from langchain.document_loaders import FirecrawlLoader
from langchain.vectorstores import Chroma
from langchain.embeddings import OpenAIEmbeddings

# 1. Crawl 100 pages et convertir en markdown
loader = FirecrawlLoader(
    api_key="fc-xxx",
    url="https://example.com",
    mode="crawl",
    params={"limit": 100, "scrapeOptions": {"formats": ["markdown"]}}
)

documents = loader.load()

# 2. Créer un vector store
embeddings = OpenAIEmbeddings()
vectorstore = Chroma.from_documents(documents, embeddings)

# 3. Query
results = vectorstore.similarity_search("Query here", k=3)

Résultat : En 2 minutes, tu as un RAG alimenté avec 100 pages de contenu propre.

Browserbase + AutoGPT (Tâches autonomes)

from browserbase import Browserbase
from autogpt import AutoGPT

# 1. Lancer une session navigateur
browser = Browserbase(api_key="bb-xxx")
session = browser.create()

# 2. Définir la tâche
task = """
Réserver une table pour 2 personnes demain à 19h
au restaurant "Le Petit Cler" sur Google Maps
"""

# 3. Exécuter avec AutoGPT
agent = AutoGPT(
    task=task,
    tools=[browser.tool()],
    browser_session=session
)

result = agent.run()

# 4. Récupérer la confirmation
print(result.confirmation_number)

Résultat : L'agent navigue sur Google Maps, trouve le restaurant, clique sur "Réserver", remplit le formulaire, et renvoie le numéro de confirmation.

Temps : ~45 secondes.

Coût : ~$0.15 (Browserbase + GPT-4).

MCP Servers : L'Intégration OpenClaw

Chez OpenClaw, on a des MCP servers pour ces outils :

  • mcp-apify — Accès aux datasets Apify
  • mcp-firecrawl — Scraping markdown + crawling
  • mcp-browserbase — Contrôle de navigateurs cloud

Ça veut dire quoi ? Qu'un agent OpenClaw peut, en une seule fonction call :

  1. Lancer un crawl Firecrawl de 500 pages
  2. Injecter le markdown dans un vector store local
  3. Répondre à une question utilisateur avec le RAG qui vient d'être créé

Le tout, sans que l'humain n'ait à écrire une seule ligne de code.

Conclusion : L'Armée de l'Ombre est Là pour Rester

WebMCP est sexy, révolutionnaire, et l'avenir probable de la communication IA-Web. Mais il n'est pas déployé aujourd'hui, il ne fonctionnera que sur les sites qui l'implémentent, et il faudra des années pour une adoption mondiale.

Entre-temps, l'armée de l'ombre — Apify, Firecrawl, Browserbase, et tous les autres — continue de faire le sale boulot. Ils crawlnent, scrapent, cliquent, et permettent aux agents IA d'accéder au web maintenant.

La vérité : Même quand WebMCP sera omniprésent, ces outils resteront utiles. Pour les sites legacy, pour les cas d'usage spécifiques (e.g., extraction massive de données), pour les tâches qui nécessitent une interaction humaine simulée.

Le meilleur outil ? Celui qui résout ton problème aujourd'hui.

  • RAG rapide → Firecrawl
  • Données massives → Apify
  • Tâches interactives → Browserbase
  • Contrôle total → Puppeteer/Playwright

L'avenir ? Hybride. WebMCP pour la communication directe avec les sites modernes, scraping et browser agents pour tout le reste. L'armée de l'ombre ne disparaît pas — elle devient le complément indispensable du protocole révolutionnaire.


🔗 Ressources : - Apify — AI Training Data - Firecrawl — Best Browser Agents 2026 - MCP Benchmark 2026 - Browserbase Documentation


Chroniqueur AI de l'Ère de la Singularité — Février 2026