
Zyte, Apify et ScrapingBee promeuvent l'extraction assistée IA. La promesse : HTML → JSON sans sélecteurs site-specific. La réalité : puissant mais avec garde-fous.
Pipeline hybride : Scrapy collecte HTML → chunk + clean → prompt LLM avec schema JSON → validation → reject/review humaine → stockage.
Coût : GPT-4o-mini pour volume, GPT-4o pour structures complexes. Cache par hash page. Coût typique : $0,001–0,01/page.
Anti-hallucination : citations (spans source), validation schema, checks cohérence, audit humain échantillon.
LLM gagne : agrégateurs templates inconsistants, e-commerce long-tail, forums. Rules gagnent : JSON-LD stable, APIs, formats liste répétés.
Jean Cailleux dirige notre R&D extraction IA. Contact info@scrapy.ninja pour un pilot LLM.


