
Los sitios web modernos cargan datos críticos vía JavaScript tras el HTML inicial. Las SPA de React, Vue y Angular a menudo devuelven divs vacíos a clientes HTTP simples. Los navegadores headless ejecutan JS como un usuario real.
Puppeteer (Google, Node.js, solo Chrome/Chromium) pionereó la categoría. Ecosistema maduro, buena documentación, integración estrecha con Chrome DevTools. Debilidad: un solo navegador, solo Node.
Playwright (Microsoft, 2020+) soporta Chromium, Firefox y WebKit desde una API. Mejor auto-wait, tracing y pruebas cross-browser. Nuestra elección para nuevos proyectos Node/TypeScript. scrapy-playwright lo integra en pipelines Python.
Scrapy solo gestiona ~80% de objetivos con HTML estático — más rápido y barato. Añade Splash (deprecated) o Playwright cuando chocas con muros JS.
Nuestro benchmark interno en 50 páginas de producto e-commerce: Scrapy estático — 12% éxito, 50 ms/página. Playwright — 96% éxito, 2,1 s/página. El trade-off es claro: usa navegadores solo cuando sea necesario, pero no los omitas cuando debas.
Scrapy Ninja selecciona automáticamente la herramienta adecuada por objetivo en nuestros pipelines gestionados. Tú describes los datos; nosotros elegimos el stack.


