Rastreador de Datos de Páginas Web Online Gratis
Al usar esta herramienta gratuita de rastreo de datos online puedes extraer y copiar datos de páginas web, además de descargarlos en tu dispositivo (formato Excel).
Uso Rastreador de Datos de Páginas Web Online Gratis
Configuración
Vista previa de la página web
No se ha cargado ninguna páginaResultados extraídos
Leer el contenido
¿Qué es el Scraping de páginas web gratuito en línea?
Respuesta simple (no se necesita conocimiento técnico): esta herramienta copia información repetitiva de cualquier página web pública en una tabla ordenada que puedes descargar como archivo Excel. Listas de productos, tablas de precios, directorios, resultados de búsqueda, ofertas de empleo — si una página muestra el mismo tipo de tarjeta o fila muchas veces, esta herramienta puede extraer cada una en filas y columnas en menos de un minuto. No requiere instalar software, ni cuenta, ni código.
Respuesta técnica: un banco de trabajo de extracción del lado del cliente. Tú proporcionas HTML de origen (obtenido del servidor desde una URL mediante un punto final de vista previa endurecido con verificaciones SSRF, límites de redirecciones y almacenamiento en caché, o pegado directamente), seleccionas un contenedor repetitivo con cualquier selector CSS válido, defines campos ordenados, cada uno asignado a un sub-selector más un tipo de extractor (Texto, Enlace, Imagen, HTML), y el motor devuelve un encabezado más una matriz de filas renderizada como tabla HTML con exportación a Excel con un clic (SheetJS, fallback CSV) y exportación/importación JSON de toda la configuración. Toda la extracción se ejecuta en tu navegador; el servidor solo obtiene la página fuente para las vistas previas.
Cómo usarlo — Sin habilidades técnicas
Sigue estos cinco pasos. Nada aquí requiere saber HTML.
- Cargar la página. Haz clic en la pestaña Desde URL, pega la dirección completa de una página de listados (una página con muchos artículos similares, no una página de producto único), y haz clic en Cargar URL. O haz clic en Desde HTML, pega el código fuente de la página y haz clic en Usar entrada HTML. Aparecerá una vista previa de la página a la derecha.
- Indícale qué se repite. Haz clic en Seleccionar junto al cuadro del contenedor, luego haz clic en cualquier tarjeta, fila o elemento en la vista previa. Un panel de ayuda sugiere el selector correcto (por ejemplo div.card) — haz clic en la sugerencia resaltada y se llenará automáticamente. Un clic enseña a la herramienta el patrón para todos los elementos.
- Elige qué recopilar. Cada fila de campo ya tiene un cuadro de nombre, un cuadro de selector y un menú desplegable de tipo. Haz clic en Seleccionar en una fila de campo, luego haz clic en la pieza exacta dentro de la vista previa (título, precio, foto). Haz clic en Agregar campo para más columnas. Elige el tipo: Texto para palabras y precios, Enlace para direcciones clicables, Imagen para fotografías, HTML para contenido con formato.
- Rascar. Haz clic en Iniciar scraping. Cada elemento coincidente se convierte en una fila de tabla. Un mensaje te indica cuántas filas fueron extraídas. Si algo está mal configurado, recibirás una advertencia en lenguaje sencillo, como cuál campo necesita ser re-seleccionado.
- Guardar. Haz clic en Exportar a Excel para una hoja de cálculo, Copiar para pegar en Google Sheets, o Exportar para guardar toda tu configuración como un archivo que podrás Importar después para repetir el mismo scrapeo.
Cómo usarlo — Referencia técnica
- Modos de origen. Desde URL envía al punto final de vista previa, que valida la URL (solo http/https públicas, se bloquea espacio IP privado y reservado, máximo 5 redirecciones manuales), obtiene con un tiempo de espera de 20 segundos, almacena en caché por 30 minutos, inyecta una etiqueta base para que las URLs relativas se resuelvan, e inyecta el script del agente del selector visual. Desde HTML acepta hasta 3 MB de marcado pegado con una anulacion opcional de URL base.
- Selector de contenedor. Cualquier selector CSS compatible con document.querySelectorAll: .product-card, table tbody tr, ul.results > li, article[data-id]. Para tablas, haz clic en cualquier celda y el selector promueve toda la fila. Un selector que no coincide con ningún nodo falla la validación con un mensaje explícito y limpia la salida obsoleta.
- Selectores de campo se resuelven por elemento de contenedor mediante querySelector, así que manténlos relativos: .title, a, img, td:nth-child(2). El valor especial :scope apunta al propio contenedor. Un resultado vacío para un campo produce una celda vacía, nunca un error; las filas donde todas las celdas están vacías se descartan.
- Tipos de extractor. Texto devuelve texto visible con etiquetas aplanadas y entidades decodificadas. Enlace devuelve el href absoluto resuelto (cadenas de consulta y fragmentos preservados). Imagen devuelve el src de imagen resuelto. HTML devuelve el HTML interno del elemento (escapado para una visualización segura en la tabla).
- Desinfección. Los nodos script y noscript se eliminan antes de la extracción, por lo que los rastreadores y el código integrado nunca se filtran en los resultados. La extracción en sí se basa en DOM en tu navegador — nada de lo que extraes se sube.
- Portabilidad de configuración. La exportación descarga el selector del contenedor más todas las definiciones de campo en formato JSON; la importación las restaura. Comparte el archivo y cualquiera podrá reproducir el mismo raspado.
Tipos de campo en resumen
| Tipo | Extrae | Úsalo para | Vacío cuando |
|---|---|---|---|
| Texto | Texto visible, etiquetas aplanadas, entidades decodificadas | Títulos, precios, descripciones, fechas | Elemento faltante o sin texto |
| Enlace | URL absoluta desde href | Enlaces de producto, páginas de perfil, siguientes páginas | Sin coincidencia de ancla, o ancla sin href |
| Imagen | URL absoluta desde src | Fotos, miniaturas, logotipos | Sin coincidencia de imagen |
| HTML | Código HTML interno | Fragmentos formateados, incrustaciones, texto enriquecido | Elemento faltante o vacío |
Consejos, limitaciones y qué evitar
- Usa páginas de listado, no páginas de detalle. La herramienta necesita un patrón repetitivo. Una página con un solo producto genera una sola fila.
- No se pueden obtener páginas protegidas por inicio de sesión mediante URL. Abre la página en tu navegador, copia su código HTML y usa la opción Desde HTML.
- El contenido renderizado con JavaScript necesita su HTML renderizado. El HTML de vista de origen puede carecer de elementos que cargan dinámicamente; usa las herramientas de desarrollador de tu navegador para copiar el marcado renderizado.
- El HTML pegado tiene un límite de 3 MB. Las páginas muy grandes deben recortarse a la sección de listado.
- Los enlaces relativos se resuelven contra la URL de origen (o tu URL base personalizada), para que los enlaces exportados permanezcan clicables.
- Respeta el sitio. Extrae solo páginas que tengas permitido usar — tus propios sitios, datos públicos o fuentes con permiso. El raspado automatizado intensivo puede provocar el bloqueo de tu IP; distribuye las extracciones repetidas en el tiempo.
Derechos de autor de los datos
Nadie quiere que los datos de su sitio web sean copiados por otros con malas intenciones. Usa esta herramienta para educación, investigación, comparación de precios de tu propio catálogo, listas de prospectos a las que tienes derecho y otros propósitos legales — nunca para robar contenido, eludir muros de pago o republicar el trabajo de otra persona como propio.
Para los propietarios de datos: Newisty respeta a cada propietario de sitio. Si crees que esta herramienta se está utilizando contra tus páginas sin permiso, bloquea clientes automatizados o contáctanos y la página o sitio será bloqueado para extracciones tan pronto como sea posible.
Preguntas frecuentes
Preguntas frecuentes
Comentarios (0)
Describe el problema que has tenido para que podamos investigarlo y mejorar la herramienta.