SEO Tool Herramienta actualizada hace 1 hora

Rastreador de Datos de Páginas Web Online Gratis

Al usar esta herramienta gratuita de rastreo de datos online puedes extraer y copiar datos de páginas web, además de descargarlos en tu dispositivo (formato Excel).

Web Data Scraper Extract Data HTML Scraper Export Results

Uso Rastreador de Datos de Páginas Web Online Gratis

Configuración

1 Cargar contenido de la fuente
Consejo: Utiliza una página de listado, no una página de detalles de un solo artículo.
Máximo recomendado: 3 MB 0 personajes
El modo de selección está activado: Haz clic en el elemento resaltado en la vista previa.
2 Selecciona el elemento que se repite
Elige una tarjeta o un elemento que se repita en la lista. En el caso de las tablas, haz clic en cualquier celda y seleccionaremos automáticamente la fila.
3 Campos que hay que rellenar
Arrastra los campos para cambiar el orden de las columnas de salida.
4 Extraer datos

Vista previa de la página web

No se ha cargado ninguna página
Carga una URL o pega código HTML para iniciar la selección visual.

Resultados extraídos

Tu tabla aparecerá aquí una vez que se haya extraído.
Enlace a la herramienta
Copiado en el portapapeles.
Ayúdanos a mejorar esta herramienta
232
Tiempo empleado
205
Número total de usuarios
5+ años
Servido
Última revisión en hace 1 mes. Las cifras de uso se actualizan durante las auditorías periódicas. (Informes desde 21 Feb 2022)
Informar de una discrepancia

Leer el contenido

Descubre cómo funciona la herramienta y cuándo utilizarla.

¿Qué es el Scraping de páginas web gratuito en línea?

Respuesta simple (no se necesita conocimiento técnico): esta herramienta copia información repetitiva de cualquier página web pública en una tabla ordenada que puedes descargar como archivo Excel. Listas de productos, tablas de precios, directorios, resultados de búsqueda, ofertas de empleo — si una página muestra el mismo tipo de tarjeta o fila muchas veces, esta herramienta puede extraer cada una en filas y columnas en menos de un minuto. No requiere instalar software, ni cuenta, ni código.

Respuesta técnica: un banco de trabajo de extracción del lado del cliente. Tú proporcionas HTML de origen (obtenido del servidor desde una URL mediante un punto final de vista previa endurecido con verificaciones SSRF, límites de redirecciones y almacenamiento en caché, o pegado directamente), seleccionas un contenedor repetitivo con cualquier selector CSS válido, defines campos ordenados, cada uno asignado a un sub-selector más un tipo de extractor (Texto, Enlace, Imagen, HTML), y el motor devuelve un encabezado más una matriz de filas renderizada como tabla HTML con exportación a Excel con un clic (SheetJS, fallback CSV) y exportación/importación JSON de toda la configuración. Toda la extracción se ejecuta en tu navegador; el servidor solo obtiene la página fuente para las vistas previas.

Cómo usarlo — Sin habilidades técnicas

Sigue estos cinco pasos. Nada aquí requiere saber HTML.

  1. Cargar la página. Haz clic en la pestaña Desde URL, pega la dirección completa de una página de listados (una página con muchos artículos similares, no una página de producto único), y haz clic en Cargar URL. O haz clic en Desde HTML, pega el código fuente de la página y haz clic en Usar entrada HTML. Aparecerá una vista previa de la página a la derecha.
  2. Indícale qué se repite. Haz clic en Seleccionar junto al cuadro del contenedor, luego haz clic en cualquier tarjeta, fila o elemento en la vista previa. Un panel de ayuda sugiere el selector correcto (por ejemplo div.card) — haz clic en la sugerencia resaltada y se llenará automáticamente. Un clic enseña a la herramienta el patrón para todos los elementos.
  3. Elige qué recopilar. Cada fila de campo ya tiene un cuadro de nombre, un cuadro de selector y un menú desplegable de tipo. Haz clic en Seleccionar en una fila de campo, luego haz clic en la pieza exacta dentro de la vista previa (título, precio, foto). Haz clic en Agregar campo para más columnas. Elige el tipo: Texto para palabras y precios, Enlace para direcciones clicables, Imagen para fotografías, HTML para contenido con formato.
  4. Rascar. Haz clic en Iniciar scraping. Cada elemento coincidente se convierte en una fila de tabla. Un mensaje te indica cuántas filas fueron extraídas. Si algo está mal configurado, recibirás una advertencia en lenguaje sencillo, como cuál campo necesita ser re-seleccionado.
  5. Guardar. Haz clic en Exportar a Excel para una hoja de cálculo, Copiar para pegar en Google Sheets, o Exportar para guardar toda tu configuración como un archivo que podrás Importar después para repetir el mismo scrapeo.

Cómo usarlo — Referencia técnica

  1. Modos de origen. Desde URL envía al punto final de vista previa, que valida la URL (solo http/https públicas, se bloquea espacio IP privado y reservado, máximo 5 redirecciones manuales), obtiene con un tiempo de espera de 20 segundos, almacena en caché por 30 minutos, inyecta una etiqueta base para que las URLs relativas se resuelvan, e inyecta el script del agente del selector visual. Desde HTML acepta hasta 3 MB de marcado pegado con una anulacion opcional de URL base.
  2. Selector de contenedor. Cualquier selector CSS compatible con document.querySelectorAll: .product-card, table tbody tr, ul.results > li, article[data-id]. Para tablas, haz clic en cualquier celda y el selector promueve toda la fila. Un selector que no coincide con ningún nodo falla la validación con un mensaje explícito y limpia la salida obsoleta.
  3. Selectores de campo se resuelven por elemento de contenedor mediante querySelector, así que manténlos relativos: .title, a, img, td:nth-child(2). El valor especial :scope apunta al propio contenedor. Un resultado vacío para un campo produce una celda vacía, nunca un error; las filas donde todas las celdas están vacías se descartan.
  4. Tipos de extractor. Texto devuelve texto visible con etiquetas aplanadas y entidades decodificadas. Enlace devuelve el href absoluto resuelto (cadenas de consulta y fragmentos preservados). Imagen devuelve el src de imagen resuelto. HTML devuelve el HTML interno del elemento (escapado para una visualización segura en la tabla).
  5. Desinfección. Los nodos script y noscript se eliminan antes de la extracción, por lo que los rastreadores y el código integrado nunca se filtran en los resultados. La extracción en sí se basa en DOM en tu navegador — nada de lo que extraes se sube.
  6. Portabilidad de configuración. La exportación descarga el selector del contenedor más todas las definiciones de campo en formato JSON; la importación las restaura. Comparte el archivo y cualquiera podrá reproducir el mismo raspado.

Tipos de campo en resumen

Tipo Extrae Úsalo para Vacío cuando
Texto Texto visible, etiquetas aplanadas, entidades decodificadas Títulos, precios, descripciones, fechas Elemento faltante o sin texto
Enlace URL absoluta desde href Enlaces de producto, páginas de perfil, siguientes páginas Sin coincidencia de ancla, o ancla sin href
Imagen URL absoluta desde src Fotos, miniaturas, logotipos Sin coincidencia de imagen
HTML Código HTML interno Fragmentos formateados, incrustaciones, texto enriquecido Elemento faltante o vacío

Consejos, limitaciones y qué evitar

  • Usa páginas de listado, no páginas de detalle. La herramienta necesita un patrón repetitivo. Una página con un solo producto genera una sola fila.
  • No se pueden obtener páginas protegidas por inicio de sesión mediante URL. Abre la página en tu navegador, copia su código HTML y usa la opción Desde HTML.
  • El contenido renderizado con JavaScript necesita su HTML renderizado. El HTML de vista de origen puede carecer de elementos que cargan dinámicamente; usa las herramientas de desarrollador de tu navegador para copiar el marcado renderizado.
  • El HTML pegado tiene un límite de 3 MB. Las páginas muy grandes deben recortarse a la sección de listado.
  • Los enlaces relativos se resuelven contra la URL de origen (o tu URL base personalizada), para que los enlaces exportados permanezcan clicables.
  • Respeta el sitio. Extrae solo páginas que tengas permitido usar — tus propios sitios, datos públicos o fuentes con permiso. El raspado automatizado intensivo puede provocar el bloqueo de tu IP; distribuye las extracciones repetidas en el tiempo.

Derechos de autor de los datos

Nadie quiere que los datos de su sitio web sean copiados por otros con malas intenciones. Usa esta herramienta para educación, investigación, comparación de precios de tu propio catálogo, listas de prospectos a las que tienes derecho y otros propósitos legales — nunca para robar contenido, eludir muros de pago o republicar el trabajo de otra persona como propio.

Para los propietarios de datos: Newisty respeta a cada propietario de sitio. Si crees que esta herramienta se está utilizando contra tus páginas sin permiso, bloquea clientes automatizados o contáctanos y la página o sitio será bloqueado para extracciones tan pronto como sea posible.

Preguntas frecuentes

Preguntas frecuentes

Respuestas breves a las preguntas que se plantean los usuarios antes de confiar en el resultado.

No. Haz clic en Seleccionar, haz clic en el elemento en la vista previa y la herramienta escribe el selector por ti. La guía técnica anterior es solo para usuarios que desean control manual.

Páginas que repiten el mismo diseño: cuadrículas de productos, tablas, directorios, resultados de búsqueda, tablones de empleo. Las páginas de un solo artículo o producto generan una sola fila.

No por URL, porque el servidor obtiene como invitado. Carga la página tú mismo mientras estás conectado, copia el HTML y usa la pestaña Desde HTML.

Texto proporciona palabras limpias y legibles con todas las etiquetas eliminadas. HTML proporciona el marcado sin procesar dentro del elemento, útil cuando el formato, los enlaces o las incrustaciones en el contenido son importantes.

Ese elemento simplemente carece del elemento — por ejemplo, un producto sin foto. Las celdas vacías son normales y significan que el extractor no encontró nada allí, no que algo se haya roto.

El selector no coincide con nada en la página cargada. O la página cambió desde la carga, o se seleccionó el elemento equivocado. Vuelve a cargar la fuente y usa Seleccionar para hacer clic en un elemento repetitivo nuevamente.

No. La extracción se ejecuta completamente en tu navegador. El servidor solo se utiliza para obtener la página fuente para vistas previas de URL; el HTML pegado nunca sale de tu dispositivo en absoluto.

Sí. La exportación guarda el contenedor más todas las definiciones de campo como JSON. La importación las restaura instantáneamente, por lo que una extracción repetida toma segundos.

Comentarios (0)

Para debates entre usuarios, casos excepcionales y consejos de seguimiento.
Deja un comentario
Tu comentario se publicará tras enviarlo.
Aún no hay comentarios. ¡Sé el primero en comentar!
¡Cuéntanoslo!
Informar de un problema con esta herramienta

Describe el problema que has tenido para que podamos investigarlo y mejorar la herramienta.

Lo que más ayuda
Incluye la entrada, el resultado esperado, el resultado real, el navegador o dispositivo y, si resulta útil, una captura de pantalla.
El botón de captura de pantalla captura la página del navegador y adjunta la imagen generada a este formulario.
Captura de pantalla a página completa
Capturado en tu navegador con newisty.
Aún no se ha capturado ninguna captura de pantalla.
Herramienta Informe