SEO Tool टूल अपडेट किया गया एक घंटा पहले

मुफ़्त ऑनलाइन वेबपेज डेटा स्क्रैपर

इस मुफ़्त ऑनलाइन डेटा स्क्रैपर टूल का उपयोग करके आप वेब पेजों से डेटा स्क्रैप और कॉपी कर सकते हैं और इसे अपने डिवाइस पर (Excel फॉर्मेट में) डाउनलोड भी कर सकते हैं।

Web Data Scraper Extract Data HTML Scraper Export Results

उपयोग करें मुफ़्त ऑनलाइन वेबपेज डेटा स्क्रैपर

सेटअप

1 लोड स्रोत सामग्री
सुझाव: एक लिस्टिंग पेज का उपयोग करें, न कि एकल आइटम विवरण पृष्ठ का।
अधिकतम अनुशंसित: 3 एमबी 0 पात्र
चयन मोड चालू है: प्रीव्यू में हाइलाइट किए गए आइटम पर क्लिक करें।
2 दोहराए जाने वाले आइटम का चयन करें
सूची में दोहराए जाने वाले किसी एक कार्ड/आइटम का चयन करें। तालिकाओं के लिए किसी भी सेल पर क्लिक करें और हम स्वचालित रूप से पंक्ति चुन लेंगे।
3 एकत्रित करने के लिए क्षेत्र
आउटपुट स्तंभों को पुनर्व्यवस्थित करने के लिए फ़ील्ड्स को ड्रैग करें।
4 डेटा खुरचना

वेबसाइट पूर्वावलोकन

कोई पृष्ठ लोड नहीं हुआ
दृश्य चयन शुरू करने के लिए URL लोड करें या HTML पेस्ट करें।

खुरचकर प्राप्त परिणाम

स्क्रैपिंग के बाद आपकी तालिका यहां दिखाई देगी।
टूल लिंक
क्लिपबोर्ड पर कॉपी हो गया।
इस उपकरण को बेहतर बनाने में मदद करें
232
उपयोग किया गया समय
205
कुल उपयोगकर्ता
5+ वर्ष
परोसा गया
अंतिम समीक्षा एक महीने पहले. में की गई थी। उपयोग संख्याएँ आवधिक ऑडिट के दौरान ताज़ा की जाती हैं। (से रिपोर्टिंग21 Feb 2022)
अनुपालनहीनता की रिपोर्ट करें

सामग्री पढ़ें

जानें कि यह उपकरण कैसे काम करता है और इसका उपयोग कब करना है।

फ्री ऑनलाइन वेबपेज डेटा स्क्रेपर क्या है?

सरल उत्तर (तकनीकी ज्ञान की आवश्यकता नहीं): यह टूल किसी भी सार्वजनिक वेब पेज से दोहरावी जानकारी को एक व्यवस्थित टेबल में कॉपी करता है, जिसे आप एक्सेल फ़ाइल के रूप में डाउनलोड कर सकते हैं। उत्पाद सूचियां, मूल्य तालिकाएं, निर्देशिका दर्जा, सर्च परिणाम, नौकरी की सूचियां — यदि कोई पेज एक ही प्रकार की कार्ड या पंक्ति कई बार दिखाता है, तो यह टूल उन्हें एक मिनट से कम समय में पंक्तियों और स्तंभों में खींच सकता है। इंस्टॉल करने के लिए किसी सॉफ़्टवेयर की आवश्यकता नहीं, कोई खाता नहीं, कोई कोड नहीं।

तकनीकी उत्तर: एक क्लाइंट-साइड एक्सट्रैक्शन वर्कबेंच। आप स्रोत HTML प्रदान करते हैं (जिसे एक सुरक्षित पूर्वावलोकन एंडपॉइंट के माध्यम से सर्वर-साइड से URL पर Fetch किया जाता है जिसमें SSRF जाँच, रीडायरेक्ट सीमाएं और कैशिंग होती है), या सीधे पेस्ट करता है, किसी वैध CSS चयनकर्ता के साथ एक दोहराव वाला कंटेनर चुनते हैं, प्रत्येक क्रमिक फ़ील्ड को एक सब-चयनकर्ता और एक एक्सट्रैक्टर प्रकार (Text, Link, Image, HTML) के साथ मैप करते हैं, और इंजन एक हेडर और रो मैट्रिक्स को HTML टेबल के रूप में लौटाता है जिसमें एक-क्लिक एक्सेल निर्यात (SheetJS, CSV फॉलबैक) और संपूर्न सेटअप के JSON निर्यात/आयात होते हैं। सभी एक्सट्रैक्शन आपके ब्राउज़र में चलते हैं; सर्वर केवल पूर्वावलोकन के लिए स्रोत पेज को Fetch करता है।

इसे कैसे उपयोग करें — तकनीकी कौशल की आवश्यकता नहीं

ये पाँच कदम अनुसरण करें। यहां कुछ भी HTML जानने की आवश्यकता नहीं है।

  1. पेज लोड करें। From URL टैब पर क्लिक करें, किसी लिस्टिंग पेज (अनेक समान आइटम वाले पेज, न कि एकल उत्पाद पेज) का पूर्ण पता पेस्ट करें, और Load URL पर क्लिक करें। या From HTML पर क्लिक करें, पेज स्रोत पेस्ट करें, और Use HTML Input पर क्लिक करें। पेज का पूर्वावलोकन दाईं ओर प्रकट होता है।
  2. यह बताएं कि क्या दोहराता है। कंटेनर बॉक्स के बगल में Select पर क्लिक करें, फिर पूर्वावलोकन में किसी भी कार्ड, पंक्ति, या आइटम पर क्लिक करें। एक सहायक पैनल सही चयनकर्ता सुझाता है (उदाहरण के लिए div.card) — हाइलाइटेड सुझाव पर क्लिक करें और यह स्वचालित रूप से भर जाएगा। एक क्लिक टूल को सभी आइटमों के लिए पैटर्न सिखाता है।
  3. चुनें कि क्या एकत्र करना है। प्रत्येक फ़ील्ड पंक्ति में पहले से ही एक नाम बॉक्स, एक चयनकर्ता बॉक्स, और एक प्रकार ड्रॉपडाउन होता है। एक फ़ील्ड पंक्ति पर Select क्लिक करें, फिर पूर्वावलोकन में सटीक टुकड़े (शीर्षक, मूल्य, फ़ोटो) पर क्लिक करें। अधिक स्तंभों के लिए Add field क्लिक करें। प्रकार चुनें: शब्दों और मूल्यों के लिए Text, क्लिक करने योग्य पताओं के लिए Link, तस्वीरों के लिए Image, प्रारूपित सामग्री के लिए HTML।
  4. स्क्रेप करें। Start scraping पर क्लिक करें। प्रत्येक मिलान आइटम एक टेबल पंक्ति बन जाता है। एक संदेश बताता है कि कितनी पंक्तियां निकाली गईं। यदि कुछ गलत कॉन्फ़िगर है तो आपको एक साधारण भाषा चेतावनी मिलती है, जैसे किस फ़ील्ड को फिर से चुनना है।
  5. सेव करें। स्प्रैडशीट के लिए Export to Excel पर क्लिक करें, Google Sheets में चिपकाने के लिए Copy, या पूरे सेटअप को एक फ़ाइल के रूप में सेव करने के लिए Export ताकि बाद में उसी स्क्रेप को दोहराने के लिए Import किया जा सके।

इसे कैसे उपयोग करें — तकनीकी संदर्भ

  1. स्रोत मोड। From URL पूर्वावलोकन एंडपॉइंट पर पोस्ट करता है, जो URL को वैधता देता है (केवल सार्वजनिक http/https, निजी और रज़र्व IP स्पेस अवरुद्ध, अधिकतम 5 मैन्युअल रीडायरेक्ट), 20-सेकंड टाइमआउट के साथ Fetch करता है, 30 मिनट के लिए कैश करता है, सामान्य URLs के समाधान के लिए base टैग इंजेक्ट करता है, और visual-picker एजेंट स्क्रिप्ट इंजेक्ट करता है। From HTML 3 MB तक पेस्ट किए गए मार्कअप को वैकल्पिक base URL ओवरराइड के साथ स्वीकार करता है।
  2. कंटेनर चयनकर्ता। कोई भी वैध document.querySelectorAll-अनुकूल CSS चयनकर्ता: .product-card, table tbody tr, ul.results > li, article[data-id]। टेबल्स के लिए, किसी भी सेल पर क्लिक करें और पिकर पूरी पंक्ति को प्रमोट करता है। शून्य नोड्स से मिलान वाला एक चयनकर्ता स्पष्ट संदेश के साथ वैधता असफल होता है और पुराने आउटपुट को साफ़ करता है।
  3. फ़ील्ड चयनकर्ता querySelector के माध्यम से प्रति कंटेनर आइटम हल होते हैं, इसलिए उन्हें सापेक्ष रखें: .title, a, img, td:nth-child(2)। विशेष मान :scope कंटेनर को लक्ष्य करता है। किसी एक फ़ील्ड के लिए खाली परिणाम खाली सेल देता है, कभी भी त्रुटि नहीं; जहां सभी सेल खाली होते हैं वहां पंक्तियों को छोड़ दिया जाता है।
  4. एक्सट्रैक्टर प्रकार। Text टैग को फ्लैट करके और एंटिटियों को डिकोड करके दृश्यमान पाठ लौटाता है। Link हल किए गए निरपेक्ष href को लौटाता है (क्वेरी स्ट्रिंग और फ़्रैगमेंट संरक्षित)। Image हल किए गए इमेज src को लौटाता है। HTML तत्व का आंतरिक HTML लौटाता है (सुरक्षित टेबल प्रदर्शन के लिए एस्केप्ड)।
  5. सनिटाइजेशन। script और noscript नोड्स एक्सट्रैक्शन से पहले हटा दिए जाते हैं, ताकि ट्रैकर और एम्बेडेड कोड कभी भी परिणामों में लीक न हों। एक्सट्रैक्शन स्वयं आपके ब्राउज़र में DOM-आधारित है — आप जो कुछ भी स्क्रेप करते हैं वह अपलोड नहीं होता।
  • कॉन्फ़िग पोर्टेबिलिटी। Export कंटेनर सेलेक्टर और सभी फ़ील्ड परिभाषाओं को JSON के रूप में डाउनलोड करता है; Import उन्हें वापस लोड कर देता है। फ़ाइल साझा करें और कोई भी समान scrape पुनः बना सकता है।
  • फील्ड प्रकार: एक नज़र में

    प्रकार ग्रैब किस काम के लिए खाली कब
    टेक्स्ट दिखने वाला टेक्स्ट, टैग सादा, entities डीकोडेड शीर्षक, कीमतें, विवरण, तारीखें एलिमेंट गायब हो या उसमें टेक्स्ट न हो
    लिंक href से पूर्ण URL उत्पाद लिंक, प्रोफ़ाइल पेज, अगले पेज कोई anchor मैच न हो, या anchor में href न हो
    इमेज src से पूर्ण URL फ़ोटो, थंबनेल, लोगो कोई इमेज मैच न हो
    HTML इनर HTML स्रोत फ़ॉर्मैटेड स्निपेट, एम्बेड, रिक टेक्स्ट एलिमेंट गायब हो या खाली हो

    टिप्स, सीमाएँ, और किन बातों से बचें

    • लिस्टिंग पेज का प्रयोग करें, डीटेल्स पेज का नहीं। टूल को दोहरा पैटर्न चाहिए। एक ही उत्पाद वाली पेज से केवल एक ही पंक्ति बनेगी।
    • लॉगिन वाले पेज URL से नहीं-fetch होते। अपने ब्राउज़र में पेज खोलें, उसका HTML स्रोत कॉपी करें और From HTML विकल्प का प्रयोग करें।
    • JavaScript-रेंडर सामग्री को रेंडर किया हुआ HTML चाहिए। View-source HTML में डिनामिक रूप से लोड होने वाली चीज़ें नहीं होतीं; ब्राउज़र डेवलपर टूल्स से रेंडर मार्कअप कॉपी करें।
    • पेस्ट किया हुआ HTML 3 MB तक सीमित है। बहुत बड़ी पेजों को लिस्टिंग सेक्शन तक ही छोटा करें।
    • रिलेटिव लिंक स्रोत URL (या आपके ओवरराइड बेस URL) के सापेक्ष resolve होते हैं, इसलिए एक्सपोर्ट किए गए लिंक हमेशा क्लिक करने योग्य रहते हैं।
    • साइट का सम्मान करें। केवल उन पेजों का scrape करें जिनका उपयोग आपको करने की अनुमति है — अपने sites, सार्वजनिक डेटा, या अनुमति वाले स्रोत। भारी ऑटोमैटेड री-स्क्रैपिंग से आपका IP बैन हो सकता है; बार-बार fetch करने के बीच समय दें।

    डेटा कॉपीराइट

    कोई नहीं चाहता कि इसकी वेबसाइट का डेटा बुरी niyat से कोई copy करे। इस टूल का प्रयोग शिक्षा, शोध, अपने कैटलॉग की कीमत तुलना, उन लीड लिस्ट के लिए करें जिनके आपको अधिकार हैं, और अन्य कानूनी उद्देश्यों के लिए — कभी भी सामग्री चोरी, paywall को तोड़ना, या किसी और की मेहनत को अपने नाम से प्रकाशित करने के लिए नहीं।

    डेटा मालिकों के लिए: Newisty हर साइट मालिक का सम्मान करता है। यदि आपको लगता है कि इस टूल का उपयोग आपके पेजों के खिलाफ अनुमति के बिना हो रहा है, तो ऑटोमैटेड क्लाइंट्स को ब्लॉक करें या हमसे संपर्क करें और जल्द से जल्द उस पेज या साइट को fetch से ब्लॉक कर दिया जाएगा।

    अक्सर पूछे जाने वाले प्रश्न

    अक्सर पूछे जाने वाले प्रश्न

    परिणाम पर भरोसा करने से पहले उपयोगकर्ताओं द्वारा पूछे जाने वाले प्रश्नों के संक्षिप्त उत्तर।

    नहीं। Select पर क्लिक करें, प्रीव्यू में आइटम पर क्लिक करें, और टूल अपने आप सेलेक्टर लिख देगा। ऊपर दी गई तकनीकी गाइड केवल उन उपयोगकर्ताओं के लिए है जो मैनुअल कंट्रोल चाहते हैं।

    वे पेज जहाँ लेआउट दोहराता है: प्रोडक्ट ग्रिड, टेबल्स, निर्देशिका, सर्च रिजल्ट, जॉब बोर्ड। सिंगल-आर्टिकल या सिंगल-प्रोडक्ट पेज से केवल एक ही पंक्ति बनेगी।

    URL से नहीं, क्योंकि सर्वर गेस्ट के रूप में fetch करता है। लॉगिन करके खुद पेज लोड करें, HTML कॉपी करें और From HTML टैब का प्रयोग करें।

    Text सब टैग हटाकर साफ़ पढ़ने योग्य शब्द देता है। HTML एलिमेंट के अंदर का_raw_ मार्कअप देता है, जब फ़ॉर्मैटिंग, लिंक, या एम्बेड्स सामग्री के अंदर मायने रखते हों।

    वह आइटम बस उस एलिमेंट से रहित है — उदाहरण के लिए किसी उत्पाद में फ़ोटो नहीं है। खाली सेल्स सामान्य हैं और इसका मतलब है कि एक्सट्रैक्टर वहाँ कुछ नहीं मिला, इसका मतलब कुछ खराब नहीं हुआ।

    सेलेक्टर लोडेड पेज में कुछ भी मैच नहीं करता। या तो पेज लोड होने के बाद बदल गया है, या गलत एलिमेंट चुना गया है। स्रोत को रीलोड करें और Select का प्रयोग करके फिर से एक दोहराता आइटम क्लिक करें।

    नहीं। एक्सट्रैक्शन पूरी तरह आपके ब्राउज़र में चलती है। सर्वर का प्रयोग केवल URL प्रीव्यू के लिए स्रोत पेज fetch करने में होता है; पेस्ट किया हुआ HTML कभी भी आपके डिवाइस से बाहर नहीं जाता।

    हाँ। Export कंटेनर और सभी फ़ील्ड परिभाषाओं को JSON के रूप में सेव करता है। Import उन्हें तुरंत वापस ला देता है, इसलिए बार-बार scrape करने में केवल कुछ सेकंड लगते हैं।

    टिप्पणियाँ (0)

    उपयोगकर्ता चर्चा, असामान्य परिस्थितियाँ, और अनुवर्ती सुझावों के लिए।
    टिप्पणी करें
    आपकी टिप्पणी सबमिट करने के बाद सार्वजनिक रूप से दिखाई देगी।
    अभी तक कोई टिप्पणी नहीं। टिप्पणी करने वाले पहले व्यक्ति बनें!
    हमें बताएं!
    इस उपकरण में समस्या की रिपोर्ट करें

    आपको जो समस्या आई, उसका वर्णन करें ताकि हम इसकी जांच कर सकें और टूल में सुधार कर सकें।

    सबसे ज्यादा मदद क्या करता है
    इनपुट, अपेक्षित परिणाम, वास्तविक परिणाम, ब्राउज़र/डिवाइस, और जब सहायक हो तो एक स्क्रीनशॉट शामिल करें।
    स्क्रीनशॉट बटन ब्राउज़र में पृष्ठ को कैप्चर करता है और उत्पन्न छवि को इस फॉर्म से संलग्न करता है।
    पूरे पेज का स्क्रीनशॉट
    आपके ब्राउज़र में newisty के साथ कैप्चर किया गया।
    अभी तक कोई स्क्रीनशॉट नहीं लिया गया है।
    उपकरण रिपोर्ट