मुफ़्त ऑनलाइन वेबपेज डेटा स्क्रैपर
इस मुफ़्त ऑनलाइन डेटा स्क्रैपर टूल का उपयोग करके आप वेब पेजों से डेटा स्क्रैप और कॉपी कर सकते हैं और इसे अपने डिवाइस पर (Excel फॉर्मेट में) डाउनलोड भी कर सकते हैं।
उपयोग करें मुफ़्त ऑनलाइन वेबपेज डेटा स्क्रैपर
सेटअप
वेबसाइट पूर्वावलोकन
कोई पृष्ठ लोड नहीं हुआखुरचकर प्राप्त परिणाम
सामग्री पढ़ें
फ्री ऑनलाइन वेबपेज डेटा स्क्रेपर क्या है?
सरल उत्तर (तकनीकी ज्ञान की आवश्यकता नहीं): यह टूल किसी भी सार्वजनिक वेब पेज से दोहरावी जानकारी को एक व्यवस्थित टेबल में कॉपी करता है, जिसे आप एक्सेल फ़ाइल के रूप में डाउनलोड कर सकते हैं। उत्पाद सूचियां, मूल्य तालिकाएं, निर्देशिका दर्जा, सर्च परिणाम, नौकरी की सूचियां — यदि कोई पेज एक ही प्रकार की कार्ड या पंक्ति कई बार दिखाता है, तो यह टूल उन्हें एक मिनट से कम समय में पंक्तियों और स्तंभों में खींच सकता है। इंस्टॉल करने के लिए किसी सॉफ़्टवेयर की आवश्यकता नहीं, कोई खाता नहीं, कोई कोड नहीं।
तकनीकी उत्तर: एक क्लाइंट-साइड एक्सट्रैक्शन वर्कबेंच। आप स्रोत HTML प्रदान करते हैं (जिसे एक सुरक्षित पूर्वावलोकन एंडपॉइंट के माध्यम से सर्वर-साइड से URL पर Fetch किया जाता है जिसमें SSRF जाँच, रीडायरेक्ट सीमाएं और कैशिंग होती है), या सीधे पेस्ट करता है, किसी वैध CSS चयनकर्ता के साथ एक दोहराव वाला कंटेनर चुनते हैं, प्रत्येक क्रमिक फ़ील्ड को एक सब-चयनकर्ता और एक एक्सट्रैक्टर प्रकार (Text, Link, Image, HTML) के साथ मैप करते हैं, और इंजन एक हेडर और रो मैट्रिक्स को HTML टेबल के रूप में लौटाता है जिसमें एक-क्लिक एक्सेल निर्यात (SheetJS, CSV फॉलबैक) और संपूर्न सेटअप के JSON निर्यात/आयात होते हैं। सभी एक्सट्रैक्शन आपके ब्राउज़र में चलते हैं; सर्वर केवल पूर्वावलोकन के लिए स्रोत पेज को Fetch करता है।
इसे कैसे उपयोग करें — तकनीकी कौशल की आवश्यकता नहीं
ये पाँच कदम अनुसरण करें। यहां कुछ भी HTML जानने की आवश्यकता नहीं है।
- पेज लोड करें। From URL टैब पर क्लिक करें, किसी लिस्टिंग पेज (अनेक समान आइटम वाले पेज, न कि एकल उत्पाद पेज) का पूर्ण पता पेस्ट करें, और Load URL पर क्लिक करें। या From HTML पर क्लिक करें, पेज स्रोत पेस्ट करें, और Use HTML Input पर क्लिक करें। पेज का पूर्वावलोकन दाईं ओर प्रकट होता है।
- यह बताएं कि क्या दोहराता है। कंटेनर बॉक्स के बगल में Select पर क्लिक करें, फिर पूर्वावलोकन में किसी भी कार्ड, पंक्ति, या आइटम पर क्लिक करें। एक सहायक पैनल सही चयनकर्ता सुझाता है (उदाहरण के लिए div.card) — हाइलाइटेड सुझाव पर क्लिक करें और यह स्वचालित रूप से भर जाएगा। एक क्लिक टूल को सभी आइटमों के लिए पैटर्न सिखाता है।
- चुनें कि क्या एकत्र करना है। प्रत्येक फ़ील्ड पंक्ति में पहले से ही एक नाम बॉक्स, एक चयनकर्ता बॉक्स, और एक प्रकार ड्रॉपडाउन होता है। एक फ़ील्ड पंक्ति पर Select क्लिक करें, फिर पूर्वावलोकन में सटीक टुकड़े (शीर्षक, मूल्य, फ़ोटो) पर क्लिक करें। अधिक स्तंभों के लिए Add field क्लिक करें। प्रकार चुनें: शब्दों और मूल्यों के लिए Text, क्लिक करने योग्य पताओं के लिए Link, तस्वीरों के लिए Image, प्रारूपित सामग्री के लिए HTML।
- स्क्रेप करें। Start scraping पर क्लिक करें। प्रत्येक मिलान आइटम एक टेबल पंक्ति बन जाता है। एक संदेश बताता है कि कितनी पंक्तियां निकाली गईं। यदि कुछ गलत कॉन्फ़िगर है तो आपको एक साधारण भाषा चेतावनी मिलती है, जैसे किस फ़ील्ड को फिर से चुनना है।
- सेव करें। स्प्रैडशीट के लिए Export to Excel पर क्लिक करें, Google Sheets में चिपकाने के लिए Copy, या पूरे सेटअप को एक फ़ाइल के रूप में सेव करने के लिए Export ताकि बाद में उसी स्क्रेप को दोहराने के लिए Import किया जा सके।
इसे कैसे उपयोग करें — तकनीकी संदर्भ
- स्रोत मोड। From URL पूर्वावलोकन एंडपॉइंट पर पोस्ट करता है, जो URL को वैधता देता है (केवल सार्वजनिक http/https, निजी और रज़र्व IP स्पेस अवरुद्ध, अधिकतम 5 मैन्युअल रीडायरेक्ट), 20-सेकंड टाइमआउट के साथ Fetch करता है, 30 मिनट के लिए कैश करता है, सामान्य URLs के समाधान के लिए base टैग इंजेक्ट करता है, और visual-picker एजेंट स्क्रिप्ट इंजेक्ट करता है। From HTML 3 MB तक पेस्ट किए गए मार्कअप को वैकल्पिक base URL ओवरराइड के साथ स्वीकार करता है।
- कंटेनर चयनकर्ता। कोई भी वैध document.querySelectorAll-अनुकूल CSS चयनकर्ता: .product-card, table tbody tr, ul.results > li, article[data-id]। टेबल्स के लिए, किसी भी सेल पर क्लिक करें और पिकर पूरी पंक्ति को प्रमोट करता है। शून्य नोड्स से मिलान वाला एक चयनकर्ता स्पष्ट संदेश के साथ वैधता असफल होता है और पुराने आउटपुट को साफ़ करता है।
- फ़ील्ड चयनकर्ता querySelector के माध्यम से प्रति कंटेनर आइटम हल होते हैं, इसलिए उन्हें सापेक्ष रखें: .title, a, img, td:nth-child(2)। विशेष मान :scope कंटेनर को लक्ष्य करता है। किसी एक फ़ील्ड के लिए खाली परिणाम खाली सेल देता है, कभी भी त्रुटि नहीं; जहां सभी सेल खाली होते हैं वहां पंक्तियों को छोड़ दिया जाता है।
- एक्सट्रैक्टर प्रकार। Text टैग को फ्लैट करके और एंटिटियों को डिकोड करके दृश्यमान पाठ लौटाता है। Link हल किए गए निरपेक्ष href को लौटाता है (क्वेरी स्ट्रिंग और फ़्रैगमेंट संरक्षित)। Image हल किए गए इमेज src को लौटाता है। HTML तत्व का आंतरिक HTML लौटाता है (सुरक्षित टेबल प्रदर्शन के लिए एस्केप्ड)।
- सनिटाइजेशन। script और noscript नोड्स एक्सट्रैक्शन से पहले हटा दिए जाते हैं, ताकि ट्रैकर और एम्बेडेड कोड कभी भी परिणामों में लीक न हों। एक्सट्रैक्शन स्वयं आपके ब्राउज़र में DOM-आधारित है — आप जो कुछ भी स्क्रेप करते हैं वह अपलोड नहीं होता।
फील्ड प्रकार: एक नज़र में
| प्रकार | ग्रैब | किस काम के लिए | खाली कब |
|---|---|---|---|
| टेक्स्ट | दिखने वाला टेक्स्ट, टैग सादा, entities डीकोडेड | शीर्षक, कीमतें, विवरण, तारीखें | एलिमेंट गायब हो या उसमें टेक्स्ट न हो |
| लिंक | href से पूर्ण URL | उत्पाद लिंक, प्रोफ़ाइल पेज, अगले पेज | कोई anchor मैच न हो, या anchor में href न हो |
| इमेज | src से पूर्ण URL | फ़ोटो, थंबनेल, लोगो | कोई इमेज मैच न हो |
| HTML | इनर HTML स्रोत | फ़ॉर्मैटेड स्निपेट, एम्बेड, रिक टेक्स्ट | एलिमेंट गायब हो या खाली हो |
टिप्स, सीमाएँ, और किन बातों से बचें
- लिस्टिंग पेज का प्रयोग करें, डीटेल्स पेज का नहीं। टूल को दोहरा पैटर्न चाहिए। एक ही उत्पाद वाली पेज से केवल एक ही पंक्ति बनेगी।
- लॉगिन वाले पेज URL से नहीं-fetch होते। अपने ब्राउज़र में पेज खोलें, उसका HTML स्रोत कॉपी करें और From HTML विकल्प का प्रयोग करें।
- JavaScript-रेंडर सामग्री को रेंडर किया हुआ HTML चाहिए। View-source HTML में डिनामिक रूप से लोड होने वाली चीज़ें नहीं होतीं; ब्राउज़र डेवलपर टूल्स से रेंडर मार्कअप कॉपी करें।
- पेस्ट किया हुआ HTML 3 MB तक सीमित है। बहुत बड़ी पेजों को लिस्टिंग सेक्शन तक ही छोटा करें।
- रिलेटिव लिंक स्रोत URL (या आपके ओवरराइड बेस URL) के सापेक्ष resolve होते हैं, इसलिए एक्सपोर्ट किए गए लिंक हमेशा क्लिक करने योग्य रहते हैं।
- साइट का सम्मान करें। केवल उन पेजों का scrape करें जिनका उपयोग आपको करने की अनुमति है — अपने sites, सार्वजनिक डेटा, या अनुमति वाले स्रोत। भारी ऑटोमैटेड री-स्क्रैपिंग से आपका IP बैन हो सकता है; बार-बार fetch करने के बीच समय दें।
डेटा कॉपीराइट
कोई नहीं चाहता कि इसकी वेबसाइट का डेटा बुरी niyat से कोई copy करे। इस टूल का प्रयोग शिक्षा, शोध, अपने कैटलॉग की कीमत तुलना, उन लीड लिस्ट के लिए करें जिनके आपको अधिकार हैं, और अन्य कानूनी उद्देश्यों के लिए — कभी भी सामग्री चोरी, paywall को तोड़ना, या किसी और की मेहनत को अपने नाम से प्रकाशित करने के लिए नहीं।
डेटा मालिकों के लिए: Newisty हर साइट मालिक का सम्मान करता है। यदि आपको लगता है कि इस टूल का उपयोग आपके पेजों के खिलाफ अनुमति के बिना हो रहा है, तो ऑटोमैटेड क्लाइंट्स को ब्लॉक करें या हमसे संपर्क करें और जल्द से जल्द उस पेज या साइट को fetch से ब्लॉक कर दिया जाएगा।
अक्सर पूछे जाने वाले प्रश्न
अक्सर पूछे जाने वाले प्रश्न
टिप्पणियाँ (0)
आपको जो समस्या आई, उसका वर्णन करें ताकि हम इसकी जांच कर सकें और टूल में सुधार कर सकें।