మুক্ত ఆన్లైన్ వెబ్పేజ్ డేటా స్క్రేపర్
ఈ ఉచిత ఆన్లైన్ డేటా స్క్రేపర్ టూల్ ఉపయోగించి మీరు వెబ్ పేజీల నుండి డేటాను స్క్రేప్ చేసి కాపీ చేయవచ్చు మరియు మీ పరికరంలోకి (ఎక్స్సెల్ ఫార్మాట్లో) డౌన్లోడ్ చేసుకోవచ్చు.
ఉపయోగించు మুক্ত ఆన్లైన్ వెబ్పేజ్ డేటా స్క్రేపర్
సెటప్
వెబ్సైట్ ప్రివ్యూ
పేజీ లోడ్ కాలేదుస్క్రాప్ చేసిన ఫలితాలు
విషయం చదవండి
ఫ్రీ ఆన్లైన్ వెబ్పేజ్ డేటా స్క్రేపర్ అంటే ఏమిటి?
ఏకవచన సమాధానం (సాంకేతిక జ్ఞానం అవసరం లేదు): ఈ టూల్ ఏదైనా స్వచ్చంద వేబ్ పేజీ నుండి పునరావృతమయ్యే సమాచారాన్ని నేర్చుకుని, మీరు ఎక్సెల్ ఫైల్గా డౌన్లోడ్ చేసుకోగల పద్ధతిగా పట్టికలోకి తీసుకువస్తుంది. ఉత్పత్తి జాబితాలు, ధర పట్టికలు, డైరెక్టరీ రికార్డ్లు, శోధన ఫలితాలు, ఉద్యోగ విజ్పోతనాలు — ఒకే రకమైన కార్డు లేదా వరుస ఎన్నోసార్లు కనిపించే పేజీ అయినా, ఈ టూల్ ఒక నిమిషం కంటే తక్కువలో వాటిని అన్నీ పంక్తులు మరియు నిలువు వరుసలుగా తీసివేయగలదు. ఏ సాఫ్ట్వేర్ను ఇన్స్టాల్ చేయాల్సిన అవసరం లేదు, ఏ ఖాతా కావాలనుకోకపోవచ్చు, కోడ్ కూడా కావాలనుకోకపోవచ్చు.
సాంకేతిక సమాధానం: క్లయింట్-సైడ్ ఎక్స్ట్రాక్షన్ వర్క్బెంచ్. మీరు మూల HTMLను (సర్వర్-సైడ్ నుండి హార్డెడ్ ప్రీవ్యూ ఎండ్పాయింట్ ద్వారా URL నుండి SSRF తనిఖీలు, రీడైరెక్ట్ పరిమితులు మరియు క్యాష్తో సహా అందుబాటులోకి తీసుకురావచ్చు లేదా నేరుగా పేస్ట్ చేయవచ్చు) సరఫరా చేస్తారు, ఏదైనా చెల్లుబాటు అయ్యే CSS సెలెక్టర్తో పునరావృత కాంటైனர்ను ఎంచుకుంటారు, ప్రతి పొంతనాన్ని ఒక ఉప-సెలెక్టర్తో మరియు ఎక్స్ట్రాక్టర్ రకంతో (పాఠ్యం, లింక్, బొమ్మ, HTML) జత చేస్తారు, మరియు ఇంజిన్ శీర్షికతో పాటు అడ్డు వరుస మాత్రికను HTML పట్టికగా తిరిగి ఇస్తుంది — ఒక్క క్లిక్తో ఎక్సెల్ ఎగుమతి (SheetJS, CSV ఫాల్బ్యాక్) మరియు సెటప్ సమగ్ర JSON ఎగుమతి/ఆమਦ్ద. అన్ని ఎక్స్ట్రాక్షన్లు మీ బ్రౌజర్లోనే జరుగుతాయి; సర్వర్ ప్రీవ్యూల కోసం మూల పేజీని మాత్రమే తీసుకువస్తుంది.
వాడకం ఎలా? — సాంకేతిక నైపుణ్యాలు అవసరం లేదు
ఈ ఐదు దశలను అనుసరించండి. ఇక్కడ ఏమీ HTML తెలియడం అవసరం లేదు.
- పేజీని లోడ్ చేయి. From URL టాబ్పై క్లిక్ చేసి, బహుళ సరిపోలికల ఉత్పత్తి పేజీ (ఒక్క ఉత్పత్తి పేజీ కాదు) యొక్క పూర్తి చిరునామాను పేస్ట్ చేసి, Load URL క్లిక్ చేయి. లేదా From HTML క్లిక్ చేసి, పేజీ మూలాన్ని పేస్ట్ చేసి, Use HTML Input క్లిక్ చేయి. పేజీ యొక్క ప్రీవ్యూ కుడి వైపు కనిపిస్తుంది.
- ఏది పునరావృతమవుతుందో చెప్పు. కాంటైనర్ పెట్టె పక్కన Select క్లిక్ చేసి, ఆపై ప్రీవ్యూలో ఏదైనా ఒక కార్డు, వరుస, లేదా వస్తువుపై క్లిక్ చేయి. ఒక సహాయక పैनल సరైన సెలెక్టర్ను సూచిస్తుంది (ఉదాహరణకు div.card) — కాంత్రాంతిత సూచనపై క్లిక్ చేయండి మరియు అది స్వయంచాలకంగా పూరించబడుతుంది. ఒక క్లిక్తో టూల్ అన్ని వస్తువుల కోసం నమూనాను నేర్చుకుంటుంది.
- ఏదైనా సేకరించాలో ఎంచుకో. ప్రతి ఫీల్డ్ వరుసకు ఇప్పటికే పేరు పెట్టె, సెలెక్టర్ పెట్టె మరియు రకం డ్రాప్డాన్ ఉంటాయి. ఫీల్డ్ వరుసపై Select క్లిక్ చేసి, ఆపై ప్రీవ్యూలో ఖచ్చితమైన భాగం (శీర్షిక, ధర, ఫోటో) పై క్లిక్ చేయి. మరింత స్తంభాలు కోసం Add field క్లిక్ చేయి. రకాన్ని ఎంచుకో: పదాలు మరియు ధరలకు Text, క్లిక్ చేయదగిన చిరునామాలు కోసం Link, బొమ్మలు కోసం Image, ఫార్మాట్ చేయబడిన కంటెంట్ కోసం HTML.
- స్క్రేప్. Start scraping క్లిక్ చేయి. అన్ని సరిపోలిన వస్తువులు ఒకే పట్టిక వరుసగా మారుతాయి. ఎన్ని వరుసలు ఎక్స్ట్రాక్ట్ చేయబడ్డాయో తెలియజేసిన ఒక సందేశం కనిపిస్తుంది. ఏదైనా తప్పుగా కాన్ఫిగర్ చేయబడితే, మీరు సాధారణ భాషలో హెచ్చరిక పొందుతారు — ఉదాహరణకు ఏ ఫీల్డ్ మళ్లీ ఎంచుకోవాలి.
- సేవ్ చేయి. స్ప్రెడ్షీట్ కోసం Export to Excel క్లిక్ చేయి, Google Sheetsకు పేస్ట్ చేయడానికి Copy క్లిక్ చేయి, లేదా మీ మొత్తం సెటప్ను ఫైల్గా Export చేసి తరువాత అదే స్క్రేప్ను పునఃప్రారంభించడానికి Import చేయడానికి సంరక్షించండి.
వాడకం ఎలా? — సాంకేతిక సహాయక పుస్తకం
- మూల రీతులు. From URL ప్రీవ్యూ ఎండ్పాయింట్కు పోస్ట్ చేస్తుంది, ఇది URLను ప్రమాణీకరిస్తుంది (పబ్లిక్ http/https మాత్రమే, ప్రైవేట్ మరియు రిజర్వ్డ్ IP స్పేస్ బ్లాక్ చేయబడుతుంది, గరిష్ఠంగా 5 మాన్యువల్ రీడైరెక్ట్లు), 20 సెకన్ల టైమౌట్తో తీసుకువస్తుంది, 30 నిమిషాల కోసం క్యాష్ చేస్తుంది, నిష్పాక్షిక URLలు సరిగ్గా విశ్లేషించబడటానికి ఒక base ట్యాగ్ నమోదు చేస్తుంది, మరియు విజువల్-పికర్ ఏజెంట్ స్క్రిప్ట్ నమోదు చేస్తుంది. From HTML 3 MB వరకు పేస్ట్ చేయబడిన మార్కప్ను అంగీకరిస్తుంది, ఒక ఐచ్ఛిక base URL మార్పిడితో.
- కంటైనర్ సెలెక్టర్. ఏదైనా చెల్లుబాటు అయ్యే document.querySelectorAll సరిపోలిన CSS సెలెక్టర్: .product-card, table tbody tr, ul.results > li, article[data-id]. పట్టికల కోసం, ఏదైనా కోষంపై క్లిక్ చేయండి మరియు పికర్ పూర్తి వరుసను ప్రోత్సహిస్తుంది. సున్నా నోడ్లతో సరిపోలే సెలెక్టర్ వైఫల్య ప్రమాణీకరణతో స్పష్టమైన సందేశంతో వైఫల్యమైస్తుంది మరియు పాత ఆutsutptను క్లియర్ చేస్తుంది.
- ఫీల్డ్ సెలెక్టర్లు ప్రతి కాంటైనర్ వస్తువు కోసం querySelector ద్వారా పరిష్కరించబడతాయి, కాబట్టి వాటిని సాపేక్షంగా ఉంచండి: .title, a, img, td:nth-child(2). ప్రత్యేక విలువ :scope కాంటైనర్ను itself targets చేస్తుంది. ఒక ఫీల్డ్ కోసం ఖాళీ ఫలితం ఖాళీ కోষాన్ని ఇస్తుంది, లెక్కన తప్పు; అన్ని కోషాలు ఖాళీగా ఉన్న పంక్తులు తొలగించబడతాయి.
- ఎక్స్ట్రాక్టర్ రకాలు. పాఠ్యం దృశ్యమాన పాఠ్యాన్ని ట్యాగులు తొలగించబడి మరియు entities decoded చేయబడి తిరిగి ఇస్తుంది. లింక్ పరిష్కరించబడిన పూర్తి hrefను (query strings మరియు fragments preserved చేయబడతాయి) తిరిగి ఇస్తుంది. బొమ్మ పరిష్కరించబడిన బొమ్మ srcను తిరిగి ఇస్తుంది. HTML ఎలిమెంట్ inner HTMLను (安全 table display కోసం escaped చేయబడి) తిరిగి ఇస్తుంది.
- Sanitization. script మరియు noscript నోడ్లు ఎక్స్ట్రాక్షన్కు ముందు తొలగించబడతాయి, కాబట్టి trackers మరియు embedded code ఫలితాల్లో ఎప్పుడూ లీక్ అవ్వవు. ఎక్స్ట్రాక్షన్ स्वయం మీ బ్రౌజర్లో DOM-ఆధారితంగా జరుగుతుంది — మీరు ఏమీ scrape చేస్తే ఎలాగైనా upload చేయబడదు.
ఫీల్డ్ రకాలు ఒక నజరాలో
| రకం | ఏమి సేకరిస్తుంది | దీనిని ఏందుకు వాడాలి | ఖాళీగా ఉండే సమయం |
|---|---|---|---|
| పదం (Text) | కనిపించే పదాలు, ట్యాగ్లు సరళీకృతం, ఎంటిటీలు డీకోడ్ చేయబడ్డాయి | శీర్షికలు, ధరలు, వివరణలు, తేదీలు | మూలకం లేకపోతే లేదా పదాలు లేకపోతే |
| లింక్ | href నుండి పూర్తి URL | ఉత్పత్తి లింకులు, ప్రొఫైల్ పేజీలు, తదుపరి పేజీలు | యాంటర్ బహిర్గతం కాకపోతే లేదా href లేకపోతే |
| చిత్రం | src నుండి పూర్తి URL | ఫోటోలు, థంబ్నెయిల్స్, లోగోలు | చిత్రం బహిర్గతం కాకపోతే |
| HTML | అంతర్గత HTML మూలాన్ని | ఫార్మాట్ చేసిన విభాగాలు, ఇంటగ్రేషన్లు, ఋక్ష టెక్స్ట్ | మూలకం లేకపోతే లేదా ఖాళీగా ఉంటే |
టిప్స్, పరిమితులు, మరియు ముప్పులు
- లిస్టింగ్ పేజీలను వాడండి, వివరణ పేజీలను కాదు. టూల్కు పునరావృత నమూనా అవసరం. ఒక ఉత్పత్తితో కూడిన పేజీ ఒకే స్తంభాన్ని ఇస్తుంది.
- లోగిన్ అవసరమైన పేజీలను URL ద్వారా ఫెచ్ చేయలేము. బ్రౌజర్లో పేజీని తెరవండి, దాని HTML మూలాన్ని కాపీ చేయండి, మరియు From HTML ఉపయోగించండి.
- JavaScript-రిడర్డ్ కాంట్ఎంట్ దాని రిడర్డ్ HTML అవసరం. View-source HTML లో డైనమిక్గా లోడ్ అయ్యే آئటమ్స్ ఉండకపోవచ్చు; రిడర్డ్ మార్క్అప్ నకలు కావడానికి బ్రౌజర్ డెవలపర్ టూల్స్ ఉపయోగించండి.
- పేస్ట్ చేసిన HTML 3 MB గడువు ఉంది. చాలా పెద్ద పేజీలను లిస్టింగ్ విభాగానికి కత్తిరించాలి.
- సాపేక్ష లింకులు సోర్స్ URL (లేదా మీ ఓవర్రైడ్ బేస్ URL) ఆధారంగా రిజాల్వ్ అవుతాయి, కాబట్టి ఎగుమతి చేసిన లింకులు క్లిక్ చేయదగినవిగా ఉంటాయి.
- సైట్ను గౌరవించండి. మీరు ఉపయోగించడానికి అనుమతించబడిన పేజీలను మాత్రమే స్క్రేప్ చేయండి — మీ స్వంత సైట్లు, ప్రజా డేటా, లేదా అనుమతి ఉన్న మూలాలు. భారీ స్వయం克里斯ేతర రీ-స్క్రేప్ వల్ల మీ IP బ్లాక్ అయ్యే అవకాశం ఉంది; పునరావృత ఫెచ్ల మధ్య వ్యవధి ఉంచండి.
డేటా కాపీరైట్లు
ఎవరి వెబ్సైట్ డేటాను కలవరాస్తితో కాపీ చేయాలనే అందరూ కోరుకోరు. ఈ టూల్ను విద్య, పరిశోధన, మీ స్వంత కాటలాగ్ ధర పోలిక, మీకు హక్కు ఉన్న లీడ్ జాబితాలు, మరియు ఇతర قانوني ఉద్దేశాల కోసం ఉపయోగించండి — ఎప్పుడూ కంటెంట్ దొంగిలించడానికి, పేవాలీలు దాటడానికి, లేదా کسی ఇతరుల పనిని మీ స్వంతంగా ప్రచురించడానికి కాదు.
డేటా యజమానులకు: Newisty ప్రతి సైట్ యజమానిని గౌరవిస్తుంది. ఈ టూల్ అనుమతి లేకుండా మీ పేజీలపై వాడబడుతుందని భావిస్తే, స్వయం克里斯ేతర క్లయింట్లను నిరోధించండి లేదా మాను సంప్రదించండి, మరియు పేజీ లేదా సైట్ అన్ని సాధ్యమైనంత త్వరగా ఫెచ్ చేయడానికి బ్లాక్ చేయబడుతుంది.
తరచుగా అడిగే ప్రశ్నలు
తరచుగా అడిగే ప్రశ్నలు
వ్యాఖ్యలు (0)
మీరు ఎదుర్కొన్న సమస్యను వివరించండి, తద్వారా మేము పరిశోధించి ఈ సాధనాన్ని మెరుగుపరచగలము.