ফ্রি অনলাইন ওয়েবপেজ ডাটা স্ক্র্যাপার
এই বিনামূল্যের অনলাইন ডাটা স্ক্র্যাপার টুল ব্যবহার করে আপনি ওয়েব পেজ থেকে তথ্য স্ক্র্যাপ ও কপি করতে পারবেন এবং আপনার ডিভাইসে (এক্সেল ফরম্যাটে) ডাউনলোড করতে পারবেন।
ব্যবহার করুন ফ্রি অনলাইন ওয়েবপেজ ডাটা স্ক্র্যাপার
সেটআপ
ওয়েবসাইট পূর্বরূপ
কোনও পৃষ্ঠা লোড হয়নিস্ক্র্যাপ করা ফলাফল
বিষয়বস্তু পড়ুন
ফ্রি অনলাইন ওয়েবপেজ ডেটা স্ক্র্যাপার কী?
সহজ উত্তর (প্রযুক্তিগত জ্ঞান প্রয়োজন নেই): এই টুল যেকোনো পাবলিক ওয়েব পেজ থেকে পুনরাবৃত্ত তথ্য কপি করে একটি সুন্দর টেবিলে নিয়ে আসে, যা আপনি এক্সেল ফাইল হিসেবে ডাউনলোড করতে পারেন। পণ্যের তালিকা, দামের টেবিল, ডিরেক্টরি তালিকা, অনুসন্ধানের ফলাফল, চাকরির বিজ্ঞাপন — যদি কোনো পেজে একই ধরনের কার্ড বা সারি বারবার দেখায়, তবে এই টুল একটি মিনিটেরও কম সময়ে সবগুলোকে সারি ও কলামে তোলা পারে। কোনো সফটওয়্যার ইনস্টল করতে হয় না, কোনো অ্যাকাউন্ট লাগে না, কোড জানতে হয় না।
প্রযুক্তিগত উত্তর: এটি একটি ক্লায়েন্ট-সাইড এক্সট্রাকশন ওয়ার্কবেঞ্চ। আপনি সোর্স HTML সরবরাহ করেন (হାର্ডেনড প্রিভিউ এন্ডপয়েন্টের মাধ্যমে URL থেকে সার্ভার-সাইডে fetched, যেখানে SSRF চেক, রিডাইরেক্ট সীমা এবং ক্যাশিং রয়েছে, অথবা সরাসরি পেস্ট করে), একটি পুনরাবৃত্ত কন্টেইনার যেকোনো বৈধ CSS সিলেক্টর দিয়ে নির্বাচন করেন, প্রতিটি অর্ডার করা ফিল্ডের জন্য একটি সাব-সিলেক্টর এবং এক্সট্রাক্টর টাইপ (টেক্সট, লিঙ্ক, ইমেজ, HTML) সংজ্ঞায়িত করেন, এবং এঞ্জিন একটি হেডার এবং সারি ম্যাট্রিক্স HTML টেবিল আকারে ফেরত দেয় যার সাথে এক-ক্লিকে এক্সেল এক্সপোর্ট (SheetJS, CSV ফলব্যাক) এবং সামগ্রিক সেটআপের JSON এক্সপোর্ট/ইমপোর্ট থাকে। সব এক্সট্রাকশন আপনার ব্রাউজারে চলে; সার্ভার শুধুমাত্র প্রিভিউয়ের জন্য সোর্স পেজ fetch করে।
ব্যবহার করার নিয়ম — কোনো প্রযুক্তিগত দক্ষতা ছাড়াই
এই পাঁচটি ধাপ অনুসরণ করুন। এখানে HTML জানা প্রয়োজন নেই।
- পেজ লোড করুন। From URL ট্যাব ক্লিক করুন, একটি তালিকা পৃষ্ঠার (অনেকগুলো একই রকম আইটেম থাকা পৃষ্ঠা, একটি মাত্র পণ্যের পৃষ্ঠা নয়) পূর্ণ ঠিকানা পেস্ট করুন এবং Load URL ক্লিক করুন। অথবা From HTML ক্লিক করে পৃষ্ঠার সোর্স পেস্ট করুন এবং Use HTML Input ক্লিক করুন। ডানদিকে পৃষ্ঠার একটি প্রিভিউ দেখা যাবে।
- বলুন কোনটি পুনরাবৃত্ত হচ্ছে। কন্টেইনার বক্সের পাশে Select ক্লিক করুন, তারপর প্রিভিউতে যেকোনো একটি কার্ড, সারি বা আইটেমে ক্লিক করুন। একটি সহায়ক প্যানেল সঠিক সিলেক্টর सुझाता है (যেমন div.card) — হাইলাইটেড পরামর্শটি ক্লিক করুন এবং এটি স্বয়ংক্রিয়ভাবে পূরণ হয়ে যাবে। একটি ক্লিকে টুলকে সব আইটেমের প্যাটার্ন শিখিয়ে দিন।
- কী সংগ্রহ করতে হবে তা নির্বাচন করুন। প্রতিটি ফিল্ড সারিতে ইতিমধ্যে একটি নাম বক্স, একটি সিলেক্টর বক্স এবং একটি টাইপ ড্রপডাউন আছে। একটি ফিল্ড সারিতে Select ক্লিক করুন, তারপর প্রিভিউতে নির্দিষ্ট অংশে ক্লিক করুন (শিরোনাম, দাম, ফটো)। আরও কলামের জন্য Add field ক্লিক করুন। টাইপ নির্বাচন করুন: Text শব্দ এবং দামের জন্য, Link ক্লিকযোগ্য ঠিকানার জন্য, Image ছবির জন্য, HTML ফরম্যাটেড কন্টেন্টের জন্য।
- স্ক্র্যাপ করুন। Start scraping ক্লিক করুন। প্রতিটি ম্যাচিং আইটেম একটি টেবিল সারিতে পরিণত হয়। কোনো সারি বের হয়েছে তা জানিয়ে একটি বার্তা দেখাবে। কিছু ভুল কনফিগার করা থাকলে আপনি সাধারণ ভাষায় সতর্কতা পাবেন, যেমন কোন ফিল্ডটি পুনরায় নির্বাচন করতে হবে।
- সংরক্ষণ করুন। স্প্রেডশিটের জন্য Export to Excel ক্লিক করুন, Google Sheets-এ পেস্ট করতে Copy ক্লিক করুন, অথবা Export ক্লিক করে পুরো সেটআপটি একটি ফাইল হিসেবে সংরক্ষণ করুন যা পরে Import করে একই স্ক্র্যাপ পুনরায় করতে পারবেন।
ব্যবহার করার নিয়ম — প্রযুক্তিগত রেফারেন্স
- সোর্স মোড। From URL প্রিভিউ এন্ডপয়েন্টে পোস্ট করে, যা URL যাচাই করে (শুধুমাত্র পাবলিক http/https, ব্যক্তিগত এবং সংরক্ষিত IP স্থান ব্লক, সর্বোচ্চ ৫টি ম্যানুয়াল রিডাইরেক্ট), ২০ সেকেন্ডের টাইমআউট সহ fetch করে, ৩০ মিনিটের জন্য ক্যাশ করে, আপেক্ষিক URL সমাধান করতে একটি বেস ট্যাগ ইনজেক্ট করে এবং ভিজ্যুয়াল-পিকার এজেন্ট স্ক্রিপ্ট ইনজেক্ট করে। From HTML ৩ MB পর্যন্ত পেস্ট করা মার্কআপ গ্রহণ করে একটি ঐচ্ছিক বেস URL ওভাররাইড সহ।
- কন্টেইনার সিলেক্টর। যেকোনো বৈধ document.querySelectorAll-সামঞ্জস্যপূর্ণ CSS সিলেক্টর: .product-card, table tbody tr, ul.results > li, article[data-id]। টেবিলের ক্ষেত্রে, যেকোনো সেলে ক্লিক করলে পিকার সম্পূর্ণ সারি প্রমোট করে। শূন্য নোড ম্যাচ করা একটি সিলেক্টর স্পষ্ট বার্তা সহ ভ্যালিডেশনে ব্যর্থ হয় এবং পুরনো আউটপুট মুছে ফেলে।
- ফিল্ড সিলেক্টর প্রতিটি কন্টেইনার আইটেমের জন্য querySelector এর মাধ্যমে সমাধান হয়, তাই এগুলোকে আপেক্ষিক রাখুন: .title, a, img, td:nth-child(2)। বিশেষ মান :scope কন্টেইনারকেই টার্গেট করে। কোনো ফিল্ডের জন্য শূন্য ফলাফল একটি শূন্য কোষ দেয়, কখনো ত্রুটি দেয় না; যে সারিতে প্রতিটি কোষ শূন্য থাকে তা বাদ দেওয়া হয়।
- এক্সট্রাক্টর টাইপ। Text দৃশ্যমান টেক্সট ফেরত দেয় ট্যাগ সমতল করে এবং এনটitetি ডিকোড করে। Link সমাধানকৃত পরম href ফেরত দেয় (কোয়েরি স্ট্রিং এবং ফ্র্যাগমেন্ট সংরক্ষণ করে)। Image সমাধানকৃত ইমেজ src ফেরত দেয়। HTML উপাদানের ইনার HTML ফেরত দেয় (নিরাপদ টেবিল প্রদর্শনের জন্য এস্কেপ করা)।
- স্যানিটাইজেশন। script এবং noscript নোডগুলো এক্সট্রাকশনের আগে অপসারণ করা হয়, তাই ট্র্যাকার এবং এম্বেডেড কোড কখনোই ফলাফলে লিক হয় না। এক্সট্রাকশন নিজেই আপনার ব্রাউজারে DOM-ভিত্তিক — আপনি যা স্ক্র্যাপ করেন তা আপলোড হয় না।
- কনফিগ পোর্টেবিলিটি। এক্সপোর্ট করে কন্টেইনার সিলেক্টর এবং সব ফিল্ড ডেফিনিশন JSON হিসেবে ডাউনলোড করে; ইম্পোর্ট করে তা পুনর্বহাল করে। ফাইলটি শেয়ার করুন এবং যে কেউ হুবহু একই স্ক্র্যাপ পুনরুত্পাদন করতে পারবে।
ফিল্ড টাইপগুলোর সংক্ষিপ্ত বিবরণ
| টাইপ | গ্রাব করে | কোথায় ব্যবহার করবেন | খালি থাকে যখন |
|---|---|---|---|
| টেক্সট | দৃশ্যমান পাঠ্য, ট্যাগ সমতল করা, এনটিটি ডিকোড করা | শিরোনাম, মূল্য, বিবরণ, তারিখ | উপাদান অনুপস্থিত বা এর কোনো পাঠ্য নেই |
| লিংক | href থেকে পরম URL | প্রোডাক্ট লিংক, প্রোফাইল পেজ, পরবর্তী পৃষ্ঠা | কোনো অ্যাঙ্কার মেলেনি অথবা অ্যাঙ্কারের href নেই |
| ইমেজ | src থেকে পরম URL | ছবি, থাম্বনেইল, লোগো | কোনো ইমেজ মেলেনি |
| HTML | ইনার HTML উৎস | বিন্যাসযুক্ত স্বল্পবিবরণ, এমবেড, রিচ টেক্সট | উপাদান অনুপস্থিত বা খালি |
টিপস, সীমাবদ্ধতা এবং এড়িয়ে চলার মতো বিষয়
- লিস্টিং পেজ ব্যবহার করুন, ডিটেইল পেজ নয়। টুলটিকে একটি পুনরাবৃত্তিমূলক প্যাটার্ন প্রয়োজন। এক পণ্য বিশিষ্ট পেজ থেকে শুধুমাত্র একটি সারি পাওয়া যাবে।
- লগইন-সংরক্ষিত পেজগুলো URL দিয়ে ফেচ করা যায় না। ব্রাউজারে পেজটি খুলুন, এর HTML উৎস কপি করুন এবং ইনস্টিটর ব্যবহার করুন।
- JavaScript-রেডার্ড কন্টেন্ট এর রেডার্ড HTML প্রয়োজন। ভিউ-সোর্স HTML-এ ডাইনামিকভাবে লোড হওয়া আইটেমগুলো অনুপস্থিত থাকতে পারে; রেডার্ড মার্কাআপ কপি করতে ব্রাউজার ডেভেলপার টুলস ব্যবহার করুন।
- পেস্ট করা HTML ৩ MB সীমাবদ্ধ। খুব বড় পেজগুলোকে লিস্টিং বিভাগে সীমিত করুন।
- রিলেটিভ লিংক সোর্স URL-এর (বা আপনার ওভাররাইড বেস URL) সাপেক্ষে সমাধান হয়, তাই এক্সপোর্ট করা লিংক ক্লিকযোগ্য থাকে।
- ওয়েবসাইটটির প্রতি সম্মান দেখান। শুধুমাত্র সেই সকল পেজ স্ক্র্যাপ করুন যেগুলো ব্যবহারের জন্য আপনি অনুমতিপ্রাপ্ত — আপনার নিজের সাইট, সार्वजनिक তথ্য, অথবা অনুমতিসহ উৎস। ভারী স্বয়ংক্রিয় পুনরায় স্ক্র্য্যপিং আপনার IP ব্লক করতে পারে; পুনরাবৃত্তিমূলক ফেচিংয়ের ব্যবধান রাখুন।
ডেটা কপিরাইট
কেউ চায় না তাদের ওয়েবসাইটের তথ্য অন্যরা খারাত ইচ্ছায় কপি করে। এই টুলটি শিক্ষা, গবেষণা, আপনার নিজস্ব ক্যাটালগের মূল্য তুলনা, যে তালিকার জন্য আপনার অধিকার রয়েছে, এবং অন্যান্য আইনসম্মত উদ্দেশ্যে ব্যবহার করুন — কখনোই কন্টেন্ট চুরি, পাইওয়ালের বাইরে যাওয়া, বা কারো অন্যের কাজকে নিজের হিসেবে পুনঃপ্রকাশ করতে নয়।
ডেটা মালিকদের জন্য: নিউইস্টি প্রতিটি সাইট মালিকের প্রতি সম্মানশীল। আপনি মনে করেন যদি এই টুলটি আপনার পেজে অনুমতি ছাড়া ব্যবহার করা হচ্ছে, অটোমেটেড ক্লায়েন্ট ব্লক করুন অথবা যোগাযোগ করুন এবং শীঘ্রই সংশ্লিষ্ট পেজ বা সাইট ফেচ থেকে ব্লক করা হবে।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
মন্তব্য (0)
আপনি যে সমস্যার সম্মুখীন হয়েছেন তা বর্ণনা করুন যাতে আমরা তা তদন্ত করে টুলটি উন্নত করতে পারি।