SEO Tool টুল আপডেট করা হয়েছে 1 ঘন্টা আগে

ফ্রি অনলাইন ওয়েবপেজ ডাটা স্ক্র্যাপার

এই বিনামূল্যের অনলাইন ডাটা স্ক্র্যাপার টুল ব্যবহার করে আপনি ওয়েব পেজ থেকে তথ্য স্ক্র্যাপ ও কপি করতে পারবেন এবং আপনার ডিভাইসে (এক্সেল ফরম্যাটে) ডাউনলোড করতে পারবেন।

Web Data Scraper Extract Data HTML Scraper Export Results

ব্যবহার করুন ফ্রি অনলাইন ওয়েবপেজ ডাটা স্ক্র্যাপার

সেটআপ

1 লোড সোর্স সামগ্রী
টিপ: একটি তালিকা পৃষ্ঠা ব্যবহার করুন, একক আইটেমের বিবরণ পৃষ্ঠা নয়।
সর্বোচ্চ সুপারিশকৃত: ৩ এমবি 0 চরিত্রসমূহ
নির্বাচন মোড চালু আছে: প্রিভিউতে হাইলাইট করা আইটেমটিতে ক্লিক করুন।
2 পুনরাবৃত্তি হওয়া আইটেমটি নির্বাচন করুন
তালিকায় যে কোনো একটি কার্ড/আইটেম নির্বাচন করুন যা পুনরাবৃত্তি হয়। টেবিলের ক্ষেত্রে, যে কোনো সেলে ক্লিক করুন এবং আমরা স্বয়ংক্রিয়ভাবে সারিটি বেছে নেব।
3 সংগ্রহ করার ক্ষেত্রসমূহ
আউটপুট কলামগুলো পুনর্বিন্যাস করতে ফিল্ডগুলো টেনে আনুন।
4 ডেটা স্ক্র্যাপ করুন

ওয়েবসাইট পূর্বরূপ

কোনও পৃষ্ঠা লোড হয়নি
দৃশ্যমান নির্বাচন শুরু করতে URL লোড করুন বা HTML পেস্ট করুন।

স্ক্র্যাপ করা ফলাফল

স্ক্র্যাপ করার পর আপনার টেবিল এখানে প্রদর্শিত হবে।
টুল লিঙ্ক
ক্লিপবোর্ডে অনুলিপি করা হয়েছে।
এই টুলটি উন্নত করতে সাহায্য করুন
232
ব্যবহৃত সময়
205
মোট ব্যবহারকারী
5+ বছর
পরিবেশিত
শেষ পর্যালোচনা করা হয়েছে 1 মাস আগে। ব্যবহারের সংখ্যাগুলি নিয়মিত নিরীক্ষার সময় পুনর্নবীকরণ করা হয়। (প্রতিবেদন করা হচ্ছে 21 Feb 2022)
অসামঞ্জস্যতা রিপোর্ট করুন

বিষয়বস্তু পড়ুন

এই টুলটি কীভাবে কাজ করে এবং কখন এটি ব্যবহার করতে হবে তা শিখুন।

ফ্রি অনলাইন ওয়েবপেজ ডেটা স্ক্র্যাপার কী?

সহজ উত্তর (প্রযুক্তিগত জ্ঞান প্রয়োজন নেই): এই টুল যেকোনো পাবলিক ওয়েব পেজ থেকে পুনরাবৃত্ত তথ্য কপি করে একটি সুন্দর টেবিলে নিয়ে আসে, যা আপনি এক্সেল ফাইল হিসেবে ডাউনলোড করতে পারেন। পণ্যের তালিকা, দামের টেবিল, ডিরেক্টরি তালিকা, অনুসন্ধানের ফলাফল, চাকরির বিজ্ঞাপন — যদি কোনো পেজে একই ধরনের কার্ড বা সারি বারবার দেখায়, তবে এই টুল একটি মিনিটেরও কম সময়ে সবগুলোকে সারি ও কলামে তোলা পারে। কোনো সফটওয়্যার ইনস্টল করতে হয় না, কোনো অ্যাকাউন্ট লাগে না, কোড জানতে হয় না।

প্রযুক্তিগত উত্তর: এটি একটি ক্লায়েন্ট-সাইড এক্সট্রাকশন ওয়ার্কবেঞ্চ। আপনি সোর্স HTML সরবরাহ করেন (হାର্ডেনড প্রিভিউ এন্ডপয়েন্টের মাধ্যমে URL থেকে সার্ভার-সাইডে fetched, যেখানে SSRF চেক, রিডাইরেক্ট সীমা এবং ক্যাশিং রয়েছে, অথবা সরাসরি পেস্ট করে), একটি পুনরাবৃত্ত কন্টেইনার যেকোনো বৈধ CSS সিলেক্টর দিয়ে নির্বাচন করেন, প্রতিটি অর্ডার করা ফিল্ডের জন্য একটি সাব-সিলেক্টর এবং এক্সট্রাক্টর টাইপ (টেক্সট, লিঙ্ক, ইমেজ, HTML) সংজ্ঞায়িত করেন, এবং এঞ্জিন একটি হেডার এবং সারি ম্যাট্রিক্স HTML টেবিল আকারে ফেরত দেয় যার সাথে এক-ক্লিকে এক্সেল এক্সপোর্ট (SheetJS, CSV ফলব্যাক) এবং সামগ্রিক সেটআপের JSON এক্সপোর্ট/ইমপোর্ট থাকে। সব এক্সট্রাকশন আপনার ব্রাউজারে চলে; সার্ভার শুধুমাত্র প্রিভিউয়ের জন্য সোর্স পেজ fetch করে।

ব্যবহার করার নিয়ম — কোনো প্রযুক্তিগত দক্ষতা ছাড়াই

এই পাঁচটি ধাপ অনুসরণ করুন। এখানে HTML জানা প্রয়োজন নেই।

  1. পেজ লোড করুন। From URL ট্যাব ক্লিক করুন, একটি তালিকা পৃষ্ঠার (অনেকগুলো একই রকম আইটেম থাকা পৃষ্ঠা, একটি মাত্র পণ্যের পৃষ্ঠা নয়) পূর্ণ ঠিকানা পেস্ট করুন এবং Load URL ক্লিক করুন। অথবা From HTML ক্লিক করে পৃষ্ঠার সোর্স পেস্ট করুন এবং Use HTML Input ক্লিক করুন। ডানদিকে পৃষ্ঠার একটি প্রিভিউ দেখা যাবে।
  2. বলুন কোনটি পুনরাবৃত্ত হচ্ছে। কন্টেইনার বক্সের পাশে Select ক্লিক করুন, তারপর প্রিভিউতে যেকোনো একটি কার্ড, সারি বা আইটেমে ক্লিক করুন। একটি সহায়ক প্যানেল সঠিক সিলেক্টর सुझाता है (যেমন div.card) — হাইলাইটেড পরামর্শটি ক্লিক করুন এবং এটি স্বয়ংক্রিয়ভাবে পূরণ হয়ে যাবে। একটি ক্লিকে টুলকে সব আইটেমের প্যাটার্ন শিখিয়ে দিন।
  3. কী সংগ্রহ করতে হবে তা নির্বাচন করুন। প্রতিটি ফিল্ড সারিতে ইতিমধ্যে একটি নাম বক্স, একটি সিলেক্টর বক্স এবং একটি টাইপ ড্রপডাউন আছে। একটি ফিল্ড সারিতে Select ক্লিক করুন, তারপর প্রিভিউতে নির্দিষ্ট অংশে ক্লিক করুন (শিরোনাম, দাম, ফটো)। আরও কলামের জন্য Add field ক্লিক করুন। টাইপ নির্বাচন করুন: Text শব্দ এবং দামের জন্য, Link ক্লিকযোগ্য ঠিকানার জন্য, Image ছবির জন্য, HTML ফরম্যাটেড কন্টেন্টের জন্য।
  4. স্ক্র্যাপ করুন। Start scraping ক্লিক করুন। প্রতিটি ম্যাচিং আইটেম একটি টেবিল সারিতে পরিণত হয়। কোনো সারি বের হয়েছে তা জানিয়ে একটি বার্তা দেখাবে। কিছু ভুল কনফিগার করা থাকলে আপনি সাধারণ ভাষায় সতর্কতা পাবেন, যেমন কোন ফিল্ডটি পুনরায় নির্বাচন করতে হবে।
  5. সংরক্ষণ করুন। স্প্রেডশিটের জন্য Export to Excel ক্লিক করুন, Google Sheets-এ পেস্ট করতে Copy ক্লিক করুন, অথবা Export ক্লিক করে পুরো সেটআপটি একটি ফাইল হিসেবে সংরক্ষণ করুন যা পরে Import করে একই স্ক্র্যাপ পুনরায় করতে পারবেন।

ব্যবহার করার নিয়ম — প্রযুক্তিগত রেফারেন্স

  1. সোর্স মোড। From URL প্রিভিউ এন্ডপয়েন্টে পোস্ট করে, যা URL যাচাই করে (শুধুমাত্র পাবলিক http/https, ব্যক্তিগত এবং সংরক্ষিত IP স্থান ব্লক, সর্বোচ্চ ৫টি ম্যানুয়াল রিডাইরেক্ট), ২০ সেকেন্ডের টাইমআউট সহ fetch করে, ৩০ মিনিটের জন্য ক্যাশ করে, আপেক্ষিক URL সমাধান করতে একটি বেস ট্যাগ ইনজেক্ট করে এবং ভিজ্যুয়াল-পিকার এজেন্ট স্ক্রিপ্ট ইনজেক্ট করে। From HTML ৩ MB পর্যন্ত পেস্ট করা মার্কআপ গ্রহণ করে একটি ঐচ্ছিক বেস URL ওভাররাইড সহ।
  2. কন্টেইনার সিলেক্টর। যেকোনো বৈধ document.querySelectorAll-সামঞ্জস্যপূর্ণ CSS সিলেক্টর: .product-card, table tbody tr, ul.results > li, article[data-id]। টেবিলের ক্ষেত্রে, যেকোনো সেলে ক্লিক করলে পিকার সম্পূর্ণ সারি প্রমোট করে। শূন্য নোড ম্যাচ করা একটি সিলেক্টর স্পষ্ট বার্তা সহ ভ্যালিডেশনে ব্যর্থ হয় এবং পুরনো আউটপুট মুছে ফেলে।
  3. ফিল্ড সিলেক্টর প্রতিটি কন্টেইনার আইটেমের জন্য querySelector এর মাধ্যমে সমাধান হয়, তাই এগুলোকে আপেক্ষিক রাখুন: .title, a, img, td:nth-child(2)। বিশেষ মান :scope কন্টেইনারকেই টার্গেট করে। কোনো ফিল্ডের জন্য শূন্য ফলাফল একটি শূন্য কোষ দেয়, কখনো ত্রুটি দেয় না; যে সারিতে প্রতিটি কোষ শূন্য থাকে তা বাদ দেওয়া হয়।
  4. এক্সট্রাক্টর টাইপ। Text দৃশ্যমান টেক্সট ফেরত দেয় ট্যাগ সমতল করে এবং এনটitetি ডিকোড করে। Link সমাধানকৃত পরম href ফেরত দেয় (কোয়েরি স্ট্রিং এবং ফ্র্যাগমেন্ট সংরক্ষণ করে)। Image সমাধানকৃত ইমেজ src ফেরত দেয়। HTML উপাদানের ইনার HTML ফেরত দেয় (নিরাপদ টেবিল প্রদর্শনের জন্য এস্কেপ করা)।
  5. স্যানিটাইজেশন। script এবং noscript নোডগুলো এক্সট্রাকশনের আগে অপসারণ করা হয়, তাই ট্র্যাকার এবং এম্বেডেড কোড কখনোই ফলাফলে লিক হয় না। এক্সট্রাকশন নিজেই আপনার ব্রাউজারে DOM-ভিত্তিক — আপনি যা স্ক্র্যাপ করেন তা আপলোড হয় না।
  6. কনফিগ পোর্টেবিলিটি। এক্সপোর্ট করে কন্টেইনার সিলেক্টর এবং সব ফিল্ড ডেফিনিশন JSON হিসেবে ডাউনলোড করে; ইম্পোর্ট করে তা পুনর্বহাল করে। ফাইলটি শেয়ার করুন এবং যে কেউ হুবহু একই স্ক্র্যাপ পুনরুত্পাদন করতে পারবে।

ফিল্ড টাইপগুলোর সংক্ষিপ্ত বিবরণ

টাইপ গ্রাব করে কোথায় ব্যবহার করবেন খালি থাকে যখন
টেক্সট দৃশ্যমান পাঠ্য, ট্যাগ সমতল করা, এনটিটি ডিকোড করা শিরোনাম, মূল্য, বিবরণ, তারিখ উপাদান অনুপস্থিত বা এর কোনো পাঠ্য নেই
লিংক href থেকে পরম URL প্রোডাক্ট লিংক, প্রোফাইল পেজ, পরবর্তী পৃষ্ঠা কোনো অ্যাঙ্কার মেলেনি অথবা অ্যাঙ্কারের href নেই
ইমেজ src থেকে পরম URL ছবি, থাম্বনেইল, লোগো কোনো ইমেজ মেলেনি
HTML ইনার HTML উৎস বিন্যাসযুক্ত স্বল্পবিবরণ, এমবেড, রিচ টেক্সট উপাদান অনুপস্থিত বা খালি

টিপস, সীমাবদ্ধতা এবং এড়িয়ে চলার মতো বিষয়

  • লিস্টিং পেজ ব্যবহার করুন, ডিটেইল পেজ নয়। টুলটিকে একটি পুনরাবৃত্তিমূলক প্যাটার্ন প্রয়োজন। এক পণ্য বিশিষ্ট পেজ থেকে শুধুমাত্র একটি সারি পাওয়া যাবে।
  • লগইন-সংরক্ষিত পেজগুলো URL দিয়ে ফেচ করা যায় না। ব্রাউজারে পেজটি খুলুন, এর HTML উৎস কপি করুন এবং ইনস্টিটর ব্যবহার করুন।
  • JavaScript-রেডার্ড কন্টেন্ট এর রেডার্ড HTML প্রয়োজন। ভিউ-সোর্স HTML-এ ডাইনামিকভাবে লোড হওয়া আইটেমগুলো অনুপস্থিত থাকতে পারে; রেডার্ড মার্কাআপ কপি করতে ব্রাউজার ডেভেলপার টুলস ব্যবহার করুন।
  • পেস্ট করা HTML ৩ MB সীমাবদ্ধ। খুব বড় পেজগুলোকে লিস্টিং বিভাগে সীমিত করুন।
  • রিলেটিভ লিংক সোর্স URL-এর (বা আপনার ওভাররাইড বেস URL) সাপেক্ষে সমাধান হয়, তাই এক্সপোর্ট করা লিংক ক্লিকযোগ্য থাকে।
  • ওয়েবসাইটটির প্রতি সম্মান দেখান। শুধুমাত্র সেই সকল পেজ স্ক্র্যাপ করুন যেগুলো ব্যবহারের জন্য আপনি অনুমতিপ্রাপ্ত — আপনার নিজের সাইট, সार्वजनिक তথ্য, অথবা অনুমতিসহ উৎস। ভারী স্বয়ংক্রিয় পুনরায় স্ক্র্য্যপিং আপনার IP ব্লক করতে পারে; পুনরাবৃত্তিমূলক ফেচিংয়ের ব্যবধান রাখুন।

ডেটা কপিরাইট

কেউ চায় না তাদের ওয়েবসাইটের তথ্য অন্যরা খারাত ইচ্ছায় কপি করে। এই টুলটি শিক্ষা, গবেষণা, আপনার নিজস্ব ক্যাটালগের মূল্য তুলনা, যে তালিকার জন্য আপনার অধিকার রয়েছে, এবং অন্যান্য আইনসম্মত উদ্দেশ্যে ব্যবহার করুন — কখনোই কন্টেন্ট চুরি, পাইওয়ালের বাইরে যাওয়া, বা কারো অন্যের কাজকে নিজের হিসেবে পুনঃপ্রকাশ করতে নয়।

ডেটা মালিকদের জন্য: নিউইস্টি প্রতিটি সাইট মালিকের প্রতি সম্মানশীল। আপনি মনে করেন যদি এই টুলটি আপনার পেজে অনুমতি ছাড়া ব্যবহার করা হচ্ছে, অটোমেটেড ক্লায়েন্ট ব্লক করুন অথবা যোগাযোগ করুন এবং শীঘ্রই সংশ্লিষ্ট পেজ বা সাইট ফেচ থেকে ব্লক করা হবে।

প্রায়শই জিজ্ঞাসিত প্রশ্ন

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

ফলাফল বিশ্বাস করার আগে ব্যবহারকারীরা যে প্রশ্নগুলো করেন, সেগুলোর সংক্ষিপ্ত উত্তর।

না। Select ক্লিক করুন, পূর্বরূপে আইটেমটি ক্লিক করুন, এবং টুলটি আপনার জন্য সিলেক্টর লিখে দেয়। উপরের টেকনিক্যাল গাইড শুধুমাত্র সেই ব্যবহারকারীদের জন্য যারা ম্যানুয়াল নিয়ন্ত্রণ চান।

যে পৃষ্ঠাগুলো একই বিন্যাস পুনরাবৃত্তি করে: পণ্য গ্রিড, টেবিল, নির্দেশিকা, খোঁজের ফলাফল, চাকরির বোর্ড। একক-আর্টিকেল বা একক-পণ্য পেজ থেকে একটি মাত্র সারি তৈরি হয়।

URL দ্বারা না, কারণ সার্ভার অতিথি হিসেবে ফেচ করে। পৃষ্ঠাটি নিজে লগইন অবস্থায় লোড করুন, HTML কপি করুন এবং From HTML ট্যাব ব্যবহার করুন।

Text সব ট্যাগ অপসারণ করে পরিষ্ঠ পাঠযোগ্য শব্দ দেয়। HTML উপাদানের ভেতরের কच्चा মার্কাআপ দেয়, যাতে বিন্যাস, লিংক বা এমবেড গুরুত্বপূর্ণ হয়।

সেই আইটেমটি সরলভাবে উপাদানটি নেই — উদাহরণস্বরূপ কোনো ছবিহীন পণ্য। খালি সেল স্বাভাবিক এবং অর্থ এই যে এক্সট্রাক্টর সেখানে কিছুই খুঁজে পায়নি, কোনো কিছু ভেঙে গেছে নয়।

সিলেক্টর লোড করা পেজে কিছুই মেলেনি। সম্ভবত পেজটি লোড করার পরে পরিবর্তন হয়েছে, অথবা ভুল উপাদানটি বেছে নেওয়া হয়েছে। সোর্স পুনরায় লোড করুন এবং Select ব্যবহার করে আবার একটি পুনরাবৃত্তিমূলক আইটেমে ক্লিক করুন।

না। এক্সট্র্যাকশন সম্পূর্ণভাবে আপনার ব্রাউজারে চালানো হয়। সার্ভার শুধুমাত্র URL পূর্বরূপের জন্য সোর্স পেজ ফেচ করতে ব্যবহৃত হয়; পেস্ট করা HTML কখনোই আপনার ডিভাইস থেকে বেরিয়ে যায় না।

হ্যাঁ। এক্সপোর্ট কন্টেইনার এবং সকল ফিল্ড ডেফিনিশন JSON হিসেবে সংরক্ষণ করে। ইম্পোর্ট তা সাথে সাথে পুনর্বহাল করে, তাই একটি পুনরাবৃত্তিমূলক স্ক্র্য্যপ কিছুক্ষণ সময় নেয়।

মন্তব্য (0)

ব্যবহারকারী আলোচনা, প্রান্তিক পরিস্থিতি এবং পরবর্তী পরামর্শের জন্য।
মন্তব্য করুন
আপনার মন্তব্য জমা দেওয়ার পর সর্বজনীনভাবে প্রদর্শিত হবে।
এখনো কোনো মন্তব্য নেই। প্রথম মন্তব্য করুন!
আমাদের জানান!
এই টুলটির কোনো সমস্যা রিপোর্ট করুন

আপনি যে সমস্যার সম্মুখীন হয়েছেন তা বর্ণনা করুন যাতে আমরা তা তদন্ত করে টুলটি উন্নত করতে পারি।

সবচেয়ে বেশি সাহায্য করে কী?
ইনপুট, প্রত্যাশিত ফলাফল, প্রকৃত ফলাফল, ব্রাউজার/ডিভাইস এবং সহায়ক হলে একটি স্ক্রিনশট অন্তর্ভুক্ত করুন।
স্ক্রিনশট বোতামটি ব্রাউজারের পৃষ্ঠাটি ধারণ করে এবং তৈরি হওয়া চিত্রটি এই ফর্মে সংযুক্ত করে।
পূর্ণ পৃষ্ঠার স্ক্রিনশট
newisty দিয়ে আপনার ব্রাউজারে ধারণ করা হয়েছে।
এখনো কোনো স্ক্রিনশট নেওয়া হয়নি।
টুল প্রতিবেদন