scan شدہ PDF کو سرچ ایبل کیسے بنایا جائے
آپ پرانے معاہدوں کے چالیس صفحات scan کرتے ہیں، انہیں ایک صاف ستھری PDF میں محفوظ کرتے ہیں، اور لفظ "indemnity" تلاش کرنے لگتے ہیں۔ Ctrl+F کچھ نہیں ڈھونڈتا۔ آپ کو وہ لفظ نظر آتا ہے — یہ صفحہ بارہویں پر موجود ہے — لیکن آپ کا کمپیوٹر اسے نہیں کر سکتا، کیونکہ جہاں تک اس کا تعلق ہے، وہ صفحہ کوئی الفاظ نہیں رکھتا۔ اس میں ایک تصویر ہے۔
وہ تین قسم کے PDF جو بالکل یکساں نظر آتے ہیں
scanز کے بارے میں تقریباً ہر الجھن یہاں سے شروع ہوتی ہے۔ تین بہت مختلف فائلیں سکرین پر ایک جیسی دکھائی دے سکتی ہیں:
- ایک ڈیجیٹل طور پر پیدا شدہ PDF۔ ورڈ پروسیسر سے ایکسپورٹ کیا گیا ہے۔ یہ اصل حروف کو اصلی فونٹس کے ساتھ محفوظ کرتا ہے۔ سرچ، سلیکشن اور کاپی سب کام کرتے ہیں کیونکہ متن واقعی ٹیکسٹ ہوتا ہے۔
- صرف تصویر والا PDF۔ scanر یا فون کیمرے سے لیا گیا ہے۔ ہر صفحہ ایک بڑی تصویر ہوتی ہے۔ فائل میں کوئی ٹیکسٹ نہیں ہوتا — صرف پکسلز جو ٹیکسٹ جیسے نظر آنے کے لیے ترتیب دیے گئے ہوتے ہیں۔ یہی چیز Ctrl+F کو ناکام بنا دیتی ہے۔
- سرچ ایبل PDF۔ scan کے ساتھ ایک غیر مرئی ٹیکسٹ لیئر۔ یہ بالکل تصویر والے ورژن جیسا نظر آتا ہے — وہی تصویر، وہی صفحہ — لیکن ٹیکسٹ اس کے پیچھے موجود ہوتا ہے، لہٰذا سرچ اور کاپی کام کرتے ہیں۔
تیسرا قسم وہ ہے جو آپ چاہتے ہیں، اور OCR اسی طرح حاصل ہوتا ہے۔
OCR اصل میں کیا کرتا ہے
Optical Character Recognition پکسلز کو دیکھتا ہے، ایسے سٹرکچر ڈھونڈتا ہے جو حروف جیسے لگتے ہیں، اور فیصلہ کرتا ہے کہ وہ کون سے حروف ہیں۔ جدید انجن ہر حرف کو ایک وقت میں نہیں ملاتے جیسا کہ سٹینسل پر کیا جاتا ہے؛ بلکہ یہ ٹیکسٹ کی لائنوں کے ساتھ کام کرتے ہوئے اور ارد گرد کے سیاق و سباق کا استعمال کرکے ابہام کو حل کرتے ہیں۔ یہی سیاق وہ وجہ ہے کہ ایک اچھا انجن "modern" میں "rn" کو دو حروف کے طور پر پڑھتا ہے لیکن خراب scan میں بھی اس سے پھسل سکتا ہے — یہ ہر بار ایک باخبر اندازہ لگا رہا ہوتا ہے۔
وہ لفظ — اندازہ (guess) — OCR کا ایماندارانہ مرکز ہے۔ یہ کسی نقصان کے بغیر تبدیلی نہیں، بلکہ ایک تصویر کی احتمالی پڑھائی ہے۔ عام طور پر بہت اچھا اندازہ۔ کبھی بھی یقینی نہیں۔
ایک سرچ ایبل PDF عموماً وہ چیز ہوتی ہے جو آپ چاہتے ہیں
آپ ایک scan پر OCR کر سکتے ہیں اور صرف متن رکھ سکتے ہیں، لیکن آپ دستاویز کو ضائع کر دیں گے: دستخط، ہیڈر، کافی کا دھبہ، لے آؤٹ — ہر وہ چیز جو اسے ٹرانسکرپٹ کے بجائے اصل بناتی ہے۔ اور چونکہ OCR کامل نہیں ہوتا، اس لیے خالص ٹیکسٹ ورژن کو خود کو چیک کرنے کا کوئی طریقہ نہیں ملتا۔
ایک سرچ ایبل PDF اس لین دین سے بچتی ہے۔ scan شدہ تصویر بالکل ویسے ہی رہتی ہے، بغیر کسی تبدیلی کے۔ پہچانا گیا متن ایک غیر مرئی تہہ (invisible layer) کے طور پر شامل کیا جاتا ہے جو ان الفاظ کے اوپر موجود ہوتا ہے جن سے یہ مطابقت رکھتا ہے۔ آپ اصل دیکھتے ہیں؛ آپ کا کمپیوٹر متن دیکھتا ہے؛ جب آپ کوئی پیراگراف کاپی کرتے ہیں تو آپ کو الفاظ ملتے ہیں، اور جب پہچاننے میں غلطی ہوتی ہے تو حقیقی صفحہ ابھی بھی موازنہ کرنے کے لیے موجود ہوتا ہے۔
درست رویہ کیا چیز چلتی ہے
OCR کی کوالٹی انجن کے چلنے سے بہت پہلے طے ہو جاتی ہے — زیادہ تر اس وقت جب سکیننگ ہوتی ہے:
- ریزولوشن۔ پرنٹ شدہ ٹیکسٹ کے لیے تقریباً 300 dpi بہترین ہے۔ 200 سے نیچے، حروف کو تمیز کرنے کی ضرورت کا تفصیل کھو جاتی ہے۔ 400 سے اوپر آپ زیادہ تر فائل کو بڑا بنا رہے ہوتے ہیں، پڑھنے کو نہیں۔
- کنٹراسٹ۔ صاف سفید پر گہرا کالا بہترین ہے۔ سرمئی فوٹو کاپیاں، رنگین کاغذ اور صفحے پر سائے آپ کی درستگی کو کم کر دیتے ہیں۔
- سیدھا ہونا۔ ٹیڑھا پن ایک حقیقی دشمن ہے۔ کسی زاویے سے کھینچی گئی یا کتاب کے ریڑھ کی ہڈی کے قریب خم دار ہونے پر فوٹوگراف شدہ صفحہ، انجن کو منحنی بیس لائنز فالو کرنے پر مجبور کرتا ہے۔
- پرنٹنگ کا معیار۔ صاف مشین سے چھپا ہوا ٹیکسٹ اچھی طرح پڑھا جاتا ہے۔ فیکس، تھرڈ جنریشن کے فوٹو کاپیاں، ڈاٹ-میٹکس آؤٹ پٹ اور سٹیمپ شدہ ٹیکسٹ کافی زیادہ خراب پڑھے جاتے ہیں۔
- صحیح زبان۔ انجن ابہام کو حل کرنے کے لیے ایک لینگویج ماڈل استعمال کرتا ہے۔ اگر آپ فرینچ دستاویز پر انگلش ماڈل چلاتے ہیں تو نتائج خراب ہو جاتے ہیں، حالانکہ حروف تہجی ملتے ہیں۔
- ہاتھ سے لکھنا — نہ کریں۔ یہ انجن مشین پرنٹ شدہ ٹیکسٹ کے لیے بنایا گیا ہے۔ ہاتھ سے لکھنے کی پہچان ایک بالکل مختلف مسئلہ ہے اور یہ کوئی سپورٹڈ یوز کیس نہیں ہے۔ اگر آپ کا دستاویز ہاتھ سے لکھا ہوا ہے، تو OCR پراعتماد غلط معلومات پیدا کرے گا۔
اگر scan خراب آئے، تو سب سے زیادہ کارآمد حل تقریباً کبھی بھی کوئی مختلف OCR سیٹنگ نہیں ہوتی۔ یہ دوبارہ scan کرنا ہے: زیادہ ہموار، زیادہ روشن، زیادہ سیدھا، 300 dpi پر۔ سکینر پر دس سیکنڈ گزارنا آؤٹ پٹ کو ٹھیک کرنے کے ایک گھنٹے سے بہتر ہے۔
سرچ ایبل PDF یا سادہ متن؟
دو مختلف مقاصد، دو مختلف ٹولز، اور غلط انتخاب وقت ضائع کرتا ہے:
- آپ چاہتے ہیں کہ دستاویز ایک دستاویز رہے — سرچ ایبل، کاپی ایبل، آرکائیوڈ، اب بھی اصل جیسی۔ وہ ہے سرچ ایبل PDF۔ معاہدوں، ریکارڈز، کسی بھی چیز کے لیے بہترین جسے آپ بعد میں جیسا تھا ویسا پیش کرنے کی ضرورت محسوس کر سکتے ہیں۔
- آپ الفاظ نکالنا چاہتے ہیں — تاکہ انہیں ایک ای میل میں پیسٹ کیا جا سکے، ایک سپریڈشیٹ میں فیڈ کیا جا سکے، یا رپورٹ میں کوٹ کیا جا سکے۔ وہ ہے Extract Text، جو آپ کو سادہ متن دیتا ہے اور لے آؤٹ کو نظر انداز کر دیتا ہے۔
اگر آپ کو یقین نہیں ہے، تو سرچ ایبل PDF کا انتخاب کریں۔ آپ بعد میں اس سے ٹیکسٹ نکال سکتے ہیں؛ آپ ایک ایسا صفحہ بحال نہیں کر سکتے جسے آپ نے ضائع کر دیا ہو۔
یہ کیسے کریں
CyvoDocOps میں OCR آپ کے اپنے ڈیوائس پر چلتا ہے — scan کبھی بھی سرور پر upload نہیں ہوتا۔ یہ CyvoDocOps Pro کا حصہ ہے، اور چونکہ Pro کو ویب پر نہیں بلکہ App Store یا Google Play کے ذریعے خریدا جاتا ہے، اس لیے OCR ٹولز موبائل ایپ میں موجود ہوتے ہیں۔
- بہترین سکین حاصل کریں جو آپ کر سکتے ہیں۔ 300 dpi، ہموار سطح، اچھی روشنی، سیدھا۔ یہ قدم کسی بھی دوسرے سے زیادہ آپ کے نتیجے کا تعین کرتا ہے۔
- CyvoDocOps ایپ میں دستاویز کھولیں۔ اگر آپ کے پاس نہیں ہے تو ایپ دیکھیں۔
- اپنا ٹول منتخب کریں۔ پیج کو برقرار رکھنے اور ایک خفیہ تہہ شامل کرنے کے لیے Searchable PDF؛ الفاظ نکالنے کے لیے Extract Text؛ یا جس زبان میں آپ پڑھ رہے ہیں اس کے لیے OCR English یا OCR Arabic۔
- نتیجہ چیک کریں۔ ایک ایسے لفظ کی تلاش کریں جو آپ کو معلوم ہے کہ صفحہ ایک پر ہے۔ اگر یہ نہیں ملتا، تو اس کا مطلب ہے کہ پہچان میں مشکل تھی — جو عام طور پر سکین کی طرف اشارہ کرتا ہے۔
حدود کے بارے میں ایماندار ہونا
- OCR کبھی بھی 100% درست نہیں ہوتا۔ صاف سکینز پر بھی غلطیاں ہوتی ہیں — کسی ہندسے کی غلط پڑھائی، ایک ہائفن کا گم ہو جانا۔ اچھا کامل نہیں ہے، اور جب نمبر ادائیگی کی رقم ہو تو یہ فرق اہمیت رکھتا ہے۔
- منفی تلاش پر بھروسہ نہ کریں۔ اگر Ctrl+F سے "indemnity" نہیں ملتا، تو اس کا مطلب یہ ہو سکتا ہے کہ وہ لفظ موجود نہیں ہے، یا OCR نے اسے "indernnity" پڑھا ہے۔ ایک OCR کی گئی دستاویز میں ہٹ کا نہ ہونا عدم موجودگی کا ثبوت نہیں ہے — یہ ایک اہم فرق ہے اگر آپ قانونی یا طبی مقاصد کے لیے ریکارڈ تلاش کر رہے ہیں۔
- ٹیبلز اور کالم مشکل ہوتے ہیں۔ ریکگنیشن ٹیکسٹ کی لائنوں پر عمل کرتی ہے؛ پیچیدہ لے آؤٹ میں کالم آپس میں مل سکتے ہیں یا ٹیبل کے خلیے بھی گڑبڑ ہو سکتے ہیں، یہاں تک کہ جب ہر انفرادی حرف کو صحیح پڑھا جائے۔
- ٹیکسٹ لیئر غلط ہو سکتی ہے جبکہ پیج درست ہو۔ یہ ڈیزائن کا مطلوبہ کام ہے — تصویر ریکارڈ ہوتی ہے، اور ٹیکسٹ انڈیکس ہوتا ہے — لیکن صرف لیئر سے کوئی اقتباس نہ کریں بغیر پیج کو دیکھے۔
عربی اور دیگر سکرپٹس
ریکگنیشن کی مشکل مختلف سکرپٹ کے لحاظ سے بہت زیادہ ہوتی ہے۔ عربی انگریزی سے نمایاں طور پر زیادہ مشکل ہے: حروف جڑتے ہیں، ان کی شکلیں لفظ میں پوزیشن کے حساب سے بدلتی ہیں، ڈائیکرٹکس کا مطلب ہوتا ہے، اور ٹیکسٹ دائیں سے بائیں چلتا ہے۔ انگریزی کے لیے تربیت یافتہ ماڈل اس پر بے کار ہے — آپ کو عربی ماڈل چاہیے، جو OCR Arabic کے ذریعے دستیاب ہے۔ اگر یہ آپ کا استعمال کا کیس ہے، تو عربی PDFs کے ساتھ کام کرنا تفصیلات فراہم کرتا ہے۔
یہاں on-device کیوں اہمیت رکھتا ہے
اس بارے میں سوچیں کہ لوگ اصل میں کیا scan کرتے ہیں: معاہدے، میڈیکل خطوط، بینک اسٹیٹمنٹس، پاسپورٹ، ٹیکس ریکارڈز۔ scanنگ وہ کام ہے جو آپ کاغذ پر موجود دستاویزات کے ساتھ کرتے ہیں کیونکہ وہ اہم ہیں۔ یہ گٹھڑی کسی اور کے سرور پر پراسیسنگ کے لیے بھیجنا ایک عجیب سودا ہے — اور عام بھی، کیونکہ زیادہ تر OCR سروسز کے پاس کام کرنے کا کوئی دوسرا طریقہ نہیں ہوتا۔ ریکگنیشن کو اپنے آلے (device) پر چلانے سے دستاویز وہیں رہتی جہاں وہ شروع ہوئی تھی۔ کچھ بھی upload نہیں کیا جاتا، لہٰذا کچھ بھی برقرار رکھنے، لاگ کرنے یا لیک ہونے کے لیے نہیں ہوتا۔
اکثر پوچھے گئے سوالات
میں اپنی scan شدہ PDF کیوں سرچ نہیں کر سکتا؟
کیونکہ اس میں کوئی متن نہیں ہے۔ ہر صفحہ ایک تصویر ہے، اور سرچ حروف تلاش کرتی ہے۔ OCR وہ چیز ہے جو تصویر کو الفاظ میں بدلتی ہے جنہیں آپ کا کمپیوٹر ڈھونڈ سکتا ہے۔
کیا PDF کو searchable بنانا اس کے ظاہری شکل پر کوئی فرق ڈالتا ہے؟
نہیں. سکین کی گئی تصویر بالکل محفوظ رہتی ہے۔ پہچانا گیا متن اسے ایک نظر نہ آنے والی تہہ (invisible layer) کے طور پر پیچھے شامل کر دیا جاتا ہے۔
کیا OCR ہاتھ سے لکھے ہوئے متن پر کام کرے گا؟
نہیں. یہ انجن مشین پرنٹ شدہ متن کے لیے ڈیزائن کیا گیا ہے۔ ہاتھ کی تحریر ایک مختلف مسئلہ ہے اور یہ کوئی سپورٹ کردہ استعمال کا کیس نہیں ہے۔
OCR ایپ میں کیوں ہے نہ کہ browser میں؟
یہ CyvoDocOps Pro کا حصہ ہے، اور Pro کو App Store یا Google Play کے ذریعے خریدا جاتا ہے — کوئی ویب چیک آؤٹ نہیں ہے — اس لیے یہ ٹولز ایپ میں موجود ہیں۔ پہچان چاہے کسی بھی طرح سے آپ کے ڈیوائس پر چلتی ہے۔
کیا میرا سکین OCR کے لیے upload کیا جاتا ہے؟
ریکوگنیشن مکمل طور پر آپ کے ڈیوائس پر چلتا ہے اور دستاویز کسی سرور کو بھیجی نہیں جاتی۔