آرشیوی که اسکن شده ولی هنوز قابل جستوجو نیست
خیلی از سازمانها سالها پیش آرشیوشان را اسکن کردهاند و خیالشان راحت است. ولی یک PDF اسکنشده از نظر کامپیوتر یک عکس است، نه متن — و در عکس نمیشود جستوجو کرد.
OCR فارسی چیست و چرا سختتر از انگلیسی است؟
OCR یعنی استخراج متن از تصویر سند. برای فارسی سختتر است چون حروف به هم میچسبند و شکلشان بسته به جای کلمه عوض میشود، نقطهها تفاوت حروف را میسازند و نویز اسکن آنها را از بین میبرد، و جدولهای راستبهچپ هنگام استخراج بههم میریزند. نتیجه اینکه خروجی خام تقریباً همیشه به بازبینی نیاز دارد.
چرا اسکنکردن کافی نبوده
اسکن، سند کاغذی را به تصویر تبدیل میکند و همین برای بایگانی و مشاهده کافی است. ولی هیچ سامانهای نمیتواند داخل تصویر دنبال یک شمارهی نامه یا یک عبارت بگردد، چون از نظر آن سامانه اصلاً متنی وجود ندارد.
نتیجهی عملیاش را همه دیدهاند: کارمندی که میداند بخشنامهای هست ولی نمیداند کجاست، و ناچار از همکار قدیمیتر میپرسد. آرشیو هست، دسترسی نیست.
جاهایی که OCR فارسی خطا میکند
- حروف نقطهدار: «ب» و «پ» و «ت» و «ث» فقط در نقطه فرق دارند و یک لکهی جوهر کافی است تا اشتباه خوانده شوند.
- اسناد قدیمی با کاغذ زردشده، مهر و امضای روی متن، و کجبودن صفحه هنگام اسکن.
- جدولهای راستبهچپ که ترتیب ستونهایشان در متن استخراجشده جابهجا میشود.
- متن دستنویس در حاشیهی نامهها — دستور مدیر، که اتفاقاً مهمترین بخش سند است.
- اعداد فارسی و لاتین قاطی، مخصوصاً در شمارهی نامه و تاریخ.
قاعدهای که رعایتش مهمتر از انتخاب موتور OCR است
وسوسهی طبیعی این است که خروجی OCR مستقیم وارد دانشنامه شود تا کار زودتر تمام شود. این دقیقاً همانجایی است که پروژهها خراب میشوند: خطای OCR بیصدا وارد پایگاه دانش میشود و بعد به شکل «جواب اشتباه با ارجاع به سند معتبر» بیرون میآید — بدترین نوع خطا، چون قابل تشخیص نیست.
راه درست یک دروازهی بازبینی است: سندی که اطمینان استخراجش پایین باشد به صف بازبینی میرود و تا وقتی کسی تأییدش نکرده وارد پاسخدهی نمیشود. حجم بازبینی هم معمولاً کم است، چون فقط بخشهای مشکوک علامت میخورند نه کل آرشیو.
سند اسکنشدهای که OCR نشده، از نظر دانشنامه اصلاً وجود ندارد. اولین کاری که موقع برآورد باید انجام دهید این است که بفهمید چه نسبتی از آرشیوتان تصویری است، نه چند گیگابایت است.
بعد از OCR چه اتفاقی میافتد
متن استخراجشده هنوز آمادهی پاسخدهی نیست. باید نرمال شود — نیمفاصله، «ی» و «ک» عربی و فارسی، فاصلههای اضافه — و بعد به قطعات معنادار شکسته شود تا بازیابی روی آن کار کند.
همینجاست که OCR به بقیهی زنجیره وصل میشود: خروجی تمیزشده وارد همان مسیری میشود که اسناد دیجیتال از آن میگذرند، و از آن به بعد فرقی بین سند اسکنشده و سند Word نیست.
پرسشهای متداول
دقت OCR فارسی چقدر است؟
عدد واحدی وجود ندارد و هر کس عدد قطعی بدهد دارد حدس میزند. دقت به کیفیت اسکن، نوع فونت، وجود مهر و دستنویس و تمیزی کاغذ بستگی دارد. راه درست این است که روی نمونهای از آرشیو واقعی خودتان اندازه گرفته شود.
دستنویس هم خوانده میشود؟
بهمراتب ضعیفتر از متن تایپی، و برای دستورهای دستنویس روی نامه معمولاً به بازبینی انسانی نیاز است. اگر این بخش برایتان حیاتی است، باید در برآورد جدا دیده شود.
آرشیو ما چند صد هزار برگ است، چقدر طول میکشد؟
پردازش خودکار است و روی حجم بالا موازی اجرا میشود، پس گلوگاه معمولاً پردازش نیست بلکه بازبینی بخشهای مشکوک است. برآورد زمان بعد از دیدن یک نمونهی واقعی داده میشود.
اسناد در این فرآیند از سازمان خارج میشوند؟
در استقرار درونشبکهای خیر. پردازش OCR هم مثل بقیهی زنجیره روی سرور خود سازمان انجام میشود.
با یک نمونه از آرشیو خودتان شروع کنیم
چند ده برگ نماینده از آرشیوتان کافی است تا کیفیت واقعی استخراج را روی همان اسناد اندازه بگیریم.
درخواست دموخانوادهی آرتین
شرکت هوش گستر فردا آرتین چند محصول هوش مصنوعی فارسی میسازد. هر کدام کار خودش را میکند — اینها را ببینید تا بدانید کدام به کار شما میآید.
شرکت هوش گستر فردا آرتینشرکتسازندهی محصولات هوش مصنوعی فارسیشرکت هوش گستر فردا آرتین، مستقر در پارک علم و فناوری خراسان رضوی، سازندهی شش محصول هوش مصنوعی فارسی و یک رسانهی تخصصی است. اینجا میبینید کدام راهکار به کار سازمان شما میآید و مرز هرکدام کجاست.artinbi.ir
آرتینباتمحصولچتبات اختصاصی فارسی، بدون کدنویسیپلتفرم ساخت چتبات هوشمند فارسی بدون کدنویسی. از فایل، لینک و Sitemap آموزشش دهید و به REST API و پایگاه داده وصلش کنید. روی سایت، اینستاگرام، تلگرام و بله پاسخ میدهد.مشتری ساعت ۱۱ شب سؤال میپرسد، ربات جواب میدهدartin-bot.ir
AgentsHubمحصولبستر یکپارچهسازی و حاکمیت ایجنت سازمانیایجنتهای سازمان از هر پیمانکار و با هر فناوری، زیر یک هویت واقعی کاربر، یک سیاست داده و یک لاگ ممیزی مشترک. کارکنان بهجای چند سامانه، یک در میبینند.هر واحد ایجنت خودش را ساخته و هیچکس نمیداند چه کسی چه کردagentshub.ir
جعبه ابزار هوش مصنوعی آرتینمحصولبیش از ۲۰ ابزار AI اداری و سندیبیش از ۲۰ ابزار هوش مصنوعی سازمانی در یک پنل: نامهساز، مترجم اداری، خلاصهساز، تولید تصویر، تبدیل صوت به متن، OCR، چارتساز و پاورپوینتساز.نامه، ترجمه، خلاصه، OCR و پاورپوینت — همه در یک پنل سازمانیtoolsai.ir
تلنتایآیمحصولاپ هوش مصنوعی فارسی برای کاربر عمومیاپلیکیشن فارسی هوش مصنوعی برای استفادهی روزمره: گفتگو، تولید و ویرایش تصویر، لوگوساز و اتاق جادویی. روی اندروید و وب، با یک اشتراک واحد.همهی ابزارهای AI روزمره در یک اپ فارسی، بدون فیلترشکنtalentai.ir
چاریکمحصولهوش تجاری فروش و بازگرداندن مشتریچاریک فایل فروش شما را تحلیل میکند، مشتریهای ازدسترفته و در خطر ریزش را پیدا میکند و برای هرکدام یک پیشنهاد و پیام هدفدار بههمراه کد تخفیف میسازد تا برگردند.مشتریهایی که دیگر خرید نمیکنند را پیدا و برمیگرداندcharik.ir
آرتینمگرسانهمجلهی تخصصی هوش مصنوعی به زبان فارسیاخبار، مقالات تحلیلی و آموزش هوش مصنوعی به زبان فارسی. آرتینمگ رسانهی مستقل گروه آرتین است و محصول نمیفروشد — اینجا یاد میگیرید، بعد تصمیم میگیرید.artinmag.ir