Knowledge Bases

ساخت پایپ‌لاین‌های OCR در سطح تولید: فراتر از استخراج متن ساده

تشخیص نوری کاراکتر (OCR) اغلب به اشتباه به عنوان یک «کپی-پیست» ساده از متن در تصاویر در نظر گرفته می‌شود. در واقع، ساخت یک پایپ‌لاین OCR مقاوم یک چالش مهندسی پیچیده است که شامل پیش‌پردازش تصویر، انتخاب مدل، پس‌پردازش و مدیریت خطای دقیق می‌شود. برای توسعه‌دهندگانی که OCR را در پایگاه‌های دانش یا سیستم‌های مدیریت اسناد ادغام می‌کنند، درک ظرافت‌های کل این پایپ‌لاین برای دستیابی به دقت بالا حیاتی است.

آناتومی یک پایپ‌لاین OCR

یک تصویر خام به ندرت متنی بی‌نقص تولید می‌کند. نویز، کنتراست پایین، کجی و فونت‌های متفاوت می‌توانند دقت تشخیص را به شدت کاهش دهند. یک پایپ‌لاین OCR حرفه‌ای معمولاً از سه مرحله متمایز تشکیل شده است: پیش‌پردازش، تشخیص و پس‌پردازش.

1. پیش‌پردازش تصویر

قبل از ارسال تصویر به یک موتور OCR، باید آن را نرمال‌سازی کنید. تکنیک‌های رایج شامل موارد زیر است:

  • تبدیل به خاکستری: پیچیدگی محاسباتی را کاهش داده و نویز رنگی را حذف می‌کند.
  • دو سطحی کردن (Binarization): تصویر را با استفاده از آستانه‌گذاری (مانند روش Otsu) به سیاه و سفید تبدیل می‌کند تا متن را از پس‌زمینه جدا کند.
  • کاهش نویز: اعمال بلور گاوسی یا عملیات مورفولوژیکی برای حذف دانه‌ها و آثار جانبی.
  • صاف‌سازی کجی (Deskewing): چرخش تصویر برای هم‌تراز کردن متن به صورت افقی.

2. انتخاب موتور OCR

استاندارد صنعتی برای OCR متن‌باز Tesseract است که توسط گوگل نگهداری می‌شود. با این حال، برنامه‌های مدرن اغلب از موتورهای مبتنی بر یادگیری عمیق مانند DeepLabCut شرکت NVIDIA یا APIهای ابری مانند AWS Textract و Google Cloud Vision استفاده می‌کنند. برای راه‌حل‌های میزبانی شده توسط خود سازمان که نیاز به حریم خصوصی و صرفه‌جویی در هزینه دارند، Tesseract به دلیل پشتیبانی گسترده از زبان‌ها و قابلیت سفارشی‌سازی بالا، همچنان یک انتخاب برتر است.

پیاده‌سازی یک پایپ‌لاین پایه در پایتون

بیایید به یک پیاده‌سازی عملی با استفاده از OpenCV برای پیش‌پردازش و tesseract (از طریق بسته pytesseract) برای استخراج نگاه کنیم. این مثال نحوه تمیز کردن یک تصویر را برای بهبود خوانایی برای موتور OCR نشان می‌دهد.

import cv2
import pytesseract
import numpy as np

def preprocess_image(image_path):
    # بارگذاری تصویر
    image = cv2.imread(image_path)
    
    # تبدیل به خاکستری
    gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY)
    
    # اعمال بلور گاوسی برای کاهش نویز
    blurred = cv2.GaussianBlur(gray, (5, 5), 0)
    
    # اعمال آستانه‌گذاری تطبیقی برای مدیریت شرایط نوری متفاوت
    thresh = cv2.adaptiveThreshold(
        blurred, 255, 
        cv2.ADAPTIVE_THRESH_GAUSSIAN_C, 
        cv2.THRESH_BINARY_INV, 
        11, 2
    )
    
    return thresh

def extract_text_from_image(image_path):
    # مرحله 1: پیش‌پردازش
    clean_image = preprocess_image(image_path)
    
    # مرحله 2: انجام OCR
    # lang='eng' زبان را مشخص می‌کند؛ psm=6 فرض می‌کند که یک بلک یکنواخت از متن وجود دارد
    text = pytesseract.image_to_string(clean_image, config='--psm 6')
    
    return text

# نحوه استفاده
if __name__ == "__main__":
    raw_text = extract_text_from_image("document.png")
    print(f"Extracted Text: {raw_text}")

پس‌پردازش و اعتبارسنجی

خروجی خام OCR اغلب حاوی خطاهایی مانند کاراکترهای اشتباه تشخیص داده شده یا فاصله‌های اضافی است. پس‌پردازش برای ادغام OCR در پایگاه‌های دانش ضروری است. این مرحله ممکن است شامل موارد زیر باشد:

  • عبارات باقاعده (Regex): تمیز کردن قالب‌بندی، استخراج الگوهای خاص (مانند تاریخ‌ها یا ایمیل‌ها) یا حذف نمادهای ناخواسته.
  • بررسی املا: استفاده از کتابخانه‌هایی مانند PyEnchant برای اصلاح اشتباهات رایج OCR.
  • امتیازدهی اعتماد: Tesseract امتیازات اعتماد را برای هر کلمه ارائه می‌دهد. توسعه‌دهندگان باید نتایج با اعتماد به نفس پایین را فیلتر کرده و بازبینی دستی یا پردازش اضافی را درخواست کنند.

نتیجه‌گیری

ساخت یک پایپ‌لاین OCR موفق نیازمند بیش از یک تماس ساده با API است. این کار رویکردی کل‌نگر را می‌طلبد که کیفیت داده‌های ورودی، انتخاب موتور تشخیص و دقت پس‌پردازش را در نظر بگیرد. با پیاده‌سازی تکنیک‌های پیش‌پردازش مقاوم و بهره‌گیری از امتیازات اعتماد، توسعه‌دهندگان می‌توانند سیستم‌های قابل اعتمادی ایجاد کنند که تصاویر غیرساختاریافته را به ورودی‌های پایگاه دانش قابل جستجو و ساختاریافته تبدیل می‌کنند.

همان‌طور که مدل‌های هوش مصنوعی به تکامل خود ادامه می‌دهند، مرز بین OCR سنتی و بینایی ماشین مدرن کمرنگ خواهد شد. با این حال، اصول اساسی تمیزسازی و اعتبارسنجی داده‌ها ثابت باقی می‌مانند. با یک پایه پیش‌پردازش محکم شروع کنید، موتور مناسب را برای محدودیت‌های خود انتخاب کنید و همیشه نتایج خود را تأیید نمایید.

Share: