Taranmış PDF'te Neden Arama Yapamıyorum? OCR Rehberi

Bir belgeyi tarayıp PDF olarak kaydettiğinizde, gözünüzün gördüğü harfler bilgisayar için yoktur. Dosyada yalnızca piksel vardır. OCR, o piksellere bakıp harfleri tahmin eden ayrı bir işlemdir.

Güncellendi:

Taranmış PDF aslında nedir

Tarayıcı bir sayfanın fotoğrafını çeker ve o fotoğrafı bir PDF kabına koyar. Sonuç dosya .pdf uzantısı taşır ama içeriği bir JPEG'den farklı değildir: metin katmanı yoktur. Bu yüzden Ctrl+F çalışmaz, kopyalama çalışmaz, ekran okuyucular sayfayı okuyamaz.

Word'den üretilen bir PDF ise metni karakter olarak saklar; her harfin hangi yazı tipiyle, hangi koordinatta çizileceği yazılıdır. Bu iki dosya aynı görünür ama tamamen farklı şeylerdir.

OCR ne yapar

OCR (Optical Character Recognition), görüntüdeki şekilleri analiz edip hangi harfe benzediklerini tahmin eder. Sonuçta bir metin katmanı üretilir ve bu katman görüntünün üzerine görünmez şekilde yerleştirilir. Sayfa aynı görünmeye devam eder ama artık aranabilir ve kopyalanabilir hale gelir.

Kritik nokta: OCR bir tahmindir, okuma değildir. Sonuç her zaman bir doğruluk oranı taşır ve o oranı belirleyen şey büyük ölçüde girdi kalitesidir.

Doğruluğu ne belirler

EtkenİyiKötü
Çözünürlük300 DPI150 DPI altı
KontrastSiyah metin, beyaz zeminGri fotokopi, sararmış kağıt
EğrilikDüz taranmışEğik veya kavisli sayfa
Yazı tipiStandart matbaa yazısıEl yazısı, süslü font
DüzenTek sütunKarmaşık tablo, çok sütun

Aynı belgeyi 150 DPI yerine 300 DPI tarayarak elde edeceğiniz doğruluk artışı, herhangi bir yazılım ayarından elde edeceğinizden büyüktür. Kaynak kalitesi her şeyin önündedir.

Reklam

Türkçe metinlerde özel durum

Türkçedeki ı/i, ğ, ş, ç, ö, ü karakterleri OCR için ek zorluk çıkarır. Özellikle noktasız ı ile noktalı i ayrımı düşük çözünürlükte kaybolur ve "ışık" kelimesi "isik" olarak çıkabilir.

Bu yüzden OCR yaparken dilin doğru seçilmesi önemlidir: Türkçe modeli, bu karakterleri bekleyen bir sözlükle çalışır ve belirsiz durumlarda doğru tahmini yapma şansı yükselir. İngilizce modeliyle taranmış bir Türkçe belge, sadece bu yüzden gözle görülür şekilde daha çok hata üretir.

OCR sonrası ne beklemeli

%99 doğruluk kulağa çok iyi gelir ama 500 kelimelik bir sayfada beş hata demektir. Sözleşme, fatura, kimlik gibi belgelerde OCR çıktısını asla doğrulamadan kullanmayın — özellikle rakamları.

Pratik akış

  1. Belgeyi 300 DPI, gri tonlama veya siyah-beyaz tarayın.
  2. Sayfa eğikse düzeltin.
  3. OCR dilini belgenin diline göre seçin.
  4. Çıktıdaki sayıları, isimleri ve tarihleri gözle doğrulayın.
  5. Aranabilir kopyayı saklayın, orijinal taramayı da atmayın.

Sık sorulan sorular

OCR sonrası belge görüntüsü değişir mi?

Hayır. Metin katmanı görüntünün üzerine görünmez biçimde yerleştirilir; sayfa aynı görünmeye devam eder ama artık aranabilir ve kopyalanabilir olur.

El yazısı tanınır mı?

Standart OCR matbaa yazısı için tasarlanmıştır ve el yazısında güvenilir sonuç vermez. Çıkan metni doğrulamadan kullanmayın; genelde elle yazmak daha hızlıdır.

Neden bazı harfler yanlış çıkıyor?

OCR bir tahmindir. Düşük çözünürlük, eğik sayfa, zayıf kontrast ve süslü yazı tipleri doğruluğu düşürür. Türkçede özellikle noktasız ı ile noktalı i ayrımı düşük çözünürlükte kaybolur.

OCR için hangi çözünürlük gerekir?

300 DPI pratik standarttır. Daha düşüğü tanıma doğruluğunu belirgin biçimde düşürür; daha yükseği genelde ek fayda sağlamadan dosyayı büyütür.

Diğer rehberler

Konta PDF'i deneyin

Birleştirme, bölme, sıralama, şifreleme, OCR ve görüntü→PDF ücretsiz. Dosyalar tarayıcınızda işleniyor.

Araçları aç