PDF'ten Metin Kopyalarken Neden Bozuk Çıkıyor?

Bir PDF'ten metin kopyalayıp yapıştırdığınızda üç farklı şey olabilir: metin düzgün gelir, kelimeler birbirine yapışır veya tamamen anlamsız karakterler çıkar. Üçünün sebebi de farklıdır.

Güncellendi:

PDF metni nasıl saklar

PDF, metni kelime veya cümle olarak değil, konumlandırılmış glif çizimleri olarak saklar: "şu yazı tipinin 65 numaralı glifini şu koordinata çiz". Sayfada "merhaba" okursunuz ama dosyada sekiz ayrı çizim komutu vardır.

Kopyalama işlemi bu komutları geri okuyup metne çevirmeye çalışır. Bu bir çeviridir ve her zaman kusursuz çalışmaz.

Üç farklı bozulma

BelirtiSebepDüzeltilebilir mi
Hiç metin kopyalanmıyorTaranmış belge, metin katmanı yokEvet, OCR ile
Anlamsız karakterlerYazı tipi eşlemesi (ToUnicode) eksikZor, OCR daha pratik
Kelimeler birleşiyorBoşluk karakteri yerine konum atlamasıKısmen, elle düzeltme
Satır sonları kayboluyorParagraf yapısı yokElle düzeltme
Sütunlar karışıyorOkuma sırası tanımsızElle düzeltme

Anlamsız karakterlerin sebebi

Her yazı tipinin kendi glif numaralandırması vardır ve bu numaralar Unicode karakterlerle aynı olmak zorunda değildir. PDF üreticisi, hangi glifin hangi karaktere karşılık geldiğini anlatan bir ToUnicode tablosu gömmelidir.

Bu tablo eksikse veya bozuksa, kopyalayan program glif numaralarını doğrudan karakter kodu sanır ve ekrana çöp çıkar. Sayfa doğru görünmeye devam eder, çünkü çizim komutları sağlamdır; bozuk olan sadece "bu şekil hangi harfti" bilgisidir.

Kelimeler neden birleşiyor

PDF'te boşluk her zaman bir boşluk karakteri değildir. Üretici çoğu zaman "sonraki kelimeyi 4 birim sağa çiz" der ve arada hiçbir karakter yoktur. Kopyalayan program bu boşluğu tahmin etmek zorundadır.

Tahmin eşiği yanlış tutulduğunda iki sonuç doğar: dar boşluklar yok sayılır ve kelimeler birleşir, veya harfler arası aralık boşluk sanılır ve tek kelime "k e l i m e" gibi dağılır. İkincisi özellikle başlıklarda ve harf aralığı açılmış tasarımlarda görülür.

Reklam

Sütunlu belgelerde okuma sırası

İki sütunlu bir sayfada metin dosyada hangi sırayla saklanır? PDF bunu tanımlamaz — çizim sırası, görsel okuma sırasıyla aynı olmak zorunda değildir. Bu yüzden iki sütunlu bir akademik makaleden kopyalanan metin, sol sütunun bir satırıyla sağ sütunun bir satırını dönüşümlü sıralayabilir.

Bazı belgeler bunu düzelten bir "etiketli PDF" yapısı taşır (erişilebilirlik için üretilmiş belgeler genelde taşır). Çoğu belge taşımaz ve bu durumda sütun sütun seçmek tek pratik yoldur.

Ne yapmalı

  1. Önce test edin: Bir paragrafı kopyalayıp düz metin düzenleyiciye yapıştırın. Sorunu görmeden çözüm aramayın.
  2. Metin yoksa: Belge taranmıştır; OCR gerekir.
  3. Metin çöpse: Yazı tipi eşlemesi bozuk; sayfayı görüntüye çevirip OCR yapın.
  4. Metin var ama dağınıksa: Küçük bölümler hâlinde kopyalayın, bul-değiştir ile temizleyin.
  5. Sütunlu belgede: Her sütunu ayrı seçin.

Son bir uyarı: kopyalanan metnin doğruluğunu göz kararı kabul etmeyin. Özellikle sayılar — 1/l, 0/O, 5/S karışıklıkları hem OCR'da hem bozuk eşlemede sık görülür ve tam olarak fark edilmesi en zor hata türüdür.

Sık sorulan sorular

Kopyaladığım metin neden anlamsız çıkıyor?

Yazı tipinin glif numaralarını Unicode karakterlere eşleyen ToUnicode tablosu eksik veya bozuktur. Sayfa doğru görünmeye devam eder çünkü çizim komutları sağlamdır; bozuk olan yalnızca "bu şekil hangi harfti" bilgisidir.

Kelimeler neden birbirine yapışıyor?

PDF'te boşluk her zaman bir boşluk karakteri değildir; üretici çoğu zaman sonraki kelimeyi biraz sağa çizer. Kopyalayan program bu boşluğu tahmin etmek zorundadır ve eşik yanlış tutulduğunda kelimeler birleşir.

İki sütunlu belgede satırlar neden karışıyor?

PDF okuma sırasını tanımlamaz; çizim sırası görsel okuma sırasıyla aynı olmak zorunda değildir. Etiketli olmayan belgelerde sütunları tek tek seçmek tek pratik yoldur.

Bozuk eşlemeyi düzeltebilir miyim?

Pratikte hayır. Metin dosyada okunabilir biçimde yoktur. Çözüm, sayfaları görüntü olarak alıp OCR ile metni yeniden üretmektir.

Diğer rehberler

Konta PDF'i deneyin

Birleştirme, bölme, sıralama, şifreleme, OCR ve görüntü→PDF ücretsiz. Dosyalar tarayıcınızda işleniyor.

Araçları aç