TanodTools
TR

PDF'ten metne

PDF'teki metni sayfa sayfa çıkarın, ardından kopyalayın ya da .txt dosyası olarak kaydedin. Taranmış PDF'lerde çıkarılacak metin yoktur; onlar için PDF OCR aracını kullanın.

Dosyalarınız cihazınızdan asla çıkmaz

PDF'i buraya bırakın

Ya da bu sayfada herhangi bir yere sürükleyin.

Bu cihazda açılır. Hiçbir şey yüklenmez.

Bir seferde tek PDF, en fazla 200 MB ve 500 sayfa. Araç, PDF'te saklanan metni okur. Taranmış bir PDF yalnızca sayfa resimlerinden oluşur ve metin içermez; onun için PDF OCR aracı gerekir. Tablolar ve sütunlar satır satır çıkar; parola korumalı PDF'ler açılamaz.

PDF'ten metin nasıl çıkarılır

  1. Bir PDF dosyası seçin veya sayfaya sürükleyin.
  2. Sayfalar okunurken biraz bekleyin. Ardından tüm sayfaları ya da 1-3, 5 gibi bir aralığı seçin; her sayfanın başladığı yeri işaretlemek isteyip istemediğinizi de belirleyin.
  3. .txt indir düğmesine basın ya da tüm metni veya listeden tek bir sayfanın metnini kopyalayın.

Bir PDF'teki metin nereden gelir

Bir kelime işlemci, bir web tarayıcısı ya da bir tasarım programıyla hazırlanan PDF, kelimelerini metin olarak saklar: her harf dizisi, bir yazı tipi ve sayfadaki bir konumla birlikte gelir. Bu aracın okuduğu şey, saklanan bu metindir. Tarayıcınız dosyayı pdf.js ile açar, her sayfadan metnini ister ve harf dizilerini dosyanın listelediği sırayla yeniden satırlar hâline getirir. Sayfanın ekranda nasıl göründüğüne hiç bakmaz.

Taranmış bir PDF farklıdır. Bir tarama cihazı ya da telefon kamerası her sayfanın bir resmini üretir ve PDF yalnızca bu resimleri içerir; dolayısıyla okunacak metin yoktur: kelimeleri görürsünüz ama dosyanın içinde yer almazlar. Resimleri yeniden metne çevirmek, optik karakter tanıma (OCR) denen başka bir iştir ve bunu PDF OCR aracı yapar. Metni olmayan sayfalar, karışık bir dosyada taramaları normal sayfalardan ayırabilmeniz için metin kutusunun altındaki listede işaretlenir.

Sonuç, hiçbir biçimlendirme içermeyen düz metindir. Satırlar PDF'te nerede bitiyorsa orada biter; iki satır arasındaki boşluk o sayfadaki olağan aralıktan belirgin biçimde büyükse araya boş bir satır eklenir. Paragraflar ve başlıklar bu şekilde ayrılır. Bazı yazı tiplerinin fi ve fl gibi harf çiftleri için kullandığı birleşik harfler (ligatürler) yeniden ayrı harflere çevrilir, görünmez yumuşak tireler ise atılır.

İpuçları

  • Taranmış sayfalar, metni olmayan sayfalar olarak görünür. Onları PDF OCR ile işleyin ve sonucu okuyun.
  • Alt alta dizilmiş satırları akıcı paragraflara dönüştürmek için metni Satır sonlarını kaldır aracına yapıştırın.
  • Yalnızca birkaç sayfa PDF olarak mı gerekiyor? PDF sayfalarını ayıkla aracı bunları ayırır, Kelime sayacı da kopyaladığınız metni sayar.

Sık sorulan sorular

PDF'im yükleniyor mu?

Hayır. Metni tarayıcınız, açık kaynaklı pdf.js kitaplığıyla kendi cihazınızda okur. Sunucuya hiçbir şey gönderilmez ve sekmeyi kapattığınızda metin de silinir.

Neden hiç metin çıkmadı ya da yalnızca bazı sayfaların metni çıktı?

Araç, PDF'te saklanan metni okur. Taranmış bir PDF her sayfayı bir resim olarak saklar; resmin arkasında metin yoktur, dolayısıyla okunacak bir şey de yoktur. Aynı durum, geri kalanı normal olan bir belgeye eklenmiş taranmış sayfalar için de geçerlidir. Resimlerdeki harfleri tanımak için PDF OCR aracını kullanın. Metni olmayan sayfalar, metin kutusunun altındaki listede işaretlenir.

Biçimlendirme korunuyor mu?

Hayır. Düz metin elde edersiniz: harfler, sayılar ve satır sonları. Yazı tipleri, renkler, resimler ve sayfa düzeni dışarıda kalır. Satırlar PDF'te nerede bitiyorsa orada bölünür; iki satır arasındaki boşluk olağandan büyükse, paragraflar arasında olduğu gibi araya boş bir satır eklenir.

Bölünmüş satırları paragraf hâlinde nasıl birleştirebilirim?

Metni Satır sonlarını kaldır aracına yapıştırın. Araç, her paragrafın içindeki satırları birleştirir, paragraflar arasındaki boş satırları korur ve satır sonunda tireyle bölünmüş kelimeleri de düzeltebilir.

Bazı metinler neden garip bir sırada çıkıyor ya da tuhaf parçalara bölünüyor?

Metin, PDF'in sakladığı sırayla çıkar; bu sıra genellikle okuma sırasıdır ama her zaman değil. Tablolar, birden çok sütunlu sayfalar ve tasarım programlarından dışa aktarılmış PDF'ler karışık çıkabilir; bazı PDF'ler de metni, gördüğünüz kelimelerle örtüşmeyen parçalar hâlinde saklar.

İngilizce dışındaki dillerle çalışır mı?

Evet. Metin Unicode olarak okunur; bu yüzden PDF'te düzgün bir metin katmanı olduğu sürece aksanlı harfler, Kiril ve Yunan alfabeleri, Hintçe, Çince ve diğer yazı sistemleri sorunsuz çıkar. Bir PDF alışılmadık bir yazı tipi düzeni kullanıyorsa, hangi programda kopyalarsanız kopyalayın metin bozuk karakterlerle çıkar; yaygın çözüm, o belgeye OCR uygulamaktır.