TanodTools
ID

PDF ke teks

Ambil teks dari PDF halaman demi halaman, lalu salin atau simpan sebagai file .txt. PDF hasil scan tidak memiliki teks untuk diambil. Untuk PDF seperti itu, gunakan OCR PDF.

File Anda tidak pernah meninggalkan perangkat Anda

Letakkan PDF di sini

Atau seret ke mana saja di halaman ini.

Dibuka di perangkat ini. Tidak ada yang diunggah.

Satu PDF sekali proses, hingga 200 MB dan 500 halaman. Alat ini membaca teks yang tersimpan di dalam PDF. PDF hasil scan hanyalah gambar halaman dan tidak memiliki teks, jadi Anda perlu memakai OCR PDF sebagai gantinya. Tabel dan kolom ditampilkan baris demi baris, dan PDF yang dilindungi kata sandi tidak bisa dibuka.

Cara mengekstrak teks dari PDF

  1. Pilih file PDF, atau seret ke halaman ini.
  2. Tunggu sebentar sementara setiap halaman dibaca. Pilih semua halaman atau rentang seperti 1-3, 5, lalu tentukan apakah awal setiap halaman perlu ditandai.
  3. Tekan Unduh .txt, atau salin seluruh teks, atau salin satu halaman dari daftar.

Dari mana teks dalam PDF berasal

PDF yang dibuat oleh pengolah kata, browser, atau program desain menyimpan kata-katanya sebagai teks: setiap rangkaian huruf disertai font dan posisinya di halaman. Teks tersimpan inilah yang dibaca alat ini. Browser Anda membuka file dengan pdf.js, meminta teks dari setiap halaman, lalu menyusun kembali rangkaian huruf itu menjadi baris sesuai urutan yang tercantum di dalam file. Alat ini sama sekali tidak melihat tampilan halaman di layar.

Lain halnya dengan PDF hasil scan. Scanner atau kamera ponsel menghasilkan gambar dari setiap halaman, dan PDF hanya berisi gambar-gambar itu, sehingga tidak ada teks yang bisa dibaca: Anda melihat kata-kata, tetapi file tidak memuatnya. Mengubah gambar kembali menjadi teks adalah pekerjaan lain yang disebut pengenalan karakter optik (OCR), dan itulah yang dilakukan OCR PDF. Halaman tanpa teks diberi tanda di daftar di bawah kotak teks, sehingga pada file campuran Anda bisa membedakan halaman hasil scan dari halaman biasa.

Hasilnya adalah teks polos tanpa format. Baris berakhir di tempat yang sama seperti di PDF, dan satu baris kosong ditambahkan di tempat jarak antara dua baris jelas lebih besar daripada jarak biasa pada halaman itu; dengan cara inilah paragraf dan judul dipisahkan. Ligatur yang dipakai sebagian font untuk pasangan huruf seperti fi dan fl dikembalikan menjadi huruf terpisah, dan tanda hubung lunak (soft hyphen) yang tidak terlihat dibuang.

Tips

  • Halaman hasil scan muncul sebagai halaman tanpa teks. Jalankan OCR PDF pada halaman itu, lalu baca hasilnya.
  • Tempel teksnya ke Hapus jeda baris untuk mengubah baris-baris yang bertumpuk menjadi paragraf yang mengalir.
  • Hanya perlu beberapa halaman dalam bentuk PDF? Ekstrak halaman PDF mengambilnya untuk Anda, dan Penghitung kata menghitung teks yang Anda salin.

Pertanyaan umum

Apakah PDF saya diunggah?

Tidak. Browser Anda membaca teksnya dengan pustaka open source pdf.js, di perangkat Anda. Tidak ada yang dikirim ke server, dan teksnya hilang begitu Anda menutup tab.

Mengapa saya tidak mendapat teks, atau hanya dari beberapa halaman?

Alat ini membaca teks yang tersimpan di dalam PDF. PDF hasil scan menyimpan setiap halaman sebagai gambar, tanpa teks di baliknya, jadi tidak ada yang bisa dibaca. Hal yang sama berlaku untuk halaman hasil scan yang ditambahkan ke dokumen yang selebihnya normal. Gunakan OCR PDF untuk mengenali huruf pada gambar tersebut. Halaman tanpa teks diberi tanda di daftar per halaman.

Apakah format teksnya dipertahankan?

Tidak. Anda mendapat teks polos: huruf, angka, dan jeda baris. Font, warna, gambar, dan tata letak halaman tidak ikut. Baris berganti di tempat yang sama seperti di PDF, dan satu baris kosong ditambahkan di tempat jarak antara dua baris lebih besar daripada biasanya, misalnya di antara paragraf.

Bagaimana cara menyatukan baris yang terpotong menjadi paragraf?

Tempel teksnya ke Hapus jeda baris. Alat itu menggabungkan baris di dalam setiap paragraf, mempertahankan baris kosong di antara paragraf, dan bisa memperbaiki kata yang terpotong tanda hubung di ujung baris.

Mengapa urutan sebagian teks aneh, atau teks terpecah menjadi potongan yang janggal?

Teks diambil sesuai urutan penyimpanannya di PDF. Biasanya urutan itu sama dengan urutan baca, tetapi tidak selalu. Tabel, halaman dengan beberapa kolom, dan PDF hasil ekspor dari program desain bisa menghasilkan teks yang acak-acakan, dan sebagian PDF menyimpan teks dalam potongan yang tidak sama dengan kata-kata yang Anda lihat.

Apakah bisa dipakai untuk bahasa selain bahasa Inggris?

Bisa. Teks dibaca sebagai Unicode, sehingga huruf beraksen, aksara Sirilik, Yunani, Hindi, Tionghoa, dan aksara lain ikut terambil, selama PDF memiliki lapisan teks yang benar. Jika sebuah PDF memakai pengaturan font yang tidak lazim, menyalin teksnya menghasilkan karakter yang kacau di program mana pun; menjalankan OCR pada PDF itu biasanya menjadi solusinya.