TanodTools
ID

Buat PDF hasil scan bisa dicari (OCR)

Tambahkan lapisan teks tersembunyi ke halaman hasil scan, agar teksnya bisa dicari, dipilih, dan disalin. Tampilan halaman tetap sama persis.

Diproses di server kami, lalu dihapus

Letakkan PDF hasil scan di sini

Atau seret ke mana saja di halaman ini. Hingga 10 MB.

Dikirim ke server kami hanya untuk tugas ini, lalu dihapus. Tidak pernah disimpan atau dicatat.

Memeriksa tugas server gratis hari ini…

Satu PDF hingga 10 MB, hingga 10 halaman per tugas, teks bahasa Inggris. Diproses di server kami, lalu dihapus. 10 tugas server gratis per hari per orang, dibagi untuk semua alat server. Tugas lebih besar: PDF OCR API (dibayar per panggilan).

Cara membuat PDF bisa dicari

  1. Pilih PDF hasil scan hingga 10 MB, atau seret ke halaman ini.
  2. Periksa halaman yang akan dibaca: semuanya untuk file pendek, atau hingga 10 halaman sekaligus.
  3. Tekan Buat bisa dicari, lalu unduh PDF-nya. Anda juga bisa menyalin atau menyimpan teks yang dikenali.

Apa yang dilakukan OCR pada PDF hasil scan

Scanner atau aplikasi ponsel menyimpan setiap halaman sebagai gambar. Anda bisa membacanya, tetapi komputer Anda tidak: pencarian tidak menemukan apa pun dan Anda tidak bisa menyalin satu kalimat pun. Pengenalan karakter optik (OCR) melihat gambar itu, menemukan huruf dan kata, lalu menuliskannya ke dalam PDF sebagai teks tak terlihat yang ditempatkan tepat di atas kata-kata yang Anda lihat. Hasilnya, PDF scan menjadi bisa dicari.

Server kami merender setiap halaman yang dipilih pada 200 sampai 300 dpi, membacanya dengan mesin open source Tesseract, dan meletakkan teks di atas halaman asli tanpa mengubahnya. Teks yang dikenali juga ditampilkan di sini, sehingga Anda bisa langsung menyalinnya.

Tips

  • Scan pada 300 dpi dalam hitam putih atau abu-abu untuk akurasi terbaik.
  • Halaman terbalik atau miring? Putar dulu dengan Putar PDF (di browser Anda).
  • Punya foto atau screenshot, bukan PDF? Gunakan Gambar ke teks (OCR).

Pertanyaan umum

Apakah PDF saya diunggah?

Ya. Berbeda dengan sebagian besar alat di situs ini, alat ini berjalan di server kami: PDF Anda dikirim melalui HTTPS, dibaca oleh mesin OCR, dan salinan yang bisa dicari langsung dikirim kembali ke browser Anda. File hanya ada di server selama tugas berjalan, di memori dan di folder sementara privat yang dihapus begitu tugas selesai. Kami tidak menyimpan PDF, hasilnya, maupun teks yang dikenali, dan kami tidak pernah mencatat isi file.

Apa yang diubah OCR pada PDF saya?

Tidak ada yang terlihat. Setiap halaman dibaca oleh mesin OCR open source Tesseract, dan kata-kata yang ditemukannya diletakkan di atas halaman sebagai teks tak terlihat di posisi yang tepat. Halaman asli tetap berada di bawahnya, tidak diubah, sehingga PDF terlihat sama tetapi kini bisa dicari, dipilih, dan disalin.

Mengapa hanya 10 halaman sekaligus?

Membaca satu halaman memerlukan beberapa detik waktu server, dan setiap tugas harus selesai dalam sekitar satu menit. Untuk dokumen yang lebih panjang, jalankan alat ini lagi pada file yang sudah diunduh dengan halaman berikutnya, misalnya 11-20. Halaman yang sudah selesai dibiarkan apa adanya.

Bahasa apa saja yang didukung?

Bahasa Inggris, dan bahasa lain yang ditulis dengan huruf Latin yang sama tanpa aksen, dengan akurasi lebih rendah. Huruf beraksen dan aksara lain belum dapat dikenali dengan andal.

Halaman saya sudah berisi teks. Apa yang terjadi?

Halaman yang sudah berisi teks dilewati, jadi PDF yang dibuat oleh pengolah kata tetap seperti semula. Centang Baca halaman yang sudah memiliki teks untuk tetap menjalankan OCR pada halaman itu, misalnya jika hasil scan memiliki lapisan teks yang buruk.

Seberapa akurat hasilnya?

Hasil scan yang bersih dan lurus dengan resolusi normal memberikan hasil yang sangat baik. Foto yang diambil miring, cetakan yang pudar atau buram, tulisan tangan, dan tabel yang rumit menghasilkan lebih banyak kesalahan. Periksa nama dan angka sebelum mengandalkannya.

Apakah ada batasnya?

File hingga 10 MB, hingga 10 halaman per tugas, dan 10 tugas server gratis per hari per orang, dibagi untuk semua alat server kami. Hanya tugas yang berhasil yang dihitung, dan hitungannya direset pada tengah malam UTC. Tugas lebih besar: PDF OCR API, dibayar per panggilan.

Apa itu verifikasi manusia?

Sebelum tugas berjalan, Cloudflare Turnstile memeriksa bahwa yang memakai alat ini adalah manusia, bukan bot. Biasanya tidak terlihat; kadang Anda diminta mencentang kotak.