OxygenPDF

OCR PDF

Ekstrak teks daripada dokumen imbasan dengan OCR.

Tentang OCR PDF

Cara menukar PDF imbasan menjadi teks

Langkah 1 — muat naik fail. Pilih PDF imbasan daripada peranti anda: seret dan lepas atau klik butang Tambah fail. PDF imbasan pada dasarnya hanyalah imej halaman: teks yang anda lihat ialah piksel, bukan aksara, sehingga tidak boleh dipilih atau dicari. Fail tidak dimuat naik ke mana-mana kerana keseluruhan proses berjalan secara lokal dalam pelayar anda.

Langkah 2 — pilih enjin OCR yang tepat. OCR (Optical Character Recognition) menganalisis imej halaman dan menukar teks visual menjadi data teks yang benar-benar boleh dicari, dipilih, dan disalin. Tesseract sesuai untuk dokumen berbahasa Inggeris dengan tata letak mudah dan berjalan pantas. PaddleOCR cemerlang untuk bahasa Asia seperti Cina, Jepun, dan Korea. Mod pintar memeriksa teks terbenam dahulu, sehingga PDF yang teksnya sudah boleh dipilih terus diekstrak tanpa dikenali semula.

Langkah 3 — ekstrak lalu muat turun hasilnya. Jalankan OCR, salin teks yang anda perlukan, atau muat turun sebagai fail .txt untuk digunakan di tempat lain. Anda juga boleh memuat turun PDF yang boleh dicari: paparan halaman kekal tepat sama, tetapi teksnya kini boleh dipilih, disalin, dan ditemui melalui carian pada mana-mana paparan.

Bila anda memerlukan OCR

Setiap kali teks dalam PDF tidak boleh dipilih atau dicari, OCR ialah penyelesaiannya.

Jadikan Imbasan Boleh Dicari

Kontrak, resit, dan borang hasil imbasan bertukar menjadi teks yang boleh dicari. Temui maklumat yang anda perlukan tanpa membaca setiap halaman satu demi satu.

Ekstrak Teks untuk Digunakan Semula

Salin teks daripada dokumen imbasan ke e-mel, hamparan, atau dokumen lain untuk dipetik dan diproses. Tidak perlu menaip semula yang memakan masa dan mudah salah taip.

Sokongan Lebih 20 Bahasa

Bahasa Inggeris, Cina Ringkas dan Tradisional, Jepun, Korea, Sepanyol, Perancis, Jerman, Arab, Rusia, dan banyak lagi. Pilih bahasa dokumen anda supaya tahap ketepatannya maksimum.

Pengesanan Mod Pintar

Mod pintar memeriksa teks terbenam dahulu sebelum bekerja. Jika PDF sudah mempunyai teks yang boleh dipilih, alat terus mengekstraknya tanpa menjalankan OCR sehingga hasilnya lebih pantas dan lebih tepat.

Pelbagai Enjin OCR

Tesseract ialah enjin lalai — enjin sumber terbuka yang berjalan dalam pelayar anda melalui WebAssembly. Paling sesuai untuk dokumen berbahasa Inggeris dan tata letak mudah. Pantas, peribadi, dan tidak memerlukan sebarang muat turun tambahan, sehingga anda boleh terus bekerja sebaik fail terbuka.

PaddleOCR cemerlang untuk bahasa Asia (Cina, Jepun, Korea) dan tersedia dalam dua varian: model pantas (muat turun lebih kurang 20 MB) untuk kerja harian dan model kualiti (lebih kurang 165 MB) untuk ketepatan lebih tinggi pada dokumen penting. Florence-2 ialah model penglihatan AI yang memerlukan WebGPU (Chrome) dan mengendalikan tata letak dokumen yang rumit dengan baik, contohnya risalah berbilang lajur atau borang campuran.

Untuk ketepatan maksimum pada dokumen sukar — jadual yang rumit, formula matematik, tata letak campuran — enjin awan seperti Surya (menyokong lebih 90 bahasa) dan GOT-OCR 2.0 menghantar imej halaman ke pelayan untuk diproses dengan model yang lebih besar. Pilihan ini menukar privasi dengan ketepatan yang lebih tinggi, jadi pilihlah mengikut kesensitifan dokumen anda.

Perbandingannya

Ketepatan OCR berbeza mengikut enjin dan jenis dokumen. Pembezanya ialah sama ada anda boleh memilih antara pemprosesan lokal dan awan.

CiriOxygenPDFAplikasi desktopAlat dalam talian lain
OCR lokal (tanpa muat naik)Desktop sahaja
Pelbagai pilihan enjin
Lebih 20 bahasaTerhad
Mod pintar (langkau OCR bila teks ada)
Pratetap kualiti (pantas/seimbang/terbaik)
Percuma digunakanTerhad

Privasi Sejak Awal

Dokumen imbasan kerap memuatkan kandungan yang anda tidak mahu simpan pada pelayan pihak lain: borang cukai, rekod perubatan, kad pengenalan, fail undang-undang. Kebanyakan alat OCR dalam talian memuat naik imej anda untuk diproses di sisi pelayan, dan anda terpaksa mempercayai janji pemadaman mereka selepas itu.

Alat ini percuma, selamat, tanpa pemasangan, dan tanpa pendaftaran — secara lalai enjin lokal berjalan dalam pelayar anda sehingga fail tidak pernah meninggalkan peranti anda. Enjin awan tersedia apabila anda memerlukan ketepatan lebih tinggi, tetapi sifatnya pilihan dan dilabelkan dengan jelas sebelum anda memilihnya.

OCR PDF: Soalan Lazim

Soalan biasa tentang alat ini dan cara ia berfungsi.

Percuma Selamanya

Semua 119+ alat — percuma, selamanya
Pembina aliran kerja visual — rangkaikan alat bersama
Dapatkan Aplikasi Desktop

Pro

$29 sekali sahaja
Proses berbilang fail secara kelompok sekaligus
Sokong pembangunan indie
Jaminan wang dikembalikan 14 hari

Kami menggunakan analitik untuk memahami cara alat kami digunakan dan menambah baik pengalaman. Tiada fail peribadi pernah dihantar.