OCR

Jak edytować zeskanowany PDF?

Od poprawnego skanu przez polski OCR do tekstu, który da się wyszukać i poprawić.

Skanowany PDF jest zbiorem obrazów. OCR nie poprawia grafiki strony, lecz rozpoznaje znaki i tworzy warstwę tekstową, którą można później wyszukiwać lub edytować.

Najważniejsze w skrócie
  • Zadbaj o prostą, ostrą stronę przed OCR.
  • Wybierz język polski i sprawdź pola o dużym ryzyku błędu.
  • Zachowaj obraz jako tło, jeśli wygląd oryginału jest ważny.
01

Rozpoznaj skan i oceń jego jakość

Jeśli kliknięcie w zdanie zaznacza całą stronę jak zdjęcie, dokument jest skanem. Powiększ go i obejrzyj krawędzie liter. Rozmycie, cień przy grzbiecie, prześwit z drugiej strony kartki i przekrzywienie obniżają skuteczność rozpoznania.

Najlepszy materiał ma równomierne światło, wysoki kontrast i przynajmniej około 300 dpi. Zdjęcie z telefonu też może działać dobrze, jeżeli kartka wypełnia kadr, obiektyw jest ustawiony równolegle, a automatyczne wyprostowanie nie ucina marginesów.

02

Ustaw OCR do rodzaju dokumentu

Wybierz język polski, a przy dokumentach dwujęzycznych dodaj drugi język. Tryb automatyczny powinien wykryć obrót, kolumny i bloki, lecz formularze z gęstą siatką mogą wymagać osobnego rozpoznania pól.

Nie uruchamiaj wielokrotnie OCR na tej samej stronie bez usunięcia wcześniejszej warstwy. Kilka nakładających się warstw tekstu powoduje podwójne wyniki wyszukiwania i chaotyczne kopiowanie.

  • Daty i kwoty.
  • Numery PESEL, NIP, VIN i rachunków.
  • Nazwiska oraz nazwy miejscowości.
  • Pola z pieczęcią lub podpisem na tle.
03

Popraw wynik bez niszczenia skanu

W wariancie przeszukiwalnym obraz strony pozostaje widoczny, a tekst jest niewidoczną warstwą dopasowaną do słów. To dobry wybór dla archiwum. Jeżeli chcesz zmieniać wygląd treści, potrzebujesz trybu edycji rozpoznanych bloków oraz kontrolowanego maskowania starego obrazu.

OCR zgaduje na podstawie kształtów, więc 0 może stać się O, 1 literą l, a rn literą m. W dokumentach istotnych nie wystarcza ogólny podgląd. Porównaj każde pole identyfikacyjne ze skanem.

04

Eksport i test wyszukiwania

Po eksporcie wyszukaj kilka słów z różnych stron, skopiuj akapit do edytora tekstu i sprawdź kolejność czytania. W tabelach zwróć uwagę, czy komórki nie są mieszane w jednym wierszu.

Zachowaj wersję źródłową i wersję po OCR jako dwa pliki. Rozpoznanie tekstu zwiększa użyteczność, ale nie jest dowodem zgodności z oryginałem. Przy aktach, umowach i dokumentach księgowych kontrola człowieka pozostaje konieczna.

Chcesz przejść do dokumentu?

Użyj właściwego narzędzia albo zacznij od gotowego, edytowalnego układu.

Otwórz narzędzie