Oni koji se bave RAG-om su se verovatno svi sapleli o isto: skenirani PDF ili PDF snimak ekrana koji pri pretrazi nikako ne može da pronađe sadržaj.
I ja sam naišao na taj problem dok sam radio na PaiSmart-u (PaiSmart — bazu znanja na nivou preduzeća zasnovanu na RAG-u).
Ali danas sam pronašao prilično dobro rešenje — pomoću LiteParse-a, koga je LlamaIndex otvorio kao open source, jednom komandom možete izvući tekst iz skeniranog dokumenta pomoću OCR-a; nije potreban API Key, a brzina parsiranja je i velika.


