Čitanje · 10 min · Lekcija 2 od 7
Dijeljenje sadržaja i vektorski prikazi
Kako se dokumenti pripremaju da bi ih sustav mogao pronaći.
Prije nego što se išta može dohvatiti, dokumenti se dijele na manje dijelove (chunkove), obično po nekoliko odlomaka, a svaki se dio pretvara u vektorski prikaz: niz brojeva koji hvata njegovo značenje. Pitanja se pretvaraju na isti način, a sustav pronalazi dijelove čije je značenje najbliže pitanju, čak i kad koriste drugačije riječi.
Veličina dijelova stvaran je kompromis. Premali dijelovi gube kontekst, pa se pravilo odvoji od svoje iznimke. Preveliki razvodnjavaju podudaranje i troše prostor u kontekstu. Dijeljenje prema strukturi samog dokumenta, po naslovima i poglavljima, obično je bolje od rezanja na fiksan broj znakova.
Pretraživanje samo po značenju ima slijepu točku: točne pojmove poput šifri proizvoda, brojeva članaka ili imena. Zato većina produkcijskih sustava kombinira pretraživanje vektorskim prikazima s klasičnim pretraživanjem po ključnim riječima, što se zove hibridno pretraživanje, i dodaje korak ponovnog rangiranja koji najbolje kandidate preslaže prije nego što stignu do modela.
Ključni zaključci
- Dokumenti se dijele na dijelove i pretvaraju u vektorske prikaze značenja.
- Dijelite prema strukturi dokumenta, a ne na fiksne duljine.
- Hibridno pretraživanje i ponovno rangiranje pokrivaju točne pojmove koje vektorski prikazi promaše.