Preskoči na sadržaj

Tečajevi

Niz učenja: 6 dana zaredom

Čitanje · 10 min · Lekcija 2 od 7

Dijeljenje sadržaja i vektorski prikazi

Kako se dokumenti pripremaju da bi ih sustav mogao pronaći.

Prije nego što se išta može dohvatiti, dokumenti se dijele na manje dijelove (chunkove), obično po nekoliko odlomaka, a svaki se dio pretvara u vektorski prikaz: niz brojeva koji hvata njegovo značenje. Pitanja se pretvaraju na isti način, a sustav pronalazi dijelove čije je značenje najbliže pitanju, čak i kad koriste drugačije riječi.

Veličina dijelova stvaran je kompromis. Premali dijelovi gube kontekst, pa se pravilo odvoji od svoje iznimke. Preveliki razvodnjavaju podudaranje i troše prostor u kontekstu. Dijeljenje prema strukturi samog dokumenta, po naslovima i poglavljima, obično je bolje od rezanja na fiksan broj znakova.

Pretraživanje samo po značenju ima slijepu točku: točne pojmove poput šifri proizvoda, brojeva članaka ili imena. Zato većina produkcijskih sustava kombinira pretraživanje vektorskim prikazima s klasičnim pretraživanjem po ključnim riječima, što se zove hibridno pretraživanje, i dodaje korak ponovnog rangiranja koji najbolje kandidate preslaže prije nego što stignu do modela.

Ključni zaključci

  1. Dokumenti se dijele na dijelove i pretvaraju u vektorske prikaze značenja.
  2. Dijelite prema strukturi dokumenta, a ne na fiksne duljine.
  3. Hibridno pretraživanje i ponovno rangiranje pokrivaju točne pojmove koje vektorski prikazi promaše.