23 May 2026 · 6 min
Tiimit murehtivat vektoritietokannasta ja ottavat oletusupotuksen. Juuri päinvastoin.
Kun tiimi ryhtyy rakentamaan semanttista hakua, keskustelu alkaa lähes aina väärästä paikasta. Viikkoja menee vektoritietokannan valintaan — Qdrant vai pgvector, tämä indeksi vai tuo, itse isännöity vai hallittu — ja minuutteja upotusmalliin, joka yleensä valuu suosittuun tai tutoriaalin käyttämään. Tämä on juuri väärinpäin. Tietokanta ratkaisee kuinka nopeasti ja halvalla haet. Upotus ratkaisee tulevatko oikeat tulokset ollenkaan.
Jos hakusi palauttaa epäolennaisia tuloksia, todennäköisyys on ylivoimainen että ongelma on upotuksessa, ei tietokannassa. Eikä mikään tietokannan viritys korjaa huonoa upotusta, sillä virhe tehtiin ennen kuin tietokanta koskaan näki dataa.
Upotusmalli muuttaa kunkin tekstinpalan pisteeksi korkeaulotteisessa avaruudessa, sijoitettuna niin että samankaltaiset merkitykset ovat lähellä toisiaan. Haku etsii sitten kyselyäsi lähimmät pisteet. Upotus siis määrittää "lähellä". Jos malli sijoittaa kyselyn kauas vastauksestaan, mikään nopeakaan tietokanta ei löydä sitä.
Osuvuus siis määräytyy upotusaikana, ei kyselyaikana. Tietokanta löytää nopeasti lähellä olevat pisteet; sillä ei ole mielipidettä siitä sijoitettiinko pisteet järkevästi. Se on täysin upotusmallin tehtävä.
Ei ole yhtä parasta upotusmallia, sillä "paras" riippuu siitä mitä upotat. Malli joka loistaa oikeusteksteissä voi olla keskinkertainen lyhyissä tuotenimissä; tukitiketeille viritetty voi arvioida tiheän teknisen dokumentaation väärin. Toimiala, pituus, sanasto ja rakenne muuttavat mikä malli suoriutuu. Tulostaulun kärkimallin voi datallasi voittaa pienempi joka sattuu sopimaan paremmin.
Siksi valintaa ei voi tehdä abstraktisti. Kysymys ei ole koskaan "mikä on paras malli" vaan "mikä on paras tälle sisällölle ja näille kyselyille".
Kaikessa englannin ulkopuolella mallivalinta on vielä merkitsevämpi. Pääosin englanniksi koulutettu malli alisuoriutuu hiljaa suomessa, norjassa, ruotsissa tai tanskassa — ei ilmeisellä virheellä vaan hienovaraisesti huonommilla sijoituksilla jotka näkyvät hieman väärinä tuloksina. Monikieliselle sisällölle aidosti monikielinen upotus ei ole mukava lisä; se on ero toimivan ja lähes toimivan haun välillä.
Tämä on yleinen ja kallis huolimattomuus. Tiimi vertailee englanniksi, kaikki näyttää hyvältä, ja heikkeneminen ilmestyy vasta oikean pohjoismaisen sisällön saapuessa — jolloin arkkitehtuuri on jo lukittu.
Julkiset upotustulostaulut ovat hyödyllisiä lähtölistana ja vaarallisia päätöksenä. Ne järjestävät mallit standardoiduilla vertailudatoilla jotka eivät lähes varmasti ole sinun dataasi, tehtävissä jotka eivät lähes varmasti ole sinun tehtäväsi. Malli voi johtaa yleistä hakua ja silti alisuoriutua toimialallasi, pituuksissasi ja kielissäsi. Tulostaulun ottaminen sijaiseksi on veto siitä että datasi näyttää vertailulta — yleensä väärin.
Tulostaulu kertoo mitkä mallit ovat testaamisen arvoisia. Ei mitä käyttää. Sen voi vain datasi.
Luotettava tapa on epäglamouraalinen: ota kourallinen ehdokasmalleja, upota edustava viipale oikeaa sisältöäsi, aja oikeat kyselysi kutakin vasten ja mittaa mikä palauttaa oikeat tulokset. Tämä ei kestä kauan ja korvaa arvailun näytöllä. Teemme juuri tämän hakuprojektin alussa, sillä tunti vertailua säästää viikkoja tietokannan viritystä sellaisen upotuksen paikkaamiseksi joka ei koskaan olisi toiminut.
Mittaus on pointti. Et etsi mallia parhaalla maineella vaan sitä joka sijoittaa kyselysi lähimmäs vastauksiasi — ja sen löytää vain kokeilemalla datallasi.
Se miten jaat dokumentit paloihin vaikuttaa suoraan upotukseen. Liian pitkät palat laimentavat merkityksen epämääräiseksi keskiarvoksi; liian lyhyet menettävät kontekstin joka tekee niistä löydettäviä. Oikea paloittelustrategia riippuu mallista ja sisällöstä yhdessä, ja väärin tehtynä jopa hyvä upotus voi palauttaa huonoja tuloksia. Ei erillinen myöhempi päätös vaan osa samaa suunnitteluongelmaa.
Upotusmalli ja paloittelustrategia ovat semanttisen haun perusta. Tee ne oikein, oikealla datalla vertailtuna, ja tietokannasta tulee mitä sen kuuluu olla: nopeutta ja kustannusta koskeva toteutusyksityiskohta. Tee ne väärin, eikä mikään tietokanta pelasta sinua — käytät aikasi infran viritykseen alusta viallisen perustan paikkaamiseksi. Käytä vaiva siihen missä se määrää tuloksen, ja muu järjestelmä helpottuu paljon.
Varaa 30 minuutin puhelu. Kerromme rehellisesti, voimmeko auttaa.
Varaa puhelu