- Word2Vec transformerer ord til høydimensjonale vektorer basert på distribusjonshypotesen, der mening er avledet fra kontekst.
- Modellen bruker to hovedarkitekturer: CBOW for å forutsi et målord fra kontekst og Skip-Gram for å forutsi kontekst fra et målord.
- Semantiske forhold fanges opp som lineære forskyvninger i vektorrommet, noe som muliggjør språklige analogier gjennom matematiske operasjoner.
Har du noen gang lurt på hvordan en maskin egentlig «forstår» hva vi mener når vi snakker? Det er ikke som om vi bare kan gi en datamaskin en ordbok og forvente at den skal forstå nyanser. I lang tid så maskiner på ord som bare isolerte symboler , noe som betydde at en «hund» var like forskjellig fra en «katt» som den var fra en «mikrobølgeovn». Alt dette endret seg med ankomsten av Word2Vec, en banebrytende teknologi innen naturlig språkbehandling som lar datamaskiner kartlegge ord i et matematisk rom der betydning er definert av nærhet.
I kjernen er Word2Vec basert på distribusjonshypotesen , som er en fin måte å si at du kan forstå et ord ut fra selskapet det holder til. Hvis to ord ofte omgås de samme naboene, deler de sannsynligvis en lignende betydning. Ved å analysere enorme mengder tekst, gjør Word2Vec ord om til høydimensjonale vektorer , og skaper et semantisk kart der språklige forhold blir til enkel geometri.
Den gamle skolen: Tellebaserte tilnærminger

Før Word2Vec tok over, brukte vi tellebaserte metoder. Den mest grunnleggende versjonen involverte samforekomstmatriser , der man ganske enkelt telte hvor mange ganger ord A dukket opp i nærheten av ord B. Selv om disse matrisene var enkle, ble de uhyrlig store og fylt med nuller, noe som gjorde dem til et mareritt å beregne. For å fikse dette brukte forskere teknikker som Positive Pointwise Mutual Information (PPMI) for å bedre måle assosiasjon, eller Latent Semantic Analysis (LSA) , som bruker Singular Value Decomposition (SVD) for å krympe dataene og avdekke skjulte «emner» i dokumenter.
Hvordan Word2Vec faktisk fungerer

Word2Vec snudde skriptet ved å behandle problemet som en prediksjonsoppgave snarere enn en telleoppgave. I stedet for bare å telle ord, bruker den et overfladisk, tolags nevralt nettverk for å lære innebygde ord. Modellen skyver et vindu over en enorm tekstsamling, med fokus på et sentralt ord og dets omkringliggende kontekst. Ved iterativt å justere vektorene for å maksimere sannsynligheten for å forutsi de riktige naboene, skyver modellen naturlig semantisk like ord nærmere hverandre i vektorrommet.
To måter å trene på: CBOW vs. Skip-Gram

- Kontinuerlig ordpose (CBOW): Tenk på dette som en «fyll inn blanke felt»-øvelse. Modellen ser på kontekstuelle ord i det omkringliggende området og prøver å forutsi det manglende sentrale ordetDet er generelt raskere å trene og fungerer utmerket for hyppige ord.
- Skip-Gram: Dette er den motsatte tilnærmingen. Modellen tar ett sentralt ord og prøver å forutsi den omkringliggende kontekstenSelv om det tar mer tid, er Skip-Gram mye bedre til å håndtere sjeldne ord og fanger opp sjeldne semantiske forhold.
Effektiv opplæring: Negativ prøvetaking

Å beregne sannsynligheten for hvert eneste ord i et massivt vokabular hver gang du flytter vinduet ville være vanvittig tregt . For å unngå dette bruker Word2Vec negativ sampling . I stedet for å oppdatere hvert ord i ordboken, oppdaterer modellen bare målordet og en liten håndfull tilfeldig valgte "negative" eksempler . Dette reduserer beregningsbelastningen drastisk uten å ofre kvaliteten på de lærte innebygde elementene, og sampler ofte ord basert på frekvensfordelingen deres for å sikre at modellen ikke blir lat.
Magien i semantisk rom
Når treningen er ferdig, er resultatet et semantisk rom hvor du faktisk kan utføre matematikk på ord. En av de kuleste oppdagelsene er at disse forholdene ofte er lineære . Hvis du for eksempel tar vektoren for «Konge», trekker fra «Mann» og legger til «Kvinne», er det resulterende punktet i rommet utrolig nær vektoren for «Dronning». Dette viser at modellen har fanget det abstrakte konseptet kjønn og kongelighet gjennom enkel vektorregning.
Utover grunnleggende ord: utvidelser og varianter
Suksessen til Word2Vec utløste en hel familie av utvidelser. Doc2Vec utvidet ideen til å representere hele avsnitt eller dokumenter som enkeltvektorer, noe som muliggjorde avansert dokumentklassifisering. Så kom Top2Vec , som kombinerer dokumentinnebygging med klyngealgoritmer som HDBSCAN for automatisk å oppdage emner uten behov for merkede data. Selv biologiske vitenskaper fikk en del av handlingen med BioVec , og anvendte disse prinsippene på DNA- og proteinsekvenser for å forstå biokjemiske mønstre.
Evaluering av resultatene
Hvordan vet vi om modellen faktisk er «smart»? Det finnes to hovedmåter. Intrinsisk evaluering ser på interne egenskaper, og bruker referansetester for å se om modellens likhetspoeng stemmer overens med menneskelig vurdering, eller om den kan løse analogietester . Ekstrinsik evaluering er mer praktisk; det innebærer å koble innebygde elementer til en virkelig oppgave, som sentimentanalyse eller tekstklassifisering, for å se om den generelle ytelsen forbedres. Mens nyere modeller som BERT eller ELMo tilbyr kontekstuelle innebygde elementer (som betyr at et ords vektor endres basert på setningen), er Word2Vec fortsatt det grunnleggende grunnlaget for statiske ordrepresentasjoner.
Ved å transformere kaoset i menneskelig språk til et strukturert geometrisk landskap , lar disse teknikkene maskiner navigere mening via cosinuslikhet og vektorforskyvninger. Fra effektiviteten til negativ sampling til allsidigheten til Skip-Gram og CBOW, har evnen til å kartlegge språklige kontekster til matematiske koordinater fundamentalt endret hvordan vi bygger alt fra søkemotorer til oversettelsesverktøy.
