Vektorwörter

Wortvektoren oder Word Embeddings sind numerische Darstellungen von Wörtern in einem mehrdimensionalen Raum. Lernverfahren ordnen Wörtern anhand ihrer Verwendung in Trainingsdaten Vektoren zu, sodass Wörter mit ähnlichen Kontexten häufig näher beieinanderliegen. Verfahren wie Word2Vec machten solche kontinuierlichen Repräsentationen weithin bekannt und ermöglichten rechnerische Ähnlichkeitsvergleiche.

Klassische Wortvektoren weisen einem Wort meist unabhängig vom Satz denselben Vektor zu und bilden Mehrdeutigkeit daher nur begrenzt ab. Kontextuelle Sprachmodelle erzeugen dagegen Darstellungen abhängig von der jeweiligen Textumgebung. Abstände sind keine objektiven Bedeutungs- oder Wahrheitsmaße: Sie spiegeln Daten, Lernziel und Modell wider und können gesellschaftliche Verzerrungen übernehmen. Für Suche werden heute häufig Embeddings ganzer Textabschnitte verwendet.

  • Numerische Darstellung von Wörtern
  • Ähnliche Verwendung kann zu räumlicher Nähe führen
  • Word2Vec ist ein bekanntes Lernverfahren
  • Kontextuelle Modelle berücksichtigen die Textumgebung
  • Vektorähnlichkeit ist kein Wahrheitsmaß

Häufige Fragen

Wortvektoren sind gelernte Zahlenfolgen, die Wörter in einem Vektorraum darstellen und rechnerische Vergleiche ermöglichen.

Sie bilden statistische Verwendungsmuster aus Trainingsdaten ab. Das ist für Ähnlichkeit nützlich, entspricht aber keinem vollständigen menschlichen Sprachverständnis.