Интересно, как телефон угадывает следующее слово?
Что-то слышали про word2vec?
Word2vec — суперинтересная модель (или сервис ?), с которой началась эра «понимания текста» для многих нейросетей. Она точно используется в клавиатурах и, скорее всего, в большинстве моделей, работающих с текстом. Но как вообще можно научить машину понимать слова? Ведь любая программа умеет работать только с цифрами: складывать, умножать, сравнивать. А «мама» + «любовь» — это не совсем формула, правда? Допустим, мы хотим научить нейросеть предсказывать следующее слово. Для этого нужно перевести слова в числа, иначе машина просто не сможет с ними работать. Представим на простом примере. У нас есть три человека. Мы описываем их по двум качествам: дружелюбие и спортивность. Леонардо: [2, 10] Рафаэль: [9, 2] Донателло: [3, 8] Наносим эти координаты на график — и получаем уже не абстрактные «характеры», а вектора в пространстве. Мы можем теперь мерить расстояние между людьми, находить самых похожих, делать выводы. Это и есть базовая идея word2vec: перевести слово в вектор, чтобы можно было работать с ним математически. Да, в реальности у слов (и у людей) не два параметра, а сотни — и мозг уже не справляется с такой визуализацией. Но векторная математика прекрасно работает и в 100, и в 1000 измерениях.
А теперь то, что вдохновило меня поделиться с вами: Король – Мужчина + Женщина = Королева
Серьезно? Серьезно. Модель находит такие координаты слов, при которых разность и сумма векторов действительно приближают нас к правильному смыслу. Это не магия — это геометрия смысла. Если «мужчина» и «женщина» — это смещение по «гендерной оси», то применяя это же смещение к «королю», мы приходим к «королеве».
P.s. кто спалил пасхалку, напишите имя четвертого 😂
· 16.07.2025
Микельанжело. Ну а как выбирать пространство для этих векторов? Нейронки используют автоэнкодер, и осмысленное пространство сильно бы помогло.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён