
GloVe 与 Word2Vec 是两种主流的词向量训练方法核心差异在于训练目标和利用语料信息的方式。核心差异对比维度Word2VecGloVe训练范式预测型predictive计数型count-based训练目标局部上下文预测全局共现矩阵分解损失函数交叉熵 / 负采样最小二乘加权信息利用局部滑动窗口全局统计信息训练方式在线学习逐词/逐batch离线矩阵分解1. Word2Vec局部预测模型Word2Vec 有两种变体CBOW 和 Skip-gram核心思想是用局部上下文窗口做预测。Skip-gram 的目标函数maximize Σ Σ log p(w_c | w_t) t c∈context(t) 其中 p(w_c | w_t) exp(v_c · v_t) / Σ exp(v_w · v_t)关键特点每次只看一个滑动窗口内的词不直接使用全局统计用负采样或层次softmax近似计算降低计算量对高频词做降采样subsample缓解高频词主导问题2. GloVe全局共现矩阵分解GloVeGlobal Vectors的核心思想是利用词对的共现统计直接拟合共现概率的比值。构建过程构建共现矩阵 X遍历语料统计词 i 在词 j 上下文窗口中出现的次数X_ij定义目标函数minimize Σ f(X_ij) · (w_i^T · w_j b_i b_j - log X_ij)² i,j 其中 f(X_ij) 是加权函数 f(x) (x/x_max)^α if x x_max f(x) 1 if x x_max加权函数 f(x) 的作用对共现次数极低的词对降权噪声大、不可靠对共现次数极高的词对封顶避免高频词对主导损失x_max通常设为 100α通常设为 0.75设计动机GloVe 的理论基础是共现概率的比值能编码语义关系。例如P(k | ice) / P(k | steam) 对不同词 k 的值 k solid → 比值很大冰相关蒸汽不相关 k gas → 比值很小 k water → 比值接近 1两者都相关 k fashion → 比值接近 1两者都不相关通过对数变换这个比值关系可以转化为向量差的线性关系w_i · w_k从而用向量内积拟合log X_ij。3. 本质区别总结信息利用范围Word2Vec: 窗口内局部信息 → 逐窗口更新 GloVe: 全局共现矩阵 → 一次性利用所有统计Word2Vec 虽然理论上遍历整个语料后也间接利用了全局信息但它是隐式的、渐进的GloVe 则显式地将全局共现统计编码进目标函数。训练效率Word2Vec在线学习内存占用小适合流式数据但需要多轮epoch才能收敛GloVe需要预先构建共现矩阵内存开销大O(V²)但矩阵构建后训练收敛快对窗口大小的敏感度Word2Vec窗口大小直接影响向量质量小窗口捕获句法关系大窗口捕获语义关系GloVe共现矩阵构建时设定窗口但因为是全局统计对窗口大小相对不敏感实际效果在词类比任务king - man woman ≈ queen上GloVe 通常略优在下游NLP任务中两者表现接近差异不大GloVe 训练更稳定超参数更少Word2Vec 对超参数学习率、负采样数、窗口大小更敏感4. 一句话总结Word2Vec 用局部窗口做预测GloVe 用全局共现做回归。前者是猜上下文后者是拟合共现次数殊途同归地学习到了词的分布式表示。