#210·GloVe

大型语料库上的糟糕结果

作者: KarahanS创建于 2023年3月31日更新于 2023年4月11日

您好, 我正在使用约 10 GB 的语料库为土耳其语训练自己的 GloVe 词嵌入。我的计算机上有足够的磁盘容量和 16 GB 内存。我成功创建了 `vocab.txt`,可以确认没有问题。现在,我相信我成功生成了一个大小约 35 GB 的 `cooccurrence` 矩阵,但之后的随机化操作耗时过长并突然终止。与 cooccurrence 生成步骤相比,随机化操作似乎反应不灵敏,它实际上没有在控制台上打印任何内容。然后,我决定直接在未随机化的 cooccurrence 矩阵上训练模型。 我对其进行了 20 次迭代。每次迭代的成本大致如下(数字不精确,但我的意思是,前 3 次迭代的成本增加,然后逐渐降低到约 0.11):

内容来源: stanfordnlp/GloVe