维基百科镜像网站2024 维基百科镜像网站中文

转载

mob64ca140761a4 2024-05-27 22:50:46

文章标签 维基百科镜像网站2024 维基百科正则表达式 xml 文章分类 云原生云计算

转自：

本篇文章主要介绍如何通过中文维基百科语料库来训练一个word2vec模型。

一、语料库的下载

我下载是zhwiki-20180720-pages-articles.xml.bz2文件，1.5G左右是一个压缩包，下载的时候需要注意文件的名称。

二、语料库文章的提取

下载完成之后，解压缩得到的是一个xml文件，里面包含了许多的文章，也有许多的日志信息。所以，我们只需要提取xml文件里面的文章就可以了。我们通过WikiExtractor来提取xml文件中的文章，它是一个意大利人写的一个Python脚本专门用来提取维基百科语料库中的文章，将每个文件分割的大小为500M，它是一个通过cmd命令来设置一些参数提取文章，提取步骤如下：

a、WikiExtractor的安装

将整个WikiExtractor项目clone或者下载到本地，打开cmd窗口，切换到WikiExtractor项目中的setup.py文件的路径中，执行以下命令安装WikiExtractor

python setup.py install

b、维基百科语料库文章的提取

使用WikiExtractor来提取语料库中的文章，还需要使用到WikiExtractor.py脚本，与setup.py文件在同级目录下，通过以下命令来提取语料库中的文章

python WikiExtractor.py -b 500M -o zhwiki zhwiki-20180720-pages-articles.xml.bz2

参数介绍：

-b，设置提取文章后的每个文件大小

-o，制定输出文件的保存目录

zhwiki-20180720-pages-articles.xml，下载的维基百科语料库文件

更多参数的使用，可以通过以下命令查看：

python WikiExtractor.py -h

维基百科镜像网站2024 维基百科镜像网站中文_维基百科镜像网站2024

使用WikiExtractor提取文章，会在指定目录下产生一个AA的文件夹，里面会包含很多的文件。使用WikiExtractor提取的文章格式如下：

维基百科镜像网站2024 维基百科镜像网站中文_维基百科镜像网站2024_02

其中省略号表示的就是文章的内容，所以后面我们还需要通过正则化表达式来去除不相关的内容。

c、中文简体和繁体的转换

因为维基百科语料库中的文章内容里面的简体和繁体是混乱的，所以我们需要将所有的繁体字转换成为简体。这里我们利用OpenCC来进行转换。

OpenCC的使用教程请参考：

d、正则表达式提取文章内容并进行分词

使用WikiExtractor提取的文章，会包含许多的<doc></doc>，所以我们需要将这些不相关的内容通过正则表达式来去除。然后再通过jieba对文章进行分词，在分词的时候还需要将一些没有实际意义的词进行去除，所以在分词的之后加了一个停用词的去除。将分割之后的文章保存到文件中，每一行表示一篇文章，每个词之间使用空格进行分隔。

e、将分词后的文件合并为一个

将分词后的多个文件合并为一个文件，便于word2vec模型的训练