自2003年第一届国际中文分词评测以来,由字构词的分词方法获得了压倒性优势,国内主要通过CRF++开源软件包来学习该分词方法,但是CRF++过于复杂的代码结构,导致了该算法的普及率。本次首先发布了CRF中文分词开源版仅仅包含CRF++软件包中分词×××部分,简化了CRF++复杂代码结构,清除了分词×××不需要的代码,大大提高了分词×××的可读性和可懂度。同时为了方便学习者可视化跟踪和调试代码,在Windows平台下分别建立了VC6.0和VS2008两个工程文件,使得VC6.0用户和VS2008用户都能轻玩转中文分词。
CRF中文分词开源版发布啦
原创langiner ©著作权
文章标签 职场 休闲 中文分词 机器学习 由字构词 分词评测 文章分类 后端开发
自2003年第一届国际中文分词评测以来,由字构词的分词方法获得了压倒性优势,国内主要通过CRF++开源软件包来学习该分词方法,但是CRF++过于复杂的代码结构,导致了该算法的普及率。本次首先发布了CRF中文分词开源版仅仅包含CRF++软件包中分词×××部分,简化了CRF++复杂代码结构,清除了分词×××不需要的代码,大大提高了分词×××的可读性和可懂度。同时为了方便学习者可视化跟踪和调试代码,在Windows平台下分别建立了VC6.0和VS2008两个工程文件,使得VC6.0用户和VS2008用户都能轻玩转中文分词。