首页 / 资料库 / 文献详情

上古汉语分词及词性标注语料库的构建——以《淮南子》为范例

留金腾宋彦夏飞

2013Acta Scientiarum Naturalium Universitatis SunyatseniEngineering被引 0

出版方页面 →

摘要

该文介绍了以《淮南子》为文本的上古汉语分词及词性标注语料库及其构建过程.该文采取了自动分词与词性标注并结合人工校正的方法构建该语料库,其中自动过程使用领域适应方法优化标注模型,在分词和词性标注上均显著提升了标注性能.分析了上古汉语的词汇特点,并以此为基础描述了一些显式的词汇形态特征,将其运用于我们的自动分词及词性标注中,特别对词性标注系统带来了有效帮助.总结并分析了自动分词和词性标注中出现的错误,最后描述了整个语料库的词汇和词性分布特点.提出的方法在《淮南子》的标注过程中得到了验证,为日后扩展到其他古汉语资源提供了参考.同时,基于该文工作得到的《淮南子》语料库也为日后的古汉语研究提供了有益的资源.

引用本文(GB/T 7714)

留金腾, 宋彦, 夏飞. 上古汉语分词及词性标注语料库的构建——以《淮南子》为范例[J]. Acta Scientiarum Naturalium Universitatis Sunyatseni, 2013.

引文网络

参考文献与被引分析加载中…

本站仅收录题录与摘要供学习参考,全文版权归属出版方;如有侵权请联系我们删除。