| 摘要: |
| 通过对包含5573个汉语句子的语料文本中的最长名词短语的分布特点的统计分析,提出了两种有效的汉语最长名词短语自动识别算法:基于边界分布概率的识别算法和基于内部结构组合的识别算法.实验结果显示,后者的识别正确率和召回率分别达到了85.4%和82.3%,取得了较好的自动识别效果. |
| 关键词: 最长名词短语,边界识别,句法分析. |
| DOI: |
| 分类号: |
| 基金项目:本文研究得到国家自然科学基金(No.69705005)和中国博士后科学基金(No.97005)资助. |
|
| Automatic Identification of Chinese Maximal Noun Phrases |
|
ZHOU Qiang,SUN Mao-song,HUANG Chang-ning
|
| Abstract: |
| Based on the statistical characteristics of Chinese maximal noun phrases (MNPs) in a Chinese corpus with 5 573 sentences,two efficient identifying algorithms for Chinese MNPs:(1) To identify MNPs by using boundary distribution probabilities; (2) To identify MNPs by using internal structure rules,are proposed in this paper.Experimental results show better performances:precision 85.4% and recall 82.3%,by using identifying algorithm (2). |
| Key words: Maximal noun phrase,boundary identification,syntax parsing. |