• 帖子:99
  • 被关注:0
hadoop小学生
hadoop小学生Spark应用HanLP对中文语料进行文本挖掘--聚类详解教程
软件:IDEA2014、Maven、HanLP、JDK; 用到的知识:HanLP、Spark TF-IDF、Spark kmeans、Spark mapPartition; 用到的数据集:http://www.threedweb.cn/threa...
2018-11-12 11:24 来自版块 - 网络技术
hadoop小学生
hadoop小学生自然语言处理之:搭建基于HanLP的开发环境
环境搭建比FNLP的简单,具体参考:https://github.com/hankcs/HanLP 各个版本的下载:https://github.com/hankcs/HanLP/releases 完毕后有一个报错: 字符类型对应表加载失败: ...
2018-11-09 10:17 来自版块 - 网络技术
hadoop小学生
hadoop小学生hanlp源码解析之中文分词算法详解
词图 词图指的是句子中所有词可能构成的图。如果一个词A的下一个词可能是B的话,那么A和B之间具有一条路径E(A,B)。一个词可能有多个后续,同时也可能有多个前驱,它们构成的图我称作词图。 需要稀疏2维矩阵模型,以一个词的起始位置作为行,终...
2018-11-07 10:58 来自版块 - 网络技术
hadoop小学生
hadoop小学生HanLP用户自定义词典源码分析详解
1. 官方文档及参考链接 l 关于词典问题Issue,首先参考:FAQ l 自定义词典其实是基于规则的分词,它的用法参考这个issue l 如果有些数量词、字母词需要分词,可参考:P2P和C2C这种词没有分出来,希望加到主词库 l 关于词性标...
2018-11-02 11:07 来自版块 - 网络技术
hadoop小学生
hadoop小学生Python中调用自然语言处理工具HanLP手记
HanLP方法封装类: 1. # -*- coding:utf-8 -*- 2. # Filename: main.py 3. 4.from jpype import * 5. 5.startJVM(getDefaultJVMPath(...
2018-10-31 11:06 来自版块 - 网络技术
hadoop小学生
hadoop小学生HanLP中的人名识别分析详解
在看源码之前,先看几遍论文《基于角色标注的中国人名自动识别研究》 关于命名识别的一些问题,可参考下列一些issue: ??名字识别的问题 #387 ??机构名识别错误 ??关于层叠HMM中文实体识别的过程 HanLP参考博客: 词性标注 ...
2018-10-29 11:37 来自版块 - 网络技术
hadoop小学生
hadoop小学生Hanlp实战HMM-Viterbi角色标注中国人名识别
天写完了人名识别模块,与分词放到一起形成了两层隐马模型。虽然在算法或模型上没有什么新意,但是胜在训练语料比较新,对质量把关比较严,实测效果很满意。比如这句真实的新闻“签约仪式前,秦光荣、李纪恒、仇和等一同会见了参加签约的企业家。”,分词结果:[签约/...
2018-10-22 15:30 来自版块 - 网络技术
hadoop小学生
hadoop小学生Hanlp中使用纯JAVA实现CRF分词
与基于隐马尔可夫模型的最短路径分词、N-最短路径分词相比,基于条件随机场(CRF)的分词对未登录词有更好的支持。本文(HanLP)使用纯Java实现CRF模型的读取与维特比后向解码,内部特征函数采用 双数组Trie树(DoubleArrayTrie)...
2018-10-19 11:52 来自版块 - 网络技术
hadoop小学生
hadoop小学生依存句法分析器的简单实现
生成式句法分析指的是,生成一系列依存句法树,从它们中用特定算法挑出概率最大那一棵。句法分析中,生成模型的构建主要使用三类信息:词性信息、词汇信息和结构信息。前二类很好理解,而结构信息需要特殊语法标记,不做考虑。 本文主要利用了词汇+词性生成联合概率...
2018-10-17 13:16 来自版块 - 网络技术

热门话题


返回顶部