备案控制台登录注册

开发者社区人工智能文章正文

hanlp源码解读之字符正规化CharTable

2018-10-26 5187

版权

举报

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

概述：字符正规化是指在分词之前把繁体转成简体、大写转成小写等，在自然语言处理中这是必不可以的一个步骤！在hanlp中的实现方法是基于词典的，也就是正规则字符对照表。就是“data/dictionary/other/CharTable.txt” 这个词典，打开后是下面这个样子的！

在java程序中如何实现呢，相信大部分人会想用到用HashMap缓存起来不就可以了吗！当然，这个方法是可行的，但是HashMap在数据量比较大时，时间复杂度是接近O(n)的。这也是为什么加载词典用trie树，而不是直接用HashMap的原因了,当然内存也是一个方面，本篇文章不会讨论！下面我们来看下hanlp代码里的具体实现。

在hanlp中，是采用一维数据实现的，下面一步步来看源码的实现！源码位于com.hankcs.hanlp.HanLP包下的CharTable类中，这个类主是要加把 CharTable.txt加载到一维数组中。为了方便阅读，下面直接在代码中加入注释!

在分词之前会首化调用正规化接口（在启用正规化的情况下）

下面来看下CharTable.normalization(text);这个函数的实现：这个函数极其简单，就是对text中的每个字符查询一维数据COVERT,看到这里应该就能明白，正规化最重要的就是加载txt文件到CONVERT数组中

下面看具本的代码，敝人在代码中都加入了注释，此处不再另行讲解

文章来源于亚当-adam的博客

文章标签：

自然语言处理

Java

缓存

蓝天白芸朵

目录

相关文章

艾派森_

|

12月前

|

机器学习/深度学习自然语言处理算法

文本分析-使用jieba库进行中文分词和去除停用词（附案例实战）

文本分析-使用jieba库进行中文分词和去除停用词（附案例实战）

艾派森_

4937 0 0

HannYang

|

自然语言处理 Go

Golang每日一练(leetDay0074) 词典类设计、单词搜索II

Golang每日一练(leetDay0074) 词典类设计、单词搜索II

HannYang

201 0 0

大数据资讯

|

Java Android开发数据格式

Android环境下hanlp汉字转拼音功能的使用介绍

由于项目需要在Android手机设备上实现汉字转拼音功能（支持多音字），于是首先想到了Pinyin4j+多音字映射对照表的实现方案，并在项目中试用了一段时间，发现数据量大时，其耗时非常严重。后来寻找其他方案，在github上找到了HanLP开源库，其多音字转换速度非常快，但是没有针对Android平台进行适配，于是对代码进行了一些修改，终于可以在Android手机上运行。

大数据资讯

1523 0 0

蓝天白芸朵

|

自然语言处理 Java Spring

Spring框架中调用HanLP分词的方法

蓝天白芸朵

15610 0 1

大数据资讯

|

机器学习/深度学习自然语言处理算法

Hanlp中使用纯JAVA实现CRF分词

与基于隐马尔可夫模型的最短路径分词、N-最短路径分词相比，基于条件随机场（CRF）的分词对未登录词有更好的支持。本文（HanLP）使用纯Java实现CRF模型的读取与维特比后向解码，内部特征函数采用双数组Trie树(DoubleArrayTrie)储存，得到了一个高性能的中文分词器。

大数据资讯

4815 1 1

大数据资讯

|

自然语言处理算法测试技术

分词工具Hanlp基于感知机的中文分词框架

结构化感知机标注框架是一套利用感知机做序列标注任务，并且应用到中文分词、词性标注与命名实体识别这三个问题的完整在线学习框架，该框架利用

大数据资讯

2110 0 0

大数据资讯

|

自然语言处理算法 Java

Hanlp汉字转拼音使用python调用详解

1、hanlp简介 HanLP是一系列模型与算法组成的NLP工具包，由大快搜索主导并完全开源，目标是普及自然语言处理在生产环境中的应用。HanLP具备功能完善、性能高效、架构清晰、语料时新、可自定义的特点。

大数据资讯

1942 0 0

大数据资讯

|

自然语言处理算法

中文分词算法工具hanlp源码解析

词图指的是句子中所有词可能构成的图。如果一个词A的下一个词可能是B的话，那么A和B之间具有一条路径E(A,B)。一个词可能有多个后续，同时也可能有多个前驱，它们构成的图我称作词图。

大数据资讯

1725 0 0

大数据资讯

|

自然语言处理

在Hanlp词典手动添加未登录词的方式介绍

在使用Hanlp词典进行分词的时候，会出现分词不准的情况，原因是内置词典中并没有收录当前这个词，也就是我们所说的未登录词，只要把这个词加入到内置词典中就可以解决类似问题，如何操作呢，

大数据资讯

1208 0 0

大数据资讯

|

自然语言处理算法 Java

Hanlp分词实例：Java实现TFIDF算法

大数据资讯

2549 0 0

热门文章

最新文章

业内首次融合数据仓库与数据湖阿里云推出下一代大数据平台 “湖仓一体”

阿里云大使推广及积分规则

与微服务一脉相承，Serverless适用何种场景？会带来哪些冲击？

ES 查询时提示：all shards failed [type=search_phase_execution_exception]

[ASP.NET入门]页面生命周期

python笔记二基础

页面copyright部分始终居于页面底部

PHP二维数组转一维数组

数据库实例: STOREBOOK > 表空间 > 编辑表空间: USERS

ArcGIS10.3新体验

Kimi-Audio：月之暗面开源音频大模型，1300万小时训练重塑语音交互

小米7B参数推理大模型首次开源！Xiaomi MiMo：数学代码双杀，超越32B巨头

这个AI把arXiv变成代码工厂，快速复现顶会算法！Paper2Code：AI论文自动转代码神器，多智能体框架颠覆科研复现

阿里通义开源新一代混合推理模型 Qwen3：创新双模式推理，支持"思考模式"和"非思考模式"

Multisim14.0中文下载安装步骤教程

《穿透技术迷雾：解码DCloud跨端开发的底层逻辑》

《从Web到原生：Cordova框架如何搭建功能互通的桥梁》

《Taro框架：微信生态下的开发利器》

《多端统一的终极答案：X5内核增强版的渲染优化全解析》

《跨端开发变革者：解码阿里Ant Container Engine的底层逻辑》

相关电子书

更多

低代码开发师（初级）实战教程

冬季实战营第三期：MySQL数据库进阶实战

阿里巴巴DevOps 最佳实践手册

下一篇

阿里云oss简介和如何对接使用

你好，我是AI助理

可以解答问题、推荐解决方案等