语料准备

简介: 之前查找了很多资料,发现语料准备这块的方法论很有限,在我看来如果说AI是个学生,语料其实是教科书,是知识的海洋,是AI的粮食,非常重要。本文主要探讨有充分的语料基础后对语料进行预处理的办法。

之前查找了很多资料,发现语料准备这块的方法论很有限,在我看来如果说AI是个学生,语料其实是教科书,是知识的海洋,是AI的粮食,非常重要。
本文主要探讨有充分的语料基础后对语料进行预处理的办法。
1,众包打标签
2,手工规则提取
关键词特征,使用数据库进行批量标记。
实体识别后特征选取,使用分词工具根据词性来标记。
词频统计,对高频特殊词单独标记。
### Dialogflow 边标记边训练,不断校正测试效果。
Explosion.ai 的 Prodigy , 快速手工标记,后台学习,提供预判,个人觉得并不好用。
3, 专家手工打标签
推荐Excel,可以与数据库互传数据,可以指定标签词汇范围,进行快速输入。
我总觉得语料工具应该有更大的发展空间,需要做的更好!

目录
相关文章
|
1月前
|
机器学习/深度学习 自然语言处理 算法
机器翻译中的分词
机器翻译中的分词
18 2
|
1月前
|
机器学习/深度学习 自然语言处理
机器翻译中的词性标注
机器翻译中的词性标注
16 2
|
4月前
|
机器学习/深度学习 自然语言处理 数据挖掘
预训练语言模型中Transfomer模型、自监督学习、BERT模型概述(图文解释)
预训练语言模型中Transfomer模型、自监督学习、BERT模型概述(图文解释)
58 0
|
4月前
|
数据采集 自然语言处理
在ModelScope中进行情感分析模型的微调
在ModelScope中进行情感分析模型的微调
62 4
|
9月前
|
自然语言处理 搜索推荐
|
10月前
|
PyTorch TensorFlow 算法框架/工具
抽取GPT-3预训练模型的emb向量
抽取GPT-3预训练模型的emb向量
158 1
|
11月前
|
自然语言处理
中英文语料公开数据集大全
中英文语料公开数据集大全
Bert可以提取关键词了:KeyBERT的介绍与使用
Bert可以提取关键词了:KeyBERT的介绍与使用
1515 1
Bert可以提取关键词了:KeyBERT的介绍与使用
|
机器学习/深度学习
【文本分类】《短文本分类的ResLCNN模型》
【文本分类】《短文本分类的ResLCNN模型》
110 0
【文本分类】《短文本分类的ResLCNN模型》