自然语言处理(NLP)

自然语言处理:

1、什么是自然语言处理(NLP)

  • 自然语言处理是一门交叉学科,包括计算机科学,人工智能和语言学
  • 目标:让计算机去处理或“理解”自然语言, 完成一些有用的任务例如问答系统,机器翻译
  • 完全理解或者表示语言的意义(甚至去定义它)都是一个虚幻的目标
  • 完美的理解语言是一个“AI-complete”的问题


2、自然语言处理的应用
  • 应用范围从简单到复杂
  • 拼写检查, 关键词提取&搜索,同义词查找&替换
  • 从网页中提取有用的信息例如产品价格,日期,地址,人名或公司名等
  • 分类,例如对教科书的文本进行分级,对长文本进行正负情绪判断
  • 机器翻译
  • 口语对话系统
  • 复杂的问答系统


3、工业届里的NLP应用
  • 搜索引擎
  • 在线广告
  • 自动的或辅助的翻译技术
  • 市场营销或者金融交易领域的情感分析
  • 语音识别


4、NLP为什么这么难
  • 语言在表达上就很复杂,使用的时候要综合考虑使用情境
  • Jane hit June and then she [fell/ran].
  • 歧义问题:“I made her duck”

5、现有的中文自然语言处理工具:
LTP
直接有纠错功能的: 腾讯文智    大汉科技



N-gram语言模型:
目的:在给定语料库的情况下,计算一个字符串出现的概率

N-gram是自然语言处理(NLP)中一个非常重要的概念,通常在NLP中,人们基于一定的语料库,可以利用N-gram来做以下几类事情:

  1. 预计或者评估一个句子是否合理;
  2. 评估两个字符串之间的差异程度,这也是模糊匹配中常用的一种手段;
  3. 语音识别;
  4. 机器翻译;
  5. 文本分类;

资料链接:
n-gram_1(包含 开源n-gram数据集

那么我们如何用N-gram来做篇章单元的分类器呢?其实很简单了,只要根据每个类别的语料库训练各自的语言模型,也就是上面的频率分布表,实质上就是每一个篇章单元的类别都有一个概率分布,当新来一个篇章单元的时候,只要根据各自的语言模型,计算出每个语言模型下这个篇章单元的发生概率,篇章单元在哪个模型的概率大,这篇文本就属于哪个类别了。


数据稀疏和平滑技术:


中文纠错


github上中文纠错项目:

结巴分词的词典:

高效的分词工具:
结巴

THULAC












评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值