Python自然语言处理实战核心技术与算法_PDF下载[129MB-百度云]涂铭

本书特色

[

自然语言处理是一门融语言学、计算机科学、数学于一体的学科，比较复杂，学习门槛高，但本书巧妙地避开了晦涩难懂的数学公式和证明，即便没有数学基础，也能零基础入门。
本书专注于中文的自然语言处理，以Python及其相关框架为工具，以实战为导向，详细讲解了自然语言处理的各种核心技术、方法论和经典算法。三位作者在人工智能、大数据和算法领域有丰富的积累和经验，是阿里巴巴、前明略数据和七牛云的资深专家。同时，本书也得到了阿里巴巴达摩院高级算法专家、七牛云AI实验室Leader等专家的高度评价和鼎力推荐。
全书一共11章，在逻辑上分为2个部分：
*部分（第1、2、11章）
主要介绍了自然语言处理所需要了解的基础知识、前置技术、Python科学包、正则表达式以及Solr检索等。
第二部分（第5-10章）自然语言处理是一门融语言学、计算机科学、数学于一体的学科，比较复杂，学习门槛高，但本书巧妙地避开了晦涩难懂的数学公式和证明，即便没有数学基础，也能零基础入门。
本书专注于中文的自然语言处理，以Python及其相关框架为工具，以实战为导向，详细讲解了自然语言处理的各种核心技术、方法论和经典算法。三位作者在人工智能、大数据和算法领域有丰富的积累和经验，是阿里巴巴、前明略数据和七牛云的资深专家。同时，本书也得到了阿里巴巴达摩院高级算法专家、七牛云AI实验室Leader等专家的高度评价和鼎力推荐。
全书一共11章，在逻辑上分为2个部分：
*部分（第1、2、11章）
主要介绍了自然语言处理所需要了解的基础知识、前置技术、Python科学包、正则表达式以及Solr检索等。
第二部分（第5-10章）
第3~5章讲解了词法分析相关的技术，包括中文分词技术、词性标注与命名实体识别、关键词提取算法等。
第6章讲解了句法分析技术，该部分目前理论研究较多，工程实践中使用门槛相对较高，且效果多是依赖结合业务知识进行规则扩展，因此本书未做深入探讨。
第7章讲解了常用的向量化方法，这些方法常用于各种NLP任务的输入。
第8章讲解了情感分析相关的概念、场景以及一般做情感分析的流程，情感分析在很多行业都有应用。
第9章介绍了机器学习的重要概念，同时重点突出NLP常用的分类算法、聚类算法，还介绍了几个案例。
第10章节介绍了NLP中常用的一些深度学习算法，这些方法比较复杂，但是非常实用，需要读者耐心学习。

]

内容简介

[

（1）三位作者资历深厚，分别是阿里巴巴的数据架构师和NLP专家、百炼智能的NLP专家（前明略数据的技术合伙人和科学家）、七牛云AI实验室NLP&OCR方向负责人
阿里巴巴、前明略数据和七牛云的资深NLP专家撰写
（2）以实战为导向，绕开各种复杂数学公式与证明，确保读者零基础入门，详细讲解自然语言处理
的各种核心技术、方法论和经典算法
（3）阿里巴巴达摩院高级算法专家、百炼智能CEO、七牛云AI LAB负责人、天善智能创始人联袂推荐

]

作者简介

[

涂铭：
阿里巴巴数据架构师，对大数据、自然语言处理、Python、Java相关技术有深入的研究，积累了丰富的实践经验。曾就职于北京明略数据，是大数据方面的高级咨询顾问。
在工业领域参与了设备故障诊断项目，在零售行业参与了精准营销项目。在自然语言处理方面，担任导购机器人项目的架构师，主导开发机器人的语义理解、短文本相似度匹配、上下文理解，以及通过自然语言检索产品库，在项目中构建了NoSQL 文本检索等大数据架构，也同时负责问答对的整理和商品属性的提取，带领NLP团队构建语义解析层。

刘祥：
百炼智能自然语言处理专家，主要研究知识图谱、NLG等前沿技术，参与机器自动写作产品的研发与设计。
曾在明略数据担当数据技术合伙人兼数据科学家，负责工业、金融等业务领域的数据挖掘工作，在这些领域构建了诸如故障诊断、关联账户分析、新闻推荐、商品推荐等模型。
酷爱新技术，活跃于开源社区，是SparkMLlib和Zeppelin的Contributor。涂铭：
阿里巴巴数据架构师，对大数据、自然语言处理、Python、Java相关技术有深入的研究，积累了丰富的实践经验。曾就职于北京明略数据，是大数据方面的高级咨询顾问。
在工业领域参与了设备故障诊断项目，在零售行业参与了精准营销项目。在自然语言处理方面，担任导购机器人项目的架构师，主导开发机器人的语义理解、短文本相似度匹配、上下文理解，以及通过自然语言检索产品库，在项目中构建了NoSQL 文本检索等大数据架构，也同时负责问答对的整理和商品属性的提取，带领NLP团队构建语义解析层。

刘树春：
七牛云高级算法专家，七牛AI实验室NLP&OCR方向负责人，主要负责七牛NLP以及OCR相关项目的研究与落地。在七牛人工智能实验室期间，参与大量NLP相关项目，例如知识图谱、问答系统、文本摘要、语音相关系统等；同时重点关注NLP与CV的交叉研究领域，主要有视觉问答（VQA），图像标注（Image Caption）等前沿问题。
曾在Intel
DCSG数据与云计算部门从事机器学习与云平台的融合开发，项目获得IDF大奖。硕士就读于华东师范大学机器学习实验室，在校期间主攻机器学习，机器视觉，图像处理，并在相关国际会议发表多篇SCI/EI论文。

]

目　　录序一序二前言第1章　NLP基础 11.1　什么是NLP 11.1.1　NLP的概念 11.1.2　NLP的研究任务 31.2　NLP的发展历程 51.3　NLP相关知识的构成 71.3.1　基本术语 71.3.2　知识结构 91.4　语料库 101.5　探讨NLP的几个层面 111.6　NLP与人工智能 131.7　本章小结 15第2章　NLP前置技术解析 162.1　搭建Python开发环境 162.1.1　Python的科学计算发行版——Anaconda 172.1.2　Anaconda的下载与安装 192.2　正则表达式在NLP的基本应用 212.2.1　匹配字符串 222.2.2　使用转义符 262.2.3　抽取文本中的数字 262.3　Numpy使用详解 272.3.1　创建数组 282.3.2　获取Numpy中数组的维度 302.3.3　获取本地数据 312.3.4　正确读取数据 322.3.5　Numpy数组索引 322.3.6　切片 332.3.7　数组比较 332.3.8　替代值 342.3.9　数据类型转换 362.3.10　Numpy的统计计算方法 362.4　本章小结 37第3章　中文分词技术 383.1　中文分词简介 383.2　规则分词 393.2.1　正向*大匹配法 393.2.2　逆向*大匹配法 403.2.3　双向*大匹配法 413.3　统计分词 423.3.1　语言模型 433.3.2　HMM模型 443.3.3　其他统计分词算法 523.4　混合分词 523.5　中文分词工具——Jieba 533.5.1　Jieba的三种分词模式 543.5.2　实战之高频词提取 553.6　本章小结 58第4章　词性标注与命名实体识别 594.1　词性标注 594.1.1　词性标注简介 594.1.2　词性标注规范 604.1.3　Jieba分词中的词性标注 614.2　命名实体识别 634.2.1　命名实体识别简介 634.2.2　基于条件随机场的命名实体识别 654.2.3　实战一：日期识别 694.2.4　实战二：地名识别 754.3　总结 84第5章　关键词提取算法 855.1　关键词提取技术概述 855.2　关键词提取算法TF/IDF算法 865.3　TextRank算法 885.4　LSA/LSI/LDA算法 915.4.1　LSA/LSI算法 935.4.2　LDA算法 945.5　实战提取文本关键词 955.6　本章小结 105第6章　句法分析 1066.1　句法分析概述 1066.2　句法分析的数据集与评测方法 1076.2.1　句法分析的数据集 1086.2.2　句法分析的评测方法 1096.3　句法分析的常用方法 1096.3.1　基于PCFG的句法分析 1106.3.2　基于*大间隔马尔可夫网络的句法分析 1126.3.3　基于CRF的句法分析 1136.3.4　基于移进–归约的句法分析模型 1136.4　使用Stanford Parser的PCFG算法进行句法分析 1156.4.1　Stanford Parser 1156.4.2　基于PCFG的中文句法分析实战 1166.5　本章小结 119第7章　文本向量化 1207.1　文本向量化概述 1207.2　向量化算法word2vec 1217.2.1　神经网络语言模型 1227.2.2　C&W模型 1247.2.3　CBOW模型和Skip-gram模型 1257.3　向量化算法doc2vec/str2vec 1277.4　案例：将网页文本向量化 1297.4.1　词向量的训练 1297.4.2　段落向量的训练 1337.4.3　利用word2vec和doc2vec计算网页相似度 1347.5　本章小结 139第8章　情感分析技术 1408.1　情感分析的应用 1418.2　情感分析的基本方法 1428.2.1　词法分析 1438.2.2　机器学习方法 1448.2.3　混合分析 1448.3　实战电影评论情感分析 1458.3.1　卷积神经网络 1468.3.2　循环神经网络 1478.3.3　长短时记忆网络 1488.3.4　载入数据 1508.3.5　辅助函数 1548.3.6　模型设置 1558.3.7　调参配置 1588.3.8　训练过程 1598.4　本章小结 159第9章　NLP中用到的机器学习算法 1609.1　简介 1609.1.1　机器学习训练的要素 1619.1.2　机器学习的组成部分 1629.2　几种常用的机器学习方法 1669.2.1　文本分类 1669.2.2　特征提取 1689.2.3　标注 1699.2.4　搜索与排序 1709.2.5　推荐系统 1709.2.6　序列学习 1729.3　分类器方法 1739.3.1　朴素贝叶斯Naive Bayesian 1739.3.2　逻辑回归 1749.3.3　支持向量机 1759.4　无监督学习的文本聚类 1779.5　文本分类实战：中文垃圾邮件分类 1809.5.1　实现代码 1809.5.2　评价指标 1879.6　文本聚类实战：用K-means对豆瓣读书数据聚类 1909.7　本章小结 194第10章　基于深度学习的NLP算法 19510.1　深度学习概述 19510.1.1　神经元模型 19610.1.2　激活函数 19710.1.3　感知机与多层网络 19810.2　神经网络模型 20110.3　多输出层模型 20310.4　反向传播算法 20410.5　*优化算法 20810.5.1　梯度下降 20810.5.2　随机梯度下降 20910.5.3　批量梯度下降 21010.6　丢弃法 21110.7　激活函数 21110.7.1　tanh函数 21210.7.2　ReLU函数 21210.8　实现BP算法 21310.9　词嵌入算法 21610.9.1　词向量 21710.9.2　word2vec简介 21710.9.3　词向量模型 22010.9.4　CBOW和Skip-gram模型 22210.1

封面

Python自然语言处理实战核心技术与算法

书名:Python自然语言处理实战核心技术与算法

作者:涂铭

页数:未知

定价:¥69.0

出版社:机械工业出版社

出版日期:2018-05-01

ISBN:9787111597674

PDF电子书大小:129MB 高清扫描完整版

百度云下载：http://www.chendianrong.com/pdf

Python自然语言处理实战核心技术与算法

相关资料

本书特色

内容简介

作者简介

目录

封面

发表评论