主页 详情

《OREILLY精品图书系列 面向机器学习的自然语言标注》_(美)普斯特若夫斯基(James Pustejovsky),(美)斯塔布斯(Amber Stubb

【书名】:《OREILLY精品图书系列 面向机器学习的自然语言标注》
【作者】:(美)普斯特若夫斯基(James Pustejovsky),(美)斯塔布斯(Amber Stubbs)著;邱立坤,金澎,王萌译
【出版社】:北京:机械工业出版社
【时间】:2017
【页数】:294
【ISBN】:9787111555155
【SS码】:14208270

最新查询

内容简介

前言

第1章基础知识

1.1语言标注的重要性

1.1.1语言学描述的层次

1.1.2什么是自然语言处理

1.2语料库语言学简史

1.2.1什么是语料库

1.2.2语料库的早期应用

1.2.3当今的语料库

1.2.4标注类型

1.3语言数据和机器学习

1.3.1分类

1.3.2聚类

1.3.3结构化模式归纳

1.4标注开发循环

1.4.1现象建模

1.4.2按照规格说明进行标注

1.4.3在语料库上训练和测试算法

1.4.4对结果进行评价

1.4.5修改模型和算法

总结

第2章确定目标与选择数据

2.1定义目标

2.1.1目标陈述

2.1.2提炼目标:信息量与正确性

2.2背景研究

2.2.1语言资源

2.2.2机构与会议

2.2.3自然语言处理竞赛

2.3整合数据集

2.3.1理想的语料库:代表性与平衡性

2.3.2从因特网上收集数据

2.3.3从人群中获取数据

2.4语料库的规模

2.4.1现有语料库

2.4.2语料库内部的分布

总结

第3章语料库分析

3.1语料库分析中的基本概率知识

3.1.1联合概率分布

3.1.2贝叶斯定理

3.2计算出现次数

3.2.1齐普夫定律(Zip’s Law)

3.2.2 n元语法

3.3语言模型

总结

第4章建立模型与规格说明

4.1模型和规格说明示例

4.1.1电影题材分类

4.1.2添加命名实体

4.1.3语义角色

4.2采用(或不采用)现有模型

4.2.1创建模型和规格说明:一般性与特殊性

4.2.2使用现有模型和规格说明

4.2.3使用没有规格说明的模型

4.3各种标准

4.3.1 ISO标准

4.3.2社区驱动型标准

4.3.3影响标注的其他标准

总结

第5章选择并应用标注标准

5.1元数据标注:文档分类

5.1.1单标签标注:电影评论

5.1.2多标签标注:电影题材

5.2文本范围标注:命名实体

5.2.1内嵌式标注

5.2.2基于词例的分离式标注

5.2.3基于字符位置的分离式标注

5.3链接范围标注:语义角色

5.4 ISO标准和你

总结

第6章标注与审核

6.1标注项目的基本结构

6.2标注规格说明与标注指南

6.3准备修改

6.4准备用于标注的数据

6.4.1元数据

6.4.2数据预处理

6.4.3为标注工作分割文件

6.5撰写标注指南

6.5.1例1:单标签标注——电影评论

6.5.2例2:多标签标注——电影题材

6.5.3例3:范围标注——命名实体

6.5.4例4:链接范围标注——语义角色

6.6标注人员

6.7选择标注环境

6.8评价标注结果

6.8.1 Cohen的Карра(к)算法

6.8.2 Fleiss的Карра(к)算法

6.8.3解释Kappa系数

6.8.4在其他上下文中计算к值

6.9创建黄金标准(审核)

总结

第7章训练:机器学习

7.1何谓学习

7.2定义学习任务

7.3分类算法

7.3.1决策树学习

7.3.2朴素贝叶斯学习

7.3.3最大熵分类器

7.3.4其他需要了解的分类器

7.4序列归纳算法

7.5聚类和无监督学习

7.6半监督学习

7.7匹配标注与算法

总结

第8章测试与评价

8.1测试算法

8.2评价算法

8.2.1混淆矩阵

8.2.2计算评价得分

8.2.3解释评价得分

8.3可能影响算法评价的问题

8.3.1数据集太小

8.3.2算法过于适合开发数据

8.3.3标注中的信息过多

8.4最后测试得分

总结

第9章修改与报告

9.1修改项目

9.1.1语料库分布和内容

9.1.2模型和规格说明

9.1.3标注

9.1.4训练和测试

9.2报告工作

9.2.1关于语料库

9.2.2关于模型和规格说明

9.2.3关于标注任务和标注人员

9.2.4关于ML算法

9.2.5关于修改

总结

第10章标注:TimeML

10.1 TimeML的设计目标

10.2相关研究

10.3建设语料库

10.4模型:初步的标注规格说明

10.4.1时间

10.4.2信号

10.4.3事件

10.4.4链接

10.5标注:最初的尝试

10.6模型:TimeBank中的TimeML标注规格说明

10.6.1时间表达式

10.6.2事件

10.6.3信号

10.6.4链接

10.6.5可信度

10.7标注:TimeBank的产生

10.8 TimeML成为ISO-TimeML

10.9对未来建模:TimeML的发展方向

10.9.1叙事容器

10.9.2将TimeML扩展到其他领域

10.9.3事件结构

总结

第11章自动标注:生成TimeML

11.1 TARSQI组件

11.1.1 GUTime:时间标志识别

11.1.2 EVITA:事件识别及分类

11.1.3 GUTenLINK

11.1.4 Slinket

11.1.5 SputLink

11.1.6 TARSQI组件中的机器学习

11.2 TTK的改进

11.2.1结构变化

11.2.2时间实体识别改进:BTime

11.2.3时间关系识别

11.2.4时间关系验证

11.2.5时间关系可视化

11.3 TimeML竞赛:TempEval-2

11.3.1 TempEval-2:系统概述

11.3.2成果综述

11.4 TTK的未来

11.4.1新的输入格式

11.4.2叙事容器/叙事时间

11.4.3医学文档

11.4.4跨文档分析

总结

第12章后记:标注的未来发展趋势

12.1众包标注

12.1.1亚马逊土耳其机器人

12.1.2有目的的游戏

12.1.3用户生成内容

12.2处理大数据

12.2.1 Boosting算法

12.2.2主动学习

12.2.3半监督学习

12.3 NLP在线和在云端

12.3.1分布式计算

12.3.2语言资源共享

12.3.3语言应用共享

结语

附录A可利用的语料库与标注规格说明列表

附录B软件资源列表

附录C MAE用户指南

附录D MAI用户指南

附录E参考文献


书查询(www.shuchaxun.com)本网页唯一编码:
1fa574ddd26bb4b1446da58395c6dbcb#bd67ce65254091477741be095cabc668#78370349#面向机器学习的自然语言标注_14208270.zip