内容简介
前言
第1章基础知识
1.1语言标注的重要性
1.1.1语言学描述的层次
1.1.2什么是自然语言处理
1.2语料库语言学简史
1.2.1什么是语料库
1.2.2语料库的早期应用
1.2.3当今的语料库
1.2.4标注类型
1.3语言数据和机器学习
1.3.1分类
1.3.2聚类
1.3.3结构化模式归纳
1.4标注开发循环
1.4.1现象建模
1.4.2按照规格说明进行标注
1.4.3在语料库上训练和测试算法
1.4.4对结果进行评价
1.4.5修改模型和算法
总结
第2章确定目标与选择数据
2.1定义目标
2.1.1目标陈述
2.1.2提炼目标:信息量与正确性
2.2背景研究
2.2.1语言资源
2.2.2机构与会议
2.2.3自然语言处理竞赛
2.3整合数据集
2.3.1理想的语料库:代表性与平衡性
2.3.2从因特网上收集数据
2.3.3从人群中获取数据
2.4语料库的规模
2.4.1现有语料库
2.4.2语料库内部的分布
总结
第3章语料库分析
3.1语料库分析中的基本概率知识
3.1.1联合概率分布
3.1.2贝叶斯定理
3.2计算出现次数
3.2.1齐普夫定律(Zip’s Law)
3.2.2 n元语法
3.3语言模型
总结
第4章建立模型与规格说明
4.1模型和规格说明示例
4.1.1电影题材分类
4.1.2添加命名实体
4.1.3语义角色
4.2采用(或不采用)现有模型
4.2.1创建模型和规格说明:一般性与特殊性
4.2.2使用现有模型和规格说明
4.2.3使用没有规格说明的模型
4.3各种标准
4.3.1 ISO标准
4.3.2社区驱动型标准
4.3.3影响标注的其他标准
总结
第5章选择并应用标注标准
5.1元数据标注:文档分类
5.1.1单标签标注:电影评论
5.1.2多标签标注:电影题材
5.2文本范围标注:命名实体
5.2.1内嵌式标注
5.2.2基于词例的分离式标注
5.2.3基于字符位置的分离式标注
5.3链接范围标注:语义角色
5.4 ISO标准和你
总结
第6章标注与审核
6.1标注项目的基本结构
6.2标注规格说明与标注指南
6.3准备修改
6.4准备用于标注的数据
6.4.1元数据
6.4.2数据预处理
6.4.3为标注工作分割文件
6.5撰写标注指南
6.5.1例1:单标签标注——电影评论
6.5.2例2:多标签标注——电影题材
6.5.3例3:范围标注——命名实体
6.5.4例4:链接范围标注——语义角色
6.6标注人员
6.7选择标注环境
6.8评价标注结果
6.8.1 Cohen的Карра(к)算法
6.8.2 Fleiss的Карра(к)算法
6.8.3解释Kappa系数
6.8.4在其他上下文中计算к值
6.9创建黄金标准(审核)
总结
第7章训练:机器学习
7.1何谓学习
7.2定义学习任务
7.3分类算法
7.3.1决策树学习
7.3.2朴素贝叶斯学习
7.3.3最大熵分类器
7.3.4其他需要了解的分类器
7.4序列归纳算法
7.5聚类和无监督学习
7.6半监督学习
7.7匹配标注与算法
总结
第8章测试与评价
8.1测试算法
8.2评价算法
8.2.1混淆矩阵
8.2.2计算评价得分
8.2.3解释评价得分
8.3可能影响算法评价的问题
8.3.1数据集太小
8.3.2算法过于适合开发数据
8.3.3标注中的信息过多
8.4最后测试得分
总结
第9章修改与报告
9.1修改项目
9.1.1语料库分布和内容
9.1.2模型和规格说明
9.1.3标注
9.1.4训练和测试
9.2报告工作
9.2.1关于语料库
9.2.2关于模型和规格说明
9.2.3关于标注任务和标注人员
9.2.4关于ML算法
9.2.5关于修改
总结
第10章标注:TimeML
10.1 TimeML的设计目标
10.2相关研究
10.3建设语料库
10.4模型:初步的标注规格说明
10.4.1时间
10.4.2信号
10.4.3事件
10.4.4链接
10.5标注:最初的尝试
10.6模型:TimeBank中的TimeML标注规格说明
10.6.1时间表达式
10.6.2事件
10.6.3信号
10.6.4链接
10.6.5可信度
10.7标注:TimeBank的产生
10.8 TimeML成为ISO-TimeML
10.9对未来建模:TimeML的发展方向
10.9.1叙事容器
10.9.2将TimeML扩展到其他领域
10.9.3事件结构
总结
第11章自动标注:生成TimeML
11.1 TARSQI组件
11.1.1 GUTime:时间标志识别
11.1.2 EVITA:事件识别及分类
11.1.3 GUTenLINK
11.1.4 Slinket
11.1.5 SputLink
11.1.6 TARSQI组件中的机器学习
11.2 TTK的改进
11.2.1结构变化
11.2.2时间实体识别改进:BTime
11.2.3时间关系识别
11.2.4时间关系验证
11.2.5时间关系可视化
11.3 TimeML竞赛:TempEval-2
11.3.1 TempEval-2:系统概述
11.3.2成果综述
11.4 TTK的未来
11.4.1新的输入格式
11.4.2叙事容器/叙事时间
11.4.3医学文档
11.4.4跨文档分析
总结
第12章后记:标注的未来发展趋势
12.1众包标注
12.1.1亚马逊土耳其机器人
12.1.2有目的的游戏
12.1.3用户生成内容
12.2处理大数据
12.2.1 Boosting算法
12.2.2主动学习
12.2.3半监督学习
12.3 NLP在线和在云端
12.3.1分布式计算
12.3.2语言资源共享
12.3.3语言应用共享
结语
附录A可利用的语料库与标注规格说明列表
附录B软件资源列表
附录C MAE用户指南
附录D MAI用户指南
附录E参考文献