内容简介
第1部分 基本概念篇
第1章 云计算
1.1云的基本特征
1.1.1按需自服务
1.1.2广泛的网络访问
1.1.3资源共享
1.1.4快速弹性
1.1.5服务可度量
1.2共有的云特征
1.3云计算到底是什么
1.3.1什么是数据中心
1.3.2云计算和传统数据中心有何不同
1.4服务模式
1.5云部署模式
1.6云计算中的角色
1.7云计算的优势
1.8云计算的风险
第2章 虚拟化
2.1背景
2.2什么是虚拟化
2.2.1管理程序的类型
2.2.2虚拟和仿真
2.3服务器虚拟化
2.3.1完全虚拟化
2.3.2部分虚拟化
2.3.3操作系统虚拟化
2.3.4讨论
2.4虚拟机的生命周期
2.4.1虚拟机快照
2.4.2克隆虚拟机
2.4.3高可用性机制
2.5虚拟化的可靠性和可用性风险
第3章 服务可靠性和服务可用性
3.1错误和失效
3.2八成分框架
3.3服务可用性
3.3.1服务可用性指标
3.3.2 MTBF和MTTR
3.3.3服务和网元影响中断
3.3.4局部中断
3.3.5可用性等级
3.3.6中断归因
3.3.7计划内宕机时间
3.4服务可靠性
3.4.1服务可靠性指标
3.4.2缺陷事务
3.5服务时延
3.6冗余和高可用性
3.6.1冗余
3.6.2高可用性
3.7高可用性和灾难恢复
3.8流媒体服务
3.8.1控制和数据平面
3.8.2服务质量指标
3.8.3等时性数据
3.8.4时延期望
3.8.5流媒体质量损伤
3.9云计算的可靠性和可用性风险
第2部分 分析篇
第4章 云计算的可靠性和可用性分析
4.1服务可靠性和可用性的期望
4.2云基本特征的风险
4.2.1按需自助服务
4.2.2宽带网络接入
4.2.3资源池
4.2.4快速弹性
4.2.5测量服务
4.3常见云特征的影响
4.3.1虚拟化
4.3.2地理分布
4.3.3弹性计算
4.3.4高级安全性
4.3.5大规模
4.3.6同质化
4.4服务模式的风险
4.4.1传统的责任归因
4.4.2云应用的责任归因
4.5 IT服务管理和可用性的风险
4.5.1 ITIL概述
4.5.2服务策略
4.5.3服务设计
4.5.4服务转移
4.5.5服务运营
4.5.6持续服务改进
4.5.7 IT服务管理概述
4.5.8服务编排的风险
4.5.9 IT服务管理风险
4.6过程区域中断的风险
4.7故障检测的注意事项
4.7.1硬件故障
4.7.2编程错误
4.7.3数据的不一致性和错误
4.7.4 冗余错误
4.7.5系统电源故障
4.7.6网络错误
4.7.7应用协议错误
4.8部署模型的风险
4.9 IaaS数据中心的期望值
第5章 虚拟化的可靠性分析
5.1可靠性分析技术
5.1.1可靠性框图
5.1.2单点故障分析
5.1.3故障模式影响分析(FMEA)
5.2虚拟化技术的可靠性分析
5.2.1全虚拟化分析
5.2.2虚拟操作系统分析
5.2.3半虚拟化分析
5.2.4 VM共存分析
5.2.5讨论
5.3软件故障率分析
5.3.1虚拟化和软件故障率
5.3.2虚拟机管理程序故障率
5.3.3虚拟化和云的其他软件风险
5.4恢复模型
5.4.1传统的恢复选项
5.4.2虚拟化恢复选项
5.4.3讨论
5.5应用架构策略
5.5.1按需单用户模式
5.5.2单用户守护进程模式
5.5.3多用户服务器模式
5.5.4服务器整合模式
5.6虚拟化恢复方式的可用性建模
5.6.1虚拟化单工架构的可用性
5.6.2虚拟化冗余架构的可用性
5.6.3关键故障率
5.6.4故障覆盖率
5.6.5故障检测延迟
5.6.6切换延迟
5.6.7切换成功率
5.6.8建模与“快速故障”
5.6.9本地和虚拟化部署的比较
第6章 硬件可靠性、虚拟化和服务可用性
6.1对硬件故障停机时间的期望
6.2硬件故障
6.3硬件故障率
6.4硬件故障检测
6.5硬件故障遏制
6.6硬件故障的缓解
6.7通过虚拟化缓解硬件故障
6.7.1虚拟CPU
6.7.2虚拟内存
6.7.3虚拟存储
6.8虚拟化网络
6.8.1虚拟网络接口卡
6.8.2虚拟局域网
6.8.3虚拟IP地址
6.8.4虚拟专用网络
6.9虚拟硬件的MTTR
6.10讨论
第7章 容量和弹性
7.1系统负载基础知识
7.1.1特别事件的考虑
7.1.2 Slashdot效应
7.2过载、服务的可靠性和可用性
7.3传统的容量规划
7.4云和容量
7.4.1标称的云存储模型
7.4.2弹性的期望
7.5管理联机容量
7.6容量相关的服务风险
7.6.1弹性和弹性故障
7.6.2部分容量故障
7.6.3服务延迟风险
7.6.4容量损伤和服务可靠性
7.7容量管理风险
7.7.1脆弱的应用架构
7.7.2故障或监测数据不足
7.7.3错误的容量决策
7.7.4不可靠的容量扩张
7.7.5不可靠的容量缩减
7.7.6转换速度不足
7.7.7缓慢的容量管理决策
7.7.8资源库存耗竭
7.7.9云跳转失败
7.7.10政策限制
7.8安全性和服务可用性
7.8.1服务可用性的安全风险
7.8.2拒绝服务攻击
7.8.3 DoS攻击的防御
7.8.4量化安全攻击对服务可用性的影响
7.8.5建议
7.9弹性扩张和收缩的架构
第8章 服务编排分析
8.1服务编排定义
8.2基于策略的管理
8.2.1 SLR的作用
8.2.2服务可靠性和可用性的测量
8.3云管理
8.3.1云管理中快速弹性的作用
8.3.2云管理中云突发的作用
8.4服务编排在风险缓解中的作用
8.4.1延迟
8.4.2可靠性
8.4.3监督管理
8.4.4安全
8.5小结
第9章 地理分布、地理冗余和灾难恢复
9.1地理分布VS地理冗余
9.2传统的灾难恢复
9.3虚拟化和灾难恢复
9.4云计算和灾难恢复
9.5地理冗余恢复模型
9.6云和传统地理冗余的附加益处
9.6.1减少预期的宕机时间
9.6.2缓解灾难性的网络元件故障
9.6.3减少未发现的和双工元件故障
9.7讨论
第3部分 建议篇
第10章 应用、解决方案和责任认定
10.1应用配置场景
10.2应用的部署方案
10.3系统宕机时间预期
10.3.1传统的系统宕机时间预期
10.3.2虚拟化应用宕机时间预期
10.3.3 IaaS的硬件宕机时间预期
10.3.4云应用的宕机时间预算
10.3.5总结
10.4最终的端到端解决方案的注意事项
10.4.1什么是端到端解决方案
10.4.2云消费者的特定架构
10.4.3数据中心冗余
10.5服务不佳的原因
10.6解决方案服务的测量
10.7管理可靠性和云计算服务
第11章 构建可靠系统的建议
11.1虚拟化和云计算的架构
11.1.1软件映射到VM
11.1.2服务负载分配
11.1.3数据管理
11.1.4软件冗余和高可用性机制
11.1.5快速弹性
11.1.6过载控制
11.1.7共享
11.1.8多租户
11.1.9同步应用
11.2灾难恢复
11.3 IT服务管理的注意事项
11.3.1软件升级和打补丁
11.3.2服务迁移活动的影响分析
11.3.3通过VM迁移缓解服务迁移活动的影响
11.3.4服务迁移活动的测试
11.3.5流程错误最小化
11.3.6服务编排的注意事项
11.4许多分布式云VS少量巨型云
11.5硬件归因宕机时间最小化
11.6架构优化
11.6.1可靠性和可用性标准
11.6.2可访问性优化
11.6.3高可用性、持续性、可靠性和质量优化
11.6.4灾难恢复优化
11.6.5操作注意事项
11.6.6案例分析
11.6.7理论最优的应用架构
第12章 虚拟化应用的可靠性设计
12.1可靠性设计
12.2调整DfR以适应虚拟化应用
12.2.1硬件独立性应用场景
12.2.2服务器整合应用场景
12.2.3多租户应用场景
12.2.4虚拟化设备应用方案
12.2.5云部署应用场景
12.3可靠性要求
12.3.1通用可用性要求
12.3.2服务的可靠性和延迟要求
12.3.3过载要求
12.3.4在线容量增长和收缩
12.3.5(虚拟化)实时迁移要求
12.3.6系统转变活动的要求
12.3.7地理冗余和服务持续性要求
12.4可靠性定性分析
12.4.1虚拟化应用的SPOF分析
12.4.2虚拟化应用的故障模式影响分析
12.4.3容量的增长和收缩分析
12.5可靠性定量预算与建模
12.5.1可用性(宕机时间)建模
12.5.2整体宕机时间预算及目标
12.5.3管理维护预算分配
12.6健壮性测试
12.6.1基准健壮性测试
12.6.2高级主题:虚拟化能更好地测试健壮性
12.7稳定性测试
12.8实际性能分析
12.9可靠性路线图
12.10硬件可靠性
第13章 云计算解决方案的可靠性设计
13.1解决方案的可靠性设计
13.2解决方案范围和期望
13.3可靠性需求
13.3.1解决方案的可用性需求
13.3.2解决方案的可靠性需求
13.3.3灾难恢复需求
13.3.4弹性需求
13.3.5明确的配置参数
13.4解决方案建模与分析
13.4.1云数据中心部署的可靠性框图
13.4.2解决方案故障模式的影响分析
13.4.3解决方案服务转变活动的影响分析
13.4.4云数据中心的服务可用性(MP 2)分析
13.4.5聚合服务可用性(MP3)建模
13.4.6恢复点目标分析
13.5组件可靠性检查
13.6解决方案的测试和验证
13.6.1健壮性测试
13.6.2服务的可靠性测试
13.6.3地理冗余测试
13.6.4弹性与调度测试
13.6.5稳定性测试
13.6.6在用服务测试
13.7实际性能的跟踪和分析
13.7.1云服务的测量
13.7.2解决方案的可靠性路线图
13.8解决方案可靠性的其他主题
13.8.1服务等级协议
13.8.2云服务提供商的选择
13.8.3书面的可靠性计划
第14章 总结
14.1服务可靠性和服务可用性
14.2故障问责和云计算
14.3服务宕机时间因素
14.4服务可用性测量点
14.5云容量和弹性的考虑
14.6最大化服务可用性
14.6.1降低产品归因的宕机时间
14.6.2降低数据中心归因的宕机时间
14.6.3降低IT服务管理的宕机时间
14.6.4降低灾难恢复的宕机时间
14.6.5优化云服务可用性
14.7可靠性努力
14.8结束语
缩略语
参考文献