Notes about RAS Offload
文章目录
本文将mark下RAS Offload的相关notes。
What
RAS Offload 是一种将部分硬件错误处理任务从 CPU 的 SMM(System Management Mode)环境卸载到 BMC 的技术。
Intel Xeon 6 引入BMC RAS Offload:
将部分 RAS error handling 从 SMM 转移到 BMC 环境,从而减少 SMI(System Management Interrupt)的使用。
传统方式:
1 | Hardware Error |
RAS Offload:
1 | Hardware Error |
即让BMC承担部分RAS管理任务,而不是让CPU参与处理。
Why
减少 SMI 对业务性能的影响
传统RAS处理中:
1 | 硬件错误 |
问题:
- SMI会暂停正常CPU执行
- OS和应用无法控制SMM
- 可能造成 latency spike 和性能抖动
对于:
- 云服务器
- HPC
- AI训练
这种长时间运行业务,SMI影响较大。
RAS Offload后:
1 | 硬件错误 |
减少CPU中断和业务扰动。
利用BMC独立管理能力
BMC本身就是服务器的管理控制器:
1 | Server |
特点:
- 独立运行
- 独立供电
- 即使OS异常,也可以工作
因此适合承担:
- 错误收集
- 故障处理
- RAS管理
RAS Offload与BMC的关系
两者关系:
BMC 是 RAS Offload 的执行平台,但 RAS Offload 不是 BMC 本身。
BMC功能包括:
1 | BMC |
RAS Offload只是BMC新增的一类可靠性管理能力。
How
简化流程:
1 | Hardware Error |
BMC负责:
- 收集错误状态
- 执行部分恢复动作
- 记录错误信息
避免:
1 | Error |
Intel Xeon 6中支持的RAS Offload能力
Memory / PCIe / UPI Corrected Error (CE) handling
- 收集和处理可纠正错误
- 减少CPU参与
Runtime PPR
运行时触发:
- DRAM坏Row修复
- 将故障Row映射到备用Row
属于memory repair能力。
ADDDC
当DRAM device出现失效趋势:
- 动态增强ECC保护
- 避免device failure导致系统故障
ECS data collection
DDR5 Error Check Scrub相关:
- 收集DRAM错误信息
- 辅助RAS分析
SPD bus recovery
恢复DIMM SPD访问通道:
- 解决SPD/SMBus异常
- 保证DIMM管理信息可获取
RAS Offload vs 传统RAS
| 传统RAS | RAS Offload | |
|---|---|---|
| 执行位置 | CPU SMM | BMC |
| 错误处理触发 | SMI | BMC处理 |
| 是否影响CPU业务 | 可能影响 | 降低影响 |
| 管理独立性 | 依赖CPU | 独立管理平面 |
总结
RAS Offload 是Intel Xeon 6提出的服务器可靠性增强机制,通过将部分RAS错误处理任务从CPU的SMM环境迁移到BMC,使BMC承担错误管理和恢复工作,从而减少SMI中断对业务性能的影响。
简单理解:
1 | 过去: |
其中:
- BMC = RAS Offload 的执行载体
- PPR/ADDDC/ECS/SPD recovery = BMC可以辅助执行的具体RAS动作
它代表服务器RAS架构从CPU参与故障处理,向独立管理控制器负责可靠性管理的演进。
参考资料:
- Intel® Xeon® 6 Processors with Performance-cores (P-cores): Reliability, Availability, and Serviceability