技能库 1304 个
更多分类(194)
故障诊断与恢复
分析 GlusterFS 日志、修复裂脑、替换故障 brick、恢复数据一致性
卷管理操作
指导 GlusterFS 工程师执行卷的创建、启动、停止、扩展、收缩、迁移,并处理裂脑与故障恢复
CRUSH 映射设计
设计和调整 CRUSH map 以实现数据分布优化、故障域隔离和权重管理
RBD 性能基准测试
使用 fio 或 rados bench 对 RBD 设备进行 IOPS、带宽和延迟测试,并解读结果,以验证 Ceph 集群性能。
Ceph 集群部署与配置
使用 cephadm 或 Ansible 完成 Ceph 集群的部署、OSD 配置和网络调优
CephFS 元数据性能调优
调整 MDS 缓存参数、日志配置和客户端挂载选项以优化 CephFS 元数据性能。
RGW 对象网关配置
部署和配置 Ceph RGW,支持 S3 API 兼容性、多站点同步和访问控制策略,适用于云计算与中间件场景。
PG 状态诊断与修复
分析 Ceph 集群中 Placement Group (PG) 的状态异常(如 peering、inconsistent、stale 等),并通过命令执行修复以恢复数据一致性。
OSD 故障处理与替换
识别故障 OSD,执行剔除、数据重建和新盘替换操作,确保 Ceph 集群数据安全与恢复。
CSI 驱动开发与调试
编写或定制 Container Storage Interface 驱动,实现卷的创建、挂载、快照等功能,并解决驱动兼容性问题。
Longhorn 卷管理
部署和配置 Longhorn 分布式块存储,管理卷的复制、备份、灾备策略,处理节点故障时的数据恢复。
存储性能基准测试
使用 fio、vdbench 等工具对块存储、文件存储进行 IOPS、吞吐量、延迟测试,分析性能瓶颈,为云原生环境提供性能基准。
Rook/Ceph 集群部署与运维
使用 Rook 在 Kubernetes 上部署和管理 Ceph 存储集群,包括 OSD、MON、MGR 等组件的配置与故障处理
分布式文件系统挂载优化
配置和调优 NFS、GlusterFS、CephFS 等文件系统在容器环境中的挂载参数,解决并发访问和性能问题。
Kubernetes 存储资源编排
编写 StorageClass、PersistentVolumeClaim、PersistentVolume 资源,实现动态供给和存储策略管理。
存储插件与 Operator 开发
使用 Operator SDK 开发存储相关的 Kubernetes Operator,自动化存储集群的生命周期管理
存储故障诊断与数据恢复
通过日志、监控指标定位存储节点故障、数据不一致等问题,执行数据修复或恢复操作
APISIX 安全策略配置
为 Apache APISIX 网关配置 IP 黑/白名单、限流限并发、CORS、JWT/OAuth2 认证等安全插件,保障 API 网关的安全防护能力。
APISIX 多环境 CI/CD 集成
通过声明式配置(APISIX Ingress Controller 或 Helm Chart)实现网关配置的版本管理与自动化发布
Linkerd 性能调优与资源限制
优化 Linkerd 代理(linkerd-proxy)的 CPU/内存资源限制,调整并发连接数和缓冲池参数以降低延迟
服务网格遥测数据采集与可视化
集成 Linkerd 与 Prometheus、Grafana,采集和可视化请求成功率、延迟、流量等指标,并配置告警规则。
mTLS 证书轮换与策略管理
配置和管理 Linkerd 的自动 mTLS,包括证书轮换策略、信任域设置以及使用 cert-manager 进行证书管理。
多集群服务网格联邦配置
配置 Linkerd 多集群连接(包括 Service Mirroring 和 Cluster Link),实现跨集群服务发现和流量路由。
服务网格故障注入与混沌工程
使用 Linkerd 的故障注入能力(延迟和错误注入)进行混沌工程实验,验证系统弹性。