Install
openclaw skills install @thcjp/kubernetes-toolkit-pro企业级Kubernetes管理平台,支持多集群统一管理、策略治理、监控告警、GitOps自动化及完整CRD生命周期管理。
openclaw skills install @thcjp/kubernetes-toolkit-pro功能说明: 本技能涵盖 中文交互、化工作流场景 等核心能力。
本平台为企业运维团队提供全功能的K8s管理能力。相比免费版,PRO版新增多集群管理、策略治理、监控告警、GitOps自动化和CRD完整管理等高级功能,全面满足企业级K8s运维的复杂需求. PRO版完全兼容免费版单集群管理命令,升级后原有管理工作流可直接使用.
| 功能 | 免费版 | PRO版 |
|---|---|---|
| 集群数量 | 单集群 | 多集群统一 |
| 策略治理 | 不支持 | OPA/Kyverno |
| 监控告警 | 不支持 | 全维度监控 |
| GitOps | 不支持 | ArgoCD/Flux |
| CRD管理 | 基础查询 | 完整生命周期 |
| Agent调度 | 固定分配 | 智能调度 |
| 资源优化 | 不支持 | 成本优化 |
| 灾备迁移 | 不支持 | 跨集群灾备 |
处理: 解析PRO版功能增强对比的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回PRO版功能增强对比的响应数据,包含状态码、结果和日志.
用input_params参数进行配置.
处理: 解析核心功能执行的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回核心功能执行的响应数据,包含状态码、结果和日志.
input_params参数,支持创建/查询/导出操作用config_options参数进行配置.
处理: 解析参数配置与调用的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回参数配置与调用的响应数据,包含状态码、结果和日志.
config_options参数,支持修改/重置/导入操作
能力覆盖范围:本skill的核心能力覆盖以下场景关键词:企业级、管理平台、支持多集群、监控告警与、自动化、面向企业运维团队、全功能管理平台、支持多集群统一管、自动化与、完整管理、Use、when、需要系统监控、日志分析、运维告警、部署管理时使用、不适用于物理硬件、适用于独立开发者、企业团队和自动化、工作流场景等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.用户输入:"查看所有集群的状态"
# 多集群状态概览
python3 (请参考skill目录中的脚本文件) clusters status --all
# ...
# 输出:
# === 集群状态总览 ===
# prod-cluster 5节点 120Pods CPU:35% MEM:45% [健康]
# staging-cluster 3节点 60Pods CPU:20% MEM:30% [健康]
# dev-cluster 2节点 30Pods CPU:15% MEM:25% [健康]
# ...
# 跨集群资源对比
python3 (请参考skill目录中的脚本文件) clusters compare --resource deployments
用户输入:"确保所有Pod都设置了资源限制"
# 创建策略
python3 (请参考skill目录中的脚本文件) policy create \
--name "require-resource-limits" \
--engine "kyverno" \
--rule "所有Pod必须设置resources.limits" \
--enforce
# ...
# 检查合规性
python3 (请参考skill目录中的脚本文件) policy check --cluster production
# ...
# 输出不合规资源列表
用户输入:"通过GitOps部署应用"
# 配置GitOps
python3 (请参考skill目录中的脚本文件) gitops setup \
--engine "argocd" \
--repo "https://git.example.com/k8s-manifests" \
--cluster production
# ...
# 同步部署
python3 (请参考skill目录中的脚本文件) gitops sync --app my-app
# ...
# 查看同步状态
python3 (请参考skill目录中的脚本文件) gitops status --all
# 依赖说明
pip install -r requirements_pro.txt
# ...
# 配置多集群
cp config_pro_template.yaml config_pro.yaml
# 多集群管理
python3 (请参考skill目录中的脚本文件) clusters list
python3 (请参考skill目录中的脚本文件) clusters status --all
python3 (请参考skill目录中的脚本文件) clusters deploy --template web-app --clusters "prod,staging"
# ...
# 策略治理
python3 (请参考skill目录中的脚本文件) policy create --name "require-limits" --engine kyverno --enforce
python3 (请参考skill目录中的脚本文件) policy check --cluster production
# ...
# GitOps
python3 (请参考skill目录中的脚本文件) gitops setup --engine argocd --repo "https://git.example.com/manifests"
python3 (请参考skill目录中的脚本文件) gitops sync --app my-app
# ...
# 监控
python3 (请参考skill目录中的脚本文件) monitor watch --cluster production
python3 (请参考skill目录中的脚本文件) monitor alerts --cluster production
# ...
# CRD管理
python3 (请参考skill目录中的脚本文件) crd list
python3 (请参考skill目录中的脚本文件) crd install --definition ./crd.yaml
响应解析: 完成完成后,查看输出响应确认任务状态。成功时输出包含解析摘要和响应数据;失败时根据错误信息排查问题,查阅错误解析章节获取恢复步骤.
pro_config:
clusters:
- name: "production"
kubeconfig: "$HOME/.kube/config-prod"
cloud: "aws"
region: "us-east-1"
- name: "staging"
kube/config-staging"
cloud: "azure"
region: "eastus"
- name: "development"
cloud: "on-premise"
# ...
policy:
engine: "kyverno" # kyverno | opa
policies:
- require_resource_limits
- disallow_latest_tag
- require_namespace_labels
- restrict_ingress
enforce: true # 强制模式
# ...
monitoring:
enabled: true
metrics_server: true
prometheus: true
grafana: true
alerts:
channels: ["webhook", "email"]
rules:
- pod_restart_count > 5
- node_cpu > 80%
- pvc_usage > 85%
# ...
gitops:
engine: "argocd" # argocd | flux
repo: "https://git.example.com/k8s-manifests"
auto_sync: true
auto_prune: true
self_heal: true
# ...
agents:
mode: "intelligent" # intelligent | fixed
max_agents: 20
scheduling: "balanced" # balanced | performance | cost
# ...
optimization:
resource_optimization: true
cost_analysis: true
right_sizing: true # 资源规格优化
# ...
disaster_recovery:
enabled: true
backup_schedule: "0 2 * * *"
cross_cluster: true
velero: true
| 实践领域 | 建议做法 |
|---|---|
| 多集群 | 统一配置基线,差异化环境策略 |
| 策略治理 | 先warn模式测试,再enforce强制 |
| GitOps | 所有变更通过Git提交,避免直接kubectl |
| 监控 | 关键指标设置告警,及时响应 |
| 灾备 | 定期演练灾备恢复流程 |
免费版命令 → PRO版命令(增强):
k8s.py deploy → k8s_pro.py clusters deploy --clusters "prod,staging"
k8s.py list → k8s_pro.py clusters compare
单集群管理 → 多集群统一+策略治理+GitOps
PRO版支持最多20个集群的统一管理。支持跨云(AWS/Azure/GCP)和混合云(含本地集群).
Kyverno是K8s原生策略引擎,语法更简洁、易学;OPA Gatekeeper功能更强大、通用性好。建议K8s专属场景用Kyverno,需要跨平台策略用OPA.
所有K8s配置(YAML清单)存储在Git仓库中,ArgoCD/Flux自动同步Git仓库与集群状态。任何变更通过Git提交,自动部署到集群。实现声明式、可审计的部署流程.
PRO版根据集群负载、资源可用性和任务优先级,自动将管理任务分配给最合适的Agent。相比免费版的固定分配,提高资源利用率和响应速度.
通过Velero备份集群资源和持久卷到对象存储(S3/Azure Blob)。支持跨集群恢复,实现灾备切换。备份策略可配置(每日/每周).
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
| Python | 运行时 | 必需 | 系统安装或conda环境 |
| kubernetes | Python库 | 必需 | pip install kubernetes |
| PyYAML | Python库 | 必需 | pip install pyyaml |
| requests | Python库 | 可选 | pip install requests(API调用) |
| argocd | CLI工具 | 可选 | GitOps引擎 |
| 服务 | 环境变量 | 是否必需 | 用途 |
|---|---|---|---|
| ArgoCD | ARGOCD_TOKEN | 可选 | GitOps集成 |
| Prometheus | PROMETHEUS_URL | 可选 | 监控集成 |
| Grafana | GRAFANA_API_KEY | 可选 | 仪表盘集成 |
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 | 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案 |
| 风险类型 | 防范措施 |
|---|---|
| API密钥泄露 | 通过环境变量配置,禁止硬编码到代码或配置文件中 |
| 命令执行风险 | 仅执行白名单命令,避免拼接用户输入到命令行参数中 |
| 网络通信安全 | 使用HTTPS协议,验证SSL证书有效性 |
| 敏感数据暴露 | 输出结果中不包含密钥、令牌等敏感信息 |
使用前请确认已阅读依赖说明章节,确保运行环境满足安全要求。