Skip to content

21:07 N G 90 K8s运维工程师 职位详情 岗位职责 负责混合云环境下Kubernetes集群和云资源的日常运维,包括集群巡检、扩容,升级、资源治理,故障排查和稳定性保障。 负责算力平台的运行环境保障,支持大量Agent任务在CPU/内存型资源池中稳定运行,处理任务调度、资源不足、容器异常、网络异常、存储异常等问题。 建设和维护监控、告警,日志和可观测体系,基于 Prometheus、Grafana、Alertmanager、Loki/ ELK等工具提升问题发现、定位和复盘能力。 推进运维自动化和平台化建设,包括自动巡检、批量变更、资源回收、弹性伸缩、成本统计、故障自愈、标准化Runbook等。 熟练使用Claude Code,Codex等Al Agent工具辅助完成运维脚本开发、配置生成、故障分析、代码 Review,文档沉淀和自动化工具建设,同时建立安全,可控,可审计的AI辅助运维流程.

任职要求

熟悉Linux系统和常见运维排障方法,能够独立分析 CPU,内存、磁盘、网络、进程、文件系统、 DNS、证书、权限等常见问题。 熟悉Kubernetes基础对象和运维场景,理解 Pod,Deployment,StatefulSet,DaemonSet, Service、Ingress、ConfigMap、Secret、PV / PVC、Namespace、RBAC等核心概念。 具备Kubernetes故障排查能力,能够处理Pod Pending、CrashLoopBackOff、 ImagePullBackOff,OOMKilled、节点NotReady、 Service不通、CoreDNS异常、镜像拉取失败等问题。 熟悉至少一种公有云或私有云环境,了解云主机、 VPC、子网、安全组、负载均衡、云盘、对象存储、弹性伸缩等基础云产品。 能够使用Shell/Python/Go中至少一种语言编写自动化脚本,并愿意熟练使用Claude Code,Codex等Al Agent工具提升运维开发、排障分析和文档产出效率。

加分项 有混合云、多集群、多租户Kubernetes平台运维经验。 有Al Agent平台、任务调度平台、DevOps平台、 SRE 平台或大规模自动化执行平台运维经验。