工作地点
远程
岗位类型
全职
部门
运维
办公方式
混合办公
薪资范围
38 万美元 - 46 万美元

职位介绍

你将负责客户交付环境和内部运维平台的稳定运行,通过自动化、监控和故障处理提升服务器资源的可用性与运维效率。

你将负责什么?

这个岗位需要同时关注线上稳定性和交付效率,既能做好日常运维,也能推动工具化和标准化落地。

  • 维护云服务器、裸金属和 GPU 集群的监控、告警、发布与变更流程,及时处理异常。
  • 编写和维护自动化脚本、部署流程与运维工具,减少重复性人工操作。
  • 配合交付团队完成新环境上线、迁移、扩容和配置核验,保障上线质量。
  • 沉淀故障处理预案、巡检标准和运维文档,提升团队响应速度与一致性。

如果你喜欢把复杂环境运行得更稳定、更自动化,这个岗位会让你的技术价值非常直接地体现出来。

岗位职责

你将围绕稳定性、自动化和交付效率展开工作,帮助团队建立可持续运维能力,并降低客户环境故障风险。

你将负责什么?

我们希望你既能快速响应线上问题,也能推动长期性的流程优化和平台建设。

  • 持续优化监控体系、日志采集、告警规则和值班流程,提升问题发现速度。
  • 参与发布变更、版本回滚、容量评估和故障复盘,推动问题闭环解决。
  • 协同售前、交付和基础设施团队,确保上线环境与客户需求、资源配置保持一致。
  • 通过脚本化和标准化改进运维流程,提升团队处理规模化客户环境的能力。

这个岗位是客户体验与平台稳定之间的重要支点,会直接影响交付口碑和服务质量。