RRedSea
PLATFORM · INFRASTRUCTURE

云原生架构升级

从公用云到自建机房的云原生重构,让效能与成本解耦、让系统既"走得快"也"走得稳"。

Role
平台开发组负责人
Period
2024.08 – 2025.12
Domain
云原生 · 基础设施
Scale
35 组后台 / 218 部署工程
01项目概述// OVERVIEW

主导核心系统从公用云向自建机房的迁移与云原生重构,以 K8s 为底座重建基础设施。在保障业务连续性的前提下显著优化硬件成本,并为未来数年的业务弹性扩展预留充足空间——把"效能"与"成本"从强耦合中解耦出来。

02关键挑战// CHALLENGES
C—01

成本与弹性

公用云成本高企、弹性受限,难以支撑公司中长期的增长曲线,需要更自主的基础设施。

C—02

迁移风险

35 组后台项目、200+ 部署工程需在业务无感的状态下平滑迁移,容错空间极小。

C—03

可观测缺失

缺乏统一的日志、告警与发布体系,运维高度依赖人工,故障定位与恢复效率低。

03实践路径// APPROACH
01

基座选型

以 K8s + KubeSphere 完成底层基座选型,经反复实验与验证,形成初版迁移方案,确保落地平稳。

02

需求拆解

带领团队做需求分析,产出方案文档 4 份、组织技术评审 5 次、内部分享 2 次,累计完成 89 个需求/任务。

03

可观测体系

搭建日志/告警中台与 DevOps 流水线,确立"标准化、工具化、容器化"方法论,实现研发无感发布。

04

质量内建

引入自动化测试平台,后端自主冒烟测试使反工率降低 20%、测试效率提升 30%+,质量左移。

04技术栈// STACK
Kubernetes KubeSphere DevOps 流水线 日志 / 告警中台 自动化测试 (MeterSphere) 容器化 多集群高可用
05核心成果// OUTCOMES
99.99%
服务可用性
10x+
资源利用率提升
218
部署工程平稳落地
0
迁移期重大故障

典型场景:某仓储业务原需 12 台 4c16g 服务器部署 12 套项目,迁移至自建 K8s 集群后,12 套项目对应 244 个容器组,CPU 资源占用不足原来的 1/10

← 返回作品列表