Storforge
L5 · 测试 · 可观测 · 调优

工程化收官

能跑通 demo 和敢上生产之间隔着一整个工程体系。用确定性模拟测试逼出并发 bug,把 metrics/tracing 织进系统,最后做一轮真正的性能调优。

本阶段出口:forge 1.0:CI 全绿、Grafana 大盘、调优报告,以及一份写给下一个学习者的复盘。
4 节课 · 约 3 小时已完成 0/4
  1. 1

    确定性模拟与故障注入

    编码55m

    分布式 bug 的死穴是「复现不了」。用 madsim 风格的确定性模拟把时间、网络、磁盘全部虚拟化,同一个种子必定复现同一个 bug。

    • 解释确定性模拟为什么能复现并发 bug
    • 给 forge 接上模拟运行时并写一个故障注入场景
    • 用随机种子扫描找出一个真实 bug
  2. 2

    可观测性:给自己的系统装仪表盘

    编码45m

    你运维时抱怨过的「这系统什么都看不见」,现在轮到你来还债:prometheus 指标、tracing 链路、慢 IO 日志,一次配齐。

    • 设计 forge 的指标体系:USE + RED 两套视角
    • 接入 tracing,一条写请求全链路可见
    • 搭出 Grafana 大盘与三条告警规则
  3. 3

    性能调优实战

    编码55m

    带着 flamegraph 和 perf 做一轮完整调优:找热点、改一处、量化收益、防止回退 —— 目标是把 L4 验收时的性能再抬 30%。

    • 用 perf / flamegraph 定位 CPU 与延迟热点
    • 完成三处有数据支撑的优化
    • 建立性能回归测试防止优化被吃掉
  4. 4

    收官:复盘与下一步

    里程碑40m

    六个阶段走完,盘点你造出的系统和长出的能力;对照 Weka/Ceph/GPFS 的真实差距,规划三条继续深入的路。

    • 完成 forge 1.0 的全量验收清单
    • 写出技术复盘:最难的三个 bug 与最值的三个决策
    • 选定下一步方向:贡献开源存储 / 深入内核 / 造轮子 2.0