QuanZhou's Wiki

阶段 1 · LLM Serving 请求链路与可复现基线

  • 目标:从模型调用到可测量的服务
  • 时间:2026.07.27 — 2026.08.11;状态:Passed
  • 先观察一个真实的单机推理服务,建立请求链路、阶段划分、指标口径和实验边界,再进入机制实现。
  • 实验路线 | 复现说明 | 证据包 | Phase 2

Lab 路线

材料与证据

Checkoff

  • 能够闭卷画出请求链路,独立启动服务、复跑长度扫描,并用环境、负载、指标和原始证据限定结论。
  • 闭卷画出请求链路,标出 Prefill、Decode 与 KV Cache;从干净终端启动服务并复跑一个长度扫描点。
  • 能够解释 Warmup、重复次数、计时边界和近似 TPOT 的限制,并列出尚未验证的并发与尾延迟结论。
  • 下一步:进入 Phase 2 · 推理机制与性能工程。