阶段 1 · LLM Serving 请求链路与可复现基线
Lab 路线
- 基础P1-L0 · 区分模型、推理与 Serving(Passed)P1-L1 · 追踪一条请求的完整生命周期(Passed)
- 运行P1-L2 · 启动本地推理服务并冻结环境(Passed)
- 测量P1-L3 · 建立可信的测量契约(Passed)P1-L4 · 执行 Input / Output Length Scan(Passed)
- 交付P1-F · Phase 1 Checkoff(Passed)
材料与证据
- 机制:LLM 推理请求生命周期说明 API、Tokenizer、Scheduler、Prefill、KV Cache、Decode 与 Streaming。
- 实验:本地 LLM 推理服务实验记录环境、长度实验、失败与指标边界。
- 复现:Phase 1 公开文件保存脚本、日志、响应和原始长度扫描数据。
Checkoff
- 能够闭卷画出请求链路,独立启动服务、复跑长度扫描,并用环境、负载、指标和原始证据限定结论。
- 闭卷画出请求链路,标出 Prefill、Decode 与 KV Cache;从干净终端启动服务并复跑一个长度扫描点。
- 能够解释 Warmup、重复次数、计时边界和近似 TPOT 的限制,并列出尚未验证的并发与尾延迟结论。
- 下一步:进入 Phase 2 · 推理机制与性能工程。