阶段 2 · 推理机制、调度与 vLLM 性能工程
- 目标:从最小 Oracle 到真实 Serving 因果链
- 时间:2026.08.12 — 2026.09.12;状态:进行中
- 当前:M2-C · Cached MHA;通过后进入 M2-D · GQA Head 映射
- 实验路线;Phase 1;Phase 2 核心路线
当前任务
- 当前:M2-C · Cached MHA(2026.09.01 · 120 min)
- 任务书 | 工作表 | Starter | 公开文件
- 当前 Checkoff 通过后进入 M2-D;未通过时只修正 M2-C。
核心路线
- 基础P0 · Python / NumPy Buffer 与轴语义(Passed)M0 · 单 Head Attention、KV Cache 与预分配(Passed)
- 机制M1 · Batch Size 曲线与收益收窄(Passed)M2 · 从 Head 轴到 Cached MHA / GQA 容量(Current)
- ServingS0 · 冻结真实 vLLM 环境与可观测性(Locked)S1 · 单并发稳态与显存基线(Locked)S2 · 真实 Serving Input Length Scan(Locked)
- ServingS3 · Client Concurrency 与饱和点(Locked)S4 · Scheduler Budget 单变量对照(Locked)
- 交付F0 · Phase 2 Checkoff 与最终交付(Locked)