QuanZhou's Wiki
更新于

Systems & AI Infrastructure


技术方向

以系统软件与数据基础设施为主线:已在 xv6 与 BusTub 中完成虚拟内存、文件系统、缓冲池、并发索引、查询执行与 MVCC 等核心模块;当前将这些系统能力迁移到单机 LLM Serving,聚焦请求链路、KV Cache、调度与性能工程。

focus
AI Infrastructure / Systems
foundation
OS · Storage Engine · Concurrency
working set
C · C++ · Python · RISC-V · Linux
method
implement → benchmark → source trace → write

系统项目

MIT 6.S081

RISC-V · xv6 · C · Linux

2026.02 — 2026.04 · 独立完成

基于 RISC-V / xv6 扩展内存、进程、Trap 与文件系统路径,重点验证虚拟内存、异常处理和持久化语义。

  • 实现独立内核页表与用户页表映射机制,掌握 trampoline、trapframe 与页表切换流程。
  • 基于 page fault 实现 lazy allocation 与 copy-on-write fork,维护物理页引用计数。
  • 扩展 trap 与 syscall 机制,实现 alarm 系统调用和用户态定时回调。
  • 实现非抢占式用户级线程库,支持线程创建、上下文保存/恢复与协作式调度。
  • 扩展 xv6 文件系统,支持二级间接索引、软链接、mmap/munmap 与按需映射回写。

CMU 15-445

BusTub · C++ · Linux

2025.11 — 2025.12 · 独立完成

围绕单机数据库内核完成存储、索引、执行、优化与事务链路,实现可并发访问的 BusTub 核心模块。

  • 实现线程安全的 BufferPoolManager,维护 page/frame 映射、pin count、dirty flag 与换入换出。
  • 实现 LRU-K 页面替换器,并与 Buffer Pool 的 evictable 状态协同工作。
  • 实现支持并发访问的 B+Tree 索引、节点 split/merge/redistribution 与有序迭代器。
  • 基于 Volcano Iterator 模型实现 Scan、Join、Aggregation、Sort、Limit、Distinct 等算子。
  • 实现规则优化器,将 SeqScan 改写为 IndexScan,将 NestedLoopJoin 改写为 HashJoin。
  • 基于版本链和 undo log 实现 MVCC,支持快照隔离下的并发读写。

AI Infra 学习路线

完整实验路线已经从 About 独立出来,统一按“Prerequisite → Question → Work → Artifact → Checkoff → Unlocks”组织。这里仅保留状态摘要,避免出现第二份路线图。

  • 阶段 1:LLM Serving 请求链路与可复现基线

    状态:已通过 · 学习周期:2026.07.27 — 2026.08.11

    先观察一个真实的单机推理服务,建立请求链路、阶段划分、指标口径和实验边界,再进入机制实现。

    P1-L0 → P1-L1 → P1-L2 → P1-L3 → P1-L4 → P1-F

    查看阶段 1 路线与证据 →
  • 阶段 2:推理机制、调度与 vLLM 性能工程

    状态:进行中 · 学习周期:2026.08.12 — 2026.09.12

    先在 NumPy 中建立可证明正确的 Attention/KV Cache Oracle,再把同一组问题迁移到真实 vLLM 的容量、调度、吞吐和延迟实验。

    P0 → M0 → M1 → M2 → S0 → S1 → S2 → S3 → S4 → F0

    当前:M2-C · Cached MHA

    继续当前 Lab →
打开完整 AI Infra 实验路线 →

学习与 AI 协作原则

不回避 AI,不外包判断。独立编程用于维护建模、实现、调试与解释能力;AI 用于扩大代码库探索、验证和工程交付效率。最终结论只由代码、测试、测量与可复现证据确认。

  • M0 · 独立模式

    用于核心机制、第一轮调试与最终解释;AI 不介入问题求解。

    负责:系统模型、约束与实现

  • M1 · 教练模式

    用于源码导航、概念澄清与反例生成;AI 提问和 Review,不直接接管结论。

    负责:源码追踪、假设与权衡

  • M2 · Agent 模式

    用于脚手架、测试、数据处理与重构;AI 在明确契约和验收标准内执行。

    负责:范围、验收与最终修改

before delegation

  • 定义 Question、Prediction 与 Invariant。
  • 限定 Action 与 Allowed AI Help。
  • 指定 Artifact 与 Acceptance。

after delivery

  • 审阅完整 Diff,运行测试并复现实验。
  • 脱离对话解释关键路径,独立修改一个约束。
  • 记录 Feedback、Reflection 与下一项决策。
question -> prediction -> minimum reading
  -> implementation -> test / benchmark
  -> explanation -> review -> correction

验收标准:能够在不查看 AI 对话的情况下解释机制、复现实验并修改约束;否则只视为完成交付,不视为掌握。