QuanZhou's Wiki

QuanZhou's Wiki

“We offer no explanation as to why these architectures seem to work; we attribute their success, as all else, to divine benevolence.”

“对于为什么架构似乎行之有效,我们不做任何说明;与世间万事一样,我们将它们的成功归功于神的眷顾。”

我是周权,就读于中国科学技术大学软件学院,研究生二年级。对底层技术痴迷,喜爱研究 Linux (Arch 用户),熟悉 C/C++ 语言,目前在国内某大厂实习,工作内容是分布式存储。

currently exploring: kernels · storage · AI infra
↗ github.com/Qizi706

个人状态

明日学习

2026.08.18 · 150 minM1 · Batch Size 曲线与吞吐拐点进行中

目标:固定 T=128,扫描 B∈{1,2,4,8},判断总吞吐是否继续增长、单 Sequence 成本怎样变化,以及当前 CPU/NumPy 路径是否已经出现收益收窄。

question
Batch 增大时,吞吐与单请求完成时间为什么可能同时上升?
prediction
Positions/s 先提高但不会线性增长;Wall Time 随 B 增大。
artifact
正确性测试、原始 CSV、P50/P95 汇总表和一段结果解释。
gate
所有 B 通过 Oracle;能区分总吞吐、Batch Wall Time 与每 Sequence 成本。
  1. 20 min:写下预测,确认当前测试通过,冻结维度、dtype、Seed 和 BLAS 线程。
  2. 50 min:让 Benchmark 支持 B 扫描,为每个 Sequence 对照独立 Oracle。
  3. 40 min:每个 B 做 3 次 Warm-up、30 次计时,并随机化 B 的运行顺序。
  4. 40 min:汇总 Wall Time、Wall Time/B、Positions/s、P50/P95,回写实验文章。

下一步判断:若曲线与正确性门禁通过,进入 M2 MHA/GQA;若没有出现拐点,记录Not reached,不要继续盲目增大 B。若 Oracle 失败,停止计时并先修复状态隔离。

文章存档