QuanZhou's Wiki
“We offer no explanation as to why these architectures seem to work; we attribute their success, as all else, to divine benevolence.”
“对于为什么架构似乎行之有效,我们不做任何说明;与世间万事一样,我们将它们的成功归功于神的眷顾。”
我是周权,就读于中国科学技术大学软件学院,研究生二年级。对底层技术痴迷,喜爱研究 Linux (Arch 用户),熟悉 C/C++ 语言,目前在国内某大厂实习,工作内容是分布式存储。
currently exploring: kernels · storage · AI infra
↗ github.com/Qizi706个人状态
明日学习
2026.08.18 · 150 minM1 · Batch Size 曲线与吞吐拐点进行中
目标:固定 T=128,扫描 B∈{1,2,4,8},判断总吞吐是否继续增长、单 Sequence 成本怎样变化,以及当前 CPU/NumPy 路径是否已经出现收益收窄。
- question
- Batch 增大时,吞吐与单请求完成时间为什么可能同时上升?
- prediction
- Positions/s 先提高但不会线性增长;Wall Time 随 B 增大。
- artifact
- 正确性测试、原始 CSV、P50/P95 汇总表和一段结果解释。
- gate
- 所有 B 通过 Oracle;能区分总吞吐、Batch Wall Time 与每 Sequence 成本。
- 20 min:写下预测,确认当前测试通过,冻结维度、dtype、Seed 和 BLAS 线程。
- 50 min:让 Benchmark 支持 B 扫描,为每个 Sequence 对照独立 Oracle。
- 40 min:每个 B 做 3 次 Warm-up、30 次计时,并随机化 B 的运行顺序。
- 40 min:汇总 Wall Time、Wall Time/B、Positions/s、P50/P95,回写实验文章。
下一步判断:若曲线与正确性门禁通过,进入 M2 MHA/GQA;若没有出现拐点,记录Not reached,不要继续盲目增大 B。若 Oracle 失败,停止计时并先修复状态隔离。
最近写作
生活中会遇到各种各样的问题,教会我正确解法(做法)的人很多,因为他们做过,那么遇到从未遇到过的问题该怎么解答?从算法解题、投机解码、NP 问题和实践论出发,思考候选答案是如何被提出、验证并不断更正的。
- 答案是如何被找到的:猜想、验证与更正(随笔 · 有感而写)
