上一篇文章《vLLM PK Ninfer, 到底谁的速度更快?》里说”等我再压榨压榨,把 Qwen 3.8 27B 的速度整到极限”。现在迷上了 AI 模型调优,今天就把 Qwen 3.8 27B 压榨到了极限:
- Fresh Code 解码速度提升到 65.88 TPS
- 重度代码编辑解码提升到 123 TPS
- Prefill 提升到 3176 TPS
- TTFT 降低到 0.1 秒
两组配置对比数据
下面是两组配置(124 和 104)的真实端到端吞吐对比,均包含 TTFT,五项中位数也全部由 124 领先:
| 工作负载 | 124 | 104 | 124 领先 |
|---|---|---|---|
| 新代码,单流 1024 token | 65.88 tok/s | 64.19 tok/s | +2.64% |
| 重度代码编辑,单流 1024 token | 122.90 tok/s | 96.19 tok/s | +27.77% |
| 中文解释,单流 512 token | 33.22 tok/s | 32.05 tok/s | +3.65% |
| 8 路并发,每路 512 token | 296.89 tok/s | 180.37 tok/s | +64.60% |
| 5K prefill | 3176.10 tok/s | 2127.73 tok/s | +49.27% |
TTFT 同样明显改善:
| 项目 | 124 | 104 | 降低 |
|---|---|---|---|
| 新代码 | 0.103 s | 0.365 s | 71.84% |
| 重度编辑 | 0.842 s | 2.062 s | 59.19% |
| 中文解释 | 0.102 s | 0.430 s | 76.29% |
| 8 路并发 makespan | 13.80 s | 22.72 s | 39.27% |
| 5K prefill | 1.582 s | 2.361 s | 33.01% |
结语
太爽了,错过算力舱就错过了世界上性能最快的 Qwen 3.8 27B。
