极限优化 Qwen 3.8 27B 的性能
AI

上一篇文章《vLLM PK Ninfer, 到底谁的速度更快?》里说”等我再压榨压榨,把 Qwen 3.8 27B 的速度整到极限”。现在迷上了 AI 模型调优,今天就把 Qwen 3.8 27B 压榨到了极限:

  • Fresh Code 解码速度提升到 65.88 TPS
  • 重度代码编辑解码提升到 123 TPS
  • Prefill 提升到 3176 TPS
  • TTFT 降低到 0.1 秒

两组配置对比数据

下面是两组配置(124 和 104)的真实端到端吞吐对比,均包含 TTFT,五项中位数也全部由 124 领先:

工作负载 124 104 124 领先
新代码,单流 1024 token 65.88 tok/s 64.19 tok/s +2.64%
重度代码编辑,单流 1024 token 122.90 tok/s 96.19 tok/s +27.77%
中文解释,单流 512 token 33.22 tok/s 32.05 tok/s +3.65%
8 路并发,每路 512 token 296.89 tok/s 180.37 tok/s +64.60%
5K prefill 3176.10 tok/s 2127.73 tok/s +49.27%

TTFT 同样明显改善:

项目 124 104 降低
新代码 0.103 s 0.365 s 71.84%
重度编辑 0.842 s 2.062 s 59.19%
中文解释 0.102 s 0.430 s 76.29%
8 路并发 makespan 13.80 s 22.72 s 39.27%
5K prefill 1.582 s 2.361 s 33.01%

Qwen 3.8 27B 两组配置性能对比

结语

太爽了,错过算力舱就错过了世界上性能最快的 Qwen 3.8 27B。

原推