昨天晚上部署了一下 Qwen 3.8 27B 到懒猫AI算力舱 X5 上,因为 X5 有 128GB 的显存,所有一台就够了。
这次测试,没有简单的测试 Tokens 数据,在一个真实的项目中跑了 4 个任务。
第二天起来,4 个任务都完成的不错,Qwen 3.8 虽然是一个小模型,但是它的 27B 应该是一个稠密性模型,不像很多 MoE 模型那样运行速度并不快,大概只有 13 ~ 15 Tokens。
早上对 Qwen 3.8 27B 做了 MTP 投机解码 + NVFP8 混合优化,并且关闭了 thinking 模式,速度从 13.9 Tokens 提升到 30.8 Tokens。
我随后调研了一下 Qwen 3.8 27B 这种模型不要关闭思考模式,虽然思考模式会让输出变快,但是关闭后,会降低代码推理的准确度,所以,我又基于前面的优化,开启了思考模式,实测速度可以稳定在 26.47 Tokens,其实思考模式并不会降低 Token 的输出,只是原始思考阶段输出的 Token 没有计算在内,如果把思考阶段和实际产出的 Tokens 一起算的话,最后实际测试的速度可以达到 35.23 Tokens/s。
这次优化后发现 MTP 是用的 NVFP4/FP8,draft 权重用的是 FP16/BF16,这一块还有提升空间,如果重新量化并构建 draft engine,速度应该还会再快,今天先优化到这里,下次再继续跟大家分享。;)
