世界纪录,Qwen 3.8 27B 单台 125 token!
经过昨天一晚上的调优,懒猫 AI 算力仓单台跑 Qwen 3.8 27B 的性能测试结果:prefill 速度 3754 TPS(思考更快),长代码解码速度 125 TPS(写代码更快),八会话代码解码速度 231 TPS(性能压榨到极限),显存占用 70GB。
Qwen 3.8 27B 这种模型,虽然看着很小,但是它是稠密型的模型,它的 27B 是专注于写代码的,我最近都是在本地用它写代码,它的最大的好处就是单台就可以跑,而且永远不降智,我最近 GPT 降智非常严重。
相对于 Mac Studio 优势是,英伟达芯片 prefill 性能高很多,并发能力强很多,兼容 CUDA 生态,而且价格便宜太多了。
