有人建议测一下开启 YaRN 扩展上下文后的表现,说 Qwen 3.8 27B 可以扩展到 1M 上下文。
我试了一下,Qwen 3.8 27B 通过 YaRN 技术最多可以把上下文从原版 265K 增加到 768K。
1M 上下文主要是 KV Cache 就需要 84GB 显存,差 3GB 显存😂
在这台 128GB 机器上的具体测试结果:
- 1M:启动失败,KV Cache 需要约 83.68 GiB,可分配约 80.32 GiB
- 768K:可启动,KV 容量约 882K token,max_model_len=786432
- 512K:可启动,10 万 token 请求成功
- 接近上限时 TTFT 极长,760K/500K 测试未在测试窗口内产生首 token
当前统一内存约使用 107.5/125.8 GB,可用约 17 GB,因此这台 128GB 机器目前实用上限是 768K,不是 1M。
我一会试一下这个 768K 上下文的时候,在日常的编程中能不能打,不能光看参数,我要去实战压测一下😎
