Qwen 3.8 27B YaRN 768K 上下文实测
AI
Tech

有人建议测一下开启 YaRN 扩展上下文后的表现,说 Qwen 3.8 27B 可以扩展到 1M 上下文。

我试了一下,Qwen 3.8 27B 通过 YaRN 技术最多可以把上下文从原版 265K 增加到 768K。

1M 上下文主要是 KV Cache 就需要 84GB 显存,差 3GB 显存😂

在这台 128GB 机器上的具体测试结果:

  • 1M:启动失败,KV Cache 需要约 83.68 GiB,可分配约 80.32 GiB
  • 768K:可启动,KV 容量约 882K token,max_model_len=786432
  • 512K:可启动,10 万 token 请求成功
  • 接近上限时 TTFT 极长,760K/500K 测试未在测试窗口内产生首 token

当前统一内存约使用 107.5/125.8 GB,可用约 17 GB,因此这台 128GB 机器目前实用上限是 768K,不是 1M。

我一会试一下这个 768K 上下文的时候,在日常的编程中能不能打,不能光看参数,我要去实战压测一下😎

Qwen 3.8 27B YaRN 768K 上下文测试结果