Qwen 3.8 27B YaRN 768K 上下文实测
「
AI
Tech
」

有人建议测一下开启 YaRN 扩展上下文后的表现,说 Qwen 3.8 27B 可以扩展到 1M 上下文。

我试了一下,Qwen 3.8 27B 通过 YaRN 技术最多可以把上下文从原版 265K 增加到 768K。

1M 上下文主要是 KV Cache 就需要 84GB 显存,差 3GB 显存😂

在这台 128GB 机器上的具体测试结果:

  • 1M:启动失败,KV Cache 需要约 83.68 GiB,可分配约 80.32 GiB
  • 768K:可启动,KV 容量约 882K token,max_model_len=786432
  • 512K:可启动,10 万 token 请求成功
  • 接近上限时 TTFT 极长,760K/500K 测试未在测试窗口内产生首 token

当前统一内存约使用 107.5/125.8 GB,可用约 17 GB,因此这台 128GB 机器目前实用上限是 768K,不是 1M。

我一会试一下这个 768K 上下文的时候,在日常的编程中能不能打,不能光看参数,我要去实战压测一下😎

Qwen 3.8 27B YaRN 768K 上下文测试结果