算力舱AI模型适配实录
AI
Tech

算力舱AI模型适配实录:

DeepSeek V4 Flash

通过两台协同计算的方式,一台计算一半最终对结果,实现稳定 70 TPS 的效果,顺带把上下文从 131K 拉到了 382K。主打日常 Agent 全能。

Qwen 3.8 27B

稠密计算模型小钢炮,通过 DFlash2 优化,最终实现单流 125 ~ 133 TPS、8 并发 231 TPS 的效果。虽然 27B 稠密模型计算非常耗费性能,但是显存消耗不多,可以做大量 KV Cache。最终通过 YaRN 技术把上下文从官方的 265K 拉到恐怖的 900K,代码智力爆表 + 超大上下文。主打离线代码 GPT。

Qwen 3.8 Flash Next

相对于社区两台方案,昨晚实现单台就可以稳定跑。昨晚首先测试了 n-gram 的方案,虽然 decode 速度最高可以到 92 TPS,但发现这个方案纯粹是噱头——只有抄重复代码的时候快,Prefill 只有 100 多,而且上下文太小只有 64K。最后还是换传统的 MTP 方案,现在日常解码稳定在 60 TPS,Prefill 2232 TPS,上下文也增大了 265K,这样的数据更适合日常写代码。

看看我晚上能优化到什么水平?

等 Qwen 3.8 Flash Next 优化完,我准备继续挑战两台 GLM 5.3 Flash。大佬们你们想要我移植什么 AI 模型?评论区留下你的建议 😎