海光 DCU 上 Qwen3.5 推理性能工程:从 Prefill/Decode 热点到端到端收益
摘要在大模型推理优化中,最容易被误读的一件事,是把某个 kernel 的局部加速比直接当成服务吞吐的提升。一个 kernel 即使在独立测试中快了 1.08 倍,完整服务也可能只快几个百分点,甚至几乎没有变化。 本文以海光 DCU gfx936 路径上的 Qwen3.5-27B BF16 推理为例,使用本地已经完成的 profile、kernel microbench 和同容器端点 A/B 数据,回答三个问题: Prefill 和 Decode 分别被什么算子限制; 为什么 BF16 的 M=1 GEMM/GEMV 会成为 Decode 的主要性能墙; 一...


