海光 DCU 上 Qwen3.5 推理性能工程:从 Prefill/Decode 热点到端到端收益
摘要在大模型推理优化中,最容易被误读的一件事,是把某个 kernel 的局部加速比直接当成服务吞吐的提升。一个 kernel 即使在独立测试中快了 1.08 倍,完整服务也可能只快几个百分点,甚至几乎没有变化。 本文以海光 DCU gfx936 路径上的 Qwen3.5-27B BF16 推理为例,使用本地已经完成的 profile、kernel microbench 和同容器端点 A/B 数据,回答三个问题: Prefill 和 Decode 分别被什么算子限制; 为什么 BF16 的 M=1 GEMM/GEMV 会成为 Decode 的主要性能墙; 一...
海光 DCU Profile 实战:如何从六万个 GPU kernel 还原一枚 Token
开场在海光 DCU 上给大模型做 profile,最难的通常不是“能不能生成 trace”,而是 trace 生成以后该怎么看。 一次 Qwen3.5-27B BF16 本地采样共产生: 1234总事件: 235,964GPU 事件: 61,804kernel 事件: 60,124GPU event 总时长: 5773.493 ms 直接按 kernel 总耗时排序,只能看到一长串 Tensile、Triton、Attention 和自定义 kernel 名称。它不会主动告诉你: 哪些属于 Prefill; 哪些属于 Decode; 一个 kernel 每 ...


