海光 DCU 长上下文 Attention:从 page784 到 page832
摘要在大模型推理中,Attention 的公式通常不是最难的部分,真正决定性能的往往是数据如何落在显存里,以及硬件一次能够以什么粒度把这些数据取出来。 本文以 Qwen3.5 的官方 prefix-off 长上下文路径为例,讨论一个看似很小、实际上贯穿 vLLM 配置、KV Cache、paged attention 和 DCU kernel dispatch 的问题:该路径的默认物理 KV Cache page 是 784 tokens,而海光 DCU gfx936 上的 vendor paged-attention 路径要求 page 长度满足 64-token 对齐。最终我们没有把...


