海光 DCU Profile 实战:如何从六万个 GPU kernel 还原一枚 Token
开场在海光 DCU 上给大模型做 profile,最难的通常不是“能不能生成 trace”,而是 trace 生成以后该怎么看。 一次 Qwen3.5-27B BF16 本地采样共产生: 1234总事件: 235,964GPU 事件: 61,804kernel 事件: 60,124GPU event 总时长: 5773.493 ms 直接按 kernel 总耗时排序,只能看到一长串 Tensile、Triton、Attention 和自定义 kernel 名称。它不会主动告诉你: 哪些属于 Prefill; 哪些属于 Decode; 一个 kernel 每 ...


