如题,我想知道int4 kvcache是如何做高效反量化的,做了kv cache的重排吗,还是先ldsm后做warp内的shuffle
如题,我想知道int4 kvcache是如何做高效反量化的,做了kv cache的重排吗,还是先ldsm后做warp内的shuffle