vllm.v1.worker.gpu.spec_decode.dflash.cudagraph
¶
Classes:
-
DFlashCudaGraphManager–DFlash CudaGraphManager for the parallel-drafting query forward,
DFlashCudaGraphManager
¶
Bases: CudaGraphManager
DFlash CudaGraphManager for the parallel-drafting query forward, building its own attention metadata from scratch.
Methods:
-
capture–precompute_context_kv(num_reqs)is captured ahead of the query
Source code in vllm/v1/worker/gpu/spec_decode/dflash/cudagraph.py
capture(forward_fn, input_buffers, block_tables, attn_groups, kv_cache_config, max_model_len, causal, precompute_context_kv, progress_bar_desc='Capturing CUDA graphs')
¶
precompute_context_kv(num_reqs) is captured ahead of the query
forward.