vllm.model_executor.models.llama_eagle
¶
Classes:
LlamaDecoderLayer
¶
Bases: LlamaDecoderLayer
Methods:
-
get_quant_config–Use drafter's quantization config instead of verifier's.
Source code in vllm/model_executor/models/llama_eagle.py
get_quant_config(vllm_config)
¶
Use drafter's quantization config instead of verifier's.