vllm.model_executor.layers.fused_moe.experts.xpu_moe
¶
Classes:
-
XPUExpertsWNA16–W4A16 INT4-symmetric MoE backed by
xpu_fused_moe(is_int4=True).
XPUExpertsWNA16
¶
Bases: XPUExperts
W4A16 INT4-symmetric MoE backed by xpu_fused_moe(is_int4=True).
Weight layout when is_int4=True (per xpu_fused_moe docstring):
w13: [num_experts, 2inter_size, hidden_size] contiguous int4-packed
w13_scales: [num_experts, 2inter_size, hidden_size // group_size]
w2: [num_experts, hidden_size, inter_size] contiguous int4-packed
w2_scales: [num_experts, hidden_size, inter_size // group_size]
Pairs with INCXPULinearMethod for the linear layers; together they
cover full-attn + MoE on Intel XPU end-to-end without IPEX.