Compare MTP steps and prefill batches; retain qualified MTP 2 baseline
This commit is contained in:
@@ -0,0 +1,24 @@
|
||||
# HELP vllm:spec_decode_num_drafts_total Number of spec decoding drafts.
|
||||
# TYPE vllm:spec_decode_num_drafts_total counter
|
||||
vllm:spec_decode_num_drafts_total{engine="0",model_name="qwen3.8-flash-next"} 13297.0
|
||||
# HELP vllm:spec_decode_num_drafts_created Number of spec decoding drafts.
|
||||
# TYPE vllm:spec_decode_num_drafts_created gauge
|
||||
vllm:spec_decode_num_drafts_created{engine="0",model_name="qwen3.8-flash-next"} 1.7897433982360141e+09
|
||||
# HELP vllm:spec_decode_num_draft_tokens_total Number of draft tokens.
|
||||
# TYPE vllm:spec_decode_num_draft_tokens_total counter
|
||||
vllm:spec_decode_num_draft_tokens_total{engine="0",model_name="qwen3.8-flash-next"} 13297.0
|
||||
# HELP vllm:spec_decode_num_draft_tokens_created Number of draft tokens.
|
||||
# TYPE vllm:spec_decode_num_draft_tokens_created gauge
|
||||
vllm:spec_decode_num_draft_tokens_created{engine="0",model_name="qwen3.8-flash-next"} 1.7897433982360315e+09
|
||||
# HELP vllm:spec_decode_num_accepted_tokens_total Number of accepted tokens.
|
||||
# TYPE vllm:spec_decode_num_accepted_tokens_total counter
|
||||
vllm:spec_decode_num_accepted_tokens_total{engine="0",model_name="qwen3.8-flash-next"} 10374.0
|
||||
# HELP vllm:spec_decode_num_accepted_tokens_created Number of accepted tokens.
|
||||
# TYPE vllm:spec_decode_num_accepted_tokens_created gauge
|
||||
vllm:spec_decode_num_accepted_tokens_created{engine="0",model_name="qwen3.8-flash-next"} 1.789743398236043e+09
|
||||
# HELP vllm:spec_decode_num_accepted_tokens_per_pos_total Accepted tokens per draft position.
|
||||
# TYPE vllm:spec_decode_num_accepted_tokens_per_pos_total counter
|
||||
vllm:spec_decode_num_accepted_tokens_per_pos_total{engine="0",model_name="qwen3.8-flash-next",position="0"} 10374.0
|
||||
# HELP vllm:spec_decode_num_accepted_tokens_per_pos_created Accepted tokens per draft position.
|
||||
# TYPE vllm:spec_decode_num_accepted_tokens_per_pos_created gauge
|
||||
vllm:spec_decode_num_accepted_tokens_per_pos_created{engine="0",model_name="qwen3.8-flash-next",position="0"} 1.7897433982360573e+09
|
||||
Reference in New Issue
Block a user