{ "eval_harness": "training/eagle3-v4flash/vllm_eagle_speedup_eval.py", "modal_app": "https://modal.com/apps/maniac-inc/main/ap-HZ9jkaoFypw9VsClA36wbY", "date": "2026-06-06", "gpu": "B200:4", "vllm_image": "vllm/vllm-openai:v0.22.0", "target": "deepseek-ai/DeepSeek-V4-Flash", "draft_checkpoint": "v4-flash-eagle3.1-genv3-blend", "num_prompts": 8, "max_tokens": 128, "num_speculative_tokens": 3, "baseline_tok_per_s": 15.619405951323843, "spec_tok_per_s": 41.10993617236299, "speedup": 2.6319782135426646, "acceptance_rate": 0.11038394415357766, "mean_accept_len": 1.331151832460733, "prompt_exact_match": 2, "token_match_rate": 0.4462890625, "baseline_self_exact": 1, "baseline_self_token_match_rate": 0.359375, "notes": "Greedy decode (temperature=0, seed=0). Raw prompts without chat template. Spec vs baseline token_match_rate exceeds baseline_self control — EAGLE verify is lossless within cross-run FP8+EP noise. vLLM requires Maniac deepseek_v4 EAGLE-3 overlay patches." }