== GGUF llama.cpp (Q5+MTP, --parallel 8) (qwen3.8-27b-parallel) warmup... N=1 agg= 136.0 tok/s per-req=136.0 tok/s p50= 5.62s p95= 5.62s (764 tok/5.62s) N=2 agg= 184.8 tok/s per-req= 92.8 tok/s p50= 7.57s p95= 7.57s (1398 tok/7.57s) N=4 agg= 319.8 tok/s per-req= 89.3 tok/s p50= 8.49s p95= 8.7s (2784 tok/8.71s) N=8 agg= 429.2 tok/s per-req= 60.8 tok/s p50=10.88s p95=12.47s (5352 tok/12.47s) JSON {"label": "GGUF llama.cpp (Q5+MTP, --parallel 8)", "model": "qwen3.8-27b-parallel", "rows": [{"n": 1, "wall_s": 5.62, "total_tok": 764, "agg_tok_s": 136.0, "per_req_tok_s": 136.0, "p50_lat_s": 5.62, "p95_lat_s": 5.62}, {"n": 2, "wall_s": 7.57, "total_tok": 1398, "agg_tok_s": 184.8, "per_req_tok_s": 92.8, "p50_lat_s": 7.57, "p95_lat_s": 7.57}, {"n": 4, "wall_s": 8.71, "total_tok": 2784, "agg_tok_s": 319.8, "per_req_tok_s": 89.3, "p50_lat_s": 8.49, "p95_lat_s": 8.7}, {"n": 8, "wall_s": 12.47, "total_tok": 5352, "agg_tok_s": 429.2, "per_req_tok_s": 60.8, "p50_lat_s": 10.88, "p95_lat_s": 12.47}]}