0.00.195.532 I log_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.195.536 I device_info:
0.00.280.718 I - CUDA0 : NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition (97244 MiB, 96677 MiB free)
0.00.280.731 I - CPU : AMD Ryzen Threadripper 9960X 24-Cores (257066 MiB, 257066 MiB free)
0.00.280.934 I system_info: n_threads = 24 (n_threads_batch = 24) / 48 | CUDA : ARCHS = 1200 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | BLACKWELL_NATIVE_FP4 = 1 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
0.00.281.015 I srv init: using 47 threads for HTTP server
0.00.281.220 I srv start: binding port with default address family
0.00.282.385 I srv llama_server: loading model
0.00.282.429 I srv load_model: loading model '/home/ripper/ornith-35b-lab/artifacts/quant/ornith-1.0-35b-IQ4_XS.gguf'
0.00.564.457 I srv load_model: [spec] estimated memory usage of draft model is 4143.45 MiB
0.00.564.492 I common_init_result: fitting params to device memory ...
0.00.564.493 I common_init_result: (for bugs during this step try to reproduce them with -fit off, or provide --verbose logs if the bug only occurs with -fit on)
0.02.625.379 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.02.641.040 I common_init_from_params: warming up the model with an empty run - please wait ... (--no-warmup to disable)
0.02.676.623 I srv load_model: loading draft model '/home/ripper/ornith-35b-lab/artifacts/mtp/ornith-1.0-35b-mtp-chaincorr-h2r10prefix250-h1r2-h3r8fw-lr5e6-Q6_K.gguf'
0.03.026.787 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.03.038.128 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.03.050.274 W srv operator(): LLAMA_MTP_PER_HEAD_CONTEXT disables prompt cache; per-head MTP state is not prompt-cache serializable yet
0.03.050.279 W srv operator(): LLAMA_MTP_PER_HEAD_CONTEXT disables context checkpoints; per-head MTP state is not checkpoint-serializable yet
0.03.050.279 I srv operator(): [spec] created 2 MTP draft contexts, one per active head
0.03.050.293 I srv load_model: initializing slots, n_slots = 16
0.03.060.810 I common_context_can_seq_rm: the context supports bounded partial sequence removal
0.03.069.268 I common_speculative_impl_draft_mtp: adding speculative implementation 'draft-mtp'
0.03.069.271 I common_speculative_impl_draft_mtp: - n_max=2, n_min=0, p_min=0.00, n_embd=2048, backend_sampling=1
0.03.069.272 I common_speculative_impl_draft_mtp: - gpu_layers=99, cache_k=f16, cache_v=f16, ctx_tgt=yes, ctx_dft=yes, devices=[default]
0.03.069.398 I common_speculative_impl_draft_mtp: - draft sampler top_k=1 top_p=1.000 temp=1.000
0.03.069.424 I common_speculative_impl_draft_mtp: - fast backend MTP sampling enabled
0.03.069.426 I common_speculative_impl_draft_mtp: - per-head MTP contexts enabled (2 active heads)
0.03.069.432 I common_speculative_impl_draft_mtp: - backend draft sampler top_k=1 top_p=1.000 temp=1.000 contexts=2
0.03.091.695 I srv load_model: speculative decoding context initialized
0.03.091.700 I slot load_model: id 0 | task -1 | new slot, n_ctx = 8192
0.03.091.710 I slot load_model: id 1 | task -1 | new slot, n_ctx = 8192
0.03.091.712 I slot load_model: id 2 | task -1 | new slot, n_ctx = 8192
0.03.091.712 I slot load_model: id 3 | task -1 | new slot, n_ctx = 8192
0.03.091.713 I slot load_model: id 4 | task -1 | new slot, n_ctx = 8192
0.03.091.713 I slot load_model: id 5 | task -1 | new slot, n_ctx = 8192
0.03.091.713 I slot load_model: id 6 | task -1 | new slot, n_ctx = 8192
0.03.091.713 I slot load_model: id 7 | task -1 | new slot, n_ctx = 8192
0.03.091.714 I slot load_model: id 8 | task -1 | new slot, n_ctx = 8192
0.03.091.714 I slot load_model: id 9 | task -1 | new slot, n_ctx = 8192
0.03.091.714 I slot load_model: id 10 | task -1 | new slot, n_ctx = 8192
0.03.091.714 I slot load_model: id 11 | task -1 | new slot, n_ctx = 8192
0.03.091.715 I slot load_model: id 12 | task -1 | new slot, n_ctx = 8192
0.03.091.715 I slot load_model: id 13 | task -1 | new slot, n_ctx = 8192
0.03.091.715 I slot load_model: id 14 | task -1 | new slot, n_ctx = 8192
0.03.091.715 I slot load_model: id 15 | task -1 | new slot, n_ctx = 8192
0.03.091.772 I srv load_model: prompt cache is disabled - use `--cache-ram N` to enable it
0.03.091.774 I srv load_model: for more info see https://github.com/ggml-org/llama.cpp/pull/16391
0.03.091.774 I srv load_model: context checkpoints disabled
0.03.091.790 W srv init: --cache-idle-slots requires --cache-ram, disabling
0.03.100.851 I init: chat template, example_format: '<|im_start|>system
You are a helpful assistant<|im_end|>
<|im_start|>user
Hello<|im_end|>
<|im_start|>assistant
Hi there<|im_end|>
<|im_start|>user
How are you?<|im_end|>
<|im_start|>assistant
'
0.03.107.491 I srv init: init: chat template, thinking = 0
0.03.107.534 I srv llama_server: model loaded
0.03.107.538 I srv llama_server: server is listening on http://0.0.0.0:8021
0.03.107.544 I srv update_slots: all slots are idle
0.40.901.218 I srv operator(): Chat format: peg-native
0.40.901.350 I slot get_availabl: id 15 | task -1 | selected slot by LRU, t_last = -1
0.40.901.393 I slot launch_slot_: id 15 | task 0 | processing task, is_child = 0
0.40.901.427 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.902.216 I srv operator(): Chat format: peg-native
0.40.902.849 I srv operator(): Chat format: peg-native
0.40.903.630 I srv operator(): Chat format: peg-native
0.40.903.690 I srv operator(): Chat format: peg-native
0.40.903.699 I srv operator(): Chat format: peg-native
0.40.903.703 I srv operator(): Chat format: peg-native
0.40.903.738 I srv operator(): Chat format: peg-native
0.40.903.747 I srv operator(): Chat format: peg-native
0.40.903.764 I srv operator(): Chat format: peg-native
0.40.903.773 I srv operator(): Chat format: peg-native
0.40.903.807 I srv operator(): Chat format: peg-native
0.40.903.816 I srv operator(): Chat format: peg-native
0.40.914.969 I srv operator(): Chat format: peg-native
0.40.915.493 I srv operator(): Chat format: peg-native
0.40.915.570 I srv operator(): Chat format: peg-native
0.41.024.146 I slot get_availabl: id 14 | task -1 | selected slot by LRU, t_last = -1
0.41.024.213 I slot launch_slot_: id 14 | task 2 | processing task, is_child = 0
0.41.024.215 I slot get_availabl: id 13 | task -1 | selected slot by LRU, t_last = -1
0.41.024.231 I slot launch_slot_: id 13 | task 3 | processing task, is_child = 0
0.41.024.234 I slot get_availabl: id 12 | task -1 | selected slot by LRU, t_last = -1
0.41.024.246 I slot launch_slot_: id 12 | task 4 | processing task, is_child = 0
0.41.024.249 I slot get_availabl: id 11 | task -1 | selected slot by LRU, t_last = -1
0.41.024.262 I slot launch_slot_: id 11 | task 5 | processing task, is_child = 0
0.41.024.264 I slot get_availabl: id 10 | task -1 | selected slot by LRU, t_last = -1
0.41.024.275 I slot launch_slot_: id 10 | task 7 | processing task, is_child = 0
0.41.024.278 I slot get_availabl: id 9 | task -1 | selected slot by LRU, t_last = -1
0.41.024.291 I slot launch_slot_: id 9 | task 6 | processing task, is_child = 0
0.41.024.293 I slot get_availabl: id 8 | task -1 | selected slot by LRU, t_last = -1
0.41.024.304 I slot launch_slot_: id 8 | task 9 | processing task, is_child = 0
0.41.024.307 I slot get_availabl: id 7 | task -1 | selected slot by LRU, t_last = -1
0.41.024.320 I slot launch_slot_: id 7 | task 8 | processing task, is_child = 0
0.41.024.323 I slot get_availabl: id 6 | task -1 | selected slot by LRU, t_last = -1
0.41.024.335 I slot launch_slot_: id 6 | task 11 | processing task, is_child = 0
0.41.024.337 I slot get_availabl: id 5 | task -1 | selected slot by LRU, t_last = -1
0.41.024.349 I slot launch_slot_: id 5 | task 10 | processing task, is_child = 0
0.41.024.351 I slot get_availabl: id 4 | task -1 | selected slot by LRU, t_last = -1
0.41.024.362 I slot launch_slot_: id 4 | task 13 | processing task, is_child = 0
0.41.024.364 I slot get_availabl: id 3 | task -1 | selected slot by LRU, t_last = -1
0.41.024.375 I slot launch_slot_: id 3 | task 12 | processing task, is_child = 0
0.41.024.377 I slot get_availabl: id 2 | task -1 | selected slot by LRU, t_last = -1
0.41.024.387 I slot launch_slot_: id 2 | task 14 | processing task, is_child = 0
0.41.024.390 I slot get_availabl: id 1 | task -1 | selected slot by LRU, t_last = -1
0.41.024.402 I slot launch_slot_: id 1 | task 15 | processing task, is_child = 0
0.41.024.404 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = -1
0.41.024.415 I slot launch_slot_: id 0 | task 16 | processing task, is_child = 0
0.41.026.623 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.641 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.655 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.681 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.706 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.752 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.758 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.761 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.797 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.802 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.815 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.842 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.853 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.875 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.41.026.901 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.653.845 I slot print_timing: id 0 | task 16 | n_decoded = 102, tg = 23.70 t/s, tg_3s = 23.70 t/s
0.45.655.387 I slot print_timing: id 3 | task 12 | n_decoded = 102, tg = 23.71 t/s, tg_3s = 23.71 t/s
0.45.656.634 I slot print_timing: id 5 | task 10 | n_decoded = 102, tg = 23.71 t/s, tg_3s = 23.71 t/s
0.45.657.243 I slot print_timing: id 6 | task 11 | n_decoded = 102, tg = 23.71 t/s, tg_3s = 23.71 t/s
0.45.660.270 I slot print_timing: id 12 | task 4 | n_decoded = 102, tg = 23.71 t/s, tg_3s = 23.71 t/s
0.45.661.190 I slot print_timing: id 14 | task 2 | n_decoded = 102, tg = 23.71 t/s, tg_3s = 23.71 t/s
0.46.146.715 I slot print_timing: id 0 | task 16 | prompt eval time = 324.18 ms / 25 tokens ( 12.97 ms per token, 77.12 tokens per second)
0.46.146.718 I slot print_timing: id 0 | task 16 | eval time = 4795.91 ms / 114 tokens ( 42.07 ms per token, 23.77 tokens per second)
0.46.146.718 I slot print_timing: id 0 | task 16 | total time = 5120.08 ms / 139 tokens
0.46.146.723 I slot print_timing: id 0 | task 16 | graphs reused = 1
0.46.146.726 I slot print_timing: id 0 | task 16 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.46.146.749 I statistics draft-mtp: #calls(b,g,a) = 16 40 610, #gen drafts = 625, #acc drafts = 473, #gen tokens = 1250, #acc tokens = 904, #mean acc len = 2.48, #acc rate/pos = (0.775, 0.707), dur(b,g,a) = 0.009, 113.937, 0.724 ms
0.46.146.800 I slot release: id 0 | task 16 | stop processing: n_tokens = 138, truncated = 0
0.46.147.421 I slot print_timing: id 1 | task 15 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.46.148.334 I slot print_timing: id 3 | task 12 | prompt eval time = 326.10 ms / 25 tokens ( 13.04 ms per token, 76.66 tokens per second)
0.46.148.335 I slot print_timing: id 3 | task 12 | eval time = 4795.52 ms / 114 tokens ( 42.07 ms per token, 23.77 tokens per second)
0.46.148.336 I slot print_timing: id 3 | task 12 | total time = 5121.62 ms / 139 tokens
0.46.148.336 I slot print_timing: id 3 | task 12 | graphs reused = 1
0.46.148.338 I slot print_timing: id 3 | task 12 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.46.148.342 I statistics draft-mtp: #calls(b,g,a) = 16 40 613, #gen drafts = 625, #acc drafts = 475, #gen tokens = 1250, #acc tokens = 908, #mean acc len = 2.48, #acc rate/pos = (0.775, 0.706), dur(b,g,a) = 0.009, 113.937, 0.728 ms
0.46.148.369 I slot release: id 3 | task 12 | stop processing: n_tokens = 138, truncated = 0
0.46.148.987 I slot print_timing: id 4 | task 13 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.46.149.587 I slot print_timing: id 5 | task 10 | prompt eval time = 327.25 ms / 25 tokens ( 13.09 ms per token, 76.40 tokens per second)
0.46.149.589 I slot print_timing: id 5 | task 10 | eval time = 4795.60 ms / 114 tokens ( 42.07 ms per token, 23.77 tokens per second)
0.46.149.589 I slot print_timing: id 5 | task 10 | total time = 5122.85 ms / 139 tokens
0.46.149.589 I slot print_timing: id 5 | task 10 | graphs reused = 1
0.46.149.590 I slot print_timing: id 5 | task 10 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.46.149.594 I statistics draft-mtp: #calls(b,g,a) = 16 40 615, #gen drafts = 625, #acc drafts = 477, #gen tokens = 1250, #acc tokens = 912, #mean acc len = 2.48, #acc rate/pos = (0.776, 0.707), dur(b,g,a) = 0.009, 113.937, 0.731 ms
0.46.149.617 I slot release: id 5 | task 10 | stop processing: n_tokens = 138, truncated = 0
0.46.150.229 I slot print_timing: id 6 | task 11 | prompt eval time = 327.95 ms / 25 tokens ( 13.12 ms per token, 76.23 tokens per second)
0.46.150.231 I slot print_timing: id 6 | task 11 | eval time = 4795.53 ms / 114 tokens ( 42.07 ms per token, 23.77 tokens per second)
0.46.150.231 I slot print_timing: id 6 | task 11 | total time = 5123.48 ms / 139 tokens
0.46.150.232 I slot print_timing: id 6 | task 11 | graphs reused = 1
0.46.150.233 I slot print_timing: id 6 | task 11 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.46.150.236 I statistics draft-mtp: #calls(b,g,a) = 16 40 616, #gen drafts = 625, #acc drafts = 478, #gen tokens = 1250, #acc tokens = 914, #mean acc len = 2.48, #acc rate/pos = (0.776, 0.708), dur(b,g,a) = 0.009, 113.937, 0.732 ms
0.46.150.251 I slot release: id 6 | task 11 | stop processing: n_tokens = 138, truncated = 0
0.46.151.415 I slot print_timing: id 9 | task 6 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.46.152.023 I slot print_timing: id 10 | task 7 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.46.152.649 I slot print_timing: id 11 | task 5 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.46.153.282 I slot print_timing: id 12 | task 4 | prompt eval time = 331.62 ms / 25 tokens ( 13.26 ms per token, 75.39 tokens per second)
0.46.153.283 I slot print_timing: id 12 | task 4 | eval time = 4794.79 ms / 114 tokens ( 42.06 ms per token, 23.78 tokens per second)
0.46.153.284 I slot print_timing: id 12 | task 4 | total time = 5126.41 ms / 139 tokens
0.46.153.284 I slot print_timing: id 12 | task 4 | graphs reused = 1
0.46.153.286 I slot print_timing: id 12 | task 4 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.46.153.290 I statistics draft-mtp: #calls(b,g,a) = 16 40 622, #gen drafts = 625, #acc drafts = 482, #gen tokens = 1250, #acc tokens = 922, #mean acc len = 2.48, #acc rate/pos = (0.775, 0.707), dur(b,g,a) = 0.009, 113.937, 0.738 ms
0.46.153.312 I slot release: id 12 | task 4 | stop processing: n_tokens = 138, truncated = 0
0.46.154.207 I slot print_timing: id 14 | task 2 | prompt eval time = 332.88 ms / 25 tokens ( 13.32 ms per token, 75.10 tokens per second)
0.46.154.209 I slot print_timing: id 14 | task 2 | eval time = 4794.43 ms / 114 tokens ( 42.06 ms per token, 23.78 tokens per second)
0.46.154.209 I slot print_timing: id 14 | task 2 | total time = 5127.31 ms / 139 tokens
0.46.154.210 I slot print_timing: id 14 | task 2 | graphs reused = 1
0.46.154.211 I slot print_timing: id 14 | task 2 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.46.154.214 I statistics draft-mtp: #calls(b,g,a) = 16 40 624, #gen drafts = 625, #acc drafts = 483, #gen tokens = 1250, #acc tokens = 924, #mean acc len = 2.48, #acc rate/pos = (0.774, 0.707), dur(b,g,a) = 0.009, 113.937, 0.740 ms
0.46.154.231 I slot release: id 14 | task 2 | stop processing: n_tokens = 138, truncated = 0
0.46.156.254 I srv operator(): Chat format: peg-native
0.46.156.922 I srv operator(): Chat format: peg-native
0.46.158.130 I srv operator(): Chat format: peg-native
0.46.158.742 I srv operator(): Chat format: peg-native
0.46.162.951 I srv operator(): Chat format: peg-native
0.46.163.008 I srv operator(): Chat format: peg-native
0.46.241.272 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.022
0.46.241.345 I slot launch_slot_: id 0 | task 58 | processing task, is_child = 0
0.46.241.348 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.46.241.365 I slot launch_slot_: id 3 | task 59 | processing task, is_child = 0
0.46.241.369 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.46.241.383 I slot launch_slot_: id 5 | task 60 | processing task, is_child = 0
0.46.241.385 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.022
0.46.241.398 I slot launch_slot_: id 6 | task 61 | processing task, is_child = 0
0.46.241.401 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.46.241.415 I slot launch_slot_: id 12 | task 62 | processing task, is_child = 0
0.46.241.417 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.46.241.430 I slot launch_slot_: id 14 | task 63 | processing task, is_child = 0
0.46.247.474 W slot operator(): id 0 | task 58 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.247.503 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.247.526 W slot operator(): id 3 | task 59 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.247.552 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.247.580 W slot operator(): id 5 | task 60 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.247.602 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.247.628 W slot operator(): id 6 | task 61 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.247.656 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.247.676 W slot operator(): id 12 | task 62 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.247.695 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.247.737 W slot operator(): id 14 | task 63 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.247.772 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.295.498 I slot print_timing: id 1 | task 15 | prompt eval time = 324.78 ms / 28 tokens ( 11.60 ms per token, 86.21 tokens per second)
0.47.295.501 I slot print_timing: id 1 | task 15 | eval time = 5944.05 ms / 125 tokens ( 47.55 ms per token, 21.03 tokens per second)
0.47.295.502 I slot print_timing: id 1 | task 15 | total time = 6268.83 ms / 153 tokens
0.47.295.503 I slot print_timing: id 1 | task 15 | graphs reused = 1
0.47.295.505 I slot print_timing: id 1 | task 15 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.47.295.522 I statistics draft-mtp: #calls(b,g,a) = 22 49 743, #gen drafts = 757, #acc drafts = 560, #gen tokens = 1514, #acc tokens = 1069, #mean acc len = 2.44, #acc rate/pos = (0.754, 0.685), dur(b,g,a) = 0.010, 150.187, 0.888 ms
0.47.295.555 I slot release: id 1 | task 15 | stop processing: n_tokens = 152, truncated = 0
0.47.297.064 I slot print_timing: id 4 | task 13 | prompt eval time = 326.66 ms / 28 tokens ( 11.67 ms per token, 85.72 tokens per second)
0.47.297.069 I slot print_timing: id 4 | task 13 | eval time = 5943.68 ms / 125 tokens ( 47.55 ms per token, 21.03 tokens per second)
0.47.297.069 I slot print_timing: id 4 | task 13 | total time = 6270.34 ms / 153 tokens
0.47.297.070 I slot print_timing: id 4 | task 13 | graphs reused = 1
0.47.297.073 I slot print_timing: id 4 | task 13 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.47.297.080 I statistics draft-mtp: #calls(b,g,a) = 22 49 746, #gen drafts = 757, #acc drafts = 562, #gen tokens = 1514, #acc tokens = 1073, #mean acc len = 2.44, #acc rate/pos = (0.753, 0.685), dur(b,g,a) = 0.010, 150.187, 0.890 ms
0.47.297.104 I slot release: id 4 | task 13 | stop processing: n_tokens = 152, truncated = 0
0.47.299.478 I slot print_timing: id 9 | task 6 | prompt eval time = 329.77 ms / 28 tokens ( 11.78 ms per token, 84.91 tokens per second)
0.47.299.480 I slot print_timing: id 9 | task 6 | eval time = 5942.87 ms / 125 tokens ( 47.54 ms per token, 21.03 tokens per second)
0.47.299.481 I slot print_timing: id 9 | task 6 | total time = 6272.64 ms / 153 tokens
0.47.299.481 I slot print_timing: id 9 | task 6 | graphs reused = 1
0.47.299.484 I slot print_timing: id 9 | task 6 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.47.299.490 I statistics draft-mtp: #calls(b,g,a) = 22 49 751, #gen drafts = 757, #acc drafts = 565, #gen tokens = 1514, #acc tokens = 1079, #mean acc len = 2.44, #acc rate/pos = (0.752, 0.684), dur(b,g,a) = 0.010, 150.187, 0.895 ms
0.47.299.514 I slot release: id 9 | task 6 | stop processing: n_tokens = 152, truncated = 0
0.47.300.113 I slot print_timing: id 10 | task 7 | prompt eval time = 330.34 ms / 28 tokens ( 11.80 ms per token, 84.76 tokens per second)
0.47.300.115 I slot print_timing: id 10 | task 7 | eval time = 5942.95 ms / 125 tokens ( 47.54 ms per token, 21.03 tokens per second)
0.47.300.115 I slot print_timing: id 10 | task 7 | total time = 6273.29 ms / 153 tokens
0.47.300.116 I slot print_timing: id 10 | task 7 | graphs reused = 1
0.47.300.117 I slot print_timing: id 10 | task 7 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.47.300.122 I statistics draft-mtp: #calls(b,g,a) = 22 49 752, #gen drafts = 757, #acc drafts = 566, #gen tokens = 1514, #acc tokens = 1081, #mean acc len = 2.44, #acc rate/pos = (0.753, 0.685), dur(b,g,a) = 0.010, 150.187, 0.899 ms
0.47.300.177 I slot release: id 10 | task 7 | stop processing: n_tokens = 152, truncated = 0
0.47.300.803 I slot print_timing: id 11 | task 5 | prompt eval time = 331.05 ms / 28 tokens ( 11.82 ms per token, 84.58 tokens per second)
0.47.300.806 I slot print_timing: id 11 | task 5 | eval time = 5942.91 ms / 125 tokens ( 47.54 ms per token, 21.03 tokens per second)
0.47.300.807 I slot print_timing: id 11 | task 5 | total time = 6273.95 ms / 153 tokens
0.47.300.807 I slot print_timing: id 11 | task 5 | graphs reused = 1
0.47.300.809 I slot print_timing: id 11 | task 5 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.47.300.813 I statistics draft-mtp: #calls(b,g,a) = 22 49 753, #gen drafts = 757, #acc drafts = 567, #gen tokens = 1514, #acc tokens = 1083, #mean acc len = 2.44, #acc rate/pos = (0.753, 0.685), dur(b,g,a) = 0.010, 150.187, 0.900 ms
0.47.300.832 I slot release: id 11 | task 5 | stop processing: n_tokens = 152, truncated = 0
0.47.304.714 I srv operator(): Chat format: peg-native
0.47.305.552 I srv operator(): Chat format: peg-native
0.47.309.464 I srv operator(): Chat format: peg-native
0.47.309.909 I srv operator(): Chat format: peg-native
0.47.310.283 I srv operator(): Chat format: peg-native
0.47.397.118 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.47.397.188 I slot launch_slot_: id 1 | task 73 | processing task, is_child = 0
0.47.397.191 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.47.397.206 I slot launch_slot_: id 4 | task 74 | processing task, is_child = 0
0.47.397.209 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.020
0.47.397.222 I slot launch_slot_: id 9 | task 75 | processing task, is_child = 0
0.47.397.224 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.47.397.235 I slot launch_slot_: id 10 | task 76 | processing task, is_child = 0
0.47.397.238 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.47.397.249 I slot launch_slot_: id 11 | task 77 | processing task, is_child = 0
0.47.403.018 W slot operator(): id 1 | task 73 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.403.051 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.403.086 W slot operator(): id 4 | task 74 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.403.130 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.403.144 W slot operator(): id 9 | task 75 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.403.181 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.403.197 W slot operator(): id 10 | task 76 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.403.230 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.403.243 W slot operator(): id 11 | task 77 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.403.274 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.833.488 I slot print_timing: id 15 | task 0 | n_decoded = 100, tg = 14.69 t/s, tg_3s = 14.69 t/s
0.47.949.000 I slot print_timing: id 2 | task 14 | n_decoded = 100, tg = 15.16 t/s, tg_3s = 15.16 t/s
0.47.952.046 I slot print_timing: id 7 | task 8 | n_decoded = 100, tg = 15.16 t/s, tg_3s = 15.16 t/s
0.47.952.654 I slot print_timing: id 8 | task 9 | n_decoded = 100, tg = 15.16 t/s, tg_3s = 15.16 t/s
0.47.955.208 I slot print_timing: id 13 | task 3 | n_decoded = 100, tg = 15.16 t/s, tg_3s = 15.16 t/s
0.49.765.700 I slot print_timing: id 15 | task 0 | prompt eval time = 122.69 ms / 29 tokens ( 4.23 ms per token, 236.37 tokens per second)
0.49.765.703 I slot print_timing: id 15 | task 0 | eval time = 8741.57 ms / 128 tokens ( 68.29 ms per token, 14.64 tokens per second)
0.49.765.704 I slot print_timing: id 15 | task 0 | total time = 8864.26 ms / 157 tokens
0.49.765.705 I slot print_timing: id 15 | task 0 | graphs reused = 1
0.49.765.708 I slot print_timing: id 15 | task 0 | draft acceptance = 0.42963 ( 58 accepted / 135 generated), mean acceptance length = 1.85, acceptance rate per position = (0.471, 0.382)
0.49.765.723 I statistics draft-mtp: #calls(b,g,a) = 27 69 1051, #gen drafts = 1066, #acc drafts = 769, #gen tokens = 2127, #acc tokens = 1452, #mean acc len = 2.38, #acc rate/pos = (0.732, 0.650), dur(b,g,a) = 0.012, 215.771, 1.226 ms
0.49.765.755 I slot release: id 15 | task 0 | stop processing: n_tokens = 156, truncated = 0
0.49.774.924 I srv operator(): Chat format: peg-native
0.49.874.378 I slot print_timing: id 2 | task 14 | prompt eval time = 325.40 ms / 29 tokens ( 11.22 ms per token, 89.12 tokens per second)
0.49.874.381 I slot print_timing: id 2 | task 14 | eval time = 8522.30 ms / 128 tokens ( 66.58 ms per token, 15.02 tokens per second)
0.49.874.382 I slot print_timing: id 2 | task 14 | total time = 8847.71 ms / 157 tokens
0.49.874.382 I slot print_timing: id 2 | task 14 | graphs reused = 1
0.49.874.385 I slot print_timing: id 2 | task 14 | draft acceptance = 0.42963 ( 58 accepted / 135 generated), mean acceptance length = 1.85, acceptance rate per position = (0.471, 0.382)
0.49.874.399 I statistics draft-mtp: #calls(b,g,a) = 27 70 1066, #gen drafts = 1077, #acc drafts = 776, #gen tokens = 2149, #acc tokens = 1466, #mean acc len = 2.38, #acc rate/pos = (0.728, 0.647), dur(b,g,a) = 0.012, 221.469, 1.242 ms
0.49.874.426 I slot release: id 2 | task 14 | stop processing: n_tokens = 156, truncated = 0
0.49.874.655 I slot print_timing: id 7 | task 8 | prompt eval time = 328.50 ms / 29 tokens ( 11.33 ms per token, 88.28 tokens per second)
0.49.874.657 I slot print_timing: id 7 | task 8 | eval time = 8519.40 ms / 128 tokens ( 66.56 ms per token, 15.02 tokens per second)
0.49.874.657 I slot print_timing: id 7 | task 8 | total time = 8847.90 ms / 157 tokens
0.49.874.658 I slot print_timing: id 7 | task 8 | graphs reused = 1
0.49.874.658 I slot print_timing: id 7 | task 8 | draft acceptance = 0.42963 ( 58 accepted / 135 generated), mean acceptance length = 1.85, acceptance rate per position = (0.471, 0.382)
0.49.874.660 I statistics draft-mtp: #calls(b,g,a) = 27 70 1066, #gen drafts = 1077, #acc drafts = 776, #gen tokens = 2149, #acc tokens = 1466, #mean acc len = 2.38, #acc rate/pos = (0.728, 0.647), dur(b,g,a) = 0.012, 221.469, 1.242 ms
0.49.874.681 I slot release: id 7 | task 8 | stop processing: n_tokens = 156, truncated = 0
0.49.874.874 I slot print_timing: id 8 | task 9 | prompt eval time = 329.21 ms / 29 tokens ( 11.35 ms per token, 88.09 tokens per second)
0.49.874.876 I slot print_timing: id 8 | task 9 | eval time = 8518.89 ms / 128 tokens ( 66.55 ms per token, 15.03 tokens per second)
0.49.874.877 I slot print_timing: id 8 | task 9 | total time = 8848.10 ms / 157 tokens
0.49.874.877 I slot print_timing: id 8 | task 9 | graphs reused = 1
0.49.874.878 I slot print_timing: id 8 | task 9 | draft acceptance = 0.42963 ( 58 accepted / 135 generated), mean acceptance length = 1.85, acceptance rate per position = (0.471, 0.382)
0.49.874.879 I statistics draft-mtp: #calls(b,g,a) = 27 70 1066, #gen drafts = 1077, #acc drafts = 776, #gen tokens = 2149, #acc tokens = 1466, #mean acc len = 2.38, #acc rate/pos = (0.728, 0.647), dur(b,g,a) = 0.012, 221.469, 1.242 ms
0.49.874.902 I slot release: id 8 | task 9 | stop processing: n_tokens = 156, truncated = 0
0.49.875.106 I slot print_timing: id 13 | task 3 | prompt eval time = 332.18 ms / 29 tokens ( 11.45 ms per token, 87.30 tokens per second)
0.49.875.108 I slot print_timing: id 13 | task 3 | eval time = 8516.06 ms / 128 tokens ( 66.53 ms per token, 15.03 tokens per second)
0.49.875.108 I slot print_timing: id 13 | task 3 | total time = 8848.24 ms / 157 tokens
0.49.875.109 I slot print_timing: id 13 | task 3 | graphs reused = 1
0.49.875.110 I slot print_timing: id 13 | task 3 | draft acceptance = 0.42963 ( 58 accepted / 135 generated), mean acceptance length = 1.85, acceptance rate per position = (0.471, 0.382)
0.49.875.111 I statistics draft-mtp: #calls(b,g,a) = 27 70 1066, #gen drafts = 1077, #acc drafts = 776, #gen tokens = 2149, #acc tokens = 1466, #mean acc len = 2.38, #acc rate/pos = (0.728, 0.647), dur(b,g,a) = 0.012, 221.469, 1.242 ms
0.49.875.131 I slot release: id 13 | task 3 | stop processing: n_tokens = 156, truncated = 0
0.49.880.950 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.49.881.022 I slot launch_slot_: id 2 | task 98 | processing task, is_child = 0
0.49.885.071 I srv operator(): Chat format: peg-native
0.49.885.194 I srv operator(): Chat format: peg-native
0.49.885.402 I srv operator(): Chat format: peg-native
0.49.885.517 I srv operator(): Chat format: peg-native
0.49.886.799 W slot operator(): id 2 | task 98 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.886.826 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.991.063 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.49.991.134 I slot launch_slot_: id 7 | task 100 | processing task, is_child = 0
0.49.991.137 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.49.991.156 I slot launch_slot_: id 8 | task 101 | processing task, is_child = 0
0.49.991.158 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.49.991.176 I slot launch_slot_: id 13 | task 102 | processing task, is_child = 0
0.49.991.178 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.49.991.195 I slot launch_slot_: id 15 | task 103 | processing task, is_child = 0
0.49.999.040 W slot operator(): id 7 | task 100 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.999.075 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.999.104 W slot operator(): id 8 | task 101 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.999.133 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.999.160 W slot operator(): id 13 | task 102 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.999.183 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.999.214 W slot operator(): id 15 | task 103 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.999.248 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.50.779.543 I slot print_timing: id 5 | task 60 | n_decoded = 102, tg = 23.52 t/s, tg_3s = 23.52 t/s
0.50.784.297 I slot print_timing: id 14 | task 63 | n_decoded = 102, tg = 23.50 t/s, tg_3s = 23.50 t/s
0.51.267.582 I slot print_timing: id 3 | task 59 | n_decoded = 101, tg = 20.93 t/s, tg_3s = 20.93 t/s
0.51.268.802 I slot print_timing: id 5 | task 60 | prompt eval time = 195.00 ms / 25 tokens ( 7.80 ms per token, 128.21 tokens per second)
0.51.268.807 I slot print_timing: id 5 | task 60 | eval time = 4826.18 ms / 114 tokens ( 42.33 ms per token, 23.62 tokens per second)
0.51.268.807 I slot print_timing: id 5 | task 60 | total time = 5021.18 ms / 139 tokens
0.51.268.808 I slot print_timing: id 5 | task 60 | graphs reused = 1
0.51.268.811 I slot print_timing: id 5 | task 60 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.51.268.827 I statistics draft-mtp: #calls(b,g,a) = 32 81 1234, #gen drafts = 1244, #acc drafts = 901, #gen tokens = 2483, #acc tokens = 1707, #mean acc len = 2.38, #acc rate/pos = (0.730, 0.653), dur(b,g,a) = 0.016, 261.605, 1.436 ms
0.51.268.859 I slot release: id 5 | task 60 | stop processing: n_tokens = 138, truncated = 0
0.51.272.363 I slot print_timing: id 12 | task 62 | n_decoded = 101, tg = 20.92 t/s, tg_3s = 20.92 t/s
0.51.273.550 I slot print_timing: id 14 | task 63 | prompt eval time = 196.92 ms / 25 tokens ( 7.88 ms per token, 126.95 tokens per second)
0.51.273.552 I slot print_timing: id 14 | task 63 | eval time = 4828.86 ms / 114 tokens ( 42.36 ms per token, 23.61 tokens per second)
0.51.273.552 I slot print_timing: id 14 | task 63 | total time = 5025.78 ms / 139 tokens
0.51.273.553 I slot print_timing: id 14 | task 63 | graphs reused = 1
0.51.273.555 I slot print_timing: id 14 | task 63 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.51.273.563 I statistics draft-mtp: #calls(b,g,a) = 32 81 1243, #gen drafts = 1244, #acc drafts = 908, #gen tokens = 2483, #acc tokens = 1720, #mean acc len = 2.38, #acc rate/pos = (0.730, 0.653), dur(b,g,a) = 0.016, 261.605, 1.445 ms
0.51.273.588 I slot release: id 14 | task 63 | stop processing: n_tokens = 138, truncated = 0
0.51.277.504 I srv operator(): Chat format: peg-native
0.51.281.889 I srv operator(): Chat format: peg-native
0.51.386.067 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.51.386.141 I slot launch_slot_: id 5 | task 115 | processing task, is_child = 0
0.51.386.144 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.51.386.162 I slot launch_slot_: id 14 | task 116 | processing task, is_child = 0
0.51.391.784 W slot operator(): id 5 | task 115 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.391.816 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.51.391.846 W slot operator(): id 14 | task 116 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.391.883 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.51.899.578 I slot print_timing: id 9 | task 75 | n_decoded = 102, tg = 23.63 t/s, tg_3s = 23.63 t/s
0.52.386.452 I slot print_timing: id 3 | task 59 | prompt eval time = 194.24 ms / 28 tokens ( 6.94 ms per token, 144.16 tokens per second)
0.52.386.455 I slot print_timing: id 3 | task 59 | eval time = 5944.65 ms / 125 tokens ( 47.56 ms per token, 21.03 tokens per second)
0.52.386.455 I slot print_timing: id 3 | task 59 | total time = 6138.88 ms / 153 tokens
0.52.386.456 I slot print_timing: id 3 | task 59 | graphs reused = 1
0.52.386.459 I slot print_timing: id 3 | task 59 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.52.386.476 I statistics draft-mtp: #calls(b,g,a) = 34 90 1372, #gen drafts = 1384, #acc drafts = 998, #gen tokens = 2763, #acc tokens = 1891, #mean acc len = 2.38, #acc rate/pos = (0.727, 0.651), dur(b,g,a) = 0.017, 293.660, 1.592 ms
0.52.386.503 I slot release: id 3 | task 59 | stop processing: n_tokens = 152, truncated = 0
0.52.387.127 I slot print_timing: id 4 | task 74 | n_decoded = 101, tg = 21.02 t/s, tg_3s = 21.02 t/s
0.52.389.937 I slot print_timing: id 9 | task 75 | prompt eval time = 180.06 ms / 25 tokens ( 7.20 ms per token, 138.84 tokens per second)
0.52.389.942 I slot print_timing: id 9 | task 75 | eval time = 4806.68 ms / 114 tokens ( 42.16 ms per token, 23.72 tokens per second)
0.52.389.943 I slot print_timing: id 9 | task 75 | total time = 4986.74 ms / 139 tokens
0.52.389.943 I slot print_timing: id 9 | task 75 | graphs reused = 1
0.52.389.946 I slot print_timing: id 9 | task 75 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.52.389.953 I statistics draft-mtp: #calls(b,g,a) = 34 90 1378, #gen drafts = 1384, #acc drafts = 1003, #gen tokens = 2763, #acc tokens = 1901, #mean acc len = 2.38, #acc rate/pos = (0.728, 0.652), dur(b,g,a) = 0.017, 293.660, 1.598 ms
0.52.389.977 I slot release: id 9 | task 75 | stop processing: n_tokens = 138, truncated = 0
0.52.390.891 I slot print_timing: id 11 | task 77 | n_decoded = 101, tg = 21.01 t/s, tg_3s = 21.01 t/s
0.52.391.516 I slot print_timing: id 12 | task 62 | prompt eval time = 196.21 ms / 28 tokens ( 7.01 ms per token, 142.70 tokens per second)
0.52.391.519 I slot print_timing: id 12 | task 62 | eval time = 5947.60 ms / 125 tokens ( 47.58 ms per token, 21.02 tokens per second)
0.52.391.520 I slot print_timing: id 12 | task 62 | total time = 6143.81 ms / 153 tokens
0.52.391.520 I slot print_timing: id 12 | task 62 | graphs reused = 1
0.52.391.523 I slot print_timing: id 12 | task 62 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.52.391.529 I statistics draft-mtp: #calls(b,g,a) = 34 90 1381, #gen drafts = 1384, #acc drafts = 1005, #gen tokens = 2763, #acc tokens = 1905, #mean acc len = 2.38, #acc rate/pos = (0.728, 0.652), dur(b,g,a) = 0.017, 293.660, 1.601 ms
0.52.391.552 I slot release: id 12 | task 62 | stop processing: n_tokens = 152, truncated = 0
0.52.395.600 I srv operator(): Chat format: peg-native
0.52.397.963 I srv operator(): Chat format: peg-native
0.52.399.795 I srv operator(): Chat format: peg-native
0.52.498.188 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.52.498.262 I slot launch_slot_: id 3 | task 126 | processing task, is_child = 0
0.52.498.265 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.52.498.282 I slot launch_slot_: id 12 | task 127 | processing task, is_child = 0
0.52.498.284 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.52.498.298 I slot launch_slot_: id 9 | task 128 | processing task, is_child = 0
0.52.504.284 W slot operator(): id 3 | task 126 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.504.322 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.504.359 W slot operator(): id 9 | task 128 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.504.401 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.504.412 W slot operator(): id 12 | task 127 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.504.446 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.53.022.647 I slot print_timing: id 0 | task 58 | n_decoded = 100, tg = 15.19 t/s, tg_3s = 15.19 t/s
0.53.025.457 I slot print_timing: id 6 | task 61 | n_decoded = 100, tg = 15.19 t/s, tg_3s = 15.19 t/s
0.53.512.306 I slot print_timing: id 4 | task 74 | prompt eval time = 179.83 ms / 28 tokens ( 6.42 ms per token, 155.70 tokens per second)
0.53.512.309 I slot print_timing: id 4 | task 74 | eval time = 5929.35 ms / 125 tokens ( 47.43 ms per token, 21.08 tokens per second)
0.53.512.309 I slot print_timing: id 4 | task 74 | total time = 6109.17 ms / 153 tokens
0.53.512.310 I slot print_timing: id 4 | task 74 | graphs reused = 1
0.53.512.313 I slot print_timing: id 4 | task 74 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.53.512.328 I statistics draft-mtp: #calls(b,g,a) = 37 99 1511, #gen drafts = 1522, #acc drafts = 1100, #gen tokens = 3039, #acc tokens = 2082, #mean acc len = 2.38, #acc rate/pos = (0.728, 0.650), dur(b,g,a) = 0.019, 326.453, 1.748 ms
0.53.512.359 I slot release: id 4 | task 74 | stop processing: n_tokens = 152, truncated = 0
0.53.515.989 I slot print_timing: id 11 | task 77 | prompt eval time = 180.48 ms / 28 tokens ( 6.45 ms per token, 155.14 tokens per second)
0.53.515.992 I slot print_timing: id 11 | task 77 | eval time = 5932.23 ms / 125 tokens ( 47.46 ms per token, 21.07 tokens per second)
0.53.515.992 I slot print_timing: id 11 | task 77 | total time = 6112.71 ms / 153 tokens
0.53.515.993 I slot print_timing: id 11 | task 77 | graphs reused = 1
0.53.515.995 I slot print_timing: id 11 | task 77 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.53.516.003 I statistics draft-mtp: #calls(b,g,a) = 37 99 1518, #gen drafts = 1522, #acc drafts = 1105, #gen tokens = 3039, #acc tokens = 2092, #mean acc len = 2.38, #acc rate/pos = (0.728, 0.650), dur(b,g,a) = 0.019, 326.453, 1.755 ms
0.53.516.026 I slot release: id 11 | task 77 | stop processing: n_tokens = 152, truncated = 0
0.53.521.045 I srv operator(): Chat format: peg-native
0.53.524.284 I srv operator(): Chat format: peg-native
0.53.629.229 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.53.629.301 I slot launch_slot_: id 4 | task 138 | processing task, is_child = 0
0.53.629.304 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.53.629.322 I slot launch_slot_: id 11 | task 139 | processing task, is_child = 0
0.53.635.151 W slot operator(): id 4 | task 138 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.53.635.181 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.53.635.220 W slot operator(): id 11 | task 139 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.53.635.258 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.142.144 I slot print_timing: id 1 | task 73 | n_decoded = 100, tg = 15.25 t/s, tg_3s = 15.25 t/s
0.54.147.280 I slot print_timing: id 10 | task 76 | n_decoded = 100, tg = 15.24 t/s, tg_3s = 15.24 t/s
0.54.386.558 I slot print_timing: id 2 | task 98 | n_decoded = 102, tg = 23.18 t/s, tg_3s = 23.18 t/s
0.54.513.747 I slot print_timing: id 13 | task 102 | n_decoded = 102, tg = 23.47 t/s, tg_3s = 23.47 t/s
0.54.872.750 I slot print_timing: id 2 | task 98 | prompt eval time = 99.03 ms / 25 tokens ( 3.96 ms per token, 252.45 tokens per second)
0.54.872.753 I slot print_timing: id 2 | task 98 | eval time = 4886.88 ms / 114 tokens ( 42.87 ms per token, 23.33 tokens per second)
0.54.872.754 I slot print_timing: id 2 | task 98 | total time = 4985.91 ms / 139 tokens
0.54.872.754 I slot print_timing: id 2 | task 98 | graphs reused = 1
0.54.872.757 I slot print_timing: id 2 | task 98 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.54.872.776 I statistics draft-mtp: #calls(b,g,a) = 39 110 1681, #gen drafts = 1694, #acc drafts = 1213, #gen tokens = 3383, #acc tokens = 2297, #mean acc len = 2.37, #acc rate/pos = (0.722, 0.645), dur(b,g,a) = 0.019, 364.975, 1.927 ms
0.54.872.809 I slot release: id 2 | task 98 | stop processing: n_tokens = 138, truncated = 0
0.54.881.800 I srv operator(): Chat format: peg-native
0.54.991.988 I slot print_timing: id 8 | task 101 | n_decoded = 101, tg = 20.93 t/s, tg_3s = 20.93 t/s
0.54.994.719 I slot print_timing: id 13 | task 102 | prompt eval time = 167.86 ms / 25 tokens ( 6.71 ms per token, 148.93 tokens per second)
0.54.994.721 I slot print_timing: id 13 | task 102 | eval time = 4827.65 ms / 114 tokens ( 42.35 ms per token, 23.61 tokens per second)
0.54.994.722 I slot print_timing: id 13 | task 102 | total time = 4995.51 ms / 139 tokens
0.54.994.723 I slot print_timing: id 13 | task 102 | graphs reused = 1
0.54.994.726 I slot print_timing: id 13 | task 102 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.54.994.743 I statistics draft-mtp: #calls(b,g,a) = 39 111 1707, #gen drafts = 1709, #acc drafts = 1230, #gen tokens = 3411, #acc tokens = 2330, #mean acc len = 2.36, #acc rate/pos = (0.721, 0.644), dur(b,g,a) = 0.019, 370.564, 1.959 ms
0.54.994.774 I slot release: id 13 | task 102 | stop processing: n_tokens = 138, truncated = 0
0.54.995.703 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.54.995.775 I slot launch_slot_: id 2 | task 151 | processing task, is_child = 0
0.55.001.545 W slot operator(): id 2 | task 151 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.001.579 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.002.748 I srv operator(): Chat format: peg-native
0.55.115.978 I slot print_timing: id 0 | task 58 | prompt eval time = 194.01 ms / 29 tokens ( 6.69 ms per token, 149.47 tokens per second)
0.55.115.981 I slot print_timing: id 0 | task 58 | eval time = 8674.46 ms / 128 tokens ( 67.77 ms per token, 14.76 tokens per second)
0.55.115.981 I slot print_timing: id 0 | task 58 | total time = 8868.47 ms / 157 tokens
0.55.115.982 I slot print_timing: id 0 | task 58 | graphs reused = 1
0.55.115.984 I slot print_timing: id 0 | task 58 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.55.115.998 I statistics draft-mtp: #calls(b,g,a) = 39 112 1709, #gen drafts = 1721, #acc drafts = 1231, #gen tokens = 3435, #acc tokens = 2332, #mean acc len = 2.36, #acc rate/pos = (0.720, 0.644), dur(b,g,a) = 0.019, 376.260, 1.962 ms
0.55.116.026 I slot release: id 0 | task 58 | stop processing: n_tokens = 156, truncated = 0
0.55.116.496 I slot print_timing: id 6 | task 61 | prompt eval time = 195.61 ms / 29 tokens ( 6.75 ms per token, 148.25 tokens per second)
0.55.116.498 I slot print_timing: id 6 | task 61 | eval time = 8673.24 ms / 128 tokens ( 67.76 ms per token, 14.76 tokens per second)
0.55.116.498 I slot print_timing: id 6 | task 61 | total time = 8868.85 ms / 157 tokens
0.55.116.498 I slot print_timing: id 6 | task 61 | graphs reused = 1
0.55.116.499 I slot print_timing: id 6 | task 61 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.55.116.502 I statistics draft-mtp: #calls(b,g,a) = 40 112 1709, #gen drafts = 1721, #acc drafts = 1231, #gen tokens = 3435, #acc tokens = 2332, #mean acc len = 2.36, #acc rate/pos = (0.720, 0.644), dur(b,g,a) = 0.020, 376.260, 1.962 ms
0.55.116.523 I slot release: id 6 | task 61 | stop processing: n_tokens = 156, truncated = 0
0.55.123.200 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.55.123.273 I slot launch_slot_: id 0 | task 153 | processing task, is_child = 0
0.55.124.694 I srv operator(): Chat format: peg-native
0.55.125.685 I srv operator(): Chat format: peg-native
0.55.128.618 W slot operator(): id 0 | task 153 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.128.650 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.247.632 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.55.247.701 I slot launch_slot_: id 6 | task 155 | processing task, is_child = 0
0.55.247.704 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.55.247.724 I slot launch_slot_: id 13 | task 156 | processing task, is_child = 0
0.55.253.205 W slot operator(): id 6 | task 155 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.253.232 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.253.268 W slot operator(): id 13 | task 156 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.253.292 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.883.828 I slot print_timing: id 14 | task 116 | n_decoded = 102, tg = 23.43 t/s, tg_3s = 23.43 t/s
0.56.123.770 I slot print_timing: id 8 | task 101 | prompt eval time = 167.27 ms / 28 tokens ( 5.97 ms per token, 167.39 tokens per second)
0.56.123.772 I slot print_timing: id 8 | task 101 | eval time = 5957.34 ms / 125 tokens ( 47.66 ms per token, 20.98 tokens per second)
0.56.123.773 I slot print_timing: id 8 | task 101 | total time = 6124.61 ms / 153 tokens
0.56.123.774 I slot print_timing: id 8 | task 101 | graphs reused = 1
0.56.123.777 I slot print_timing: id 8 | task 101 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.56.123.793 I statistics draft-mtp: #calls(b,g,a) = 43 120 1837, #gen drafts = 1844, #acc drafts = 1318, #gen tokens = 3679, #acc tokens = 2498, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.642), dur(b,g,a) = 0.022, 404.849, 2.117 ms
0.56.123.826 I slot release: id 8 | task 101 | stop processing: n_tokens = 152, truncated = 0
0.56.132.743 I srv operator(): Chat format: peg-native
0.56.234.517 I slot print_timing: id 1 | task 73 | prompt eval time = 179.62 ms / 29 tokens ( 6.19 ms per token, 161.45 tokens per second)
0.56.234.523 I slot print_timing: id 1 | task 73 | eval time = 8651.85 ms / 128 tokens ( 67.59 ms per token, 14.79 tokens per second)
0.56.234.524 I slot print_timing: id 1 | task 73 | total time = 8831.47 ms / 157 tokens
0.56.234.525 I slot print_timing: id 1 | task 73 | graphs reused = 1
0.56.234.527 I slot print_timing: id 1 | task 73 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.56.234.540 I statistics draft-mtp: #calls(b,g,a) = 43 121 1844, #gen drafts = 1857, #acc drafts = 1322, #gen tokens = 3705, #acc tokens = 2506, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.642), dur(b,g,a) = 0.022, 410.843, 2.124 ms
0.56.234.569 I slot release: id 1 | task 73 | stop processing: n_tokens = 156, truncated = 0
0.56.234.774 I slot print_timing: id 10 | task 76 | prompt eval time = 180.27 ms / 29 tokens ( 6.22 ms per token, 160.87 tokens per second)
0.56.234.776 I slot print_timing: id 10 | task 76 | eval time = 8651.29 ms / 128 tokens ( 67.59 ms per token, 14.80 tokens per second)
0.56.234.776 I slot print_timing: id 10 | task 76 | total time = 8831.57 ms / 157 tokens
0.56.234.776 I slot print_timing: id 10 | task 76 | graphs reused = 1
0.56.234.777 I slot print_timing: id 10 | task 76 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.56.234.779 I statistics draft-mtp: #calls(b,g,a) = 43 121 1844, #gen drafts = 1857, #acc drafts = 1322, #gen tokens = 3705, #acc tokens = 2506, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.642), dur(b,g,a) = 0.022, 410.843, 2.124 ms
0.56.234.798 I slot release: id 10 | task 76 | stop processing: n_tokens = 156, truncated = 0
0.56.241.333 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.56.241.408 I slot launch_slot_: id 1 | task 165 | processing task, is_child = 0
0.56.243.938 I srv operator(): Chat format: peg-native
0.56.244.129 I srv operator(): Chat format: peg-native
0.56.247.502 W slot operator(): id 1 | task 165 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.247.528 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.363.005 I slot print_timing: id 5 | task 115 | n_decoded = 101, tg = 20.90 t/s, tg_3s = 20.90 t/s
0.56.366.925 I slot print_timing: id 14 | task 116 | prompt eval time = 139.30 ms / 25 tokens ( 5.57 ms per token, 179.46 tokens per second)
0.56.366.927 I slot print_timing: id 14 | task 116 | eval time = 4835.73 ms / 114 tokens ( 42.42 ms per token, 23.57 tokens per second)
0.56.366.928 I slot print_timing: id 14 | task 116 | total time = 4975.04 ms / 139 tokens
0.56.366.929 I slot print_timing: id 14 | task 116 | graphs reused = 1
0.56.366.932 I slot print_timing: id 14 | task 116 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.56.366.949 I statistics draft-mtp: #calls(b,g,a) = 44 122 1869, #gen drafts = 1870, #acc drafts = 1341, #gen tokens = 3731, #acc tokens = 2543, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.643), dur(b,g,a) = 0.023, 416.851, 2.155 ms
0.56.366.984 I slot release: id 14 | task 116 | stop processing: n_tokens = 138, truncated = 0
0.56.367.452 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.56.367.516 I slot launch_slot_: id 8 | task 167 | processing task, is_child = 0
0.56.367.519 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.56.367.538 I slot launch_slot_: id 14 | task 168 | processing task, is_child = 0
0.56.373.599 W slot operator(): id 8 | task 167 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.373.624 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.373.655 W slot operator(): id 14 | task 168 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.373.681 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.375.544 I srv operator(): Chat format: peg-native
0.56.512.502 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.56.512.572 I slot launch_slot_: id 10 | task 170 | processing task, is_child = 0
0.56.516.945 W slot operator(): id 10 | task 170 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.516.979 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.772.529 I slot print_timing: id 15 | task 103 | n_decoded = 100, tg = 15.14 t/s, tg_3s = 15.14 t/s
0.57.011.648 I slot print_timing: id 7 | task 100 | n_decoded = 100, tg = 14.61 t/s, tg_3s = 14.61 t/s
0.57.012.721 I slot print_timing: id 9 | task 128 | n_decoded = 102, tg = 23.42 t/s, tg_3s = 23.42 t/s
0.57.498.741 I slot print_timing: id 5 | task 115 | prompt eval time = 139.10 ms / 28 tokens ( 4.97 ms per token, 201.30 tokens per second)
0.57.498.744 I slot print_timing: id 5 | task 115 | eval time = 5967.83 ms / 125 tokens ( 47.74 ms per token, 20.95 tokens per second)
0.57.498.744 I slot print_timing: id 5 | task 115 | total time = 6106.92 ms / 153 tokens
0.57.498.745 I slot print_timing: id 5 | task 115 | graphs reused = 1
0.57.498.748 I slot print_timing: id 5 | task 115 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.57.498.767 I statistics draft-mtp: #calls(b,g,a) = 47 131 2000, #gen drafts = 2010, #acc drafts = 1434, #gen tokens = 4011, #acc tokens = 2716, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.641), dur(b,g,a) = 0.025, 448.166, 2.308 ms
0.57.498.799 I slot release: id 5 | task 115 | stop processing: n_tokens = 152, truncated = 0
0.57.500.670 I slot print_timing: id 9 | task 128 | prompt eval time = 153.22 ms / 25 tokens ( 6.13 ms per token, 163.16 tokens per second)
0.57.500.672 I slot print_timing: id 9 | task 128 | eval time = 4843.06 ms / 114 tokens ( 42.48 ms per token, 23.54 tokens per second)
0.57.500.673 I slot print_timing: id 9 | task 128 | total time = 4996.28 ms / 139 tokens
0.57.500.673 I slot print_timing: id 9 | task 128 | graphs reused = 1
0.57.500.675 I slot print_timing: id 9 | task 128 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.57.500.680 I statistics draft-mtp: #calls(b,g,a) = 47 131 2004, #gen drafts = 2010, #acc drafts = 1436, #gen tokens = 4011, #acc tokens = 2720, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.641), dur(b,g,a) = 0.025, 448.166, 2.312 ms
0.57.500.703 I slot release: id 9 | task 128 | stop processing: n_tokens = 138, truncated = 0
0.57.502.535 I slot print_timing: id 12 | task 127 | n_decoded = 101, tg = 20.85 t/s, tg_3s = 20.85 t/s
0.57.508.562 I srv operator(): Chat format: peg-native
0.57.508.977 I srv operator(): Chat format: peg-native
0.57.615.027 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.57.615.100 I slot launch_slot_: id 5 | task 180 | processing task, is_child = 0
0.57.615.103 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.57.615.120 I slot launch_slot_: id 9 | task 181 | processing task, is_child = 0
0.57.620.908 W slot operator(): id 5 | task 180 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.57.620.933 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.57.620.974 W slot operator(): id 9 | task 181 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.57.621.009 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.617.634 I slot print_timing: id 11 | task 139 | n_decoded = 101, tg = 20.86 t/s, tg_3s = 20.86 t/s
0.58.618.250 I slot print_timing: id 12 | task 127 | prompt eval time = 153.42 ms / 28 tokens ( 5.48 ms per token, 182.51 tokens per second)
0.58.618.252 I slot print_timing: id 12 | task 127 | eval time = 5960.39 ms / 125 tokens ( 47.68 ms per token, 20.97 tokens per second)
0.58.618.252 I slot print_timing: id 12 | task 127 | total time = 6113.80 ms / 153 tokens
0.58.618.253 I slot print_timing: id 12 | task 127 | graphs reused = 1
0.58.618.256 I slot print_timing: id 12 | task 127 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.58.618.273 I statistics draft-mtp: #calls(b,g,a) = 49 140 2147, #gen drafts = 2150, #acc drafts = 1532, #gen tokens = 4291, #acc tokens = 2903, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.639), dur(b,g,a) = 0.027, 480.397, 2.468 ms
0.58.618.303 I slot release: id 12 | task 127 | stop processing: n_tokens = 152, truncated = 0
0.58.627.284 I srv operator(): Chat format: peg-native
0.58.735.981 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.58.736.053 I slot launch_slot_: id 12 | task 191 | processing task, is_child = 0
0.58.739.950 W slot operator(): id 12 | task 191 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.58.739.989 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.863.188 I slot print_timing: id 15 | task 103 | prompt eval time = 168.56 ms / 29 tokens ( 5.81 ms per token, 172.04 tokens per second)
0.58.863.191 I slot print_timing: id 15 | task 103 | eval time = 8695.39 ms / 128 tokens ( 67.93 ms per token, 14.72 tokens per second)
0.58.863.192 I slot print_timing: id 15 | task 103 | total time = 8863.95 ms / 157 tokens
0.58.863.192 I slot print_timing: id 15 | task 103 | graphs reused = 1
0.58.863.195 I slot print_timing: id 15 | task 103 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.58.863.206 I statistics draft-mtp: #calls(b,g,a) = 50 142 2165, #gen drafts = 2179, #acc drafts = 1544, #gen tokens = 4348, #acc tokens = 2927, #mean acc len = 2.35, #acc rate/pos = (0.713, 0.639), dur(b,g,a) = 0.028, 488.267, 2.486 ms
0.58.863.231 I slot release: id 15 | task 103 | stop processing: n_tokens = 156, truncated = 0
0.58.872.110 I srv operator(): Chat format: peg-native
0.58.984.786 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.58.984.855 I slot launch_slot_: id 15 | task 194 | processing task, is_child = 0
0.58.989.575 W slot operator(): id 15 | task 194 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.58.989.610 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.112.802 I slot print_timing: id 7 | task 100 | prompt eval time = 166.64 ms / 29 tokens ( 5.75 ms per token, 174.03 tokens per second)
0.59.112.805 I slot print_timing: id 7 | task 100 | eval time = 8947.10 ms / 128 tokens ( 69.90 ms per token, 14.31 tokens per second)
0.59.112.806 I slot print_timing: id 7 | task 100 | total time = 9113.73 ms / 157 tokens
0.59.112.807 I slot print_timing: id 7 | task 100 | graphs reused = 1
0.59.112.809 I slot print_timing: id 7 | task 100 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
0.59.112.823 I statistics draft-mtp: #calls(b,g,a) = 50 144 2194, #gen drafts = 2208, #acc drafts = 1564, #gen tokens = 4405, #acc tokens = 2964, #mean acc len = 2.35, #acc rate/pos = (0.713, 0.638), dur(b,g,a) = 0.028, 495.894, 2.521 ms
0.59.112.848 I slot release: id 7 | task 100 | stop processing: n_tokens = 156, truncated = 0
0.59.122.962 I srv operator(): Chat format: peg-native
0.59.233.250 I slot print_timing: id 3 | task 126 | n_decoded = 100, tg = 15.21 t/s, tg_3s = 15.21 t/s
0.59.238.830 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.59.238.898 I slot launch_slot_: id 7 | task 197 | processing task, is_child = 0
0.59.244.011 W slot operator(): id 7 | task 197 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.244.055 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.492.567 I slot print_timing: id 2 | task 151 | n_decoded = 102, tg = 23.31 t/s, tg_3s = 23.31 t/s
0.59.740.821 I slot print_timing: id 11 | task 139 | prompt eval time = 139.58 ms / 28 tokens ( 4.99 ms per token, 200.60 tokens per second)
0.59.740.826 I slot print_timing: id 11 | task 139 | eval time = 5965.95 ms / 125 tokens ( 47.73 ms per token, 20.95 tokens per second)
0.59.740.826 I slot print_timing: id 11 | task 139 | total time = 6105.53 ms / 153 tokens
0.59.740.828 I slot print_timing: id 11 | task 139 | graphs reused = 1
0.59.740.831 I slot print_timing: id 11 | task 139 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.59.740.846 I statistics draft-mtp: #calls(b,g,a) = 52 149 2282, #gen drafts = 2286, #acc drafts = 1629, #gen tokens = 4561, #acc tokens = 3086, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.638), dur(b,g,a) = 0.029, 515.066, 2.621 ms
0.59.740.875 I slot release: id 11 | task 139 | stop processing: n_tokens = 152, truncated = 0
0.59.742.173 I slot print_timing: id 13 | task 156 | n_decoded = 102, tg = 23.45 t/s, tg_3s = 23.45 t/s
0.59.749.578 I srv operator(): Chat format: peg-native
0.59.861.860 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.59.861.929 I slot launch_slot_: id 11 | task 203 | processing task, is_child = 0
0.59.866.884 W slot operator(): id 11 | task 203 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.866.917 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.994.087 I slot print_timing: id 2 | task 151 | prompt eval time = 114.74 ms / 25 tokens ( 4.59 ms per token, 217.89 tokens per second)
0.59.994.090 I slot print_timing: id 2 | task 151 | eval time = 4877.76 ms / 114 tokens ( 42.79 ms per token, 23.37 tokens per second)
0.59.994.091 I slot print_timing: id 2 | task 151 | total time = 4992.50 ms / 139 tokens
0.59.994.092 I slot print_timing: id 2 | task 151 | graphs reused = 1
0.59.994.095 I slot print_timing: id 2 | task 151 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.59.994.110 I statistics draft-mtp: #calls(b,g,a) = 53 151 2304, #gen drafts = 2316, #acc drafts = 1643, #gen tokens = 4621, #acc tokens = 3114, #mean acc len = 2.35, #acc rate/pos = (0.713, 0.638), dur(b,g,a) = 0.030, 526.076, 2.648 ms
0.59.994.137 I slot release: id 2 | task 151 | stop processing: n_tokens = 138, truncated = 0
1.00.002.803 I srv operator(): Chat format: peg-native
1.00.116.893 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
1.00.116.962 I slot launch_slot_: id 2 | task 206 | processing task, is_child = 0
1.00.120.951 W slot operator(): id 2 | task 206 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.120.981 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.249.271 I slot print_timing: id 6 | task 155 | n_decoded = 101, tg = 20.79 t/s, tg_3s = 20.79 t/s
1.00.253.076 I slot print_timing: id 13 | task 156 | prompt eval time = 138.54 ms / 25 tokens ( 5.54 ms per token, 180.45 tokens per second)
1.00.253.078 I slot print_timing: id 13 | task 156 | eval time = 4861.23 ms / 114 tokens ( 42.64 ms per token, 23.45 tokens per second)
1.00.253.078 I slot print_timing: id 13 | task 156 | total time = 4999.77 ms / 139 tokens
1.00.253.079 I slot print_timing: id 13 | task 156 | graphs reused = 1
1.00.253.082 I slot print_timing: id 13 | task 156 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.00.253.096 I statistics draft-mtp: #calls(b,g,a) = 54 153 2344, #gen drafts = 2346, #acc drafts = 1674, #gen tokens = 4681, #acc tokens = 3173, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.640), dur(b,g,a) = 0.031, 533.924, 2.695 ms
1.00.253.127 I slot release: id 13 | task 156 | stop processing: n_tokens = 138, truncated = 0
1.00.261.573 I srv operator(): Chat format: peg-native
1.00.365.754 I slot print_timing: id 4 | task 138 | n_decoded = 100, tg = 15.17 t/s, tg_3s = 15.17 t/s
1.00.371.348 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.00.371.415 I slot launch_slot_: id 13 | task 209 | processing task, is_child = 0
1.00.375.422 W slot operator(): id 13 | task 209 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.375.460 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.871.914 I slot print_timing: id 14 | task 168 | n_decoded = 102, tg = 23.36 t/s, tg_3s = 23.36 t/s
1.01.351.602 I slot print_timing: id 3 | task 126 | prompt eval time = 153.03 ms / 29 tokens ( 5.28 ms per token, 189.51 tokens per second)
1.01.351.605 I slot print_timing: id 3 | task 126 | eval time = 8694.26 ms / 128 tokens ( 67.92 ms per token, 14.72 tokens per second)
1.01.351.605 I slot print_timing: id 3 | task 126 | total time = 8847.29 ms / 157 tokens
1.01.351.606 I slot print_timing: id 3 | task 126 | graphs reused = 1
1.01.351.609 I slot print_timing: id 3 | task 126 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.01.351.623 I statistics draft-mtp: #calls(b,g,a) = 55 162 2472, #gen drafts = 2487, #acc drafts = 1760, #gen tokens = 4962, #acc tokens = 3336, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.638), dur(b,g,a) = 0.032, 564.125, 2.848 ms
1.01.351.646 I slot release: id 3 | task 126 | stop processing: n_tokens = 156, truncated = 0
1.01.354.630 I slot print_timing: id 6 | task 155 | prompt eval time = 138.33 ms / 28 tokens ( 4.94 ms per token, 202.41 tokens per second)
1.01.354.632 I slot print_timing: id 6 | task 155 | eval time = 5963.05 ms / 125 tokens ( 47.70 ms per token, 20.96 tokens per second)
1.01.354.633 I slot print_timing: id 6 | task 155 | total time = 6101.39 ms / 153 tokens
1.01.354.633 I slot print_timing: id 6 | task 155 | graphs reused = 1
1.01.354.636 I slot print_timing: id 6 | task 155 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.01.354.643 I statistics draft-mtp: #calls(b,g,a) = 55 162 2478, #gen drafts = 2487, #acc drafts = 1764, #gen tokens = 4962, #acc tokens = 3343, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.637), dur(b,g,a) = 0.032, 564.125, 2.856 ms
1.01.354.667 I slot release: id 6 | task 155 | stop processing: n_tokens = 152, truncated = 0
1.01.355.902 I slot print_timing: id 8 | task 167 | n_decoded = 101, tg = 20.82 t/s, tg_3s = 20.82 t/s
1.01.358.877 I slot print_timing: id 14 | task 168 | prompt eval time = 132.46 ms / 25 tokens ( 5.30 ms per token, 188.74 tokens per second)
1.01.358.879 I slot print_timing: id 14 | task 168 | eval time = 4852.72 ms / 114 tokens ( 42.57 ms per token, 23.49 tokens per second)
1.01.358.879 I slot print_timing: id 14 | task 168 | total time = 4985.18 ms / 139 tokens
1.01.358.879 I slot print_timing: id 14 | task 168 | graphs reused = 1
1.01.358.881 I slot print_timing: id 14 | task 168 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.01.358.887 I statistics draft-mtp: #calls(b,g,a) = 55 162 2486, #gen drafts = 2487, #acc drafts = 1771, #gen tokens = 4962, #acc tokens = 3355, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.637), dur(b,g,a) = 0.032, 564.125, 2.864 ms
1.01.358.907 I slot release: id 14 | task 168 | stop processing: n_tokens = 138, truncated = 0
1.01.361.267 I srv operator(): Chat format: peg-native
1.01.363.386 I srv operator(): Chat format: peg-native
1.01.367.594 I srv operator(): Chat format: peg-native
1.01.465.265 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.01.465.332 I slot launch_slot_: id 3 | task 219 | processing task, is_child = 0
1.01.465.335 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.01.465.353 I slot launch_slot_: id 6 | task 220 | processing task, is_child = 0
1.01.465.355 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.01.465.370 I slot launch_slot_: id 14 | task 221 | processing task, is_child = 0
1.01.471.406 W slot operator(): id 3 | task 219 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.471.425 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.471.477 W slot operator(): id 6 | task 220 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.471.510 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.471.532 W slot operator(): id 14 | task 221 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.471.560 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.02.111.717 I slot print_timing: id 0 | task 153 | n_decoded = 100, tg = 14.55 t/s, tg_3s = 14.55 t/s
1.02.116.074 I slot print_timing: id 9 | task 181 | n_decoded = 102, tg = 23.42 t/s, tg_3s = 23.42 t/s
1.02.476.832 I slot print_timing: id 4 | task 138 | prompt eval time = 139.38 ms / 29 tokens ( 4.81 ms per token, 208.06 tokens per second)
1.02.476.836 I slot print_timing: id 4 | task 138 | eval time = 8702.27 ms / 128 tokens ( 67.99 ms per token, 14.71 tokens per second)
1.02.476.836 I slot print_timing: id 4 | task 138 | total time = 8841.65 ms / 157 tokens
1.02.476.837 I slot print_timing: id 4 | task 138 | graphs reused = 1
1.02.476.840 I slot print_timing: id 4 | task 138 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.02.476.854 I statistics draft-mtp: #calls(b,g,a) = 58 171 2609, #gen drafts = 2624, #acc drafts = 1857, #gen tokens = 5235, #acc tokens = 3518, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.637), dur(b,g,a) = 0.033, 598.751, 3.020 ms
1.02.476.878 I slot release: id 4 | task 138 | stop processing: n_tokens = 156, truncated = 0
1.02.481.654 I slot print_timing: id 8 | task 167 | prompt eval time = 132.24 ms / 28 tokens ( 4.72 ms per token, 211.73 tokens per second)
1.02.481.657 I slot print_timing: id 8 | task 167 | eval time = 5975.78 ms / 125 tokens ( 47.81 ms per token, 20.92 tokens per second)
1.02.481.658 I slot print_timing: id 8 | task 167 | total time = 6108.02 ms / 153 tokens
1.02.481.658 I slot print_timing: id 8 | task 167 | graphs reused = 1
1.02.481.661 I slot print_timing: id 8 | task 167 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.02.481.667 I statistics draft-mtp: #calls(b,g,a) = 58 171 2617, #gen drafts = 2624, #acc drafts = 1864, #gen tokens = 5235, #acc tokens = 3532, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.637), dur(b,g,a) = 0.033, 598.751, 3.029 ms
1.02.481.690 I slot release: id 8 | task 167 | stop processing: n_tokens = 152, truncated = 0
1.02.486.033 I srv operator(): Chat format: peg-native
1.02.490.866 I srv operator(): Chat format: peg-native
1.02.593.034 I slot print_timing: id 5 | task 180 | n_decoded = 101, tg = 20.90 t/s, tg_3s = 20.90 t/s
1.02.594.830 I slot print_timing: id 9 | task 181 | prompt eval time = 140.27 ms / 25 tokens ( 5.61 ms per token, 178.22 tokens per second)
1.02.594.832 I slot print_timing: id 9 | task 181 | eval time = 4833.55 ms / 114 tokens ( 42.40 ms per token, 23.59 tokens per second)
1.02.594.833 I slot print_timing: id 9 | task 181 | total time = 4973.82 ms / 139 tokens
1.02.594.834 I slot print_timing: id 9 | task 181 | graphs reused = 1
1.02.594.836 I slot print_timing: id 9 | task 181 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (1.000, 0.897)
1.02.594.848 I statistics draft-mtp: #calls(b,g,a) = 58 172 2632, #gen drafts = 2638, #acc drafts = 1875, #gen tokens = 5263, #acc tokens = 3553, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.638), dur(b,g,a) = 0.033, 604.371, 3.048 ms
1.02.594.877 I slot release: id 9 | task 181 | stop processing: n_tokens = 138, truncated = 0
1.02.597.857 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.02.597.932 I slot launch_slot_: id 4 | task 230 | processing task, is_child = 0
1.02.597.935 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.02.597.954 I slot launch_slot_: id 8 | task 232 | processing task, is_child = 0
1.02.603.348 I srv operator(): Chat format: peg-native
1.02.603.455 W slot operator(): id 4 | task 230 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.02.603.491 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.02.603.527 W slot operator(): id 8 | task 232 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.02.603.550 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.02.742.813 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.02.742.887 I slot launch_slot_: id 9 | task 234 | processing task, is_child = 0
1.02.747.837 W slot operator(): id 9 | task 234 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.02.747.872 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.239.705 I slot print_timing: id 1 | task 165 | n_decoded = 100, tg = 14.54 t/s, tg_3s = 14.54 t/s
1.03.487.365 I slot print_timing: id 10 | task 170 | n_decoded = 100, tg = 14.61 t/s, tg_3s = 14.61 t/s
1.03.728.795 I slot print_timing: id 5 | task 180 | prompt eval time = 140.07 ms / 28 tokens ( 5.00 ms per token, 199.90 tokens per second)
1.03.728.797 I slot print_timing: id 5 | task 180 | eval time = 5967.77 ms / 125 tokens ( 47.74 ms per token, 20.95 tokens per second)
1.03.728.798 I slot print_timing: id 5 | task 180 | total time = 6107.85 ms / 153 tokens
1.03.728.799 I slot print_timing: id 5 | task 180 | graphs reused = 1
1.03.728.802 I slot print_timing: id 5 | task 180 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.03.728.813 I statistics draft-mtp: #calls(b,g,a) = 61 181 2768, #gen drafts = 2778, #acc drafts = 1969, #gen tokens = 5543, #acc tokens = 3729, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.636), dur(b,g,a) = 0.035, 636.289, 3.222 ms
1.03.728.843 I slot release: id 5 | task 180 | stop processing: n_tokens = 152, truncated = 0
1.03.729.761 I slot print_timing: id 7 | task 197 | n_decoded = 102, tg = 23.39 t/s, tg_3s = 23.39 t/s
1.03.737.407 I srv operator(): Chat format: peg-native
1.03.850.572 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.03.850.654 I slot launch_slot_: id 5 | task 244 | processing task, is_child = 0
1.03.855.551 W slot operator(): id 5 | task 244 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.855.579 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.988.883 I slot print_timing: id 15 | task 194 | n_decoded = 101, tg = 20.71 t/s, tg_3s = 20.71 t/s
1.04.221.752 I slot print_timing: id 0 | task 153 | prompt eval time = 111.96 ms / 29 tokens ( 3.86 ms per token, 259.02 tokens per second)
1.04.221.755 I slot print_timing: id 0 | task 153 | eval time = 8981.14 ms / 128 tokens ( 70.17 ms per token, 14.25 tokens per second)
1.04.221.756 I slot print_timing: id 0 | task 153 | total time = 9093.10 ms / 157 tokens
1.04.221.756 I slot print_timing: id 0 | task 153 | graphs reused = 1
1.04.221.759 I slot print_timing: id 0 | task 153 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.04.221.778 I statistics draft-mtp: #calls(b,g,a) = 62 185 2824, #gen drafts = 2839, #acc drafts = 2005, #gen tokens = 5664, #acc tokens = 3799, #mean acc len = 2.35, #acc rate/pos = (0.710, 0.635), dur(b,g,a) = 0.036, 651.366, 3.283 ms
1.04.221.803 I slot release: id 0 | task 153 | stop processing: n_tokens = 156, truncated = 0
1.04.225.764 I slot print_timing: id 7 | task 197 | prompt eval time = 125.17 ms / 25 tokens ( 5.01 ms per token, 199.73 tokens per second)
1.04.225.766 I slot print_timing: id 7 | task 197 | eval time = 4856.56 ms / 114 tokens ( 42.60 ms per token, 23.47 tokens per second)
1.04.225.767 I slot print_timing: id 7 | task 197 | total time = 4981.73 ms / 139 tokens
1.04.225.767 I slot print_timing: id 7 | task 197 | graphs reused = 1
1.04.225.770 I slot print_timing: id 7 | task 197 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.04.225.776 I statistics draft-mtp: #calls(b,g,a) = 62 185 2831, #gen drafts = 2839, #acc drafts = 2012, #gen tokens = 5664, #acc tokens = 3812, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.636), dur(b,g,a) = 0.036, 651.366, 3.292 ms
1.04.225.797 I slot release: id 7 | task 197 | stop processing: n_tokens = 138, truncated = 0
1.04.230.809 I srv operator(): Chat format: peg-native
1.04.233.824 I srv operator(): Chat format: peg-native
1.04.338.379 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.04.338.456 I slot launch_slot_: id 0 | task 249 | processing task, is_child = 0
1.04.338.459 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.04.338.478 I slot launch_slot_: id 7 | task 250 | processing task, is_child = 0
1.04.343.326 W slot operator(): id 0 | task 249 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.343.354 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.343.391 W slot operator(): id 7 | task 250 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.343.427 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.853.660 I slot print_timing: id 13 | task 209 | n_decoded = 102, tg = 23.43 t/s, tg_3s = 23.43 t/s
1.05.093.593 I slot print_timing: id 2 | task 206 | n_decoded = 101, tg = 20.84 t/s, tg_3s = 20.84 t/s
1.05.099.362 I slot print_timing: id 15 | task 194 | prompt eval time = 123.54 ms / 28 tokens ( 4.41 ms per token, 226.65 tokens per second)
1.05.099.365 I slot print_timing: id 15 | task 194 | eval time = 5986.21 ms / 125 tokens ( 47.89 ms per token, 20.88 tokens per second)
1.05.099.366 I slot print_timing: id 15 | task 194 | total time = 6109.75 ms / 153 tokens
1.05.099.367 I slot print_timing: id 15 | task 194 | graphs reused = 1
1.05.099.370 I slot print_timing: id 15 | task 194 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.05.099.385 I statistics draft-mtp: #calls(b,g,a) = 64 192 2947, #gen drafts = 2947, #acc drafts = 2088, #gen tokens = 5880, #acc tokens = 3958, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.635), dur(b,g,a) = 0.038, 676.517, 3.429 ms
1.05.099.414 I slot release: id 15 | task 194 | stop processing: n_tokens = 152, truncated = 0
1.05.107.559 I srv operator(): Chat format: peg-native
1.05.213.970 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.05.214.038 I slot launch_slot_: id 15 | task 258 | processing task, is_child = 0
1.05.217.919 W slot operator(): id 15 | task 258 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.217.950 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.341.303 I slot print_timing: id 1 | task 165 | prompt eval time = 112.64 ms / 29 tokens ( 3.88 ms per token, 257.45 tokens per second)
1.05.341.306 I slot print_timing: id 1 | task 165 | eval time = 8981.12 ms / 128 tokens ( 70.17 ms per token, 14.25 tokens per second)
1.05.341.306 I slot print_timing: id 1 | task 165 | total time = 9093.77 ms / 157 tokens
1.05.341.307 I slot print_timing: id 1 | task 165 | graphs reused = 1
1.05.341.310 I slot print_timing: id 1 | task 165 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.05.341.324 I statistics draft-mtp: #calls(b,g,a) = 64 194 2962, #gen drafts = 2976, #acc drafts = 2097, #gen tokens = 5937, #acc tokens = 3976, #mean acc len = 2.34, #acc rate/pos = (0.708, 0.634), dur(b,g,a) = 0.038, 683.364, 3.446 ms
1.05.341.348 I slot release: id 1 | task 165 | stop processing: n_tokens = 156, truncated = 0
1.05.348.584 I slot print_timing: id 13 | task 209 | prompt eval time = 124.38 ms / 25 tokens ( 4.98 ms per token, 200.99 tokens per second)
1.05.348.587 I slot print_timing: id 13 | task 209 | eval time = 4848.75 ms / 114 tokens ( 42.53 ms per token, 23.51 tokens per second)
1.05.348.587 I slot print_timing: id 13 | task 209 | total time = 4973.14 ms / 139 tokens
1.05.348.588 I slot print_timing: id 13 | task 209 | graphs reused = 1
1.05.348.590 I slot print_timing: id 13 | task 209 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.05.348.596 I statistics draft-mtp: #calls(b,g,a) = 65 194 2975, #gen drafts = 2976, #acc drafts = 2108, #gen tokens = 5937, #acc tokens = 3996, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.635), dur(b,g,a) = 0.039, 683.364, 3.463 ms
1.05.348.617 I slot release: id 13 | task 209 | stop processing: n_tokens = 138, truncated = 0
1.05.350.588 I srv operator(): Chat format: peg-native
1.05.357.108 I srv operator(): Chat format: peg-native
1.05.457.753 I slot print_timing: id 12 | task 191 | n_decoded = 100, tg = 15.16 t/s, tg_3s = 15.16 t/s
1.05.458.967 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.05.459.033 I slot launch_slot_: id 1 | task 261 | processing task, is_child = 0
1.05.459.037 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.05.459.055 I slot launch_slot_: id 13 | task 262 | processing task, is_child = 0
1.05.465.070 W slot operator(): id 1 | task 261 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.465.096 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.465.133 W slot operator(): id 13 | task 262 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.465.155 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.602.154 I slot print_timing: id 10 | task 170 | prompt eval time = 125.13 ms / 29 tokens ( 4.31 ms per token, 231.76 tokens per second)
1.05.602.158 I slot print_timing: id 10 | task 170 | eval time = 8960.06 ms / 128 tokens ( 70.00 ms per token, 14.29 tokens per second)
1.05.602.158 I slot print_timing: id 10 | task 170 | total time = 9085.19 ms / 157 tokens
1.05.602.159 I slot print_timing: id 10 | task 170 | graphs reused = 1
1.05.602.162 I slot print_timing: id 10 | task 170 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.05.602.176 I statistics draft-mtp: #calls(b,g,a) = 66 196 2990, #gen drafts = 3003, #acc drafts = 2119, #gen tokens = 5990, #acc tokens = 4017, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.635), dur(b,g,a) = 0.040, 694.054, 3.479 ms
1.05.602.199 I slot release: id 10 | task 170 | stop processing: n_tokens = 156, truncated = 0
1.05.611.704 I srv operator(): Chat format: peg-native
1.05.726.043 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.05.726.109 I slot launch_slot_: id 10 | task 265 | processing task, is_child = 0
1.05.730.757 W slot operator(): id 10 | task 265 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.730.787 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.984.964 I slot print_timing: id 14 | task 221 | n_decoded = 102, tg = 23.40 t/s, tg_3s = 23.40 t/s
1.06.222.747 I slot print_timing: id 2 | task 206 | prompt eval time = 125.19 ms / 28 tokens ( 4.47 ms per token, 223.66 tokens per second)
1.06.222.750 I slot print_timing: id 2 | task 206 | eval time = 5976.58 ms / 125 tokens ( 47.81 ms per token, 20.91 tokens per second)
1.06.222.750 I slot print_timing: id 2 | task 206 | total time = 6101.77 ms / 153 tokens
1.06.222.751 I slot print_timing: id 2 | task 206 | graphs reused = 1
1.06.222.754 I slot print_timing: id 2 | task 206 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.06.222.769 I statistics draft-mtp: #calls(b,g,a) = 68 201 3068, #gen drafts = 3081, #acc drafts = 2175, #gen tokens = 6146, #acc tokens = 4122, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.635), dur(b,g,a) = 0.041, 712.174, 3.575 ms
1.06.222.794 I slot release: id 2 | task 206 | stop processing: n_tokens = 152, truncated = 0
1.06.231.460 I srv operator(): Chat format: peg-native
1.06.344.866 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.06.344.941 I slot launch_slot_: id 2 | task 271 | processing task, is_child = 0
1.06.349.027 W slot operator(): id 2 | task 271 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.06.349.046 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.06.477.961 I slot print_timing: id 6 | task 220 | n_decoded = 101, tg = 20.81 t/s, tg_3s = 20.81 t/s
1.06.482.989 I slot print_timing: id 14 | task 221 | prompt eval time = 153.68 ms / 25 tokens ( 6.15 ms per token, 162.67 tokens per second)
1.06.482.992 I slot print_timing: id 14 | task 221 | eval time = 4857.73 ms / 114 tokens ( 42.61 ms per token, 23.47 tokens per second)
1.06.482.992 I slot print_timing: id 14 | task 221 | total time = 5011.41 ms / 139 tokens
1.06.482.993 I slot print_timing: id 14 | task 221 | graphs reused = 1
1.06.482.995 I slot print_timing: id 14 | task 221 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.06.483.004 I statistics draft-mtp: #calls(b,g,a) = 69 203 3110, #gen drafts = 3111, #acc drafts = 2205, #gen tokens = 6206, #acc tokens = 4179, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.635), dur(b,g,a) = 0.042, 720.132, 3.624 ms
1.06.483.026 I slot release: id 14 | task 221 | stop processing: n_tokens = 138, truncated = 0
1.06.491.321 I srv operator(): Chat format: peg-native
1.06.599.972 I slot print_timing: id 11 | task 203 | n_decoded = 100, tg = 15.13 t/s, tg_3s = 15.13 t/s
1.06.602.579 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.06.602.654 I slot launch_slot_: id 14 | task 274 | processing task, is_child = 0
1.06.606.595 W slot operator(): id 14 | task 274 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.06.606.622 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.07.223.168 I slot print_timing: id 9 | task 234 | n_decoded = 102, tg = 23.44 t/s, tg_3s = 23.44 t/s
1.07.583.452 I slot print_timing: id 12 | task 191 | prompt eval time = 123.00 ms / 29 tokens ( 4.24 ms per token, 235.76 tokens per second)
1.07.583.455 I slot print_timing: id 12 | task 191 | eval time = 8720.46 ms / 128 tokens ( 68.13 ms per token, 14.68 tokens per second)
1.07.583.455 I slot print_timing: id 12 | task 191 | total time = 8843.47 ms / 157 tokens
1.07.583.456 I slot print_timing: id 12 | task 191 | graphs reused = 1
1.07.583.460 I slot print_timing: id 12 | task 191 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.07.583.480 I statistics draft-mtp: #calls(b,g,a) = 70 212 3237, #gen drafts = 3252, #acc drafts = 2290, #gen tokens = 6487, #acc tokens = 4339, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.633), dur(b,g,a) = 0.043, 749.866, 3.759 ms
1.07.583.507 I slot release: id 12 | task 191 | stop processing: n_tokens = 156, truncated = 0
1.07.587.025 I slot print_timing: id 6 | task 220 | prompt eval time = 153.48 ms / 28 tokens ( 5.48 ms per token, 182.44 tokens per second)
1.07.587.028 I slot print_timing: id 6 | task 220 | eval time = 5962.04 ms / 125 tokens ( 47.70 ms per token, 20.97 tokens per second)
1.07.587.028 I slot print_timing: id 6 | task 220 | total time = 6115.52 ms / 153 tokens
1.07.587.029 I slot print_timing: id 6 | task 220 | graphs reused = 1
1.07.587.031 I slot print_timing: id 6 | task 220 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.07.587.037 I statistics draft-mtp: #calls(b,g,a) = 70 212 3244, #gen drafts = 3252, #acc drafts = 2295, #gen tokens = 6487, #acc tokens = 4348, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.633), dur(b,g,a) = 0.043, 749.866, 3.768 ms
1.07.587.057 I slot release: id 6 | task 220 | stop processing: n_tokens = 152, truncated = 0
1.07.588.265 I slot print_timing: id 8 | task 232 | n_decoded = 101, tg = 20.82 t/s, tg_3s = 20.82 t/s
1.07.592.750 I srv operator(): Chat format: peg-native
1.07.595.792 I srv operator(): Chat format: peg-native
1.07.700.856 I slot print_timing: id 9 | task 234 | prompt eval time = 124.55 ms / 25 tokens ( 4.98 ms per token, 200.72 tokens per second)
1.07.700.859 I slot print_timing: id 9 | task 234 | eval time = 4828.44 ms / 114 tokens ( 42.35 ms per token, 23.61 tokens per second)
1.07.700.860 I slot print_timing: id 9 | task 234 | total time = 4952.99 ms / 139 tokens
1.07.700.860 I slot print_timing: id 9 | task 234 | graphs reused = 1
1.07.700.863 I slot print_timing: id 9 | task 234 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.07.700.874 I statistics draft-mtp: #calls(b,g,a) = 70 213 3261, #gen drafts = 3266, #acc drafts = 2309, #gen tokens = 6515, #acc tokens = 4376, #mean acc len = 2.34, #acc rate/pos = (0.708, 0.634), dur(b,g,a) = 0.043, 755.314, 3.788 ms
1.07.700.899 I slot release: id 9 | task 234 | stop processing: n_tokens = 138, truncated = 0
1.07.703.568 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.07.703.635 I slot launch_slot_: id 12 | task 284 | processing task, is_child = 0
1.07.703.638 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.07.703.656 I slot launch_slot_: id 6 | task 285 | processing task, is_child = 0
1.07.709.487 I srv operator(): Chat format: peg-native
1.07.709.567 W slot operator(): id 6 | task 285 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.709.599 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.07.709.626 W slot operator(): id 12 | task 284 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.709.659 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.07.849.377 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.07.849.453 I slot launch_slot_: id 9 | task 287 | processing task, is_child = 0
1.07.854.062 W slot operator(): id 9 | task 287 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.854.095 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.466.463 I slot print_timing: id 3 | task 219 | n_decoded = 100, tg = 14.62 t/s, tg_3s = 14.62 t/s
1.08.710.531 I slot print_timing: id 11 | task 203 | prompt eval time = 125.44 ms / 29 tokens ( 4.33 ms per token, 231.18 tokens per second)
1.08.710.537 I slot print_timing: id 11 | task 203 | eval time = 8718.18 ms / 128 tokens ( 68.11 ms per token, 14.68 tokens per second)
1.08.710.537 I slot print_timing: id 11 | task 203 | total time = 8843.62 ms / 157 tokens
1.08.710.538 I slot print_timing: id 11 | task 203 | graphs reused = 1
1.08.710.541 I slot print_timing: id 11 | task 203 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.08.710.553 I statistics draft-mtp: #calls(b,g,a) = 73 221 3374, #gen drafts = 3389, #acc drafts = 2387, #gen tokens = 6760, #acc tokens = 4523, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.633), dur(b,g,a) = 0.045, 785.042, 3.916 ms
1.08.710.576 I slot release: id 11 | task 203 | stop processing: n_tokens = 156, truncated = 0
1.08.715.116 I slot print_timing: id 8 | task 232 | prompt eval time = 133.02 ms / 28 tokens ( 4.75 ms per token, 210.50 tokens per second)
1.08.715.118 I slot print_timing: id 8 | task 232 | eval time = 5978.54 ms / 125 tokens ( 47.83 ms per token, 20.91 tokens per second)
1.08.715.119 I slot print_timing: id 8 | task 232 | total time = 6111.56 ms / 153 tokens
1.08.715.119 I slot print_timing: id 8 | task 232 | graphs reused = 1
1.08.715.121 I slot print_timing: id 8 | task 232 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.08.715.127 I statistics draft-mtp: #calls(b,g,a) = 73 221 3383, #gen drafts = 3389, #acc drafts = 2393, #gen tokens = 6760, #acc tokens = 4535, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.633), dur(b,g,a) = 0.045, 785.042, 3.926 ms
1.08.715.150 I slot release: id 8 | task 232 | stop processing: n_tokens = 152, truncated = 0
1.08.719.908 I srv operator(): Chat format: peg-native
1.08.723.413 I srv operator(): Chat format: peg-native
1.08.827.240 I slot print_timing: id 7 | task 250 | n_decoded = 102, tg = 23.47 t/s, tg_3s = 23.47 t/s
1.08.830.040 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.08.830.105 I slot launch_slot_: id 11 | task 296 | processing task, is_child = 0
1.08.830.108 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.08.830.125 I slot launch_slot_: id 8 | task 297 | processing task, is_child = 0
1.08.835.789 W slot operator(): id 8 | task 297 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.835.821 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.835.848 W slot operator(): id 11 | task 296 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.835.873 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.09.339.759 I slot print_timing: id 0 | task 249 | n_decoded = 101, tg = 20.79 t/s, tg_3s = 20.79 t/s
1.09.343.676 I slot print_timing: id 7 | task 250 | prompt eval time = 138.67 ms / 25 tokens ( 5.55 ms per token, 180.28 tokens per second)
1.09.343.679 I slot print_timing: id 7 | task 250 | eval time = 4861.58 ms / 114 tokens ( 42.65 ms per token, 23.45 tokens per second)
1.09.343.679 I slot print_timing: id 7 | task 250 | total time = 5000.25 ms / 139 tokens
1.09.343.680 I slot print_timing: id 7 | task 250 | graphs reused = 1
1.09.343.683 I slot print_timing: id 7 | task 250 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.09.343.694 I statistics draft-mtp: #calls(b,g,a) = 75 226 3457, #gen drafts = 3465, #acc drafts = 2445, #gen tokens = 6912, #acc tokens = 4634, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.633), dur(b,g,a) = 0.045, 805.300, 4.010 ms
1.09.343.721 I slot release: id 7 | task 250 | stop processing: n_tokens = 138, truncated = 0
1.09.351.916 I srv operator(): Chat format: peg-native
1.09.464.159 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.09.464.226 I slot launch_slot_: id 7 | task 303 | processing task, is_child = 0
1.09.469.326 W slot operator(): id 7 | task 303 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.09.469.368 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.09.597.086 I slot print_timing: id 4 | task 230 | n_decoded = 100, tg = 14.58 t/s, tg_3s = 14.58 t/s
1.09.966.595 I slot print_timing: id 13 | task 262 | n_decoded = 102, tg = 23.37 t/s, tg_3s = 23.37 t/s
1.10.449.985 I slot print_timing: id 0 | task 249 | prompt eval time = 138.43 ms / 28 tokens ( 4.94 ms per token, 202.28 tokens per second)
1.10.449.989 I slot print_timing: id 0 | task 249 | eval time = 5968.19 ms / 125 tokens ( 47.75 ms per token, 20.94 tokens per second)
1.10.449.989 I slot print_timing: id 0 | task 249 | total time = 6106.61 ms / 153 tokens
1.10.449.990 I slot print_timing: id 0 | task 249 | graphs reused = 1
1.10.449.993 I slot print_timing: id 0 | task 249 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.10.450.006 I statistics draft-mtp: #calls(b,g,a) = 76 235 3592, #gen drafts = 3607, #acc drafts = 2537, #gen tokens = 7195, #acc tokens = 4807, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.632), dur(b,g,a) = 0.046, 836.476, 4.172 ms
1.10.450.031 I slot release: id 0 | task 249 | stop processing: n_tokens = 152, truncated = 0
1.10.450.962 I slot print_timing: id 1 | task 261 | n_decoded = 101, tg = 20.83 t/s, tg_3s = 20.83 t/s
1.10.457.175 I slot print_timing: id 13 | task 262 | prompt eval time = 137.33 ms / 25 tokens ( 5.49 ms per token, 182.04 tokens per second)
1.10.457.178 I slot print_timing: id 13 | task 262 | eval time = 4854.66 ms / 114 tokens ( 42.58 ms per token, 23.48 tokens per second)
1.10.457.179 I slot print_timing: id 13 | task 262 | total time = 4991.99 ms / 139 tokens
1.10.457.179 I slot print_timing: id 13 | task 262 | graphs reused = 1
1.10.457.182 I slot print_timing: id 13 | task 262 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (1.000, 0.897)
1.10.457.193 I statistics draft-mtp: #calls(b,g,a) = 76 235 3605, #gen drafts = 3607, #acc drafts = 2546, #gen tokens = 7195, #acc tokens = 4824, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.632), dur(b,g,a) = 0.046, 836.476, 4.188 ms
1.10.457.219 I slot release: id 13 | task 262 | stop processing: n_tokens = 138, truncated = 0
1.10.459.103 I srv operator(): Chat format: peg-native
1.10.465.265 I srv operator(): Chat format: peg-native
1.10.560.061 I slot print_timing: id 3 | task 219 | prompt eval time = 153.28 ms / 29 tokens ( 5.29 ms per token, 189.20 tokens per second)
1.10.560.065 I slot print_timing: id 3 | task 219 | eval time = 8935.34 ms / 128 tokens ( 69.81 ms per token, 14.33 tokens per second)
1.10.560.065 I slot print_timing: id 3 | task 219 | total time = 9088.62 ms / 157 tokens
1.10.560.067 I slot print_timing: id 3 | task 219 | graphs reused = 1
1.10.560.069 I slot print_timing: id 3 | task 219 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.10.560.082 I statistics draft-mtp: #calls(b,g,a) = 76 236 3607, #gen drafts = 3620, #acc drafts = 2547, #gen tokens = 7221, #acc tokens = 4826, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.632), dur(b,g,a) = 0.046, 841.257, 4.190 ms
1.10.560.106 I slot release: id 3 | task 219 | stop processing: n_tokens = 156, truncated = 0
1.10.562.634 I slot print_timing: id 5 | task 244 | n_decoded = 100, tg = 15.19 t/s, tg_3s = 15.19 t/s
1.10.566.343 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.10.566.411 I slot launch_slot_: id 3 | task 313 | processing task, is_child = 0
1.10.566.413 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.10.566.432 I slot launch_slot_: id 0 | task 314 | processing task, is_child = 0
1.10.568.590 I srv operator(): Chat format: peg-native
1.10.571.141 W slot operator(): id 0 | task 314 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.571.169 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.571.202 W slot operator(): id 3 | task 313 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.571.235 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.710.872 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.10.710.929 I slot launch_slot_: id 13 | task 316 | processing task, is_child = 0
1.10.714.909 W slot operator(): id 13 | task 316 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.714.937 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.090.593 I slot print_timing: id 14 | task 274 | n_decoded = 102, tg = 23.40 t/s, tg_3s = 23.40 t/s
1.11.328.218 I slot print_timing: id 2 | task 271 | n_decoded = 101, tg = 20.81 t/s, tg_3s = 20.81 t/s
1.11.571.096 I slot print_timing: id 1 | task 261 | prompt eval time = 136.84 ms / 28 tokens ( 4.89 ms per token, 204.61 tokens per second)
1.11.571.099 I slot print_timing: id 1 | task 261 | eval time = 5969.16 ms / 125 tokens ( 47.75 ms per token, 20.94 tokens per second)
1.11.571.099 I slot print_timing: id 1 | task 261 | total time = 6106.00 ms / 153 tokens
1.11.571.100 I slot print_timing: id 1 | task 261 | graphs reused = 1
1.11.571.103 I slot print_timing: id 1 | task 261 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.11.571.116 I statistics draft-mtp: #calls(b,g,a) = 79 244 3730, #gen drafts = 3744, #acc drafts = 2629, #gen tokens = 7468, #acc tokens = 4984, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.047, 868.058, 4.330 ms
1.11.571.141 I slot release: id 1 | task 261 | stop processing: n_tokens = 152, truncated = 0
1.11.577.782 I slot print_timing: id 14 | task 274 | prompt eval time = 125.56 ms / 25 tokens ( 5.02 ms per token, 199.11 tokens per second)
1.11.577.784 I slot print_timing: id 14 | task 274 | eval time = 4845.59 ms / 114 tokens ( 42.51 ms per token, 23.53 tokens per second)
1.11.577.784 I slot print_timing: id 14 | task 274 | total time = 4971.14 ms / 139 tokens
1.11.577.785 I slot print_timing: id 14 | task 274 | graphs reused = 1
1.11.577.787 I slot print_timing: id 14 | task 274 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.11.577.794 I statistics draft-mtp: #calls(b,g,a) = 79 244 3743, #gen drafts = 3744, #acc drafts = 2639, #gen tokens = 7468, #acc tokens = 5003, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.632), dur(b,g,a) = 0.047, 868.058, 4.343 ms
1.11.577.816 I slot release: id 14 | task 274 | stop processing: n_tokens = 138, truncated = 0
1.11.579.938 I srv operator(): Chat format: peg-native
1.11.586.047 I srv operator(): Chat format: peg-native
1.11.681.344 I slot print_timing: id 4 | task 230 | prompt eval time = 132.81 ms / 29 tokens ( 4.58 ms per token, 218.35 tokens per second)
1.11.681.347 I slot print_timing: id 4 | task 230 | eval time = 8945.05 ms / 128 tokens ( 69.88 ms per token, 14.31 tokens per second)
1.11.681.348 I slot print_timing: id 4 | task 230 | total time = 9077.86 ms / 157 tokens
1.11.681.349 I slot print_timing: id 4 | task 230 | graphs reused = 1
1.11.681.351 I slot print_timing: id 4 | task 230 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.11.681.363 I statistics draft-mtp: #calls(b,g,a) = 79 245 3744, #gen drafts = 3757, #acc drafts = 2640, #gen tokens = 7494, #acc tokens = 5004, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.047, 873.484, 4.344 ms
1.11.681.387 I slot release: id 4 | task 230 | stop processing: n_tokens = 156, truncated = 0
1.11.688.222 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.11.688.290 I slot launch_slot_: id 4 | task 325 | processing task, is_child = 0
1.11.688.293 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.11.688.310 I slot launch_slot_: id 1 | task 326 | processing task, is_child = 0
1.11.689.863 I srv operator(): Chat format: peg-native
1.11.693.854 W slot operator(): id 1 | task 326 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.11.693.892 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.693.920 W slot operator(): id 4 | task 325 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.11.693.943 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.834.843 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.11.834.914 I slot launch_slot_: id 14 | task 328 | processing task, is_child = 0
1.11.838.823 W slot operator(): id 14 | task 328 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.11.838.853 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.971.002 I slot print_timing: id 15 | task 258 | n_decoded = 100, tg = 15.08 t/s, tg_3s = 15.08 t/s
1.12.333.877 I slot print_timing: id 9 | task 287 | n_decoded = 102, tg = 23.42 t/s, tg_3s = 23.42 t/s
1.12.452.380 I slot print_timing: id 2 | task 271 | prompt eval time = 125.50 ms / 28 tokens ( 4.48 ms per token, 223.10 tokens per second)
1.12.452.383 I slot print_timing: id 2 | task 271 | eval time = 5977.82 ms / 125 tokens ( 47.82 ms per token, 20.91 tokens per second)
1.12.452.384 I slot print_timing: id 2 | task 271 | total time = 6103.32 ms / 153 tokens
1.12.452.385 I slot print_timing: id 2 | task 271 | graphs reused = 1
1.12.452.387 I slot print_timing: id 2 | task 271 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.12.452.405 I statistics draft-mtp: #calls(b,g,a) = 82 251 3836, #gen drafts = 3849, #acc drafts = 2706, #gen tokens = 7678, #acc tokens = 5126, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.049, 894.913, 4.446 ms
1.12.452.434 I slot release: id 2 | task 271 | stop processing: n_tokens = 152, truncated = 0
1.12.461.393 I srv operator(): Chat format: peg-native
1.12.574.361 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.12.574.429 I slot launch_slot_: id 2 | task 335 | processing task, is_child = 0
1.12.579.147 W slot operator(): id 2 | task 335 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.579.181 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.703.539 I slot print_timing: id 5 | task 244 | prompt eval time = 125.78 ms / 29 tokens ( 4.34 ms per token, 230.55 tokens per second)
1.12.703.542 I slot print_timing: id 5 | task 244 | eval time = 8722.18 ms / 128 tokens ( 68.14 ms per token, 14.68 tokens per second)
1.12.703.542 I slot print_timing: id 5 | task 244 | total time = 8847.97 ms / 157 tokens
1.12.703.543 I slot print_timing: id 5 | task 244 | graphs reused = 1
1.12.703.545 I slot print_timing: id 5 | task 244 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.12.703.560 I statistics draft-mtp: #calls(b,g,a) = 83 253 3864, #gen drafts = 3878, #acc drafts = 2722, #gen tokens = 7735, #acc tokens = 5158, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.049, 903.487, 4.478 ms
1.12.703.585 I slot release: id 5 | task 244 | stop processing: n_tokens = 156, truncated = 0
1.12.706.386 I slot print_timing: id 6 | task 285 | n_decoded = 101, tg = 20.77 t/s, tg_3s = 20.77 t/s
1.12.708.800 I slot print_timing: id 10 | task 265 | n_decoded = 100, tg = 14.59 t/s, tg_3s = 14.59 t/s
1.12.712.650 I srv operator(): Chat format: peg-native
1.12.824.989 I slot print_timing: id 9 | task 287 | prompt eval time = 124.79 ms / 25 tokens ( 4.99 ms per token, 200.33 tokens per second)
1.12.824.992 I slot print_timing: id 9 | task 287 | eval time = 4846.09 ms / 114 tokens ( 42.51 ms per token, 23.52 tokens per second)
1.12.824.992 I slot print_timing: id 9 | task 287 | total time = 4970.88 ms / 139 tokens
1.12.824.993 I slot print_timing: id 9 | task 287 | graphs reused = 1
1.12.824.996 I slot print_timing: id 9 | task 287 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.12.825.007 I statistics draft-mtp: #calls(b,g,a) = 83 254 3887, #gen drafts = 3893, #acc drafts = 2740, #gen tokens = 7765, #acc tokens = 5193, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.049, 907.715, 4.503 ms
1.12.825.036 I slot release: id 9 | task 287 | stop processing: n_tokens = 138, truncated = 0
1.12.827.943 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.12.828.010 I slot launch_slot_: id 5 | task 338 | processing task, is_child = 0
1.12.833.666 W slot operator(): id 5 | task 338 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.833.695 I srv operator(): Chat format: peg-native
1.12.833.699 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.960.372 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.12.960.451 I slot launch_slot_: id 9 | task 340 | processing task, is_child = 0
1.12.965.360 W slot operator(): id 9 | task 340 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.965.388 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.13.823.970 I slot print_timing: id 6 | task 285 | prompt eval time = 133.13 ms / 28 tokens ( 4.75 ms per token, 210.32 tokens per second)
1.13.823.973 I slot print_timing: id 6 | task 285 | eval time = 5981.24 ms / 125 tokens ( 47.85 ms per token, 20.90 tokens per second)
1.13.823.974 I slot print_timing: id 6 | task 285 | total time = 6114.37 ms / 153 tokens
1.13.823.975 I slot print_timing: id 6 | task 285 | graphs reused = 1
1.13.823.978 I slot print_timing: id 6 | task 285 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.13.823.990 I statistics draft-mtp: #calls(b,g,a) = 85 262 4009, #gen drafts = 4018, #acc drafts = 2823, #gen tokens = 8015, #acc tokens = 5350, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.050, 936.168, 4.644 ms
1.13.824.016 I slot release: id 6 | task 285 | stop processing: n_tokens = 152, truncated = 0
1.13.824.946 I slot print_timing: id 8 | task 297 | n_decoded = 101, tg = 20.82 t/s, tg_3s = 20.82 t/s
1.13.833.019 I srv operator(): Chat format: peg-native
1.13.941.550 I slot print_timing: id 7 | task 303 | n_decoded = 102, tg = 23.46 t/s, tg_3s = 23.46 t/s
1.13.945.760 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.13.945.831 I slot launch_slot_: id 6 | task 349 | processing task, is_child = 0
1.13.950.759 W slot operator(): id 6 | task 349 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.13.950.787 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.074.541 I slot print_timing: id 15 | task 258 | prompt eval time = 123.71 ms / 29 tokens ( 4.27 ms per token, 234.43 tokens per second)
1.14.074.544 I slot print_timing: id 15 | task 258 | eval time = 8732.90 ms / 128 tokens ( 68.23 ms per token, 14.66 tokens per second)
1.14.074.545 I slot print_timing: id 15 | task 258 | total time = 8856.60 ms / 157 tokens
1.14.074.546 I slot print_timing: id 15 | task 258 | graphs reused = 1
1.14.074.548 I slot print_timing: id 15 | task 258 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.14.074.559 I statistics draft-mtp: #calls(b,g,a) = 86 264 4033, #gen drafts = 4047, #acc drafts = 2840, #gen tokens = 8072, #acc tokens = 5384, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.631), dur(b,g,a) = 0.051, 945.551, 4.674 ms
1.14.074.584 I slot release: id 15 | task 258 | stop processing: n_tokens = 156, truncated = 0
1.14.084.577 I srv operator(): Chat format: peg-native
1.14.196.261 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.14.196.331 I slot launch_slot_: id 15 | task 352 | processing task, is_child = 0
1.14.199.402 W slot operator(): id 15 | task 352 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.199.423 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.449.432 I slot print_timing: id 7 | task 303 | prompt eval time = 124.92 ms / 25 tokens ( 5.00 ms per token, 200.12 tokens per second)
1.14.449.435 I slot print_timing: id 7 | task 303 | eval time = 4855.13 ms / 114 tokens ( 42.59 ms per token, 23.48 tokens per second)
1.14.449.436 I slot print_timing: id 7 | task 303 | total time = 4980.05 ms / 139 tokens
1.14.449.437 I slot print_timing: id 7 | task 303 | graphs reused = 1
1.14.449.445 I slot print_timing: id 7 | task 303 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.14.449.457 I statistics draft-mtp: #calls(b,g,a) = 87 267 4085, #gen drafts = 4093, #acc drafts = 2875, #gen tokens = 8164, #acc tokens = 5449, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.052, 954.545, 4.736 ms
1.14.449.484 I slot release: id 7 | task 303 | stop processing: n_tokens = 138, truncated = 0
1.14.458.341 I srv operator(): Chat format: peg-native
1.14.570.493 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.14.570.563 I slot launch_slot_: id 7 | task 356 | processing task, is_child = 0
1.14.575.695 W slot operator(): id 7 | task 356 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.575.730 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.706.640 I slot print_timing: id 12 | task 284 | n_decoded = 100, tg = 14.57 t/s, tg_3s = 14.57 t/s
1.14.823.127 I slot print_timing: id 10 | task 265 | prompt eval time = 125.47 ms / 29 tokens ( 4.33 ms per token, 231.14 tokens per second)
1.14.823.130 I slot print_timing: id 10 | task 265 | eval time = 8966.88 ms / 128 tokens ( 70.05 ms per token, 14.27 tokens per second)
1.14.823.130 I slot print_timing: id 10 | task 265 | total time = 9092.34 ms / 157 tokens
1.14.823.131 I slot print_timing: id 10 | task 265 | graphs reused = 1
1.14.823.134 I slot print_timing: id 10 | task 265 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.14.823.149 I statistics draft-mtp: #calls(b,g,a) = 88 270 4123, #gen drafts = 4138, #acc drafts = 2902, #gen tokens = 8253, #acc tokens = 5500, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.053, 968.920, 4.788 ms
1.14.823.176 I slot release: id 10 | task 265 | stop processing: n_tokens = 156, truncated = 0
1.14.832.511 I srv operator(): Chat format: peg-native
1.14.945.511 I slot print_timing: id 8 | task 297 | prompt eval time = 139.10 ms / 28 tokens ( 4.97 ms per token, 201.29 tokens per second)
1.14.945.514 I slot print_timing: id 8 | task 297 | eval time = 5970.58 ms / 125 tokens ( 47.76 ms per token, 20.94 tokens per second)
1.14.945.514 I slot print_timing: id 8 | task 297 | total time = 6109.68 ms / 153 tokens
1.14.945.515 I slot print_timing: id 8 | task 297 | graphs reused = 1
1.14.945.518 I slot print_timing: id 8 | task 297 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.14.945.529 I statistics draft-mtp: #calls(b,g,a) = 88 271 4147, #gen drafts = 4153, #acc drafts = 2921, #gen tokens = 8283, #acc tokens = 5536, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.631), dur(b,g,a) = 0.053, 973.536, 4.819 ms
1.14.945.549 I slot release: id 8 | task 297 | stop processing: n_tokens = 152, truncated = 0
1.14.948.494 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.14.948.563 I slot launch_slot_: id 10 | task 360 | processing task, is_child = 0
1.14.954.069 I srv operator(): Chat format: peg-native
1.14.954.248 W slot operator(): id 10 | task 360 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.954.274 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.15.079.562 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.15.079.631 I slot launch_slot_: id 8 | task 362 | processing task, is_child = 0
1.15.084.761 W slot operator(): id 8 | task 362 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.15.084.781 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.15.216.039 I slot print_timing: id 13 | task 316 | n_decoded = 102, tg = 23.31 t/s, tg_3s = 23.31 t/s
1.15.575.182 I slot print_timing: id 0 | task 314 | n_decoded = 101, tg = 20.73 t/s, tg_3s = 20.73 t/s
1.15.704.184 I slot print_timing: id 13 | task 316 | prompt eval time = 124.74 ms / 25 tokens ( 4.99 ms per token, 200.42 tokens per second)
1.15.704.188 I slot print_timing: id 13 | task 316 | eval time = 4864.50 ms / 114 tokens ( 42.67 ms per token, 23.44 tokens per second)
1.15.704.188 I slot print_timing: id 13 | task 316 | total time = 4989.23 ms / 139 tokens
1.15.704.190 I slot print_timing: id 13 | task 316 | graphs reused = 1
1.15.704.193 I slot print_timing: id 13 | task 316 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.15.704.205 I statistics draft-mtp: #calls(b,g,a) = 90 277 4244, #gen drafts = 4246, #acc drafts = 2989, #gen tokens = 8469, #acc tokens = 5664, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.054, 996.226, 4.934 ms
1.15.704.232 I slot release: id 13 | task 316 | stop processing: n_tokens = 138, truncated = 0
1.15.713.021 I srv operator(): Chat format: peg-native
1.15.820.203 I slot print_timing: id 11 | task 296 | n_decoded = 100, tg = 14.61 t/s, tg_3s = 14.61 t/s
1.15.822.033 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.15.822.102 I slot launch_slot_: id 13 | task 369 | processing task, is_child = 0
1.15.826.105 W slot operator(): id 13 | task 369 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.15.826.134 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.321.692 I slot print_timing: id 14 | task 328 | n_decoded = 102, tg = 23.41 t/s, tg_3s = 23.41 t/s
1.16.681.532 I slot print_timing: id 0 | task 314 | prompt eval time = 132.26 ms / 28 tokens ( 4.72 ms per token, 211.70 tokens per second)
1.16.681.535 I slot print_timing: id 0 | task 314 | eval time = 5978.09 ms / 125 tokens ( 47.82 ms per token, 20.91 tokens per second)
1.16.681.536 I slot print_timing: id 0 | task 314 | total time = 6110.35 ms / 153 tokens
1.16.681.537 I slot print_timing: id 0 | task 314 | graphs reused = 1
1.16.681.540 I slot print_timing: id 0 | task 314 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.16.681.554 I statistics draft-mtp: #calls(b,g,a) = 91 285 4357, #gen drafts = 4372, #acc drafts = 3066, #gen tokens = 8720, #acc tokens = 5807, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.629), dur(b,g,a) = 0.055, 1022.290, 5.065 ms
1.16.681.577 I slot release: id 0 | task 314 | stop processing: n_tokens = 152, truncated = 0
1.16.682.204 I slot print_timing: id 1 | task 326 | n_decoded = 101, tg = 20.81 t/s, tg_3s = 20.81 t/s
1.16.690.121 I srv operator(): Chat format: peg-native
1.16.797.158 I slot print_timing: id 12 | task 284 | prompt eval time = 133.35 ms / 29 tokens ( 4.60 ms per token, 217.47 tokens per second)
1.16.797.162 I slot print_timing: id 12 | task 284 | eval time = 8954.14 ms / 128 tokens ( 69.95 ms per token, 14.30 tokens per second)
1.16.797.162 I slot print_timing: id 12 | task 284 | total time = 9087.48 ms / 157 tokens
1.16.797.164 I slot print_timing: id 12 | task 284 | graphs reused = 1
1.16.797.167 I slot print_timing: id 12 | task 284 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.16.797.181 I statistics draft-mtp: #calls(b,g,a) = 91 286 4372, #gen drafts = 4386, #acc drafts = 3077, #gen tokens = 8748, #acc tokens = 5829, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.629), dur(b,g,a) = 0.055, 1026.347, 5.082 ms
1.16.797.210 I slot release: id 12 | task 284 | stop processing: n_tokens = 156, truncated = 0
1.16.804.178 I slot print_timing: id 14 | task 328 | prompt eval time = 125.08 ms / 25 tokens ( 5.00 ms per token, 199.87 tokens per second)
1.16.804.181 I slot print_timing: id 14 | task 328 | eval time = 4840.23 ms / 114 tokens ( 42.46 ms per token, 23.55 tokens per second)
1.16.804.181 I slot print_timing: id 14 | task 328 | total time = 4965.31 ms / 139 tokens
1.16.804.182 I slot print_timing: id 14 | task 328 | graphs reused = 1
1.16.804.184 I slot print_timing: id 14 | task 328 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (1.000, 0.897)
1.16.804.193 I statistics draft-mtp: #calls(b,g,a) = 91 286 4385, #gen drafts = 4386, #acc drafts = 3086, #gen tokens = 8748, #acc tokens = 5847, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.055, 1026.347, 5.098 ms
1.16.804.220 I slot release: id 14 | task 328 | stop processing: n_tokens = 138, truncated = 0
1.16.804.898 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.16.804.965 I slot launch_slot_: id 12 | task 378 | processing task, is_child = 0
1.16.806.969 I srv operator(): Chat format: peg-native
1.16.809.597 W slot operator(): id 12 | task 378 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.16.809.634 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.814.497 I srv operator(): Chat format: peg-native
1.16.928.000 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.16.928.071 I slot launch_slot_: id 0 | task 380 | processing task, is_child = 0
1.16.928.074 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.16.928.093 I slot launch_slot_: id 14 | task 381 | processing task, is_child = 0
1.16.932.012 W slot operator(): id 0 | task 380 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.16.932.042 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.932.078 W slot operator(): id 14 | task 381 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.16.932.114 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.439.404 I slot print_timing: id 9 | task 340 | n_decoded = 102, tg = 23.45 t/s, tg_3s = 23.45 t/s
1.17.558.240 I slot print_timing: id 3 | task 313 | n_decoded = 100, tg = 14.59 t/s, tg_3s = 14.59 t/s
1.17.802.368 I slot print_timing: id 1 | task 326 | prompt eval time = 134.06 ms / 28 tokens ( 4.79 ms per token, 208.87 tokens per second)
1.17.802.371 I slot print_timing: id 1 | task 326 | eval time = 5974.43 ms / 125 tokens ( 47.80 ms per token, 20.92 tokens per second)
1.17.802.371 I slot print_timing: id 1 | task 326 | total time = 6108.49 ms / 153 tokens
1.17.802.372 I slot print_timing: id 1 | task 326 | graphs reused = 1
1.17.802.375 I slot print_timing: id 1 | task 326 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.17.802.386 I statistics draft-mtp: #calls(b,g,a) = 94 294 4495, #gen drafts = 4509, #acc drafts = 3162, #gen tokens = 8993, #acc tokens = 5992, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.630), dur(b,g,a) = 0.055, 1053.131, 5.225 ms
1.17.802.410 I slot release: id 1 | task 326 | stop processing: n_tokens = 152, truncated = 0
1.17.803.904 I slot print_timing: id 5 | task 338 | n_decoded = 101, tg = 20.82 t/s, tg_3s = 20.82 t/s
1.17.811.258 I srv operator(): Chat format: peg-native
1.17.917.713 I slot print_timing: id 11 | task 296 | prompt eval time = 139.32 ms / 29 tokens ( 4.80 ms per token, 208.16 tokens per second)
1.17.917.718 I slot print_timing: id 11 | task 296 | eval time = 8942.51 ms / 128 tokens ( 69.86 ms per token, 14.31 tokens per second)
1.17.917.718 I slot print_timing: id 11 | task 296 | total time = 9081.83 ms / 157 tokens
1.17.917.719 I slot print_timing: id 11 | task 296 | graphs reused = 1
1.17.917.722 I slot print_timing: id 11 | task 296 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.17.917.735 I statistics draft-mtp: #calls(b,g,a) = 94 295 4509, #gen drafts = 4523, #acc drafts = 3171, #gen tokens = 9021, #acc tokens = 6009, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.055, 1058.222, 5.241 ms
1.17.917.758 I slot release: id 11 | task 296 | stop processing: n_tokens = 156, truncated = 0
1.17.922.331 I slot print_timing: id 9 | task 340 | prompt eval time = 124.69 ms / 25 tokens ( 4.99 ms per token, 200.50 tokens per second)
1.17.922.333 I slot print_timing: id 9 | task 340 | eval time = 4832.25 ms / 114 tokens ( 42.39 ms per token, 23.59 tokens per second)
1.17.922.334 I slot print_timing: id 9 | task 340 | total time = 4956.94 ms / 139 tokens
1.17.922.334 I slot print_timing: id 9 | task 340 | graphs reused = 1
1.17.922.336 I slot print_timing: id 9 | task 340 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.17.922.343 I statistics draft-mtp: #calls(b,g,a) = 94 295 4518, #gen drafts = 4523, #acc drafts = 3177, #gen tokens = 9021, #acc tokens = 6021, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.055, 1058.222, 5.253 ms
1.17.922.364 I slot release: id 9 | task 340 | stop processing: n_tokens = 138, truncated = 0
1.17.924.800 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.17.924.869 I slot launch_slot_: id 11 | task 390 | processing task, is_child = 0
1.17.926.708 I srv operator(): Chat format: peg-native
1.17.930.694 I srv operator(): Chat format: peg-native
1.17.931.101 W slot operator(): id 11 | task 390 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.931.134 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.050.166 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.18.050.237 I slot launch_slot_: id 1 | task 392 | processing task, is_child = 0
1.18.050.240 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.18.050.260 I slot launch_slot_: id 9 | task 393 | processing task, is_child = 0
1.18.055.983 W slot operator(): id 1 | task 392 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.18.056.009 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.056.052 W slot operator(): id 9 | task 393 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.18.056.073 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.685.141 I slot print_timing: id 4 | task 325 | n_decoded = 100, tg = 14.58 t/s, tg_3s = 14.58 t/s
1.18.929.532 I slot print_timing: id 5 | task 338 | prompt eval time = 119.91 ms / 28 tokens ( 4.28 ms per token, 233.52 tokens per second)
1.18.929.535 I slot print_timing: id 5 | task 338 | eval time = 5975.92 ms / 125 tokens ( 47.81 ms per token, 20.92 tokens per second)
1.18.929.535 I slot print_timing: id 5 | task 338 | total time = 6095.83 ms / 153 tokens
1.18.929.536 I slot print_timing: id 5 | task 338 | graphs reused = 1
1.18.929.539 I slot print_timing: id 5 | task 338 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.18.929.550 I statistics draft-mtp: #calls(b,g,a) = 97 303 4636, #gen drafts = 4646, #acc drafts = 3260, #gen tokens = 9267, #acc tokens = 6176, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.058, 1088.398, 5.392 ms
1.18.929.575 I slot release: id 5 | task 338 | stop processing: n_tokens = 152, truncated = 0
1.18.938.092 I srv operator(): Chat format: peg-native
1.19.047.647 I slot print_timing: id 7 | task 356 | n_decoded = 102, tg = 23.46 t/s, tg_3s = 23.46 t/s
1.19.051.795 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.19.051.864 I slot launch_slot_: id 5 | task 402 | processing task, is_child = 0
1.19.056.537 W slot operator(): id 5 | task 402 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.056.567 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.19.188.840 I slot print_timing: id 15 | task 352 | n_decoded = 101, tg = 20.76 t/s, tg_3s = 20.76 t/s
1.19.304.567 I slot print_timing: id 2 | task 335 | n_decoded = 100, tg = 15.15 t/s, tg_3s = 15.15 t/s
1.19.550.324 I slot print_timing: id 7 | task 356 | prompt eval time = 124.46 ms / 25 tokens ( 4.98 ms per token, 200.87 tokens per second)
1.19.550.327 I slot print_timing: id 7 | task 356 | eval time = 4850.12 ms / 114 tokens ( 42.54 ms per token, 23.50 tokens per second)
1.19.550.328 I slot print_timing: id 7 | task 356 | total time = 4974.58 ms / 139 tokens
1.19.550.329 I slot print_timing: id 7 | task 356 | graphs reused = 1
1.19.550.332 I slot print_timing: id 7 | task 356 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.19.550.343 I statistics draft-mtp: #calls(b,g,a) = 98 308 4716, #gen drafts = 4724, #acc drafts = 3313, #gen tokens = 9422, #acc tokens = 6277, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.628), dur(b,g,a) = 0.059, 1106.543, 5.492 ms
1.19.550.366 I slot release: id 7 | task 356 | stop processing: n_tokens = 138, truncated = 0
1.19.559.686 I srv operator(): Chat format: peg-native
1.19.663.415 I slot print_timing: id 3 | task 313 | prompt eval time = 132.48 ms / 29 tokens ( 4.57 ms per token, 218.90 tokens per second)
1.19.663.419 I slot print_timing: id 3 | task 313 | eval time = 8959.69 ms / 128 tokens ( 70.00 ms per token, 14.29 tokens per second)
1.19.663.420 I slot print_timing: id 3 | task 313 | total time = 9092.17 ms / 157 tokens
1.19.663.420 I slot print_timing: id 3 | task 313 | graphs reused = 1
1.19.663.423 I slot print_timing: id 3 | task 313 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.19.663.444 I statistics draft-mtp: #calls(b,g,a) = 98 309 4724, #gen drafts = 4738, #acc drafts = 3320, #gen tokens = 9450, #acc tokens = 6289, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.628), dur(b,g,a) = 0.059, 1111.995, 5.503 ms
1.19.663.468 I slot release: id 3 | task 313 | stop processing: n_tokens = 156, truncated = 0
1.19.670.722 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.19.670.791 I slot launch_slot_: id 3 | task 408 | processing task, is_child = 0
1.19.672.596 I srv operator(): Chat format: peg-native
1.19.676.364 W slot operator(): id 3 | task 408 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.676.393 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.19.803.133 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.19.803.201 I slot launch_slot_: id 7 | task 410 | processing task, is_child = 0
1.19.808.370 W slot operator(): id 7 | task 410 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.808.402 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.058.372 I slot print_timing: id 8 | task 362 | n_decoded = 101, tg = 20.83 t/s, tg_3s = 20.83 t/s
1.20.303.903 I slot print_timing: id 13 | task 369 | n_decoded = 102, tg = 23.43 t/s, tg_3s = 23.43 t/s
1.20.305.119 I slot print_timing: id 15 | task 352 | prompt eval time = 125.00 ms / 28 tokens ( 4.46 ms per token, 223.99 tokens per second)
1.20.305.121 I slot print_timing: id 15 | task 352 | eval time = 5980.67 ms / 125 tokens ( 47.85 ms per token, 20.90 tokens per second)
1.20.305.122 I slot print_timing: id 15 | task 352 | total time = 6105.68 ms / 153 tokens
1.20.305.123 I slot print_timing: id 15 | task 352 | graphs reused = 1
1.20.305.126 I slot print_timing: id 15 | task 352 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.20.305.138 I statistics draft-mtp: #calls(b,g,a) = 100 314 4815, #gen drafts = 4815, #acc drafts = 3379, #gen tokens = 9604, #acc tokens = 6402, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.061, 1131.800, 5.614 ms
1.20.305.167 I slot release: id 15 | task 352 | stop processing: n_tokens = 152, truncated = 0
1.20.313.829 I srv operator(): Chat format: peg-native
1.20.420.224 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.20.420.296 I slot launch_slot_: id 15 | task 416 | processing task, is_child = 0
1.20.423.366 W slot operator(): id 15 | task 416 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.423.390 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.673.003 I slot print_timing: id 6 | task 349 | n_decoded = 100, tg = 15.15 t/s, tg_3s = 15.15 t/s
1.20.792.335 I slot print_timing: id 4 | task 325 | prompt eval time = 134.26 ms / 29 tokens ( 4.63 ms per token, 215.99 tokens per second)
1.20.792.338 I slot print_timing: id 4 | task 325 | eval time = 8964.12 ms / 128 tokens ( 70.03 ms per token, 14.28 tokens per second)
1.20.792.339 I slot print_timing: id 4 | task 325 | total time = 9098.39 ms / 157 tokens
1.20.792.340 I slot print_timing: id 4 | task 325 | graphs reused = 1
1.20.792.342 I slot print_timing: id 4 | task 325 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.20.792.356 I statistics draft-mtp: #calls(b,g,a) = 101 318 4861, #gen drafts = 4876, #acc drafts = 3414, #gen tokens = 9725, #acc tokens = 6469, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.062, 1145.194, 5.671 ms
1.20.792.378 I slot release: id 4 | task 325 | stop processing: n_tokens = 156, truncated = 0
1.20.799.007 I slot print_timing: id 13 | task 369 | prompt eval time = 124.39 ms / 25 tokens ( 4.98 ms per token, 200.97 tokens per second)
1.20.799.009 I slot print_timing: id 13 | task 369 | eval time = 4848.48 ms / 114 tokens ( 42.53 ms per token, 23.51 tokens per second)
1.20.799.009 I slot print_timing: id 13 | task 369 | total time = 4972.87 ms / 139 tokens
1.20.799.010 I slot print_timing: id 13 | task 369 | graphs reused = 1
1.20.799.012 I slot print_timing: id 13 | task 369 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (1.000, 0.897)
1.20.799.018 I statistics draft-mtp: #calls(b,g,a) = 101 318 4874, #gen drafts = 4876, #acc drafts = 3424, #gen tokens = 9725, #acc tokens = 6487, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.628), dur(b,g,a) = 0.062, 1145.194, 5.686 ms
1.20.799.039 I slot release: id 13 | task 369 | stop processing: n_tokens = 138, truncated = 0
1.20.800.822 I srv operator(): Chat format: peg-native
1.20.807.773 I srv operator(): Chat format: peg-native
1.20.911.680 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.20.911.748 I slot launch_slot_: id 4 | task 421 | processing task, is_child = 0
1.20.911.751 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.20.911.768 I slot launch_slot_: id 13 | task 422 | processing task, is_child = 0
1.20.917.452 W slot operator(): id 4 | task 421 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.917.475 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.917.513 W slot operator(): id 13 | task 422 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.917.539 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.181.314 I slot print_timing: id 8 | task 362 | prompt eval time = 125.08 ms / 28 tokens ( 4.47 ms per token, 223.86 tokens per second)
1.21.181.317 I slot print_timing: id 8 | task 362 | eval time = 5971.45 ms / 125 tokens ( 47.77 ms per token, 20.93 tokens per second)
1.21.181.317 I slot print_timing: id 8 | task 362 | total time = 6096.53 ms / 153 tokens
1.21.181.318 I slot print_timing: id 8 | task 362 | graphs reused = 1
1.21.181.321 I slot print_timing: id 8 | task 362 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.21.181.332 I statistics draft-mtp: #calls(b,g,a) = 103 321 4913, #gen drafts = 4920, #acc drafts = 3450, #gen tokens = 9813, #acc tokens = 6537, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.063, 1159.445, 5.733 ms
1.21.181.358 I slot release: id 8 | task 362 | stop processing: n_tokens = 152, truncated = 0
1.21.189.850 I srv operator(): Chat format: peg-native
1.21.300.737 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.21.300.808 I slot launch_slot_: id 8 | task 426 | processing task, is_child = 0
1.21.306.422 W slot operator(): id 8 | task 426 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.21.306.464 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.430.370 I slot print_timing: id 2 | task 335 | prompt eval time = 124.16 ms / 29 tokens ( 4.28 ms per token, 233.58 tokens per second)
1.21.430.373 I slot print_timing: id 2 | task 335 | eval time = 8727.04 ms / 128 tokens ( 68.18 ms per token, 14.67 tokens per second)
1.21.430.374 I slot print_timing: id 2 | task 335 | total time = 8851.19 ms / 157 tokens
1.21.430.374 I slot print_timing: id 2 | task 335 | graphs reused = 1
1.21.430.377 I slot print_timing: id 2 | task 335 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.21.430.391 I statistics draft-mtp: #calls(b,g,a) = 103 323 4935, #gen drafts = 4949, #acc drafts = 3462, #gen tokens = 9870, #acc tokens = 6560, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.063, 1170.076, 5.758 ms
1.21.430.415 I slot release: id 2 | task 335 | stop processing: n_tokens = 156, truncated = 0
1.21.437.152 I slot print_timing: id 14 | task 381 | n_decoded = 102, tg = 23.36 t/s, tg_3s = 23.36 t/s
1.21.439.163 I srv operator(): Chat format: peg-native
1.21.553.720 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.21.553.789 I slot launch_slot_: id 2 | task 429 | processing task, is_child = 0
1.21.557.746 W slot operator(): id 2 | task 429 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.21.557.766 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.928.913 I slot print_timing: id 0 | task 380 | n_decoded = 101, tg = 20.79 t/s, tg_3s = 20.79 t/s
1.21.934.247 I slot print_timing: id 10 | task 360 | n_decoded = 100, tg = 14.57 t/s, tg_3s = 14.57 t/s
1.21.936.101 I slot print_timing: id 14 | task 381 | prompt eval time = 138.10 ms / 25 tokens ( 5.52 ms per token, 181.03 tokens per second)
1.21.936.103 I slot print_timing: id 14 | task 381 | eval time = 4865.89 ms / 114 tokens ( 42.68 ms per token, 23.43 tokens per second)
1.21.936.104 I slot print_timing: id 14 | task 381 | total time = 5003.99 ms / 139 tokens
1.21.936.105 I slot print_timing: id 14 | task 381 | graphs reused = 1
1.21.936.108 I slot print_timing: id 14 | task 381 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.21.936.119 I statistics draft-mtp: #calls(b,g,a) = 105 327 5010, #gen drafts = 5011, #acc drafts = 3517, #gen tokens = 9994, #acc tokens = 6665, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.065, 1184.093, 5.851 ms
1.21.936.145 I slot release: id 14 | task 381 | stop processing: n_tokens = 138, truncated = 0
1.21.945.026 I srv operator(): Chat format: peg-native
1.22.055.876 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.22.055.945 I slot launch_slot_: id 14 | task 434 | processing task, is_child = 0
1.22.059.936 W slot operator(): id 14 | task 434 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.22.059.955 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.22.556.423 I slot print_timing: id 9 | task 393 | n_decoded = 102, tg = 23.39 t/s, tg_3s = 23.39 t/s
1.22.795.997 I slot print_timing: id 6 | task 349 | prompt eval time = 123.54 ms / 29 tokens ( 4.26 ms per token, 234.75 tokens per second)
1.22.796.001 I slot print_timing: id 6 | task 349 | eval time = 8721.67 ms / 128 tokens ( 68.14 ms per token, 14.68 tokens per second)
1.22.796.001 I slot print_timing: id 6 | task 349 | total time = 8845.21 ms / 157 tokens
1.22.796.003 I slot print_timing: id 6 | task 349 | graphs reused = 1
1.22.796.006 I slot print_timing: id 6 | task 349 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.22.796.021 I statistics draft-mtp: #calls(b,g,a) = 106 334 5105, #gen drafts = 5120, #acc drafts = 3582, #gen tokens = 10211, #acc tokens = 6786, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.065, 1208.653, 5.959 ms
1.22.796.046 I slot release: id 6 | task 349 | stop processing: n_tokens = 156, truncated = 0
1.22.804.903 I srv operator(): Chat format: peg-native
1.22.921.773 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.22.921.843 I slot launch_slot_: id 6 | task 442 | processing task, is_child = 0
1.22.926.345 W slot operator(): id 6 | task 442 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.22.926.367 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.052.636 I slot print_timing: id 0 | task 380 | prompt eval time = 137.89 ms / 28 tokens ( 4.92 ms per token, 203.06 tokens per second)
1.23.052.639 I slot print_timing: id 0 | task 380 | eval time = 5982.69 ms / 125 tokens ( 47.86 ms per token, 20.89 tokens per second)
1.23.052.640 I slot print_timing: id 0 | task 380 | total time = 6120.58 ms / 153 tokens
1.23.052.640 I slot print_timing: id 0 | task 380 | graphs reused = 1
1.23.052.644 I slot print_timing: id 0 | task 380 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.23.052.659 I statistics draft-mtp: #calls(b,g,a) = 107 336 5136, #gen drafts = 5150, #acc drafts = 3605, #gen tokens = 10271, #acc tokens = 6830, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.066, 1217.977, 6.002 ms
1.23.052.687 I slot release: id 0 | task 380 | stop processing: n_tokens = 152, truncated = 0
1.23.053.348 I slot print_timing: id 1 | task 392 | n_decoded = 101, tg = 20.79 t/s, tg_3s = 20.79 t/s
1.23.057.175 I slot print_timing: id 9 | task 393 | prompt eval time = 139.18 ms / 25 tokens ( 5.57 ms per token, 179.62 tokens per second)
1.23.057.178 I slot print_timing: id 9 | task 393 | eval time = 4861.90 ms / 114 tokens ( 42.65 ms per token, 23.45 tokens per second)
1.23.057.178 I slot print_timing: id 9 | task 393 | total time = 5001.08 ms / 139 tokens
1.23.057.179 I slot print_timing: id 9 | task 393 | graphs reused = 1
1.23.057.181 I slot print_timing: id 9 | task 393 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.23.057.187 I statistics draft-mtp: #calls(b,g,a) = 107 336 5144, #gen drafts = 5150, #acc drafts = 3612, #gen tokens = 10271, #acc tokens = 6843, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.066, 1217.977, 6.011 ms
1.23.057.212 I slot release: id 9 | task 393 | stop processing: n_tokens = 138, truncated = 0
1.23.061.100 I srv operator(): Chat format: peg-native
1.23.065.153 I srv operator(): Chat format: peg-native
1.23.170.940 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.23.171.009 I slot launch_slot_: id 0 | task 445 | processing task, is_child = 0
1.23.171.012 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.23.171.030 I slot launch_slot_: id 9 | task 446 | processing task, is_child = 0
1.23.176.020 W slot operator(): id 0 | task 445 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.176.043 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.176.090 W slot operator(): id 9 | task 446 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.176.121 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.563.227 I slot print_timing: id 12 | task 378 | n_decoded = 100, tg = 15.06 t/s, tg_3s = 15.06 t/s
1.24.046.991 I slot print_timing: id 10 | task 360 | prompt eval time = 118.82 ms / 29 tokens ( 4.10 ms per token, 244.06 tokens per second)
1.24.046.995 I slot print_timing: id 10 | task 360 | eval time = 8973.89 ms / 128 tokens ( 70.11 ms per token, 14.26 tokens per second)
1.24.046.995 I slot print_timing: id 10 | task 360 | total time = 9092.71 ms / 157 tokens
1.24.046.996 I slot print_timing: id 10 | task 360 | graphs reused = 1
1.24.046.999 I slot print_timing: id 10 | task 360 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.24.047.012 I statistics draft-mtp: #calls(b,g,a) = 109 344 5258, #gen drafts = 5273, #acc drafts = 3691, #gen tokens = 10516, #acc tokens = 6993, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.067, 1247.417, 6.156 ms
1.24.047.040 I slot release: id 10 | task 360 | stop processing: n_tokens = 156, truncated = 0
1.24.055.278 I srv operator(): Chat format: peg-native
1.24.165.925 I slot print_timing: id 1 | task 392 | prompt eval time = 138.94 ms / 28 tokens ( 4.96 ms per token, 201.53 tokens per second)
1.24.165.927 I slot print_timing: id 1 | task 392 | eval time = 5970.97 ms / 125 tokens ( 47.77 ms per token, 20.93 tokens per second)
1.24.165.928 I slot print_timing: id 1 | task 392 | total time = 6109.90 ms / 153 tokens
1.24.165.929 I slot print_timing: id 1 | task 392 | graphs reused = 1
1.24.165.931 I slot print_timing: id 1 | task 392 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.24.165.946 I statistics draft-mtp: #calls(b,g,a) = 109 345 5275, #gen drafts = 5288, #acc drafts = 3703, #gen tokens = 10546, #acc tokens = 7016, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.067, 1252.107, 6.178 ms
1.24.165.972 I slot release: id 1 | task 392 | stop processing: n_tokens = 152, truncated = 0
1.24.171.755 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.24.171.824 I slot launch_slot_: id 10 | task 455 | processing task, is_child = 0
1.24.174.522 I srv operator(): Chat format: peg-native
1.24.177.502 W slot operator(): id 10 | task 455 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.177.531 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.299.951 I slot print_timing: id 7 | task 410 | n_decoded = 102, tg = 23.36 t/s, tg_3s = 23.36 t/s
1.24.303.603 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.24.303.673 I slot launch_slot_: id 1 | task 457 | processing task, is_child = 0
1.24.307.675 W slot operator(): id 1 | task 457 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.307.704 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.679.756 I slot print_timing: id 3 | task 408 | n_decoded = 101, tg = 20.68 t/s, tg_3s = 20.68 t/s
1.24.804.387 I slot print_timing: id 7 | task 410 | prompt eval time = 124.64 ms / 25 tokens ( 4.99 ms per token, 200.58 tokens per second)
1.24.804.390 I slot print_timing: id 7 | task 410 | eval time = 4871.33 ms / 114 tokens ( 42.73 ms per token, 23.40 tokens per second)
1.24.804.390 I slot print_timing: id 7 | task 410 | total time = 4995.97 ms / 139 tokens
1.24.804.391 I slot print_timing: id 7 | task 410 | graphs reused = 1
1.24.804.394 I slot print_timing: id 7 | task 410 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.24.804.406 I statistics draft-mtp: #calls(b,g,a) = 111 350 5357, #gen drafts = 5365, #acc drafts = 3761, #gen tokens = 10700, #acc tokens = 7127, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.069, 1270.858, 6.278 ms
1.24.804.429 I slot release: id 7 | task 410 | stop processing: n_tokens = 138, truncated = 0
1.24.814.295 I srv operator(): Chat format: peg-native
1.24.923.368 I slot print_timing: id 11 | task 390 | n_decoded = 100, tg = 14.54 t/s, tg_3s = 14.54 t/s
1.24.925.162 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.24.925.230 I slot launch_slot_: id 7 | task 463 | processing task, is_child = 0
1.24.930.405 W slot operator(): id 7 | task 463 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.930.434 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.25.428.412 I slot print_timing: id 13 | task 422 | n_decoded = 102, tg = 23.33 t/s, tg_3s = 23.33 t/s
1.25.666.656 I slot print_timing: id 12 | task 378 | prompt eval time = 112.30 ms / 29 tokens ( 3.87 ms per token, 258.24 tokens per second)
1.25.666.660 I slot print_timing: id 12 | task 378 | eval time = 8744.73 ms / 128 tokens ( 68.32 ms per token, 14.64 tokens per second)
1.25.666.660 I slot print_timing: id 12 | task 378 | total time = 8857.03 ms / 157 tokens
1.25.666.661 I slot print_timing: id 12 | task 378 | graphs reused = 1
1.25.666.664 I slot print_timing: id 12 | task 378 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.25.666.678 I statistics draft-mtp: #calls(b,g,a) = 112 357 5459, #gen drafts = 5474, #acc drafts = 3826, #gen tokens = 10917, #acc tokens = 7250, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.070, 1297.399, 6.400 ms
1.25.666.703 I slot release: id 12 | task 378 | stop processing: n_tokens = 156, truncated = 0
1.25.675.963 I srv operator(): Chat format: peg-native
1.25.785.871 I slot print_timing: id 3 | task 408 | prompt eval time = 119.99 ms / 28 tokens ( 4.29 ms per token, 233.35 tokens per second)
1.25.785.874 I slot print_timing: id 3 | task 408 | eval time = 5989.48 ms / 125 tokens ( 47.92 ms per token, 20.87 tokens per second)
1.25.785.875 I slot print_timing: id 3 | task 408 | total time = 6109.47 ms / 153 tokens
1.25.785.876 I slot print_timing: id 3 | task 408 | graphs reused = 1
1.25.785.879 I slot print_timing: id 3 | task 408 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.25.785.894 I statistics draft-mtp: #calls(b,g,a) = 112 358 5478, #gen drafts = 5489, #acc drafts = 3840, #gen tokens = 10947, #acc tokens = 7277, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.070, 1301.482, 6.425 ms
1.25.785.919 I slot release: id 3 | task 408 | stop processing: n_tokens = 152, truncated = 0
1.25.787.150 I slot print_timing: id 5 | task 402 | n_decoded = 100, tg = 15.14 t/s, tg_3s = 15.14 t/s
1.25.791.350 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.25.791.415 I slot launch_slot_: id 12 | task 471 | processing task, is_child = 0
1.25.795.036 I srv operator(): Chat format: peg-native
1.25.796.974 W slot operator(): id 12 | task 471 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.25.797.000 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.25.919.273 I slot print_timing: id 4 | task 421 | n_decoded = 101, tg = 20.77 t/s, tg_3s = 20.77 t/s
1.25.923.363 I slot print_timing: id 13 | task 422 | prompt eval time = 138.91 ms / 25 tokens ( 5.56 ms per token, 179.97 tokens per second)
1.25.923.365 I slot print_timing: id 13 | task 422 | eval time = 4866.90 ms / 114 tokens ( 42.69 ms per token, 23.42 tokens per second)
1.25.923.366 I slot print_timing: id 13 | task 422 | total time = 5005.81 ms / 139 tokens
1.25.923.367 I slot print_timing: id 13 | task 422 | graphs reused = 1
1.25.923.369 I slot print_timing: id 13 | task 422 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.25.923.380 I statistics draft-mtp: #calls(b,g,a) = 113 359 5501, #gen drafts = 5503, #acc drafts = 3858, #gen tokens = 10975, #acc tokens = 7310, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.071, 1306.961, 6.452 ms
1.25.923.406 I slot release: id 13 | task 422 | stop processing: n_tokens = 138, truncated = 0
1.25.924.673 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.25.924.741 I slot launch_slot_: id 3 | task 473 | processing task, is_child = 0
1.25.929.758 W slot operator(): id 3 | task 473 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.25.929.778 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.25.932.647 I srv operator(): Chat format: peg-native
1.26.055.806 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.26.055.877 I slot launch_slot_: id 13 | task 475 | processing task, is_child = 0
1.26.059.904 W slot operator(): id 13 | task 475 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.26.059.928 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.26.552.569 I slot print_timing: id 2 | task 429 | n_decoded = 101, tg = 20.74 t/s, tg_3s = 20.74 t/s
1.26.558.103 I slot print_timing: id 14 | task 434 | n_decoded = 102, tg = 23.33 t/s, tg_3s = 23.33 t/s
1.27.040.472 I slot print_timing: id 11 | task 390 | prompt eval time = 112.57 ms / 29 tokens ( 3.88 ms per token, 257.61 tokens per second)
1.27.040.476 I slot print_timing: id 11 | task 390 | eval time = 8996.77 ms / 128 tokens ( 70.29 ms per token, 14.23 tokens per second)
1.27.040.477 I slot print_timing: id 11 | task 390 | total time = 9109.34 ms / 157 tokens
1.27.040.478 I slot print_timing: id 11 | task 390 | graphs reused = 1
1.27.040.480 I slot print_timing: id 11 | task 390 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.27.040.495 I statistics draft-mtp: #calls(b,g,a) = 115 368 5628, #gen drafts = 5643, #acc drafts = 3942, #gen tokens = 11254, #acc tokens = 7472, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.073, 1338.389, 6.598 ms
1.27.040.522 I slot release: id 11 | task 390 | stop processing: n_tokens = 156, truncated = 0
1.27.043.704 I slot print_timing: id 4 | task 421 | prompt eval time = 138.69 ms / 28 tokens ( 4.95 ms per token, 201.88 tokens per second)
1.27.043.706 I slot print_timing: id 4 | task 421 | eval time = 5987.52 ms / 125 tokens ( 47.90 ms per token, 20.88 tokens per second)
1.27.043.707 I slot print_timing: id 4 | task 421 | total time = 6126.22 ms / 153 tokens
1.27.043.707 I slot print_timing: id 4 | task 421 | graphs reused = 1
1.27.043.709 I slot print_timing: id 4 | task 421 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.27.043.714 I statistics draft-mtp: #calls(b,g,a) = 115 368 5633, #gen drafts = 5643, #acc drafts = 3947, #gen tokens = 11254, #acc tokens = 7482, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.073, 1338.389, 6.606 ms
1.27.043.734 I slot release: id 4 | task 421 | stop processing: n_tokens = 152, truncated = 0
1.27.048.790 I slot print_timing: id 14 | task 434 | prompt eval time = 125.44 ms / 25 tokens ( 5.02 ms per token, 199.30 tokens per second)
1.27.048.793 I slot print_timing: id 14 | task 434 | eval time = 4863.39 ms / 114 tokens ( 42.66 ms per token, 23.44 tokens per second)
1.27.048.793 I slot print_timing: id 14 | task 434 | total time = 4988.83 ms / 139 tokens
1.27.048.794 I slot print_timing: id 14 | task 434 | graphs reused = 1
1.27.048.796 I slot print_timing: id 14 | task 434 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.27.048.802 I statistics draft-mtp: #calls(b,g,a) = 115 368 5642, #gen drafts = 5643, #acc drafts = 3955, #gen tokens = 11254, #acc tokens = 7497, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.073, 1338.389, 6.617 ms
1.27.048.828 I slot release: id 14 | task 434 | stop processing: n_tokens = 138, truncated = 0
1.27.049.746 I srv operator(): Chat format: peg-native
1.27.052.154 I srv operator(): Chat format: peg-native
1.27.057.025 I srv operator(): Chat format: peg-native
1.27.154.899 I slot print_timing: id 15 | task 416 | n_decoded = 100, tg = 15.14 t/s, tg_3s = 15.14 t/s
1.27.154.909 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.27.154.975 I slot launch_slot_: id 11 | task 485 | processing task, is_child = 0
1.27.154.978 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.27.154.995 I slot launch_slot_: id 4 | task 486 | processing task, is_child = 0
1.27.154.998 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.27.155.013 I slot launch_slot_: id 14 | task 487 | processing task, is_child = 0
1.27.161.328 W slot operator(): id 4 | task 486 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.161.356 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.161.397 W slot operator(): id 11 | task 485 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.161.425 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.161.460 W slot operator(): id 14 | task 487 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.161.488 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.681.640 I slot print_timing: id 2 | task 429 | prompt eval time = 125.05 ms / 28 tokens ( 4.47 ms per token, 223.91 tokens per second)
1.27.681.644 I slot print_timing: id 2 | task 429 | eval time = 5998.80 ms / 125 tokens ( 47.99 ms per token, 20.84 tokens per second)
1.27.681.644 I slot print_timing: id 2 | task 429 | total time = 6123.85 ms / 153 tokens
1.27.681.645 I slot print_timing: id 2 | task 429 | graphs reused = 1
1.27.681.649 I slot print_timing: id 2 | task 429 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.27.681.666 I statistics draft-mtp: #calls(b,g,a) = 118 373 5704, #gen drafts = 5717, #acc drafts = 3997, #gen tokens = 11402, #acc tokens = 7575, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.074, 1360.083, 6.690 ms
1.27.681.694 I slot release: id 2 | task 429 | stop processing: n_tokens = 152, truncated = 0
1.27.685.100 I slot print_timing: id 9 | task 446 | n_decoded = 102, tg = 23.34 t/s, tg_3s = 23.34 t/s
1.27.690.114 I srv operator(): Chat format: peg-native
1.27.803.741 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.27.803.811 I slot launch_slot_: id 2 | task 493 | processing task, is_child = 0
1.27.808.691 W slot operator(): id 2 | task 493 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.808.725 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.933.150 I slot print_timing: id 5 | task 402 | prompt eval time = 125.35 ms / 29 tokens ( 4.32 ms per token, 231.35 tokens per second)
1.27.933.153 I slot print_timing: id 5 | task 402 | eval time = 8751.24 ms / 128 tokens ( 68.37 ms per token, 14.63 tokens per second)
1.27.933.153 I slot print_timing: id 5 | task 402 | total time = 8876.59 ms / 157 tokens
1.27.933.154 I slot print_timing: id 5 | task 402 | graphs reused = 1
1.27.933.156 I slot print_timing: id 5 | task 402 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.27.933.167 I statistics draft-mtp: #calls(b,g,a) = 119 375 5732, #gen drafts = 5746, #acc drafts = 4015, #gen tokens = 11459, #acc tokens = 7608, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.075, 1368.856, 6.727 ms
1.27.933.189 I slot release: id 5 | task 402 | stop processing: n_tokens = 156, truncated = 0
1.27.942.295 I srv operator(): Chat format: peg-native
1.28.054.231 I slot print_timing: id 8 | task 426 | n_decoded = 100, tg = 15.10 t/s, tg_3s = 15.10 t/s
1.28.057.394 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.28.057.488 I slot launch_slot_: id 5 | task 496 | processing task, is_child = 0
1.28.062.124 W slot operator(): id 5 | task 496 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.062.152 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.28.188.004 I slot print_timing: id 0 | task 445 | n_decoded = 101, tg = 20.72 t/s, tg_3s = 20.72 t/s
1.28.192.122 I slot print_timing: id 9 | task 446 | prompt eval time = 138.74 ms / 25 tokens ( 5.55 ms per token, 180.19 tokens per second)
1.28.192.125 I slot print_timing: id 9 | task 446 | eval time = 4877.25 ms / 114 tokens ( 42.78 ms per token, 23.37 tokens per second)
1.28.192.125 I slot print_timing: id 9 | task 446 | total time = 5015.99 ms / 139 tokens
1.28.192.126 I slot print_timing: id 9 | task 446 | graphs reused = 1
1.28.192.129 I slot print_timing: id 9 | task 446 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.28.192.142 I statistics draft-mtp: #calls(b,g,a) = 120 377 5770, #gen drafts = 5776, #acc drafts = 4042, #gen tokens = 11519, #acc tokens = 7660, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.076, 1377.809, 6.774 ms
1.28.192.172 I slot release: id 9 | task 446 | stop processing: n_tokens = 138, truncated = 0
1.28.200.925 I srv operator(): Chat format: peg-native
1.28.312.801 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.28.312.872 I slot launch_slot_: id 9 | task 499 | processing task, is_child = 0
1.28.317.816 W slot operator(): id 9 | task 499 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.317.841 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.295.274 I slot print_timing: id 15 | task 416 | prompt eval time = 124.95 ms / 29 tokens ( 4.31 ms per token, 232.09 tokens per second)
1.29.295.277 I slot print_timing: id 15 | task 416 | eval time = 8746.93 ms / 128 tokens ( 68.34 ms per token, 14.63 tokens per second)
1.29.295.277 I slot print_timing: id 15 | task 416 | total time = 8871.88 ms / 157 tokens
1.29.295.278 I slot print_timing: id 15 | task 416 | graphs reused = 1
1.29.295.281 I slot print_timing: id 15 | task 416 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.29.295.296 I statistics draft-mtp: #calls(b,g,a) = 121 386 5902, #gen drafts = 5917, #acc drafts = 4133, #gen tokens = 11800, #acc tokens = 7834, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.076, 1408.562, 6.937 ms
1.29.295.320 I slot release: id 15 | task 416 | stop processing: n_tokens = 156, truncated = 0
1.29.295.998 I slot print_timing: id 0 | task 445 | prompt eval time = 138.53 ms / 28 tokens ( 4.95 ms per token, 202.13 tokens per second)
1.29.296.000 I slot print_timing: id 0 | task 445 | eval time = 5981.43 ms / 125 tokens ( 47.85 ms per token, 20.90 tokens per second)
1.29.296.000 I slot print_timing: id 0 | task 445 | total time = 6119.96 ms / 153 tokens
1.29.296.001 I slot print_timing: id 0 | task 445 | graphs reused = 1
1.29.296.003 I slot print_timing: id 0 | task 445 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.29.296.007 I statistics draft-mtp: #calls(b,g,a) = 121 386 5903, #gen drafts = 5917, #acc drafts = 4134, #gen tokens = 11800, #acc tokens = 7836, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.076, 1408.562, 6.939 ms
1.29.296.034 I slot release: id 0 | task 445 | stop processing: n_tokens = 152, truncated = 0
1.29.296.651 I slot print_timing: id 1 | task 457 | n_decoded = 101, tg = 20.77 t/s, tg_3s = 20.77 t/s
1.29.304.549 I srv operator(): Chat format: peg-native
1.29.304.712 I srv operator(): Chat format: peg-native
1.29.407.384 I slot print_timing: id 7 | task 463 | n_decoded = 102, tg = 23.44 t/s, tg_3s = 23.44 t/s
1.29.410.360 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.29.410.431 I slot launch_slot_: id 15 | task 509 | processing task, is_child = 0
1.29.410.432 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.29.410.456 I slot launch_slot_: id 0 | task 510 | processing task, is_child = 0
1.29.413.436 W slot operator(): id 0 | task 510 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.413.461 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.413.504 W slot operator(): id 15 | task 509 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.413.527 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.920.047 I slot print_timing: id 6 | task 442 | n_decoded = 100, tg = 14.56 t/s, tg_3s = 14.56 t/s
1.29.920.674 I slot print_timing: id 7 | task 463 | prompt eval time = 125.12 ms / 25 tokens ( 5.00 ms per token, 199.81 tokens per second)
1.29.920.676 I slot print_timing: id 7 | task 463 | eval time = 4865.11 ms / 114 tokens ( 42.68 ms per token, 23.43 tokens per second)
1.29.920.676 I slot print_timing: id 7 | task 463 | total time = 4990.23 ms / 139 tokens
1.29.920.678 I slot print_timing: id 7 | task 463 | graphs reused = 1
1.29.920.681 I slot print_timing: id 7 | task 463 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.29.920.695 I statistics draft-mtp: #calls(b,g,a) = 123 391 5985, #gen drafts = 5993, #acc drafts = 4188, #gen tokens = 11952, #acc tokens = 7937, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.626), dur(b,g,a) = 0.076, 1423.669, 7.036 ms
1.29.920.725 I slot release: id 7 | task 463 | stop processing: n_tokens = 138, truncated = 0
1.29.929.536 I srv operator(): Chat format: peg-native
1.30.042.565 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.30.042.635 I slot launch_slot_: id 7 | task 516 | processing task, is_child = 0
1.30.047.434 W slot operator(): id 7 | task 516 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.30.047.468 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.30.170.468 I slot print_timing: id 8 | task 426 | prompt eval time = 124.26 ms / 29 tokens ( 4.28 ms per token, 233.38 tokens per second)
1.30.170.471 I slot print_timing: id 8 | task 426 | eval time = 8739.77 ms / 128 tokens ( 68.28 ms per token, 14.65 tokens per second)
1.30.170.472 I slot print_timing: id 8 | task 426 | total time = 8864.03 ms / 157 tokens
1.30.170.472 I slot print_timing: id 8 | task 426 | graphs reused = 1
1.30.170.475 I slot print_timing: id 8 | task 426 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.30.170.490 I statistics draft-mtp: #calls(b,g,a) = 124 393 6008, #gen drafts = 6022, #acc drafts = 4206, #gen tokens = 12009, #acc tokens = 7970, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.626), dur(b,g,a) = 0.076, 1433.452, 7.066 ms
1.30.170.519 I slot release: id 8 | task 426 | stop processing: n_tokens = 156, truncated = 0
1.30.178.828 I srv operator(): Chat format: peg-native
1.30.295.917 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.30.295.990 I slot launch_slot_: id 8 | task 519 | processing task, is_child = 0
1.30.301.191 W slot operator(): id 8 | task 519 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.30.301.221 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.30.427.715 I slot print_timing: id 1 | task 457 | prompt eval time = 125.04 ms / 28 tokens ( 4.47 ms per token, 223.93 tokens per second)
1.30.427.718 I slot print_timing: id 1 | task 457 | eval time = 5994.94 ms / 125 tokens ( 47.96 ms per token, 20.85 tokens per second)
1.30.427.718 I slot print_timing: id 1 | task 457 | total time = 6119.98 ms / 153 tokens
1.30.427.719 I slot print_timing: id 1 | task 457 | graphs reused = 1
1.30.427.722 I slot print_timing: id 1 | task 457 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.30.427.736 I statistics draft-mtp: #calls(b,g,a) = 125 395 6039, #gen drafts = 6052, #acc drafts = 4229, #gen tokens = 12069, #acc tokens = 8016, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.077, 1443.651, 7.107 ms
1.30.427.766 I slot release: id 1 | task 457 | stop processing: n_tokens = 152, truncated = 0
1.30.436.700 I srv operator(): Chat format: peg-native
1.30.549.391 I slot print_timing: id 13 | task 475 | n_decoded = 102, tg = 23.38 t/s, tg_3s = 23.38 t/s
1.30.550.343 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.30.550.414 I slot launch_slot_: id 1 | task 522 | processing task, is_child = 0
1.30.554.391 W slot operator(): id 1 | task 522 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.30.554.424 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.30.925.724 I slot print_timing: id 3 | task 473 | n_decoded = 101, tg = 20.71 t/s, tg_3s = 20.71 t/s
1.31.053.062 I slot print_timing: id 13 | task 475 | prompt eval time = 126.17 ms / 25 tokens ( 5.05 ms per token, 198.14 tokens per second)
1.31.053.065 I slot print_timing: id 13 | task 475 | eval time = 4866.94 ms / 114 tokens ( 42.69 ms per token, 23.42 tokens per second)
1.31.053.065 I slot print_timing: id 13 | task 475 | total time = 4993.12 ms / 139 tokens
1.31.053.067 I slot print_timing: id 13 | task 475 | graphs reused = 1
1.31.053.070 I slot print_timing: id 13 | task 475 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.31.053.085 I statistics draft-mtp: #calls(b,g,a) = 126 400 6128, #gen drafts = 6130, #acc drafts = 4292, #gen tokens = 12225, #acc tokens = 8135, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.078, 1460.649, 7.217 ms
1.31.053.115 I slot release: id 13 | task 475 | stop processing: n_tokens = 138, truncated = 0
1.31.061.378 I srv operator(): Chat format: peg-native
1.31.168.165 I slot print_timing: id 10 | task 455 | n_decoded = 100, tg = 14.55 t/s, tg_3s = 14.55 t/s
1.31.169.647 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.31.169.717 I slot launch_slot_: id 13 | task 528 | processing task, is_child = 0
1.31.173.719 W slot operator(): id 13 | task 528 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.31.173.750 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.31.670.439 I slot print_timing: id 14 | task 487 | n_decoded = 102, tg = 23.42 t/s, tg_3s = 23.42 t/s
1.32.033.799 I slot print_timing: id 6 | task 442 | prompt eval time = 125.56 ms / 29 tokens ( 4.33 ms per token, 230.97 tokens per second)
1.32.033.802 I slot print_timing: id 6 | task 442 | eval time = 8981.86 ms / 128 tokens ( 70.17 ms per token, 14.25 tokens per second)
1.32.033.803 I slot print_timing: id 6 | task 442 | total time = 9107.42 ms / 157 tokens
1.32.033.804 I slot print_timing: id 6 | task 442 | graphs reused = 1
1.32.033.806 I slot print_timing: id 6 | task 442 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.32.033.822 I statistics draft-mtp: #calls(b,g,a) = 127 408 6240, #gen drafts = 6255, #acc drafts = 4366, #gen tokens = 12474, #acc tokens = 8273, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.626), dur(b,g,a) = 0.079, 1488.308, 7.362 ms
1.32.033.846 I slot release: id 6 | task 442 | stop processing: n_tokens = 156, truncated = 0
1.32.035.958 I slot print_timing: id 3 | task 473 | prompt eval time = 119.24 ms / 28 tokens ( 4.26 ms per token, 234.83 tokens per second)
1.32.035.959 I slot print_timing: id 3 | task 473 | eval time = 5986.92 ms / 125 tokens ( 47.90 ms per token, 20.88 tokens per second)
1.32.035.959 I slot print_timing: id 3 | task 473 | total time = 6106.15 ms / 153 tokens
1.32.035.960 I slot print_timing: id 3 | task 473 | graphs reused = 1
1.32.035.962 I slot print_timing: id 3 | task 473 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.32.035.968 I statistics draft-mtp: #calls(b,g,a) = 127 408 6244, #gen drafts = 6255, #acc drafts = 4369, #gen tokens = 12474, #acc tokens = 8278, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.626), dur(b,g,a) = 0.079, 1488.308, 7.370 ms
1.32.035.991 I slot release: id 3 | task 473 | stop processing: n_tokens = 152, truncated = 0
1.32.042.954 I srv operator(): Chat format: peg-native
1.32.148.485 I slot print_timing: id 4 | task 486 | n_decoded = 101, tg = 20.90 t/s, tg_3s = 20.90 t/s
1.32.153.641 I slot print_timing: id 14 | task 487 | prompt eval time = 154.06 ms / 25 tokens ( 6.16 ms per token, 162.27 tokens per second)
1.32.153.643 I slot print_timing: id 14 | task 487 | eval time = 4838.08 ms / 114 tokens ( 42.44 ms per token, 23.56 tokens per second)
1.32.153.643 I slot print_timing: id 14 | task 487 | total time = 4992.14 ms / 139 tokens
1.32.153.644 I slot print_timing: id 14 | task 487 | graphs reused = 1
1.32.153.647 I slot print_timing: id 14 | task 487 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (1.000, 0.897)
1.32.153.659 I statistics draft-mtp: #calls(b,g,a) = 127 409 6268, #gen drafts = 6269, #acc drafts = 4386, #gen tokens = 12502, #acc tokens = 8312, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.626), dur(b,g,a) = 0.079, 1493.320, 7.402 ms
1.32.153.684 I slot release: id 14 | task 487 | stop processing: n_tokens = 138, truncated = 0
1.32.154.320 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.32.154.389 I slot launch_slot_: id 6 | task 537 | processing task, is_child = 0
1.32.160.554 W slot operator(): id 6 | task 537 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.32.160.574 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.32.722.416 I slot print_timing: id 9 | task 499 | n_decoded = 102, tg = 23.83 t/s, tg_3s = 23.83 t/s
1.32.723.637 I slot print_timing: id 12 | task 471 | n_decoded = 100, tg = 14.69 t/s, tg_3s = 14.69 t/s
1.32.942.679 I slot print_timing: id 5 | task 496 | n_decoded = 101, tg = 21.24 t/s, tg_3s = 21.24 t/s
1.33.161.594 I slot print_timing: id 10 | task 455 | prompt eval time = 118.67 ms / 29 tokens ( 4.09 ms per token, 244.36 tokens per second)
1.33.161.597 I slot print_timing: id 10 | task 455 | eval time = 8865.38 ms / 128 tokens ( 69.26 ms per token, 14.44 tokens per second)
1.33.161.598 I slot print_timing: id 10 | task 455 | total time = 8984.06 ms / 157 tokens
1.33.161.599 I slot print_timing: id 10 | task 455 | graphs reused = 1
1.33.161.602 I slot print_timing: id 10 | task 455 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.33.161.617 I statistics draft-mtp: #calls(b,g,a) = 128 418 6380, #gen drafts = 6393, #acc drafts = 4459, #gen tokens = 12749, #acc tokens = 8452, #mean acc len = 2.32, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.080, 1539.539, 7.531 ms
1.33.161.642 I slot release: id 10 | task 455 | stop processing: n_tokens = 156, truncated = 0
1.33.164.232 I slot print_timing: id 4 | task 486 | prompt eval time = 153.64 ms / 28 tokens ( 5.49 ms per token, 182.25 tokens per second)
1.33.164.234 I slot print_timing: id 4 | task 486 | eval time = 5849.23 ms / 125 tokens ( 46.79 ms per token, 21.37 tokens per second)
1.33.164.234 I slot print_timing: id 4 | task 486 | total time = 6002.87 ms / 153 tokens
1.33.164.235 I slot print_timing: id 4 | task 486 | graphs reused = 1
1.33.164.237 I slot print_timing: id 4 | task 486 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.33.164.243 I statistics draft-mtp: #calls(b,g,a) = 128 418 6384, #gen drafts = 6393, #acc drafts = 4463, #gen tokens = 12749, #acc tokens = 8460, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.080, 1539.539, 7.538 ms
1.33.164.264 I slot release: id 4 | task 486 | stop processing: n_tokens = 152, truncated = 0
1.33.166.669 I slot print_timing: id 9 | task 499 | prompt eval time = 124.57 ms / 25 tokens ( 4.98 ms per token, 200.70 tokens per second)
1.33.166.671 I slot print_timing: id 9 | task 499 | eval time = 4724.26 ms / 114 tokens ( 41.44 ms per token, 24.13 tokens per second)
1.33.166.671 I slot print_timing: id 9 | task 499 | total time = 4848.82 ms / 139 tokens
1.33.166.671 I slot print_timing: id 9 | task 499 | graphs reused = 1
1.33.166.674 I slot print_timing: id 9 | task 499 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.33.166.680 I statistics draft-mtp: #calls(b,g,a) = 128 418 6389, #gen drafts = 6393, #acc drafts = 4466, #gen tokens = 12749, #acc tokens = 8466, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.080, 1539.539, 7.543 ms
1.33.166.701 I slot release: id 9 | task 499 | stop processing: n_tokens = 138, truncated = 0
1.33.798.725 I slot print_timing: id 5 | task 496 | prompt eval time = 125.14 ms / 28 tokens ( 4.47 ms per token, 223.75 tokens per second)
1.33.798.728 I slot print_timing: id 5 | task 496 | eval time = 5611.43 ms / 125 tokens ( 44.89 ms per token, 22.28 tokens per second)
1.33.798.728 I slot print_timing: id 5 | task 496 | total time = 5736.57 ms / 153 tokens
1.33.798.729 I slot print_timing: id 5 | task 496 | graphs reused = 1
1.33.798.732 I slot print_timing: id 5 | task 496 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.33.798.744 I statistics draft-mtp: #calls(b,g,a) = 128 425 6463, #gen drafts = 6470, #acc drafts = 4515, #gen tokens = 12903, #acc tokens = 8559, #mean acc len = 2.32, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.080, 1579.088, 7.639 ms
1.33.798.766 I slot release: id 5 | task 496 | stop processing: n_tokens = 152, truncated = 0
1.33.800.705 I slot print_timing: id 11 | task 485 | n_decoded = 100, tg = 15.42 t/s, tg_3s = 15.42 t/s
1.33.962.031 I slot print_timing: id 0 | task 510 | n_decoded = 101, tg = 22.90 t/s, tg_3s = 22.90 t/s
1.34.045.502 I slot print_timing: id 2 | task 493 | n_decoded = 100, tg = 16.36 t/s, tg_3s = 16.36 t/s
1.34.046.398 I slot print_timing: id 7 | task 516 | n_decoded = 102, tg = 26.31 t/s, tg_3s = 26.31 t/s
1.34.206.414 I slot print_timing: id 12 | task 471 | prompt eval time = 119.73 ms / 29 tokens ( 4.13 ms per token, 242.21 tokens per second)
1.34.206.417 I slot print_timing: id 12 | task 471 | eval time = 8289.69 ms / 128 tokens ( 64.76 ms per token, 15.44 tokens per second)
1.34.206.417 I slot print_timing: id 12 | task 471 | total time = 8409.42 ms / 157 tokens
1.34.206.418 I slot print_timing: id 12 | task 471 | graphs reused = 1
1.34.206.421 I slot print_timing: id 12 | task 471 | draft acceptance = 0.40288 ( 56 accepted / 139 generated), mean acceptance length = 1.80, acceptance rate per position = (0.443, 0.357)
1.34.206.433 I statistics draft-mtp: #calls(b,g,a) = 128 430 6510, #gen drafts = 6519, #acc drafts = 4546, #gen tokens = 13000, #acc tokens = 8617, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.625), dur(b,g,a) = 0.080, 1605.435, 7.701 ms
1.34.206.456 I slot release: id 12 | task 471 | stop processing: n_tokens = 156, truncated = 0
1.34.359.646 I slot print_timing: id 7 | task 516 | prompt eval time = 122.80 ms / 25 tokens ( 4.91 ms per token, 203.59 tokens per second)
1.34.359.649 I slot print_timing: id 7 | task 516 | eval time = 4189.38 ms / 114 tokens ( 36.75 ms per token, 27.21 tokens per second)
1.34.359.649 I slot print_timing: id 7 | task 516 | total time = 4312.17 ms / 139 tokens
1.34.359.650 I slot print_timing: id 7 | task 516 | graphs reused = 1
1.34.359.653 I slot print_timing: id 7 | task 516 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.34.359.666 I statistics draft-mtp: #calls(b,g,a) = 128 432 6533, #gen drafts = 6537, #acc drafts = 4560, #gen tokens = 13036, #acc tokens = 8642, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.625), dur(b,g,a) = 0.080, 1616.905, 7.734 ms
1.34.359.689 I slot release: id 7 | task 516 | stop processing: n_tokens = 138, truncated = 0
1.34.634.327 I slot print_timing: id 0 | task 510 | prompt eval time = 138.58 ms / 28 tokens ( 4.95 ms per token, 202.05 tokens per second)
1.34.634.329 I slot print_timing: id 0 | task 510 | eval time = 5082.29 ms / 125 tokens ( 40.66 ms per token, 24.60 tokens per second)
1.34.634.330 I slot print_timing: id 0 | task 510 | total time = 5220.86 ms / 153 tokens
1.34.634.331 I slot print_timing: id 0 | task 510 | graphs reused = 1
1.34.634.334 I slot print_timing: id 0 | task 510 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.34.634.345 I statistics draft-mtp: #calls(b,g,a) = 128 436 6562, #gen drafts = 6569, #acc drafts = 4580, #gen tokens = 13100, #acc tokens = 8682, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.625), dur(b,g,a) = 0.080, 1642.067, 7.771 ms
1.34.634.362 I slot release: id 0 | task 510 | stop processing: n_tokens = 152, truncated = 0
1.34.635.007 I slot print_timing: id 1 | task 522 | n_decoded = 101, tg = 25.53 t/s, tg_3s = 25.53 t/s
1.34.697.277 I slot print_timing: id 13 | task 528 | n_decoded = 102, tg = 30.01 t/s, tg_3s = 30.01 t/s
1.34.937.476 I slot print_timing: id 13 | task 528 | prompt eval time = 124.73 ms / 25 tokens ( 4.99 ms per token, 200.44 tokens per second)
1.34.937.479 I slot print_timing: id 13 | task 528 | eval time = 3639.01 ms / 114 tokens ( 31.92 ms per token, 31.33 tokens per second)
1.34.937.479 I slot print_timing: id 13 | task 528 | total time = 3763.74 ms / 139 tokens
1.34.937.480 I slot print_timing: id 13 | task 528 | graphs reused = 1
1.34.937.483 I slot print_timing: id 13 | task 528 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (1.000, 0.897)
1.34.937.494 I statistics draft-mtp: #calls(b,g,a) = 128 441 6603, #gen drafts = 6604, #acc drafts = 4601, #gen tokens = 13169, #acc tokens = 8720, #mean acc len = 2.32, #acc rate/pos = (0.697, 0.624), dur(b,g,a) = 0.080, 1672.268, 7.819 ms
1.34.937.512 I slot release: id 13 | task 528 | stop processing: n_tokens = 138, truncated = 0
1.34.984.175 I slot print_timing: id 11 | task 485 | prompt eval time = 153.85 ms / 29 tokens ( 5.31 ms per token, 188.49 tokens per second)
1.34.984.178 I slot print_timing: id 11 | task 485 | eval time = 7668.90 ms / 128 tokens ( 59.91 ms per token, 16.69 tokens per second)
1.34.984.178 I slot print_timing: id 11 | task 485 | total time = 7822.76 ms / 157 tokens
1.34.984.179 I slot print_timing: id 11 | task 485 | graphs reused = 1
1.34.984.181 I slot print_timing: id 11 | task 485 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.34.984.193 I statistics draft-mtp: #calls(b,g,a) = 128 442 6604, #gen drafts = 6609, #acc drafts = 4602, #gen tokens = 13179, #acc tokens = 8722, #mean acc len = 2.32, #acc rate/pos = (0.697, 0.624), dur(b,g,a) = 0.080, 1676.481, 7.821 ms
1.34.984.209 I slot release: id 11 | task 485 | stop processing: n_tokens = 156, truncated = 0
1.35.030.449 I slot print_timing: id 15 | task 509 | n_decoded = 100, tg = 18.25 t/s, tg_3s = 18.25 t/s
1.35.110.926 I slot print_timing: id 2 | task 493 | prompt eval time = 124.22 ms / 29 tokens ( 4.28 ms per token, 233.45 tokens per second)
1.35.110.929 I slot print_timing: id 2 | task 493 | eval time = 7177.99 ms / 128 tokens ( 56.08 ms per token, 17.83 tokens per second)
1.35.110.929 I slot print_timing: id 2 | task 493 | total time = 7302.22 ms / 157 tokens
1.35.110.930 I slot print_timing: id 2 | task 493 | graphs reused = 1
1.35.110.934 I slot print_timing: id 2 | task 493 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.35.110.951 I statistics draft-mtp: #calls(b,g,a) = 128 445 6619, #gen drafts = 6623, #acc drafts = 4610, #gen tokens = 13206, #acc tokens = 8737, #mean acc len = 2.32, #acc rate/pos = (0.696, 0.624), dur(b,g,a) = 0.080, 1688.720, 7.842 ms
1.35.110.970 I slot release: id 2 | task 493 | stop processing: n_tokens = 156, truncated = 0
1.35.111.657 I slot print_timing: id 1 | task 522 | prompt eval time = 125.17 ms / 28 tokens ( 4.47 ms per token, 223.69 tokens per second)
1.35.111.658 I slot print_timing: id 1 | task 522 | eval time = 4432.08 ms / 125 tokens ( 35.46 ms per token, 28.20 tokens per second)
1.35.111.659 I slot print_timing: id 1 | task 522 | total time = 4557.25 ms / 153 tokens
1.35.111.659 I slot print_timing: id 1 | task 522 | graphs reused = 1
1.35.111.661 I slot print_timing: id 1 | task 522 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.35.111.667 I statistics draft-mtp: #calls(b,g,a) = 128 445 6620, #gen drafts = 6623, #acc drafts = 4611, #gen tokens = 13206, #acc tokens = 8739, #mean acc len = 2.32, #acc rate/pos = (0.697, 0.624), dur(b,g,a) = 0.080, 1688.720, 7.844 ms
1.35.111.680 I slot release: id 1 | task 522 | stop processing: n_tokens = 152, truncated = 0
1.35.247.318 I slot print_timing: id 8 | task 519 | n_decoded = 100, tg = 20.74 t/s, tg_3s = 20.74 t/s
1.35.509.712 I slot print_timing: id 15 | task 509 | prompt eval time = 138.79 ms / 29 tokens ( 4.79 ms per token, 208.94 tokens per second)
1.35.509.715 I slot print_timing: id 15 | task 509 | eval time = 5957.40 ms / 128 tokens ( 46.54 ms per token, 21.49 tokens per second)
1.35.509.715 I slot print_timing: id 15 | task 509 | total time = 6096.19 ms / 157 tokens
1.35.509.716 I slot print_timing: id 15 | task 509 | graphs reused = 1
1.35.509.719 I slot print_timing: id 15 | task 509 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.35.509.730 I statistics draft-mtp: #calls(b,g,a) = 128 460 6665, #gen drafts = 6667, #acc drafts = 4629, #gen tokens = 13293, #acc tokens = 8773, #mean acc len = 2.32, #acc rate/pos = (0.695, 0.622), dur(b,g,a) = 0.080, 1731.401, 7.894 ms
1.35.509.745 I slot release: id 15 | task 509 | stop processing: n_tokens = 156, truncated = 0
1.35.564.479 I slot print_timing: id 6 | task 537 | n_decoded = 100, tg = 30.39 t/s, tg_3s = 30.39 t/s
1.35.631.311 I slot print_timing: id 8 | task 519 | prompt eval time = 125.15 ms / 29 tokens ( 4.32 ms per token, 231.73 tokens per second)
1.35.631.313 I slot print_timing: id 8 | task 519 | eval time = 5204.96 ms / 128 tokens ( 40.66 ms per token, 24.59 tokens per second)
1.35.631.314 I slot print_timing: id 8 | task 519 | total time = 5330.11 ms / 157 tokens
1.35.631.314 I slot print_timing: id 8 | task 519 | graphs reused = 1
1.35.631.317 I slot print_timing: id 8 | task 519 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.35.631.330 I statistics draft-mtp: #calls(b,g,a) = 128 467 6679, #gen drafts = 6680, #acc drafts = 4636, #gen tokens = 13318, #acc tokens = 8785, #mean acc len = 2.32, #acc rate/pos = (0.694, 0.621), dur(b,g,a) = 0.080, 1744.115, 7.909 ms
1.35.631.346 I slot release: id 8 | task 519 | stop processing: n_tokens = 156, truncated = 0
1.35.739.807 I slot print_timing: id 6 | task 537 | prompt eval time = 113.67 ms / 29 tokens ( 3.92 ms per token, 255.13 tokens per second)
1.35.739.810 I slot print_timing: id 6 | task 537 | eval time = 3465.58 ms / 128 tokens ( 27.07 ms per token, 36.93 tokens per second)
1.35.739.811 I slot print_timing: id 6 | task 537 | total time = 3579.25 ms / 157 tokens
1.35.739.811 I slot print_timing: id 6 | task 537 | graphs reused = 11
1.35.739.814 I slot print_timing: id 6 | task 537 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.35.739.827 I statistics draft-mtp: #calls(b,g,a) = 128 479 6692, #gen drafts = 6692, #acc drafts = 4640, #gen tokens = 13341, #acc tokens = 8793, #mean acc len = 2.31, #acc rate/pos = (0.693, 0.621), dur(b,g,a) = 0.080, 1756.073, 7.919 ms
1.35.739.841 I slot release: id 6 | task 537 | stop processing: n_tokens = 156, truncated = 0
1.35.739.851 I srv update_slots: all slots are idle