0.00.137.855 I log_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.137.858 I device_info:
0.00.213.173 I - CUDA0 : NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition (97244 MiB, 96677 MiB free)
0.00.213.188 I - CPU : AMD Ryzen Threadripper 9960X 24-Cores (257066 MiB, 257066 MiB free)
0.00.213.279 I system_info: n_threads = 24 (n_threads_batch = 24) / 48 | CUDA : ARCHS = 1200 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | BLACKWELL_NATIVE_FP4 = 1 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
0.00.213.358 I srv init: using 47 threads for HTTP server
0.00.213.564 I srv start: binding port with default address family
0.00.214.687 I srv llama_server: loading model
0.00.214.730 I srv load_model: loading model '/home/ripper/ornith-35b-lab/artifacts/quant/ornith-1.0-35b-IQ4_XS.gguf'
0.00.486.673 I srv load_model: [spec] estimated memory usage of draft model is 4143.45 MiB
0.00.486.711 I common_init_result: fitting params to device memory ...
0.00.486.712 I common_init_result: (for bugs during this step try to reproduce them with -fit off, or provide --verbose logs if the bug only occurs with -fit on)
0.02.514.635 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.02.532.255 I common_init_from_params: warming up the model with an empty run - please wait ... (--no-warmup to disable)
0.02.568.149 I srv load_model: loading draft model '/home/ripper/ornith-35b-lab/artifacts/mtp/ornith-1.0-35b-mtp-chaincorr-h2r9fw125-h1r2-h3r6ce375-lr5e7-Q6_K.gguf'
0.02.912.264 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.02.922.934 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.02.933.654 W srv operator(): LLAMA_MTP_PER_HEAD_CONTEXT disables prompt cache; per-head MTP state is not prompt-cache serializable yet
0.02.933.657 W srv operator(): LLAMA_MTP_PER_HEAD_CONTEXT disables context checkpoints; per-head MTP state is not checkpoint-serializable yet
0.02.933.658 I srv operator(): [spec] created 2 MTP draft contexts, one per active head
0.02.933.671 I srv load_model: initializing slots, n_slots = 16
0.02.944.706 I common_context_can_seq_rm: the context supports bounded partial sequence removal
0.02.953.024 I common_speculative_impl_draft_mtp: adding speculative implementation 'draft-mtp'
0.02.953.027 I common_speculative_impl_draft_mtp: - n_max=2, n_min=0, p_min=0.00, n_embd=2048, backend_sampling=1
0.02.953.028 I common_speculative_impl_draft_mtp: - gpu_layers=99, cache_k=f16, cache_v=f16, ctx_tgt=yes, ctx_dft=yes, devices=[default]
0.02.953.155 I common_speculative_impl_draft_mtp: - draft sampler top_k=1 top_p=1.000 temp=1.000
0.02.953.181 I common_speculative_impl_draft_mtp: - fast backend MTP sampling enabled
0.02.953.183 I common_speculative_impl_draft_mtp: - per-head MTP contexts enabled (2 active heads)
0.02.953.189 I common_speculative_impl_draft_mtp: - backend draft sampler top_k=1 top_p=1.000 temp=1.000 contexts=2
0.02.953.257 I common_speculative_impl_draft_mtp: - deferred MTP replay enabled
0.02.973.874 I srv load_model: speculative decoding context initialized
0.02.973.878 I slot load_model: id 0 | task -1 | new slot, n_ctx = 8192
0.02.973.888 I slot load_model: id 1 | task -1 | new slot, n_ctx = 8192
0.02.973.889 I slot load_model: id 2 | task -1 | new slot, n_ctx = 8192
0.02.973.889 I slot load_model: id 3 | task -1 | new slot, n_ctx = 8192
0.02.973.889 I slot load_model: id 4 | task -1 | new slot, n_ctx = 8192
0.02.973.890 I slot load_model: id 5 | task -1 | new slot, n_ctx = 8192
0.02.973.890 I slot load_model: id 6 | task -1 | new slot, n_ctx = 8192
0.02.973.890 I slot load_model: id 7 | task -1 | new slot, n_ctx = 8192
0.02.973.890 I slot load_model: id 8 | task -1 | new slot, n_ctx = 8192
0.02.973.890 I slot load_model: id 9 | task -1 | new slot, n_ctx = 8192
0.02.973.891 I slot load_model: id 10 | task -1 | new slot, n_ctx = 8192
0.02.973.891 I slot load_model: id 11 | task -1 | new slot, n_ctx = 8192
0.02.973.891 I slot load_model: id 12 | task -1 | new slot, n_ctx = 8192
0.02.973.892 I slot load_model: id 13 | task -1 | new slot, n_ctx = 8192
0.02.973.892 I slot load_model: id 14 | task -1 | new slot, n_ctx = 8192
0.02.973.892 I slot load_model: id 15 | task -1 | new slot, n_ctx = 8192
0.02.973.939 I srv load_model: prompt cache is disabled - use `--cache-ram N` to enable it
0.02.973.940 I srv load_model: for more info see https://github.com/ggml-org/llama.cpp/pull/16391
0.02.973.940 I srv load_model: context checkpoints disabled
0.02.973.956 W srv init: --cache-idle-slots requires --cache-ram, disabling
0.02.982.701 I init: chat template, example_format: '<|im_start|>system
You are a helpful assistant<|im_end|>
<|im_start|>user
Hello<|im_end|>
<|im_start|>assistant
Hi there<|im_end|>
<|im_start|>user
How are you?<|im_end|>
<|im_start|>assistant
'
0.02.989.067 I srv init: init: chat template, thinking = 0
0.02.989.112 I srv llama_server: model loaded
0.02.989.116 I srv llama_server: server is listening on http://0.0.0.0:8024
0.02.989.123 I srv update_slots: all slots are idle
0.39.964.793 I srv operator(): Chat format: peg-native
0.39.964.801 I srv operator(): Chat format: peg-native
0.39.964.809 I srv operator(): Chat format: peg-native
0.39.964.821 I srv operator(): Chat format: peg-native
0.39.964.830 I srv operator(): Chat format: peg-native
0.39.964.837 I srv operator(): Chat format: peg-native
0.39.964.841 I srv operator(): Chat format: peg-native
0.39.964.843 I srv operator(): Chat format: peg-native
0.39.964.967 I slot get_availabl: id 15 | task -1 | selected slot by LRU, t_last = -1
0.39.965.086 I slot launch_slot_: id 15 | task 4 | processing task, is_child = 0
0.39.965.089 I slot get_availabl: id 14 | task -1 | selected slot by LRU, t_last = -1
0.39.965.108 I slot launch_slot_: id 14 | task 5 | processing task, is_child = 0
0.39.965.111 I slot get_availabl: id 13 | task -1 | selected slot by LRU, t_last = -1
0.39.965.127 I slot launch_slot_: id 13 | task 6 | processing task, is_child = 0
0.39.965.130 I slot get_availabl: id 12 | task -1 | selected slot by LRU, t_last = -1
0.39.965.145 I slot launch_slot_: id 12 | task 2 | processing task, is_child = 0
0.39.965.148 I slot get_availabl: id 11 | task -1 | selected slot by LRU, t_last = -1
0.39.965.162 I slot launch_slot_: id 11 | task 0 | processing task, is_child = 0
0.39.965.164 I slot get_availabl: id 10 | task -1 | selected slot by LRU, t_last = -1
0.39.965.177 I slot launch_slot_: id 10 | task 7 | processing task, is_child = 0
0.39.965.180 I slot get_availabl: id 9 | task -1 | selected slot by LRU, t_last = -1
0.39.965.195 I slot launch_slot_: id 9 | task 1 | processing task, is_child = 0
0.39.965.197 I slot get_availabl: id 8 | task -1 | selected slot by LRU, t_last = -1
0.39.965.211 I slot launch_slot_: id 8 | task 3 | processing task, is_child = 0
0.39.965.273 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.39.965.311 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.39.965.328 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.39.965.348 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.39.965.369 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.39.965.531 I srv operator(): Chat format: peg-native
0.39.966.760 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.39.966.767 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.39.966.786 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.39.970.344 I srv operator(): Chat format: peg-native
0.39.971.100 I srv operator(): Chat format: peg-native
0.39.972.234 I srv operator(): Chat format: peg-native
0.39.972.428 I srv operator(): Chat format: peg-native
0.39.979.885 I srv operator(): Chat format: peg-native
0.39.982.020 I srv operator(): Chat format: peg-native
0.39.982.040 I srv operator(): Chat format: peg-native
0.40.232.334 I slot get_availabl: id 7 | task -1 | selected slot by LRU, t_last = -1
0.40.232.406 I slot launch_slot_: id 7 | task 9 | processing task, is_child = 0
0.40.232.408 I slot get_availabl: id 6 | task -1 | selected slot by LRU, t_last = -1
0.40.232.423 I slot launch_slot_: id 6 | task 10 | processing task, is_child = 0
0.40.232.426 I slot get_availabl: id 5 | task -1 | selected slot by LRU, t_last = -1
0.40.232.440 I slot launch_slot_: id 5 | task 11 | processing task, is_child = 0
0.40.232.442 I slot get_availabl: id 4 | task -1 | selected slot by LRU, t_last = -1
0.40.232.454 I slot launch_slot_: id 4 | task 12 | processing task, is_child = 0
0.40.232.457 I slot get_availabl: id 3 | task -1 | selected slot by LRU, t_last = -1
0.40.232.469 I slot launch_slot_: id 3 | task 13 | processing task, is_child = 0
0.40.232.471 I slot get_availabl: id 2 | task -1 | selected slot by LRU, t_last = -1
0.40.232.481 I slot launch_slot_: id 2 | task 14 | processing task, is_child = 0
0.40.232.483 I slot get_availabl: id 1 | task -1 | selected slot by LRU, t_last = -1
0.40.232.495 I slot launch_slot_: id 1 | task 15 | processing task, is_child = 0
0.40.232.497 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = -1
0.40.232.508 I slot launch_slot_: id 0 | task 16 | processing task, is_child = 0
0.40.239.394 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.239.414 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.239.433 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.239.442 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.239.469 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.239.487 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.239.507 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.239.518 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.44.805.901 I slot print_timing: id 9 | task 1 | n_decoded = 102, tg = 22.28 t/s, tg_3s = 22.28 t/s
0.44.809.848 I slot print_timing: id 14 | task 5 | n_decoded = 102, tg = 22.28 t/s, tg_3s = 22.28 t/s
0.44.810.794 I slot print_timing: id 15 | task 4 | n_decoded = 102, tg = 22.28 t/s, tg_3s = 22.28 t/s
0.44.925.434 I slot print_timing: id 1 | task 15 | n_decoded = 102, tg = 22.90 t/s, tg_3s = 22.90 t/s
0.44.928.941 I slot print_timing: id 5 | task 11 | n_decoded = 102, tg = 22.89 t/s, tg_3s = 22.89 t/s
0.44.929.918 I slot print_timing: id 6 | task 10 | n_decoded = 102, tg = 22.89 t/s, tg_3s = 22.89 t/s
0.45.316.888 I slot print_timing: id 10 | task 7 | n_decoded = 101, tg = 19.85 t/s, tg_3s = 19.85 t/s
0.45.317.879 I slot print_timing: id 11 | task 0 | n_decoded = 101, tg = 19.85 t/s, tg_3s = 19.85 t/s
0.45.437.324 I slot print_timing: id 2 | task 14 | n_decoded = 101, tg = 20.34 t/s, tg_3s = 20.34 t/s
0.45.438.322 I slot print_timing: id 3 | task 13 | n_decoded = 101, tg = 20.34 t/s, tg_3s = 20.34 t/s
0.45.441.821 I slot print_timing: id 7 | task 9 | n_decoded = 101, tg = 20.33 t/s, tg_3s = 20.33 t/s
0.45.443.363 I slot print_timing: id 9 | task 1 | prompt eval time = 263.04 ms / 25 tokens ( 10.52 ms per token, 95.04 tokens per second)
0.45.443.365 I slot print_timing: id 9 | task 1 | eval time = 5215.00 ms / 114 tokens ( 45.75 ms per token, 21.86 tokens per second)
0.45.443.366 I slot print_timing: id 9 | task 1 | total time = 5478.04 ms / 139 tokens
0.45.443.372 I slot print_timing: id 9 | task 1 | graphs reused = 1
0.45.443.375 I slot print_timing: id 9 | task 1 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.45.443.396 I statistics draft-mtp: #calls(b,g,a) = 16 40 626, #gen drafts = 632, #acc drafts = 490, #gen tokens = 1264, #acc tokens = 915, #mean acc len = 2.46, #acc rate/pos = (0.783, 0.679), dur(b,g,a) = 0.013, 109.845, 224.477 ms
0.45.443.433 I slot release: id 9 | task 1 | stop processing: n_tokens = 140, truncated = 0
0.45.447.609 I slot print_timing: id 14 | task 5 | prompt eval time = 264.82 ms / 25 tokens ( 10.59 ms per token, 94.40 tokens per second)
0.45.447.612 I slot print_timing: id 14 | task 5 | eval time = 5216.01 ms / 114 tokens ( 45.75 ms per token, 21.86 tokens per second)
0.45.447.612 I slot print_timing: id 14 | task 5 | total time = 5480.83 ms / 139 tokens
0.45.447.613 I slot print_timing: id 14 | task 5 | graphs reused = 1
0.45.447.615 I slot print_timing: id 14 | task 5 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.45.447.624 I statistics draft-mtp: #calls(b,g,a) = 16 40 631, #gen drafts = 632, #acc drafts = 493, #gen tokens = 1264, #acc tokens = 921, #mean acc len = 2.46, #acc rate/pos = (0.781, 0.678), dur(b,g,a) = 0.013, 109.845, 226.161 ms
0.45.447.647 I slot release: id 14 | task 5 | stop processing: n_tokens = 140, truncated = 0
0.45.448.611 I slot print_timing: id 15 | task 4 | prompt eval time = 265.53 ms / 25 tokens ( 10.62 ms per token, 94.15 tokens per second)
0.45.448.612 I slot print_timing: id 15 | task 4 | eval time = 5216.28 ms / 114 tokens ( 45.76 ms per token, 21.85 tokens per second)
0.45.448.612 I slot print_timing: id 15 | task 4 | total time = 5481.81 ms / 139 tokens
0.45.448.613 I slot print_timing: id 15 | task 4 | graphs reused = 1
0.45.448.615 I slot print_timing: id 15 | task 4 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.45.448.620 I statistics draft-mtp: #calls(b,g,a) = 16 40 632, #gen drafts = 632, #acc drafts = 494, #gen tokens = 1264, #acc tokens = 923, #mean acc len = 2.46, #acc rate/pos = (0.782, 0.679), dur(b,g,a) = 0.013, 109.845, 226.522 ms
0.45.448.636 I slot release: id 15 | task 4 | stop processing: n_tokens = 140, truncated = 0
0.45.452.308 I srv operator(): Chat format: peg-native
0.45.455.633 I srv operator(): Chat format: peg-native
0.45.457.656 I srv operator(): Chat format: peg-native
0.45.543.535 I slot print_timing: id 1 | task 15 | prompt eval time = 231.04 ms / 25 tokens ( 9.24 ms per token, 108.21 tokens per second)
0.45.543.538 I slot print_timing: id 1 | task 15 | eval time = 5073.09 ms / 114 tokens ( 44.50 ms per token, 22.47 tokens per second)
0.45.543.539 I slot print_timing: id 1 | task 15 | total time = 5304.13 ms / 139 tokens
0.45.543.540 I slot print_timing: id 1 | task 15 | graphs reused = 1
0.45.543.542 I slot print_timing: id 1 | task 15 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.45.543.553 I statistics draft-mtp: #calls(b,g,a) = 16 41 634, #gen drafts = 645, #acc drafts = 495, #gen tokens = 1290, #acc tokens = 925, #mean acc len = 2.46, #acc rate/pos = (0.781, 0.678), dur(b,g,a) = 0.013, 113.701, 227.400 ms
0.45.543.577 I slot release: id 1 | task 15 | stop processing: n_tokens = 140, truncated = 0
0.45.547.196 I slot print_timing: id 5 | task 11 | prompt eval time = 233.48 ms / 25 tokens ( 9.34 ms per token, 107.08 tokens per second)
0.45.547.199 I slot print_timing: id 5 | task 11 | eval time = 5074.23 ms / 114 tokens ( 44.51 ms per token, 22.47 tokens per second)
0.45.547.199 I slot print_timing: id 5 | task 11 | total time = 5307.71 ms / 139 tokens
0.45.547.200 I slot print_timing: id 5 | task 11 | graphs reused = 1
0.45.547.202 I slot print_timing: id 5 | task 11 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.45.547.212 I statistics draft-mtp: #calls(b,g,a) = 16 41 638, #gen drafts = 645, #acc drafts = 498, #gen tokens = 1290, #acc tokens = 931, #mean acc len = 2.46, #acc rate/pos = (0.781, 0.679), dur(b,g,a) = 0.013, 113.701, 228.850 ms
0.45.547.236 I slot release: id 5 | task 11 | stop processing: n_tokens = 140, truncated = 0
0.45.548.193 I slot print_timing: id 6 | task 10 | prompt eval time = 234.05 ms / 25 tokens ( 9.36 ms per token, 106.82 tokens per second)
0.45.548.194 I slot print_timing: id 6 | task 10 | eval time = 5074.64 ms / 114 tokens ( 44.51 ms per token, 22.46 tokens per second)
0.45.548.195 I slot print_timing: id 6 | task 10 | total time = 5308.69 ms / 139 tokens
0.45.548.195 I slot print_timing: id 6 | task 10 | graphs reused = 1
0.45.548.197 I slot print_timing: id 6 | task 10 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.45.548.202 I statistics draft-mtp: #calls(b,g,a) = 16 41 639, #gen drafts = 645, #acc drafts = 499, #gen tokens = 1290, #acc tokens = 933, #mean acc len = 2.46, #acc rate/pos = (0.781, 0.679), dur(b,g,a) = 0.013, 113.701, 229.218 ms
0.45.548.219 I slot release: id 6 | task 10 | stop processing: n_tokens = 140, truncated = 0
0.45.551.968 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.021
0.45.552.030 I slot launch_slot_: id 1 | task 58 | processing task, is_child = 0
0.45.552.033 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.021
0.45.552.049 I slot launch_slot_: id 5 | task 59 | processing task, is_child = 0
0.45.552.054 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
0.45.552.067 I slot launch_slot_: id 6 | task 60 | processing task, is_child = 0
0.45.552.243 I srv operator(): Chat format: peg-native
0.45.555.420 I srv operator(): Chat format: peg-native
0.45.557.601 I srv operator(): Chat format: peg-native
0.45.558.423 W slot operator(): id 1 | task 58 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.558.453 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.558.486 W slot operator(): id 5 | task 59 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.558.518 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.558.533 W slot operator(): id 6 | task 60 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.558.565 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.697.461 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.021
0.45.697.526 I slot launch_slot_: id 9 | task 62 | processing task, is_child = 0
0.45.697.529 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.021
0.45.697.548 I slot launch_slot_: id 14 | task 63 | processing task, is_child = 0
0.45.697.551 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
0.45.697.570 I slot launch_slot_: id 15 | task 64 | processing task, is_child = 0
0.45.701.458 W slot operator(): id 9 | task 62 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.701.478 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.701.513 W slot operator(): id 14 | task 63 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.701.542 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.701.564 W slot operator(): id 15 | task 64 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.701.589 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.492.684 I slot print_timing: id 10 | task 7 | prompt eval time = 263.69 ms / 28 tokens ( 9.42 ms per token, 106.19 tokens per second)
0.46.492.687 I slot print_timing: id 10 | task 7 | eval time = 6263.62 ms / 125 tokens ( 50.11 ms per token, 19.96 tokens per second)
0.46.492.688 I slot print_timing: id 10 | task 7 | total time = 6527.31 ms / 153 tokens
0.46.492.688 I slot print_timing: id 10 | task 7 | graphs reused = 1
0.46.492.692 I slot print_timing: id 10 | task 7 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.492.704 I statistics draft-mtp: #calls(b,g,a) = 22 48 743, #gen drafts = 748, #acc drafts = 567, #gen tokens = 1496, #acc tokens = 1060, #mean acc len = 2.43, #acc rate/pos = (0.763, 0.664), dur(b,g,a) = 0.017, 137.430, 265.445 ms
0.46.492.732 I slot release: id 10 | task 7 | stop processing: n_tokens = 152, truncated = 0
0.46.493.704 I slot print_timing: id 11 | task 0 | prompt eval time = 264.35 ms / 28 tokens ( 9.44 ms per token, 105.92 tokens per second)
0.46.493.706 I slot print_timing: id 11 | task 0 | eval time = 6263.98 ms / 125 tokens ( 50.11 ms per token, 19.96 tokens per second)
0.46.493.706 I slot print_timing: id 11 | task 0 | total time = 6528.33 ms / 153 tokens
0.46.493.707 I slot print_timing: id 11 | task 0 | graphs reused = 1
0.46.493.708 I slot print_timing: id 11 | task 0 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.493.714 I statistics draft-mtp: #calls(b,g,a) = 22 48 744, #gen drafts = 748, #acc drafts = 568, #gen tokens = 1496, #acc tokens = 1062, #mean acc len = 2.43, #acc rate/pos = (0.763, 0.664), dur(b,g,a) = 0.017, 137.430, 265.811 ms
0.46.493.731 I slot release: id 11 | task 0 | stop processing: n_tokens = 152, truncated = 0
0.46.501.665 I srv operator(): Chat format: peg-native
0.46.502.391 I srv operator(): Chat format: peg-native
0.46.601.636 I slot print_timing: id 2 | task 14 | prompt eval time = 231.61 ms / 28 tokens ( 8.27 ms per token, 120.89 tokens per second)
0.46.601.638 I slot print_timing: id 2 | task 14 | eval time = 6130.59 ms / 125 tokens ( 49.04 ms per token, 20.39 tokens per second)
0.46.601.639 I slot print_timing: id 2 | task 14 | total time = 6362.20 ms / 153 tokens
0.46.601.640 I slot print_timing: id 2 | task 14 | graphs reused = 1
0.46.601.642 I slot print_timing: id 2 | task 14 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.601.654 I statistics draft-mtp: #calls(b,g,a) = 22 49 751, #gen drafts = 762, #acc drafts = 572, #gen tokens = 1524, #acc tokens = 1070, #mean acc len = 2.42, #acc rate/pos = (0.762, 0.663), dur(b,g,a) = 0.017, 142.833, 268.338 ms
0.46.601.687 I slot release: id 2 | task 14 | stop processing: n_tokens = 152, truncated = 0
0.46.602.663 I slot print_timing: id 3 | task 13 | prompt eval time = 232.19 ms / 28 tokens ( 8.29 ms per token, 120.59 tokens per second)
0.46.602.665 I slot print_timing: id 3 | task 13 | eval time = 6131.01 ms / 125 tokens ( 49.05 ms per token, 20.39 tokens per second)
0.46.602.665 I slot print_timing: id 3 | task 13 | total time = 6363.19 ms / 153 tokens
0.46.602.665 I slot print_timing: id 3 | task 13 | graphs reused = 1
0.46.602.667 I slot print_timing: id 3 | task 13 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.602.671 I statistics draft-mtp: #calls(b,g,a) = 22 49 752, #gen drafts = 762, #acc drafts = 573, #gen tokens = 1524, #acc tokens = 1072, #mean acc len = 2.43, #acc rate/pos = (0.762, 0.664), dur(b,g,a) = 0.017, 142.833, 268.695 ms
0.46.602.694 I slot release: id 3 | task 13 | stop processing: n_tokens = 152, truncated = 0
0.46.606.144 I slot print_timing: id 7 | task 9 | prompt eval time = 234.75 ms / 28 tokens ( 8.38 ms per token, 119.28 tokens per second)
0.46.606.145 I slot print_timing: id 7 | task 9 | eval time = 6131.86 ms / 125 tokens ( 49.05 ms per token, 20.39 tokens per second)
0.46.606.146 I slot print_timing: id 7 | task 9 | total time = 6366.61 ms / 153 tokens
0.46.606.146 I slot print_timing: id 7 | task 9 | graphs reused = 1
0.46.606.148 I slot print_timing: id 7 | task 9 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.606.154 I statistics draft-mtp: #calls(b,g,a) = 22 49 756, #gen drafts = 762, #acc drafts = 576, #gen tokens = 1524, #acc tokens = 1078, #mean acc len = 2.43, #acc rate/pos = (0.762, 0.664), dur(b,g,a) = 0.017, 142.833, 270.067 ms
0.46.606.172 I slot release: id 7 | task 9 | stop processing: n_tokens = 152, truncated = 0
0.46.609.978 I srv operator(): Chat format: peg-native
0.46.610.347 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.46.610.386 I slot launch_slot_: id 2 | task 72 | processing task, is_child = 0
0.46.610.389 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.46.610.407 I slot launch_slot_: id 3 | task 73 | processing task, is_child = 0
0.46.610.409 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.020
0.46.610.422 I slot launch_slot_: id 7 | task 74 | processing task, is_child = 0
0.46.610.824 I srv operator(): Chat format: peg-native
0.46.614.343 I srv operator(): Chat format: peg-native
0.46.615.750 W slot operator(): id 2 | task 72 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.615.776 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.615.813 W slot operator(): id 3 | task 73 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.615.847 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.615.865 W slot operator(): id 7 | task 74 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.615.913 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.762.397 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.46.762.459 I slot launch_slot_: id 10 | task 76 | processing task, is_child = 0
0.46.762.463 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.46.762.481 I slot launch_slot_: id 11 | task 77 | processing task, is_child = 0
0.46.766.488 W slot operator(): id 10 | task 76 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.766.537 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.766.547 W slot operator(): id 11 | task 77 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.766.582 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.290.451 I slot print_timing: id 8 | task 3 | n_decoded = 100, tg = 14.16 t/s, tg_3s = 14.16 t/s
0.47.293.502 I slot print_timing: id 12 | task 2 | n_decoded = 100, tg = 14.16 t/s, tg_3s = 14.16 t/s
0.47.294.445 I slot print_timing: id 13 | task 6 | n_decoded = 100, tg = 14.16 t/s, tg_3s = 14.16 t/s
0.47.410.180 I slot print_timing: id 0 | task 16 | n_decoded = 100, tg = 14.41 t/s, tg_3s = 14.41 t/s
0.47.413.742 I slot print_timing: id 4 | task 12 | n_decoded = 100, tg = 14.41 t/s, tg_3s = 14.41 t/s
0.49.292.154 I slot print_timing: id 8 | task 3 | prompt eval time = 262.48 ms / 29 tokens ( 9.05 ms per token, 110.49 tokens per second)
0.49.292.159 I slot print_timing: id 8 | task 3 | eval time = 9064.42 ms / 128 tokens ( 70.82 ms per token, 14.12 tokens per second)
0.49.292.160 I slot print_timing: id 8 | task 3 | total time = 9326.89 ms / 157 tokens
0.49.292.161 I slot print_timing: id 8 | task 3 | graphs reused = 1
0.49.292.164 I slot print_timing: id 8 | task 3 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.292.188 I statistics draft-mtp: #calls(b,g,a) = 27 70 1075, #gen drafts = 1088, #acc drafts = 792, #gen tokens = 2171, #acc tokens = 1477, #mean acc len = 2.37, #acc rate/pos = (0.737, 0.637), dur(b,g,a) = 0.019, 207.145, 381.103 ms
0.49.292.216 I slot release: id 8 | task 3 | stop processing: n_tokens = 156, truncated = 0
0.49.292.433 I slot print_timing: id 12 | task 2 | prompt eval time = 264.94 ms / 29 tokens ( 9.14 ms per token, 109.46 tokens per second)
0.49.292.436 I slot print_timing: id 12 | task 2 | eval time = 9062.13 ms / 128 tokens ( 70.80 ms per token, 14.12 tokens per second)
0.49.292.437 I slot print_timing: id 12 | task 2 | total time = 9327.07 ms / 157 tokens
0.49.292.437 I slot print_timing: id 12 | task 2 | graphs reused = 1
0.49.292.438 I slot print_timing: id 12 | task 2 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.292.441 I statistics draft-mtp: #calls(b,g,a) = 27 70 1075, #gen drafts = 1088, #acc drafts = 792, #gen tokens = 2171, #acc tokens = 1477, #mean acc len = 2.37, #acc rate/pos = (0.737, 0.637), dur(b,g,a) = 0.019, 207.145, 381.103 ms
0.49.292.457 I slot release: id 12 | task 2 | stop processing: n_tokens = 156, truncated = 0
0.49.292.656 I slot print_timing: id 13 | task 6 | prompt eval time = 265.63 ms / 29 tokens ( 9.16 ms per token, 109.18 tokens per second)
0.49.292.659 I slot print_timing: id 13 | task 6 | eval time = 9061.64 ms / 128 tokens ( 70.79 ms per token, 14.13 tokens per second)
0.49.292.660 I slot print_timing: id 13 | task 6 | total time = 9327.27 ms / 157 tokens
0.49.292.660 I slot print_timing: id 13 | task 6 | graphs reused = 1
0.49.292.661 I slot print_timing: id 13 | task 6 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.292.663 I statistics draft-mtp: #calls(b,g,a) = 27 70 1075, #gen drafts = 1088, #acc drafts = 792, #gen tokens = 2171, #acc tokens = 1477, #mean acc len = 2.37, #acc rate/pos = (0.737, 0.637), dur(b,g,a) = 0.019, 207.145, 381.103 ms
0.49.292.688 I slot release: id 13 | task 6 | stop processing: n_tokens = 156, truncated = 0
0.49.302.458 I srv operator(): Chat format: peg-native
0.49.303.188 I srv operator(): Chat format: peg-native
0.49.303.271 I srv operator(): Chat format: peg-native
0.49.303.345 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.49.303.381 I slot launch_slot_: id 8 | task 98 | processing task, is_child = 0
0.49.303.384 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.49.303.400 I slot launch_slot_: id 12 | task 99 | processing task, is_child = 0
0.49.303.403 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.49.303.417 I slot launch_slot_: id 13 | task 100 | processing task, is_child = 0
0.49.308.557 W slot operator(): id 8 | task 98 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.308.589 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.308.624 W slot operator(): id 12 | task 99 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.308.651 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.308.684 W slot operator(): id 13 | task 100 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.308.702 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.453.648 I slot print_timing: id 0 | task 16 | prompt eval time = 230.30 ms / 29 tokens ( 7.94 ms per token, 125.92 tokens per second)
0.49.453.654 I slot print_timing: id 0 | task 16 | eval time = 8983.95 ms / 128 tokens ( 70.19 ms per token, 14.25 tokens per second)
0.49.453.655 I slot print_timing: id 0 | task 16 | total time = 9214.26 ms / 157 tokens
0.49.453.655 I slot print_timing: id 0 | task 16 | graphs reused = 1
0.49.453.658 I slot print_timing: id 0 | task 16 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.453.672 I statistics draft-mtp: #calls(b,g,a) = 27 71 1088, #gen drafts = 1099, #acc drafts = 800, #gen tokens = 2193, #acc tokens = 1491, #mean acc len = 2.37, #acc rate/pos = (0.735, 0.635), dur(b,g,a) = 0.019, 212.225, 385.723 ms
0.49.453.702 I slot release: id 0 | task 16 | stop processing: n_tokens = 156, truncated = 0
0.49.453.915 I slot print_timing: id 4 | task 12 | prompt eval time = 232.90 ms / 29 tokens ( 8.03 ms per token, 124.52 tokens per second)
0.49.453.916 I slot print_timing: id 4 | task 12 | eval time = 8981.56 ms / 128 tokens ( 70.17 ms per token, 14.25 tokens per second)
0.49.453.917 I slot print_timing: id 4 | task 12 | total time = 9214.46 ms / 157 tokens
0.49.453.917 I slot print_timing: id 4 | task 12 | graphs reused = 1
0.49.453.918 I slot print_timing: id 4 | task 12 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.453.920 I statistics draft-mtp: #calls(b,g,a) = 27 71 1088, #gen drafts = 1099, #acc drafts = 800, #gen tokens = 2193, #acc tokens = 1491, #mean acc len = 2.37, #acc rate/pos = (0.735, 0.635), dur(b,g,a) = 0.019, 212.225, 385.723 ms
0.49.453.948 I slot release: id 4 | task 12 | stop processing: n_tokens = 156, truncated = 0
0.49.463.478 I srv operator(): Chat format: peg-native
0.49.463.574 I srv operator(): Chat format: peg-native
0.49.463.945 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.49.464.007 I slot launch_slot_: id 0 | task 102 | processing task, is_child = 0
0.49.464.010 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.49.464.029 I slot launch_slot_: id 4 | task 103 | processing task, is_child = 0
0.49.469.108 W slot operator(): id 0 | task 102 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.469.145 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.469.178 W slot operator(): id 4 | task 103 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.469.200 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.50.246.986 I slot print_timing: id 6 | task 60 | n_decoded = 102, tg = 22.38 t/s, tg_3s = 22.38 t/s
0.50.380.418 I slot print_timing: id 15 | task 64 | n_decoded = 102, tg = 22.53 t/s, tg_3s = 22.53 t/s
0.50.751.744 I slot print_timing: id 5 | task 59 | n_decoded = 101, tg = 19.95 t/s, tg_3s = 19.95 t/s
0.50.879.789 I slot print_timing: id 6 | task 60 | prompt eval time = 131.70 ms / 25 tokens ( 5.27 ms per token, 189.83 tokens per second)
0.50.879.792 I slot print_timing: id 6 | task 60 | eval time = 5189.53 ms / 114 tokens ( 45.52 ms per token, 21.97 tokens per second)
0.50.879.793 I slot print_timing: id 6 | task 60 | total time = 5321.23 ms / 139 tokens
0.50.879.794 I slot print_timing: id 6 | task 60 | graphs reused = 1
0.50.879.797 I slot print_timing: id 6 | task 60 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.50.879.812 I statistics draft-mtp: #calls(b,g,a) = 32 82 1264, #gen drafts = 1273, #acc drafts = 929, #gen tokens = 2541, #acc tokens = 1734, #mean acc len = 2.37, #acc rate/pos = (0.735, 0.637), dur(b,g,a) = 0.023, 245.208, 448.324 ms
0.50.879.840 I slot release: id 6 | task 60 | stop processing: n_tokens = 140, truncated = 0
0.50.886.577 I slot print_timing: id 14 | task 63 | n_decoded = 101, tg = 20.06 t/s, tg_3s = 20.06 t/s
0.50.888.804 I srv operator(): Chat format: peg-native
0.51.007.104 I slot print_timing: id 15 | task 64 | prompt eval time = 151.46 ms / 25 tokens ( 6.06 ms per token, 165.06 tokens per second)
0.51.007.107 I slot print_timing: id 15 | task 64 | eval time = 5154.05 ms / 114 tokens ( 45.21 ms per token, 22.12 tokens per second)
0.51.007.107 I slot print_timing: id 15 | task 64 | total time = 5305.52 ms / 139 tokens
0.51.007.108 I slot print_timing: id 15 | task 64 | graphs reused = 1
0.51.007.111 I slot print_timing: id 15 | task 64 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.51.007.123 I statistics draft-mtp: #calls(b,g,a) = 32 83 1288, #gen drafts = 1288, #acc drafts = 946, #gen tokens = 2571, #acc tokens = 1763, #mean acc len = 2.37, #acc rate/pos = (0.734, 0.634), dur(b,g,a) = 0.023, 249.413, 456.528 ms
0.51.007.149 I slot release: id 15 | task 64 | stop processing: n_tokens = 140, truncated = 0
0.51.007.164 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.021
0.51.007.226 I slot launch_slot_: id 6 | task 116 | processing task, is_child = 0
0.51.011.874 W slot operator(): id 6 | task 116 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.011.901 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.51.015.509 I srv operator(): Chat format: peg-native
0.51.138.808 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
0.51.138.874 I slot launch_slot_: id 15 | task 118 | processing task, is_child = 0
0.51.143.120 W slot operator(): id 15 | task 118 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.143.147 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.51.273.441 I slot print_timing: id 7 | task 74 | n_decoded = 102, tg = 22.56 t/s, tg_3s = 22.56 t/s
0.51.776.863 I slot print_timing: id 3 | task 73 | n_decoded = 101, tg = 20.10 t/s, tg_3s = 20.10 t/s
0.51.905.364 I slot print_timing: id 5 | task 59 | prompt eval time = 130.97 ms / 28 tokens ( 4.68 ms per token, 213.80 tokens per second)
0.51.905.367 I slot print_timing: id 5 | task 59 | eval time = 6215.87 ms / 125 tokens ( 49.73 ms per token, 20.11 tokens per second)
0.51.905.367 I slot print_timing: id 5 | task 59 | total time = 6346.84 ms / 153 tokens
0.51.905.368 I slot print_timing: id 5 | task 59 | graphs reused = 1
0.51.905.372 I slot print_timing: id 5 | task 59 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.51.905.389 I statistics draft-mtp: #calls(b,g,a) = 34 90 1387, #gen drafts = 1397, #acc drafts = 1016, #gen tokens = 2789, #acc tokens = 1896, #mean acc len = 2.37, #acc rate/pos = (0.733, 0.634), dur(b,g,a) = 0.025, 272.010, 491.183 ms
0.51.905.422 I slot release: id 5 | task 59 | stop processing: n_tokens = 152, truncated = 0
0.51.907.368 I slot print_timing: id 7 | task 74 | prompt eval time = 136.16 ms / 25 tokens ( 5.45 ms per token, 183.60 tokens per second)
0.51.907.373 I slot print_timing: id 7 | task 74 | eval time = 5155.31 ms / 114 tokens ( 45.22 ms per token, 22.11 tokens per second)
0.51.907.374 I slot print_timing: id 7 | task 74 | total time = 5291.48 ms / 139 tokens
0.51.907.374 I slot print_timing: id 7 | task 74 | graphs reused = 1
0.51.907.377 I slot print_timing: id 7 | task 74 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.51.907.383 I statistics draft-mtp: #calls(b,g,a) = 34 90 1389, #gen drafts = 1397, #acc drafts = 1018, #gen tokens = 2789, #acc tokens = 1900, #mean acc len = 2.37, #acc rate/pos = (0.733, 0.635), dur(b,g,a) = 0.025, 272.010, 491.902 ms
0.51.907.403 I slot release: id 7 | task 74 | stop processing: n_tokens = 140, truncated = 0
0.51.910.493 I slot print_timing: id 11 | task 77 | n_decoded = 101, tg = 20.17 t/s, tg_3s = 20.17 t/s
0.51.914.111 I srv operator(): Chat format: peg-native
0.51.915.466 I srv operator(): Chat format: peg-native
0.52.028.195 I slot print_timing: id 14 | task 63 | prompt eval time = 151.26 ms / 28 tokens ( 5.40 ms per token, 185.12 tokens per second)
0.52.028.198 I slot print_timing: id 14 | task 63 | eval time = 6175.39 ms / 125 tokens ( 49.40 ms per token, 20.24 tokens per second)
0.52.028.198 I slot print_timing: id 14 | task 63 | total time = 6326.65 ms / 153 tokens
0.52.028.199 I slot print_timing: id 14 | task 63 | graphs reused = 1
0.52.028.202 I slot print_timing: id 14 | task 63 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.52.028.213 I statistics draft-mtp: #calls(b,g,a) = 34 91 1410, #gen drafts = 1411, #acc drafts = 1030, #gen tokens = 2817, #acc tokens = 1924, #mean acc len = 2.36, #acc rate/pos = (0.730, 0.634), dur(b,g,a) = 0.025, 278.942, 499.008 ms
0.52.028.240 I slot release: id 14 | task 63 | stop processing: n_tokens = 152, truncated = 0
0.52.029.246 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.52.029.307 I slot launch_slot_: id 5 | task 126 | processing task, is_child = 0
0.52.029.311 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.52.029.324 I slot launch_slot_: id 14 | task 127 | processing task, is_child = 0
0.52.035.143 W slot operator(): id 5 | task 126 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.035.172 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.035.204 W slot operator(): id 14 | task 127 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.035.232 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.036.382 I srv operator(): Chat format: peg-native
0.52.176.970 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
0.52.177.032 I slot launch_slot_: id 7 | task 129 | processing task, is_child = 0
0.52.185.390 W slot operator(): id 7 | task 129 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.185.423 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.564.586 I slot print_timing: id 1 | task 58 | n_decoded = 100, tg = 14.54 t/s, tg_3s = 14.54 t/s
0.52.697.282 I slot print_timing: id 9 | task 62 | n_decoded = 100, tg = 14.61 t/s, tg_3s = 14.61 t/s
0.52.944.932 I slot print_timing: id 3 | task 73 | prompt eval time = 135.96 ms / 28 tokens ( 4.86 ms per token, 205.95 tokens per second)
0.52.944.937 I slot print_timing: id 3 | task 73 | eval time = 6193.12 ms / 125 tokens ( 49.54 ms per token, 20.18 tokens per second)
0.52.944.937 I slot print_timing: id 3 | task 73 | total time = 6329.07 ms / 153 tokens
0.52.944.938 I slot print_timing: id 3 | task 73 | graphs reused = 1
0.52.944.941 I slot print_timing: id 3 | task 73 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.52.944.958 I statistics draft-mtp: #calls(b,g,a) = 37 98 1507, #gen drafts = 1519, #acc drafts = 1105, #gen tokens = 3033, #acc tokens = 2061, #mean acc len = 2.37, #acc rate/pos = (0.733, 0.634), dur(b,g,a) = 0.027, 306.761, 533.453 ms
0.52.944.986 I slot release: id 3 | task 73 | stop processing: n_tokens = 152, truncated = 0
0.52.953.341 I srv operator(): Chat format: peg-native
0.52.955.293 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.52.955.332 I slot launch_slot_: id 3 | task 136 | processing task, is_child = 0
0.52.959.183 W slot operator(): id 3 | task 136 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.959.218 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.53.092.953 I slot print_timing: id 11 | task 77 | prompt eval time = 137.24 ms / 28 tokens ( 4.90 ms per token, 204.02 tokens per second)
0.53.092.957 I slot print_timing: id 11 | task 77 | eval time = 6189.12 ms / 125 tokens ( 49.51 ms per token, 20.20 tokens per second)
0.53.092.958 I slot print_timing: id 11 | task 77 | total time = 6326.35 ms / 153 tokens
0.53.092.958 I slot print_timing: id 11 | task 77 | graphs reused = 1
0.53.092.962 I slot print_timing: id 11 | task 77 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.53.092.974 I statistics draft-mtp: #calls(b,g,a) = 38 99 1530, #gen drafts = 1534, #acc drafts = 1121, #gen tokens = 3063, #acc tokens = 2093, #mean acc len = 2.37, #acc rate/pos = (0.733, 0.635), dur(b,g,a) = 0.027, 310.535, 541.829 ms
0.53.093.001 I slot release: id 11 | task 77 | stop processing: n_tokens = 152, truncated = 0
0.53.101.719 I srv operator(): Chat format: peg-native
0.53.215.707 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.53.215.770 I slot launch_slot_: id 11 | task 139 | processing task, is_child = 0
0.53.219.903 W slot operator(): id 11 | task 139 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.53.219.935 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.53.596.455 I slot print_timing: id 2 | task 72 | n_decoded = 100, tg = 14.61 t/s, tg_3s = 14.61 t/s
0.53.730.730 I slot print_timing: id 10 | task 76 | n_decoded = 100, tg = 14.65 t/s, tg_3s = 14.65 t/s
0.53.982.051 I slot print_timing: id 8 | task 98 | n_decoded = 102, tg = 22.53 t/s, tg_3s = 22.53 t/s
0.54.101.831 I slot print_timing: id 0 | task 102 | n_decoded = 102, tg = 22.69 t/s, tg_3s = 22.69 t/s
0.54.487.916 I slot print_timing: id 13 | task 100 | n_decoded = 101, tg = 20.07 t/s, tg_3s = 20.07 t/s
0.54.608.842 I slot print_timing: id 8 | task 98 | prompt eval time = 145.65 ms / 25 tokens ( 5.83 ms per token, 171.64 tokens per second)
0.54.608.847 I slot print_timing: id 8 | task 98 | eval time = 5154.61 ms / 114 tokens ( 45.22 ms per token, 22.12 tokens per second)
0.54.608.847 I slot print_timing: id 8 | task 98 | total time = 5300.26 ms / 139 tokens
0.54.608.848 I slot print_timing: id 8 | task 98 | graphs reused = 1
0.54.608.851 I slot print_timing: id 8 | task 98 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.54.608.865 I statistics draft-mtp: #calls(b,g,a) = 39 111 1717, #gen drafts = 1724, #acc drafts = 1247, #gen tokens = 3442, #acc tokens = 2327, #mean acc len = 2.36, #acc rate/pos = (0.726, 0.629), dur(b,g,a) = 0.028, 346.390, 605.665 ms
0.54.608.889 I slot release: id 8 | task 98 | stop processing: n_tokens = 140, truncated = 0
0.54.617.410 I srv operator(): Chat format: peg-native
0.54.720.080 I slot print_timing: id 1 | task 58 | prompt eval time = 130.22 ms / 29 tokens ( 4.49 ms per token, 222.71 tokens per second)
0.54.720.083 I slot print_timing: id 1 | task 58 | eval time = 9031.41 ms / 128 tokens ( 70.56 ms per token, 14.17 tokens per second)
0.54.720.083 I slot print_timing: id 1 | task 58 | total time = 9161.63 ms / 157 tokens
0.54.720.084 I slot print_timing: id 1 | task 58 | graphs reused = 1
0.54.720.086 I slot print_timing: id 1 | task 58 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.54.720.099 I statistics draft-mtp: #calls(b,g,a) = 39 112 1724, #gen drafts = 1738, #acc drafts = 1253, #gen tokens = 3469, #acc tokens = 2339, #mean acc len = 2.36, #acc rate/pos = (0.727, 0.630), dur(b,g,a) = 0.028, 351.655, 608.068 ms
0.54.720.125 I slot release: id 1 | task 58 | stop processing: n_tokens = 156, truncated = 0
0.54.721.276 I slot print_timing: id 0 | task 102 | prompt eval time = 136.97 ms / 25 tokens ( 5.48 ms per token, 182.52 tokens per second)
0.54.721.280 I slot print_timing: id 0 | task 102 | eval time = 5115.17 ms / 114 tokens ( 44.87 ms per token, 22.29 tokens per second)
0.54.721.280 I slot print_timing: id 0 | task 102 | total time = 5252.14 ms / 139 tokens
0.54.721.281 I slot print_timing: id 0 | task 102 | graphs reused = 1
0.54.721.283 I slot print_timing: id 0 | task 102 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.54.721.290 I statistics draft-mtp: #calls(b,g,a) = 39 112 1725, #gen drafts = 1738, #acc drafts = 1254, #gen tokens = 3469, #acc tokens = 2341, #mean acc len = 2.36, #acc rate/pos = (0.727, 0.630), dur(b,g,a) = 0.028, 351.655, 608.537 ms
0.54.721.315 I slot release: id 0 | task 102 | stop processing: n_tokens = 140, truncated = 0
0.54.729.209 I srv operator(): Chat format: peg-native
0.54.729.966 I srv operator(): Chat format: peg-native
0.54.731.698 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
0.54.731.762 I slot launch_slot_: id 0 | task 152 | processing task, is_child = 0
0.54.731.765 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.54.731.782 I slot launch_slot_: id 1 | task 153 | processing task, is_child = 0
0.54.731.785 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.021
0.54.731.799 I slot launch_slot_: id 8 | task 154 | processing task, is_child = 0
0.54.735.943 W slot operator(): id 0 | task 152 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.735.976 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.736.004 W slot operator(): id 1 | task 153 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.736.023 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.736.063 W slot operator(): id 8 | task 154 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.736.092 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.883.594 I slot print_timing: id 9 | task 62 | prompt eval time = 151.02 ms / 29 tokens ( 5.21 ms per token, 192.02 tokens per second)
0.54.883.598 I slot print_timing: id 9 | task 62 | eval time = 9031.09 ms / 128 tokens ( 70.56 ms per token, 14.17 tokens per second)
0.54.883.598 I slot print_timing: id 9 | task 62 | total time = 9182.11 ms / 157 tokens
0.54.883.599 I slot print_timing: id 9 | task 62 | graphs reused = 1
0.54.883.602 I slot print_timing: id 9 | task 62 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.54.883.616 I statistics draft-mtp: #calls(b,g,a) = 42 113 1738, #gen drafts = 1750, #acc drafts = 1262, #gen tokens = 3493, #acc tokens = 2356, #mean acc len = 2.36, #acc rate/pos = (0.726, 0.629), dur(b,g,a) = 0.030, 355.728, 612.847 ms
0.54.883.642 I slot release: id 9 | task 62 | stop processing: n_tokens = 156, truncated = 0
0.54.892.234 I srv operator(): Chat format: peg-native
0.54.893.576 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.54.893.637 I slot launch_slot_: id 9 | task 156 | processing task, is_child = 0
0.54.897.895 W slot operator(): id 9 | task 156 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.897.922 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.661.085 I slot print_timing: id 13 | task 100 | prompt eval time = 146.07 ms / 28 tokens ( 5.22 ms per token, 191.68 tokens per second)
0.55.661.088 I slot print_timing: id 13 | task 100 | eval time = 6206.28 ms / 125 tokens ( 49.65 ms per token, 20.14 tokens per second)
0.55.661.088 I slot print_timing: id 13 | task 100 | total time = 6352.35 ms / 153 tokens
0.55.661.089 I slot print_timing: id 13 | task 100 | graphs reused = 1
0.55.661.092 I slot print_timing: id 13 | task 100 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.55.661.104 I statistics draft-mtp: #calls(b,g,a) = 43 119 1843, #gen drafts = 1845, #acc drafts = 1332, #gen tokens = 3682, #acc tokens = 2488, #mean acc len = 2.35, #acc rate/pos = (0.723, 0.627), dur(b,g,a) = 0.031, 373.831, 649.658 ms
0.55.661.134 I slot release: id 13 | task 100 | stop processing: n_tokens = 152, truncated = 0
0.55.669.753 I srv operator(): Chat format: peg-native
0.55.767.080 I slot print_timing: id 2 | task 72 | prompt eval time = 135.74 ms / 29 tokens ( 4.68 ms per token, 213.64 tokens per second)
0.55.767.086 I slot print_timing: id 2 | task 72 | eval time = 9015.56 ms / 128 tokens ( 70.43 ms per token, 14.20 tokens per second)
0.55.767.087 I slot print_timing: id 2 | task 72 | total time = 9151.30 ms / 157 tokens
0.55.767.088 I slot print_timing: id 2 | task 72 | graphs reused = 1
0.55.767.090 I slot print_timing: id 2 | task 72 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.55.767.102 I statistics draft-mtp: #calls(b,g,a) = 43 120 1845, #gen drafts = 1859, #acc drafts = 1333, #gen tokens = 3709, #acc tokens = 2489, #mean acc len = 2.35, #acc rate/pos = (0.722, 0.627), dur(b,g,a) = 0.031, 378.317, 650.298 ms
0.55.767.128 I slot release: id 2 | task 72 | stop processing: n_tokens = 156, truncated = 0
0.55.775.853 I srv operator(): Chat format: peg-native
0.55.779.211 I slot print_timing: id 15 | task 118 | n_decoded = 102, tg = 22.60 t/s, tg_3s = 22.60 t/s
0.55.779.220 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.55.779.270 I slot launch_slot_: id 2 | task 164 | processing task, is_child = 0
0.55.779.272 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.55.779.288 I slot launch_slot_: id 13 | task 165 | processing task, is_child = 0
0.55.784.954 W slot operator(): id 2 | task 164 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.784.978 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.785.018 W slot operator(): id 13 | task 165 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.785.044 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.919.267 I slot print_timing: id 10 | task 76 | prompt eval time = 137.02 ms / 29 tokens ( 4.72 ms per token, 211.65 tokens per second)
0.55.919.270 I slot print_timing: id 10 | task 76 | eval time = 9015.74 ms / 128 tokens ( 70.44 ms per token, 14.20 tokens per second)
0.55.919.271 I slot print_timing: id 10 | task 76 | total time = 9152.76 ms / 157 tokens
0.55.919.271 I slot print_timing: id 10 | task 76 | graphs reused = 1
0.55.919.274 I slot print_timing: id 10 | task 76 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.55.919.287 I statistics draft-mtp: #calls(b,g,a) = 44 121 1859, #gen drafts = 1872, #acc drafts = 1343, #gen tokens = 3735, #acc tokens = 2508, #mean acc len = 2.35, #acc rate/pos = (0.722, 0.627), dur(b,g,a) = 0.032, 383.908, 655.247 ms
0.55.919.313 I slot release: id 10 | task 76 | stop processing: n_tokens = 156, truncated = 0
0.55.927.964 I srv operator(): Chat format: peg-native
0.55.930.128 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.55.930.194 I slot launch_slot_: id 10 | task 167 | processing task, is_child = 0
0.55.934.397 W slot operator(): id 10 | task 167 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.934.416 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.188.802 I slot print_timing: id 6 | task 116 | n_decoded = 101, tg = 19.96 t/s, tg_3s = 19.96 t/s
0.56.449.548 I slot print_timing: id 15 | task 118 | prompt eval time = 122.83 ms / 25 tokens ( 4.91 ms per token, 203.54 tokens per second)
0.56.449.552 I slot print_timing: id 15 | task 118 | eval time = 5183.58 ms / 114 tokens ( 45.47 ms per token, 21.99 tokens per second)
0.56.449.552 I slot print_timing: id 15 | task 118 | total time = 5306.41 ms / 139 tokens
0.56.449.553 I slot print_timing: id 15 | task 118 | graphs reused = 1
0.56.449.556 I slot print_timing: id 15 | task 118 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.56.449.567 I statistics draft-mtp: #calls(b,g,a) = 46 125 1935, #gen drafts = 1935, #acc drafts = 1400, #gen tokens = 3861, #acc tokens = 2612, #mean acc len = 2.35, #acc rate/pos = (0.724, 0.626), dur(b,g,a) = 0.033, 396.337, 682.242 ms
0.56.449.589 I slot release: id 15 | task 118 | stop processing: n_tokens = 140, truncated = 0
0.56.458.189 I srv operator(): Chat format: peg-native
0.56.566.273 I slot print_timing: id 12 | task 99 | n_decoded = 100, tg = 14.06 t/s, tg_3s = 14.06 t/s
0.56.568.198 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.021
0.56.568.259 I slot launch_slot_: id 15 | task 173 | processing task, is_child = 0
0.56.571.085 W slot operator(): id 15 | task 173 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.571.120 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.698.750 I slot print_timing: id 4 | task 103 | n_decoded = 100, tg = 14.10 t/s, tg_3s = 14.10 t/s
0.56.826.842 I slot print_timing: id 7 | task 129 | n_decoded = 102, tg = 22.57 t/s, tg_3s = 22.57 t/s
0.57.212.636 I slot print_timing: id 14 | task 127 | n_decoded = 101, tg = 20.01 t/s, tg_3s = 20.01 t/s
0.57.331.213 I slot print_timing: id 6 | task 116 | prompt eval time = 116.22 ms / 28 tokens ( 4.15 ms per token, 240.93 tokens per second)
0.57.331.216 I slot print_timing: id 6 | task 116 | eval time = 6203.09 ms / 125 tokens ( 49.62 ms per token, 20.15 tokens per second)
0.57.331.216 I slot print_timing: id 6 | task 116 | total time = 6319.31 ms / 153 tokens
0.57.331.217 I slot print_timing: id 6 | task 116 | graphs reused = 1
0.57.331.220 I slot print_timing: id 6 | task 116 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.57.331.233 I statistics draft-mtp: #calls(b,g,a) = 47 132 2036, #gen drafts = 2045, #acc drafts = 1469, #gen tokens = 4081, #acc tokens = 2744, #mean acc len = 2.35, #acc rate/pos = (0.722, 0.626), dur(b,g,a) = 0.034, 415.860, 717.395 ms
0.57.331.259 I slot release: id 6 | task 116 | stop processing: n_tokens = 152, truncated = 0
0.57.339.998 I srv operator(): Chat format: peg-native
0.57.452.289 I slot print_timing: id 7 | task 129 | prompt eval time = 122.69 ms / 25 tokens ( 4.91 ms per token, 203.77 tokens per second)
0.57.452.291 I slot print_timing: id 7 | task 129 | eval time = 5144.19 ms / 114 tokens ( 45.12 ms per token, 22.16 tokens per second)
0.57.452.292 I slot print_timing: id 7 | task 129 | total time = 5266.88 ms / 139 tokens
0.57.452.293 I slot print_timing: id 7 | task 129 | graphs reused = 1
0.57.452.295 I slot print_timing: id 7 | task 129 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
0.57.452.308 I statistics draft-mtp: #calls(b,g,a) = 47 133 2052, #gen drafts = 2060, #acc drafts = 1480, #gen tokens = 4111, #acc tokens = 2764, #mean acc len = 2.35, #acc rate/pos = (0.721, 0.626), dur(b,g,a) = 0.034, 420.090, 722.983 ms
0.57.452.334 I slot release: id 7 | task 129 | stop processing: n_tokens = 140, truncated = 0
0.57.458.473 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.57.458.536 I slot launch_slot_: id 6 | task 181 | processing task, is_child = 0
0.57.460.389 I srv operator(): Chat format: peg-native
0.57.463.186 W slot operator(): id 6 | task 181 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.57.463.217 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.57.591.929 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
0.57.591.989 I slot launch_slot_: id 7 | task 183 | processing task, is_child = 0
0.57.596.798 W slot operator(): id 7 | task 183 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.57.596.822 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.361.094 I slot print_timing: id 11 | task 139 | n_decoded = 101, tg = 20.13 t/s, tg_3s = 20.13 t/s
0.58.363.626 I slot print_timing: id 14 | task 127 | prompt eval time = 130.54 ms / 28 tokens ( 4.66 ms per token, 214.50 tokens per second)
0.58.363.631 I slot print_timing: id 14 | task 127 | eval time = 6197.85 ms / 125 tokens ( 49.58 ms per token, 20.17 tokens per second)
0.58.363.631 I slot print_timing: id 14 | task 127 | total time = 6328.38 ms / 153 tokens
0.58.363.632 I slot print_timing: id 14 | task 127 | graphs reused = 1
0.58.363.635 I slot print_timing: id 14 | task 127 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.58.363.647 I statistics draft-mtp: #calls(b,g,a) = 49 140 2168, #gen drafts = 2169, #acc drafts = 1561, #gen tokens = 4329, #acc tokens = 2918, #mean acc len = 2.35, #acc rate/pos = (0.720, 0.626), dur(b,g,a) = 0.037, 443.401, 763.151 ms
0.58.363.672 I slot release: id 14 | task 127 | stop processing: n_tokens = 152, truncated = 0
0.58.372.019 I srv operator(): Chat format: peg-native
0.58.483.639 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.58.483.705 I slot launch_slot_: id 14 | task 191 | processing task, is_child = 0
0.58.487.425 W slot operator(): id 14 | task 191 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.58.487.451 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.732.780 I slot print_timing: id 12 | task 99 | prompt eval time = 145.86 ms / 29 tokens ( 5.03 ms per token, 198.82 tokens per second)
0.58.732.783 I slot print_timing: id 12 | task 99 | eval time = 9278.27 ms / 128 tokens ( 72.49 ms per token, 13.80 tokens per second)
0.58.732.783 I slot print_timing: id 12 | task 99 | total time = 9424.12 ms / 157 tokens
0.58.732.784 I slot print_timing: id 12 | task 99 | graphs reused = 1
0.58.732.787 I slot print_timing: id 12 | task 99 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
0.58.732.800 I statistics draft-mtp: #calls(b,g,a) = 50 143 2199, #gen drafts = 2214, #acc drafts = 1579, #gen tokens = 4417, #acc tokens = 2953, #mean acc len = 2.34, #acc rate/pos = (0.718, 0.625), dur(b,g,a) = 0.038, 454.429, 773.813 ms
0.58.732.825 I slot release: id 12 | task 99 | stop processing: n_tokens = 156, truncated = 0
0.58.741.741 I srv operator(): Chat format: peg-native
0.58.746.419 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.58.746.480 I slot launch_slot_: id 12 | task 194 | processing task, is_child = 0
0.58.751.894 W slot operator(): id 12 | task 194 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.58.751.923 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.872.890 I slot print_timing: id 4 | task 103 | prompt eval time = 137.85 ms / 29 tokens ( 4.75 ms per token, 210.38 tokens per second)
0.58.872.894 I slot print_timing: id 4 | task 103 | eval time = 9265.83 ms / 128 tokens ( 72.39 ms per token, 13.81 tokens per second)
0.58.872.894 I slot print_timing: id 4 | task 103 | total time = 9403.68 ms / 157 tokens
0.58.872.895 I slot print_timing: id 4 | task 103 | graphs reused = 1
0.58.872.897 I slot print_timing: id 4 | task 103 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
0.58.872.910 I statistics draft-mtp: #calls(b,g,a) = 50 144 2214, #gen drafts = 2228, #acc drafts = 1592, #gen tokens = 4445, #acc tokens = 2977, #mean acc len = 2.34, #acc rate/pos = (0.719, 0.626), dur(b,g,a) = 0.038, 459.763, 779.172 ms
0.58.872.934 I slot release: id 4 | task 103 | stop processing: n_tokens = 156, truncated = 0
0.58.881.794 I srv operator(): Chat format: peg-native
0.58.885.393 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.58.885.456 I slot launch_slot_: id 4 | task 196 | processing task, is_child = 0
0.58.889.617 W slot operator(): id 4 | task 196 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.58.889.654 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.017.062 I slot print_timing: id 5 | task 126 | n_decoded = 100, tg = 14.60 t/s, tg_3s = 14.60 t/s
0.59.392.771 I slot print_timing: id 0 | task 152 | n_decoded = 102, tg = 22.62 t/s, tg_3s = 22.62 t/s
0.59.527.270 I slot print_timing: id 9 | task 156 | n_decoded = 102, tg = 22.64 t/s, tg_3s = 22.64 t/s
0.59.529.366 I slot print_timing: id 11 | task 139 | prompt eval time = 122.66 ms / 28 tokens ( 4.38 ms per token, 228.27 tokens per second)
0.59.529.369 I slot print_timing: id 11 | task 139 | eval time = 6186.76 ms / 125 tokens ( 49.49 ms per token, 20.20 tokens per second)
0.59.529.370 I slot print_timing: id 11 | task 139 | total time = 6309.43 ms / 153 tokens
0.59.529.371 I slot print_timing: id 11 | task 139 | graphs reused = 1
0.59.529.374 I slot print_timing: id 11 | task 139 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.59.529.386 I statistics draft-mtp: #calls(b,g,a) = 52 149 2303, #gen drafts = 2307, #acc drafts = 1661, #gen tokens = 4603, #acc tokens = 3102, #mean acc len = 2.35, #acc rate/pos = (0.721, 0.626), dur(b,g,a) = 0.039, 475.037, 810.879 ms
0.59.529.412 I slot release: id 11 | task 139 | stop processing: n_tokens = 152, truncated = 0
0.59.538.542 I srv operator(): Chat format: peg-native
0.59.652.710 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.59.652.772 I slot launch_slot_: id 11 | task 203 | processing task, is_child = 0
0.59.656.970 W slot operator(): id 11 | task 203 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.656.991 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.909.891 I slot print_timing: id 3 | task 136 | n_decoded = 100, tg = 14.65 t/s, tg_3s = 14.65 t/s
0.59.914.298 I slot print_timing: id 8 | task 154 | n_decoded = 101, tg = 20.08 t/s, tg_3s = 20.08 t/s
1.00.035.194 I slot print_timing: id 0 | task 152 | prompt eval time = 146.88 ms / 25 tokens ( 5.88 ms per token, 170.21 tokens per second)
1.00.035.197 I slot print_timing: id 0 | task 152 | eval time = 5152.34 ms / 114 tokens ( 45.20 ms per token, 22.13 tokens per second)
1.00.035.197 I slot print_timing: id 0 | task 152 | total time = 5299.22 ms / 139 tokens
1.00.035.198 I slot print_timing: id 0 | task 152 | graphs reused = 1
1.00.035.200 I slot print_timing: id 0 | task 152 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.00.035.213 I statistics draft-mtp: #calls(b,g,a) = 53 153 2354, #gen drafts = 2369, #acc drafts = 1697, #gen tokens = 4727, #acc tokens = 3172, #mean acc len = 2.35, #acc rate/pos = (0.721, 0.627), dur(b,g,a) = 0.040, 488.775, 829.116 ms
1.00.035.239 I slot release: id 0 | task 152 | stop processing: n_tokens = 140, truncated = 0
1.00.045.174 I srv operator(): Chat format: peg-native
1.00.048.804 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.021
1.00.048.868 I slot launch_slot_: id 0 | task 207 | processing task, is_child = 0
1.00.051.659 W slot operator(): id 0 | task 207 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.051.689 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.182.415 I slot print_timing: id 9 | task 156 | prompt eval time = 123.79 ms / 25 tokens ( 4.95 ms per token, 201.95 tokens per second)
1.00.182.418 I slot print_timing: id 9 | task 156 | eval time = 5160.71 ms / 114 tokens ( 45.27 ms per token, 22.09 tokens per second)
1.00.182.419 I slot print_timing: id 9 | task 156 | total time = 5284.50 ms / 139 tokens
1.00.182.419 I slot print_timing: id 9 | task 156 | graphs reused = 1
1.00.182.423 I slot print_timing: id 9 | task 156 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.00.182.435 I statistics draft-mtp: #calls(b,g,a) = 54 154 2378, #gen drafts = 2384, #acc drafts = 1717, #gen tokens = 4757, #acc tokens = 3208, #mean acc len = 2.35, #acc rate/pos = (0.722, 0.627), dur(b,g,a) = 0.041, 491.480, 837.768 ms
1.00.182.461 I slot release: id 9 | task 156 | stop processing: n_tokens = 140, truncated = 0
1.00.191.239 I srv operator(): Chat format: peg-native
1.00.307.839 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.00.307.900 I slot launch_slot_: id 9 | task 210 | processing task, is_child = 0
1.00.312.178 W slot operator(): id 9 | task 210 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.312.214 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.568.195 I slot print_timing: id 10 | task 167 | n_decoded = 102, tg = 22.61 t/s, tg_3s = 22.61 t/s
1.00.951.375 I slot print_timing: id 13 | task 165 | n_decoded = 101, tg = 20.07 t/s, tg_3s = 20.07 t/s
1.01.071.248 I slot print_timing: id 8 | task 154 | prompt eval time = 147.31 ms / 28 tokens ( 5.26 ms per token, 190.08 tokens per second)
1.01.071.251 I slot print_timing: id 8 | task 154 | eval time = 6187.84 ms / 125 tokens ( 49.50 ms per token, 20.20 tokens per second)
1.01.071.252 I slot print_timing: id 8 | task 154 | total time = 6335.14 ms / 153 tokens
1.01.071.253 I slot print_timing: id 8 | task 154 | graphs reused = 1
1.01.071.255 I slot print_timing: id 8 | task 154 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.01.071.267 I statistics draft-mtp: #calls(b,g,a) = 55 161 2487, #gen drafts = 2494, #acc drafts = 1790, #gen tokens = 4976, #acc tokens = 3346, #mean acc len = 2.35, #acc rate/pos = (0.720, 0.626), dur(b,g,a) = 0.042, 513.898, 875.753 ms
1.01.071.291 I slot release: id 8 | task 154 | stop processing: n_tokens = 152, truncated = 0
1.01.079.814 I srv operator(): Chat format: peg-native
1.01.183.516 I slot print_timing: id 5 | task 126 | prompt eval time = 130.32 ms / 29 tokens ( 4.49 ms per token, 222.54 tokens per second)
1.01.183.518 I slot print_timing: id 5 | task 126 | eval time = 9018.03 ms / 128 tokens ( 70.45 ms per token, 14.19 tokens per second)
1.01.183.519 I slot print_timing: id 5 | task 126 | total time = 9148.35 ms / 157 tokens
1.01.183.520 I slot print_timing: id 5 | task 126 | graphs reused = 1
1.01.183.522 I slot print_timing: id 5 | task 126 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.01.183.536 I statistics draft-mtp: #calls(b,g,a) = 55 162 2494, #gen drafts = 2508, #acc drafts = 1796, #gen tokens = 5004, #acc tokens = 3357, #mean acc len = 2.35, #acc rate/pos = (0.720, 0.626), dur(b,g,a) = 0.042, 519.107, 878.241 ms
1.01.183.558 I slot release: id 5 | task 126 | stop processing: n_tokens = 156, truncated = 0
1.01.191.297 I slot print_timing: id 10 | task 167 | prompt eval time = 122.47 ms / 25 tokens ( 4.90 ms per token, 204.12 tokens per second)
1.01.191.299 I slot print_timing: id 10 | task 167 | eval time = 5134.40 ms / 114 tokens ( 45.04 ms per token, 22.20 tokens per second)
1.01.191.299 I slot print_timing: id 10 | task 167 | total time = 5256.88 ms / 139 tokens
1.01.191.300 I slot print_timing: id 10 | task 167 | graphs reused = 1
1.01.191.304 I slot print_timing: id 10 | task 167 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.01.191.312 I statistics draft-mtp: #calls(b,g,a) = 55 162 2503, #gen drafts = 2508, #acc drafts = 1802, #gen tokens = 5004, #acc tokens = 3369, #mean acc len = 2.35, #acc rate/pos = (0.720, 0.626), dur(b,g,a) = 0.042, 519.107, 881.443 ms
1.01.191.335 I slot release: id 10 | task 167 | stop processing: n_tokens = 140, truncated = 0
1.01.191.849 I srv operator(): Chat format: peg-native
1.01.195.228 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.01.195.290 I slot launch_slot_: id 5 | task 218 | processing task, is_child = 0
1.01.195.293 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.01.195.309 I slot launch_slot_: id 8 | task 219 | processing task, is_child = 0
1.01.199.370 I srv operator(): Chat format: peg-native
1.01.201.170 W slot operator(): id 5 | task 218 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.201.193 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.201.237 W slot operator(): id 8 | task 219 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.201.261 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.342.200 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.01.342.265 I slot launch_slot_: id 10 | task 221 | processing task, is_child = 0
1.01.346.428 W slot operator(): id 10 | task 221 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.346.448 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.973.748 I slot print_timing: id 1 | task 153 | n_decoded = 100, tg = 14.10 t/s, tg_3s = 14.10 t/s
1.02.097.121 I slot print_timing: id 3 | task 136 | prompt eval time = 123.38 ms / 29 tokens ( 4.25 ms per token, 235.05 tokens per second)
1.02.097.124 I slot print_timing: id 3 | task 136 | eval time = 9014.53 ms / 128 tokens ( 70.43 ms per token, 14.20 tokens per second)
1.02.097.124 I slot print_timing: id 3 | task 136 | total time = 9137.91 ms / 157 tokens
1.02.097.125 I slot print_timing: id 3 | task 136 | graphs reused = 1
1.02.097.128 I slot print_timing: id 3 | task 136 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.02.097.141 I statistics draft-mtp: #calls(b,g,a) = 58 169 2600, #gen drafts = 2615, #acc drafts = 1869, #gen tokens = 5217, #acc tokens = 3494, #mean acc len = 2.34, #acc rate/pos = (0.719, 0.625), dur(b,g,a) = 0.044, 543.859, 915.755 ms
1.02.097.166 I slot release: id 3 | task 136 | stop processing: n_tokens = 156, truncated = 0
1.02.105.640 I srv operator(): Chat format: peg-native
1.02.108.267 I slot print_timing: id 13 | task 165 | prompt eval time = 134.56 ms / 28 tokens ( 4.81 ms per token, 208.09 tokens per second)
1.02.108.269 I slot print_timing: id 13 | task 165 | eval time = 6188.66 ms / 125 tokens ( 49.51 ms per token, 20.20 tokens per second)
1.02.108.269 I slot print_timing: id 13 | task 165 | total time = 6323.22 ms / 153 tokens
1.02.108.269 I slot print_timing: id 13 | task 165 | graphs reused = 1
1.02.108.272 I slot print_timing: id 13 | task 165 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.02.108.280 I statistics draft-mtp: #calls(b,g,a) = 58 169 2613, #gen drafts = 2615, #acc drafts = 1879, #gen tokens = 5217, #acc tokens = 3511, #mean acc len = 2.34, #acc rate/pos = (0.719, 0.625), dur(b,g,a) = 0.044, 543.859, 920.382 ms
1.02.108.302 I slot release: id 13 | task 165 | stop processing: n_tokens = 152, truncated = 0
1.02.109.458 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.02.109.499 I slot launch_slot_: id 3 | task 228 | processing task, is_child = 0
1.02.114.190 W slot operator(): id 3 | task 228 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.02.114.211 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.02.117.044 I srv operator(): Chat format: peg-native
1.02.236.132 I slot print_timing: id 7 | task 183 | n_decoded = 102, tg = 22.58 t/s, tg_3s = 22.58 t/s
1.02.242.721 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.02.242.787 I slot launch_slot_: id 13 | task 230 | processing task, is_child = 0
1.02.247.950 W slot operator(): id 13 | task 230 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.02.247.981 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.02.629.251 I slot print_timing: id 6 | task 181 | n_decoded = 101, tg = 20.01 t/s, tg_3s = 20.01 t/s
1.02.881.619 I slot print_timing: id 7 | task 183 | prompt eval time = 122.75 ms / 25 tokens ( 4.91 ms per token, 203.66 tokens per second)
1.02.881.622 I slot print_timing: id 7 | task 183 | eval time = 5162.04 ms / 114 tokens ( 45.28 ms per token, 22.08 tokens per second)
1.02.881.622 I slot print_timing: id 7 | task 183 | total time = 5284.80 ms / 139 tokens
1.02.881.623 I slot print_timing: id 7 | task 183 | graphs reused = 1
1.02.881.626 I slot print_timing: id 7 | task 183 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.02.881.639 I statistics draft-mtp: #calls(b,g,a) = 60 175 2700, #gen drafts = 2708, #acc drafts = 1939, #gen tokens = 5403, #acc tokens = 3625, #mean acc len = 2.34, #acc rate/pos = (0.718, 0.624), dur(b,g,a) = 0.046, 564.625, 950.887 ms
1.02.881.667 I slot release: id 7 | task 183 | stop processing: n_tokens = 140, truncated = 0
1.02.890.549 I srv operator(): Chat format: peg-native
1.02.999.109 I slot print_timing: id 2 | task 164 | n_decoded = 100, tg = 14.12 t/s, tg_3s = 14.12 t/s
1.03.008.865 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.03.008.930 I slot launch_slot_: id 7 | task 237 | processing task, is_child = 0
1.03.013.761 W slot operator(): id 7 | task 237 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.013.785 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.519.097 I slot print_timing: id 4 | task 196 | n_decoded = 102, tg = 22.63 t/s, tg_3s = 22.63 t/s
1.03.528.747 I slot print_timing: id 15 | task 173 | n_decoded = 100, tg = 14.63 t/s, tg_3s = 14.63 t/s
1.03.772.422 I slot print_timing: id 6 | task 181 | prompt eval time = 117.38 ms / 28 tokens ( 4.19 ms per token, 238.55 tokens per second)
1.03.772.426 I slot print_timing: id 6 | task 181 | eval time = 6191.83 ms / 125 tokens ( 49.53 ms per token, 20.19 tokens per second)
1.03.772.427 I slot print_timing: id 6 | task 181 | total time = 6309.20 ms / 153 tokens
1.03.772.428 I slot print_timing: id 6 | task 181 | graphs reused = 1
1.03.772.431 I slot print_timing: id 6 | task 181 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.03.772.443 I statistics draft-mtp: #calls(b,g,a) = 61 182 2809, #gen drafts = 2818, #acc drafts = 2014, #gen tokens = 5623, #acc tokens = 3763, #mean acc len = 2.34, #acc rate/pos = (0.717, 0.623), dur(b,g,a) = 0.047, 587.952, 988.925 ms
1.03.772.469 I slot release: id 6 | task 181 | stop processing: n_tokens = 152, truncated = 0
1.03.781.162 I srv operator(): Chat format: peg-native
1.03.897.310 I slot print_timing: id 12 | task 194 | n_decoded = 101, tg = 20.10 t/s, tg_3s = 20.10 t/s
1.03.899.664 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.03.899.731 I slot launch_slot_: id 6 | task 245 | processing task, is_child = 0
1.03.903.989 W slot operator(): id 6 | task 245 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.904.008 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.149.616 I slot print_timing: id 1 | task 153 | prompt eval time = 147.10 ms / 29 tokens ( 5.07 ms per token, 197.14 tokens per second)
1.04.149.620 I slot print_timing: id 1 | task 153 | eval time = 9266.48 ms / 128 tokens ( 72.39 ms per token, 13.81 tokens per second)
1.04.149.620 I slot print_timing: id 1 | task 153 | total time = 9413.58 ms / 157 tokens
1.04.149.621 I slot print_timing: id 1 | task 153 | graphs reused = 1
1.04.149.624 I slot print_timing: id 1 | task 153 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.04.149.641 I statistics draft-mtp: #calls(b,g,a) = 62 185 2848, #gen drafts = 2863, #acc drafts = 2040, #gen tokens = 5712, #acc tokens = 3813, #mean acc len = 2.34, #acc rate/pos = (0.716, 0.623), dur(b,g,a) = 0.048, 599.810, 1002.190 ms
1.04.149.667 I slot release: id 1 | task 153 | stop processing: n_tokens = 156, truncated = 0
1.04.153.386 I slot print_timing: id 4 | task 196 | prompt eval time = 123.04 ms / 25 tokens ( 4.92 ms per token, 203.18 tokens per second)
1.04.153.389 I slot print_timing: id 4 | task 196 | eval time = 5140.71 ms / 114 tokens ( 45.09 ms per token, 22.18 tokens per second)
1.04.153.390 I slot print_timing: id 4 | task 196 | total time = 5263.75 ms / 139 tokens
1.04.153.390 I slot print_timing: id 4 | task 196 | graphs reused = 1
1.04.153.392 I slot print_timing: id 4 | task 196 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.04.153.400 I statistics draft-mtp: #calls(b,g,a) = 62 185 2852, #gen drafts = 2863, #acc drafts = 2043, #gen tokens = 5712, #acc tokens = 3819, #mean acc len = 2.34, #acc rate/pos = (0.716, 0.623), dur(b,g,a) = 0.048, 599.810, 1003.725 ms
1.04.153.420 I slot release: id 4 | task 196 | stop processing: n_tokens = 140, truncated = 0
1.04.158.390 I srv operator(): Chat format: peg-native
1.04.161.586 I srv operator(): Chat format: peg-native
1.04.162.579 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.04.162.642 I slot launch_slot_: id 1 | task 248 | processing task, is_child = 0
1.04.162.645 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.04.162.661 I slot launch_slot_: id 4 | task 249 | processing task, is_child = 0
1.04.167.163 W slot operator(): id 1 | task 248 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.167.195 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.167.226 W slot operator(): id 4 | task 249 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.167.264 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.940.813 I slot print_timing: id 9 | task 210 | n_decoded = 102, tg = 22.64 t/s, tg_3s = 22.64 t/s
1.05.067.155 I slot print_timing: id 12 | task 194 | prompt eval time = 121.30 ms / 28 tokens ( 4.33 ms per token, 230.83 tokens per second)
1.05.067.160 I slot print_timing: id 12 | task 194 | eval time = 6193.93 ms / 125 tokens ( 49.55 ms per token, 20.18 tokens per second)
1.05.067.161 I slot print_timing: id 12 | task 194 | total time = 6315.23 ms / 153 tokens
1.05.067.162 I slot print_timing: id 12 | task 194 | graphs reused = 1
1.05.067.165 I slot print_timing: id 12 | task 194 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.05.067.178 I statistics draft-mtp: #calls(b,g,a) = 64 192 2970, #gen drafts = 2973, #acc drafts = 2124, #gen tokens = 5931, #acc tokens = 3972, #mean acc len = 2.34, #acc rate/pos = (0.715, 0.622), dur(b,g,a) = 0.049, 620.900, 1044.736 ms
1.05.067.202 I slot release: id 12 | task 194 | stop processing: n_tokens = 152, truncated = 0
1.05.075.282 I srv operator(): Chat format: peg-native
1.05.174.581 I slot print_timing: id 2 | task 164 | prompt eval time = 134.08 ms / 29 tokens ( 4.62 ms per token, 216.29 tokens per second)
1.05.174.584 I slot print_timing: id 2 | task 164 | eval time = 9255.52 ms / 128 tokens ( 72.31 ms per token, 13.83 tokens per second)
1.05.174.585 I slot print_timing: id 2 | task 164 | total time = 9389.60 ms / 157 tokens
1.05.174.586 I slot print_timing: id 2 | task 164 | graphs reused = 1
1.05.174.589 I slot print_timing: id 2 | task 164 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.05.174.601 I statistics draft-mtp: #calls(b,g,a) = 64 193 2973, #gen drafts = 2987, #acc drafts = 2125, #gen tokens = 5959, #acc tokens = 3973, #mean acc len = 2.34, #acc rate/pos = (0.715, 0.622), dur(b,g,a) = 0.049, 625.481, 1045.648 ms
1.05.174.626 I slot release: id 2 | task 164 | stop processing: n_tokens = 156, truncated = 0
1.05.175.783 I slot print_timing: id 0 | task 207 | n_decoded = 101, tg = 20.20 t/s, tg_3s = 20.19 t/s
1.05.183.196 I srv operator(): Chat format: peg-native
1.05.186.990 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.05.187.040 I slot launch_slot_: id 2 | task 258 | processing task, is_child = 0
1.05.187.043 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.05.187.059 I slot launch_slot_: id 12 | task 259 | processing task, is_child = 0
1.05.191.732 W slot operator(): id 2 | task 258 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.191.754 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.191.800 W slot operator(): id 12 | task 259 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.191.827 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.466.660 I slot print_timing: id 14 | task 191 | n_decoded = 100, tg = 14.58 t/s, tg_3s = 14.58 t/s
1.05.588.935 I slot print_timing: id 9 | task 210 | prompt eval time = 122.48 ms / 25 tokens ( 4.90 ms per token, 204.12 tokens per second)
1.05.588.938 I slot print_timing: id 9 | task 210 | eval time = 5154.26 ms / 114 tokens ( 45.21 ms per token, 22.12 tokens per second)
1.05.588.938 I slot print_timing: id 9 | task 210 | total time = 5276.73 ms / 139 tokens
1.05.588.939 I slot print_timing: id 9 | task 210 | graphs reused = 1
1.05.588.942 I slot print_timing: id 9 | task 210 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.05.588.954 I statistics draft-mtp: #calls(b,g,a) = 66 196 3027, #gen drafts = 3033, #acc drafts = 2167, #gen tokens = 6050, #acc tokens = 4053, #mean acc len = 2.34, #acc rate/pos = (0.716, 0.623), dur(b,g,a) = 0.050, 635.586, 1065.067 ms
1.05.588.977 I slot release: id 9 | task 210 | stop processing: n_tokens = 140, truncated = 0
1.05.597.451 I srv operator(): Chat format: peg-native
1.05.699.176 I slot print_timing: id 15 | task 173 | prompt eval time = 123.06 ms / 29 tokens ( 4.24 ms per token, 235.66 tokens per second)
1.05.699.179 I slot print_timing: id 15 | task 173 | eval time = 9005.01 ms / 128 tokens ( 70.35 ms per token, 14.21 tokens per second)
1.05.699.179 I slot print_timing: id 15 | task 173 | total time = 9128.06 ms / 157 tokens
1.05.699.180 I slot print_timing: id 15 | task 173 | graphs reused = 1
1.05.699.182 I slot print_timing: id 15 | task 173 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.05.699.196 I statistics draft-mtp: #calls(b,g,a) = 66 197 3033, #gen drafts = 3047, #acc drafts = 2172, #gen tokens = 6078, #acc tokens = 4061, #mean acc len = 2.34, #acc rate/pos = (0.716, 0.623), dur(b,g,a) = 0.050, 639.536, 1067.134 ms
1.05.699.220 I slot release: id 15 | task 173 | stop processing: n_tokens = 156, truncated = 0
1.05.707.855 I srv operator(): Chat format: peg-native
1.05.711.304 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.05.711.342 I slot launch_slot_: id 9 | task 264 | processing task, is_child = 0
1.05.711.344 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.05.711.360 I slot launch_slot_: id 15 | task 265 | processing task, is_child = 0
1.05.715.443 W slot operator(): id 9 | task 264 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.715.474 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.715.501 W slot operator(): id 15 | task 265 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.715.534 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.985.751 I slot print_timing: id 10 | task 221 | n_decoded = 102, tg = 22.58 t/s, tg_3s = 22.58 t/s
1.06.354.782 I slot print_timing: id 0 | task 207 | prompt eval time = 122.88 ms / 28 tokens ( 4.39 ms per token, 227.86 tokens per second)
1.06.354.785 I slot print_timing: id 0 | task 207 | eval time = 6180.18 ms / 125 tokens ( 49.44 ms per token, 20.23 tokens per second)
1.06.354.785 I slot print_timing: id 0 | task 207 | total time = 6303.06 ms / 153 tokens
1.06.354.786 I slot print_timing: id 0 | task 207 | graphs reused = 1
1.06.354.789 I slot print_timing: id 0 | task 207 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.06.354.809 I statistics draft-mtp: #calls(b,g,a) = 68 202 3110, #gen drafts = 3125, #acc drafts = 2224, #gen tokens = 6234, #acc tokens = 4157, #mean acc len = 2.34, #acc rate/pos = (0.715, 0.622), dur(b,g,a) = 0.051, 654.643, 1094.067 ms
1.06.354.832 I slot release: id 0 | task 207 | stop processing: n_tokens = 152, truncated = 0
1.06.361.468 I slot print_timing: id 8 | task 219 | n_decoded = 101, tg = 20.08 t/s, tg_3s = 20.08 t/s
1.06.363.958 I srv operator(): Chat format: peg-native
1.06.367.359 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.06.367.401 I slot launch_slot_: id 0 | task 271 | processing task, is_child = 0
1.06.370.161 W slot operator(): id 0 | task 271 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.06.370.179 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.06.629.207 I slot print_timing: id 10 | task 221 | prompt eval time = 122.53 ms / 25 tokens ( 4.90 ms per token, 204.04 tokens per second)
1.06.629.210 I slot print_timing: id 10 | task 221 | eval time = 5160.23 ms / 114 tokens ( 45.27 ms per token, 22.09 tokens per second)
1.06.629.210 I slot print_timing: id 10 | task 221 | total time = 5282.76 ms / 139 tokens
1.06.629.211 I slot print_timing: id 10 | task 221 | graphs reused = 1
1.06.629.214 I slot print_timing: id 10 | task 221 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.06.629.227 I statistics draft-mtp: #calls(b,g,a) = 69 204 3151, #gen drafts = 3156, #acc drafts = 2255, #gen tokens = 6296, #acc tokens = 4217, #mean acc len = 2.34, #acc rate/pos = (0.716, 0.623), dur(b,g,a) = 0.052, 660.113, 1108.395 ms
1.06.629.251 I slot release: id 10 | task 221 | stop processing: n_tokens = 140, truncated = 0
1.06.630.231 I slot print_timing: id 11 | task 203 | n_decoded = 100, tg = 14.60 t/s, tg_3s = 14.60 t/s
1.06.639.012 I srv operator(): Chat format: peg-native
1.06.753.907 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.06.753.981 I slot launch_slot_: id 10 | task 275 | processing task, is_child = 0
1.06.758.214 W slot operator(): id 10 | task 275 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.06.758.247 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.07.394.793 I slot print_timing: id 13 | task 230 | n_decoded = 101, tg = 20.11 t/s, tg_3s = 20.11 t/s
1.07.514.723 I slot print_timing: id 8 | task 219 | prompt eval time = 130.06 ms / 28 tokens ( 4.64 ms per token, 215.29 tokens per second)
1.07.514.726 I slot print_timing: id 8 | task 219 | eval time = 6183.38 ms / 125 tokens ( 49.47 ms per token, 20.22 tokens per second)
1.07.514.726 I slot print_timing: id 8 | task 219 | total time = 6313.44 ms / 153 tokens
1.07.514.727 I slot print_timing: id 8 | task 219 | graphs reused = 1
1.07.514.730 I slot print_timing: id 8 | task 219 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.07.514.742 I statistics draft-mtp: #calls(b,g,a) = 70 211 3259, #gen drafts = 3266, #acc drafts = 2327, #gen tokens = 6515, #acc tokens = 4350, #mean acc len = 2.33, #acc rate/pos = (0.714, 0.621), dur(b,g,a) = 0.053, 682.159, 1145.657 ms
1.07.514.766 I slot release: id 8 | task 219 | stop processing: n_tokens = 152, truncated = 0
1.07.523.443 I srv operator(): Chat format: peg-native
1.07.627.018 I slot print_timing: id 14 | task 191 | prompt eval time = 122.80 ms / 29 tokens ( 4.23 ms per token, 236.16 tokens per second)
1.07.627.022 I slot print_timing: id 14 | task 191 | eval time = 9016.76 ms / 128 tokens ( 70.44 ms per token, 14.20 tokens per second)
1.07.627.023 I slot print_timing: id 14 | task 191 | total time = 9139.56 ms / 157 tokens
1.07.627.023 I slot print_timing: id 14 | task 191 | graphs reused = 1
1.07.627.027 I slot print_timing: id 14 | task 191 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.07.627.040 I statistics draft-mtp: #calls(b,g,a) = 70 212 3266, #gen drafts = 3280, #acc drafts = 2331, #gen tokens = 6543, #acc tokens = 4358, #mean acc len = 2.33, #acc rate/pos = (0.714, 0.621), dur(b,g,a) = 0.053, 687.413, 1147.934 ms
1.07.627.065 I slot release: id 14 | task 191 | stop processing: n_tokens = 156, truncated = 0
1.07.634.095 I slot print_timing: id 7 | task 237 | n_decoded = 102, tg = 22.68 t/s, tg_3s = 22.68 t/s
1.07.636.588 I srv operator(): Chat format: peg-native
1.07.639.429 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.07.639.492 I slot launch_slot_: id 14 | task 283 | processing task, is_child = 0
1.07.639.495 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.07.639.511 I slot launch_slot_: id 8 | task 284 | processing task, is_child = 0
1.07.644.846 W slot operator(): id 8 | task 284 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.644.872 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.07.644.911 W slot operator(): id 14 | task 283 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.644.930 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.292.379 I slot print_timing: id 7 | task 237 | prompt eval time = 122.30 ms / 25 tokens ( 4.89 ms per token, 204.42 tokens per second)
1.08.292.384 I slot print_timing: id 7 | task 237 | eval time = 5156.30 ms / 114 tokens ( 45.23 ms per token, 22.11 tokens per second)
1.08.292.384 I slot print_timing: id 7 | task 237 | total time = 5278.60 ms / 139 tokens
1.08.292.385 I slot print_timing: id 7 | task 237 | graphs reused = 1
1.08.292.388 I slot print_timing: id 7 | task 237 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.08.292.400 I statistics draft-mtp: #calls(b,g,a) = 72 217 3350, #gen drafts = 3358, #acc drafts = 2392, #gen tokens = 6699, #acc tokens = 4472, #mean acc len = 2.33, #acc rate/pos = (0.714, 0.621), dur(b,g,a) = 0.054, 703.893, 1177.520 ms
1.08.292.425 I slot release: id 7 | task 237 | stop processing: n_tokens = 140, truncated = 0
1.08.300.825 I srv operator(): Chat format: peg-native
1.08.411.721 I slot print_timing: id 5 | task 218 | n_decoded = 100, tg = 14.12 t/s, tg_3s = 14.12 t/s
1.08.419.225 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.08.419.293 I slot launch_slot_: id 7 | task 291 | processing task, is_child = 0
1.08.424.145 W slot operator(): id 7 | task 291 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.424.173 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.558.846 I slot print_timing: id 13 | task 230 | prompt eval time = 123.22 ms / 28 tokens ( 4.40 ms per token, 227.24 tokens per second)
1.08.558.849 I slot print_timing: id 13 | task 230 | eval time = 6187.63 ms / 125 tokens ( 49.50 ms per token, 20.20 tokens per second)
1.08.558.850 I slot print_timing: id 13 | task 230 | total time = 6310.85 ms / 153 tokens
1.08.558.851 I slot print_timing: id 13 | task 230 | graphs reused = 1
1.08.558.854 I slot print_timing: id 13 | task 230 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.08.558.866 I statistics draft-mtp: #calls(b,g,a) = 73 219 3386, #gen drafts = 3388, #acc drafts = 2416, #gen tokens = 6759, #acc tokens = 4517, #mean acc len = 2.33, #acc rate/pos = (0.714, 0.620), dur(b,g,a) = 0.055, 713.419, 1189.987 ms
1.08.558.894 I slot release: id 13 | task 230 | stop processing: n_tokens = 152, truncated = 0
1.08.567.127 I srv operator(): Chat format: peg-native
1.08.677.690 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.08.677.760 I slot launch_slot_: id 13 | task 294 | processing task, is_child = 0
1.08.682.238 W slot operator(): id 13 | task 294 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.682.273 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.802.983 I slot print_timing: id 11 | task 203 | prompt eval time = 123.75 ms / 29 tokens ( 4.27 ms per token, 234.35 tokens per second)
1.08.802.986 I slot print_timing: id 11 | task 203 | eval time = 9022.24 ms / 128 tokens ( 70.49 ms per token, 14.19 tokens per second)
1.08.802.986 I slot print_timing: id 11 | task 203 | total time = 9145.98 ms / 157 tokens
1.08.802.987 I slot print_timing: id 11 | task 203 | graphs reused = 1
1.08.802.990 I slot print_timing: id 11 | task 203 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.08.803.004 I statistics draft-mtp: #calls(b,g,a) = 73 221 3403, #gen drafts = 3417, #acc drafts = 2427, #gen tokens = 6816, #acc tokens = 4537, #mean acc len = 2.33, #acc rate/pos = (0.713, 0.620), dur(b,g,a) = 0.055, 721.475, 1195.812 ms
1.08.803.030 I slot release: id 11 | task 203 | stop processing: n_tokens = 156, truncated = 0
1.08.808.569 I slot print_timing: id 4 | task 249 | n_decoded = 102, tg = 22.64 t/s, tg_3s = 22.64 t/s
1.08.811.863 I srv operator(): Chat format: peg-native
1.08.816.448 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.08.816.494 I slot launch_slot_: id 11 | task 296 | processing task, is_child = 0
1.08.820.651 W slot operator(): id 11 | task 296 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.820.674 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.09.321.824 I slot print_timing: id 1 | task 248 | n_decoded = 101, tg = 20.12 t/s, tg_3s = 20.12 t/s
1.09.323.390 I slot print_timing: id 3 | task 228 | n_decoded = 100, tg = 14.10 t/s, tg_3s = 14.10 t/s
1.09.450.221 I slot print_timing: id 4 | task 249 | prompt eval time = 136.03 ms / 25 tokens ( 5.44 ms per token, 183.78 tokens per second)
1.09.450.224 I slot print_timing: id 4 | task 249 | eval time = 5146.94 ms / 114 tokens ( 45.15 ms per token, 22.15 tokens per second)
1.09.450.224 I slot print_timing: id 4 | task 249 | total time = 5282.97 ms / 139 tokens
1.09.450.225 I slot print_timing: id 4 | task 249 | graphs reused = 1
1.09.450.228 I slot print_timing: id 4 | task 249 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.09.450.242 I statistics draft-mtp: #calls(b,g,a) = 75 226 3485, #gen drafts = 3496, #acc drafts = 2485, #gen tokens = 6974, #acc tokens = 4645, #mean acc len = 2.33, #acc rate/pos = (0.713, 0.620), dur(b,g,a) = 0.056, 736.641, 1224.658 ms
1.09.450.268 I slot release: id 4 | task 249 | stop processing: n_tokens = 140, truncated = 0
1.09.458.948 I srv operator(): Chat format: peg-native
1.09.459.252 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.09.459.289 I slot launch_slot_: id 4 | task 302 | processing task, is_child = 0
1.09.463.408 W slot operator(): id 4 | task 302 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.09.463.422 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.351.403 I slot print_timing: id 9 | task 264 | n_decoded = 102, tg = 22.67 t/s, tg_3s = 22.67 t/s
1.10.354.254 I slot print_timing: id 12 | task 259 | n_decoded = 101, tg = 20.10 t/s, tg_3s = 20.10 t/s
1.10.470.194 I slot print_timing: id 1 | task 248 | prompt eval time = 135.82 ms / 28 tokens ( 4.85 ms per token, 206.16 tokens per second)
1.10.470.197 I slot print_timing: id 1 | task 248 | eval time = 6167.17 ms / 125 tokens ( 49.34 ms per token, 20.27 tokens per second)
1.10.470.197 I slot print_timing: id 1 | task 248 | total time = 6302.99 ms / 153 tokens
1.10.470.198 I slot print_timing: id 1 | task 248 | graphs reused = 1
1.10.470.201 I slot print_timing: id 1 | task 248 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.10.470.219 I statistics draft-mtp: #calls(b,g,a) = 76 234 3609, #gen drafts = 3623, #acc drafts = 2572, #gen tokens = 7227, #acc tokens = 4811, #mean acc len = 2.33, #acc rate/pos = (0.713, 0.620), dur(b,g,a) = 0.057, 760.156, 1268.394 ms
1.10.470.245 I slot release: id 1 | task 248 | stop processing: n_tokens = 152, truncated = 0
1.10.479.039 I srv operator(): Chat format: peg-native
1.10.481.932 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.10.481.982 I slot launch_slot_: id 1 | task 311 | processing task, is_child = 0
1.10.486.634 W slot operator(): id 1 | task 311 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.486.654 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.608.862 I slot print_timing: id 5 | task 218 | prompt eval time = 129.85 ms / 29 tokens ( 4.48 ms per token, 223.34 tokens per second)
1.10.608.864 I slot print_timing: id 5 | task 218 | eval time = 9277.83 ms / 128 tokens ( 72.48 ms per token, 13.80 tokens per second)
1.10.608.865 I slot print_timing: id 5 | task 218 | total time = 9407.67 ms / 157 tokens
1.10.608.865 I slot print_timing: id 5 | task 218 | graphs reused = 1
1.10.608.869 I slot print_timing: id 5 | task 218 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.10.608.881 I statistics draft-mtp: #calls(b,g,a) = 77 235 3623, #gen drafts = 3637, #acc drafts = 2582, #gen tokens = 7255, #acc tokens = 4829, #mean acc len = 2.33, #acc rate/pos = (0.713, 0.620), dur(b,g,a) = 0.058, 764.720, 1273.230 ms
1.10.608.907 I slot release: id 5 | task 218 | stop processing: n_tokens = 156, truncated = 0
1.10.617.476 I srv operator(): Chat format: peg-native
1.10.620.663 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.10.620.711 I slot launch_slot_: id 5 | task 313 | processing task, is_child = 0
1.10.624.911 W slot operator(): id 5 | task 313 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.624.939 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.879.699 I slot print_timing: id 6 | task 245 | n_decoded = 100, tg = 14.59 t/s, tg_3s = 14.59 t/s
1.11.008.459 I slot print_timing: id 9 | task 264 | prompt eval time = 136.07 ms / 25 tokens ( 5.44 ms per token, 183.72 tokens per second)
1.11.008.463 I slot print_timing: id 9 | task 264 | eval time = 5156.92 ms / 114 tokens ( 45.24 ms per token, 22.11 tokens per second)
1.11.008.464 I slot print_timing: id 9 | task 264 | total time = 5292.99 ms / 139 tokens
1.11.008.465 I slot print_timing: id 9 | task 264 | graphs reused = 1
1.11.008.468 I slot print_timing: id 9 | task 264 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.11.008.480 I statistics draft-mtp: #calls(b,g,a) = 78 238 3678, #gen drafts = 3684, #acc drafts = 2620, #gen tokens = 7349, #acc tokens = 4899, #mean acc len = 2.33, #acc rate/pos = (0.712, 0.620), dur(b,g,a) = 0.059, 774.373, 1292.582 ms
1.11.008.506 I slot release: id 9 | task 264 | stop processing: n_tokens = 140, truncated = 0
1.11.018.028 I srv operator(): Chat format: peg-native
1.11.132.959 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.11.133.025 I slot launch_slot_: id 9 | task 318 | processing task, is_child = 0
1.11.137.322 W slot operator(): id 9 | task 318 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.11.137.354 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.394.041 I slot print_timing: id 10 | task 275 | n_decoded = 102, tg = 22.60 t/s, tg_3s = 22.60 t/s
1.11.509.159 I slot print_timing: id 3 | task 228 | prompt eval time = 116.02 ms / 29 tokens ( 4.00 ms per token, 249.96 tokens per second)
1.11.509.166 I slot print_timing: id 3 | task 228 | eval time = 9278.92 ms / 128 tokens ( 72.49 ms per token, 13.79 tokens per second)
1.11.509.167 I slot print_timing: id 3 | task 228 | total time = 9394.94 ms / 157 tokens
1.11.509.168 I slot print_timing: id 3 | task 228 | graphs reused = 1
1.11.509.170 I slot print_timing: id 3 | task 228 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.11.509.184 I statistics draft-mtp: #calls(b,g,a) = 79 242 3730, #gen drafts = 3745, #acc drafts = 2655, #gen tokens = 7470, #acc tokens = 4965, #mean acc len = 2.33, #acc rate/pos = (0.712, 0.619), dur(b,g,a) = 0.061, 789.374, 1310.900 ms
1.11.509.209 I slot release: id 3 | task 228 | stop processing: n_tokens = 156, truncated = 0
1.11.510.400 I slot print_timing: id 0 | task 271 | n_decoded = 101, tg = 20.13 t/s, tg_3s = 20.13 t/s
1.11.517.964 I srv operator(): Chat format: peg-native
1.11.519.966 I slot print_timing: id 12 | task 259 | prompt eval time = 137.13 ms / 28 tokens ( 4.90 ms per token, 204.18 tokens per second)
1.11.519.969 I slot print_timing: id 12 | task 259 | eval time = 6191.00 ms / 125 tokens ( 49.53 ms per token, 20.19 tokens per second)
1.11.519.969 I slot print_timing: id 12 | task 259 | total time = 6328.13 ms / 153 tokens
1.11.519.970 I slot print_timing: id 12 | task 259 | graphs reused = 1
1.11.519.972 I slot print_timing: id 12 | task 259 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.11.519.982 I statistics draft-mtp: #calls(b,g,a) = 79 242 3742, #gen drafts = 3745, #acc drafts = 2664, #gen tokens = 7470, #acc tokens = 4983, #mean acc len = 2.33, #acc rate/pos = (0.712, 0.620), dur(b,g,a) = 0.061, 789.374, 1315.223 ms
1.11.520.005 I slot release: id 12 | task 259 | stop processing: n_tokens = 152, truncated = 0
1.11.522.212 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.11.522.269 I slot launch_slot_: id 3 | task 322 | processing task, is_child = 0
1.11.527.542 W slot operator(): id 3 | task 322 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.11.527.574 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.529.411 I srv operator(): Chat format: peg-native
1.11.655.629 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.11.655.698 I slot launch_slot_: id 12 | task 324 | processing task, is_child = 0
1.11.659.589 W slot operator(): id 12 | task 324 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.11.659.606 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.045.418 I slot print_timing: id 10 | task 275 | prompt eval time = 122.60 ms / 25 tokens ( 4.90 ms per token, 203.92 tokens per second)
1.12.045.421 I slot print_timing: id 10 | task 275 | eval time = 5164.58 ms / 114 tokens ( 45.30 ms per token, 22.07 tokens per second)
1.12.045.422 I slot print_timing: id 10 | task 275 | total time = 5287.18 ms / 139 tokens
1.12.045.423 I slot print_timing: id 10 | task 275 | graphs reused = 1
1.12.045.425 I slot print_timing: id 10 | task 275 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.12.045.437 I statistics draft-mtp: #calls(b,g,a) = 81 246 3801, #gen drafts = 3806, #acc drafts = 2707, #gen tokens = 7592, #acc tokens = 5064, #mean acc len = 2.33, #acc rate/pos = (0.712, 0.620), dur(b,g,a) = 0.063, 803.899, 1336.256 ms
1.12.045.463 I slot release: id 10 | task 275 | stop processing: n_tokens = 140, truncated = 0
1.12.053.997 I srv operator(): Chat format: peg-native
1.12.170.305 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.12.170.368 I slot launch_slot_: id 10 | task 329 | processing task, is_child = 0
1.12.174.533 W slot operator(): id 10 | task 329 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.174.569 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.424.479 I slot print_timing: id 2 | task 258 | n_decoded = 100, tg = 14.09 t/s, tg_3s = 14.09 t/s
1.12.674.245 I slot print_timing: id 0 | task 271 | prompt eval time = 123.06 ms / 28 tokens ( 4.39 ms per token, 227.53 tokens per second)
1.12.674.248 I slot print_timing: id 0 | task 271 | eval time = 6180.97 ms / 125 tokens ( 49.45 ms per token, 20.22 tokens per second)
1.12.674.249 I slot print_timing: id 0 | task 271 | total time = 6304.02 ms / 153 tokens
1.12.674.249 I slot print_timing: id 0 | task 271 | graphs reused = 1
1.12.674.252 I slot print_timing: id 0 | task 271 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.12.674.266 I statistics draft-mtp: #calls(b,g,a) = 82 251 3869, #gen drafts = 3884, #acc drafts = 2754, #gen tokens = 7748, #acc tokens = 5150, #mean acc len = 2.33, #acc rate/pos = (0.712, 0.619), dur(b,g,a) = 0.065, 820.428, 1360.293 ms
1.12.674.293 I slot release: id 0 | task 271 | stop processing: n_tokens = 152, truncated = 0
1.12.682.675 I srv operator(): Chat format: peg-native
1.12.686.779 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.12.686.826 I slot launch_slot_: id 0 | task 334 | processing task, is_child = 0
1.12.689.669 W slot operator(): id 0 | task 334 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.689.695 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.820.369 I slot print_timing: id 8 | task 284 | n_decoded = 101, tg = 20.05 t/s, tg_3s = 20.05 t/s
1.12.951.978 I slot print_timing: id 15 | task 265 | n_decoded = 100, tg = 14.08 t/s, tg_3s = 14.08 t/s
1.13.064.097 I slot print_timing: id 6 | task 245 | prompt eval time = 121.77 ms / 29 tokens ( 4.20 ms per token, 238.15 tokens per second)
1.13.064.101 I slot print_timing: id 6 | task 245 | eval time = 9038.30 ms / 128 tokens ( 70.61 ms per token, 14.16 tokens per second)
1.13.064.101 I slot print_timing: id 6 | task 245 | total time = 9160.07 ms / 157 tokens
1.13.064.102 I slot print_timing: id 6 | task 245 | graphs reused = 1
1.13.064.106 I slot print_timing: id 6 | task 245 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.13.064.127 I statistics draft-mtp: #calls(b,g,a) = 83 254 3915, #gen drafts = 3930, #acc drafts = 2787, #gen tokens = 7839, #acc tokens = 5213, #mean acc len = 2.33, #acc rate/pos = (0.712, 0.620), dur(b,g,a) = 0.066, 830.188, 1376.527 ms
1.13.064.157 I slot release: id 6 | task 245 | stop processing: n_tokens = 156, truncated = 0
1.13.070.510 I slot print_timing: id 7 | task 291 | n_decoded = 102, tg = 22.55 t/s, tg_3s = 22.55 t/s
1.13.072.243 I srv operator(): Chat format: peg-native
1.13.076.827 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.13.076.868 I slot launch_slot_: id 6 | task 338 | processing task, is_child = 0
1.13.081.249 W slot operator(): id 6 | task 338 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.13.081.270 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.13.715.617 I slot print_timing: id 7 | task 291 | prompt eval time = 123.12 ms / 25 tokens ( 4.92 ms per token, 203.06 tokens per second)
1.13.715.620 I slot print_timing: id 7 | task 291 | eval time = 5168.33 ms / 114 tokens ( 45.34 ms per token, 22.06 tokens per second)
1.13.715.621 I slot print_timing: id 7 | task 291 | total time = 5291.45 ms / 139 tokens
1.13.715.622 I slot print_timing: id 7 | task 291 | graphs reused = 1
1.13.715.624 I slot print_timing: id 7 | task 291 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.13.715.635 I statistics draft-mtp: #calls(b,g,a) = 84 259 4001, #gen drafts = 4009, #acc drafts = 2846, #gen tokens = 7997, #acc tokens = 5323, #mean acc len = 2.33, #acc rate/pos = (0.711, 0.619), dur(b,g,a) = 0.067, 845.648, 1407.028 ms
1.13.715.660 I slot release: id 7 | task 291 | stop processing: n_tokens = 140, truncated = 0
1.13.724.820 I srv operator(): Chat format: peg-native
1.13.842.953 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.13.843.018 I slot launch_slot_: id 7 | task 345 | processing task, is_child = 0
1.13.847.898 W slot operator(): id 7 | task 345 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.13.847.928 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.13.977.496 I slot print_timing: id 8 | task 284 | prompt eval time = 136.91 ms / 28 tokens ( 4.89 ms per token, 204.51 tokens per second)
1.13.977.499 I slot print_timing: id 8 | task 284 | eval time = 6195.69 ms / 125 tokens ( 49.57 ms per token, 20.18 tokens per second)
1.13.977.499 I slot print_timing: id 8 | task 284 | total time = 6332.60 ms / 153 tokens
1.13.977.500 I slot print_timing: id 8 | task 284 | graphs reused = 1
1.13.977.503 I slot print_timing: id 8 | task 284 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.13.977.514 I statistics draft-mtp: #calls(b,g,a) = 85 261 4032, #gen drafts = 4039, #acc drafts = 2866, #gen tokens = 8057, #acc tokens = 5360, #mean acc len = 2.33, #acc rate/pos = (0.711, 0.619), dur(b,g,a) = 0.068, 855.242, 1417.892 ms
1.13.977.543 I slot release: id 8 | task 284 | stop processing: n_tokens = 152, truncated = 0
1.13.980.479 I slot print_timing: id 11 | task 296 | n_decoded = 101, tg = 20.05 t/s, tg_3s = 20.05 t/s
1.13.985.741 I srv operator(): Chat format: peg-native
1.14.095.018 I slot print_timing: id 4 | task 302 | n_decoded = 102, tg = 22.62 t/s, tg_3s = 22.62 t/s
1.14.103.972 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.14.104.038 I slot launch_slot_: id 8 | task 348 | processing task, is_child = 0
1.14.108.875 W slot operator(): id 8 | task 348 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.108.899 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.607.287 I slot print_timing: id 2 | task 258 | prompt eval time = 136.91 ms / 29 tokens ( 4.72 ms per token, 211.82 tokens per second)
1.14.607.291 I slot print_timing: id 2 | task 258 | eval time = 9278.62 ms / 128 tokens ( 72.49 ms per token, 13.80 tokens per second)
1.14.607.291 I slot print_timing: id 2 | task 258 | total time = 9415.53 ms / 157 tokens
1.14.607.292 I slot print_timing: id 2 | task 258 | graphs reused = 1
1.14.607.296 I slot print_timing: id 2 | task 258 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.14.607.308 I statistics draft-mtp: #calls(b,g,a) = 86 266 4101, #gen drafts = 4116, #acc drafts = 2913, #gen tokens = 8210, #acc tokens = 5449, #mean acc len = 2.33, #acc rate/pos = (0.710, 0.618), dur(b,g,a) = 0.069, 874.039, 1442.448 ms
1.14.607.332 I slot release: id 2 | task 258 | stop processing: n_tokens = 156, truncated = 0
1.14.616.354 I srv operator(): Chat format: peg-native
1.14.620.631 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.14.620.698 I slot launch_slot_: id 2 | task 353 | processing task, is_child = 0
1.14.624.441 W slot operator(): id 2 | task 353 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.624.466 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.751.182 I slot print_timing: id 4 | task 302 | prompt eval time = 122.03 ms / 25 tokens ( 4.88 ms per token, 204.87 tokens per second)
1.14.751.186 I slot print_timing: id 4 | task 302 | eval time = 5165.72 ms / 114 tokens ( 45.31 ms per token, 22.07 tokens per second)
1.14.751.186 I slot print_timing: id 4 | task 302 | total time = 5287.75 ms / 139 tokens
1.14.751.188 I slot print_timing: id 4 | task 302 | graphs reused = 1
1.14.751.191 I slot print_timing: id 4 | task 302 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.14.751.201 I statistics draft-mtp: #calls(b,g,a) = 87 267 4120, #gen drafts = 4131, #acc drafts = 2927, #gen tokens = 8240, #acc tokens = 5475, #mean acc len = 2.33, #acc rate/pos = (0.710, 0.618), dur(b,g,a) = 0.070, 877.697, 1449.313 ms
1.14.751.226 I slot release: id 4 | task 302 | stop processing: n_tokens = 140, truncated = 0
1.14.759.935 I srv operator(): Chat format: peg-native
1.14.879.518 I slot print_timing: id 14 | task 283 | n_decoded = 100, tg = 14.09 t/s, tg_3s = 14.09 t/s
1.14.880.495 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.14.880.559 I slot launch_slot_: id 4 | task 356 | processing task, is_child = 0
1.14.884.707 W slot operator(): id 4 | task 356 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.884.736 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.15.127.869 I slot print_timing: id 15 | task 265 | prompt eval time = 136.36 ms / 29 tokens ( 4.70 ms per token, 212.67 tokens per second)
1.15.127.872 I slot print_timing: id 15 | task 265 | eval time = 9275.97 ms / 128 tokens ( 72.47 ms per token, 13.80 tokens per second)
1.15.127.873 I slot print_timing: id 15 | task 265 | total time = 9412.33 ms / 157 tokens
1.15.127.874 I slot print_timing: id 15 | task 265 | graphs reused = 1
1.15.127.877 I slot print_timing: id 15 | task 265 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.15.127.888 I statistics draft-mtp: #calls(b,g,a) = 88 270 4161, #gen drafts = 4176, #acc drafts = 2954, #gen tokens = 8329, #acc tokens = 5526, #mean acc len = 2.33, #acc rate/pos = (0.710, 0.618), dur(b,g,a) = 0.071, 888.497, 1463.397 ms
1.15.127.919 I slot release: id 15 | task 265 | stop processing: n_tokens = 156, truncated = 0
1.15.136.607 I srv operator(): Chat format: peg-native
1.15.138.824 I slot print_timing: id 11 | task 296 | prompt eval time = 122.94 ms / 28 tokens ( 4.39 ms per token, 227.75 tokens per second)
1.15.138.827 I slot print_timing: id 11 | task 296 | eval time = 6195.19 ms / 125 tokens ( 49.56 ms per token, 20.18 tokens per second)
1.15.138.828 I slot print_timing: id 11 | task 296 | total time = 6318.13 ms / 153 tokens
1.15.138.828 I slot print_timing: id 11 | task 296 | graphs reused = 1
1.15.138.831 I slot print_timing: id 11 | task 296 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.15.138.840 I statistics draft-mtp: #calls(b,g,a) = 88 270 4173, #gen drafts = 4176, #acc drafts = 2964, #gen tokens = 8329, #acc tokens = 5545, #mean acc len = 2.33, #acc rate/pos = (0.710, 0.618), dur(b,g,a) = 0.071, 888.497, 1467.754 ms
1.15.138.861 I slot release: id 11 | task 296 | stop processing: n_tokens = 152, truncated = 0
1.15.141.409 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.15.141.465 I slot launch_slot_: id 15 | task 359 | processing task, is_child = 0
1.15.145.219 W slot operator(): id 15 | task 359 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.15.145.236 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.15.147.121 I srv operator(): Chat format: peg-native
1.15.272.920 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.15.272.987 I slot launch_slot_: id 11 | task 361 | processing task, is_child = 0
1.15.277.124 W slot operator(): id 11 | task 361 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.15.277.151 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.15.664.311 I slot print_timing: id 13 | task 294 | n_decoded = 100, tg = 14.58 t/s, tg_3s = 14.58 t/s
1.15.784.136 I slot print_timing: id 5 | task 313 | n_decoded = 101, tg = 20.06 t/s, tg_3s = 20.06 t/s
1.15.787.957 I slot print_timing: id 9 | task 318 | n_decoded = 102, tg = 22.53 t/s, tg_3s = 22.53 t/s
1.16.419.209 I slot print_timing: id 9 | task 318 | prompt eval time = 122.52 ms / 25 tokens ( 4.90 ms per token, 204.06 tokens per second)
1.16.419.212 I slot print_timing: id 9 | task 318 | eval time = 5159.35 ms / 114 tokens ( 45.26 ms per token, 22.10 tokens per second)
1.16.419.213 I slot print_timing: id 9 | task 318 | total time = 5281.86 ms / 139 tokens
1.16.419.214 I slot print_timing: id 9 | task 318 | graphs reused = 1
1.16.419.217 I slot print_timing: id 9 | task 318 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.16.419.228 I statistics draft-mtp: #calls(b,g,a) = 90 280 4327, #gen drafts = 4333, #acc drafts = 3074, #gen tokens = 8643, #acc tokens = 5748, #mean acc len = 2.33, #acc rate/pos = (0.710, 0.618), dur(b,g,a) = 0.072, 918.451, 1522.172 ms
1.16.419.253 I slot release: id 9 | task 318 | stop processing: n_tokens = 140, truncated = 0
1.16.428.044 I srv operator(): Chat format: peg-native
1.16.543.324 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.16.543.388 I slot launch_slot_: id 9 | task 372 | processing task, is_child = 0
1.16.547.693 W slot operator(): id 9 | task 372 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.16.547.720 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.805.471 I slot print_timing: id 10 | task 329 | n_decoded = 102, tg = 22.62 t/s, tg_3s = 22.62 t/s
1.16.807.399 I slot print_timing: id 12 | task 324 | n_decoded = 101, tg = 20.10 t/s, tg_3s = 20.10 t/s
1.16.927.306 I slot print_timing: id 5 | task 313 | prompt eval time = 123.18 ms / 28 tokens ( 4.40 ms per token, 227.31 tokens per second)
1.16.927.312 I slot print_timing: id 5 | task 313 | eval time = 6179.17 ms / 125 tokens ( 49.43 ms per token, 20.23 tokens per second)
1.16.927.313 I slot print_timing: id 5 | task 313 | total time = 6302.35 ms / 153 tokens
1.16.927.314 I slot print_timing: id 5 | task 313 | graphs reused = 1
1.16.927.317 I slot print_timing: id 5 | task 313 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.16.927.333 I statistics draft-mtp: #calls(b,g,a) = 91 284 4385, #gen drafts = 4395, #acc drafts = 3114, #gen tokens = 8766, #acc tokens = 5825, #mean acc len = 2.33, #acc rate/pos = (0.710, 0.618), dur(b,g,a) = 0.073, 932.480, 1542.769 ms
1.16.927.360 I slot release: id 5 | task 313 | stop processing: n_tokens = 152, truncated = 0
1.16.936.668 I srv operator(): Chat format: peg-native
1.17.042.820 I slot print_timing: id 14 | task 283 | prompt eval time = 137.13 ms / 29 tokens ( 4.73 ms per token, 211.47 tokens per second)
1.17.042.823 I slot print_timing: id 14 | task 283 | eval time = 9260.75 ms / 128 tokens ( 72.35 ms per token, 13.82 tokens per second)
1.17.042.823 I slot print_timing: id 14 | task 283 | total time = 9397.88 ms / 157 tokens
1.17.042.825 I slot print_timing: id 14 | task 283 | graphs reused = 1
1.17.042.828 I slot print_timing: id 14 | task 283 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.17.042.840 I statistics draft-mtp: #calls(b,g,a) = 91 285 4395, #gen drafts = 4409, #acc drafts = 3121, #gen tokens = 8794, #acc tokens = 5838, #mean acc len = 2.33, #acc rate/pos = (0.710, 0.618), dur(b,g,a) = 0.073, 937.782, 1546.161 ms
1.17.042.867 I slot release: id 14 | task 283 | stop processing: n_tokens = 156, truncated = 0
1.17.051.381 I srv operator(): Chat format: peg-native
1.17.054.037 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.17.054.100 I slot launch_slot_: id 14 | task 377 | processing task, is_child = 0
1.17.054.102 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.17.054.119 I slot launch_slot_: id 5 | task 378 | processing task, is_child = 0
1.17.059.517 W slot operator(): id 5 | task 378 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.059.539 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.059.586 W slot operator(): id 14 | task 377 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.059.611 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.448.545 I slot print_timing: id 1 | task 311 | n_decoded = 100, tg = 14.62 t/s, tg_3s = 14.62 t/s
1.17.456.869 I slot print_timing: id 10 | task 329 | prompt eval time = 122.24 ms / 25 tokens ( 4.89 ms per token, 204.51 tokens per second)
1.17.456.872 I slot print_timing: id 10 | task 329 | eval time = 5160.07 ms / 114 tokens ( 45.26 ms per token, 22.09 tokens per second)
1.17.456.873 I slot print_timing: id 10 | task 329 | total time = 5282.31 ms / 139 tokens
1.17.456.874 I slot print_timing: id 10 | task 329 | graphs reused = 1
1.17.456.877 I slot print_timing: id 10 | task 329 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.17.456.888 I statistics draft-mtp: #calls(b,g,a) = 93 288 4450, #gen drafts = 4455, #acc drafts = 3157, #gen tokens = 8886, #acc tokens = 5907, #mean acc len = 2.33, #acc rate/pos = (0.709, 0.618), dur(b,g,a) = 0.074, 948.651, 1565.463 ms
1.17.456.913 I slot release: id 10 | task 329 | stop processing: n_tokens = 140, truncated = 0
1.17.465.279 I srv operator(): Chat format: peg-native
1.17.581.034 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.17.581.098 I slot launch_slot_: id 10 | task 383 | processing task, is_child = 0
1.17.585.299 W slot operator(): id 10 | task 383 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.585.325 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.830.159 I slot print_timing: id 13 | task 294 | prompt eval time = 121.07 ms / 29 tokens ( 4.17 ms per token, 239.53 tokens per second)
1.17.830.162 I slot print_timing: id 13 | task 294 | eval time = 9026.83 ms / 128 tokens ( 70.52 ms per token, 14.18 tokens per second)
1.17.830.163 I slot print_timing: id 13 | task 294 | total time = 9147.90 ms / 157 tokens
1.17.830.164 I slot print_timing: id 13 | task 294 | graphs reused = 1
1.17.830.167 I slot print_timing: id 13 | task 294 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.17.830.179 I statistics draft-mtp: #calls(b,g,a) = 94 291 4485, #gen drafts = 4500, #acc drafts = 3181, #gen tokens = 8975, #acc tokens = 5952, #mean acc len = 2.33, #acc rate/pos = (0.709, 0.618), dur(b,g,a) = 0.074, 960.504, 1577.642 ms
1.17.830.201 I slot release: id 13 | task 294 | stop processing: n_tokens = 156, truncated = 0
1.17.838.482 I srv operator(): Chat format: peg-native
1.17.843.486 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.17.843.552 I slot launch_slot_: id 13 | task 386 | processing task, is_child = 0
1.17.847.285 W slot operator(): id 13 | task 386 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.847.306 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.981.286 I slot print_timing: id 12 | task 324 | prompt eval time = 122.84 ms / 28 tokens ( 4.39 ms per token, 227.94 tokens per second)
1.17.981.289 I slot print_timing: id 12 | task 324 | eval time = 6198.82 ms / 125 tokens ( 49.59 ms per token, 20.17 tokens per second)
1.17.981.289 I slot print_timing: id 12 | task 324 | total time = 6321.65 ms / 153 tokens
1.17.981.290 I slot print_timing: id 12 | task 324 | graphs reused = 1
1.17.981.293 I slot print_timing: id 12 | task 324 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.17.981.304 I statistics draft-mtp: #calls(b,g,a) = 95 292 4513, #gen drafts = 4515, #acc drafts = 3202, #gen tokens = 9005, #acc tokens = 5991, #mean acc len = 2.33, #acc rate/pos = (0.710, 0.618), dur(b,g,a) = 0.075, 964.158, 1587.454 ms
1.17.981.332 I slot release: id 12 | task 324 | stop processing: n_tokens = 152, truncated = 0
1.17.989.301 I srv operator(): Chat format: peg-native
1.18.102.014 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.18.102.082 I slot launch_slot_: id 12 | task 389 | processing task, is_child = 0
1.18.105.944 W slot operator(): id 12 | task 389 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.18.105.967 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.234.180 I slot print_timing: id 6 | task 338 | n_decoded = 101, tg = 20.08 t/s, tg_3s = 20.08 t/s
1.18.486.332 I slot print_timing: id 7 | task 345 | n_decoded = 102, tg = 22.59 t/s, tg_3s = 22.59 t/s
1.18.735.537 I slot print_timing: id 3 | task 322 | n_decoded = 100, tg = 14.10 t/s, tg_3s = 14.10 t/s
1.19.117.156 I slot print_timing: id 7 | task 345 | prompt eval time = 122.87 ms / 25 tokens ( 4.91 ms per token, 203.46 tokens per second)
1.19.117.160 I slot print_timing: id 7 | task 345 | eval time = 5146.37 ms / 114 tokens ( 45.14 ms per token, 22.15 tokens per second)
1.19.117.161 I slot print_timing: id 7 | task 345 | total time = 5269.24 ms / 139 tokens
1.19.117.162 I slot print_timing: id 7 | task 345 | graphs reused = 1
1.19.117.166 I slot print_timing: id 7 | task 345 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.19.117.179 I statistics draft-mtp: #calls(b,g,a) = 96 301 4649, #gen drafts = 4657, #acc drafts = 3296, #gen tokens = 9289, #acc tokens = 6166, #mean acc len = 2.33, #acc rate/pos = (0.709, 0.617), dur(b,g,a) = 0.076, 991.169, 1634.971 ms
1.19.117.205 I slot release: id 7 | task 345 | stop processing: n_tokens = 140, truncated = 0
1.19.125.354 I srv operator(): Chat format: peg-native
1.19.243.291 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.19.243.355 I slot launch_slot_: id 7 | task 399 | processing task, is_child = 0
1.19.248.224 W slot operator(): id 7 | task 399 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.248.258 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.19.377.534 I slot print_timing: id 6 | task 338 | prompt eval time = 122.75 ms / 28 tokens ( 4.38 ms per token, 228.10 tokens per second)
1.19.377.538 I slot print_timing: id 6 | task 338 | eval time = 6173.49 ms / 125 tokens ( 49.39 ms per token, 20.25 tokens per second)
1.19.377.538 I slot print_timing: id 6 | task 338 | total time = 6296.24 ms / 153 tokens
1.19.377.539 I slot print_timing: id 6 | task 338 | graphs reused = 1
1.19.377.543 I slot print_timing: id 6 | task 338 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.19.377.556 I statistics draft-mtp: #calls(b,g,a) = 97 303 4679, #gen drafts = 4687, #acc drafts = 3315, #gen tokens = 9349, #acc tokens = 6200, #mean acc len = 2.33, #acc rate/pos = (0.708, 0.617), dur(b,g,a) = 0.077, 1000.764, 1645.366 ms
1.19.377.587 I slot release: id 6 | task 338 | stop processing: n_tokens = 152, truncated = 0
1.19.385.777 I srv operator(): Chat format: peg-native
1.19.493.647 I slot print_timing: id 4 | task 356 | n_decoded = 102, tg = 22.73 t/s, tg_3s = 22.73 t/s
1.19.502.637 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.19.502.711 I slot launch_slot_: id 6 | task 402 | processing task, is_child = 0
1.19.507.636 W slot operator(): id 6 | task 402 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.507.656 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.19.629.102 I slot print_timing: id 1 | task 311 | prompt eval time = 121.99 ms / 29 tokens ( 4.21 ms per token, 237.73 tokens per second)
1.19.629.105 I slot print_timing: id 1 | task 311 | eval time = 9020.45 ms / 128 tokens ( 70.47 ms per token, 14.19 tokens per second)
1.19.629.106 I slot print_timing: id 1 | task 311 | total time = 9142.43 ms / 157 tokens
1.19.629.107 I slot print_timing: id 1 | task 311 | graphs reused = 1
1.19.629.110 I slot print_timing: id 1 | task 311 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.19.629.129 I statistics draft-mtp: #calls(b,g,a) = 97 305 4702, #gen drafts = 4716, #acc drafts = 3331, #gen tokens = 9406, #acc tokens = 6231, #mean acc len = 2.33, #acc rate/pos = (0.708, 0.617), dur(b,g,a) = 0.077, 1009.846, 1653.338 ms
1.19.629.164 I slot release: id 1 | task 311 | stop processing: n_tokens = 156, truncated = 0
1.19.630.597 I slot print_timing: id 0 | task 334 | n_decoded = 100, tg = 14.67 t/s, tg_3s = 14.67 t/s
1.19.638.412 I srv operator(): Chat format: peg-native
1.19.641.564 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.19.641.629 I slot launch_slot_: id 1 | task 404 | processing task, is_child = 0
1.19.645.254 W slot operator(): id 1 | task 404 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.645.286 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.19.770.169 I slot print_timing: id 2 | task 353 | n_decoded = 101, tg = 20.11 t/s, tg_3s = 20.11 t/s
1.20.150.799 I slot print_timing: id 4 | task 356 | prompt eval time = 121.05 ms / 25 tokens ( 4.84 ms per token, 206.52 tokens per second)
1.20.150.802 I slot print_timing: id 4 | task 356 | eval time = 5145.02 ms / 114 tokens ( 45.13 ms per token, 22.16 tokens per second)
1.20.150.803 I slot print_timing: id 4 | task 356 | total time = 5266.07 ms / 139 tokens
1.20.150.804 I slot print_timing: id 4 | task 356 | graphs reused = 1
1.20.150.807 I slot print_timing: id 4 | task 356 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.20.150.820 I statistics draft-mtp: #calls(b,g,a) = 99 309 4768, #gen drafts = 4779, #acc drafts = 3379, #gen tokens = 9532, #acc tokens = 6321, #mean acc len = 2.33, #acc rate/pos = (0.709, 0.617), dur(b,g,a) = 0.079, 1021.741, 1676.897 ms
1.20.150.848 I slot release: id 4 | task 356 | stop processing: n_tokens = 140, truncated = 0
1.20.159.467 I srv operator(): Chat format: peg-native
1.20.279.441 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.20.279.508 I slot launch_slot_: id 4 | task 409 | processing task, is_child = 0
1.20.283.693 W slot operator(): id 4 | task 409 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.283.728 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.415.119 I slot print_timing: id 11 | task 361 | n_decoded = 101, tg = 20.14 t/s, tg_3s = 20.14 t/s
1.20.906.564 I slot print_timing: id 3 | task 322 | prompt eval time = 116.59 ms / 29 tokens ( 4.02 ms per token, 248.73 tokens per second)
1.20.906.567 I slot print_timing: id 3 | task 322 | eval time = 9262.40 ms / 128 tokens ( 72.36 ms per token, 13.82 tokens per second)
1.20.906.568 I slot print_timing: id 3 | task 322 | total time = 9378.99 ms / 157 tokens
1.20.906.569 I slot print_timing: id 3 | task 322 | graphs reused = 1
1.20.906.572 I slot print_timing: id 3 | task 322 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.20.906.588 I statistics draft-mtp: #calls(b,g,a) = 100 315 4857, #gen drafts = 4872, #acc drafts = 3439, #gen tokens = 9717, #acc tokens = 6434, #mean acc len = 2.32, #acc rate/pos = (0.708, 0.617), dur(b,g,a) = 0.080, 1042.142, 1708.092 ms
1.20.906.620 I slot release: id 3 | task 322 | stop processing: n_tokens = 156, truncated = 0
1.20.909.911 I slot print_timing: id 2 | task 353 | prompt eval time = 123.28 ms / 28 tokens ( 4.40 ms per token, 227.13 tokens per second)
1.20.909.913 I slot print_timing: id 2 | task 353 | eval time = 6162.15 ms / 125 tokens ( 49.30 ms per token, 20.29 tokens per second)
1.20.909.914 I slot print_timing: id 2 | task 353 | total time = 6285.43 ms / 153 tokens
1.20.909.914 I slot print_timing: id 2 | task 353 | graphs reused = 1
1.20.909.917 I slot print_timing: id 2 | task 353 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.20.909.925 I statistics draft-mtp: #calls(b,g,a) = 100 315 4860, #gen drafts = 4872, #acc drafts = 3442, #gen tokens = 9717, #acc tokens = 6440, #mean acc len = 2.33, #acc rate/pos = (0.708, 0.617), dur(b,g,a) = 0.080, 1042.142, 1709.410 ms
1.20.909.949 I slot release: id 2 | task 353 | stop processing: n_tokens = 152, truncated = 0
1.20.915.448 I srv operator(): Chat format: peg-native
1.20.919.349 I srv operator(): Chat format: peg-native
1.20.919.792 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.20.919.847 I slot launch_slot_: id 3 | task 416 | processing task, is_child = 0
1.20.919.849 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.20.919.867 I slot launch_slot_: id 2 | task 417 | processing task, is_child = 0
1.20.923.504 W slot operator(): id 2 | task 417 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.923.534 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.923.573 W slot operator(): id 3 | task 416 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.923.589 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.067.229 I slot print_timing: id 8 | task 348 | n_decoded = 100, tg = 14.63 t/s, tg_3s = 14.63 t/s
1.21.194.757 I slot print_timing: id 9 | task 372 | n_decoded = 102, tg = 22.54 t/s, tg_3s = 22.54 t/s
1.21.576.160 I slot print_timing: id 11 | task 361 | prompt eval time = 123.05 ms / 28 tokens ( 4.39 ms per token, 227.56 tokens per second)
1.21.576.163 I slot print_timing: id 11 | task 361 | eval time = 6175.95 ms / 125 tokens ( 49.41 ms per token, 20.24 tokens per second)
1.21.576.163 I slot print_timing: id 11 | task 361 | total time = 6299.00 ms / 153 tokens
1.21.576.164 I slot print_timing: id 11 | task 361 | graphs reused = 1
1.21.576.167 I slot print_timing: id 11 | task 361 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.21.576.178 I statistics draft-mtp: #calls(b,g,a) = 102 320 4946, #gen drafts = 4950, #acc drafts = 3505, #gen tokens = 9873, #acc tokens = 6558, #mean acc len = 2.33, #acc rate/pos = (0.709, 0.617), dur(b,g,a) = 0.082, 1056.859, 1740.043 ms
1.21.576.204 I slot release: id 11 | task 361 | stop processing: n_tokens = 152, truncated = 0
1.21.585.066 I srv operator(): Chat format: peg-native
1.21.696.999 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.020
1.21.697.070 I slot launch_slot_: id 11 | task 424 | processing task, is_child = 0
1.21.701.148 W slot operator(): id 11 | task 424 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.21.701.182 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.821.982 I slot print_timing: id 0 | task 334 | prompt eval time = 123.64 ms / 29 tokens ( 4.26 ms per token, 234.56 tokens per second)
1.21.821.985 I slot print_timing: id 0 | task 334 | eval time = 9008.65 ms / 128 tokens ( 70.38 ms per token, 14.21 tokens per second)
1.21.821.986 I slot print_timing: id 0 | task 334 | total time = 9132.28 ms / 157 tokens
1.21.821.987 I slot print_timing: id 0 | task 334 | graphs reused = 1
1.21.821.990 I slot print_timing: id 0 | task 334 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.21.822.007 I statistics draft-mtp: #calls(b,g,a) = 102 322 4965, #gen drafts = 4979, #acc drafts = 3516, #gen tokens = 9930, #acc tokens = 6578, #mean acc len = 2.32, #acc rate/pos = (0.708, 0.617), dur(b,g,a) = 0.082, 1064.942, 1746.569 ms
1.21.822.034 I slot release: id 0 | task 334 | stop processing: n_tokens = 156, truncated = 0
1.21.829.587 I slot print_timing: id 9 | task 372 | prompt eval time = 122.74 ms / 25 tokens ( 4.91 ms per token, 203.69 tokens per second)
1.21.829.590 I slot print_timing: id 9 | task 372 | eval time = 5159.14 ms / 114 tokens ( 45.26 ms per token, 22.10 tokens per second)
1.21.829.590 I slot print_timing: id 9 | task 372 | total time = 5281.88 ms / 139 tokens
1.21.829.591 I slot print_timing: id 9 | task 372 | graphs reused = 1
1.21.829.594 I slot print_timing: id 9 | task 372 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.21.829.603 I statistics draft-mtp: #calls(b,g,a) = 103 322 4974, #gen drafts = 4979, #acc drafts = 3521, #gen tokens = 9930, #acc tokens = 6587, #mean acc len = 2.32, #acc rate/pos = (0.708, 0.616), dur(b,g,a) = 0.082, 1064.942, 1749.729 ms
1.21.829.629 I slot release: id 9 | task 372 | stop processing: n_tokens = 140, truncated = 0
1.21.830.715 I srv operator(): Chat format: peg-native
1.21.833.557 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.21.833.601 I slot launch_slot_: id 0 | task 426 | processing task, is_child = 0
1.21.838.317 W slot operator(): id 0 | task 426 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.21.838.340 I srv operator(): Chat format: peg-native
1.21.838.345 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.966.677 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.021
1.21.966.750 I slot launch_slot_: id 9 | task 428 | processing task, is_child = 0
1.21.971.088 W slot operator(): id 9 | task 428 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.21.971.114 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.22.226.180 I slot print_timing: id 5 | task 378 | n_decoded = 101, tg = 20.08 t/s, tg_3s = 20.08 t/s
1.22.230.906 I slot print_timing: id 10 | task 383 | n_decoded = 102, tg = 22.54 t/s, tg_3s = 22.54 t/s
1.22.362.830 I slot print_timing: id 15 | task 359 | n_decoded = 100, tg = 14.08 t/s, tg_3s = 14.08 t/s
1.22.861.486 I slot print_timing: id 10 | task 383 | prompt eval time = 121.20 ms / 25 tokens ( 4.85 ms per token, 206.27 tokens per second)
1.22.861.489 I slot print_timing: id 10 | task 383 | eval time = 5154.96 ms / 114 tokens ( 45.22 ms per token, 22.11 tokens per second)
1.22.861.489 I slot print_timing: id 10 | task 383 | total time = 5276.16 ms / 139 tokens
1.22.861.491 I slot print_timing: id 10 | task 383 | graphs reused = 1
1.22.861.494 I slot print_timing: id 10 | task 383 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.22.861.509 I statistics draft-mtp: #calls(b,g,a) = 105 330 5099, #gen drafts = 5104, #acc drafts = 3612, #gen tokens = 10180, #acc tokens = 6758, #mean acc len = 2.33, #acc rate/pos = (0.708, 0.617), dur(b,g,a) = 0.084, 1090.557, 1794.270 ms
1.22.861.536 I slot release: id 10 | task 383 | stop processing: n_tokens = 140, truncated = 0
1.22.870.273 I srv operator(): Chat format: peg-native
1.22.986.116 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.22.986.183 I slot launch_slot_: id 10 | task 437 | processing task, is_child = 0
1.22.990.392 W slot operator(): id 10 | task 437 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.22.990.420 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.237.223 I slot print_timing: id 8 | task 348 | prompt eval time = 123.25 ms / 29 tokens ( 4.25 ms per token, 235.30 tokens per second)
1.23.237.227 I slot print_timing: id 8 | task 348 | eval time = 9005.07 ms / 128 tokens ( 70.35 ms per token, 14.21 tokens per second)
1.23.237.228 I slot print_timing: id 8 | task 348 | total time = 9128.32 ms / 157 tokens
1.23.237.229 I slot print_timing: id 8 | task 348 | graphs reused = 1
1.23.237.232 I slot print_timing: id 8 | task 348 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.23.237.252 I statistics draft-mtp: #calls(b,g,a) = 106 333 5134, #gen drafts = 5149, #acc drafts = 3633, #gen tokens = 10269, #acc tokens = 6799, #mean acc len = 2.32, #acc rate/pos = (0.708, 0.617), dur(b,g,a) = 0.085, 1103.587, 1806.423 ms
1.23.237.282 I slot release: id 8 | task 348 | stop processing: n_tokens = 156, truncated = 0
1.23.246.225 I srv operator(): Chat format: peg-native
1.23.247.570 I slot print_timing: id 12 | task 389 | n_decoded = 101, tg = 20.12 t/s, tg_3s = 20.12 t/s
1.23.249.671 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.23.249.738 I slot launch_slot_: id 8 | task 440 | processing task, is_child = 0
1.23.254.654 W slot operator(): id 8 | task 440 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.254.682 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.382.827 I slot print_timing: id 5 | task 378 | prompt eval time = 137.24 ms / 28 tokens ( 4.90 ms per token, 204.02 tokens per second)
1.23.382.829 I slot print_timing: id 5 | task 378 | eval time = 6186.03 ms / 125 tokens ( 49.49 ms per token, 20.21 tokens per second)
1.23.382.829 I slot print_timing: id 5 | task 378 | total time = 6323.28 ms / 153 tokens
1.23.382.830 I slot print_timing: id 5 | task 378 | graphs reused = 1
1.23.382.833 I slot print_timing: id 5 | task 378 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.23.382.845 I statistics draft-mtp: #calls(b,g,a) = 107 334 5155, #gen drafts = 5164, #acc drafts = 3647, #gen tokens = 10299, #acc tokens = 6825, #mean acc len = 2.32, #acc rate/pos = (0.707, 0.616), dur(b,g,a) = 0.086, 1108.417, 1813.886 ms
1.23.382.871 I slot release: id 5 | task 378 | stop processing: n_tokens = 152, truncated = 0
1.23.391.158 I srv operator(): Chat format: peg-native
1.23.509.709 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.23.509.772 I slot launch_slot_: id 5 | task 443 | processing task, is_child = 0
1.23.513.951 W slot operator(): id 5 | task 443 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.513.979 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.896.344 I slot print_timing: id 7 | task 399 | n_decoded = 102, tg = 22.54 t/s, tg_3s = 22.54 t/s
1.24.281.676 I slot print_timing: id 14 | task 377 | n_decoded = 100, tg = 14.12 t/s, tg_3s = 14.12 t/s
1.24.405.358 I slot print_timing: id 12 | task 389 | prompt eval time = 122.39 ms / 28 tokens ( 4.37 ms per token, 228.77 tokens per second)
1.24.405.361 I slot print_timing: id 12 | task 389 | eval time = 6176.97 ms / 125 tokens ( 49.42 ms per token, 20.24 tokens per second)
1.24.405.361 I slot print_timing: id 12 | task 389 | total time = 6299.36 ms / 153 tokens
1.24.405.362 I slot print_timing: id 12 | task 389 | graphs reused = 1
1.24.405.365 I slot print_timing: id 12 | task 389 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.24.405.377 I statistics draft-mtp: #calls(b,g,a) = 108 342 5287, #gen drafts = 5290, #acc drafts = 3741, #gen tokens = 10550, #acc tokens = 7001, #mean acc len = 2.32, #acc rate/pos = (0.708, 0.617), dur(b,g,a) = 0.087, 1133.328, 1860.639 ms
1.24.405.409 I slot release: id 12 | task 389 | stop processing: n_tokens = 152, truncated = 0
1.24.414.120 I srv operator(): Chat format: peg-native
1.24.512.316 I slot print_timing: id 15 | task 359 | prompt eval time = 116.14 ms / 29 tokens ( 4.00 ms per token, 249.69 tokens per second)
1.24.512.320 I slot print_timing: id 15 | task 359 | eval time = 9250.92 ms / 128 tokens ( 72.27 ms per token, 13.84 tokens per second)
1.24.512.321 I slot print_timing: id 15 | task 359 | total time = 9367.06 ms / 157 tokens
1.24.512.322 I slot print_timing: id 15 | task 359 | graphs reused = 1
1.24.512.325 I slot print_timing: id 15 | task 359 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.24.512.338 I statistics draft-mtp: #calls(b,g,a) = 108 343 5290, #gen drafts = 5304, #acc drafts = 3742, #gen tokens = 10578, #acc tokens = 7002, #mean acc len = 2.32, #acc rate/pos = (0.707, 0.616), dur(b,g,a) = 0.087, 1136.883, 1861.580 ms
1.24.512.364 I slot release: id 15 | task 359 | stop processing: n_tokens = 156, truncated = 0
1.24.519.607 I slot print_timing: id 7 | task 399 | prompt eval time = 122.77 ms / 25 tokens ( 4.91 ms per token, 203.64 tokens per second)
1.24.519.610 I slot print_timing: id 7 | task 399 | eval time = 5148.60 ms / 114 tokens ( 45.16 ms per token, 22.14 tokens per second)
1.24.519.610 I slot print_timing: id 7 | task 399 | total time = 5271.36 ms / 139 tokens
1.24.519.611 I slot print_timing: id 7 | task 399 | graphs reused = 1
1.24.519.614 I slot print_timing: id 7 | task 399 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.24.519.625 I statistics draft-mtp: #calls(b,g,a) = 108 343 5298, #gen drafts = 5304, #acc drafts = 3748, #gen tokens = 10578, #acc tokens = 7014, #mean acc len = 2.32, #acc rate/pos = (0.707, 0.616), dur(b,g,a) = 0.087, 1136.883, 1864.490 ms
1.24.519.648 I slot release: id 7 | task 399 | stop processing: n_tokens = 140, truncated = 0
1.24.521.565 I srv operator(): Chat format: peg-native
1.24.524.562 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.24.524.622 I slot launch_slot_: id 7 | task 452 | processing task, is_child = 0
1.24.524.624 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.24.524.640 I slot launch_slot_: id 15 | task 453 | processing task, is_child = 0
1.24.527.956 I srv operator(): Chat format: peg-native
1.24.529.827 W slot operator(): id 7 | task 452 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.529.860 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.529.898 W slot operator(): id 15 | task 453 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.529.933 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.670.597 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.24.670.663 I slot launch_slot_: id 12 | task 455 | processing task, is_child = 0
1.24.674.592 W slot operator(): id 12 | task 455 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.674.613 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.799.420 I slot print_timing: id 1 | task 404 | n_decoded = 101, tg = 20.07 t/s, tg_3s = 20.07 t/s
1.24.926.230 I slot print_timing: id 4 | task 409 | n_decoded = 102, tg = 22.57 t/s, tg_3s = 22.57 t/s
1.25.059.197 I slot print_timing: id 13 | task 386 | n_decoded = 100, tg = 14.11 t/s, tg_3s = 14.11 t/s
1.25.557.790 I slot print_timing: id 4 | task 409 | prompt eval time = 122.36 ms / 25 tokens ( 4.89 ms per token, 204.32 tokens per second)
1.25.557.793 I slot print_timing: id 4 | task 409 | eval time = 5151.72 ms / 114 tokens ( 45.19 ms per token, 22.13 tokens per second)
1.25.557.793 I slot print_timing: id 4 | task 409 | total time = 5274.07 ms / 139 tokens
1.25.557.794 I slot print_timing: id 4 | task 409 | graphs reused = 1
1.25.557.797 I slot print_timing: id 4 | task 409 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.25.557.807 I statistics draft-mtp: #calls(b,g,a) = 111 351 5417, #gen drafts = 5428, #acc drafts = 3833, #gen tokens = 10826, #acc tokens = 7171, #mean acc len = 2.32, #acc rate/pos = (0.708, 0.616), dur(b,g,a) = 0.088, 1162.536, 1906.631 ms
1.25.557.831 I slot release: id 4 | task 409 | stop processing: n_tokens = 140, truncated = 0
1.25.569.257 I srv operator(): Chat format: peg-native
1.25.687.711 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.25.687.777 I slot launch_slot_: id 4 | task 464 | processing task, is_child = 0
1.25.691.919 W slot operator(): id 4 | task 464 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.25.691.948 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.25.940.176 I slot print_timing: id 1 | task 404 | prompt eval time = 122.89 ms / 28 tokens ( 4.39 ms per token, 227.85 tokens per second)
1.25.940.180 I slot print_timing: id 1 | task 404 | eval time = 6171.98 ms / 125 tokens ( 49.38 ms per token, 20.25 tokens per second)
1.25.940.181 I slot print_timing: id 1 | task 404 | total time = 6294.87 ms / 153 tokens
1.25.940.182 I slot print_timing: id 1 | task 404 | graphs reused = 1
1.25.940.185 I slot print_timing: id 1 | task 404 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.25.940.200 I statistics draft-mtp: #calls(b,g,a) = 112 354 5460, #gen drafts = 5474, #acc drafts = 3856, #gen tokens = 10918, #acc tokens = 7215, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.088, 1173.496, 1921.853 ms
1.25.940.231 I slot release: id 1 | task 404 | stop processing: n_tokens = 152, truncated = 0
1.25.948.696 I srv operator(): Chat format: peg-native
1.25.951.829 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.25.951.893 I slot launch_slot_: id 1 | task 467 | processing task, is_child = 0
1.25.955.530 W slot operator(): id 1 | task 467 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.25.955.567 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.26.081.513 I slot print_timing: id 2 | task 417 | n_decoded = 101, tg = 20.12 t/s, tg_3s = 20.12 t/s
1.26.343.393 I slot print_timing: id 11 | task 424 | n_decoded = 102, tg = 22.56 t/s, tg_3s = 22.56 t/s
1.26.457.978 I slot print_timing: id 14 | task 377 | prompt eval time = 137.45 ms / 29 tokens ( 4.74 ms per token, 210.99 tokens per second)
1.26.457.981 I slot print_timing: id 14 | task 377 | eval time = 9260.91 ms / 128 tokens ( 72.35 ms per token, 13.82 tokens per second)
1.26.457.982 I slot print_timing: id 14 | task 377 | total time = 9398.36 ms / 157 tokens
1.26.457.982 I slot print_timing: id 14 | task 377 | graphs reused = 1
1.26.457.985 I slot print_timing: id 14 | task 377 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.26.457.998 I statistics draft-mtp: #calls(b,g,a) = 113 358 5521, #gen drafts = 5536, #acc drafts = 3904, #gen tokens = 11041, #acc tokens = 7304, #mean acc len = 2.32, #acc rate/pos = (0.707, 0.616), dur(b,g,a) = 0.090, 1186.231, 1943.254 ms
1.26.458.026 I slot release: id 14 | task 377 | stop processing: n_tokens = 156, truncated = 0
1.26.463.864 I slot print_timing: id 6 | task 402 | n_decoded = 100, tg = 14.63 t/s, tg_3s = 14.63 t/s
1.26.466.729 I srv operator(): Chat format: peg-native
1.26.470.490 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.26.470.555 I slot launch_slot_: id 14 | task 472 | processing task, is_child = 0
1.26.474.257 W slot operator(): id 14 | task 472 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.26.474.292 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.26.985.593 I slot print_timing: id 11 | task 424 | prompt eval time = 121.16 ms / 25 tokens ( 4.85 ms per token, 206.33 tokens per second)
1.26.985.595 I slot print_timing: id 11 | task 424 | eval time = 5163.26 ms / 114 tokens ( 45.29 ms per token, 22.08 tokens per second)
1.26.985.596 I slot print_timing: id 11 | task 424 | total time = 5284.42 ms / 139 tokens
1.26.985.596 I slot print_timing: id 11 | task 424 | graphs reused = 1
1.26.985.599 I slot print_timing: id 11 | task 424 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.26.985.610 I statistics draft-mtp: #calls(b,g,a) = 114 362 5595, #gen drafts = 5599, #acc drafts = 3952, #gen tokens = 11167, #acc tokens = 7396, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.616), dur(b,g,a) = 0.091, 1198.229, 1969.143 ms
1.26.985.638 I slot release: id 11 | task 424 | stop processing: n_tokens = 140, truncated = 0
1.26.994.926 I srv operator(): Chat format: peg-native
1.27.104.072 I slot print_timing: id 9 | task 428 | n_decoded = 101, tg = 20.16 t/s, tg_3s = 20.16 t/s
1.27.107.963 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.27.108.024 I slot launch_slot_: id 11 | task 478 | processing task, is_child = 0
1.27.112.561 W slot operator(): id 11 | task 478 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.112.592 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.233.383 I slot print_timing: id 13 | task 386 | prompt eval time = 123.14 ms / 29 tokens ( 4.25 ms per token, 235.49 tokens per second)
1.27.233.386 I slot print_timing: id 13 | task 386 | eval time = 9262.93 ms / 128 tokens ( 72.37 ms per token, 13.82 tokens per second)
1.27.233.386 I slot print_timing: id 13 | task 386 | total time = 9386.08 ms / 157 tokens
1.27.233.387 I slot print_timing: id 13 | task 386 | graphs reused = 1
1.27.233.390 I slot print_timing: id 13 | task 386 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.27.233.404 I statistics draft-mtp: #calls(b,g,a) = 115 364 5614, #gen drafts = 5628, #acc drafts = 3965, #gen tokens = 11224, #acc tokens = 7420, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.091, 1206.814, 1975.686 ms
1.27.233.433 I slot release: id 13 | task 386 | stop processing: n_tokens = 156, truncated = 0
1.27.235.824 I slot print_timing: id 2 | task 417 | prompt eval time = 136.90 ms / 28 tokens ( 4.89 ms per token, 204.53 tokens per second)
1.27.235.827 I slot print_timing: id 2 | task 417 | eval time = 6175.38 ms / 125 tokens ( 49.40 ms per token, 20.24 tokens per second)
1.27.235.827 I slot print_timing: id 2 | task 417 | total time = 6312.28 ms / 153 tokens
1.27.235.828 I slot print_timing: id 2 | task 417 | graphs reused = 1
1.27.235.830 I slot print_timing: id 2 | task 417 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.27.235.837 I statistics draft-mtp: #calls(b,g,a) = 115 364 5617, #gen drafts = 5628, #acc drafts = 3966, #gen tokens = 11224, #acc tokens = 7422, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.091, 1206.814, 1976.766 ms
1.27.235.864 I slot release: id 2 | task 417 | stop processing: n_tokens = 152, truncated = 0
1.27.242.392 I srv operator(): Chat format: peg-native
1.27.244.541 I srv operator(): Chat format: peg-native
1.27.244.645 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.27.244.712 I slot launch_slot_: id 13 | task 480 | processing task, is_child = 0
1.27.244.715 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.27.244.733 I slot launch_slot_: id 2 | task 481 | processing task, is_child = 0
1.27.249.313 W slot operator(): id 2 | task 481 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.249.344 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.249.376 W slot operator(): id 13 | task 480 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.249.403 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.647.982 I slot print_timing: id 10 | task 437 | n_decoded = 102, tg = 22.49 t/s, tg_3s = 22.49 t/s
1.28.148.977 I slot print_timing: id 3 | task 416 | n_decoded = 100, tg = 14.11 t/s, tg_3s = 14.11 t/s
1.28.280.011 I slot print_timing: id 9 | task 428 | prompt eval time = 123.21 ms / 28 tokens ( 4.40 ms per token, 227.25 tokens per second)
1.28.280.014 I slot print_timing: id 9 | task 428 | eval time = 6185.66 ms / 125 tokens ( 49.49 ms per token, 20.21 tokens per second)
1.28.280.014 I slot print_timing: id 9 | task 428 | total time = 6308.88 ms / 153 tokens
1.28.280.015 I slot print_timing: id 9 | task 428 | graphs reused = 1
1.28.280.018 I slot print_timing: id 9 | task 428 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.28.280.034 I statistics draft-mtp: #calls(b,g,a) = 117 372 5748, #gen drafts = 5754, #acc drafts = 4061, #gen tokens = 11476, #acc tokens = 7599, #mean acc len = 2.32, #acc rate/pos = (0.707, 0.616), dur(b,g,a) = 0.093, 1230.970, 2023.842 ms
1.28.280.060 I slot release: id 9 | task 428 | stop processing: n_tokens = 152, truncated = 0
1.28.281.027 I slot print_timing: id 10 | task 437 | prompt eval time = 121.25 ms / 25 tokens ( 4.85 ms per token, 206.19 tokens per second)
1.28.281.029 I slot print_timing: id 10 | task 437 | eval time = 5169.37 ms / 114 tokens ( 45.35 ms per token, 22.05 tokens per second)
1.28.281.029 I slot print_timing: id 10 | task 437 | total time = 5290.62 ms / 139 tokens
1.28.281.030 I slot print_timing: id 10 | task 437 | graphs reused = 1
1.28.281.031 I slot print_timing: id 10 | task 437 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.28.281.037 I statistics draft-mtp: #calls(b,g,a) = 117 372 5749, #gen drafts = 5754, #acc drafts = 4062, #gen tokens = 11476, #acc tokens = 7601, #mean acc len = 2.32, #acc rate/pos = (0.707, 0.616), dur(b,g,a) = 0.093, 1230.970, 2024.207 ms
1.28.281.056 I slot release: id 10 | task 437 | stop processing: n_tokens = 140, truncated = 0
1.28.289.464 I srv operator(): Chat format: peg-native
1.28.289.718 I srv operator(): Chat format: peg-native
1.28.396.568 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.28.396.631 I slot launch_slot_: id 10 | task 491 | processing task, is_child = 0
1.28.396.634 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.28.396.650 I slot launch_slot_: id 9 | task 492 | processing task, is_child = 0
1.28.400.731 W slot operator(): id 9 | task 492 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.400.762 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.28.400.794 W slot operator(): id 10 | task 491 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.400.827 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.28.660.462 I slot print_timing: id 6 | task 402 | prompt eval time = 121.82 ms / 29 tokens ( 4.20 ms per token, 238.06 tokens per second)
1.28.660.465 I slot print_timing: id 6 | task 402 | eval time = 9030.98 ms / 128 tokens ( 70.55 ms per token, 14.17 tokens per second)
1.28.660.466 I slot print_timing: id 6 | task 402 | total time = 9152.80 ms / 157 tokens
1.28.660.466 I slot print_timing: id 6 | task 402 | graphs reused = 1
1.28.660.469 I slot print_timing: id 6 | task 402 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.28.660.483 I statistics draft-mtp: #calls(b,g,a) = 119 375 5782, #gen drafts = 5797, #acc drafts = 4083, #gen tokens = 11561, #acc tokens = 7642, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.616), dur(b,g,a) = 0.094, 1243.161, 2035.674 ms
1.28.660.509 I slot release: id 6 | task 402 | stop processing: n_tokens = 156, truncated = 0
1.28.666.021 I slot print_timing: id 5 | task 443 | n_decoded = 101, tg = 20.08 t/s, tg_3s = 20.08 t/s
1.28.669.130 I srv operator(): Chat format: peg-native
1.28.672.781 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.28.672.846 I slot launch_slot_: id 6 | task 495 | processing task, is_child = 0
1.28.677.195 W slot operator(): id 6 | task 495 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.677.219 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.054.317 I slot print_timing: id 0 | task 426 | n_decoded = 100, tg = 14.09 t/s, tg_3s = 14.09 t/s
1.29.186.943 I slot print_timing: id 7 | task 452 | n_decoded = 102, tg = 22.53 t/s, tg_3s = 22.53 t/s
1.29.822.925 I slot print_timing: id 5 | task 443 | prompt eval time = 122.65 ms / 28 tokens ( 4.38 ms per token, 228.29 tokens per second)
1.29.822.928 I slot print_timing: id 5 | task 443 | eval time = 6186.28 ms / 125 tokens ( 49.49 ms per token, 20.21 tokens per second)
1.29.822.928 I slot print_timing: id 5 | task 443 | total time = 6308.94 ms / 153 tokens
1.29.822.929 I slot print_timing: id 5 | task 443 | graphs reused = 1
1.29.822.932 I slot print_timing: id 5 | task 443 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.29.822.948 I statistics draft-mtp: #calls(b,g,a) = 120 384 5930, #gen drafts = 5940, #acc drafts = 4185, #gen tokens = 11847, #acc tokens = 7832, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.096, 1269.771, 2088.207 ms
1.29.822.976 I slot release: id 5 | task 443 | stop processing: n_tokens = 152, truncated = 0
1.29.824.926 I slot print_timing: id 7 | task 452 | prompt eval time = 129.32 ms / 25 tokens ( 5.17 ms per token, 193.32 tokens per second)
1.29.824.928 I slot print_timing: id 7 | task 452 | eval time = 5165.76 ms / 114 tokens ( 45.31 ms per token, 22.07 tokens per second)
1.29.824.929 I slot print_timing: id 7 | task 452 | total time = 5295.08 ms / 139 tokens
1.29.824.929 I slot print_timing: id 7 | task 452 | graphs reused = 1
1.29.824.932 I slot print_timing: id 7 | task 452 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.29.824.939 I statistics draft-mtp: #calls(b,g,a) = 120 384 5932, #gen drafts = 5940, #acc drafts = 4187, #gen tokens = 11847, #acc tokens = 7836, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.096, 1269.771, 2088.956 ms
1.29.824.961 I slot release: id 7 | task 452 | stop processing: n_tokens = 140, truncated = 0
1.29.829.422 I slot print_timing: id 12 | task 455 | n_decoded = 101, tg = 20.07 t/s, tg_3s = 20.07 t/s
1.29.831.765 I srv operator(): Chat format: peg-native
1.29.833.888 I srv operator(): Chat format: peg-native
1.29.945.621 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.29.945.691 I slot launch_slot_: id 7 | task 505 | processing task, is_child = 0
1.29.945.694 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.29.945.711 I slot launch_slot_: id 5 | task 507 | processing task, is_child = 0
1.29.951.077 W slot operator(): id 5 | task 507 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.951.112 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.951.145 W slot operator(): id 7 | task 505 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.951.177 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.30.336.549 I slot print_timing: id 3 | task 416 | prompt eval time = 137.12 ms / 29 tokens ( 4.73 ms per token, 211.50 tokens per second)
1.30.336.553 I slot print_timing: id 3 | task 416 | eval time = 9275.83 ms / 128 tokens ( 72.47 ms per token, 13.80 tokens per second)
1.30.336.553 I slot print_timing: id 3 | task 416 | total time = 9412.94 ms / 157 tokens
1.30.336.554 I slot print_timing: id 3 | task 416 | graphs reused = 1
1.30.336.558 I slot print_timing: id 3 | task 416 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.30.336.571 I statistics draft-mtp: #calls(b,g,a) = 122 388 5984, #gen drafts = 5999, #acc drafts = 4225, #gen tokens = 11964, #acc tokens = 7906, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.097, 1286.937, 2107.532 ms
1.30.336.597 I slot release: id 3 | task 416 | stop processing: n_tokens = 156, truncated = 0
1.30.340.020 I slot print_timing: id 4 | task 464 | n_decoded = 102, tg = 22.54 t/s, tg_3s = 22.54 t/s
1.30.345.894 I srv operator(): Chat format: peg-native
1.30.349.049 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.30.349.095 I slot launch_slot_: id 3 | task 511 | processing task, is_child = 0
1.30.352.970 W slot operator(): id 3 | task 511 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.30.352.991 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.30.482.307 I slot print_timing: id 8 | task 440 | n_decoded = 100, tg = 14.08 t/s, tg_3s = 14.07 t/s
1.30.986.328 I slot print_timing: id 4 | task 464 | prompt eval time = 122.59 ms / 25 tokens ( 4.90 ms per token, 203.93 tokens per second)
1.30.986.331 I slot print_timing: id 4 | task 464 | eval time = 5171.79 ms / 114 tokens ( 45.37 ms per token, 22.04 tokens per second)
1.30.986.332 I slot print_timing: id 4 | task 464 | total time = 5294.38 ms / 139 tokens
1.30.986.332 I slot print_timing: id 4 | task 464 | graphs reused = 1
1.30.986.335 I slot print_timing: id 4 | task 464 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.30.986.349 I statistics draft-mtp: #calls(b,g,a) = 123 393 6067, #gen drafts = 6078, #acc drafts = 4280, #gen tokens = 12122, #acc tokens = 8009, #mean acc len = 2.32, #acc rate/pos = (0.705, 0.615), dur(b,g,a) = 0.099, 1302.235, 2137.477 ms
1.30.986.376 I slot release: id 4 | task 464 | stop processing: n_tokens = 140, truncated = 0
1.30.993.707 I slot print_timing: id 12 | task 455 | prompt eval time = 122.75 ms / 28 tokens ( 4.38 ms per token, 228.11 tokens per second)
1.30.993.710 I slot print_timing: id 12 | task 455 | eval time = 6196.31 ms / 125 tokens ( 49.57 ms per token, 20.17 tokens per second)
1.30.993.710 I slot print_timing: id 12 | task 455 | total time = 6319.06 ms / 153 tokens
1.30.993.711 I slot print_timing: id 12 | task 455 | graphs reused = 1
1.30.993.714 I slot print_timing: id 12 | task 455 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.30.993.723 I statistics draft-mtp: #calls(b,g,a) = 123 393 6075, #gen drafts = 6078, #acc drafts = 4287, #gen tokens = 12122, #acc tokens = 8023, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.099, 1302.235, 2140.319 ms
1.30.993.746 I slot release: id 12 | task 455 | stop processing: n_tokens = 152, truncated = 0
1.30.994.817 I srv operator(): Chat format: peg-native
1.30.995.973 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.30.996.035 I slot launch_slot_: id 4 | task 517 | processing task, is_child = 0
1.31.001.474 W slot operator(): id 4 | task 517 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.31.001.506 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.31.001.929 I srv operator(): Chat format: peg-native
1.31.126.897 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.31.126.959 I slot launch_slot_: id 12 | task 519 | processing task, is_child = 0
1.31.130.768 W slot operator(): id 12 | task 519 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.31.130.801 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.31.251.262 I slot print_timing: id 0 | task 426 | prompt eval time = 116.54 ms / 29 tokens ( 4.02 ms per token, 248.84 tokens per second)
1.31.251.266 I slot print_timing: id 0 | task 426 | eval time = 9296.38 ms / 128 tokens ( 72.63 ms per token, 13.77 tokens per second)
1.31.251.267 I slot print_timing: id 0 | task 426 | total time = 9412.92 ms / 157 tokens
1.31.251.267 I slot print_timing: id 0 | task 426 | graphs reused = 1
1.31.251.270 I slot print_timing: id 0 | task 426 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.31.251.285 I statistics draft-mtp: #calls(b,g,a) = 124 395 6092, #gen drafts = 6106, #acc drafts = 4295, #gen tokens = 12177, #acc tokens = 8038, #mean acc len = 2.32, #acc rate/pos = (0.705, 0.614), dur(b,g,a) = 0.100, 1311.314, 2146.036 ms
1.31.251.312 I slot release: id 0 | task 426 | stop processing: n_tokens = 156, truncated = 0
1.31.260.527 I srv operator(): Chat format: peg-native
1.31.263.998 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.31.264.060 I slot launch_slot_: id 0 | task 521 | processing task, is_child = 0
1.31.266.879 W slot operator(): id 0 | task 521 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.31.266.908 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.31.657.760 I slot print_timing: id 14 | task 472 | n_decoded = 101, tg = 19.96 t/s, tg_3s = 19.96 t/s
1.31.784.094 I slot print_timing: id 11 | task 478 | n_decoded = 102, tg = 22.41 t/s, tg_3s = 22.41 t/s
1.31.787.567 I slot print_timing: id 15 | task 453 | n_decoded = 100, tg = 14.03 t/s, tg_3s = 14.03 t/s
1.32.407.565 I slot print_timing: id 2 | task 481 | n_decoded = 101, tg = 20.11 t/s, tg_3s = 20.11 t/s
1.32.415.396 I slot print_timing: id 11 | task 478 | prompt eval time = 120.59 ms / 25 tokens ( 4.82 ms per token, 207.31 tokens per second)
1.32.415.398 I slot print_timing: id 11 | task 478 | eval time = 5182.22 ms / 114 tokens ( 45.46 ms per token, 22.00 tokens per second)
1.32.415.399 I slot print_timing: id 11 | task 478 | total time = 5302.81 ms / 139 tokens
1.32.415.400 I slot print_timing: id 11 | task 478 | graphs reused = 1
1.32.415.404 I slot print_timing: id 11 | task 478 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.32.415.416 I statistics draft-mtp: #calls(b,g,a) = 126 404 6245, #gen drafts = 6249, #acc drafts = 4406, #gen tokens = 12463, #acc tokens = 8246, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.101, 1336.371, 2201.245 ms
1.32.415.443 I slot release: id 11 | task 478 | stop processing: n_tokens = 140, truncated = 0
1.32.424.226 I srv operator(): Chat format: peg-native
1.32.537.112 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.179
1.32.537.176 I slot launch_slot_: id 11 | task 532 | processing task, is_child = 0
1.32.542.658 W slot operator(): id 11 | task 532 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.32.542.696 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.32.662.756 I slot print_timing: id 8 | task 440 | prompt eval time = 122.84 ms / 29 tokens ( 4.24 ms per token, 236.07 tokens per second)
1.32.662.762 I slot print_timing: id 8 | task 440 | eval time = 9285.23 ms / 128 tokens ( 72.54 ms per token, 13.79 tokens per second)
1.32.662.762 I slot print_timing: id 8 | task 440 | total time = 9408.07 ms / 157 tokens
1.32.662.763 I slot print_timing: id 8 | task 440 | graphs reused = 1
1.32.662.766 I slot print_timing: id 8 | task 440 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.32.662.781 I statistics draft-mtp: #calls(b,g,a) = 126 406 6264, #gen drafts = 6278, #acc drafts = 4419, #gen tokens = 12520, #acc tokens = 8269, #mean acc len = 2.32, #acc rate/pos = (0.705, 0.615), dur(b,g,a) = 0.101, 1345.847, 2207.854 ms
1.32.662.810 I slot release: id 8 | task 440 | stop processing: n_tokens = 156, truncated = 0
1.32.671.427 I srv operator(): Chat format: peg-native
1.32.675.575 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.32.675.638 I slot launch_slot_: id 8 | task 534 | processing task, is_child = 0
1.32.680.569 W slot operator(): id 8 | task 534 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.32.680.598 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.32.816.398 I slot print_timing: id 14 | task 472 | prompt eval time = 123.87 ms / 28 tokens ( 4.42 ms per token, 226.05 tokens per second)
1.32.816.401 I slot print_timing: id 14 | task 472 | eval time = 6218.24 ms / 125 tokens ( 49.75 ms per token, 20.10 tokens per second)
1.32.816.401 I slot print_timing: id 14 | task 472 | total time = 6342.11 ms / 153 tokens
1.32.816.402 I slot print_timing: id 14 | task 472 | graphs reused = 1
1.32.816.406 I slot print_timing: id 14 | task 472 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.32.816.418 I statistics draft-mtp: #calls(b,g,a) = 128 407 6292, #gen drafts = 6293, #acc drafts = 4441, #gen tokens = 12550, #acc tokens = 8311, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.103, 1350.691, 2217.888 ms
1.32.816.449 I slot release: id 14 | task 472 | stop processing: n_tokens = 152, truncated = 0
1.32.926.970 I slot print_timing: id 1 | task 467 | n_decoded = 100, tg = 14.60 t/s, tg_3s = 14.60 t/s
1.33.054.447 I slot print_timing: id 10 | task 491 | n_decoded = 102, tg = 22.57 t/s, tg_3s = 22.57 t/s
1.33.527.143 I slot print_timing: id 2 | task 481 | prompt eval time = 136.59 ms / 28 tokens ( 4.88 ms per token, 205.00 tokens per second)
1.33.527.146 I slot print_timing: id 2 | task 481 | eval time = 6141.20 ms / 125 tokens ( 49.13 ms per token, 20.35 tokens per second)
1.33.527.147 I slot print_timing: id 2 | task 481 | total time = 6277.79 ms / 153 tokens
1.33.527.148 I slot print_timing: id 2 | task 481 | graphs reused = 1
1.33.527.150 I slot print_timing: id 2 | task 481 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.33.527.163 I statistics draft-mtp: #calls(b,g,a) = 128 413 6371, #gen drafts = 6383, #acc drafts = 4496, #gen tokens = 12730, #acc tokens = 8415, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.103, 1372.311, 2246.011 ms
1.33.527.187 I slot release: id 2 | task 481 | stop processing: n_tokens = 152, truncated = 0
1.33.645.226 I slot print_timing: id 10 | task 491 | prompt eval time = 135.26 ms / 25 tokens ( 5.41 ms per token, 184.83 tokens per second)
1.33.645.231 I slot print_timing: id 10 | task 491 | eval time = 5109.15 ms / 114 tokens ( 44.82 ms per token, 22.31 tokens per second)
1.33.645.232 I slot print_timing: id 10 | task 491 | total time = 5244.41 ms / 139 tokens
1.33.645.233 I slot print_timing: id 10 | task 491 | graphs reused = 1
1.33.645.235 I slot print_timing: id 10 | task 491 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.33.645.247 I statistics draft-mtp: #calls(b,g,a) = 128 414 6393, #gen drafts = 6397, #acc drafts = 4511, #gen tokens = 12757, #acc tokens = 8442, #mean acc len = 2.32, #acc rate/pos = (0.706, 0.615), dur(b,g,a) = 0.103, 1376.773, 2253.529 ms
1.33.645.270 I slot release: id 10 | task 491 | stop processing: n_tokens = 140, truncated = 0
1.33.740.573 I slot print_timing: id 15 | task 453 | prompt eval time = 129.52 ms / 29 tokens ( 4.47 ms per token, 223.90 tokens per second)
1.33.740.578 I slot print_timing: id 15 | task 453 | eval time = 9081.12 ms / 128 tokens ( 70.95 ms per token, 14.10 tokens per second)
1.33.740.578 I slot print_timing: id 15 | task 453 | total time = 9210.65 ms / 157 tokens
1.33.740.579 I slot print_timing: id 15 | task 453 | graphs reused = 1
1.33.740.582 I slot print_timing: id 15 | task 453 | draft acceptance = 0.40288 ( 56 accepted / 139 generated), mean acceptance length = 1.80, acceptance rate per position = (0.443, 0.357)
1.33.740.594 I statistics draft-mtp: #calls(b,g,a) = 128 415 6397, #gen drafts = 6409, #acc drafts = 4513, #gen tokens = 12781, #acc tokens = 8446, #mean acc len = 2.32, #acc rate/pos = (0.705, 0.615), dur(b,g,a) = 0.103, 1381.495, 2254.810 ms
1.33.740.618 I slot release: id 15 | task 453 | stop processing: n_tokens = 156, truncated = 0
1.33.745.812 I slot print_timing: id 6 | task 495 | n_decoded = 101, tg = 20.43 t/s, tg_3s = 20.43 t/s
1.34.237.270 I slot print_timing: id 13 | task 480 | n_decoded = 100, tg = 14.60 t/s, tg_3s = 14.60 t/s
1.34.330.849 I slot print_timing: id 7 | task 505 | n_decoded = 102, tg = 24.04 t/s, tg_3s = 24.04 t/s
1.34.620.747 I slot print_timing: id 6 | task 495 | prompt eval time = 124.45 ms / 28 tokens ( 4.44 ms per token, 224.99 tokens per second)
1.34.620.749 I slot print_timing: id 6 | task 495 | eval time = 5819.07 ms / 125 tokens ( 46.55 ms per token, 21.48 tokens per second)
1.34.620.749 I slot print_timing: id 6 | task 495 | total time = 5943.52 ms / 153 tokens
1.34.620.750 I slot print_timing: id 6 | task 495 | graphs reused = 1
1.34.620.753 I slot print_timing: id 6 | task 495 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.34.620.763 I statistics draft-mtp: #calls(b,g,a) = 128 424 6511, #gen drafts = 6517, #acc drafts = 4588, #gen tokens = 12996, #acc tokens = 8586, #mean acc len = 2.32, #acc rate/pos = (0.705, 0.614), dur(b,g,a) = 0.103, 1424.314, 2294.762 ms
1.34.620.783 I slot release: id 6 | task 495 | stop processing: n_tokens = 152, truncated = 0
1.34.704.356 I slot print_timing: id 1 | task 467 | prompt eval time = 123.76 ms / 29 tokens ( 4.27 ms per token, 234.33 tokens per second)
1.34.704.359 I slot print_timing: id 1 | task 467 | eval time = 8625.05 ms / 128 tokens ( 67.38 ms per token, 14.84 tokens per second)
1.34.704.360 I slot print_timing: id 1 | task 467 | total time = 8748.81 ms / 157 tokens
1.34.704.361 I slot print_timing: id 1 | task 467 | graphs reused = 1
1.34.704.363 I slot print_timing: id 1 | task 467 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.34.704.373 I statistics draft-mtp: #calls(b,g,a) = 128 425 6517, #gen drafts = 6527, #acc drafts = 4591, #gen tokens = 13016, #acc tokens = 8591, #mean acc len = 2.32, #acc rate/pos = (0.704, 0.614), dur(b,g,a) = 0.103, 1429.238, 2296.677 ms
1.34.704.393 I slot release: id 1 | task 467 | stop processing: n_tokens = 156, truncated = 0
1.34.791.334 I slot print_timing: id 7 | task 505 | prompt eval time = 136.65 ms / 25 tokens ( 5.47 ms per token, 182.95 tokens per second)
1.34.791.336 I slot print_timing: id 7 | task 505 | eval time = 4703.52 ms / 114 tokens ( 41.26 ms per token, 24.24 tokens per second)
1.34.791.337 I slot print_timing: id 7 | task 505 | total time = 4840.17 ms / 139 tokens
1.34.791.338 I slot print_timing: id 7 | task 505 | graphs reused = 1
1.34.791.340 I slot print_timing: id 7 | task 505 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.34.791.350 I statistics draft-mtp: #calls(b,g,a) = 128 426 6532, #gen drafts = 6537, #acc drafts = 4602, #gen tokens = 13036, #acc tokens = 8611, #mean acc len = 2.32, #acc rate/pos = (0.705, 0.614), dur(b,g,a) = 0.103, 1434.157, 2302.044 ms
1.34.791.367 I slot release: id 7 | task 505 | stop processing: n_tokens = 140, truncated = 0
1.34.867.577 I slot print_timing: id 9 | task 492 | n_decoded = 100, tg = 15.79 t/s, tg_3s = 15.79 t/s
1.34.939.521 I slot print_timing: id 3 | task 511 | n_decoded = 101, tg = 22.63 t/s, tg_3s = 22.63 t/s
1.35.015.321 I slot print_timing: id 4 | task 517 | n_decoded = 102, tg = 26.16 t/s, tg_3s = 26.16 t/s
1.35.389.306 I slot print_timing: id 4 | task 517 | prompt eval time = 114.47 ms / 25 tokens ( 4.58 ms per token, 218.41 tokens per second)
1.35.389.309 I slot print_timing: id 4 | task 517 | eval time = 4273.35 ms / 114 tokens ( 37.49 ms per token, 26.68 tokens per second)
1.35.389.310 I slot print_timing: id 4 | task 517 | total time = 4387.82 ms / 139 tokens
1.35.389.311 I slot print_timing: id 4 | task 517 | graphs reused = 1
1.35.389.313 I slot print_timing: id 4 | task 517 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.35.389.324 I statistics draft-mtp: #calls(b,g,a) = 128 434 6603, #gen drafts = 6609, #acc drafts = 4649, #gen tokens = 13180, #acc tokens = 8700, #mean acc len = 2.32, #acc rate/pos = (0.704, 0.614), dur(b,g,a) = 0.103, 1472.336, 2327.342 ms
1.35.389.343 I slot release: id 4 | task 517 | stop processing: n_tokens = 140, truncated = 0
1.35.455.765 I slot print_timing: id 0 | task 521 | n_decoded = 101, tg = 24.84 t/s, tg_3s = 24.84 t/s
1.35.585.821 I slot print_timing: id 13 | task 480 | prompt eval time = 136.80 ms / 29 tokens ( 4.72 ms per token, 211.98 tokens per second)
1.35.585.824 I slot print_timing: id 13 | task 480 | eval time = 8199.62 ms / 128 tokens ( 64.06 ms per token, 15.61 tokens per second)
1.35.585.824 I slot print_timing: id 13 | task 480 | total time = 8336.43 ms / 157 tokens
1.35.585.825 I slot print_timing: id 13 | task 480 | graphs reused = 1
1.35.585.827 I slot print_timing: id 13 | task 480 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.35.585.839 I statistics draft-mtp: #calls(b,g,a) = 128 437 6625, #gen drafts = 6632, #acc drafts = 4662, #gen tokens = 13225, #acc tokens = 8725, #mean acc len = 2.32, #acc rate/pos = (0.704, 0.613), dur(b,g,a) = 0.103, 1487.927, 2335.054 ms
1.35.585.857 I slot release: id 13 | task 480 | stop processing: n_tokens = 156, truncated = 0
1.35.587.604 I slot print_timing: id 3 | task 511 | prompt eval time = 122.95 ms / 28 tokens ( 4.39 ms per token, 227.73 tokens per second)
1.35.587.606 I slot print_timing: id 3 | task 511 | eval time = 5111.65 ms / 125 tokens ( 40.89 ms per token, 24.45 tokens per second)
1.35.587.606 I slot print_timing: id 3 | task 511 | total time = 5234.60 ms / 153 tokens
1.35.587.607 I slot print_timing: id 3 | task 511 | graphs reused = 1
1.35.587.609 I slot print_timing: id 3 | task 511 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.35.587.615 I statistics draft-mtp: #calls(b,g,a) = 128 437 6627, #gen drafts = 6632, #acc drafts = 4663, #gen tokens = 13225, #acc tokens = 8727, #mean acc len = 2.32, #acc rate/pos = (0.704, 0.613), dur(b,g,a) = 0.103, 1487.927, 2335.808 ms
1.35.587.630 I slot release: id 3 | task 511 | stop processing: n_tokens = 152, truncated = 0
1.35.691.112 I slot print_timing: id 5 | task 507 | n_decoded = 100, tg = 17.85 t/s, tg_3s = 17.85 t/s
1.35.795.772 I slot print_timing: id 11 | task 532 | n_decoded = 102, tg = 32.56 t/s, tg_3s = 32.56 t/s
1.35.940.497 I slot print_timing: id 9 | task 492 | prompt eval time = 135.04 ms / 29 tokens ( 4.66 ms per token, 214.75 tokens per second)
1.35.940.500 I slot print_timing: id 9 | task 492 | eval time = 7404.71 ms / 128 tokens ( 57.85 ms per token, 17.29 tokens per second)
1.35.940.501 I slot print_timing: id 9 | task 492 | total time = 7539.75 ms / 157 tokens
1.35.940.502 I slot print_timing: id 9 | task 492 | graphs reused = 1
1.35.940.504 I slot print_timing: id 9 | task 492 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.35.940.516 I statistics draft-mtp: #calls(b,g,a) = 128 444 6668, #gen drafts = 6673, #acc drafts = 4688, #gen tokens = 13306, #acc tokens = 8772, #mean acc len = 2.32, #acc rate/pos = (0.703, 0.612), dur(b,g,a) = 0.103, 1516.548, 2350.449 ms
1.35.940.534 I slot release: id 9 | task 492 | stop processing: n_tokens = 156, truncated = 0
1.35.941.655 I slot print_timing: id 0 | task 521 | prompt eval time = 122.85 ms / 28 tokens ( 4.39 ms per token, 227.92 tokens per second)
1.35.941.657 I slot print_timing: id 0 | task 521 | eval time = 4551.91 ms / 125 tokens ( 36.42 ms per token, 27.46 tokens per second)
1.35.941.658 I slot print_timing: id 0 | task 521 | total time = 4674.76 ms / 153 tokens
1.35.941.658 I slot print_timing: id 0 | task 521 | graphs reused = 1
1.35.941.660 I slot print_timing: id 0 | task 521 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.35.941.666 I statistics draft-mtp: #calls(b,g,a) = 128 444 6669, #gen drafts = 6673, #acc drafts = 4689, #gen tokens = 13306, #acc tokens = 8774, #mean acc len = 2.32, #acc rate/pos = (0.703, 0.613), dur(b,g,a) = 0.103, 1516.548, 2350.894 ms
1.35.941.683 I slot release: id 0 | task 521 | stop processing: n_tokens = 152, truncated = 0
1.36.013.252 I slot print_timing: id 11 | task 532 | prompt eval time = 120.42 ms / 25 tokens ( 4.82 ms per token, 207.61 tokens per second)
1.36.013.254 I slot print_timing: id 11 | task 532 | eval time = 3350.16 ms / 114 tokens ( 29.39 ms per token, 34.03 tokens per second)
1.36.013.254 I slot print_timing: id 11 | task 532 | total time = 3470.58 ms / 139 tokens
1.36.013.255 I slot print_timing: id 11 | task 532 | graphs reused = 1
1.36.013.258 I slot print_timing: id 11 | task 532 | draft acceptance = 0.93750 ( 75 accepted / 80 generated), mean acceptance length = 2.88, acceptance rate per position = (1.000, 0.875)
1.36.013.268 I statistics draft-mtp: #calls(b,g,a) = 128 446 6680, #gen drafts = 6681, #acc drafts = 4695, #gen tokens = 13322, #acc tokens = 8784, #mean acc len = 2.31, #acc rate/pos = (0.703, 0.612), dur(b,g,a) = 0.103, 1522.639, 2354.846 ms
1.36.013.283 I slot release: id 11 | task 532 | stop processing: n_tokens = 140, truncated = 0
1.36.068.631 I slot print_timing: id 12 | task 519 | n_decoded = 100, tg = 20.76 t/s, tg_3s = 20.76 t/s
1.36.274.752 I slot print_timing: id 5 | task 507 | prompt eval time = 136.44 ms / 29 tokens ( 4.70 ms per token, 212.56 tokens per second)
1.36.274.755 I slot print_timing: id 5 | task 507 | eval time = 6187.23 ms / 128 tokens ( 48.34 ms per token, 20.69 tokens per second)
1.36.274.755 I slot print_timing: id 5 | task 507 | total time = 6323.66 ms / 157 tokens
1.36.274.756 I slot print_timing: id 5 | task 507 | graphs reused = 1
1.36.274.758 I slot print_timing: id 5 | task 507 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.36.274.770 I statistics draft-mtp: #calls(b,g,a) = 128 456 6708, #gen drafts = 6710, #acc drafts = 4706, #gen tokens = 13379, #acc tokens = 8805, #mean acc len = 2.31, #acc rate/pos = (0.702, 0.611), dur(b,g,a) = 0.103, 1550.145, 2364.994 ms
1.36.274.786 I slot release: id 5 | task 507 | stop processing: n_tokens = 156, truncated = 0
1.36.383.941 I slot print_timing: id 8 | task 534 | n_decoded = 100, tg = 27.93 t/s, tg_3s = 27.93 t/s
1.36.432.383 I slot print_timing: id 12 | task 519 | prompt eval time = 120.82 ms / 29 tokens ( 4.17 ms per token, 240.02 tokens per second)
1.36.432.385 I slot print_timing: id 12 | task 519 | eval time = 5180.79 ms / 128 tokens ( 40.47 ms per token, 24.71 tokens per second)
1.36.432.386 I slot print_timing: id 12 | task 519 | total time = 5301.61 ms / 157 tokens
1.36.432.387 I slot print_timing: id 12 | task 519 | graphs reused = 1
1.36.432.389 I slot print_timing: id 12 | task 519 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.36.432.400 I statistics draft-mtp: #calls(b,g,a) = 128 465 6726, #gen drafts = 6727, #acc drafts = 4715, #gen tokens = 13412, #acc tokens = 8821, #mean acc len = 2.31, #acc rate/pos = (0.701, 0.610), dur(b,g,a) = 0.103, 1566.458, 2371.478 ms
1.36.432.415 I slot release: id 12 | task 519 | stop processing: n_tokens = 156, truncated = 0
1.36.541.240 I slot print_timing: id 8 | task 534 | prompt eval time = 123.22 ms / 29 tokens ( 4.25 ms per token, 235.35 tokens per second)
1.36.541.243 I slot print_timing: id 8 | task 534 | eval time = 3737.44 ms / 128 tokens ( 29.20 ms per token, 34.25 tokens per second)
1.36.541.243 I slot print_timing: id 8 | task 534 | total time = 3860.66 ms / 157 tokens
1.36.541.244 I slot print_timing: id 8 | task 534 | graphs reused = 11
1.36.541.246 I slot print_timing: id 8 | task 534 | draft acceptance = 0.40288 ( 56 accepted / 139 generated), mean acceptance length = 1.80, acceptance rate per position = (0.443, 0.357)
1.36.541.260 I statistics draft-mtp: #calls(b,g,a) = 128 477 6739, #gen drafts = 6739, #acc drafts = 4721, #gen tokens = 13435, #acc tokens = 8832, #mean acc len = 2.31, #acc rate/pos = (0.701, 0.610), dur(b,g,a) = 0.103, 1578.354, 2376.101 ms
1.36.541.276 I slot release: id 8 | task 534 | stop processing: n_tokens = 156, truncated = 0
1.36.541.288 I srv update_slots: all slots are idle