0.00.147.142 I log_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.147.145 I device_info:
0.00.226.218 I - CUDA0 : NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition (97244 MiB, 96677 MiB free)
0.00.226.232 I - CPU : AMD Ryzen Threadripper 9960X 24-Cores (257066 MiB, 257066 MiB free)
0.00.226.326 I system_info: n_threads = 24 (n_threads_batch = 24) / 48 | CUDA : ARCHS = 1200 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | BLACKWELL_NATIVE_FP4 = 1 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
0.00.226.418 I srv init: using 47 threads for HTTP server
0.00.226.651 I srv start: binding port with default address family
0.00.227.829 I srv llama_server: loading model
0.00.227.877 I srv load_model: loading model '/home/ripper/ornith-35b-lab/artifacts/quant/ornith-1.0-35b-IQ4_XS.gguf'
0.00.510.802 I srv load_model: [spec] estimated memory usage of draft model is 4143.45 MiB
0.00.510.837 I common_init_result: fitting params to device memory ...
0.00.510.837 I common_init_result: (for bugs during this step try to reproduce them with -fit off, or provide --verbose logs if the bug only occurs with -fit on)
0.02.549.314 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.02.567.205 I common_init_from_params: warming up the model with an empty run - please wait ... (--no-warmup to disable)
0.02.603.456 I srv load_model: loading draft model '/home/ripper/ornith-35b-lab/artifacts/mtp/ornith-1.0-35b-mtp-chaincorr-h2r10prefix1000-h1r2-h3r8fw-lr5e6-Q6_K.gguf'
0.02.978.724 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.02.990.156 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.03.001.910 W srv operator(): LLAMA_MTP_PER_HEAD_CONTEXT disables prompt cache; per-head MTP state is not prompt-cache serializable yet
0.03.001.913 W srv operator(): LLAMA_MTP_PER_HEAD_CONTEXT disables context checkpoints; per-head MTP state is not checkpoint-serializable yet
0.03.001.913 I srv operator(): [spec] created 2 MTP draft contexts, one per active head
0.03.001.930 I srv load_model: initializing slots, n_slots = 16
0.03.013.138 I common_context_can_seq_rm: the context supports bounded partial sequence removal
0.03.021.464 I common_speculative_impl_draft_mtp: adding speculative implementation 'draft-mtp'
0.03.021.467 I common_speculative_impl_draft_mtp: - n_max=2, n_min=0, p_min=0.00, n_embd=2048, backend_sampling=1
0.03.021.469 I common_speculative_impl_draft_mtp: - gpu_layers=99, cache_k=f16, cache_v=f16, ctx_tgt=yes, ctx_dft=yes, devices=[default]
0.03.021.598 I common_speculative_impl_draft_mtp: - draft sampler top_k=1 top_p=1.000 temp=1.000
0.03.021.625 I common_speculative_impl_draft_mtp: - fast backend MTP sampling enabled
0.03.021.627 I common_speculative_impl_draft_mtp: - per-head MTP contexts enabled (2 active heads)
0.03.021.634 I common_speculative_impl_draft_mtp: - backend draft sampler top_k=1 top_p=1.000 temp=1.000 contexts=2
0.03.043.059 I srv load_model: speculative decoding context initialized
0.03.043.064 I slot load_model: id 0 | task -1 | new slot, n_ctx = 8192
0.03.043.075 I slot load_model: id 1 | task -1 | new slot, n_ctx = 8192
0.03.043.076 I slot load_model: id 2 | task -1 | new slot, n_ctx = 8192
0.03.043.077 I slot load_model: id 3 | task -1 | new slot, n_ctx = 8192
0.03.043.078 I slot load_model: id 4 | task -1 | new slot, n_ctx = 8192
0.03.043.078 I slot load_model: id 5 | task -1 | new slot, n_ctx = 8192
0.03.043.078 I slot load_model: id 6 | task -1 | new slot, n_ctx = 8192
0.03.043.079 I slot load_model: id 7 | task -1 | new slot, n_ctx = 8192
0.03.043.079 I slot load_model: id 8 | task -1 | new slot, n_ctx = 8192
0.03.043.079 I slot load_model: id 9 | task -1 | new slot, n_ctx = 8192
0.03.043.080 I slot load_model: id 10 | task -1 | new slot, n_ctx = 8192
0.03.043.080 I slot load_model: id 11 | task -1 | new slot, n_ctx = 8192
0.03.043.081 I slot load_model: id 12 | task -1 | new slot, n_ctx = 8192
0.03.043.081 I slot load_model: id 13 | task -1 | new slot, n_ctx = 8192
0.03.043.081 I slot load_model: id 14 | task -1 | new slot, n_ctx = 8192
0.03.043.082 I slot load_model: id 15 | task -1 | new slot, n_ctx = 8192
0.03.043.135 I srv load_model: prompt cache is disabled - use `--cache-ram N` to enable it
0.03.043.135 I srv load_model: for more info see https://github.com/ggml-org/llama.cpp/pull/16391
0.03.043.136 I srv load_model: context checkpoints disabled
0.03.043.153 W srv init: --cache-idle-slots requires --cache-ram, disabling
0.03.051.985 I init: chat template, example_format: '<|im_start|>system
You are a helpful assistant<|im_end|>
<|im_start|>user
Hello<|im_end|>
<|im_start|>assistant
Hi there<|im_end|>
<|im_start|>user
How are you?<|im_end|>
<|im_start|>assistant
'
0.03.058.416 I srv init: init: chat template, thinking = 0
0.03.058.468 I srv llama_server: model loaded
0.03.058.473 I srv llama_server: server is listening on http://0.0.0.0:8023
0.03.058.481 I srv update_slots: all slots are idle
0.40.026.980 I srv operator(): Chat format: peg-native
0.40.026.988 I srv operator(): Chat format: peg-native
0.40.026.994 I srv operator(): Chat format: peg-native
0.40.026.999 I srv operator(): Chat format: peg-native
0.40.027.001 I srv operator(): Chat format: peg-native
0.40.027.003 I srv operator(): Chat format: peg-native
0.40.027.009 I srv operator(): Chat format: peg-native
0.40.027.108 I srv operator(): Chat format: peg-native
0.40.027.120 I slot get_availabl: id 15 | task -1 | selected slot by LRU, t_last = -1
0.40.027.158 I slot launch_slot_: id 15 | task 7 | processing task, is_child = 0
0.40.027.160 I slot get_availabl: id 14 | task -1 | selected slot by LRU, t_last = -1
0.40.027.171 I slot launch_slot_: id 14 | task 4 | processing task, is_child = 0
0.40.027.173 I slot get_availabl: id 13 | task -1 | selected slot by LRU, t_last = -1
0.40.027.183 I slot launch_slot_: id 13 | task 3 | processing task, is_child = 0
0.40.027.184 I slot get_availabl: id 12 | task -1 | selected slot by LRU, t_last = -1
0.40.027.194 I slot launch_slot_: id 12 | task 1 | processing task, is_child = 0
0.40.027.196 I slot get_availabl: id 11 | task -1 | selected slot by LRU, t_last = -1
0.40.027.205 I slot launch_slot_: id 11 | task 0 | processing task, is_child = 0
0.40.027.206 I slot get_availabl: id 10 | task -1 | selected slot by LRU, t_last = -1
0.40.027.216 I slot launch_slot_: id 10 | task 5 | processing task, is_child = 0
0.40.027.218 I slot get_availabl: id 9 | task -1 | selected slot by LRU, t_last = -1
0.40.027.227 I slot launch_slot_: id 9 | task 2 | processing task, is_child = 0
0.40.027.228 I slot get_availabl: id 8 | task -1 | selected slot by LRU, t_last = -1
0.40.027.239 I slot launch_slot_: id 8 | task 6 | processing task, is_child = 0
0.40.027.275 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.027.303 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.027.325 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.027.368 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.027.373 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.027.385 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.027.407 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.027.428 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.027.861 I srv operator(): Chat format: peg-native
0.40.031.314 I srv operator(): Chat format: peg-native
0.40.040.832 I srv operator(): Chat format: peg-native
0.40.040.838 I srv operator(): Chat format: peg-native
0.40.041.144 I srv operator(): Chat format: peg-native
0.40.042.411 I srv operator(): Chat format: peg-native
0.40.042.423 I srv operator(): Chat format: peg-native
0.40.043.478 I srv operator(): Chat format: peg-native
0.40.330.658 I slot get_availabl: id 7 | task -1 | selected slot by LRU, t_last = -1
0.40.330.728 I slot launch_slot_: id 7 | task 9 | processing task, is_child = 0
0.40.330.729 I slot get_availabl: id 6 | task -1 | selected slot by LRU, t_last = -1
0.40.330.743 I slot launch_slot_: id 6 | task 10 | processing task, is_child = 0
0.40.330.745 I slot get_availabl: id 5 | task -1 | selected slot by LRU, t_last = -1
0.40.330.758 I slot launch_slot_: id 5 | task 12 | processing task, is_child = 0
0.40.330.760 I slot get_availabl: id 4 | task -1 | selected slot by LRU, t_last = -1
0.40.330.771 I slot launch_slot_: id 4 | task 11 | processing task, is_child = 0
0.40.330.772 I slot get_availabl: id 3 | task -1 | selected slot by LRU, t_last = -1
0.40.330.784 I slot launch_slot_: id 3 | task 13 | processing task, is_child = 0
0.40.330.785 I slot get_availabl: id 2 | task -1 | selected slot by LRU, t_last = -1
0.40.330.796 I slot launch_slot_: id 2 | task 15 | processing task, is_child = 0
0.40.330.797 I slot get_availabl: id 1 | task -1 | selected slot by LRU, t_last = -1
0.40.330.809 I slot launch_slot_: id 1 | task 14 | processing task, is_child = 0
0.40.330.810 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = -1
0.40.330.820 I slot launch_slot_: id 0 | task 16 | processing task, is_child = 0
0.40.337.955 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.337.969 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.337.995 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.338.011 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.338.033 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.338.065 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.338.083 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.40.338.109 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.44.748.756 I slot print_timing: id 8 | task 6 | n_decoded = 102, tg = 23.06 t/s, tg_3s = 23.06 t/s
0.44.752.055 I slot print_timing: id 15 | task 7 | n_decoded = 102, tg = 23.07 t/s, tg_3s = 23.07 t/s
0.44.866.264 I slot print_timing: id 0 | task 16 | n_decoded = 102, tg = 23.73 t/s, tg_3s = 23.73 t/s
0.44.868.156 I slot print_timing: id 4 | task 11 | n_decoded = 102, tg = 23.73 t/s, tg_3s = 23.73 t/s
0.44.868.761 I slot print_timing: id 5 | task 12 | n_decoded = 102, tg = 23.73 t/s, tg_3s = 23.73 t/s
0.44.869.924 I slot print_timing: id 7 | task 9 | n_decoded = 102, tg = 23.73 t/s, tg_3s = 23.73 t/s
0.45.239.208 I slot print_timing: id 8 | task 6 | prompt eval time = 298.87 ms / 25 tokens ( 11.95 ms per token, 83.65 tokens per second)
0.45.239.211 I slot print_timing: id 8 | task 6 | eval time = 4913.05 ms / 114 tokens ( 43.10 ms per token, 23.20 tokens per second)
0.45.239.212 I slot print_timing: id 8 | task 6 | total time = 5211.92 ms / 139 tokens
0.45.239.217 I slot print_timing: id 8 | task 6 | graphs reused = 1
0.45.239.220 I slot print_timing: id 8 | task 6 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.45.239.240 I statistics draft-mtp: #calls(b,g,a) = 16 39 609, #gen drafts = 616, #acc drafts = 468, #gen tokens = 1232, #acc tokens = 889, #mean acc len = 2.46, #acc rate/pos = (0.768, 0.691), dur(b,g,a) = 0.009, 116.460, 0.720 ms
0.45.239.281 I slot release: id 8 | task 6 | stop processing: n_tokens = 138, truncated = 0
0.45.240.498 I slot print_timing: id 10 | task 5 | n_decoded = 101, tg = 20.56 t/s, tg_3s = 20.56 t/s
0.45.242.299 I slot print_timing: id 13 | task 3 | n_decoded = 101, tg = 20.56 t/s, tg_3s = 20.56 t/s
0.45.242.915 I slot print_timing: id 14 | task 4 | n_decoded = 101, tg = 20.56 t/s, tg_3s = 20.56 t/s
0.45.243.505 I slot print_timing: id 15 | task 7 | prompt eval time = 303.21 ms / 25 tokens ( 12.13 ms per token, 82.45 tokens per second)
0.45.243.506 I slot print_timing: id 15 | task 7 | eval time = 4912.84 ms / 114 tokens ( 43.10 ms per token, 23.20 tokens per second)
0.45.243.507 I slot print_timing: id 15 | task 7 | total time = 5216.05 ms / 139 tokens
0.45.243.508 I slot print_timing: id 15 | task 7 | graphs reused = 1
0.45.243.510 I slot print_timing: id 15 | task 7 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.45.243.522 I statistics draft-mtp: #calls(b,g,a) = 16 39 616, #gen drafts = 616, #acc drafts = 475, #gen tokens = 1232, #acc tokens = 903, #mean acc len = 2.47, #acc rate/pos = (0.771, 0.695), dur(b,g,a) = 0.009, 116.460, 0.729 ms
0.45.243.553 I slot release: id 15 | task 7 | stop processing: n_tokens = 138, truncated = 0
0.45.248.252 I srv operator(): Chat format: peg-native
0.45.251.688 I srv operator(): Chat format: peg-native
0.45.350.954 I slot print_timing: id 0 | task 16 | prompt eval time = 229.76 ms / 25 tokens ( 9.19 ms per token, 108.81 tokens per second)
0.45.350.957 I slot print_timing: id 0 | task 16 | eval time = 4783.20 ms / 114 tokens ( 41.96 ms per token, 23.83 tokens per second)
0.45.350.958 I slot print_timing: id 0 | task 16 | total time = 5012.96 ms / 139 tokens
0.45.350.959 I slot print_timing: id 0 | task 16 | graphs reused = 1
0.45.350.961 I slot print_timing: id 0 | task 16 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.45.350.977 I statistics draft-mtp: #calls(b,g,a) = 16 40 617, #gen drafts = 630, #acc drafts = 476, #gen tokens = 1260, #acc tokens = 905, #mean acc len = 2.47, #acc rate/pos = (0.771, 0.695), dur(b,g,a) = 0.009, 124.874, 0.732 ms
0.45.351.007 I slot release: id 0 | task 16 | stop processing: n_tokens = 138, truncated = 0
0.45.352.236 I slot print_timing: id 2 | task 15 | n_decoded = 101, tg = 21.12 t/s, tg_3s = 21.12 t/s
0.45.353.439 I slot print_timing: id 4 | task 11 | prompt eval time = 232.25 ms / 25 tokens ( 9.29 ms per token, 107.64 tokens per second)
0.45.353.440 I slot print_timing: id 4 | task 11 | eval time = 4783.12 ms / 114 tokens ( 41.96 ms per token, 23.83 tokens per second)
0.45.353.441 I slot print_timing: id 4 | task 11 | total time = 5015.38 ms / 139 tokens
0.45.353.441 I slot print_timing: id 4 | task 11 | graphs reused = 1
0.45.353.443 I slot print_timing: id 4 | task 11 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.45.353.449 I statistics draft-mtp: #calls(b,g,a) = 16 40 621, #gen drafts = 630, #acc drafts = 480, #gen tokens = 1260, #acc tokens = 913, #mean acc len = 2.47, #acc rate/pos = (0.773, 0.697), dur(b,g,a) = 0.009, 124.874, 0.736 ms
0.45.353.475 I slot release: id 4 | task 11 | stop processing: n_tokens = 138, truncated = 0
0.45.354.081 I slot print_timing: id 5 | task 12 | prompt eval time = 232.96 ms / 25 tokens ( 9.32 ms per token, 107.31 tokens per second)
0.45.354.082 I slot print_timing: id 5 | task 12 | eval time = 4783.04 ms / 114 tokens ( 41.96 ms per token, 23.83 tokens per second)
0.45.354.082 I slot print_timing: id 5 | task 12 | total time = 5016.00 ms / 139 tokens
0.45.354.083 I slot print_timing: id 5 | task 12 | graphs reused = 1
0.45.354.084 I slot print_timing: id 5 | task 12 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.45.354.088 I statistics draft-mtp: #calls(b,g,a) = 16 40 622, #gen drafts = 630, #acc drafts = 481, #gen tokens = 1260, #acc tokens = 915, #mean acc len = 2.47, #acc rate/pos = (0.773, 0.698), dur(b,g,a) = 0.009, 124.874, 0.737 ms
0.45.354.105 I slot release: id 5 | task 12 | stop processing: n_tokens = 138, truncated = 0
0.45.354.719 I slot print_timing: id 6 | task 10 | n_decoded = 101, tg = 21.12 t/s, tg_3s = 21.12 t/s
0.45.355.316 I slot print_timing: id 7 | task 9 | prompt eval time = 234.11 ms / 25 tokens ( 9.36 ms per token, 106.79 tokens per second)
0.45.355.317 I slot print_timing: id 7 | task 9 | eval time = 4783.07 ms / 114 tokens ( 41.96 ms per token, 23.83 tokens per second)
0.45.355.317 I slot print_timing: id 7 | task 9 | total time = 5017.18 ms / 139 tokens
0.45.355.317 I slot print_timing: id 7 | task 9 | graphs reused = 1
0.45.355.318 I slot print_timing: id 7 | task 9 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.45.355.322 I statistics draft-mtp: #calls(b,g,a) = 16 40 624, #gen drafts = 630, #acc drafts = 483, #gen tokens = 1260, #acc tokens = 919, #mean acc len = 2.47, #acc rate/pos = (0.774, 0.699), dur(b,g,a) = 0.009, 124.874, 0.740 ms
0.45.355.342 I slot release: id 7 | task 9 | stop processing: n_tokens = 138, truncated = 0
0.45.357.976 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.022
0.45.358.044 I slot launch_slot_: id 0 | task 57 | processing task, is_child = 0
0.45.358.047 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.45.358.065 I slot launch_slot_: id 4 | task 58 | processing task, is_child = 0
0.45.359.537 I srv operator(): Chat format: peg-native
0.45.362.690 W slot operator(): id 0 | task 57 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.362.716 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.362.749 W slot operator(): id 4 | task 58 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.362.771 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.363.535 I srv operator(): Chat format: peg-native
0.45.364.949 I srv operator(): Chat format: peg-native
0.45.365.770 I srv operator(): Chat format: peg-native
0.45.478.080 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.45.478.152 I slot launch_slot_: id 5 | task 60 | processing task, is_child = 0
0.45.478.155 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.45.478.173 I slot launch_slot_: id 7 | task 61 | processing task, is_child = 0
0.45.478.176 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.022
0.45.478.190 I slot launch_slot_: id 8 | task 62 | processing task, is_child = 0
0.45.478.193 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.45.478.207 I slot launch_slot_: id 15 | task 63 | processing task, is_child = 0
0.45.485.863 W slot operator(): id 5 | task 60 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.485.897 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.485.921 W slot operator(): id 7 | task 61 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.485.953 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.485.969 W slot operator(): id 8 | task 62 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.485.992 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.486.014 W slot operator(): id 15 | task 63 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.486.052 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.389.716 I slot print_timing: id 10 | task 5 | prompt eval time = 300.22 ms / 28 tokens ( 10.72 ms per token, 93.27 tokens per second)
0.46.389.721 I slot print_timing: id 10 | task 5 | eval time = 6062.13 ms / 125 tokens ( 48.50 ms per token, 20.62 tokens per second)
0.46.389.721 I slot print_timing: id 10 | task 5 | total time = 6362.35 ms / 153 tokens
0.46.389.722 I slot print_timing: id 10 | task 5 | graphs reused = 1
0.46.389.725 I slot print_timing: id 10 | task 5 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.389.740 I statistics draft-mtp: #calls(b,g,a) = 22 48 743, #gen drafts = 748, #acc drafts = 560, #gen tokens = 1496, #acc tokens = 1064, #mean acc len = 2.43, #acc rate/pos = (0.754, 0.678), dur(b,g,a) = 0.012, 154.776, 0.886 ms
0.46.389.772 I slot release: id 10 | task 5 | stop processing: n_tokens = 152, truncated = 0
0.46.390.971 I slot print_timing: id 13 | task 3 | prompt eval time = 302.08 ms / 28 tokens ( 10.79 ms per token, 92.69 tokens per second)
0.46.390.974 I slot print_timing: id 13 | task 3 | eval time = 6061.47 ms / 125 tokens ( 48.49 ms per token, 20.62 tokens per second)
0.46.390.974 I slot print_timing: id 13 | task 3 | total time = 6363.55 ms / 153 tokens
0.46.390.975 I slot print_timing: id 13 | task 3 | graphs reused = 1
0.46.390.977 I slot print_timing: id 13 | task 3 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.390.983 I statistics draft-mtp: #calls(b,g,a) = 22 48 746, #gen drafts = 748, #acc drafts = 561, #gen tokens = 1496, #acc tokens = 1066, #mean acc len = 2.43, #acc rate/pos = (0.752, 0.677), dur(b,g,a) = 0.012, 154.776, 0.890 ms
0.46.391.002 I slot release: id 13 | task 3 | stop processing: n_tokens = 152, truncated = 0
0.46.391.621 I slot print_timing: id 14 | task 4 | prompt eval time = 302.63 ms / 28 tokens ( 10.81 ms per token, 92.52 tokens per second)
0.46.391.625 I slot print_timing: id 14 | task 4 | eval time = 6061.56 ms / 125 tokens ( 48.49 ms per token, 20.62 tokens per second)
0.46.391.625 I slot print_timing: id 14 | task 4 | total time = 6364.19 ms / 153 tokens
0.46.391.625 I slot print_timing: id 14 | task 4 | graphs reused = 1
0.46.391.627 I slot print_timing: id 14 | task 4 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.391.632 I statistics draft-mtp: #calls(b,g,a) = 22 48 747, #gen drafts = 748, #acc drafts = 562, #gen tokens = 1496, #acc tokens = 1068, #mean acc len = 2.43, #acc rate/pos = (0.752, 0.677), dur(b,g,a) = 0.012, 154.776, 0.891 ms
0.46.391.653 I slot release: id 14 | task 4 | stop processing: n_tokens = 152, truncated = 0
0.46.398.506 I srv operator(): Chat format: peg-native
0.46.400.515 I srv operator(): Chat format: peg-native
0.46.400.522 I srv operator(): Chat format: peg-native
0.46.490.177 I slot print_timing: id 2 | task 15 | prompt eval time = 231.11 ms / 28 tokens ( 8.25 ms per token, 121.15 tokens per second)
0.46.490.180 I slot print_timing: id 2 | task 15 | eval time = 5921.04 ms / 125 tokens ( 47.37 ms per token, 21.11 tokens per second)
0.46.490.180 I slot print_timing: id 2 | task 15 | total time = 6152.15 ms / 153 tokens
0.46.490.181 I slot print_timing: id 2 | task 15 | graphs reused = 1
0.46.490.184 I slot print_timing: id 2 | task 15 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.490.194 I statistics draft-mtp: #calls(b,g,a) = 22 49 751, #gen drafts = 761, #acc drafts = 564, #gen tokens = 1522, #acc tokens = 1072, #mean acc len = 2.43, #acc rate/pos = (0.751, 0.676), dur(b,g,a) = 0.012, 159.348, 0.896 ms
0.46.490.222 I slot release: id 2 | task 15 | stop processing: n_tokens = 152, truncated = 0
0.46.492.317 I slot print_timing: id 6 | task 10 | prompt eval time = 233.53 ms / 28 tokens ( 8.34 ms per token, 119.90 tokens per second)
0.46.492.319 I slot print_timing: id 6 | task 10 | eval time = 5920.68 ms / 125 tokens ( 47.37 ms per token, 21.11 tokens per second)
0.46.492.319 I slot print_timing: id 6 | task 10 | total time = 6154.22 ms / 153 tokens
0.46.492.320 I slot print_timing: id 6 | task 10 | graphs reused = 1
0.46.492.321 I slot print_timing: id 6 | task 10 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.46.492.327 I statistics draft-mtp: #calls(b,g,a) = 22 49 755, #gen drafts = 761, #acc drafts = 567, #gen tokens = 1522, #acc tokens = 1078, #mean acc len = 2.43, #acc rate/pos = (0.751, 0.677), dur(b,g,a) = 0.012, 159.348, 0.900 ms
0.46.492.350 I slot release: id 6 | task 10 | stop processing: n_tokens = 152, truncated = 0
0.46.495.033 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.46.495.100 I slot launch_slot_: id 2 | task 72 | processing task, is_child = 0
0.46.495.103 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.46.495.119 I slot launch_slot_: id 6 | task 73 | processing task, is_child = 0
0.46.495.122 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.020
0.46.495.135 I slot launch_slot_: id 10 | task 74 | processing task, is_child = 0
0.46.498.967 I srv operator(): Chat format: peg-native
0.46.500.521 I srv operator(): Chat format: peg-native
0.46.501.241 W slot operator(): id 2 | task 72 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.501.278 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.501.315 W slot operator(): id 6 | task 73 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.501.355 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.501.371 W slot operator(): id 10 | task 74 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.501.400 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.647.295 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.46.647.364 I slot launch_slot_: id 13 | task 76 | processing task, is_child = 0
0.46.647.367 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.46.647.384 I slot launch_slot_: id 14 | task 77 | processing task, is_child = 0
0.46.652.510 W slot operator(): id 13 | task 76 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.652.536 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.46.652.564 W slot operator(): id 14 | task 77 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.46.652.595 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.165.406 I slot print_timing: id 9 | task 2 | n_decoded = 100, tg = 14.62 t/s, tg_3s = 14.62 t/s
0.47.166.551 I slot print_timing: id 11 | task 0 | n_decoded = 100, tg = 14.62 t/s, tg_3s = 14.62 t/s
0.47.167.161 I slot print_timing: id 12 | task 1 | n_decoded = 100, tg = 14.62 t/s, tg_3s = 14.62 t/s
0.47.283.348 I slot print_timing: id 1 | task 14 | n_decoded = 100, tg = 14.89 t/s, tg_3s = 14.89 t/s
0.47.284.540 I slot print_timing: id 3 | task 13 | n_decoded = 100, tg = 14.89 t/s, tg_3s = 14.89 t/s
0.49.096.971 I slot print_timing: id 9 | task 2 | prompt eval time = 299.49 ms / 29 tokens ( 10.33 ms per token, 96.83 tokens per second)
0.49.096.977 I slot print_timing: id 9 | task 2 | eval time = 8770.15 ms / 128 tokens ( 68.52 ms per token, 14.59 tokens per second)
0.49.096.977 I slot print_timing: id 9 | task 2 | total time = 9069.64 ms / 157 tokens
0.49.096.978 I slot print_timing: id 9 | task 2 | graphs reused = 1
0.49.096.981 I slot print_timing: id 9 | task 2 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.096.997 I statistics draft-mtp: #calls(b,g,a) = 27 70 1074, #gen drafts = 1087, #acc drafts = 780, #gen tokens = 2169, #acc tokens = 1469, #mean acc len = 2.37, #acc rate/pos = (0.726, 0.642), dur(b,g,a) = 0.015, 228.471, 1.287 ms
0.49.097.024 I slot release: id 9 | task 2 | stop processing: n_tokens = 156, truncated = 0
0.49.097.222 I slot print_timing: id 11 | task 0 | prompt eval time = 300.80 ms / 29 tokens ( 10.37 ms per token, 96.41 tokens per second)
0.49.097.224 I slot print_timing: id 11 | task 0 | eval time = 8769.07 ms / 128 tokens ( 68.51 ms per token, 14.60 tokens per second)
0.49.097.224 I slot print_timing: id 11 | task 0 | total time = 9069.87 ms / 157 tokens
0.49.097.225 I slot print_timing: id 11 | task 0 | graphs reused = 1
0.49.097.226 I slot print_timing: id 11 | task 0 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.097.228 I statistics draft-mtp: #calls(b,g,a) = 27 70 1074, #gen drafts = 1087, #acc drafts = 780, #gen tokens = 2169, #acc tokens = 1469, #mean acc len = 2.37, #acc rate/pos = (0.726, 0.642), dur(b,g,a) = 0.015, 228.471, 1.287 ms
0.49.097.254 I slot release: id 11 | task 0 | stop processing: n_tokens = 156, truncated = 0
0.49.097.466 I slot print_timing: id 12 | task 1 | prompt eval time = 301.38 ms / 29 tokens ( 10.39 ms per token, 96.23 tokens per second)
0.49.097.467 I slot print_timing: id 12 | task 1 | eval time = 8768.72 ms / 128 tokens ( 68.51 ms per token, 14.60 tokens per second)
0.49.097.468 I slot print_timing: id 12 | task 1 | total time = 9070.10 ms / 157 tokens
0.49.097.468 I slot print_timing: id 12 | task 1 | graphs reused = 1
0.49.097.469 I slot print_timing: id 12 | task 1 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.097.470 I statistics draft-mtp: #calls(b,g,a) = 27 70 1074, #gen drafts = 1087, #acc drafts = 780, #gen tokens = 2169, #acc tokens = 1469, #mean acc len = 2.37, #acc rate/pos = (0.726, 0.642), dur(b,g,a) = 0.015, 228.471, 1.287 ms
0.49.097.481 I slot release: id 12 | task 1 | stop processing: n_tokens = 156, truncated = 0
0.49.107.494 I srv operator(): Chat format: peg-native
0.49.107.508 I srv operator(): Chat format: peg-native
0.49.107.546 I srv operator(): Chat format: peg-native
0.49.197.519 I slot print_timing: id 1 | task 14 | prompt eval time = 230.39 ms / 29 tokens ( 7.94 ms per token, 125.87 tokens per second)
0.49.197.526 I slot print_timing: id 1 | task 14 | eval time = 8629.14 ms / 128 tokens ( 67.42 ms per token, 14.83 tokens per second)
0.49.197.526 I slot print_timing: id 1 | task 14 | total time = 8859.54 ms / 157 tokens
0.49.197.527 I slot print_timing: id 1 | task 14 | graphs reused = 1
0.49.197.530 I slot print_timing: id 1 | task 14 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.197.546 I statistics draft-mtp: #calls(b,g,a) = 27 71 1087, #gen drafts = 1098, #acc drafts = 788, #gen tokens = 2191, #acc tokens = 1483, #mean acc len = 2.36, #acc rate/pos = (0.725, 0.639), dur(b,g,a) = 0.015, 234.691, 1.306 ms
0.49.197.570 I slot release: id 1 | task 14 | stop processing: n_tokens = 156, truncated = 0
0.49.197.780 I slot print_timing: id 3 | task 13 | prompt eval time = 231.68 ms / 29 tokens ( 7.99 ms per token, 125.17 tokens per second)
0.49.197.782 I slot print_timing: id 3 | task 13 | eval time = 8628.09 ms / 128 tokens ( 67.41 ms per token, 14.84 tokens per second)
0.49.197.782 I slot print_timing: id 3 | task 13 | total time = 8859.77 ms / 157 tokens
0.49.197.783 I slot print_timing: id 3 | task 13 | graphs reused = 1
0.49.197.783 I slot print_timing: id 3 | task 13 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.49.197.785 I statistics draft-mtp: #calls(b,g,a) = 27 71 1087, #gen drafts = 1098, #acc drafts = 788, #gen tokens = 2191, #acc tokens = 1483, #mean acc len = 2.36, #acc rate/pos = (0.725, 0.639), dur(b,g,a) = 0.015, 234.691, 1.306 ms
0.49.197.795 I slot release: id 3 | task 13 | stop processing: n_tokens = 156, truncated = 0
0.49.203.605 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.49.203.670 I slot launch_slot_: id 1 | task 99 | processing task, is_child = 0
0.49.203.673 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.49.203.690 I slot launch_slot_: id 3 | task 100 | processing task, is_child = 0
0.49.203.692 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.49.203.706 I slot launch_slot_: id 9 | task 101 | processing task, is_child = 0
0.49.207.654 I srv operator(): Chat format: peg-native
0.49.208.027 I srv operator(): Chat format: peg-native
0.49.210.004 W slot operator(): id 1 | task 99 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.210.037 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.210.073 W slot operator(): id 3 | task 100 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.210.103 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.210.135 W slot operator(): id 9 | task 101 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.210.182 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.356.261 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.49.356.323 I slot launch_slot_: id 11 | task 103 | processing task, is_child = 0
0.49.356.326 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.49.356.345 I slot launch_slot_: id 12 | task 104 | processing task, is_child = 0
0.49.361.658 W slot operator(): id 11 | task 103 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.361.690 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.361.717 W slot operator(): id 12 | task 104 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.361.744 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.993.271 I slot print_timing: id 5 | task 60 | n_decoded = 102, tg = 23.50 t/s, tg_3s = 23.50 t/s
0.49.994.478 I slot print_timing: id 7 | task 61 | n_decoded = 102, tg = 23.50 t/s, tg_3s = 23.50 t/s
0.50.358.773 I slot print_timing: id 4 | task 58 | n_decoded = 101, tg = 20.68 t/s, tg_3s = 20.68 t/s
0.50.481.516 I slot print_timing: id 5 | task 60 | prompt eval time = 167.34 ms / 25 tokens ( 6.69 ms per token, 149.40 tokens per second)
0.50.481.518 I slot print_timing: id 5 | task 60 | eval time = 4828.28 ms / 114 tokens ( 42.35 ms per token, 23.61 tokens per second)
0.50.481.519 I slot print_timing: id 5 | task 60 | total time = 4995.62 ms / 139 tokens
0.50.481.519 I slot print_timing: id 5 | task 60 | graphs reused = 1
0.50.481.522 I slot print_timing: id 5 | task 60 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.50.481.537 I statistics draft-mtp: #calls(b,g,a) = 32 81 1241, #gen drafts = 1251, #acc drafts = 902, #gen tokens = 2497, #acc tokens = 1704, #mean acc len = 2.37, #acc rate/pos = (0.727, 0.646), dur(b,g,a) = 0.016, 270.092, 1.494 ms
0.50.481.565 I slot release: id 5 | task 60 | stop processing: n_tokens = 138, truncated = 0
0.50.482.776 I slot print_timing: id 7 | task 61 | prompt eval time = 167.91 ms / 25 tokens ( 6.72 ms per token, 148.89 tokens per second)
0.50.482.778 I slot print_timing: id 7 | task 61 | eval time = 4828.91 ms / 114 tokens ( 42.36 ms per token, 23.61 tokens per second)
0.50.482.779 I slot print_timing: id 7 | task 61 | total time = 4996.82 ms / 139 tokens
0.50.482.779 I slot print_timing: id 7 | task 61 | graphs reused = 1
0.50.482.780 I slot print_timing: id 7 | task 61 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.50.482.784 I statistics draft-mtp: #calls(b,g,a) = 32 81 1243, #gen drafts = 1251, #acc drafts = 904, #gen tokens = 2497, #acc tokens = 1708, #mean acc len = 2.37, #acc rate/pos = (0.727, 0.647), dur(b,g,a) = 0.016, 270.092, 1.497 ms
0.50.482.802 I slot release: id 7 | task 61 | stop processing: n_tokens = 138, truncated = 0
0.50.486.858 I slot print_timing: id 15 | task 63 | n_decoded = 101, tg = 20.90 t/s, tg_3s = 20.90 t/s
0.50.490.051 I srv operator(): Chat format: peg-native
0.50.491.326 I srv operator(): Chat format: peg-native
0.50.599.810 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.50.599.882 I slot launch_slot_: id 5 | task 115 | processing task, is_child = 0
0.50.599.887 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.50.599.902 I slot launch_slot_: id 7 | task 116 | processing task, is_child = 0
0.50.605.530 W slot operator(): id 5 | task 115 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.50.605.554 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.50.605.592 W slot operator(): id 7 | task 116 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.50.605.620 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.50.992.764 I slot print_timing: id 10 | task 74 | n_decoded = 102, tg = 23.44 t/s, tg_3s = 23.44 t/s
0.51.479.852 I slot print_timing: id 4 | task 58 | prompt eval time = 111.39 ms / 28 tokens ( 3.98 ms per token, 251.36 tokens per second)
0.51.479.854 I slot print_timing: id 4 | task 58 | eval time = 6005.67 ms / 125 tokens ( 48.05 ms per token, 20.81 tokens per second)
0.51.479.855 I slot print_timing: id 4 | task 58 | total time = 6117.06 ms / 153 tokens
0.51.479.856 I slot print_timing: id 4 | task 58 | graphs reused = 1
0.51.479.859 I slot print_timing: id 4 | task 58 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.51.479.870 I statistics draft-mtp: #calls(b,g,a) = 34 89 1364, #gen drafts = 1375, #acc drafts = 987, #gen tokens = 2745, #acc tokens = 1866, #mean acc len = 2.37, #acc rate/pos = (0.724, 0.644), dur(b,g,a) = 0.018, 299.457, 1.652 ms
0.51.479.898 I slot release: id 4 | task 58 | stop processing: n_tokens = 152, truncated = 0
0.51.481.150 I slot print_timing: id 6 | task 73 | n_decoded = 101, tg = 20.87 t/s, tg_3s = 20.87 t/s
0.51.482.954 I slot print_timing: id 10 | task 74 | prompt eval time = 140.27 ms / 25 tokens ( 5.61 ms per token, 178.22 tokens per second)
0.51.482.956 I slot print_timing: id 10 | task 74 | eval time = 4841.28 ms / 114 tokens ( 42.47 ms per token, 23.55 tokens per second)
0.51.482.957 I slot print_timing: id 10 | task 74 | total time = 4981.55 ms / 139 tokens
0.51.482.957 I slot print_timing: id 10 | task 74 | graphs reused = 1
0.51.482.960 I slot print_timing: id 10 | task 74 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.51.482.970 I statistics draft-mtp: #calls(b,g,a) = 34 89 1370, #gen drafts = 1375, #acc drafts = 991, #gen tokens = 2745, #acc tokens = 1874, #mean acc len = 2.37, #acc rate/pos = (0.723, 0.645), dur(b,g,a) = 0.018, 299.457, 1.658 ms
0.51.482.990 I slot release: id 10 | task 74 | stop processing: n_tokens = 138, truncated = 0
0.51.488.774 I srv operator(): Chat format: peg-native
0.51.492.454 I srv operator(): Chat format: peg-native
0.51.597.013 I slot print_timing: id 14 | task 77 | n_decoded = 101, tg = 21.02 t/s, tg_3s = 21.02 t/s
0.51.597.643 I slot print_timing: id 15 | task 63 | prompt eval time = 169.15 ms / 28 tokens ( 6.04 ms per token, 165.53 tokens per second)
0.51.597.646 I slot print_timing: id 15 | task 63 | eval time = 5942.44 ms / 125 tokens ( 47.54 ms per token, 21.04 tokens per second)
0.51.597.647 I slot print_timing: id 15 | task 63 | total time = 6111.59 ms / 153 tokens
0.51.597.648 I slot print_timing: id 15 | task 63 | graphs reused = 1
0.51.597.651 I slot print_timing: id 15 | task 63 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.51.597.663 I statistics draft-mtp: #calls(b,g,a) = 34 90 1389, #gen drafts = 1389, #acc drafts = 1006, #gen tokens = 2773, #acc tokens = 1904, #mean acc len = 2.37, #acc rate/pos = (0.724, 0.647), dur(b,g,a) = 0.018, 305.042, 1.687 ms
0.51.597.690 I slot release: id 15 | task 63 | stop processing: n_tokens = 152, truncated = 0
0.51.597.704 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.51.597.771 I slot launch_slot_: id 4 | task 125 | processing task, is_child = 0
0.51.597.774 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.51.597.789 I slot launch_slot_: id 15 | task 126 | processing task, is_child = 0
0.51.603.595 W slot operator(): id 4 | task 125 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.603.630 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.51.603.665 W slot operator(): id 15 | task 126 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.603.695 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.51.606.596 I srv operator(): Chat format: peg-native
0.51.743.262 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.51.743.333 I slot launch_slot_: id 10 | task 128 | processing task, is_child = 0
0.51.747.828 W slot operator(): id 10 | task 128 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.747.849 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.117.055 I slot print_timing: id 0 | task 57 | n_decoded = 100, tg = 15.05 t/s, tg_3s = 15.05 t/s
0.52.243.744 I slot print_timing: id 8 | task 62 | n_decoded = 100, tg = 15.18 t/s, tg_3s = 15.18 t/s
0.52.608.194 I slot print_timing: id 6 | task 73 | prompt eval time = 140.06 ms / 28 tokens ( 5.00 ms per token, 199.91 tokens per second)
0.52.608.197 I slot print_timing: id 6 | task 73 | eval time = 5966.77 ms / 125 tokens ( 47.73 ms per token, 20.95 tokens per second)
0.52.608.198 I slot print_timing: id 6 | task 73 | total time = 6106.83 ms / 153 tokens
0.52.608.199 I slot print_timing: id 6 | task 73 | graphs reused = 1
0.52.608.201 I slot print_timing: id 6 | task 73 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.52.608.219 I statistics draft-mtp: #calls(b,g,a) = 37 98 1504, #gen drafts = 1513, #acc drafts = 1088, #gen tokens = 3021, #acc tokens = 2055, #mean acc len = 2.37, #acc rate/pos = (0.723, 0.643), dur(b,g,a) = 0.020, 333.482, 1.832 ms
0.52.608.248 I slot release: id 6 | task 73 | stop processing: n_tokens = 152, truncated = 0
0.52.617.121 I srv operator(): Chat format: peg-native
0.52.730.157 I slot print_timing: id 14 | task 77 | prompt eval time = 139.94 ms / 28 tokens ( 5.00 ms per token, 200.09 tokens per second)
0.52.730.160 I slot print_timing: id 14 | task 77 | eval time = 5937.62 ms / 125 tokens ( 47.50 ms per token, 21.05 tokens per second)
0.52.730.160 I slot print_timing: id 14 | task 77 | total time = 6077.56 ms / 153 tokens
0.52.730.161 I slot print_timing: id 14 | task 77 | graphs reused = 1
0.52.730.164 I slot print_timing: id 14 | task 77 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.52.730.174 I statistics draft-mtp: #calls(b,g,a) = 37 99 1527, #gen drafts = 1528, #acc drafts = 1105, #gen tokens = 3051, #acc tokens = 2088, #mean acc len = 2.37, #acc rate/pos = (0.724, 0.644), dur(b,g,a) = 0.020, 338.076, 1.861 ms
0.52.730.204 I slot release: id 14 | task 77 | stop processing: n_tokens = 152, truncated = 0
0.52.730.847 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.52.730.915 I slot launch_slot_: id 6 | task 137 | processing task, is_child = 0
0.52.738.698 I srv operator(): Chat format: peg-native
0.52.740.611 W slot operator(): id 6 | task 137 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.740.652 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.867.467 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.52.867.537 I slot launch_slot_: id 14 | task 139 | processing task, is_child = 0
0.52.871.518 W slot operator(): id 14 | task 139 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.871.545 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.53.244.362 I slot print_timing: id 2 | task 72 | n_decoded = 100, tg = 15.14 t/s, tg_3s = 15.14 t/s
0.53.372.705 I slot print_timing: id 13 | task 76 | n_decoded = 100, tg = 15.20 t/s, tg_3s = 15.20 t/s
0.53.732.323 I slot print_timing: id 1 | task 99 | n_decoded = 102, tg = 23.27 t/s, tg_3s = 23.27 t/s
0.53.858.674 I slot print_timing: id 11 | task 103 | n_decoded = 102, tg = 23.41 t/s, tg_3s = 23.41 t/s
0.54.216.118 I slot print_timing: id 0 | task 57 | prompt eval time = 111.18 ms / 29 tokens ( 3.83 ms per token, 260.84 tokens per second)
0.54.216.123 I slot print_timing: id 0 | task 57 | eval time = 8742.22 ms / 128 tokens ( 68.30 ms per token, 14.64 tokens per second)
0.54.216.124 I slot print_timing: id 0 | task 57 | total time = 8853.40 ms / 157 tokens
0.54.216.125 I slot print_timing: id 0 | task 57 | graphs reused = 1
0.54.216.127 I slot print_timing: id 0 | task 57 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.54.216.142 I statistics draft-mtp: #calls(b,g,a) = 39 111 1701, #gen drafts = 1716, #acc drafts = 1220, #gen tokens = 3425, #acc tokens = 2306, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.638), dur(b,g,a) = 0.022, 381.911, 2.080 ms
0.54.216.172 I slot release: id 0 | task 57 | stop processing: n_tokens = 156, truncated = 0
0.54.216.887 I slot print_timing: id 1 | task 99 | prompt eval time = 139.33 ms / 25 tokens ( 5.57 ms per token, 179.43 tokens per second)
0.54.216.890 I slot print_timing: id 1 | task 99 | eval time = 4867.49 ms / 114 tokens ( 42.70 ms per token, 23.42 tokens per second)
0.54.216.890 I slot print_timing: id 1 | task 99 | total time = 5006.82 ms / 139 tokens
0.54.216.891 I slot print_timing: id 1 | task 99 | graphs reused = 1
0.54.216.892 I slot print_timing: id 1 | task 99 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.54.216.897 I statistics draft-mtp: #calls(b,g,a) = 39 111 1702, #gen drafts = 1716, #acc drafts = 1221, #gen tokens = 3425, #acc tokens = 2308, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.639), dur(b,g,a) = 0.022, 381.911, 2.082 ms
0.54.216.918 I slot release: id 1 | task 99 | stop processing: n_tokens = 138, truncated = 0
0.54.220.820 I slot print_timing: id 9 | task 101 | n_decoded = 101, tg = 20.74 t/s, tg_3s = 20.74 t/s
0.54.226.008 I srv operator(): Chat format: peg-native
0.54.226.015 I srv operator(): Chat format: peg-native
0.54.325.049 I slot print_timing: id 8 | task 62 | prompt eval time = 168.61 ms / 29 tokens ( 5.81 ms per token, 172.00 tokens per second)
0.54.325.053 I slot print_timing: id 8 | task 62 | eval time = 8670.44 ms / 128 tokens ( 67.74 ms per token, 14.76 tokens per second)
0.54.325.054 I slot print_timing: id 8 | task 62 | total time = 8839.04 ms / 157 tokens
0.54.325.054 I slot print_timing: id 8 | task 62 | graphs reused = 1
0.54.325.057 I slot print_timing: id 8 | task 62 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.54.325.071 I statistics draft-mtp: #calls(b,g,a) = 39 112 1716, #gen drafts = 1729, #acc drafts = 1231, #gen tokens = 3451, #acc tokens = 2326, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.638), dur(b,g,a) = 0.022, 386.508, 2.104 ms
0.54.325.098 I slot release: id 8 | task 62 | stop processing: n_tokens = 156, truncated = 0
0.54.330.374 I slot print_timing: id 11 | task 103 | prompt eval time = 139.66 ms / 25 tokens ( 5.59 ms per token, 179.00 tokens per second)
0.54.330.378 I slot print_timing: id 11 | task 103 | eval time = 4829.01 ms / 114 tokens ( 42.36 ms per token, 23.61 tokens per second)
0.54.330.379 I slot print_timing: id 11 | task 103 | total time = 4968.68 ms / 139 tokens
0.54.330.379 I slot print_timing: id 11 | task 103 | graphs reused = 1
0.54.330.382 I slot print_timing: id 11 | task 103 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.54.330.393 I statistics draft-mtp: #calls(b,g,a) = 39 112 1725, #gen drafts = 1729, #acc drafts = 1239, #gen tokens = 3451, #acc tokens = 2342, #mean acc len = 2.36, #acc rate/pos = (0.718, 0.639), dur(b,g,a) = 0.022, 386.508, 2.120 ms
0.54.330.419 I slot release: id 11 | task 103 | stop processing: n_tokens = 138, truncated = 0
0.54.332.668 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.54.332.737 I slot launch_slot_: id 1 | task 153 | processing task, is_child = 0
0.54.332.740 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.54.332.759 I slot launch_slot_: id 0 | task 152 | processing task, is_child = 0
0.54.333.497 I srv operator(): Chat format: peg-native
0.54.337.966 W slot operator(): id 0 | task 152 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.338.016 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.338.038 W slot operator(): id 1 | task 153 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.338.071 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.340.494 I srv operator(): Chat format: peg-native
0.54.469.426 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.54.469.488 I slot launch_slot_: id 8 | task 155 | processing task, is_child = 0
0.54.469.491 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.54.469.512 I slot launch_slot_: id 11 | task 156 | processing task, is_child = 0
0.54.475.200 W slot operator(): id 8 | task 155 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.475.229 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.475.264 W slot operator(): id 11 | task 156 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.475.304 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.103.190 I slot print_timing: id 7 | task 116 | n_decoded = 102, tg = 23.40 t/s, tg_3s = 23.40 t/s
0.55.343.414 I slot print_timing: id 2 | task 72 | prompt eval time = 139.86 ms / 29 tokens ( 4.82 ms per token, 207.35 tokens per second)
0.55.343.419 I slot print_timing: id 2 | task 72 | eval time = 8702.28 ms / 128 tokens ( 67.99 ms per token, 14.71 tokens per second)
0.55.343.419 I slot print_timing: id 2 | task 72 | total time = 8842.14 ms / 157 tokens
0.55.343.420 I slot print_timing: id 2 | task 72 | graphs reused = 1
0.55.343.423 I slot print_timing: id 2 | task 72 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.55.343.437 I statistics draft-mtp: #calls(b,g,a) = 43 120 1835, #gen drafts = 1850, #acc drafts = 1310, #gen tokens = 3691, #acc tokens = 2477, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.636), dur(b,g,a) = 0.024, 416.426, 2.253 ms
0.55.343.466 I slot release: id 2 | task 72 | stop processing: n_tokens = 156, truncated = 0
0.55.348.186 I slot print_timing: id 9 | task 101 | prompt eval time = 139.75 ms / 28 tokens ( 4.99 ms per token, 200.36 tokens per second)
0.55.348.190 I slot print_timing: id 9 | task 101 | eval time = 5998.27 ms / 125 tokens ( 47.99 ms per token, 20.84 tokens per second)
0.55.348.190 I slot print_timing: id 9 | task 101 | total time = 6138.02 ms / 153 tokens
0.55.348.191 I slot print_timing: id 9 | task 101 | graphs reused = 1
0.55.348.194 I slot print_timing: id 9 | task 101 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.55.348.199 I statistics draft-mtp: #calls(b,g,a) = 43 120 1844, #gen drafts = 1850, #acc drafts = 1317, #gen tokens = 3691, #acc tokens = 2490, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.636), dur(b,g,a) = 0.024, 416.426, 2.267 ms
0.55.348.221 I slot release: id 9 | task 101 | stop processing: n_tokens = 152, truncated = 0
0.55.352.691 I srv operator(): Chat format: peg-native
0.55.357.290 I srv operator(): Chat format: peg-native
0.55.454.473 I slot print_timing: id 13 | task 76 | prompt eval time = 139.34 ms / 29 tokens ( 4.80 ms per token, 208.13 tokens per second)
0.55.454.476 I slot print_timing: id 13 | task 76 | eval time = 8662.60 ms / 128 tokens ( 67.68 ms per token, 14.78 tokens per second)
0.55.454.477 I slot print_timing: id 13 | task 76 | total time = 8801.93 ms / 157 tokens
0.55.454.477 I slot print_timing: id 13 | task 76 | graphs reused = 1
0.55.454.480 I slot print_timing: id 13 | task 76 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.55.454.494 I statistics draft-mtp: #calls(b,g,a) = 43 121 1850, #gen drafts = 1863, #acc drafts = 1321, #gen tokens = 3717, #acc tokens = 2498, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.636), dur(b,g,a) = 0.024, 422.435, 2.274 ms
0.55.454.519 I slot release: id 13 | task 76 | stop processing: n_tokens = 156, truncated = 0
0.55.461.503 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.55.461.570 I slot launch_slot_: id 2 | task 165 | processing task, is_child = 0
0.55.461.573 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.55.461.590 I slot launch_slot_: id 9 | task 166 | processing task, is_child = 0
0.55.464.278 I srv operator(): Chat format: peg-native
0.55.467.618 W slot operator(): id 2 | task 165 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.467.646 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.467.687 W slot operator(): id 9 | task 166 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.467.714 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.603.484 I slot print_timing: id 5 | task 115 | n_decoded = 101, tg = 20.79 t/s, tg_3s = 20.79 t/s
0.55.604.375 I slot print_timing: id 7 | task 116 | prompt eval time = 139.16 ms / 25 tokens ( 5.57 ms per token, 179.65 tokens per second)
0.55.604.380 I slot print_timing: id 7 | task 116 | eval time = 4859.59 ms / 114 tokens ( 42.63 ms per token, 23.46 tokens per second)
0.55.604.380 I slot print_timing: id 7 | task 116 | total time = 4998.75 ms / 139 tokens
0.55.604.381 I slot print_timing: id 7 | task 116 | graphs reused = 1
0.55.604.386 I slot print_timing: id 7 | task 116 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.55.604.404 I statistics draft-mtp: #calls(b,g,a) = 45 122 1870, #gen drafts = 1876, #acc drafts = 1335, #gen tokens = 3743, #acc tokens = 2526, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.637), dur(b,g,a) = 0.025, 428.382, 2.303 ms
0.55.604.433 I slot release: id 7 | task 116 | stop processing: n_tokens = 138, truncated = 0
0.55.607.814 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.55.607.881 I slot launch_slot_: id 7 | task 168 | processing task, is_child = 0
0.55.612.828 I srv operator(): Chat format: peg-native
0.55.613.483 W slot operator(): id 7 | task 168 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.613.518 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.739.049 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.55.739.117 I slot launch_slot_: id 13 | task 170 | processing task, is_child = 0
0.55.743.194 W slot operator(): id 13 | task 170 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.743.236 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.236.932 I slot print_timing: id 3 | task 100 | n_decoded = 100, tg = 14.52 t/s, tg_3s = 14.52 t/s
0.56.240.085 I slot print_timing: id 10 | task 128 | n_decoded = 102, tg = 23.35 t/s, tg_3s = 23.35 t/s
0.56.364.972 I slot print_timing: id 12 | task 104 | n_decoded = 100, tg = 14.57 t/s, tg_3s = 14.57 t/s
0.56.611.008 I slot print_timing: id 15 | task 126 | n_decoded = 101, tg = 20.72 t/s, tg_3s = 20.72 t/s
0.56.727.445 I slot print_timing: id 5 | task 115 | prompt eval time = 138.94 ms / 28 tokens ( 4.96 ms per token, 201.52 tokens per second)
0.56.727.450 I slot print_timing: id 5 | task 115 | eval time = 5982.91 ms / 125 tokens ( 47.86 ms per token, 20.89 tokens per second)
0.56.727.451 I slot print_timing: id 5 | task 115 | total time = 6121.86 ms / 153 tokens
0.56.727.452 I slot print_timing: id 5 | task 115 | graphs reused = 1
0.56.727.455 I slot print_timing: id 5 | task 115 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.56.727.466 I statistics draft-mtp: #calls(b,g,a) = 47 131 2007, #gen drafts = 2017, #acc drafts = 1434, #gen tokens = 4025, #acc tokens = 2713, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.637), dur(b,g,a) = 0.027, 459.365, 2.485 ms
0.56.727.495 I slot release: id 5 | task 115 | stop processing: n_tokens = 152, truncated = 0
0.56.730.086 I slot print_timing: id 10 | task 128 | prompt eval time = 124.76 ms / 25 tokens ( 4.99 ms per token, 200.39 tokens per second)
0.56.730.088 I slot print_timing: id 10 | task 128 | eval time = 4857.46 ms / 114 tokens ( 42.61 ms per token, 23.47 tokens per second)
0.56.730.088 I slot print_timing: id 10 | task 128 | total time = 4982.22 ms / 139 tokens
0.56.730.089 I slot print_timing: id 10 | task 128 | graphs reused = 1
0.56.730.091 I slot print_timing: id 10 | task 128 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.56.730.097 I statistics draft-mtp: #calls(b,g,a) = 47 131 2012, #gen drafts = 2017, #acc drafts = 1438, #gen tokens = 4025, #acc tokens = 2720, #mean acc len = 2.35, #acc rate/pos = (0.715, 0.637), dur(b,g,a) = 0.027, 459.365, 2.490 ms
0.56.730.118 I slot release: id 10 | task 128 | stop processing: n_tokens = 138, truncated = 0
0.56.736.000 I srv operator(): Chat format: peg-native
0.56.738.493 I srv operator(): Chat format: peg-native
0.56.844.253 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.56.844.323 I slot launch_slot_: id 5 | task 180 | processing task, is_child = 0
0.56.844.327 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.56.844.344 I slot launch_slot_: id 10 | task 181 | processing task, is_child = 0
0.56.850.187 W slot operator(): id 5 | task 180 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.850.205 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.850.248 W slot operator(): id 10 | task 181 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.850.272 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.57.730.126 I slot print_timing: id 15 | task 126 | prompt eval time = 133.18 ms / 28 tokens ( 4.76 ms per token, 210.24 tokens per second)
0.57.730.129 I slot print_timing: id 15 | task 126 | eval time = 5993.24 ms / 125 tokens ( 47.95 ms per token, 20.86 tokens per second)
0.57.730.130 I slot print_timing: id 15 | task 126 | total time = 6126.41 ms / 153 tokens
0.57.730.131 I slot print_timing: id 15 | task 126 | graphs reused = 1
0.57.730.134 I slot print_timing: id 15 | task 126 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.57.730.145 I statistics draft-mtp: #calls(b,g,a) = 49 139 2141, #gen drafts = 2141, #acc drafts = 1525, #gen tokens = 4273, #acc tokens = 2885, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.635), dur(b,g,a) = 0.028, 489.184, 2.644 ms
0.57.730.174 I slot release: id 15 | task 126 | stop processing: n_tokens = 152, truncated = 0
0.57.738.854 I srv operator(): Chat format: peg-native
0.57.844.610 I slot print_timing: id 14 | task 139 | n_decoded = 101, tg = 20.84 t/s, tg_3s = 20.84 t/s
0.57.844.620 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.57.844.686 I slot launch_slot_: id 15 | task 190 | processing task, is_child = 0
0.57.847.736 W slot operator(): id 15 | task 190 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.57.847.756 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.338.829 I slot print_timing: id 3 | task 100 | prompt eval time = 139.54 ms / 29 tokens ( 4.81 ms per token, 207.82 tokens per second)
0.58.338.834 I slot print_timing: id 3 | task 100 | eval time = 8989.18 ms / 128 tokens ( 70.23 ms per token, 14.24 tokens per second)
0.58.338.835 I slot print_timing: id 3 | task 100 | total time = 9128.72 ms / 157 tokens
0.58.338.836 I slot print_timing: id 3 | task 100 | graphs reused = 1
0.58.338.839 I slot print_timing: id 3 | task 100 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
0.58.338.865 I statistics draft-mtp: #calls(b,g,a) = 50 144 2203, #gen drafts = 2218, #acc drafts = 1567, #gen tokens = 4425, #acc tokens = 2966, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.635), dur(b,g,a) = 0.029, 505.474, 2.716 ms
0.58.338.895 I slot release: id 3 | task 100 | stop processing: n_tokens = 156, truncated = 0
0.58.341.239 I slot print_timing: id 4 | task 125 | n_decoded = 100, tg = 15.14 t/s, tg_3s = 15.14 t/s
0.58.348.350 I srv operator(): Chat format: peg-native
0.58.456.194 I slot print_timing: id 12 | task 104 | prompt eval time = 140.53 ms / 29 tokens ( 4.85 ms per token, 206.36 tokens per second)
0.58.456.199 I slot print_timing: id 12 | task 104 | eval time = 8953.91 ms / 128 tokens ( 69.95 ms per token, 14.30 tokens per second)
0.58.456.200 I slot print_timing: id 12 | task 104 | total time = 9094.45 ms / 157 tokens
0.58.456.201 I slot print_timing: id 12 | task 104 | graphs reused = 1
0.58.456.204 I slot print_timing: id 12 | task 104 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
0.58.456.217 I statistics draft-mtp: #calls(b,g,a) = 50 145 2218, #gen drafts = 2232, #acc drafts = 1577, #gen tokens = 4453, #acc tokens = 2984, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.634), dur(b,g,a) = 0.029, 510.947, 2.733 ms
0.58.456.238 I slot release: id 12 | task 104 | stop processing: n_tokens = 156, truncated = 0
0.58.464.137 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.58.464.206 I slot launch_slot_: id 3 | task 196 | processing task, is_child = 0
0.58.464.887 I srv operator(): Chat format: peg-native
0.58.469.779 W slot operator(): id 3 | task 196 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.58.469.811 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.596.000 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.58.596.068 I slot launch_slot_: id 12 | task 198 | processing task, is_child = 0
0.58.600.751 W slot operator(): id 12 | task 198 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.58.600.769 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.848.562 I slot print_timing: id 1 | task 153 | n_decoded = 102, tg = 23.26 t/s, tg_3s = 23.26 t/s
0.58.975.780 I slot print_timing: id 11 | task 156 | n_decoded = 102, tg = 23.39 t/s, tg_3s = 23.39 t/s
0.58.977.615 I slot print_timing: id 14 | task 139 | prompt eval time = 126.59 ms / 28 tokens ( 4.52 ms per token, 221.18 tokens per second)
0.58.977.617 I slot print_timing: id 14 | task 139 | eval time = 5979.48 ms / 125 tokens ( 47.84 ms per token, 20.90 tokens per second)
0.58.977.618 I slot print_timing: id 14 | task 139 | total time = 6106.07 ms / 153 tokens
0.58.977.619 I slot print_timing: id 14 | task 139 | graphs reused = 1
0.58.977.622 I slot print_timing: id 14 | task 139 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.58.977.634 I statistics draft-mtp: #calls(b,g,a) = 52 149 2292, #gen drafts = 2293, #acc drafts = 1631, #gen tokens = 4575, #acc tokens = 3088, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.636), dur(b,g,a) = 0.031, 527.115, 2.819 ms
0.58.977.665 I slot release: id 14 | task 139 | stop processing: n_tokens = 152, truncated = 0
0.58.986.851 I srv operator(): Chat format: peg-native
0.59.095.249 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.59.095.317 I slot launch_slot_: id 14 | task 203 | processing task, is_child = 0
0.59.099.354 W slot operator(): id 14 | task 203 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.099.380 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.349.404 I slot print_timing: id 1 | task 153 | prompt eval time = 125.53 ms / 25 tokens ( 5.02 ms per token, 199.16 tokens per second)
0.59.349.407 I slot print_timing: id 1 | task 153 | eval time = 4885.79 ms / 114 tokens ( 42.86 ms per token, 23.33 tokens per second)
0.59.349.407 I slot print_timing: id 1 | task 153 | total time = 5011.31 ms / 139 tokens
0.59.349.408 I slot print_timing: id 1 | task 153 | graphs reused = 1
0.59.349.411 I slot print_timing: id 1 | task 153 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.59.349.425 I statistics draft-mtp: #calls(b,g,a) = 53 152 2325, #gen drafts = 2339, #acc drafts = 1653, #gen tokens = 4667, #acc tokens = 3129, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.635), dur(b,g,a) = 0.032, 538.171, 2.863 ms
0.59.349.450 I slot release: id 1 | task 153 | stop processing: n_tokens = 138, truncated = 0
0.59.358.699 I srv operator(): Chat format: peg-native
0.59.469.141 I slot print_timing: id 6 | task 137 | n_decoded = 100, tg = 15.13 t/s, tg_3s = 15.13 t/s
0.59.470.334 I slot print_timing: id 8 | task 155 | n_decoded = 101, tg = 20.80 t/s, tg_3s = 20.80 t/s
0.59.472.122 I slot print_timing: id 11 | task 156 | prompt eval time = 138.76 ms / 25 tokens ( 5.55 ms per token, 180.17 tokens per second)
0.59.472.126 I slot print_timing: id 11 | task 156 | eval time = 4858.05 ms / 114 tokens ( 42.61 ms per token, 23.47 tokens per second)
0.59.472.126 I slot print_timing: id 11 | task 156 | total time = 4996.81 ms / 139 tokens
0.59.472.128 I slot print_timing: id 11 | task 156 | graphs reused = 1
0.59.472.131 I slot print_timing: id 11 | task 156 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.59.472.141 I statistics draft-mtp: #calls(b,g,a) = 53 153 2350, #gen drafts = 2354, #acc drafts = 1674, #gen tokens = 4697, #acc tokens = 3169, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.636), dur(b,g,a) = 0.032, 542.071, 2.897 ms
0.59.472.168 I slot release: id 11 | task 156 | stop processing: n_tokens = 138, truncated = 0
0.59.474.324 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.59.474.397 I slot launch_slot_: id 1 | task 207 | processing task, is_child = 0
0.59.479.608 W slot operator(): id 1 | task 207 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.479.639 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.480.521 I srv operator(): Chat format: peg-native
0.59.605.758 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.59.605.825 I slot launch_slot_: id 11 | task 209 | processing task, is_child = 0
0.59.610.281 W slot operator(): id 11 | task 209 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.610.298 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.103.408 I slot print_timing: id 7 | task 168 | n_decoded = 102, tg = 23.33 t/s, tg_3s = 23.33 t/s
1.00.464.206 I slot print_timing: id 4 | task 125 | prompt eval time = 132.97 ms / 29 tokens ( 4.59 ms per token, 218.09 tokens per second)
1.00.464.211 I slot print_timing: id 4 | task 125 | eval time = 8727.61 ms / 128 tokens ( 68.18 ms per token, 14.67 tokens per second)
1.00.464.212 I slot print_timing: id 4 | task 125 | total time = 8860.58 ms / 157 tokens
1.00.464.212 I slot print_timing: id 4 | task 125 | graphs reused = 1
1.00.464.216 I slot print_timing: id 4 | task 125 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.00.464.230 I statistics draft-mtp: #calls(b,g,a) = 55 161 2463, #gen drafts = 2478, #acc drafts = 1748, #gen tokens = 4944, #acc tokens = 3309, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.634), dur(b,g,a) = 0.034, 571.141, 3.044 ms
1.00.464.254 I slot release: id 4 | task 125 | stop processing: n_tokens = 156, truncated = 0
1.00.469.104 I slot print_timing: id 9 | task 166 | n_decoded = 101, tg = 20.75 t/s, tg_3s = 20.75 t/s
1.00.473.124 I srv operator(): Chat format: peg-native
1.00.585.329 I slot print_timing: id 7 | task 168 | prompt eval time = 118.16 ms / 25 tokens ( 4.73 ms per token, 211.58 tokens per second)
1.00.585.332 I slot print_timing: id 7 | task 168 | eval time = 4853.65 ms / 114 tokens ( 42.58 ms per token, 23.49 tokens per second)
1.00.585.332 I slot print_timing: id 7 | task 168 | total time = 4971.81 ms / 139 tokens
1.00.585.333 I slot print_timing: id 7 | task 168 | graphs reused = 1
1.00.585.336 I slot print_timing: id 7 | task 168 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.00.585.346 I statistics draft-mtp: #calls(b,g,a) = 55 162 2485, #gen drafts = 2493, #acc drafts = 1766, #gen tokens = 4974, #acc tokens = 3344, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.635), dur(b,g,a) = 0.034, 575.513, 3.075 ms
1.00.585.377 I slot release: id 7 | task 168 | stop processing: n_tokens = 138, truncated = 0
1.00.586.014 I slot print_timing: id 8 | task 155 | prompt eval time = 138.55 ms / 28 tokens ( 4.95 ms per token, 202.09 tokens per second)
1.00.586.017 I slot print_timing: id 8 | task 155 | eval time = 5972.22 ms / 125 tokens ( 47.78 ms per token, 20.93 tokens per second)
1.00.586.017 I slot print_timing: id 8 | task 155 | total time = 6110.77 ms / 153 tokens
1.00.586.018 I slot print_timing: id 8 | task 155 | graphs reused = 1
1.00.586.019 I slot print_timing: id 8 | task 155 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.00.586.023 I statistics draft-mtp: #calls(b,g,a) = 55 162 2486, #gen drafts = 2493, #acc drafts = 1767, #gen tokens = 4974, #acc tokens = 3346, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.635), dur(b,g,a) = 0.034, 575.513, 3.076 ms
1.00.586.039 I slot release: id 8 | task 155 | stop processing: n_tokens = 152, truncated = 0
1.00.589.778 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.00.589.848 I slot launch_slot_: id 4 | task 218 | processing task, is_child = 0
1.00.594.255 I srv operator(): Chat format: peg-native
1.00.594.415 I srv operator(): Chat format: peg-native
1.00.596.012 W slot operator(): id 4 | task 218 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.596.047 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.714.891 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.00.714.957 I slot launch_slot_: id 8 | task 220 | processing task, is_child = 0
1.00.714.960 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.00.714.981 I slot launch_slot_: id 7 | task 221 | processing task, is_child = 0
1.00.719.856 W slot operator(): id 7 | task 221 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.719.897 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.719.929 W slot operator(): id 8 | task 220 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.719.962 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.102.785 I slot print_timing: id 0 | task 152 | n_decoded = 100, tg = 15.06 t/s, tg_3s = 15.06 t/s
1.01.353.451 I slot print_timing: id 10 | task 181 | n_decoded = 102, tg = 23.37 t/s, tg_3s = 23.37 t/s
1.01.592.479 I slot print_timing: id 6 | task 137 | prompt eval time = 120.15 ms / 29 tokens ( 4.14 ms per token, 241.37 tokens per second)
1.01.592.486 I slot print_timing: id 6 | task 137 | eval time = 8731.69 ms / 128 tokens ( 68.22 ms per token, 14.66 tokens per second)
1.01.592.487 I slot print_timing: id 6 | task 137 | total time = 8851.84 ms / 157 tokens
1.01.592.488 I slot print_timing: id 6 | task 137 | graphs reused = 1
1.01.592.491 I slot print_timing: id 6 | task 137 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.01.592.505 I statistics draft-mtp: #calls(b,g,a) = 58 170 2600, #gen drafts = 2615, #acc drafts = 1846, #gen tokens = 5217, #acc tokens = 3495, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.634), dur(b,g,a) = 0.035, 606.227, 3.217 ms
1.01.592.531 I slot release: id 6 | task 137 | stop processing: n_tokens = 156, truncated = 0
1.01.597.115 I slot print_timing: id 9 | task 166 | prompt eval time = 133.25 ms / 28 tokens ( 4.76 ms per token, 210.13 tokens per second)
1.01.597.117 I slot print_timing: id 9 | task 166 | eval time = 5996.14 ms / 125 tokens ( 47.97 ms per token, 20.85 tokens per second)
1.01.597.118 I slot print_timing: id 9 | task 166 | total time = 6129.39 ms / 153 tokens
1.01.597.119 I slot print_timing: id 9 | task 166 | graphs reused = 1
1.01.597.121 I slot print_timing: id 9 | task 166 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.01.597.128 I statistics draft-mtp: #calls(b,g,a) = 58 170 2609, #gen drafts = 2615, #acc drafts = 1852, #gen tokens = 5217, #acc tokens = 3507, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.634), dur(b,g,a) = 0.035, 606.227, 3.229 ms
1.01.597.150 I slot release: id 9 | task 166 | stop processing: n_tokens = 152, truncated = 0
1.01.603.480 I srv operator(): Chat format: peg-native
1.01.607.311 I srv operator(): Chat format: peg-native
1.01.711.857 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.01.711.928 I slot launch_slot_: id 6 | task 230 | processing task, is_child = 0
1.01.711.931 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.01.711.948 I slot launch_slot_: id 9 | task 231 | processing task, is_child = 0
1.01.717.498 W slot operator(): id 6 | task 230 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.717.531 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.717.567 W slot operator(): id 9 | task 231 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.717.588 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.860.107 I slot print_timing: id 5 | task 180 | n_decoded = 101, tg = 20.73 t/s, tg_3s = 20.73 t/s
1.01.861.953 I slot print_timing: id 10 | task 181 | prompt eval time = 139.04 ms / 25 tokens ( 5.56 ms per token, 179.80 tokens per second)
1.01.861.955 I slot print_timing: id 10 | task 181 | eval time = 4872.63 ms / 114 tokens ( 42.74 ms per token, 23.40 tokens per second)
1.01.861.955 I slot print_timing: id 10 | task 181 | total time = 5011.67 ms / 139 tokens
1.01.861.956 I slot print_timing: id 10 | task 181 | graphs reused = 1
1.01.861.959 I slot print_timing: id 10 | task 181 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.01.861.970 I statistics draft-mtp: #calls(b,g,a) = 60 172 2638, #gen drafts = 2643, #acc drafts = 1872, #gen tokens = 5273, #acc tokens = 3546, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.635), dur(b,g,a) = 0.036, 617.617, 3.264 ms
1.01.861.997 I slot release: id 10 | task 181 | stop processing: n_tokens = 138, truncated = 0
1.01.871.011 I srv operator(): Chat format: peg-native
1.01.981.636 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.01.981.706 I slot launch_slot_: id 10 | task 234 | processing task, is_child = 0
1.01.986.566 W slot operator(): id 10 | task 234 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.986.596 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.02.481.618 I slot print_timing: id 2 | task 165 | n_decoded = 100, tg = 14.53 t/s, tg_3s = 14.53 t/s
1.02.731.185 I slot print_timing: id 13 | task 170 | n_decoded = 100, tg = 14.57 t/s, tg_3s = 14.57 t/s
1.02.971.111 I slot print_timing: id 5 | task 180 | prompt eval time = 138.82 ms / 28 tokens ( 4.96 ms per token, 201.69 tokens per second)
1.02.971.114 I slot print_timing: id 5 | task 180 | eval time = 5982.06 ms / 125 tokens ( 47.86 ms per token, 20.90 tokens per second)
1.02.971.114 I slot print_timing: id 5 | task 180 | total time = 6120.88 ms / 153 tokens
1.02.971.116 I slot print_timing: id 5 | task 180 | graphs reused = 1
1.02.971.119 I slot print_timing: id 5 | task 180 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.02.971.129 I statistics draft-mtp: #calls(b,g,a) = 61 181 2775, #gen drafts = 2785, #acc drafts = 1970, #gen tokens = 5557, #acc tokens = 3729, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.634), dur(b,g,a) = 0.037, 648.033, 3.424 ms
1.02.971.156 I slot release: id 5 | task 180 | stop processing: n_tokens = 152, truncated = 0
1.02.979.702 I srv operator(): Chat format: peg-native
1.03.089.605 I slot print_timing: id 12 | task 198 | n_decoded = 102, tg = 23.37 t/s, tg_3s = 23.37 t/s
1.03.091.106 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.03.091.176 I slot launch_slot_: id 5 | task 244 | processing task, is_child = 0
1.03.095.548 W slot operator(): id 5 | task 244 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.095.570 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.219.747 I slot print_timing: id 0 | task 152 | prompt eval time = 125.33 ms / 29 tokens ( 4.32 ms per token, 231.39 tokens per second)
1.03.219.751 I slot print_timing: id 0 | task 152 | eval time = 8756.42 ms / 128 tokens ( 68.41 ms per token, 14.62 tokens per second)
1.03.219.751 I slot print_timing: id 0 | task 152 | total time = 8881.75 ms / 157 tokens
1.03.219.752 I slot print_timing: id 0 | task 152 | graphs reused = 1
1.03.219.756 I slot print_timing: id 0 | task 152 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.03.219.771 I statistics draft-mtp: #calls(b,g,a) = 61 183 2800, #gen drafts = 2814, #acc drafts = 1984, #gen tokens = 5614, #acc tokens = 3756, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.633), dur(b,g,a) = 0.037, 656.674, 3.455 ms
1.03.219.799 I slot release: id 0 | task 152 | stop processing: n_tokens = 156, truncated = 0
1.03.229.058 I srv operator(): Chat format: peg-native
1.03.341.995 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.03.342.065 I slot launch_slot_: id 0 | task 247 | processing task, is_child = 0
1.03.345.156 W slot operator(): id 0 | task 247 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.345.177 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.471.697 I slot print_timing: id 3 | task 196 | n_decoded = 101, tg = 20.69 t/s, tg_3s = 20.69 t/s
1.03.598.372 I slot print_timing: id 12 | task 198 | prompt eval time = 124.69 ms / 25 tokens ( 4.99 ms per token, 200.49 tokens per second)
1.03.598.374 I slot print_timing: id 12 | task 198 | eval time = 4872.89 ms / 114 tokens ( 42.74 ms per token, 23.39 tokens per second)
1.03.598.375 I slot print_timing: id 12 | task 198 | total time = 4997.59 ms / 139 tokens
1.03.598.376 I slot print_timing: id 12 | task 198 | graphs reused = 1
1.03.598.378 I slot print_timing: id 12 | task 198 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.03.598.391 I statistics draft-mtp: #calls(b,g,a) = 63 186 2857, #gen drafts = 2860, #acc drafts = 2024, #gen tokens = 5706, #acc tokens = 3833, #mean acc len = 2.34, #acc rate/pos = (0.708, 0.633), dur(b,g,a) = 0.039, 665.827, 3.525 ms
1.03.598.415 I slot release: id 12 | task 198 | stop processing: n_tokens = 138, truncated = 0
1.03.608.142 I srv operator(): Chat format: peg-native
1.03.716.968 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.03.717.038 I slot launch_slot_: id 12 | task 251 | processing task, is_child = 0
1.03.721.820 W slot operator(): id 12 | task 251 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.721.846 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.097.269 I slot print_timing: id 11 | task 209 | n_decoded = 102, tg = 23.38 t/s, tg_3s = 23.38 t/s
1.04.457.927 I slot print_timing: id 1 | task 207 | n_decoded = 101, tg = 20.78 t/s, tg_3s = 20.78 t/s
1.04.578.100 I slot print_timing: id 2 | task 165 | prompt eval time = 133.04 ms / 29 tokens ( 4.59 ms per token, 217.98 tokens per second)
1.04.578.104 I slot print_timing: id 2 | task 165 | eval time = 8977.41 ms / 128 tokens ( 70.14 ms per token, 14.26 tokens per second)
1.04.578.105 I slot print_timing: id 2 | task 165 | total time = 9110.45 ms / 157 tokens
1.04.578.106 I slot print_timing: id 2 | task 165 | graphs reused = 1
1.04.578.110 I slot print_timing: id 2 | task 165 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.04.578.128 I statistics draft-mtp: #calls(b,g,a) = 64 194 2970, #gen drafts = 2985, #acc drafts = 2098, #gen tokens = 5955, #acc tokens = 3975, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.632), dur(b,g,a) = 0.040, 694.066, 3.669 ms
1.04.578.158 I slot release: id 2 | task 165 | stop processing: n_tokens = 156, truncated = 0
1.04.579.943 I slot print_timing: id 3 | task 196 | prompt eval time = 119.76 ms / 28 tokens ( 4.28 ms per token, 233.79 tokens per second)
1.04.579.945 I slot print_timing: id 3 | task 196 | eval time = 5990.37 ms / 125 tokens ( 47.92 ms per token, 20.87 tokens per second)
1.04.579.945 I slot print_timing: id 3 | task 196 | total time = 6110.13 ms / 153 tokens
1.04.579.945 I slot print_timing: id 3 | task 196 | graphs reused = 1
1.04.579.947 I slot print_timing: id 3 | task 196 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.04.579.952 I statistics draft-mtp: #calls(b,g,a) = 64 194 2973, #gen drafts = 2985, #acc drafts = 2101, #gen tokens = 5955, #acc tokens = 3980, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.632), dur(b,g,a) = 0.040, 694.066, 3.672 ms
1.04.579.972 I slot release: id 3 | task 196 | stop processing: n_tokens = 152, truncated = 0
1.04.583.840 I slot print_timing: id 11 | task 209 | prompt eval time = 124.63 ms / 25 tokens ( 4.99 ms per token, 200.59 tokens per second)
1.04.583.844 I slot print_timing: id 11 | task 209 | eval time = 4848.90 ms / 114 tokens ( 42.53 ms per token, 23.51 tokens per second)
1.04.583.845 I slot print_timing: id 11 | task 209 | total time = 4973.53 ms / 139 tokens
1.04.583.846 I slot print_timing: id 11 | task 209 | graphs reused = 1
1.04.583.848 I slot print_timing: id 11 | task 209 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.04.583.854 I statistics draft-mtp: #calls(b,g,a) = 64 194 2981, #gen drafts = 2985, #acc drafts = 2107, #gen tokens = 5955, #acc tokens = 3990, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.632), dur(b,g,a) = 0.040, 694.066, 3.681 ms
1.04.583.875 I slot release: id 11 | task 209 | stop processing: n_tokens = 138, truncated = 0
1.04.586.296 I slot print_timing: id 15 | task 190 | n_decoded = 100, tg = 15.12 t/s, tg_3s = 15.12 t/s
1.04.587.267 I srv operator(): Chat format: peg-native
1.04.588.279 I srv operator(): Chat format: peg-native
1.04.591.808 I srv operator(): Chat format: peg-native
1.04.689.744 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.04.689.815 I slot launch_slot_: id 2 | task 260 | processing task, is_child = 0
1.04.689.817 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.04.689.836 I slot launch_slot_: id 3 | task 261 | processing task, is_child = 0
1.04.689.838 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.04.689.853 I slot launch_slot_: id 11 | task 262 | processing task, is_child = 0
1.04.695.773 W slot operator(): id 2 | task 260 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.695.795 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.695.850 W slot operator(): id 3 | task 261 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.695.884 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.695.919 W slot operator(): id 11 | task 262 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.695.948 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.847.474 I slot print_timing: id 13 | task 170 | prompt eval time = 125.14 ms / 29 tokens ( 4.32 ms per token, 231.74 tokens per second)
1.04.847.480 I slot print_timing: id 13 | task 170 | eval time = 8979.12 ms / 128 tokens ( 70.15 ms per token, 14.26 tokens per second)
1.04.847.480 I slot print_timing: id 13 | task 170 | total time = 9104.26 ms / 157 tokens
1.04.847.481 I slot print_timing: id 13 | task 170 | graphs reused = 1
1.04.847.484 I slot print_timing: id 13 | task 170 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.04.847.498 I statistics draft-mtp: #calls(b,g,a) = 67 196 2998, #gen drafts = 3010, #acc drafts = 2121, #gen tokens = 6004, #acc tokens = 4017, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.632), dur(b,g,a) = 0.042, 705.365, 3.703 ms
1.04.847.526 I slot release: id 13 | task 170 | stop processing: n_tokens = 156, truncated = 0
1.04.856.334 I srv operator(): Chat format: peg-native
1.04.970.775 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.04.970.846 I slot launch_slot_: id 13 | task 265 | processing task, is_child = 0
1.04.974.915 W slot operator(): id 13 | task 265 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.974.948 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.225.552 I slot print_timing: id 7 | task 221 | n_decoded = 102, tg = 23.36 t/s, tg_3s = 23.36 t/s
1.05.587.161 I slot print_timing: id 1 | task 207 | prompt eval time = 118.92 ms / 28 tokens ( 4.25 ms per token, 235.44 tokens per second)
1.05.587.164 I slot print_timing: id 1 | task 207 | eval time = 5988.60 ms / 125 tokens ( 47.91 ms per token, 20.87 tokens per second)
1.05.587.165 I slot print_timing: id 1 | task 207 | total time = 6107.53 ms / 153 tokens
1.05.587.166 I slot print_timing: id 1 | task 207 | graphs reused = 1
1.05.587.169 I slot print_timing: id 1 | task 207 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.05.587.180 I statistics draft-mtp: #calls(b,g,a) = 68 202 3090, #gen drafts = 3104, #acc drafts = 2182, #gen tokens = 6192, #acc tokens = 4133, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.631), dur(b,g,a) = 0.042, 725.622, 3.820 ms
1.05.587.208 I slot release: id 1 | task 207 | stop processing: n_tokens = 152, truncated = 0
1.05.597.077 I srv operator(): Chat format: peg-native
1.05.707.003 I slot print_timing: id 7 | task 221 | prompt eval time = 138.78 ms / 25 tokens ( 5.55 ms per token, 180.15 tokens per second)
1.05.707.005 I slot print_timing: id 7 | task 221 | eval time = 4848.33 ms / 114 tokens ( 42.53 ms per token, 23.51 tokens per second)
1.05.707.006 I slot print_timing: id 7 | task 221 | total time = 4987.10 ms / 139 tokens
1.05.707.007 I slot print_timing: id 7 | task 221 | graphs reused = 1
1.05.707.009 I slot print_timing: id 7 | task 221 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.05.707.021 I statistics draft-mtp: #calls(b,g,a) = 68 203 3111, #gen drafts = 3119, #acc drafts = 2200, #gen tokens = 6222, #acc tokens = 4167, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.632), dur(b,g,a) = 0.042, 729.493, 3.845 ms
1.05.707.045 I slot release: id 7 | task 221 | stop processing: n_tokens = 138, truncated = 0
1.05.707.668 I slot print_timing: id 8 | task 220 | n_decoded = 101, tg = 20.83 t/s, tg_3s = 20.83 t/s
1.05.711.565 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.05.711.635 I slot launch_slot_: id 1 | task 272 | processing task, is_child = 0
1.05.715.829 I srv operator(): Chat format: peg-native
1.05.717.254 W slot operator(): id 1 | task 272 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.717.284 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.844.209 I slot print_timing: id 14 | task 203 | n_decoded = 100, tg = 15.11 t/s, tg_3s = 15.11 t/s
1.05.844.832 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.05.844.912 I slot launch_slot_: id 7 | task 274 | processing task, is_child = 0
1.05.850.149 W slot operator(): id 7 | task 274 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.850.177 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.06.465.712 I slot print_timing: id 10 | task 234 | n_decoded = 102, tg = 23.43 t/s, tg_3s = 23.43 t/s
1.06.702.107 I slot print_timing: id 15 | task 190 | prompt eval time = 124.92 ms / 29 tokens ( 4.31 ms per token, 232.15 tokens per second)
1.06.702.111 I slot print_timing: id 15 | task 190 | eval time = 8729.41 ms / 128 tokens ( 68.20 ms per token, 14.66 tokens per second)
1.06.702.111 I slot print_timing: id 15 | task 190 | total time = 8854.33 ms / 157 tokens
1.06.702.112 I slot print_timing: id 15 | task 190 | graphs reused = 1
1.06.702.116 I slot print_timing: id 15 | task 190 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.06.702.130 I statistics draft-mtp: #calls(b,g,a) = 70 211 3228, #gen drafts = 3243, #acc drafts = 2278, #gen tokens = 6469, #acc tokens = 4315, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.631), dur(b,g,a) = 0.044, 758.387, 3.982 ms
1.06.702.156 I slot release: id 15 | task 190 | stop processing: n_tokens = 156, truncated = 0
1.06.707.613 I slot print_timing: id 9 | task 231 | n_decoded = 101, tg = 20.82 t/s, tg_3s = 20.82 t/s
1.06.711.235 I srv operator(): Chat format: peg-native
1.06.821.814 I slot print_timing: id 8 | task 220 | prompt eval time = 138.98 ms / 28 tokens ( 4.96 ms per token, 201.47 tokens per second)
1.06.821.817 I slot print_timing: id 8 | task 220 | eval time = 5962.87 ms / 125 tokens ( 47.70 ms per token, 20.96 tokens per second)
1.06.821.818 I slot print_timing: id 8 | task 220 | total time = 6101.84 ms / 153 tokens
1.06.821.819 I slot print_timing: id 8 | task 220 | graphs reused = 1
1.06.821.822 I slot print_timing: id 8 | task 220 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.06.821.834 I statistics draft-mtp: #calls(b,g,a) = 70 212 3252, #gen drafts = 3258, #acc drafts = 2295, #gen tokens = 6499, #acc tokens = 4348, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.631), dur(b,g,a) = 0.044, 761.396, 4.013 ms
1.06.821.858 I slot release: id 8 | task 220 | stop processing: n_tokens = 152, truncated = 0
1.06.825.507 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.06.825.576 I slot launch_slot_: id 15 | task 283 | processing task, is_child = 0
1.06.830.360 I srv operator(): Chat format: peg-native
1.06.830.526 W slot operator(): id 15 | task 283 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.06.830.554 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.06.953.152 I slot print_timing: id 10 | task 234 | prompt eval time = 125.58 ms / 25 tokens ( 5.02 ms per token, 199.08 tokens per second)
1.06.953.156 I slot print_timing: id 10 | task 234 | eval time = 4840.95 ms / 114 tokens ( 42.46 ms per token, 23.55 tokens per second)
1.06.953.156 I slot print_timing: id 10 | task 234 | total time = 4966.53 ms / 139 tokens
1.06.953.157 I slot print_timing: id 10 | task 234 | graphs reused = 1
1.06.953.160 I slot print_timing: id 10 | task 234 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.06.953.170 I statistics draft-mtp: #calls(b,g,a) = 71 213 3268, #gen drafts = 3272, #acc drafts = 2305, #gen tokens = 6527, #acc tokens = 4367, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.044, 766.271, 4.031 ms
1.06.953.196 I slot release: id 10 | task 234 | stop processing: n_tokens = 138, truncated = 0
1.06.955.147 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.06.955.216 I slot launch_slot_: id 8 | task 285 | processing task, is_child = 0
1.06.960.829 W slot operator(): id 8 | task 285 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.06.960.847 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.06.961.825 I srv operator(): Chat format: peg-native
1.07.086.671 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.07.086.737 I slot launch_slot_: id 10 | task 287 | processing task, is_child = 0
1.07.091.139 W slot operator(): id 10 | task 287 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.091.168 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.07.583.859 I slot print_timing: id 4 | task 218 | n_decoded = 100, tg = 14.54 t/s, tg_3s = 14.54 t/s
1.07.830.907 I slot print_timing: id 9 | task 231 | prompt eval time = 139.74 ms / 28 tokens ( 4.99 ms per token, 200.37 tokens per second)
1.07.830.910 I slot print_timing: id 9 | task 231 | eval time = 5973.56 ms / 125 tokens ( 47.79 ms per token, 20.93 tokens per second)
1.07.830.910 I slot print_timing: id 9 | task 231 | total time = 6113.30 ms / 153 tokens
1.07.830.912 I slot print_timing: id 9 | task 231 | graphs reused = 1
1.07.830.914 I slot print_timing: id 9 | task 231 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.07.830.927 I statistics draft-mtp: #calls(b,g,a) = 73 220 3375, #gen drafts = 3381, #acc drafts = 2381, #gen tokens = 6744, #acc tokens = 4511, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.046, 791.255, 4.146 ms
1.07.830.952 I slot release: id 9 | task 231 | stop processing: n_tokens = 152, truncated = 0
1.07.839.654 I srv operator(): Chat format: peg-native
1.07.943.462 I slot print_timing: id 14 | task 203 | prompt eval time = 125.77 ms / 29 tokens ( 4.34 ms per token, 230.58 tokens per second)
1.07.943.468 I slot print_timing: id 14 | task 203 | eval time = 8718.30 ms / 128 tokens ( 68.11 ms per token, 14.68 tokens per second)
1.07.943.469 I slot print_timing: id 14 | task 203 | total time = 8844.07 ms / 157 tokens
1.07.943.470 I slot print_timing: id 14 | task 203 | graphs reused = 1
1.07.943.473 I slot print_timing: id 14 | task 203 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.07.943.487 I statistics draft-mtp: #calls(b,g,a) = 73 221 3381, #gen drafts = 3395, #acc drafts = 2386, #gen tokens = 6772, #acc tokens = 4520, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.631), dur(b,g,a) = 0.046, 796.374, 4.154 ms
1.07.943.509 I slot release: id 14 | task 203 | stop processing: n_tokens = 156, truncated = 0
1.07.950.859 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.07.950.923 I slot launch_slot_: id 14 | task 295 | processing task, is_child = 0
1.07.952.245 I srv operator(): Chat format: peg-native
1.07.956.141 W slot operator(): id 14 | task 295 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.956.169 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.082.249 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.08.082.315 I slot launch_slot_: id 9 | task 297 | processing task, is_child = 0
1.08.086.882 W slot operator(): id 9 | task 297 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.086.898 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.219.040 I slot print_timing: id 12 | task 251 | n_decoded = 102, tg = 23.33 t/s, tg_3s = 23.33 t/s
1.08.334.498 I slot print_timing: id 0 | task 247 | n_decoded = 101, tg = 20.76 t/s, tg_3s = 20.76 t/s
1.08.702.627 I slot print_timing: id 6 | task 230 | n_decoded = 100, tg = 14.61 t/s, tg_3s = 14.61 t/s
1.08.705.744 I slot print_timing: id 12 | task 251 | prompt eval time = 124.86 ms / 25 tokens ( 4.99 ms per token, 200.22 tokens per second)
1.08.705.747 I slot print_timing: id 12 | task 251 | eval time = 4859.03 ms / 114 tokens ( 42.62 ms per token, 23.46 tokens per second)
1.08.705.747 I slot print_timing: id 12 | task 251 | total time = 4983.89 ms / 139 tokens
1.08.705.748 I slot print_timing: id 12 | task 251 | graphs reused = 1
1.08.705.752 I slot print_timing: id 12 | task 251 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.08.705.763 I statistics draft-mtp: #calls(b,g,a) = 75 227 3485, #gen drafts = 3488, #acc drafts = 2457, #gen tokens = 6958, #acc tokens = 4655, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.048, 818.240, 4.284 ms
1.08.705.789 I slot release: id 12 | task 251 | stop processing: n_tokens = 138, truncated = 0
1.08.714.862 I srv operator(): Chat format: peg-native
1.08.825.086 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.08.825.153 I slot launch_slot_: id 12 | task 304 | processing task, is_child = 0
1.08.829.599 W slot operator(): id 12 | task 304 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.829.617 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.09.203.491 I slot print_timing: id 11 | task 262 | n_decoded = 102, tg = 23.41 t/s, tg_3s = 23.41 t/s
1.09.442.072 I slot print_timing: id 0 | task 247 | prompt eval time = 124.59 ms / 28 tokens ( 4.45 ms per token, 224.74 tokens per second)
1.09.442.080 I slot print_timing: id 0 | task 247 | eval time = 5972.29 ms / 125 tokens ( 47.78 ms per token, 20.93 tokens per second)
1.09.442.080 I slot print_timing: id 0 | task 247 | total time = 6096.88 ms / 153 tokens
1.09.442.081 I slot print_timing: id 0 | task 247 | graphs reused = 1
1.09.442.084 I slot print_timing: id 0 | task 247 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.09.442.099 I statistics draft-mtp: #calls(b,g,a) = 76 233 3567, #gen drafts = 3582, #acc drafts = 2512, #gen tokens = 7146, #acc tokens = 4759, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.049, 839.189, 4.383 ms
1.09.442.125 I slot release: id 0 | task 247 | stop processing: n_tokens = 152, truncated = 0
1.09.451.138 I srv operator(): Chat format: peg-native
1.09.566.602 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.09.566.670 I slot launch_slot_: id 0 | task 311 | processing task, is_child = 0
1.09.570.690 W slot operator(): id 0 | task 311 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.09.570.720 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.09.694.495 I slot print_timing: id 4 | task 218 | prompt eval time = 112.34 ms / 29 tokens ( 3.87 ms per token, 258.14 tokens per second)
1.09.694.498 I slot print_timing: id 4 | task 218 | eval time = 8986.12 ms / 128 tokens ( 70.20 ms per token, 14.24 tokens per second)
1.09.694.499 I slot print_timing: id 4 | task 218 | total time = 9098.47 ms / 157 tokens
1.09.694.500 I slot print_timing: id 4 | task 218 | graphs reused = 1
1.09.694.503 I slot print_timing: id 4 | task 218 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.09.694.516 I statistics draft-mtp: #calls(b,g,a) = 77 235 3597, #gen drafts = 3611, #acc drafts = 2532, #gen tokens = 7203, #acc tokens = 4796, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.629), dur(b,g,a) = 0.049, 846.161, 4.419 ms
1.09.694.538 I slot release: id 4 | task 218 | stop processing: n_tokens = 156, truncated = 0
1.09.696.465 I slot print_timing: id 3 | task 261 | n_decoded = 101, tg = 20.83 t/s, tg_3s = 20.83 t/s
1.09.700.358 I slot print_timing: id 11 | task 262 | prompt eval time = 151.33 ms / 25 tokens ( 6.05 ms per token, 165.20 tokens per second)
1.09.700.361 I slot print_timing: id 11 | task 262 | eval time = 4853.06 ms / 114 tokens ( 42.57 ms per token, 23.49 tokens per second)
1.09.700.362 I slot print_timing: id 11 | task 262 | total time = 5004.40 ms / 139 tokens
1.09.700.363 I slot print_timing: id 11 | task 262 | graphs reused = 1
1.09.700.365 I slot print_timing: id 11 | task 262 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.09.700.372 I statistics draft-mtp: #calls(b,g,a) = 77 235 3607, #gen drafts = 3611, #acc drafts = 2541, #gen tokens = 7203, #acc tokens = 4814, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.049, 846.161, 4.429 ms
1.09.700.402 I slot release: id 11 | task 262 | stop processing: n_tokens = 138, truncated = 0
1.09.703.682 I srv operator(): Chat format: peg-native
1.09.708.765 I srv operator(): Chat format: peg-native
1.09.810.160 I slot print_timing: id 5 | task 244 | n_decoded = 100, tg = 15.17 t/s, tg_3s = 15.17 t/s
1.09.814.617 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.09.814.684 I slot launch_slot_: id 4 | task 314 | processing task, is_child = 0
1.09.814.687 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.09.814.705 I slot launch_slot_: id 11 | task 315 | processing task, is_child = 0
1.09.820.553 W slot operator(): id 4 | task 314 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.09.820.583 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.09.820.623 W slot operator(): id 11 | task 315 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.09.820.644 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.329.094 I slot print_timing: id 7 | task 274 | n_decoded = 102, tg = 23.43 t/s, tg_3s = 23.43 t/s
1.10.691.719 I slot print_timing: id 1 | task 272 | n_decoded = 101, tg = 20.81 t/s, tg_3s = 20.81 t/s
1.10.814.141 I slot print_timing: id 6 | task 230 | prompt eval time = 139.54 ms / 29 tokens ( 4.81 ms per token, 207.83 tokens per second)
1.10.814.144 I slot print_timing: id 6 | task 230 | eval time = 8957.07 ms / 128 tokens ( 69.98 ms per token, 14.29 tokens per second)
1.10.814.145 I slot print_timing: id 6 | task 230 | total time = 9096.61 ms / 157 tokens
1.10.814.146 I slot print_timing: id 6 | task 230 | graphs reused = 1
1.10.814.150 I slot print_timing: id 6 | task 230 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.10.814.166 I statistics draft-mtp: #calls(b,g,a) = 79 244 3735, #gen drafts = 3750, #acc drafts = 2625, #gen tokens = 7480, #acc tokens = 4975, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.050, 880.823, 4.574 ms
1.10.814.193 I slot release: id 6 | task 230 | stop processing: n_tokens = 156, truncated = 0
1.10.816.059 I slot print_timing: id 3 | task 261 | prompt eval time = 151.14 ms / 28 tokens ( 5.40 ms per token, 185.26 tokens per second)
1.10.816.061 I slot print_timing: id 3 | task 261 | eval time = 5969.03 ms / 125 tokens ( 47.75 ms per token, 20.94 tokens per second)
1.10.816.061 I slot print_timing: id 3 | task 261 | total time = 6120.18 ms / 153 tokens
1.10.816.061 I slot print_timing: id 3 | task 261 | graphs reused = 1
1.10.816.064 I slot print_timing: id 3 | task 261 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.10.816.071 I statistics draft-mtp: #calls(b,g,a) = 79 244 3739, #gen drafts = 3750, #acc drafts = 2627, #gen tokens = 7480, #acc tokens = 4979, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.050, 880.823, 4.581 ms
1.10.816.093 I slot release: id 3 | task 261 | stop processing: n_tokens = 152, truncated = 0
1.10.817.908 I slot print_timing: id 7 | task 274 | prompt eval time = 124.92 ms / 25 tokens ( 5.00 ms per token, 200.14 tokens per second)
1.10.817.911 I slot print_timing: id 7 | task 274 | eval time = 4842.81 ms / 114 tokens ( 42.48 ms per token, 23.54 tokens per second)
1.10.817.912 I slot print_timing: id 7 | task 274 | total time = 4967.72 ms / 139 tokens
1.10.817.912 I slot print_timing: id 7 | task 274 | graphs reused = 1
1.10.817.914 I slot print_timing: id 7 | task 274 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.10.817.919 I statistics draft-mtp: #calls(b,g,a) = 79 244 3742, #gen drafts = 3750, #acc drafts = 2630, #gen tokens = 7480, #acc tokens = 4985, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.050, 880.823, 4.583 ms
1.10.817.939 I slot release: id 7 | task 274 | stop processing: n_tokens = 138, truncated = 0
1.10.823.572 I srv operator(): Chat format: peg-native
1.10.824.406 I srv operator(): Chat format: peg-native
1.10.827.308 I srv operator(): Chat format: peg-native
1.10.926.731 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.10.926.798 I slot launch_slot_: id 6 | task 325 | processing task, is_child = 0
1.10.926.802 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.10.926.819 I slot launch_slot_: id 3 | task 326 | processing task, is_child = 0
1.10.926.821 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.10.926.836 I slot launch_slot_: id 7 | task 327 | processing task, is_child = 0
1.10.932.240 W slot operator(): id 3 | task 326 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.932.268 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.932.312 W slot operator(): id 6 | task 325 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.932.339 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.932.374 W slot operator(): id 7 | task 327 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.932.407 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.577.699 I slot print_timing: id 10 | task 287 | n_decoded = 102, tg = 23.39 t/s, tg_3s = 23.39 t/s
1.11.695.880 I slot print_timing: id 2 | task 260 | n_decoded = 100, tg = 14.60 t/s, tg_3s = 14.60 t/s
1.11.817.878 I slot print_timing: id 1 | task 272 | prompt eval time = 119.92 ms / 28 tokens ( 4.28 ms per token, 233.49 tokens per second)
1.11.817.882 I slot print_timing: id 1 | task 272 | eval time = 5980.67 ms / 125 tokens ( 47.85 ms per token, 20.90 tokens per second)
1.11.817.882 I slot print_timing: id 1 | task 272 | total time = 6100.59 ms / 153 tokens
1.11.817.883 I slot print_timing: id 1 | task 272 | graphs reused = 1
1.11.817.886 I slot print_timing: id 1 | task 272 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.11.817.902 I statistics draft-mtp: #calls(b,g,a) = 82 252 3858, #gen drafts = 3872, #acc drafts = 2713, #gen tokens = 7723, #acc tokens = 5142, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.630), dur(b,g,a) = 0.051, 909.941, 4.722 ms
1.11.817.927 I slot release: id 1 | task 272 | stop processing: n_tokens = 152, truncated = 0
1.11.826.986 I srv operator(): Chat format: peg-native
1.11.934.168 I slot print_timing: id 5 | task 244 | prompt eval time = 124.52 ms / 29 tokens ( 4.29 ms per token, 232.90 tokens per second)
1.11.934.172 I slot print_timing: id 5 | task 244 | eval time = 8714.07 ms / 128 tokens ( 68.08 ms per token, 14.69 tokens per second)
1.11.934.173 I slot print_timing: id 5 | task 244 | total time = 8838.59 ms / 157 tokens
1.11.934.174 I slot print_timing: id 5 | task 244 | graphs reused = 1
1.11.934.177 I slot print_timing: id 5 | task 244 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.11.934.198 I statistics draft-mtp: #calls(b,g,a) = 82 253 3872, #gen drafts = 3886, #acc drafts = 2723, #gen tokens = 7751, #acc tokens = 5160, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.051, 914.865, 4.737 ms
1.11.934.225 I slot release: id 5 | task 244 | stop processing: n_tokens = 156, truncated = 0
1.11.937.822 I slot print_timing: id 8 | task 285 | n_decoded = 101, tg = 20.79 t/s, tg_3s = 20.79 t/s
1.11.940.799 I slot print_timing: id 13 | task 265 | n_decoded = 100, tg = 14.62 t/s, tg_3s = 14.62 t/s
1.11.941.684 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.11.941.748 I slot launch_slot_: id 5 | task 336 | processing task, is_child = 0
1.11.943.686 I srv operator(): Chat format: peg-native
1.11.946.782 W slot operator(): id 5 | task 336 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.11.946.816 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.070.770 I slot print_timing: id 10 | task 287 | prompt eval time = 125.05 ms / 25 tokens ( 5.00 ms per token, 199.92 tokens per second)
1.12.070.773 I slot print_timing: id 10 | task 287 | eval time = 4854.55 ms / 114 tokens ( 42.58 ms per token, 23.48 tokens per second)
1.12.070.774 I slot print_timing: id 10 | task 287 | total time = 4979.59 ms / 139 tokens
1.12.070.775 I slot print_timing: id 10 | task 287 | graphs reused = 1
1.12.070.778 I slot print_timing: id 10 | task 287 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.12.070.791 I statistics draft-mtp: #calls(b,g,a) = 83 254 3895, #gen drafts = 3900, #acc drafts = 2741, #gen tokens = 7779, #acc tokens = 5196, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.052, 919.811, 4.771 ms
1.12.070.818 I slot release: id 10 | task 287 | stop processing: n_tokens = 138, truncated = 0
1.12.073.240 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.12.073.310 I slot launch_slot_: id 1 | task 338 | processing task, is_child = 0
1.12.079.053 W slot operator(): id 1 | task 338 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.079.077 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.079.431 I srv operator(): Chat format: peg-native
1.12.204.552 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.12.204.621 I slot launch_slot_: id 10 | task 340 | processing task, is_child = 0
1.12.209.164 W slot operator(): id 10 | task 340 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.209.190 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.13.071.777 I slot print_timing: id 8 | task 285 | prompt eval time = 118.56 ms / 28 tokens ( 4.23 ms per token, 236.18 tokens per second)
1.13.071.780 I slot print_timing: id 8 | task 285 | eval time = 5992.34 ms / 125 tokens ( 47.94 ms per token, 20.86 tokens per second)
1.13.071.780 I slot print_timing: id 8 | task 285 | total time = 6110.89 ms / 153 tokens
1.13.071.781 I slot print_timing: id 8 | task 285 | graphs reused = 1
1.13.071.784 I slot print_timing: id 8 | task 285 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.13.071.794 I statistics draft-mtp: #calls(b,g,a) = 85 262 4018, #gen drafts = 4025, #acc drafts = 2825, #gen tokens = 8029, #acc tokens = 5355, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.630), dur(b,g,a) = 0.054, 948.589, 4.929 ms
1.13.071.818 I slot release: id 8 | task 285 | stop processing: n_tokens = 152, truncated = 0
1.13.072.443 I slot print_timing: id 9 | task 297 | n_decoded = 101, tg = 20.78 t/s, tg_3s = 20.78 t/s
1.13.080.274 I srv operator(): Chat format: peg-native
1.13.192.219 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.13.192.288 I slot launch_slot_: id 8 | task 349 | processing task, is_child = 0
1.13.197.474 W slot operator(): id 8 | task 349 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.13.197.501 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.13.329.567 I slot print_timing: id 12 | task 304 | n_decoded = 102, tg = 23.31 t/s, tg_3s = 23.31 t/s
1.13.811.583 I slot print_timing: id 2 | task 260 | prompt eval time = 150.95 ms / 29 tokens ( 5.21 ms per token, 192.12 tokens per second)
1.13.811.587 I slot print_timing: id 2 | task 260 | eval time = 8964.83 ms / 128 tokens ( 70.04 ms per token, 14.28 tokens per second)
1.13.811.588 I slot print_timing: id 2 | task 260 | total time = 9115.77 ms / 157 tokens
1.13.811.589 I slot print_timing: id 2 | task 260 | graphs reused = 1
1.13.811.593 I slot print_timing: id 2 | task 260 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.13.811.611 I statistics draft-mtp: #calls(b,g,a) = 86 268 4103, #gen drafts = 4118, #acc drafts = 2881, #gen tokens = 8214, #acc tokens = 5460, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.629), dur(b,g,a) = 0.055, 972.155, 5.044 ms
1.13.811.641 I slot release: id 2 | task 260 | stop processing: n_tokens = 156, truncated = 0
1.13.817.580 I slot print_timing: id 12 | task 304 | prompt eval time = 124.61 ms / 25 tokens ( 4.98 ms per token, 200.62 tokens per second)
1.13.817.583 I slot print_timing: id 12 | task 304 | eval time = 4863.34 ms / 114 tokens ( 42.66 ms per token, 23.44 tokens per second)
1.13.817.583 I slot print_timing: id 12 | task 304 | total time = 4987.95 ms / 139 tokens
1.13.817.585 I slot print_timing: id 12 | task 304 | graphs reused = 1
1.13.817.588 I slot print_timing: id 12 | task 304 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.13.817.595 I statistics draft-mtp: #calls(b,g,a) = 86 268 4115, #gen drafts = 4118, #acc drafts = 2889, #gen tokens = 8214, #acc tokens = 5475, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.055, 972.155, 5.059 ms
1.13.817.618 I slot release: id 12 | task 304 | stop processing: n_tokens = 138, truncated = 0
1.13.819.131 I slot print_timing: id 15 | task 283 | n_decoded = 100, tg = 14.56 t/s, tg_3s = 14.56 t/s
1.13.820.931 I srv operator(): Chat format: peg-native
1.13.826.123 I srv operator(): Chat format: peg-native
1.13.929.118 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.13.929.187 I slot launch_slot_: id 2 | task 356 | processing task, is_child = 0
1.13.929.190 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.13.929.209 I slot launch_slot_: id 12 | task 357 | processing task, is_child = 0
1.13.934.012 W slot operator(): id 2 | task 356 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.13.934.046 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.13.934.083 W slot operator(): id 12 | task 357 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.13.934.117 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.071.077 I slot print_timing: id 13 | task 265 | prompt eval time = 125.52 ms / 29 tokens ( 4.33 ms per token, 231.05 tokens per second)
1.14.071.080 I slot print_timing: id 13 | task 265 | eval time = 8970.63 ms / 128 tokens ( 70.08 ms per token, 14.27 tokens per second)
1.14.071.081 I slot print_timing: id 13 | task 265 | total time = 9096.15 ms / 157 tokens
1.14.071.081 I slot print_timing: id 13 | task 265 | graphs reused = 1
1.14.071.085 I slot print_timing: id 13 | task 265 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.14.071.096 I statistics draft-mtp: #calls(b,g,a) = 88 270 4132, #gen drafts = 4145, #acc drafts = 2901, #gen tokens = 8267, #acc tokens = 5498, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.629), dur(b,g,a) = 0.056, 981.898, 5.082 ms
1.14.071.123 I slot release: id 13 | task 265 | stop processing: n_tokens = 156, truncated = 0
1.14.080.286 I srv operator(): Chat format: peg-native
1.14.192.185 I slot print_timing: id 9 | task 297 | prompt eval time = 125.50 ms / 28 tokens ( 4.48 ms per token, 223.12 tokens per second)
1.14.192.189 I slot print_timing: id 9 | task 297 | eval time = 5979.78 ms / 125 tokens ( 47.84 ms per token, 20.90 tokens per second)
1.14.192.189 I slot print_timing: id 9 | task 297 | total time = 6105.27 ms / 153 tokens
1.14.192.190 I slot print_timing: id 9 | task 297 | graphs reused = 1
1.14.192.193 I slot print_timing: id 9 | task 297 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.14.192.204 I statistics draft-mtp: #calls(b,g,a) = 88 271 4155, #gen drafts = 4160, #acc drafts = 2915, #gen tokens = 8297, #acc tokens = 5525, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.056, 985.913, 5.110 ms
1.14.192.231 I slot release: id 9 | task 297 | stop processing: n_tokens = 152, truncated = 0
1.14.194.690 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.14.194.757 I slot launch_slot_: id 13 | task 360 | processing task, is_child = 0
1.14.199.809 W slot operator(): id 13 | task 360 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.199.842 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.201.134 I srv operator(): Chat format: peg-native
1.14.325.022 I slot print_timing: id 11 | task 315 | n_decoded = 102, tg = 23.37 t/s, tg_3s = 23.37 t/s
1.14.326.243 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.14.326.312 I slot launch_slot_: id 9 | task 362 | processing task, is_child = 0
1.14.330.960 W slot operator(): id 9 | task 362 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.330.994 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.825.121 I slot print_timing: id 4 | task 314 | n_decoded = 101, tg = 20.76 t/s, tg_3s = 20.76 t/s
1.14.829.019 I slot print_timing: id 11 | task 315 | prompt eval time = 139.31 ms / 25 tokens ( 5.57 ms per token, 179.45 tokens per second)
1.14.829.021 I slot print_timing: id 11 | task 315 | eval time = 4869.04 ms / 114 tokens ( 42.71 ms per token, 23.41 tokens per second)
1.14.829.022 I slot print_timing: id 11 | task 315 | total time = 5008.36 ms / 139 tokens
1.14.829.023 I slot print_timing: id 11 | task 315 | graphs reused = 1
1.14.829.025 I slot print_timing: id 11 | task 315 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.14.829.036 I statistics draft-mtp: #calls(b,g,a) = 90 276 4233, #gen drafts = 4237, #acc drafts = 2972, #gen tokens = 8451, #acc tokens = 5633, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.629), dur(b,g,a) = 0.058, 1004.682, 5.207 ms
1.14.829.061 I slot release: id 11 | task 315 | stop processing: n_tokens = 138, truncated = 0
1.14.837.982 I srv operator(): Chat format: peg-native
1.14.947.358 I slot print_timing: id 14 | task 295 | n_decoded = 100, tg = 14.55 t/s, tg_3s = 14.55 t/s
1.14.947.981 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.14.948.050 I slot launch_slot_: id 11 | task 368 | processing task, is_child = 0
1.14.953.115 W slot operator(): id 11 | task 368 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.953.148 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.15.449.468 I slot print_timing: id 7 | task 327 | n_decoded = 102, tg = 23.37 t/s, tg_3s = 23.37 t/s
1.15.930.047 I slot print_timing: id 15 | task 283 | prompt eval time = 118.72 ms / 29 tokens ( 4.09 ms per token, 244.27 tokens per second)
1.15.930.051 I slot print_timing: id 15 | task 283 | eval time = 8980.76 ms / 128 tokens ( 70.16 ms per token, 14.25 tokens per second)
1.15.930.051 I slot print_timing: id 15 | task 283 | total time = 9099.48 ms / 157 tokens
1.15.930.053 I slot print_timing: id 15 | task 283 | graphs reused = 1
1.15.930.056 I slot print_timing: id 15 | task 283 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.15.930.074 I statistics draft-mtp: #calls(b,g,a) = 91 285 4363, #gen drafts = 4378, #acc drafts = 3058, #gen tokens = 8732, #acc tokens = 5793, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.059, 1035.712, 5.369 ms
1.15.930.099 I slot release: id 15 | task 283 | stop processing: n_tokens = 156, truncated = 0
1.15.932.534 I slot print_timing: id 3 | task 326 | n_decoded = 101, tg = 20.84 t/s, tg_3s = 20.84 t/s
1.15.933.136 I slot print_timing: id 4 | task 314 | prompt eval time = 139.10 ms / 28 tokens ( 4.97 ms per token, 201.29 tokens per second)
1.15.933.138 I slot print_timing: id 4 | task 314 | eval time = 5973.45 ms / 125 tokens ( 47.79 ms per token, 20.93 tokens per second)
1.15.933.138 I slot print_timing: id 4 | task 314 | total time = 6112.55 ms / 153 tokens
1.15.933.138 I slot print_timing: id 4 | task 314 | graphs reused = 1
1.15.933.141 I slot print_timing: id 4 | task 314 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.15.933.147 I statistics draft-mtp: #calls(b,g,a) = 91 285 4368, #gen drafts = 4378, #acc drafts = 3063, #gen tokens = 8732, #acc tokens = 5802, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.059, 1035.712, 5.377 ms
1.15.933.170 I slot release: id 4 | task 314 | stop processing: n_tokens = 152, truncated = 0
1.15.935.593 I slot print_timing: id 7 | task 327 | prompt eval time = 153.35 ms / 25 tokens ( 6.13 ms per token, 163.02 tokens per second)
1.15.935.596 I slot print_timing: id 7 | task 327 | eval time = 4849.84 ms / 114 tokens ( 42.54 ms per token, 23.51 tokens per second)
1.15.935.597 I slot print_timing: id 7 | task 327 | total time = 5003.19 ms / 139 tokens
1.15.935.598 I slot print_timing: id 7 | task 327 | graphs reused = 1
1.15.935.601 I slot print_timing: id 7 | task 327 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.15.935.612 I statistics draft-mtp: #calls(b,g,a) = 91 285 4371, #gen drafts = 4378, #acc drafts = 3065, #gen tokens = 8732, #acc tokens = 5806, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.059, 1035.712, 5.382 ms
1.15.935.641 I slot release: id 7 | task 327 | stop processing: n_tokens = 138, truncated = 0
1.15.940.766 I srv operator(): Chat format: peg-native
1.15.943.739 I srv operator(): Chat format: peg-native
1.15.945.386 I srv operator(): Chat format: peg-native
1.16.045.348 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.16.045.420 I slot launch_slot_: id 15 | task 378 | processing task, is_child = 0
1.16.045.425 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.16.045.441 I slot launch_slot_: id 4 | task 379 | processing task, is_child = 0
1.16.045.444 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.16.045.459 I slot launch_slot_: id 7 | task 380 | processing task, is_child = 0
1.16.051.041 W slot operator(): id 4 | task 379 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.16.051.065 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.051.107 W slot operator(): id 7 | task 380 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.16.051.135 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.051.166 W slot operator(): id 15 | task 378 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.16.051.202 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.325.024 I slot print_timing: id 0 | task 311 | n_decoded = 100, tg = 15.08 t/s, tg_3s = 15.08 t/s
1.16.695.411 I slot print_timing: id 10 | task 340 | n_decoded = 102, tg = 23.39 t/s, tg_3s = 23.39 t/s
1.17.057.862 I slot print_timing: id 14 | task 295 | prompt eval time = 119.77 ms / 29 tokens ( 4.13 ms per token, 242.13 tokens per second)
1.17.057.866 I slot print_timing: id 14 | task 295 | eval time = 8981.92 ms / 128 tokens ( 70.17 ms per token, 14.25 tokens per second)
1.17.057.867 I slot print_timing: id 14 | task 295 | total time = 9101.69 ms / 157 tokens
1.17.057.868 I slot print_timing: id 14 | task 295 | graphs reused = 1
1.17.057.872 I slot print_timing: id 14 | task 295 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.17.057.887 I statistics draft-mtp: #calls(b,g,a) = 94 294 4500, #gen drafts = 4515, #acc drafts = 3155, #gen tokens = 9005, #acc tokens = 5981, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.061, 1068.961, 5.542 ms
1.17.057.916 I slot release: id 14 | task 295 | stop processing: n_tokens = 156, truncated = 0
1.17.058.950 I slot print_timing: id 1 | task 338 | n_decoded = 101, tg = 20.78 t/s, tg_3s = 20.78 t/s
1.17.059.859 I slot print_timing: id 3 | task 326 | prompt eval time = 152.93 ms / 28 tokens ( 5.46 ms per token, 183.09 tokens per second)
1.17.059.863 I slot print_timing: id 3 | task 326 | eval time = 5974.65 ms / 125 tokens ( 47.80 ms per token, 20.92 tokens per second)
1.17.059.863 I slot print_timing: id 3 | task 326 | total time = 6127.58 ms / 153 tokens
1.17.059.864 I slot print_timing: id 3 | task 326 | graphs reused = 1
1.17.059.867 I slot print_timing: id 3 | task 326 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.17.059.877 I statistics draft-mtp: #calls(b,g,a) = 94 294 4504, #gen drafts = 4515, #acc drafts = 3157, #gen tokens = 9005, #acc tokens = 5985, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.061, 1068.961, 5.548 ms
1.17.059.899 I slot release: id 3 | task 326 | stop processing: n_tokens = 152, truncated = 0
1.17.067.507 I srv operator(): Chat format: peg-native
1.17.068.846 I srv operator(): Chat format: peg-native
1.17.175.188 I slot print_timing: id 10 | task 340 | prompt eval time = 124.84 ms / 25 tokens ( 4.99 ms per token, 200.25 tokens per second)
1.17.175.191 I slot print_timing: id 10 | task 340 | eval time = 4841.15 ms / 114 tokens ( 42.47 ms per token, 23.55 tokens per second)
1.17.175.192 I slot print_timing: id 10 | task 340 | total time = 4965.99 ms / 139 tokens
1.17.175.193 I slot print_timing: id 10 | task 340 | graphs reused = 1
1.17.175.195 I slot print_timing: id 10 | task 340 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.17.175.207 I statistics draft-mtp: #calls(b,g,a) = 94 295 4525, #gen drafts = 4529, #acc drafts = 3173, #gen tokens = 9033, #acc tokens = 6016, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.061, 1073.891, 5.572 ms
1.17.175.237 I slot release: id 10 | task 340 | stop processing: n_tokens = 138, truncated = 0
1.17.177.233 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.17.177.300 I slot launch_slot_: id 14 | task 390 | processing task, is_child = 0
1.17.177.302 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.17.177.319 I slot launch_slot_: id 3 | task 391 | processing task, is_child = 0
1.17.183.378 W slot operator(): id 3 | task 391 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.183.406 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.183.454 W slot operator(): id 14 | task 390 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.183.488 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.183.653 I srv operator(): Chat format: peg-native
1.17.324.065 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.17.324.137 I slot launch_slot_: id 10 | task 393 | processing task, is_child = 0
1.17.328.557 W slot operator(): id 10 | task 393 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.328.589 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.943.616 I slot print_timing: id 6 | task 325 | n_decoded = 100, tg = 14.58 t/s, tg_3s = 14.58 t/s
1.18.187.066 I slot print_timing: id 1 | task 338 | prompt eval time = 119.09 ms / 28 tokens ( 4.25 ms per token, 235.12 tokens per second)
1.18.187.069 I slot print_timing: id 1 | task 338 | eval time = 5988.88 ms / 125 tokens ( 47.91 ms per token, 20.87 tokens per second)
1.18.187.069 I slot print_timing: id 1 | task 338 | total time = 6107.97 ms / 153 tokens
1.18.187.070 I slot print_timing: id 1 | task 338 | graphs reused = 1
1.18.187.073 I slot print_timing: id 1 | task 338 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.18.187.084 I statistics draft-mtp: #calls(b,g,a) = 97 303 4639, #gen drafts = 4653, #acc drafts = 3252, #gen tokens = 9281, #acc tokens = 6164, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.064, 1102.598, 5.706 ms
1.18.187.114 I slot release: id 1 | task 338 | stop processing: n_tokens = 152, truncated = 0
1.18.195.755 I srv operator(): Chat format: peg-native
1.18.308.884 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.18.308.955 I slot launch_slot_: id 1 | task 402 | processing task, is_child = 0
1.18.311.947 W slot operator(): id 1 | task 402 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.18.311.970 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.434.891 I slot print_timing: id 0 | task 311 | prompt eval time = 123.56 ms / 29 tokens ( 4.26 ms per token, 234.69 tokens per second)
1.18.434.897 I slot print_timing: id 0 | task 311 | eval time = 8740.61 ms / 128 tokens ( 68.29 ms per token, 14.64 tokens per second)
1.18.434.897 I slot print_timing: id 0 | task 311 | total time = 8864.17 ms / 157 tokens
1.18.434.898 I slot print_timing: id 0 | task 311 | graphs reused = 1
1.18.434.902 I slot print_timing: id 0 | task 311 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.18.434.916 I statistics draft-mtp: #calls(b,g,a) = 97 305 4668, #gen drafts = 4682, #acc drafts = 3270, #gen tokens = 9338, #acc tokens = 6199, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.064, 1109.506, 5.742 ms
1.18.434.942 I slot release: id 0 | task 311 | stop processing: n_tokens = 156, truncated = 0
1.18.441.178 I slot print_timing: id 12 | task 357 | n_decoded = 102, tg = 23.34 t/s, tg_3s = 23.34 t/s
1.18.447.270 I srv operator(): Chat format: peg-native
1.18.557.708 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.18.557.781 I slot launch_slot_: id 0 | task 405 | processing task, is_child = 0
1.18.560.889 W slot operator(): id 0 | task 405 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.18.560.922 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.931.275 I slot print_timing: id 2 | task 356 | n_decoded = 101, tg = 20.78 t/s, tg_3s = 20.78 t/s
1.18.932.442 I slot print_timing: id 5 | task 336 | n_decoded = 100, tg = 14.56 t/s, tg_3s = 14.56 t/s
1.18.936.611 I slot print_timing: id 12 | task 357 | prompt eval time = 136.77 ms / 25 tokens ( 5.47 ms per token, 182.79 tokens per second)
1.18.936.613 I slot print_timing: id 12 | task 357 | eval time = 4865.73 ms / 114 tokens ( 42.68 ms per token, 23.43 tokens per second)
1.18.936.614 I slot print_timing: id 12 | task 357 | total time = 5002.49 ms / 139 tokens
1.18.936.615 I slot print_timing: id 12 | task 357 | graphs reused = 1
1.18.936.618 I slot print_timing: id 12 | task 357 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.18.936.630 I statistics draft-mtp: #calls(b,g,a) = 99 309 4741, #gen drafts = 4744, #acc drafts = 3325, #gen tokens = 9462, #acc tokens = 6304, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.065, 1121.753, 5.835 ms
1.18.936.658 I slot release: id 12 | task 357 | stop processing: n_tokens = 138, truncated = 0
1.18.945.385 I srv operator(): Chat format: peg-native
1.19.054.190 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.19.054.260 I slot launch_slot_: id 12 | task 410 | processing task, is_child = 0
1.19.059.052 W slot operator(): id 12 | task 410 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.059.089 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.19.311.583 I slot print_timing: id 9 | task 362 | n_decoded = 101, tg = 20.80 t/s, tg_3s = 20.80 t/s
1.19.435.154 I slot print_timing: id 11 | task 368 | n_decoded = 102, tg = 23.41 t/s, tg_3s = 23.41 t/s
1.19.921.907 I slot print_timing: id 8 | task 349 | n_decoded = 100, tg = 15.16 t/s, tg_3s = 15.16 t/s
1.19.923.595 I slot print_timing: id 11 | task 368 | prompt eval time = 125.78 ms / 25 tokens ( 5.03 ms per token, 198.76 tokens per second)
1.19.923.597 I slot print_timing: id 11 | task 368 | eval time = 4844.67 ms / 114 tokens ( 42.50 ms per token, 23.53 tokens per second)
1.19.923.598 I slot print_timing: id 11 | task 368 | total time = 4970.45 ms / 139 tokens
1.19.923.599 I slot print_timing: id 11 | task 368 | graphs reused = 1
1.19.923.602 I slot print_timing: id 11 | task 368 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.19.923.614 I statistics draft-mtp: #calls(b,g,a) = 100 317 4866, #gen drafts = 4870, #acc drafts = 3408, #gen tokens = 9713, #acc tokens = 6460, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.066, 1149.077, 5.999 ms
1.19.923.642 I slot release: id 11 | task 368 | stop processing: n_tokens = 138, truncated = 0
1.19.932.509 I srv operator(): Chat format: peg-native
1.20.036.102 I slot print_timing: id 6 | task 325 | prompt eval time = 153.15 ms / 29 tokens ( 5.28 ms per token, 189.36 tokens per second)
1.20.036.105 I slot print_timing: id 6 | task 325 | eval time = 8950.60 ms / 128 tokens ( 69.93 ms per token, 14.30 tokens per second)
1.20.036.106 I slot print_timing: id 6 | task 325 | total time = 9103.75 ms / 157 tokens
1.20.036.107 I slot print_timing: id 6 | task 325 | graphs reused = 1
1.20.036.109 I slot print_timing: id 6 | task 325 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.20.036.123 I statistics draft-mtp: #calls(b,g,a) = 100 318 4870, #gen drafts = 4884, #acc drafts = 3412, #gen tokens = 9741, #acc tokens = 6468, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.066, 1154.812, 6.002 ms
1.20.036.148 I slot release: id 6 | task 325 | stop processing: n_tokens = 156, truncated = 0
1.20.037.635 I slot print_timing: id 2 | task 356 | prompt eval time = 136.56 ms / 28 tokens ( 4.88 ms per token, 205.05 tokens per second)
1.20.037.637 I slot print_timing: id 2 | task 356 | eval time = 5967.02 ms / 125 tokens ( 47.74 ms per token, 20.95 tokens per second)
1.20.037.637 I slot print_timing: id 2 | task 356 | total time = 6103.58 ms / 153 tokens
1.20.037.638 I slot print_timing: id 2 | task 356 | graphs reused = 1
1.20.037.640 I slot print_timing: id 2 | task 356 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.20.037.647 I statistics draft-mtp: #calls(b,g,a) = 100 318 4873, #gen drafts = 4884, #acc drafts = 3414, #gen tokens = 9741, #acc tokens = 6471, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.066, 1154.812, 6.007 ms
1.20.037.668 I slot release: id 2 | task 356 | stop processing: n_tokens = 152, truncated = 0
1.20.043.417 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.20.043.485 I slot launch_slot_: id 6 | task 419 | processing task, is_child = 0
1.20.046.711 I srv operator(): Chat format: peg-native
1.20.047.012 I srv operator(): Chat format: peg-native
1.20.049.730 W slot operator(): id 6 | task 419 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.049.751 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.170.696 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.20.170.760 I slot launch_slot_: id 2 | task 421 | processing task, is_child = 0
1.20.170.763 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.20.170.782 I slot launch_slot_: id 11 | task 422 | processing task, is_child = 0
1.20.176.556 W slot operator(): id 2 | task 421 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.176.591 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.176.644 W slot operator(): id 11 | task 422 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.176.673 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.441.290 I slot print_timing: id 9 | task 362 | prompt eval time = 125.37 ms / 28 tokens ( 4.48 ms per token, 223.34 tokens per second)
1.20.441.293 I slot print_timing: id 9 | task 362 | eval time = 5984.92 ms / 125 tokens ( 47.88 ms per token, 20.89 tokens per second)
1.20.441.294 I slot print_timing: id 9 | task 362 | total time = 6110.29 ms / 153 tokens
1.20.441.295 I slot print_timing: id 9 | task 362 | graphs reused = 1
1.20.441.298 I slot print_timing: id 9 | task 362 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.20.441.309 I statistics draft-mtp: #calls(b,g,a) = 103 321 4921, #gen drafts = 4927, #acc drafts = 3446, #gen tokens = 9827, #acc tokens = 6533, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.068, 1169.786, 6.067 ms
1.20.441.336 I slot release: id 9 | task 362 | stop processing: n_tokens = 152, truncated = 0
1.20.449.778 I srv operator(): Chat format: peg-native
1.20.558.256 I slot print_timing: id 7 | task 380 | n_decoded = 102, tg = 23.43 t/s, tg_3s = 23.43 t/s
1.20.561.131 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.20.561.199 I slot launch_slot_: id 9 | task 426 | processing task, is_child = 0
1.20.566.175 W slot operator(): id 9 | task 426 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.566.206 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.060.514 I slot print_timing: id 5 | task 336 | prompt eval time = 119.07 ms / 29 tokens ( 4.11 ms per token, 243.55 tokens per second)
1.21.060.518 I slot print_timing: id 5 | task 336 | eval time = 8994.62 ms / 128 tokens ( 70.27 ms per token, 14.23 tokens per second)
1.21.060.518 I slot print_timing: id 5 | task 336 | total time = 9113.70 ms / 157 tokens
1.21.060.519 I slot print_timing: id 5 | task 336 | graphs reused = 1
1.21.060.523 I slot print_timing: id 5 | task 336 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.21.060.539 I statistics draft-mtp: #calls(b,g,a) = 104 326 4989, #gen drafts = 5004, #acc drafts = 3493, #gen tokens = 9980, #acc tokens = 6622, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.069, 1189.899, 6.158 ms
1.21.060.566 I slot release: id 5 | task 336 | stop processing: n_tokens = 156, truncated = 0
1.21.063.720 I slot print_timing: id 4 | task 379 | n_decoded = 101, tg = 20.78 t/s, tg_3s = 20.78 t/s
1.21.064.927 I slot print_timing: id 7 | task 380 | prompt eval time = 152.94 ms / 25 tokens ( 6.12 ms per token, 163.46 tokens per second)
1.21.064.929 I slot print_timing: id 7 | task 380 | eval time = 4860.83 ms / 114 tokens ( 42.64 ms per token, 23.45 tokens per second)
1.21.064.930 I slot print_timing: id 7 | task 380 | total time = 5013.78 ms / 139 tokens
1.21.064.931 I slot print_timing: id 7 | task 380 | graphs reused = 1
1.21.064.934 I slot print_timing: id 7 | task 380 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.21.064.942 I statistics draft-mtp: #calls(b,g,a) = 104 326 4996, #gen drafts = 5004, #acc drafts = 3500, #gen tokens = 9980, #acc tokens = 6636, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.069, 1189.899, 6.168 ms
1.21.064.968 I slot release: id 7 | task 380 | stop processing: n_tokens = 138, truncated = 0
1.21.069.814 I srv operator(): Chat format: peg-native
1.21.074.419 I srv operator(): Chat format: peg-native
1.21.179.761 I slot print_timing: id 13 | task 360 | n_decoded = 100, tg = 14.58 t/s, tg_3s = 14.58 t/s
1.21.180.354 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.21.180.433 I slot launch_slot_: id 5 | task 432 | processing task, is_child = 0
1.21.180.438 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.21.180.456 I slot launch_slot_: id 7 | task 433 | processing task, is_child = 0
1.21.186.096 W slot operator(): id 5 | task 432 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.21.186.133 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.186.160 W slot operator(): id 7 | task 433 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.21.186.182 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.817.618 I slot print_timing: id 10 | task 393 | n_decoded = 102, tg = 23.37 t/s, tg_3s = 23.37 t/s
1.22.058.067 I slot print_timing: id 8 | task 349 | prompt eval time = 126.09 ms / 29 tokens ( 4.35 ms per token, 229.99 tokens per second)
1.22.058.070 I slot print_timing: id 8 | task 349 | eval time = 8734.47 ms / 128 tokens ( 68.24 ms per token, 14.65 tokens per second)
1.22.058.071 I slot print_timing: id 8 | task 349 | total time = 8860.56 ms / 157 tokens
1.22.058.071 I slot print_timing: id 8 | task 349 | graphs reused = 1
1.22.058.074 I slot print_timing: id 8 | task 349 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.22.058.088 I statistics draft-mtp: #calls(b,g,a) = 106 334 5112, #gen drafts = 5127, #acc drafts = 3577, #gen tokens = 10225, #acc tokens = 6781, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.070, 1221.879, 6.316 ms
1.22.058.110 I slot release: id 8 | task 349 | stop processing: n_tokens = 156, truncated = 0
1.22.067.162 I srv operator(): Chat format: peg-native
1.22.177.724 I slot print_timing: id 3 | task 391 | n_decoded = 101, tg = 20.78 t/s, tg_3s = 20.78 t/s
1.22.178.354 I slot print_timing: id 4 | task 379 | prompt eval time = 152.73 ms / 28 tokens ( 5.45 ms per token, 183.33 tokens per second)
1.22.178.356 I slot print_timing: id 4 | task 379 | eval time = 5974.55 ms / 125 tokens ( 47.80 ms per token, 20.92 tokens per second)
1.22.178.356 I slot print_timing: id 4 | task 379 | total time = 6127.28 ms / 153 tokens
1.22.178.357 I slot print_timing: id 4 | task 379 | graphs reused = 1
1.22.178.360 I slot print_timing: id 4 | task 379 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.22.178.372 I statistics draft-mtp: #calls(b,g,a) = 106 335 5132, #gen drafts = 5142, #acc drafts = 3590, #gen tokens = 10255, #acc tokens = 6806, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.070, 1226.981, 6.339 ms
1.22.178.407 I slot release: id 4 | task 379 | stop processing: n_tokens = 152, truncated = 0
1.22.183.933 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.22.184.001 I slot launch_slot_: id 8 | task 442 | processing task, is_child = 0
1.22.187.435 I srv operator(): Chat format: peg-native
1.22.189.807 W slot operator(): id 8 | task 442 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.22.189.847 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.22.314.035 I slot print_timing: id 10 | task 393 | prompt eval time = 124.54 ms / 25 tokens ( 4.98 ms per token, 200.73 tokens per second)
1.22.314.038 I slot print_timing: id 10 | task 393 | eval time = 4860.89 ms / 114 tokens ( 42.64 ms per token, 23.45 tokens per second)
1.22.314.039 I slot print_timing: id 10 | task 393 | total time = 4985.43 ms / 139 tokens
1.22.314.040 I slot print_timing: id 10 | task 393 | graphs reused = 1
1.22.314.042 I slot print_timing: id 10 | task 393 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.22.314.053 I statistics draft-mtp: #calls(b,g,a) = 107 336 5151, #gen drafts = 5156, #acc drafts = 3604, #gen tokens = 10283, #acc tokens = 6834, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.071, 1232.696, 6.364 ms
1.22.314.077 I slot release: id 10 | task 393 | stop processing: n_tokens = 138, truncated = 0
1.22.316.990 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.22.317.059 I slot launch_slot_: id 4 | task 444 | processing task, is_child = 0
1.22.322.829 W slot operator(): id 4 | task 444 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.22.322.853 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.22.323.172 I srv operator(): Chat format: peg-native
1.22.448.820 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.22.448.890 I slot launch_slot_: id 10 | task 446 | processing task, is_child = 0
1.22.453.587 W slot operator(): id 10 | task 446 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.22.453.612 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.22.832.062 I slot print_timing: id 15 | task 378 | n_decoded = 100, tg = 15.09 t/s, tg_3s = 15.09 t/s
1.23.315.983 I slot print_timing: id 13 | task 360 | prompt eval time = 119.44 ms / 29 tokens ( 4.12 ms per token, 242.80 tokens per second)
1.23.315.987 I slot print_timing: id 13 | task 360 | eval time = 8996.69 ms / 128 tokens ( 70.29 ms per token, 14.23 tokens per second)
1.23.315.988 I slot print_timing: id 13 | task 360 | total time = 9116.13 ms / 157 tokens
1.23.315.989 I slot print_timing: id 13 | task 360 | graphs reused = 1
1.23.315.992 I slot print_timing: id 13 | task 360 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.23.316.009 I statistics draft-mtp: #calls(b,g,a) = 109 344 5265, #gen drafts = 5280, #acc drafts = 3687, #gen tokens = 10530, #acc tokens = 6990, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.073, 1262.435, 6.511 ms
1.23.316.037 I slot release: id 13 | task 360 | stop processing: n_tokens = 156, truncated = 0
1.23.317.971 I slot print_timing: id 3 | task 391 | prompt eval time = 134.07 ms / 28 tokens ( 4.79 ms per token, 208.84 tokens per second)
1.23.317.974 I slot print_timing: id 3 | task 391 | eval time = 6000.48 ms / 125 tokens ( 48.00 ms per token, 20.83 tokens per second)
1.23.317.975 I slot print_timing: id 3 | task 391 | total time = 6134.55 ms / 153 tokens
1.23.317.976 I slot print_timing: id 3 | task 391 | graphs reused = 1
1.23.317.978 I slot print_timing: id 3 | task 391 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.23.317.985 I statistics draft-mtp: #calls(b,g,a) = 109 344 5269, #gen drafts = 5280, #acc drafts = 3689, #gen tokens = 10530, #acc tokens = 6994, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.073, 1262.435, 6.520 ms
1.23.318.005 I slot release: id 3 | task 391 | stop processing: n_tokens = 152, truncated = 0
1.23.326.673 I srv operator(): Chat format: peg-native
1.23.327.845 I srv operator(): Chat format: peg-native
1.23.433.738 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.23.433.807 I slot launch_slot_: id 13 | task 455 | processing task, is_child = 0
1.23.433.810 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.23.433.829 I slot launch_slot_: id 3 | task 456 | processing task, is_child = 0
1.23.438.888 W slot operator(): id 3 | task 456 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.438.919 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.438.958 W slot operator(): id 13 | task 455 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.438.984 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.579.348 I slot print_timing: id 0 | task 405 | n_decoded = 101, tg = 20.64 t/s, tg_3s = 20.64 t/s
1.23.585.611 I slot print_timing: id 12 | task 410 | n_decoded = 102, tg = 23.18 t/s, tg_3s = 23.18 t/s
1.24.075.525 I slot print_timing: id 12 | task 410 | prompt eval time = 125.36 ms / 25 tokens ( 5.01 ms per token, 199.43 tokens per second)
1.24.075.528 I slot print_timing: id 12 | task 410 | eval time = 4891.07 ms / 114 tokens ( 42.90 ms per token, 23.31 tokens per second)
1.24.075.528 I slot print_timing: id 12 | task 410 | total time = 5016.43 ms / 139 tokens
1.24.075.529 I slot print_timing: id 12 | task 410 | graphs reused = 1
1.24.075.532 I slot print_timing: id 12 | task 410 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.24.075.544 I statistics draft-mtp: #calls(b,g,a) = 111 350 5369, #gen drafts = 5372, #acc drafts = 3757, #gen tokens = 10714, #acc tokens = 7123, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.074, 1284.989, 6.660 ms
1.24.075.572 I slot release: id 12 | task 410 | stop processing: n_tokens = 138, truncated = 0
1.24.084.715 I srv operator(): Chat format: peg-native
1.24.193.518 I slot print_timing: id 14 | task 390 | n_decoded = 100, tg = 14.54 t/s, tg_3s = 14.54 t/s
1.24.193.822 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.24.193.890 I slot launch_slot_: id 12 | task 463 | processing task, is_child = 0
1.24.198.537 W slot operator(): id 12 | task 463 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.198.568 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.690.996 I slot print_timing: id 0 | task 405 | prompt eval time = 124.75 ms / 28 tokens ( 4.46 ms per token, 224.45 tokens per second)
1.24.691.000 I slot print_timing: id 0 | task 405 | eval time = 6005.32 ms / 125 tokens ( 48.04 ms per token, 20.81 tokens per second)
1.24.691.000 I slot print_timing: id 0 | task 405 | total time = 6130.07 ms / 153 tokens
1.24.691.001 I slot print_timing: id 0 | task 405 | graphs reused = 1
1.24.691.004 I slot print_timing: id 0 | task 405 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.24.691.018 I statistics draft-mtp: #calls(b,g,a) = 112 355 5435, #gen drafts = 5450, #acc drafts = 3802, #gen tokens = 10870, #acc tokens = 7209, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.075, 1302.941, 6.739 ms
1.24.691.044 I slot release: id 0 | task 405 | stop processing: n_tokens = 152, truncated = 0
1.24.696.824 I slot print_timing: id 11 | task 422 | n_decoded = 102, tg = 23.28 t/s, tg_3s = 23.28 t/s
1.24.700.663 I srv operator(): Chat format: peg-native
1.24.812.466 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.24.812.537 I slot launch_slot_: id 0 | task 469 | processing task, is_child = 0
1.24.815.532 W slot operator(): id 0 | task 469 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.815.565 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.939.553 I slot print_timing: id 15 | task 378 | prompt eval time = 153.14 ms / 29 tokens ( 5.28 ms per token, 189.37 tokens per second)
1.24.939.555 I slot print_timing: id 15 | task 378 | eval time = 8735.23 ms / 128 tokens ( 68.24 ms per token, 14.65 tokens per second)
1.24.939.556 I slot print_timing: id 15 | task 378 | total time = 8888.37 ms / 157 tokens
1.24.939.556 I slot print_timing: id 15 | task 378 | graphs reused = 1
1.24.939.559 I slot print_timing: id 15 | task 378 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.24.939.571 I statistics draft-mtp: #calls(b,g,a) = 113 357 5465, #gen drafts = 5479, #acc drafts = 3821, #gen tokens = 10927, #acc tokens = 7244, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.076, 1308.851, 6.776 ms
1.24.939.595 I slot release: id 15 | task 378 | stop processing: n_tokens = 156, truncated = 0
1.24.948.422 I srv operator(): Chat format: peg-native
1.25.054.660 I slot print_timing: id 1 | task 402 | n_decoded = 100, tg = 15.11 t/s, tg_3s = 15.11 t/s
1.25.061.666 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.25.061.744 I slot launch_slot_: id 15 | task 472 | processing task, is_child = 0
1.25.064.780 W slot operator(): id 15 | task 472 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.25.064.812 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.25.191.858 I slot print_timing: id 2 | task 421 | n_decoded = 101, tg = 20.71 t/s, tg_3s = 20.71 t/s
1.25.196.439 I slot print_timing: id 11 | task 422 | prompt eval time = 139.61 ms / 25 tokens ( 5.58 ms per token, 179.07 tokens per second)
1.25.196.442 I slot print_timing: id 11 | task 422 | eval time = 4880.15 ms / 114 tokens ( 42.81 ms per token, 23.36 tokens per second)
1.25.196.442 I slot print_timing: id 11 | task 422 | total time = 5019.76 ms / 139 tokens
1.25.196.443 I slot print_timing: id 11 | task 422 | graphs reused = 1
1.25.196.447 I slot print_timing: id 11 | task 422 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.25.196.458 I statistics draft-mtp: #calls(b,g,a) = 114 359 5506, #gen drafts = 5509, #acc drafts = 3851, #gen tokens = 10987, #acc tokens = 7300, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.077, 1314.789, 6.827 ms
1.25.196.487 I slot release: id 11 | task 422 | stop processing: n_tokens = 138, truncated = 0
1.25.205.005 I srv operator(): Chat format: peg-native
1.25.315.347 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.25.315.419 I slot launch_slot_: id 11 | task 475 | processing task, is_child = 0
1.25.320.502 W slot operator(): id 11 | task 475 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.25.320.538 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.25.692.580 I slot print_timing: id 7 | task 433 | n_decoded = 102, tg = 23.35 t/s, tg_3s = 23.35 t/s
1.26.181.935 I slot print_timing: id 5 | task 432 | n_decoded = 101, tg = 20.79 t/s, tg_3s = 20.79 t/s
1.26.182.827 I slot print_timing: id 7 | task 433 | prompt eval time = 138.93 ms / 25 tokens ( 5.56 ms per token, 179.95 tokens per second)
1.26.182.830 I slot print_timing: id 7 | task 433 | eval time = 4857.70 ms / 114 tokens ( 42.61 ms per token, 23.47 tokens per second)
1.26.182.830 I slot print_timing: id 7 | task 433 | total time = 4996.62 ms / 139 tokens
1.26.182.831 I slot print_timing: id 7 | task 433 | graphs reused = 1
1.26.182.834 I slot print_timing: id 7 | task 433 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.26.182.846 I statistics draft-mtp: #calls(b,g,a) = 115 367 5627, #gen drafts = 5635, #acc drafts = 3931, #gen tokens = 11238, #acc tokens = 7455, #mean acc len = 2.32, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.078, 1342.743, 6.984 ms
1.26.182.874 I slot release: id 7 | task 433 | stop processing: n_tokens = 138, truncated = 0
1.26.191.871 I srv operator(): Chat format: peg-native
1.26.297.168 I slot print_timing: id 14 | task 390 | prompt eval time = 134.32 ms / 29 tokens ( 4.63 ms per token, 215.91 tokens per second)
1.26.297.172 I slot print_timing: id 14 | task 390 | eval time = 8979.36 ms / 128 tokens ( 70.15 ms per token, 14.25 tokens per second)
1.26.297.172 I slot print_timing: id 14 | task 390 | total time = 9113.68 ms / 157 tokens
1.26.297.174 I slot print_timing: id 14 | task 390 | graphs reused = 1
1.26.297.177 I slot print_timing: id 14 | task 390 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.26.297.190 I statistics draft-mtp: #calls(b,g,a) = 115 368 5635, #gen drafts = 5649, #acc drafts = 3936, #gen tokens = 11266, #acc tokens = 7465, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.626), dur(b,g,a) = 0.078, 1348.358, 6.993 ms
1.26.297.216 I slot release: id 14 | task 390 | stop processing: n_tokens = 156, truncated = 0
1.26.299.030 I slot print_timing: id 2 | task 421 | prompt eval time = 139.36 ms / 28 tokens ( 4.98 ms per token, 200.91 tokens per second)
1.26.299.034 I slot print_timing: id 2 | task 421 | eval time = 5983.06 ms / 125 tokens ( 47.86 ms per token, 20.89 tokens per second)
1.26.299.034 I slot print_timing: id 2 | task 421 | total time = 6122.42 ms / 153 tokens
1.26.299.035 I slot print_timing: id 2 | task 421 | graphs reused = 1
1.26.299.037 I slot print_timing: id 2 | task 421 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.26.299.044 I statistics draft-mtp: #calls(b,g,a) = 115 368 5638, #gen drafts = 5649, #acc drafts = 3939, #gen tokens = 11266, #acc tokens = 7470, #mean acc len = 2.32, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.078, 1348.358, 6.999 ms
1.26.299.066 I slot release: id 2 | task 421 | stop processing: n_tokens = 152, truncated = 0
1.26.304.782 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.26.304.847 I slot launch_slot_: id 14 | task 484 | processing task, is_child = 0
1.26.306.150 I srv operator(): Chat format: peg-native
1.26.307.638 I srv operator(): Chat format: peg-native
1.26.311.106 W slot operator(): id 14 | task 484 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.26.311.141 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.26.431.518 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.26.431.588 I slot launch_slot_: id 2 | task 486 | processing task, is_child = 0
1.26.431.591 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.26.431.613 I slot launch_slot_: id 7 | task 487 | processing task, is_child = 0
1.26.437.407 W slot operator(): id 2 | task 486 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.26.437.437 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.26.437.480 W slot operator(): id 7 | task 487 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.26.437.517 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.26.948.003 I slot print_timing: id 10 | task 446 | n_decoded = 102, tg = 23.35 t/s, tg_3s = 23.34 t/s
1.27.068.252 I slot print_timing: id 6 | task 419 | n_decoded = 100, tg = 14.48 t/s, tg_3s = 14.48 t/s
1.27.187.033 I slot print_timing: id 1 | task 402 | prompt eval time = 123.27 ms / 29 tokens ( 4.25 ms per token, 235.26 tokens per second)
1.27.187.036 I slot print_timing: id 1 | task 402 | eval time = 8751.78 ms / 128 tokens ( 68.37 ms per token, 14.63 tokens per second)
1.27.187.037 I slot print_timing: id 1 | task 402 | total time = 8875.05 ms / 157 tokens
1.27.187.038 I slot print_timing: id 1 | task 402 | graphs reused = 1
1.27.187.041 I slot print_timing: id 1 | task 402 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.27.187.055 I statistics draft-mtp: #calls(b,g,a) = 118 375 5740, #gen drafts = 5755, #acc drafts = 4010, #gen tokens = 11477, #acc tokens = 7604, #mean acc len = 2.32, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.081, 1376.700, 7.137 ms
1.27.187.087 I slot release: id 1 | task 402 | stop processing: n_tokens = 156, truncated = 0
1.27.196.124 I srv operator(): Chat format: peg-native
1.27.305.346 I slot print_timing: id 4 | task 444 | n_decoded = 101, tg = 20.77 t/s, tg_3s = 20.77 t/s
1.27.305.982 I slot print_timing: id 5 | task 432 | prompt eval time = 138.71 ms / 28 tokens ( 4.95 ms per token, 201.86 tokens per second)
1.27.305.987 I slot print_timing: id 5 | task 432 | eval time = 5981.12 ms / 125 tokens ( 47.85 ms per token, 20.90 tokens per second)
1.27.305.988 I slot print_timing: id 5 | task 432 | total time = 6119.83 ms / 153 tokens
1.27.305.989 I slot print_timing: id 5 | task 432 | graphs reused = 1
1.27.305.992 I slot print_timing: id 5 | task 432 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.27.306.002 I statistics draft-mtp: #calls(b,g,a) = 118 376 5760, #gen drafts = 5770, #acc drafts = 4025, #gen tokens = 11507, #acc tokens = 7633, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.081, 1380.594, 7.160 ms
1.27.306.026 I slot release: id 5 | task 432 | stop processing: n_tokens = 152, truncated = 0
1.27.308.168 I slot print_timing: id 9 | task 426 | n_decoded = 100, tg = 15.11 t/s, tg_3s = 15.11 t/s
1.27.311.350 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.27.311.422 I slot launch_slot_: id 1 | task 495 | processing task, is_child = 0
1.27.314.462 I srv operator(): Chat format: peg-native
1.27.316.413 W slot operator(): id 1 | task 495 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.316.449 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.441.469 I slot print_timing: id 10 | task 446 | prompt eval time = 125.16 ms / 25 tokens ( 5.01 ms per token, 199.75 tokens per second)
1.27.441.473 I slot print_timing: id 10 | task 446 | eval time = 4862.69 ms / 114 tokens ( 42.66 ms per token, 23.44 tokens per second)
1.27.441.474 I slot print_timing: id 10 | task 446 | total time = 4987.85 ms / 139 tokens
1.27.441.475 I slot print_timing: id 10 | task 446 | graphs reused = 1
1.27.441.478 I slot print_timing: id 10 | task 446 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.27.441.488 I statistics draft-mtp: #calls(b,g,a) = 119 377 5779, #gen drafts = 5784, #acc drafts = 4041, #gen tokens = 11535, #acc tokens = 7662, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.627), dur(b,g,a) = 0.082, 1385.492, 7.184 ms
1.27.441.518 I slot release: id 10 | task 446 | stop processing: n_tokens = 138, truncated = 0
1.27.443.783 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.27.443.847 I slot launch_slot_: id 5 | task 497 | processing task, is_child = 0
1.27.449.667 W slot operator(): id 5 | task 497 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.449.695 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.449.814 I srv operator(): Chat format: peg-native
1.27.575.650 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.27.575.717 I slot launch_slot_: id 10 | task 499 | processing task, is_child = 0
1.27.580.532 W slot operator(): id 10 | task 499 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.580.565 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.28.441.385 I slot print_timing: id 3 | task 456 | n_decoded = 101, tg = 20.77 t/s, tg_3s = 20.77 t/s
1.28.442.015 I slot print_timing: id 4 | task 444 | prompt eval time = 119.19 ms / 28 tokens ( 4.26 ms per token, 234.91 tokens per second)
1.28.442.017 I slot print_timing: id 4 | task 444 | eval time = 5999.94 ms / 125 tokens ( 48.00 ms per token, 20.83 tokens per second)
1.28.442.017 I slot print_timing: id 4 | task 444 | total time = 6119.14 ms / 153 tokens
1.28.442.018 I slot print_timing: id 4 | task 444 | graphs reused = 1
1.28.442.021 I slot print_timing: id 4 | task 444 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.28.442.032 I statistics draft-mtp: #calls(b,g,a) = 121 385 5898, #gen drafts = 5909, #acc drafts = 4122, #gen tokens = 11785, #acc tokens = 7816, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.084, 1414.568, 7.333 ms
1.28.442.059 I slot release: id 4 | task 444 | stop processing: n_tokens = 152, truncated = 0
1.28.451.314 I srv operator(): Chat format: peg-native
1.28.564.123 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.28.564.201 I slot launch_slot_: id 4 | task 508 | processing task, is_child = 0
1.28.569.162 W slot operator(): id 4 | task 508 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.569.191 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.28.701.471 I slot print_timing: id 12 | task 463 | n_decoded = 102, tg = 23.30 t/s, tg_3s = 23.30 t/s
1.29.184.665 I slot print_timing: id 6 | task 419 | prompt eval time = 113.42 ms / 29 tokens ( 3.91 ms per token, 255.68 tokens per second)
1.29.184.669 I slot print_timing: id 6 | task 419 | eval time = 9021.47 ms / 128 tokens ( 70.48 ms per token, 14.19 tokens per second)
1.29.184.670 I slot print_timing: id 6 | task 419 | total time = 9134.89 ms / 157 tokens
1.29.184.671 I slot print_timing: id 6 | task 419 | graphs reused = 1
1.29.184.674 I slot print_timing: id 6 | task 419 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.29.184.689 I statistics draft-mtp: #calls(b,g,a) = 122 391 5987, #gen drafts = 6002, #acc drafts = 4181, #gen tokens = 11970, #acc tokens = 7928, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.626), dur(b,g,a) = 0.084, 1437.614, 7.440 ms
1.29.184.712 I slot release: id 6 | task 419 | stop processing: n_tokens = 156, truncated = 0
1.29.188.386 I slot print_timing: id 8 | task 442 | n_decoded = 100, tg = 14.54 t/s, tg_3s = 14.54 t/s
1.29.190.804 I slot print_timing: id 12 | task 463 | prompt eval time = 124.99 ms / 25 tokens ( 5.00 ms per token, 200.01 tokens per second)
1.29.190.807 I slot print_timing: id 12 | task 463 | eval time = 4867.23 ms / 114 tokens ( 42.70 ms per token, 23.42 tokens per second)
1.29.190.807 I slot print_timing: id 12 | task 463 | total time = 4992.23 ms / 139 tokens
1.29.190.808 I slot print_timing: id 12 | task 463 | graphs reused = 1
1.29.190.810 I slot print_timing: id 12 | task 463 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.29.190.817 I statistics draft-mtp: #calls(b,g,a) = 122 391 5999, #gen drafts = 6002, #acc drafts = 4189, #gen tokens = 11970, #acc tokens = 7944, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.626), dur(b,g,a) = 0.084, 1437.614, 7.457 ms
1.29.190.841 I slot release: id 12 | task 463 | stop processing: n_tokens = 138, truncated = 0
1.29.194.171 I srv operator(): Chat format: peg-native
1.29.199.010 I srv operator(): Chat format: peg-native
1.29.303.379 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.29.303.454 I slot launch_slot_: id 6 | task 515 | processing task, is_child = 0
1.29.303.459 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.29.303.480 I slot launch_slot_: id 12 | task 516 | processing task, is_child = 0
1.29.309.454 W slot operator(): id 6 | task 515 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.309.479 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.309.521 W slot operator(): id 12 | task 516 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.309.546 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.446.915 I slot print_timing: id 9 | task 426 | prompt eval time = 125.57 ms / 29 tokens ( 4.33 ms per token, 230.95 tokens per second)
1.29.446.918 I slot print_timing: id 9 | task 426 | eval time = 8755.15 ms / 128 tokens ( 68.40 ms per token, 14.62 tokens per second)
1.29.446.919 I slot print_timing: id 9 | task 426 | total time = 8880.72 ms / 157 tokens
1.29.446.920 I slot print_timing: id 9 | task 426 | graphs reused = 1
1.29.446.923 I slot print_timing: id 9 | task 426 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.29.446.935 I statistics draft-mtp: #calls(b,g,a) = 123 393 6016, #gen drafts = 6029, #acc drafts = 4200, #gen tokens = 12023, #acc tokens = 7964, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.626), dur(b,g,a) = 0.086, 1449.445, 7.478 ms
1.29.446.962 I slot release: id 9 | task 426 | stop processing: n_tokens = 156, truncated = 0
1.29.456.173 I srv operator(): Chat format: peg-native
1.29.565.674 I slot print_timing: id 3 | task 456 | prompt eval time = 139.47 ms / 28 tokens ( 4.98 ms per token, 200.75 tokens per second)
1.29.565.677 I slot print_timing: id 3 | task 456 | eval time = 5987.26 ms / 125 tokens ( 47.90 ms per token, 20.88 tokens per second)
1.29.565.678 I slot print_timing: id 3 | task 456 | total time = 6126.74 ms / 153 tokens
1.29.565.679 I slot print_timing: id 3 | task 456 | graphs reused = 1
1.29.565.682 I slot print_timing: id 3 | task 456 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.29.565.694 I statistics draft-mtp: #calls(b,g,a) = 124 394 6033, #gen drafts = 6044, #acc drafts = 4211, #gen tokens = 12053, #acc tokens = 7986, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.626), dur(b,g,a) = 0.086, 1454.018, 7.502 ms
1.29.565.719 I slot release: id 3 | task 456 | stop processing: n_tokens = 152, truncated = 0
1.29.572.047 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.29.572.113 I slot launch_slot_: id 9 | task 519 | processing task, is_child = 0
1.29.574.558 I srv operator(): Chat format: peg-native
1.29.577.743 W slot operator(): id 9 | task 519 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.577.764 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.704.023 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.29.704.087 I slot launch_slot_: id 3 | task 521 | processing task, is_child = 0
1.29.708.665 W slot operator(): id 3 | task 521 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.708.694 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.839.956 I slot print_timing: id 11 | task 475 | n_decoded = 102, tg = 23.21 t/s, tg_3s = 23.21 t/s
1.30.086.798 I slot print_timing: id 15 | task 472 | n_decoded = 101, tg = 20.63 t/s, tg_3s = 20.63 t/s
1.30.329.725 I slot print_timing: id 11 | task 475 | prompt eval time = 124.90 ms / 25 tokens ( 5.00 ms per token, 200.16 tokens per second)
1.30.329.728 I slot print_timing: id 11 | task 475 | eval time = 4884.27 ms / 114 tokens ( 42.84 ms per token, 23.34 tokens per second)
1.30.329.728 I slot print_timing: id 11 | task 475 | total time = 5009.17 ms / 139 tokens
1.30.329.729 I slot print_timing: id 11 | task 475 | graphs reused = 1
1.30.329.732 I slot print_timing: id 11 | task 475 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.30.329.745 I statistics draft-mtp: #calls(b,g,a) = 126 400 6133, #gen drafts = 6137, #acc drafts = 4285, #gen tokens = 12239, #acc tokens = 8126, #mean acc len = 2.32, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.088, 1476.425, 7.632 ms
1.30.329.772 I slot release: id 11 | task 475 | stop processing: n_tokens = 138, truncated = 0
1.30.338.351 I srv operator(): Chat format: peg-native
1.30.447.511 I slot print_timing: id 13 | task 455 | n_decoded = 100, tg = 14.56 t/s, tg_3s = 14.56 t/s
1.30.448.725 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.30.448.792 I slot launch_slot_: id 11 | task 528 | processing task, is_child = 0
1.30.453.945 W slot operator(): id 11 | task 528 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.30.453.971 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.30.948.407 I slot print_timing: id 7 | task 487 | n_decoded = 102, tg = 23.34 t/s, tg_3s = 23.33 t/s
1.31.197.040 I slot print_timing: id 15 | task 472 | prompt eval time = 125.22 ms / 28 tokens ( 4.47 ms per token, 223.60 tokens per second)
1.31.197.043 I slot print_timing: id 15 | task 472 | eval time = 6006.98 ms / 125 tokens ( 48.06 ms per token, 20.81 tokens per second)
1.31.197.043 I slot print_timing: id 15 | task 472 | total time = 6132.21 ms / 153 tokens
1.31.197.044 I slot print_timing: id 15 | task 472 | graphs reused = 1
1.31.197.047 I slot print_timing: id 15 | task 472 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.31.197.057 I statistics draft-mtp: #calls(b,g,a) = 127 407 6247, #gen drafts = 6247, #acc drafts = 4360, #gen tokens = 12458, #acc tokens = 8264, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.625), dur(b,g,a) = 0.089, 1501.275, 7.779 ms
1.31.197.084 I slot release: id 15 | task 472 | stop processing: n_tokens = 152, truncated = 0
1.31.207.237 I srv operator(): Chat format: peg-native
1.31.306.595 I slot print_timing: id 8 | task 442 | prompt eval time = 119.63 ms / 29 tokens ( 4.13 ms per token, 242.42 tokens per second)
1.31.306.599 I slot print_timing: id 8 | task 442 | eval time = 8997.13 ms / 128 tokens ( 70.29 ms per token, 14.23 tokens per second)
1.31.306.599 I slot print_timing: id 8 | task 442 | total time = 9116.75 ms / 157 tokens
1.31.306.600 I slot print_timing: id 8 | task 442 | graphs reused = 1
1.31.306.603 I slot print_timing: id 8 | task 442 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.31.306.624 I statistics draft-mtp: #calls(b,g,a) = 127 408 6247, #gen drafts = 6261, #acc drafts = 4360, #gen tokens = 12486, #acc tokens = 8264, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.625), dur(b,g,a) = 0.089, 1506.261, 7.779 ms
1.31.306.653 I slot release: id 8 | task 442 | stop processing: n_tokens = 156, truncated = 0
1.31.314.610 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.31.314.676 I slot launch_slot_: id 8 | task 536 | processing task, is_child = 0
1.31.319.635 W slot operator(): id 8 | task 536 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.31.319.664 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.31.440.554 I slot print_timing: id 2 | task 486 | n_decoded = 101, tg = 20.77 t/s, tg_3s = 20.77 t/s
1.31.442.938 I slot print_timing: id 7 | task 487 | prompt eval time = 139.77 ms / 25 tokens ( 5.59 ms per token, 178.87 tokens per second)
1.31.442.940 I slot print_timing: id 7 | task 487 | eval time = 4865.65 ms / 114 tokens ( 42.68 ms per token, 23.43 tokens per second)
1.31.442.941 I slot print_timing: id 7 | task 487 | total time = 5005.42 ms / 139 tokens
1.31.442.942 I slot print_timing: id 7 | task 487 | graphs reused = 1
1.31.442.945 I slot print_timing: id 7 | task 487 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.31.442.957 I statistics draft-mtp: #calls(b,g,a) = 128 409 6269, #gen drafts = 6275, #acc drafts = 4377, #gen tokens = 12514, #acc tokens = 8298, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.625), dur(b,g,a) = 0.090, 1511.132, 7.810 ms
1.31.442.987 I slot release: id 7 | task 487 | stop processing: n_tokens = 138, truncated = 0
1.31.550.162 I slot print_timing: id 0 | task 469 | n_decoded = 100, tg = 15.13 t/s, tg_3s = 15.13 t/s
1.31.994.982 I slot print_timing: id 10 | task 499 | n_decoded = 102, tg = 23.78 t/s, tg_3s = 23.78 t/s
1.32.322.598 I slot print_timing: id 5 | task 497 | n_decoded = 101, tg = 21.25 t/s, tg_3s = 21.25 t/s
1.32.428.806 I slot print_timing: id 13 | task 455 | prompt eval time = 139.69 ms / 29 tokens ( 4.82 ms per token, 207.61 tokens per second)
1.32.428.809 I slot print_timing: id 13 | task 455 | eval time = 8850.13 ms / 128 tokens ( 69.14 ms per token, 14.46 tokens per second)
1.32.428.810 I slot print_timing: id 13 | task 455 | total time = 8989.82 ms / 157 tokens
1.32.428.811 I slot print_timing: id 13 | task 455 | graphs reused = 1
1.32.428.815 I slot print_timing: id 13 | task 455 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.32.428.828 I statistics draft-mtp: #calls(b,g,a) = 128 418 6387, #gen drafts = 6400, #acc drafts = 4453, #gen tokens = 12763, #acc tokens = 8446, #mean acc len = 2.32, #acc rate/pos = (0.697, 0.625), dur(b,g,a) = 0.090, 1554.643, 7.956 ms
1.32.428.849 I slot release: id 13 | task 455 | stop processing: n_tokens = 156, truncated = 0
1.32.430.463 I slot print_timing: id 2 | task 486 | prompt eval time = 139.56 ms / 28 tokens ( 4.98 ms per token, 200.62 tokens per second)
1.32.430.465 I slot print_timing: id 2 | task 486 | eval time = 5853.47 ms / 125 tokens ( 46.83 ms per token, 21.35 tokens per second)
1.32.430.466 I slot print_timing: id 2 | task 486 | total time = 5993.03 ms / 153 tokens
1.32.430.467 I slot print_timing: id 2 | task 486 | graphs reused = 1
1.32.430.469 I slot print_timing: id 2 | task 486 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.32.430.474 I statistics draft-mtp: #calls(b,g,a) = 128 418 6390, #gen drafts = 6400, #acc drafts = 4455, #gen tokens = 12763, #acc tokens = 8450, #mean acc len = 2.32, #acc rate/pos = (0.697, 0.625), dur(b,g,a) = 0.090, 1554.643, 7.961 ms
1.32.430.490 I slot release: id 2 | task 486 | stop processing: n_tokens = 152, truncated = 0
1.32.434.000 I slot print_timing: id 10 | task 499 | prompt eval time = 124.98 ms / 25 tokens ( 5.00 ms per token, 200.04 tokens per second)
1.32.434.002 I slot print_timing: id 10 | task 499 | eval time = 4728.46 ms / 114 tokens ( 41.48 ms per token, 24.11 tokens per second)
1.32.434.002 I slot print_timing: id 10 | task 499 | total time = 4853.44 ms / 139 tokens
1.32.434.003 I slot print_timing: id 10 | task 499 | graphs reused = 1
1.32.434.005 I slot print_timing: id 10 | task 499 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.32.434.010 I statistics draft-mtp: #calls(b,g,a) = 128 418 6397, #gen drafts = 6400, #acc drafts = 4460, #gen tokens = 12763, #acc tokens = 8460, #mean acc len = 2.32, #acc rate/pos = (0.697, 0.625), dur(b,g,a) = 0.090, 1554.643, 7.970 ms
1.32.434.026 I slot release: id 10 | task 499 | stop processing: n_tokens = 138, truncated = 0
1.32.979.596 I slot print_timing: id 14 | task 484 | n_decoded = 100, tg = 15.26 t/s, tg_3s = 15.26 t/s
1.33.157.286 I slot print_timing: id 5 | task 497 | prompt eval time = 119.24 ms / 28 tokens ( 4.26 ms per token, 234.82 tokens per second)
1.33.157.289 I slot print_timing: id 5 | task 497 | eval time = 5588.35 ms / 125 tokens ( 44.71 ms per token, 22.37 tokens per second)
1.33.157.290 I slot print_timing: id 5 | task 497 | total time = 5707.59 ms / 153 tokens
1.33.157.291 I slot print_timing: id 5 | task 497 | graphs reused = 1
1.33.157.294 I slot print_timing: id 5 | task 497 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.33.157.305 I statistics draft-mtp: #calls(b,g,a) = 128 426 6482, #gen drafts = 6488, #acc drafts = 4512, #gen tokens = 12938, #acc tokens = 8558, #mean acc len = 2.32, #acc rate/pos = (0.696, 0.624), dur(b,g,a) = 0.090, 1605.051, 8.077 ms
1.33.157.326 I slot release: id 5 | task 497 | stop processing: n_tokens = 152, truncated = 0
1.33.236.686 I slot print_timing: id 0 | task 469 | prompt eval time = 123.78 ms / 29 tokens ( 4.27 ms per token, 234.28 tokens per second)
1.33.236.689 I slot print_timing: id 0 | task 469 | eval time = 8297.35 ms / 128 tokens ( 64.82 ms per token, 15.43 tokens per second)
1.33.236.690 I slot print_timing: id 0 | task 469 | total time = 8421.13 ms / 157 tokens
1.33.236.691 I slot print_timing: id 0 | task 469 | graphs reused = 1
1.33.236.695 I slot print_timing: id 0 | task 469 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.33.236.708 I statistics draft-mtp: #calls(b,g,a) = 128 427 6488, #gen drafts = 6497, #acc drafts = 4515, #gen tokens = 12956, #acc tokens = 8564, #mean acc len = 2.32, #acc rate/pos = (0.696, 0.624), dur(b,g,a) = 0.090, 1611.563, 8.084 ms
1.33.236.731 I slot release: id 0 | task 469 | stop processing: n_tokens = 156, truncated = 0
1.33.317.756 I slot print_timing: id 12 | task 516 | n_decoded = 102, tg = 26.35 t/s, tg_3s = 26.35 t/s
1.33.467.563 I slot print_timing: id 1 | task 495 | n_decoded = 100, tg = 16.58 t/s, tg_3s = 16.58 t/s
1.33.622.026 I slot print_timing: id 6 | task 515 | n_decoded = 101, tg = 24.19 t/s, tg_3s = 24.19 t/s
1.33.624.098 I slot print_timing: id 12 | task 516 | prompt eval time = 137.71 ms / 25 tokens ( 5.51 ms per token, 181.55 tokens per second)
1.33.624.101 I slot print_timing: id 12 | task 516 | eval time = 4176.84 ms / 114 tokens ( 36.64 ms per token, 27.29 tokens per second)
1.33.624.101 I slot print_timing: id 12 | task 516 | total time = 4314.55 ms / 139 tokens
1.33.624.102 I slot print_timing: id 12 | task 516 | graphs reused = 1
1.33.624.105 I slot print_timing: id 12 | task 516 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.33.624.117 I statistics draft-mtp: #calls(b,g,a) = 128 432 6541, #gen drafts = 6542, #acc drafts = 4552, #gen tokens = 13046, #acc tokens = 8634, #mean acc len = 2.32, #acc rate/pos = (0.696, 0.624), dur(b,g,a) = 0.090, 1644.000, 8.152 ms
1.33.624.137 I slot release: id 12 | task 516 | stop processing: n_tokens = 138, truncated = 0
1.33.829.351 I slot print_timing: id 3 | task 521 | n_decoded = 101, tg = 25.28 t/s, tg_3s = 25.28 t/s
1.33.967.598 I slot print_timing: id 11 | task 528 | n_decoded = 102, tg = 30.10 t/s, tg_3s = 30.10 t/s
1.34.170.571 I slot print_timing: id 4 | task 508 | n_decoded = 100, tg = 18.26 t/s, tg_3s = 18.26 t/s
1.34.234.407 I slot print_timing: id 14 | task 484 | prompt eval time = 113.54 ms / 29 tokens ( 3.92 ms per token, 255.42 tokens per second)
1.34.234.410 I slot print_timing: id 14 | task 484 | eval time = 7809.74 ms / 128 tokens ( 61.01 ms per token, 16.39 tokens per second)
1.34.234.410 I slot print_timing: id 14 | task 484 | total time = 7923.28 ms / 157 tokens
1.34.234.411 I slot print_timing: id 14 | task 484 | graphs reused = 1
1.34.234.414 I slot print_timing: id 14 | task 484 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.34.234.428 I statistics draft-mtp: #calls(b,g,a) = 128 441 6606, #gen drafts = 6613, #acc drafts = 4591, #gen tokens = 13187, #acc tokens = 8708, #mean acc len = 2.32, #acc rate/pos = (0.695, 0.623), dur(b,g,a) = 0.090, 1699.943, 8.221 ms
1.34.234.448 I slot release: id 14 | task 484 | stop processing: n_tokens = 156, truncated = 0
1.34.236.446 I slot print_timing: id 6 | task 515 | prompt eval time = 137.22 ms / 28 tokens ( 4.90 ms per token, 204.06 tokens per second)
1.34.236.448 I slot print_timing: id 6 | task 515 | eval time = 4789.76 ms / 125 tokens ( 38.32 ms per token, 26.10 tokens per second)
1.34.236.449 I slot print_timing: id 6 | task 515 | total time = 4926.97 ms / 153 tokens
1.34.236.449 I slot print_timing: id 6 | task 515 | graphs reused = 1
1.34.236.451 I slot print_timing: id 6 | task 515 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.34.236.457 I statistics draft-mtp: #calls(b,g,a) = 128 441 6610, #gen drafts = 6613, #acc drafts = 4594, #gen tokens = 13187, #acc tokens = 8713, #mean acc len = 2.32, #acc rate/pos = (0.695, 0.623), dur(b,g,a) = 0.090, 1699.943, 8.226 ms
1.34.236.472 I slot release: id 6 | task 515 | stop processing: n_tokens = 152, truncated = 0
1.34.237.943 I slot print_timing: id 11 | task 528 | prompt eval time = 125.35 ms / 25 tokens ( 5.01 ms per token, 199.45 tokens per second)
1.34.237.945 I slot print_timing: id 11 | task 528 | eval time = 3658.64 ms / 114 tokens ( 32.09 ms per token, 31.16 tokens per second)
1.34.237.945 I slot print_timing: id 11 | task 528 | total time = 3783.99 ms / 139 tokens
1.34.237.946 I slot print_timing: id 11 | task 528 | graphs reused = 1
1.34.237.948 I slot print_timing: id 11 | task 528 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.34.237.954 I statistics draft-mtp: #calls(b,g,a) = 128 441 6613, #gen drafts = 6613, #acc drafts = 4596, #gen tokens = 13187, #acc tokens = 8717, #mean acc len = 2.32, #acc rate/pos = (0.695, 0.623), dur(b,g,a) = 0.090, 1699.943, 8.230 ms
1.34.237.968 I slot release: id 11 | task 528 | stop processing: n_tokens = 138, truncated = 0
1.34.364.166 I slot print_timing: id 3 | task 521 | prompt eval time = 125.69 ms / 28 tokens ( 4.49 ms per token, 222.77 tokens per second)
1.34.364.169 I slot print_timing: id 3 | task 521 | eval time = 4529.80 ms / 125 tokens ( 36.24 ms per token, 27.60 tokens per second)
1.34.364.169 I slot print_timing: id 3 | task 521 | total time = 4655.49 ms / 153 tokens
1.34.364.170 I slot print_timing: id 3 | task 521 | graphs reused = 1
1.34.364.173 I slot print_timing: id 3 | task 521 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.34.364.186 I statistics draft-mtp: #calls(b,g,a) = 128 444 6625, #gen drafts = 6628, #acc drafts = 4605, #gen tokens = 13217, #acc tokens = 8734, #mean acc len = 2.32, #acc rate/pos = (0.695, 0.623), dur(b,g,a) = 0.090, 1710.136, 8.245 ms
1.34.364.201 I slot release: id 3 | task 521 | stop processing: n_tokens = 152, truncated = 0
1.34.427.027 I slot print_timing: id 1 | task 495 | prompt eval time = 120.15 ms / 29 tokens ( 4.14 ms per token, 241.36 tokens per second)
1.34.427.029 I slot print_timing: id 1 | task 495 | eval time = 6990.45 ms / 128 tokens ( 54.61 ms per token, 18.31 tokens per second)
1.34.427.030 I slot print_timing: id 1 | task 495 | total time = 7110.60 ms / 157 tokens
1.34.427.031 I slot print_timing: id 1 | task 495 | graphs reused = 1
1.34.427.034 I slot print_timing: id 1 | task 495 | draft acceptance = 0.42963 ( 58 accepted / 135 generated), mean acceptance length = 1.85, acceptance rate per position = (0.471, 0.382)
1.34.427.045 I statistics draft-mtp: #calls(b,g,a) = 128 446 6632, #gen drafts = 6635, #acc drafts = 4605, #gen tokens = 13230, #acc tokens = 8734, #mean acc len = 2.32, #acc rate/pos = (0.694, 0.623), dur(b,g,a) = 0.090, 1715.597, 8.251 ms
1.34.427.060 I slot release: id 1 | task 495 | stop processing: n_tokens = 156, truncated = 0
1.34.533.254 I slot print_timing: id 9 | task 519 | n_decoded = 100, tg = 20.68 t/s, tg_3s = 20.68 t/s
1.34.707.171 I slot print_timing: id 4 | task 508 | prompt eval time = 126.32 ms / 29 tokens ( 4.36 ms per token, 229.58 tokens per second)
1.34.707.175 I slot print_timing: id 4 | task 508 | eval time = 6011.68 ms / 128 tokens ( 46.97 ms per token, 21.29 tokens per second)
1.34.707.175 I slot print_timing: id 4 | task 508 | total time = 6138.00 ms / 157 tokens
1.34.707.176 I slot print_timing: id 4 | task 508 | graphs reused = 1
1.34.707.179 I slot print_timing: id 4 | task 508 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.34.707.189 I statistics draft-mtp: #calls(b,g,a) = 128 457 6665, #gen drafts = 6667, #acc drafts = 4619, #gen tokens = 13293, #acc tokens = 8760, #mean acc len = 2.31, #acc rate/pos = (0.693, 0.621), dur(b,g,a) = 0.090, 1738.804, 8.283 ms
1.34.707.205 I slot release: id 4 | task 508 | stop processing: n_tokens = 156, truncated = 0
1.34.826.830 I slot print_timing: id 8 | task 536 | n_decoded = 100, tg = 29.52 t/s, tg_3s = 29.52 t/s
1.34.874.092 I slot print_timing: id 9 | task 519 | prompt eval time = 119.99 ms / 29 tokens ( 4.14 ms per token, 241.68 tokens per second)
1.34.874.095 I slot print_timing: id 9 | task 519 | eval time = 5176.35 ms / 128 tokens ( 40.44 ms per token, 24.73 tokens per second)
1.34.874.095 I slot print_timing: id 9 | task 519 | total time = 5296.34 ms / 157 tokens
1.34.874.096 I slot print_timing: id 9 | task 519 | graphs reused = 1
1.34.874.099 I slot print_timing: id 9 | task 519 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.34.874.109 I statistics draft-mtp: #calls(b,g,a) = 128 467 6685, #gen drafts = 6686, #acc drafts = 4628, #gen tokens = 13330, #acc tokens = 8776, #mean acc len = 2.31, #acc rate/pos = (0.692, 0.620), dur(b,g,a) = 0.090, 1750.772, 8.305 ms
1.34.874.124 I slot release: id 9 | task 519 | stop processing: n_tokens = 156, truncated = 0
1.34.990.946 I slot print_timing: id 8 | task 536 | prompt eval time = 119.26 ms / 29 tokens ( 4.11 ms per token, 243.17 tokens per second)
1.34.990.949 I slot print_timing: id 8 | task 536 | eval time = 3552.05 ms / 128 tokens ( 27.75 ms per token, 36.04 tokens per second)
1.34.990.949 I slot print_timing: id 8 | task 536 | total time = 3671.30 ms / 157 tokens
1.34.990.950 I slot print_timing: id 8 | task 536 | graphs reused = 12
1.34.990.952 I slot print_timing: id 8 | task 536 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.34.990.963 I statistics draft-mtp: #calls(b,g,a) = 128 480 6699, #gen drafts = 6699, #acc drafts = 4633, #gen tokens = 13355, #acc tokens = 8786, #mean acc len = 2.31, #acc rate/pos = (0.692, 0.620), dur(b,g,a) = 0.090, 1763.843, 8.316 ms
1.34.990.975 I slot release: id 8 | task 536 | stop processing: n_tokens = 156, truncated = 0
1.34.990.985 I srv update_slots: all slots are idle