344.51.660.464 I srv load: --flash-attn 344.51.660.464 I srv load: auto 344.51.660.464 I srv load: --kv-unified 344.51.660.464 I srv load: --log-verbosity 344.51.660.465 I srv load: 3 344.51.660.465 I srv load: --model 344.51.660.465 I srv load: /models/Qwen-3.6-27b-heretic-neocode/Qwen3.6-27B-NEO-CODE-HERE-2T-OT-Q4_K_M.gguf 344.51.660.465 I srv load: --mmproj 344.51.660.465 I srv load: /models/Qwen-3.6-27b-heretic-neocode/Qwen3.6-27B-mmproj-BF16.gguf 344.51.660.465 I srv load: --n-gpu-layers 344.51.660.465 I srv load: 999 344.51.660.465 I srv load: --parallel 344.51.660.465 I srv load: 3 344.51.660.465 I srv load: --reasoning 344.51.660.466 I srv load: on 344.51.660.466 I srv load: --threads 344.51.660.466 I srv load: 20 344.51.660.466 I srv load: --threads-batch 344.51.660.466 I srv load: 20 [52171] 0.00.019.610 I cmn common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg) [52171] 0.00.102.589 W srv llama_server: ----------------- [52171] 0.00.102.592 W srv llama_server: CORS is set to allow all origins ('*') and no API key is set [52171] 0.00.102.592 W srv llama_server: this can be a security risk (cross-origin attacks) [52171] 0.00.102.593 W srv llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655 [52171] 0.00.102.593 W srv llama_server: ----------------- [52171] 0.00.104.009 I srv load_model: loading model '/models/Qwen-3.6-27b-heretic-neocode/Qwen3.6-27B-NEO-CODE-HERE-2T-OT-Q4_K_M.gguf' [52171] 0.03.375.068 I cmn init: llama threadpool init, n_threads = 20 [52171] 0.03.375.097 W cmn common_init_: KV cache shifting is not supported for this context, disabling KV cache shifting [52171] 0.03.425.790 W load_hparams: Qwen-VL models require at minimum 1024 image tokens to function correctly on grounding tasks [52171] 0.03.425.792 W load_hparams: if you encounter problems with accuracy, try adding --image-min-tokens 1024 [52171] 0.03.425.792 W load_hparams: more info: https://github.com/ggml-org/llama.cpp/issues/16842 [52171] [52171] 0.03.745.039 I srv load_model: loaded multimodal model, '/models/Qwen-3.6-27b-heretic-neocode/Qwen3.6-27B-mmproj-BF16.gguf' [52171] 0.03.781.457 I srv load_model: initializing, n_slots = 3, n_ctx_slot = 262144, kv_unified = 'true' [52171] 0.03.784.152 I srv init: chat template supports preserving reasoning, consider enabling it via --reasoning-preserve [52171] 0.03.784.194 I srv llama_server: model loaded [52171] 0.03.784.199 I srv llama_server: listening on http://127.0.0.1:52171 344.55.504.120 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 0.03.992.953 I slot get_availabl: id 2 | task -1 | selected slot by LRU, t_last = -1 [52171] 0.03.995.513 I slot launch_slot_: id 2 | task 0 | processing task, is_child = 0 [52171] 0.07.334.095 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 12288, progress = 0.08, t = 3.34 s / 3680.89 tokens per second [52171] 0.07.932.807 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 14336, progress = 0.10, t = 3.94 s / 3641.32 tokens per second [52171] 0.08.541.823 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 16384, progress = 0.11, t = 4.55 s / 3604.01 tokens per second [52171] 0.09.160.745 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 18432, progress = 0.12, t = 5.16 s / 3568.66 tokens per second [52171] 0.09.789.088 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 20480, progress = 0.14, t = 5.79 s / 3535.11 tokens per second [52171] 0.10.425.472 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 22528, progress = 0.15, t = 6.43 s / 3503.74 tokens per second [52171] 0.11.073.677 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 24576, progress = 0.17, t = 7.08 s / 3472.22 tokens per second [52171] 0.11.734.606 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 26624, progress = 0.18, t = 7.74 s / 3440.31 tokens per second [52171] 0.12.410.807 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 28672, progress = 0.19, t = 8.42 s / 3407.24 tokens per second [52171] 0.13.103.916 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 30720, progress = 0.21, t = 9.11 s / 3372.81 tokens per second [52171] 0.13.815.098 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 32768, progress = 0.22, t = 9.82 s / 3337.09 tokens per second [52171] 0.14.545.639 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 34816, progress = 0.24, t = 10.55 s / 3300.14 tokens per second [52171] 0.15.296.032 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 36864, progress = 0.25, t = 11.30 s / 3262.23 tokens per second [52171] 0.16.066.207 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 38912, progress = 0.26, t = 12.07 s / 3223.75 tokens per second [52171] 0.16.206.514 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 39115, progress = 0.26, t = 12.21 s / 3203.33 tokens per second [52171] 0.16.993.306 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 41163, progress = 0.28, t = 13.00 s / 3166.99 tokens per second [52171] 0.17.811.035 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 43211, progress = 0.29, t = 13.82 s / 3127.77 tokens per second [52171] 0.18.649.072 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 45259, progress = 0.31, t = 14.65 s / 3088.66 tokens per second [52171] 0.19.507.925 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 47307, progress = 0.32, t = 15.51 s / 3049.67 tokens per second [52171] 0.20.388.266 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 49355, progress = 0.33, t = 16.39 s / 3010.83 tokens per second [52171] 0.21.289.219 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 51403, progress = 0.35, t = 17.29 s / 2972.40 tokens per second [52171] 0.22.213.623 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 53451, progress = 0.36, t = 18.22 s / 2933.99 tokens per second [52171] 0.23.160.636 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 55499, progress = 0.38, t = 19.16 s / 2895.87 tokens per second [52171] 0.24.130.566 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 57547, progress = 0.39, t = 20.13 s / 2858.09 tokens per second [52171] 0.25.121.186 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 59595, progress = 0.40, t = 21.13 s / 2821.01 tokens per second [52171] 0.26.138.258 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 61643, progress = 0.42, t = 22.14 s / 2783.92 tokens per second [52171] 0.27.178.889 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 63691, progress = 0.43, t = 23.18 s / 2747.30 tokens per second [52171] 0.28.240.230 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 65739, progress = 0.45, t = 24.24 s / 2711.51 tokens per second [52171] 0.29.324.648 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 67787, progress = 0.46, t = 25.33 s / 2676.27 tokens per second [52171] 0.30.432.747 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 69835, progress = 0.47, t = 26.44 s / 2641.57 tokens per second [52171] 0.31.562.880 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 71883, progress = 0.49, t = 27.57 s / 2607.56 tokens per second [52171] 0.32.712.213 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 73931, progress = 0.50, t = 28.72 s / 2574.52 tokens per second [52171] 0.33.882.178 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 75979, progress = 0.51, t = 29.89 s / 2542.26 tokens per second [52171] 0.35.073.718 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 78027, progress = 0.53, t = 31.08 s / 2510.69 tokens per second [52171] 0.36.286.603 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 80075, progress = 0.54, t = 32.29 s / 2479.81 tokens per second [52171] 0.37.521.223 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 82123, progress = 0.56, t = 33.53 s / 2449.57 tokens per second [52171] 0.38.776.549 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 84171, progress = 0.57, t = 34.78 s / 2420.04 tokens per second [52171] 0.40.051.847 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 86219, progress = 0.58, t = 36.06 s / 2391.25 tokens per second [52171] 0.41.349.407 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 88267, progress = 0.60, t = 37.35 s / 2363.01 tokens per second [52171] 0.42.664.800 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 90315, progress = 0.61, t = 38.67 s / 2335.59 tokens per second [52171] 0.44.000.025 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 92363, progress = 0.63, t = 40.00 s / 2308.83 tokens per second [52171] 0.45.357.851 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 94411, progress = 0.64, t = 41.36 s / 2282.55 tokens per second [52171] 0.46.734.125 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 96459, progress = 0.65, t = 42.74 s / 2256.97 tokens per second [52171] 0.48.128.116 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 98507, progress = 0.67, t = 44.13 s / 2232.08 tokens per second [52171] 0.49.543.784 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 100555, progress = 0.68, t = 45.55 s / 2207.67 tokens per second [52171] 0.50.978.705 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 102603, progress = 0.69, t = 46.98 s / 2183.84 tokens per second [52171] 0.52.435.551 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 104651, progress = 0.71, t = 48.44 s / 2160.44 tokens per second [52171] 0.53.913.330 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 106699, progress = 0.72, t = 49.92 s / 2137.50 tokens per second [52171] 0.55.412.682 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 108747, progress = 0.74, t = 51.42 s / 2115.00 tokens per second [52171] 0.56.931.494 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 110795, progress = 0.75, t = 52.94 s / 2093.01 tokens per second [52171] 0.58.473.304 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 112843, progress = 0.76, t = 54.48 s / 2071.37 tokens per second [52171] 1.00.035.113 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 114891, progress = 0.78, t = 56.04 s / 2050.18 tokens per second [52171] 1.00.815.093 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 115899, progress = 0.78, t = 56.82 s / 2039.78 tokens per second [52171] 1.01.012.468 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 115932, progress = 0.79, t = 57.02 s / 2033.30 tokens per second [52171] 1.02.449.249 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 117980, progress = 0.80, t = 58.45 s / 2018.36 tokens per second [52171] 1.04.061.649 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 120028, progress = 0.81, t = 60.07 s / 1998.27 tokens per second [52171] 1.05.691.304 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 122076, progress = 0.83, t = 61.70 s / 1978.68 tokens per second [52171] 1.07.330.292 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 124096, progress = 0.84, t = 63.33 s / 1959.37 tokens per second [52171] 1.07.599.919 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 124234, progress = 0.84, t = 63.60 s / 1953.24 tokens per second [52171] 1.09.149.772 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 126282, progress = 0.86, t = 65.15 s / 1938.21 tokens per second [52171] 1.10.843.370 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 128330, progress = 0.87, t = 66.85 s / 1919.74 tokens per second [52171] 1.12.560.058 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 130378, progress = 0.88, t = 68.56 s / 1901.54 tokens per second [52171] 1.14.275.016 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 132376, progress = 0.90, t = 70.28 s / 1883.57 tokens per second [52171] 1.14.551.421 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 132514, progress = 0.90, t = 70.56 s / 1878.15 tokens per second [52171] 1.16.176.447 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 134562, progress = 0.91, t = 72.18 s / 1864.24 tokens per second [52171] 1.17.947.454 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 136610, progress = 0.93, t = 73.95 s / 1847.29 tokens per second [52171] 1.19.739.955 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 138658, progress = 0.94, t = 75.74 s / 1830.61 tokens per second [52171] 1.21.535.932 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 140656, progress = 0.95, t = 77.54 s / 1813.98 tokens per second [52171] 1.21.823.061 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 140794, progress = 0.95, t = 77.83 s / 1809.06 tokens per second [52171] 1.23.521.840 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 142842, progress = 0.97, t = 79.53 s / 1796.17 tokens per second [52171] 1.25.375.292 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 144890, progress = 0.98, t = 81.38 s / 1780.42 tokens per second [52171] 1.27.243.174 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 146938, progress = 1.00, t = 83.25 s / 1765.08 tokens per second [52171] 1.27.578.490 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 147146, progress = 1.00, t = 83.58 s / 1760.48 tokens per second [52171] 1.27.854.340 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 147622, progress = 1.00, t = 83.86 s / 1760.37 tokens per second [52171] 1.28.024.885 I slot print_timing: id 2 | task 0 | prompt processing, n_tokens = 147658, progress = 1.00, t = 84.03 s / 1757.22 tokens per second [52171] 1.30.208.588 I slot print_timing: id 2 | task 0 | prompt eval time = 84152.89 ms / 147662 tokens ( 0.57 ms per token, 1754.69 tokens per second) [52171] 1.30.208.591 I slot print_timing: id 2 | task 0 | eval time = 2059.93 ms / 101 tokens ( 20.60 ms per token, 48.55 tokens per second) [52171] 1.30.208.592 I slot print_timing: id 2 | task 0 | total time = 86212.82 ms / 147763 tokens [52171] 1.30.208.596 I slot print_timing: id 2 | task 0 | graphs reused = 99 [52171] 1.30.211.165 I slot release: id 2 | task 0 | stop processing: n_tokens = 147762, truncated = 0 374.51.001.021 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 29.59.493.436 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 29.59.495.894 I slot launch_slot_: id 2 | task 182 | processing task, is_child = 0 [52171] 30.01.965.797 I slot print_timing: id 2 | task 182 | prompt eval time = 433.68 ms / 142 tokens ( 3.05 ms per token, 327.43 tokens per second) [52171] 30.01.965.800 I slot print_timing: id 2 | task 182 | eval time = 2035.81 ms / 101 tokens ( 20.36 ms per token, 49.12 tokens per second) [52171] 30.01.965.801 I slot print_timing: id 2 | task 182 | total time = 2469.49 ms / 243 tokens [52171] 30.01.965.802 I slot print_timing: id 2 | task 182 | graphs reused = 198 [52171] 30.01.968.480 I slot release: id 2 | task 182 | stop processing: n_tokens = 147900, truncated = 0 404.51.005.940 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 59.59.495.468 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 59.59.497.778 I slot launch_slot_: id 2 | task 286 | processing task, is_child = 0 [52171] 60.01.975.327 I slot print_timing: id 2 | task 286 | prompt eval time = 434.84 ms / 142 tokens ( 3.06 ms per token, 326.56 tokens per second) [52171] 60.01.975.330 I slot print_timing: id 2 | task 286 | eval time = 2042.31 ms / 101 tokens ( 20.42 ms per token, 48.96 tokens per second) [52171] 60.01.975.330 I slot print_timing: id 2 | task 286 | total time = 2477.15 ms / 243 tokens [52171] 60.01.975.331 I slot print_timing: id 2 | task 286 | graphs reused = 296 [52171] 60.01.977.872 I slot release: id 2 | task 286 | stop processing: n_tokens = 148038, truncated = 0 434.51.076.220 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 89.59.570.189 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 89.59.572.691 I slot launch_slot_: id 2 | task 390 | processing task, is_child = 0 [52171] 90.02.069.561 I slot print_timing: id 2 | task 390 | prompt eval time = 445.26 ms / 142 tokens ( 3.14 ms per token, 318.91 tokens per second) [52171] 90.02.069.564 I slot print_timing: id 2 | task 390 | eval time = 2051.20 ms / 101 tokens ( 20.51 ms per token, 48.75 tokens per second) [52171] 90.02.069.564 I slot print_timing: id 2 | task 390 | total time = 2496.46 ms / 243 tokens [52171] 90.02.069.565 I slot print_timing: id 2 | task 390 | graphs reused = 395 [52171] 90.02.072.130 I slot release: id 2 | task 390 | stop processing: n_tokens = 148176, truncated = 0 464.51.068.736 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 119.59.569.362 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 119.59.571.967 I slot launch_slot_: id 2 | task 494 | processing task, is_child = 0 [52171] 120.02.052.099 I slot print_timing: id 2 | task 494 | prompt eval time = 440.61 ms / 142 tokens ( 3.10 ms per token, 322.28 tokens per second) [52171] 120.02.052.102 I slot print_timing: id 2 | task 494 | eval time = 2039.12 ms / 101 tokens ( 20.39 ms per token, 49.04 tokens per second) [52171] 120.02.052.103 I slot print_timing: id 2 | task 494 | total time = 2479.73 ms / 243 tokens [52171] 120.02.052.104 I slot print_timing: id 2 | task 494 | graphs reused = 493 [52171] 120.02.054.440 I slot release: id 2 | task 494 | stop processing: n_tokens = 148314, truncated = 0 494.50.995.032 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 149.59.479.148 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 149.59.481.717 I slot launch_slot_: id 2 | task 598 | processing task, is_child = 0 [52171] 150.01.963.902 I slot print_timing: id 2 | task 598 | prompt eval time = 443.61 ms / 142 tokens ( 3.12 ms per token, 320.10 tokens per second) [52171] 150.01.963.905 I slot print_timing: id 2 | task 598 | eval time = 2038.15 ms / 101 tokens ( 20.38 ms per token, 49.06 tokens per second) [52171] 150.01.963.905 I slot print_timing: id 2 | task 598 | total time = 2481.77 ms / 243 tokens [52171] 150.01.963.906 I slot print_timing: id 2 | task 598 | graphs reused = 592 [52171] 150.01.966.306 I slot release: id 2 | task 598 | stop processing: n_tokens = 148452, truncated = 0 524.50.980.838 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 179.59.473.558 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 179.59.476.207 I slot launch_slot_: id 2 | task 702 | processing task, is_child = 0 [52171] 180.01.965.850 I slot print_timing: id 2 | task 702 | prompt eval time = 442.73 ms / 142 tokens ( 3.12 ms per token, 320.73 tokens per second) [52171] 180.01.965.854 I slot print_timing: id 2 | task 702 | eval time = 2046.48 ms / 101 tokens ( 20.46 ms per token, 48.86 tokens per second) [52171] 180.01.965.855 I slot print_timing: id 2 | task 702 | total time = 2489.21 ms / 243 tokens [52171] 180.01.965.855 I slot print_timing: id 2 | task 702 | graphs reused = 691 [52171] 180.01.968.174 I slot release: id 2 | task 702 | stop processing: n_tokens = 148590, truncated = 0 554.51.051.627 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 209.59.546.067 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 209.59.548.961 I slot launch_slot_: id 2 | task 806 | processing task, is_child = 0 [52171] 210.02.028.241 I slot print_timing: id 2 | task 806 | prompt eval time = 441.86 ms / 142 tokens ( 3.11 ms per token, 321.37 tokens per second) [52171] 210.02.028.244 I slot print_timing: id 2 | task 806 | eval time = 2037.01 ms / 101 tokens ( 20.37 ms per token, 49.09 tokens per second) [52171] 210.02.028.244 I slot print_timing: id 2 | task 806 | total time = 2478.87 ms / 243 tokens [52171] 210.02.028.245 I slot print_timing: id 2 | task 806 | graphs reused = 790 [52171] 210.02.030.729 I slot release: id 2 | task 806 | stop processing: n_tokens = 148728, truncated = 0 584.51.157.948 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 239.59.646.344 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 239.59.648.853 I slot launch_slot_: id 2 | task 910 | processing task, is_child = 0 [52171] 240.02.130.868 I slot print_timing: id 2 | task 910 | prompt eval time = 443.46 ms / 142 tokens ( 3.12 ms per token, 320.21 tokens per second) [52171] 240.02.130.871 I slot print_timing: id 2 | task 910 | eval time = 2038.16 ms / 101 tokens ( 20.38 ms per token, 49.06 tokens per second) [52171] 240.02.130.872 I slot print_timing: id 2 | task 910 | total time = 2481.62 ms / 243 tokens [52171] 240.02.130.873 I slot print_timing: id 2 | task 910 | graphs reused = 889 [52171] 240.02.133.258 I slot release: id 2 | task 910 | stop processing: n_tokens = 148866, truncated = 0 614.51.166.680 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 269.59.654.096 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 269.59.656.662 I slot launch_slot_: id 2 | task 1014 | processing task, is_child = 0 [52171] 270.02.158.324 I slot print_timing: id 2 | task 1014 | prompt eval time = 437.93 ms / 142 tokens ( 3.08 ms per token, 324.25 tokens per second) [52171] 270.02.158.327 I slot print_timing: id 2 | task 1014 | eval time = 2063.32 ms / 101 tokens ( 20.63 ms per token, 48.47 tokens per second) [52171] 270.02.158.327 I slot print_timing: id 2 | task 1014 | total time = 2501.25 ms / 243 tokens [52171] 270.02.158.328 I slot print_timing: id 2 | task 1014 | graphs reused = 987 [52171] 270.02.160.720 I slot release: id 2 | task 1014 | stop processing: n_tokens = 149004, truncated = 0 644.50.971.022 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 299.59.446.507 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.999 (> 0.100 thold), f_keep = 0.999 [52171] 299.59.449.160 I slot launch_slot_: id 2 | task 1118 | processing task, is_child = 0 [52171] 300.01.924.032 I slot print_timing: id 2 | task 1118 | prompt eval time = 419.62 ms / 142 tokens ( 2.96 ms per token, 338.40 tokens per second) [52171] 300.01.924.035 I slot print_timing: id 2 | task 1118 | eval time = 2054.85 ms / 101 tokens ( 20.55 ms per token, 48.67 tokens per second) [52171] 300.01.924.036 I slot print_timing: id 2 | task 1118 | total time = 2474.47 ms / 243 tokens [52171] 300.01.924.037 I slot print_timing: id 2 | task 1118 | graphs reused = 1086 [52171] 300.01.926.426 I slot release: id 2 | task 1118 | stop processing: n_tokens = 149142, truncated = 0 662.24.776.182 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 317.33.128.460 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, f_sim_best = 0.926 (> 0.100 thold), f_keep = 0.167 [52171] 317.35.934.643 I slot launch_slot_: id 2 | task 1222 | processing task, is_child = 0 662.30.406.007 I srv proxy_reques: proxying request to model qwen36-27b-neocoder-q4 on port 52171 [52171] 317.38.799.780 I slot get_availabl: id 1 | task -1 | selected slot by LRU, t_last = -1 [52171] 317.38.802.264 I slot launch_slot_: id 1 | task 1228 | processing task, is_child = 0 [52171] 317.41.837.848 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 10240, progress = 0.38, t = 3.04 s / 3373.48 tokens per second [52171] 317.42.473.844 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 12288, progress = 0.46, t = 3.67 s / 3346.92 tokens per second [52171] 317.43.121.733 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 14336, progress = 0.54, t = 4.32 s / 3319.04 tokens per second [52171] 317.43.788.779 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 16384, progress = 0.62, t = 4.99 s / 3285.76 tokens per second [52171] 317.44.462.485 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 18432, progress = 0.69, t = 5.66 s / 3256.49 tokens per second [52171] 317.45.155.416 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 20480, progress = 0.77, t = 6.35 s / 3223.67 tokens per second [52171] 317.45.867.455 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 22528, progress = 0.85, t = 7.07 s / 3188.66 tokens per second [52171] 317.46.597.743 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 24576, progress = 0.92, t = 7.80 s / 3152.66 tokens per second [52171] 317.47.366.977 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 26098, progress = 0.98, t = 8.56 s / 3047.21 tokens per second [52171] 317.47.450.448 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 10766, progress = 0.40, t = 11.43 s / 941.75 tokens per second [52171] 317.48.204.893 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 26225, progress = 0.99, t = 9.40 s / 2789.16 tokens per second [52171] 317.48.277.429 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 12687, progress = 0.47, t = 12.27 s / 1034.00 tokens per second [52171] 317.49.056.887 I slot print_timing: id 1 | task 1228 | prompt processing, n_tokens = 26610, progress = 1.00, t = 10.25 s / 2594.96 tokens per second [52171] 317.49.136.042 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 14350, progress = 0.53, t = 13.12 s / 1093.60 tokens per second [52171] 317.49.968.530 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 16394, progress = 0.61, t = 14.03 s / 1168.24 tokens per second [52171] 317.50.823.695 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 18441, progress = 0.69, t = 14.89 s / 1238.62 tokens per second [52171] 317.51.700.989 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 20488, progress = 0.76, t = 15.77 s / 1299.54 tokens per second [52171] 317.52.599.132 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 22535, progress = 0.84, t = 16.66 s / 1352.34 tokens per second [52171] 317.53.519.176 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 24582, progress = 0.92, t = 17.58 s / 1397.99 tokens per second [52171] 317.54.287.194 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 26225, progress = 0.98, t = 18.35 s / 1429.02 tokens per second [52171] 317.54.452.157 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 26327, progress = 0.98, t = 18.52 s / 1421.79 tokens per second [52171] 317.54.769.977 I slot print_timing: id 2 | task 1222 | prompt processing, n_tokens = 26839, progress = 1.00, t = 18.83 s / 1424.99 tokens per second [52171] 317.56.518.722 I slot print_timing: id 1 | task 1228 | n_gen = 100, tg = 15.11 t/s, tg_3s = 15.27 t/s [52171] 317.57.899.086 I slot print_timing: id 2 | task 1222 | n_gen = 168, tg = 55.45 t/s, tg_3s = 55.78 t/s [52171] 317.58.134.476 I slot print_timing: id 1 | task 1228 | prompt eval time = 11166.12 ms / 26614 tokens ( 0.42 ms per token, 2383.46 tokens per second) [52171] 317.58.134.479 I slot print_timing: id 1 | task 1228 | eval time = 8165.95 ms / 189 tokens ( 43.44 ms per token, 23.02 tokens per second) [52171] 317.58.134.480 I slot print_timing: id 1 | task 1228 | total time = 19332.07 ms / 26803 tokens [52171] 317.58.134.481 I slot print_timing: id 1 | task 1228 | graphs reused = 1263 [52171] 317.58.135.382 I slot release: id 1 | task 1228 | stop processing: n_tokens = 26802, truncated = 0 [52171] 317.58.830.632 I slot print_timing: id 2 | task 1222 | prompt eval time = 18952.38 ms / 26843 tokens ( 0.71 ms per token, 1416.34 tokens per second) [52171] 317.58.830.635 I slot print_timing: id 2 | task 1222 | eval time = 3943.17 ms / 224 tokens ( 17.68 ms per token, 56.55 tokens per second) [52171] 317.58.830.635 I slot print_timing: id 2 | task 1222 | total time = 22895.55 ms / 27067 tokens [52171] 317.58.830.636 I slot print_timing: id 2 | task 1222 | graphs reused = 1305 [52171] 317.58.831.442 I slot release: id 2 | task 1222 | stop processing: n_tokens = 27066, truncated = 0