bench de CPU: 512 e 1024, EPYC 16 vCPU, RAM folgada
Browse files- bench/cpu_speed.json +50 -0
bench/cpu_speed.json
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"512": {
|
| 3 |
+
"tq3p": {
|
| 4 |
+
"encode_prompt_s": 17.51,
|
| 5 |
+
"sampling_s": 259.43,
|
| 6 |
+
"s_per_it": 64.858,
|
| 7 |
+
"vae_decode_s": 9.43,
|
| 8 |
+
"total_s": 286.4
|
| 9 |
+
},
|
| 10 |
+
"q4km": {
|
| 11 |
+
"encode_prompt_s": 12.81,
|
| 12 |
+
"sampling_s": 171.32,
|
| 13 |
+
"s_per_it": 42.83,
|
| 14 |
+
"vae_decode_s": 9.46,
|
| 15 |
+
"total_s": 193.6
|
| 16 |
+
}
|
| 17 |
+
},
|
| 18 |
+
"1024": {
|
| 19 |
+
"tq3p": {
|
| 20 |
+
"encode_prompt_s": 17.19,
|
| 21 |
+
"sampling_s": 833.03,
|
| 22 |
+
"s_per_it": 208.257,
|
| 23 |
+
"vae_decode_s": 35.89,
|
| 24 |
+
"total_s": 886.1
|
| 25 |
+
},
|
| 26 |
+
"q4km": {
|
| 27 |
+
"encode_prompt_s": 12.17,
|
| 28 |
+
"sampling_s": 570.16,
|
| 29 |
+
"s_per_it": 142.54,
|
| 30 |
+
"vae_decode_s": 36.9,
|
| 31 |
+
"total_s": 619.2
|
| 32 |
+
}
|
| 33 |
+
},
|
| 34 |
+
"_meta": {
|
| 35 |
+
"host": "RunPod CPU pod cpu5g, AMD EPYC 4564P 16 vCPU, 124 GB RAM (96 GB disponivel)",
|
| 36 |
+
"runtime": "stable-diffusion.cpp master-802-e92e86f + sdcpp-cpu.patch, SD_CUDA=OFF, -t 16",
|
| 37 |
+
"protocolo": "4 steps, euler, cfg 1.0, seed 42, VAE small-decoder; RAM FOLGADA (sem --mmap) => mede o TETO de CPU, sem releitura de disco",
|
| 38 |
+
"n": "1 execucao por (braco, resolucao) -- s/it e derivado do sampling isolado do log, nao do wall total",
|
| 39 |
+
"bracos": {
|
| 40 |
+
"tq3p": "DiT TQ3P (6,1875 bpw) + TE Qwen3-8B TQ3P",
|
| 41 |
+
"q4km": "DiT Q4_K_M (~4,5 bpw) + TE Qwen3-8B Q8_0"
|
| 42 |
+
},
|
| 43 |
+
"veredito": "em CPU o Q4_K_M GANHA: 1,51x a 512 e 1,46x a 1024 -- o inverso da GPU (onde o TQ3P ganha 1,52x). Em CPU o custo e bytes lidos por peso, e o K3 le ~37% mais que o Q4_K_M.",
|
| 44 |
+
"executado_via": "python3 -m sasori draw (o subcomando novo, exercitado de verdade)",
|
| 45 |
+
"razao_tq3p_sobre_q4km": {
|
| 46 |
+
"512": 1.514,
|
| 47 |
+
"1024": 1.461
|
| 48 |
+
}
|
| 49 |
+
}
|
| 50 |
+
}
|