FardoX commited on
Commit
bd7fb07
·
verified ·
1 Parent(s): f03b346

bench de CPU: 512 e 1024, EPYC 16 vCPU, RAM folgada

Browse files
Files changed (1) hide show
  1. bench/cpu_speed.json +50 -0
bench/cpu_speed.json ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "512": {
3
+ "tq3p": {
4
+ "encode_prompt_s": 17.51,
5
+ "sampling_s": 259.43,
6
+ "s_per_it": 64.858,
7
+ "vae_decode_s": 9.43,
8
+ "total_s": 286.4
9
+ },
10
+ "q4km": {
11
+ "encode_prompt_s": 12.81,
12
+ "sampling_s": 171.32,
13
+ "s_per_it": 42.83,
14
+ "vae_decode_s": 9.46,
15
+ "total_s": 193.6
16
+ }
17
+ },
18
+ "1024": {
19
+ "tq3p": {
20
+ "encode_prompt_s": 17.19,
21
+ "sampling_s": 833.03,
22
+ "s_per_it": 208.257,
23
+ "vae_decode_s": 35.89,
24
+ "total_s": 886.1
25
+ },
26
+ "q4km": {
27
+ "encode_prompt_s": 12.17,
28
+ "sampling_s": 570.16,
29
+ "s_per_it": 142.54,
30
+ "vae_decode_s": 36.9,
31
+ "total_s": 619.2
32
+ }
33
+ },
34
+ "_meta": {
35
+ "host": "RunPod CPU pod cpu5g, AMD EPYC 4564P 16 vCPU, 124 GB RAM (96 GB disponivel)",
36
+ "runtime": "stable-diffusion.cpp master-802-e92e86f + sdcpp-cpu.patch, SD_CUDA=OFF, -t 16",
37
+ "protocolo": "4 steps, euler, cfg 1.0, seed 42, VAE small-decoder; RAM FOLGADA (sem --mmap) => mede o TETO de CPU, sem releitura de disco",
38
+ "n": "1 execucao por (braco, resolucao) -- s/it e derivado do sampling isolado do log, nao do wall total",
39
+ "bracos": {
40
+ "tq3p": "DiT TQ3P (6,1875 bpw) + TE Qwen3-8B TQ3P",
41
+ "q4km": "DiT Q4_K_M (~4,5 bpw) + TE Qwen3-8B Q8_0"
42
+ },
43
+ "veredito": "em CPU o Q4_K_M GANHA: 1,51x a 512 e 1,46x a 1024 -- o inverso da GPU (onde o TQ3P ganha 1,52x). Em CPU o custo e bytes lidos por peso, e o K3 le ~37% mais que o Q4_K_M.",
44
+ "executado_via": "python3 -m sasori draw (o subcomando novo, exercitado de verdade)",
45
+ "razao_tq3p_sobre_q4km": {
46
+ "512": 1.514,
47
+ "1024": 1.461
48
+ }
49
+ }
50
+ }