{ "512": { "tq3p": { "encode_prompt_s": 17.51, "sampling_s": 259.43, "s_per_it": 64.858, "vae_decode_s": 9.43, "total_s": 286.4 }, "q4km": { "encode_prompt_s": 12.81, "sampling_s": 171.32, "s_per_it": 42.83, "vae_decode_s": 9.46, "total_s": 193.6 } }, "1024": { "tq3p": { "encode_prompt_s": 17.19, "sampling_s": 833.03, "s_per_it": 208.257, "vae_decode_s": 35.89, "total_s": 886.1 }, "q4km": { "encode_prompt_s": 12.17, "sampling_s": 570.16, "s_per_it": 142.54, "vae_decode_s": 36.9, "total_s": 619.2 } }, "_meta": { "host": "RunPod CPU pod cpu5g, AMD EPYC 4564P 16 vCPU, 124 GB RAM (96 GB disponivel)", "runtime": "stable-diffusion.cpp master-802-e92e86f + sdcpp-cpu.patch, SD_CUDA=OFF, -t 16", "protocolo": "4 steps, euler, cfg 1.0, seed 42, VAE small-decoder; RAM FOLGADA (sem --mmap) => mede o TETO de CPU, sem releitura de disco", "n": "1 execucao por (braco, resolucao) -- s/it e derivado do sampling isolado do log, nao do wall total", "bracos": { "tq3p": "DiT TQ3P (6,1875 bpw) + TE Qwen3-8B TQ3P", "q4km": "DiT Q4_K_M (~4,5 bpw) + TE Qwen3-8B Q8_0" }, "veredito": "em CPU o Q4_K_M GANHA: 1,51x a 512 e 1,46x a 1024 -- o inverso da GPU (onde o TQ3P ganha 1,52x). Em CPU o custo e bytes lidos por peso, e o K3 le ~37% mais que o Q4_K_M.", "executado_via": "python3 -m sasori draw (o subcomando novo, exercitado de verdade)", "razao_tq3p_sobre_q4km": { "512": 1.514, "1024": 1.461 } } }