Benchmarks

#2
by zviratko - opened

For your modelcard if you want :) for some weird reason your finetunes always score better at 4-5bits ¯\_(ツ)_/¯

So far I like it very much, though I have seen some weird looping, but I think it was some chat template weirdness.

Intelligence Benchmark Comparison

              Mode    Sampled                   Qwen3.8-27B-Brainwaves-WFH   Qwen3.8-27B-Brainwaves-WFH-oQ4e-mtp   Qwen3.8-27B-Brainwaves-WFH-oQ5e-mtp   Qwen3.8-27B-Brainwaves-WFH-oQ6e-mtp   Qwen3.8-27B-Brainwaves-WFH-oQ8e-mtp  Qwen3.8-27B-Brainwaves-WFH-mxfp4-mlx
------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
MMLU          Sample  300/14042                                      85.0%                                 86.0%                                 85.7%                                 85.0%                                 85.0%                                 85.7%
MMLU_PRO      Sample  300/12032                                      69.3%                                 69.3%                                 71.0%                                 69.0%                                 68.0%                                 69.0%
HUMANEVAL     Full    164                                            88.4%                                 88.4%                                 87.2%                                 87.2%                                 88.4%                                 87.2%

--- Detail ---

Model: Qwen3.8-27B-Brainwaves-WFH
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 85.0%       255     300     398.6      No
MMLU_PRO             69.3%       208     300     266.8      No
HUMANEVAL            88.4%       145     164    1083.7      No

Model: Qwen3.8-27B-Brainwaves-WFH-oQ4e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 86.0%       258     300     386.2      No
MMLU_PRO             69.3%       208     300       198      No
HUMANEVAL            88.4%       145     164     372.4      No

Model: Qwen3.8-27B-Brainwaves-WFH-oQ5e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 85.7%       257     300     469.9      No
MMLU_PRO             71.0%       213     300     209.2      No
HUMANEVAL            87.2%       143     164     459.2      No

Model: Qwen3.8-27B-Brainwaves-WFH-oQ6e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 85.0%       255     300       482      No
MMLU_PRO             69.0%       207     300     223.5      No
HUMANEVAL            87.2%       143     164     486.4      No

Model: Qwen3.8-27B-Brainwaves-WFH-oQ8e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 85.0%       255     300     485.4      No
MMLU_PRO             68.0%       204     300     232.3      No
HUMANEVAL            88.4%       145     164     522.7      No

Model: Qwen3.8-27B-Brainwaves-WFH-mxfp4-mlx
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 85.7%       257     300     339.5      No
MMLU_PRO             69.0%       207     300     174.7      No
HUMANEVAL            87.2%       143     164     420.8      No

wow, nice, excellent results!

Sign up or log in to comment