Xavier Rey-Robert commited on
Commit
3b1639f
·
1 Parent(s): 2c59376

Update Qwen Terminal-Bench comparison table

Browse files
Files changed (1) hide show
  1. README.md +2 -2
README.md CHANGED
@@ -358,9 +358,9 @@ Scope note: single-pass unrestricted generation exposed one pathological runaway
358
  </tr>
359
  </thead>
360
  <tbody>
361
- <tr style="background: rgba(16, 185, 129, 0.06);"><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); font-weight: 700; color: #047857;">This GPTQ-Pro ns256 artifact + Terminus-2</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); text-align: right; font-weight: 800; color: #047857;">44.94%</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15);">40 / 89, recovery-corrected local operational run</td></tr>
362
  <tr><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); font-weight: 600;">Qwen/Qwen3.6-27B</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); text-align: right; font-weight: 700;">59.3%</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15);">Published on the <a href="https://huggingface.co/Qwen/Qwen3.6-27B">Qwen model card</a>; Qwen protocol uses Harbor/Terminus-2, 3h timeout, 32 CPU/48 GB RAM, max_tokens 80K, 256K context, average of 5 runs.</td></tr>
363
- <tr><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); font-weight: 600;">little-coder + Qwen3.6-35B-A3B</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); text-align: right; font-weight: 700;">24.6% +/- 3.2</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15);">Official Terminal-Bench 2.0 leaderboard Qwen-family entry; different agent and different model.</td></tr>
364
  </tbody>
365
  </table>
366
  </div>
 
358
  </tr>
359
  </thead>
360
  <tbody>
361
+ <tr style="background: rgba(16, 185, 129, 0.06);"><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); font-weight: 700; color: #047857;">Qwopus3.6-27B-v2-GPTQ-Pro-v1</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); text-align: right; font-weight: 800; color: #047857;">44.94%</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15);">40 / 89, recovery-corrected local operational run</td></tr>
362
  <tr><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); font-weight: 600;">Qwen/Qwen3.6-27B</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); text-align: right; font-weight: 700;">59.3%</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15);">Published on the <a href="https://huggingface.co/Qwen/Qwen3.6-27B">Qwen model card</a>; Qwen protocol uses Harbor/Terminus-2, 3h timeout, 32 CPU/48 GB RAM, max_tokens 80K, 256K context, average of 5 runs.</td></tr>
363
+ <tr><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); font-weight: 600;">Qwen/Qwen3.6-35B-A3B</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15); text-align: right; font-weight: 700;">51.5%</td><td style="padding: 8px 10px; border-bottom: 1px solid rgba(128,128,128,0.15);">Published on the <a href="https://huggingface.co/Qwen/Qwen3.6-27B">Qwen model card</a> with the same Terminal-Bench 2.0 protocol as the Qwen3.6-27B row.</td></tr>
364
  </tbody>
365
  </table>
366
  </div>