GRM-2.7-Mythos / .eval_results /swe_bench_pro.yaml
DedeProGames's picture
Create .eval_results/swe_bench_pro.yaml
90b6b0a verified
Raw
History Blame Contribute Delete
207 Bytes
- dataset:
id: ScaleAI/SWE-bench_Pro
task_id: SWE_Bench_Pro
value: 56.5
source:
url: https://huggingface.co/OrionLLM/GRM-2.7-Mythos
name: Official GRM-2.7 Benchmark
user: DedeProGames