react / .eval_results /open_agent_leaderboard_openai_aws_claude-opus-4-5.yaml
Elron's picture
Add Open Agent Leaderboard evaluation results
c76b9f1 verified
Raw
History Blame Contribute Delete
1.41 kB
- dataset:
id: open-agent-leaderboard/results
task_id: overall
value: 0.6098
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Claude Opus 4.5'
- dataset:
id: open-agent-leaderboard/results
task_id: appworld
value: 0.61
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Claude Opus 4.5'
- dataset:
id: open-agent-leaderboard/results
task_id: browsecomp_plus
value: 0.49
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Claude Opus 4.5'
- dataset:
id: open-agent-leaderboard/results
task_id: swebench
value: 0.6061
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Claude Opus 4.5'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_airline
value: 0.66
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Claude Opus 4.5'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_retail
value: 0.78
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Claude Opus 4.5'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_telecom
value: 0.76
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Claude Opus 4.5'