smolagent / .eval_results /open_agent_leaderboard_openai_azure_gpt-5.2-2025-12-11.yaml
Elron's picture
Duplicate from open-agent-leaderboard/smolagent
99e4642
Raw
History Blame Contribute Delete
1.35 kB
- dataset:
id: open-agent-leaderboard/results
task_id: overall
value: 0.3796
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: appworld
value: 0.07
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: browsecomp_plus
value: 0.26
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: swebench
value: 0.5253
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_airline
value: 0.6
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_retail
value: 0.68
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_telecom
value: 0.71
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'