react / .eval_results /open_agent_leaderboard_openai_azure_kimi-k2.5.yaml
Elron's picture
Add Open Agent Leaderboard evaluation results
c76b9f1 verified
Raw
History Blame Contribute Delete
1.37 kB
- dataset:
id: open-agent-leaderboard/results
task_id: overall
value: 0.4251
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Kimi K2.5'
- dataset:
id: open-agent-leaderboard/results
task_id: appworld
value: 0.09
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Kimi K2.5'
- dataset:
id: open-agent-leaderboard/results
task_id: browsecomp_plus
value: 0.34
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Kimi K2.5'
- dataset:
id: open-agent-leaderboard/results
task_id: swebench
value: 0.5714
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Kimi K2.5'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_airline
value: 0.62
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Kimi K2.5'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_retail
value: 0.6465
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Kimi K2.5'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_telecom
value: 0.83
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: Kimi K2.5'