Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
Spaces:
Yashp2003
/
repro-swe-bench-pro-can-ai-agents-solve-long-horizon-software-engineering-tasks
like
0
Running
App
Files
Files
Community
main
repro-swe-bench-pro-can-ai-agents-solve-long-horizon-software-engineering-tasks
/
pages
/
index.md
Yashp2003
Update logbook: Reproduction: SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
25d831e
verified
3 days ago
preview
code
|
Raw
Download with hf CLI
Copy download link
History
Blame
Contribute
Delete
Safe
1.32 kB
Reproduction: SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
HF paper page
Pages
Page
Executive summary
Claim 1: SWE-Bench Pro comprises 1,865 problems from 41 actively maintained repositories.
Claim 2: SWE-Bench Pro splits into public (11 repos), held-out (12 repos), and commercial (18 proprietary repos) sets.
Claim 3: SWE-Bench Pro tasks are long-horizon, requiring hours to days for professionals and multi-file patches.
Claim 4: All SWE-Bench Pro tasks underwent human verification for adequate context.
Claim 5: SWE-Bench Pro is a contamination-resistant testbed spanning business apps, B2B services, and dev tools.
Conclusion