Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
Spaces:
Yashp2003
/
repro-swe-bench-pro-can-ai-agents-solve-long-horizon-software-engineering-tasks
like
0
Running
App
Files
Files
Community
fbc261c
repro-swe-bench-pro-can-ai-agents-solve-long-horizon-software-engineering-tasks
/
pages
/
index.md
Yashp2003
Update logbook: Reproduction: SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
fbc261c
verified
5 days ago
preview
code
|
Raw
Download with hf CLI
Copy download link
History
Blame
Safe
1.77 kB
Reproduction: SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
HF paper page
Pages
Page
Executive summary
Claim 1: SWE-Bench Pro comprises 1,865 problems sourced from 41 actively maintained software repositories (abstract only).
Claim 2: SWE-Bench Pro splits into public (11 repos), held-out (12 repos), and commercial (18 proprietary repos) sets (abstract only).
Claim 3: Tasks are long-horizon, potentially requiring hours to days for professional engineers and often spanning multiple files (abstract only).
Claim 4: All SWE-Bench Pro tasks underwent human verification for adequate resolution context (abstract only).
Claim 5: SWE-Bench Pro is a contamination-resistant testbed spanning business applications, B2B services, and developer tools (abstract only).
Conclusion
Deep Verification: Contamination Resistance, Agent Solve Rate, and Eval Repo Evidence