Hugging Face's logo Hugging Face
  • Models
  • Datasets
  • Spaces
  • Buckets new
  • Docs
  • Enterprise
  • Pricing
    • Website
      • Tasks
      • HuggingChat
      • Collections
      • Languages
      • Organizations
    • Community
      • Blog
      • Posts
      • Daily Papers
      • Hardware
      • Learn
      • Discord
      • Forum
      • GitHub
    • Solutions
      • Team & Enterprise
      • Hugging Face PRO
      • Enterprise Support
      • Inference Providers
      • Inference Endpoints
      • Storage Buckets

  • Log In
  • Sign Up

Spaces:
Yashp2003
/
repro-swe-bench-pro-can-ai-agents-solve-long-horizon-software-engineering-tasks
Running

App Files Files Community
repro-swe-bench-pro-can-ai-agents-solve-long-horizon-software-engineering-tasks / pages /index.md
Yashp2003's picture
Yashp2003
Update logbook: Reproduction: SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
fbc261c verified 5 days ago
preview code
|
Raw
History Blame
1.77 kB

Reproduction: SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?

HF paper page

Pages

Page
Executive summary
Claim 1: SWE-Bench Pro comprises 1,865 problems sourced from 41 actively maintained software repositories (abstract only).
Claim 2: SWE-Bench Pro splits into public (11 repos), held-out (12 repos), and commercial (18 proprietary repos) sets (abstract only).
Claim 3: Tasks are long-horizon, potentially requiring hours to days for professional engineers and often spanning multiple files (abstract only).
Claim 4: All SWE-Bench Pro tasks underwent human verification for adequate resolution context (abstract only).
Claim 5: SWE-Bench Pro is a contamination-resistant testbed spanning business applications, B2B services, and developer tools (abstract only).
Conclusion
Deep Verification: Contamination Resistance, Agent Solve Rate, and Eval Repo Evidence