Hugging Face's logo Hugging Face
  • Models
  • Datasets
  • Spaces
  • Buckets new
  • Docs
  • Enterprise
  • Pricing
    • Website
      • Tasks
      • HuggingChat
      • Collections
      • Languages
      • Organizations
    • Community
      • Blog
      • Posts
      • Daily Papers
      • Hardware
      • Learn
      • Discord
      • Forum
      • GitHub
    • Solutions
      • Team & Enterprise
      • Hugging Face PRO
      • Enterprise Support
      • Inference Providers
      • Inference Endpoints
      • Storage Buckets

  • Log In
  • Sign Up

Spaces:
Yashp2003
/
repro-swe-bench-pro-can-ai-agents-solve-long-horizon-software-engineering-tasks
Running

App Files Files Community
repro-swe-bench-pro-can-ai-agents-solve-long-horizon-software-engineering-tasks / pages /index.md
Yashp2003's picture
Yashp2003
Update logbook: Reproduction: SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
25d831e verified 3 days ago
preview code
|
Raw
History Blame Contribute Delete
1.32 kB

Reproduction: SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?

HF paper page

Pages

Page
Executive summary
Claim 1: SWE-Bench Pro comprises 1,865 problems from 41 actively maintained repositories.
Claim 2: SWE-Bench Pro splits into public (11 repos), held-out (12 repos), and commercial (18 proprietary repos) sets.
Claim 3: SWE-Bench Pro tasks are long-horizon, requiring hours to days for professionals and multi-file patches.
Claim 4: All SWE-Bench Pro tasks underwent human verification for adequate context.
Claim 5: SWE-Bench Pro is a contamination-resistant testbed spanning business apps, B2B services, and dev tools.
Conclusion