← Back to Explore
Agent Evaluation and Benchmarks🚀 production

SWE-bench

SWE-bench/SWE-bench
GitHub ↗

Benchmark for evaluating LLMs on real-world software engineering tasks from GitHub issues.

LanguagePython
SourceREADME.md (Line 384)
#Python#GitHub

Related Resources in Agent Evaluation and Benchmarks