AI-Wiki
Search
Search
Dark mode
Light mode
Explorer
Tag: benchmark
3 items with this tag.
Aug 30, 2026
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
swe-bench
benchmark
github-issues
code-generation
iclr-2024
swe-llama
claude-2
evaluation
princeton-nlp
swe-bench-verified
swe-bench-pro
type/source
kind/paper
Aug 30, 2026
EvilGenie: A Reward Hacking Benchmark
reward-hacking
benchmark
livecodebench
llm-judge
held-out-tests
codex
claude-code
gemini-cli
inspect
misalignment
detection
type/source
kind/paper
Aug 30, 2026
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
specbench
reward-hacking
reward-hacking-gap
held-out-tests
long-horizon
benchmark
oversight-surface
os-kernel
json-parser
test-memorization
type/source
kind/paper