AI-Wiki
Search
Search
Dark mode
Light mode
Explorer
Tag: reward-hacking
10 items with this tag.
Sep 01, 2026
Reward hacking
reward-hacking
specification-gaming
benchmark-integrity
held-out-tests
cot-monitoring
obfuscation
swe-bench
evaluation
oversight-surface
goodharts-law
type/concept
Aug 30, 2026
Cursor
cursor
composer
ai-ide
coding-agent
benchmark-integrity
reward-hacking
swe-bench-pro
agentic-pr
evaluation
type/entity
kind/product
Aug 30, 2026
Elizabeth Barnes
elizabeth-barnes
beth-barnes
metr
evaluations
reward-hacking
rct
developer-productivity
ai-safety
type/entity
kind/person
Aug 30, 2026
METR
metr
ai-evaluation
ai-benchmarks
ai-safety
reward-hacking
rct
developer-productivity
task-horizons
re-bench
hcast
type/entity
kind/organization
Aug 30, 2026
Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation
openai
reward-hacking
chain-of-thought
cot-monitoring
obfuscation
monitorability-tax
o3-mini
gpt-4o
alignment
oversight
type/source
kind/paper
Aug 30, 2026
Recent Frontier Models Are Reward Hacking
metr
reward-hacking
o3
o1
claude-3-7-sonnet
re-bench
hcast
evaluation-integrity
monkey-patching
grader-exploitation
field-evidence
type/source
kind/article
Aug 30, 2026
EvilGenie: A Reward Hacking Benchmark
reward-hacking
benchmark
livecodebench
llm-judge
held-out-tests
codex
claude-code
gemini-cli
inspect
misalignment
detection
type/source
kind/paper
Aug 30, 2026
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
specbench
reward-hacking
reward-hacking-gap
held-out-tests
long-horizon
benchmark
oversight-surface
os-kernel
json-parser
test-memorization
type/source
kind/paper
Aug 30, 2026
Reward hacking is swamping model intelligence gains
cursor
reward-hacking
benchmark-contamination
swe-bench-pro
swe-bench-multilingual
opus-4-8-max
composer-2-5
upstream-lookup
git-history-mining
harness-design
evaluation-integrity
type/source
kind/article
Aug 12, 2026
Agentic Evaluations Workshop — Deep Dive on the Future of Evals for Agents
evals
agentic-evals
ai-benchmarks
reliability
capability-reliability-gap
automation-vs-augmentation
gaia-2
are-environment
inspect-ai
lighteval
open-llm-leaderboard
community-eval
living-benchmarks
every-eval-ever
sim-to-real-gap
reward-hacking
llm-as-judge
rubrics
agent-development-lifecycle
agent-harness
ai-policy
hugging-face
type/source
kind/video