InfraBench

nplus1 × Zendo

hard · software-engineering

Add a composable web Cloud Run job-runner capability to n1x

Add a composable web Cloud Run job-runner capability to n1x.

Task version0.3.0
Checksumf7c427d17d9c
Published attempts9
Full reward1.00

Current task results

Evaluation comparison

Each bar averages that model configuration's verifier rewards for this task. The latest published batch 2026-08-05__12-16-53 contains 9 attempts across 3 model configurations.

  1. v9m-rl-learnability-tp8openai
    96.0%± 0.0 pp SD
    3/3 scored attempts
  2. gpt-5.6-lunaopenai
    93.0%± 1.7 pp SD
    3/3 scored attempts
  3. gpt-5.6-solopenai
    84.3%± 22.9 pp SD
    3/3 scored attempts

± is sample standard deviation across scored attempts. The line spans minimum to maximum; the heavier marker is the mean. Fixed 0–100 scale.

Latest published cohort

Verifier criteria

Pass rate across 9 attempts from 3 model configurations in batch 2026-08-05__12-16-53. Reward weight is how much each check contributes to one attempt's total score. Expand a criterion to see attempt outcomes by model configuration.

core engine and unrelated capabilities are unchangedReward weight 3%Passed 3/9Pass rate 33%
core engine and unrelated capabilities are unchanged attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 failed2/3
gpt-5.6-solopenaiAttempt 1 failedAttempt 2 failedAttempt 3 passed1/3
v9m-rl-learnability-tp8openaiAttempt 1 failedAttempt 2 failedAttempt 3 failed0/3
web-job-runner resolves its prerequisites without infraReward weight 5%Passed 9/9Pass rate 100%
web-job-runner resolves its prerequisites without infra attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
Next tracing includes the project job rosterReward weight 5%Passed 9/9Pass rate 100%
Next tracing includes the project job roster attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
plain web keeps the shared seam and project-owned routesReward weight 4%Passed 9/9Pass rate 100%
plain web keeps the shared seam and project-owned routes attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
standalone documents optional credentials and fail-closed useReward weight 5%Passed 5/9Pass rate 56%
standalone documents optional credentials and fail-closed use attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 failedAttempt 2 failedAttempt 3 failed0/3
gpt-5.6-solopenaiAttempt 1 failedAttempt 2 passedAttempt 3 passed2/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
infra derives a valid suffix-safe runner identityReward weight 5%Passed 8/9Pass rate 89%
infra derives a valid suffix-safe runner identity attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 failedAttempt 2 passedAttempt 3 passed2/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
Terraform grants the runner exactly the two-job rosterReward weight 12%Passed 8/9Pass rate 89%
Terraform grants the runner exactly the two-job roster attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 failedAttempt 2 passedAttempt 3 passed2/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
runner key and Terraform outputs have the required semanticsReward weight 6%Passed 8/9Pass rate 89%
runner key and Terraform outputs have the required semantics attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 failedAttempt 2 passedAttempt 3 passed2/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
Vercel receives region and sensitive runner credentialsReward weight 6%Passed 8/9Pass rate 89%
Vercel receives region and sensitive runner credentials attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 failedAttempt 2 passedAttempt 3 passed2/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
local env workflow writes both values only when configuredReward weight 7%Passed 9/9Pass rate 100%
local env workflow writes both values only when configured attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
consumer composition is independent of requested plugin orderReward weight 5%Passed 9/9Pass rate 100%
consumer composition is independent of requested plugin order attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
shared policy has one neutral owner and both legacy movesReward weight 7%Passed 9/9Pass rate 100%
shared policy has one neutral owner and both legacy moves attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
removing runner preserves the Gemini shared ownerReward weight 4%Passed 9/9Pass rate 100%
removing runner preserves the Gemini shared owner attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
removing Gemini preserves the runner shared ownerReward weight 4%Passed 8/9Pass rate 89%
removing Gemini preserves the runner shared owner attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 failedAttempt 2 passedAttempt 3 passed2/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
removing both consumers cleans the shared ownerReward weight 4%Passed 9/9Pass rate 100%
removing both consumers cleans the shared owner attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
projects without credential consumers stay isolatedReward weight 5%Passed 9/9Pass rate 100%
projects without credential consumers stay isolated attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
repeated apply preserves project-owned roster, route, and editsReward weight 5%Passed 9/9Pass rate 100%
repeated apply preserves project-owned roster, route, and edits attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
runner cleanup is complete while Gemini and project files remainReward weight 4%Passed 9/9Pass rate 100%
runner cleanup is complete while Gemini and project files remain attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
downstream lint fixture exercises the generated capabilityReward weight 1%Passed 0/9Pass rate 0%
downstream lint fixture exercises the generated capability attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 failedAttempt 2 failedAttempt 3 failed0/3
gpt-5.6-solopenaiAttempt 1 failedAttempt 2 failedAttempt 3 failed0/3
v9m-rl-learnability-tp8openaiAttempt 1 failedAttempt 2 failedAttempt 3 failed0/3
repository smoke detects broken runner contractsReward weight 3%Passed 9/9Pass rate 100%
repository smoke detects broken runner contracts attempt outcomes by model configuration
Model configurationAttempts
gpt-5.6-lunaopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
gpt-5.6-solopenaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3
v9m-rl-learnability-tp8openaiAttempt 1 passedAttempt 2 passedAttempt 3 passed3/3

Published evidence

Individual attempts