nplus1 × Zendo
hard · software-engineering
Add a composable web Cloud Run job-runner capability to n1x
Add a composable web Cloud Run job-runner capability to n1x.
Task version0.3.0
Checksumf7c427d17d9c
Published attempts9
Full reward1.00
Current task results
Evaluation comparison
Each bar averages that model configuration's verifier rewards for this task. The latest published batch 2026-08-05__12-16-53 contains 9 attempts across 3 model configurations.
- v9m-rl-learnability-tp8openai96.0%± 0.0 pp SD
- gpt-5.6-lunaopenai93.0%± 1.7 pp SD
- gpt-5.6-solopenai84.3%± 22.9 pp SD
± is sample standard deviation across scored attempts. The line spans minimum to maximum; the heavier marker is the mean. Fixed 0–100 scale.
Latest published cohort
Verifier criteria
Pass rate across 9 attempts from 3 model configurations in batch 2026-08-05__12-16-53. Reward weight is how much each check contributes to one attempt's total score. Expand a criterion to see attempt outcomes by model configuration.
core engine and unrelated capabilities are unchangedReward weight 3%Passed 3/9Pass rate 33%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 failed2/3 |
| gpt-5.6-solopenai | Attempt 1 failedAttempt 2 failedAttempt 3 passed1/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 failedAttempt 2 failedAttempt 3 failed0/3 |
web-job-runner resolves its prerequisites without infraReward weight 5%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
Next tracing includes the project job rosterReward weight 5%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
plain web keeps the shared seam and project-owned routesReward weight 4%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
standalone documents optional credentials and fail-closed useReward weight 5%Passed 5/9Pass rate 56%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 failedAttempt 2 failedAttempt 3 failed0/3 |
| gpt-5.6-solopenai | Attempt 1 failedAttempt 2 passedAttempt 3 passed2/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
infra derives a valid suffix-safe runner identityReward weight 5%Passed 8/9Pass rate 89%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 failedAttempt 2 passedAttempt 3 passed2/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
Terraform grants the runner exactly the two-job rosterReward weight 12%Passed 8/9Pass rate 89%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 failedAttempt 2 passedAttempt 3 passed2/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
runner key and Terraform outputs have the required semanticsReward weight 6%Passed 8/9Pass rate 89%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 failedAttempt 2 passedAttempt 3 passed2/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
Vercel receives region and sensitive runner credentialsReward weight 6%Passed 8/9Pass rate 89%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 failedAttempt 2 passedAttempt 3 passed2/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
local env workflow writes both values only when configuredReward weight 7%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
consumer composition is independent of requested plugin orderReward weight 5%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
shared policy has one neutral owner and both legacy movesReward weight 7%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
removing runner preserves the Gemini shared ownerReward weight 4%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
removing Gemini preserves the runner shared ownerReward weight 4%Passed 8/9Pass rate 89%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 failedAttempt 2 passedAttempt 3 passed2/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
removing both consumers cleans the shared ownerReward weight 4%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
projects without credential consumers stay isolatedReward weight 5%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
repeated apply preserves project-owned roster, route, and editsReward weight 5%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
runner cleanup is complete while Gemini and project files remainReward weight 4%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
downstream lint fixture exercises the generated capabilityReward weight 1%Passed 0/9Pass rate 0%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 failedAttempt 2 failedAttempt 3 failed0/3 |
| gpt-5.6-solopenai | Attempt 1 failedAttempt 2 failedAttempt 3 failed0/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 failedAttempt 2 failedAttempt 3 failed0/3 |
repository smoke detects broken runner contractsReward weight 3%Passed 9/9Pass rate 100%
| Model configuration | Attempts |
|---|---|
| gpt-5.6-lunaopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| gpt-5.6-solopenai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
| v9m-rl-learnability-tp8openai | Attempt 1 passedAttempt 2 passedAttempt 3 passed3/3 |
Published evidence