Parent: #64227
Summary
Add the shared benchmark harness and release gate for GPT-5.4 vs Opus 4.6 so parity claims are evidence-backed.
Scope
- shared task suite
- completion / unintended-stop / valid-tool-call metrics
- targeted auth/proxy mislabel regressions
- release gate document and CI entrypoint if feasible
Acceptance
- same prompts, tool surface, sandbox policy, and continuation policy for both models
- GPT-5.4 must match or beat Opus 4.6 on completion rate
- equal or lower unintended-stop rate
- equal or higher valid-tool-call rate
- zero fake-success cases
- zero mislabeled auth/proxy/DNS failures
Parent: #64227
Summary
Add the shared benchmark harness and release gate for GPT-5.4 vs Opus 4.6 so parity claims are evidence-backed.
Scope
Acceptance